นักวิจัย Bristol เสนอใช้มาตรฐานอนุมัติยาคุมกำเนิด 'AI ทางการแพทย์'

· By: SirilukP

Manuel Uth

Image description

ประเด็นสำคัญ

  • นักวิจัยจาก University of Bristol เสนอการทดสอบความน่าเชื่อถือของระบบ AI ทางการแพทย์อย่างเป็นระบบ โดยจำลองมาจากวิธีการตรวจสอบและอนุมัติยา
  • แนวทางที่ชื่อว่า "Learning Ensemble" จะตรวจสอบ 3 ด้านหลัก ได้แก่ ขีดจำกัดการทำงานและข้อมูลฝึกฝน ความน่าเชื่อถือในกลุ่มผู้ป่วยที่หลากหลาย และความเหมาะสมในการใช้งานจริงในคลินิก
  • กระบวนการนี้มีวัตถุประสงค์เพื่อป้องกันความล้มเหลวของระบบที่มักเกิดจากตัวแปรที่ไม่เกี่ยวข้องในทางปฏิบัติ หรือการประเมินความเสี่ยงของผู้ป่วยที่ผิดพลาด

นักวิจัยจาก University of Bristol เสนอเฟรมเวิร์กที่ช่วยให้นักพัฒนาสามารถทดสอบความน่าเชื่อถือของระบบ AI ในการใช้งานทางการแพทย์ได้อย่างเป็นระบบ โดยถอดแบบมาจากมาตรฐานที่วงการแพทย์ใช้ในการนำยาใหม่ออกสู่ตลาด

ระบบ AI ทางการแพทย์มักให้ผลลัพธ์ที่ดีในการทดสอบเบื้องต้น แต่กลับประสบความล้มเหลวเมื่อนำไปใช้งานจริงในคลินิก เนื่องจากโมเดลมักยึดติดกับคุณลักษณะบางอย่างในข้อมูลฝึกฝนที่ไม่เกี่ยวข้องกับการวินิจฉัยโรคจริง

วงการแพทย์เคยเผชิญความไม่แน่นอนในลักษณะเดียวกันนี้กับยาที่ยังไม่เข้าใจผลกระทบต่อร่างกายอย่างถ่องแท้ แต่สามารถพัฒนาวิธีการใช้สารเหล่านั้นได้อย่างปลอดภัยผ่านมาตรฐานที่เข้มงวด ยาทุกชนิดจะมีเอกสารข้อมูลระบุเงื่อนไขการใช้งาน ขนาดยา ระยะเวลา และกลุ่มผู้ป่วยที่เหมาะสม ซึ่งช่วยเปลี่ยนสารเคมีให้กลายเป็นการรักษาที่น่าเชื่อถือ นักวิจัยจึงนำแนวคิดนี้มาประยุกต์ใช้กับ AI

ชุดเครื่องมือตรวจสอบ 3 ด้าน

ข้อเสนอ "Learning Ensemble" ครอบคลุม 3 ด้านสำคัญที่นักพัฒนาต้องจัดทำเอกสารและตรวจสอบก่อนนำระบบไปใช้กับผู้ป่วยจริง

ส่วนแรกคือการระบุขีดจำกัดของระบบ รวมถึงกลุ่มแพทย์หรือคลินิกที่เหมาะสม ฮาร์ดแวร์ที่รองรับ และข้อมูลที่ใช้ฝึกฝน โดย การศึกษาในปี 2021 พบว่า AI ตรวจหาโควิดจากภาพ X-ray ล้มเหลวเมื่อย้ายคลินิก เพราะระบบไปจดจำรายละเอียดปลีกย่อยในภาพที่บังเอิญสัมพันธ์กับโรคแทนที่จะดูความผิดปกติในปอด

ส่วนที่สองคือความน่าเชื่อถือในกลุ่มผู้ป่วยที่หลากหลาย เนื่องจากค่าเฉลี่ยความสำเร็จในภาพรวมอาจปกปิดความผิดพลาดที่เกิดขึ้นกับคนเฉพาะกลุ่ม การศึกษาอีกชิ้นในปี 2021 พบว่า AI อ่านภาพ X-ray มีความแม่นยำต่ำกว่าในกลุ่มประชากรที่ขาดโอกาส ซึ่งอาจส่งผลเสียซ้ำเติมผู้ป่วยที่ได้รับบริการทางการแพทย์ที่ด้อยกว่าอยู่แล้ว

ส่วนที่สามคือความเหมาะสมกับวัตถุประสงค์ทางคลินิก ซึ่งนักวิจัยถือว่าเป็นส่วนที่สำคัญที่สุด เพราะระบบที่เก่งในทางเทคนิคอาจไร้ประโยชน์ในทางปฏิบัติ เช่น AI ประเมินว่าผู้ป่วยโรคหอบหืดที่เป็นปอดบวมมีความเสี่ยงเสียชีวิตต่ำเนื่องจากข้อมูลฝึกฝนระบุว่ามีอัตรารอดชีวิตสูง แต่ความจริงเป็นเพราะกลุ่มนี้ได้รับการรักษาที่รวดเร็วเป็นพิเศษในห้องฉุกเฉิน การนำผลประเมินนี้ไปใช้คัดกรองผู้ป่วยใหม่ (triage) จึงเป็นเรื่องที่อันตรายและไร้ค่า

ผู้เขียนมองว่าเฟรมเวิร์กนี้เป็นเพียงจุดเริ่มต้น เนื่องจากการสร้าง AI ทางการแพทย์ที่เชื่อถือได้ต้องอาศัยการลองผิดลองถูก ความเชี่ยวชาญเฉพาะทาง และการตรวจสอบจากภายนอกอย่างต่อเนื่อง โดยโครงสร้างนี้จะช่วยให้คนในวงการมีมาตรฐานภาษาเดียวกันเพื่อตรวจพบและแก้ไขปัญหาได้รวดเร็วยิ่งขึ้น

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร