Sakana AI พัฒนาระบบ MLR ตรวจพบข้อผิดพลาดงานวิจัยได้แม่นยำ 73%

Sakana AI ได้เผยแพร่ Beyond Imitation ซึ่งเป็นงานวิจัย TMLR เกี่ยวกับกระบวนการ peer review ที่ช่วยโดย LLM ซึ่งสร้างขึ้นเพื่อเน้นการตรวจจับข้อผิดพลาดโดยเฉพาะ ปกติแล้วผู้ประเมิน AI ส่วนใหญ่มักถูกตัดสินจากความสามารถในการเลียนแบบมนุษย์ แต่งานวิจัยชิ้นนี้ตั้งคำถามที่ท้าทายกว่านั้น คือผู้ประเมิน AI จะพบข้อผิดพลาดที่จงใจใส่ไว้ได้หรือไม่
ทีมวิจัยได้ส่งมอบผลงานสำคัญสองส่วน ได้แก่ Contradiction Benchmark และระบบ Multi-Layered Review (MLR) สำหรับนักพัฒนาที่สร้าง research agents ซึ่งบทเรียนนี้สามารถนำไปใช้ได้จริง ทั้งในแง่การออกแบบระบบและการเลือกโมเดลที่มีผลต่อประสิทธิภาพการตรวจจับข้อผิดพลาด
TL;DR
- ขนาด: ทดสอบกับข้อขัดแย้งที่จงใจใส่เข้าไป 1,164 รายการ ในบทความวิจัย 257 ฉบับ จาก 5 แหล่งจัดงาน โดย MLR สามารถอ่านเนื้อหาหลักได้สูงสุด 10 หน้า
- ทำงานบน: ใช้ API models ทั่วไปอย่าง Claude Sonnet 4 และ Claude Haiku 3.5 โดยไม่ต้องพึ่ง GPU หรือทำ fine-tuning มีค่าใช้จ่ายประมาณ $0.47 ต่อการประเมิน
- ประสิทธิภาพ: มีอัตราการตรวจจับข้อผิดพลาดสูงสุดจากทั้งหมด 4 ระบบที่ทดสอบ และมีผลคะแนนที่สอดคล้องกับมนุษย์
- ดีที่สุด: ตรวจพบข้อผิดพลาดในข้อกล่าวอ้างหลัก (core-claim) ได้ 73.43% จากการประเมิน 4 ครั้ง เทียบกับระบบ baseline ที่ดีที่สุดซึ่งทำได้เพียง 14.81%
- แย่ที่สุด: มีการจับคู่ที่ตรงกันทุกประการ (exact matches) เพียง 16.11% ในบทความจาก arXiv ที่ถูกถอนออกจริง
- สรุปประเด็นสำคัญ: ระบบทำงานได้ดีที่สุดด้วยการอ่านก่อนตัดสินใจ ทำให้พบข้อผิดพลาดร้ายแรงได้มากขึ้น แต่ในแง่ลบคือยังคงมีจุดอ่อนต่อการทำ Social Engineering ในรูปแบบ hidden prompt injection
Multi-Layered Review คืออะไร?
Multi-Layered Review คือระบบ AI review แบบ agentic จาก Sakana AI ที่เน้นทำความเข้าใจบทความวิจัยอย่างลึกซึ้งก่อนวิจารณ์ โดยใช้ 3 เอเจนต์ทำงานร่วมกันบนโมเดล Claude รุ่นทั่วไปประกอบด้วย:
- Appendix Agent (Claude Haiku 3.5): รับหน้าที่สรุปผลการทดลองและรายละเอียดการนำไปใช้จากภาคผนวก
- Literature Review Agent (Claude Sonnet 4): ใช้การค้นหาข้อมูลบนเว็บเพื่อเปรียบเทียบบทความวิจัยกับบริบทของงานก่อนหน้า (เป็นตัวเลือกเสริม)
- Review Agent (Claude Sonnet 4): รัน prompt chain แบบ 3 รอบ (3-pass) ตามแนวทางของ Keshav’s Three-Pass Approach
ในกระบวนการนี้ Pass 1 จะเขียนโครงร่างระดับสูง Pass 2 อ่านรายละเอียดเพื่อระบุจุดอ่อนและข้อสันนิษฐาน ส่วน Pass 3 จะรวมผลลัพธ์ทั้งหมดเป็นจุดแข็ง จุดอ่อน คำถาม และข้อเสนอแนะ โดยระบบสามารถรับไฟล์ PDF ได้โดยตรง ทำให้ยังคงเห็นรูปภาพและสมการครบถ้วน
Contradiction Benchmark ทำงานอย่างไร?
Benchmark นี้ถูกออกแบบมาเพื่อใส่ข้อผิดพลาดเข้าไปในบทความวิจัยจริงเพื่อทดสอบผู้ประเมิน ทีมวิจัยได้รวบรวมบทความลิขสิทธิ์ CC จำนวน 257 ฉบับจากงานประชุมระดับโลกอย่าง ACL, AISTATS, CVPR, ICML 2025 และ NeurIPS 2024
กระบวนการเริ่มต้นจาก Gemini 2.5 Pro สร้าง knowledge graph ของข้อกล่าวอ้างและวิธีการในบทความ โดยระยะห่างจาก "main claim" จะระบุความรุนแรงของข้อผิดพลาด (ระยะ 0 คือกระทบข้อกล่าวอ้างหลัก) จากนั้น GPT-4.1 จะเขียนข้อความขัดแย้งใส่ลงไปจนได้จุดข้อมูล 1,164 รายการ
ทีมวิจัยยังใช้ o3 judge ให้คะแนนการประเมิน 10 รอบ ซึ่งพบว่ามีความแม่นยำถึง 99.9% ในบทความปกติ และมีความไว (sensitivity) 86.8% ในการตรวจจับที่ยืนยันด้วยมนุษย์ ทำให้คะแนนที่รายงานออกมาอาจต่ำกว่าความเป็นจริงเล็กน้อยในเชิงระมัดระวัง (conservative)
MLR ตรวจจับข้อผิดพลาดได้ดีแค่ไหน?
MLR ทำผลงานได้เหนือกว่า baseline ทุกตัวใน benchmark โดยการประเมิน 4 ครั้งสามารถตรวจพบข้อขัดแย้งระยะ 0 ได้ถึง 73.43% และพบ 40.95% ในภาพรวม เมื่อเทียบกับ AgentReview ที่ตรวจพบได้เพียง 14.81% ในระยะเดียวกัน แม้การประเมิน MLR เพียงครั้งเดียวก็ยังทำผลงานได้สูงถึง 60.79%
จากการทดสอบ ablation พบว่าการเปลี่ยนโมเดลจาก GPT-4.1 เป็น Claude Sonnet 4 ช่วยเพิ่มประสิทธิภาพได้ชัดเจนจาก 14.56% เป็น 35.40% และการออกแบบระบบของ MLR เองก็ช่วยเพิ่มคะแนนได้อีกประมาณ 25 จุด อย่างไรก็ตาม ความแม่นยำจะลดลงตามระยะห่างของ node ที่เพิ่มขึ้น
สำหรับบทความที่ถูกถอนออกจริงจาก WithdrarXiv-Check จำนวน 211 ฉบับ พบว่างานนี้ยังคงเป็นเรื่องยาก โดย MLR ทำคะแนน 'ความคล้ายคลึง' (similar) ได้ 26.07% และ 'ตรงกันทุกประการ' (exact) 16.11% แม้จะยังดูน้อยแต่ก็ยังสูงกว่า baseline ตัวอื่นในตลาด
MLR มีความเห็นตรงกับผู้ประเมินที่เป็นมนุษย์หรือไม่?
ในด้านการให้คะแนนพบว่ามีความสอดคล้องกันพอสมควร โดยในงาน ICLR 2025 คะแนนของ MLR มีความสัมพันธ์แบบ Pearson กับมนุษย์ที่ 0.586 (มนุษย์ด้วยกันเองอยู่ที่ 0.742) ส่วนในงาน ICML 2025 พบว่า the AI Reviewer ทำคะแนนเบียดกันที่ 0.439 ต่อ 0.429
อย่างไรก็ตาม จุดเน้นในการตรวจงานนั้นต่างกัน โดย MLR จะมุ่งเน้นไปที่ความถูกต้อง (validity) และการทดลอง ส่วนมนุษย์จะให้ความสำคัญกับความชัดเจนและความแปลกใหม่ของงานมากกว่า ซึ่งผู้เขียนมองว่า AI จะเข้ามาทำหน้าที่เป็นมุมมองเสริมมากกว่าที่จะเข้ามาแทนที่มนุษย์ทั้งหมด
ค่าใช้จ่ายในการรันอยู่ที่เท่าไหร่?
ค่าใช้จ่ายของ MLR อยู่ที่ประมาณ $0.47 ต่อการประเมิน (ไม่รวม literature agent) โดยใช้ input tokens ประมาณ 189,062 ตัว ซึ่งถือว่าน้อยกว่าครึ่งหนึ่งเมื่อเทียบกับ AI Reviewer ที่ใช้ถึง 403,654 ตัว หากต้องการประหยัดค่าใช้จ่าย สามารถใช้ตัวแปรแบบ prompt เดียวที่จะช่วยลดต้นทุนลงได้สองในสาม แต่ประสิทธิภาพการตรวจจับจะลดลงประมาณ 3.5 จุด
MLR เปรียบเทียบกับผู้ประเมิน AI อื่นๆ อย่างไร?
| คุณสมบัติ | MLR (Sakana AI) | LLM-Review | AI Reviewer | AgentReview |
|---|---|---|---|---|
| LLM ที่ใช้ในการศึกษานี้ | Claude Sonnet 4 + Haiku 3.5 | GPT-4.1 | o4-mini | GPT-4o |
| การออกแบบ | 3 เอเจนต์, 3-pass chain | Prompt เดียว, ตัดทอนข้อความ | รวม 5 การประเมิน, meta-review, reflection | บทบาท Reviewer, author, area chair |
| Contradiction Benchmark, ทั้งหมด | 40.95% (4 การประเมิน) | 6.39% | 6.50% | 5.95% |
| ข้อผิดพลาดข้อกล่าวอ้างหลัก (ระยะ 0) | 73.43% | 14.56% | 11.17% | 14.81% |
| WithdrarXiv-Check, คล้ายคลึง / ตรงเป๊ะ | 26.07% / 16.11% | 5.21% / 2.37% | 13.74% / 9.00% | 18.48% / 5.69% |
| ICLR 2025 Pearson เทียบกับมนุษย์ | 0.586 | -0.013 | 0.538 | 0.195 |
| Input tokens ต่อการประเมิน | 189,062 | 6,517 | 403,654 | 310,964 |
| ราคาต่อการประเมิน | ~$0.47 | ~$0.01 | ~$0.49 | ~$0.81 |
| Open code | เมื่อมีการร้องขอ | ใช่ | ใช่ | ใช่ |
หมายเหตุ: ข้อมูลตัวเลขทั้งหมดอ้างอิงจากบทความวิจัย Beyond Imitation
ประเด็นสำคัญ
- Sakana AI เปลี่ยนเกณฑ์การวัดผล AI Reviewer จากการเลียนแบบมนุษย์มาเป็นการตรวจจับข้อผิดพลาดจริง
- ระบบ MLR แสดงศักยภาพสูงกว่า baseline เดิมถึง 5 เท่าในการตรวจพบข้อผิดพลาดระดับวิกฤต
- การออกแบบระบบแบบ Multi-agent และกระบวนการ 3-pass มีส่วนสำคัญอย่างยิ่งต่อความแม่นยำ
- แม้ระบบจะเก่งขึ้น แต่การตรวจพบข้อผิดพลาดในงานที่ถูกถอนจริงยังคงเป็นความท้าทายที่ต้องพัฒนาต่อ
- ปัญหา Social Engineering ในรูปแบบ Hidden prompt injection ยังคงเป็นช่องโหว่ที่กระทบต่อ AI ทุกตัวในการทดสอบนี้
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
