Sakana AI พัฒนาระบบ MLR ตรวจพบข้อผิดพลาดงานวิจัยได้แม่นยำ 73%

· By: NatapolK

Sakana AI พัฒนาระบบ MLR ตรวจพบข้อผิดพลาดงานวิจัยได้แม่นยำ 73%

Sakana AI ได้เผยแพร่ Beyond Imitation ซึ่งเป็นงานวิจัย TMLR เกี่ยวกับกระบวนการ peer review ที่ช่วยโดย LLM ซึ่งสร้างขึ้นเพื่อเน้นการตรวจจับข้อผิดพลาดโดยเฉพาะ ปกติแล้วผู้ประเมิน AI ส่วนใหญ่มักถูกตัดสินจากความสามารถในการเลียนแบบมนุษย์ แต่งานวิจัยชิ้นนี้ตั้งคำถามที่ท้าทายกว่านั้น คือผู้ประเมิน AI จะพบข้อผิดพลาดที่จงใจใส่ไว้ได้หรือไม่

ทีมวิจัยได้ส่งมอบผลงานสำคัญสองส่วน ได้แก่ Contradiction Benchmark และระบบ Multi-Layered Review (MLR) สำหรับนักพัฒนาที่สร้าง research agents ซึ่งบทเรียนนี้สามารถนำไปใช้ได้จริง ทั้งในแง่การออกแบบระบบและการเลือกโมเดลที่มีผลต่อประสิทธิภาพการตรวจจับข้อผิดพลาด

TL;DR

  • ขนาด: ทดสอบกับข้อขัดแย้งที่จงใจใส่เข้าไป 1,164 รายการ ในบทความวิจัย 257 ฉบับ จาก 5 แหล่งจัดงาน โดย MLR สามารถอ่านเนื้อหาหลักได้สูงสุด 10 หน้า
  • ทำงานบน: ใช้ API models ทั่วไปอย่าง Claude Sonnet 4 และ Claude Haiku 3.5 โดยไม่ต้องพึ่ง GPU หรือทำ fine-tuning มีค่าใช้จ่ายประมาณ $0.47 ต่อการประเมิน
  • ประสิทธิภาพ: มีอัตราการตรวจจับข้อผิดพลาดสูงสุดจากทั้งหมด 4 ระบบที่ทดสอบ และมีผลคะแนนที่สอดคล้องกับมนุษย์
  • ดีที่สุด: ตรวจพบข้อผิดพลาดในข้อกล่าวอ้างหลัก (core-claim) ได้ 73.43% จากการประเมิน 4 ครั้ง เทียบกับระบบ baseline ที่ดีที่สุดซึ่งทำได้เพียง 14.81%
  • แย่ที่สุด: มีการจับคู่ที่ตรงกันทุกประการ (exact matches) เพียง 16.11% ในบทความจาก arXiv ที่ถูกถอนออกจริง
  • สรุปประเด็นสำคัญ: ระบบทำงานได้ดีที่สุดด้วยการอ่านก่อนตัดสินใจ ทำให้พบข้อผิดพลาดร้ายแรงได้มากขึ้น แต่ในแง่ลบคือยังคงมีจุดอ่อนต่อการทำ Social Engineering ในรูปแบบ hidden prompt injection

Multi-Layered Review คืออะไร?

Multi-Layered Review คือระบบ AI review แบบ agentic จาก Sakana AI ที่เน้นทำความเข้าใจบทความวิจัยอย่างลึกซึ้งก่อนวิจารณ์ โดยใช้ 3 เอเจนต์ทำงานร่วมกันบนโมเดล Claude รุ่นทั่วไปประกอบด้วย:

  • Appendix Agent (Claude Haiku 3.5): รับหน้าที่สรุปผลการทดลองและรายละเอียดการนำไปใช้จากภาคผนวก
  • Literature Review Agent (Claude Sonnet 4): ใช้การค้นหาข้อมูลบนเว็บเพื่อเปรียบเทียบบทความวิจัยกับบริบทของงานก่อนหน้า (เป็นตัวเลือกเสริม)
  • Review Agent (Claude Sonnet 4): รัน prompt chain แบบ 3 รอบ (3-pass) ตามแนวทางของ Keshav’s Three-Pass Approach

ในกระบวนการนี้ Pass 1 จะเขียนโครงร่างระดับสูง Pass 2 อ่านรายละเอียดเพื่อระบุจุดอ่อนและข้อสันนิษฐาน ส่วน Pass 3 จะรวมผลลัพธ์ทั้งหมดเป็นจุดแข็ง จุดอ่อน คำถาม และข้อเสนอแนะ โดยระบบสามารถรับไฟล์ PDF ได้โดยตรง ทำให้ยังคงเห็นรูปภาพและสมการครบถ้วน

Contradiction Benchmark ทำงานอย่างไร?

Benchmark นี้ถูกออกแบบมาเพื่อใส่ข้อผิดพลาดเข้าไปในบทความวิจัยจริงเพื่อทดสอบผู้ประเมิน ทีมวิจัยได้รวบรวมบทความลิขสิทธิ์ CC จำนวน 257 ฉบับจากงานประชุมระดับโลกอย่าง ACL, AISTATS, CVPR, ICML 2025 และ NeurIPS 2024

กระบวนการเริ่มต้นจาก Gemini 2.5 Pro สร้าง knowledge graph ของข้อกล่าวอ้างและวิธีการในบทความ โดยระยะห่างจาก "main claim" จะระบุความรุนแรงของข้อผิดพลาด (ระยะ 0 คือกระทบข้อกล่าวอ้างหลัก) จากนั้น GPT-4.1 จะเขียนข้อความขัดแย้งใส่ลงไปจนได้จุดข้อมูล 1,164 รายการ

ทีมวิจัยยังใช้ o3 judge ให้คะแนนการประเมิน 10 รอบ ซึ่งพบว่ามีความแม่นยำถึง 99.9% ในบทความปกติ และมีความไว (sensitivity) 86.8% ในการตรวจจับที่ยืนยันด้วยมนุษย์ ทำให้คะแนนที่รายงานออกมาอาจต่ำกว่าความเป็นจริงเล็กน้อยในเชิงระมัดระวัง (conservative)

MLR ตรวจจับข้อผิดพลาดได้ดีแค่ไหน?

MLR ทำผลงานได้เหนือกว่า baseline ทุกตัวใน benchmark โดยการประเมิน 4 ครั้งสามารถตรวจพบข้อขัดแย้งระยะ 0 ได้ถึง 73.43% และพบ 40.95% ในภาพรวม เมื่อเทียบกับ AgentReview ที่ตรวจพบได้เพียง 14.81% ในระยะเดียวกัน แม้การประเมิน MLR เพียงครั้งเดียวก็ยังทำผลงานได้สูงถึง 60.79%

จากการทดสอบ ablation พบว่าการเปลี่ยนโมเดลจาก GPT-4.1 เป็น Claude Sonnet 4 ช่วยเพิ่มประสิทธิภาพได้ชัดเจนจาก 14.56% เป็น 35.40% และการออกแบบระบบของ MLR เองก็ช่วยเพิ่มคะแนนได้อีกประมาณ 25 จุด อย่างไรก็ตาม ความแม่นยำจะลดลงตามระยะห่างของ node ที่เพิ่มขึ้น

สำหรับบทความที่ถูกถอนออกจริงจาก WithdrarXiv-Check จำนวน 211 ฉบับ พบว่างานนี้ยังคงเป็นเรื่องยาก โดย MLR ทำคะแนน 'ความคล้ายคลึง' (similar) ได้ 26.07% และ 'ตรงกันทุกประการ' (exact) 16.11% แม้จะยังดูน้อยแต่ก็ยังสูงกว่า baseline ตัวอื่นในตลาด

MLR มีความเห็นตรงกับผู้ประเมินที่เป็นมนุษย์หรือไม่?

ในด้านการให้คะแนนพบว่ามีความสอดคล้องกันพอสมควร โดยในงาน ICLR 2025 คะแนนของ MLR มีความสัมพันธ์แบบ Pearson กับมนุษย์ที่ 0.586 (มนุษย์ด้วยกันเองอยู่ที่ 0.742) ส่วนในงาน ICML 2025 พบว่า the AI Reviewer ทำคะแนนเบียดกันที่ 0.439 ต่อ 0.429

อย่างไรก็ตาม จุดเน้นในการตรวจงานนั้นต่างกัน โดย MLR จะมุ่งเน้นไปที่ความถูกต้อง (validity) และการทดลอง ส่วนมนุษย์จะให้ความสำคัญกับความชัดเจนและความแปลกใหม่ของงานมากกว่า ซึ่งผู้เขียนมองว่า AI จะเข้ามาทำหน้าที่เป็นมุมมองเสริมมากกว่าที่จะเข้ามาแทนที่มนุษย์ทั้งหมด

ค่าใช้จ่ายในการรันอยู่ที่เท่าไหร่?

ค่าใช้จ่ายของ MLR อยู่ที่ประมาณ $0.47 ต่อการประเมิน (ไม่รวม literature agent) โดยใช้ input tokens ประมาณ 189,062 ตัว ซึ่งถือว่าน้อยกว่าครึ่งหนึ่งเมื่อเทียบกับ AI Reviewer ที่ใช้ถึง 403,654 ตัว หากต้องการประหยัดค่าใช้จ่าย สามารถใช้ตัวแปรแบบ prompt เดียวที่จะช่วยลดต้นทุนลงได้สองในสาม แต่ประสิทธิภาพการตรวจจับจะลดลงประมาณ 3.5 จุด

MLR เปรียบเทียบกับผู้ประเมิน AI อื่นๆ อย่างไร?

คุณสมบัติMLR (Sakana AI)LLM-ReviewAI ReviewerAgentReview
LLM ที่ใช้ในการศึกษานี้Claude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
การออกแบบ3 เอเจนต์, 3-pass chainPrompt เดียว, ตัดทอนข้อความรวม 5 การประเมิน, meta-review, reflectionบทบาท Reviewer, author, area chair
Contradiction Benchmark, ทั้งหมด40.95% (4 การประเมิน)6.39%6.50%5.95%
ข้อผิดพลาดข้อกล่าวอ้างหลัก (ระยะ 0)73.43%14.56%11.17%14.81%
WithdrarXiv-Check, คล้ายคลึง / ตรงเป๊ะ26.07% / 16.11%5.21% / 2.37%13.74% / 9.00%18.48% / 5.69%
ICLR 2025 Pearson เทียบกับมนุษย์0.586-0.0130.5380.195
Input tokens ต่อการประเมิน189,0626,517403,654310,964
ราคาต่อการประเมิน~$0.47~$0.01~$0.49~$0.81
Open codeเมื่อมีการร้องขอใช่ใช่ใช่

หมายเหตุ: ข้อมูลตัวเลขทั้งหมดอ้างอิงจากบทความวิจัย Beyond Imitation

ประเด็นสำคัญ

  • Sakana AI เปลี่ยนเกณฑ์การวัดผล AI Reviewer จากการเลียนแบบมนุษย์มาเป็นการตรวจจับข้อผิดพลาดจริง
  • ระบบ MLR แสดงศักยภาพสูงกว่า baseline เดิมถึง 5 เท่าในการตรวจพบข้อผิดพลาดระดับวิกฤต
  • การออกแบบระบบแบบ Multi-agent และกระบวนการ 3-pass มีส่วนสำคัญอย่างยิ่งต่อความแม่นยำ
  • แม้ระบบจะเก่งขึ้น แต่การตรวจพบข้อผิดพลาดในงานที่ถูกถอนจริงยังคงเป็นความท้าทายที่ต้องพัฒนาต่อ
  • ปัญหา Social Engineering ในรูปแบบ Hidden prompt injection ยังคงเป็นช่องโหว่ที่กระทบต่อ AI ทุกตัวในการทดสอบนี้
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร