งานวิจัยชี้ทีม AI Agent สิ้นเปลือง Token มหาศาลแต่คุณภาพไม่เพิ่ม

· By: SirilukP

Image description

งานวิจัยพบว่าทีม AI agent ให้ผลลัพธ์แทบไม่ต่างจาก agent ตัวเดียว

Vals AI บริษัทด้านการประเมินประสิทธิภาพ AI ได้ทำการทดสอบโมเดล GPT-6 Sol และ Claude Opus 5.5 บนระบบ "Vibe Code Bench" เพื่อเปรียบเทียบการทำงานระหว่างรูปแบบ Agent ตัวเดียวและรูปแบบทีม โดยตั้งค่าระดับการใช้เหตุผลไว้สองระดับคือระดับปานกลางและระดับสูงสุด ซึ่งผลการทดสอบพบว่าการทำงานรูปแบบทีมมีค่าใช้จ่ายสูงกว่า Agent ตัวเดียวตั้งแต่ 1.8 ถึง 5.1 เท่าเลยทีเดียว

จากการ เปรียบเทียบสี่รายการ มีเพียงรายการเดียวเท่านั้นที่แสดงการปรับปรุงอย่างมีนัยสำคัญทางสถิติ นั่นคือ GPT-6 Sol ในระดับการใช้เหตุผลปานกลางที่ทำคะแนนได้สูงกว่าเดิม 7.3 คะแนน ส่วนในการใช้เหตุผลระดับสูงสุด ทั้งโมเดล Sol และ Opus 5.5 แบบทีมกลับไม่ได้เปรียบอย่างแท้จริง ซึ่งบ่งชี้ว่าค่าใช้จ่ายที่เพิ่มขึ้นนั้นไม่คุ้มค่า โดยเฉพาะเมื่อโมเดลทำงานด้วยกำลังการคำนวณเต็มที่อยู่แล้ว

งานวิจัยชี้ทีม AI Agent สิ้นเปลือง Token มหาศาลแต่คุณภาพไม่เพิ่ม

ด้าน Anthropic ได้เผยแพร่ การทดสอบสองรายการของตัวเองด้วย Opus 5.5 ซึ่งพบว่าทีมขนาดใหญ่จะช่วยให้บรรลุระดับประสิทธิภาพที่ต้องการได้เร็วกว่าในตอนต้น แต่การเพิ่มจำนวนจาก 10 เป็น 100 Agent กลับทำให้คะแนนขยับขึ้นเพียงเล็กน้อยหลังจากผ่านไป 24 ชั่วโมง นอกจากนี้ในการทดสอบ ProgramBench ยังพบว่าความเร็วที่เพิ่มขึ้นต้องแลกมาด้วยการใช้ Token ที่สูงขึ้นอย่างมาก

ภารกิจด้วย Opus 5.51 agent10 agents30 agents100 agents
Knowledge base0.530.700.710.74
Lean Theorem Proving0.390.660.660.68

สำหรับโมเดล Fable 5.1 แสดงการพัฒนาคุณภาพที่ชัดเจนกว่าในภารกิจการพิสูจน์ทฤษฎีบท Lean เมื่อใช้เกิน 10 Agent แต่คะแนนโดยรวมยังคงต่ำกว่า Opus 5.5 ในทุกการทดสอบ และในส่วนของภารกิจฐานความรู้ คะแนนของ Fable กลับลดลงเล็กน้อยเมื่อขยายจาก 30 เป็น 100 Agent

จำนวน agent ที่มากขึ้นช่วยเรื่องความเร็วแต่ไม่ใช่ผลลัพธ์ที่ดีกว่า

Noam Brown นักวิจัยจาก OpenAI ยืนยันผ่าน Dwarkesh Podcast ว่าระบบ Multi-Agent ช่วยเรื่องความเร็วเป็นหลักแต่ไม่ได้ช่วยเรื่องคุณภาพ โดย Agent 4 ตัวอาจแก้ปัญหาได้เร็วกว่าเดิม 2 เท่า แต่ก็มีค่าใช้จ่ายสูงขึ้น 2 เท่าเช่นกัน ซึ่งเมื่อเพิ่มเป็น 16 Agent รูปแบบประสิทธิภาพต่อราคาก็จะยิ่งเริ่มลดลง

เขาอธิบายว่าผลลัพธ์นี้ขึ้นอยู่กับประเภทของงานเป็นสำคัญ เช่น งานวิจัยเว็บและคณิตศาสตร์สามารถแบ่งงานกันทำแบบขนานได้ดี แต่การเขียนนิยายไม่สามารถทำได้ การใช้ 10,000 Agent กับนิยายเรื่องเดียวจึงไร้ประโยชน์พอๆ กับการใช้คนจำนวนเท่ากันมาเขียนร่วมกัน โดย Brown ยอมรับว่าการขยายจำนวน Agent ไปสู่ระดับมหาศาลยังไม่ถูกสำรวจมากนักเนื่องจากมีต้นทุนที่สูงเกินไป

สอดคล้องกับ Eric Provencher นักพัฒนาของ OpenAI ที่เพิ่งออกมาเตือนเรื่อง การใช้ agent swarms ว่าเป็นการเสียเงินโดยเปล่าประโยชน์ เพราะการประสานงานระหว่าง Agent มักจะล้มเหลว ซึ่งเขาเรียกปัญหานี้ว่า "ภาษีการประสานงาน" (coordination tax)

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร