NVIDIA เปิดตัว SoL-Pi ลดปริมาณ Token ใน Coding Agent สูงสุด 49%

ปัจจุบัน Coding agents ต้องทำงานต่อเนื่องเป็นเวลาหลายชั่วโมง ทำให้ทุกการแก้ไขไฟล์ การรันการทดสอบ และการอ่าน log ถูกส่งกลับเข้าไปในบริบท (context) ของโมเดลอย่างมหาศาล ทีมนักวิจัยจาก NVIDIA, NTU และ MIT จึงได้เปิดตัว SoL-Pi ชุดกลไกเพิ่มประสิทธิภาพ 4 รูปแบบสำหรับ Pi ซึ่งเป็น Coding agent แบบ open-source
ผลการประเมินด้วย EdgeBench จำนวน 51 งาน พบว่า SoL-Pi สามารถลดปริมาณ Token ที่บันทึกไว้ได้ถึง 44.7% ถึง 49.0% เมื่อเทียบกับ Pi รุ่นพื้นฐาน และลดต้นทุน API ลงได้ประมาณ 33% โดยที่คะแนนความสามารถยังคงใกล้เคียงเดิมทั้งในโมเดล GPT-5.6 Sol และ Opus 5 นอกจากนี้ SoL-Pi ยังเปิดให้ใช้งานจริงแล้วบน GitHub ภายใต้ NVlabs ในรูปแบบส่วนขยายสัญญาอนุญาต MIT
ทำไมต้องตั้งเป้าไปที่ Harness
ขณะที่การเพิ่มประสิทธิภาพส่วนใหญ่มักเน้นไปที่การทำ quantization หรือใช้โมเดลราคาถูก แต่ SoL-Pi เลือกปรับปรุงที่ตัว Harness ซึ่งเป็นเลเยอร์จัดการการเรียกใช้เครื่องมือและบริบทของงาน โดยปกติการปรับแต่ง Harness ด้วยมือนั้นทำได้ช้าและซับซ้อน เพราะการแก้ไขจุดหนึ่งอาจส่งผลกระทบต่อต้นทุนในขั้นตอนถัดไป
แม้ระบบอัตโนมัติอย่าง Meta-Harness จะเข้ามาช่วยได้ แต่ การศึกษาเมื่อเร็วๆ นี้ พบว่า Harness ที่วิวัฒนาการขึ้นมาอาจเกิดการ overfitting หรือทำงานได้ดีเฉพาะกับงานที่ใช้ฝึกฝน แต่ให้ผลลัพธ์เพียงเล็กน้อยกับงานใหม่ที่ไม่เคยเห็นมาก่อน
กระบวนการค้นหาทำงานอย่างไร
ทีมวิจัยใช้ AI สังเกตการทำงานของ Pi รุ่นพื้นฐานเพื่อเสนอการเปลี่ยนแปลงและทำการทดสอบ โดยครอบคลุม 152 แนวทางใน 6 ตระกูลหลัก เช่น การจัดการบริบทและเครื่องมือ ผ่านสภาพแวดล้อมที่รันได้จริง 535 แห่ง ซึ่งรวมถึงข้อมูลจาก GitHub และงานสังเคราะห์อื่นๆ มีการปฏิสัมพันธ์ระหว่าง agent-environment กว่า 60,000 ครั้ง
การค้นหาแต่ละครั้งใช้ลูปแยกอิสระตามวงจร autoresearch และขั้นตอน Ralph Loop โดยมีกฎการยอมรับที่เข้มงวด ข้อมูลจาก EdgeBench จะถูกแยกไว้ต่างหากเพื่อใช้ประเมินผลสุดท้าย เพื่อป้องกันไม่ให้โมเดลนำผลลัพธ์มาฟีดซ้ำในกระบวนการค้นหา
4 กลไกที่รอดการคัดเลือก
- Action Fusion: ยุบรวมการแก้ไขไฟล์และการทดสอบเข้าเป็นคำสั่งเดียว ช่วยลดรอบการทำงาน (round trip) ของโมเดล
- Online Context Compact: ระบบจะประมาณการการประหยัด input และเรียกใช้การบีบอัดบริบทเมื่อผ่านเกณฑ์ที่กำหนดหรือเมื่อ context ใกล้เต็มขีดจำกัด
- ObservationPack: ผลลัพธ์เครื่องมือที่มีขนาดเกิน 10 KiB จะถูกเก็บไว้ในเครื่องและส่งเฉพาะข้อมูลสำคัญในครั้งถัดๆ ไป เพื่อลดขนาดข้อมูลที่โมเดลต้องอ่าน
- Evidence-Preserving Reducer: ใช้โมเดลราคาถูกอย่าง GPT-5.6 Luna สรุปย่อ log ของการ build และ test ที่มีขนาดใหญ่ โดยมีระบบตรวจสอบความถูกต้องอย่างเข้มงวดก่อนนำไปใช้งาน
ผลลัพธ์บน EdgeBench
| Backend | Harness | Tokens (B) | API Cost | Avg. Score |
|---|---|---|---|---|
| GPT-5.6 Sol | Codex | 3.05 | $1,787 | 34.7 |
| GPT-5.6 Sol | Pi | 2.15 | $1,339 | 44.8 |
| GPT-5.6 Sol | SoL-Pi [Efficiency] | 1.10 | $894 | 42.0 |
| GPT-5.6 Sol | SoL-Pi [Performance] | 2.02 | $1,271 | 47.2 |
| Opus 5 | Claude Code | 2.00 | $2,535 | 43.7 |
| Opus 5 | Pi | 2.37 | $1,741 | 44.8 |
| Opus 5 | SoL-Pi [Efficiency] | 1.31 | $1,158 | 42.2 |
| Opus 5 | SoL-Pi [Performance] | 2.10 | $1,605 | 50.5 |
ในโมเดล Opus 5 ระบบสามารถลดปริมาณ Token ได้ 44.7% และลดต้นทุน 33.5% โดยยังคงประสิทธิภาพไว้ได้ถึง 94.3% ส่วนใน GPT-5.6 Sol ลด Token ได้ 49.0% และลดต้นทุน 33.2% โดยเฉพาะในจุด Performance ที่ใช้กลไกที่ดีที่สุดสำหรับแต่ละ backend สามารถยกระดับคะแนนขึ้นได้ 5.3% ถึง 12.8% เมื่อเทียบกับ Pi
นอกเหนือจาก EdgeBench
สำหรับการทดสอบใน Terminal-Bench 4 และโจทย์ IMO 2026 พบว่า SoL-Pi มีต้นทุนต่อโจทย์ที่ผ่านต่ำที่สุดเพียง $20.90 นอกจากนี้ในการทำงานแบบ Agent swarm ที่มีคนงาน 20 ราย SoL-Pi ยังช่วยลดต้นทุนรวมเหลือ $60.11 เมื่อเทียบกับ Pi ที่ใช้ $82.12
ทีมวิจัยระบุว่าการส่งต่อกลไกข้ามโมเดล (cross-model transfer) ยังอยู่ในขั้นเริ่มต้น เนื่องจากกลไกบางอย่างทำงานใน Opus 5 ได้น้อยครั้งกว่า อาจเป็นเพราะการค้นหาอ้างอิงจากข้อมูลของ GPT-5.6 Sol เป็นหลัก ซึ่งเป็นประเด็นที่ต้องพัฒนาต่อไป
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
