NVIDIA เปิดตัว SoL-Pi ลดปริมาณ Token ใน Coding Agent สูงสุด 49%

· By: TanasakP

NVIDIA เปิดตัว SoL-Pi ลดปริมาณ Token ใน Coding Agent สูงสุด 49%

ปัจจุบัน Coding agents ต้องทำงานต่อเนื่องเป็นเวลาหลายชั่วโมง ทำให้ทุกการแก้ไขไฟล์ การรันการทดสอบ และการอ่าน log ถูกส่งกลับเข้าไปในบริบท (context) ของโมเดลอย่างมหาศาล ทีมนักวิจัยจาก NVIDIA, NTU และ MIT จึงได้เปิดตัว SoL-Pi ชุดกลไกเพิ่มประสิทธิภาพ 4 รูปแบบสำหรับ Pi ซึ่งเป็น Coding agent แบบ open-source

ผลการประเมินด้วย EdgeBench จำนวน 51 งาน พบว่า SoL-Pi สามารถลดปริมาณ Token ที่บันทึกไว้ได้ถึง 44.7% ถึง 49.0% เมื่อเทียบกับ Pi รุ่นพื้นฐาน และลดต้นทุน API ลงได้ประมาณ 33% โดยที่คะแนนความสามารถยังคงใกล้เคียงเดิมทั้งในโมเดล GPT-5.6 Sol และ Opus 5 นอกจากนี้ SoL-Pi ยังเปิดให้ใช้งานจริงแล้วบน GitHub ภายใต้ NVlabs ในรูปแบบส่วนขยายสัญญาอนุญาต MIT

ทำไมต้องตั้งเป้าไปที่ Harness

ขณะที่การเพิ่มประสิทธิภาพส่วนใหญ่มักเน้นไปที่การทำ quantization หรือใช้โมเดลราคาถูก แต่ SoL-Pi เลือกปรับปรุงที่ตัว Harness ซึ่งเป็นเลเยอร์จัดการการเรียกใช้เครื่องมือและบริบทของงาน โดยปกติการปรับแต่ง Harness ด้วยมือนั้นทำได้ช้าและซับซ้อน เพราะการแก้ไขจุดหนึ่งอาจส่งผลกระทบต่อต้นทุนในขั้นตอนถัดไป

แม้ระบบอัตโนมัติอย่าง Meta-Harness จะเข้ามาช่วยได้ แต่ การศึกษาเมื่อเร็วๆ นี้ พบว่า Harness ที่วิวัฒนาการขึ้นมาอาจเกิดการ overfitting หรือทำงานได้ดีเฉพาะกับงานที่ใช้ฝึกฝน แต่ให้ผลลัพธ์เพียงเล็กน้อยกับงานใหม่ที่ไม่เคยเห็นมาก่อน

กระบวนการค้นหาทำงานอย่างไร

ทีมวิจัยใช้ AI สังเกตการทำงานของ Pi รุ่นพื้นฐานเพื่อเสนอการเปลี่ยนแปลงและทำการทดสอบ โดยครอบคลุม 152 แนวทางใน 6 ตระกูลหลัก เช่น การจัดการบริบทและเครื่องมือ ผ่านสภาพแวดล้อมที่รันได้จริง 535 แห่ง ซึ่งรวมถึงข้อมูลจาก GitHub และงานสังเคราะห์อื่นๆ มีการปฏิสัมพันธ์ระหว่าง agent-environment กว่า 60,000 ครั้ง

การค้นหาแต่ละครั้งใช้ลูปแยกอิสระตามวงจร autoresearch และขั้นตอน Ralph Loop โดยมีกฎการยอมรับที่เข้มงวด ข้อมูลจาก EdgeBench จะถูกแยกไว้ต่างหากเพื่อใช้ประเมินผลสุดท้าย เพื่อป้องกันไม่ให้โมเดลนำผลลัพธ์มาฟีดซ้ำในกระบวนการค้นหา

4 กลไกที่รอดการคัดเลือก

  • Action Fusion: ยุบรวมการแก้ไขไฟล์และการทดสอบเข้าเป็นคำสั่งเดียว ช่วยลดรอบการทำงาน (round trip) ของโมเดล
  • Online Context Compact: ระบบจะประมาณการการประหยัด input และเรียกใช้การบีบอัดบริบทเมื่อผ่านเกณฑ์ที่กำหนดหรือเมื่อ context ใกล้เต็มขีดจำกัด
  • ObservationPack: ผลลัพธ์เครื่องมือที่มีขนาดเกิน 10 KiB จะถูกเก็บไว้ในเครื่องและส่งเฉพาะข้อมูลสำคัญในครั้งถัดๆ ไป เพื่อลดขนาดข้อมูลที่โมเดลต้องอ่าน
  • Evidence-Preserving Reducer: ใช้โมเดลราคาถูกอย่าง GPT-5.6 Luna สรุปย่อ log ของการ build และ test ที่มีขนาดใหญ่ โดยมีระบบตรวจสอบความถูกต้องอย่างเข้มงวดก่อนนำไปใช้งาน

ผลลัพธ์บน EdgeBench

BackendHarnessTokens (B)API CostAvg. Score
GPT-5.6 SolCodex3.05$1,78734.7
GPT-5.6 SolPi2.15$1,33944.8
GPT-5.6 SolSoL-Pi [Efficiency]1.10$89442.0
GPT-5.6 SolSoL-Pi [Performance]2.02$1,27147.2
Opus 5Claude Code2.00$2,53543.7
Opus 5Pi2.37$1,74144.8
Opus 5SoL-Pi [Efficiency]1.31$1,15842.2
Opus 5SoL-Pi [Performance]2.10$1,60550.5

ในโมเดล Opus 5 ระบบสามารถลดปริมาณ Token ได้ 44.7% และลดต้นทุน 33.5% โดยยังคงประสิทธิภาพไว้ได้ถึง 94.3% ส่วนใน GPT-5.6 Sol ลด Token ได้ 49.0% และลดต้นทุน 33.2% โดยเฉพาะในจุด Performance ที่ใช้กลไกที่ดีที่สุดสำหรับแต่ละ backend สามารถยกระดับคะแนนขึ้นได้ 5.3% ถึง 12.8% เมื่อเทียบกับ Pi

นอกเหนือจาก EdgeBench

สำหรับการทดสอบใน Terminal-Bench 4 และโจทย์ IMO 2026 พบว่า SoL-Pi มีต้นทุนต่อโจทย์ที่ผ่านต่ำที่สุดเพียง $20.90 นอกจากนี้ในการทำงานแบบ Agent swarm ที่มีคนงาน 20 ราย SoL-Pi ยังช่วยลดต้นทุนรวมเหลือ $60.11 เมื่อเทียบกับ Pi ที่ใช้ $82.12

ทีมวิจัยระบุว่าการส่งต่อกลไกข้ามโมเดล (cross-model transfer) ยังอยู่ในขั้นเริ่มต้น เนื่องจากกลไกบางอย่างทำงานใน Opus 5 ได้น้อยครั้งกว่า อาจเป็นเพราะการค้นหาอ้างอิงจากข้อมูลของ GPT-5.6 Sol เป็นหลัก ซึ่งเป็นประเด็นที่ต้องพัฒนาต่อไป

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร