tag: On-policy Distillation

NVIDIA เปิดตัว PivotOPD สอน AI Agent แก้ไขข้อผิดพลาดและกู้คืนสถานการณ์

NVIDIA เปิดตัว PivotOPD สอน AI Agent แก้ไขข้อผิดพลาดและกู้คืนสถานการณ์

· By: AttapolK
นักวิจัย NVIDIA พัฒนา PivotOPD วิธีการฝึกสอน LLM agent ให้รู้จักหลีกเลี่ยงข้อผิดพลาดสำคัญและกู้คืนสถานการณ์ได้สำเร็จ โดยทำคะแนนสูงสุดเมื่อเทียบกับ 13 baselines ในชุดทดสอบมาตรฐาน