UK AISI ชี้เกณฑ์มาตรฐานปัจจุบันประเมินความสามารถที่แท้จริงของ AI Agent ต่ำเกินไป
· By: SirilukP
จากการศึกษาที่ครอบคลุมการทดสอบมาตรฐาน (Benchmarks) 7 รายการ AI Security Institute (AISI) ของสหราชอาณาจักร ชี้ให้เห็นว่าการประเมิน AI ด้วยเกณฑ์มาตรฐานทั่วไป มักจะประเมินความสามารถที่แท้จริงของ AI Agent ต่ำเกินไปอย่างเป็นระบบ เนื่องจากข้อจำกัดด้านงบประมาณการประมวลผล (Compute budget)
สำหรับงานด้านวิศวกรรมซอฟต์แวร์ อัตราความสำเร็จสามารถพุ่งสูงขึ้นราว 25% เมื่อมีการเพิ่มงบประมาณ Token (Token budget) ขึ้น 10 เท่า โดยโมเดลรุ่นใหม่ ๆ จะได้รับประโยชน์จากการเพิ่มงบประมาณนี้มากที่สุด
ข้อมูลจาก AISI ยังระบุด้วยว่า ความก้าวหน้าที่แท้จริงของโมเดลระดับ Frontier นั้นเติบโตเร็วกว่าที่การวัดผลก่อนหน้านี้เคยระบุไว้ถึงประมาณ 60% ทั้งนี้ขึ้นอยู่กับปริมาณ Token budget ด้วย
Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
