Google พัฒนาระบบประเมิน AI แบบ Double-Blind หวังแก้ปัญหาความเชื่อมั่นใน AI Benchmarks

Google DeepMind กำลังเริ่มทดสอบระบบประเมินผลแบบ Double-blind สำหรับโมเดล AI ระดับสูง (Frontier AI) เป็นครั้งแรก เพื่อแก้ปัญหาความน่าเชื่อถือของผลทดสอบในปัจจุบัน โดยใช้เทคโนโลยี Confidential Space ในการสร้างพื้นที่ประมวลผลที่ปลอดภัยและเข้ารหัสไว้

เป้าหมายหลักของการทดสอบนี้คือการสร้างเกราะป้องกันสองชั้น โดยฝั่ง Google จะไม่สามารถเข้าถึงหรือเห็นคำถามที่ใช้ในการทดสอบได้ ในขณะที่ฝั่งผู้ประเมินภายนอกก็จะไม่สามารถเข้าถึงน้ำหนักของโมเดล (Model Weights) ได้เช่นกัน เพื่อให้มั่นใจว่ากระบวนการประเมินผลเป็นไปอย่างยุติธรรมที่สุด

โครงการนำร่องนี้เป็นการทำงานร่วมกับ Singapore AI Safety Institute (SAISI) โดยใช้โมเดล Gemini Flash Lite เป็นตัวทดสอบ ซึ่งหากประสบความสำเร็จ วิธีการนี้อาจกลายเป็นมาตรฐานใหม่สำหรับ AI Benchmarks ที่ช่วยป้องกันการดัดแปลงข้อมูลหรือการปรับแต่งโมเดลเพื่อหวังผลคะแนนสอบเพียงอย่างเดียว

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP
Google พัฒนาระบบประเมิน AI แบบ Double-Blind หวังแก้ปัญหาความเชื่อมั่นใน AI Benchmarks

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร