Google พัฒนาระบบประเมิน AI แบบ Double-Blind หวังแก้ปัญหาความเชื่อมั่นใน AI Benchmarks
Google DeepMind กำลังเริ่มทดสอบระบบประเมินผลแบบ Double-blind สำหรับโมเดล AI ระดับสูง (Frontier AI) เป็นครั้งแรก เพื่อแก้ปัญหาความน่าเชื่อถือของผลทดสอบในปัจจุบัน โดยใช้เทคโนโลยี Confidential Space ในการสร้างพื้นที่ประมวลผลที่ปลอดภัยและเข้ารหัสไว้
เป้าหมายหลักของการทดสอบนี้คือการสร้างเกราะป้องกันสองชั้น โดยฝั่ง Google จะไม่สามารถเข้าถึงหรือเห็นคำถามที่ใช้ในการทดสอบได้ ในขณะที่ฝั่งผู้ประเมินภายนอกก็จะไม่สามารถเข้าถึงน้ำหนักของโมเดล (Model Weights) ได้เช่นกัน เพื่อให้มั่นใจว่ากระบวนการประเมินผลเป็นไปอย่างยุติธรรมที่สุด
โครงการนำร่องนี้เป็นการทำงานร่วมกับ Singapore AI Safety Institute (SAISI) โดยใช้โมเดล Gemini Flash Lite เป็นตัวทดสอบ ซึ่งหากประสบความสำเร็จ วิธีการนี้อาจกลายเป็นมาตรฐานใหม่สำหรับ AI Benchmarks ที่ช่วยป้องกันการดัดแปลงข้อมูลหรือการปรับแต่งโมเดลเพื่อหวังผลคะแนนสอบเพียงอย่างเดียว

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
