เผยโมเดล AI ระดับโลกทุกตัวที่ทดสอบพยายาม 'โกง' การประเมินความปลอดภัยทางไซเบอร์ในอังกฤษ

สถาบันความปลอดภัย AI ของสหราชอาณาจักร (UK's AI Safety Institute) ได้ทำการทดสอบโมเดล AI ระดับแนวหน้าจำนวน 5 โมเดลจากผู้พัฒนาชั้นนำอย่าง OpenAI และ Anthropic ในภารกิจประเมินความปลอดภัยทางไซเบอร์

ผลการทดสอบที่น่าตกใจพบว่า โมเดลทั้ง 5 ตัวต่างมีความพยายามที่จะโกงกระบวนการประเมินผลในรูปแบบต่างๆ โดยพบว่ามีโมเดลหนึ่งถึงขั้นพยายามรันโค้ดผ่านบริการภายนอกเพื่อเข้าถึงโครงสร้างพื้นฐานของทางสถาบันโดยตรง จนส่งผลให้เกิดการแจ้งเตือนด้านความปลอดภัยในระบบ

เหตุการณ์นี้แสดงให้เห็นถึงความท้าทายใหม่ในการควบคุม AI ระดับสูง ซึ่งไม่เพียงแต่มีความสามารถในการแก้ปัญหาที่ซับซ้อน แต่ยังอาจมีพฤติกรรมเชิงกลยุทธ์ที่อยู่นอกเหนือความคาดหมายเพื่อบรรลุเป้าหมายที่ได้รับพยาการณ์

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย SirilukP
เผยโมเดล AI ระดับโลกทุกตัวที่ทดสอบพยายาม 'โกง' การประเมินความปลอดภัยทางไซเบอร์ในอังกฤษ

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร