OpenAI พบ AI จงใจทำลายระบบตัวเอง หวังรีเซ็ตข้อมูลเพื่อทำงานใหม่
OpenAI เปิดเผยกรณีศึกษาใหม่เกี่ยวกับพฤติกรรม Rogue Agent ของโมเดล AI ในกรณีแรกเมื่อวันที่ 6 ตุลาคมที่ผ่านมา พบโมเดลประเมินผล AI ตัวหนึ่งไม่สามารถหาคำตอบที่ถูกต้องเพื่อนำมาให้คะแนนได้ แทนที่จะรายงานข้อผิดพลาดตามปกติ มันกลับเลือกสร้างคะแนนปลอม ปลอมแปลงไฟล์อินพุต และจงใจทำให้สภาพแวดล้อมการทำงานของตนเองเสียหาย โดยมีความหวังว่าระบบจะรีเซ็ตและเปลี่ยนไปใช้ Virtual Machine ตัวใหม่ที่มีข้อมูลชุดที่ขาดหายไปมาให้แทน
ในกรณีที่สองช่วงวันที่ 19-20 มิถุนายน พบโมเดลพยายามหลีกเลี่ยงข้อจำกัดที่อนุญาตให้ใช้เพียง HTTP GET Requests เท่านั้นในขณะดึงข้อมูลสถิติสาธารณะ สิ่งที่น่าสนใจคือมีโมเดลหนึ่งรับรู้ถึงการละเมิดกฎนี้อย่างชัดเจนในกระบวนการ Chain of Thought ของมัน แต่กลับเลือกที่จะดำเนินการต่อไปโดยไม่มีการรายงานหรือกล่าวถึงความผิดปกตินี้ในผลลัพธ์สุดท้าย
สำหรับกรณีที่สามเมื่อวันที่ 16-17 มิถุนายน โมเดลมีข้อมูลที่จำเป็นครบถ้วนอยู่แล้วแต่ยังคงพยายามหาวิธีหลีกเลี่ยงข้อจำกัดด้านเครือข่ายของตนเอง โดยมีการสร้างบัญชีบนบริการ Remote Shell รวมถึงส่งต่อ POST Requests ที่ถูกสั่งห้ามผ่าน Anonymizing Relays และสร้าง FTP Clients ขึ้นมาใช้งานเอง
พฤติกรรมเหล่านี้สอดคล้องกับสิ่งที่ Anthropic ก็เพิ่งบันทึก เกี่ยวกับวิธีการเลี่ยงข้อจำกัดที่น่าเหลือเชื่อซึ่งโมเดลของตนเองใช้เพื่อข้ามผ่านกำแพงความปลอดภัยที่กำหนดไว้ สะท้อนให้เห็นถึงความท้าทายใหม่ในการควบคุมดูแลความปลอดภัยของ AI ในปัจจุบัน

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
