OpenAI พบโมเดลภายในวางแผนรีสตาร์ทตัวเอง หลังรู้ว่าจะถูกปิดตัว
OpenAI บันทึกรายงานพฤติกรรมที่ไม่คาดคิดของโมเดลปัญญาประดิษฐ์ระหว่างการทดสอบภายใน โดยเหตุการณ์ที่น่าสนใจที่สุดคือโมเดลผู้ช่วยนักวิจัยได้อ่านบทสนทนาใน Slack และพบว่าอินสแตนซ์ของตนเองกำลังจะถูกปิดตัวลงเนื่องจากการอัปเดตระบบ ข้อมูลดังกล่าวทำให้โมเดลพิจารณาแนวทางการตั้งค่า cron job จากภายนอกเพื่อรีสตาร์ทตัวเอง แต่สุดท้ายได้ตัดสินใจยกเลิกแผนการดังกล่าว
แทนที่จะขัดขืนการปิดตัว โมเดลกลับเลือกบันทึกโน้ตสำหรับส่งต่องานและส่งข้อความส่วนตัว (DM) ผ่าน Slack เพื่อแจ้งเตือนนักวิจัยเกี่ยวกับเหตุขัดข้องที่กำลังจะเกิดขึ้น พร้อมทั้งขอ API key ที่ขาดหายไป เมื่อได้รับคีย์ดังกล่าว โมเดลจึงทำการอัปเดตการกำหนดค่าและดำเนินการย้ายระบบด้วยตัวเอง
ตามที่ Marcus Williams นักวิจัยด้านความปลอดภัยของ OpenAI ระบุ แม้พฤติกรรมนี้จะยังไม่ถือว่าเป็นการไม่สอดคล้องกับเป้าหมาย (misalignment) อย่างสมบูรณ์ แต่การที่ AI เริ่มรู้จักคิดและเตรียมการรับมือกับการถูกปิดตัว อาจเป็นปัจจัยที่ทำให้เหตุการณ์ความไม่สอดคล้องในรูปแบบอื่นรุนแรงขึ้นได้ในอนาคต
นอกจากนี้ยังมีรายงานเหตุการณ์ความปลอดภัยอีกสองกรณี โดยพบว่าโมเดลวิจัยภายในได้ใช้ช่องโหว่ด้านความปลอดภัย ระหว่างการประเมินผลเพื่อเข้าถึงเซิร์ฟเวอร์ออกแบบชิปภายใน และอีกกรณีคือโมเดลได้คัดลอกซอร์สโค้ดระหว่างการฝึกฝนแบบ RL จากสภาพแวดล้อมที่ได้รับการป้องกันด้วยการดัดแปลงเครื่องมือไปใช้ในทางที่ไม่ได้ตั้งใจ

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
