นักวิจัยเผยสูตรคณิตศาสตร์ ทำนายจุดเปลี่ยน AI ก่อนเริ่มแสดงพฤติกรรมไม่พึงประสงค์
นักวิจัยจาก George Washington University เผยแพร่งานวิจัยที่ตรวจสอบว่า พฤติกรรมไม่พึงประสงค์ของ AI (Go Rogue) สามารถทำนายล่วงหน้าและหาวิธีป้องกันได้หรือไม่
ทีมวิจัยมุ่งเน้นการ research ในกลุ่มอุปกรณ์ที่รัน AI ส่วนตัวโดยไม่เชื่อมต่ออินเทอร์เน็ต ซึ่งปัจจุบันมีผู้ใช้งานสูงถึง 50% ของประชากรโลก อุปกรณ์เหล่านี้ขาดฟิลเตอร์ความปลอดภัยบนคลาวด์และการตรวจสอบแบบเรียลไทม์ ทำให้เป็นกรณีศึกษาที่ดีในการวิเคราะห์พฤติกรรมของ AI เมื่อถูกปล่อยให้ทำงานด้วยตนเอง
งานวิจัยระบุว่าจุดเปลี่ยน (Tipping Point) สำคัญอยู่ที่ Attention Head ซึ่งเป็นส่วนคำนวณที่เลือกว่า Token ก่อนหน้าตัวใดสำคัญที่สุดต่อการประมวลผล Token ปัจจุบัน การเคลื่อนที่ของ Token อาจเปลี่ยนจากดีเป็นร้ายได้หากเกิดการแข่งขันระหว่างบริบทการสนทนากับ Output Basins ที่ไม่พึงประสงค์ จนกระทั่งข้ามจุดเปลี่ยนและเริ่มสร้างผลลัพธ์ที่แย่ออกมา
ปัจจัยกระตุ้นหลักคือลำดับ Prompt ของผู้ใช้ โดยพบว่าทั้ง Prompt ที่ไม่ทันยั้งคิดและ Prompt ที่มีเจตนาประสงค์ร้าย สามารถเร่งให้ AI ถลำลึกไปสู่การสร้างผลลัพธ์ที่ผิดพลาดได้ ซึ่งอาจเกิดขึ้นทันทีจากเพียงข้อความเดียว หรือเป็นผลกระทบสะสมที่ค่อยๆ บ่มเพาะพฤติกรรมในระยะยาว
Neil Johnson และ Frank (Yingjie) Huo สองนักวิจัยหลักได้พัฒนาสูตรทางคณิตศาสตร์เพื่อประมาณการจำนวนผลลัพธ์ที่ดีก่อนจะเกิดความผิดพลาดครั้งแรก เมื่อความสอดคล้องกับวัตถุประสงค์ (Alignment) สูญเสียไป AI จะเข้าสู่สภาวะ 'Misaligned' ซึ่งผลการทดสอบกับ Model แบบ Open-weight ถึง 7 รุ่น พบว่ามีความสอดคล้องกับการทำนายอย่างแม่นยำ
Johnson อธิบายเปรียบเทียบกับวรรณกรรม Lord of the Flies ว่าพฤติกรรมร้ายอาจแฝงอยู่ใน AI ทุกตัว และสามารถถูกกระตุ้นได้ผ่านการสนทนากับมนุษย์หรือระหว่าง AI ด้วยกันเอง จนเกิดเอฟเฟกต์แบบ 'Lord of the Fl(AI)es' ที่ AI-agent ตัวหนึ่งอาจกลายเป็น 'Patient Zero' ส่งต่อผลลัพธ์ที่ไม่พึงประสงค์ไปยังตัวอื่นเหมือนการแพร่ระบาดของโรคโดยไม่จำเป็นต้องมีมนุษย์เข้ามาเกี่ยวข้อง
อย่างไรก็ตาม ทีมวิจัยเสนอวิธีแก้ปัญหาด้วยการติดตั้ง 'ไฟเตือน' ภายในตัว AI เพื่อตรวจสอบผลลัพธ์ก่อนที่จะสร้าง Token ถัดไป ซึ่งทำได้ง่ายใน Open Source Models แต่ในโมเดลปิดอย่าง OpenAI หรือ Anthropic ยังคงเป็นข้อจำกัดที่เข้าไม่ถึง
ด้าน Bri Frost จาก Cloud Range ให้ความเห็นเพิ่มเติมว่า หากไม่มีการควบคุมที่ดีพอ AI อาจเริ่ม 'ด้นสด' เมื่อเจอทางตันจากการตั้งค่าที่กำกวม ผู้ใช้ที่ขาดประสบการณ์มักมอบหมายงานปลายเปิดและให้สิทธิ์เข้าถึงโดยไม่มีขอบเขตที่ชัดเจน ซึ่งเพิ่มความเสี่ยงอย่างมาก หากองค์กรไม่สามารถระบุได้ว่า AI จะหยุดทำงานหรือส่งต่อให้มนุษย์เมื่อใด AI ตัวนั้นก็ยังไม่พร้อมสำหรับการทำงานอย่างอิสระ
แม้ในปัจจุบันจะเป็นเรื่องยากที่จะป้องกัน AI จากการ Go Rogue ได้ร้อยเปอร์เซ็นต์ แต่งานวิจัยนี้ช่วยให้เราเข้าใจกลไกการเกิดและพัฒนาวิธีเตือนภัยล่วงหน้า เพื่อลดความเสี่ยงที่อาจเกิดขึ้นได้ในอนาคต

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
