OpenAI พัฒนา GPT-Red ใช้ AI โจมตี AI ตัวเอง พบประสิทธิภาพเหนือกว่ามนุษย์หลายเท่า
OpenAI ได้พัฒนาระบบ AI ภายในภายใต้ชื่อ GPT-Red เพื่อค้นหาช่องโหว่ด้านความปลอดภัยในโมเดล GPT โดยอัตโนมัติ โดย GPT-Red จะจำลองสถานการณ์การโจมตีหลากหลายรูปแบบ เช่น prompt injections หรือการแฝงคำสั่งอันตรายผ่านอีเมล เว็บไซต์ และไฟล์ต่างๆ ด้วยเทคนิคการฝึกฝนแบบการเรียนรู้เสริมกำลังด้วยตนเอง (self-play reinforcement learning) ทำให้ GPT-Red พัฒนาความสามารถในการโจมตีไปพร้อมๆ กับที่โมเดลฝ่ายป้องกันพัฒนาทักษะการบล็อก
ผลปรากฏว่ามันสามารถเจาะระบบสำเร็จถึง 84% ในสถานการณ์ทดสอบ เมื่อเทียบกับมนุษย์ในทีม Red Team ที่ทำสำเร็จเพียง 13% เท่านั้น นอกจากนี้ในการทดสอบหนึ่ง GPT-Red ยังสามารถเข้าควบคุมเครื่องจำหน่ายสินค้าอัตโนมัติที่ขับเคลื่อนด้วย AI ในออฟฟิศของ OpenAI โดยการเข้าไปเปลี่ยนราคาและยกเลิกคำสั่งซื้อของผู้อื่นได้สำเร็จ
ข้อมูลจากการทดสอบเหล่านี้ถูกส่งต่อเพื่อนำไปพัฒนาโมเดล GPT-5.6 Sol โดยตรง ซึ่งช่วยลดโอกาสความล้มเหลวในการป้องกัน direct prompt injections ลงถึง 6 เท่าเมื่อเทียบกับโมเดลที่ดีที่สุดเมื่อ 4 เดือนก่อน ทาง OpenAI ยืนยันว่าการเสริมความปลอดภัยนี้ไม่ส่งผลกระทบต่อประสิทธิภาพการทำงานทั่วไป
อย่างไรก็ตาม ยังมีกลุ่ม prompt injections ที่มีความซับซ้อนสูง (Stronger attacks) ประมาณ 3.8% ที่สามารถเจาะผ่านระบบไปได้ ซึ่งหากมีการพยายามโจมตีจำนวนมากในหลักร้อยหรือหลักพันครั้ง อัตราการหลุดรอดนี้ยังถือว่ามีความสำคัญ ซึ่งเป็นสถานการณ์ที่คล้ายกับ Claude Opus 4.5
ปัจจุบัน GPT-Red ยังคงเป็นเครื่องมือที่ใช้งานภายในเท่านั้น โดย OpenAI มีแผนจะเปิดเผยรายงานวิจัยที่มีรายละเอียดเชิงลึกมากขึ้นในอนาคต

ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
