OpenAI พัฒนา GPT-Red ใช้ AI โจมตี AI ตัวเอง พบประสิทธิภาพเหนือกว่ามนุษย์หลายเท่า

OpenAI ได้พัฒนาระบบ AI ภายในภายใต้ชื่อ GPT-Red เพื่อค้นหาช่องโหว่ด้านความปลอดภัยในโมเดล GPT โดยอัตโนมัติ โดย GPT-Red จะจำลองสถานการณ์การโจมตีหลากหลายรูปแบบ เช่น prompt injections หรือการแฝงคำสั่งอันตรายผ่านอีเมล เว็บไซต์ และไฟล์ต่างๆ ด้วยเทคนิคการฝึกฝนแบบการเรียนรู้เสริมกำลังด้วยตนเอง (self-play reinforcement learning) ทำให้ GPT-Red พัฒนาความสามารถในการโจมตีไปพร้อมๆ กับที่โมเดลฝ่ายป้องกันพัฒนาทักษะการบล็อก

ผลปรากฏว่ามันสามารถเจาะระบบสำเร็จถึง 84% ในสถานการณ์ทดสอบ เมื่อเทียบกับมนุษย์ในทีม Red Team ที่ทำสำเร็จเพียง 13% เท่านั้น นอกจากนี้ในการทดสอบหนึ่ง GPT-Red ยังสามารถเข้าควบคุมเครื่องจำหน่ายสินค้าอัตโนมัติที่ขับเคลื่อนด้วย AI ในออฟฟิศของ OpenAI โดยการเข้าไปเปลี่ยนราคาและยกเลิกคำสั่งซื้อของผู้อื่นได้สำเร็จ

ข้อมูลจากการทดสอบเหล่านี้ถูกส่งต่อเพื่อนำไปพัฒนาโมเดล GPT-5.6 Sol โดยตรง ซึ่งช่วยลดโอกาสความล้มเหลวในการป้องกัน direct prompt injections ลงถึง 6 เท่าเมื่อเทียบกับโมเดลที่ดีที่สุดเมื่อ 4 เดือนก่อน ทาง OpenAI ยืนยันว่าการเสริมความปลอดภัยนี้ไม่ส่งผลกระทบต่อประสิทธิภาพการทำงานทั่วไป

อย่างไรก็ตาม ยังมีกลุ่ม prompt injections ที่มีความซับซ้อนสูง (Stronger attacks) ประมาณ 3.8% ที่สามารถเจาะผ่านระบบไปได้ ซึ่งหากมีการพยายามโจมตีจำนวนมากในหลักร้อยหรือหลักพันครั้ง อัตราการหลุดรอดนี้ยังถือว่ามีความสำคัญ ซึ่งเป็นสถานการณ์ที่คล้ายกับ Claude Opus 4.5

ปัจจุบัน GPT-Red ยังคงเป็นเครื่องมือที่ใช้งานภายในเท่านั้น โดย OpenAI มีแผนจะเปิดเผยรายงานวิจัยที่มีรายละเอียดเชิงลึกมากขึ้นในอนาคต

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย NatapolK
rompt injection success rates dropped steadily from GPT-5.3 through GPT-5.6 Sol, but haven't hit zero. | Image: OpenAI

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร