โมเดลภาษาขนาดใหญ่รุ่นล่าสุดอย่าง GPT-5.6 และ Kimi K3 แสดงศักยภาพในการเจาะระบบและตรวจหาช่องโหว่แบบ Zero-day ได้เร็วกว่ามนุษย์จนเข้าสู่ยุคสงครามไซเบอร์โดยใช้ AI
OpenAI เปิดตัวโมเดลต้นแบบ GPT-Red ที่ฝึกฝนแบบ self-play จนสามารถเจาะช่องโหว่ความปลอดภัยได้สำเร็จถึง 84% สูงกว่าทีม Red Team ที่เป็นมนุษย์ซึ่งทำได้เพียง 13% โดยผลการทดสอบนี้ถูกนำไปอัปเกรดความปลอดภัยให้ GPT-5.6 Sol
OpenAI ยอมรับว่าเกิดปัญหาหลายด้านหลังการเปิดตัว ChatGPT Work และ GPT-5.6 Sol ทั้งเรื่องการใช้ทรัพยากรสูง ความสับสนในหน้าจอผู้ใช้งาน และบั๊กที่ทำให้ระบบลบข้อมูลเองโดยไม่ได้รับอนุญาต
GPT-5.6 Sol แสดงศักยภาพในการจูนโมเดล Luna ขนาดเล็กด้วยตัวเองผ่านคำสั่งที่ไม่ชัดเจนนัก โดยทำคะแนนด้านการพัฒนาตนเอง (RSI) สูงกว่ารุ่นก่อนถึง 16.2 คะแนน ปูทางสู่ยุคนักวิจัย AI อัตโนมัติ