การวิเคราะห์พฤติกรรมผู้โจมตีไซเบอร์ที่ใช้ AI พบว่ามีแนวโน้มเข้าสู่ขั้นตอนเชิงลึกมากขึ้นและมีความเป็นอัตโนมัติสูง จนเฟรมเวิร์กความปลอดภัยเดิมอาจไม่เพียงพอต่อการตรวจจับ
เจาะลึกแนวทางการทำ Red Teaming ของ Anthropic เพื่อทดสอบความปลอดภัยของ AI ตั้งแต่การใช้ผู้เชี่ยวชาญเฉพาะด้านไปจนถึงการทดสอบแบบอัตโนมัติ เพื่อสร้างมาตรฐานใหม่ในการรับมือความเสี่ยงของโมเดลอัจฉริยะ
OpenAI เปิดตัวโมเดลต้นแบบ GPT-Red ที่ฝึกฝนแบบ self-play จนสามารถเจาะช่องโหว่ความปลอดภัยได้สำเร็จถึง 84% สูงกว่าทีม Red Team ที่เป็นมนุษย์ซึ่งทำได้เพียง 13% โดยผลการทดสอบนี้ถูกนำไปอัปเกรดความปลอดภัยให้ GPT-5.6 Sol