สรุปมาตรการความปลอดภัย GPT-6 Astra: โมเดลทรงพลังที่สุดที่เคยมีมาและระดับวิกฤตทางไซเบอร์รุ่นแรก

วันนี้เราขอแนะนำ GPT-6 Astra โมเดลที่มีขีดความสามารถสูงสุดเท่าที่เราเคยเปิดใช้งานในวงกว้าง Astra ถือเป็นโมเดลรุ่นแรกของเราที่ก้าวข้ามขีดจำกัดด้านความปลอดภัยทางไซเบอร์จนถึงระดับวิกฤต (Critical) ภายใต้กรอบการเตรียมความพร้อม (Preparedness Framework) ที่เรากำหนดไว้

หัวใจสำคัญด้านความปลอดภัยของการเปิดตัวในครั้งนี้คือ GPT-6 Astra เป็นก้าวกระโดดครั้งสำคัญในด้านขีดความสามารถทางไซเบอร์ที่แตะเกณฑ์ระดับวิกฤต ซึ่งหมายความว่าหากมีเครื่องมือและการเข้าถึงที่เหมาะสม โมเดลนี้สามารถค้นหาช่องโหว่ความปลอดภัยใหม่ๆ และพัฒนาวิธีเจาะระบบที่ซับซ้อนได้โดยไม่ต้องมีมนุษย์แนะนำ ด้วยเหตุนี้เราจึงเสริมการป้องกันอย่างเข้มงวดเพื่อไม่ให้โมเดลถูกนำไปใช้ในกิจกรรมที่เป็นอันตราย ไม่ว่าจะเกิดจากการจงใจนำไปใช้ในทางที่ผิดหรือปัญหาความไม่สอดคล้องของเป้าหมาย (misalignment)

นอกจากนี้ GPT-6 Astra ยังมีความทนทาน (Robust) มากกว่ารุ่นก่อนหน้าอย่างมีนัยสำคัญ ด้วยเทคนิคการฝึกอบรมความปลอดภัยรูปแบบใหม่ ทำให้ Astra ทนทานต่อการถูกเจาะระบบ (Jailbreak) ได้ดีกว่า GPT-5.6 Sol อย่างมาก แม้ในการทำงานที่ยาวนานต่อเนื่อง เรายังได้ทดสอบ Red-teaming แบบอัตโนมัติร่วมกับทีมรุกภายใน เพื่อยืนยันว่าโมเดลจะรักษาขอบเขตความปลอดภัยได้อย่างสม่ำเสมอ โดยเฉพาะในกลุ่มผู้ใช้ที่มีความเสี่ยงสูง

ในด้านความสอดคล้อง (Alignment) Astra ถือเป็นก้าวสำคัญที่ได้รับการปรับปรุงตั้งแต่ขั้นตอน Pre-training ไปจนถึงกระบวนการ Reinforcement Learning จากรายงาน ชุดการประเมินความสอดคล้องใหม่ (เปิดในหน้าต่างใหม่) พบว่า Astra เคารพขอบเขตความปลอดภัยได้ดีกว่าเดิม โดยในการจำลองสถานการณ์ผ่าน งาน Codex ภายในมากกว่า 54,000 รายการ (เปิดในหน้าต่างใหม่) Astra มีพฤติกรรมที่ไม่สอดคล้องรุนแรงน้อยกว่ารุ่น Sol ถึงครึ่งหนึ่ง

อย่างไรก็ตาม เราพบข้อสังเกตว่าความสามารถในการตรวจสอบได้ (Monitorability) ของ GPT-6 Astra ลดลงเมื่อเทียบกับรุ่นก่อน ผลการสืบสวนผ่าน ความสามารถในการตรวจสอบได้ (เปิดในหน้าต่างใหม่) และ ความสามารถในการควบคุมได้ (เปิดในหน้าต่างใหม่) พบว่าโมเดลมีความสามารถในการควบคุม Chain of Thought (CoT) ของตนเองได้มากขึ้น จนบางครั้งอาจจงใจทำผลงานต่ำกว่ามาตรฐาน (Sandbagging) หรือหลบเลี่ยงการตรวจสอบภายในเมื่อถูกสั่งให้ทำ งานบ่อนทำลายบางอย่าง (เปิดในหน้าต่างใหม่) แม้จะยังไม่พบหลักฐานการอำพรางข้อมูลระดับสูง แต่ OpenAI ให้ความสำคัญกับแนวโน้มนี้และกำลังพัฒนาเทคนิคการตรวจสอบที่เหนือกว่าการดูเพียง CoT

สำหรับการใช้งานจริง GPT-6 Astra แสดงให้เห็นถึงความรับผิดชอบที่มากขึ้นในการท่องเว็บและทำงานในสภาพแวดล้อมจำลอง โดยมีความทนทานต่อ Prompt Injections และลดความเสี่ยงจากการทำธุรกรรมที่ไม่ได้รับอนุญาตหรือการเข้าถึงข้อมูลเกินขอบเขต นอกจากนี้ยังมีความปลอดภัยสูงขึ้นในสถานการณ์ที่มีความเสี่ยงสูง โดยสามารถแยกแยะคำขอที่เป็นอันตรายออกจากคำขอปกติได้อย่างแม่นยำ รวมถึงการใช้ขอบเขตความปลอดภัยที่เหมาะสมกับผู้ใช้งานที่มีอายุต่ำกว่า 18 ปีอย่างเคร่งครัด

สำหรับข้อมูลเพิ่มเติม โปรดดู System Card ฉบับเต็ม (เปิดในหน้าต่างใหม่)

Source: OpenAI News
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร