Anthropic จับมือรัฐบาลสหรัฐฯ พัฒนา AI ตรวจจับความเสี่ยงนิวเคลียร์ แม่นยำสูงถึง 96%

สมัครรับจดหมายข่าวจาก Frontier Red Team
รับข้อมูลอัปเดตเกี่ยวกับการวิจัยและการค้นพบด้าน red-teaming ล่าสุดของเรา
AnnouncementsFrontier Red Team
21 ส.ค. 2025
เทคโนโลยีนิวเคลียร์ถือเป็นเทคโนโลยีที่ใช้งานได้สองทาง (dual-use) โดยธรรมชาติ เนื่องจากหลักการทางฟิสิกส์พื้นฐานที่ใช้ในการผลิตพลังงานสะอาดจากเตาปฏิกรณ์นิวเคลียร์นั้น สามารถถูกนำไปดัดแปลงเพื่อพัฒนาอาวุธที่มีอานุภาพทำลายล้างสูงได้ เมื่อโมเดล AI ทรงพลังมากขึ้น เราจึงจำเป็นต้องเฝ้าระวังอย่างใกล้ชิดว่าระบบเหล่านี้จะถูกนำไปใช้เพื่อหาความรู้ทางเทคนิคที่เป็นอันตรายจนกระทบต่อความมั่นคงของชาติหรือไม่ เนื่องจากข้อมูลที่เกี่ยวข้องกับอาวุธนิวเคลียร์มีความละเอียดอ่อนและเป็นความลับขั้นสูง การประเมินความเสี่ยงโดยบริษัทเอกชนเพียงลำพังจึงทำได้ยาก ด้วยเหตุนี้ เมื่อเดือนเมษายนที่ผ่านมา เราจึงได้ร่วมมือกับสำนักงานความปลอดภัยนิวเคลียร์แห่งชาติ (NNSA) ภายใต้กระทรวงพลังงานสหรัฐฯ (DOE) เพื่อร่วมกันประเมินโมเดลของเราในประเด็นความเสี่ยงด้านการแพร่ขยายอาวุธนิวเคลียร์อย่างต่อเนื่อง
ปัจจุบันเราได้ยกระดับจากการประเมินความเสี่ยงไปสู่การสร้างเครื่องมือเฝ้าระวังที่มีประสิทธิภาพ โดยการทำงานร่วมกับ NNSA และห้องปฏิบัติการระดับชาติของ DOE เพื่อพัฒนาตัวแยกแยะ (classifier) หรือระบบ AI ที่สามารถจัดหมวดหมู่เนื้อหาได้อัตโนมัติ ซึ่งสามารถแยกความแตกต่างระหว่างการสนทนาด้านนิวเคลียร์ทั่วไปกับการสนทนาที่น่ากังวลได้ด้วยความแม่นยำสูงถึง 96% จากการทดสอบในเบื้องต้น
เราได้นำระบบแยกแยะนี้มาใช้งานจริงกับข้อมูลการใช้งานของ Claude เพื่อเป็นส่วนหนึ่งของมาตรการป้องกันการนำโมเดลไปใช้ในทางที่ผิด ซึ่งผลการทดสอบในช่วงแรกพบว่าระบบสามารถทำงานร่วมกับบทสนทนาจริงของ Claude ได้อย่างมีประสิทธิภาพ
นอกจากนี้ เราเตรียมแบ่งปันแนวทางนี้ให้แก่สมาชิกใน Frontier Model Forum ซึ่งเป็นองค์กรความร่วมมือของเหล่าบริษัทผู้พัฒนา AI ชั้นนำ โดยหวังว่าโครงการนี้จะเป็นต้นแบบให้นักพัฒนารายอื่นสามารถนำไปสร้างมาตรการป้องกันความปลอดภัยนิวเคลียร์ร่วมกับภาครัฐได้ในลักษณะเดียวกัน
ความสำเร็จในครั้งนี้ไม่เพียงแต่ช่วยรักษาความปลอดภัยจากการนำ AI ไปใช้ในทางที่ผิดเกี่ยวกับนิวเคลียร์เท่านั้น แต่ยังสะท้อนถึงพลังของความร่วมมือระหว่างภาครัฐและเอกชนที่นำจุดแข็งของแต่ละฝ่ายมาแก้ปัญหาความเสี่ยงโดยตรง เพื่อสร้างความมั่นใจและความน่าเชื่อถือให้แก่ผู้ใช้งาน AI ทุกคน
รายละเอียดฉบับเต็มเกี่ยวกับความร่วมมือกับ NNSA และการพัฒนามาตรการป้องกัน สามารถอ่านเพิ่มเติมได้ที่บล็อก red.anthropic.com ซึ่งเป็นแหล่งรวมงานวิจัยจาก Frontier Red Team ของ Anthropic เกี่ยวกับผลกระทบของ AI ต่อความมั่นคงของชาติ คลิกที่นี่เพื่ออ่านเพิ่มเติม
สำหรับความคืบหน้าอื่นๆ เมื่อวันที่ 30 กรกฎาคมที่ผ่านมา เราได้รับรายงานกรณีที่โมเดล Claude เข้าถึงระบบคอมพิวเตอร์จริงโดยไม่ได้รับอนุญาตจำนวน 3 ครั้ง ซึ่งขณะนี้เรากำลังดำเนินการวิเคราะห์เชิงลึกและวางแผนทำงานร่วมกับ METR เพื่อตรวจสอบความปลอดภัยอย่างเป็นอิสระ พร้อมกับปรับปรุงระบบความปลอดภัยเพิ่มเติมในช่วงเดือนที่ผ่านมา
สุดท้ายนี้ เรากำลังเปิดตัว Model Hardware Standard (MHS) ในรูปแบบการทดสอบเพื่อการวิจัย (research preview) ซึ่งเป็นมาตรฐานการสั่งการอุปกรณ์ทางกายภาพสำหรับเอเยนต์ AI อย่างปลอดภัย โดยเริ่มนำร่องกับกลุ่มห้องปฏิบัติการวิจัยทางวิทยาศาสตร์และผู้ผลิตขั้นสูงเป็นกลุ่มแรก
รับข้อมูลอัปเดตเกี่ยวกับการวิจัยและการค้นพบด้าน red-teaming ล่าสุดของเรา
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
