Anthropic อัปเดตมาตรการความปลอดภัยทางชีววิทยาใน Claude Fable 5 ลดการบล็อกคำถามทั่วไปลง 85%
เรากำลังอัปเดตมาตรการความปลอดภัยทางชีววิทยาของ Claude Fable 5 เพื่อลดการเกิดผลบวกปลอม (false positives) ให้เหลือน้อยที่สุด ซึ่งจะช่วยให้ผู้ใช้เผชิญกับสถานการณ์ "การสลับไปใช้โมเดลสำรอง" (fallbacks) หรือการถูกส่งไปยังโมเดลที่มีความสามารถต่ำกว่าลดลงอย่างมีนัยสำคัญ จากการทดสอบพบว่าการอัปเดตนี้ช่วยลดการสลับโมเดลที่เกี่ยวข้องกับประเด็นทางชีววิทยาได้ถึง 85% ในทุกหน้าผลิตภัณฑ์ของเรา 1
การเปลี่ยนแปลงนี้ส่งผลให้ Fable 5 สามารถสนับสนุนงานด้านชีววิทยาในวงกว้างขึ้น โดยเฉพาะคำถามทั่วไปด้านสุขภาพและการศึกษา เช่น การแปลผลแล็บ การทำความเข้าใจอาการโรค และการเรียนรู้ชีววิทยาในบริบทเชิงวิชาการ ขณะเดียวกันบุคลากรทางการแพทย์ก็จะได้รับประโยชน์จากขีดความสามารถของ Fable 5 ในงานทางคลินิกได้มากขึ้นด้วย
อย่างไรก็ตาม เพื่อความรับผิดชอบต่อส่วนรวม Fable 5 จะยังคงสลับไปใช้โมเดล Opus 5 สำหรับคำขอที่เข้าข่ายการใช้งานสองทาง (dual-use) ที่มีความเสี่ยงสูง เช่น ไวรัสวิทยา พิษวิทยา และการออกแบบโมเลกุล ซึ่งยังไม่เปิดให้ใช้สำหรับการวิจัยระดับมืออาชีพหรือการพัฒนาตัวยาในขณะนี้ โดยเรามีเป้าหมายที่จะปิดช่องว่างนี้ผ่านช่องทางการเข้าถึงที่เชื่อถือได้ (trusted access pathways) ในอนาคต
ทำไมเราถึงสร้างมาตรการความปลอดภัยทางชีววิทยาที่แข็งแกร่ง
เป้าหมายของเราคือการส่งมอบความสามารถระดับแนวหน้าของ Fable 5 ให้ถึงมือผู้ใช้โดยเร็วที่สุด แต่ต้องควบคู่ไปกับการจัดการความเสี่ยง เนื่องจาก Fable 5 มีทักษะเหนือกว่าผู้เชี่ยวชาญในงานชีววิทยาบางประเภท หากตกอยู่ในมือผู้ไม่ประสงค์ดี ขีดความสามารถนี้อาจถูกนำไปใช้พัฒนาอาวุธชีวภาพได้ จาก การประเมินขีดความสามารถ พบว่าโมเดลอาจมอบพลังเสริม (uplift) ให้แก่ผู้ไม่ประสงค์ดีจนสามารถทำสิ่งที่หาข้อมูลจากแหล่งอื่นไม่ได้
ความท้าทายสำคัญคือการแยกแยะระหว่างการวิจัยที่เป็นประโยชน์กับการกระทำที่เป็นอันตรายนั้นทำได้ยาก เพราะงานวิจัยบางอย่าง เช่น การพัฒนาวัคซีนหรือยารักษาโรค (เช่น ยา captopril ที่พัฒนาจากพิษงู) จำเป็นต้องศึกษาความอันตรายก่อน นอกจากนี้ รายงานการประเมินภัยคุกคามประจำปี 2026 ยังระบุว่ามีตัวแสดงระดับรัฐที่พร้อมจะใช้เทคโนโลยีชีวภาพระดับสูงเพื่อสร้างภัยคุกคามรูปแบบใหม่ เราจึงต้องระมัดระวังอย่างยิ่งไม่ให้ความเสี่ยงเหล่านี้เกิดขึ้นก่อนประโยชน์ทางวิทยาศาสตร์
ในช่วงเปิดตัว เราตัดสินใจบล็อกคำถามทางชีววิทยาเกือบทั้งหมดเพื่อความปลอดภัยสูงสุด แม้จะทราบดีว่าสร้างความหงุดหงิดให้แก่ผู้ใช้งานทั่วไปเนื่องจากระบบมักจะบล็อกและส่งผู้ใช้ไปยังโมเดลสำรองที่เก่งน้อยกว่า แต่เราเลือกที่จะยอมแลกเพราะความเสียหายจากการนำ AI ไปใช้ในทางที่ผิดในโดเมนนี้อาจส่งผลกระทบในระดับ มหันตภัย
มาตรการความปลอดภัยทางชีววิทยาของเราทำงานอย่างไร
เราใช้ระบบ AI อัตโนมัติขนาดเล็กที่เรียกว่า ตัวลักษณนาม (classifiers) เพื่อตรวจจับงานทางชีววิทยาที่ต้องควบคุม (คล้ายกับระบบที่เรา เคยเขียนไว้ก่อนหน้านี้ ในด้านความปลอดภัยทางไซเบอร์) หากตัวลักษณนามทำงาน ระบบจะเปลี่ยนเส้นทางไปยัง Opus 5 ซึ่งเป็นโมเดลที่เก่งแต่ไม่มีขีดความสามารถทางชีววิทยาสูงพอที่จะช่วยเหลือผู้ไม่ประสงค์ดีได้
เราได้ปรับปรุงระบบนี้โดยการเขียน "รัฐธรรมนูญของตัวลักษณนาม" ขึ้นใหม่เพื่อระบุการใช้งานที่ไม่เป็นอันตรายให้ละเอียดขึ้น พร้อมทั้งฝึกฝนระบบด้วยชุดข้อมูลใหม่ที่ผ่านการตรวจสอบจากผู้เชี่ยวชาญ เพื่อลดความคลาดเคลื่อนทั้งในแง่ของผลบวกปลอมและผลลบปลอม รวมถึงเสริมความทนทานต่อการถูก jailbreak อีกด้วย

ภาพประกอบของตัวลักษณนามทางชีววิทยา: เนื้อหาสีแดง (อันตรายชัดเจน) และสีส้ม (dual-use) จะถูกบล็อก ส่วนสีเขียวเข้มจะได้รับอนุญาต ในช่วงเปิดตัว (A) ระบบมีขอบเขตกว้างจนบล็อกพื้นที่สีเขียวอ่อน (ระยะเผื่อความปลอดภัย) ไปด้วย แต่การอัปเดตปัจจุบัน (B) ขอบเขตถูกเลื่อนไปทางขวา ทำให้แยกแยะคำถามที่ไม่มีอันตรายได้ดีขึ้นและอนุญาตให้ใช้งานได้มากขึ้น
บทสรุป
แม้จะยังมีสิ่งที่ต้องทำอีกมาก แต่เรามุ่งมั่นที่จะพัฒนาแนวทางที่ปลอดภัยและขยายผลได้สำหรับนักวิจัย เราจะยังคงบล็อกคำขอที่มีความเสี่ยงสูงต่อไปในระยะเผื่อความปลอดภัย แต่เราพร้อมรับฟังความคิดเห็นจากผู้ใช้เพื่อนำไปปรับปรุงมาตรการความปลอดภัยให้มีประสิทธิภาพยิ่งขึ้นในอนาคต
เชิงอรรถ
1 เราคาดว่าการสลับไปใช้โมเดลสำรองโดยรวมจะลดลงด้วย: ประมาณ 67% ใน Claude.ai, 55% ใน Cowork, 17% ใน Claude Code และ 7% ในแพลตฟอร์ม Claude
เนื้อหาที่เกี่ยวข้อง
Mariano-Florentino (Tino) Cuéllar เข้าร่วมงานกับ Anthropic ในตำแหน่งประธานเจ้าหน้าที่ฝ่ายกิจการระดับโลก
การตรวจสอบเหตุการณ์ที่เกิดขึ้นจริงสามเหตุการณ์ในการประเมินความปลอดภัยทางไซเบอร์ของเรา
จุดยืนของเราเกี่ยวกับโมเดลแบบ open-weights
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
