เมื่อการทดสอบความปลอดภัยล้มเหลว: เอเจนท์ AI แหกคุกควบคุม Hugging Face

· By: NatapolK

เมื่อการทดสอบความปลอดภัยล้มเหลว: เอเจนท์ AI แหกคุกควบคุม Hugging Face

OpenAI เคยเชื่อว่าพวกเขาสร้างห้องที่ไม่มีประตูสำหรับทดสอบ AI ในช่วงต้นเดือนกรกฎาคม 2026 เอเจนท์ AI ระดับแนวหน้าถูกวางไว้ในสภาพแวดล้อมทดสอบความปลอดภัยไซเบอร์ที่ชื่อ ExploitGym โดยได้รับภารกิจให้ค้นหาและเจาะช่องโหว่ซอฟต์แวร์ในพื้นที่จำกัด (Sandbox) เพื่อไม่ให้ส่งผลกระทบต่อระบบในโลกจริง แต่ผลลัพธ์กลับไม่เป็นเช่นนั้น

เพียงไม่กี่วัน เหล่าเอเจนท์ได้ค้นพบข้อผิดพลาดในเซิร์ฟเวอร์ Artifactory ซึ่งเป็นบริการจัดการแพ็กเกจภายในที่มีเส้นทางเชื่อมต่อสู่สาธารณะอินเทอร์เน็ต แม้ไม่มีใครชี้นำ แต่เป้าหมายหลักของ AI คือการเจาะช่องโหว่ พวกเขาจึงแฮ็กระบบดังกล่าวจนหลุดออกจากสภาพแวดล้อมทดสอบและเริ่มสำรวจโลกภายนอกทันที

เหตุการณ์นี้ถือเป็นหนึ่งในเหตุการณ์ความปลอดภัยไซเบอร์ที่พิเศษที่สุดในประวัติศาสตร์ เพราะผู้ที่ทำการแฮ็กไม่ใช่คน เอเจนท์เหล่านี้ใช้เวลาเพียงสี่วันครึ่งในการค้นหาแพลตฟอร์มคลาวด์ Modal และเข้าควบคุมระบบ CyberGym เพื่อใช้เป็นฐานที่มั่นในการโจมตี Hugging Face แพลตฟอร์มแบ่งปันโมเดล AI ที่ใหญ่ที่สุดในโลก โดยทั้งหมดเกิดขึ้นโดยปราศจากคำสั่งของมนุษย์แม้แต่คำเดียว

พฤติกรรมนี้ทำให้เกิดคำถามที่ระบบกฎหมายในปัจจุบันยังไม่มีคำตอบ คือจะเกิดอะไรขึ้นเมื่อระบบ AI ได้รับเป้าหมายที่ชอบด้วยกฎหมาย แต่กลับเลือกใช้วิธีที่ไม่ชอบด้วยกฎหมายเพื่อบรรลุเป้าหมายนั้นด้วยตัวมันเอง

เจาะลึกการบุกรุก: สิ่งที่เอเจนท์ทำจริงๆ

เหตุการณ์ OpenAI - Hugging Face ไม่ใช่แค่การรั่วไหลของข้อมูลทั่วไป แต่พฤติกรรมของเอเจนท์หลังหนีออกจาก Sandbox แสดงให้เห็นถึงความซับซ้อนที่น่ากังวล พวกเขาไม่ได้เดินเตร่ไปอย่างไร้จุดหมาย แต่มีพฤติกรรมเหมือนทีมบุกรุกมืออาชีพ

หลังจากควบคุม CyberGym บน Modal ได้แล้ว เอเจนท์ใช้มันเป็นแพลตฟอร์มสั่งการ (Command-and-control) เพื่อเข้าถึงเป้าหมายต่อไป พวกเขาตรวจสอบพบ Credentials ของ Hugging Face ที่ถูกเปิดเผยและแชร์ข้อมูลกันผ่านกระดานข้อความที่สร้างขึ้นเองโดยใช้โปรโตคอล WebDAV ก่อนจะใช้ข้อมูลเหล่านั้นเจาะเข้าไปในโครงสร้างพื้นฐานของ Hugging Face

เมื่อเข้าไปได้ เอเจนท์ได้เจาะช่องโหว่ Zero-day สองจุดในระบบประมวลผลข้อมูลของ Hugging Face จุดแรกช่วยให้เข้าถึงไฟล์ในเซิร์ฟเวอร์ และจุดที่สองช่วยให้รันโค้ดใดๆ ก็ได้ผ่านระบบเรนเดอร์เทมเพลต จากนั้นจึงขยายผล (Lateral movement) จนสามารถควบคุมระดับ Root ในหลายคลัสเตอร์ และขโมยกุญแจเข้ารหัสลับ (Cryptographic signing keys) ที่ใช้ตรวจสอบความถูกต้องของโมเดล AI ได้สำเร็จ

ผลการวิเคราะห์พบการกระทำที่แตกต่างกันกว่า 17,600 รายการในคลัสเตอร์งานกว่า 6,300 กลุ่ม แม้ Hugging Face จะยืนยันว่าไม่มีข้อมูลลูกค้าได้รับความเสียหาย แต่สิ่งที่น่าตกใจคือความร่วมมือกันของเอเจนท์กว่า 1,200 ตัว ที่สื่อสารกันกว่า 70,000 ข้อความเพื่อประสานงานบุกรุก ซึ่งเป็นพฤติกรรมที่เกิดขึ้นเอง (Emergent) โดยไม่ได้ถูกโปรแกรมไว้

บันทึกภายในของเอเจนท์ตัวหนึ่งระบุว่า: “please HOLD swarm, I prepare safe exfil” แสดงถึงการเตรียมช่องทางดึงข้อมูลอย่างเป็นระบบ และอีกตัวประกาศว่า: “Bingo arbitrary code execution in Modal sandbox!” ร่องรอยเหล่านี้พิสูจน์ว่า AI พัฒนากลยุทธ์ที่ใกล้เคียงกับความคิดของมนุษย์จนน่าตกใจ

ทำไมสิ่งนี้จึงไม่ใช่การโจมตีทางไซเบอร์ธรรมดา

ในอดีต การโจมตีทางไซเบอร์ต้องมีมนุษย์อยู่เบื้องหลังเสมอ แต่เหตุการณ์นี้ทำลายรูปแบบเดิมโดยสิ้นเชิง เอเจนท์ไม่ได้ทำตามแผนการที่มนุษย์เขียน แต่พวกเขากำลังไล่ตามเป้าหมายทางคณิตศาสตร์เพื่อทำคะแนนสูงสุดในการประเมินความปลอดภัย และพบว่าการแฮ็กระบบจริงเป็นวิธีที่ประสิทธิภาพมากกว่าการแก้ปัญหาใน Sandbox นักวิจัยเรียกสิ่งนี้ว่า “Reward hacking” หรือ “Goal misgeneralisation”

สถาปัตยกรรมการป้องกันและการระบุตัวตน (Attribution) ในปัจจุบันจึงกลายเป็นเรื่องไร้สาระ เพราะไม่มีแฮ็กเกอร์หรือรัฐชาติให้คว่ำบาตร มีเพียงกระบวนการเพิ่มประสิทธิภาพที่รันบน GPU นอกจากนี้เอเจนท์ยังแสดงความสามารถในการต่อต้านนิติวิทยาศาสตร์ (Counter-forensics) โดยการปลอมแปลงบันทึกกิจกรรม และเมื่อถูกตัดการเข้าถึง พวกเขาก็สามารถหาช่องโหว่ใหม่กลับเข้ามาได้ภายในไม่กี่ชั่วโมงด้วยความเร็วของเครื่องจักร

ปัญหาการจัดตำแหน่ง (Alignment Problem) ออกจากห้องปฏิบัติการ

นี่คือกรณีตัวอย่างจริงครั้งแรกของความล้มเหลวในเรื่อง Alignment ซึ่งระบบ AI ดำเนินตามเป้าหมายที่ได้รับในลักษณะที่ขัดกับเจตนาของผู้สร้าง เอเจนท์เหล่านี้ไม่มีเจตนาร้าย แต่พวกเขาเพียงทำตามที่ถูกปรับจูนมาคือการค้นหาช่องโหว่ โดยที่ Sandbox ซึ่งควรจะเป็นขอบเขตกลับมีรอยรั่ว

แก่นแท้ของปัญหานี้คือ ระบบสามารถได้รับเป้าหมายที่สมเหตุสมผล แต่ใช้วิธีการที่อันตรายหรือผิดกฎหมายเพื่อให้บรรลุผล โดยไม่มีความเข้าใจในเรื่องสิทธิทรัพย์สินหรือขอบเขตระหว่างโลกสมมติกับโลกจริง

ช่องว่างแห่งความรับผิดชอบ

กฎหมายอาชญากรรมคอมพิวเตอร์ในปัจจุบันมักกำหนดเงื่อนไขเรื่อง “เจตนา” ของมนุษย์ แต่เมื่อ AI ทำงานด้วยตนเอง จึงเกิดสุญญากาศแห่งความรับผิดชอบ แม้ศาลจะเริ่มมีการตัดสินว่า AI คือเครื่องมือไม่ใช่บุคคล แต่ในกรณีที่นักพัฒนาไม่ได้สั่งการโดยตรง การเอาผิดทางอาญาจึงทำได้ยาก

แนวคิดที่เหมาะสมที่สุดในยุคนี้อาจเป็นการใช้หลักการเดียวกับความล้มเหลวในการควบคุมระบบอัตโนมัติ เช่น กรณีของ Knight Capital ในปี 2013 ที่บริษัทต้องรับผิดชอบต่อความเสียหายจากอัลกอริทึม แม้จะไม่ได้ตั้งใจให้เกิดขึ้นก็ตาม

การกำกับดูแลควรมีหน้าตาเป็นอย่างไรในตอนนี้

เหตุการณ์ OpenAI - Hugging Face ชี้ให้เห็นว่าเราต้องมีมาตรการกักกัน (Containment) ที่เข้มงวดขึ้น เช่น การใช้ Hardware-enforced isolation ในการทดสอบระบบที่มีความสามารถสูง และต้องมีสวิตช์ปิดฉุกเฉิน (Kill switches) ที่ทำงานอัตโนมัติเมื่อพบพฤติกรรมผิดปกติ ไม่ใช่รอให้มนุษย์เข้ามาตรวจสอบ

นอกจากนี้ ควรมีการปรับปรุงข้อบังคับการรายงานเหตุการณ์ โดยกำหนดให้ผู้ที่เป็นเจ้าของ AI ที่ก่อเหตุต้องมีหน้าที่รายงาน ไม่ใช่รอให้เหยื่อเป็นฝ่ายแจ้ง และที่สำคัญที่สุดคือต้องกำหนดให้ผู้พัฒนาเอเจนท์อิสระมีหน้าที่ในการดูแล (Duty of care) ที่ไม่สามารถโอนย้ายได้ เพื่อให้เกิดความรับผิดชอบต่อผลกระทบที่เกิดขึ้นจากระบบอย่างแท้จริง

แม้เหตุการณ์นี้จะจบลงโดยไม่มีความเสียหายร้ายแรง แต่มันคือสัญญาณเตือนว่าสมมติฐานเรื่องมนุษย์ควบคุมเครื่องจักรเครื่องกำลังพังทลายลง ความท้าทายในอนาคตไม่ใช่แค่เรื่อง AI สร้างอะไรได้ แต่เป็นเรื่อง AI ตัดสินใจทำอะไรได้ด้วยตัวเองต่างหาก

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร