AI ปิดฉากมนุษย์ในเกม Stratego ด้วยงบไม่ถึง 8,000 ดอลลาร์

ทีมนักวิจัยจาก Carnegie Mellon, NYU, Stanford และ MIT ร่วมกันพัฒนา AI ที่สามารถเอาชนะผู้เล่น Stratego ที่ประสบความสำเร็จที่สุดในประวัติศาสตร์ได้สำเร็จ โดยใช้ต้นทุนการฝึกฝนระบบไม่ถึง 8,000 ดอลลาร์
ข้อมูลจาก paper published in Nature ระบุว่านักวิจัยได้เปิดตัว "Ataraxos" ซึ่งเป็น AI ตัวแรกที่มีสมรรถนะเหนือมนุษย์ (superhuman performance) ในเกม Stratego โดยในการแข่งขันอย่างเป็นทางการ 20 เกม Ataraxos สามารถเอาชนะ Pim Niemeijer ยอดฝีมือชาวดัตช์ไปได้ถึง 15 เกม แพ้เพียง 1 เกม และเสมอ 4 เกม
Niemeijer ถือเป็นตำนานที่ยังมีลมหายใจของวงการ โดยเป็นเจ้าของแชมป์โลก 4 สมัย และครองอันดับหนึ่งของโลกยาวนานกว่า 600 สัปดาห์ ซึ่ง George Franka ผู้คร่ำหวอดในวงการมาตั้งแต่ปี 1997 ยกย่องว่าเขาคือผู้เล่นที่เก่งที่สุดตลอดกาล การที่ AI เอาชนะเขาได้จึงเป็นหมุดหมายสำคัญของวงการเทคโนโลยี
Stratego เป็นเกมกระดานที่มีความซับซ้อนสูงและเป็นบททดสอบที่ยากสำหรับ AI เนื่องจากเป็นเกมที่มีข้อมูลไม่ครบถ้วน (imperfect information) โดยผู้เล่นต้องวางหมาก 40 ตัวแบบคว่ำหน้า ทำให้มีรูปแบบการจัดวางเป็นไปได้มากกว่า 10^33 แบบ first author Samuel Sokota wrote on X ว่ามูลค่าการเดินหมากในเกมนี้ไม่ได้ขึ้นอยู่กับอนาคตเท่านั้น แต่ยังสัมพันธ์กับสิ่งที่เกิดขึ้นก่อนหน้าและการตัดสินใจในขณะนั้นด้วย

Sokota อธิบายว่าแม้กลยุทธ์จาก AI เล่นโป๊กเกอร์จะพอประยุกต์ใช้ได้ แต่ก็มีข้อจำกัดด้านการคำนวณที่เพิ่มขึ้นมหาศาลตามจำนวนข้อมูลที่ถูกซ่อนอยู่ Stratego จึงเป็นหนึ่งในเกมกระดานเชิงกลยุทธ์หลักเกมสุดท้ายที่มนุษย์ยังคงมีความได้เปรียบเหนือปัญญาประดิษฐ์จนกระทั่งปัจจุบัน
งบประมาณระดับมหาวิทยาลัยเอาชนะสิ่งที่เงินล้านของ DeepMind ทำไม่ได้
ก่อนหน้านี้ Google DeepMind เคยพยายามพิชิตเกมนี้ด้วยระบบ DeepNash ซึ่งใช้โหนด TPU ถึง 1,024 โหนด และเวลาฝึกฝนนานหลายเดือน คิดเป็นมูลค่าปัจจุบันสูงถึง 3 - 4.5 ล้านดอลลาร์ แต่ยังไม่สามารถก้าวข้ามระดับผู้เล่นชั้นนำของโลกได้
ในทางกลับกัน Ataraxos ใช้เพียง Nvidia H100 GPU จำนวน 16 ตัว ฝึกฝนเพียงหนึ่งสัปดาห์ด้วยงบประมาณไม่ถึง 8,000 ดอลลาร์ นักวิจัยระบุว่าระบบนี้ใช้ต้นทุนคำนวณเพียง 1/500 และใช้ข้อมูลการฝึกฝนเพียง 1/100 เมื่อเทียบกับ DeepNash โดยความสำเร็จนี้มาจากการเขียน GPU simulator ขึ้นเองเพื่อให้การสุ่มตัวอย่างมีประสิทธิภาพสูงสุด
แม้ไม่มีการเปรียบเทียบระหว่างสองระบบโดยตรง แต่นักวิจัยระบุว่า DeepMind ปฏิเสธการทดสอบเนื่องจากโค้ด DeepNash ไม่สามารถใช้งานได้แล้ว ทั้งนี้ในการแข่งชิงแชมป์โลกปี 2023 DeepNash เคยพ่ายแพ้ให้กับผู้เล่นระดับท็อปหลายคนรวมถึง Niemeijer ต่างจาก Ataraxos ที่โชว์ฟอร์มเหนือกว่าชัดเจน
การบังคับให้ AI ผสมผสานกลยุทธ์ช่วยไม่ให้มันติดหล่ม
Ataraxos เรียนรู้ผ่านการเล่นกับตัวเอง (Self-play) โดยไม่มีข้อมูลจากมนุษย์ กุญแจสำคัญคือเทคนิค Regularization ที่บังคับให้ AI กระจายการวางหมากแทนการยึดติดกับกลยุทธ์เดิมๆ เนื่องจากใน Stratego การสุ่มและการคาดเดาได้ยากคือหัวใจสำคัญของการเล่นที่แข็งแกร่ง
นอกจากนี้ AI ยังใช้ Belief Network เพื่อทำนายหมากที่ซ่อนอยู่ของคู่ต่อสู้ก่อนการเดินหมากทุกครั้ง เพื่อสร้างสถานะเกมที่เป็นไปได้และจำลองการตัดสินใจล่วงหน้า ซึ่งเป็นขั้นตอนที่งานวิจัยในอดีตมองว่ายากเกินกว่าจะทำได้ในเกมที่มีข้อมูลซ่อนอยู่จำนวนมาก
AI ชนะขาดลอยแม้จะมีข้อเสียเปรียบที่ถูกตั้งไว้
ในการแข่งกับ Niemeijer นักวิจัยกำหนดให้ AI มีข้อเสียเปรียบเชิงโครงสร้างคือมันจะไม่ปรับตัวตามสไตล์ของคู่ต่อสู้ ขณะที่ Niemeijer สามารถวิเคราะห์และปรับตัวเข้าหา AI ได้ตลอดการแข่งขัน แต่อัตราการชนะสุทธิที่ 85% ของ Ataraxos ก็ยังถือเป็นสถิติที่ไม่เคยเกิดขึ้นมาก่อนในระดับมืออาชีพ
ในการสาธิตที่ Stratego World Championship 2025 Ataraxos ยังชนะถึง 38 จาก 40 เกม โดยผู้เล่นระบุว่ามันมีสไตล์การเล่นที่อ่านยาก มีการบลัฟที่เสี่ยงเกินมนุษย์ และดูเหมือนจะ "โชคดี" ในการวางตำแหน่งหมากเสมอ ผู้ที่สนใจสามารถรับชม games against Niemeijer ได้ทางออนไลน์
วิธีการนี้ใช้งานได้ดีไกลกว่าแค่เกม Stratego
ความสำเร็จของ Ataraxos ไม่ได้จำกัดอยู่แค่เกมเดียว แต่นักวิจัยยังนำไปประยุกต์ใช้กับเกมอื่นๆ เช่น Hanabi และเกมไพ่จีน Dou dizhu ซึ่งก็ได้ผลลัพธ์ที่ทำลายสถิติเดิมเช่นกัน
บทสรุปของงานวิจัยชี้ให้เห็นว่า ข้อมูลที่ซ่อนอยู่มหาศาลไม่ใช่พรมแดนที่ AI ข้ามไม่ได้อีกต่อไป ซึ่งจะส่งผลต่อการนำ AI ไปใช้ในสถานการณ์จริงที่มีความซับซ้อน เช่น ตลาดการเงิน การเจรจาต่อรอง หรือแม้แต่ความขัดแย้งทางทหาร โดยทีมงานได้เผยแพร่ code for Ataraxos เป็นโอเพนซอร์สให้ผู้ที่สนใจนำไปศึกษาต่อ
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
