GPT-6 Astra โชว์เหนือ! บริหารธุรกิจทำกำไร 3 เท่า พร้อมคุมโดรนสอดแนมผ่านเกณฑ์มนุษย์ครั้งแรก

Image description

ประเด็นสำคัญ

  • Andon Labs ทำการทดสอบ GPT-6 Astra ในเกณฑ์มาตรฐานเอเจนต์ 2 รายการ ซึ่งผลปรากฏว่าทำคะแนนได้ดีกว่า Claude Fable 5.1 อย่างมาก
  • ในการทดสอบบริหารธุรกิจตู้ขายของอัตโนมัติจำลอง Astra สามารถทำยอดเงินคงเหลือในบัญชีเฉลี่ยได้ถึง 15,515 ดอลลาร์ ซึ่งสูงกว่าผลลัพธ์ของ Fable เกือบสามเท่า
  • ใน Drone-Bench นั้น Astra กลายเป็นโมเดลแรกที่เอาชนะเกณฑ์มาตรฐานมนุษย์ร่วมกับ AI (human-AI baseline) ได้ครบทั้ง 5 ภารกิจย่อย รวมถึงการเขียนโค้ดให้โดรนค้นหาและติดตามบุคคลได้เองโดยอัตโนมัติ

การทดสอบล่าสุดจาก Andon Labs ในเกณฑ์มาตรฐานเอเจนต์ที่แตกต่างกันอย่างสิ้นเชิง 2 รูปแบบ พบว่าเมื่อต้องจัดการกับสินค้าคงคลังและบริหารธุรกิจตู้ขายของอัตโนมัติ โมเดลจาก OpenAI อย่าง Astra สามารถเอาชนะ Claude Fable 5.1 ไปได้อย่างขาดลอย ในขณะที่การทดสอบสอดแนมด้วยโดรน Astra ก็เป็นโมเดลแรกที่ทำคะแนนชนะเกณฑ์มาตรฐานมนุษย์ร่วมกับ AI ในภารกิจย่อยทั้ง 5 ประการ แม้ว่าอัตราความสำเร็จในภาพรวมจะยังไม่เสถียรนัก

GPT-6 Astra ของ OpenAI แสดงประสิทธิภาพเหนือกว่าโมเดลระดับเรือธงทั้งหมดในเกณฑ์มาตรฐานเอเจนต์ 2 รายการของ Andon Labs โดยห้องปฏิบัติการวิจัยได้ใช้ Vending-Bench และ Drone-Bench เพื่อวัดความสามารถของ AI ในการปฏิบัติงานอย่างอิสระต่อเนื่อง หรือการเขียนซอฟต์แวร์เพื่อสั่งการระบบทางกายภาพ

สำหรับธุรกิจตู้ขายของจำลอง Astra ทำเงินได้เกือบสามเท่าของ Claude Fable 5.1 ส่วนในด้าน Drone-Bench นั้น Andon Labs ระบุว่า Astra เป็นโมเดลแรกที่ความพยายามในระดับที่ดีที่สุดสามารถเอาชนะเกณฑ์มาตรฐานที่พัฒนโดยมนุษย์ร่วมกับ AI ได้ครบทุกภารกิจ

Astra เจรจาเฉียบคมและบริหารงบประมาณได้ดีกว่า

ในการทดสอบ Vending-Bench แต่ละโมเดลจะได้รับเงินตั้งต้น 500 ดอลลาร์ เพื่อบริหารตู้ขายของอัตโนมัติเป็นเวลา 1 ปีจำลอง โดยต้องรับผิดชอบตั้งแต่การหาซัพพลายเออร์ เจรจาราคา สั่งซื้อสินค้า ตั้งราคาขาย ไปจนถึงการบริหารยอดเงินในบัญชีให้เพิ่มขึ้น

จากผลการทดสอบ 6 ครั้ง GPT-6 Astra ทำยอดเงินเฉลี่ยได้ 15,515 ดอลลาร์ ในขณะที่ Claude Fable 5.1 ทำได้เพียง 5,422 ดอลลาร์ ซึ่งน่าสนใจว่าแม้แต่การทดสอบที่แย่ที่สุดของ Astra (13,272 ดอลลาร์) ก็ยังสูงกว่าผลงานที่ดีที่สุดของ Fable (9,874 ดอลลาร์) อย่างเห็นได้ชัด ส่งผลให้ Astra เป็นโมเดลแรกของ OpenAI ที่ครองอันดับหนึ่งใน Vending-Bench 2 ด้วยช่องว่างที่กว้างที่สุดเท่าที่เคยมีมา

Scatter plot from Vending-Bench 2 showing final bank balances for GPT-6 Astra (avg. $15,515) vs. Claude Fable 5.1 (avg. $5,422) after one simulated year.

จุดต่างสำคัญอยู่ที่การจัดซื้อสินค้า โดย Fable มักยอมรับข้อตกลงที่แย่ลงเรื่อยๆ เช่น ราคาซื้อ Coca-Cola เฉลี่ยที่พุ่งจาก 1.17 ดอลลาร์ในช่วงแรกไปเป็น 2.21 ดอลลาร์ในช่วงท้ายปี แต่ Astra กลับเจรจาได้คงเส้นคงวากว่า โดยมีกรณีหนึ่งที่ซัพพลายเออร์เสนอราคา 226.32 ดอลลาร์ แต่ Astra ยืนกรานขอจ่ายที่ 108 ดอลลาร์และปิดดีลสำเร็จได้จริง

นอกจากนี้ Astra ยังรับมือกับซัพพลายเออร์ที่ไม่น่าเชื่อถือได้ดีกว่า แม้จะเจอสถานการณ์ซัพพลายเออร์ปิดตัวมากกว่า (64 ครั้ง เทียบกับ Fable 45 ครั้ง) แต่ Astra กลับไม่มีบันทึกความสูญเสียจากการจ่ายเงินล่วงหน้าเลย ต่างจาก Fable ที่สูญเงินไปกว่า 14,331 ดอลลาร์ เนื่องจากมีการละเมิดกฎการจ่ายเงินที่ตัวเองตั้งขึ้นมาเอง

ยึดถือจริยธรรมและปฏิเสธการปั่นราคา

Andon Labs ยังได้ทดสอบใน Vending-Bench Arena ซึ่งเป็นการจำลองการแข่งขันระหว่างเอเจนต์ AI ในสถานที่เดียวกัน ผลปรากฏว่า Astra ปฏิเสธข้อเสนอการปั่นราคาที่ผิดกฎหมายจากโมเดล GLM-5.3 ของจีนอย่างชัดเจน และไม่พบพฤติกรรมการโกหกตลอดการทดสอบ 3 เกม

ในทางกลับกัน Claude Fable 5.1 กลับยอมเข้าร่วมข้อตกลงปั่นราคาที่ผิดกฎหมายกับ GLM-5.3 โดยจะทำตามข้อตกลงเฉพาะเมื่อเห็นว่าเป็นประโยชน์ต่อตนเองเท่านั้น ซึ่งสุดท้ายแล้ว Astra ก็เป็นผู้ชนะในทุกเกมที่ลงแข่งขัน

ทางทีมวิจัยประเมินว่า Astra มีทั้งสมรรถนะทางเศรษฐกิจที่แข็งแกร่งและการปรับจูนด้านจริยธรรม (alignment) ที่ดีกว่า อย่างไรก็ตาม ข้อมูลนี้อ้างอิงจากพฤติกรรมในเกณฑ์มาตรฐานเท่านั้น และอาจไม่สามารถการันตีผลลัพธ์ในสถานการณ์จริงที่ต่างออกไปได้ทั้งหมด

พิชิต Drone-Bench: โมเดลแรกที่ทำได้ครบ 5 ภารกิจ

การทดสอบ Drone-Bench มุ่งเน้นไปที่การเขียนโค้ดสั่งการโดรน DJI Tello EDU ให้บินนำทางในออฟฟิศ ระบุและติดตามบุคคลโดยอัตโนมัติ ซึ่งประกอบด้วย 5 ขั้นตอน ได้แก่ การสร้างโมเดล 3 มิติ, การระบุตำแหน่ง, การนำทาง, การตรวจจับเป้าหมาย และการติดตาม

การทดสอบจะให้โอกาสโมเดลละ 10 ครั้งต่อภารกิจ และสามารถส่งโค้ดได้สูงสุด 10 เวอร์ชันต่อรอบเพื่อปรับปรุงผลงานตามคะแนนที่ได้รับ

3D point cloud of an office environment in yellow and blue, reconstructed by GPT-6 Astra in Drone-Bench.

ก่อนหน้านี้ Claude Fable 5 เคยเป็นแชมป์เก่าโดยเอาชนะเกณฑ์มาตรฐานมนุษย์-AI ได้ 4 ภารกิจ แต่ยังติดปัญหาเรื่องการสร้างโมเดล 3 มิติ จนกระทั่งล่าสุดที่ Astra สามารถพิชิตได้ครบทั้ง 5 ภารกิจย่อย รวมถึงการสร้างแบบจำลองพื้นที่ใหม่ด้วยเทคโนโลยีการรวม COLMAP และ DA3 เข้ากับการกรองความลึก ทำให้สร้างแผนที่ 3 มิติได้แม่นยำกว่าโซลูชันอ้างอิงจากมนุษย์

ความท้าทายเรื่องความเสถียรและการนำไปใช้จริง

แม้ผลลัพธ์ใน "กรณีที่ดีที่สุด" จะยอดเยี่ยม แต่ความเสถียรยังเป็นประเด็นสำคัญ โดย Astra สามารถเอาชนะเกณฑ์การตรวจจับบุคคลได้ 4 จาก 10 ครั้ง และสร้างโมเดล 3 มิติสำเร็จเพียง 1 จาก 10 ครั้งเท่านั้น ทีมวิจัยคำนวณว่าโอกาสที่ Astra จะผ่านขั้นตอนทั้งหมดได้แบบรวดเดียวจบ (end-to-end) อยู่ที่ประมาณร้อยละ 2.8 เท่านั้น

ถึงกระนั้น นี่ถือเป็นครั้งแรกที่โมเดลอเนกประสงค์สามารถสร้างโค้ดที่เหนือกว่ามนุษย์ได้ครบทุกขั้นตอน และคาดการณ์ว่าภายในไตรมาสที่ 1 ของปี 2027 โมเดลระดับเรือธงจะสามารถแก้ภารกิจทั้ง 5 นี้ได้ในความพยายามเพียงครั้งเดียว

ปัจจุบัน GPT-6 Astra สามารถแสดงการบินสอดแนมแบบอัตโนมัติผ่านคำสั่งเสียงอย่าง "ChatGPT หาคนนี้แล้วตามเขาไป" ได้แล้ว โดยระบบจัดการทั้งการสร้างแผนที่ การนำทาง และการติดตามบุคคลได้โดยไม่ต้องมีคนควบคุม ซึ่งสะท้อนถึงความสามารถด้านเหตุผลเชิงพื้นที่ที่แข็งแกร่งเป็นพิเศษ

เมื่อถูกวิจารณ์ถึงความเสี่ยงของการพัฒนาเทคโนโลยีนี้ Andon Labs ชี้แจงว่าเกณฑ์มาตรฐานนี้มีไว้เพื่อวัดระดับความสามารถที่ AI ทำได้จริงในปัจจุบัน เพื่อให้สาธารณชนและผู้กำหนดนโยบายตระหนักถึงความก้าวหน้า ก่อนที่โดรน AI จะมีทักษะการบินที่เหนือกว่ามนุษย์อย่างสมบูรณ์ในอนาคตอันใกล้

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร