Microsoft เปิดตัว Microsoft-Decision-1 โมเดล AI เน้นการตัดสินใจแม่นยำสูง

· By: AttapolK

Microsoft เปิดตัว Microsoft-Decision-1 โมเดล AI เน้นการตัดสินใจแม่นยำสูง

Microsoft เปิดตัว Microsoft-Decision-1 โมเดลการตัดสินใจที่ออกแบบมาเพื่อรองรับงานด้านการกำหนดเส้นทาง (routing), การจำแนกประเภท (classification), การตรวจสอบ และการควบคุมเอเจนต์โดยเฉพาะ โดยโมเดลนี้จะส่งคืนค่าความน่าจะเป็นที่ได้รับการปรับจูน (calibrated probability) ของแต่ละตัวเลือกแทนการสร้างข้อความแบบทั่วไป

ตัวโมเดลได้รับการ post-trained จาก Qwen3.5-9B ของ Alibaba และพร้อมเปิดให้ใช้งานแล้วผ่าน Microsoft Foundry และ OpenRouter

TL;DR

  • ขนาด: พัฒนาบนพื้นฐาน Qwen3.5-9B โดยมี context window ขนาด 32,768 token
  • การใช้งาน: รองรับเฉพาะ Hosted API (Microsoft Foundry และ OpenRouter) ไม่มีเวอร์ชัน open weights หรือ quantization
  • ประสิทธิภาพ: ทำความแม่นยำเฉลี่ยสูงสุดจากการทดสอบ 36 benchmark ของ Microsoft โดยมีค่าลาเทนซี p50 เพียง 85 ms
  • ข้อดี: ความแม่นยำเฉลี่ย 83.5% นำหน้า Quyet-1.0-Large (81.9%) ราคาประหยัดเพียง $0.042 ต่อล้าน input token และฟรีค่า output
  • ข้อด้อย: การปรับจูนค่าความเชื่อมั่นอยู่ที่ 92.2 เป็นรอง Quyet-1.0-Large ที่ทำได้ 93.1 และไม่รองรับการอธิบายเหตุผลหรือข้อมูลภาพ
  • บทสรุป: เป็นระบบ closed weights ที่เน้นความรวดเร็วและราคาถูกสำหรับการตัดสินใจเชิงความน่าจะเป็น แต่ผลทดสอบทั้งหมดยังมาจากทางผู้พัฒนาเอง

โมเดลการตัดสินใจ (decision model) คืออะไร?

โมเดลการตัดสินใจจะทำหน้าที่อ่านข้อมูลนำเข้าและให้คะแนนชุดตัวเลือกที่กำหนดไว้ (closed set) โดยไม่เน้นการเขียนร้อยแก้ว Microsoft วางตำแหน่งโมเดลการตัดสินใจให้เป็นหมวดหมู่ AI ใหม่ เพื่อสร้างผลลัพธ์ที่ระบบซอฟต์แวร์สามารถนำไปสั่งการต่อได้ทันที

Microsoft-Decision-1 ทำงานอย่างไร?

Microsoft ได้นำโมเดล post-trained Qwen3.5-9B มาปรับจูนสำหรับการให้คะแนนการตัดสินใจแบบรอบเดียว (single-pass decision scoring) เมื่อได้รับสถานการณ์และตัวเลือก โมเดลจะส่งคืนค่าความน่าจะเป็นในการเรียกใช้งานเพียงครั้งเดียว ทั้งนี้ Microsoft มีแผนจะเปลี่ยนฐานของโมเดลรุ่นอนาคตไปใช้ MAI และ OpenAI ต่อไป

ข้อมูลใน Foundry ระบุรูปแบบการใช้งานที่รองรับดังนี้:

  • คำถามประเภท ใช่/ไม่ใช่, ปรนัย, การจำแนกประเภท และเกณฑ์การให้คะแนน (rubric)
  • การให้เกรดคำตอบ AI และการเสนอการดำเนินการของเอเจนต์
  • การตรวจสอบความถูกต้องของข้อมูล (groundedness checks) ร่วมกับหลักฐานที่กำหนด
  • ตัวเลือกสำหรับการสละสิทธิ์ เช่น "ไม่สามารถระบุได้"

กระบวนการฝึกฝนใช้ชุดข้อมูลสาธารณะภายใต้ Open Data ของ Microsoft ร่วมกับข้อมูลสังเคราะห์ (synthetic data) โดยผลลัพธ์จะออกมาเป็นรูปแบบ JSON ซึ่ง OpenRouter ระบุว่า จะมีการอัปเดตน้ำหนักโมเดล (weights) อย่างต่อเนื่องในขณะที่โครงสร้าง API ยังคงเดิม

ความเร็วและความแม่นยำในระดับแถวหน้า

Microsoft ได้เปรียบเทียบ 9 ระบบผ่าน 36 benchmark พร้อมคำถามกว่า 1.4 แสนข้อ ผลปรากฏว่า Microsoft-Decision-1 นำหน้าด้วยความแม่นยำเฉลี่ย 83.5%

ด้านความเร็วมีค่าลาเทนซี p50 อยู่ที่ 85 ms ซึ่ง เร็วกว่า Quyet-1.0-Large ถึง 4.5 เท่า และเร็วกว่า GPT-6 Sol ถึง 35 เท่า นอกจากนี้ยังมีความแข็งแกร่ง (robustness) สูง โดยเมื่อลองสลับลำดับตัวเลือกหรือถอดความใหม่ โมเดล เปลี่ยนคำตัดสินใจเพียง 1.3% เท่านั้น

สำหรับการทดสอบภายใน Microsoft รายงานผลลัพธ์ที่น่าสนใจดังนี้:

  • Xbox Research: จัดเรียงคำติชมเร็วกว่าเดิม 14 เท่า และถูกลง 200 เท่าเมื่อเทียบกับ GPT-6 Sol
  • Copilot Quality Control: ประสิทธิภาพทัดเทียม GPT5.6 Luna แต่เร็วกว่าถึง 100 เท่า
  • Microsoft Discovery: มีความสม่ำเสมอมากกว่าการใช้ LLM ทั่วไปถึง 46 เท่า

ตารางเปรียบเทียบกับโมเดลคู่แข่ง

คุณสมบัติMicrosoft-Decision-1Quyet-1.0-LargeH2O-Lightning-4BGPT-6 Luna Decisions
ผู้พัฒนาMicrosoftChinh NguyenH2O.aiOpenAI
โมเดลพื้นฐานQwen3.5-9BGemma-4-31B-itQwen3.5-4Bไม่เปิดเผย
Context / input32,768 tokens8,000 tokens40,960 tokensไม่เปิดเผย
ความแม่นยำ83.5%81.9%77.2%79.4%
ลาเทนซีมัธยฐาน85 ms380 ms210 ms300 ms
ราคา (ต่อ 1M input)$0.042โฮสต์เองโฮสต์เอง$0.10

หมายเหตุ: ตัวเลขความแม่นยำและลาเทนซีอ้างอิงจากผลการทดสอบของ Microsoft ส่วนคู่แข่งใช้ค่ามัธยฐานจาก JevBench v1.6.1

ประเด็นเรื่องความเท่าเทียมในการวัดผล

การเปรียบเทียบลาเทนซีอาจมีความคลาดเคลื่อน เนื่องจาก Microsoft วัดผลโมเดลตัวเองผ่าน Foundry ขณะที่คู่แข่งใช้ตัวเลขจาก JevBench ซึ่ง model card ของ H2O.ai โต้แย้งว่า JevBench คำนวณเวลาสูงกว่าความเป็นจริง โดย H2O อ้างว่าค่ามัธยฐานจริงของตนอยู่ที่ 29 ms เท่านั้น

ข้อจำกัดที่ควรทราบ

โมเดลนี้มีข้อจำกัดชัดเจนคือ ไม่รองรับการสร้างข้อความร้อยแก้ว, การแชท, หรือการแปลภาษา รวมถึงไม่สามารถรับข้อมูลภาพหรือเสียงได้ และที่สำคัญคือ ห้ามใช้ในการตัดสินใจอัตโนมัติ ในประเด็นที่มีผลกระทบสูง เช่น สินเชื่อ การจ้างงาน หรือการดูแลสุขภาพ โดยต้องมีการกำกับดูแลโดยมนุษย์เสมอ

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร