Microsoft เปิดตัว Microsoft-Decision-1 โมเดล AI เน้นการตัดสินใจแม่นยำสูง

Microsoft เปิดตัว Microsoft-Decision-1 โมเดลการตัดสินใจที่ออกแบบมาเพื่อรองรับงานด้านการกำหนดเส้นทาง (routing), การจำแนกประเภท (classification), การตรวจสอบ และการควบคุมเอเจนต์โดยเฉพาะ โดยโมเดลนี้จะส่งคืนค่าความน่าจะเป็นที่ได้รับการปรับจูน (calibrated probability) ของแต่ละตัวเลือกแทนการสร้างข้อความแบบทั่วไป
ตัวโมเดลได้รับการ post-trained จาก Qwen3.5-9B ของ Alibaba และพร้อมเปิดให้ใช้งานแล้วผ่าน Microsoft Foundry และ OpenRouter
TL;DR
- ขนาด: พัฒนาบนพื้นฐาน Qwen3.5-9B โดยมี context window ขนาด 32,768 token
- การใช้งาน: รองรับเฉพาะ Hosted API (Microsoft Foundry และ OpenRouter) ไม่มีเวอร์ชัน open weights หรือ quantization
- ประสิทธิภาพ: ทำความแม่นยำเฉลี่ยสูงสุดจากการทดสอบ 36 benchmark ของ Microsoft โดยมีค่าลาเทนซี p50 เพียง 85 ms
- ข้อดี: ความแม่นยำเฉลี่ย 83.5% นำหน้า Quyet-1.0-Large (81.9%) ราคาประหยัดเพียง $0.042 ต่อล้าน input token และฟรีค่า output
- ข้อด้อย: การปรับจูนค่าความเชื่อมั่นอยู่ที่ 92.2 เป็นรอง Quyet-1.0-Large ที่ทำได้ 93.1 และไม่รองรับการอธิบายเหตุผลหรือข้อมูลภาพ
- บทสรุป: เป็นระบบ closed weights ที่เน้นความรวดเร็วและราคาถูกสำหรับการตัดสินใจเชิงความน่าจะเป็น แต่ผลทดสอบทั้งหมดยังมาจากทางผู้พัฒนาเอง
โมเดลการตัดสินใจ (decision model) คืออะไร?
โมเดลการตัดสินใจจะทำหน้าที่อ่านข้อมูลนำเข้าและให้คะแนนชุดตัวเลือกที่กำหนดไว้ (closed set) โดยไม่เน้นการเขียนร้อยแก้ว Microsoft วางตำแหน่งโมเดลการตัดสินใจให้เป็นหมวดหมู่ AI ใหม่ เพื่อสร้างผลลัพธ์ที่ระบบซอฟต์แวร์สามารถนำไปสั่งการต่อได้ทันที
Microsoft-Decision-1 ทำงานอย่างไร?
Microsoft ได้นำโมเดล post-trained Qwen3.5-9B มาปรับจูนสำหรับการให้คะแนนการตัดสินใจแบบรอบเดียว (single-pass decision scoring) เมื่อได้รับสถานการณ์และตัวเลือก โมเดลจะส่งคืนค่าความน่าจะเป็นในการเรียกใช้งานเพียงครั้งเดียว ทั้งนี้ Microsoft มีแผนจะเปลี่ยนฐานของโมเดลรุ่นอนาคตไปใช้ MAI และ OpenAI ต่อไป
ข้อมูลใน Foundry ระบุรูปแบบการใช้งานที่รองรับดังนี้:
- คำถามประเภท ใช่/ไม่ใช่, ปรนัย, การจำแนกประเภท และเกณฑ์การให้คะแนน (rubric)
- การให้เกรดคำตอบ AI และการเสนอการดำเนินการของเอเจนต์
- การตรวจสอบความถูกต้องของข้อมูล (groundedness checks) ร่วมกับหลักฐานที่กำหนด
- ตัวเลือกสำหรับการสละสิทธิ์ เช่น "ไม่สามารถระบุได้"
กระบวนการฝึกฝนใช้ชุดข้อมูลสาธารณะภายใต้ Open Data ของ Microsoft ร่วมกับข้อมูลสังเคราะห์ (synthetic data) โดยผลลัพธ์จะออกมาเป็นรูปแบบ JSON ซึ่ง OpenRouter ระบุว่า จะมีการอัปเดตน้ำหนักโมเดล (weights) อย่างต่อเนื่องในขณะที่โครงสร้าง API ยังคงเดิม
ความเร็วและความแม่นยำในระดับแถวหน้า
Microsoft ได้เปรียบเทียบ 9 ระบบผ่าน 36 benchmark พร้อมคำถามกว่า 1.4 แสนข้อ ผลปรากฏว่า Microsoft-Decision-1 นำหน้าด้วยความแม่นยำเฉลี่ย 83.5%
ด้านความเร็วมีค่าลาเทนซี p50 อยู่ที่ 85 ms ซึ่ง เร็วกว่า Quyet-1.0-Large ถึง 4.5 เท่า และเร็วกว่า GPT-6 Sol ถึง 35 เท่า นอกจากนี้ยังมีความแข็งแกร่ง (robustness) สูง โดยเมื่อลองสลับลำดับตัวเลือกหรือถอดความใหม่ โมเดล เปลี่ยนคำตัดสินใจเพียง 1.3% เท่านั้น
สำหรับการทดสอบภายใน Microsoft รายงานผลลัพธ์ที่น่าสนใจดังนี้:
- Xbox Research: จัดเรียงคำติชมเร็วกว่าเดิม 14 เท่า และถูกลง 200 เท่าเมื่อเทียบกับ GPT-6 Sol
- Copilot Quality Control: ประสิทธิภาพทัดเทียม GPT5.6 Luna แต่เร็วกว่าถึง 100 เท่า
- Microsoft Discovery: มีความสม่ำเสมอมากกว่าการใช้ LLM ทั่วไปถึง 46 เท่า
ตารางเปรียบเทียบกับโมเดลคู่แข่ง
| คุณสมบัติ | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| ผู้พัฒนา | Microsoft | Chinh Nguyen | H2O.ai | OpenAI |
| โมเดลพื้นฐาน | Qwen3.5-9B | Gemma-4-31B-it | Qwen3.5-4B | ไม่เปิดเผย |
| Context / input | 32,768 tokens | 8,000 tokens | 40,960 tokens | ไม่เปิดเผย |
| ความแม่นยำ | 83.5% | 81.9% | 77.2% | 79.4% |
| ลาเทนซีมัธยฐาน | 85 ms | 380 ms | 210 ms | 300 ms |
| ราคา (ต่อ 1M input) | $0.042 | โฮสต์เอง | โฮสต์เอง | $0.10 |
หมายเหตุ: ตัวเลขความแม่นยำและลาเทนซีอ้างอิงจากผลการทดสอบของ Microsoft ส่วนคู่แข่งใช้ค่ามัธยฐานจาก JevBench v1.6.1
ประเด็นเรื่องความเท่าเทียมในการวัดผล
การเปรียบเทียบลาเทนซีอาจมีความคลาดเคลื่อน เนื่องจาก Microsoft วัดผลโมเดลตัวเองผ่าน Foundry ขณะที่คู่แข่งใช้ตัวเลขจาก JevBench ซึ่ง model card ของ H2O.ai โต้แย้งว่า JevBench คำนวณเวลาสูงกว่าความเป็นจริง โดย H2O อ้างว่าค่ามัธยฐานจริงของตนอยู่ที่ 29 ms เท่านั้น
ข้อจำกัดที่ควรทราบ
โมเดลนี้มีข้อจำกัดชัดเจนคือ ไม่รองรับการสร้างข้อความร้อยแก้ว, การแชท, หรือการแปลภาษา รวมถึงไม่สามารถรับข้อมูลภาพหรือเสียงได้ และที่สำคัญคือ ห้ามใช้ในการตัดสินใจอัตโนมัติ ในประเด็นที่มีผลกระทบสูง เช่น สินเชื่อ การจ้างงาน หรือการดูแลสุขภาพ โดยต้องมีการกำกับดูแลโดยมนุษย์เสมอ
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
