AWS เปิดตัว Strands Decider 2B โมเดลการตัดสินใจโอเพนซอร์สสุดเร็ว

AWS Strands Labs เปิดตัว Strands Decider 2B โมเดลการตัดสินใจแบบ Open Source ที่เน้นประสิทธิภาพการทำงานโดยไม่มีการสร้างข้อความ (non-generative) โมเดลนี้จะวิเคราะห์สถานะและคำถามที่ระบุประเภทไว้ เพื่อคืนค่าเป็นตัวเลือก ความน่าจะเป็นแบบ ใช่/ไม่ใช่ หรือคะแนนพร้อมค่าความมั่นใจที่ผ่านการปรับจูน (calibrated confidence)
ตัวโมเดลมาพร้อมพารามิเตอร์ขนาด 1.9 พันล้านตัว รองรับการทำงานในเครื่อง (local) ได้หลากหลายแพลตฟอร์ม ทั้งบน CPU, GPU ระดับผู้บริโภคทั่วไป รวมถึง Apple Silicon Mac ช่วยให้การประมวลผลข้อมูลรวดเร็วและเป็นส่วนตัวมากขึ้น
สามารถนำไปใช้งานจริงได้หรือไม่? คำตอบคือได้ทันทีสำหรับการใช้งานในเครื่องหรือการโฮสต์ด้วยตนเอง (self-hosted) โดย Weights ของโมเดลถูกปล่อยบน Hugging Face ภายใต้ลิขสิทธิ์ Apache-2.0 และสามารถติดตั้งได้ง่ายผ่านคำสั่ง pip install strands-decider
ตัวระบบรองรับทั้ง CLI และ HTTP server โดยเซิร์ฟเวอร์ที่แถมมาจะผูกติดกับ IP 127.0.0.1 โดยไม่มีการยืนยันตัวตน ดังนั้นหากต้องการนำไปใช้ในระดับ Production ผู้ใช้งานจำเป็นต้องเพิ่มเลเยอร์ความปลอดภัยเอง เนื่องจากปัจจุบันยังไม่มีผู้ให้บริการ Inference รายใหญ่รายใดเปิดให้ใช้งานแบบ Hosted
สิ่งที่โมเดลการตัดสินใจทำ
โมเดลการตัดสินใจหรือที่เรียกกันว่าโมเดล System One เริ่มกลายเป็นหมวดหมู่ใหม่ที่น่าจับตาหลังจาก TypeSafe AI เปิดตัว Jev เมื่อเดือนที่แล้ว ซึ่งแตกต่างจาก LLM ทั่วไปที่สร้างผลลัพธ์ได้ไม่จำกัด เพราะโมเดลนี้จะทำหน้าที่เพียงเลือกจากตัวเลือกที่มี หรือให้คะแนนตามเกณฑ์ที่กำหนดเท่านั้น
Strands Decider รองรับคำถาม 3 รูปแบบหลัก:
- choice: เลือก 1 คำตอบจากตัวเลือก N ข้อ
- noul: ให้ความน่าจะเป็นแบบ ใช่/ไม่ใช่ ในช่วง 0 ถึง 1
- score: ให้คะแนนตามเกณฑ์ที่กำหนดไว้
ทุกคำตอบจะมาพร้อมกับค่าความมั่นใจเสมอ อย่างไรก็ตาม ทีมพัฒนาเน้นย้ำว่าโมเดลนี้มีประสิทธิภาพด้อยกว่าโมเดลการให้เหตุผล (Reasoning models) ในโจทย์ที่ซับซ้อน และไม่เหมาะสำหรับงานเขียนโค้ด การสนทนา หรือการสรุปเนื้อหา
สถาปัตยกรรม: LLM ที่ถูกตัดส่วนปากออก
ทีมงานพัฒนาต่อยอดจาก Qwen3.5-2B-Base โดยทำการตัดส่วน Language-modelling head ออก แล้วแทนที่ด้วย Pointer head ขนาดเล็กที่มีพารามิเตอร์เพียง 1 ล้านตัว เพื่อเปรียบเทียบสถานะซ่อนเร้น (hidden state) ที่ตำแหน่ง <answer> กับสถานะของ Token สุดท้ายในแต่ละตัวเลือก
กระบวนการนี้ทำให้สามารถประมวลผลได้ในรอบเดียว (one forward pass) โดยไม่ต้องผ่านลูปการถอดรหัส (decoding loop) ที่กินเวลา ส่วนโครงสร้างหลัก (torso) ใช้เทคนิค LoRA แบบ rank-16 และส่วน Head ทำงานในรูปแบบ fp32 ซึ่งช่วยให้การถามคำถามหลายข้อเกี่ยวกับข้อความเดิมมีต้นทุนต่ำลง เพราะสถานะจะถูกอ่านเพียงครั้งเดียวเท่านั้น
เกณฑ์มาตรฐานและความหน่วง
จากการทดสอบบนชุดข้อมูลสาธารณะ JevBench ซึ่งเป็นมาตรฐานภายนอกสำหรับโมเดลระดับนี้ พบว่าเวอร์ชัน v19 ทำผลงานได้น่าประทับใจ:
- ความแม่นยำรวม JevBench v1: 0.723 (ผ่าน 167 จาก 231 งาน)
- ความหน่วง (Latency) บน RTX 3090: ค่ามัธยฐานเพียง 115 ms
- ความหน่วงบน M3 Pro: ค่ามัธยฐาน 153 ms สำหรับข้อความไม่เกิน 300 token
ในตารางคะแนนล่าสุด v19 อยู่ในอันดับที่ 3 จาก 33 โมเดลในระดับ 2B และขึ้นเป็นอันดับ 1 หากวัดเฉพาะโมเดลที่ไม่เกิน 2B โดยจุดเด่นสำคัญคือการปรับจูนค่าความมั่นใจ (Calibration) ซึ่งหากโมเดลระบุค่าความมั่นใจที่ 0.9 ขึ้นไป จะมีความถูกต้องแม่นยำสูงถึง 95%
การเปรียบเทียบ
| คุณสมบัติ | Strands Decider 2B (v19) | Jev 1.13.0 | decider-2b | Decision 2B |
|---|---|---|---|---|
| ผู้พัฒนา | Strands Agents (AWS) | TypeSafe AI | Mapika | FlyMy.AI |
| การเข้าถึง | Open weights, Apache-2.0 | API แบบปิด (hosted) | Open code หรือ weights | Open code หรือ weights |
| โมเดลพื้นฐาน | Qwen3.5-2B-Base + LoRA + pointer head | ไม่เปิดเผย | Qwen3.5-2B-Base + trained readout | MiniCPM5-2B + LoRA + pointer head |
| ขนาด | 1.9B | ไม่เปิดเผย | 1.9B | 2.5B dense |
| การโฮสต์เอง | ใช่ | ไม่ | ใช่ | ใช่ |
| เผยแพร่ข้อมูลครบถ้วน | ใช่ | ไม่ | ไม่ได้รับการยืนยัน | ไม่ได้รับการยืนยัน |
| ความแม่นยำ JevBench | 0.723 | ไม่อยู่ในตาราง | 0.710 | 0.753 |
| ความหน่วงที่รายงาน | มัธยฐาน 115 ms (RTX 3090) | 70 - 500 ms | ไม่ได้เปรียบเทียบ | ไม่ได้เปรียบเทียบ |
แหล่งข้อมูล: การเปรียบเทียบ JevBench ของ Strands, Benchmark Heaven JevBench, หน้าผลิตภัณฑ์ Jev
กรณีการใช้งานและตัวอย่าง guardrail
โมเดลนี้ถูกนำไปใช้จริงในงานหลายด้าน เช่น Model Routing, การเลือกเครื่องมือ, และการทำ Guardrails เพื่อความปลอดภัย ตัวอย่างใน repo แสดงการใช้ควบคุมเครื่องมือพยากรณ์อากาศ โดยโมเดลจะตรวจสอบอาร์กิวเมนต์ว่าตรงกับที่ผู้ใช้ระบุหรือไม่ก่อนที่จะทำการเรียกใช้เครื่องมือจริง
นอกจากนี้ยังสามารถนำไปใช้ในงานคัดกรอง (Triage) เช่น การแยกแยะข้อความแจ้งปัญหาลูกค้าประโยคว่า "Help! My payouts have been failing for 3 days!" โมเดลสามารถระบุได้ทันทีว่าเป็นเรื่อง billing ด้วยค่าความมั่นใจ 0.768 ซึ่งช่วยลดภาระของ LLM ตัวใหญ่ในการจัดการงานซ้ำๆ เหล่านี้
ประเด็นสำคัญ
- Strands Decider 2B มุ่งเน้นการคืนค่าตัวเลือกและคะแนนโดยไม่มีการสร้างข้อความ
- ปรับแต่งจาก Qwen3.5-2B โดยใช้ Pointer head เพื่อความรวดเร็ว
- ทำความหน่วงมัธยฐานได้ 115 ms บน RTX 3090
- เปิดเผย Weights, โค้ด และสูตรการฝึกแบบ Apache-2.0 ทั้งหมด
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
