AWS เปิดตัว Strands Decider 2B โมเดลการตัดสินใจโอเพนซอร์สสุดเร็ว

· By: AttapolK

AWS เปิดตัว Strands Decider 2B โมเดลการตัดสินใจโอเพนซอร์สสุดเร็ว

AWS Strands Labs เปิดตัว Strands Decider 2B โมเดลการตัดสินใจแบบ Open Source ที่เน้นประสิทธิภาพการทำงานโดยไม่มีการสร้างข้อความ (non-generative) โมเดลนี้จะวิเคราะห์สถานะและคำถามที่ระบุประเภทไว้ เพื่อคืนค่าเป็นตัวเลือก ความน่าจะเป็นแบบ ใช่/ไม่ใช่ หรือคะแนนพร้อมค่าความมั่นใจที่ผ่านการปรับจูน (calibrated confidence)

ตัวโมเดลมาพร้อมพารามิเตอร์ขนาด 1.9 พันล้านตัว รองรับการทำงานในเครื่อง (local) ได้หลากหลายแพลตฟอร์ม ทั้งบน CPU, GPU ระดับผู้บริโภคทั่วไป รวมถึง Apple Silicon Mac ช่วยให้การประมวลผลข้อมูลรวดเร็วและเป็นส่วนตัวมากขึ้น

สามารถนำไปใช้งานจริงได้หรือไม่? คำตอบคือได้ทันทีสำหรับการใช้งานในเครื่องหรือการโฮสต์ด้วยตนเอง (self-hosted) โดย Weights ของโมเดลถูกปล่อยบน Hugging Face ภายใต้ลิขสิทธิ์ Apache-2.0 และสามารถติดตั้งได้ง่ายผ่านคำสั่ง pip install strands-decider

ตัวระบบรองรับทั้ง CLI และ HTTP server โดยเซิร์ฟเวอร์ที่แถมมาจะผูกติดกับ IP 127.0.0.1 โดยไม่มีการยืนยันตัวตน ดังนั้นหากต้องการนำไปใช้ในระดับ Production ผู้ใช้งานจำเป็นต้องเพิ่มเลเยอร์ความปลอดภัยเอง เนื่องจากปัจจุบันยังไม่มีผู้ให้บริการ Inference รายใหญ่รายใดเปิดให้ใช้งานแบบ Hosted

สิ่งที่โมเดลการตัดสินใจทำ

โมเดลการตัดสินใจหรือที่เรียกกันว่าโมเดล System One เริ่มกลายเป็นหมวดหมู่ใหม่ที่น่าจับตาหลังจาก TypeSafe AI เปิดตัว Jev เมื่อเดือนที่แล้ว ซึ่งแตกต่างจาก LLM ทั่วไปที่สร้างผลลัพธ์ได้ไม่จำกัด เพราะโมเดลนี้จะทำหน้าที่เพียงเลือกจากตัวเลือกที่มี หรือให้คะแนนตามเกณฑ์ที่กำหนดเท่านั้น

Strands Decider รองรับคำถาม 3 รูปแบบหลัก:

  • choice: เลือก 1 คำตอบจากตัวเลือก N ข้อ
  • noul: ให้ความน่าจะเป็นแบบ ใช่/ไม่ใช่ ในช่วง 0 ถึง 1
  • score: ให้คะแนนตามเกณฑ์ที่กำหนดไว้

ทุกคำตอบจะมาพร้อมกับค่าความมั่นใจเสมอ อย่างไรก็ตาม ทีมพัฒนาเน้นย้ำว่าโมเดลนี้มีประสิทธิภาพด้อยกว่าโมเดลการให้เหตุผล (Reasoning models) ในโจทย์ที่ซับซ้อน และไม่เหมาะสำหรับงานเขียนโค้ด การสนทนา หรือการสรุปเนื้อหา

สถาปัตยกรรม: LLM ที่ถูกตัดส่วนปากออก

ทีมงานพัฒนาต่อยอดจาก Qwen3.5-2B-Base โดยทำการตัดส่วน Language-modelling head ออก แล้วแทนที่ด้วย Pointer head ขนาดเล็กที่มีพารามิเตอร์เพียง 1 ล้านตัว เพื่อเปรียบเทียบสถานะซ่อนเร้น (hidden state) ที่ตำแหน่ง <answer> กับสถานะของ Token สุดท้ายในแต่ละตัวเลือก

กระบวนการนี้ทำให้สามารถประมวลผลได้ในรอบเดียว (one forward pass) โดยไม่ต้องผ่านลูปการถอดรหัส (decoding loop) ที่กินเวลา ส่วนโครงสร้างหลัก (torso) ใช้เทคนิค LoRA แบบ rank-16 และส่วน Head ทำงานในรูปแบบ fp32 ซึ่งช่วยให้การถามคำถามหลายข้อเกี่ยวกับข้อความเดิมมีต้นทุนต่ำลง เพราะสถานะจะถูกอ่านเพียงครั้งเดียวเท่านั้น

เกณฑ์มาตรฐานและความหน่วง

จากการทดสอบบนชุดข้อมูลสาธารณะ JevBench ซึ่งเป็นมาตรฐานภายนอกสำหรับโมเดลระดับนี้ พบว่าเวอร์ชัน v19 ทำผลงานได้น่าประทับใจ:

  • ความแม่นยำรวม JevBench v1: 0.723 (ผ่าน 167 จาก 231 งาน)
  • ความหน่วง (Latency) บน RTX 3090: ค่ามัธยฐานเพียง 115 ms
  • ความหน่วงบน M3 Pro: ค่ามัธยฐาน 153 ms สำหรับข้อความไม่เกิน 300 token

ในตารางคะแนนล่าสุด v19 อยู่ในอันดับที่ 3 จาก 33 โมเดลในระดับ 2B และขึ้นเป็นอันดับ 1 หากวัดเฉพาะโมเดลที่ไม่เกิน 2B โดยจุดเด่นสำคัญคือการปรับจูนค่าความมั่นใจ (Calibration) ซึ่งหากโมเดลระบุค่าความมั่นใจที่ 0.9 ขึ้นไป จะมีความถูกต้องแม่นยำสูงถึง 95%

การเปรียบเทียบ

คุณสมบัติStrands Decider 2B (v19)Jev 1.13.0decider-2bDecision 2B
ผู้พัฒนาStrands Agents (AWS)TypeSafe AIMapikaFlyMy.AI
การเข้าถึงOpen weights, Apache-2.0API แบบปิด (hosted)Open code หรือ weightsOpen code หรือ weights
โมเดลพื้นฐานQwen3.5-2B-Base + LoRA + pointer headไม่เปิดเผยQwen3.5-2B-Base + trained readoutMiniCPM5-2B + LoRA + pointer head
ขนาด1.9Bไม่เปิดเผย1.9B2.5B dense
การโฮสต์เองใช่ไม่ใช่ใช่
เผยแพร่ข้อมูลครบถ้วนใช่ไม่ไม่ได้รับการยืนยันไม่ได้รับการยืนยัน
ความแม่นยำ JevBench0.723ไม่อยู่ในตาราง0.7100.753
ความหน่วงที่รายงานมัธยฐาน 115 ms (RTX 3090)70 - 500 msไม่ได้เปรียบเทียบไม่ได้เปรียบเทียบ

แหล่งข้อมูล: การเปรียบเทียบ JevBench ของ Strands, Benchmark Heaven JevBench, หน้าผลิตภัณฑ์ Jev

กรณีการใช้งานและตัวอย่าง guardrail

โมเดลนี้ถูกนำไปใช้จริงในงานหลายด้าน เช่น Model Routing, การเลือกเครื่องมือ, และการทำ Guardrails เพื่อความปลอดภัย ตัวอย่างใน repo แสดงการใช้ควบคุมเครื่องมือพยากรณ์อากาศ โดยโมเดลจะตรวจสอบอาร์กิวเมนต์ว่าตรงกับที่ผู้ใช้ระบุหรือไม่ก่อนที่จะทำการเรียกใช้เครื่องมือจริง

นอกจากนี้ยังสามารถนำไปใช้ในงานคัดกรอง (Triage) เช่น การแยกแยะข้อความแจ้งปัญหาลูกค้าประโยคว่า "Help! My payouts have been failing for 3 days!" โมเดลสามารถระบุได้ทันทีว่าเป็นเรื่อง billing ด้วยค่าความมั่นใจ 0.768 ซึ่งช่วยลดภาระของ LLM ตัวใหญ่ในการจัดการงานซ้ำๆ เหล่านี้

ประเด็นสำคัญ

  • Strands Decider 2B มุ่งเน้นการคืนค่าตัวเลือกและคะแนนโดยไม่มีการสร้างข้อความ
  • ปรับแต่งจาก Qwen3.5-2B โดยใช้ Pointer head เพื่อความรวดเร็ว
  • ทำความหน่วงมัธยฐานได้ 115 ms บน RTX 3090
  • เปิดเผย Weights, โค้ด และสูตรการฝึกแบบ Apache-2.0 ทั้งหมด
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร