Liquid AI เปิดตัว Open d1 โมเดลตัดสินใจแบบ Multimodal ไร้ Output Token

Liquid AI has released Open d1 โมเดล multimodal แบบ open-weight สองรุ่นใหม่ในตระกูล d1 decision model ได้แก่ d1-3B ที่รองรับการอ่านข้อความและรูปภาพ และ d1-omni-600M ที่ประมวลผลข้อความคู่กับรูปภาพหรือเสียงได้
ความพิเศษของทั้งสองโมเดลคือจะไม่เขียนข้อความตอบกลับ แต่จะส่งคืนคำตอบที่ผ่านการคำนวณความน่าจะเป็นในการประมวลผลครั้งเดียว (forward pass) โดยมียอด output token เป็นศูนย์ ออกแบบมาเพื่อการตัดสินใจแบบเรียลไทม์บนเทคโนโลยีของ NVIDIA ทั้งเซิร์ฟเวอร์ DGX, เวิร์กสเตชัน RTX และบอร์ดประมวลผล Jetson edge
ปัจจุบันโมเดลทั้งสองรุ่นพร้อมใช้งานแล้วบน Hugging Face รองรับการโหลดผ่าน Transformers และ llama.cpp ได้ทันที ภายใต้เงื่อนไข LFM Open License v1.0 ที่อนุญาตให้ใช้งานเชิงพาณิชย์ได้ฟรีสำหรับองค์กรที่มีรายได้ต่อปีไม่เกิน 10 ล้านดอลลาร์ โดยรุ่น d1-omni-600M ยังอยู่ในช่วงการวิจัยระยะแรกและยังไม่มีการเปิดเผยตัวเลข latency อย่างเป็นทางการ
Decision model คืออะไร?
ในขณะที่โมเดลภาษาทั่วไป (LLM) จะสร้างคำตอบทีละ token ซึ่งนักพัฒนาต้องนำมา parse ข้อมูลต่อ แต่ decision model จะรับสถานะ (state) และชุดคำถามที่ระบุไว้ จากนั้นจะอ่านข้อมูลเพียงครั้งเดียวเพื่อส่งคืนค่าความน่าจะเป็นของคำตอบที่อนุญาตทั้งหมด Liquid AI ได้กำหนดรูปแบบคำถามไว้ 3 ประเภท ได้แก่:
- noul: คำถามประเภท ใช่ หรือ ไม่ใช่ โดยส่งคืนค่าเป็น P(yes)
- choice: การเลือกป้ายกำกับหนึ่งอย่างจากตัวเลือกที่ระบุ พร้อมแสดงการกระจายความน่าจะเป็นทั้งหมด
- score: การให้คะแนนแบบถ่วงน้ำหนักตามเกณฑ์ที่จัดลำดับไว้ตั้งแต่ 2 ถึง 10 ระดับ
โมเดลนี้สามารถตอบคำถามหลายข้อพร้อมกันได้ในการเรียกใช้งานครั้งเดียวโดยใช้ข้อมูล state ชุดเดิม ซึ่งทุกการตอบกลับจะระบุ output_tokens: 0 ทาง Liquid AI แนะนำให้นำ d1 ไปใช้ในงานด้านการหาเส้นทาง (routing), การตรวจสอบเนื้อหา (moderation), การจำแนกเจตนา, การจัดลำดับใหม่ (reranking), การประเมินผลโดย AI (LLM-as-a-judge), ระบบป้องกันเอเจนท์ (agent guardrails) และการตรวจสอบด้วยภาพ โดยเน้นย้ำว่านี่ไม่ใช่โมเดลสำหรับแชท
d1-3B และ d1-omni-600M ถูกสร้างขึ้นอย่างไร?
d1-3B มาพร้อมพารามิเตอร์ขนาด 3.12B พัฒนาต่อยอดจาก LFM2.5-VL-3B ซึ่งเป็น vision-language model แบบ decoder-only โดยทีมงานได้เฉลี่ยน้ำหนักของ LFM2.5-2.6B ร่วมกับ text backbone ของโมเดลเดิม ก่อนจะทำ fine-tune หลายรอบด้วยข้อมูลที่ต่างกันแล้วนำมา merge กันอีกครั้ง โมเดลนี้ใช้ vision encoder แบบ SigLIP2 NaFlex ขนาด 400M รองรับ context สูงสุด 32,768 token โดยให้ความสำคัญกับการจัดการ input ที่ยาวและการแก้ไขทางลัดของข้อมูล (data shortcuts) เป็นหลัก
d1-omni-600M มีพารามิเตอร์ขนาด 587M พัฒนาจาก LFM2.5-Encoder-350M ซึ่งเป็นโมเดลแบบ bidirectional encoder ประกอบด้วยส่วนตัดสินใจหลักขนาด 381M, vision encoder 94M และ audio encoder 112M (ใช้ FastConformer 17 ชั้น) รองรับ context 16,384 token และคลิปเสียงยาวสูงสุด 30 วินาที อย่างไรก็ตาม ในหนึ่งคำขอจะเลือกส่งได้เพียงรูปภาพหรือเสียงอย่างใดอย่างหนึ่งเท่านั้น และการฝึกฝนด้านเสียงยังจำกัดเฉพาะภาษาอังกฤษ
Open d1 เหมาะกับงานประเภทใดมากที่สุด?
- การคัดกรองตั๋วสนับสนุนลูกค้า: d1-3B สามารถประเมินความเร่งด่วน เลือกทีมที่ต้องรับผิดชอบ และตรวจสอบเงื่อนไขการคืนเงินได้พร้อมกันจากการอ่านข้อความเพียงครั้งเดียว โดยไม่ต้องเสียเวลา parse ข้อความตอบกลับ
- การตรวจสอบภาพเรียลไทม์ที่ edge: d1-3B สามารถประมวลผลรูปภาพขนาด 384px ได้ในเวลาเพียง 35 ms บน Jetson AGX Thor ซึ่ง Liquid AI ได้สาธิตการใช้งานใน Open d1 Arcade เพื่อควบคุมท่าทางและดูแลเนื้อหาจากกล้องสด
- การจัดการคำสั่งเสียงในอุปกรณ์พกพา: d1-omni-600M สามารถระบุเจตนาหรือหัวข้อจากเสียงพูด 30 วินาทีได้โดยตรง เหมาะสำหรับระบบหาเส้นทางคำสั่งเสียงและ agent guardrails ในอุปกรณ์ขนาดเล็ก
ประสิทธิภาพของ d1 บน benchmark เป็นอย่างไร?
ผลทดสอบบน Decision Index v0.2.1 พบว่า d1-3B ทำคะแนนได้ 48.57 ครองอันดับหนึ่งในกลุ่มโมเดลที่ต่ำกว่า 10B แซงหน้า Decider 35B-A3B (47.11) และเป็นรองเพียง Winnow-12B (50.02) เท่านั้น โดย d1-3B โดดเด่นเป็นพิเศษในหมวดเครื่องมือ (Tools) และศิลปะ (Arts) แต่ยังตามหลังในด้านความรู้ทั่วไป (Knowledge)
สำหรับการทดสอบด้านข้อความ d1-3B ทำคะแนนเฉลี่ย 82.9 นำหน้า Decider 4B ส่วน d1-omni-600M ทำคะแนนได้ดีเยี่ยมในด้านการตรวจสอบความเห็น (Civil Comments) และ PAWS-X ขณะที่ผลทดสอบด้านรูปภาพ d1-3B ทำคะแนนเฉลี่ยได้ 74.1 ซึ่งสูงกว่าโมเดลฐานเล็กน้อย
d1-3B ทำงานเร็วแค่ไหนบนฮาร์ดแวร์ NVIDIA?
จากการวัดค่า latency แบบ end-to-end พบว่า d1-3B ใช้เวลาตอบหนึ่งคำถามเพียง 8 ms บน RTX 4090 และ 9 ms บน AMD MI325X สำหรับตระกูล Jetson รุ่น AGX Thor ทำเวลาได้ 16 ms, AGX Orin 26 ms และ Orin Nano 50 ms
หากเพิ่มคำถามเป็นสามข้อต่อหนึ่ง state บน Jetson AGX Thor จะใช้เวลาเพียง 20 ms ทั้งนี้ผลการทดสอบบน RTX 4090 ได้เปิดใช้งานโหมด model.compile(mode="reduce-overhead") ซึ่งช่วยลดเวลาจากปกติ 16 ms ลงได้ครึ่งหนึ่ง โดยผู้ที่สนใจสามารถศึกษาคู่มือการใช้งานเพิ่มเติมได้ที่ Jetson AI Lab ของ NVIDIA
Open d1 เปรียบเทียบกับ open decision model อื่นๆ อย่างไร?
| คุณสมบัติ | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| ผู้สร้าง | Liquid AI | Liquid AI | Mapika | Mapika | EldanRing |
| พารามิเตอร์ | 3.12B | 587M | 4.2B | รวม 34.7B (active 3B) | 12B |
| โมเดลฐาน | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| อินพุต | ข้อความ, รูปภาพ | ข้อความ + ภาพ/เสียง | ข้อความ | ข้อความ | ข้อความ, รูปภาพ |
| Context | 32,768 | 16,384 | 32,000 | 32,000 | 65,536 |
| Decision Index | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 |
| สัญญาอนุญาต | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Latency | 8 ms (RTX 4090) | N/A | 5.2 ms (B300) | 47 ms (B300) | 143 ms (RTX 5070 Ti) |
หมายเหตุ: ข้อมูล latency มาจากสภาพแวดล้อมที่ต่างกัน ไม่สามารถเปรียบเทียบกันตรงๆ ได้
จะรัน d1 ในเครื่องได้อย่างไร?
d1-3B จำเป็นต้องใช้ transformers>=5.14 และตั้งค่า trust_remote_code=True ขณะที่ d1-omni-600M ต้องการ transformers>=5.15 ขึ้นไป ทั้งสองรุ่นรองรับฟังก์ชัน system_one(state, questions) และการประมวลผลแบบกลุ่ม (batch)
สำหรับ d1-omni-600M แนะนำให้ใช้ float16 บน GPU เพื่อความแม่นยำของคำตอบ ผู้สนใจสามารถทดลองเล่นเดโมผ่านกล้องได้ที่ Open d1 Arcade หรือดูการสาธิตการนำทางหุ่นยนต์ใน Isaac Sim ที่ Liquid AI ร่วมมือกับ NVIDIA
สรุปสาระสำคัญ
- โมเดล d1 ให้คำตอบเป็นค่าความน่าจะเป็นจากการประมวลผลครั้งเดียว โดยไม่ต้องสร้าง token ข้อความ
- d1-3B ขึ้นแท่นผู้นำในกลุ่มโมเดลขนาดต่ำกว่า 10B บน Decision Index v0.2.1
- ประสิทธิภาพความเร็วสูง โดย d1-3B ตอบสนองในเวลาเพียง 8 ms บนการ์ดจอ RTX 4090
- d1-omni-600M รองรับทั้งภาพและเสียงในขนาดพารามิเตอร์ที่เล็กเพียง 587M
- เปิดให้ใช้งานเชิงพาณิชย์ฟรีหากรายได้บริษัทไม่เกิน 10 ล้านดอลลาร์ต่อปี
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
