Liquid AI เปิดตัว d1 โมเดลตัดสินใจแบบ Open Source สำหรับอุปกรณ์ Edge
วันนี้ เราเปิดตัวโมเดลการตัดสินใจแบบ open สองรุ่นใน ตระกูลโมเดลการตัดสินใจ d1 ของเรา ได้แก่ d1-3B และ d1-omni-600M ซึ่งเป็นรุ่นทดลอง
โมเดล d1-3B ถือเป็นโมเดลการตัดสินใจที่ดีที่สุดในกลุ่มที่ต่ำกว่า 10B บน Decision Index 0.2.1 โดยทำคะแนนได้ 48.57 นำหน้าโมเดลขนาด 4B และ 9B รวมถึง Decider 35B-A3B ที่ทำได้ 47.11 นอกจากนี้ยังมาพร้อมความสามารถด้าน Multimodal โดย d1-3B รองรับข้อความและรูปภาพ ส่วน d1-omni-600M รองรับได้ทั้งข้อความ รูปภาพ และเสียง
ในด้านความเร็ว d1-3B สามารถตอบคำถามได้ในเวลาเพียง 16 ms บน NVIDIA Jetson AGX Thor, 26 ms บน Jetson AGX Orin และ 50 ms บน Jetson Orin Nano
วิธีที่เราสร้างโมเดลการตัดสินใจสำหรับอุปกรณ์ปลายทาง (Edge)
โมเดลการตัดสินใจ d1 แบบ open เหล่านี้สร้างขึ้นบน Liquid Foundation Models (LFMs) ของเรา ซึ่งมีความแตกต่างจากโมเดลเชิงสร้างสรรค์ (generative models) ทั่วไปตรงที่โมเดลการตัดสินใจจะไม่สร้าง token แต่จะตอบคำถามผ่านการส่งข้อมูลไปข้างหน้าเพียงครั้งเดียว (single forward pass)
d1-3B และ d1-omni-600M ถูกฝึกฝนจากโครงสร้างหลัก (backbones) สองแบบที่แตกต่างกัน โดย d1-3B พัฒนาจาก LFM2.5-VL-3B ซึ่งเป็น VLM แบบ decoder-only รองรับอินพุตข้อความและรูปภาพ
ส่วน d1-omni-600M พัฒนาจาก LFM2.5-Encoder-350M ซึ่งเป็น bidirectional encoder ที่เพิ่ม vision และ audio encoders เพื่อจัดการข้อมูลได้ครบทั้งสามรูปแบบ ขณะนี้โมเดลนี้ยังอยู่ในช่วงการเปิดตัวเพื่องานวิจัยระยะเริ่มต้นและกำลังอยู่ระหว่างการพัฒนาเพิ่มเติม
ผลลัพธ์การทดสอบมาตรฐาน (Benchmark results)
เราได้ทดสอบ d1-3B และ d1-omni-600M บนชุดข้อมูลสาธารณะ 7 ชุด ครอบคลุมทั้งการอ่านจับใจความ การตรวจจับความเป็นพิษ การจำแนกเจตนา การตอบคำถามทางการแพทย์ และความเข้าใจหลายภาษา โดย d1-3B ทำคะแนนเฉลี่ยได้สูงสุดที่ 82.9 เหนือกว่า Decider 4B ขณะที่ d1-omni-600M ทำได้ 78.4 ซึ่งสูงกว่า Decider 2B (77.1) แม้จะใช้พารามิเตอร์เพียงหนึ่งในสี่เท่านั้น
| Benchmark | d1-omni-600M | d1-3B | Decider 2B | Decider 4B |
|---|---|---|---|---|
| SQuAD 2.0 | 74.0 | 83.3 | 67.7 | 76.0 |
| Civil Comments | 95.8 | 93.3 | 93.6 | 92.8 |
| MASSIVE intent | 86.1 | 86.9 | 81.1 | 88.3 |
| PubMedQA | 61.3 | 68.3 | 65.7 | 63.3 |
| BoolQ | 77.7 | 86.3 | 87.3 | 89.0 |
| XNLI | 74.7 | 85.6 | 85.0 | 88.6 |
| PAWS-X | 79.5 | 76.4 | 59.5 | 69.8 |
| Mean | 78.4 | 82.9 | 77.1 | 81.1 |
ผลการทดสอบยืนยันว่า d1-3B ยังคงประสิทธิภาพด้านการมองเห็นของโครงสร้าง LFM2.5-VL-3B ไว้อย่างครบถ้วน ส่วน d1-omni-600M สามารถจัดการข้อมูลได้ทั้งสามรูปแบบ อย่างไรก็ตาม เราไม่ได้รายงานผลการทดสอบด้านการมองเห็นหรือเสียงแยกต่างหาก เนื่องจาก Decision Index v0.3 ปัจจุบันยังมีเพียงชุดข้อมูลภาพส่วนตัวและการทดสอบการตัดสินใจด้วยเสียงที่ยังเป็นโจทย์ท้าทายในระดับสากล
ความเร็ว
จากความร่วมมือกับ NVIDIA เราได้ประเมิน d1-3B บนฮาร์ดแวร์หลากหลายรุ่น ทั้ง NVIDIA GeForce RTX 4090 และตระกูล Jetson โดย d1-3B สามารถประมวลผลบนอุปกรณ์ปลายทาง (Edge inference) และตอบคำถามเดี่ยวได้ในเวลาไม่ถึง 50 ms บนทุกอุปกรณ์ที่ทดสอบ
การตอบ 3 คำถามพร้อมกันใช้เวลาเพียง 1.3 เท่าของการตอบคำถามเดียว โดยบน AGX Thor เวลาเพิ่มขึ้นจาก 16 ms เป็นเพียง 20 ms เท่านั้น
| One question | 3 questions | 3.4K-token state | 384px image | 64 states, packed | |
|---|---|---|---|---|---|
| Apple M5 Pro | 30 ms | 41 ms | 640 ms | 62 ms | 78 / s |
| Jetson AGX Thor | 16 ms | 20 ms | 220 ms | 35 ms | 262 / s |
| Jetson AGX Orin 64 GB | 26 ms | 35 ms | 560 ms | 83 ms | 110 / s |
| Jetson Orin Nano | 50 ms | 73 ms | 1,640 ms | 202 ms | 38 / s |
สำหรับการประมวลผลบน GPU นั้น d1-3B ให้ความเร็วที่น่าทึ่ง โดยตอบคำถามได้ในเวลาไม่ถึง 10 ms และประมวลผลรูปภาพขนาด 384px ได้ในเวลาไม่ถึง 18 ms บนทั้งสองแพลตฟอร์มที่ทดสอบ
| One question | 3 questions | 3.4K-token state | 384px image | 64 states, packed | |
|---|---|---|---|---|---|
| NVIDIA RTX 4090 | 8 ms | 21 ms | 102 ms | 17 ms | 475 / s |
| AMD MI325X | 9 ms | 14 ms | 44 ms | 18 ms | 1,106 / s |
วิธีใช้โมเดลการตัดสินใจ d1 แบบ open
โมเดลการตัดสินใจ d1 เหมาะสำหรับงานที่ต้องการความเร็วและการตัดสินใจที่มีโครงสร้างชัดเจน รวมถึงงานที่ต้องใช้อินพุตแบบ multimodal โดย d1-3B ให้คุณภาพการตัดสินใจสูงสุดเมื่อเทียบกับโมเดลขนาดเดียวกัน ส่วน d1-omni-600M จะเหมาะอย่างยิ่งสำหรับอุปกรณ์ที่มีพื้นที่จัดเก็บจำกัด
ก่อนเริ่มใช้งาน ตรวจสอบการติดตั้งการอ้างอิง (ต้องการ transformers>=5.14):
pip install "transformers>=5.14" torch torchvision pillow
``` เนื่องจากโมเดลเหล่านี้มาพร้อมกับโค้ดเฉพาะตัว โปรดโหลดโมเดลด้วยคำสั่ง `trust_remote_code=True` ดังตัวอย่างด้านล่าง:
```python
import io
import urllib.request
import torch
from PIL import Image
from transformers import AutoModel
device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)
# Several named questions over one text state, answered in one pass
questions = {
"refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
"team": {"type": "choice", "instructions": "Which team should handle this?",
"criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
"fraud": "Suspected unauthorised use"}},
"urgency": {"type": "score", "instructions": "How urgent is this?",
"criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))
# An image as the whole state
url = "http://images.cocodataset.org/val2017/000000039769.jpg" # two cats on a sofa
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
"criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
images=[photo]))
# Many requests, packed together with no padding
tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))ตัวอย่างข้างต้นเป็นเพียงการใช้งานเบื้องต้นสำหรับ d1-3B สำหรับคำแนะนำของรุ่น d1-omni-600M สามารถดูได้ที่ model card ของ d1-omni-600M
เริ่มต้นกับโมเดลการตัดสินใจ d1 แบบ open
ขณะนี้โมเดลการตัดสินใจทั้งสองรุ่นพร้อมใช้งานแล้วบน Hugging Face ในรูปแบบ open-weight:
- ดาวน์โหลด: d1-3B และ d1-omni-600M บน Hugging Face
- ทดลอง: สามารถรันการสาธิตในพื้นที่ System One Arcade ของเราผ่าน Hugging Face Space
เราตื่นเต้นที่จะได้เห็นนวัตกรรมใหม่ๆ ที่คุณจะสร้างขึ้นจากโมเดลเหล่านี้
การอ้างอิง
หากคุณใช้ผลงานนี้ในงานวิจัยหรือโครงการ โปรดอ้างอิงบล็อกการเปิดตัวอย่างเป็นทางการ:
@article{liquidAI2026opend1,
author = {Liquid AI},
title = {Open d1: Edge decision models for text, vision, and audio},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/open-d1},
}ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
