Liquid AI เปิดตัว LFM2.5-VL-3B โมเดล Vision-Language ไซส์จิ๋วแต่ทรงพลังสำหรับ Edge Device
LFM2.5-VL-3B คือโมเดล Vision-Language ประสิทธิภาพสูงสุดที่ออกแบบมาเพื่อให้คุณสามารถรันบนฮาร์ดแวร์ของตัวเองได้โดยตรง ตัวโมเดลมีความเชี่ยวชาญในการเข้าใจทั้งเอกสารและหน้าจอดิจิทัล สามารถระบุตำแหน่งวัตถุ (Grounding) และเรียกใช้เครื่องมือ (Tool Call) ได้อย่างแม่นยำ
หัวใจสำคัญของ LFM2.5-VL-3B คือการตอบสนองที่รวดเร็วแบบเรียลไทม์สำหรับแอปพลิเคชันบนอุปกรณ์พกพา โดยเน้นการตอบคำถามโดยตรงแทนการใช้กระบวนการให้เหตุผล (Reasoning) ที่ซับซ้อนเกินจำเป็น ช่วยลดความหน่วงในการทำงานได้อย่างมีนัยสำคัญ
การพัฒนาในรุ่น 2.5 นี้มีการขยายขีดความสามารถหลัก 4 ด้าน ได้แก่ ความเข้าใจหน้าจอและ UI ที่แข็งแกร่งขึ้นในทุกอุปกรณ์, ระบบ Grounding ที่ตรวจจับวัตถุผ่านคำสั่งภาษาธรรมชาติได้ดีกว่าเดิม, การรองรับอินพุตหลายรูปภาพที่พัฒนาขึ้น และความสามารถในการเรียกใช้ฟังก์ชัน (Function Calling) ที่ทรงพลังทั้งในรูปแบบข้อความและภาพ

กระบวนการฝึกฝนโมเดล Vision-Language ระดับท็อป
LFM2.5-VL-3B เกิดจากการจับคู่ระหว่าง SigLIP2 400M NaFlex vision encoder เข้ากับโครงสร้างหลัก (Backbone) แบบเดียวกับโมเดลข้อความ LFM2.5-2.6B ผ่านการฝึกฝนด้วยโทเคนมหาศาลถึง 34T พร้อมเพิ่มข้อมูลด้านการมองเห็นมากขึ้นถึง 4 เท่า
นอกจากนี้ยังมีการเพิ่มคลังคำศัพท์เป็น 128K เพื่อรองรับอักษรที่ไม่ใช่ละตินผ่านเทคนิคการ ขยาย Tokenizer ในตำแหน่งเดิม ช่วยให้ไม่ต้องเริ่มฝึกใหม่ตั้งแต่ต้น ส่วนขั้นตอน Post-training ได้ใช้ทั้งการปรับจูนแบบมีผู้สอน (SFT) ร่วมกับการถ่ายทอดความรู้จากโมเดลครู และปิดท้ายด้วยการเรียนรู้แบบเสริมกำลัง (RL) เพื่อประสิทธิภาพสูงสุด
ผลการทดสอบประสิทธิภาพ (Benchmark)
จากการประเมินผล LFM2.5-VL-3B ขึ้นแท่นเป็นผู้นำในกลุ่มโมเดลขนาดเดียวกันสำหรับงานด้านภาพในโลกแห่งความเป็นจริง ไม่ว่าจะเป็นความเข้าใจภาพหลายภาษา, การให้เหตุผลทางคณิตศาสตร์และวิทยาศาสตร์ผ่านภาพ รวมถึงความเข้าใจเอกสารและแผนภูมิที่ซับซ้อน
| Task | Benchmark | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| General | MMStar | 63.3 | 57.7 | 45.3 | 52.9 | 57.7 | 65.5 | 55.1 | 59.3 |
| MME | 73.1 | 73.0 | 54.9 | 67.6 | 73.6 | 81.0 | 76.2 | 79.5 | |
| RealWorldQA | 73.1 | 71.1 | 60.0 | 64.3 | 61.6 | 67.7 | 65.1 | 67.1 | |
| SimpleVQA | 35.4 | 33.0 | 27.3 | 30.4 | 30.5 | 33.7 | 35.2 | 40.7 | |
| SEED-Bench (image) | 77.7 | 76.6 | 71.4 | 75.3 | 75.4 | 76.4 | 75.8 | 76.1 | |
| MMBench (dev EN v1.1) | 81.0 | 80.0 | 64.2 | 71.6 | 76.2 | 81.1 | 73.1 | 78.4 | |
| CountBenchQA | 87.3 | 92.2 | 70.4 | 80.5 | 70.4 | 82.5 | 83.8 | 86.7 | |
| Multilingual | MMMB | 83.0 | 81.9 | 73.3 | 80.4 | 76.3 | 81.5 | 75.9 | 82.0 |
| Multilingual MMBench | 79.5 | 76.3 | 62.8 | 71.2 | 70.9 | 76.6 | 69.9 | 77.0 | |
| Multimodal IF | MM-IFEval | 60.6 | 51.4 | 65.6 | 68.2 | 47.1 | 54.5 | 55.4 | 63.1 |
| STEM | LogicVista | 37.4 | 32.2 | 29.5 | 34.5 | 30.9 | 36.2 | 34.0 | 37.6 |
| MathVista (mini) | 68.5 | 62.1 | 37.8 | 45.2 | 56.8 | 67.1 | 48.7 | 63.6 | |
| MMMU-Pro | 30.5 | 28.7 | 26.9 | 32.6 | 21.3 | 22.7 | 24.9 | 36.0 | |
| MMMU (val) | 48.4 | 45.6 | 41.1 | 49.3 | 52.0 | 60.7 | 44.1 | 50.3 | |
| Document, OCR & Chart | ChartQA (test) | 81.3 | 80.4 | 43.2 | 42.1 | 81.7 | 86.2 | 78.4 | 84.2 |
| DocVQA (val) | 91.1 | 89.8 | 85.7 | 87.4 | 88.4 | 91.8 | 92.6 | 94.8 | |
| InfographicVQA (val) | 70.2 | 67.8 | 54.4 | 60.9 | 69.3 | 76.9 | 73.5 | 80.3 | |
| OCRBench v1 | 84.2 | 81.7 | 70.2 | 73.5 | 83.9 | 82.0 | 84.4 | 85.6 | |
| OCRBench v2 (En) | 47.5 | 43.9 | 44.4 | 48.8 | 45.5 | 49.1 | 47.7 | 58.7 | |
| TextVQA (val) | 84.3 | 83.0 | 62.5 | 69.0 | 76.6 | 77.5 | 77.3 | 81.2 | |
| Grounding | RefCOCO-avg | 87.9 | 57.1 | 67.3 | 72.1 | 82.9 | 88.8 | 78.5 | 86.6 |
| Multi-Image | BLINK | 61.5 | 50.2 | 45.2 | 52.2 | 52.0 | 57.2 | 48.6 | 58.7 |
| MuirBench | 58.3 | 34.9 | 32.9 | 51.8 | 45.0 | 53.5 | 48.2 | 62.0 | |
| Hallucination | HallusionBench | 47.2 | 46.4 | 41.8 | 49.8 | 47.6 | 52.1 | 49.3 | 51.7 |
| POPE | 88.7 | 89.2 | 84.0 | 86.9 | 88.0 | 88.9 | 88.6 | 86.0 | |
| GUI | ScreenSpot-v2 Desktop | 78.7 | 6.0 | 28.1 | 45.8 | 79.9 | 82.0 | 63.8 | 76.3 |
| ScreenSpot-v2 Mobile | 81.2 | 7.6 | 42.9 | 60.3 | 86.2 | 87.8 | 69.7 | 81.4 | |
| ScreenSpot-v2 Web | 82.2 | 2.5 | 22.4 | 47.6 | 79.9 | 82.6 | 65.9 | 77.8 | |
| Average | - | 69.4 | 57.2 | 52.0 | 59.7 | 64.6 | 69.4 | 63.7 | 70.1 |
ด้านการทดสอบเฉพาะข้อความ LFM2.5-VL-3B ยังทำคะแนนการปฏิบัติตามคำสั่ง (Instruction Following) ได้สูงขึ้นอย่างชัดเจน และมีความสามารถในการใช้เครื่องมืออยู่ในระดับเดียวกับโมเดลที่ใหญ่กว่าอย่าง Gemma-4-E2B และ Qwen3.5-2B
| Task | Benchmark | LFM2.5-VL-3B (3.1B) | LFM2-VL-3B (3.1B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | InternVL 3.5 2B (2.4B) | InternVL 3.5 4B (4.7B) | Qwen3.5-2B (2.3B) | Qwen3.5-4B (4.7B) |
|---|---|---|---|---|---|---|---|---|---|
| Instruction following | IFEval | 82.3 | 72.9 | 83.0 | 87.9 | 32.4 | 35.4 | 73.6 | 86.2 |
| IFBench | 25.8 | 20.8 | 34.1 | 39.2 | 24.4 | 24.5 | 28.9 | 33.5 | |
| Multi-IF | 59.4 | 46.5 | 69.4 | 77.4 | 16.3 | 16.9 | 53.5 | 66.7 | |
| Tool use & function calling | ToolSandbox | 59.5 | 26.4 | 56.5 | 61.6 | N/A | N/A | 47.7 | 65.0 |
| BFCL V4 | 32.5 | 20.5 | 33.2 | 40.0 | N/A | N/A | 33.9 | 53.6 |
ความเร็วในการอนุมานบน CPU และ GPU
โมเดลนี้รองรับระบบนิเวศการอนุมาน (Inference) ที่หลากหลายตั้งแต่วันแรก ไม่ว่าจะเป็น llama.cpp, MLX, vLLM, SGLang และ ONNX
สำหรับการใช้งานบนอุปกรณ์ (On-device) LFM2.5-VL-3B สามารถทำความเร็วได้ถึง 228 tokens/s บนชิป M5 Max และ 116 tokens/s บน Ryzen AI Max+ โดยใช้หน่วยความจำเพียง 3 GB แม้แต่บนสมาร์ทโฟนอย่าง Galaxy S26 Ultra ก็ยังรันได้สูงถึง 20 tokens/s

เมื่อใช้งานบน GPU โมเดลนี้รักษาความหน่วงได้ต่ำอย่างสม่ำเสมอ โดยเฉพาะกับอินพุตแบบหลายเฟรม และยังทำสถิติ Output Throughput สูงสุดที่ 11K tokens/s ซึ่งเร็วกว่าโมเดลระดับ 4B ถึง 2 เท่า และเหนือกว่าโมเดลระดับ 2B บางรุ่นด้วยซ้ำ


วิธีใช้งาน LFM2.5-VL-3B
หากคุณต้องการโมเดลที่ชาญฉลาดและรองรับปริมาณงานสูงบนอุปกรณ์ LFM2.5-VL-3B คือคำตอบ
ติดตั้ง transformers เวอร์ชันล่าสุด:
%pip install -q torch torchvision accelerate "transformers>=5.10.1"ตัวอย่างโค้ดสำหรับโหลดและรันโมเดล:
import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype="bfloat16",
)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Describe this image in two concise sentences."},
],
}
]
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256,
)
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)
Two cats are sleeping on a pink couch with two remote controls.คุณสามารถศึกษาข้อมูลเพิ่มเติมเกี่ยวกับการใช้งาน Multi-image, Grounding หรือ OCR ได้ที่ เอกสารของเรา หรือรับชมวิดีโอตัวอย่างได้ที่ บล็อกการเปิดตัว
เดโมและช่องทางการใช้งาน
สัมผัสพลังของ LFM2.5-VL-3B ได้ทันทีผ่านเดโมบนเว็บเบราว์เซอร์ ซึ่งรองรับการแชทและการทำงานร่วมกับภาพได้หลากหลายรูปแบบที่ Hugging Face Spaces
LFM2.5-VL-3B พร้อมให้ดาวน์โหลดแล้ววันนี้ โดยคุณสามารถ:
- ดาวน์โหลด: LFM2.5-VL-3B บน Hugging Face
- ทดลอง: รัน เดโม WebGPU ในเบราว์เซอร์ โดยไม่ต้องตั้งค่า
- ปรับจูน (Fine-tune): ศึกษา บทเรียนการปรับจูน เพื่อประยุกต์ใช้กับงานเฉพาะทางของคุณ
การอ้างอิง
Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.@article{liquidAI2026VL3B,
author = {Liquid AI},
title = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-3b},
}ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
