Liquid AI เปิดตัว LFM2.5-VL-3B โมเดล Vision-Language ไซส์จิ๋วแต่ทรงพลังสำหรับ Edge Device

LFM2.5-VL-3B คือโมเดล Vision-Language ประสิทธิภาพสูงสุดที่ออกแบบมาเพื่อให้คุณสามารถรันบนฮาร์ดแวร์ของตัวเองได้โดยตรง ตัวโมเดลมีความเชี่ยวชาญในการเข้าใจทั้งเอกสารและหน้าจอดิจิทัล สามารถระบุตำแหน่งวัตถุ (Grounding) และเรียกใช้เครื่องมือ (Tool Call) ได้อย่างแม่นยำ

หัวใจสำคัญของ LFM2.5-VL-3B คือการตอบสนองที่รวดเร็วแบบเรียลไทม์สำหรับแอปพลิเคชันบนอุปกรณ์พกพา โดยเน้นการตอบคำถามโดยตรงแทนการใช้กระบวนการให้เหตุผล (Reasoning) ที่ซับซ้อนเกินจำเป็น ช่วยลดความหน่วงในการทำงานได้อย่างมีนัยสำคัญ

การพัฒนาในรุ่น 2.5 นี้มีการขยายขีดความสามารถหลัก 4 ด้าน ได้แก่ ความเข้าใจหน้าจอและ UI ที่แข็งแกร่งขึ้นในทุกอุปกรณ์, ระบบ Grounding ที่ตรวจจับวัตถุผ่านคำสั่งภาษาธรรมชาติได้ดีกว่าเดิม, การรองรับอินพุตหลายรูปภาพที่พัฒนาขึ้น และความสามารถในการเรียกใช้ฟังก์ชัน (Function Calling) ที่ทรงพลังทั้งในรูปแบบข้อความและภาพ

lfm2_5_vl_3b_task_group_averages

กระบวนการฝึกฝนโมเดล Vision-Language ระดับท็อป

LFM2.5-VL-3B เกิดจากการจับคู่ระหว่าง SigLIP2 400M NaFlex vision encoder เข้ากับโครงสร้างหลัก (Backbone) แบบเดียวกับโมเดลข้อความ LFM2.5-2.6B ผ่านการฝึกฝนด้วยโทเคนมหาศาลถึง 34T พร้อมเพิ่มข้อมูลด้านการมองเห็นมากขึ้นถึง 4 เท่า

นอกจากนี้ยังมีการเพิ่มคลังคำศัพท์เป็น 128K เพื่อรองรับอักษรที่ไม่ใช่ละตินผ่านเทคนิคการ ขยาย Tokenizer ในตำแหน่งเดิม ช่วยให้ไม่ต้องเริ่มฝึกใหม่ตั้งแต่ต้น ส่วนขั้นตอน Post-training ได้ใช้ทั้งการปรับจูนแบบมีผู้สอน (SFT) ร่วมกับการถ่ายทอดความรู้จากโมเดลครู และปิดท้ายด้วยการเรียนรู้แบบเสริมกำลัง (RL) เพื่อประสิทธิภาพสูงสุด

ผลการทดสอบประสิทธิภาพ (Benchmark)

จากการประเมินผล LFM2.5-VL-3B ขึ้นแท่นเป็นผู้นำในกลุ่มโมเดลขนาดเดียวกันสำหรับงานด้านภาพในโลกแห่งความเป็นจริง ไม่ว่าจะเป็นความเข้าใจภาพหลายภาษา, การให้เหตุผลทางคณิตศาสตร์และวิทยาศาสตร์ผ่านภาพ รวมถึงความเข้าใจเอกสารและแผนภูมิที่ซับซ้อน

TaskBenchmarkLFM2.5-VL-3B (3.1B)LFM2-VL-3B (3.1B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)InternVL 3.5 2B (2.4B)InternVL 3.5 4B (4.7B)Qwen3.5-2B (2.3B)Qwen3.5-4B (4.7B)
GeneralMMStar63.357.745.352.957.765.555.159.3
MME73.173.054.967.673.681.076.279.5
RealWorldQA73.171.160.064.361.667.765.167.1
SimpleVQA35.433.027.330.430.533.735.240.7
SEED-Bench (image)77.776.671.475.375.476.475.876.1
MMBench (dev EN v1.1)81.080.064.271.676.281.173.178.4
CountBenchQA87.392.270.480.570.482.583.886.7
MultilingualMMMB83.081.973.380.476.381.575.982.0
Multilingual MMBench79.576.362.871.270.976.669.977.0
Multimodal IFMM-IFEval60.651.465.668.247.154.555.463.1
STEMLogicVista37.432.229.534.530.936.234.037.6
MathVista (mini)68.562.137.845.256.867.148.763.6
MMMU-Pro30.528.726.932.621.322.724.936.0
MMMU (val)48.445.641.149.352.060.744.150.3
Document, OCR & ChartChartQA (test)81.380.443.242.181.786.278.484.2
DocVQA (val)91.189.885.787.488.491.892.694.8
InfographicVQA (val)70.267.854.460.969.376.973.580.3
OCRBench v184.281.770.273.583.982.084.485.6
OCRBench v2 (En)47.543.944.448.845.549.147.758.7
TextVQA (val)84.383.062.569.076.677.577.381.2
GroundingRefCOCO-avg87.957.167.372.182.988.878.586.6
Multi-ImageBLINK61.550.245.252.252.057.248.658.7
MuirBench58.334.932.951.845.053.548.262.0
HallucinationHallusionBench47.246.441.849.847.652.149.351.7
POPE88.789.284.086.988.088.988.686.0
GUIScreenSpot-v2 Desktop78.76.028.145.879.982.063.876.3
ScreenSpot-v2 Mobile81.27.642.960.386.287.869.781.4
ScreenSpot-v2 Web82.22.522.447.679.982.665.977.8
Average-69.457.252.059.764.669.463.770.1

ด้านการทดสอบเฉพาะข้อความ LFM2.5-VL-3B ยังทำคะแนนการปฏิบัติตามคำสั่ง (Instruction Following) ได้สูงขึ้นอย่างชัดเจน และมีความสามารถในการใช้เครื่องมืออยู่ในระดับเดียวกับโมเดลที่ใหญ่กว่าอย่าง Gemma-4-E2B และ Qwen3.5-2B

TaskBenchmarkLFM2.5-VL-3B (3.1B)LFM2-VL-3B (3.1B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)InternVL 3.5 2B (2.4B)InternVL 3.5 4B (4.7B)Qwen3.5-2B (2.3B)Qwen3.5-4B (4.7B)
Instruction followingIFEval82.372.983.087.932.435.473.686.2
IFBench25.820.834.139.224.424.528.933.5
Multi-IF59.446.569.477.416.316.953.566.7
Tool use & function callingToolSandbox59.526.456.561.6N/AN/A47.765.0
BFCL V432.520.533.240.0N/AN/A33.953.6

ความเร็วในการอนุมานบน CPU และ GPU

โมเดลนี้รองรับระบบนิเวศการอนุมาน (Inference) ที่หลากหลายตั้งแต่วันแรก ไม่ว่าจะเป็น llama.cpp, MLX, vLLM, SGLang และ ONNX

สำหรับการใช้งานบนอุปกรณ์ (On-device) LFM2.5-VL-3B สามารถทำความเร็วได้ถึง 228 tokens/s บนชิป M5 Max และ 116 tokens/s บน Ryzen AI Max+ โดยใช้หน่วยความจำเพียง 3 GB แม้แต่บนสมาร์ทโฟนอย่าง Galaxy S26 Ultra ก็ยังรันได้สูงถึง 20 tokens/s

lfm2_5_vl_3b_on-device_inference_TTFT

เมื่อใช้งานบน GPU โมเดลนี้รักษาความหน่วงได้ต่ำอย่างสม่ำเสมอ โดยเฉพาะกับอินพุตแบบหลายเฟรม และยังทำสถิติ Output Throughput สูงสุดที่ 11K tokens/s ซึ่งเร็วกว่าโมเดลระดับ 4B ถึง 2 เท่า และเหนือกว่าโมเดลระดับ 2B บางรุ่นด้วยซ้ำ

lfm2_5_vl_3b_ttft

lfm2_5_vl_3b_throughput

วิธีใช้งาน LFM2.5-VL-3B

หากคุณต้องการโมเดลที่ชาญฉลาดและรองรับปริมาณงานสูงบนอุปกรณ์ LFM2.5-VL-3B คือคำตอบ

ติดตั้ง transformers เวอร์ชันล่าสุด:

%pip install -q torch torchvision accelerate "transformers>=5.10.1"

ตัวอย่างโค้ดสำหรับโหลดและรันโมเดล:

import torch
from transformers.image_utils import load_image
from transformers import AutoModelForImageTextToText, AutoProcessor
from IPython.display import display
 
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
 
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
    MODEL_ID,
    device_map="auto",
    dtype="bfloat16",
)
 
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
display(input_image)
 
messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": input_image},
            {"type": "text", "text": "Describe this image in two concise sentences."},
        ],
    }
]
 
inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)
 
with torch.inference_mode():
    outputs = model.generate(
        **inputs,
        do_sample=True,
        temperature=0.2,
        top_k=50,
        repetition_penalty=1.0,
        max_new_tokens=256,
    )
 
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print(output)

cats_image

Two cats are sleeping on a pink couch with two remote controls.

คุณสามารถศึกษาข้อมูลเพิ่มเติมเกี่ยวกับการใช้งาน Multi-image, Grounding หรือ OCR ได้ที่ เอกสารของเรา หรือรับชมวิดีโอตัวอย่างได้ที่ บล็อกการเปิดตัว

เดโมและช่องทางการใช้งาน

สัมผัสพลังของ LFM2.5-VL-3B ได้ทันทีผ่านเดโมบนเว็บเบราว์เซอร์ ซึ่งรองรับการแชทและการทำงานร่วมกับภาพได้หลากหลายรูปแบบที่ Hugging Face Spaces

LFM2.5-VL-3B พร้อมให้ดาวน์โหลดแล้ววันนี้ โดยคุณสามารถ:

การอ้างอิง

Liquid AI, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge", Liquid AI Blog, Aug 2026.
@article{liquidAI2026VL3B,
  author  = {Liquid AI},
  title   = {LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/lfm2-5-vl-3b},
}
Source: Hugging Face Blog
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร