Liquid AI เปิดตัว LFM2.5-Encoders ประมวลผล Long-Context เร็วกว่าเดิม 3.7 เท่าบน CPU

วันนี้เราประกาศเปิดตัวโมเดล encoder ใหม่ 2 รุ่นบน Hugging Face ได้แก่ LFM2.5-Encoder-230M และ LFM2.5-Encoder-350M ซึ่งให้ประสิทธิภาพการทำงานระดับสูงเทียบเท่าโมเดลขนาดใหญ่ แต่ยังคงความรวดเร็วแม้ในขณะประมวลผลข้อมูลที่มีความยาวมาก ช่วยให้คุณสามารถรันงานวิเคราะห์เอกสารบนฮาร์ดแวร์พื้นฐานอย่าง CPU ได้โดยไม่ต้องพึ่งพาทรัพยากรราคาแพง

จุดเด่นที่น่าสนใจของโมเดลรุ่นนี้ประกอบด้วย ประสิทธิภาพที่แข็งแกร่งเกินขนาดตัว โดยสามารถทำคะแนนทดสอบบน GLUE, SuperGLUE และงานด้านหลายภาษาได้เทียบเท่าหรือดีกว่า encoder ที่มีขนาดใหญ่กว่า อีกทั้งยังรองรับบริบทสูงสุดถึง 8,192-token โดยมีค่าความหน่วง (latency) เพิ่มขึ้นเพียงเล็กน้อยเมื่ออินพุตยาวขึ้น และที่สำคัญที่สุดคือความเร็วบน CPU ที่เร็วกว่า ModernBERT-base ถึง 3.7 เท่าในสถานการณ์ที่ต้องประมวลผลบริบทขนาดยาว

โมเดลเหล่านี้ได้รับการออกแบบมาเพื่อให้คุณนำไปสร้างเครื่องมือต่างๆ ได้อย่างคุ้มค่า เช่น intent routers, policy linters, PII detectors และ text classifiers ที่รันได้อย่างต่อเนื่องตลอดทั้งวันในงบประมาณที่ประหยัด โดยผู้ที่สนใจสามารถทดลองใช้งานเดโมสดได้ในลิงก์ด้านล่าง

ทำไมเราถึงสร้าง encoder อเนกประสงค์

หลังจากที่เราปล่อย LFM2.5-Retrievers ไปเมื่อเดือนก่อนเพื่อเน้นการค้นหาหลายภาษา LFM2.5-Encoders ถูกพัฒนาตามมาในตระกูลเดียวกันแต่ปรับให้ใช้งานได้กว้างขวางขึ้น โดยผ่านการโมเดลแบบ pre-trained ด้วยวัตถุประสงค์ masked-language ทำให้ผู้ใช้งานสามารถนำไป fine-tune ต่อเพื่อใช้ในงานจัดหมวดหมู่ (classification) งานระดับหน่วยคำ (token-level tasks) หรือการค้นหาข้อมูลได้ตามต้องการ

ในโลกของการใช้งานจริง Encoders เปรียบเหมือนขุมพลังหลังบ้านของแอปพลิเคชัน NLP มากมาย ไม่ว่าจะเป็นระบบตรวจจับความปลอดภัย (safety filters) หรือการคัดแยกประเภทข้อมูล ซึ่งงานเหล่านี้มักต้องรันตลอดเวลาและต้องรองรับข้อมูลที่ยาวขึ้นเรื่อยๆ แม้ว่า BERT และ ModernBERT จะทำมาตรฐานไว้ได้ดีมาก แต่ LFM2.5-Encoders ก้าวข้ามไปอีกขั้นด้วยสถาปัตยกรรม LFM2 ที่ช่วยคุมต้นทุนการประมวลผลให้เพิ่มขึ้นต่ำมากแม้ข้อมูลอินพุตจะยาวขึ้นก็ตาม

วิธีการสร้าง encoders

เราสร้าง encoders เหล่านี้โดยต่อยอดจากโครงสร้างหลัก LFM2 decoder ของรุ่น LFM2.5-230M และ LFM2.5-350M จากนั้นปรับเปลี่ยน causal decoder ให้กลายเป็น bidirectional encoder ด้วยเทคนิคสำคัญ 3 ประการคือ:

  1. Bidirectional attention mask: เพื่อให้แต่ละ token สามารถมองเห็นข้อมูลได้ทั้งสองด้าน (หน้า-หลัง)
  2. Non-causal short convolutions: ใช้การ pad แบบสมมาตรเพื่อให้แต่ละ token ผสมผสานกับข้อมูลข้างเคียงได้อย่างลื่นไหล
  3. Masked language modeling: สุ่มปิด (mask) ข้อมูล 30% ระหว่างการฝึกสอนเพื่อความแม่นยำ

bidirectional_patches

กระบวนการฝึกสอนถูกแบ่งเป็น 2 ขั้นตอน เริ่มจากการสร้างทักษะทางภาษาทั่วไปบนบริบท 1,024-token ด้วยข้อมูลเว็บจำนวนมหาศาล ตามด้วยระยะการปรับตัวกับบริบทขนาดยาว (Long-context adaptation) เพื่อขยายความจุเป็น 8,192 tokens เสริมสร้างความรู้เชิงลึกในด้านข้อเท็จจริง ภาษา และข้อบังคับทางกฎหมาย

ผลการทดสอบ Benchmark

เราได้ทำการ fine-tune โมเดลในงานต่างๆ และทดสอบกับ 14 โมเดลคู่แข่งผ่าน 17 ภารกิจสำคัญจาก GLUE, SuperGLUE และการจัดหมวดหมู่หลายภาษา โดยใช้ค่าเฉลี่ยจากการรัน 5 ครั้งเพื่อให้ได้ตัวเลขที่เชื่อถือได้มากที่สุด ซึ่งเราได้เผยแพร่ผลลัพธ์แบบ open-sourced ให้ทุกคนตรวจสอบได้ด้วย

benchmark_ranking

ผลการทดสอบพบว่า LFM2.5-Encoder-350M ติดอันดับที่ 4 จากทั้งหมด โดยเป็นรองเพียงโมเดลที่มีขนาดใหญ่กว่ามาก (บางรุ่นใหญ่กว่าเกือบ 10 เท่า) ขณะที่ LFM2.5-Encoder-230M สามารถทำคะแนนชนะ ModernBERT-base และ EuroBERT ทุกตัว แม้จะมีขนาดโมเดลที่เล็กกว่าก็ตาม

ความเร็วการประมวลผลบน CPU และ GPU

ด้วยมรดกความเร็วจากสถาปัตยกรรม LFM2 ทำให้ encoders ของเราทำงานได้รวดเร็วมาก เมื่อเปรียบเทียบในบริบท 8,192-token ความแตกต่างจะเห็นได้ชัดเจนที่สุดบน CPU

cpu_plot

บนระบบ CPU รุ่น LFM2.5-Encoder-230M ทำความเร็วได้สูงสุดในทุกช่วงความยาวข้อมูล ขณะที่คู่แข่งอย่าง ModernBERT จะมีความเร็ว (throughput) ลดลงอย่างมากเมื่อเจอข้อมูลยาวขึ้น ที่ความยาวปลายทาง 8,192 tokens ModernBERT-base ต้องใช้เวลาประมวลผลเฉลี่ยถึง 90 วินาทีต่อรอบ แต่ LFM2.5-Encoder-230M ใช้เวลาเพียง 28 วินาที ซึ่งเร็วกว่าราว 3.7 เท่า ช่วยให้นักพัฒนาสามารถวิเคราะห์สัญญาฉบับยาวหรือบทสนทนาจำนวนมากได้ในเวลาไม่ถึงครึ่งนาทีบนแล็ปท็อปทั่วไป

gpu_plot

สำหรับบน GPU แม้ส่วนต่างความเร็วจะแคบลง แต่ LFM2.5-Encoders ยังคงได้เปรียบในงานที่มีอินพุตตั้งแต่ 2K tokens ขึ้นไป โดยสรุปคือหากคุณรันงานบน CPU โมเดลของเราจะมอบความเร็วที่ทิ้งห่างอย่างมหาศาล และยังเป็นตัวเลือกที่เหนือกว่าสำหรับงานอินพุตยาวบน GPU อีกด้วย

เดโมของ LFM2.5-Encoder

เราจัดเตรียมเดโมที่รันบน Hugging Face space (CPU Only) ให้คุณได้ทดลองประสิทธิภาพจริง:

  • Zero-shot prompt routing: ระบบกำหนดเส้นทางคำสั่งแบบอัตโนมัติ
  • Zero-shot policy linting: ตรวจสอบความสอดคล้องของนโยบายองค์กร
  • Spell checking: แก้ไขคำสะกดผิดราย token
  • PII detection: ตรวจจับข้อมูลส่วนบุคคล 40 ประเภทใน 16 ภาษา
  • Masked-diffusion text generation: โหมดสร้างข้อความผ่านการเปิด mask ซ้ำๆ

วิธีใช้และ fine-tune LFM2.5-Encoders

หากคุณต้องการโมเดลที่ทำงานได้เร็ว ต้นทุนต่ำ และรองรับการประมวลผลข้อมูลปริมาณมากบน CPU ที่มีอยู่ LFM2.5-Encoders คือคำตอบที่คุ้มค่ากว่า generative LLM ขนาดใหญ่ โดยคุณสามารถเลือกใช้ได้ 2 รุ่นตามความเหมาะสม:

  • LFM2.5-Encoder-350M: สำหรับงานที่ต้องการความแม่นยำสูงสุด
  • LFM2.5-Encoder-230M: สำหรับงานที่เน้นความเร็วสูงสุดหรือมีทรัพยากรจำกัด

เริ่มต้นใช้งาน

ติดตั้งไลบรารี transformers เวอร์ชันล่าสุดได้ทาง:

pip install -U transformers

และนี่คือตัวอย่างการรันการทำนาย masked-token:

from transformers import AutoModelForMaskedLM, AutoTokenizer
import torch
 
model_id = "LiquidAI/LFM2.5-Encoder-230M"  # หรือ "LiquidAI/LFM2.5-Encoder-350M"
tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
mlm = AutoModelForMaskedLM.from_pretrained(model_id, trust_remote_code=True)
 
text = f"The capital of France is {tok.mask_token}."
enc = tok(text, return_tensors="pt")
with torch.no_grad():
    logits = mlm(**enc).logits
pos = (enc["input_ids"][0] == tok.mask_token_id).nonzero()[0].item()
print([tok.decode([t]).strip() for t in logits[0, pos].topk(5).indices.tolist()])
# -> ['Paris', 'Strasbourg', 'Paris', 'Lyon', 'Versailles']

สำหรับการใช้งานในระดับโครงสร้างโมเดล:

from transformers import AutoModel
 
body = AutoModel.from_pretrained(model_id, trust_remote_code=True)

สำหรับผู้ใช้ GPU แนะนำให้ติดตั้ง flash-attn เพื่อประสิทธิภาพสูงสุด

การ Fine-tuning เนื่องจากโมเดลหลักเป็น base encoder คุณจึงจำเป็นต้อง fine-tune เพื่อให้เหมาะกับงานเฉพาะทางของคุณ โดยสามารถศึกษาขั้นตอนการทำได้จาก บทเรียนการ fine-tuning ที่มีการสอนจัดการเอกสารกฎหมายความยาว 8k ไว้ให้แล้ว

เริ่มต้นกับ LFM2.5-Encoders ได้เลย

โมเดลทั้งสองพร้อมให้ดาวน์โหลดแบบ open-weight แล้ววันนี้:

  • ดาวน์โหลด: LFM2.5-Encoder-230M และ LFM2.5-Encoder-350M
  • ทดลองใช้: ผ่านเดโมบนเบราว์เซอร์ได้ทันที
  • ปรับแต่ง: ศึกษา คู่มือ fine-tuning เพื่อปรับใช้กับงานของคุณ

การอ้างอิง

หากท่านนำผลงานนี้ไปใช้ โปรดระบุแหล่งที่มาดังนี้:

@article{liquidAI2026Encoders,
  author = {Liquid AI},
  title = {LFM2.5-Encoders: Fast at Long Context, Even on CPU},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-encoders},
}
Source: Hugging Face Blog
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร