Contrastive-LM เปิดตัว CLM-8B โมเดล Open-Source เร็วกว่า Jev 9 เท่า

· By: TanasakP

Contrastive-LM เปิดตัว CLM-8B โมเดล Open-Source เร็วกว่า Jev 9 เท่า

Contrastive-LM ได้เปิดตัว CLM-8B ซึ่งเป็นโมเดลตัวแรกในคลาสใหม่ที่เรียกว่า Contrastive Language Models (CLMs) ความพิเศษคือมันจะไม่สร้างข้อความ แต่จะทำหน้าที่ให้คะแนนชุดการกระทำของผู้สมัคร (candidate actions) เทียบกับสถานะปัจจุบันและส่งคืนค่าความน่าจะเป็น โดยมีคู่แข่งสำคัญคือ Jev ซึ่งเป็นโมเดล System One ที่เป็นกรรมสิทธิ์จาก TypeSafe AI

ในแง่การนำไปใช้งานจริง ผู้ใช้สามารถเข้าถึง head ภายใต้ลิขสิทธิ์ Apache-2.0 ที่มีขนาดเพียง 75 MB ทำงานบน NVIDIA GPU เพียง 1 ใบภายใต้ระบบ Linux โดยใช้ vLLM ในการรัน Qwen3-8B encoder

โมเดล System One ทำหน้าที่อะไร

Jev เริ่มเปิดให้เข้าใช้งานแบบจำกัดเมื่อช่วงปลายปี 2026 โดยเน้นการส่งคืนค่าที่ระบุประเภท (typed values) พร้อมความน่าจะเป็นแทนการตอบเป็นข้อความ ซึ่ง CLM มีเป้าหมายเดียวกัน CLM GitHub repo ให้บริการ CLM-8B ผ่าน API ที่ใช้งานร่วมกับ TypeSafe ได้ โดยรองรับคำถาม 3 รูปแบบหลัก ได้แก่:

  • Noul: ส่งคืนความน่าจะเป็นที่ข้อความนั้นเป็นจริง
  • Choice: เลือกตัวเลือกที่ดีที่สุดจากชุดที่กำหนดพร้อมค่าความน่าจะเป็น
  • Score: ให้คะแนนตามเกณฑ์ที่กำหนด (ordered rubric)

ผู้ใช้งานสามารถนำคำขอ (request) ที่เขียนขึ้นสำหรับ API ของ TypeSafe มาประมวลผลผ่าน Python client ของ CLM ได้ทันที

CLM ทำงานอย่างไร

CLM ฝึกฝนด้วยวิธี bidirectional InfoNCE loss เพื่อจัดการ state encoder และ action encoder โดยใช้โครงสร้างหลักของ Qwen3-8B ที่ถูกแช่แข็ง (frozen) ไว้ แล้วเพิ่ม projection head ขนาด 20 ล้านพารามิเตอร์เข้าไป การฝึกฝนจะมุ่งเน้นการดึงสถานะเข้าหาการกระทำที่เกิดขึ้นจริง และผลักสถานะนั้นออกจากการกระทำอื่นๆ ที่ไม่เกี่ยวข้อง

ในขั้นตอนการอนุมาน (inference) CLM จะให้คะแนนผู้สมัครแต่ละรายผ่านการทำ dot product ของ state และ action embeddings จากนั้นจึงใช้ค่า softmax แปลงเป็นค่าความน่าจะเป็น รูปแบบนี้ช่วยให้โมเดลสามารถจัดอันดับโซลูชันแบบ best-of-N เลือกใช้เครื่องมือ (tool routing) และตัดสินใจในรูปแบบระบุประเภทได้อย่างมีประสิทธิภาพ

จุดเด่นของการออกแบบนี้คือการแยกสถานะและการกระทำออกจากกัน ในการทำงานของเอเจนต์ที่สถานะเปลี่ยนไปเรื่อยๆ แต่ชุดการกระทำยังเหมือนเดิม clm-serve จะใช้การสำรองหน่วยความจำ GPU ในลักษณะเดียวกับ KV cache ของ vLLM เพื่อนำเวกเตอร์มาใช้ใหม่ บน RTX 4090 การทำงานจะเร็วขึ้นจาก 1.7 ms เหลือเพียง 0.6 ms และเมื่อมีตัวเลือกประมาณ 1,000 ราย CLM จะทำงานเร็วกว่า Jev ถึง 13 เท่า

สูตรการฝึกฝน 3 ขั้นตอน

  1. Pre-training: ฝึกบนคู่คำถาม-คำตอบ Nemotron DQA 60 ล้านคู่
  2. Mid-training: ฝึกบน synthetic hard negatives 30 ล้านชุดที่สร้างโดย Gemini 2.5 Flash-Lite
  3. Post-training: ฝึกบนวิถีการทำงานของเอเจนต์ (agent trajectories) 1 ล้านชุดจากโปรโตคอลชั้นนำ

ผลการทดสอบพบว่าการทำ pre-training อย่างเดียวให้ความแม่นยำ top-1 ที่ 52.1% แต่เมื่อผ่านขั้นตอน mid-training ความแม่นยำจะพุ่งสูงถึง 69.2% ในขณะที่การฝึกบน hard negatives ตั้งแต่แรกเริ่มกลับทำให้เกิด overfitting ที่ 62.4%

ผลลัพธ์ Zero-Shot เทียบกับ Jev

ภารกิจCLM-8B latencyJev latencyCLM-8B successJev success
เกม T-Rex16.5 ms149.8 ms5/55/5
การเรียกใช้เครื่องมือ (BFCL v4)76.8 ms125.5 ms95.2%99.2%
WikiRacing79.8 ms225 ms26/3030/30
Super Mario33.5 ms132.6 ms5/55/5

ความเร็วที่มากกว่า 9 เท่าเห็นได้ชัดในเกม T-Rex ซึ่งมีการกระทำซ้ำซ้อน CLM มีประสิทธิภาพเท่าเทียมกับ Jev ในเกมส่วนใหญ่ แต่อาจเป็นรองเล็กน้อยในด้านการเรียกใช้เครื่องมือและ WikiRacing แม้จะทำงานได้รวดเร็วกว่ามากก็ตาม

CLM ในฐานะตัวตรวจสอบสำหรับเอเจนต์เขียนโค้ด

เมื่อนำ CLM มาทำหน้าที่เป็นตัวตรวจสอบ (verifier) เพื่อเลือกโซลูชันที่ดีที่สุดจากผู้สมัครหลายราย ผลการประเมินในงาน DeepSWE (held-out) พบว่า CLM ที่ผ่านการ fine-tune ทำคะแนนได้ 81.6% และใน Terminal-Bench 2.1 ทำได้ 87.6% โดยมี latency ต่ำกว่าคู่แข่งอย่างเห็นได้ชัดบนเครื่อง H100

เกณฑ์มาตรฐานPass@1CLM (fine-tuned)JevCLM latencyJev latency
DeepSWE73.7%81.6%71.1%79 ms449 ms
Terminal-Bench 2.184.0%87.6%83.1%32 ms131 ms

ผลลัพธ์นี้ถือเป็นมาตรฐานใหม่ (SOTA) ของตัวตรวจสอบ โดย CLM ทำงานเร็วกว่า Jev ถึง 4.1-5.7 เท่า ทั้งนี้ตัวเลขดังกล่าวมาจากการใช้ fine-tuned heads ขนาดเล็กในชุดทดสอบแบบ held-out ไม่ใช่คะแนนรวมจากตารางผู้นำหลัก

คำอธิบายแบบโต้ตอบ

ประเด็นสำคัญ

  • CLM-8B เน้นการให้คะแนนการกระทำแทนการสร้างข้อความเพื่อลดการใช้ทรัพยากร
  • ความเร็วสูงกว่า Jev สูงสุด 9 เท่าในการทดสอบแบบ zero-shot
  • ทำคะแนนได้สูงถึง 81.6% ใน DeepSWE และ 87.6% ใน Terminal-Bench 2.1 หลังผ่านการ fine-tune
  • ระบบแคชเวกเตอร์ช่วยลด latency ในลูปการทำงานของเอเจนต์อย่างมีนัยสำคัญ
  • เป็นโมเดลแบบ Open-source ภายใต้ลิขสิทธิ์ Apache-2.0 ที่ติดตั้งใช้งานเองได้ง่าย
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย TanasakP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร