เปิดตัว Saluki 27B: โมเดลจิ๋ว 2-bit ที่เก่ง Tool Calling กว่ารุ่นพี่

· By: AttapolK

เปิดตัว Saluki 27B: โมเดลจิ๋ว 2-bit ที่เก่ง Tool Calling กว่ารุ่นพี่

Underdog ผู้ช่วยส่วนตัวบนอุปกรณ์ (on-device assistant) จาก Conway Research ได้ทำการ released Saluki 27B ภายใต้สัญญาอนุญาต Apache 2.0 โดยโมเดลนี้เป็นเวอร์ชัน GGUF แบบ 2-bit ของ Qwen3.8-27B ที่มีขนาดไฟล์เพียง 7.89 GB ลดลงอย่างมากเมื่อเทียบกับโมเดล BF16 ตัวเต็มที่ต้องใช้พื้นที่ถึง 54 GB

ทาง Underdog ได้ปรับแต่งเทคนิคการบีบอัดเพื่อเน้นรักษาความสามารถด้าน tool calling ซึ่งเป็นหัวใจสำคัญในการเปลี่ยนโมเดลแชทให้กลายเป็น agent สำหรับนักพัฒนา ส่งผลให้โมเดลระดับ 27B นี้สามารถทำงานเป็น agent ได้อย่างมีประสิทธิภาพบน stock llama.cpp

TL;DR

  • Size: พารามิเตอร์แบบ dense ขนาด 27B โดยมีขนาดไฟล์ GGUF 7.89 GB เทียบกับ 54 GB สำหรับ BF16
  • Runs on: รองรับ stock llama.cpp และแอปพลิเคชันที่สร้างบนนี้ พร้อมรองรับ full GPU offload และมีส่วนเสริมด้าน vision ขนาด 629 MB หรือ 928 MB ให้เลือก
  • Performance: รักษาประสิทธิภาพเฉลี่ยได้ 96% จาก 9 benchmark เมื่อเทียบกับ Qwen3.8-27B ตัวเต็ม
  • Best: การเรียกเครื่องมือแบบขนาน (Parallel tool calls) ทำได้ 42 ครั้ง เทียบกับ 35 ครั้งในโมเดลตัวเต็ม (คิดเป็น 120% ของประสิทธิภาพเดิม)
  • Worst: AIME 2025 ได้คะแนน 79.2 เทียบกับ 96.7 (รักษาประสิทธิภาพได้ประมาณ 82%)
  • Bottom line: ข้อดีคือชนะรุ่นต้นฉบับขนาด 54 GB ในด้าน tool calling ด้วยขนาดไฟล์ที่เล็กกว่า 8 GB แต่ต้องแลกกับคะแนนคณิตศาสตร์ระดับการแข่งขันและการใช้เหตุผลหลายขั้นตอนที่ลดลง 12 ถึง 18 จุด

Underdog Saluki 27B คืออะไร?

Saluki 27B คือ Qwen3.8-27B ในรูปแบบ GGUF แบบ mixed-precision 2-bit ที่ออกแบบมาสำหรับ local agents โดยเฉพาะ โดยมีโครงสร้างการทำงานซ้อนกัน 3 ชั้น ดังนี้:

ชั้นแรกคือฐานจาก Qwen3.8-27B ซึ่งเป็นโมเดล dense ขนาด 27B จากทีม Qwen ประกอบด้วย 64 เลเยอร์ ผสมผสาน Gated DeltaNet linear attention เข้ากับ gated attention และรองรับ 262,144 tokens โดยกำเนิด

ชั้นที่สองเป็นการนำ Qwen3.8-27B-GSQ-RCO-GGUF ของ ISTA-DASLab มาใช้ โดยเทคโนโลยี GSQ จะเรียนรู้ scalar grids บิตต่ำที่แม่นยำต่อหนึ่ง tensor และ RCO จะกำหนดประเภท quantization ให้กับแต่ละ tensor ตามงบประมาณขนาดไฟล์ที่กำหนด

ชั้นสุดท้ายคือการประมวลผลเฉพาะของ Underdog ที่ช่วยรีดขนาดไฟล์ลงเหลือ 7.89 GB โดยมุ่งเน้นไปที่ประสิทธิภาพ tool calling ไฟล์นี้ใช้ชื่อว่า IQ2-mix และมี imatrix tag กำกับไว้ แม้ว่าทาง Underdog จะยังไม่ได้เปิดเผยสูตรการประมวลผลทั้งหมดในส่วนนี้ก็ตาม

ประสิทธิภาพของ Saluki บน Benchmark เป็นอย่างไร?

Underdog ได้เปรียบเทียบผลลัพธ์โดยแบ่งเป็น 2 กลุ่มการทดสอบ

กลุ่มแรก รันทั้งสองโมเดลในสภาพแวดล้อมเดียวกัน:

  • Underdog Bench: ทดสอบ 120 งานจาก BFCL v4 (ปิดการคิดและตั้งค่า temperature เป็น 0) Saluki ทำได้ 88 คะแนน ชนะโมเดลตัวเต็มที่ได้ 84 คะแนน และ Bonsai 2 ของ PrismML ที่ได้ 70 คะแนน
  • Parallel tool calls: ทดสอบงานขนาน 100 งานจาก BFCL v4 ปรากฏว่า Saluki ทำได้ 42 ครั้ง ขณะที่โมเดลตัวเต็มทำได้ 35 ครั้ง
  • SWE-bench Verified: ในการแก้ปัญหา 50 รายการ Saluki แก้ได้ 30 ปัญหา ส่วนโมเดลตัวเต็มแก้ได้ 33 ปัญหา

กลุ่มที่สอง เปรียบเทียบ Saluki กับคะแนนสาธารณะของรุ่นตัวเต็ม:

BenchmarkSaluki 27BQwen3.8-27B (สาธารณะ)
IFEval (prompt-loose)93.591.5
IFBench (prompt-loose)72.771.0
MBPP+78.083.9
MuSR67.579.6
AIME 2025 (avg@4)79.296.7
AIME 2026 (avg@4)80.094.6

Saluki เปรียบเทียบกับ Qwen3.8-27B รุ่นคอมแพคอื่นๆ อย่างไร?

FeatureUnderdog Saluki 27BQwen3.8-27B (BF16)ISTA GSQ-RCO IQ2_XSPrismML Bonsai 2 27B (PTQ1_0)
องค์กรUnderdog (Conway Research)ทีม QwenISTA-DASLabPrismML
พารามิเตอร์27B27B27B27.36B
ขนาดไฟล์7.89 GB54 GB8.4 GB5.95 GB
Bits per weightไม่เปิดเผย (2-bit mix)162.501.75
บริบท (Context)ไม่เปิดเผย262,144 nativeไม่เปิดเผย262K
Visionส่วนเสริม 629 หรือ 928 MBมีในตัว0.9 GB mmprojตัวเลือกเสริม 0.63 GB
รันไทม์Stock llama.cppTransformers, vLLM, SGLangStock llama.cpp, Ollama, LM StudioPrismML llama.cpp fork
Underdog Bench (จาก 120)8884ไม่เปิดเผย70
จุดเด่นรักษาประสิทธิภาพเฉลี่ย 96%พื้นฐาน100.3% zero-shot recovery98.2% ของ FP16
สัญญาอนุญาตApache 2.0Apache 2.0Apache 2.0Apache 2.0

แม้ Bonsai 2 จะมีขนาดเล็กกว่าและมีคะแนนคณิตศาสตร์ที่แข็งแกร่งกว่าใน AIME25 แต่จำเป็นต้องใช้ llama.cpp เวอร์ชันดัดแปลงของ PrismML เท่านั้น ในขณะที่ Saluki สามารถรันบน stock llama.cpp มาตรฐานได้ทันที อย่างไรก็ตาม ควรระวังว่าคะแนนจากผู้ผลิตแต่ละรายอาจเปรียบเทียบกันโดยตรงไม่ได้เนื่องจากสภาพแวดล้อมการทดสอบที่ต่างกัน

สรุปประเด็นสำคัญ

Saluki 27B สามารถบีบอัด Qwen3.8-27B ให้เหลือขนาดไม่ถึง 8 GB แต่ยังคงความสามารถด้าน tool calling ได้อย่างยอดเยี่ยมจนชนะโมเดลตัวเต็ม แม้ว่าประสิทธิภาพด้านคณิตศาสตร์และการใช้เหตุผลจะลดลงเหลือประมาณ 82-85% ของเดิม แต่การรองรับ stock llama.cpp ภายใต้สัญญาอนุญาต Apache 2.0 ก็ทำให้มันเป็นตัวเลือกที่น่าสนใจสำหรับนักพัฒนา local agents

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร