Aleph Alpha เปิดตัว Kolibri โมเดล MoE สองภาษาประสิทธิภาพสูง
Aleph Alpha ได้ทำการ released Kolibri โมเดลภาษาขนาดใหญ่โครงสร้าง Mixture-of-Experts (MoE) แบบ Open-weight ที่ออกแบบมาเพื่อรองรับภาษาเยอรมันและภาษาอังกฤษโดยเฉพาะ
Kolibri มาพร้อมพารามิเตอร์รวม 78.1B แต่ถูกออกแบบให้เปิดใช้งานจริงเพียง 3.46B หรือประมาณ 4.4% ต่อโทเค็นเท่านั้น จุดเด่นคือการรองรับบริบท (Context) ได้สูงสุดถึง 1,048,576 โทเค็น พร้อมฟีเจอร์ปรับระดับความพยายามในการใช้เหตุผล (reasoning effort) ได้ตามความต้องการของผู้ใช้ โดยเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 บน Hugging Face
โมเดลนี้มุ่งเป้าไปที่การใช้งานแบบอธิปไตยทางข้อมูล (sovereign deployment) ในกลุ่มอุตสาหกรรมที่มีกฎระเบียบเข้มงวด เช่น หน่วยงานรัฐ อุตสาหกรรมการผลิต และเทคโนโลยีการบินอวกาศ สำหรับการใช้งานจริง เช็คพอยต์ FP8 มีขนาดประมาณ 78GB สามารถรันบน B200, B300 หรือ H200 เพียงตัวเดียว หรือใช้ H100 SXM5 จำนวน 2 ตัว ผ่านเฟรมเวิร์ก vLLM
Kolibri คืออะไร?
Kolibri (Kolibri-1) เป็น MoE Transformer สองภาษาที่พัฒนาโดยทีมงานในเยอรมนีแบบครบวงจร จากรายงาน technical research report ระบุว่า Aleph Alpha ควบคุมทุกขั้นตอนตั้งแต่การคัดเลือกข้อมูล สถาปัตยกรรม ไปจนถึงการฝึกฝนหลังขั้นตอนหลัก (post-training) บนโครงสร้างพื้นฐานในเยอรมนีและฟินแลนด์
การพัฒนามุ่งเน้นให้สอดคล้องกับ EU General-Purpose AI Code of Practice, EU AI Act และ GDPR โดยมีการปกปิดข้อมูลส่วนบุคคลก่อนเริ่มกระบวนการฝึกฝนอย่างเข้มงวด
สถาปัตยกรรม: Sparse Experts และ Hybrid Attention
โครงสร้างของ Kolibri ประกอบด้วย Transformer Blocks 50 บล็อก โดยมีความกว้างโมเดล 2,560 ในทุกเลเยอร์ MoE จะมีผู้เชี่ยวชาญ (experts) 384 ตัว ซึ่งจะถูกเลือกใช้งาน 6 ตัวต่อหนึ่งโทเค็นผ่าน sigmoid router พร้อมผู้เชี่ยวชาญส่วนกลาง (shared expert) อีก 1 ตัวเสมอ เพื่อรักษาสมดุลภาระงานผ่านระบบ Exact Quantile Balancing
ด้านกลไก Attention มีการผสมผสานระหว่าง Grouped-query attention (GQA) โดยทุกๆ 5 บล็อกจะเป็นแบบ full attention ส่วนที่เหลืออีก 40 บล็อกจะใช้ sliding-window attention เหนือ 512 โทเค็นก่อนหน้า ซึ่งช่วยให้รองรับลำดับข้อมูลยาวกว่าโมเดลแบบ full-attention ปกติถึง 4 เท่าในระดับการคำนวณที่เท่ากัน
Tokenizer ที่สร้างขึ้นสำหรับภาษาเยอรมัน
โมเดลใช้คำศัพท์ขนาด 128,000 โทเค็นที่ฝึกด้วย UniBPE ซึ่งช่วยให้การประมวลผลข้อความภาษาเยอรมันมีประสิทธิภาพสูงขึ้น โดยใช้โทเค็นน้อยลง 11.2% เมื่อเทียบกับ GPT-5 tokenizer ในขณะที่ประสิทธิภาพในภาษาอังกฤษยังคงอยู่ในระดับที่ยอดเยี่ยม
การฝึกฝน: 24T โทเค็น ตามด้วย SFT และ RL
การฝึกฝนแบ่งเป็น 3 ระยะหลัก เริ่มจาก Pre-training 20T โทเค็นบน NVIDIA B200 จำนวน 768 ตัว ตามด้วยระยะ Mid-training 3.44T โทเค็น และปิดท้ายด้วย Long-context stage 201B โทเค็น โดยมีสัดส่วนภาษาเยอรมันที่คัดสรรมาอย่างดีกว่า 2T โทเค็น
ในขั้นตอน Post-training ได้ใช้การจูนแบบละเอียด (SFT) ร่วมกับ MergeMix และการเรียนรู้แบบเสริมกำลัง (RL) ผ่านโปรโตคอล Merlin-Arthur เพื่อฝึกให้โมเดลรู้จักปฏิเสธการตอบคำถามหากข้อมูลในบริบทไม่เพียงพอ
Interactive Explainer: วิธีการทำงานของ Kolibri
ผลการทดสอบ (Benchmarks)
จากการทดสอบด้วย eval-framework พบว่า Kolibri ทำคะแนนนำในหลายด้าน เช่น GPQA Diamond (84.3) และ AIME 2025 (96.9) โดยให้ประสิทธิภาพการถอดรหัสข้อความเร็วกว่ารุ่นเดิมอย่าง Kolibri Origin ถึง 2.7 เท่าต่อ GPU พร้อมคะแนนภาษาอังกฤษที่สูงขึ้นอย่างมีนัยสำคัญ
Kolibri เทียบกับคู่แข่งที่ใกล้เคียงที่สุด
| คุณสมบัติ | Kolibri-1 | Qwen3.6 35B-A3B | Nemotron 3 Super | Mistral Small 4 |
|---|---|---|---|---|
| ผู้พัฒนา | Aleph Alpha (เยอรมนี) | Alibaba Qwen | NVIDIA | Mistral AI (ฝรั่งเศส) |
| พารามิเตอร์ทั้งหมด / ขณะทำงาน | 78.1B / 3.46B | ~35B / 3B | 120B / 12B | 119B / 6.5B |
| สถาปัตยกรรม | MoE, sliding-window + full attention | MoE, Gated DeltaNet hybrid | Mamba-2 + MoE + attention | MoE |
| บริบทสูงสุด | 1,048,576 โทเค็น | 262,144 native, ~1M พร้อม YaRN | 1M โทเค็น | 256k โทเค็น |
| การควบคุมการใช้เหตุผล | ไม่มี / ต่ำ / กลาง / สูง | เปิด / ปิด การคิด | เปิด / ปิด, โหมดใช้ความพยายามต่ำ | ไม่มี / สูง |
| สัญญาอนุญาต | Apache 2.0 | Apache 2.0 | NVIDIA Nemotron Open Model License | Apache 2.0 |
| คะแนนรวม (EN / DE) | 75.5 / 70.8 | 71.4 / 67.3 | 73.0 / 67.9 | 63.1 / 61.4 |
ข้อมูลทางเทคนิคอ้างอิงจาก model cards ของ Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super และ Mistral Small 4
วิธีการติดตั้ง Kolibri
ผู้ใช้สามารถติดตั้งแพ็กเกจ aleph-alpha-inference และรันผ่าน vLLM ได้ดังนี้:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 --tool-call-parser kolibri1 \
--enable-auto-tool-choiceหากต้องการใช้หน้าต่างบริบท 1M เต็มรูปแบบ ให้ระบุค่า --max-model-len 1048576 โดยทาง Aleph Alpha แนะนำให้ตั้งค่า temperature 1.0, top-p 0.97 และ top-k 128 เพื่อผลลัพธ์ที่ดีที่สุด
ประเด็นสำคัญ
- ใช้โครงสร้าง MoE ที่มีพารามิเตอร์รวม 78.1B แต่ประมวลผลจริงเพียง 3.46B ต่อโทเค็น
- สถาปัตยกรรม Hybrid Attention ช่วยให้จัดการบริบท 1 ล้านโทเค็นได้อย่างคุ้มค่า
- ฝึกฝนด้วยข้อมูลมหาศาล 24T โทเค็น โดยมีสัดส่วนภาษาเยอรมันมากกว่า 20%
- ครองอันดับหนึ่งด้านคะแนนรวมทั้งภาษาอังกฤษและเยอรมันในกลุ่มโมเดล MoE ที่นำมาเปรียบเทียบ
- สัญญาอนุญาต Apache 2.0 รองรับการใช้งานบน GPU ประสิทธิภาพสูงเพียงตัวเดียวได้
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
