Aleph Alpha เปิดตัว Kolibri โมเดล MoE สองภาษาประสิทธิภาพสูง

· By: AttapolK

Aleph Alpha ได้ทำการ released Kolibri โมเดลภาษาขนาดใหญ่โครงสร้าง Mixture-of-Experts (MoE) แบบ Open-weight ที่ออกแบบมาเพื่อรองรับภาษาเยอรมันและภาษาอังกฤษโดยเฉพาะ

Kolibri มาพร้อมพารามิเตอร์รวม 78.1B แต่ถูกออกแบบให้เปิดใช้งานจริงเพียง 3.46B หรือประมาณ 4.4% ต่อโทเค็นเท่านั้น จุดเด่นคือการรองรับบริบท (Context) ได้สูงสุดถึง 1,048,576 โทเค็น พร้อมฟีเจอร์ปรับระดับความพยายามในการใช้เหตุผล (reasoning effort) ได้ตามความต้องการของผู้ใช้ โดยเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 บน Hugging Face

โมเดลนี้มุ่งเป้าไปที่การใช้งานแบบอธิปไตยทางข้อมูล (sovereign deployment) ในกลุ่มอุตสาหกรรมที่มีกฎระเบียบเข้มงวด เช่น หน่วยงานรัฐ อุตสาหกรรมการผลิต และเทคโนโลยีการบินอวกาศ สำหรับการใช้งานจริง เช็คพอยต์ FP8 มีขนาดประมาณ 78GB สามารถรันบน B200, B300 หรือ H200 เพียงตัวเดียว หรือใช้ H100 SXM5 จำนวน 2 ตัว ผ่านเฟรมเวิร์ก vLLM

Kolibri คืออะไร?

Kolibri (Kolibri-1) เป็น MoE Transformer สองภาษาที่พัฒนาโดยทีมงานในเยอรมนีแบบครบวงจร จากรายงาน technical research report ระบุว่า Aleph Alpha ควบคุมทุกขั้นตอนตั้งแต่การคัดเลือกข้อมูล สถาปัตยกรรม ไปจนถึงการฝึกฝนหลังขั้นตอนหลัก (post-training) บนโครงสร้างพื้นฐานในเยอรมนีและฟินแลนด์

การพัฒนามุ่งเน้นให้สอดคล้องกับ EU General-Purpose AI Code of Practice, EU AI Act และ GDPR โดยมีการปกปิดข้อมูลส่วนบุคคลก่อนเริ่มกระบวนการฝึกฝนอย่างเข้มงวด

สถาปัตยกรรม: Sparse Experts และ Hybrid Attention

โครงสร้างของ Kolibri ประกอบด้วย Transformer Blocks 50 บล็อก โดยมีความกว้างโมเดล 2,560 ในทุกเลเยอร์ MoE จะมีผู้เชี่ยวชาญ (experts) 384 ตัว ซึ่งจะถูกเลือกใช้งาน 6 ตัวต่อหนึ่งโทเค็นผ่าน sigmoid router พร้อมผู้เชี่ยวชาญส่วนกลาง (shared expert) อีก 1 ตัวเสมอ เพื่อรักษาสมดุลภาระงานผ่านระบบ Exact Quantile Balancing

ด้านกลไก Attention มีการผสมผสานระหว่าง Grouped-query attention (GQA) โดยทุกๆ 5 บล็อกจะเป็นแบบ full attention ส่วนที่เหลืออีก 40 บล็อกจะใช้ sliding-window attention เหนือ 512 โทเค็นก่อนหน้า ซึ่งช่วยให้รองรับลำดับข้อมูลยาวกว่าโมเดลแบบ full-attention ปกติถึง 4 เท่าในระดับการคำนวณที่เท่ากัน

Tokenizer ที่สร้างขึ้นสำหรับภาษาเยอรมัน

โมเดลใช้คำศัพท์ขนาด 128,000 โทเค็นที่ฝึกด้วย UniBPE ซึ่งช่วยให้การประมวลผลข้อความภาษาเยอรมันมีประสิทธิภาพสูงขึ้น โดยใช้โทเค็นน้อยลง 11.2% เมื่อเทียบกับ GPT-5 tokenizer ในขณะที่ประสิทธิภาพในภาษาอังกฤษยังคงอยู่ในระดับที่ยอดเยี่ยม

การฝึกฝน: 24T โทเค็น ตามด้วย SFT และ RL

การฝึกฝนแบ่งเป็น 3 ระยะหลัก เริ่มจาก Pre-training 20T โทเค็นบน NVIDIA B200 จำนวน 768 ตัว ตามด้วยระยะ Mid-training 3.44T โทเค็น และปิดท้ายด้วย Long-context stage 201B โทเค็น โดยมีสัดส่วนภาษาเยอรมันที่คัดสรรมาอย่างดีกว่า 2T โทเค็น

ในขั้นตอน Post-training ได้ใช้การจูนแบบละเอียด (SFT) ร่วมกับ MergeMix และการเรียนรู้แบบเสริมกำลัง (RL) ผ่านโปรโตคอล Merlin-Arthur เพื่อฝึกให้โมเดลรู้จักปฏิเสธการตอบคำถามหากข้อมูลในบริบทไม่เพียงพอ

Interactive Explainer: วิธีการทำงานของ Kolibri

ผลการทดสอบ (Benchmarks)

จากการทดสอบด้วย eval-framework พบว่า Kolibri ทำคะแนนนำในหลายด้าน เช่น GPQA Diamond (84.3) และ AIME 2025 (96.9) โดยให้ประสิทธิภาพการถอดรหัสข้อความเร็วกว่ารุ่นเดิมอย่าง Kolibri Origin ถึง 2.7 เท่าต่อ GPU พร้อมคะแนนภาษาอังกฤษที่สูงขึ้นอย่างมีนัยสำคัญ

Kolibri เทียบกับคู่แข่งที่ใกล้เคียงที่สุด

คุณสมบัติKolibri-1Qwen3.6 35B-A3BNemotron 3 SuperMistral Small 4
ผู้พัฒนาAleph Alpha (เยอรมนี)Alibaba QwenNVIDIAMistral AI (ฝรั่งเศส)
พารามิเตอร์ทั้งหมด / ขณะทำงาน78.1B / 3.46B~35B / 3B120B / 12B119B / 6.5B
สถาปัตยกรรมMoE, sliding-window + full attentionMoE, Gated DeltaNet hybridMamba-2 + MoE + attentionMoE
บริบทสูงสุด1,048,576 โทเค็น262,144 native, ~1M พร้อม YaRN1M โทเค็น256k โทเค็น
การควบคุมการใช้เหตุผลไม่มี / ต่ำ / กลาง / สูงเปิด / ปิด การคิดเปิด / ปิด, โหมดใช้ความพยายามต่ำไม่มี / สูง
สัญญาอนุญาตApache 2.0Apache 2.0NVIDIA Nemotron Open Model LicenseApache 2.0
คะแนนรวม (EN / DE)75.5 / 70.871.4 / 67.373.0 / 67.963.1 / 61.4

ข้อมูลทางเทคนิคอ้างอิงจาก model cards ของ Kolibri-1, Qwen3.6-35B-A3B, Nemotron 3 Super และ Mistral Small 4

วิธีการติดตั้ง Kolibri

ผู้ใช้สามารถติดตั้งแพ็กเกจ aleph-alpha-inference และรันผ่าน vLLM ได้ดังนี้:

pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

หากต้องการใช้หน้าต่างบริบท 1M เต็มรูปแบบ ให้ระบุค่า --max-model-len 1048576 โดยทาง Aleph Alpha แนะนำให้ตั้งค่า temperature 1.0, top-p 0.97 และ top-k 128 เพื่อผลลัพธ์ที่ดีที่สุด

ประเด็นสำคัญ

  • ใช้โครงสร้าง MoE ที่มีพารามิเตอร์รวม 78.1B แต่ประมวลผลจริงเพียง 3.46B ต่อโทเค็น
  • สถาปัตยกรรม Hybrid Attention ช่วยให้จัดการบริบท 1 ล้านโทเค็นได้อย่างคุ้มค่า
  • ฝึกฝนด้วยข้อมูลมหาศาล 24T โทเค็น โดยมีสัดส่วนภาษาเยอรมันมากกว่า 20%
  • ครองอันดับหนึ่งด้านคะแนนรวมทั้งภาษาอังกฤษและเยอรมันในกลุ่มโมเดล MoE ที่นำมาเปรียบเทียบ
  • สัญญาอนุญาต Apache 2.0 รองรับการใช้งานบน GPU ประสิทธิภาพสูงเพียงตัวเดียวได้
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร