JetBrains เปิดตัว Mellum2.1 โมเดล MoE 12B สำหรับ Coding Agents

· By: SirilukP

JetBrains เปิดตัว Mellum2.1 โมเดล MoE 12B สำหรับ Coding Agents

JetBrains เปิดตัว Mellum2.1 โมเดลแบบเปิด (open model) ที่ออกแบบมาเพื่อความรวดเร็วสำหรับ coding agents และ sub-agents โดยเฉพาะ Mellum2.1 ใช้สถาปัตยกรรมแบบ mixture-of-experts ขนาด 12B ซึ่งมีพารามิเตอร์ทำงานจริงเพียง 2.5B ต่อ token เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 บน Hugging Face

แม้สถาปัตยกรรมจะยังคงเดิมจาก Mellum2 แต่การอัปเกรดส่วนใหญ่เกิดขึ้นจากการเรียนรู้แบบเสริมกำลัง (reinforcement learning หรือ RL) ในสภาพแวดล้อมซอฟต์แวร์จริง ส่งผลให้ได้โมเดลขนาดเล็กที่สามารถรันเองได้ (self-hosting) พร้อมความสามารถในการสำรวจ repository แก้ไขไฟล์ และตรวจสอบความถูกต้องของการเปลี่ยนแปลงโค้ดได้ด้วยตัวเอง

TL;DR

  • ขนาด: รวม 12B, ทำงานจริง 2.5B (64 experts, เปิดใช้งาน 8), context 131,072 token
  • การรัน: ใช้งานผ่าน GPU ของคุณเองด้วย vLLM หรือ SGLang (ทดสอบบน NVIDIA H200) ส่วนเวอร์ชัน GGUF สำหรับ llama.cpp, Ollama และ LM Studio เริ่มต้นที่ 7.0 GB
  • ประสิทธิภาพ: ชนะ Mellum2 ใน 15 จาก 17 benchmark และชนะ Qwen3.5-9B ได้ใน 5 จาก 17 หัวข้อ
  • จุดแข็ง: ทำคะแนนได้ 82.0 บน LiveCodeBench v6 นำหน้า Qwen3.5-9B (75.4) และ Gemma 4 E4B (69.4)
  • จุดอ่อน: ทำได้ 17.4 บน Terminal-Bench 2.1 ซึ่งยังต่ำกว่า Qwen3.5-9B (21.7)
  • สรุป (จุดเด่น): เขียนโค้ดได้ยอดเยี่ยมและมี throughput สูงเนื่องจากใช้พารามิเตอร์ทำงานจริงเพียง 2.5B
  • สรุป (จุดด้อย): ยังตามหลัง Qwen3.5-9B ในงานด้านความรู้ทั่วไปและงานแบบ agentic ที่มีความซับซ้อนสูง

Mellum2.1 คืออะไร?

Mellum2.1 คือเวอร์ชันพัฒนาต่อจาก Mellum2 Thinking ที่ JetBrains เปิดเป็น open-source ในเดือนมิถุนายน 2026 โดยเวอร์ชันล่าสุดคือ Mellum2.1-12B-A2.5B-Thinking ซึ่งเป็นโมเดลที่แสดงกระบวนการคิด (chain of thought) ก่อนตอบคำถาม

JetBrains วางเป้าหมายการใช้งานไว้ 3 ด้านหลัก ได้แก่ การเป็นเครื่องมือช่วยงานอัตโนมัติ (agent worker), ผู้ช่วยให้เหตุผลทั่วไป และการนำไปติดตั้งใช้งานแบบส่วนตัวภายในองค์กร

สถาปัตยกรรม Mellum2.1 ทำงานอย่างไร?

โมเดลประกอบด้วย 28 layer และ 64 experts โดยมีระบบ router เลือกเปิดใช้งาน 8 experts ต่อหนึ่ง token สำหรับส่วน attention ใช้เทคนิค grouped-query attention (32 query heads และ 4 KV heads) โดยในทุก 3 จาก 4 layer จะใช้ระบบ sliding window ขนาด 1,024 token รองรับ context ยาวสูงสุด 131,072 token และมี vocabulary 98,304 token โดยเก็บน้ำหนักโมเดลในรูปแบบ bfloat16

Mellum2.1 ถูกฝึกฝนอย่างไร?

กระบวนการพัฒนาส่วนใหญ่เน้นไปที่ช่วง post-training โดยขยายส่วน RL ให้เป็นหัวใจหลักของการฝึกฝน JetBrains ได้เพิ่มโจทย์ RL ครอบคลุมทั้งด้านคณิตศาสตร์ การแข่งขันเขียนโปรแกรม วิทยาศาสตร์ การใช้เครื่องมือ และวิศวกรรมซอฟต์แวร์ นอกจากนี้ยังมีการกรองชุดข้อมูลแบบเปิดเพื่อคัดกรองงานที่ง่ายเกินไปหรือมีข้อผิดพลาดออก

ในส่วนของวิศวกรรมซอฟต์แวร์ โมเดลถูกฝึกใน repository จริงโดยใช้ shell และเครื่องมือแก้ไขไฟล์จริง โมเดลจะได้รับรางวัล (reward) เมื่อทำการทดสอบผ่าน ซึ่งการฝึกฝนนี้ทำงานบน sandbox หลายล้านเครื่องภายใต้สภาพแวดล้อมที่แตกต่างกันนับพันรูปแบบ

ประสิทธิภาพบน Benchmark

JetBrains ประเมิน Mellum2.1 เปรียบเทียบกับ Mellum2, Qwen3.5-9B และ Gemma 4 E4B ผ่านระบบทดสอบเดียวกันในโหมด thinking ซึ่งผลคะแนนทั้งหมดรายงานโดย JetBrains เอง

จุดที่พัฒนาขึ้นอย่างโดดเด่นคือ agentic coding โดยคะแนน SWE-bench Verified พุ่งจาก 2.0 เป็น 47.0 ขณะที่ SWE-bench Pro เพิ่มจาก 0.0 เป็น 28.0 และ Terminal-Bench 2.1 ขยับจาก 0.6 เป็น 17.4 ซึ่งการทดสอบแบบ Agentic นี้ใช้เฟรมเวิร์ก Pi v0.73.1 พร้อม context ขนาด 114K-token

Mellum2.1 ขึ้นแท่นผู้นำในกลุ่มใน LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) และ BFCL v4 (62.3) อย่างไรก็ตาม Qwen3.5-9B ยังคงรักษาตำแหน่งผู้นำในด้าน SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) และ GPQA Diamond (77.8) ส่วนด้านความปลอดภัยนั้น Mellum2.1 ทำได้ดีขึ้น โดยคะแนน HarmBench ลดลงเหลือ 8.5 (ยิ่งต่ำยิ่งดี)

ทั้งนี้ มีข้อสังเกตว่าตัวเลขผลลัพธ์อาจต่างกันตามวิธีการทดสอบ เช่น Qwen ระบุคะแนน LiveCodeBench v6 ของตนเองไว้ที่ 65.6 และ GPQA Diamond ที่ 81.7 แต่ทาง JetBrains วัดได้ 75.4 และ 77.8 ตามลำดับ

Mellum2.1 เร็วแค่ไหน? เนื่องจากไม่มีการเปลี่ยนสถาปัตยกรรมในช่วง post-training ความเร็วจึงเท่ากับ Mellum2 โดย JetBrains ระบุว่าเมื่อรันบน H200 1 ใบ Mellum2.1 สามารถจ่าย token ได้เร็วกว่า Qwen3.5-9B เกือบ 2 เท่าต่อหนึ่งการร้องขอ และเมื่อใช้ multi-token prediction (MTP) จะช่วยให้เร็วขึ้นถึง 1.6 เท่า โดยแผนการเพิ่ม MTP head สำหรับ vLLM speculative decoding จะตามมาเร็วๆ นี้

วิธีการรัน Mellum2.1 ในเครื่อง (locally)

ผู้ใช้สามารถรันโมเดลตัวเต็มบน vLLM โดยใช้คำสั่ง --reasoning-parser qwen3 และสำหรับการเรียกใช้เครื่องมือ (tool call) ให้เพิ่ม --enable-auto-tool-choice --tool-call-parser hermes โดยตั้งค่าแนะนำที่ temperature 0.6, top_p 0.95 และ top_k 20

สำหรับการใช้งานผ่าน GGUF นั้นอยู่ระหว่างดำเนินการ ซึ่งใน GGUF repository มีไฟล์ให้เลือกดังนี้:

  • BF16: 24.3 GB (ขนาดเต็ม)
  • Q8_0: 12.9 GB (ความแม่นยำ 96.1%)
  • Q6_K: 10.9 GB (ความแม่นยำ 93.9%)
  • Q4_K_M: 8.1 GB (ความแม่นยำ 88.0% - แนะนำให้ใช้)
  • MXFP4_MOE: 7.0 GB (ความแม่นยำ 85.6%)

ตารางเปรียบเทียบประสิทธิภาพ

คุณสมบัติMellum2.1Mellum2 ThinkingQwen3.5-9BGemma 4 E4B
สถาปัตยกรรมMoE, 64 experts (8 active)MoE (เช่นเดียวกับ 2.1)Hybrid Gated DeltaNetDense
พารามิเตอร์รวม12B12B9B8B
พารามิเตอร์ทำงานจริง2.5B active2.5B active9B (dense)4.5B effective
Context131,072131,072262,144+128K
LiveCodeBench v6*82.069.475.469.4
SWE-bench Verified*47.02.050.023.0
BFCL v4*62.349.658.552.5
GPQA Diamond*64.651.077.853.1

หมายเหตุ: เป็นคะแนนจากการทดสอบโดย JetBrains ในโหมด thinking เพื่อเปรียบเทียบมาตรฐานเดียวกัน

สรุปประเด็นสำคัญ

  • Mellum2.1 เป็นโมเดล MoE ขนาด 12B ที่ประหยัดทรัพยากรด้วยการทำงานจริงเพียง 2.5B ภายใต้ลิขสิทธิ์ Apache 2.0
  • การฝึกแบบ RL ในสภาพแวดล้อมจริงทำให้ความสามารถในงานวิศวกรรมซอฟต์แวร์ก้าวกระโดดอย่างมาก
  • โดดเด่นเป็นพิเศษใน LiveCodeBench v6 และการทำงานผ่านเครื่องมือ (BFCL v4)
  • แม้ในงานยากๆ จะยังตามหลัง Qwen3.5-9B แต่ด้วยเวอร์ชัน GGUF ที่มีขนาดเพียง 7-8 GB ทำให้การใช้งาน coding agents บนเครื่องส่วนตัวมีประสิทธิภาพและเป็นไปได้จริงมากขึ้น
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร