Moonshot AI เปิดตัว Kimi K3: โมเดล Open MoE 2.8 ล้านล้านพารามิเตอร์ พร้อมเทคโนโลยี KDA และคอนเทกซ์ 1M

Moonshot AI เปิดตัว Kimi K3: โมเดล Open MoE 2.8 ล้านล้านพารามิเตอร์ พร้อมเทคโนโลยี KDA และคอนเทกซ์ 1M

Moonshot AI ประกาศเปิดตัว Kimi K3 โมเดลภาษาขนาด 2.8 ล้านล้านพารามิเตอร์ที่มีความสามารถด้าน Vision ในตัว พร้อม Context Window ขนาดกว้างถึง 1 ล้าน Token โดย Moonshot ยกย่องให้เป็นโมเดลคลาส 3T แบบเปิดตัวแรกของโลก

Kimi K3 คืออะไร?

Kimi K3 คือโมเดลประเภท sparse Mixture-of-Experts (MoE) ที่พัฒนาขึ้นบนการอัปเกรดสถาปัตยกรรมสำคัญสองส่วน ได้แก่ Kimi Delta Attention (KDA) และ Attention Residuals (AttnRes) ซึ่งช่วยเพิ่มประสิทธิภาพการไหลของข้อมูลตามความยาวลำดับและความลึกของโมเดล โดย K3 ถูกออกแบบมาเพื่อรองรับงานด้านการเขียนโค้ด (Coding) ระยะยาว งานด้านคลังความรู้ และการใช้เหตุผลโดยเฉพาะ

ทีมงาน Moonshot ระบุว่า K3 เป็นโมเดลแบบเปิดรุ่นแรกที่มีพารามิเตอร์สูงถึง 2.8 ล้านล้านตัว ซึ่งตลอดช่วง 1 ปีที่ผ่านมา ผลิตภัณฑ์ในตระกูล Kimi ได้ทำลายสถิติขีดจำกัดด้านขนาดของโมเดลแบบเปิดมาอย่างต่อเนื่อง

อย่างไรก็ตาม Moonshot ยอมรับว่าประสิทธิภาพโดยรวมของ K3 ยังคงตามหลังโมเดลแบบปิด (Proprietary) ที่ทรงพลังที่สุดอย่าง Claude Fable 5 และ GPT 5.6 Sol แต่จากการทดสอบในชุดประเมินของ Moonshot เอง พบว่า K3 ทำผลงานได้เหนือกว่าโมเดลอื่นๆ ในระดับเดียวกันอย่างสม่ำเสมอ

Moonshot AI เปิดตัว Kimi K3: โมเดล Open MoE 2.8 ล้านล้านพารามิเตอร์ พร้อมเทคโนโลยี KDA และคอนเทกซ์ 1M

สถาปัตยกรรมเบื้องหลัง

Kimi Delta Attention (KDA) เป็นกลไก Hybrid Linear Attention ที่ช่วยให้การ Decoding เร็วขึ้นถึง 6.3 เท่า เมื่อต้องประมวลผลคอนเทกซ์ระดับล้าน Token

ในขณะที่ AttnRes ทำงานกับความลึกของโมเดล โดยจะเลือกดึงการนำเสนอข้อมูล (Representation) จากระดับความลึกต่างๆ แทนการสะสมแบบสม่ำเสมอ ซึ่งช่วยให้ประสิทธิภาพในการฝึกฝนสูงขึ้นประมาณ 25% โดยมีต้นทุนเพิ่มขึ้นเพียงไม่ถึง 2%

ด้าน Sparsity โมเดล K3 ใช้เทคโนโลยี Stable LatentMoE ซึ่งเรียกใช้งาน Expert จำนวน 16 ตัวจากทั้งหมด 896 ตัวได้อย่างมีประสิทธิภาพ นอกจากนี้ยังมีการใช้ Quantile Balancing เพื่อแก้ปัญหาการจัดสรร Expert โดยตรงผ่าน Router-score Quantiles ช่วยลดปัญหาจาก Heuristic Updates และการปรับ Hyperparameter ที่ตอบสนองไวเกินไป ส่วน Per-Head Muon, Sigmoid Tanh Unit (SiTU) และ Gated MLA ต่างเข้ามาช่วยเพิ่มประสิทธิภาพในการควบคุมและเลือกใช้ Attention ตามลำดับ

ด้วยกระบวนการฝึกฝนและชุดข้อมูลที่ผ่านการคัดเกลาอย่างละเอียด ควบคู่ไปกับการปรับปรุงโครงสร้างเหล่านี้ ส่งผลให้ประสิทธิภาพการสเกล (Scaling Efficiency) โดยรวมของ K3 ดีขึ้นกว่ารุ่น Kimi K2 ถึง 2.5 เท่า

สำหรับการใช้งานจริง (Serving) K3 ได้ใช้แนวทาง Quantization-aware Training ตั้งแต่ขั้นตอน SFT โดยใช้น้ำหนักแบบ MXFP4 และ Activation แบบ MXFP8 เพื่อให้รองรับฮาร์ดแวร์ได้หลากหลาย ทีม Moonshot แนะนำให้ใช้งานบน Supernode ที่มี Accelerator 64 ตัวขึ้นไป และเนื่องจาก KDA มีความท้าทายใหม่ในด้าน Prefix Caching ทาง Moonshot จึงได้ร่วมผลักดันฟีเจอร์นี้ไปใช้ใน vLLM ด้วย

ประสิทธิภาพ

ผลคะแนนการทดสอบของ K3 ที่ประกาศออกมานั้นมาจากการตั้งค่าการใช้เหตุผล (Reasoning Effort) ไว้ที่ระดับสูงสุด (Max) โดยอ้างอิงจากเบนช์มาร์กหลักอย่าง KimiCode, Claude Code และ Codex ดังนี้:

เบนช์มาร์กKimi K3Fable 5 (พร้อม fallback)GPT 5.6 SolOpus 4.8GLM-5.2
DeepSWE67.570.073.059.046.2
Program Bench77.876.877.671.963.7
Terminal Bench 2.188.384.688.884.682.7
FrontierSWE81.286.671.366.767.3
SWE Marathon42.035.039.040.013.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.212.9
GPQA-Diamond93.592.694.191.091.2
HLE-Full43.553.344.549.8
MMMU-Pro81.681.283.078.9
OmniDocBench91.189.885.887.9

หมายเหตุ: 'With fallback' ของ Fable 5 หมายถึงกรณีที่คำขอถูกปฏิเสธตามนโยบายการใช้งาน ระบบจะส่งต่อไปยัง Opus 4.8 แทน และใน BrowseComp มีการใช้การบีบอัดคอนเทกซ์ (Context Compaction) เมื่อถึงระยะ 300K Token หากไม่มีการจัดการนี้ K3 จะได้คะแนนอยู่ที่ 90.4

สรุปผลการทดสอบ K3 เป็นผู้นำใน Program Bench, SWE Marathon, BrowseComp, Automation Bench และ OmniDocBench โดยเป็นรอง Fable 5 ใน FrontierSWE และ HLE-Full และตามหลัง GPT 5.6 Sol ใน DeepSWE

กรณีการใช้งานและตัวอย่าง

กรณีการใช้งานตัวอย่างที่มีการรายงานสิ่งที่อาศัยเป็นหลัก
วิศวกรรมระดับ Repoเซสชันที่ยาวนาน, การควบคุมจากมนุษย์น้อยที่สุดKimi Code, /model
Vision ในการทำงานการสลับทำงานระหว่างโค้ดและภาพหน้าจอสดVision, ms://<file-id>
การจำลองงานวิจัยความสัมพันธ์ I–Love–Q: บทความ 20+ ฉบับ, Python 3,000+ บรรทัดคอนเทกซ์ 1M, auto caching
รายงานวิจัยเชิงลึกการศึกษา ASIC ระยะเวลา 42 ปี: การดึงข้อมูล 2.8k+ ครั้ง, 11k+ หน้าKimi Work, Widgets
การแยกวิเคราะห์เอกสารคะแนน OmniDocBench ที่ 91.1Vision, structured output

ทั้งนี้ สถาปัตยกรรมแบบ Native Multimodal ของ Moonshot สามารถประมวลผลทั้งข้อความ, รูปภาพ และวิดีโอร่วมกันได้อย่างไร้รอยต่อ

การเข้าถึงและการใช้งานเบื้องต้น

K3 พร้อมใช้งานแล้วผ่าน Kimi.com, Kimi Work, Kimi Code และ API โดยสามารถเรียกใช้งานได้ผ่าน OpenAI SDK โดยระบุ Base URL ของ Moonshot ดังนี้:

from openai import OpenAI
import os
client = OpenAI(api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1")
completion = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="max",
messages=[{"role": "user", "content": "Introduce Kimi K3 in one sentence."}],
)
print(completion.choices[0].message.content)

เงื่อนไขสำคัญคือ reasoning_effort รองรับเฉพาะค่า max เท่านั้น และไม่รองรับพารามิเตอร์ thinking จากรุ่น K2.x ส่วน temperature, top_p และ n ถูกกำหนดค่าตายตัวไว้แล้ว สำหรับ max_completion_tokens มีค่าเริ่มต้นที่ 131,072 และปรับสูงสุดได้ถึง 1,048,576

โครงสร้างราคาเป็นแบบอัตราคงที่: อินพุตเแบบ Cache-hit อยู่ที่ $0.30/MTok, Cache-miss อยู่ที่ $3.00/MTok และเอาต์พุตอยู่ที่ $15.00/MTok โดย Moonshot เผยว่าในงานด้าน Coding มีอัตรา Cache-hit สูงกว่า 90%

สรุปประเด็นสำคัญ

  • Kimi K3 เป็นโมเดล Open MoE ขนาด 2.8T พารามิเตอร์ ที่เปิดใช้งาน Expert 16 จาก 896 ตัว
  • มีประสิทธิภาพการสเกลดีขึ้น 2.5 เท่าเมื่อเทียบกับ K2 ด้วยเทคโนโลยี KDA, AttnRes และระบบ Sparsity แบบใหม่
  • ครองอันดับหนึ่งในเบนช์มาร์ก BrowseComp, SWE Marathon และ OmniDocBench
  • รองรับ OpenAI SDK ในราคาที่คุ้มค่า พร้อมรองรับคอนเทกซ์สูงสุด 1M

ตรวจสอบ รายละเอียทางเทคนิค และ

ทดลองใช้ที่นี่**.** นอกจากนี้ สามารถติดตามเราได้ที่

Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร