tag: Mixture-of-Experts

Cohere เปิดตัว North Small Translate โมเดล MoE 218B ชูประสิทธิภาพการแปล 50 ภาษา แซงหน้า Google Translate

Cohere เปิดตัว North Small Translate โมเดล MoE 218B ชูประสิทธิภาพการแปล 50 ภาษา แซงหน้า Google Translate

Cohere เปิดตัว North Small Translate โมเดลแปลภาษาแบบ open-weight สถาปัตยกรรม MoE ขนาด 218 พันล้านพารามิเตอร์ ซึ่งทำคะแนนทดสอบ WMT26 ได้สูงถึง 83.6 เหนือกว่าผู้นำในตลาดอย่าง Google Translate และ DeepL
DeepSeek ปล่อย DeepSeek-V4.1-Flash รุ่นใหม่: มาพร้อม 1M Context และนวัตกรรมประหยัด KV Cache ถึง 437 เท่า

DeepSeek ปล่อย DeepSeek-V4.1-Flash รุ่นใหม่: มาพร้อม 1M Context และนวัตกรรมประหยัด KV Cache ถึง 437 เท่า

DeepSeek-V4.1-Flash คือโมเดล Mixture-of-Experts มัลติโมดอลที่ออกแบบมาเพื่อลดปัญหาคอขวดของหน่วยความจำในการรัน Long-horizon agents โดยรองรับ Context Window สูงสุดถึง 1 ล้านโทเคน
AMD เปิดตัว Instella-MoE-16B-A3B โมเดล LLM แบบเปิดกว้างเต็มรูปแบบ ฝึกฝนบนชิป Instinct GPU

AMD เปิดตัว Instella-MoE-16B-A3B โมเดล LLM แบบเปิดกว้างเต็มรูปแบบ ฝึกฝนบนชิป Instinct GPU

· By: NatapolK
AMD เปิดตัว Instella-MoE-16B-A3B โมเดลภาษาขนาด 16B ที่ใช้พารามิเตอร์จริงเพียง 2.8B ต่อโทเค็น ฝึกฝนบน GPU Instinct MI300X และ MI325X พร้อมเปิดเผยชุดข้อมูลและโค้ดทั้งหมดเพื่อการวิจัย
Induction Labs เปิดตัว Photon-1 โมเดล MoE 106B ที่เรียนรู้การใช้คอมพิวเตอร์จากวิดีโอโดยไม่ต้องอาศัยการกำกับข้อมูล

Induction Labs เปิดตัว Photon-1 โมเดล MoE 106B ที่เรียนรู้การใช้คอมพิวเตอร์จากวิดีโอโดยไม่ต้องอาศัยการกำกับข้อมูล

Induction Labs เปิดตัว Photon-1 สถาปัตยกรรม imagination model ที่เรียนรู้พฤติกรรมการใช้งานคอมพิวเตอร์และฟิสิกส์พื้นฐานได้จากการวิเคราะห์วิดีโอดิบ โดยใช้ทรัพยากรน้อยกว่าคู่แข่งอย่าง Gemini ถึง 27 เท่า
Poolside เปิดตัว Laguna S 2.1 โมเดล Agentic Coding แบบ Open-Weight ระดับ 118B สยบยักษ์ใหญ่บน SWE-Bench

Poolside เปิดตัว Laguna S 2.1 โมเดล Agentic Coding แบบ Open-Weight ระดับ 118B สยบยักษ์ใหญ่บน SWE-Bench

Poolside เปิดตัว Laguna S 2.1 โมเดล Mixture-of-Experts ขนาด 118B ที่รองรับบริบทสูงสุด 1M tokens โดยทำผลงานชนะโมเดลขนาดใหญ่กว่าหลายเท่าในด้านการเขียนโค้ดและรันได้บน NVIDIA DGX Spark เพียงเครื่องเดียว
ศึก 3 ยักษ์ใหญ่ MoE จีน: เปรียบเทียบ Kimi K3, DeepSeek V4 Pro และ GLM-5.2 ในยุคโมเดลล้านล้านพารามิเตอร์

ศึก 3 ยักษ์ใหญ่ MoE จีน: เปรียบเทียบ Kimi K3, DeepSeek V4 Pro และ GLM-5.2 ในยุคโมเดลล้านล้านพารามิเตอร์

· By: TanasakP
การเปรียบเทียบโมเดล AI สัญชาติจีน 3 รุ่น ได้แก่ Kimi K3, DeepSeek V4 Pro และ GLM-5.2 พบว่า Kimi K3 มีประสิทธิภาพสูงสุดในระนาบเดียวกับโมเดลชั้นนำของโลก แต่ DeepSeek V4 Pro โดดเด่นด้านความคุ้มค่าของราคา API ในขณะที่ GLM-5.2 ให้ความเร็วในการประมวลผลสูงสุด
Moonshot AI เปิดตัว Kimi K3: โมเดล Open MoE 2.8 ล้านล้านพารามิเตอร์ พร้อมเทคโนโลยี KDA และคอนเทกซ์ 1M

Moonshot AI เปิดตัว Kimi K3: โมเดล Open MoE 2.8 ล้านล้านพารามิเตอร์ พร้อมเทคโนโลยี KDA และคอนเทกซ์ 1M

Moonshot AI เปิดตัว Kimi K3 โมเดลภาษาแบบ Open MoE ขนาด 2.8 ล้านล้านพารามิเตอร์ที่มาพร้อมความสามารถด้าน Vision และรองรับคอนเทกซ์สูงถึง 1 ล้าน Token โดยเน้นประสิทธิภาพด้านการเขียนโค้ดและงานวิจัยเชิงลึก
เปิดตัว Inkling: โมเดล Open Multimodal ระดับ 1 ล้านล้านพารามิเตอร์จาก Thinking Machines

เปิดตัว Inkling: โมเดล Open Multimodal ระดับ 1 ล้านล้านพารามิเตอร์จาก Thinking Machines

Thinking Machines เปิดตัว Inkling โมเดล open source ขนาดมหึมาที่รองรับอินพุตทั้งภาพ ข้อความ และเสียงแบบเนทีฟ พร้อม Context Window สูงถึง 1 ล้านโทเค็น และความสามารถด้านการใช้เหตุผลระดับสูง
Robbyant เปิดตัว LingBot-VLA 2.0: โมเดล VLA ขนาด 6B แบบ Open-Source คุมหุ่นยนต์ได้หลากหลายรูปแบบร่าง

Robbyant เปิดตัว LingBot-VLA 2.0: โมเดล VLA ขนาด 6B แบบ Open-Source คุมหุ่นยนต์ได้หลากหลายรูปแบบร่าง

· By: TanasakP
Robbyant จาก Ant Group เปิดตัว LingBot-VLA 2.0 โมเดลควบคุมหุ่นยนต์ข้ามรูปแบบร่างที่ฝึกฝนด้วยข้อมูลกว่า 60,000 ชั่วโมง โดยใช้สถาปัตยกรรม MoE และระบบพื้นที่การสั่งการมาตรฐาน 55 มิติเพื่อรองรับการสั่งงานที่ซับซ้อน
Tencent เปิดตัว Hy3 โมเดล AI โอเพนซอร์สสถาปัตยกรรม MoE ประสิทธิภาพแรงกว่าขนาดตัว 5 เท่า

Tencent เปิดตัว Hy3 โมเดล AI โอเพนซอร์สสถาปัตยกรรม MoE ประสิทธิภาพแรงกว่าขนาดตัว 5 เท่า

· By: NatapolK
Tencent เปิดตัวโมเดลภาษาขนาดใหญ่ Hy3 ชูจุดเด่นสถาปัตยกรรม MoE ที่มีพารามิเตอร์รวม 295 พันล้าน แต่ใช้ทรัพยากรประมวลผลจริงเพียง 21 พันล้านพารามิเตอร์ ให้ประสิทธิภาพสูงเทียบเท่าโมเดลขนาดใหญ่กว่าหลายเท่า พร้อมลดอัตราการหลอนลงกว่าครึ่ง