Cohere เปิดตัว North Small Translate โมเดล MoE 218B ชูประสิทธิภาพการแปล 50 ภาษา แซงหน้า Google Translate

Cohere เปิดตัว North Small Translate โมเดล MoE 218B ชูประสิทธิภาพการแปล 50 ภาษา แซงหน้า Google Translate

Cohere และ Cohere Labs ประกาศเปิดตัว North Small Translate โมเดลการแปลภาษาด้วยเครื่องแบบ open-weight ที่ใช้สถาปัตยกรรม sparse Mixture-of-Experts (MoE) โดยมีพารามิเตอร์รวม 218B และมีพารามิเตอร์ที่ทำงานจริง (active parameters) 25B รองรับการแปลครอบคลุมถึง 50 ภาษา ตั้งแต่ภาษาแอลเบเนียไปจนถึงภาษาเวียดนาม

จากการประเมินด้วยเกณฑ์ WMT26 ของ Cohere โมเดลนี้ทำคะแนนเฉลี่ยได้สูงถึง 83.6 ในทุกภาษา ซึ่ง Cohere ระบุว่าสามารถเอาชนะทั้ง DeepL และ Google Translate รวมถึงโมเดลแบบเปิดอย่าง GLM 5.2 และ Mistral Large 3 ได้สำเร็จ โดยผู้ใช้งานสามารถเข้าถึงได้ฟรีผ่าน API ของ Cohere ตามขีดจำกัดที่กำหนด หรือเลือกติดตั้งใช้งานเอง (self-host) สำหรับโครงการที่ไม่ใช่เชิงพาณิชย์

กลับสู่จุดเริ่มต้นของ Transformer

การเปิดตัวครั้งนี้ถือเป็นการกลับมาสู่รากเหง้าของเทคโนโลยี Transformer ที่นักวิจัย Google เคยนำเสนอไว้ในบทความ Attention Is All You Need เมื่อปี 2017 ซึ่งเน้นไปที่การแปลภาษาเป็นหลัก โดย 9 ปีให้หลัง Cohere ได้นำประเด็นนี้มาพัฒนาต่อยอดผ่านโมเดลเฉพาะทาง ซึ่งใน โพสต์เปิดตัวของ Cohere บน X ได้นิยามว่าการแปลภาษาเป็นเรื่องของอำนาจอธิปไตยทางข้อมูลที่องค์กรระดับโลกจำเป็นต้องมี

North Small Translate เป็นโมเดลลำดับแรกในตระกูล North ของ Cohere ซึ่งพัฒนาต่อยอดจากความสำเร็จของ Tiny Aya และ Command A Translate โดยได้รับความร่วมมือจาก RWS และผู้เชี่ยวชาญจาก Language Weaver ในการปรับแต่งคุณภาพให้พร้อมสำหรับการใช้งานจริงในภาคธุรกิจ

สถาปัตยกรรม (Architecture)

โครงสร้างโมเดล เป็นแบบ Transformer sparse MoE ที่ใช้เฉพาะส่วน decoder-only โดยมีรายละเอียดทางเทคนิคที่น่าสนใจดังนี้:

  • Experts: มีทั้งหมด 128 experts โดยจะเลือกเปิดใช้งาน 8 experts ต่อ token พร้อมมี shared experts ที่ประมวลผลทุก token
  • Router: ใช้ระบบ sigmoid เหนือ expert logits และปรับให้เป็นค่ามาตรฐาน (normalized) ในกลุ่ม top-k ที่เลือก
  • Attention: ผสมผสานระหว่าง Sliding-window (4096, RoPE) และ global layers ในสัดส่วน 3:1 ซึ่งเป็นรูปแบบที่เคยใช้ใน Command A
  • Context: รองรับ input และ output สูงสุดอย่างละ 16K tokens สำหรับข้อมูลรูปแบบข้อความ

แม้โมเดลจะมีขนาดรวม 218B แต่เนื่องจากเป็นระบบ MoE จึงมีการทำงานจริงเพียง 11.5% หรือประมาณ 25B พารามิเตอร์ต่อหนึ่ง token อย่างไรก็ตาม ในการติดตั้งใช้งาน หน่วยความจำของระบบยังจำเป็นต้องรองรับพารามิเตอร์ทั้งหมดให้ได้

ผลการทดสอบ (Benchmarks)

ทีมงานได้รายงานคะแนนจาก บล็อกเปิดตัว โดยเปรียบเทียบกับคู่แข่งรายสำคัญ ดังนี้:

โมเดลคะแนน WMT26
North Small Translate (Agentic)84.36
North Small Translate83.60
Qwen 3.5 397B A17B81.56
DeepL NextGen81.37
Gemma 4 31B (on)79.46
GLM 5.2 FP876.50
Google Translate68.20

สำหรับเวอร์ชัน Agentic จะทำงานในลักษณะ multi-pass เพื่อตรวจสอบและแก้ไขข้อผิดพลาดด้วยตัวเอง ทั้งนี้ คะแนนในช่วง 80-100 ถือว่าเป็นระดับที่เกือบสมบูรณ์แบบ อย่างไรก็ตาม ผลการทดสอบนี้เป็นการรันโดย Cohere และตัดสินผลด้วย GPT-5.6-Sol ซึ่งควรรอการยืนยันจากผลทดสอบอิสระของ WMT26 เพิ่มเติม

ความเร็ว เอกสารยาว และความคุ้มค่า

ในแง่ของประสิทธิภาพการทำงาน North Small Translate สามารถสร้างผลลัพธ์ได้ 112 tokens ต่อวินาที ซึ่งสูงกว่า Gemma 4 31B ที่ทำได้ 81 tokens หรือคิดเป็น throughput ที่สูงกว่า 1.4 เท่า นอกจากนี้ยังโดดเด่นในการแปลเอกสารยาว โดยทำคะแนนคุณภาพต่อย่อหน้าได้ 48.9 เมื่อแปลหนังสือ 2 บทพร้อมกัน ซึ่งสูงกว่า Google Translate ที่ทำได้เพียง 21.3

ด้านความคุ้มค่าทางการเงินพบว่ามีความโดดเด่นอย่างมาก โดยมีต้นทุนเพียง $0.000676 ต่อหนึ่งงานวิจัย (เฉลี่ย 661 tokens) ในขณะที่ Gemini 3.1 Pro Preview มีต้นทุนสูงถึง $0.038928 หรือแพงกว่ากันถึง 58 เท่า

วิธีการรันโมเดล

ผู้ที่สนใจสามารถเริ่มต้นใช้งานได้ทันทีผ่าน Chat V2 API ของ Cohere โดยมีตัวอย่างการเรียกใช้งานผ่าน Python ดังนี้:

from cohere import ClientV2
co = ClientV2(api_key="<YOUR_API_KEY>")
response = co.chat(
model="north-small-translate-1-0",
messages=[{"role": "user",
"content": "Translate everything that follows into French:\n\nEnterprises need accurate translations of business-critical documents."}],
)
print(response.message.content[0].text)

สำหรับการติดตั้งในเซิร์ฟเวอร์ส่วนตัว Cohere ได้เตรียม checkpoint ไว้ 3 รูปแบบ เพื่อรองรับฮาร์ดแวร์ที่แตกต่างกัน:

CheckpointBlackwellHopper
FP81x B2004x H100 (80GB)
NVFP41x B200N/A
W4A16N/A2x H100 (80GB)

สรุปประเด็นสำคัญ

  • North Small Translate เป็นโมเดล MoE ขนาดใหญ่ 218B แต่มี Active Parameters เพียง 25B
  • ผลการทดสอบ WMT26 โดดเด่นที่ 83.6 คะแนน และขยับขึ้นเป็น 84.36 ในโหมด Agentic
  • มีประสิทธิภาพเหนือกว่าคู่แข่งทั้งในด้านความเร็ว ความแม่นยำของเอกสารยาว และความคุ้มค่าด้านต้นทุน
  • รองรับการรันบนฮาร์ดแวร์ระดับสูงอย่าง 1x B200 หรือ 2x H100 สำหรับ checkpoint แบบ 4-bit
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร