สรุปโมเดลจดจำเสียง (ASR) แบบเปิดปี 2026: เมื่อคะแนน WER ไม่ใช่คำตอบสุดท้ายอีกต่อไป

การจดจำเสียงแบบเปิด (Open speech recognition) ก้าวข้ามผ่านยุคที่ Whisper ครองตลาดเพียงผู้เดียวในช่วงสิบสองเดือนที่ผ่านมา โดยในเดือนมีนาคม 2026 Cohere ได้เปิดตัว Transcribe โมเดล Apache 2.0 ขนาด 2B ที่คว้าอันดับหนึ่งบน Hugging Face Open ASR Leaderboard ด้วยค่าเฉลี่ยความผิดพลาด (WER) 5.42%
อย่างไรก็ตาม เพียงห้าสัปดาห์หลังจากนั้น IBM ได้ส่งมอบ Granite Speech 4.1 2B ที่ทำคะแนนได้ 5.33% ตามมาด้วย ARK-ASR-3B และ MOSS-Transcribe-preview-2B ที่ทำสถิติต่ำลงไปอีก จนปัจจุบันส่วนบนของตารางมีคะแนนห่างกันไม่ถึงหนึ่งจุด
ภาวะดังกล่าวส่งผลให้ลำดับบนตารางไม่ใช่ตัวแปรตัดสินความเก่งอีกต่อไป แต่ผู้ใช้งานต้องพิจารณาปัจจัยอื่นร่วมด้วย เช่น ใบอนุญาต การครอบคลุมภาษา การรองรับการสตรีม และความคุ้มค่าของราคาต่อชั่วโมง ซึ่งบทสรุปนี้จะเจาะลึกการเปรียบเทียบในมุมต่างๆ
ประการแรก ปัญหาของตัวเลขในตารางผู้นำที่ทุกคนอ้างถึง
ค่าเฉลี่ยบน Open ASR Leaderboard นั้นไม่ใช่ค่าคงที่ที่นำมาเปรียบเทียบกันได้โดยตรงเสมอไป เนื่องจากโมเดลแต่ละตัวอาจถูกทดสอบด้วยชุดข้อมูลที่ต่างกัน เช่น คะแนนของ Cohere มาจากการเฉลี่ยชุดทดสอบ 8 ชุด รวมถึง TED-LIUM ในขณะที่ ARK-ASR-3B ใช้เพียง 7 ชุดโดยตัด TED-LIUM ซึ่งเป็นชุดข้อมูลที่ง่ายกว่าออก ส่งผลให้ค่าเฉลี่ยดูดีขึ้นเกินจริงหากเทียบแบบตัวต่อตัว
นอกจากนี้ยังมีประเด็นเรื่องการปรับแต่งโมเดล (Fine-tuned) ให้เข้ากับชุดข้อมูลทดสอบโดยเฉพาะ เช่น กรณีของ MOSS-Transcribe-preview-2B ที่ระบุว่าใช้ reinforcement learning บนชุดข้อมูลฝึกของตารางผู้นำโดยตรง ซึ่งหมายความว่าคะแนนที่ได้อาจสะท้อนถึงการทำข้อสอบเก่าได้ดีมากกว่าความสามารถในการใช้งานจริงในสภาวะทั่วไป
อีกปัจจัยคือข้อมูลในชุดส่วนตัว (Private-track data) จาก Appen ที่พบว่าเมื่อทดสอบกับสำเนียงที่หลากหลายและเสียงสนทนาตามธรรมชาติ ลำดับบนตารางจะเปลี่ยนไปทันที โดยโมเดลที่เก่งเฉพาะเสียงอ่านที่สะอาดจะประสิทธิภาพลดลงอย่างมาก ดังนั้นจึงควรใช้ตารางผู้นำเพียงเพื่อสร้างกลุ่มตัวเลือก (Shortlist) เท่านั้น
ระดับความแม่นยำ (The accuracy tier)
Cohere Transcribe (2B, Apache 2.0, 14 ภาษา) เป็นโมเดลที่พร้อมใช้งานจริงและได้รับความนิยมสูง รองรับทั้งการรันผ่าน
transformersvLLM และอุปกรณ์ Apple Silicon ข้อดีคือความแม่นยำในด้านชื่อเฉพาะและลดการเกิดภาพหลอน แต่มีข้อจำกัดที่ไม่มีระบบตรวจจับภาษาอัตโนมัติและไม่มีการประทับเวลา (Timestamps) จึงเหมาะกับการทำงานที่มีขั้นตอน VAD นำหน้าประมวลผล
Granite Speech 4.1 2B (2B, Apache 2.0) ของ IBM คือตัวเลือกที่ครบเครื่องกว่าหากต้องการฟีเจอร์เสริม รองรับ 6 ภาษาหลักพร้อมความสามารถในการแปลภาษาแบบสองทิศทาง การกำหนดความสำคัญของคำสำคัญ (Keyword biasing) และการปรับรูปแบบตัวพิมพ์ที่แม่นยำ โดย IBM ยังมีรุ่นย่อยที่รองรับการระบุตัวผู้พูด (Diarization) อีกด้วย
Canary-Qwen-2.5B (2.5B, CC-BY-4.0) เป็นโมเดลภาษาอังกฤษที่ผสมผสานพลังของ Qwen3 สามารถเลือกโหมดการทำงานได้ทั้งถอดความล้วนๆ หรือใช้ LLM สรุปความและตอบคำถามจากเสียงได้ทันที ขณะที่ Qwen3-ASR-1.7B (Apache 2.0) จะเป็นตัวเลือกที่ดีที่สุดสำหรับงานที่เกี่ยวข้องกับภาษาจีนและสำเนียงท้องถิ่นซึ่งรองรับรวมกว่า 52 ภาษา
ระดับการจัดการปริมาณงาน (The throughput tier)
ในขณะที่ความแม่นยำอาจต่างกันเพียง 1% แต่ปริมาณงาน (Throughput) ของแต่ละโมเดลอาจต่างกันได้มากกว่าสิบเท่า ซึ่งส่งผลโดยตรงต่อต้นทุนค่า GPU
Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) คือผู้นำด้านความเร็ว โดยทำความเร็ว RTFx ได้สูงถึง 3332.74 จัดการเสียงยาว 24 นาทีได้ในการประมวลผลรอบเดียว แม้จะมีค่า WER สูงกว่ารายอื่นเล็กน้อยแต่ให้ประสิทธิภาพต่อวินาทีของ GPU มากกว่าถึง 14 เท่า
Granite Speech 4.1 2B-NAR ก็น่าสนใจด้วยสถาปัตยกรรมแบบ non-autoregressive ที่แก้ไขข้อความได้ในการประมวลผลรอบเดียว ทำความเร็วบน H100 ได้อย่างน่าประทับใจ เช่นเดียวกับ Qwen3-ASR-0.6B ที่คงจำนวนภาษาไว้ครบถ้วนแต่เพิ่มปริมาณงานได้มหาศาล
ระดับการสตรีม (The streaming tier)
สำหรับการใช้งานที่ต้องการความเรียลไทม์ ค่า WER แบบประมวลผลเป็นชุดอาจไม่ใช่ตัววัดที่เหมาะสมที่สุด
Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 ภาษา) ถูกออกแบบมาเพื่อการสตรีมที่ไร้ขีดจำกัดด้วยเทคโนโลยี sliding-window attention สามารถตั้งค่าการหน่วงเวลาได้ต่ำถึง 80ms และทำงานได้ดีบน GPU ขนาดเล็กเพียง 16GB พร้อมรองรับ vLLM Realtime API ทันที
การรองรับ vLLM Realtime API ตั้งแต่วันแรก
Kyutai STT (CC-BY-4.0) โดดเด่นด้วยระบบตรวจจับกิจกรรมเสียงเชิงความหมาย (Semantic VAD) ซึ่งช่วยให้ AI ทราบได้ว่าผู้พูดพูดจบประเด็นจริงๆ เมื่อใด ช่วยลดความหน่วงในการสลับตาพูด (Turn-taking) ในระบบ AI Agent ให้ดูเป็นธรรมชาติมากขึ้น
ระดับการครอบคลุม (The coverage tier)
Meta’s Omnilingual ASR (Apache 2.0) ไม่ได้ลงแข่งเรื่องความแม่นยำบนตารางผู้นำ แต่เน้นการครอบคลุมภาษาที่โลกเข้าไม่ถึง โดยรองรับภาษาพื้นฐานกว่า 1,600 ภาษา และขยายได้ถึง 5,400+ ภาษาผ่านการเรียนรู้ในบริบท นับเป็นก้าวสำคัญสำหรับภาษาที่ขาดแคลนทรัพยากรข้อมูล
Whisper large-v3 (1.55B, MIT) แม้จะถูกโมเดลรุ่นใหม่แซงหน้าด้านความแม่นยำไปแล้ว แต่มันยังคงเป็นมาตรฐานหลักด้วยใบอนุญาต MIT ที่ยืดหยุ่นที่สุดและระบบนิเวศการรันที่แข็งแกร่งที่สุด หากโจทย์คือการทำงานบนฮาร์ดแวร์ทั่วไปโดยไม่ต้องการความซับซ้อนด้านกฎหมาย Whisper ยังคงเป็นคำตอบที่ปลอดภัย
ขอบเขตการวิจัย (The research edge)
diffusion-gemma-asr-small จาก Interfaze นำเสนอวิธีคิดใหม่ด้วยการใช้ต้นแบบ parallel diffusion denoising ในการผลิตข้อความ ทำให้ค่าใช้จ่ายในการถอดรหัสไม่ผูกติดกับความยาวของข้อความ แม้จะยังไม่เหมาะกับการใช้งานจริงเต็มรูปแบบแต่เป็นแนวทางที่น่าจับตา
MOSS-Transcribe-Diarize 0.9B (Apache 2.0) แก้ปัญหาจุดบอดที่หลายค่ายละเลย โดยสามารถพ่นทั้งป้ายกำกับผู้พูด การเข้าจังหวะคำ และข้อความถอดความออกมาได้พร้อมกันในขั้นตอนเดียว ช่วยลดความซับซ้อนในการต้องรันระบบระบุตัวผู้พูดแยกต่างหาก
ความแตกต่างของใบอนุญาตที่ไม่มีใครอ่านจนกว่าจะนำไปใช้งานจริง
ใบอนุญาตคือตัวตัดสินว่าโครงการจะไปต่อได้หรือไม่ในเชิงธุรกิจ:
- Apache 2.0: รวมถึง Cohere, Granite, Qwen3 และ Voxtral ใช้งานเชิงพาณิชย์ได้ไม่จำกัดและไม่ต้องให้เครดิต
- MIT: Whisper large-v3 ผ่อนปรนที่สุดในบรรดาทั้งหมด
- CC-BY-4.0: เช่น Canary และ Kyutai ใช้งานเชิงพาณิชย์ได้แต่ "ต้องให้เครดิต" ซึ่งอาจเป็นอุปสรรคสำหรับผลิตภัณฑ์แบบ White-label หรือระบบฝังตัว
วิธีการเลือกที่แท้จริง
ในการเลือกโมเดลใช้งานจริง อย่าดูเพียงตารางผู้นำ แต่ควรไล่เรียงตามลำดับความสำคัญดังนี้: เริ่มจาก ใบอนุญาต ที่ธุรกิจยอมรับได้ ต่อด้วย การครอบคลุมภาษา ที่จำเป็น และรูปแบบการใช้งานว่าเป็นแบบ สตรีมหรือประมวลผลเป็นชุด
สุดท้ายคือการ วัดค่า WER บนเสียงจริงของคุณเอง เพราะส่วนต่างเพียงเล็กน้อยบนตารางผู้นำ อาจกลายเป็นความต่างมหาศาลเมื่อเจอกับสภาพเสียงและสำเนียงในโลกแห่งความเป็นจริง รวมถึงการคำนวณราคาต่อชั่วโมงบน GPU ที่คุณมี เพื่อหาโมเดลที่คุ้มค่าและมีประสิทธิภาพสูงสุดสำหรับงานนั้นๆ
แหล่งข้อมูล:
Cohere Transcribe blog และ model card IBM Granite Speech 4.1 2B และ 4.1 2B-NAR ARK-ASR-3B MOSS-Transcribe-preview-2B และ MOSS-Transcribe-Diarize NVIDIA Canary-Qwen-2.5B และ Parakeet TDT 0.6B v3 Qwen3-ASR · Voxtral Mini 4B Realtime 2602 Kyutai STT Meta Omnilingual ASR และ paper Whisper large-v3 diffusion-gemma-asr Open ASR Leaderboard paper, leaderboard dataset, และ Appen private-track announcement
ตำแหน่งบนตารางสมรรถนะเป็นแบบสดและเปลี่ยนแปลงบ่อย ตัวเลขทั้งหมดได้รับการตรวจสอบกับแหล่งข้อมูลปฐมภูมิเมื่อวันที่ 23 กรกฎาคม 2026
Asif Razzaq เป็น CEO ของ Marktechpost Media Inc.. ในฐานะผู้ประกอบการและวิศวกรที่มีวิสัยทัศน์ Asif มุ่งมั่นที่จะใช้ศักยภาพของปัญญาประดิษฐ์เพื่อประโยชน์ต่อสังคม ความพยายามล่าสุดของเขาคือการเปิดตัวแพลตฟอร์มสื่อ Artificial Intelligence อย่าง Marktechpost ซึ่งโดดเด่นในด้านการนำเสนอข่าวสารด้าน machine learning และ deep learning ที่มีเนื้อหาทางเทคนิคที่มั่นคงและเข้าใจง่ายสำหรับผู้ชมในวงกว้าง แพลตฟอร์มนี้มียอดชมมากกว่า 2 ล้านครั้งต่อเดือน ซึ่งแสดงให้เห็นถึงความนิยมในกลุ่มผู้ชม
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
