Sarvam AI เปิดตัว Saaras V4 โมเดลแปลงเสียงรองรับ 22 ภาษาอินเดีย

Sarvam AI ได้เปิดตัว Saaras V4 โมเดลรู้จำเสียงรุ่นล่าสุดที่ออกแบบมาให้ครอบคลุมทั้ง 22 ภาษาตามรัฐธรรมนูญของอินเดีย รวมถึงภาษาอังกฤษสำเนียงต่าง ๆ จากทั่วโลก โดยทาง Sarvam ระบุว่าโมเดลนี้มีความแม่นยำในระดับแถหน้าของวงการ (state-of-the-art) ในทุกภาษาที่รองรับ
ปัจจุบัน Saaras V4 พร้อมใช้งานแล้วผ่าน API ของ Sarvam โดยเรียกใช้ผ่าน model="saaras:v4" อย่างไรก็ตาม ตัว Weight ของโมเดลยังไม่ได้เปิดเป็นสาธารณะ และ เอกสารการโฮสต์ด้วยตนเองบน SageMaker ยังคงจำกัดอยู่ที่เวอร์ชัน Saaras v3 เท่านั้น
เจาะลึกโครงสร้าง Saaras V4
Saaras V4 ใช้สถาปัตยกรรมแบบ encoder-decoder โดยส่วน audio encoder จะแปลงคลื่นเสียงเป็น embeddings ที่บันทึกรายละเอียดทางสัทศาสตร์อย่างครบถ้วน จากนั้นจะมี temporal-downsampling adapter ทำหน้าที่ย่อข้อมูลเพื่อส่งเข้าสู่โมเดลภาษา ช่วยให้สามารถประมวลผลเสียงที่มีความยาวมากภายใต้ข้อจำกัด context window ของ decoder ได้
ในส่วนของ decoder ใช้ Sarvam-3B ซึ่งเป็นโมเดลภาษาแบบ hybrid state-space ขนาด 3 พันล้านพารามิเตอร์ที่บริษัทพัฒนาขึ้นเอง โมเดลจะวิเคราะห์คุณลักษณะของเสียงควบคู่กับ text prompt เพื่อสร้างบทถอดความแบบ autoregressively โดยใช้โทเคนก่อนหน้าเป็นข้อมูลนำเข้าสำหรับโทเคนถัดไป
ผลการทดสอบประสิทธิภาพ
ในการทดสอบ ภาษาอังกฤษ Sarvam ได้ประเมินผ่านชุดข้อมูล 7 ชุด ซึ่งรวมถึง Open ASR Leaderboard ของ Hugging Face และ Svarah ของ AI4Bharat พบว่า Saaras V4 มีค่าเฉลี่ยอัตราความผิดพลาดของคำ (WER) ต่ำที่สุดเมื่อเทียบกับคู่แข่ง
สำหรับการทดสอบ ภาษาอินเดีย ผ่านชุดข้อมูล Vistaar มีการใช้เกณฑ์ LLM-WER เพื่อตรวจสอบความถูกต้องทางอรรถศาสตร์ ซึ่งช่วยแยกแยะระหว่างความผิดพลาดด้านความหมายจริง ๆ กับความผันแปรของการสะกดในภาษาท้องถิ่น
นอกจากนี้ ในสภาวะที่มี เสียงรบกวน เช่น ชุดข้อมูล Kathbath Noisy ทางผู้พัฒนาระบุว่า Saaras V4 มีอัตราข้อผิดพลาดต่ำกว่าครึ่งหนึ่งเมื่อเทียบกับ Deepgram Nova-3 และ GPT-4o Transcribe ส่วนด้าน การระบุภาษา (Language ID) พบข้อผิดพลาดเพียง 2.9% สำหรับ 10 ภาษาหลัก และ 5.22% เมื่อทดสอบครบทั้ง 22 ภาษา อย่างไรก็ตาม ข้อมูลทั้งหมดนี้เป็นรายงานจากผู้พัฒนาและยังไม่มีผลการทดสอบจากหน่วยงานอิสระภายนอก
5 โหมดการแสดงผลในโมเดลเดียว
ผู้ใช้งานสามารถเลือกรูปแบบผลลัพธ์ได้ 5 โหมดผ่านพารามิเตอร์ mode เพื่อความสะดวกในการใช้งานที่หลากหลาย:
- transcribe (ค่าเริ่มต้น): แสดงอักษรท้องถิ่นพร้อมปรับรูปแบบตัวเลขและวันที่ให้เป็นมาตรฐาน
- verbatim: ถอดความทุกคำพูดรวมถึงคำสร้อย (fillers) และอ่านตัวเลขตามเสียงจริง
- codemix: ใช้ตัวอักษรท้องถิ่นแต่คงคำภาษาอังกฤษไว้ตามเดิม
- translit: ถอดเสียงทั้งหมดเป็นอักษรละติน
- translate: แปลเป็นภาษาอังกฤษพร้อมปรับรูปแบบข้อมูลให้เป็นมาตรฐาน
การรวมความสามารถเหล่านี้ไว้ในโมเดลเดียวช่วยลดขั้นตอนการปรับแต่งภายหลัง (post-processing) ซึ่งมักเป็นสาเหตุที่ทำให้เกิดข้อผิดพลาดสะสม
ฟีเจอร์ Keyterm Prompting
Keyterm prompting เป็นฟีเจอร์ใหม่ที่รองรับเฉพาะรุ่น V4 โดยผู้ใช้สามารถส่งรายการ JSON ของ keyterms ได้สูงสุด 50 คำ (คำละไม่เกิน 64 ตัวอักษร) เพื่อช่วยชี้นำการตรวจจับคำเฉพาะทาง เช่น ชื่อแบรนด์ ซึ่งจากการทดสอบใน IndicContextEval (งานวิจัย) Saaras V4 ทำคะแนน WER ได้ต่ำที่สุดใน benchmark นี้ที่ 16.03%
การเชื่อมต่อและราคาการให้บริการ
โมเดลรองรับการใช้งานหลายรูปแบบ:
- Streaming: ผ่าน WebSocket โดยมีความหน่วงจนถึงโทเคนแรก (TTFT) ต่ำกว่า 150 ms
- REST API: สำหรับการถอดความแบบ synchronous ในคลิปสั้นไม่เกิน 30 วินาที
- Batch: งานแบบ asynchronous รองรับไฟล์ยาวสูงสุด 2 ชั่วโมง พร้อมระบบแยกแยะผู้พูด
- SDKs: รองรับ Python, Node.js และบูรณาการร่วมกับเครื่องมืออย่าง LiveKit Agents, Pipecat และ Vercel AI SDK
Sarvam กำหนดราคาเริ่มต้นที่ 30 รูปีต่อชั่วโมง สำหรับบริการทั่วไป และ 45 รูปีต่อชั่วโมงหากต้องการฟีเจอร์แยกแยะผู้พูด โดยผู้ที่ใช้งานรุ่น V3 อยู่เดิมสามารถอัปเกรดเป็น V4 ได้ง่าย ๆ เพียงแก้ไขโค้ดระบุชื่อรุ่นเท่านั้น
ตารางเปรียบเทียบ Saaras V4 กับคู่แข่ง
ข้อมูลอ้างอิงจากการทดสอบและราคาประกาศ ณ วันที่ 26 กันยายน 2026:
| ฟีเจอร์ | Sarvam Saaras V4 | Deepgram Nova-3 | ElevenLabs Scribe v2 | OpenAI GPT-4o Transcribe |
|---|---|---|---|---|
| ภาษาอินเดีย (จาก 22) | 22 | 11 | 14 | ไม่ระบุรายภาษา |
| ภาษารวมทั้งหมด | 23 | 45+ | 90+ | รองรับหลายภาษา |
| Keyterm biasing | สูงสุด 50 คำ | มี (ชำระเงินเพิ่ม) | สูงสุด 50-1,000 | Free-text prompt |
| โหมดการแสดงผล | 5 รูปแบบ | Transcript + Smart Format | Verbatim Option | Transcript |
| ความเร็ว TTFT | < 150 ms | มี (WebSocket) | ~ 150 ms | ผ่าน Realtime API |
| ราคาประกาศ | ₹30/ชั่วโมง | $0.0052/นาที | $0.22/ชั่วโมง | ~$0.006/นาที |
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
