NVIDIA เปิดตัว Magpie TTS โมเดลสร้างเสียงหลายภาษาแบบ Open Weights ชูจุดเด่นความหน่วงต่ำระดับมิลลิวินาที
ในการโต้ตอบด้วยเสียงทุกครั้ง "งบประมาณความหน่วง" (latency budget) คือหัวใจสำคัญ ก่อนที่ผู้ใช้จะได้รับยินเสียงตอบกลับจากแอปพลิเคชัน ระบบต้องผ่านกระบวนการตั้งแต่นับมิลลิวินาทีแรกในการจับเสียง ถอดความ (transcribing) ประมวลผลผ่าน LLM ไปจนถึงการดึงข้อมูลบริบท โดย Text-to-speech (TTS) คือขั้นตอนสุดท้ายและสำคัญที่สุด เพราะหากขั้นตอนนี้ล่าช้า ประสบการณ์ใช้งานทั้งหมดจะดูอืดอาดทันทีในความรู้สึกของผู้ใช้
การที่นักพัฒนาสามารถรันและปรับแต่งไปป์ไลน์ได้ด้วยตัวเองจึงเป็นเรื่องจำเป็น แม้โมเดลเสียงแบบเบ็ดเสร็จ (Integrated speech models) จะมอบความสะดวกผ่าน API แต่ก็ต้องแลกกับการขาดอิสระในการปรับจูน (fine-tune) เฉพาะทาง การสลับโมเดลที่ดีกว่า หรือการควบคุมที่จัดเก็บข้อมูลในประเทศ (data residency) เพื่อการควบคุมที่เหนือกว่า สถาปัตยกรรมแบบลดหลั่น (cascaded architecture) ซึ่งแยกส่วนประกอบ ASR, TTS และ LLM ออกจากกัน จึงช่วยให้แต่ละเลเยอร์สามารถปรับจูนและติดตั้งบนโครงสร้างพื้นฐานที่เป็นเจ้าของเองได้อย่างมีประสิทธิภาพ
NVIDIA Magpie Multilingual TTS ถูกสร้างขึ้นเพื่อตอบโจทย์นี้ ด้วยรูปแบบ open weights และ NVIDIA NIM ที่พร้อมสำหรับการใช้งานจริง โมเดลนี้รองรับถึง 12 ภาษา ช่วยให้คุณติดตั้งระบบเสียงพูดหลายภาษาภายในโครงสร้างพื้นฐานของตนเอง ปรับแต่งความหน่วงให้เหมาะกับงาน และปรับจูนโมเดลแบบ end-to-end ได้ตามความต้องการ
การอัปเดตล่าสุดนี้ได้ขยายการรองรับภาษาเพิ่มเติม ได้แก่ ภาษาอาหรับมาตรฐานสมัยใหม่, ภาษาเกาหลี และภาษาโปรตุเกสแบบบราซิล พร้อมปรับปรุงคุณภาพในภาษาเดิมผ่านชุดข้อมูลใหม่และการพัฒนาโครงสร้างโมเดล ไม่ว่าจะเป็นเอเจนต์สนับสนุนลูกค้า ผู้ช่วยด้านการดูแลสุขภาพ หรือระบบแปลภาษา Magpie พร้อมมอบรากฐานแบบเปิดสำหรับ Voice AI ในระดับการใช้งานจริง
Voice AI กำลังกลายเป็นระบบหลายภาษาโดยค่าเริ่มต้น
แอปพลิเคชันเสียงในปัจจุบันไม่ได้จำกัดอยู่เพียงภาษาเดียวอีกต่อไป ความต้องการการสนทนาที่เป็นธรรมชาติในหลายภาษาเพิ่มสูงขึ้นอย่างมาก ทั้งในงานสนับสนุนลูกค้าระดับโลกและระบบอัตโนมัติในค้าปลีก โดยยังต้องรักษาความหน่วงให้ต่ำที่สุด ซึ่งนอกจากจำนวนภาษาแล้ว นักพัฒนายังต้องการความสามารถในการติดตั้งในแหล่งที่ข้อมูลจัดเก็บอยู่ เพื่อตอบโจทย์ความเป็นส่วนตัว ปรับแต่งการออกเสียง และขยายขนาดบนโครงสร้างพื้นฐานของตนเอง ซึ่งโมเดลแบบเปิด (Open models) ได้เข้ามาเปลี่ยนข้อจำกัดเหล่านี้ทั้งหมด
หนึ่งโมเดลเปิด, สิบสองภาษา
Magpie TTS Multilingual เป็นโมเดล open-weights ขนาด 364 ล้านพารามิเตอร์ที่รองรับภาษาอังกฤษ, สเปน, ฝรั่งเศส, เยอรมัน, อิตาลี, เวียดนาม, จีนกลาง, ฮินดี, ญี่ปุ่น รวมถึงภาษาใหม่อย่างอาหรับมาตรฐานสมัยใหม่, เกาหลี และโปรตุเกสแบบบราซิล โดยแต่ละภาษามีเสียงผู้พูดทั้งชายและหญิงผ่าน multilingual speaker representation ร่วมกัน
นอกจากนี้ยังเพิ่มความยืดหยุ่นด้วยการขยายการรองรับการสลับภาษา (code-switching) สำหรับภาษาฮินดีและภาษาญี่ปุ่น โดยใช้การประมวลผล IPA grapheme-to-phoneme และพจนานุกรมการออกเสียงแบบกำหนดเอง ช่วยให้การออกเสียงชื่อเฉพาะหรือศัพท์เทคนิคที่มีหลายภาษาผสมกันทำได้แม่นยำยิ่งขึ้น ทำให้นักพัฒนาไม่ต้องดูแลโมเดลแยกกันหลายชุดสำหรับแต่ละภูมิภาค
ความหน่วงที่ผู้ใช้ของคุณสังเกตเห็นจริงๆ
ในระบบ Conversational AI ค่า Time to First Audio (TTFA) หรือระยะเวลาก่อนที่เสียงแรกจะถูกส่งถึงผู้ใช้ คือตัวชี้วัดที่สำคัญที่สุด เนื่องจาก Magpie TTS สามารถติดตั้งในสภาพแวดล้อมของคุณเอง ความหน่วงที่วัดได้จึงเป็นความหน่วงฝั่งเซิร์ฟเวอร์ที่คุณควบคุมได้จริง โดยไม่ต้องเสียเวลาไป-กลับ (round-trip) ของบริการแบบภายนอก
| GPU | 1-stream TTFA | 1-stream RTFX | 64-stream TTFA | 64-stream RTFX |
|---|---|---|---|---|
| B200 | 32 ms | 12.1× | 239 ms | 319.81× |
| H100 | 47ms | 14.7× | 275 ms | 290.79× |
| DGX Spark | 53 ms | 9.8× | 962 ms | 75.88× |
| A100 | 79 ms | 12.2× | 395 ms | 197× |
ที่มา: เอกสารประกอบประสิทธิภาพ NVIDIA TTS NIM (v26.07), ค่าเฉลี่ยจากการทดสอบสามครั้ง, ติดตั้งในพื้นที่ (on-prem)
ด้วยเวลาเพียง 32ms บน GPU B200 ช่วยคืนงบประมาณความหน่วงให้กับส่วนประมวลผลอื่น ทำให้ความหน่วงรวม (end-to-end) ต่ำกว่า 200ms ซึ่งเป็นระดับที่จำเป็นสำหรับการสนทนาที่เป็นธรรมชาติ แม้จะทำงานพร้อมกันถึง 64 สตรีม B200 ก็ยังให้ปริมาณงานสูงกว่าเวลาจริงถึง 320 เท่า ช่วยให้การสนทนาตอบสนองได้อย่างทันใจ
ปรับแต่งมาเพื่อการสร้างเสียงพูดแบบเรียลไทม์
ความหน่วงที่ต่ำนี้มาจากการปรับปรุงทางสถาปัตยกรรมสองส่วนหลักคือ Frame stacking ที่ตัวถอดรหัสจะคาดการณ์เฟรมเสียงทีละสองเฟรม ช่วยลดรอบการทำงานลงครึ่งหนึ่ง และ Local transformer ที่ช่วยสร้างโมเดลความสัมพันธ์ของโทเคนเพื่อขัดเกลาคุณภาพเสียงให้เป็นธรรมชาติ สถาปัตยกรรมนี้ถูกอธิบายรายละเอียดไว้ใน Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation (ICASSP 2026)
ความเร็วจะไม่มีความหมายเลยหากเสียงไม่เป็นธรรมชาติ
นอกจากการเพิ่มภาษาแล้ว การเปิดตัวครั้งนี้ยังปรับปรุงคุณภาพการสังเคราะห์เสียงในภาษาเดิมอย่างเห็นได้ชัด โดยมีอัตราข้อผิดพลาดของตัวอักษร (CER) ลดลง และความคล้ายคลึงของผู้พูด (SSIM) สูงขึ้น โดยเฉพาะในภาษาฝรั่งเศสและสเปน
| ภาษา | CER (เดิม) | CER (การเปิดตัวนี้) | SSIM (เดิม) | SSIM (การเปิดตัวนี้) |
|---|---|---|---|---|
| ฝรั่งเศส | 2.70% | 1.54% | 0.703 | 0.747 |
| สเปน | 1.14% | 0.60% | 0.715 | 0.793 |
| เยอรมัน | 0.66% | 0.80% | 0.626 | 0.742 |
ที่มา: Magpie TTS Multilingual model card ค่า CER ยิ่งต่ำยิ่งดี; ค่า SSIM ยิ่งสูงยิ่งดี
ทำไม Open Weights ถึงมีความสำคัญ
Open weights มอบอำนาจในการเป็นเจ้าของระบบให้นักพัฒนาอย่างเต็มรูปแบบ ทั้งการติดตั้งในสภาพแวดล้อมที่ตัดขาดจากอินเทอร์เน็ต (air-gapped) การประหยัดเวลาการส่งข้อมูลผ่านบริการคลาวด์ภายนอก การทำ fine-tune ด้วย NeMo เพื่อสร้างเสียงเฉพาะของแบรนด์ และการเก็บรักษาข้อมูลลูกค้าไว้ภายในองค์กรเพื่อความปลอดภัยสูงสุด
สร้าง Voice Agent ที่สมบูรณ์แบบ — ไม่ใช่แค่เสียงพูดที่ดีขึ้น
Magpie TTS เป็นเพียงส่วนหนึ่งของ NVIDIA Nemotron Voice Agent Developer Example ซึ่งเป็นตัวอย่างการทำงานร่วมกันของโมเดลเสียง ภาษา และการใช้เหตุผลที่สอดประสานกัน นักพัฒนาสามารถผสมผสาน Nemotron Speech สำหรับการรู้จำเสียง, Magpie TTS สำหรับการสร้างเสียง และโมเดล Nemotron อื่นๆ สำหรับการใช้เหตุผล โดยทุกอย่างรันผ่าน NVIDIA NIM เพื่อประสิทธิภาพสูงสุดบน GPU
สถาปัตยกรรมอ้างอิงนี้ช่วยให้นักพัฒนาสร้าง Voice Agent ที่โต้ตอบได้แบบเรียลไทม์ ขัดจังหวะได้ และมีความเข้าใจในภาพ (multimodal) ได้ภายในเวลาไม่กี่ชั่วโมง แทนที่จะต้องเริ่มสร้างทุกอย่างใหม่ตั้งแต่ต้น
เริ่มต้นใช้งาน
ลองใช้โมเดล
ติดตั้งเพื่อใช้งานจริง
- NVIDIA Magpie Multilingual TTS NIM — คอนเทนเนอร์การอนุมานที่ปรับแต่งมาแล้ว
ปรับแต่งสำหรับโดเมนของคุณ
- NVIDIA NeMo Speech — การทำ fine-tuning และการฝึกฝน
สร้าง Voice Agent ที่สมบูรณ์
Open weights และใบอนุญาต
- Model card บน Hugging Face — ภายใต้ NVIDIA Open Model License
การตั้งค่าการอนุมานที่แนะนำ:
cfg_scale = 2.5 # classifier-free guidance — raise for tighter text adherence
temperature = 0.6
top_k = 80
apply_attention_prior = True
prior_epsilon = 0.1
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
