tag: Text-to-Speech

Gradium เปิดตัว Voice Design สร้างเสียงสังเคราะห์คุณภาพสูงจาก Prompt ในไม่กี่วินาที

Gradium เปิดตัว Voice Design สร้างเสียงสังเคราะห์คุณภาพสูงจาก Prompt ในไม่กี่วินาที

· By: AttapolK
Gradium สตาร์ทอัพ Voice AI จากปารีส เปิดตัวฟีเจอร์ Voice Design ที่ช่วยให้ผู้พัฒนาสามารถสร้างเสียงสังเคราะห์ใหม่ตามจินตนาการได้เพียงการเขียนคำอธิบาย โดยไม่ต้องใช้ไฟล์เสียงต้นฉบับหรือการโคลนเสียง
Gradium AI เปิดตัวโมเดล TTS รุ่นใหม่ ชูความแม่นยำ 81% และความหน่วงต่ำเพียง 216 ms

Gradium AI เปิดตัวโมเดล TTS รุ่นใหม่ ชูความแม่นยำ 81% และความหน่วงต่ำเพียง 216 ms

· By: TanasakP
Gradium AI เปิดตัวโมเดล Text-to-Speech พื้นฐานตัวใหม่ที่แก้ปัญหาความเร็วและความแม่นยำสวนทางกัน โดยทำคะแนนประเมินจากมนุษย์ในประโยคยากได้ 81.0% พร้อมความเร็ว Time-to-First-Audio ที่ 216 ms บน Coval
Cartesia เปิดตัว Sonic-3.6 โมเดล AI สร้างเสียงพูดระดับท็อป ครองอันดับ 1 ในทุกตารางทดสอบ

Cartesia เปิดตัว Sonic-3.6 โมเดล AI สร้างเสียงพูดระดับท็อป ครองอันดับ 1 ในทุกตารางทดสอบ

Cartesia ปล่อย Sonic-3.6 โมเดล Text-to-Speech แบบสตรีมมิ่งที่ใช้สถาปัตยกรรม State Space Models จนสามารถคว้าอันดับ 1 ในตาราง Artificial Analysis ทั้งสองรายการ ด้วยความเร็วในการสร้างเสียงครั้งแรกต่ำกว่า 90ms
NVIDIA เปิดตัว Magpie TTS โมเดลสร้างเสียงหลายภาษาแบบ Open Weights ชูจุดเด่นความหน่วงต่ำระดับมิลลิวินาที

NVIDIA เปิดตัว Magpie TTS โมเดลสร้างเสียงหลายภาษาแบบ Open Weights ชูจุดเด่นความหน่วงต่ำระดับมิลลิวินาที

· By: SirilukP
NVIDIA เปิดตัว Magpie TTS โมเดล Text-to-speech แบบ open weights รองรับ 12 ภาษา รวมถึงภาษาใหม่และรองรับการสลับภาษาไปมา (code-switching) ออกแบบมาเพื่อสร้าง Voice Agent ที่ทำงานได้รวดเร็วและควบคุมการติดตั้งได้เองบนโครงสร้างพื้นฐานของผู้ใช้
เจาะลึกวิศวกรรมการสร้าง Voice AI Agent: เมื่อเสียงเป็นมากกว่าแค่การพิมพ์

เจาะลึกวิศวกรรมการสร้าง Voice AI Agent: เมื่อเสียงเป็นมากกว่าแค่การพิมพ์

สรุปกระบวนการสร้างเอเจนต์ AI ควบคุมด้วยเสียง ตั้งแต่การถอดความสตรีมมิ่ง การตรวจจับรอบสนทนา ไปจนถึงการจัดการระบบพูดแทรก เพื่อมอบประสบการณ์การสื่อสารที่เป็นธรรมชาติและลดความหน่วง
เริ่มต้นใช้งาน OmniVoice Studio: ทางเลือกโอเพนซอร์สของ ElevenLabs ที่ทำงานแบบ Local 100%

เริ่มต้นใช้งาน OmniVoice Studio: ทางเลือกโอเพนซอร์สของ ElevenLabs ที่ทำงานแบบ Local 100%

OmniVoice Studio คือเครื่องมือจัดการเสียงระดับมืออาชีพที่รันบนฮาร์ดแวร์ของคุณเองโดยไม่ต้องผ่านคลาวด์ รองรับการโคลนเสียง พากย์วิดีโอ และถอดความได้ฟรีถึง 646 ภาษา