tag: Speech-to-Text

Google เปิดตัว Gemini 3.5 Transcribe โมเดลแปลงเสียงเป็นข้อความความแม่นยำสูง รองรับกว่า 85 ภาษา

Google เปิดตัว Gemini 3.5 Transcribe โมเดลแปลงเสียงเป็นข้อความความแม่นยำสูง รองรับกว่า 85 ภาษา

Google เปิดตัว Gemini 3.5 Transcribe โมเดล Speech-to-Text รุ่นใหม่ที่ทำสถิติอัตราข้อผิดพลาดต่ำสุดเพียง 2.6% โดยแบ่งการทำงานเป็นสองรูปแบบเพื่อรองรับทั้งการสตรีมแบบเรียลไทม์และการประมวลผลไฟล์เสียงย้อนหลังที่มีประสิทธิภาพสูงกว่าเดิม 70%
เจาะลึกวิศวกรรมการสร้าง Voice AI Agent: เมื่อเสียงเป็นมากกว่าแค่การพิมพ์

เจาะลึกวิศวกรรมการสร้าง Voice AI Agent: เมื่อเสียงเป็นมากกว่าแค่การพิมพ์

สรุปกระบวนการสร้างเอเจนต์ AI ควบคุมด้วยเสียง ตั้งแต่การถอดความสตรีมมิ่ง การตรวจจับรอบสนทนา ไปจนถึงการจัดการระบบพูดแทรก เพื่อมอบประสบการณ์การสื่อสารที่เป็นธรรมชาติและลดความหน่วง