Google เปิดตัว Gemini 3.8 Flash TTS ออกแบบเสียงด้วย Prompt ได้

· By: NatapolK

Google เปิดตัว Gemini 3.8 Flash TTS ออกแบบเสียงด้วย Prompt ได้

Google เปิดตัว Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS โมเดลสร้างเสียงพูด (Text-to-Speech) สองรุ่นใหม่ล่าสุดในตระกูล Gemini Audio โดยชูจุดเด่นเรื่องการแสดงอารมณ์ที่สมจริงที่สุดเท่าที่เคยมีมา ช่วยให้นักพัฒนาสามารถกำกับการถ่ายทอดเสียงแบบบรรทัดต่อบรรทัดได้ผ่านภาษาธรรมชาติ

ปัจจุบันทั้งสองโมเดลเริ่มเปิดให้ใช้งานแล้วผ่าน Gemini API และ Google AI Studio ในรูปแบบ API เท่านั้น และยังไม่มีแผนปล่อย open weights สำหรับการติดตั้งเอง ส่วนบริการสำหรับองค์กรผ่าน Gemini Enterprise คาดว่าจะตามมาในเร็วๆ นี้

สิ่งที่ Google ส่งมอบ

Google แบ่งระดับโมเดล TTS ออกเป็น 2 เกรด เพื่อตอบโจทย์การใช้งานที่ต่างกัน:

  • Gemini 3.8 Flash TTS: ออกแบบมาสำหรับการกำกับเชิงสร้างสรรค์ขั้นสูง เหมาะกับงานที่ต้องการความละเอียด เช่น เกม, หนังสือเสียง, พอดแคสต์ และสื่อเชิงโต้ตอบ โดยควบคุมได้ลึกถึงจังหวะ สำเนียง และการโต้ตอบในบทสนทนา
  • Gemini 3.8 Flash-Lite TTS: เน้นความคุ้มค่าและการขยายตัวในปริมาณมาก เหมาะสำหรับการพากย์เสียงทั่วไปและการสร้าง Voice Agents ที่ยังคงความหลากหลายทางอารมณ์ได้ดี

สำหรับการทดสอบใน AI Studio นักพัฒนาสามารถใช้งานผ่านตัวระบุโมเดล gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts

การออกแบบเสียงจาก Text Prompt

การอัปเดตครั้งนี้ถือเป็นก้าวกระโดดจากเดิมที่มีเพียง 30 เสียง สู่ระบบเสียงขนาดใหญ่ที่ปรับแต่งได้แทบไม่จำกัด โดยมีฟีเจอร์เด่นดังนี้:

  • Generative Voice Design: สร้างเสียงใหม่ได้จาก Prompt ที่ระบุบทบาทหรือลักษณะเฉพาะ รองรับกว่า 100 ภาษา เช่น การสร้างเสียงมังกรญี่ปุ่น หรือดีเจชาวเมลเบิร์น
  • คลังเสียงสำเร็จรูป: มีเสียงพร้อมใช้มากกว่า 2,000 เสียง ครอบคลุมสำเนียงท้องถิ่นที่หลากหลาย เช่น ภาษาอังกฤษสำเนียงสกอต หรือภาษาสเปนเม็กซิกัน
  • การบันทึกและขยายผล: สามารถบันทึกเสียงที่ออกแบบไว้เพื่อนำกลับมาใช้ใหม่ในโปรเจกต์อื่นได้โดยคุณภาพไม่เพี้ยน

การกำกับการแสดงที่สมจริง

โมเดลใหม่รองรับคำสั่งกำกับการแสดงที่แทรกอยู่ในสคริปต์ ช่วยให้เสียงพูดต่อเนื่องหลายชั่วโมงยังคงคุณภาพและจังหวะที่สม่ำเสมอ รองรับการสร้างบทสนทนาแบบ 2 ผู้พูดที่มีเสียงแยกจากกันชัดเจนในสคริปต์เดียว

นอกจากนี้ยังเพิ่มมิติด้วย Vocal Bursts เช่น เสียงหัวเราะ <laughs>, เสียงถอนหายใจ <sigh> หรือการตอบรับขณะฟังอย่าง |mhm| ซึ่งช่วยให้จังหวะการสนทนาดูเป็นธรรมชาติและมีความเป็นมนุษย์มากขึ้น

ระบบความปลอดภัยและการจำลองเสียง

สำหรับการจำลองเสียง (Voice Replication) ระบบต้องการตัวอย่างเสียงเพียง 30 วินาที แต่มีเงื่อนไขด้านความปลอดภัยที่เข้มงวด โดยผู้ใช้งานต้องได้รับความยินยอมจากเจ้าของเสียงและต้องบันทึกเสียงยืนยันตัวตนเพื่อตรวจสอบย้อนกลับได้

ทุกผลลัพธ์เสียงที่สร้างจาก Gemini Audio จะถูกฝังลายน้ำ SynthID ซึ่งมองไม่เห็นแต่ตรวจสอบได้ รวมถึงมีการใช้ Content Credentials ตามมาตรฐาน C2PA เพื่อระบุแหล่งที่มาของเนื้อหา ตามแนวทางใน Gemini 3.8 Audio model card

ผลการทดสอบ Benchmark

จากการทดสอบประสิทธิภาพ Gemini 3.8 Flash TTS สามารถคว้าอันดับ 1 ใน Hume AI Voice Design Benchmark ด้วยคะแนน 71.4 และขึ้นนำเป็นอันดับหนึ่งในด้านการจำลองสำเนียงด้วยคะแนน 60.8 ตามรายงานของ Hume AI

นอกจากนี้ ทั้งสองรุ่นยังครองตำแหน่งสูงสุดในการทดสอบภาษาอื่นๆ เช่น ญี่ปุ่น, เวียดนาม และอาหรับ รวมถึงได้รับความนิยมสูงจากการทดสอบแบบ Blind Preference ใน Voice Arena อีกด้วย

ประเด็นสำคัญ

  • เปิดตัวโมเดลแยกตามการใช้งาน: Flash สำหรับงานครีเอทีฟ และ Flash-Lite สำหรับงานสเกลใหญ่
  • รองรับการออกแบบเสียงผ่าน Prompt มากกว่า 100 ภาษา
  • เพิ่มคลังเสียงจาก 30 เสียง เป็นมากกว่า 2,000 เสียง
  • ระบบจำลองเสียงมีความปลอดภัยสูง ต้องใช้เสียงยินยอมตัวจริงเท่านั้น
  • คว้าอันดับ 1 ในการทดสอบประสิทธิภาพการออกแบบเสียงระดับโลก
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร