Google เปิดตัว Gemini 3.8 TTS ปฏิวัติการสร้างเสียงด้วย AI

· By: SirilukP

a text card image reading "Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS"

วันนี้ เราขอแนะนำโมเดล text-to-speech (TTS) ใหม่สองรุ่นสู่ครอบครัว Gemini ซึ่งจะเปลี่ยนการสร้างเสียงจากค่าล่วงหน้าแบบคงที่ให้กลายเป็นสตูดิโอสร้างสรรค์ที่ทรงพลัง โมเดลเหล่านี้ช่วยให้ครีเอเตอร์ นักพัฒนา และองค์กรสามารถสร้างประสบการณ์เสียงที่สมบูรณ์และแสดงอารมณ์ได้มากขึ้น ในขณะเดียวกันก็ช่วยปรับปรุงประสบการณ์ผู้ใช้งานในผลิตภัณฑ์อย่าง Gemini Notebook และ Google Vids

Gemini 3.8 Flash TTS: ออกแบบมาเพื่อการกำกับงานสร้างสรรค์ในระดับลึกและการดีไซน์ตัวละคร โดยสามารถสร้างเสียงใหม่ทั้งหมดตั้งแต่เริ่มต้นผ่านพรอมต์ภาษาธรรมชาติเพื่อทำให้ตัวละครมีชีวิตชีวา ทั้งในเกม หนังสือเสียง พอดแคสต์ และสื่อเชิงโต้ตอบ ผู้ใช้สามารถกำกับการแสดงได้ละเอียดแบบบรรทัดต่อบรรทัด ทั้งจังหวะ การเปลี่ยนสำเนียง และการตอบรับเชิงสนทนา (backchanneling)

Gemini 3.8 Flash-Lite TTS: สร้างขึ้นเพื่อการใช้งานปริมาณมากในราคาประหยัด เหมาะสำหรับการพากย์เสียงจำนวนมากและการสร้างตัวแทนเสียงที่แสดงอารมณ์ได้แม่นยำ พร้อมการควบคุมโทนเสียงและจังหวะที่ละเอียดอ่อน โมเดลเหล่านี้เข้ามาเสริมทัพครอบครัว Gemini Audio ที่เติบโตอย่างรวดเร็ว ต่อจาก 3.5 Live Translate, 3.5 Transcribe, 3.8 Live, and 3.8 Live Extended Thinking

สร้างและปรับแต่งเสียงของคุณเอง

ยกระดับจากเสียงต้นฉบับ 30 เสียงไปสู่คลังเสียงที่ไม่จำกัด ไม่ว่าคุณจะต้องการเสียงตัวละครที่เป็นเอกลักษณ์หรือทูตของแบรนด์ที่คงเส้นคงวา Gemini 3.8 Flash TTS ทำหน้าที่เป็นสตูดิโอเสียงเต็มรูปแบบ ช่วยให้คุณสร้างเสียงที่ฟังดูเป็นธรรมชาติได้ในทุกช่วงเวลา เพิ่มศักยภาพให้นักพัฒนาและองค์กรสร้างประสบการณ์เสียงเฉพาะตัวได้อย่างง่ายดาย

การออกแบบเสียงแบบ Generative: ผู้ใช้สามารถสร้างเสียงเฉพาะตัวโดยกำหนดบทบาท สำเนียง และลักษณะเฉพาะในกว่า 100 ภาษาและสำเนียงท้องถิ่นผ่านพรอมต์ภาษาธรรมชาติ ไม่ว่าจะเป็นมังกรพ่นไฟที่ดูดราม่า หรือนักบรรยายที่มีเสน่ห์พร้อมจังหวะการพูดตามภูมิภาคที่ชัดเจน

ฟังตัวอย่างว่า Gemini 3.8 Flash TTS สร้างเสียงดีเจที่มีพลังงานสูงจากเมลเบิร์นได้อย่างไร

ฟังตัวอย่างว่า Gemini 3.8 Flash TTS สร้างเสียงหุ่นยนต์ที่แหลมเล็กและราบเรียบได้อย่างไร

ฟังตัวอย่างว่า Gemini 3.8 Flash TTS ทำให้มังกรญี่ปุ่นมีชีวิตขึ้นมาได้อย่างไร

ฟีเจอร์เด่นอื่นๆ ประกอบด้วย:

  • คลังเสียงที่กว้างขวาง: เข้าถึงเสียงพร้อมใช้งานกว่า 2,000 เสียง ครอบคลุมความหลากหลายทางภูมิภาค เช่น ภาษาสเปนเม็กซิกัน และอังกฤษสกอต
  • การจำลองเสียง: สร้างโปรไฟล์เสียงใหม่จากตัวอย่างเพียง 30 วินาที โดยมีระบบตรวจสอบความยินยอม การทำลายน้ำด้วย SynthID และข้อมูลรับรอง C2PA เพื่อความโปร่งใส
  • บันทึกและขยายผล: จัดการเสียงที่ออกแบบไว้เพื่อให้การแสดงผลคงเส้นคงวาตลอดโครงการ
  • การรีมิกซ์เสียง: เตรียมเปิดให้ปรับแต่งกังวานเสียง (timbre) ระดับเสียง และสำเนียงจากคลังเสียงเดิมผ่านพรอมต์เร็วๆ นี้

กำกับการแสดงแบบบรรทัดต่อบรรทัด

เมื่อเลือกเสียงได้แล้ว โมเดล TTS ทั้งสองรุ่นจะเปิดให้ควบคุมการถ่ายทอดอารมณ์ในแต่ละบรรทัดได้อย่างแม่นยำ ไม่ว่าจะเป็นการเขียนคำสั่งการแสดงเองหรือให้ Gemini ช่วยนำทาง ตั้งแต่พนักงานบริการลูกค้าที่ใจเย็นไปจนถึงเสียงกระซิบในฉากระทึกขวัญ

ฟังตัวอย่างว่า Gemini 3.8 Flash TTS ช่วยให้การสนทนาเป็นธรรมชาติและแสดงอารมณ์ได้สูงสำหรับตัวแทนเสียงเชิงโต้ตอบได้อย่างไร

ชมและฟังว่า Gemini 3.8 Flash TTS ใช้การควบคุมบทพูดที่ละเอียดเพื่อสร้างประสบการณ์เสียงที่ดึงดูดและสมจริงได้อย่างไร

นอกจากนี้ยังรองรับ การสร้างเนื้อหาขนาดยาว ที่รักษาคุณภาพเสียงและจังหวะได้ต่อเนื่องหลายชั่วโมง เหมาะสำหรับพอดแคสต์ รวมถึง การจัดฉากสำหรับผู้พูดสองคนแบบ Native ที่จัดการบทสนทนาโต้ตอบได้ราบรื่นในไฟล์เดียว และการแทรก เสียงตอบรับตามบท เช่น เสียงหัวเราะ หรือการถอนหายใจ เพื่อเพิ่มความสมจริง

ดูวิธีที่ Gemini 3.8 Flash TTS เปลี่ยนพรอมต์ภาษาธรรมชาติให้เป็นบุคลิกเสียงเฉพาะตัวตั้งแต่เริ่มต้น

ดูวิธีที่ Gemini 3.8 Flash TTS ช่วยให้ครีเอเตอร์ออกแบบฉากที่กำหนดเองเพื่อทำให้บทสนทนาแอนิเมชันมีชีวิตชีวา

ดูวิธีที่ Gemini 3.8 Flash TTS เปลี่ยนบทพูดให้เป็นฉากการสนทนาที่มีการแสดงเต็มรูปแบบ ช่วยให้ครีเอเตอร์กำกับการถ่ายทอดเสียงและจังหวะการสลับคิวที่เป็นธรรมชาติ

คุณภาพเสียงระดับโลกที่การันตีด้วยผลทดสอบ

Gemini 3.8 Flash TTS ครองอันดับ 1 ใน Voice Design Benchmark ของ Hume AI ด้วยคะแนน 71.4 และเป็นผู้นำในการจำลองสำเนียง ขณะที่ในการประเมินความพึงพอใจแบบ Blind Human Preference บน Voice Arena พบว่าครองตำแหน่งสูงสุดในหลายภาษาหลัก เช่น ญี่ปุ่น โปรตุเกส เวียดนาม อาหรับ และฮินดี

An evaluation showing text-to-speech quality benchmark Hume AI

an evaluation chart showing text to speech voice design leaderboard Hume AI

an evaluation chart showing text to speech leaderboard for Voice Arena

ความปลอดภัยและความโปร่งใส

เราสร้างความสามารถนี้ด้วยมาตรการป้องกันเข้มงวด การจำลองเสียงต้องใช้บันทึกความยินยอมจากเจ้าของเสียงจริงเท่านั้น นอกจากนี้ คลิปเสียงทุกชิ้นจะถูกใส่ลายน้ำดิจิทัลด้วย SynthID เพื่อให้ตรวจสอบได้ว่าเป็นเสียงจาก AI ป้องกันข้อมูลบิดเบือน สามารถดูรายละเอียดเพิ่มเติมได้ที่ model card

เริ่มต้นใช้งานได้ทันที

นักพัฒนาสามารถทดลองใช้งานใน Google AI Studio ซึ่งออกแบบมาเป็นพื้นที่ทำงานเสียงโดยเฉพาะ สามารถพรอมต์สร้างเสียงใหม่หรือจำลองเสียงตนเอง 1 เพื่อนำไปใช้ในตัวแก้ไขบทภาพยนตร์ได้ทันที

ลองใช้การจำลองเสียงใน Google AI Studio

นอกจากนี้ยังสามารถเข้าถึง Gemini API ผ่านพันธมิตรอย่าง Agora, LiveKit, Pipecat และ Vercel โดยมีบริษัทชั้นนำอย่าง Figma และ HeyGen ร่วมผสานรวมโมเดลเพื่อเพิ่มประสิทธิภาพการพากย์เสียงและการสื่อสารทั่วโลก

a quote from Darius Cheung, CEO and Co-Founder of 99 Group

a quote from Mason Adams, Developer Evangelist, Agora

a quote from Jonathan Gur-Zeev, Director of Product, Figma Weave

a quote from Bin Liu, VP of Engineering for Hygen

a quote card from Luke Pane, Developer, katsuyo

quote from Ritwik Baranwal, Associate Director AI/ML of kuku.

a quote from Oded Shafran, Co-Founder & CTO of linguana

Aziz Ulak, CTO & Co-founder, Ollang

a quote from Phil Marshall, Founder and CEO of Spoken

quote from Zina Rahman, Co-Founder and CEO, Transforms.AI

quote from Mei Ki Yiu, CTO of Wondercraft

ช่องทางการเข้าถึงโมเดลล่าสุด:

Gemini 3.8 Flash TTS:

Gemini 3.8 Flash-Lite TTS:

Source: Google Blog (Models & research)
ดูแลงานแปลและเรียบเรียงโดย SirilukP

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร