ElevenLabs เปิดตัว Eleven v4 โมเดลเสียง AI อารมณ์ชัดเจนขึ้น

ประเด็นสำคัญ
- ElevenLabs ปล่อย Eleven v4 โมเดลเสียงที่ทำตามคำสั่งทิศทางเสียงได้แม่นยำยิ่งขึ้น และรักษาความสม่ำเสมอของเสียงในผลงานที่มีความยาว
- เวอร์ชันใหม่รองรับมากกว่า 90 ภาษา ปรับปรุงระบบโคลนเสียง และรองรับอักขระสูงสุด 10,000 ตัวต่อคำขอ
- Eleven v4 Turbo มุ่งเป้าไปที่ voice agents ด้วยการตอบสนองในเวลาเพียง 150 มิลลิวินาที ซึ่ง ElevenLabs ระบุว่าเร็วยิ่งกว่าโมเดลคู่แข่ง
ElevenLabs กำลังเปิดตัว Eleven v4 โมเดลเสียงใหม่ล่าสุดที่ทำตามคำสั่งทิศทางเสียงได้แม่นยำยิ่งขึ้น และสามารถรักษาความสม่ำเสมอของเสียงในผลงานที่มีความยาว นอกจากนี้สถาปัตยกรรมโมเดลใหม่ยังขับเคลื่อนรุ่น Turbo สำหรับใช้งานกับ real-time voice agents อีกด้วย
Eleven v4 สามารถสร้างเสียงหัวเราะ เสียงกระซิบ และเสียงประกอบอย่างการกระแทกประตูได้น่าเชื่อถือกว่ารุ่นก่อนหน้า ส่วนรุ่น Turbo สำหรับ voice agents นั้นเริ่มผลิตคำพูดได้ในเวลาประมาณ 150 มิลลิวินาที ต่างจาก Eleven v3 ที่เปิดตัวไปเมื่อปีก่อน ซึ่งแม้จะรองรับแท็กเสียงเหล่านี้อยู่แล้วแต่ยังทำตามได้แม่นยำน้อยกว่า

ความสม่ำเสมอที่มากขึ้น
ElevenLabs กล่าวว่า v4 ใช้ สถาปัตยกรรมใหม่ ที่ช่วยวิเคราะห์โทนเสียง จังหวะ และบริบทของสคริปต์ โดยผู้ใช้สามารถให้คำแนะนำผ่านแท็กหรือประโยคธรรมดา รวมถึงใช้การสะกดตามสัทอักษร (phonetic spelling) เพื่อกำหนดการออกเสียงชื่อและคำศัพท์เทคนิคได้ ซึ่งทางบริษัทระบุว่าระบบควบคุมการออกเสียงนี้ทำงานได้เสถียรขึ้นแล้ว ส่งผลให้ผู้บรรยายและตัวละครมีเสียงที่สม่ำเสมอตลอดทั้งผลงาน แม้ผู้ใช้จะทำการสร้าง (regenerate) บรรทัดเดิมซ้ำหลายครั้งก็ตาม
Eleven v4 รองรับอักขระสูงสุด 10,000 ตัวต่อคำขอ หรือคิดเป็นความยาวเสียงประมาณ 10 นาที สำหรับงานที่ยาวกว่านั้นอย่าง audiobooks จะใช้การนำหลายส่วนมาประกอบกัน โดยคาดว่าจังหวะและการถ่ายทอดเสียงจะยังคงสม่ำเสมอในระหว่างช่วงรอยต่อ ในส่วนของบทสนทนานั้น ผู้พูด AI จะตอบสนองต่อบริบทของทั้งฉากมากกว่าการอ่านแยกกันไปทีละบรรทัด
เวอร์ชันใหม่นี้รองรับภาษามากกว่า 90 ภาษา เพิ่มขึ้นจากประมาณ 70 ภาษาใน v3 โดยเสียงที่ถูกโคลนจะสามารถพูดภาษาอื่นด้วยสำเนียงท้องถิ่นได้อย่างไม่ผิดเพี้ยนเมื่อเวลาผ่านไป นอกจากนี้ ฟังก์ชัน Professional Voice Clones ได้กลับมาใช้งานได้อีกครั้งหลังจากไม่รองรับใน v3 ขณะที่ฟังก์ชัน "Instant Voice Clone" ต้องการไฟล์เสียงเริ่มต้นเพียง 10 วินาทีเท่านั้น
Turbo มุ่งเป้าให้ voice agents แสดงอารมณ์ได้เร็วขึ้น
ElevenLabs ยังได้เปิดตัวรุ่น v4 Turbo ที่ทำงานได้เร็วขึ้นสำหรับการใช้งานแบบ เรียลไทม์ เช่น การโทรบริการลูกค้า หรือตัวละครในเกม ซึ่งทางบริษัทกล่าวว่า ก่อนหน้านี้นักพัฒนา voice agent จำเป็นต้องเลือกอย่างใดอย่างหนึ่งระหว่างความเร็วกับการแสดงอารมณ์ แต่ v4 Turbo ถูกสร้างมาเพื่อตอบโจทย์ทั้งสองด้านพร้อมกัน
จากการทดสอบของ ElevenLabs พบว่ารุ่น Turbo เริ่มผลิตเสียงที่ได้ยินได้ในเวลาเพียง 150 มิลลิวินาที เมื่อเทียบกับ 262 มิลลิวินาทีของ Cartesia Sonic 3.6 ส่วน GPT-4o mini TTS ของ OpenAI ใช้เวลา 814 มิลลิวินาที โดย ElevenLabs ได้ปรับแต่งโมเดล Turbo นี้ร่วมกับแพลตฟอร์ม ElevenAgents ของตนเอง

นอกจากนี้ Eleven v4 ยังมีอันดับนำหน้า Cartesia Sonic 3.6 และ Gemini 3.8 Flash TTS ของ Google บน ตารางอันดับ Provider Voice Arena ของ Artificial Analysis โดยทำคะแนนเกณฑ์มาตรฐานการออกเสียงได้ถึง 91.7 เปอร์เซ็นต์ เพิ่มขึ้นจาก 85.6 เปอร์เซ็นต์ในรุ่น v3 และจากการทดสอบแบบ blind test ของ ElevenLabs ผู้ฟังประมาณ 3 ใน 4 พึงพอใจกับ v4 มากกว่าโมเดลจาก Cartesia, Inworld และ Google

การโคลนเสียงที่มีคุณภาพสูงขึ้นทำให้ v4 มีประโยชน์อย่างมากสำหรับการพากย์เสียง โดย ElevenLabs ได้ส่งเสริมความสามารถในการใช้เสียงของนักแสดงได้ในทุกภาษาที่รองรับ ซึ่งบริษัทได้รับลิขสิทธิ์เสียงจากเจ้าของเสียงโดยตรง ทำให้นักพากย์สามารถเสนอเสียงโคลนที่ผ่านการฝึกฝนอย่างละเอียดในคลังของ ElevenLabs เพื่อสร้างรายได้เมื่อมีผู้ใช้แบบชำระเงินนำไปใช้งาน นอกจากนี้ ElevenLabs ยังเปิดให้เข้าถึงเสียงของคนดังอย่าง Michael Caine ผ่าน marketplace เฉพาะ อีกด้วย
ทั้งสองโมเดลเปิดตัวพร้อมการลดราคาชั่วคราว
สำหรับ ราคา API มาตรฐานของ ElevenLabs จะอยู่ที่ 80 ดอลลาร์ต่อล้านอักขระสำหรับ v4 และ 40 ดอลลาร์สำหรับ Turbo แต่จนถึงวันที่ 12 ตุลาคมนี้ อัตราค่าบริการจะลดลงเหลือเพียง 22 ดอลลาร์และ 11 ดอลลาร์ตามลำดับ จากข้อมูลของ ElevenLabs ผู้ใช้แผน Creator รายเดือนราคา 22 ดอลลาร์ขึ้นไปจะสามารถใช้งาน v4 ใน ElevenCreative ได้โดยไม่มีค่าใช้จ่ายเพิ่มเติมเป็นเวลาสองสัปดาห์ โดยจำกัดการใช้งานไว้ที่สองเท่าของเครดิตรายเดือน ทั้งนี้ Artificial Analysis ระบุราคาของ Sonic 3.6 ไว้ที่ 49 ดอลลาร์ต่อล้านอักขระ และ Gemini 3.8 Flash TTS ที่ 16.49 ดอลลาร์
ปัจจุบันทั้งสองโมเดลพร้อมใช้งานแล้วใน ElevenAgents, ElevenCreative และผ่านทาง API โดยตาม เอกสารประกอบ ระบุว่า ElevenLabs จะจัดเก็บข้อมูลลูกค้าในสหรัฐอเมริกาเป็นค่าเริ่มต้น แต่ลูกค้าองค์กรสามารถเลือกจัดเก็บข้อมูลในสภาพแวดล้อมที่แยกต่างหากในสหภาพยุโรป อินเดีย หรือสิงคโปร์ได้ แม้ว่าการประมวลผลบางอย่างอาจเกิดขึ้นนอกภูมิภาคที่เลือกก็ตาม สำหรับในสหภาพยุโรป ลูกค้าจะสามารถรักษาการประมวลผล API ไว้ภายในภูมิภาคได้โดยการเลือกใช้โหมดที่ไม่เก็บรักษาข้อมูล
นอกจากนี้ ElevenLabs ยังได้เปิดตัวโมเดล Music 2.5 ไปเมื่อกลางเดือนกันยายน ซึ่งได้รับการออกแบบมาเพื่อสร้างสรรค์บทเพลงที่มีความแน่นและให้เสียงที่เป็นธรรมชาติมากยิ่งขึ้น
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
