Microsoft AI เปิดตัวโมเดลถอดความและสังเคราะห์เสียงรุ่นใหม่

· By: AttapolK

Microsoft AI ได้เปิดตัว MAI-Transcribe-2-Streaming ซึ่งเป็นโมเดลใหม่สำหรับการถอดความแบบเรียลไทม์ โดย Microsoft ระบุว่าโมเดลนี้ครองอันดับหนึ่งในด้านความแม่นยำจากการจัดอันดับของ Artificial Analysis ซึ่งสามารถรองรับการถอดความได้ถึง 60 ภาษา และประมวลผลลัพธ์ชุดแรกออกมาได้ในเวลาเพียง 100 มิลลิวินาทีเศษเท่านั้น

ความเร็วระดับนี้ช่วยให้เอเจนท์เสียงสามารถตอบโต้ได้ทันทีในขณะที่ผู้ใช้งานยังพูดไม่จบประโยค โดย Microsoft เตรียมเปิดให้ใช้งานในช่วงท้ายปีนี้ด้วยราคาเริ่มต้นที่ 0.54 ดอลลาร์ต่อชั่วโมงเสียง

นอกจากนี้ Microsoft ยังได้เปิดตัวโมเดลข้อความเป็นเสียง (text-to-speech) ใหม่อีกสองโมเดล ได้แก่ MAI-Voice-2.1 ที่ถูกออกแบบมาให้พูดได้ 23 ภาษาด้วยเสียงเดียวกันแต่คงสำเนียงแบบเจ้าของภาษาในแต่ละท้องถิ่นเอาไว้ โดยรุ่น MAI-Voice-2.1-Flash มีความหน่วงเพียง 150 มิลลิวินาที และมีราคา 15 ดอลลาร์ต่อหนึ่งล้านตัวอักษร ลดลงจากเดิมที่ 22 ดอลลาร์

โมเดลเสียงทั้งสองรุ่นสามารถโคลนเสียงได้โดยใช้ตัวอย่างเสียงอ้างอิงเพียงไม่กี่วินาที พร้อมติดตั้งระบบป้องกันในตัวเพื่อป้องกันการนำไปใช้ในทางที่ผิด ปัจจุบันเปิดให้ใช้งานแล้วผ่าน Microsoft Foundry, MAI Playground และแพลตฟอร์มอื่นๆ รวมถึงยังมีให้บริการบน OpenRouter ด้วย

จากการทดสอบกับผู้เข้าร่วมประมาณ 4,000 คน พบว่าเกือบครึ่งหนึ่งเชื่อว่าเสียงที่ได้จากโมเดลเหล่านี้เป็นเสียงของบุคคลจริงๆ ซึ่งสะท้อนถึงความสมจริงในการนำไปประยุกต์ใช้กับระบบเอเจนท์อัจฉริยะในอนาคต

Source: The Decoder
ดูแลงานแปลและเรียบเรียงโดย AttapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร