Google เปิดตัว Gemini 3.5 Transcribe โมเดลแปลงเสียงเป็นข้อความความแม่นยำสูง รองรับกว่า 85 ภาษา

Google เปิดตัว Gemini 3.5 Transcribe โมเดลแปลงเสียงเป็นข้อความรุ่นล่าสุดที่ออกแบบมาเพื่อรองรับทั้งอินเทอร์เฟซเสียงแบบเรียลไทม์และไฟล์เสียงที่บันทึกไว้ โดยให้บริการผ่านสอง endpoint แยกตามลักษณะการใช้งาน ได้แก่ gemini-3.5-transcribe สำหรับประมวลผลไฟล์ที่บันทึกไว้ล่วงหน้าผ่าน Interactions API และ gemini-3.5-transcribe-live สำหรับการสตรีมเสียงแบบสองทิศทางผ่าน Live API
จากรายงานของ Artificial Analysis พบว่าโมเดลนี้มีอัตราข้อผิดพลาดของคำ (Word Error Rate - WER) เฉลี่ยเพียง 4.0% สำหรับการสตรีม และลดลงเหลือ 2.6% สำหรับรูปแบบ batch นอกจากนี้ความเร็วในการประมวลผลขั้นสุดท้ายยังดีขึ้นกว่า Chirp 3 ซึ่งเป็นโมเดลรุ่นก่อนหน้าถึง 70% โดยรองรับการตรวจจับภาษาอัตโนมัติมากกว่า 85 ภาษา และสามารถจัดการกับการสลับภาษา (code-switching) กลางประโยคได้อย่างมีประสิทธิภาพ อย่างไรก็ตาม ผู้ใช้งานควรวางแผนล่วงหน้าเนื่องจากทั้งสอง endpoint มีฟีเจอร์ ขีดจำกัด และราคาที่แตกต่างกัน
สามารถนำไปใช้งานได้จริงหรือไม่?
โมเดลนี้เปิดให้ใช้งานผ่าน API เท่านั้น โดยไม่มีการเปิดเผยค่าน้ำหนักโมเดล (open weights) หรือทางเลือกสำหรับการติดตั้งบนเซิร์ฟเวอร์ตัวเอง (self-hosted) ถือเป็นการให้บริการในรูปแบบ managed-service เต็มตัว
ในระดับบริษัท นักพัฒนาทั่วไปและสตาร์ทอัพสามารถเริ่มใช้งานได้ฟรีผ่าน Google AI Studio ส่วนทีมขนาดกลางสามารถเลือกใช้ระดับชำระเงินเพื่อขยายขีดจำกัดการใช้งาน (rate limits) และการันตีว่าข้อมูลจะไม่ถูกนำไปใช้ฝึกฝนโมเดลของ Google สำหรับองค์กรใหญ่จะใช้งานผ่าน Gemini Enterprise Agent Platform ซึ่งมาพร้อมการควบคุมด้านความปลอดภัยและส่วนลดตามปริมาณการใช้งาน โดยปัจจุบันยังอยู่ในช่วง public preview
อุตสาหกรรมที่เหมาะสม ได้แก่ ศูนย์บริการลูกค้า (contact centers), การบันทึกข้อมูลทางการแพทย์, การทำคำบรรยายสื่อ, งานด้านกฎหมายและประกันภัย รวมถึงเครื่องมือการประชุมออนไลน์ แอปพลิเคชันหลัก คือ voice agents แบบเรียลไทม์, การทำคำบรรยายสด, การวิเคราะห์ข้อมูลหลังการโทร และระบบถอดความการประชุมที่ระบุตัวตนผู้พูดได้
สองหน้า API สองผลิตภัณฑ์ที่แตกต่างกัน
Live API เน้นการถอดความต่อเนื่องด้วยความหน่วงต่ำกว่าวินาที โดยจะส่งผลลัพธ์แบบ interim_input_transcription ขณะที่ผู้พูดยังพูดไม่จบ และส่ง input_transcription เมื่อจบประโยค ระบบรองรับไฟล์ raw 16-bit PCM ที่ 16kHz mono ขนาด 100ms พร้อมฟีเจอร์ตรวจจับเสียงพูด (VAD) หลายรูปแบบ นอกจากนี้ยังมี Ephemeral tokens ที่ช่วยให้แอปบนมือถือหรือเว็บสตรีมข้อมูลได้โดยไม่ต้องถือ API key ไว้ที่ตัวไคลเอนต์
อย่างไรก็ตาม Live API มีข้อจำกัดคือรองรับการสตรีมต่อเนื่องได้สูงสุด 10 นาทีต่อเซสชัน และไม่รองรับการแยกแยะผู้พูด (speaker diarization) หรือการระบุเวลาของคำ (word-level timestamps)
ในส่วนของ Interactions API จะเข้ามาเติมเต็มในสิ่งที่ Live API ทำไม่ได้ โดยรองรับการแยกแยะผู้พูด, การระบุเวลาเริ่ม-จบของคำ และการกำหนดคำศัพท์เฉพาะ (custom vocabulary biasing) ได้สูงสุด 1,000 คำ (แนะนำที่ต่ำกว่า 100 คำเพื่อประสิทธิภาพสูงสุด) โดยคำขอมาตรฐานรองรับเสียงได้นานถึง 1 ชั่วโมง แต่จะลดเหลือ 30 นาทีหากเปิดฟีเจอร์ diarization หรือ word timestamps
Verbatim และ Smart: ทางเลือกในการจัดรูปแบบข้อความ
ทั้งสอง endpoint มาพร้อม 2 โหมดการใช้งาน คือ verbatim ซึ่งเป็นค่าเริ่มต้นที่จะถอดความทุกคำรวมถึงคำเติม (fillers) เช่น "เอ่อ..." หรือการพูดซ้ำ และโหมด smart ที่จะตัดคำที่ไม่จำเป็นออก แก้ไขคำผิดให้โดยอัตโนมัติ และจัดรูปแบบข้อความให้อ่านง่าย
ตัวอย่างเช่น ประโยคว่า “Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol.” โหมด Verbatim จะเก็บไว้ทุกคำ ส่วน Smart จะปรับเป็น “For the meeting, I think we should invite Bob and Carol.” ทั้งนี้ โหมด Smart ไม่สามารถใช้ร่วมกับ word timestamps หรือ diarization ได้ ผู้ใช้จึงต้องเลือกระหว่างความอ่านง่ายกับการตรวจสอบย้อนกลับ
ประสิทธิภาพและระบบนิเวศ
Google รายงานค่า WER ที่ 4.0% สำหรับการสตรีม และ 2.6% สำหรับ batch ขณะที่การทดสอบเบนช์มาร์กภาษา FLEURS ให้ผลลัพธ์ที่ 5.50% และ 5.04% ตามลำดับ ซึ่งถือว่ามีประสิทธิภาพสูงขึ้นกว่ารุ่นเดิมอย่างเห็นได้ชัด
ปัจจุบัน Live API ได้รับการเชื่อมต่อเข้ากับแพลตฟอร์มต่างๆ เช่น LiveKit, Pipecat, Agora, Fishjam, Vercel รวมถึงผลิตภัณฑ์ในเครือ Google อย่างแอป Gemini บน macOS และระบบ Rambler บน Android โดยมีแผนจะใช้งานบน Chrome ในอนาคต
ประเด็นสำคัญ
- แบ่งเป็น 2 Endpoint: เลือกได้ระหว่างความหน่วงต่ำ (Live) หรือฟีเจอร์ครบ (Batch)
- ความแม่นยำสูง: ค่า WER ต่ำสุด 2.6% (Batch) และ 4.0% (Live)
- โหมด Smart: ให้ข้อความที่สรุปสวยงามแต่ใช้ร่วมกับ timestamps หรือ diarization ไม่ได้
- ราคา: ประมาณ $0.005/นาที สำหรับ batch และ $0.009/นาที สำหรับ live (ไม่มี open weights)
- ข้อจำกัด: เซสชัน live สูงสุด 10 นาที, ไฟล์ปกติ 1 ชั่วโมง, และ 30 นาทีหากใช้ฟีเจอร์แยกเสียงพูด
ดู รายละเอียดทางเทคนิคที่นี่ นอกจากนี้ โปรดติดตามเราบน
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
