ศึกโมเดลถอดความเสียง Gemini 3.5 Transcribe ปะทะ GPT-Transcribe

Google ได้เปิดตัว Gemini 3.5 Transcribe เมื่อวันที่ 26 สิงหาคม 2026 ซึ่งถือเป็นจังหวะเวลาที่เหมาะอย่างยิ่งสำหรับการนำมาเปรียบเทียบกัน เนื่องจาก OpenAI เพิ่งเปิดตัว GPT-Transcribe ซึ่งเป็นโมเดลถอดความระดับเรือธงรุ่นปัจจุบันไปก่อนหน้านั้นเพียงสี่สัปดาห์ ในวันที่ 28 กรกฎาคม 2026 การที่สองยักษ์ใหญ่แห่งวงการ AI ปล่อยโมเดลถอดความรุ่นใหม่ในเวลาที่ใกล้เคียงกันเช่นนี้ ทำให้การเปรียบเทียบมีประโยชน์และสะท้อนประสิทธิภาพที่แท้จริง โดยไม่ต้องนำโมเดลต่างยุคมาวัดกัน
ทั้งสองบริษัทแบ่งประเภทการให้บริการในรูปแบบเดียวกัน คือมีโมเดลสำหรับการสตรีมแบบเรียลไทม์ และโมเดลสำหรับไฟล์เสียงที่บันทึกไว้ล่วงหน้า ทำให้การเปรียบเทียบนี้เป็นมวยถูกคู่แบบเคียงข้างกันอย่างแท้จริง ต่อไปนี้คือเส้นทางพัฒนาการ ตัวอย่างการใช้งาน โค้ดที่นำไปใช้ได้ทันที รวมถึงตารางเปรียบเทียบตัวเลขสำคัญของทั้งสองฝั่ง
Gemini 3.5 Transcribe
Gemini 3.5 Transcribe พัฒนาขึ้นมาแทนที่ Chirp 3 ซึ่งเป็นโมเดลถอดความรุ่นก่อนหน้าของ Google โดยจุดเด่นที่เน้นย้ำมากที่สุดคือเรื่องความเร็วในการถอดความจนเสร็จสมบูรณ์ (time-to-final-transcription) ที่เร็วขึ้นถึง 70% เมื่อเทียบกับ Chirp 3 ควบคู่ไปกับความแม่นยำที่สูงขึ้น
โมเดลนี้แยกการให้บริการออกเป็น 2 ID ตามการใช้งาน แทนที่จะเป็น endpoint อเนกประสงค์ตัวเดียว ได้แก่ gemini-3.5-transcribe-live สำหรับการสตรีมต่อเนื่องที่มีความหน่วงต่ำกว่าหนึ่งวินาทีผ่าน Live API และ gemini-3.5-transcribe สำหรับเสียงที่บันทึกไว้ล่วงหน้า เช่น การประชุม บันทึกการโทร และงานในลักษณะเดียวกันผ่าน Interactions API
สำหรับตัวเลขประสิทธิภาพที่วัดโดย Artificial Analysis และถูกอ้างอิงในประกาศของ Google พบว่ามีอัตราความผิดพลาดของคำ (word error rate หรือ WER) อยู่ที่ 4.0% สำหรับการใช้งานแบบสตรีมมิ่ง และ 2.6% สำหรับแบบไม่ใช่สตรีมมิ่ง ส่วนเกณฑ์มาตรฐานพหุภาษา FLEURS ซึ่งเป็นเกณฑ์ที่ยากกว่าและแยกต่างหากนั้น Google รายงานว่ามี WER อยู่ที่ 5.50% สำหรับสตรีมมิ่ง และ 5.04% สำหรับไม่ใช่สตรีมมิ่ง
นอกเหนือจากความแม่นยำแล้ว โมเดลสำหรับเสียงบันทึกไว้ล่วงหน้ายังมีฟีเจอร์แยกแยะผู้พูดหลายคนในตัว โดยรองรับการแยกแยะผู้พูดสูงสุด 3 คนอย่างแม่นยำ (และมากกว่านั้นยังอยู่ในขั้นทดลอง) พร้อมทั้งประทับเวลาในระดับคำ (word-level timestamps) มาให้เสร็จสรรพโดยไม่ต้องใช้โมเดลอื่นช่วย นอกจากนี้ยังรองรับมากกว่า 85 ภาษา จดจำคำศัพท์เฉพาะ (custom vocabulary) และสามารถส่งต่องานไปยังโมเดล Gemini อื่นๆ ผ่าน function calling ได้ ซึ่งปัจจุบันฟีเจอร์นี้ใช้งานได้จริงแล้วบนแอป Gemini บน macOS
OpenAI's GPT-Transcribe
Whisper คือโมเดลถอดความแบบ open ตัวแรกของ OpenAI ก่อนที่จะถูกแทนที่ด้วย gpt-4o-transcribe ในเดือนมีนาคม 2025 ซึ่งเป็นโมเดลตัวแรกที่สร้างขึ้นบนสถาปัตยกรรม GPT-4o จริงๆ ส่วน GPT-Transcribe ที่ปล่อยออกมาเมื่อวันที่ 28 กรกฎาคม 2026 คือก้าวสำคัญถัดมาในสายผลิตภัณฑ์นี้
ปัจจุบัน OpenAI แนะนำให้ใช้โมเดลนี้เหนือกว่า whisper-1, gpt-4o-transcribe และ gpt-4o-mini-transcribe สำหรับการถอดความเสียงพูดที่บันทึกไว้ในภาษาต้นฉบับ โดยมีการแยกโมเดลสำหรับการสตรีมเช่นเดียวกับ Gemini นั่นคือ gpt-live-transcribe สำหรับเซสชันต่อเนื่องที่มีความหน่วงต่ำ
ในด้านตัวเลขประสิทธิภาพ เกณฑ์มาตรฐานของ OpenAI เองเมื่อเทียบกับ Common Voice ใน 22 ภาษา ระบุว่า GPT-Transcribe ช่วยลดอัตราความผิดพลาดของคำจาก whisper-1 ลงไปได้ราวครึ่งหนึ่ง จาก 40.37% เหลือเพียง 19.27% ในขณะที่มีค่าใช้จ่ายต่อนาทีถูกลงกว่ารุ่นก่อนหน้าถึง 25% โดยมีราคาอยู่ที่ $0.0045 ต่อนาทีสำหรับไฟล์เสียง และ $0.017 ต่อนาทีสำหรับเวอร์ชันสตรีมมิ่ง
นอกจากนี้ โมเดลยังสามารถรับคำใบ้คำสำคัญ (keyword hints) และคำใบ้หลายภาษา (multiple language hints) เพื่อช่วยในเรื่องคำศัพท์เฉพาะทางและการสลับภาษา (code-switching) รวมถึงรายงานภาษาที่ตรวจพบในไฟล์เสียงได้ด้วย อย่างไรก็ตาม ข้อจำกัดของ GPT-Transcribe รุ่นธรรมดาคือไม่สามารถแยกแยะผู้พูด (speaker diarization) หรือประทับเวลาในระดับคำได้ ซึ่งฟีเจอร์เหล่านี้ยังต้องพึ่งพาโมเดลแยกอย่าง gpt-4o-transcribe-diarize หรือหากต้องการเฉพาะการประทับเวลา ก็ต้องย้อนไปใช้ whisper-1 รุ่นเก่า
เรามาดูตัวอย่างการใช้งานจริงของทั้งสองโมเดลกัน
การใช้ Gemini 3.5 Transcribe สำหรับการประชุมที่มีผู้พูดหลายคน
ในสถานการณ์จริงที่ฟีเจอร์แยกแยะผู้พูดในตัวแสดงประสิทธิภาพได้อย่างคุ้มค่า เช่น การถอดความการประชุมของคนสามคนที่ถูกบันทึกไว้ เพื่อให้ได้ผลลัพธ์ว่าใครเป็นคนพูดประโยคไหน แทนที่จะเป็นข้อความยาวพืดต่อกัน
from google import genai
client = genai.Client(api_key="YOUR_GOOGLE_API_KEY")
with open("meeting_recording.mp3", "rb") as f:
audio_bytes = f.read()
response = client.models.generate_content(
model="gemini-3.5-transcribe",
contents=[
{"text": "Transcribe this meeting with speaker labels and timestamps."},
{"inline_data": {"mime_type": "audio/mp3", "data": audio_bytes}},
],
)
print(response.text)คำขอนี้จะส่งข้อมูลไบต์ของไฟล์เสียงดิบไปพร้อมกับคำสั่งภาษาทั่วไป เนื่องจาก gemini-3.5-transcribe ถูกสร้างขึ้นมาเพื่อให้ผลลัพธ์ที่มีการระบุตัวผู้พูดและประทับเวลาได้ทันที โดยไม่ต้องมีขั้นตอนหรือโมเดลแยกแยะผู้พูดต่างหาก บทสนทนาที่ส่งกลับมาจะแยกแยะเป็น Speaker 1, Speaker 2 และ Speaker 3 พร้อมแนบการประทับเวลามาให้เรียบร้อย ซึ่งระบบวิเคราะห์หลังการโทรสามารถนำไปใช้งานต่อได้ทันที
การใช้ GPT-Transcribe สำหรับการทำคำบรรยายสด (Live Captioning)
ตัวอย่างสถานการณ์ที่เหมาะสำหรับการสตรีมมิ่ง คือการทำคำบรรยายแบบเรียลไทม์สำหรับงานอีเวนต์สด ซึ่งความหน่วง (latency) มีความสำคัญมากกว่าการแยกแยะผู้พูด
import asyncio
import websockets
import json
async def stream_captions(audio_chunks):
uri = "wss://api.openai.com/v1/realtime?intent=transcription"
headers = {"Authorization": "Bearer YOUR_OPENAI_API_KEY"}
async with websockets.connect(uri, extra_headers=headers) as ws:
await ws.send(json.dumps({
"type": "transcription_session.update",
"session": {"input_audio_transcription": {"model": "gpt-live-transcribe"}},
}))
for chunk in audio_chunks:
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": chunk,
}))
message = await ws.recv()
event = json.loads(message)
if event.get("type") == "conversation.item.input_audio_transcription.delta":
print(event["delta"], end="", flush=True)โค้ดนี้จะเปิดการเชื่อมต่อ WebSocket แบบคงอยู่ตลอดเวลา แทนที่จะส่งคำขอแยกทีละคลิปเสียง ซึ่งเป็นจุดประสงค์หลักของโมเดลแบบสตรีมมิ่ง ข้อความถอดความบางส่วนจะมาถึงในรูปแบบของเหตุการณ์ delta ในขณะที่ผู้พูดยังคงพูดอยู่ เสียงแต่ละชิ้น (chunk) จะถูกนำไปต่อท้ายในบัฟเฟอร์ และ gpt-live-transcribe จะส่งคืนข้อความที่เพิ่มขึ้นเรื่อยๆ เมื่อมีความมั่นใจมากพอ ซึ่งตอบโจทย์การแสดงผลคำบรรยายสดที่ต้องการความซิงค์กับผู้พูดเป็นอย่างยิ่ง
ตารางเปรียบเทียบ
| # | Gemini 3.5 Transcribe | OpenAI GPT-Transcribe |
|---|---|---|
| วันที่เปิดตัว | 26 สิงหาคม 2026 | 28 กรกฎาคม 2026 |
| รุ่นก่อนหน้า | Chirp 3 | gpt-4o-transcribe |
| โมเดลสตรีมมิ่ง | gemini-3.5-transcribe-live | gpt-live-transcribe |
| โมเดลไฟล์/บันทึกไว้ล่วงหน้า | gemini-3.5-transcribe | gpt-transcribe |
| อัตราความผิดพลาดของคำ | 4.0% แบบสตรีมมิ่ง / 2.6% แบบไม่ใช่สตรีมมิ่ง (Artificial Analysis) | ~19.27% บน Common Voice ลดลงจาก 40.37% ของ whisper-1 |
| การรองรับภาษา | 85+ ภาษา | คำใบ้คำสำคัญและภาษา ใน 22+ ภาษาที่ผ่านการทดสอบเกณฑ์มาตรฐาน |
| ฟีเจอร์แยกแยะผู้พูดในตัว | มี รองรับสูงสุด 3 คนอย่างแม่นยำ | ไม่มี ต้องใช้ gpt-4o-transcribe-diarize แยกต่างหาก |
| การประทับเวลาระดับคำ | มี มาในตัว | ไม่มี ต้องใช้ whisper-1 |
| ราคาสตรีมมิ่ง | ยังไม่มีการประกาศราคาต่อนาที ณ เวลาที่เขียนนี้ | $0.017 ต่อนาทีของเสียงในเซสชัน |
| ราคาแบบไฟล์ | ยังไม่มีการประกาศราคาต่อนาที ณ เวลาที่เขียนนี้ | $0.0045 ต่อนาที |
บทสรุป
ฟีเจอร์แยกแยะผู้พูดและการประทับเวลาในตัวของ Gemini 3.5 Transcribe ทำให้มันเป็นตัวเลือกที่โดดเด่นและแข็งแกร่งกว่าทันที หากรูปแบบการใช้งานของคุณเน้นไปที่การประชุม บันทึกการโทร หรือกรณีใดก็ตามที่มีผู้พูดหลายคน ความสามารถนี้ช่วยลดขั้นตอนและประหยัดการเรียกใช้โมเดลตัวที่สอง ซึ่งในฝั่งของ OpenAI ยังจำเป็นต้องใช้อยู่
ในทางกลับกัน GPT-Transcribe ก็มีจุดเด่นสำคัญในเรื่องของราคาที่ถูกกว่าและสามารถรวมเข้ากับระบบเดิมได้เร็วกว่า เมื่องานนั้นเป็นการถอดความผู้พูดคนเดียวแบบตรงไปตรงมา หรือการทำคำบรรยายสดที่คุณไม่จำเป็นต้องระบุตัวตนของผู้พูดเลย
ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
