รู้จัก S1-mini: โมเดล Open-Weights ขนาด 462 MB จาก Superwhisper ที่เปลี่ยนข้อความเสียงดิบให้เป็นภาษาเขียนสุดเนี๊ยบ

รู้จัก S1-mini: โมเดล Open-Weights ขนาด 462 MB จาก Superwhisper ที่เปลี่ยนข้อความเสียงดิบให้เป็นภาษาเขียนสุดเนี๊ยบ

Superwhisper ได้เปิดตัว S1 family of models ซึ่งประกอบด้วย S1-Voice, S1-Language และ S1-mini โดย S1-Voice เป็นโมเดล speech-to-text และ S1-Language เป็นโมเดลทำตามคำสั่งสำหรับการจัดรูปแบบข้อความซึ่งทำงานบนคลาวด์ทั้งคู่ อย่างไรก็ตาม สิ่งที่น่าสนใจเป็นพิเศษคือ S1-mini ซึ่งเปิดตัวแบบ open weights บน Hugging Face

S1-mini เป็น text normalizer ขนาด 0.6B ที่ไม่ได้ทำหน้าที่ถอดความหรือแชท แต่ทำหน้าที่ต่อจากระบบจดจำเสียงอัตโนมัติ (Automatic Speech Recognition) เพื่อเปลี่ยนคำบรรยายดิบให้เป็นข้อความเขียนที่สะอาดตา โมเดลจะทำหน้าที่ลบคำเติม (filler words), แก้ไขการพูดติดขัดให้เหลือเพียงใจความสำคัญ, ใส่เครื่องหมายวรรคตอนและตัวพิมพ์ใหญ่ รวมถึงแปลงตัวเลข วันที่ สกุลเงิน และอีเมลให้อยู่ในรูปแบบการเขียนที่ถูกต้อง โมเดลนี้ถูก fine-tuned มาจาก Qwen/Qwen3-0.6B รองรับภาษาอังกฤษในเวอร์ชัน v1 โดยควบคุมผ่านบรรทัดควบคุมสามแกน (three-axis control line) และมีผลการทดสอบความแม่นยำของโทเค็นสูงถึง 94.8%

สามารถนำไปใช้งานจริงได้หรือไม่?

คำตอบคือได้ แต่เฉพาะ S1-mini เท่านั้น เนื่องจาก S1-mini ถูกเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 พร้อมเงื่อนไขการระบุชื่อ ในขณะที่ S1-Voice และ S1-Language เป็นบริการแบบโฮสต์ที่ใช้งานได้เฉพาะผ่านระบบของ Superwhisper เท่านั้น

สำหรับระดับองค์กร S1-mini ในเวอร์ชัน Q4_K_M GGUF build มีขนาดไฟล์เพียง 462 MB ซึ่งสามารถทำงานบน CPU ของแล็ปท็อปได้ทันที ทำให้นักพัฒนาอิสระสามารถฝังไปพร้อมกับแอปพลิเคชันเดสก์ท็อปได้ ส่วนองค์กรขนาดใหญ่ก็สามารถรันโมเดลไว้หลัง VPC เพื่อความปลอดภัยของข้อมูลเสียงที่ไม่สามารถส่งออกนอกเครือข่ายได้ โดยเหมาะกับอุตสาหกรรมทางการแพทย์, กฎหมาย, การเงิน และการบริการลูกค้า เพื่อใช้ในแอปพิมพ์ด้วยเสียงหรือสรุปการประชุม

สิ่งที่ S1-mini ทำ

S1-mini คือ text normalizer ที่ทำงานในขั้นตอนสุดท้ายหลังจากกระบวนการจดจำเสียงดังนี้:

audio → ASR (Whisper, Parakeet, …) → S1-mini → clean text

โมเดลจะจัดการลบคำเติมและแก้ไขการเริ่มพูดผิดให้เหลือเพียงสิ่งที่ผู้พูดต้องการสื่อ พร้อมจัดรูปแบบตัวเลขและที่อยู่อีเมลให้ถูกต้อง เช่น หากผู้พูดพูดว่า “support at superwhisper dot com” ระบบจะแปลงเป็น [email protected] ให้โดยอัตโนมัติ

ในเชิงเทคนิค โมเดลนี้ fine-tuned จาก Qwen/Qwen3-0.6B มีพารามิเตอร์เฉพาะ 596M ตัว (0.44B non-embedding) ประกอบด้วย 28 เลเยอร์ และใช้โครงสร้าง GQA พร้อมน้ำหนักแบบ BF16 แม้บน Hub จะรายงานว่าเป็น 0.8B เนื่องจากการเก็บ tied embedding แต่ใน model card ได้ระบุรายละเอียดไว้ชัดเจน โดยเวอร์ชัน v1 นี้รองรับอินพุตได้ประมาณ 1,000 โทเค็น

บรรทัดควบคุมคืออินเทอร์เฟซทั้งหมด

การใช้งาน S1-mini จะรับ system prompt ที่กำหนดตายตัว ตามด้วยบรรทัดควบคุม และคำบรรยายดิบดังนี้:

[Styling: <value>] [Structure: <value>] [Context: <value>]
<raw transcript>

ผู้ใช้สามารถกำหนด Styling (casual, semi-casual, semi-formal, formal), Structure (prose, lists) และ Context (general, email) ได้อย่างอิสระ ซึ่งทุกการผสมผสานได้รับการฝึกฝนมาแล้ว อย่างไรก็ตาม หากส่งค่านอกเหนือจากนี้เอาต์พุตอาจด้อยคุณภาพลง นอกจากนี้ยังมีจุดสังเกตว่าในแอปหลักมีตัวเลือก Styling 5 ระดับ แต่ในเวอร์ชัน open weights จะรองรับเพียง 4 ค่าตามที่ระบุในเอกสาร

โมเดลถูกออกแบบมาให้ทำงานเฉพาะทาง คือจะไม่เพิ่มเนื้อหาที่ไม่ได้พูด, ไม่แก้ไขข้อเท็จจริง และไม่ลดทอนคำหยาบคาย หากอินพุตมีแต่คำเติม โมเดลจะคืนค่าเป็นสตริงว่าง ซึ่งถือว่าเป็นผลลัพธ์ที่ถูกต้องตามการออกแบบ

การตั้งค่าสองประการที่ทำให้การเชื่อมต่อส่วนใหญ่ล้มเหลว

ประการแรก ผู้ใช้งานจำเป็นต้องตั้งค่า enable_thinking=False เนื่องจาก S1-mini ถูกฝึกมาโดยปิดระบบการคิด (thinking) ของ Qwen3 ไว้ หากไม่ปิดแฟล็กนี้ในส่วนของ assistant ด้วยบล็อก <think> ที่ว่างเปล่า มักจะไม่ได้รับเอาต์พุตที่ใช้งานได้เลย

ประการที่สอง ต้องทำการ decode แบบ greedy โดยกำหนด temperature เป็น 0 ในทุกคำขอ แม้ในไฟล์ generation_config.json จะระบุ do_sample: false มาให้ แต่เวอร์ชัน GGUF มักจะสืบทอดค่า metadata เดิมมา สำหรับผู้ใช้ llama.cpp ควรใช้คำสั่ง --jinja พร้อมกับ --chat-template-kwargs '{"enable_thinking":false}' เพื่อให้ได้ผลลัพธ์ที่ดีที่สุด

รายงานการประเมินผล

จากการประเมินผลในชุดข้อมูลทดสอบ 7,519 กรณี Superwhisper พบว่า S1-mini มีความแม่นยำของโทเค็นถึง 94.8% เมื่อวัดผลแบบ greedy บนเวอร์ชัน Q4_K_M โดยมีอัตราความผิดพลาดในการแก้ไขข้อความ (text-edit error rate) อยู่ที่ 11.6% ในรูปแบบอีเมล โมเดลระบุบรรทัดคำทักทายได้แม่นยำ 99.3% และสร้างที่อยู่อีเมลถูกต้องถึง 92% ของกรณีทั้งหมด

โมเดลบนคลาวด์สองตัว

ในส่วนของบริการคลาวด์ S1-Voice สามารถถอดความได้เร็วกว่าเวลาพูดถึง 46 เท่า โดยเสียงที่สั้นกว่า 30 วินาทีจะประมวลผลเสร็จในเวลาเพียง 0.32 วินาที มีอัตราความผิดพลาด (WER) เฉลี่ยเพียง 6.8% ซึ่งถือว่าต่ำที่สุดเมื่อเทียบกับ 15 โมเดลที่นำมาทดสอบร่วมกัน

ส่วน S1-Language เป็นโมเดลทำตามคำสั่งสำหรับจัดรูปแบบและสรุปผล ซึ่งเป็นตัวเลือกเสริมควบคู่ไปกับโมเดลจาก Anthropic หรือ OpenAI โดย Superwhisper แนะนำให้ใช้คู่กับ S1-Voice เพื่อประสิทธิภาพสูงสุดบนคลาวด์ หรือใช้ Cohere Transcribe คู่กับ S1-mini สำหรับการทำงานแบบออฟไลน์

ประเด็นสำคัญ

  • S1-mini เป็น text normalizer ขนาด 0.6B แบบ open-weights สำหรับปรับปรุงเอาต์พุต ASR ไม่ใช่โมเดลแชททั่วไป
  • เวอร์ชัน GGUF (462 MB) สามารถใช้งานบน CPU แล็ปท็อปได้จริง
  • ควบคุมการทำงานผ่านบรรทัดควบคุมสามแกนใน system prompt
  • ต้องตั้งค่า enable_thinking=False และ temperature 0 เพื่อให้โมเดลทำงานถูกต้อง
Source: MarkTechPost
ดูแลงานแปลและเรียบเรียงโดย NatapolK

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร