TII เปิดตัว Falcon ASR โมเดลจดจำเสียงภาษาอาหรับระดับแนวหน้า

· By: SirilukP

English · العربية

Arabic WER: 20.92% · Parameters: 1.6B · Emirati WER (TII evaluation): 22.73%

เราขอแนะนำ Falcon-ASR โมเดลจดจำเสียงพูด (Speech Recognition) ขนาด 1.6 พันล้านพารามิเตอร์ที่ออกแบบมาเพื่อภาษาอาหรับโดยเฉพาะ โดยเน้นความสำคัญไปที่สำเนียงเอมิเรตส์ พัฒนาโดยสถาบันนวัตกรรมเทคโนโลยี (Technology Innovation Institute - TII) ณ กรุงอาบูดาบี นอกจากความเชี่ยวชาญด้านภาษาอาหรับแล้ว โมเดลนี้ยังรองรับภาษาอังกฤษ ฝรั่งเศส สเปน และโปรตุเกสอีกด้วย

จากการประเมินผล Falcon-ASR สามารถทำค่าเฉลี่ยอัตราความผิดพลาดของคำ (Word Error Rate - WER) ได้ที่ 20.92% จากชุดทดสอบภาษาอาหรับ 6 ชุด ซึ่งเหนือกว่าสถิติที่ดีที่สุดเดิมบน Leaderboard ที่บันทึกไว้ 23.17% ขณะที่การทดสอบภายในสำหรับสำเนียงเอมิเรตส์พบว่าโมเดลนี้มีค่าความผิดพลาดทั้งในระดับคำและตัวอักษรต่ำที่สุดเมื่อเทียบกับระบบอื่นๆ ในปัจจุบัน

นอกจากความแม่นยำแล้ว โมเดลยังรองรับฟีเจอร์ Word-level Timestamps สำหรับการถอดความ โดยสามารถระบุตำแหน่งเวลาของแต่ละคำในไฟล์เสียงได้อย่างแม่นยำ ผู้ที่สนใจสามารถ ลองใช้ Falcon-ASR ใน Hugging Face Demo ของเรา

การจดจำภาษาอาหรับพูด

เสียงพูดภาษาอาหรับมีความท้าทายสูงเนื่องจากความหลากหลายตามภูมิภาคและสภาพแวดล้อม โมเดลที่ถอดความจากสำนักข่าวที่เป็นทางการได้ดี มักจะประสบปัญหาเมื่อต้องเจอการสนทนาสำเนียงเอมิเรตส์หรือเสียงผ่านโทรศัพท์ นอกจากนี้ ภาษาอาหรับแบบสำเนียง (Dialectal Arabic) ยังมีทรัพยากรข้อมูลสำหรับการฝึกฝนน้อยกว่าภาษาอาหรับมาตรฐาน (MSA) ทำให้การพัฒนาทำได้ยาก

เราจึงฝึกฝน Falcon-ASR ด้วยข้อมูลที่ครอบคลุมทั้งสำเนียงเอมิเรตส์, MSA, สำเนียงกัลฟ์ และสำเนียงอาหรับอื่นๆ รวมถึงภาษาอังกฤษ เป้าหมายของเราคือการสร้างระบบที่สามารถถอดความภาษาพูดในชีวิตประจำวันได้จริง รวมถึงรองรับการสลับภาษาไปมาในประโยคเดียวได้อย่างลื่นไหล

ผลลัพธ์ Arabic benchmark

Open Universal Arabic ASR Leaderboard โดย ELM Research Center จัดอันดับระบบโดยใช้ค่าเฉลี่ย WER จากชุดทดสอบ 6 ชุด รวมถึงรายงานค่าอัตราความผิดพลาดตัวอักษร (CER) ซึ่งค่าที่ต่ำกว่าหมายถึงประสิทธิภาพที่สูงกว่า การประเมิน Falcon-ASR ของเราใช้เกณฑ์มาตรฐานเดียวกันนี้

ModelParametersAvg WER (%)Avg CER (%)
Falcon-ASR1.6B20.928.79
Audar-ASR-V1-Turbo2.35B23.179.23
Cohere Transcribe Arabic (07-2026)2.0B25.8711.80
omniASR LLM 7B7.0B28.3212.52

WER = Word Error Rate; CER = Character Error Rate ค่าที่ต่ำกว่าบ่งบอกถึงประสิทธิภาพที่ดีกว่า

เราเปรียบเทียบ Falcon-ASR บน Benchmark ชุดเดียวกับผู้เล่นรายอื่นในตลาด โดยอ้างอิงข้อมูลจาก Leaderboard เมื่อวันที่ 30 กันยายน 2026 พบว่าค่าเฉลี่ย WER ของ Falcon-ASR ดีกว่าผลลัพธ์ที่ดีที่สุดในขณะนั้นถึง 2.25 เปอร์เซ็นต์

การประเมินเสียงพูดสำเนียงเอมิเรตส์

นอกจากการใช้ข้อมูลสาธารณะอย่าง Casablanca ที่มีส่วนของสำเนียง UAE แล้ว เรายังได้ประเมินผลเพิ่มเติมภายในองค์กรด้วยเสียงพูดสำเนียงเอมิเรตส์และกัลฟ์ โดยใช้บทถอดความที่ผ่านการตรวจสอบโดยมนุษย์เพื่อยืนยันความแม่นยำที่เหนือกว่าชุดข้อมูลทั่วไป

ในผลการทดสอบภายในสำหรับสำเนียงเอมิเรตส์ Falcon-ASR ทำค่า WER ได้ 22.73% และ CER 10.19%:

ModelParametersWER (%)CER (%)
Falcon-ASR1.6B22.7310.19
Qwen3-Omni-30B-A3B-Instruct30.0B (3.0B active)26.8012.72
Audar-ASR-V1-Turbo2.35B27.8913.75
Cohere Transcribe Arabic (07-2026)2.0B31.0518.07
Qwen3-ASR-1.7B-hf2.0B31.5213.35
Audar-ASR-V1-Flash0.78B32.8715.36

Falcon-ASR ครองตำแหน่งผู้นำด้วยค่าความผิดพลาดที่ต่ำที่สุด โดยมี WER ต่ำกว่า Qwen3-Omni ซึ่งเป็นอันดับสองอยู่ถึง 4.07 เปอร์เซ็นต์ แสดงให้เห็นถึงความแม่นยำที่โดดเด่นทั้งในระดับคำและตัวอักษร

การฝึกฝนสำหรับเงื่อนไขการบันทึกที่แตกต่างกัน เพื่อให้ใช้งานได้จริงในทุกสถานการณ์ เราได้รวมข้อมูลเสียงที่มีสัญญาณรบกวน เช่น เสียงพื้นหลัง เสียงพูดซ้อนกัน ดนตรี เสียงก้อง รวมถึงการจำลองเสียงจากสายโทรศัพท์ที่มีความเร็วและระดับเสียงที่แตกต่างกัน การเตรียมความพร้อมนี้ช่วยให้ Falcon-ASR สามารถถอดความจากการประชุม การโทรศัพท์ หรือการบันทึกเสียงในชีวิตประจำวันได้อย่างมีประสิทธิภาพ

ภาษาอังกฤษและภาษาอื่นๆ

แม้จะเน้นภาษาอาหรับ แต่ Falcon-ASR ก็สามารถถอดความภาษาอังกฤษได้ดีเยี่ยมโดยใช้ชุด Weight เดียวกัน จากการทดสอบบน Open ASR Leaderboard ของ Hugging Face ในชุดทดสอบภาษาอังกฤษ 7 ชุด โมเดลสามารถทำค่าเฉลี่ย WER ได้ที่ 5.74%

Test setWER (%)
LibriSpeech clean1.75
LibriSpeech other4.21
SPGISpeech2.02
VoxPopuli3.87
GigaSpeech8.15
AMI8.33
Earnings-2211.86

ตัวโมเดลยังรองรับภาษาฝรั่งเศส สเปน และโปรตุเกส โดยทั้ง 5 ภาษาสามารถทำงานได้ทันทีจากโมเดลตัวเดียวโดยไม่ต้องระบุ Language Flag ซึ่งระบบจะทำการถอดความตามภาษาที่ได้ยินโดยอัตโนมัติ

รากฐานของโมเดล

Falcon-ASR พัฒนาต่อยอดมาจากโครงการ Falcon3-Audio โดยผู้ที่สนใจสามารถศึกษาในรายละเอียดเกี่ยวกับสถาปัตยกรรมและกระบวนการฝึกฝนได้จากงานวิจัยเรื่อง Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data

ทดลองใช้ Falcon ASR

ท่านสามารถทดลองใช้งานและทดสอบความสามารถของโมเดลผ่าน Hugging Face Demo Space ด้วยไฟล์เสียงของคุณเอง โดยในอนาคตเรามีแผนที่จะเปิดให้เข้าถึงผ่าน API และพัฒนาแอปพลิเคชันแบบ Native ต่อไป


ขอแนะนำ Falcon ASR (ฉบับภาษาอาหรับ)

نقدّم Falcon-ASR، نموذجنا للتعرف على الكلام العربي بحجم 1.6 مليار معلمة، مع اهتمام خاص باللهجة الإماراتية. طوّرنا النموذج في معهد الابتكار التكنولوجي (TII) في أبوظبي، وهو يدعم أيضًا اللغات الإنجليزية والفرنسية والإسبانية والبرتغالية.

في تقييمنا، حقق Falcon-ASR متوسط معدل خطأ في الكلمات بلغ 20.92% عبر ست مجموعات اختبار باللغة العربية، مقارنةً بأفضل نتيجة منشورة بلغت 23.17% في نسخة لوحة المتصدرين التي استخدمناها. وفي تقييمنا الداخلي للهجة الإماراتية، سجّل النموذج أدنى معدلات خطأ في الكلمات والأحرف بين الأنظمة التي قارناها.

ندعم أيضاً الطوابع الزمنية على مستوى الكلمات في عمليات التفريغ النصي، بحيث ترتبط كل كلمة بموضعها في التسجيل الصوتي.

يمكنكم تجربة Falcon-ASR عبر عرضنا التجريبي على Hugging Face.

التعرف على العربية المنطوقة

يختلف الكلام العربي باختلاف المنطقة والمتحدث وظروف التسجيل. فقد ينجح نموذج في تفريغ نشرة إخبارية رسمية، ثم يجد صعوبة في تفريغ محادثة باللهجة الإماراتية أو تسجيل عبر الهاتف. كما أن الموارد الصوتية المفرّغة نصيًا للهجات العربية أقل من تلك المتاحة للعربية الفصحى، مما يزيد صعوبة التدريب والتقييم.

درّبنا Falcon-ASR على اللهجة الإماراتية والعربية الفصحى ولهجات خليجية وعربية أخرى، إلى جانب الإنجليزية. وهدفنا هو تفريغ الكلمات التي يستخدمها الناس في حديثهم اليومي، بما في ذلك الصيغ اللهجية والانتقال بين اللغات.

نتائج الاختبارات العربية

ترتّب لوحة المتصدرين المفتوحة الشاملة للتعرف على الكلام العربي، التي يديرها مركز ELM للأبحاث، الأنظمة وفق متوسط معدل خطأ الكلمات عبر ست مجموعات اختبار، بوزن متساوٍ لكل مجموعة. وتعرض أيضًا معدل خطأ الأحرف (CER). وكلما انخفضت قيمة أي من المقياسين، كان الأداء أفضل. ويتبع تقييمنا للنموذج هذا البروتوكول.

ModelParametersAvg WER (%)Avg CER (%)
Falcon-ASR1.6B20.928.79
Audar-ASR-V1-Turbo2.35B23.179.23
Cohere Transcribe Arabic (07-2026)2.0B25.8711.80
omniASR LLM 7B7.0B28.3212.52

WER هو معدل خطأ الكلمات؛ وCER هو معدل خطأ الأحرف. تشير القيمة الأقل إلى أداء أفضل.

قيّمنا Falcon-ASR على مجموعات الاختبار الست نفسها، باستخدام قوائم العينات المثبّتة في لوحة المتصدرين. وأرقام النماذج المنافسة هي المتوسطات المنشورة في اللوحة، والتي جرى التحقق منها في 30 سبتمبر 2026. وكان متوسط خطأ الكلمات للنموذج أفضل بمقدار 2.25 نقطة مئوية من أفضل نتيجة منشورة في تلك النسخة.

تقييم اللهجة الإماراتية

تتوافر بالفعل بيانات عامة لتقييم اللهجة الإماراتية، إذ تضم مجموعة Casablanca قسمًا خاصًا بالإمارات. ونكمّل هذه التغطية بتقييم داخلي لتسجيلات إضافية من الكلام الإماراتي والخليجي، باستخدام تسجيلات مخصّصة للاختبار ونصوص مرجعية خضعت لمراجعة بشرية، لتقييم دقة التفريغ على مواد إضافية إلى جانب البيانات الإماراتية العامة.

حقق Falcon-ASR في تقييمنا الإماراتي الداخلي معدل خطأ كلمات قدره 22.73٪ ومعدل خطأ أحرف قدره 10.19٪:

ModelParametersWER (%)CER (%)
Falcon-ASR1.6B22.7310.19
Qwen3-Omni-30B-A3B-Instruct30.0B (3.0B active)26.8012.72
Audar-ASR-V1-Turbo2.35B27.8913.75
Cohere Transcribe Arabic (07-2026)2.0B31.0518.07
Qwen3-ASR-1.7B-hf2.0B31.5213.35
Audar-ASR-V1-Flash0.78B32.8715.36

سجّل Falcon-ASR أقل معدل لخطأ الكلمات والأحرف بين الأنظمة المقارَنة هنا. وكان معدل خطأ الكلمات أقل بمقدار 4.07 نقطة مئوية من Qwen3-Omni، صاحب النتيجة التالية. وتُظهر النتائج تحسنًا في دقة التفريغ على مستوى الكلمات والأحرف في هذا التقييم.

التدريب على ظروف تسجيل مختلفة

ضمّنا بيانات التدريب ضوضاء خلفية وكلامًا متداخلًا وموسيقى وصدى الصوت وتأثيرات الاتصالات الهاتفية، إلى جانب تغيّرات في سرعة الكلام وحدّة الصوت. وطبّقنا المعالجة نفسها على التسجيلات الإماراتية، لتهيئة النموذج للتعامل مع ظروف مختلفة قد يواجهها في الاجتماعات والمكالمات والتسجيلات اليومية الأخرى.

الإنجليزية واللغات الأخرى

يفرّغ Falcon-ASR الكلام الإنجليزي باستخدام أوزان النموذج نفسها. وفي تقييمنا على مجموعات الاختبار الإنجليزية العامة السبع المستخدمة في لوحة Hugging Face المفتوحة للتعرف على الكلام، بلغ متوسط معدل خطأ الكلمات 5.74٪.

Test setWER (%)
LibriSpeech clean1.75
LibriSpeech other4.21
SPGISpeech2.02
VoxPopuli3.87
GigaSpeech8.15
AMI8.33
Earnings-2211.86

يدعم النموذج أيضًا الفرنسية والإسبانية والبرتغالية. وتستخدم اللغات الخمس أوزانًا واحدة، دون الحاجة إلى تحديد اللغة مسبقًا. ويكون الناتج تفريغًا نصيًا باللغة المنطوقة.

أساس النموذج

يستند Falcon-ASR إلى أعمالنا في Falcon3-Audio. وتعرض ورقة Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data بنية Falcon3-Audio ونهج تدريبه.

تجربة Falcon ASR

يتيح عرضنا التجريبي على Hugging Face تجربة Falcon-ASR واستكشاف قدراته في تفريغ الكلام. أما الوصول عبر واجهة API والتطبيقات الأصلية فهو مخطّط له. ندعوكم إلى تجربة النموذج باستخدام تسجيلاتكم.

Source: Hugging Face Blog
ดูแลงานแปลและเรียบเรียงโดย SirilukP
Falcon ASR: Arabic and English speech recognition

ความคิดเห็น (0)

เข้าสู่ระบบเพื่อร่วมแสดงความเห็น

สมัครสมาชิก

มาเป็นคนแรกที่แสดงความเห็นกันเลยโบร