Falcon-Emirati: ปฏิวัติ LLM ให้เข้าใจสำเนียงและวัฒนธรรมเอมิเรตส์

ภาษาอาหรับเปรียบเสมือนครอบครัวของภาษาภายใต้ชื่อเดียวกัน แม้ภาษาอาหรับมาตรฐานสมัยใหม่ (MSA) จะใช้ในข่าวหรือตำราเรียน แต่ในชีวิตประจำวันของชาวสหรัฐอาหรับเอมิเรตส์ (UAE) การสื่อสาร อารมณ์ขัน และการเล่าเรื่องกลับเกิดขึ้นในภาษาอาหรับเอมิเรตส์ ซึ่งเป็นสำเนียงกัลฟ์ที่มีคำศัพท์และจังหวะเฉพาะตัว โดยเฉพาะบทกวี Nabati และสุภาษิตท้องถิ่นที่สื่อความหมายลึกซึ้งจนการแปลตรงตัวตามหลัก MSA ไม่สามารถเก็บใจความสำคัญได้ นี่คือช่องว่างที่ Falcon-Emirati-7B ถูกสร้างขึ้นเพื่อเติมเต็ม เพื่อให้ AI เข้าใจน้ำเสียงและบริบททางวัฒนธรรมในแบบที่เจ้าของภาษาใช้จริง
สร้างขึ้นบน Falcon-H1-Arabic
Falcon-Emirati-7B พัฒนาต่อยอดจาก Falcon-H1-Arabic ตระกูลโมเดลภาษาอาหรับที่สร้างเกณฑ์มาตรฐานใหม่เมื่อต้นปีที่ผ่านมา โดยใช้สถาปัตยกรรมไฮบริดระหว่าง State Space Models (Mamba) และ Transformer attention ซึ่งช่วยให้ประมวลผลข้อมูลลำดับยาวได้อย่างมีประสิทธิภาพในขณะที่ยังคงความแม่นยำสูง
เราเลือกพัฒนาบนรุ่น 7B เนื่องจากเป็นขนาดที่สมดุลที่สุด โดยใหญ่พอที่จะรักษาความละเอียดอ่อนของสำเนียง แต่ยังเล็กพอที่จะนำไปใช้งานจริงได้ (Inference) เมื่อเทียบกับรุ่น 34B ที่มีต้นทุนสูงเกินไป หรือรุ่น 3B ที่ยังขาดความลึกซึ้งทางวัฒนธรรม
ทำไมการปรับจูนสำเนียงถึงยาก
การเปลี่ยนโมเดลทั่วไปให้เชี่ยวชาญสำเนียงเอมิเรตส์มีความท้าทายหลัก 3 ประการ:
- ข้อมูลมีจำกัด: ภาษาเอมิเรตส์ส่วนใหญ่เป็นภาษาพูด ทำให้มีข้อความบนโลกออนไลน์น้อยกว่า MSA
- ความหมายไม่ตรงตัว: สุภาษิตและบทกวีอิงตามบริบททางวัฒนธรรมมากกว่าความหมายตามพจนานุกรม
- ขาดสูตรสำเร็จ: ยังไม่มีคู่มือชัดเจนว่าต้องใช้ข้อมูลสำเนียงปริมาณเท่าใด หรือใช้เทคนิคการฝึกฝนแบบใดจึงจะดีที่สุด
แนวทางจัดการข้อมูลของเรา
เราสร้างไปป์ไลน์ข้อมูลเฉพาะทางโดยดึงข้อมูลจาก 3 แหล่งสำคัญ ได้แก่ ข้อมูลเว็บสำเนียงเอมิเรตส์แท้เพื่อให้ได้ภาษาที่ใช้จริง, ข้อมูล MSA เกี่ยวกับวัฒนธรรมและมรดกของเอมิเรตส์เพื่อให้ AI เข้าใจประวัติศาสตร์และมารยาททางสังคม และการสร้างข้อมูลสังเคราะห์ที่กำกับด้วยกฎไวยากรณ์และพจนานุกรมเอมิเรตส์อย่างเข้มงวด
การค้นหาสูตรการปรับจูนที่เหมาะสม
เราทดลองปรับส่วนผสมของข้อมูลและขั้นตอนการฝึกฝนอย่างละเอียด โดยอิงทั้งคะแนนทดสอบอัตโนมัติและการตรวจสอบโดยเจ้าของภาษา เนื่องจากตัวชี้วัดทั่วไปไม่สามารถตัดสินความเป็นธรรมชาติและความเหมาะสมทางวัฒนธรรมได้ดีพอ
วิธีการประเมินผล
เราใช้แนวทางประเมิน 2 รูปแบบ คือการให้เจ้าของภาษาตรวจสอบคุณภาพของคำตอบโดยตรง และการใช้ Alyah ซึ่งเป็นเกณฑ์มาตรฐานแบบปรนัย 1,173 ข้อที่ออกแบบมาเพื่อประเมินความสามารถด้านสำเนียงเอมิเรตส์โดยเฉพาะ ครอบคลุมทั้งมารยาท ภาษาเชิงเปรียบเทียบ และบทกวี
ผลลัพธ์
Falcon-Emirati-7B ทำคะแนนได้ 84.83% บน Alyah ซึ่งนำหน้าโมเดลภาษาอาหรับและโมเดลหลายภาษาอื่นๆ รวมถึงโมเดลที่มีขนาดใหญ่กว่าหลายเท่า

ความแม่นยำของ Alyah (%), โมเดลที่ปรับจูนตามคำสั่ง โมเดอร์ตระกูล Falcon-H1-Arabic ถูกแยกออกจากการเปรียบเทียบนี้เนื่องจาก Falcon-Emirati-7B ถูกสร้างขึ้นบนพื้นฐานเหล่านั้น
สิ่งที่ผลลัพธ์บอกเรา
ผลการทดสอบชี้ให้เห็นว่า "ขนาดโมเดล" ไม่ได้การันตีความเชี่ยวชาญด้านสำเนียง ความสำเร็จนี้เกิดจากการตั้งใจฝึกฝนด้วยข้อมูลเฉพาะทาง โดยเฉพาะในส่วนของบทกวีและมรดกทางวัฒนธรรม ซึ่งโมเดลทั่วไปมักจะทำคะแนนได้ต่ำกว่าอย่างเห็นได้ชัด
นอกเหนือจากปรนัย: การประเมินด้วย LLM-as-Judge
เราได้ทำการทดสอบการตอบคำถามแบบปลายเปิดโดยใช้ Gemini 3.7 Flash เป็นผู้ตัดสิน พบว่า Falcon-Emirati-7B ไม่เพียงแต่ตอบถูกต้อง แต่ยังมีความซื่อตรงต่อสำเนียง (Dialect Fidelity) สูงกว่าคู่แข่งเกือบ 2 เท่าของอันดับความสำคัญ (Orders of magnitude) ในขณะที่โมเดลอื่นมักจะเลือกตอบด้วยภาษา MSA แม้จะถูกถามด้วยภาษาสำเนียงก็ตาม



ความเข้าใจในวัฒนธรรมเอมิเรตส์
จากการทดสอบบน ArabCulture-Dialogue ในสถานการณ์จำลองของ UAE ทั้งหมด 283 รายการ Falcon-Emirati-7B ทำคะแนนได้สูงสุดถึง 85.57% ยืนยันถึงความสามารถในการสื่อสารที่เหมาะสมตามขนบธรรมเนียมท้องถิ่น

ดูการทำงานจริง

การเปรียบเทียบแบบโต้ตอบ: Falcon-Emirati-7B แสดงความโดดเด่นในด้านบทกวีและการแสดงออกเชิงสร้างสรรค์ รวมถึงความละเอียดอ่อนทางศาสนาและสังคมเมื่อเทียบกับโมเดลคู่แข่ง
ลองใช้ Falcon-Emirati-7B
Falcon-Emirati-7B เปิดให้ใช้งานแล้วที่: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
AI ที่มีความรับผิดชอบและข้อจำกัด
เช่นเดียวกับ LLM ทั่วไป โมเดลนี้อาจสะท้อนอคติจากข้อมูลฝึกฝนหรือให้ข้อมูลผิดพลาดในกรณีของสำนวนที่หายากมาก เราแนะนำให้ประเมินผลก่อนนำไปใช้ในงานที่เป็นทางการหรือมีความเสี่ยงสูง และพร้อมรับฟังความเห็นจากชุมชนเพื่อนำไปพัฒนาต่อไป
กิตติกรรมประกาศ
ขอขอบคุณ Mikhail Lubinets และ Matthieu Berjon สำหรับการสนับสนุนด้านโครงสร้างพื้นฐาน และ Jatin Mittal ที่ช่วยพัฒนาแอป Falcon Chat
การอ้างอิง
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}ความคิดเห็น (0)
เข้าสู่ระบบเพื่อร่วมแสดงความเห็น
สมัครสมาชิกมาเป็นคนแรกที่แสดงความเห็นกันเลยโบร
