اللغة العربية هي في الحقيقة عائلة من اللغات تعيش تحت اسم واحد. العربية الفصحى الحديثة هي ما تقرؤه في الأخبار أو الكتب المدرسية، لكنها نادراً ما تكون الطريقة التي يتحدث بها الناس فعلاً مع بعضهم البعض. في الإمارات، تحدث الحياة اليومية والفكاهة والتفاوض والحكاية تجري بالعربية الإماراتية، وهي لهجة خليجية لها مفرداتها الخاصة وإيقاعها الخاص وثقافة متماسكة تحيط بها. الشعر الإماراتي، وخاصة الشعر النبطي، إلى جانب الأمثال والحكايات القصيرة، يحمل معانٍ لا تصمد أمام قراءة حرفية كلمة بكلمة. النموذج الذي يعرف الفصحى فقط يمكنه ترجمة كل كلمة في جملة إماراتية ومع ذلك أن يفوّت ما تعنيه فعلاً.
هذه هي الفجوة التي بُني Falcon-Emirati-7B لسدها. إنه نموذج متخصص في اللهجة مبني على Falcon-H1-Arabic، ويستهدف فهم العربية الإماراتية وتوليدها بالطريقة التي يفهمها بها متحدث أصلي: المفردات والنبرة والسياق الثقافي الكامن وراءها.
مبني على Falcon-H1-Arabic
لم نبدأ من الصفر. Falcon-Emirati-7B مبني على Falcon-H1-Arabic، عائلة نماذجنا العربية التي وضعت بالفعل معايير جديدة للغة في وقت سابق من هذا العام. يستخدم Falcon-H1-Arabic بنية Falcon-H1 الهجينة: نماذج الفضاء الحالي (Mamba) وآلية انتباه المحوّل تعملان بالتوازي داخل كل كتلة، مع دمج مخرجاتهما قبل إسقاط كل كتلة. يمنح هذا المزيج كفاءة Mamba ذات الزمن الخطي على التسلسلات الطويلة مع الحفاظ على دقة الانتباه للاعتماديات بعيدة المدى، وهو أمر مهم للغة غنية مورفولوجياً مثل العربية. تمتد العائلة على ثلاثة أحجام (3B و7B و34B معاملات) بنوافذ سياق تصل إلى 128K و256K رمزاً، وقد تم تدريبها بالفعل على مزيج واسع من الفصحى والعربية اللهجية (الخليجية والشامية والمصرية والمغاربية) إلى جانب الإنجليزية وبيانات متعددة اللغات.
منحنا ذلك نقطة انطلاق قوية: نموذج يفهم العربية على نطاق واسع بالفعل، ويتعامل جيداً مع السياق الطويل، ويمتلك بعض الانكشاف على اللهجات مدمجاً فيه. يأخذ Falcon-Emirati-7B هذه الأساسات ويدفعها تحديداً نحو اللهجة الإماراتية: المفردات والقواعد والمعرفة الثقافية التي لا يلتقطها نموذج عربي عام، مهما بلغت قدرته، من تلقاء نفسه.
بنينا Falcon-Emirati-7B تحديداً على نسخة 7B. فهي النقطة المثلى في العائلة: كبيرة بما يكفي للحفاظ على الفروق الدقيقة التي يحتاجها تكييف اللهجة، وصغيرة بما يكفي ليبقى التدريب والاستدلال عمليين. من المرجح أن يدفع نموذج 34B الجودة قليلاً إلى أبعد، لكن بتكلفة تدريب وتقديم لا تكون منطقية لنموذج محادثة متخصص في لهجة، بينما لا يترك نموذج 3B مساحة كافية لعمق الفهم الثقافي واللغوي الذي كنا نسعى إليه. أعطتنا 7B أفضل توازن بين الجودة وتكلفة التدريب والاستدلال.
لماذا يُعد تكييف اللهجة صعباً
تحويل نموذج عربي عام إلى متخصص في اللهجة الإماراتية يبدو مهمة أصغر من بناء النموذج الأساسي في البداية. لكنها ليست كذلك. هناك أمور قليلة تجعلها صعبة فعلاً:
- الإماراتية هي في معظمها لهجة منطوقة. تظهر في الكتابة على الإنترنت أقل بكثير من الفصحى، أو حتى من لهجات خليجية وشامية أخرى، لذا لا يوجد ببساطة نص خام كافٍ للتعلم منه.
- المعنى غالباً غير حرفي. التعبيرات الاصطلاحية والأمثال والإحالات الشعرية تعتمد على سياق ثقافي مشترك، لا على المفردات الظاهرة.
- لا توجد خطة عمل راسخة. لا توجد وصفة موثقة جيداً لكمية البيانات اللهجية الكافية، أو كيفية مزجها بالفصحى والعربية العامة، أو أي مرحلة تدريب (الاستمرار في التدريب المسبق، أو SFT، أو تحسين التفضيل) هي الأهم لالتقاط لهجة.
شكّلت النقطة الأخيرة طريقة عملنا. جاء الكثير من بناء Falcon-Emirati-7B نتيجة التجربة والخطأ: اختبار مزائج بيانات ومراحل تدريب واستراتيجيات إشراف مختلفة، واستخدام الحكم البشري ودراجات المعايير المرجعية لمعرفة ما يحرّك الإبرة فعلاً.
نهجنا تجاه البيانات
بنينا خط بيانات إماراتياً مخصصاً فوق التدريب المسبق لـ Falcon-H1-Arabic، مستعينين بثلاثة مصادر متكاملة.
1. بيانات ويب أصيلة باللهجة الإماراتية
زحفنا وانتقينا محتوى من مواقع ومنتديات إماراتية مكتوب أصلاً باللهجة، لا مترجماً أو منقولاً حرفياً من الفصحى. هنا حصلنا على حقيقتنا المرجعية: كيف يكتب ويتحدث الإماراتيون فعلاً على الإنترنت، والعبارات اليومية، والتعبيرات العامية، والتبادل الطبيعي بين الإماراتية والفصحى الذي يظهر في الاستخدام الواقعي.
2. بيانات بالفصحى عن الثقافة والهوية الإماراتية
إلى جانب النصوص اللهجية، سحبنا مادة بالفصحى تتناول تحديداً الثقافة والتراث واللغة الإماراتية: مقالات ومراجع عن العادات والقيم والتاريخ والأعراف الاجتماعية المحلية، بما في ذلك كيفية إدراك الإماراتيين والصور النمطية عنهم. هذا لا يعلّم النموذج الكتابة باللهجة، لكنه يعلّمه ما يتحدث عنه عندما تُثار مواضيع إماراتية: أشياء مثل التراث وآداب السلوك والسياق الذي يعرفه المتحدث الأصلي تلقائياً.
3. بيانات اصطناعية موجّهة بقواميس المصطلحات وقواعد الأسلوب
لم يكن النص القِطري الأصيل وحده كافيًا لتغطية مجموعة المواضيع التي يحتاج نموذج الدردشة فعليًا إلى التعامل معها يومًا بعد يوم. لذا أنشأنا كمية كبيرة من البيانات الاصطناعية باللهجة الإماراتية لسدّ الفجوات. لم نترك نموذجًا مولّدًا يرتجلك في عربية "خليجية عمومية"، بل قيّدناه بقواعد صارمة وقواميس ومصطلحات مبنية خصيصًا للمفردات والقواعد الإماراتية. جعلت هذه الضوابط الفرق بين مخرجات اصطناعية تُقرأ كإماراتية أصيلة ومخرجات سليمة نحويًا لكنها تبدو غريبة لأي شخص يتحدث اللهجة فعلًا.
إيجاد وصفة التكييف المناسبة
ولعدم وجود وصفة معيارية للتكييف من الفصحى إلى اللهجة، تعاملنا مع استراتيجية التدريب ذاتها كأمر ينبغي اكتشافه تجريبيًا. أجرينا تجارب حذف (ablations) حول مقدار البيانات القِطرية التي ينبغي إدخالها وفي أي مرحلة من التدريب، وكيفية موازنة البيانات المجمّعة الأصيلة مع البيانات الاصطناعية دون أن يفرط النموذج في ملاءمة الأنماط الاصطناعية، ومقدار السياق الثقافي الفصيح اللازم فعلًا ليبقى النموذج مرتكزًا ثقافيًا لا مجرد سلس على السطح. وعند كل خطوة اعتمدنا على مزيج من التقييم الآلي ومراجعة الناطقين الأصليين، إذ لا تلتقط المقاييس الآلية وحدها الطبيعية أو النبرة أو الملاءمة الثقافية بدرجة تكفي للوثوق بها منفردة.
منهجية التقييم
تتبّعنا التقدم طوال التدريب بأسلوبين متكاملين:
التقييم اليدوي من الناطقين الأصليين
راجع ناطقون أصليون باللهجة الإماراتية مخرجات النموذج مباشرة، محكمين ليس فقط على صحة الإجابة بل على مدى سماعها صحيحًا: الطبيعية والنبرة والملاءمة الثقافية. هذه أمور لا تخبرك بها درجة اختبار معياري، لكن الأذن الأصلية تلتقطها فورًا.
التقييم الآلي على Alyah
وللتتبع الكمي، استخدمنا Alyah (الياه، "النجم الثابت")، وهو اختبار معياري أطلقناه نحن والمجتمع خصيصًا لتقييم القدرة على اللهجة الإماراتية في نماذج اللغة العربية الكبيرة. Alyah اختبار معياري أصيل بالكامل من نوع الاختيار من متعدد يضم 1,173 عينة، جُمعت يدويًا من ناطقين إماراتيين أصليين، ويغطي فئات تتراوح من التحيات وآداب التعامل اليومية إلى اللغة المجازية والمعرفة التراثية والشعر الإماراتي: وهي الفئات التي تُحدث فيها اللهجة والثقافة أكبر أثر والتي تميل فيها النماذج العربية العامة إلى التعثر. التفاصيل الكاملة حول بناء Alyah وتوزيع فئاته متاحة في منشور مدونة الاختبار المعياري، وخلفية عائلة النموذج الأساسية متاحة في إعلان Falcon-H1-Arabic.
النتائج
يحقق Falcon-Emirati-7B نتيجة 84.83% على Alyah، متقدمًا على كل نموذج عربي ومتعدد اللغات قارنّاه به، بما في ذلك عدة نماذج أكبر منه بأضعاف. يوضح الرسم البياني أدناه موقعه بجانب مجموعة تمثيلية من نماذج الضبط بالتعليمات الرائدة على لوحة صدارة Alyah.
دقة Alyah (%)، نماذج الضبط بالتعليمات. نماذج عائلة Falcon-H1-Arabic مستثناة من هذه المقارنة لأن Falcon-Emirati-7B مبني فوقها.
ما تخبرنا به النتائج
هناك أمران بارزان من هذه المقارنة: الحجم وحده لا يشتري لك الكفاءة في اللهجة. بعض أكبر النماذج متعددة اللغات هنا تسجل نتائج أقل بكثير من نماذج أصغر وأكثر وعيًا باللهجة، مما يخبرك أن الإتقان الإماراتي يجب أن يُدرَّب عمدًا ولا يُكتسب كأثر جانبي للتوسع. كما أن النماذج الأفضل أداءً تميل إلى أن تكون عربية الأصل أو عربية التوجه بدايةً، وهو ما يتوافق مع ما لاحظناه في تجارب الحذف لدينا: التغطية العامة للعربية واللهجات نقطة انطلاق ضرورية، لكنها لا تزال تتطلب عملًا موجّهًا خاصًا باللهجة لسد بقية الفجوة، خصوصًا في أصعب أجزاء Alyah، كالشعر والمعرفة التراثية وفئة اللغة واللهجة ذاتها.
يتوافق هذا أيضًا مع ما برز من إطلاق اختبار Alyah المعياري على نطاق أوسع: حتى النماذج القوية تُظهر تدهورًا حقيقيًا بمجرد الانتقال إلى محتوى قِطري أصيل وراسخ ثقافيًا. وهذه الفجوة لا تُسد تلقائيًا بنماذج أكبر، بل تتطلب بيانات وتقييمًا مبنيين خصيصًا للهجة.
ما بعد الاختيار من متعدد: تقييم LLM-as-Judge
تخبرك دقة الاختيار من متعدد ما إذا كان النموذج قادرًا على التعرف على الإجابة الصحيحة من بين أربعة خيارات، لكنه لا يخبرك ما إذا كان النموذج سيُنتج فعليًا العربية الإماراتية من تلقاء نفسه عندما يتحدث معه أحدهم مباشرة. لذلك، إلى جانب Alyah، أجرينا تقييمًا ثانيًا: توليد مفتوح على نفس الأسئلة البالغ عددها 1,173 سؤالًا من Alyah، وقيّمها حكم LLM (Gemini 3.7 Flash) ضد خمسة نماذج هي Falcon-Emirati-7B وALLaM-7B-Instruct-preview وgemma-3-27b-it وJais-2-8B-Chat وFanar-2-27B-Instruct، المختارة كأقوى النماذج المنافسة من لوحة صدارة Alyah.
قيّم الحُكَم كل إجابة على بعدين منفصلين: ما إذا كان المحتوى صحيحًا، وبشكل مستقل، ما إذا كانت الإجابة قد جاءت فعلًا باللهجة الإماراتية وليس بالفصحى الحديثة (MSA). نعرض درجة جزئية (تقييم الحُكَم المتدرج) ونسخة أكثر صرامة بنمط نجاح/فشل، بالإضافة إلى مدى تكرار امتناع كل نموذج عن الإجابة.
الصحة بحكم LLM على الأسئلة البالغ عددها 1,173 من Alyah، توليد مفتوح، Gemini 3.7 كحَكَم.
أمانة اللهجة بحكم LLM على نفس الأسئلة: هل تأتي الإجابة فعلًا بالإماراتية، أم أن النموذج يعود افتراضيًا إلى الفصحى الحديثة (MSA)؟
يتصدر Falcon-Emirati-7B في الصحة، لكن الفجوة الحقيقية في الرسم البياني الثاني. في أمانة اللهجة، يحصل Falcon-Emirati-7B على 0.52 (درجة جزئية) مقابل 0.05 لـ ALLaM، و0.03 لـ gemma-3-27b-it، و0.02 لـ Jais-2-8B-Chat، و0.00 فعليًا لـ Fanar-2-27B-Instruct. هذه ليست ميزة بسيطة، بل تقترب من مرتبتين حجميتين عند الطرف الأدنى. عمليًا، هذا يعني أن النماذج الأخرى غالبًا تعرف الإجابة الصحيحة لكنها تقولها بالعربية الفصحى الحديثة افتراضيًا، حتى عند مخاطبتها مباشرة بالإماراتية. Falcon-Emirati-7B هو الوحيد بين الخمسة الذي يجيب بموثوقية باللهجة التي سُئل بها.
يتميز Fanar-2-27B-Instruct لسبب ثانٍ أيضًا: فهو يمتنع عن الإجابة أكثر بكثير من أي نموذج آخر، رافضًا الإجابة بنسبة 26.2% من الوقت، مقابل أقل من 5% لكل نموذج آخر في المقارنة. وبالاقتران مع درجة صحته البالغة 0.27 (درجة جزئية)، وهي الأدنى بين الخمسة، يوحي ذلك بنموذج أقل استعدادًا وأقل قدرة على التعامل مع المحتوى الخاص بالإمارات، وليس مجرد نموذج يجيب بالسجل اللغوي الخاطئ.
أمانة اللهجة حسب فئات Alyah، درجة جزئية. Falcon-Emirati-7B هو النموذج الوحيد الذي ينتقل باستمرار إلى الإماراتية؛ أما البقية فيبقون بالفصحى الحديثة في كل فئة تقريبًا.
تفصيل أمانة اللهجة حسب الفئة يجعل النمط أوضح. تنطبق النتيجة على كل فئة في Alyah دون استثناء، من التحيات اليومية إلى الشعر، مما يوحي بأن هذه ليست حيلة ضيقة تُتعلَّم لعدد قليل من أنواع الأسئلة. إنه تحول عام في السجل اللغوي الذي يعتمده النموذج افتراضيًا عندما تكون الإماراتية هي السجل المتوقع. المكان الوحيد الذي تتصرف فيه النماذج المنافسة بشكل أفضل نسبيًا، التحيات والتعبيرات اليومية، هو أيضًا الفئة التي يتداخل فيها الإماراتي والفصحى الحديثة أكثر، لذا فهي أسهل مكان ليتصادف أن يبدو نموذج عربي عام صحيحًا.
المقارنة الزوجية، فئة بفئة
كمنظور ثالث على نفس السؤال، أجرينا تقييمًا زوجيًا مباشرًا: لكل سؤال من Alyah، عُرض على الحَكَم (Gemini 3.7 Flash) إجابة Falcon-Emirati-7B بجانب إجابة نموذج منافس، دون علمه بأي منه، وطُلب منه اختيار الأفضل. تُظهر مخططات الرادار أدناه معدل الفوز الناتج حسب الفئة ضد ثلاثة نماذج منافسة: Jais-2-8B-Chat وALLaM-7B-Instruct-preview وFanar-2-27B-Instruct.
معدل الفوز الزوجي حسب الفئة، Falcon-Emirati-7B مقابل Jais-2-8B-Chat وALLaM-7B-Instruct-preview وFanar-2-27B-Instruct، بتقييم مباشر من Gemini 3.7.
يفوز Falcon-Emirati-7B بأغلبية الفئات ضد المنافسين الثلاثة جميعًا، وبفارق كبير في الفئات الأكثر اعتمادًا على اللهجة والطلاقة الثقافية. ضد Jais-2-8B-Chat، تكون الفجوة أكبر في الشعر والتعبير الإبداعي (0.69 مقابل 0.31) واللغة واللهجة (0.62 مقابل 0.38). وضد ALLaM-7B-Instruct-preview، تُظهر الفئتان نفسهما مرة أخرى أوسع الفوارق: الشعر والتعبير الإبداعي (0.66 مقابل 0.34) واللغة واللهجة (0.58 مقابل 0.42). وضد Fanar-2-27B-Instruct، تكون الفوارق الأوسع بين المواجهات الثلاث كلها، ويفوز Falcon-Emirati-7B بكل فئة، وفي أعلى المقياس الشعر والتعبير الإبداعي (0.88 مقابل 0.12) والحساسية الدينية والاجتماعية (0.80 مقابل 0.20).
الفئة الوحيدة التي تصمد فيها النماذج المنافسة هي التحيات والتعبيرات اليومية: يخسرها Falcon-Emirati-7B بفارق ضيق أمام Jais-2-8B-Chat (0.46 مقابل 0.54) ويتعادل مع ALLaM-7B-Instruct-preview عند 0.50، مع أنه يفوز بوضوح ضد Fanar-2-27B-Instruct (0.70 مقابل 0.30). وهذا متسق عمومًا مع ما رأيناه في تفصيل أمانة اللهجة أعلاه؛ فالتحيات هي الفئة التي يتداخل فيها الإماراتي والفصحى الحديثة أكثر، لذا فهي أسهل مكان لِيبدو نموذج عربي عام أصيلًا حتى دون تدريب مخصص على اللهجة. وفي كل مكان تكون فيه اللهجة أكثر تميزًا، الشعر، واللغة المجازية، والمعرفة التراثية، تظل ميزة Falcon-Emirati-7B واضحة ضد كل نموذج منافس اختبرناه ضده.
فهم الثقافة الإماراتية
اللغة هي أيضًا فهم الثقافة الكامنة وراء المحادثة. قيّمنا Falcon-Emirati-7B على الجزء الخاص بالإمارات العربية المتحدة من ArabCulture-Dialogue، وهو معيار مرجعي لفهم الثقافة بالعربية. في مهمة الاختيار من متعدد، يختار النماذج الرد الأنسب ثقافيًا من بين ثلاثة خيارات. اقرأ المزيد في الورقة البحثية.
اختبرنا النماذج الأربع جميعها على نفس 283 سيناريو إماراتياً، باللهجة الإماراتية والعربية الفصحى الحديثة على حد سواء، وبمستويات متفاوتة من معلومات الموقع.
الدقة الإجمالية في مهمة الاختيار من متعدد الإماراتية، وهي متوسط محسوب عبر كلا تنوعي اللغة وجميع إعدادات الموقع. هذه هي نتائج تقييمنا.
حصل Falcon-Emirati-7B على 85.57%، وهي الأعلى بين النماذج الأربعة المختبرة، متقدماً على ALLaM-7B (83.39%) وJais-2-8B (73.79%) وFanar-2-27B (71.50%). تُبرز هذه النتائج قدرته على التعرف على الإجابات الملائمة ثقافياً في المحادثات الإماراتية.
شاهدها أثناء العمل
الأرقام لا تحكي سوى جزء من القصة، لذا فيما يلي مقارنة حية وتفاعلية: خمسة مطالبات إماراتية حقيقية، جرى تشغيلها عبر Falcon-Emirati-7B جنباً إلى جنب مع Fanar-2-27B-Instruct وALLaM-7B-Instruct-preview. اسحب أو استخدم الأسهم للتنقل بين المطالبات، ووسّع أي إجابة لقراءتها كاملة.
مقارنة تفاعلية: Falcon-Emirati-7B مقابل Fanar-2-27B-Instruct مقابل ALLaM-7B-Instruct-preview على خمس مطالبات إماراتية، تغطي تهنئات عيد الفطر، والتاريخ المحلي، والشعر، والمعرفة التراثية. تُعرض المخرجات كما وُلّدت وقد تحتوي على أخطاء؛ يحدد التظليل نموذجنا وليس تقييماً للدقة.
جرّب Falcon-Emirati-7B
يتوفر Falcon-Emirati-7B على منصة الدردشة لدينا. 🚀 جرّبه الآن: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
الذكاء الاصطناعي المسؤول والقيود
مثل أي نموذج لغوي، يمكن أن يعكس Falcon-Emirati-7B التحيزات الموجودة في بيانات تدريبه، وقد يخطئ أحياناً، خاصةً في التعبيرات النادرة أو الإشارات المحلية جداً أو الحالات الطرفية التي لم تكن لدينا بيانات كثيرة عنها. الفروق اللهجية والثقافية ذاتية في بعض المواضع، وحتى الناطقون الأصليون لن يتفقوا دائماً على الإجابة "الصحيحة". نوصي بتقييم النموذج لحالة الاستخدام المحددة لديك قبل الاعتماد عليه في أي شيء حساس أو رسمي أو عالي المخاطر، ونتلقى بكل ترحاب ملاحظات المجتمع الإماراتي لمساعدتنا على تحسين النموذج ومنصة Alyah مستقبلاً.
شكر وتقدير
نود أن نتقدم بجزيل الشكر إلى Mikhail Lubinets وMatthieu Berjon على دعمهما المستمر للبنية التحتية للحوسبة، وإلى Jatin Mittal على مساعدته في إتاحة النموذج عبر تطبيق Falcon Chat.
الاستشهاد
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







