L’arabe est en réalité une famille de langues qui portent le même nom. L’arabe standard moderne est celui que l’on lit dans les nouvelles ou dans un manuel, mais c’est rarement la manière dont les gens parlent entre eux. Dans les Émirats arabes, les conversations quotidiennes, l’humour, les négociations et les récits se font en arabe émirati, un dialecte du Golfe avec son propre vocabulaire, son propre rythme et une culture entièrement liée à lui. La poésie émiratie, en particulier la poésie nabati, ainsi que les proverbes et les anecdotes courtes, possèdent un sens qui ne se perçoit pas dans une lecture littérale, mot pour mot. Un modèle ne connaissant que le MSA peut traduire chaque mot d’une phrase émiratie, mais il manquera toujours de comprendre son véritable sens.
C’est la lacune que le Falcon-Emirati-7B est conçu à combler. C’est un modèle spécialisé dans une dialecte, basé sur le Falcon-H1-Arabic, destiné à comprendre et générer l’arabe émirati comme le fera un natif : le vocabulaire, le ton et le contexte culturel qui se cache derrière.
Construit sur Falcon-H1-Arabic
Nous n’avons pas commencé depuis zéro. Le Falcon-Emirati-7B est construit sur le Falcon-H1-Arabic, notre famille de modèles arabe qui a déjà établi de nouveaux standards pour la langue au début de cette année. Le Falcon-H1-Arabic utilise l’architecture hybride Falcon-H1 : des modèles de espace d’état (Mamba) et une attention Transformer fonctionnant en parallèle dans chaque bloc, avec leurs sorties fusionnées avant la projection de chaque bloc. Cette combinaison offre l’efficacité en temps linéaire de Mamba sur les séquences longues, tout en conservant la précision nécessaire pour les dépendances à longue distance, ce qui est important pour une langue morphologiquement riche comme l’arabe. La famille comprend trois niveaux de paramètres (3B, 7B et 34B), avec des fenêtres de contexte atteignant 128K et 256K tokens. Elle a déjà été entraînée sur une large variété de données MSA et d’arabe dialectal (Gulf, Levantin, Égyptien, Maghrébin) ainsi que sur des données en anglais et multilingues.
Cela nous a donné un point de départ solide : un modèle qui comprend déjà largement l’arabe, gère bien les contextes longs et possède une exposition aux dialectes emiratiennes. Falcon-Emiratien-7B utilise cette base pour se concentrer spécifiquement sur le dialecte emiratien, le vocabulaire, la grammaire et les connaissances culturelles que même un modèle d’arabe général, très compétent, ne peut acquérir de lui-même.
Nous avons construit Falcon-Emirati-7B spécifiquement basé sur la variante 7B. C’est le point idéal de cette famille : suffisamment grand pour prendre en compte les besoins liés à l’adaptation dialectale, mais suffisamment petit pour que le entraînement et l’inférence restent pratiques. Le modèle 34B pourrait probablement améliorer la qualité un peu plus, mais au coût d’entraînement et de service qui n’est pas pertinent pour un modèle de chat spécialisé dans les dialectes, et le modèle 3B ne laisse pas suffisamment de marge pour la profondeur de la compréhension culturelle et linguistique que nous voulions atteindre. 7B nous a offert le meilleur équilibre entre la qualité et les coûts de formation et d’inférence.
Pourquoi l’adaptation du dialecte est difficile
Transformer un modèle arabe général en spécialiste du dialecte émirati semble moins difficile que de construire le modèle de base au départ. Mais ce n’est pas le cas. Plusieurs facteurs rendent cela vraiment difficile :
- L’émiratien est principalement un dialecte parlé. Il apparaît beaucoup moins en écrit dans les sites en ligne que le MSA, ou même d’autres dialectes du Golfe et du Levant, donc il n’y a pas autant de texte brut à apprendre.
- Le sens est souvent non littéral. Les idiomes, les proverbes et les références poétiques s’appuient sur un contexte culturel commun, et non sur le vocabulaire superficiel.
- Il n’existe pas de méthode établie. Il n’y a pas de recette bien documentée quant à la quantité de données dialectales nécessaire, comment les mélanger avec le MSA et l’arabe général, ou quelle étape d’entraînement (pré-trainement continu, SFT ou optimisation des préférences) est la plus importante pour apprendre un dialecte.
Ce dernier point a déterminé la manière dont nous avons travaillé. Beaucoup de l’construction de Falcon-Emirati-7B s’est basée sur des essais et erreurs : tester différentes combinaisons de données, différentes étapes d’entraînement et différentes stratégies de supervision, et utiliser à la fois le jugement humain et les scores de benchmark pour déterminer ce qui était réellement efficace.
Notre approche des données
Nous avons construit un pipeline de données dédié pour l’Émirat sur la base du pré-entraînement de Falcon-H1-Arabic, en nous appuyant sur trois sources complémentaires.
1. Données web en dialecte émirati authentique
Nous avons crawlé et curaté des contenus provenant de sites web et de forums émirati écrits nativement dans le dialecte, sans être traduits ou translittérés depuis le MSA. C’est là que nous avons obtenu la vérité fondamentale : la manière dont les Émiratis écrivent et parlent en ligne, les expressions quotidiennes, les expressions coloquales, ainsi que les échanges naturels entre Émiratis et MSA qui apparaissent dans la pratique réelle.
2. Données MSA sur la culture et l’identité émirati
Parallèlement au texte dialectal, nous avons inclus des documents en langue MSA concernant la culture, le patrimoine et la langue émirati : articles et références sur les coutumes locales, les valeurs, l’histoire et les normes sociales, y compris la manière dont les Émiratis sont perçus et stéréotypés. Cela ne permet pas au modèle de écrire en dialecte, mais lui montre de quoi il parle lorsque des sujets liés aux Émiratis sont abordés, comme le patrimoine, les codes de politesse et le contexte que connaît un locuteur natif.
3. Données synthétiques, guidées par des glossaires et des règles de style
Seul le texte authentique en dialecte n’était pas suffisant pour couvrir l’ensemble des sujets que un modèle de chat doit gérer au quotidien. Nous avons donc généré une grande quantité de données synthétiques en dialecte émirati pour combler les lacunes. Nous n’avons pas laissé un modèle de générateur improviser en arabe « du Golfe ». Nous l’avons contraint par des règles strictes et des glossaires et dictionnaires spécifiquement conçus pour le vocabulaire et la grammaire émirati. Ces limites ont fait la différence entre une sortie synthétique qui semble authentiquement émirite et une sortie qui est grammaticalement correcte mais sonne bizarre pour quiconque parle réellement le dialecte.
Trouver la bonne recette d’adaptation
Comme il n’existe pas de recette standard pour l’adaptation du MSA au dialecte, nous avons traité la stratégie d’entraînement elle-même comme quelque chose à déterminer expérimentalement. Nous avons testé différentes techniques d’ablation pour déterminer quelle quantité de données dialectales injecter et à quelle étape de l’entraînement, comment équilibrer les données authentiques extraites du texte contre les données synthétiques sans que le modèle ne se sur entraîne dans des schémas synthétiques, et quelle quantité de contexte culturel MSA était réellement nécessaire pour le maintenir ancré dans la culture plutôt que simplement fluide à l’ surface. À chaque étape, nous nous appuyons sur une combinaison de notation automatique et de revue effectuée par des natifs, car les indicateurs automatiques seuls ne suffisent pas à capturer la naturelité, le ton ou l’adéquation culturelle, afin de pouvoir compter dessus seuls.
Méthodologie d'évaluation
Nous avons suivi les progrès tout au long de l’entraînement en utilisant deux approches complémentaires :
Évaluation manuelle par des natifs
Les natifs emiratiennes ont examiné directement les résultats du modèle, en jugeant non seulement si la réponse était correcte, mais aussi si elle sonnait naturelle : naturel, ton, appropriation culturelle. Ce sont des éléments que le score de référence ne peut pas indiquer, mais que l’oreille native détecte immédiatement.
Évaluation automatique sur Alyah
Pour le suivi quantitatif, nous avons utilisé Alyah (الياه, « L’Étoile du Nord »), un benchmark que nous et la communauté avons publié spécifiquement pour évaluer les capacités des LLMs en arabe dialectale émirati. Alyah est un benchmark de type multiple-choice entièrement natif comprenant 1 173 échantillons, recueilli manuellement auprès de locuteurs natifs émiratis et couvrant des catégories allant des salutations et bonnes manières quotidiennes aux langages figuratifs, aux connaissances sur le patrimoine et à la poésie émirati : les catégories où le dialecte et la culture jouent le plus de rôle, et où les modèles arabes généraux ont tendance à souffrir. Les détails complets sur la construction de Alyah et la répartition des catégories sont disponibles dans notre article de blog sur les benchmarks, tandis que les informations sur la famille de modèles de base est disponible dans l’annonce Falcon-H1-Arabic.
Résultats
Falcon-Emirati-7B obtient 84,83% sur Alyah, devant tous les autres modèles arabes et multilingues avec lesquels il a été comparé, y compris plusieurs modèles dix fois plus gros que lui. Le graphique ci-dessous montre où il se place par rapport à un ensemble représentatif de modèles référents adaptés aux instructions sur le classement Alyah.
Précision de Alyah (%), modèles ajustés selon les instructions. Les modèles de la famille Falcon-H1-Arabic ne sont pas inclus dans cette comparaison, car Falcon-Emirati-7B est construit sur eux.
Ce que les résultats nous disent
Quelques points ressortent de cette comparaison. La taille seule ne vous garantit pas la compétence en dialectes. Certains des modèles multilingues les plus grands obtiennent des scores inférieurs à ceux plus petits, qui prennent en compte les dialectes, ce qui indique que la maîtrise de l’arabe émirati doit être apprise de manière intentionnelle, et non acquise comme effet secondaire de la taille. Les modèles qui se distinguent le plus ont également tendance à être natifs en arabe ou axés sur l’arabe, ce qui correspond à ce que nous avons observé lors de nos propres études : la couverture générale de l’arabe et des dialectes constitue un point de départ nécessaire, mais il reste nécessaire de mener des travaux ciblés spécifiques pour les dialectes afin de combler le reste du écart, en particulier dans les domaines les plus difficiles comme la poésie, les connaissances héritées et la catégorie langue-dialecte.
Cela correspond également à ce qui a été observé dans la sortie du benchmark Alyah : même les modèles puissants montrent une véritable dégradation dès qu’on passe à des contenus véritablement dialectaux et intégrés culturellement. Cette différence ne se résout pas toute seule avec des modèles plus grands. Il faut des données et des évaluations spécifiquement conçues pour le dialecte.
Au-delà des choix multiples : Évaluation des LLM en tant que juge
La précision du quiz vous indique si un modèle peut reconnaître la bonne réponse parmi quatre options. Cela ne vous dit pas si le modèle produira réellement de l’arabe émirati seul lorsque quelqu’un lui parle. Ainsi, en plus d’Alyah, nous avons réalisé une deuxième évaluation : génération ouverte sur les mêmes 1 173 questions d’Alyah, évaluée par un juge LLM (Gemini 3.7 Flash) face à cinq modèles : Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat et Fanar-2-27B-Instruct, choisis comme les modèles compétents les plus forts de la liste des leaders d’Alyah.
Le juge a évalué chaque réponse selon deux dimensions distinctes : la justesse du contenu et, indépendamment de cela, le fait que la réponse était effectivement donnée en dialecte émirati plutôt qu’en MSA. Nous rapportons à la fois un score partiel (l’évaluation qualifiée du juge) et une version plus stricte de passage/échec, ainsi que la fréquence à laquelle chaque modèle se trompait en ne répondant pas.
La justesse du LLM a été jugée sur 1 173 questions Alyah, avec une génération ouverte, par Gemini 3.7.
Le modèle LLM a évalué la fidélité du dialecte sur les mêmes questions : l’answer est-elle vraiment donnée en arabe émirati, ou le modèle se réfère par défaut au MSA ?
Falcon-Emirati-7B se distingue en termes de précision, mais l’écart réel se situe dans le deuxième graphique. En matière de fidélité dialectale, Falcon-Emirati-7B obtient 0,52 (crédit partiel) contre 0,05 pour ALLaM, 0,03 pour gemma-3-27b-it, 0,02 pour Jais-2-8B-Chat, et effectivement 0,00 pour Fanar-2-27B-Instruct. Ce n’est pas un avantage mineur ; c’est un écart de près de deux ordres de grandeur à l’échelle basse. En pratique, cela signifie que les autres modèles connaissent souvent la bonne réponse, mais la disent par défaut en arabe standard moderne, même lorsqu’on leur pose une question directement en émirati. Le Falcon-Emirati-7B est le seul des cinq à répondre de manière fiable dans le dialecte dans lequel il a été questionné.
Fanar-2-27B-Instruct se distingue également pour une deuxième raison : il refuse bien plus que tout autre modèle, refusant de répondre à 26,2 % des fois, contre moins de 5 % pour tous les autres modèles comparés. Avec un score de précision de 0,27 (crédit partiel), le plus bas parmi les cinq, cela suggère qu’il est à la fois moins disposé et moins capable de traiter des contenus spécifiques aux Émirats, plutôt que simplement de répondre de manière incorrecte.
Fidélité du dialecte selon la catégorie Alyah, crédit partiel. Le Falcon-Emirati-7B est le seul modèle qui se tourne systématiquement vers l’emiratien ; les autres restent en MSA dans presque toutes les catégories.
Décomposer la fidélité dialectale par catégorie rend le modèle encore plus clair. Cela s’applique à toutes les catégories dans Alyah, des salutations quotidiennes aux poèmes, ce qui indique qu’il ne s’agit pas d’un stratagème limité appris pour quelques types de questions. Il s’agit d’un changement général dans le registre auquel le modèle se réfère par défaut lorsque le registre émirati est attendu. Le seul domaine où les modèles concurrents se comportent relativement mieux, Greetings & Daily Expressions, est également la catégorie où l’emiratien et le MSA se chevauchent le plus ; c’est donc le meilleur endroit pour qu’un modèle d’arabe générique semble par hasard correct.
Comparaison par paires, catégorie par catégorie
Comme une troisième perspective sur la même question, nous avons mené des évaluations par paires : pour chaque question d’Alyah, le juge (Gemini 3.7 Flash) a vu la réponse de Falcon-Emirati-7B à côté de celle d’un modèle concurrent, sans connaître laquelle était meilleure, et devait choisir la meilleure réponse. Les graphiques radar ci-dessous montrent le taux de victoire obtenu par catégorie face à trois modèles concurrents : Jais-2-8B-Chat, ALLaM-7B-Instruct-preview et Fanar-2-27B-Instruct.
Taux de victoire par paire par catégorie : Falcon-Emirati-7B contre Jais-2-8B-Chat, ALLaM-7B-Instruct-preview et Fanar-2-27B-Instruct a été évalué face à face par Gemini 3.7.
Falcon-Emirati-7B remporte la majorité des catégories face aux trois concurrents, et par un écart important dans les catégories qui dépendent fortement de la maîtrise du dialecte et de la fluidité culturelle. Face à Jais-2-8B-Chat, l’écart est le plus grand en Poésie et Expression Créative (0,69 contre 0,31) et en Langue et Dialecte (0,62 contre 0,38). Face à ALLaM-7B-Instruct-preview, les mêmes deux catégories présentent à nouveau les écarts les plus importants : Poésie et Expression Créative (0,66 contre 0,34) et Langue et Dialecte (0,58 contre 0,42). Contre Fanar-2-27B-Instruct, les marges sont les plus larges de toutes les trois confrontations, et Falcon-Emirati-7B remporte chaque catégorie, atteignant des scores élevés en Poésie et Expression Créative (0,88 contre 0,12) et en Sensibilité Religieuse et Sociale (0,80 contre 0,20).
La catégorie où les modèles concurrents tiennent leur place est les Salutations et expressions quotidiennes : Falcon-Emirati-7B perd nettement face à Jais-2-8B-Chat (0,46 contre 0,54) et se met en équilibre avec ALLaM-7B-Instruct-preview à 0,50, bien qu’il gagne clairement contre Fanar-2-27B-Instruct (0,70 contre 0,30). Cela est largement en accord avec ce que nous avons vu dans le décompte de fidélité au dialecte ci-dessus. Les salutations sont la catégorie où l’emiratien et le MSA se chevauchent le plus, donc c’est le point le plus facile pour un modèle d’arabe générique de paraître natif, même sans formation spécifique sur les dialectes. Lorsque le dialecte est plus distinctif, comme dans la poésie, le langage figuré ou les connaissances historiques, l’avantage de Falcon-Emirati-7B reste clairement présent face à tous les modèles concurrents que nous avons testés.
Comprendre la culture émirati
La langue consiste également à comprendre la culture qui se cache derrière une conversation. Nous avons évalué Falcon-Emirati-7B sur la partie des Émirats arabes de ArabCulture-Dialogue, un benchmark pour la compréhension culturelle en langue arabe. Dans sa tâche de choix multiple, les modèles choisissent la réponse la plus appropriée culturellement parmi trois options. Lisez plus en détail dans le article de recherche.
Nous avons testé les quatre modèles sur les mêmes 283 scénarios UAE, en arabe émirati et en arabe standard moderne, avec des quantités variées d'informations sur l'emplacement.
Précision globale sur l’exercice de choix multiples des Émirats arabes unis, en moyenne pour les deux variétés de langues et toutes les configurations de localisation. Ce sont nos résultats d’évaluation.
Falcon-Emirati-7B a obtenu 85,57 %, le score le plus élevé parmi les quatre modèles testés, devant ALLaM-7B (83,39 %), Jais-2-8B (73,79 %) et Fanar-2-27B (71,50 %). Ces résultats mettent en évidence sa capacité à reconnaître des réponses culturellement appropriées dans les conversations émirati.
Voir en action
Seuls les chiffres révèlent une partie de l’histoire, donc ci-dessous se trouve une comparaison en temps réel et interactive : cinq prompts réels émiratis, testés côte à côte avec Falcon-Emirati-7B, Fanar-2-27B-Instruct et ALLaM-7B-Instruct-preview. Faites glisser ou utilisez les flèches pour passer entre les prompts, et étendez toute réponse pour la lire en entier.
Comparaison interactive : Falcon-Emirati-7B vs. Fanar-2-27B-Instruct vs. ALLaM-7B-Instruct-preview sur cinq prompts émiratis, couvrant les salutations du Eid, l’histoire locale, la poésie et les connaissances liées au patrimoine. Les sorties sont affichées comme générées et peuvent contenir des erreurs ; l’accentuation identifie notre modèle, mais ne constitue pas une évaluation factuelle.
Testez Falcon-Emirati-7B
Falcon-Emirati-7B est disponible sur notre plateforme de chat. 🚀 Essaie-le maintenant : https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
AI responsable et limites
Comme tout modèle linguistique, Falcon-Emirati-7B peut refléter des biais dans ses données d’entraînement et parfois se tromper, en particulier pour les expressions rares, les références très locales ou les cas limites pour lesquels nous n’avons pas beaucoup de données. Les dialectes et les nuances culturelles sont subjectifs, et même les locuteurs natifs ne seront pas toujours d’accord sur la « bonne » réponse. Nous recommandons d’évaluer le modèle pour votre cas d’usage spécifique avant de compter sur lui pour tout ce qui est sensible, officiel ou à haut risque. Nous serions vraiment reconnaissants pour les retours de la communauté émirati afin que nous puissions améliorer à la fois le modèle et Alyah à l’avenir.
>Remerciements
Nous souhaitons exprimer nos sincères remerciements à Mikhail Lubinets et Matthieu Berjon pour leur soutien continu concernant l’infrastructure informatique, ainsi qu’à Jatin Mittal pour son aide dans la rendre le modèle accessible via l’application Falcon Chat.
Citation
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







