Arabsisch ist tatsächlich eine Sprachfamilie, die unter einem Namen existiert. Das moderne Standard-Arabisch ist das, was man in den Nachrichten oder in Lehrbüchern liest, aber es wird selten so gesprochen, wie Menschen miteinander kommunizieren. In den UAE wird das tägliche Gespräch, Humor, Verhandlung und Erzählen auf Emirati-Arabisch ausgedrückt – einem Golfdialekt mit seinem eigenen Wortschatz, seinem eigenen Rhythmus und einer Kultur, die eng um ihn herum liegt. Emiratische Poesie, insbesondere Nabati-Poesie, zusammen mit Sprichwörtern und kurzen Anekdoten trägt eine Bedeutung, die bei einer wörtlichen, Wort für Wort-Übersetzung nicht erhalten bleibt. Ein Modell, das nur MSA kennt, kann jedes Wort eines emiratischen Satzes übersetzen, aber dennoch das eigentliche Sinne verfehlen.
Das ist die Lücke, die der Falcon-Emirati-7B ausfüllen soll. Es handelt sich um ein auf Dialekte spezialisiertes Modell auf der Basis des Falcon-H1-Arabic, das darauf abzielt, den Emirati-Arabisch so zu verstehen und zu generieren wie ein Muttersprachler: das Vokabular, den Tonfall und den kulturellen Kontext dahinter.
> Erstellt auf Falcon-H1-Arabic
Wir haben nicht von vorne angefangen. Der Falcon-Emirati-7B basiert auf dem Falcon-H1-Arabic, unserer arabischen Modellfamilie, die bereits Anfang dieses Jahres neue Benchmarks für die Sprache setzte. Das Falcon-H1-Arabic verwendet die hybride Architektur Falcon-H1: State Space Models (Mamba) und Transformer-Attention, die parallel in jedem Block laufen und ihre Ausgaben vor der Projektion jedes Blocks zusammengeführt werden. Diese Kombination bietet die lineare-Effizienz von Mamba für lange Sequenzen, während die Präzision der Aufmerksamkeit für lange Entfernungsabhängigkeiten erhalten bleibt – was für eine morphologisch reiche Sprache wie Arabisch wichtig ist. Die Familie umfasst drei Skalen (3B, 7B und 34B Parameter), mit Kontextfenstern bis zu 128K und 256K Tokens. Sie wurde bereits auf einer breiten Mischung aus MSA und dialektalem Arabisch (Gulf, Levant, Ägypten, Maghrebi) sowie Englisch und mehrsprachigen Daten trainiert.
Das gab uns einen starken Ausgangspunkt: ein Modell, das bereits breit über Arabisch verfügt, gut mit langem Kontext umgeht und eine gewisse Erfahrung im Emirati-Dialekt hat. Falcon-Emirati-7B nutzt diese Grundlage und fördert sie gezielt im Emirati-Dialekt, im Wortschatz, in der Grammatik und im kulturellen Wissen – Dinge, die ein allgemeines Arabisch-Modell, egal wie kompetent, nicht selbst erlangen kann.
Wir haben Falcon-Emirati-7B speziell auf der 7B-Variante entwickelt. Es ist der ideale Punkt in der Familie: groß genug, um die Anforderungen der Dialektanpassung zu erfüllen, aber klein genug, damit sowohl das Training als auch die Inferenz praktisch bleiben. Das 34B-Modell würde wahrscheinlich die Qualität etwas weiter erhöhen, aber bei den Kosten für Training und Bereitstellung ist es für ein dialekt-spezifisches Chatmodell unsinnig. Das 3B-Modell lässt außerdem nicht genug Platz für die Tiefe der kulturellen und sprachlichen Verständnis, nach dem wir streben. 7B bot uns den besten Ausgleich zwischen Qualität und den Kosten für Training und Inferenz.
Warum die Dialekt-Anpassung schwierig ist
Die Umwandlung eines allgemeinen arabischen Modells in einen Experten für den Emiratien-Dialekt klingt als weniger schwierige Aufgabe als die Erstellung des Grundmodells von Anfang an. Das ist jedoch nicht der Fall. Einige Dinge machen es wirklich schwierig:
- Emiratisch ist hauptsächlich ein gesprochener Dialekt. Er kommt im Online-Schreiben viel seltener vor als MSA oder andere Golf- und Levantinische Dialekte, daher gibt es kaum Text, aus dem man lernen könnte.
- Die Bedeutung ist oft nicht wörtlich. Idiome, Sprichwörter und poetische Anspielungen beruhen auf einem gemeinsamen kulturellen Kontext, nicht auf der Oberflächenwörterliste.
- Es gibt keine etablierte Anleitung. Es gibt keine gut dokumentierte Methode, wie viel Dialektdaten ausreichen, wie man sie mit MSA und allgemeinem Arabisch vermischen sollte, oder welche Trainingsstufe (angehängtes VorTrainieren, SFT oder Präferenzoptimierung) am wichtigsten ist, um einen Dialekt zu erlernen.
Dieser letzte Punkt bestimmte die Art und Weise, wie wir arbeiteten. Viel des Aufbaus von Falcon-Emirati-7B beruhte auf Versuch und Irrtum: Es wurden verschiedene Datenmischungen getestet, Trainingsphasen und Überwachungsstrategien ausprobiert, und sowohl menschliches Urteil als auch Benchmark-Punkte wurden genutzt, um herauszufinden, was tatsächlich den Fortschritt erzielte.
Unsere Vorgehensweise bei der Datenverarbeitung
Wir haben eine spezialisierte Emiratische Datenpipeline auf der Grundlage des Vortrainings von Falcon-H1-Arabic erstellt, wobei wir drei komplementäre Quellen nutzen.
1. Authentic Emirati-Dialekt Web-Daten
Wir haben Inhalte von emiratischen Webseiten und Foren gesammelt und bearbeitet, die ausschließlich in dem Dialekt geschrieben sind, nicht übersetzt oder transkribiert aus MSA. Hier erhielten wir die eigentliche Wahrheit: wie Emirenten im Internet schreiben und sprechen, die alltäglichen Ausdrücke, die umgangssprachlichen Phrasen sowie der natürliche Dialog zwischen Emirenten und MSA, der in echter Verwendung auftritt.
2. MSA-Daten über die kulturelle und identitäre Welt der Emiratis
Neben dem Dialekttext haben wir auch Material auf MSA-Sprache hinzugefügt, das sich speziell mit der kulturellen Erbschaft und der Sprache der Emiraten beschäftigt: Artikel und Referenzen zu lokalen Bräuchen, Werten, Geschichte und sozialen Normen, einschließlich der Art und Weise, wie die Emiraten Menschen wahrgenommen und stereotypisiert werden. Dies lehrt das Modell nicht, in Dialekt zu schreiben, sondern zeigt, worüber es spricht, wenn Themen zur Emiratensprache auftauchen – Dinge wie Erbschaft, Etikette und den Kontext, den ein Muttersprachler kennt.
3. Synthetische Daten, geleitet durch Glossare und Stilregeln
Allein authentisches Dialekttext war nicht ausreichend, um den Bereich an Themen abzudecken, den ein Chatmodell täglich bewältigen muss. Deshalb haben wir eine große Menge synthetischen emiraten-dialektischen Datensatzes erstellt, um die Lücken zu füllen. Wir haben nicht einfach einem Generierungsmodell erlaubt, im „Gulf-ish“-Arabisch nach Belieben zu improvisieren. Stattdessen haben wir es mit strengen Regeln sowie Glossarien und Wörterbüchern belegt, die speziell für das emiratenische Vokabular und die Grammatik erstellt wurden. Diese Sicherheitsmaßnahmen machten den Unterschied zwischen einem synthetischen Output, der als authentisch emiratisch gelesen wird, und einem Output, der grammatikalisch gut ist, aber für jemanden, der das Dialekt spielt, ungewöhnlich klingt.
Die Suche nach der richtigen Anpassungsmethode
Da es keine standardisierte Methode für die Anpassung von MSA an einen Dialekt gibt, betrachteten wir die Trainingsstrategie selbst als etwas, das man experimentell herausfinden muss. Wir untersuchten, wie viel dialektales Daten eingefügt werden soll und in welcher Phase des Trainings, wie man authentische gesammelte Daten gegen synthetische Daten ausbalancieren kann, ohne dass das Modell zu synthetischen Mustern überflüssig wird, und wie viel kulturelles Kontext der MSA tatsächlich benötigt wird, um ihn kulturell fundiert zu halten und nicht nur oberflächlich flüssig zu sein. Bei jeder Stufe haben wir eine Mischung aus automatischem Bewertungsverfahren und Überprüfung durch Muttersprachler verwendet, da allein die automatischen Indikatoren nicht ausreichend die Natürlichkeit, den Tonfall oder die kulturelle Passung abbilden, um darauf allein zu vertrauen.
Evaluationsmethode
Wir haben den Fortschritt während des Trainings mit zwei komplementären Ansätzen verfolgt:
Manuelle Bewertung durch Muttersprachler
Emiratische Muttersprachler überprüften die Modelle direkt, und sie bewerteten nicht nur, ob die Antwort richtig war, sondern auch, ob sie natürlich klang: Natürlichkeit, Tonfall, kulturelle Passung. Das sind Dinge, die ein Benchmark-Score nicht erkennen kann, aber ein Muttersprachler sofort erfasst.
Automatische Bewertung auf Alyah
Für die quantitative Überwachung verwendeten wir Alyah (الياه, „Nordstern“), ein Benchmark, den wir und die Community speziell zur Bewertung der Dialektfähigkeit in arabischen LLMs im Emirati-Dialekt veröffentlicht haben. Alyah ist ein vollständig nativem Multiple-Choice-Benchmark mit 1.173 Beispielen, der manuell von natürlichen Emirati-Sprechern gesammelt wurde und alle Kategorien umfasst, die von alltäglichen Begrüßungen und Etikette bis hin zu bildhafter Sprache, Erbewissen und Emirati-Poesie reichen: Kategorien, in denen Dialekt und Kultur am wichtigsten sind und in denen generische arabische Modelle oft Schwierigkeiten haben. Alle Details zur Konstruktion von Alyah und zur Kategorienaufteilung finden Sie in unserem Benchmark-Blogpost, und die Hintergrundinformationen zur Familie der Basismodelle sind in dem Falcon-H1-Arabic-Announcement zu finden.
Ergebnisse
Falcon-Emirati-7B erzielt 84,83% auf Alyah, vor allen anderen arabischen und mehrsprachigen Modellen, mit denen wir verglichen haben, einschließlich mehrerer Modelle, die um einiges größer sind als dieses. Die untenstehende Grafik zeigt, wo es neben einer repräsentativen Gruppe von modifizierten Instruktionsmodellen auf der Alyah-Leistungsliste steht.
Alyah-Erkennungsrate (%), instruktionsgesteuerte Modelle. Die Modelle der Falcon-H1-Arabic-Familie werden aus dieser Vergleichung ausgeschlossen, da das Falcon-Emirati-7B auf ihnen basiert.
Was die Ergebnisse uns sagen
Ein paar Dinge springen bei dieser Vergleichung ins Auge. Die Größe allein reicht nicht aus, um die Fähigkeit zu Sprachkompetenz zu erlangen. Einige der größten mehrsprachigen Modelle erzielen eine schlechte Bewertung im Vergleich zu kleineren, sprachsensitiven Modellen – das zeigt, dass die Kompetenz in der arabischen Sprache bewusst trainiert werden muss, nicht als Nebeneffekt der Größe. Die Modelle, die am besten sind, sind in der Regel auch an Arabisch gebaut oder fokussiert auf Arabisch – was mit dem übereinstimmt, was wir bei unseren eigenen Untersuchungen festgestellt haben: Die allgemeine Abdeckung des Arabischen und der Dialekte ist ein notwendiger Ausgangspunkt, aber es bedarf weiterhin gezielten, dialekt-spezifischen Arbeiten, um den Rest der Lücke zu schließen, insbesondere bei den schwierigsten Bereichen wie Poesie, Wissen über die Kulturgeschichte und der Kategorie Sprache und Dialekt.
Dies entspricht auch dem, was aus der Alyah-Benchmark-Version hervorgeht: Selbst starke Modelle zeigen eine echte Degradation, sobald man auf Inhalte einläuft, die tatsächlich dialektal und kulturell verankert sind. Diese Lücke schließt sich nicht von selbst mit größeren Modellen. Es sind Daten und Bewertungen erforderlich, die speziell für den Dialekt entwickelt wurden.
Jenseits der Multiple-Choice-Option: LLM als Richter-Evaluierung
Die Genauigkeit der Multiple-Choice-Fragen zeigt an, ob ein Modell die richtige Antwort unter vier Optionen erkennen kann. Sie sagt jedoch nicht aus, ob das Modell tatsächlich eigenständig Emirati-Arabisch produziert, wenn jemand mit ihm spricht. Also führten wir neben Alyah eine zweite Bewertung durch: offene Generierung für die gleichen 1.173 Alyah-Fragen, bewertet von einem LLM-Judge (Gemini 3.7 Flash) gegen fünf Modelle – Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat und Fanar-2-27B-Instruct, die als die stärksten konkurrierenden Modelle aus der Alyah-Liste ausgewählt wurden.
Der Richter bewertete jede Antwort an zwei unterschiedlichen Kriterien: ob der Inhalt richtig war und, unabhängig davon, ob die Antwort tatsächlich im Emiratischen Dialekt statt in MSA erfolgte. Wir berichten sowohl über eine teilweise Punktzahl (die bewertete Beurteilung des Richters) als auch über eine strengere Pass/Fail-Version, sowie darüber, wie oft jedes Modell abwichen und nicht antworten.
Die Korrektheit wurde durch ein LLM auf 1.173 Alyah-Fragen bewertet, mit offenen generativen Aufgaben, Gericht: Gemini 3.7.
Der LLM bewertete die Dialekttreue zu denselben Fragen: kommt die Antwort tatsächlich in Arabisch, oder wählt das Modell standardmäßig MSA?
Falcon-Emirati-7B führt in Bezug auf Korrektheit, aber der eigentliche Unterschied liegt im zweiten Diagramm. In Bezug auf die Genauigkeit des Dialekts erzielt Falcon-Emirati-7B 0,52 (teilweises Ergebnis), gegenüber 0,05 für ALLaM, 0,03 für gemma-3-27b-it, 0,02 für Jais-2-8B-Chat und effektiv 0,00 für Fanar-2-27B-Instruct. Das ist kein geringer Vorteil, es liegt fast zwei Größenordnungen im unteren Bereich. In der Praxis bedeutet das, dass die anderen Modelle oft die richtige Antwort kennen, aber standardmäßig auf Modern Standard Arabic sagen, selbst wenn direkt auf Emiriisch gefragt wird. Der Falcon-Emirati-7B ist das einzige von den fünf Modellen, das verlässlich in dem Dialekt antwortet, in dem es gefragt wurde.
Fanar-2-27B-Instruct hebt sich auch aus zweierlei Gründen hervor: Es vermeidet viel mehr als jedes andere Modell, indem es 26,2% der Zeit nicht antwortet, während bei allen anderen Modellen im Vergleich weniger als 5% sind. Zusammen mit seinem Korrektheitsscore von 0,27 (teilweiser Credit), dem niedrigsten unter den fünf Modellen, deutet dies darauf hin, dass das Modell sowohl weniger bereit als auch weniger in der Lage ist, mit emiratischen Inhalten umzugehen, anstatt einfach nur falsch zu antworten.
Die Treue zum Dialekt nach Kategorie von Alyah – Teilbewährung. Der Falcon-Emirati-7B ist das einzige Modell, das konstant in Emirati umschaltet; die anderen bleiben in MSA in fast allen Kategorien.
Die Aufteilung der Dialekttreue nach Kategorien macht das Muster noch klarer. Dies gilt für alle Kategorien in Alyah, von alltäglichen Begrüßungen bis hin zur Poesie – was darauf hindeutet, dass es sich nicht um einen begrenzten Trick handelt, der nur für eine Handvoll Fragetypen erlernt wird. Es handelt sich vielmehr um eine allgemeine Veränderung des Register, zu dem das Modell bei Erwartung eines Emirati-Registers standardmäßig verwendet. Der eine Bereich, in dem die konkurrierenden Modelle relativ besser sind – Greetings & Daily Expressions – ist auch der Bereich, in dem die Emirati- und MSA-Formen am meisten überschneiden sich. Deshalb ist es am einfachsten für ein allgemeines Arabisch-Modell, versehentlich richtig zu klingen.
Paarweise Vergleich, Kategorie für Kategorie
Als dritte Perspektive auf dieselbe Frage führten wir ein Paarweise-Judge-Verfahren durch: Für jede Alyah-Frage wurde dem Judge (Gemini 3.7 Flash) die Antwort von Falcon-Emirati-7B neben der Antwort eines konkurrierenden Modells gezeigt, ohne zu wissen, welches das bessere ist, und er sollte das bessere Modell auswählen. Die untenstehenden Radar-Charts zeigen die Ergebnisse bezüglich der Siegsrate nach Kategorie gegen drei konkurrierende Modelle: Jais-2-8B-Chat, ALLaM-7B-Instruct-preview und Fanar-2-27B-Instruct.
Die Siegsrate paarweise nach Kategorie: Falcon-Emirati-7B gegen Jais-2-8B-Chat, ALLaM-7B-Instruct-preview und Fanar-2-27B-Instruct wurde von Gemini 3.7 als direkte Konkurrenz bewertet.
Falcon-Emirati-7B gewinnt die Mehrheit der Kategorien gegen alle drei Konkurrenten und mit einer großen Differenz in den Kategorien, die am meisten von Dialekt und kulturellem Fluss abhängen. Gegen Jais-2-8B-Chat ist die Differenz am größten in Poesie & kreativem Ausdruck (0,69 gegen 0,31) und Sprache & Dialekt (0,62 gegen 0,38). Gegen ALLaM-7B-Instruct-preview zeigen wiederum dieselben beiden Kategorien die breiteste Differenzen: Poesie & kreativem Ausdruck (0,66 gegen 0,34) und Sprache & Dialekt (0,58 gegen 0,42). Gegen Fanar-2-27B-Instruct sind die Abstände am bretesten bei allen drei Konkurrenzen, und Falcon-Emirati-7B gewinnt in jeder Kategorie, wobei sie in Poetry & Creative Expression (0,88 gegen 0,12) und Religious & Social Sensitivity (0,80 gegen 0,20) an der Spitze liegt.
Die einzige Kategorie, in der die konkurrierenden Modelle sich durchsetzen können, ist Greetings & Daily Expressions: Falcon-Emirati-7B verliert knapp gegen Jais-2-8B-Chat (0,46 gegen 0,54) und trifft mit ALLaM-7B-Instruct-preview bei 0,50. Dennoch gewinnt es klar gegen Fanar-2-27B-Instruct (0,70 gegen 0,30). Das stimmt im Großen und Ganzen mit dem überein, was wir in der oben genannten Analyse der Dialektgenauigkeit gesehen haben. Begrüßungen sind die Kategorie, in der Emirati und MSA am meisten übereinstimmen, daher ist dies der einfachste Bereich für ein allgemeines arabisches Modell, um natürlich zu klingen – auch ohne spezifische Dialektausbildung. Je mehr der Dialekt charakteristisch ist, wie in Poesie, bildlichen Sprache oder Erinnerungswissen, dann bleibt die Vorteilhaftigkeit von Falcon-Emirati-7B bei allen verglichenen Modellen deutlich erhalten.
Verständnis der emiratischen Kultur
Die Sprache betrifft auch das Verständnis der Kultur hinter einer Konversation. Wir haben Falcon-Emirati-7B im Bereich der Vereinigten Arabischen Emirate in ArabCulture-Dialogue bewertet, einem Benchmark für kulturelles Verständnis in Arabisch. In seiner Multiple-Choice-Aufgabe wählen die Modelle die kulturelt am passendste Antwort aus drei Optionen. Lesen Sie mehr im Forschungsartikel.
Wir haben alle vier Modelle auf denselben 283 UAE-Szenarien getestet, in emiratischem Arabisch und modernem Standardarabisch, mit unterschiedlichen Mengen an Standortinformationen.
Die Gesamtrechtigkeit bei der Multiple-Choice-Aufgabe in den UAE ist durchgehend, gemessen über beide Sprachvarietten und alle Standortanpassungen. Das sind unsere Bewertungsergebnisse.
Falcon-Emirati-7B erreichte 85,57%, das höchste Ergebnis unter den vier getesteten Modellen, vor ALLaM-7B (83,39%), Jais-2-8B (73,79%) und Fanar-2-27B (71,50%). Diese Ergebnisse zeigen seine Fähigkeit, kulturell angemessene Reaktionen in emiratischen Gesprächen zu erkennen.
Sehen Sie es in Aktion
Die Zahlen erzählen nur einen Teil der Geschichte, daher folgt unten eine aktive, interaktive Vergleichsstelle: fünf echte Emirati-Prompts werden nebeneinander mit Falcon-Emirati-7B sowie Fanar-2-27B-Instruct und ALLaM-7B-Instruct-preview ausgeführt. Schwenken Sie oder verwenden Sie die Pfeile, um zwischen den Prompts zu wechseln, und erweitern Sie eine Antwort, um sie vollständig zu lesen.
Interaktive Vergleich: Falcon-Emirati-7B vs. Fanar-2-27B-Instruct vs. ALLaM-7B-Instruct-preview bei fünf emiratischen Prompts, die Eid-Grüße, lokale Geschichte, Poesie und Wissen über das Erbe behandeln. Die Ausgaben werden als generiert angezeigt und können Fehler enthalten; die Hervorhebung identifiziert unser Modell, nicht eine tatsächliche Bewertung.
Probieren Sie Falcon-Emirati-7B
Falcon-Emirati-7B ist auf unserer Chatplattform verfügbar. 🚀 Probieren Sie es jetzt aus: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
Verantwortungsvolle KI und Einschränkungen
Wie jedes Sprachmodell kann der Falcon-Emirati-7B Vorurteile in seinen Trainingsdaten widerspiegeln und manchmal Fehler machen, insbesondere bei seltenen Ausdrücken, stark lokalisierten Referenzen oder Grenzfällen, für die nicht genügend Daten vorhanden sind. Dialekte und kulturelle Nuancen sind subjektiv, und selbst Muttersprachler werden nicht immer übereinstimmen, was die „richtige“ Antwort ist. Wir empfehlen, das Modell vor dem Einsatz in sensiblen, offiziellen oder hochriskanten Situationen zu testen. Wir würden gerne Feedback von der emiratischen Community erhalten, um sowohl das Modell als auch Alyah künftig weiter zu verbessern.
Danksagung
Wir möchten Mikhail Lubinets und Matthieu Berjon für ihre kontinuierliche Unterstützung bei der Recheninfrastruktur sowie Jatin Mittal für seine Hilfe bei der Bereitstellung des Modells über die Falcon Chat-App danken.
Zitate
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







