アラビア語は、一つの名前の下で共存する言語群である。現代標準アラビア語は、ニュースや教科書で読むものだが、実際に人々が会話をする際にはほとんど使われない。UAEでは、日常の会話、ユーモア、交渉、物語の語りは、独自の語彙、独自のリズムを持つガルフ方言であるエミレーティア・アラビア語で行われる。それには独自の文化が密接に結びついている。 エミレットの詩、特にナバティ詩は、ことわざや短い逸話と共に、文字通りの意味では生き残らない意味を持っています。MSAのみを知っているモデルは、エミレットの文の各単語を翻訳することはできても、その実際の意味を見落としてしまいます。
それがFalcon-Emirati-7Bが解決しようとするギャップです。これはFalcon-H1-Arabicの上に構築された方言特化モデルであり、母国語話者が行うようにエミレットアラビア語を理解し生成することを目的としています。すなわち、語彙、トーン、そしてその背景にある文化的文脈です。
Falcon-H1-Arabic上で構築された
私たちは何もかもから始めたわけではありません。Falcon-Emirati-7Bは、今年初めに言語の新たな基準を打ち立てた私たちのアラビア語モデルファミリーであるFalcon-H1-Arabicを基に構築されています。Falcon-H1-ArabicはFalcon-H1ハイブリッドアーキテクチャを使用しています。各ブロック内では、状態空間モデル(Mamba)とトランスフォーマーアテンションが並行して動作し、各ブロックの投影前にその出力が融合されます。 その組み合わせにより、長いシーケンスに対してMambaの線形時間効率を実現しながら、長距離依存関係に対する注意の精度も保たれる。これはアラビア語のような形態的に豊かな言語にとって重要である。このフレームワークは3つのスケール(3B、7B、34Bパラメータ)を持ち、コンテキストウィンドウは128Kおよび256Kトークンまで対応し、既にMSAと方言アラビア語(グループ、レバンティン、エジプト、マグレビ)の幅広いデータに加えて、英語や多言語データでも訓練されている。
それにより、強力な出発点が得られた。すなわち、アラビア語を広く理解し、長い文脈を適切に処理でき、また方言の知識も内在しているモデルである。Falcon-Emirati-7Bはその基盤を活用し、エミレット方言、語彙、文法、文化知識に特化して発展させる。これらは、どんなに能力が高くても一般的なアラビア語モデルが自ら習得できないものである。
私たちは、特に7Bバリアントを基にFalcon-Emirati-7Bを構築しました。これはモデルファミリーにおいて最適なポイントです。方言の適応が必要とするニュアンスを保持できるほど十分に大きい一方で、トレーニングと推論の両方が実用的である程度小さくなっています。34Bモデルでは品質がさらに向上する可能性がありますが、方言特化型チャットモデルとしてはトレーニングやサービスのコストが合理的ではありません。また、3Bモデルでは私たちが求める文化的・言語的理解の深さに十分な余地が残りません。 7Bは、トレーニングと推論のコストとを考慮した場合でも、最適な品質のバランスを実現しました。
言語変種の適応が難しい理由
一般的なアラビア語モデルをエミレーツ方言専門家に変換することは、最初にベースモデルを構築するよりも少ない作業のように思えますが、実際にはそうではありません。いくつかの点が本当に困難です:
- エミレーテ語は主に口語です。オンライン上の文章で見られる割合は、MSAや他の湾岸・レバンティア語派ほどではないため、学ぶべき生のテキストもほとんどありません。
- 意味はしばしば非文字通りです。成語や諺、詩的な表現は、表面的な語彙ではなく、共通の文化的背景に依存しています。
- 確立された手順はありません。 どれだけの方言データが必要か、MSAや一般的なアラビア語とどのように混ぜるか、またはどの訓練段階(事前学習の継続、SFT、または好み最適化)が方言を習得する上で最も重要かについては、明確に記載された方法がありません。
最後の点が、私たちの作業の仕方を決定しました。Falcon-Emirati-7Bの構築は、試行錯誤に頼るものでした。異なるデータの組み合わせ、訓練段階、監督戦略をテストし、人間の判断とベンチマークスコアの両方を利用して、何が実際に効果的かを明らかにしました。
データへの私たちのアプローチ
Falcon-H1-Arabicの事前学習を基に、3つの相互補完的なソースから得られるエミレット語データパイプラインを構築しました。
1. 正統なエミレティ方言のウェブデータ
エミレット語で原語で書かれたウェブサイトやフォーラムのコンテンツをクロールし、選定した。これらはMSAから翻訳されたり、文字化されたものではない。ここにこそ、実際のエミレット人がオンライン上でどのように書き、話すか、日常的な表現、口語的な表現、そして実際の使用において見られるエミレット人とMSAの自然なやり取りがある。
2. エミルアティ文化とアイデンティティに関するMSAデータ
方言のテキストに加えて、エミレタ人の文化、伝統、言語に関するMSA言語の資料も収集した。それには、エミレタ人の認識やステレオタイプについても含まれる、地域の習慣、価値観、歴史、社会規範に関する記事や参考文献がある。これはモデルが方言で書くことを教えるのではなく、エミレタのテーマが出る際にモデルが何を話しているか、すなわち伝統、礼儀、ネイティブスピーカーが知っている文脈といったものを教える。
3. 用語集とスタイルルールに導かれた合成データ
真の方言テキストだけでは、チャットモデルが日常で対応する必要があるトピックの範囲をカバーするには不十分だった。そのため、ギャップルの空白を埋めるために大量の合成エミレティ方言データを生成した。私たちは単に生成モデルに「ガルフ風」アラビア語で自由に創作させるのではなく、厳格な規則や、エミレティ語の語彙と文法に特化して構築された用語集を用いて制限した。 そのガードレールは、本物のエミリティ語のように読める合成的な出力と、文法的には正しいが実際にその方言を話す人にとっては不自然に聞こえる出力との違いを生み出した。
適切な適応レシピの見つけ方
MSAから方言への適応に関する標準的な方法がないため、トレーニング戦略自体を実験的に解明することにしました。どれだけの方言データを注入し、どのトレーニング段階で行うか、モデルが合成パターンに過度に適応しないように、真正な Crawled データと合成データのバランスをどう取るか、そして表面的には流暢であっても、文化的に根強い状態を保つために実際に必要な MSAの文化的背景はどれくらいかという点です。 各ステップでは、自動的な評価とネイティブスピーカーのレビューを組み合わせていました。なぜなら、自動的な指標だけでは、自然さやトーン、文化への適合性を十分に捉えることができず、単独で信頼するには不十分だからです。
評価方法論
トレーニング中に進捗を追跡するために、2つの補完的な方法を用いた。
ネイティブスピーカーによる手動評価
アラビア語のネイティブスピーカーは、モデルの出力を直接検討し、答えが正しいかどうかだけでなく、自然さやトーン、文化的に適切かどうかも評価した。これらはベンチマークスコアではわかりませんが、ネイティブの耳がすぐに感じ取るものである。
Alyah上の自動評価
定量的追跡のために、私たちとコミュニティが特別に発表した、アラビア語LLMのアラビア語方言能力を評価するためのベンチマークであるAlyah(الياه、「北の星」)を使用しました。Alyahは、1,173個のサンプルから手動で収集された完全なネイティブの多肢選択ベンチマークであり、日常の挨拶や礼儀、比喩的な言語、伝統知識、アラビア詩など、方言と文化が最も重要であり、一般的なアラビア語モデルが苦手とすると考えられるカテゴリーを含んでいます。Alyahの構築とカテゴリーの詳細については、私たちのベンチマークブログ記事で、基礎モデルファミリーに関する背景情報はFalcon-H1-Arabicの発表で確認できます。
結果
Falcon-Emirati-7BはAlyahで84.83%のスコアを記録し、私たちが比較した他のすべてのアラビア語および多言語モデル、さらにその数倍のサイズのモデルも上回りました。下のチャートは、Alyahの順位表において代表的な指示調整モデルと並ぶ位置を示しています。
アリヤの精度(%)、指示に調整されたモデルです。ファルコン-H1-アラビア語系モデルは、ファルコン-エミレーティ-7Bがそれらを基盤として構築されているため、この比較から除外されています。
結果が教えてくれること
この比較からいくつかの点が明らかになります。サイズだけでは方言能力は得られません。ここにある最も大きな多言語モデルの中には、より小さく、方言対応性の高いモデルよりも点数が低いものがあります。これは、エミレット語の熟練度は意図的に訓練されるものであり、規模の増大によって自然に得られるものではないことを示しています。 最も優れたモデルは、もともとアラビア語に精通しているか、アラビア語を中心に作られている傾向があります。これは、私たち自身の研究で見られたことと一致しています。一般的なアラビア語と方言のカバレッジは必要な出発点ですが、詩や遺産に関する知識、言語と方言のカテゴリーなど、最も難しい部分を克服するためには、特定の方言に特化した取り組みが必要です。
これは、Alyahベンチマークのリリースから得られた結果とも一致しています。強力なモデルであっても、本当に方言的で文化的に根ざしたコンテンツになると実際に性能が低下します。このギャップは、より大きなモデルだけでは自動的に解消されません。方言に特化して構築されたデータと評価が必要です。
複数選択を超えて:評価者としてのLLM
多肢選択の正確性は、モデルが4つの選択肢の中から正しい答えを認識できるかどうかを示します。しかし、人が単にモデルと話しかけるときに、モデルが実際にエミレタ・アラビア語を自ら生成するかどうかは示しません。 したがって、Alyahと共に、2回目の評価も行いました。同じ1,173件のAlyah質問に対してオープンエンド生成を実施し、LLMジャッジ(Gemini 3.7 Flash)が5つのモデル、Falcon-Emirati-7B、ALLaM-7B-Instruct-preview、gemma-3-27b-it、Jais-2-8B-Chat、Fanar-2-27B-Instructと比較しました。これらのモデルは、Alyahランキングで最も強力な競合モデルとして選ばれました。
裁判官は、各回答を2つの別々の基準で評価した。すなわち、内容が正しいかどうか、そして独立して、回答がMSAではなくエミレティ方言で実際に出されたかどうかである。私たちは、部分的な加点スコア(裁判官の評価)と、より厳格な合格/不合格のバージョン、そして各モデルが回答せずに回避する頻度を報告する。
1,173件のAlyah問題、オープンエンド生成について、Gemini 3.7が審査官として正確性を判断した。
LLMが判断する方言の忠実性は同じ質問において:回答が実際にアラビア語で返されるのか、それともモデルがMSAをデフォルトで使用するのか?
Falcon-Emirati-7Bは正確性でリードしているが、実際の差は第2のチャートにある。方言の忠実さに関しては、Falcon-Emirati-7Bは0.52(部分的な評価)を得ているが、ALLaMは0.05、gemma-3-27b-itは0.03、Jais-2-8B-Chatは0.02、Fanar-2-27B-Instructは実質的に0.00である。これは小さな優位性ではなく、低い側で2桁の差がある。 実際には、他のモデルはしばしば正しい答えを知っていても、エミレーテ語で直接尋ねられる場合でも、デフォルトではモダン・スタンダードアラビア語で答える。Falcon-Emirati-7Bだけが、5つの中で、尋ねられた方言で確実に返答できるモデルである。
ファナル-2-27B-Instructは、もう一つの理由でも際立っています。他のモデルよりもはるかに答えを避けているのです。比較対象の他のモデルでは5%未満しか答えないのに対し、このモデルは26.2%の時間答えを拒否します。正確性スコアが0.27(部分的な評価)で、5モデル中最低であることから、エミレット特有の内容との関わり方が控えめであり、能力も低いモデルであることが示唆されます。単に間違ったやり方で答えているだけではなく、そうした傾向があるのです。
Alyahのカテゴリーによる方言の忠実性、部分的な功績。Falcon-Emirati-7Bはエミレタ語に一貫して切り替わる唯一のモデルであり、他のモデルはほぼ全てのカテゴリーでMSAを維持する。
カテゴリー別に方言の忠実性を分解すると、パターンがさらに明確になります。これは、日常の挨拶から詩まで、Alyahのすべてのカテゴリーにおいて同様です。つまり、これは少数の質問タイプ用に学んだ狭い技巧ではないようです。エミレット語が期待されるレジスターの場合、モデルがデフォルトで採用するレジスターが一般的に変化するものです。 競合モデルの中で比較的に優れている「Greetings & Daily Expressions」は、エミレタ語とMSAが最も重なるカテゴリーでもあります。そのため、一般的なアラビア語モデルが偶然にも正しく聞こえる最適な場所です。
ペア比較、カテゴリー別
同じ問題に対する第三の視点として、ペア対決による評価を行った。Alyahの各質問について、審査員(Gemini 3.7 Flash)にはFalcon-Emirati-7Bの回答と競合モデルの回答が表示され、どちらが優れているかは知らされておらず、より良い方を選ぶよう求められた。以下のレーダーチャートは、Jais-2-8B-Chat、ALLaM-7B-Instruct-preview、Fanar-2-27B-Instructという3つの競合モデルに対する各カテゴリーでの勝率を示している。
カテゴリー別のペア対決での勝率:Falcon-Emirati-7B対Jais-2-8B-Chat、ALLaM-7B-Instruct-preview、およびFanar-2-27B-Instructは、Gemini 3.7によって直接対決で評価された。
Falcon-Emirati-7Bは、3つの競争者に対してすべてのカテゴリーで優位に立ち、特に方言や文化的な流暢さが重要となるカテゴリーでは大きな差で勝利しました。Jais-2-8B-Chatに対しては、詩と創造的表現(0.69対0.31)および言語と方言(0.62対0.38)の分野で最大の差が見られます。ALLaM-7B-Instruct-previewに対しても、同じ2つのカテゴリーで最も大きな差が見られます:詩と創造的表現(0.66対0.34)および言語と方言(0.58対0.42)。 Fanar-2-27B-Instructに対して、三つの対決の中で最も幅が広いのはマージンであり、Falcon-Emirati-7Bは全てのカテゴリーで勝利し、Poetry & Creative Expression(0.88対0.12)とReligious & Social Sensitivity(0.80対0.20)で最高値を記録した。
競合モデルが優位を保っている唯一のカテゴリーは「挨拶と日常表現」です。Falcon-Emirati-7BはJais-2-8B-Chatに0.46対0.54でわずかに負け、ALLaM-7B-Instruct-previewには0.50で引き分かりましたが、Fanar-2-27B-Instruct(0.70対0.30)には明らかに勝ちました。 上記の方言忠実性の分析で見た内容と大まかに一致しています。挨拶はエミレティ語とMSAが最も重なるカテゴリーであり、専用の方言トレーニングを行わなくても、一般的なアラビア語モデルがネイティブのように聞こえるのに最適な分野です。方言がより特徴的になる場所では、詩や比喩的な言語、伝統知識において、Falcon-Emirati-7Bの利点は、私たちがテストした他のすべてのモデルに対しても明確にあります。
エミレティ文化の理解
言語とは、会話の背後にある文化を理解することでもある。私たちは、アラビア語における文化的理解のベンチマークであるArabCulture-DialogueのUAE部分においてFalcon-Emirati-7Bを評価した。多肢選択タスクでは、モデルは3つの選択肢の中から最も文化的に適切な回答を選ぶ。詳細は研究論文を参照してください。
4つのモデルを、同じ283 UAEシナリオ、エミレーツ・アラビア語と現代標準アラビア語の両方で、異なる量の場所情報を含む形でテストしました。
UAE多肢選択課題における全体的な正確性で、言語種とすべての場所設定を合計した平均値です。これらが私たちの評価結果です。
Falcon-Emirati-7Bは85.57%の得点を記録し、テストされた4つのモデルの中で最も高かった。これはALLaM-7B(83.39%)、Jais-2-8B(73.79%)、Fanar-2-27B(71.50%)よりも高い値である。これらの結果は、エミレティ語の会話における文化的に適切な応答を認識する能力を示している。
実際に見る 実践例
数字だけでは物語の一部しかわかりません。以下はライブでインタラクティブな比較です:5つの実際のエミレーティアプロンプトが、Falcon-Emirati-7Bと並んでFanar-2-27B-Instruct、ALLaM-7B-Instruct-previewで実行されます。プロンプト間を移動するにはスワイプまたは矢印を使い、応答を拡大して全文を読むことができます。
相互比較:Falcon-Emirati-7B vs. Fanar-2-27B-Instruct vs. ALLaM-7B-Instruct-preview は、祝日の挨拶、地域の歴史、詩、文化知識を含む5つのエミレティプロンプトで実行されます。出力結果は生成されたものであり、誤りを含む可能性があります。ハイライトされている部分は私たちのモデルを示しており、事実上の評価ではありません。
Falcon-Emirati-7Bを試してみる
Falcon-Emirati-7Bは私たちのチャットプラットフォームで利用可能です。 🚀 今すぐ試してみてください: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
責任あるAIと制限事項
どの言語モデルと同様に、Falcon-Emirati-7Bもその訓練データに偏見を反映している可能性があり、特に珍しい表現や地域に特有の参照、あるいはデータが不足している境界ケースにおいて間違うこともある。方言や文化的なニュアンスは主観的なものであり、母語話者でさえ「正しい」答えについて常に一致することはない。 敏感な、公式の、または重要な任務に利用する前に、特定の使用ケースにおいてモデルを評価することをお勧めします。また、モデルとAlyahの改善に役立つよう、エミレットコミュニティからのフィードバックを心から歓迎します。
表彰
コンピュータインフラに関する継続的な支援をしてくれたミハイル・ルビネツとマチュー・ベルジョンに、心からの感謝を申し上げます。また、Falcon Chatアプリを通じてモデルを利用可能にする手助けをしてくれたジャティン・ミトールにも感謝します。
引用
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







