阿拉伯语实际上是一组以同一名称存在的语言家族。现代标准阿拉伯语是你在新闻或教科书上看到的语言,但人们实际交流时却很少使用这种语言。在阿联酋,日常对话、幽默、谈判和故事讲述都是用埃米尔塔利阿拉伯语进行的,这是一种海湾方言,拥有独特的词汇、独特的节奏,以及与之紧密相关的文化。 阿联酋诗歌,尤其是纳巴蒂诗歌,连同谚语和简短轶事一样,所蕴含的意义无法通过逐字解读来理解。仅掌握 MSA 的模型虽然能翻译阿联酋句子的每个单词,却仍可能忽略其真正的含义。
这就是Falcon-Emirati-7B旨在填补的空白。它是基于Falcon-H1-Arabic的方言专用模型,旨在像母语者一样理解和生成阿联酋阿拉伯语:包括词汇、语调以及背后的文化背景。
基于 Falcon-H1-Arabic 构建
我们并非从零开始。Falcon-Emirati-7B是基于Falcon-H1-Arabic构建的,后者是我们已有的阿拉伯语模型系列,今年早些时就已经为该语言树立了新的标杆。Falcon-H1-Arabic采用Falcon-H1混合架构:每个模块中同时运行状态空间模型(Mamba)和Transformer注意力机制,其输出在每個模块的投影之前进行融合。 这种组合使得 Mamba 在长序列上具有线性时间效率,同时又能保持对长期依赖关系的关注精度,这对于像阿拉伯语这样形态丰富的语言来说非常重要。该模型包含三种参数规模(3B、7B 和 34B),上下文窗口可达 128K 和 256K 个标记,并且已经通过混合使用 MSA 和方言阿拉伯语(海湾地区、黎凡特地区、埃及语、马格里布语)以及英语和多语言数据进行了训练。
这为我们提供了一个坚实的起点:一个已经能够广泛理解阿拉伯语、能良好处理长文本上下文,并且具备一定方言经验的模型。Falcon-Emirati-7B 基于这一基础,进一步专注于阿联酋方言、词汇、语法以及文化知识方面,而这些是普通的阿拉伯语模型无论多么擅长都无法自行掌握的。
我们专门使用了 7B 版本来构建 Falcon-Emirati-7B。这是该系列模型中的最佳平衡点:既足够强大以容纳方言适配所需的细节,又足够轻巧,使得训练和推理过程都具备实际性。34B 模型可能会进一步提升性能,但其训练和运行成本对于专注于方言的聊天模型来说并不合理;而 3B 模型则无法提供我们所需的文化和语言理解深度。 7B 在质量与训练及推理成本之间提供了最佳的平衡。
为什么方言适应很困难
将一般阿拉伯语模型转化为阿联酋方言专家的需求,似乎比最初构建基础模型还要简单。实际上并非如此。有一些因素使得这项工作真正困难起来:
- 阿联酋语主要是一种口语方言。与MSA或其他海湾及黎凡特方言相比,它在网络上的文字使用频率要低得多,因此可供学习的原始文本也相对较少。
- 含义往往不是字面上的。成语、谚语和诗歌引用依赖于共同的文化背景,而非表面词汇。
- 没有成熟的操作手册。 并没有关于需要多少方言数据、如何将其与通用阿拉伯语及阿拉伯语混合使用,以及哪个训练阶段(继续预训练、SFT 或偏好优化)对掌握方言最为重要的详细指导。
最后一点决定了我们的工作方式。Falcon-Emirati-7B模型的构建很大程度上依赖于反复试验:测试不同的数据组合、训练阶段和监管策略,同时结合人工判断和基准分数,以找出真正有效的因素。
我们的数据处理方法
我们在 Falcon-H1-Arabic的预训练基础上构建了一个专门的阿联酋数据管道,该管道源自三个互补的数据源。
1. 真实的阿联酋方言网络数据
我们从以阿联酋方言原生编写的网站和论坛中抓取并整理了内容,这些内容并未从沙特阿拉伯语翻译或转写而来。这就是我们获取真实数据的地方:即阿联酋人实际在线上书写和说话的方式、日常表达、口语化用语,以及真实使用中的阿联酋语与沙特阿拉伯语之间的自然交流。
2. MSA 数据:关于阿联酋文化和身份的研究
除了方言文本外,我们还收集了专门关于阿联酋文化、传统和语言的 MSA 语言材料:关于当地习俗、价值观、历史和社会规范的文章及参考文献,包括人们对阿联酋人的看法和刻板印象。这并非教会模型使用方言进行写作,而是让模型明白在涉及阿联酋相关话题时该说什么,比如传统、礼仪以及母语者所熟悉的背景知识。
3. 由词汇表和风格规则引导的合成数据
仅靠真实的方言文本,不足以涵盖聊天模型日常需要处理的各种主题。因此,我们生成了大量合成的阿联酋方言数据来填补空白。我们并非让生成模型在“海湾式”阿拉伯语中自由发挥,而是以严格的规则以及专门为阿联酋词汇和语法构建的词典和词汇表来约束它。 那些约束规则使得合成输出能够听起来像真正的阿联酋方言,而语法上正确但发音不符合该方言习惯的输出则被排除在外。
寻找正确的适配方案
由于没有适用于 MSA 到方言转换的标准方法,我们直接将训练策略视为需要通过实验来探索的问题。我们研究了应注入多少方言数据、在训练的哪个阶段进行注入、如何平衡真实采集的数据与合成数据,避免模型过度拟合合成模式,以及实际上需要多少 MSA 文化背景才能使其保持文化根基,而不仅仅是表面上的流畅性。 在每一步中,我们结合了自动评分和母语者审核两种方法,因为仅靠自动指标无法充分体现自然性、语气或文化适配度,无法单独作为信任依据。
评估方法学
我们在训练过程中通过两种互补的方法跟踪了进展情况:
由母语使用者进行的手动评估
阿联酋的母语者直接审查模型输出结果,他们不仅判断答案是否正确,还关注其是否自然、语气是否恰当以及是否符合文化习惯。这些是基准分数无法体现的,但母语者能立即察觉到。
在 Alyah 上的自动评估
用于定量跟踪方面,我们使用了 Alyah(الياه,“北极星”),这是一个由我们和社区共同发布的基准测试,旨在评估阿拉伯语大语言模型对阿联酋方言的掌握能力。Alyah是一个完整的本土式选择题基准测试,包含1,173个样本,这些样本是从阿联酋本地语使用者处手动收集而来的,涵盖从日常问候与礼仪到比喻性语言、文化遗产知识以及阿联酋诗歌等类别——这些领域正是方言与文化最为重要的地方,也是通用阿拉伯语模型往往难以应对的领域。关于Alyah的构建方式和分类详情,可参阅我们的 基准测试博客文章;关于基础模型家族的背景信息,则可在 Falcon-H1-Arabic公告中查阅。
结果
Falcon-Emirati-7B在Alyah测试中的得分是84.83%,高于我们与之对比的所有其他阿拉伯语和多语言模型,甚至超过一些规模是它数倍的模型。下面的图表展示了它在Alyah排行榜上与一组代表性的一级训练模型的位置关系。
Alyah 准确率(%),指令优化模型。Falcon-H1-Arabic 系列模型不纳入此比较,因为 Falcon-Emirati-7B 是基于这些模型构建的。
结果告诉我们什么
从这种比较中可以注意到几件事。仅仅规模大并不能让你具备方言能力。这里一些最大的多语言模型的成绩远低于那些更关注方言的较小模型,这说明阿联酋语水平需要通过专门训练获得,而非依靠规模带来的自然结果。 表现最好的模型往往是以阿拉伯语为母语或专注于阿拉伯语的,这与我们自己的研究结果一致:覆盖通用阿拉伯语和方言是必要的起点,但仍需针对特定方言进行专门工作,以填补剩余的空白,尤其是针对 Alyah 中最困难的领域,如诗歌、文化遗产知识以及语言与方言类别本身。
这也符合 Alyah 基准测试整体结果:即使是非常强大的模型,一旦处理真正与方言、文化相关的内容时,也会出现实际性能下降的情况。这种差距不会通过更强大的模型自行消失。需要专门针对该方言构建的数据和评估方法。
超越选择题:LLM作为评判者的评估方式
多项选择准确性可以表明模型是否能从四个选项中识别出正确的答案。但它无法说明当有人与模型对话时,模型是否真的能独立生成阿联酋阿拉伯语。 因此,与 Alyah 一起,我们进行了第二次评估:对相同的 1,173 个 Alyah 问题进行了开放式生成测试,由 LLM 评判员(Gemini 3.7 Flash)针对五款模型进行评分,这些模型包括 Falcon-Emirati-7B、ALLaM-7B-Instruct-preview、gemma-3-27b-it、Jais-2-8B-Chat 和 Fanar-2-27B-Instruct,它们是从 Alyah 排行榜中选出的最强竞争对手模型。
法官根据两个独立维度对每个答案进行评分:一是内容是否正确,二是答案是否实际使用阿联酋方言而非标准阿拉伯语。我们报告了部分得分评分(法官的评估等级)以及更严格的通过/失败版本,还说明了每种模型选择回避而不回答的频率。
LLM对1,173道Alyah问题进行了正确性判断,由Gemini 3.7进行开放式生成评估。
LLM对方言忠实的判断基于相同的问题:答案是否真的以阿联酋语呈现,还是模型默认使用 MSA?
Falcon-Emirati-7B在准确性方面领先,但真正的差距出现在第二个图表中。在方言忠实度方面,Falcon-Emirati-7B得分为0.52(部分分数),而ALLaM为0.05,gemma-3-27b-it为0.03,Jais-2-8B-Chat为0.02,Fanar-2-27B-Instruct则几乎为0.00。这并非微小的优势,在较低水平下接近两个数量级。 实际上,这意味着其他模型通常知道正确答案,但默认使用现代标准阿拉伯语来表达,即使直接用阿联酋语提问也是如此。Falcon-Emirati-7B是这五款模型中唯一一种能准确用被提问的方言进行回答的模型。
Fanar-2-27B-Instruct 因第二个原因也十分突出:它拒绝回答的比例远高于其他模型,达 26.2%,而对比中的其他模型这一比例均低于 5%。结合其正确率仅为 0.27(部分得分)的最低成绩,这表明该模型既不愿也无法处理阿联酋特有的内容,而非只是用错误的方式回应。
按方言忠实度分类,部分归功于 Alyah。Falcon-Emirati-7B 是唯一一种始终切换为 Emirati 的型号;其他型号在几乎所有类别中均保持为 MSA。
按类别划分方言忠实度的变化使这一规律更加清晰。这种规律适用于 Alyah 中的每一个类别,从日常问候到诗歌都适用,这表明这并非针对少数几种问题类型而学习的特殊技巧。当期望使用阿联酋语时,模型默认使用的语言风格发生了普遍变化。 竞争模型中表现相对较好的一个领域是“问候语与日常表达”,这也是阿联酋语和MSA重叠最多的类别,因此通用阿拉伯语模型最容易不小心发音正确。
逐对比较,按类别对比
作为对同一问题的第三种评判方式,我们进行了两两对比评判:对于每个 Alyah 问题,评判器(Gemini 3.7 Flash)都会看到 Falcon-Emirati-7B 的回答与另一个竞争模型的回答并列呈现,而评判者无法区分两者中的哪个更好,需要选择更好的答案。下面的雷达图展示了针对三个竞争模型——Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct——各分类下的获胜率。
按类别划分的成对胜率:Falcon-Emirati-7B 对 Jais-2-8B-Chat、ALLaM-7B-Instruct-preview 和 Fanar-2-27B-Instruct,由 Gemini 3.7 进行直接对决评估。
Falcon-Emirati-7B在所有三个竞争对手中赢得了大多数类别的冠军,且在那些对方言和文化熟练度要求极高的类别中优势非常明显。与Jais-2-8B-Chat相比,在诗歌与创意表达(0.69 vs. 0.31)和语言与方言(0.62 vs. 0.38)两个类别中的差距最大。与ALLaM-7B-Instruct-preview相比,同样的两个类别也展现出最广泛的优势:诗歌与创意表达(0.66 vs. 0.34)和语言与方言(0.58 vs. 0.42)。 与 Fanar-2-27B-Instruct 相比,Falcon-Emirati-7B 的边界最宽,并且在所有类别中均获得胜利,最高分分别出现在诗歌与创意表达(0.88 对 0.12)和宗教与社会敏感性(0.80 对 0.20)领域。
唯一一个竞争模型能够保持优势的类别是“问候语与日常表达”:Falcon-Emirati-7B 在这一项中仅以 0.46 对 0.54 的成绩输给 Jais-2-8B-Chat,并在 ALLaM-7B-Instruct-preview 上以 0.50 平局,不过它在与 Fanar-2-27B-Instruct 的对比中仍然明显占优(0.70 对 0.30)。 这与上述方言忠实性分析结果基本一致。问候语是阿联酋语和 MSA 重叠最明显的类别,因此通用阿拉伯语模型即使没有专门的方言训练,也能在这一领域听起来像本地话。当方言特征更为明显时,如诗歌、比喻性语言以及传统知识方面,Falcon-Emirati-7B 的优势在我们对所有竞争模型进行的测试中依然显著。
了解阿联酋文化
语言也关乎理解对话背后的文化。我们针对ArabCulture-Dialogue这一阿拉伯语文化理解基准数据集,对 Falcon-Emirati-7B 进行了评估。在多项选择任务中,模型需要从三个选项中选择最符合文化习惯的回答。更多内容可参阅研究论文。
我们在相同的283 UAE场景上,使用阿联酋阿拉伯语和现代标准阿拉伯语,并搭配不同量的地点信息,对所有四种模型进行了测试。
UAE多项选择任务的整体准确率,是按两种语言风格和所有位置设置平均得出的。这些就是我们的评估结果。
Falcon-Emirati-7B的得分为85.57%,是测试的四款模型中最高的,超过了ALLaM-7B(83.39%)、Jais-2-8B(73.79%)和Fanar-2-27B(71.50%)。这些结果凸显了它识别阿联酋对话中文化适宜的回应能力。
查看实际应用效果
数字只能揭示故事的一部分,因此下面是一个实时互动对比:五个真实的阿联酋语提示词,与 Falcon-Emirati-7B、Fanar-2-27B-Instruct 以及 ALLaM-7B-Instruct-preview 并列测试。使用滑动或箭头按钮在提示词之间切换,并展开任何回复以完整阅读。
互动对比:Falcon-Emirati-7B 与 Fanar-2-27B-Instruct 以及 ALLaM-7B-Instruct-preview,在五个阿联酋相关提示下进行测试,涵盖开斋节问候、当地历史、诗歌和文化遗产知识。输出结果均为生成内容,可能包含错误;标记则用于标识我们的模型,并非事实评分。
尝试 Falcon-Emirati-7B
Falcon-Emirati-7B 可在我们的聊天平台使用。 🚀 立即尝试: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
负责任的人工智能与限制条件
就像任何语言模型一样,Falcon-Emirati-7B 会在其训练数据中表现出偏见,有时也会出错,尤其是在罕见的表达、高度地方性的引用或我们缺乏足够数据的边缘情况上。方言和文化细微差别是主观的,甚至本地人也未必总是对“正确”答案达成一致。 我们建议在依赖该模型处理任何敏感、正式或高风险事务之前,先针对您的特定使用场景对模型进行评估。我们真心期待阿联酋社区提供反馈,以帮助我们未来改进模型以及 Alyah。
> 感谢致谢
我们想对米哈伊尔·卢宾茨和马蒂厄·贝尔容在计算基础设施方面的持续支持,以及贾廷·米塔尔通过 Falcon Chat 应用帮助模型可被访问的付出,表示诚挚的感谢。
引用文
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







