
阿拉伯语 WER:20.92% · 参数量:1.6B · 阿联酋方言 WER(TII 评估):22.73%
我们推出Falcon-ASR,这是我们的16亿参数阿拉伯语语音识别模型,特别关注阿联酋方言。该模型由阿布扎比技术创新研究院(TII)开发,同时还支持英语、法语、西班牙语和葡萄牙语。
在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错误率为 20.92%,而我们所使用的排行榜快照中最佳公开结果为 23.17%。在我们内部的阿联酋方言评估中,它在所比较的系统中录得最低的词错误率和字符错误率。
我们还支持转录的词级时间戳,将每个转录出的词与它在音频中的位置关联起来。
您可以 在我们的 Hugging Face 演示中试用 Falcon-ASR.
识别阿拉伯语口语
阿拉伯语语音因地区、说话人和场景而异。能够处理正式新闻广播的模型,在处理阿联酋方言对话或通过电话线路录制的语音时仍可能遇到困难。与标准现代阿拉伯语(Modern Standard Arabic,MSA)相比,方言阿拉伯语的转录资源也更少,这使得训练和评估更加困难。
我们使用阿联酋方言、MSA、其他海湾及阿拉伯方言以及英语对 Falcon-ASR 进行了训练。我们的目标是转录人们在日常口语中使用的词语,包括方言形式和语言之间的切换。
阿拉伯语基准测试结果
由 ELM Research Center 维护的 Open Universal Arabic ASR Leaderboard按六个测试集的等权平均 WER 对各系统进行排名,同时报告字符错误率(character error rate,CER)。两项指标都是数值越低越好。我们的 Falcon-ASR 评估遵循这一协议。
| 模型 | 参数量 | 平均 WER (%) | 平均 CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER = 词错误率;CER = 字符错误率。数值越低表示性能越好。
我们使用排行榜固定的清单(fixed manifests)在相同的六个基准上评估了 Falcon-ASR。竞品数字是 2026 年 9 月 30 日核对的公开排行榜平均值。Falcon-ASR 的平均 WER 比该快照中最佳公开结果好 2.25 个百分点。
评估阿联酋方言语音
公开评估数据已包含阿联酋 subset: Casablanca 具有一个阿联酋(UAE)子集。我们通过内部评估补充了这一覆盖范围,对更多阿联酋和海湾地区的语音进行测试,使用留出的录音和经人工校验的转录文本,以在公开的阿联酋子集之外评估转录准确性。
在我们的内部阿联酋评估中,Falcon-ASR 实现了 22.73% 的 WER 和 10.19% 的 CER:
| 模型 | 参数量 | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B active) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
Falcon-ASR在本文比较的系统中具有最低的WER和CER。其WER比次优的Qwen3-Omni低4.07个百分点。结果表明,在该评估中,词级和字符级的转录准确率均有所提升。
针对不同录音条件的训练
我们加入了背景噪声、重叠语音、音乐、房间混响和电话效果,以及语速和音高的变化。我们对阿联酋录音采用了相同的处理方式,使模型接触到它在会议、通话及其他日常录音中可能遇到的各种条件。
英语及其他语言
Falcon-ASR还可使用相同的模型权重转录英语。在Hugging Face Open ASR Leaderboard使用的七个公开英语测试集上的评估中,其平均WER为5.74%。
| 测试集 | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
该模型还支持法语、西班牙语和葡萄牙语。所有五种语言使用相同的权重,无需指定语言标志。输出为所讲语言的转录文本。
模型基础
Falcon-ASR基于我们的Falcon3-Audio工作构建。Falcon3-Audio的架构和训练方法在 在公开数据上通过数据高效单阶段训练的具有竞争力的音频-语言模型.
试试 Falcon ASR
我们的 Hugging Face 演示空间 让您可以试用 Falcon-ASR 并探索其转录能力。API 访问和原生应用已在计划中。我们邀请您用自己的录音来试用该演示。
我们推出 Falcon ASR
我们推出 Falcon-ASR,这是我们拥有 1.6 十亿参数的阿拉伯语语音识别模型,特别关注阿联酋方言。该模型由我们在阿布扎比的技术创新研究院(TII)开发,同时还支持英语、法语、西班牙语和葡萄牙语。
在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上的平均词错误率为 20.92%,而我们使用的排行榜版本中已发布的最佳结果为 23.17%。在我们对阿联酋方言的内部评估中,该模型在我们比较的系统中取得了最低的词错误率和字符错误率。
我们还支持转录中的词级时间戳,使每个单词都与它在录音中的位置相关联。
您可以 通过我们在 Hugging Face 上的演示试用 Falcon-ASR.
识别阿拉伯语口语
阿拉伯语语音因地区、说话人和录音条件而异。一个模型可能能够成功转录正式的新闻播报,却在转录阿联酋方言对话或电话录音时遇到困难。此外,阿拉伯各方言的已标注语音资源也少于现代标准阿拉伯语,这使得训练和评估更加困难。
我们对 Falcon-ASR 进行了阿联酋方言、现代标准阿拉伯语以及其他海湾和阿拉伯方言的训练,同时还包括英语。我们的目标是转录人们日常对话中使用的词语,包括方言形式和语言之间的切换。
阿拉伯语测试结果
对 由 ELM 研究中心管理的阿拉伯语语音识别综合公开排行榜按照六个测试集上的平均词错误率对系统进行排序,每个测试集权重相等。它还展示字符错误率(CER)。任一指标的数值越低,性能越好。我们对模型的评估遵循这一协议。
| Model | Parameters | Avg WER (%) | Avg CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER 是词错误率;CER 是字符错误率。数值越低表示性能越好。
我们在相同的六个测试集上评估了 Falcon-ASR,使用了排行榜中固定的样本列表。竞争模型的数字是排行榜中发布的平均值,已于 2026 年 9 月 30 日进行了验证。该模型的平均词错误率比该版本中已发布的最佳结果高出(即优于)2.25 个百分点。
阿联酋方言评估
用于评估阿联酋方言的公开数据已经存在,例如某个数据集 卡萨布兰卡 面向阿联酋的专门部分。我们通过一次内部评估继续这项评测,评估对象是来自阿联酋和海湾地区演讲的额外录音,使用专为测试准备的录音以及经人工审校的参考文本,以便在阿联酋通用数据之外评估在额外材料上的转写准确率。
在我们的阿联酋内部评估中,Falcon-ASR 的词错误率为 22.73%,字符错误率为 10.19%:
| Model | Parameters | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B active) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
在本次比较的系统中,Falcon-ASR 实现了最低的词错误率和字符错误率。其词错误率比排名第二的 Qwen3-Omni 低 4.07 个百分点。结果显示,在该评估中,词级和字符级的转写准确率均有所提升。
在不同录音条件下的训练
我们在训练数据中加入了背景噪声、重叠语音、音乐、房间混响以及电话通信效果,同时还包括语速和音高的变化。我们对阿联酋录音也应用了相同的处理,使模型能够应对其在会议、通话以及其他日常录音中可能遇到的各种条件。
英语及其他语言
Falcon-ASR 使用相同的模型权重转写英语语音。在 Hugging Face 开放自动语音识别排行榜使用的七个公开英语测试集上的评估中,平均词错误率为 5.74%。
| 测试集 | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
该模型还支持法语、西班牙语和葡萄牙语。这五种语言共用同一组权重,无需预先指定语言。输出即为以所使用语言呈现的文本转写。
模型基础
Falcon-ASR 基于我们在 Falcon3-Audio 方面的工作。论文 在公开数据上采用数据高效单阶段训练的竞争力音频-语言模型 介绍了 Falcon3-Audio 的架构及其训练方法。
体验 Falcon ASR
使……成为可能 我们在 Hugging Face 上的演示 体验Falcon-ASR并探索其在语音转写方面的能力。通过API和原生应用程序的访问也已列入计划。我们诚邀您使用自己的录音来试用该模型。
