
WER arabe : 20,92 % · Paramètres : 1,6B · WER émirati (évaluation TII) : 22,73 %
Nous présentons Falcon-ASR, notre modèle de reconnaissance vocale de 1,6 milliard de paramètres pour l'arabe, avec un accent particulier sur le dialecte émirati. Développé au Technology Innovation Institute (TII) à Abu Dhabi, il prend également en charge l'anglais, le français, l'espagnol et le portugais.
Lors de notre évaluation, Falcon-ASR a atteint un taux d'erreur par mot moyen de 20,92% sur six ensembles de tests en arabe, contre le meilleur résultat publié de 23,17% dans l'instantané du classement que nous avons utilisé. Lors de notre évaluation interne sur l'émirati, il a enregistré les taux d'erreur par mot et par caractère les plus faibles parmi les systèmes comparés.
Nous prenons également en charge les horodatages au niveau du mot pour les transcriptions, en associant chaque mot transcrit à sa position dans l'audio.
Vous pouvez essayer Falcon-ASR dans notre démo Hugging Face.
Reconnaître l'arabe parlé
L'arabe parlé varie selon la région, le locuteur et le contexte. Un modèle qui gère un journal télévisé formel peut encore avoir des difficultés avec une conversation en émirati ou avec de la parole enregistrée via une ligne téléphonique. L'arabe dialectal dispose également de moins de ressources transcrites que l'arabe standard moderne (MSA), ce qui rend l'entraînement et l'évaluation plus difficiles.
Nous avons entraîné Falcon-ASR sur l'émirati, le MSA, d'autres dialectes du Golfe et de l'arabe, ainsi que l'anglais. Notre objectif est de transcrire les mots que les gens emploient dans la parole quotidienne, y compris les formes dialectales et les alternances entre les langues.
Résultats aux benchmarks arabes
Le Open Universal Arabic ASR Leaderboard, maintenu par l'ELM Research Center, classe les systèmes selon la moyenne pondérée équitablement du WER sur six ensembles de tests. Il rapporte également le taux d'erreur par caractère (CER). Des valeurs plus faibles sont meilleures pour les deux métriques. Notre évaluation de Falcon-ASR suit ce protocole.
| Modèle | Paramètres | WER moyen (%) | CER moyen (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER = Word Error Rate (taux d'erreur par mot) ; CER = Character Error Rate (taux d'erreur par caractère). Une valeur plus faible indique de meilleures performances.
Nous avons évalué Falcon-ASR sur les six mêmes benchmarks en utilisant les manifests épinglés du classement. Les chiffres des concurrents sont les moyennes publiées du classement vérifiées le 30 septembre 2026. Le WER moyen de Falcon-ASR est de 2,25 points de pourcentage meilleur que le meilleur résultat publié dans cet instantané.
Évaluer la parole émiratie
Les données d'évaluation publiques incluent déjà l'émirati : Casablanca comporte un sous-ensemble EAU. Nous complétons cette couverture par une évaluation interne de discours émirati et du Golfe supplémentaires, en utilisant des enregistrements mis de côté et des transcriptions validées par des humains pour évaluer la précision de transcription au-delà du sous-ensemble EAU public.
Dans notre évaluation interne de l'émirati, Falcon-ASR a atteint un WER de 22.73 % et un CER de 10.19 % :
| Modèle | Paramètres | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B actifs) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
Falcon-ASR présente le WER et le CER les plus bas parmi les systèmes comparés ici. Son WER est inférieur de 4.07 points de pourcentage à celui de Qwen3-Omni, le meilleur résultat suivant. Les résultats montrent une précision de transcription améliorée au niveau des mots comme des caractères sur cette évaluation.
Entraînement pour différentes conditions d'enregistrement
Nous avons inclus le bruit de fond, la parole qui se chevauche, la musique, la réverbération de salle et les effets de téléphonie, ainsi que des variations de vitesse et de hauteur. Nous avons appliqué le même traitement aux enregistrements émiratis, exposant le modèle à un éventail de conditions qu'il peut rencontrer dans des réunions, des appels et d'autres enregistrements du quotidien.
Anglais et autres langues
Falcon-ASR transcrit également l'anglais avec les mêmes poids de modèle. Lors de notre évaluation sur les sept jeux de tests publics en anglais utilisés par le Hugging Face Open ASR Leaderboard, il a atteint un WER moyen de 5.74%.
| Jeu de tests | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
Le modèle prend également en charge le français, l'espagnol et le portugais. Les cinq langues utilisent les mêmes poids, sans nécessiter d'indicateur de langue. La sortie est une transcription dans la langue parlée.
Fondation du modèle
Falcon-ASR s'appuie sur nos travaux Falcon3-Audio. L'architecture et l'approche d'entraînement de Falcon3-Audio sont décrites dans Des modèles audio-langage compétitifs grâce à un entraînement monophysase économe en données sur des données publiques.
Essayez Falcon ASR
Notre Hugging Face Demo Space vous permet d'essayer Falcon-ASR et d'explorer ses capacités de transcription. Un accès API et des applications natives sont prévus. Nous vous invitons à essayer la Démo avec vos propres enregistrements.
نقدّم Falcon ASR
نقدّم Falcon-ASR، نموذجنا للتعرف على الكلام العربي بحجم 1.6 مليار معلمة، مع اهتمام خاص باللهجة الإماراتية. طوّرنا النموذج في معهد الابتكار التكنولوجي (TII) في أبوظبي، وهو يدعم أيضًا اللغات الإنجليزية والفرنسية والإسبانية والبرتغالية.
في تقييمنا، حقق Falcon-ASR متوسط معدل خطأ في الكلمات بلغ 20.92% عبر ست مجموعات اختبار باللغة العربية، مقارنةً بأفضل نتيجة منشورة بلغت 23.17% في نسخة لوحة المتصدرين التي استخدمناها. وفي تقييمنا الداخلي للهجة الإماراتية، سجّل النموذج أدنى معدلات خطأ في الكلمات والأحرف بين الأنظمة التي قارناها.
ندعم أيضاً الطوابع الزمنية على مستوى الكلمات في عمليات التفريغ النصي، بحيث ترتبط كل كلمة بموضعها في التسجيل الصوتي.
يمكنكم تجربة Falcon-ASR عبر عرضنا التجريبي على Hugging Face.
التعرف على العربية المنطوقة
يختلف الكلام العربي باختلاف المنطقة والمتحدث وظروف التسجيل. فقد ينجح نموذج في تفريغ نشرة إخبارية رسمية، ثم يجد صعوبة في تفريغ محادثة باللهجة الإماراتية أو تسجيل عبر الهاتف. كما أن الموارد الصوتية المفرّغة نصيًا للهجات العربية أقل من تلك المتاحة للعربية الفصحى، مما يزيد صعوبة التدريب والتقييم.
درّبنا Falcon-ASR على اللهجة الإماراتية والعربية الفصحى ولهجات خليجية وعربية أخرى، إلى جانب الإنجليزية. وهدفنا هو تفريغ الكلمات التي يستخدمها الناس في حديثهم اليومي، بما في ذلك الصيغ اللهجية والانتقال بين اللغات.
نتائج الاختبارات العربية
ترتّب لوحة المتصدرين المفتوحة الشاملة للتعرف على الكلام العربي، التي يديرها مركز ELM للأبحاث، الأنظمة وفق متوسط معدل خطأ الكلمات عبر ست مجموعات اختبار، بوزن متساوٍ لكل مجموعة. وتعرض أيضًا معدل خطأ الأحرف (CER). وكلما انخفضت قيمة أي من المقياسين، كان الأداء أفضل. ويتبع تقييمنا للنموذج هذا البروتوكول.
| Model | Parameters | Avg WER (%) | Avg CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 20.92 | 8.79 |
| Audar-ASR-V1-Turbo | 2.35B | 23.17 | 9.23 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 25.87 | 11.80 |
| omniASR LLM 7B | 7.0B | 28.32 | 12.52 |
WER هو معدل خطأ الكلمات؛ وCER هو معدل خطأ الأحرف. تشير القيمة الأقل إلى أداء أفضل.
قيّمنا Falcon-ASR على مجموعات الاختبار الست نفسها، باستخدام قوائم العينات المثبّتة في لوحة المتصدرين. وأرقام النماذج المنافسة هي المتوسطات المنشورة في اللوحة، والتي جرى التحقق منها في 30 سبتمبر 2026. وكان متوسط خطأ الكلمات للنموذج أفضل بمقدار 2.25 نقطة مئوية من أفضل نتيجة منشورة في تلك النسخة.
تقييم اللهجة الإماراتية
تتوافر بالفعل بيانات عامة لتقييم اللهجة الإماراتية، إذ تضم مجموعة Casablanca Une section spéciale aux Émirats. Nous poursuivons cette couverture par une évaluation interne de transcriptions supplémentaires en arabe émirati et du Golfe, en utilisant des enregistrements dédiés aux tests et des textes de référence ayant fait l'objet d'une révision humaine, afin d'évaluer la précision de la transcription sur des matériaux supplémentaires en plus des données générales émiraties.
Dans notre évaluation interne émiratie, Falcon-ASR a obtenu un taux d'erreur par mot de 22,73٪ et un taux d'erreur par caractère de 10,19٪ :
| Modèle | Paramètres | WER (%) | CER (%) |
|---|---|---|---|
| Falcon-ASR | 1.6B | 22.73 | 10.19 |
| Qwen3-Omni-30B-A3B-Instruct | 30.0B (3.0B actifs) | 26.80 | 12.72 |
| Audar-ASR-V1-Turbo | 2.35B | 27.89 | 13.75 |
| Cohere Transcribe Arabic (07-2026) | 2.0B | 31.05 | 18.07 |
| Qwen3-ASR-1.7B-hf | 2.0B | 31.52 | 13.35 |
| Audar-ASR-V1-Flash | 0.78B | 32.87 | 15.36 |
Falcon-ASR a enregistré le taux d'erreur par mot et par caractère le plus bas parmi les systèmes comparés ici. Son taux d'erreur par mot était inférieur de 4.07 points de pourcentage à celui de Qwen3-Omni, qui obtient le résultat suivant. Les résultats montrent une amélioration de la précision de transcription au niveau des mots et des caractères dans cette évaluation.
Entraînement sur des conditions d'enregistrement variées
Nous avons inclus dans les données d'entraînement du bruit de fond, des conversations qui se chevauchent, de la musique, de la réverbération et des effets de téléphonie, ainsi que des variations de débit de parole et de clarté du son. Nous avons appliqué le même traitement aux enregistrements émiratis, afin de préparer le modèle à gérer les différentes conditions qu'il peut rencontrer dans les réunions, les appels et les autres enregistrements quotidiens.
L'anglais et les autres langues
Falcon-ASR transcrit la parole en anglais en utilisant les mêmes poids du modèle. Dans notre évaluation sur les sept jeux de test anglais publics utilisés dans le classement ouvert Hugging Face de reconnaissance vocale, le taux d'erreur par mot moyen était de 5.74 %.
| Jeu de test | WER (%) |
|---|---|
| LibriSpeech clean | 1.75 |
| LibriSpeech other | 4.21 |
| SPGISpeech | 2.02 |
| VoxPopuli | 3.87 |
| GigaSpeech | 8.15 |
| AMI | 8.33 |
| Earnings-22 | 11.86 |
Le modèle prend également en charge le français, l'espagnol et le portugais. Les cinq langues utilisent un même ensemble de poids, sans qu'il soit nécessaire de spécifier la langue au préalable. La sortie est une transcription textuelle dans la langue parlée.
Base du modèle
Falcon-ASR s'appuie sur nos travaux sur Falcon3-Audio. L'article Des modèles audio-langage compétitifs avec un entraînement monophasé efficace en données sur des données publiques décrit l'architecture de Falcon3-Audio et son approche d'entraînement.
Essayer Falcon ASR
permet Notre démo sur Hugging Face d'essayer Falcon-ASR et d'explorer ses capacités de transcription de la parole. L'accès via une API et des applications natives est prévu. Nous vous invitons à essayer le modèle avec vos propres enregistrements.
