Hugging Face

Falcon ASRをご紹介します

英語 · アラビア語 アラビア語WER:20.92% · パラメータ:1.6B · エミレーティア語WER(TII評価):22.73% アラビア語のための、16億パラメータを持つ音声認識モデルであるFalcon-ASRを発表します。特にエミレーテ方言に焦点を当てています。アブダビのテクノロジーイノベーション研究所(TII)で開発されたこのモデルは、英語、フランス語、スペイン語、ポルトガル語にも

Falcon ASR: Arabic and English speech recognition
画像の出典 · Hugging Face

Falcon ASR: Arabic and English speech recognition

英語 · アラビア語

アラビア語WER:20.92% · パラメータ:1.6B · エミレーティア語WER(TII評価):22.73%

アラビア語のための、16億パラメータを持つ音声認識モデルであるFalcon-ASRを発表します。特にエミレーテ方言に焦点を当てています。アブダビのテクノロジーイノベーション研究所(TII)で開発されたこのモデルは、英語、フランス語、スペイン語、ポルトガル語にも対応しています。

我々の評価では、Falcon-ASRは6つのアラビア語テストセット全体で平均単語誤り率が20.92%であり、我々が使用したリーダーボードのスナップショットで公表されている最高値である23.17%と比べて低い。内部のエミレット語評価では、比較したシステムの中で最も低い単語および文字誤り率を記録した。

また、テキスト翻字において単語レベルのタイムスタンプをサポートし、翻字された各単語と音声内の位置を関連付けます。

Hugging FaceデモでFalcon-ASRを試すことができます。

話すアラビア語を認識する

アラビア語の発音は地域、話者、環境によって異なる。正式なニュース放送を扱うモデルでも、エミレット語や電話回線で録音された言葉の会話には苦労するかもしれない。方言アラビア語には、現代標準アラビア語(MSA)よりも翻字資料が少なく、そのため訓練と評価が困難になる。

Falcon-ASRをエミレット語、MSA、他の湾岸諸語、アラビア語方言、そして英語について訓練しました。私たちの目的は、方言形や言語間の変化を含む、人々が日常会話で使う単語を正確に転写することです。

アラビア語ベンチマーク結果

Open Universal Arabic ASR Leaderboardは、ELM Research Centerが管理しており、6つのテストセットを通じた等しい重みの平均WERによってシステムを評価します。また、文字エラー率(CER)も報告されます。どちらの指標においても、値が低い方が良いです。私たちのFalcon-ASR評価はこのプロトコルに従います。

モデル パラメータ 平均WER(%) 平均CER(%)
ファルコン-ASR 1.6B 20.92 8.79
オダール-ASR-V1-ターボ 2.35B 23.17 9.23
コーバー・トランスクリプト・アラビア語(07-2026) 2.0B 25.87 11.80
omniASR LLM 7B 7.0B 28.32 12.52

WER = 単語エラー率;CER = 文字エラー率です。値が低いほど性能が良いことを意味します。

リーダーボードの固定マニフェストを使用して、同じ6つのベンチマークでFalcon-ASRを評価した。競合製品の数値は、2026年9月30日に確認された公表されたリーダーボードの平均値である。Falcon-ASRの平均WERは、その時点で公表された最高の結果より2.25パーセントポイント優れている。

エミレトリア語の評価

公開された評価データにはすでにエミレーツ言語が含まれています:カサブランカにはUAEのサブセットがあります。私たちは、予備録音や人間が検証したテキストデータを用いた内部評価を通じて、公開されたUAEサブセットを超えた翻字精度を評価し、エミレーツ言語および湾岸言語のカバレッジを補完します。

私たちの内部エミレタ語評価では、Falcon-ASRは22.73%のWERと10.19%のCERを達成しました。

モデル パラメータ WER (%) CER (%)
ファルコン-ASR 1.6B 22.73 10.19
Qwen3-Omni-30B-A3B-Instruct 30.0B(3.0Bがアクティブ) 26.80 12.72
オダール-ASR-V1-ターボ 2.35B 27.89 13.75
コーバー・トランスクリプト・アラビア語(07-2026) 2.0B 31.05 18.07
Qwen3-ASR-1.7B-hf 2.0B 31.52 13.35
オダール-ASR-V1-フラッシュ 0.78B 32.87 15.36

ここで比較されるシステムの中で、Falcon-ASRはWERとCERが最も低い。そのWERは、次に良い結果を出したQwen3-Omniより4.07ポイント低い。この評価結果から、単語レベルおよび文字レベルでの翻字精度が向上していることがわかる。

異なる録音条件におけるトレーニング

背景ノイズ、重なる音声、音楽、部屋の残響、電話効果、そして速度やピッチの変化を含めました。エミレーツ語の録音にも同じ処理を適用し、会議、通話、その他の日常的な録音でモデルが遭遇する可能性のある様々な条件にモデルを晒しました。

英語やその他の言語

Falcon-ASRは同じモデル重みで英語も翻訳します。Hugging Face Open ASR Leaderboardで使用される7つの公開された英語テストセットに対する評価では、平均WERが5.74%を達成しました。

テストセット WER (%)
LibriSpeech clean 1.75
LibriSpeech 他 4.21
SPGスピーチ 2.02
ヴォクスポプリウ 3.87
GigaSpeech 8.15
AMI 8.33
利益-22 11.86

モデルはフランス語、スペイン語、ポルトガル語もサポートしています。5つの言語すべてに同じ重みが使用され、言語のフラグは不要です。出力されるのは、話された言語で記録されたテキストです。

モデル基盤

Falcon-ASRは、私たちのFalcon3-Audioの研究を基に構築されています。Falcon3-Audioのアーキテクチャとトレーニング方法については、公共データ上でのデータ効率的な単段階トレーニングによる競争的音声言語モデルで説明されています。

ファルコンASRを試してみて

私たちのHugging Faceデモスペースを利用することで、Falcon-ASRを試し、その音声認識機能を確認することができます。APIアクセスやネイティブアプリケーションも予定されています。自分の録音データでデモを試すことをお勧めします。


Falcon ASRをご紹介します

Falcon-ASRは、1.6十億個のパラメータを持つアラビア語言識別モデルです。特にアマラ語に重点を置いて開発されました。このモデルはアブダビの技術イノベーション研究所(TII)で開発されており、英語、フランス語、スペイン語、ポルトガル語もサポートしています。

私たちの評価によると、Falcon-ASRはアラビア語の6つのテストセットで平均誤り率が20.92%に達しました。これは、私たちが使用したトップレベルのバージョンで得られた23.17%という最高値と比べても低いです。 イエメラ語の内部評価では、モデルが比較したシステム間での単語や文字の誤り率が最も低かった。

テキストの抽出処理において、単語レベルでのタイムスタンプもサポートされており、各単語が音声記録内のその位置と関連している。

Hugging Faceの試用ページを通じてFalcon-ASRを体験する

話されるアラビア語の認識

アラビア語の言葉は、地域や話し手、録音環境によって異なります。あるモデルは公式ニュースレターを生成するのに成功しても、イエメリア方言の会話を生成したり、電話で録音するのが難しいことがあります。 アラビア語の発音用音声データは、正書法アラビア語用のデータよりも少なく、そのため訓練と評価が困難になる。

Falcon-ASRをアラビア語正書体、イエメル語方言、グリージア方言、その他のアラビア語方言、そして英語と共にイエメル方言で訓練しました。私たちの目的は、人々が日常会話で使う単語を解放することです。これには方言表現や言語間の移行も含まれます。

アラビア語のテスト結果

アラビア語言識別の総合的な開放型リーダーシップレース板は、ELM研究センターが管理しています。このセンターでは、6つのテストグループに均等な重みを付けて、単語の平均誤差率に基づいてシステムを運用しています。また、文字の誤差率(CER)も表示されます。どちらの指標の値が低ければ低いほど、性能が良くなります。私たちのモデル評価はこのプロトコルに従っています。

モデル パラメータ 平均WER(%) 平均CER(%)
ファルコン-ASR 1.6B 20.92 8.79
オダール-ASR-V1-ターボ 2.35B 23.17 9.23
コーバー・トランスクリプト・アラビア語(07-2026) 2.0B 25.87 11.80
omniASR LLM 7B 7.0B 28.32 12.52

WERは単語の誤り率であり、CERは文字の誤り率です。値が小さいほど性能が良いことを意味します。

私たちは、フィールドリストに記載されたサンプルリストを使用して、同じ6つのテストグループでFalcon-ASRを実施しました。競合モデルの数値は、2026年9月30日に確認されたフィールドリスト上の平均値です。 そのバージョンで公開された最高の結果より、モデルの単語の平均誤差が2.25ポイントパーセント良かった。

アラビア語の発音評価

アラビア語の発音を評価するための一般データがすでに利用可能である。Casablanca コレクションにはアラブ首長国連邦に関するセクションが含まれている。このデータを補完するために、アラブ語およびカリフ語の追加発音に関する内部評価が行われており、テスト用の録音や人間による検証を受けた参照テキストを用いて、一般のアラブ語データに加えて追加データにおける翻訳の正確性を評価している。

ファルコン-ASRは、アラブ首長国連邦内の評価で、単語の誤り率が22.73%、文字の誤り率が10.19%であった。

モデル パラメータ WER (%) CER (%)
ファルコン-ASR 1.6B 22.73 10.19
Qwen3-Omni-30B-A3B-Instruct 30.0B(3.0Bがアクティブ) 26.80 12.72
オダール-ASR-V1-ターボ 2.35B 27.89 13.75
コーバー・トランスクリプト・アラビア語(07-2026) 2.0B 31.05 18.07
Qwen3-ASR-1.7B-hf 2.0B 31.52 13.35
オダール-ASR-V1-フラッシュ 0.78B 32.87 15.36

Falcon-ASRは、ここでの比較システム間の単語や文字の誤り率が最も低い。単語の誤り率はQwen3-Omniより4.07ポイントパーセント低く、その結果が得られた。この評価において、単語や文字レベルでの抽出精度が向上していることが結果から示されている。

異なる録音条件におけるトレーニング

トレーニングデータには、背景ノイズ、重なる音声、音楽、音の残響、電話通信の影響、そして言語速度や音の明瞭さの変化が含まれています。 私たちは同じ処理をアラブ首長国連邦の録音にも適用し、会議、通話、その他の日常的な録音で直面する可能性のある様々な状況に対応できるようにモデルを準備した。

英語と他の言語

Falcon-ASRは同じモデルの重みを使用して英語の言葉を処理する。Hugging Faceのオープン言語認識プラットフォームで使用される7つの一般的な英語テストセットに対する our評価では、単語の平均誤差率は5.74%であった。

テストセット WER (%)
LibriSpeech clean 1.75
LibriSpeech 他 4.21
SPGスピーチ 2.02
ヴォクスポプリウ 3.87
GigaSpeech 8.15
AMI 8.33
利益-22 11.86

モデルはフランス語、スペイン語、ポルトガル語もサポートします。これら5つの言語は、事前に言語を指定する必要なく、同じフォントを使用します。出力されるのは、話し言葉のテキスト形式です。

モデルの基礎

Falcon-ASRは、Falcon3-Audioにおける研究結果に基づいています。公共データ上でのデータ効率的な単段階学習による競争的音声言語モデルという論文では、Falcon3-Audioの構造と学習方法が示されています。

ファルコンASRの体験

Hugging Faceでの試用体験を通じて、Falcon-ASRの機能を音声解析の面で体験し、その能力を探ってみましょう。APIインターフェースや実際のアプリケーションへのアクセスは今後計画されています。ご自身の録音データを使ってモデルを試すことをお勧めします。

原文の出典

Hugging Face

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください