Hugging Face수정일

Falcon ASR 소개

English · العربية 아랍어 WER: 20.92% · 파라미터: 1.6B · 에미라티 WER (TII 평가): 22.73% 저희는 아랍어, 특히 에미라티 방언에 중점을 둔 1.6 billion 파라미터 음성 인식 모델 Falcon-ASR을 소개합니다. 아부다비의 Technology Innovation Institute (TII)에서 개발된 이

Falcon ASR: Arabic and English speech recognition
이미지 출처 · Hugging Face

Falcon ASR: Arabic and English speech recognition

English · العربية

아랍어 WER: 20.92% · 파라미터: 1.6B · 에미라티 WER (TII 평가): 22.73%

저희는 아랍어, 특히 에미라티 방언에 중점을 둔 1.6 billion 파라미터 음성 인식 모델 Falcon-ASR을 소개합니다. 아부다비의 Technology Innovation Institute (TII)에서 개발된 이 모델은 영어, 프랑스어, 스페인어, 포르투갈어도 지원합니다.

저희의 평가에서 Falcon-ASR은 여섯 개의 아랍어 테스트 세트에서 평균 단어 오류율 20.92%를 기록했으며, 이는 저희가 사용한 리더보드 스냅샷의 최고 공개 결과인 23.17%와 비교됩니다. 저희 내부 에미라티 평가에서는 비교한 시스템들 중 가장 낮은 단어 및 문자 오류율을 기록했습니다.

또한 전사(transcription)에 대해 단어 수준 타임스탬프를 지원하여, 전사된 각 단어를 오디오 내 위치와 연결합니다.

다음에서 Hugging Face 데모에서 Falcon-ASR을 사용해 볼 수 있습니다.

구어 아랍어 인식

아랍어 음성은 지역, 화자, 상황에 따라 다릅니다. 공식 뉴스 방송을 처리하는 모델이라도 에미라티 방언의 대화나 전화선을 통해 녹음된 음성에서는 여전히 어려움을 겪을 수 있습니다. 또한 방언 아랍어는 현대 표준 아랍어(MSA)보다 전사된 자료가 적어 학습과 평가가 더 어렵습니다.

저희는 에미라티어, MSA, 기타 걸프 및 아랍 방언, 그리고 영어로 Falcon-ASR을 학습했습니다. 저희의 목표는 방언 형태와 언어 간 전환을 포함하여 일상 대화에서 사람들이 사용하는 단어를 전사하는 것입니다.

아랍어 벤치마크 결과

ELM Research Center가 운영하는 Open Universal Arabic ASR Leaderboard는 여섯 개 테스트 세트에 걸친 동등 가중 평균 WER로 시스템을 순위 매김합니다. 또한 문자 오류율(CER)도 보고합니다. 두 지표 모두 값이 낮을수록 좋습니다. 저희의 Falcon-ASR 평가는 이 프로토콜을 따릅니다.

모델 파라미터 평균 WER (%) 평균 CER (%)
Falcon-ASR 1.6B 20.92 8.79
Audar-ASR-V1-Turbo 2.35B 23.17 9.23
Cohere Transcribe Arabic (07-2026) 2.0B 25.87 11.80
omniASR LLM 7B 7.0B 28.32 12.52

WER = Word Error Rate; CER = Character Error Rate. 값이 낮을수록 더 나은 성능을 나타냅니다.

저희는 리더보드의 고정된 매니페스트를 사용하여 동일한 여섯 개 벤치마크에서 Falcon-ASR을 평가했습니다. 경쟁 모델 수치는 2026년 9월 30일에 확인된 공개 리더보드 평균입니다. Falcon-ASR의 평균 WER은 해당 스냅샷의 최고 공개 결과보다 2.25 퍼센트 포인트 더 우수합니다.

에미라티 음성 평가

공개 평가 데이터에는 이미 에미라티: 카사블랑카 의 UAE 서브셋이 포함되어 있습니다. 우리는 공개된 UAE 서브셋을 넘어서 전사 정확도를 평가하기 위해, 별도로 보관된 녹음 파일과 사람이 검증한 전사본을 사용하여 추가적인 에미라티 및 걸프 지역 음성에 대한 내부 평가로 이러한 커버리지를 보완했습니다.

내부 에미라티 평가에서 Falcon-ASR은 22.73% WER과 10.19% CER을 달성했습니다:

모델 파라미터 WER (%) CER (%)
Falcon-ASR 1.6B 22.73 10.19
Qwen3-Omni-30B-A3B-Instruct 30.0B (3.0B active) 26.80 12.72
Audar-ASR-V1-Turbo 2.35B 27.89 13.75
Cohere Transcribe Arabic (07-2026) 2.0B 31.05 18.07
Qwen3-ASR-1.7B-hf 2.0B 31.52 13.35
Audar-ASR-V1-Flash 0.78B 32.87 15.36

Falcon-ASR는 여기서 비교된 시스템들 중 가장 낮은 WER과 CER을 기록했습니다. 그 WER은 다음으로 좋은 결과인 Qwen3-Omni보다 4.07 퍼센트포인트 낮습니다. 이 평가 결과는 단어 수준과 문자 수준 모두에서 전사 정확도가 향상되었음을 보여줍니다.

다양한 녹음 조건에 대한 학습

우리는 배경 소음, 겹치는 발화, 음악, 실내 잔향 및 전화 효과뿐만 아니라 속도와 피치의 변화까지 포함했습니다. 우리는 에미라티 녹음에도 동일한 처리를 적용하여, 모델이 회의, 통화 및 기타 일상적인 녹음에서 마주칠 수 있는 다양한 조건에 노출되도록 했습니다.

영어 및 기타 언어

Falcon-ASR는 동일한 모델 가중치로 영어 전사도 수행합니다. Hugging Face Open ASR Leaderboard에서 사용된 7개의 공개 영어 테스트 세트에 대한 우리의 평가에서, 이 모델은 평균 WER 5.74%를 달성했습니다.

테스트 세트 WER (%)
LibriSpeech clean 1.75
LibriSpeech other 4.21
SPGISpeech 2.02
VoxPopuli 3.87
GigaSpeech 8.15
AMI 8.33
Earnings-22 11.86

이 모델은 프랑스어, 스페인어, 포르투갈어도 지원합니다. 5개 언어 모두 동일한 가중치를 사용하며, 언어 플래그가 필요하지 않습니다. 출력은 해당 언어로 된 전사문입니다.

모델 기반

Falcon-ASR는 우리의 Falcon3-Audio 연구를 기반으로 합니다. Falcon3-Audio의 아키텍처와 학습 방식은 다음 문서에 설명되어 있습니다: 공개 데이터 기반 데이터 효율적 단일 단계 훈련으로 경쟁력 있는 오디오-언어 모델.

Falcon ASR를 사용해 보세요

우리의 Hugging Face 데모 스페이스 Falcon-ASR를 사용해 보고 그 전사 기능을 탐색할 수 있습니다. API 액세스와 네이티브 애플리케이션이 계획되어 있습니다. 여러분의 녹음 파일로 데모를 사용해 보시기 바랍니다.


Falcon ASR을 소개합니다

Falcon-ASR을 소개합니다. 이는 파라미터 1.6B 규모의 아랍어 음성 인식 모델로, 아랍에미리트 방언에 특화되어 있습니다. 우리는 아부다비의 기술혁신연구원(TII)에서 이 모델을 개발했으며, 영어, 프랑스어, 스페인어, 포르투갈어도 지원합니다.

우리의 평가에서 Falcon-ASR은 아랍어 6개 테스트 세트 전반에서 평균 단어 오류율 20.92%를 기록했으며, 이는 우리가 사용한 리더보드 버전에서 발표된 최고 성적 23.17%와 비교됩니다. 아랍에미리트 방언에 대한 우리의 내부 평가에서는, 이 모델이 비교한 시스템들 중 가장 낮은 단어 오류율과 문자 오류율을 기록했습니다.

또한 전사(텍스트 변환) 과정에서 단어 수준 타임스탬프를 지원하여, 각 단어가 음성 녹음에서의 위치와 연결되도록 합니다.

여러분은 Hugging Face의 데모를 통해 Falcon-ASR을 체험할 수 있습니다.

구어 아랍어 인식

아랍어 음성은 지역, 화자, 녹음 조건에 따라 다릅니다. 어떤 모델은 공식 뉴스 방송은 잘 전사할 수 있지만, 아랍에미리트 방언 대화나 전화 녹음은 전사하는 데 어려움을 겪을 수 있습니다. 또한 아랍어 방언에 대해 전사된 음성 자원은 현대 표준 아랍어에 비해 적어, 훈련과 평가가 더 어렵습니다.

우리는 Falcon-ASR을 아랍에미리트 방언, 현대 표준 아랍어, 기타 걸프 및 아랍 방언들과 함께 영어에 대해서도 훈련했습니다. 우리의 목표는 방언 형태와 언어 전환을 포함하여 사람들이 일상 대화에서 사용하는 단어들을 전사하는 것입니다.

아랍어 테스트 결과

순위를 매기다 아랍어 음성 인식을 위한 포괄적 오픈 리더보드는 ELM 리서치 센터가 운영하며, 6개 테스트 세트 전반의 평균 단어 오류율을 기준으로 시스템들의 순위를 매기며, 각 세트에 동일한 가중치를 부여합니다. 또한 문자 오류율(CER)도 표시합니다. 두 지표 모두 값이 낮을수록 성능이 더 좋습니다. 우리의 모델 평가는 이 프로토콜을 따릅니다.

Model Parameters Avg WER (%) Avg CER (%)
Falcon-ASR 1.6B 20.92 8.79
Audar-ASR-V1-Turbo 2.35B 23.17 9.23
Cohere Transcribe Arabic (07-2026) 2.0B 25.87 11.80
omniASR LLM 7B 7.0B 28.32 12.52

WER는 단어 오류율이고, CER은 문자 오류율입니다. 값이 낮을수록 더 좋은 성능을 나타냅니다.

우리는 리더보드에 고정된 샘플 목록을 사용하여 동일한 6개 테스트 세트에서 Falcon-ASR을 평가했습니다. 경쟁 모델들의 수치는 리더보드에 게시된 평균값으로, 2026년 9월 30일에 검증되었습니다. 이 모델의 평균 단어 오류율은 해당 버전에서 발표된 최고 성적보다 2.25 퍼센트포인트 더 좋았습니다.

아랍에미리트 방언 평가

아랍에미리트 방언을 평가하기 위한 공개 데이터가 이미 존재하며, 예를 들어 세트가 포함됩니다 카사블랑카 아랍에미리트 전용 섹션입니다. 테스트 전용 녹음 및 인간 검토를 거친 기준 텍스트를 사용하여 아랍에미리트 및 걸프 지역 추가 음성 녹음에 대한 내부 평가로 이번 취재를 이어가며, 아랍에미리트 일반 데이터 외에 추가 자료에 대한 전사 정확도를 평가합니다.

Falcon-ASR은 아랍에미리트 내부 평가에서 단어 오류율 22.73%, 문자 오류율 10.19%를 기록했습니다:

Model Parameters WER (%) CER (%)
Falcon-ASR 1.6B 22.73 10.19
Qwen3-Omni-30B-A3B-Instruct 30.0B (활성 3.0B) 26.80 12.72
Audar-ASR-V1-Turbo 2.35B 27.89 13.75
Cohere Transcribe Arabic (07-2026) 2.0B 31.05 18.07
Qwen3-ASR-1.7B-hf 2.0B 31.52 13.35
Audar-ASR-V1-Flash 0.78B 32.87 15.36

Falcon-ASR는 여기서 비교된 시스템들 중 가장 낮은 단어 및 문자 오류율을 기록했습니다. 단어 오류율은 다음 순위인 Qwen3-Omni보다 4.07퍼센트포인트 낮았습니다. 이번 평가에서 단어 및 문자 수준 전사 정확도가 향상되었음을 결과가 보여줍니다.

다양한 녹음 조건에 대한 학습

학습 데이터에는 배경 소음, 겹치는 발화, 음악, 잔향, 전화 통화 효과뿐 아니라 말하기 속도와 음성 선명도의 변화가 포함되었습니다. 동일한 처리를 에미라티 녹음에도 적용하여, 모델이 회의, 통화 및 기타 일상 녹음에서 직면할 수 있는 다양한 조건을 처리할 수 있도록 준비했습니다.

영어 및 기타 언어

Falcon-ASR은 동일한 모델 가중치를 사용하여 영어 음성을 전사합니다. Hugging Face 오픈 자동 음성 인식 리더보드에 사용된 7개의 공개 영어 테스트 세트에 대한 평가에서 평균 단어 오류율은 5.74%였습니다.

Test set WER (%)
LibriSpeech clean 1.75
LibriSpeech other 4.21
SPGISpeech 2.02
VoxPopuli 3.87
GigaSpeech 8.15
AMI 8.33
Earnings-22 11.86

이 모델은 프랑스어, 스페인어, 포르투갈어도 지원합니다. 다섯 언어 모두 단일 가중치를 사용하며, 언어를 사전에 지정할 필요가 없습니다. 출력은 발화된 언어의 텍스트 전사입니다.

모델의 기반

Falcon-ASR은 Falcon3-Audio 관련 우리 연구에 기반을 둡니다. 논문 공개 데이터 기반 데이터 효율적인 단일 단계 훈련을 통한 경쟁력 있는 오디오-언어 모델 에서 Falcon3-Audio의 아키텍처와 학습 방식을 설명합니다.

Falcon ASR 사용해 보기

다음을 통해 Hugging Face 데모 Falcon-ASR를 사용해 음성 전사 기능을 직접 체험하고 탐색할 수 있습니다. API 및 네이티브 애플리케이션을 통한 접근도 계획되어 있습니다. 여러분의 녹음 파일로 모델을 직접 사용해 보시기 바랍니다.

원문 출처

Hugging Face

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요