아랍어는 하나의 이름 아래 존재하는 여러 언어들의 집합입니다. 현대 표준 아랍어는 뉴스나 교과서에서 읽을 수 있는 언어이지만, 실제로 사람들이 서로 대화할 때 사용되는 언어는 드물습니다. UAE에서는 일상적인 대화, 유머, 협상, 이야기하기 등은 에미리트 아랍어로 이루어집니다. 이는 고유한 어휘와 리듬을 가진 걸프 방언이며, 그에 관련된 문화도 함께 존재합니다. 에미리트 시, 특히 나바티 시는 속담과 짧은 일화와 함께, 문자 그대로 단어별로 읽으면 의미가 드러나지 않는 의미를 담고 있습니다. MSA만을 알고 있는 모델은 에미리트 문장의 모든 단어를 번역할 수 있지만, 실제 의미를 놓칠 수 있습니다.
그것이 팔콘-에미리트-7B가 해결하려는 간극입니다. 이는 팔콘-H1-아랍어 위에 구축된 방언 전문 모델로, 원어민처럼 에미리트 아랍어를 이해하고 생성하는 것을 목표로 합니다. 즉, 어휘, 톤, 그리고 그 뒤에 있는 문화적 맥락을 말합니다.
Falcon-H1-Arabic를 기반으로 제작됨
우리는 처음부터 새로 시작하지 않았습니다. Falcon-Emirati-7B는 이미 올해 초에 언어 분야의 새로운 기준을 세운 Falcon-H1-Arabic 모델 제품군 위에 구축되었습니다. Falcon-H1-Arabic는 Falcon-H1 하이브리드 아키텍처를 사용합니다. 즉, 각 블록 내에서 State Space Models(Mamba)와 Transformer attention이 병렬로 작동하며, 각 블록의 프로젝션 전에 그 출력값이 결합됩니다. 이 조합은 긴 시퀀스에서 Mamba의 선형 시간 효율성을 제공하면서도 장거리 의존성에 대한 주의의 정확성을 유지합니다. 이는 아랍어와 같은 형태학적으로 풍부한 언어에 매우 중요합니다. 이 모델은 3B, 7B, 34B 파라미터를 포함하는 세 가지 규모를 가지고 있으며, 컨텍스트 윈도우는 128K 및 256K 토큰까지입니다. 이 모델은 MSA와 방언 아랍어(걸프, 레반틴, 이집트, 마그레브)뿐만 아니라 영어와 다국어 데이터를 포함한 다양한 데이터로 이미 훈련되었습니다.
이것은 우리에게 강력한 출발점을 제공했습니다: 아랍어를 광범위하게 이해하고 긴 맥락 처리를 잘하며, 일부 방언에 대한 경험도 내재된 모델입니다. Falcon-Emirati-7B는 이러한 기반을 바탕으로 에미리트 방언, 어휘, 문법, 문화 지식에 특화된 모델로 발전시킵니다. 일반적인 아랍어 모델은 아무리 능력이 뛰어나도 이런 것들을 스스로 습득할 수 없습니다.
우리는 7B 버전을 특별히 고려하여 Falcon-Emirati-7B를 구축했습니다. 이 모델은 가족 내에서 적당한 균형을 이루는 모델입니다. 언어 적응에 필요한 세부적인 특징을 유지할 수 있을 만큼 충분히 크지만, 훈련과 인출 모두 실용적이도록 작기 때문에 적당합니다. 34B 모델은 품질을 한층 더 높일 가능성이 있지만, 언어 전문 채팅 모델에 비해 훈련 및 서비스 비용이 지나치게 높습니다. 또한 3B 모델은 우리가 원하는 문화적, 언어적 이해의 깊이를 충분히 담아내지 못합니다. 7B는 훈련 및 인출 비용과 품질 사이의 최적의 균형을 제공했습니다.
언어적 적응이 어려운 이유
일반 아랍 모델을 에미리트 방언 전문가로 변환하는 것은 처음에 기본 모델을 만드는 것보다 덜 쉬운 일처럼 보이지만, 그렇지 않습니다. 몇 가지 요소가 실제로 어렵게 만듭니다:
- 에미리티어는 주로 구어적 방언입니다. 온라인에서의 글쓰기에서는 MSA나 다른 걸프 및 레반틴 방언보다 훨씬 적게 나타나므로, 배울 수 있는 원시 텍스트도 그다지 많지 않습니다.
- 의미는 종종 직접적인 의미가 아닙니다. 속담, 격언, 시적 표현들은 표면적인 단어보다는 공통된 문화적 맥락에 기반을 두고 있습니다.
- 정해진 사용법이 없습니다. 얼마나 많은 방언 데이터가 필요한지, 그것을 MSA와 일반 아랍어와 어떻게 혼합해야 하는지, 또는 어떤 훈련 단계(계속되는 사전 학습, SFT, 또는 선호도 최적화)가 방언을 배우는 데 가장 중요한지에 대한 명확한 방법이 없습니다.
마지막 요점이 우리가 작업하는 방식을 결정했습니다. Falcon-Emirati-7B 모델을 개발하는 과정은 시행착오에 의존했습니다. 다양한 데이터 조합, 훈련 단계, 감독 전략을 테스트하고, 인간의 판단과 벤치마크 점수를 모두 활용하여 무엇이 실제로 성과를 높이는지 알아내는 것이었습니다.
우리의 데이터 접근 방식
우리는 Falcon-H1-Arabic의 사전 학습 단계 위에 에미리트어 데이터 파이프라인을 구축했으며, 세 가지 보완적인 소스 데이터를 활용했습니다.
1. 진정한 에미리트 방언 웹 데이터
우리는 에미리트어로 직접 쓰인 웹사이트와 포럼의 콘텐츠를 크롤링하고 큐레이션했습니다. 이는 MSA로 번역되거나 음역된 것이 아니라, 에미리트어 자체로 작성된 것입니다. 바로 여기서 우리는 실제 사용되는 방식, 일상적인 표현, 구어체적 표현, 그리고 에미리트인과 MSA 간의 자연스러운 대화를 알게 되었습니다.
2. 아랍에미리트 문화와 정체성에 관한 MSA 데이터
방언 텍스트와 함께, 우리는 에미리트 문화, 유산, 언어에 관한 MSA 언어 자료도 함께 활용했습니다. 현지 관습, 가치관, 역사, 사회적 규범에 대한 기사와 참고문헌을 포함하여, 에미리트 사람들이 어떻게 인식되고 고정관념화되는지에 대한 내용도 포함됩니다. 이 자료는 모델이 방언으로 글을 쓰도록 가르치는 것이 아니라, 에미리트 관련 주제가 나올 때 모델이 무엇에 대해 말하는지를 가르칩니다. 예를 들어 유산, 예절, 원어민이 알고 있는 맥락과 같은 내용입니다.
3. 용어집과 스타일 규칙에 의해 지도되는 합성 데이터
진정한 방언 텍스트만으로는 채팅 모델이 일상적으로 처리해야 하는 주제 범위를 충족시키기에는 부족했습니다. 그래서 우리는 공백을 메울 수 있도록 많은 양의 합성 에미리트 방언 데이터를 생성했습니다. 저희는 생성 모델이 "걸프스러운" 아랍어로 임의적으로 만들도록 내버려 두지 않았습니다. 대신 엄격한 규칙과, 에미리트 어휘와 문법을 위해 특별히 만들어진 용어집으로 제약을 걸었습니다. 그 보호 장치들은 진짜 에미리트 방언처럼 들리는 합성된 결과와, 문법적으로는 괜찮지만 실제로 그 방언을 사용하는 사람에게는 어색하게 들리는 결과 사이의 차이를 만드는 요인이 되었습니다.
적절한 적응 레시피 찾기
MSA에서 방언으로의 적응에 대한 표준적인 방법이 없으므로, 훈련 전략 자체를 실험적으로 파악해야 했습니다. 얼마나 많은 방언 데이터를 주입하고, 어떤 훈련 단계에서 이를 수행해야 하는지, 모델이 합성 패턴에 과적합되지 않도록 진짜로 추출된 데이터와 합성 데이터를 어떻게 균형 있게 사용하는지, 그리고 문화적 맥락이 실제로 얼마나 필요한지 등을 실험적으로 조정했습니다. 각 단계에서 우리는 자동 평가와 원어민 검토를 혼합하여 진행했습니다. 왜냐하면 자동 지표만으로는 자연스러움, 톤, 문화적 적합성을 충분히 파악할 수 없기 때문입니다.
평가 방법론
우리는 두 가지 보완적인 방법을 사용하여 훈련 과정 중의 진행 상황을 추적했습니다:
원어민에 의한 수동 평가
에미리트 원어민들은 모델의 결과를 직접 검토했으며, 답이 정확한지뿐만 아니라 말이 자연스러운지, 톤이 적절한지, 문화적 적합성 있는지를 판단했습니다. 이런 것들은 벤치마크 점수로는 알 수 없지만 원어민의 귀가 즉시 감지할 수 있습니다.
알리야에서의 자동 평가
정량적 추적을 위해, 저희와 커뮤니티가 아랍 LLM의 아랍어 방언 능력을 평가하기 위해 특별히 발표한 벤치마크인 Alyah (الياه, "북쪽 별")을 사용했습니다. Alyah는 1,173개의 샘플로 구성된 완전한 원어민 다중 선택 벤치마크로, 아랍어 방언과 문화가 가장 중요한 분야인 일상적인 인사말과 예절부터 비유적 언어, 유산 지식, 아랍어 시까지 다양한 범주를 포함합니다. Alyah의 구축 방식과 범주 분류에 대한 자세한 내용은 저희의 벤치마크 블로그 글에서 확인할 수 있으며, 기반 모델 family에 대한 배경 정보는 Falcon-H1-Arabic 발표문에서 확인할 수 있습니다.
결과
Falcon-Emirati-7B는 Alyah에서 84.83%의 점수를 기록했으며, 우리가 비교한 다른 아랍어 및 다국어 모델들보다 앞서 있습니다. 이는 그보다 몇 배 큰 여러 모델들도 마찬가지입니다. 아래 차트는 Alyah 순위표에서 대표적인 지시문 조정된 모델들과의 위치를 보여줍니다.
알리아 정확도(%) – 지시어를 통해 조정된 모델들. 팔콘-H1-아랍어 계열 모델들은 이 비교에서 제외됩니다. 왜냐하면 팔콘-에미라티-7B는 그 위에 구축된 모델들이기 때문입니다.
결과가 우리에게 말하는 것
이 비교에서 두 가지가 눈에 띄습니다. 크기만으로는 방언 능력을 얻을 수 없습니다. 여기 있는 가장 큰 다국어 모델들 중 일부는 더 작고 방언에 대한 인식을 높인 모델들보다 점수가 낮습니다. 이는 에미리트어 능력이 의도적으로 훈련되어야 하며, 규모가 클수록 얻게 되는 부수적인 결과가 아니라는 것을 의미합니다. 가장 잘 작동하는 모델들은 원래 아랍어에 기반하거나 아랍어에 집중된 경향이 있어서, 이는 우리가 직접 수행한 연구에서 관찰한 것과 일치합니다. 일반적인 아랍어와 방언의 커버리지는 필수적인 출발점이지만, 시, 유산 지식, 언어와 방언 카테고리와 같은 가장 어려운 부분을 보완하기 위해서는 목표에 맞는 방언별 작업이 필요합니다.
이는 Alyah 벤치마크 출시 결과도 마찬가지입니다. 강력한 모델이라도 진정한 방언적이고 문화적으로 내재된 콘텐츠에 들어가면 실제 성능 저하가 나타납니다. 이러한 격차는 더 큰 모델로도 스스로 해소되지 않습니다. 방언에 특화된 데이터와 평가가 필요합니다.
다중 선택이 아닌: 판정 평가로서의 LLM
다중 선택 정확도는 모델이 네 가지 옵션 중 올바른 답을 인식할 수 있는지 나타냅니다. 하지만 사람이 모델과 대화할 때 모델이 스스로 에미리트 아랍어를 생성할 수 있는지는 알 수 없습니다. 그래서 알리아와 함께 두 번째 평가를 진행했습니다: 같은 1,173개의 알리아 질문에 대해 열린형 생성 작업을 수행했으며, 이는 LLM 판사(Gemini 3.7 Flash)에 의해 5개 모델과 비교되었습니다. 해당 모델들은 Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat, 그리고 Fanar-2-27B-Instruct였으며, 이들은 알리아 리더보드에서 가장 강력한 경쟁 모델로 선정되었습니다.
판사는 각 답변에 두 가지 별개의 기준으로 점수를 매겼습니다: 내용이 정확한지, 그리고 독립적으로 답변이 MSA가 아닌 에미리트 방언으로 실제로 전달되었는지 여부입니다. 우리는 부분적인 점수(판사의 평가)와 더 엄격한 통과/실패 버전을 보고하며, 각 모델이 답변 대신 중단했던 빈도도 함께 제시합니다.
LLM은 1,173개의 Alyah 질문에 대한 정확성을 평가했으며, 개방형 생성 작업에서는 Gemini 3.7이 판정자로 작용했습니다.
LLM은 동일한 질문에 대한 방언 충실도를 평가했습니다: 답이 실제로 에미리트어로 나오는지, 아니면 모델이 기본적으로 MSA로 출력하는지입니다.
Falcon-Emirati-7B가 정확성 면에서 앞서지만, 실제 차이는 두 번째 차트에서 나타납니다. 방언 충실도 측면에서 Falcon-Emirati-7B는 0.52(부분 점수)를 얻었으며, ALLaM은 0.05, gemma-3-27b-it은 0.03, Jais-2-8B-Chat은 0.02, Fanar-2-27B-Instruct는 효과적으로 0.00점을 기록했습니다. 이는 작은 우위가 아니라, 저쪽에서 두 배의 차이가 나는 수준입니다. 실제로는 다른 모델들이 올바른 답을 알고 있음에도 불구하고, 에미리트어로 직접 질문이 나오더라도 기본적으로 현대 표준 아랍어로 답합니다. Falcon-Emirati-7B만이 다섯 모델 중에서 질문이 이루어진 방언으로 신뢰할 수 있게 답변하는 유일한 모델입니다.
Fanar-2-27B-Instruct는 두 번째로 두드러집니다: 다른 모델들보다 훨씬 더 자주 대답을 거부합니다. 비교 대상의 다른 모델들은 5% 미만으로 대답하는 반면, 이 모델은 26.2%의 시간 동안 대답을 거부합니다. 부분적인 점수를 포함한 정확도 점수가 0.27로 다섯 모델 중 가장 낮은 수준인 점을 고려할 때, 이 모델은 아랍에미리트 특유의 콘텐츠와는 적극적으로 상호작용하지 못하는 모델이며, 단순히 잘못된 방식으로 대답하는 모델이 아닙니다.
알리아 카테고리에 따른 방언 충실성으로 부분적인 공로를 인정합니다. 팔콘-에미리트-7B는 에미리트 방언으로 일관되게 전환되는 유일한 모델이며, 다른 모델들은 거의 모든 카테고리에서 MSA 방언을 유지합니다.
카테고리별로 방언의 정확성을 분석하면 패턴이 더욱 명확해진다. 이는 일상적인 인사부터 시까지 Alyah의 모든 카테고리에 적용되며, 이는 이가 몇 가지 질문 유형을 위해 배운 좁은 기술이 아니라는 것을 의미한다. 이는 에미라티어가 기대되는 레지스터일 때 모델이 기본적으로 사용하는 레지스터가 일반적으로 변하는 것이다. 경쟁 모델 중 비교적 더 나은 성능을 보이는 한 곳인 Greetings & Daily Expressions는 에미리트어와 MSA가 가장 많이 겹치는 범주이기도 하므로, 일반적인 아랍어 모델이 실수로 올바르게 들리는 가장 쉬운 장소입니다.
쌍대 비교, 카테고리별로
동일한 질문에 대한 세 번째 관점에서, 우리는 쌍대결 방식으로 평가를 진행했습니다. 각 Alyah 질문에 대해, 판사(Gemini 3.7 Flash)는 Falcon-Emirati-7B의 답과 경쟁 모델의 답을 함께 보여주고, 어느 쪽이 더 우수한지 알 수 없게 한 후 더 나은 답을 선택하도록 요청했습니다. 아래의 레이더 차트는 세 개의 경쟁 모델인 Jais-2-8B-Chat, ALLaM-7B-Instruct-preview, Fanar-2-27B-Instruct에 대한 각 카테고리별 승률을 보여줍니다.
카테고리별 쌍대비 승률로, Falcon-Emirati-7B 대 Jais-2-8B-Chat, ALLaM-7B-Instruct-preview 및 Fanar-2-27B-Instruct는 Gemini 3.7에 의해 직접 대결로 평가되었다.
Falcon-Emirati-7B는 세 경쟁자 모두에 맞서 대부분의 카테고리에서 우승했으며, 방언과 문화적 유창성에 가장 크게 의존하는 카테고리에서는 큰 격차로 우위를 점했습니다. Jais-2-8B-Chat에 대해서는 시와 창의적 표현(0.69 대 0.31) 및 언어와 방언(0.62 대 0.38) 분야에서 가장 큰 격차가 나타났습니다. ALLaM-7B-Instruct-preview에 대해서는 동일한 두 카테고리에서도 넓은 격차가 관찰되었으며, 그 내용은 시와 창의적 표현(0.66 대 0.34) 및 언어와 방언(0.58 대 0.42)입니다. Fanar-2-27B-Instruct에 대항하여, 여섯 가지 대결 중 가장 넓은 간격을 보이며, Falcon-Emirati-7B는 모든 카테고리에서 우승하며, Poetry & Creative Expression(0.88 대 0.12)과 Religious & Social Sensitivity(0.80 대 0.20)에서 최고점을 기록했습니다.
경쟁 모델들이 우위를 점하는 유일한 카테고리는 ‘인사 및 일상 표현’입니다: Falcon-Emirati-7B는 Jais-2-8B-Chat(0.46 대 0.54)에게 약하였고, ALLaM-7B-Instruct-preview와는 0.50으로 비겼지만, Fanar-2-27B-Instruct(0.70 대 0.30)에는 명확하게 우세했습니다. 이는 위에서 보인 방언 충실도 분석과 대체로 일치합니다. 인사말은 에미리트어와 MSA가 가장 많이 겹치는 범주이므로, 전용 방언 훈련 없이도 일반적인 아랍어 모델이 원어민처럼 말하는 데 가장 쉬운 부분입니다. 방언이 더 뚜렷한 곳에서는 시, 은유적 언어, 유산 지식에서 Falcon-Emirati-7B의 장점이 우리가 테스트한 모든 경쟁 모델에서 명확하게 나타납니다.
에미리트 문화 이해하기
언어는 대화 뒤에 있는 문화를 이해하는 것도 포함합니다. 우리는 아랍어에서 문화적 이해를 위한 벤치마크인 ArabCulture-Dialogue의 UAE 부분에 Falcon-Emirati-7B를 평가했습니다. 다중 선택 문제에서 모델은 세 가지 옵션 중 가장 문화적으로 적절한 답을 선택합니다. 자세한 내용은 연구 논문을 참조하십시오.
우리는 같은 283 UAE 시나리오에서 네 가지 모델을 에미리트 아랍어와 현대 표준 아랍어로, 다양한 위치 정보를 포함한 형태로 테스트했습니다.
UAE 다중선택 문제에서의 전체 정확도는 두 언어 유형과 모든 위치 설정을 통틀어 평균된 값입니다. 이는 우리의 평가 결과입니다.
Falcon-Emirati-7B는 테스트된 네 가지 모델 중 가장 높은 점수인 85.57%를 기록했으며, ALLaM-7B(83.39%), Jais-2-8B(73.79%), Fanar-2-27B(71.50%)보다 앞섰습니다. 이러한 결과는 에미리트 언어의 대화에서 문화적으로 적절한 반응을 인식하는 능력을 잘 보여줍니다.
실제로 보기
숫자만으로는 이야기의 일부분만을 알 수 있으므로, 아래에는 실시간으로 상호작용 가능한 비교가 있습니다: 5개의 실제 에미리트 언어 프롬프트가 Falcon-Emirati-7B와 함께 Fanar-2-27B-Instruct 및 ALLaM-7B-Instruct-preview와 비교됩니다. 슬쩍 넘기거나 화살표를 사용하여 프롬프트를 이동하고, 응답을 확장하여 전체 내용을 읽을 수 있습니다.
인터랙티브 비교: Falcon-Emirati-7B vs. Fanar-2-27B-Instruct vs. ALLaM-7B-Instruct-preview가 5개의 에미리트 푸시를 통해 이드 인사, 지역 역사, 시, 유산 지식을 다루는 데 사용되었습니다. 출력 결과는 생성된 것으로 오류가 있을 수 있으며, 강조 표시는 우리 모델을 나타내며 사실적인 평가는 아닙니다.
Falcon-Emirati-7B를 시도해 보세요
Falcon-Emirati-7B는 우리 채팅 플랫폼에서 이용 가능합니다. 🚀 지금 사용해 보세요: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
책임 있는 AI와 한계점들
어떤 언어 모델이든 마찬가지로 Falcon-Emirati-7B도 훈련 데이터에 포함된 편견을 반영할 수 있으며, 특히 드물고 지역적인 표현이나 우리가 충분한 데이터가 없는 경계 상황에서는 오류를 범하기도 합니다. 방언과 문화적 미묘함은 주관적인 것이며, 원어민들조차도 "올바른" 답에 대해 항상 동의하지는 않습니다. 특히 민감하거나 공식적이거나 위험도가 높은 작업에 이 모델을 사용하기 전에, 특정 사용 사례에 맞게 모델을 평가하는 것을 권장합니다. 또한 에미리트 커뮤니티의 피드백을 진심으로 환영하며, 이를 통해 모델과 Alyah를 더욱 개선할 수 있기를 바랍니다.
공로 표창
컴퓨터 인프라에 대한 지속적인 지원에 대해 미하일 루비네츠와 마티외 베르종에게 진심으로 감사드리며, 팔콘 채팅 앱을 통해 모델을 접근 가능하게 만드는 데 도움을 준 자틴 미탈에게도 감사를 표합니다.
참고문헌
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







