El árabe es realmente una familia de lenguas que coexisten bajo un mismo nombre. El árabe estándar moderno es lo que se lee en las noticias o en los libros de texto, pero rara vez es la forma en que la gente se comunica entre sí. En los EAU, la conversación diaria, el humor, la negociación y la narración de historias se realizan en árabe emiratí, un dialecto del Golfo con su propio vocabulario, su propio ritmo y una cultura que está estrechamente vinculada a él. La poesía emiratí, especialmente la poesía nabati, junto con los proverbios y las anécdotas cortas, contiene un significado que no se conserva en una lectura literal, palabra por palabra. Un modelo que solo conoce MSA puede traducir cada palabra de una oración emiratí y, aún así, omitir lo que realmente significa.
Esa es la brecha que el Falcon-Emirati-7B está diseñado para cerrar. Es un modelo especializado en dialectos, basado en el Falcon-H1-Arabic, cuyo objetivo es comprender y generar el árabe emiratí de la manera en que lo haría un hablante nativo: el vocabulario, el tono y el contexto cultural que lo acompaña.
Construido sobre Falcon-H1-Arabic
No comenzamos desde cero. Falcon-Emirati-7B está construido sobre Falcon-H1-Arabic, nuestra familia de modelos en árabe que ya estableció nuevos estándares para el idioma este año. Falcon-H1-Arabic utiliza la arquitectura híbrida Falcon-H1: Modelos de Espacio de Estado (Mamba) y atención Transformer que operan en paralelo dentro de cada bloque, con sus salidas fusionadas antes de la proyección de cada bloque. Esa combinación proporciona la eficiencia de tiempo lineal de Mamba en secuencias largas, manteniendo al mismo tiempo la precisión de atención para las dependencias de largo alcance, lo cual es importante para un idioma morfológicamente rico como el árabe. La familia abarca tres escalas (3B, 7B y 34B de parámetros), con ventanas de contexto de hasta 128K y 256K tokens, y ya se ha entrenado con una amplia mezcla de MSA y árabe dialectal (Golfo, Levante, Egipto, Magreb) junto con datos en inglés y multilingües.
Eso nos dio un punto de partida sólido: un modelo que ya comprende ampliamente el árabe, maneja bien contextos largos y tiene cierta exposición a dialectos. Falcon-Emirati-7B utiliza esa base y la dirige específicamente hacia el dialecto emiratí, el vocabulario, la gramática y el conocimiento cultural que un modelo de árabe general, por muy capaz que sea, no adquiere por sí mismo.
Construimos Falcon-Emirati-7B específicamente basándonos en la variante 7B. Es el punto óptimo dentro de la familia: lo suficientemente grande como para tener en cuenta las necesidades de adaptación dialectal, pero lo suficientemente pequeño como para que tanto el entrenamiento como la inferencia sean prácticos. El modelo 34B probablemente llevaría la calidad un poco más lejos, pero con un costo de entrenamiento y servicio que no tiene sentido para un modelo de chat especializado en dialectos, y el modelo 3B no deja suficiente espacio para la profundidad de la comprensión cultural y lingüística que queríamos lograr. 7B nos proporcionó la mejor equilibración entre calidad y costos de entrenamiento e inferencia.
Por qué la adaptación del dialecto es difícil
Convertir un modelo árabe general en un especialista en dialecto emiratí suena como una tarea más pequeña que construir el modelo básico en primer lugar. Pero no es así. Algunas cosas lo hacen realmente difícil:
- El emiratí es principalmente un dialecto hablado. Aparece mucho menos en los textos en línea que el MSA, o incluso otros dialectos del Golfo y el Levante, por lo que simplemente no hay tanto texto bruto para aprender.
- El significado a menudo no es literal. Los modismos, los proverbios y las referencias poéticas se basan en un contexto cultural común, no en el vocabulario superficial.
- No existe un manual establecido. No existe una receta bien documentada sobre cuánta información dialectal es suficiente, cómo mezclarla con MSA y árabe general, o qué etapa de entrenamiento (preentrenamiento continuo, SFT o optimización de preferencias) es más importante para adquirir un dialecto.
Ese último punto determinó cómo trabajamos. Mucho de la construcción de Falcon-Emirati-7B se basó en pruebas y errores: probar diferentes mezclas de datos, etapas de entrenamiento y estrategias de supervisión, y utilizar tanto el juicio humano como las puntuaciones de referencia para averiguar qué realmente funcionaba.
Nuestro Enfoque hacia los Datos
Construimos un pipeline de datos dedicado para Emiratos Árabes sobre la etapa de preentrenamiento de Falcon-H1-Arabic, basándonos en tres fuentes complementarias.
1. Datos web en dialecto emiratí auténtico
Rastreamos y seleccionamos contenido de sitios web y foros emiratíes escritos originalmente en el dialecto, sin ser traducidos o transcritos desde el árabe standard. Es aquí donde obtuvimos la verdad fundamental: cómo los emiratíes realmente escriben y hablan en línea, las expresiones cotidianas, las expresiones coloquiales y el diálogo natural entre emiratíes y personas que hablan árabe standard que se observa en su uso real.
2. Datos MSA sobre la cultura y la identidad emiratíes
Junto con el texto en dialecto, hemos incluido material en lengua MSA específicamente sobre la cultura, el patrimonio y el idioma emiratí: artículos y referencias sobre costumbres locales, valores, historia y normas sociales, incluyendo cómo son percibidos y estereotipados los emiratíes. Esto no enseña al modelo a escribir en dialecto, pero le enseña qué habla cuando surgen temas relacionados con los emiratíes, como el patrimonio, la etiqueta y el contexto que solo un hablante nativo conoce.
3. Datos sintéticos, guiados por glosarios y reglas de estilo
El texto dialectal auténtico por sí solo no era suficiente para abarcar el rango de temas que un modelo de chat necesita manejar día a día. Por lo tanto, generamos una gran cantidad de datos sintéticos en dialecto emiratí para llenar las lagunas. No dejamos que un modelo de generador improvisara en árabe “de Golfo”. Lo restringimos con reglas estrictas y glosarios y diccionarios construidos específicamente para el vocabulario y la gramática emiratí. Esas barreras impidieron que la diferencia existiera entre el resultado sintético que se lee como auténtico emiratí y el resultado que, aunque gramaticalmente correcto, suena extraño para quienes realmente hablan el dialecto.
Encontrar la Receta de Adaptación Correcta
Dado que no existe una receta estándar para la adaptación del MSA al dialecto, tratamos la estrategia de entrenamiento en sí como algo que hay que descubrir experimentalmente. Realizamos ablaciones para determinar cuánta información dialectal se debe inyectar y en qué etapa del entrenamiento, cómo equilibrar los datos auténticos obtenidos mediante crawling con los datos sintéticos, sin que el modelo se sobreajuste a los patrones sintéticos, y cuánto contexto cultural de MSA realmente es necesario para mantenerlo culturalmente fundamentado, en lugar de ser simplemente fluido en la superficie. En cada paso, nos basamos en una combinación de evaluaciones automáticas y revisiones realizadas por hablantes nativos, ya que las métricas automáticas por sí solas no capturan adecuadamente la naturalidad, el tono o la adaptación cultural, para poder confiar en ellas por sí solas.
Metodología de Evaluación
Se rastreó el progreso durante el entrenamiento con dos enfoques complementarios:
Evaluación Manual por Hablantes Nativos
Los hablantes nativos de Emirato revisaron directamente los resultados del modelo, juzgando no solo si la respuesta era correcta, sino también si sonaba adecuada: naturalidad, tono y adecuación cultural. Estas son cosas que un puntaje de referencia no puede indicar, pero que un oído nativo percibe de inmediato.
Evaluación Automática en Alyah
Para el seguimiento cuantitativo, utilizamos Alyah (الياه, “Estrella del Norte”), un benchmark que nosotros y la comunidad lanzamos específicamente para evaluar la capacidad de los LLMs en árabe con dialecto emiratí. Alyah es un benchmark de opción múltiple completamente nativo de 1,173 muestras, recopilado manualmente de hablantes nativos de emiratí y que abarca categorías desde saludos cotidianos y etiqueta hasta lenguaje figurativo, conocimientos sobre la herencia cultural y poesía emiratí: son las categorías en las que el dialecto y la cultura son los más importantes y donde los modelos genéricos de árabe tienden a tener dificultades. Los detalles completos sobre la construcción de Alyah y la distribución de sus categorías se encuentran en nuestro artículo del blog sobre el benchmark, y los antecedentes sobre la familia de modelos base se encuentran en el anuncio de Falcon-H1-Arabic.
Resultados
Falcon-Emirati-7B obtiene 84.83% en Alyah, por delante de todos los otros modelos árabes y multilingües con los que se comparó, incluyendo varios modelos que son muchas veces más grandes que él. El gráfico a continuación muestra su posición junto con un conjunto representativo de modelos líderes entrenados con instrucciones en la clasificación de Alyah.
Precisión de Alyah (%), modelos ajustados con instrucciones. Los modelos de la familia Falcon-H1-Arabic no se incluyen en esta comparación, ya que Falcon-Emirati-7B está construido sobre ellos.
Lo que los resultados nos dicen
Algunas cosas resaltan de esta comparación. La única medida de tamaño no te garantiza competencia en dialectos. Algunos de los modelos multilingües más grandes obtienen puntajes muy inferiores que los más pequeños, que tienen más conocimiento de los dialectos, lo que indica que la habilidad en emiratí debe ser entrenada intencionadamente, y no adquirida como efecto secundario del tamaño. Los modelos que funcionan mejor también tienden a ser nativos del árabe o enfocados en el árabe desde el principio, lo cual coincide con lo que observamos durante nuestras propias investigaciones: la cobertura general del árabe y de los dialectos es un punto de partida necesario, pero todavía se requiere trabajo específico para cada dialecto para cerrar el resto de la brecha, especialmente en las partes más difíciles de Alyah, como la poesía, el conocimiento del patrimonio y la categoría de lengua y dialecto en sí.
Esto también coincide con lo que se obtuvo en la publicación del benchmark Alyah en general: incluso los modelos robustos muestran una degradación real una vez que se pasa a contenido verdaderamente dialectal y culturalmente arraigado. Esa brecha no se cierra por sí sola con modelos más grandes. Se necesitan datos y evaluaciones diseñados específicamente para el dialecto.
Más allá de las opciones múltiples: Evaluación de LLM como juez
La precisión de los seleccionados múltiples indica si un modelo puede reconocer la respuesta correcta entre cuatro opciones. No indica si el modelo producirá en árabe emiratí por sí mismo cuando alguien le hable. Así, junto con Alyah, realizamos una segunda evaluación: generación abierta en las mismas 1,173 preguntas de Alyah, calificada por un juez LLM (Gemini 3.7 Flash) frente a cinco modelos: Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat y Fanar-2-27B-Instruct, que fueron seleccionados como los modelos más fuertes en la tabla de liderazgo de Alyah.
El juez calificó cada respuesta en dos dimensiones separadas: si el contenido era correcto y, de forma independiente, si la respuesta realmente se daba en dialecto emiratí en lugar de en MSA. Informamos tanto de una puntuación parcial (la evaluación calificada del juez) como de una versión más estricta de aprobado/rechazado, además de cuán frecuente era que cada modelo se abstuviera en lugar de responder.
El LLM evaluó la corrección en 1,173 preguntas de Alyah, generación abierta, Gemini 3.7 como juez.
El LLM evaluó la fidelidad del dialecto en las mismas preguntas: ¿la respuesta realmente se emite en árabe emiratí, o el modelo opta por el MSA por defecto?
Falcon-Emirati-7B lidera en corrección, pero la verdadera diferencia está en el segundo gráfico. En términos de fidelidad al dialecto, Falcon-Emirati-7B obtiene 0.52 (crédito parcial) frente a 0.05 para ALLaM, 0.03 para gemma-3-27b-it, 0.02 para Jais-2-8B-Chat y efectivamente 0.00 para Fanar-2-27B-Instruct. Eso no es una ventaja pequeña; es casi dos órdenes de magnitud en el extremo inferior. En la práctica, esto significa que los otros modelos a menudo conocen la respuesta correcta, pero la dicen en árabe estándar moderno por defecto, incluso cuando se les pregunta directamente en emiratí. Falcon-Emirati-7B es el único de los cinco que responde de manera fiable en el dialecto en el que se le preguntó.
Fanar-2-27B-Instruct también destaca por un segundo motivo: se abstiene mucho más que cualquier otro modelo, rechazando responder en el 26.2% de los casos, en comparación con menos del 5% para todos los demás modelos en la comparación. Unido al puntaje de precisión de 0.27 (crédito parcial), el más bajo de los cinco, sugiere que es un modelo que es tanto menos dispuesto como menos capaz de interactuar con el contenido específico de Emiratí, en lugar de uno que simplemente responde de forma incorrecta.
Fidelidad al dialecto según la categoría de Alyah, crédito parcial. El Falcon-Emirati-7B es el único modelo que cambia consistentemente a Emirati; los demás permanecen en MSA en casi todas las categorías.
Descomponer la fidelidad del dialecto según las categorías hace que el patrón sea aún más claro. Se mantiene en todas y cada una de las categorías de Alyah, desde saludos cotidianos hasta poesía, lo que sugiere que no se trata de un truco limitado aprendido para unos pocos tipos de preguntas. Es un cambio general en el registro al que el modelo se ajusta por defecto cuando se espera que el idioma sea emiratí. El único lugar donde los modelos competitivos son relativamente mejores, Greetings & Daily Expressions, es también la categoría en la que Emirati y MSA se superponen más, por lo que es el lugar más fácil para un modelo de árabe genérico sonar correctamente por accidente.
Comparación Paralela, Categoría por Categoría
Como tercera perspectiva sobre la misma pregunta, realizamos juicios en parejas cara a cara: para cada pregunta de Alyah, al juez (Gemini 3.7 Flash) se mostraba la respuesta de Falcon-Emirati-7B junto a la respuesta de un modelo competidor, sin conocer cuál era mejor, y se le pedía que eligiera el más adecuado. Los gráficos de radar a continuación muestran la tasa de victorias resultante por categoría frente a tres modelos competidores: Jais-2-8B-Chat, ALLaM-7B-Instruct-preview y Fanar-2-27B-Instruct.
Tasa de victorias entre pares por categoría: Falcon-Emirati-7B contra Jais-2-8B-Chat, ALLaM-7B-Instruct-preview y Fanar-2-27B-Instruct fueron evaluadas cara a cara por Gemini 3.7.
Falcon-Emirati-7B gana la mayoría de las categorías contra los tres competidores, y con una diferencia amplia en las categorías que dependen principalmente del dialecto y la fluidez cultural. Contra Jais-2-8B-Chat, la brecha es más grande en Poesía y Expresión Creativa (0.69 contra 0.31) y Lenguaje y Dialecto (0.62 contra 0.38). Contra ALLaM-7B-Instruct-preview, las mismas dos categorías muestran las diferencias más amplias: Poesía y Expresión Creativa (0.66 contra 0.34) y Lenguaje y Dialecto (0.58 contra 0.42). Contra Fanar-2-27B-Instruct, los márgenes son los más amplios de todas las tres confrontaciones, y Falcon-Emirati-7B gana en cada categoría, alcanzando el pico en Poesía y Expresión Creativa (0.88 contra 0.12) y Sensibilidad Religiosa y Social (0.80 contra 0.20).
La única categoría en la que los modelos competidores se mantienen a la altura es las Saludos y Expresiones Diarias: Falcon-Emirati-7B pierde por poco frente a Jais-2-8B-Chat (0.46 contra 0.54), y empatiza con ALLaM-7B-Instruct-preview en 0.50, aunque sigue ganando claramente frente a Fanar-2-27B-Instruct (0.70 contra 0.30). Eso es en general consistente con lo que vimos en el desglose de fidelidad al dialecto anterior. Las salutas son la categoría en la que Emirati y MSA se superponen más, por lo que es el lugar más fácil para un modelo de árabe genérico sonar nativo, incluso sin entrenamiento especializado en dialectos. En todos los casos donde el dialecto es más distintivo, como la poesía, el lenguaje figurado y el conocimiento del patrimonio, la ventaja de Falcon-Emirati-7B se mantiene claramente frente a todos los modelos competidores contra los que lo hemos probado.
Comprensión de la cultura emiratí
El lenguaje también se refiere a la comprensión de la cultura detrás de una conversación. Evaluamos Falcon-Emirati-7B en la sección de los Emiratos Árabes Unidos de ArabCulture-Dialogue, un benchmark para la comprensión cultural en árabe. En su tarea de selección múltiple, los modelos eligen la respuesta más apropiada desde el punto de vista cultural entre tres opciones. Lea más en el artículo de investigación.
Probamos todos los cuatro modelos en los mismos 283 escenarios de UAE, tanto en árabe emiratí como en árabe estándar moderno, con diferentes cantidades de información sobre ubicación.
La precisión general en la tarea de selección múltiple de los Emiratos Árabes Unidos, promedio entre ambas variedades lingüísticas y todas las configuraciones de ubicación. Estos son nuestros resultados de evaluación.
Falcon-Emirati-7B obtuvo un 85.57%, el más alto entre los cuatro modelos probados, por delante de ALLaM-7B (83.39%), Jais-2-8B (73.79%) y Fanar-2-27B (71.50%). Estos resultados destacan su capacidad para reconocer respuestas culturalmente adecuadas en las conversaciones emiratíes.
Verlo en acción
Solo los números narran una parte de la historia, por lo que a continuación se presenta una comparación en tiempo real e interactiva: cinco prompts reales de Emirato, ejecutados uno al lado del otro con Falcon-Emirati-7B junto con Fanar-2-27B-Instruct y ALLaM-7B-Instruct-preview. Desliza o utiliza las flechas para moverte entre los prompts, y expande cualquier respuesta para leerla completa.
Comparación interactiva: Falcon-Emirati-7B vs. Fanar-2-27B-Instruct vs. ALLaM-7B-Instruct-preview en cinco prompts emiratíes, que abarcan saludos de Eid, historia local, poesía y conocimientos sobre el patrimonio. Las salidas se muestran como generadas y pueden contener errores; los destacados identifican nuestro modelo, no una calificación factual.
Prueba Falcon-Emirati-7B
Falcon-Emirati-7B está disponible en nuestra plataforma de chat. 🚀 Prueba ahora: https://chat.falconllm.tii.ae/?model=Falcon-Emirati-7B
IA responsable y limitaciones
Como cualquier modelo de lenguaje, Falcon-Emirati-7B puede reflejar sesgos en sus datos de entrenamiento y a veces comete errores, especialmente con expresiones raras, referencias altamente locales o casos extremos para los cuales no tenemos muchos datos. Los dialectos y las sutilezas culturales son subjetivos, y incluso los hablantes nativos no siempre estarán de acuerdo sobre la respuesta “correcta”. Recomendaríamos evaluar el modelo para su caso de uso específico antes de depender de él en cualquier cosa sensible, oficial o de alto riesgo, y realmente agradeceríamos los comentarios de la comunidad emiratí para ayudarnos a mejorar tanto el modelo como Alyah en el futuro.
>Agradecimientos
Queríamos extender nuestro sincero agradecimiento a Mikhail Lubinets y Matthieu Berjon por su continuo apoyo en la infraestructura de computación, y a Jatin Mittal por su ayuda en hacer que el modelo sea accesible a través de la aplicación Falcon Chat.
Cita
@misc{falcon_emirati_7b_2026,
title = {Falcon-Emirati-7B: A Dialect-Specialized Arabic LLM for the Emirati Dialect},
author = {Shaikha Alsuwaidi, Omar Alkaabi, Maitha Alhammadi, Hamza Alobeidli, Ahmed Alzubaidi, Mohammed Alyafeai, Leen AlQadi, Basma Boussaha, Hakim Hacid},
organization = {Technology Innovation Institute},
year = {2026}
}







