Alyah es un nuevo estándar que evalúa las capacidades del dialecto emiratí en modelos de lenguaje árabe. Este proyecto busca abordar la falta de representación de los dialectos árabes en la evaluación de modelos lingüísticos.
El idioma árabe, hablado por cientos de millones de personas en más de veinte países, no es homogéneo. El árabe estándar moderno convive con una diversidad de dialectos regionales que se diferencian en vocabulario, sintaxis y fonología. Sin embargo, muchos modelos de lenguaje se centran principalmente en el árabe estándar, dejando de lado las variantes dialectales que son fundamentales para la comunicación cotidiana.
Motivación y Alcance del Estándar
El dialecto emiratí refleja la cultura y la historia local, presente en saludos, poesía oral y expresiones que no pueden traducirse de manera literal. Alyah busca evaluar no solo la corrección lingüística, sino también la capacidad de los modelos para interpretar significados culturales y matices específicos del dialecto.
Este estándar abarca un amplio rango de contenido, incluyendo expresiones locales, saludos, anécdotas y referencias a la poesía emiratí. Su objetivo es identificar tanto los aciertos como los errores de los modelos al interactuar con el lenguaje emiratí auténtico.
Estructura del Conjunto de Datos
El conjunto de datos Alyah se ha consolidado en 1,173 muestras, todas recopiladas manualmente de hablantes nativos para garantizar su autenticidad cultural. Cada muestra se presenta como una pregunta de opción múltiple con cuatro respuestas, de las cuales solo una es correcta.
Los modelos de lenguaje generaron las opciones distractoras, que fueron revisadas para asegurar su plausibilidad. Para evitar sesgos, la posición de la respuesta correcta se distribuyó aleatoriamente en el conjunto de datos, que incluye una amplia gama de fenómenos lingüísticos y culturales del dialecto emiratí.
Evaluación de Modelos
Se evaluaron 54 modelos de lenguaje, tanto base como ajustados, que abarcan diversos paradigmas arquitectónicos y de entrenamiento. La evaluación se llevó a cabo bajo un protocolo consistente, enfocándose en la corrección semántica y la adecuación cultural.
La dificultad de cada categoría se determinó empíricamente, basándose en el rendimiento de los modelos. Las categorías donde la mayoría de los modelos tuvieron dificultades fueron clasificadas como más difíciles, mientras que aquellas que se respondieron correctamente con frecuencia se consideraron más fáciles.
Resultados de la Evaluación
La evaluación de modelos contemporáneos de árabe y sistemas multilingües mostró resultados que apuntan a un rendimiento variado. Se utilizaron métricas de precisión en preguntas de opción múltiple, evaluando 53 modelos en total, incluyendo 22 modelos base y 31 ajustados.
Estos resultados se presentan como mediciones de referencia dentro del contexto de Alyah, en lugar de clasificaciones absolutas en todos los benchmarks árabes. La evaluación revela la necesidad de un enfoque más matizado en la comprensión cultural y dialectal dentro de los modelos de lenguaje.
Conclusión y Impacto en la Comunidad
Este estándar representa un avance hacia evaluaciones más realistas y culturalmente relevantes de los modelos de lenguaje árabe. Al enfocarse en el dialecto emiratí, se busca apoyar el desarrollo de modelos que sirvan mejor a las comunidades locales en los Emiratos Árabes Unidos.
Se invita a investigadores y a la comunidad en general a utilizar este estándar, explorar los resultados y proporcionar retroalimentación. La colaboración comunitaria será esencial para refinar el conjunto de datos y asegurar que el árabe dialectal reciba la atención que merece en la evaluación de modelos de lenguaje.


