QIMMA قِمّة es un nuevo líder en evaluaciones de modelos de lenguaje en árabe. Este sistema, que significa «cima» en árabe, se centra en validar los benchmarks antes de evaluar los modelos, garantizando que las puntuaciones reflejen realmente la capacidad del idioma árabe en los LLM.
En el ámbito de la evaluación de LLM árabes, ha surgido una tensión creciente. Aunque los benchmarks y las tablas de clasificación se están expandiendo rápidamente, aún persiste la duda: ¿realmente estamos midiendo lo que creemos? Para abordar esta cuestión, QIMMA fue desarrollado con un riguroso proceso de validación de calidad que precede cualquier evaluación.
El Problema: Evaluación Fragmentada y No Validada
El árabe, hablado por más de 400 millones de personas, presenta un paisaje de evaluación NLP que sigue siendo fragmentado. Existen varios puntos críticos que impulsan este trabajo:
Problemas de traducción. Muchos benchmarks árabes son traducciones del inglés, lo que provoca cambios en la distribución. Preguntas que son naturales en inglés pueden resultar incómodas o culturalmente desalineadas en árabe.
Falta de validación de calidad. Los benchmarks árabes a menudo se publican sin controles de calidad rigurosos. Se han documentado inconsistencias en la anotación, respuestas incorrectas y sesgos culturales en las etiquetas de verdad.
Qué Incluye QIMMA
QIMMA consolida 109 subconjuntos de 14 benchmarks en un conjunto de evaluación unificado de más de 52,000 muestras que abarca 7 dominios:
| Dominio | Benchmarks | Tipos de Tarea |
|---|---|---|
| Cultural | AraDiCE-Culture, ArabCulture, PalmX | MCQ |
| STEM | ArabicMMLU, GAT, 3LM STEM | MCQ |
| Legal | ArabLegalQA, MizanQA | MCQ, QA |
| Médico | MedArabiQ, MedAraBench | MCQ, QA |
| Seguridad | AraTrust | MCQ |
| Poesía y Literatura | FannOrFlop | QA |
| Programación | 3LM HumanEval+, 3LM MBPP+ | Código |


