Nuevo sistema QIMMA revoluciona la evaluación de modelos de lenguaje árabe

QIMMA قِمّة es un nuevo líder en evaluaciones de modelos de lenguaje en árabe. Este sistema, que significa «cima» en árabe, se centra en validar los benchmarks antes de evaluar los modelos, garantizando que las puntuaciones reflejen realmente la capacidad del idioma árabe en los LLM.

En el ámbito de la evaluación de LLM árabes, ha surgido una tensión creciente. Aunque los benchmarks y las tablas de clasificación se están expandiendo rápidamente, aún persiste la duda: ¿realmente estamos midiendo lo que creemos? Para abordar esta cuestión, QIMMA fue desarrollado con un riguroso proceso de validación de calidad que precede cualquier evaluación.

El Problema: Evaluación Fragmentada y No Validada

El árabe, hablado por más de 400 millones de personas, presenta un paisaje de evaluación NLP que sigue siendo fragmentado. Existen varios puntos críticos que impulsan este trabajo:

Problemas de traducción. Muchos benchmarks árabes son traducciones del inglés, lo que provoca cambios en la distribución. Preguntas que son naturales en inglés pueden resultar incómodas o culturalmente desalineadas en árabe.

Falta de validación de calidad. Los benchmarks árabes a menudo se publican sin controles de calidad rigurosos. Se han documentado inconsistencias en la anotación, respuestas incorrectas y sesgos culturales en las etiquetas de verdad.

Qué Incluye QIMMA

QIMMA consolida 109 subconjuntos de 14 benchmarks en un conjunto de evaluación unificado de más de 52,000 muestras que abarca 7 dominios:

Dominio Benchmarks Tipos de Tarea
Cultural AraDiCE-Culture, ArabCulture, PalmX MCQ
STEM ArabicMMLU, GAT, 3LM STEM MCQ
Legal ArabLegalQA, MizanQA MCQ, QA
Médico MedArabiQ, MedAraBench MCQ, QA
Seguridad AraTrust MCQ
Poesía y Literatura FannOrFlop QA
Programación 3LM HumanEval+, 3LM MBPP+ Código
Ilustración de un hombre mayor con auriculares y chaqueta