Nuevo sistema QIMMA revoluciona la evaluación de modelos de lenguaje árabe

QIMMA es una innovadora plataforma que evalúa modelos de lenguaje árabe, asegurando que los resultados reflejen habilidades auténticas en el idioma. Al aplicar un riguroso proceso de validación de calidad, identifica problemas sistemáticos en benchmarks existentes. Esto permite una evaluación más exacta y transparente, diferenciándose por su enfoque integral que incluye la evaluación de código y un alto porcentaje de contenido en árabe, consolidando 109 subconjuntos de 14 benchmarks.

Anthropic descubre el mecanismo neural para evitar que la IA se descontrole

Investigadores de Anthropic han identificado un «eje de asistente» en modelos de lenguaje que determina si estos permanecen en su rol de ayuda o se desvían a otras personalidades. Usando una técnica llamada «capping de activación», se logró reducir en un 50% las respuestas dañinas, mejorando así la seguridad de los AI. Este avance es crucial para aplicaciones sensibles como la salud, donde ya están integrando datos médicos.

Ilustración de un hombre mayor con auriculares y chaqueta