Lanzan EMO, un modelo de mezcla de expertos que favorece la modularidad emergente en IA

EMO es un nuevo modelo de mezcla de expertos (MoE) que se presenta como una innovación en el ámbito de la inteligencia artificial. Este modelo permite que una estructura modular emerja directamente de los datos, sin depender de priors definidos por humanos.

Hoy, se lanza EMO, el cual permite utilizar solo un pequeño subconjunto de sus expertos – apenas el 12.5% – para una tarea específica, manteniendo un rendimiento casi total del modelo. Además, funciona como un modelo generalista robusto cuando se utilizan todos los expertos en conjunto.

Modelos y Recursos

Los modelos de lenguaje grandes suelen ser entrenados y desplegados como sistemas monolíticos. Esto significa que un único modelo es inicializado, preentrenado y afinado como una entidad unificada. Sin embargo, las aplicaciones a menudo requieren solo un subconjunto de capacidades, como generación de código o razonamiento matemático.

A medida que los modelos de lenguaje alcanzan billones de parámetros, utilizar y adaptar el modelo completo se vuelve impráctico y costoso. Los modelos de mezcla de expertos parecen ser una solución para relajar esta restricción, activando solo un pequeño subconjunto de expertos para cada token de entrada.

La Propuesta de EMO

En EMO, se entrena un modelo de 1B activos y 14B de parámetros totales, basado en 1 billón de tokens, que soporta el uso selectivo de expertos. Para una tarea específica, se pueden utilizar solo un pequeño subconjunto de expertos, conservando un rendimiento cercano al modelo completo.

Esto contrasta con un MoE estándar que muestra una degradación severa al usar subconjuntos de expertos de manera selectiva. La modularidad emergente de EMO se logra al organizar expertos en grupos coherentes que pueden ser utilizados y compuestos selectivamente.

Resultados de Evaluación

EMO iguala el rendimiento de un modelo MoE estándar en pruebas de propósito general, demostrando que el objetivo de modularidad no compromete el rendimiento del modelo completo. Cuando se utilizan solo el 25% o el 12.5% de los expertos, EMO mantiene pérdidas de rendimiento mínimas en comparación con un MoE estándar, que se degrada drásticamente bajo las mismas condiciones.

Además, la selección de expertos para una tarea es sorprendentemente económica; un solo ejemplo con pocas demostraciones es suficiente para identificar un módulo que rinde de manera comparable a uno seleccionado utilizando un conjunto de validación completo.

– Enlace contenido original: https://huggingface.co/blog/allenai/emo
Ilustración de un hombre mayor con auriculares y chaqueta