Nuevas investigaciones muestran cómo la IA puede mejorar su propio desempeño automáticamente

El entrenamiento de modelos de inteligencia artificial (IA) utilizando otros modelos de IA se ha convertido en un objetivo popular entre los neolabs. Recientemente, un investigador del programa de becarios de Anthropic nos ha brindado una visión temprana de cómo podría funcionar en la práctica.

El viernes, Anthropic publicó un nuevo artículo titulado “Automated Researchers Can Reliably Mitigate Alignment Failures”, en el que se detalla cómo los sistemas de IA pueden mejorar de manera confiable el rendimiento de un modelo en un conjunto de métricas de alineación. Al evaluar 10 métricas para comportamientos desalineados, los sistemas automatizados lograron mejorar el desempeño en cada una de ellas sin afectar el rendimiento general.

Dirigido por el becario de Anthropic, Chen Yueh-Han, el sistema replica gran parte del enfoque tradicional de investigación. Cada sistema automatizado busca en la literatura disponible, propone un método y entrena el modelo utilizando ese método durante 30 minutos, aumentando gradualmente la métrica a lo largo de varias iteraciones. Los métodos efectivos son preservados mientras que los ineficaces son descartados, lo que permite que el sistema opere de manera rápida y a gran escala.

Avances en la mejora automática de alineación

“En general, estos resultados proporcionan evidencia temprana de que la alineación automatizada post-entrenamiento podría hacerse práctica en el corto plazo”, se menciona en el artículo.

Este trabajo representa un paso hacia la auto-mejora recursiva, vista por muchos como el siguiente paso significativo en el progreso de la IA. Si los modelos pueden mejorar su propio entrenamiento de alineación, es plausible que puedan optimizar prácticas de entrenamiento más amplias, lo que podría llevar a la obsolescencia de los investigadores humanos en IA.

El artículo aborda esta idea, comparando explícitamente al Investigador de Alineación Automatizada (AAR) con su equivalente humano. “El mejor método de AAR supera lo que proponen los humanos con experiencia, en promedio, dentro de las seis horas”, se indica en el artículo. “Las direcciones de investigación guiadas por humanos no conducen a un rendimiento más fuerte.”

Costos y limitaciones del enfoque automatizado

Además, se presenta una comparación de costos. “Un AAR cuesta aproximadamente $4 por hora en inferencia de API, en contraste con los $150 por hora que pagamos a nuestros investigadores humanos.”

A pesar de esto, el artículo también señala algunas limitaciones de este enfoque. El sistema automatizado solo es efectivo en la medida en que las métricas reflejen los objetivos de alineación reales. Además, hay un trabajo considerable por hacer en el establecimiento y mantenimiento de esas métricas, así como en la expansión de la literatura de la que se nutren los investigadores automatizados.

Cuando compras a través de los enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.

Ilustración de un hombre mayor con auriculares y chaqueta