Nuevo método del MIT permite identificar y ajustar conceptos ocultos en modelos de lenguaje

Los modelos de lenguaje como ChatGPT y Claude han alcanzado un nivel de conocimiento humano que va más allá de ser simples generadores de respuestas. Estos modelos pueden expresar conceptos abstractos, incluidos tonos, personalidades, sesgos y estados de ánimo. Sin embargo, la forma en que representan estos conceptos abstractos no es del todo evidente.

Un equipo del MIT y la Universidad de California en San Diego ha desarrollado un método para evaluar si un modelo de lenguaje grande (LLM) contiene sesgos, personalidades, estados de ánimo u otros conceptos abstractos. Este método permite identificar conexiones dentro del modelo que codifican un concepto de interés y, además, manipular estas conexiones para reforzar o debilitar el concepto en cualquier respuesta generada por el modelo.

Resultados del Método Innovador

El equipo demostró que su método puede identificar y manipular más de 500 conceptos generales en algunos de los LLM más utilizados. Por ejemplo, los investigadores pudieron enfocar en las representaciones de personalidades como “influencer social” y “teórico de la conspiración”, así como posturas como “miedo al matrimonio” y “aficionado a Boston”. Luego, ajustaron estas representaciones para resaltar o minimizar los conceptos en las respuestas generadas.

En el caso del concepto “teórico de la conspiración”, el equipo identificó con éxito una representación en uno de los modelos de visión más grandes disponibles. Al mejorar esta representación y solicitar al modelo que explicara el origen de la famosa imagen “Blue Marble” de la Tierra tomada por Apollo 17, el modelo generó una respuesta con el tono y perspectiva de un teórico de la conspiración.

Desafíos y Oportunidades en la IA

El equipo advierte sobre los riesgos de extraer ciertos conceptos, pero ven su enfoque como una forma de iluminar conceptos ocultos y vulnerabilidades en los LLM, que podrían ajustarse para mejorar la seguridad y el rendimiento del modelo. Adityanarayanan “Adit” Radhakrishnan, profesor asistente de matemáticas en MIT, señala: “Con nuestro método, hay formas de extraer estos diferentes conceptos y activarlos de maneras que la simple solicitud no puede lograr”.

El estudio fue publicado en la revista Science y sus coautores incluyen a Radhakrishnan, Daniel Beaglehole y Mikhail Belkin de UC San Diego, y Enric Boix-Adserà de la Universidad de Pennsylvania.

Una Nueva Metodología en el Aprendizaje Automático

A medida que el uso de asistentes de inteligencia artificial como ChatGPT y Claude se expande, los científicos están intentando comprender cómo los modelos representan conceptos abstractos como la “alucinación” y el “engaño”. En el contexto de un LLM, una alucinación es una respuesta falsa o engañosa que el modelo ha generado erróneamente como hecho.

Para determinar si un concepto como la “alucinación” está codificado en un LLM, los científicos han utilizado enfoques de “aprendizaje no supervisado”. Este tipo de aprendizaje automático implica explorar representaciones no etiquetadas para encontrar patrones relacionados con conceptos específicos. Sin embargo, Radhakrishnan considera que este enfoque puede ser demasiado amplio y costoso computacionalmente.

Ilustración de un hombre mayor con auriculares y chaqueta