Nuevo método del MIT permite identificar y ajustar conceptos ocultos en modelos de lenguaje

Un equipo de MIT y UC San Diego ha desarrollado un método para detectar y manipular conceptos abstractos, como sesgos y personalidades, en modelos de lenguaje extensos. Esta técnica permite identificar representaciones ocultas de más de 500 conceptos y ajustarlas, mejorando la seguridad y rendimiento de los modelos. La investigación, publicada en la revista Science, busca iluminar vulnerabilidades y potenciar características específicas en los LLM.

Ilustración de un hombre mayor con auriculares y chaqueta