Anthropic descubre el mecanismo neural para evitar que la IA se descontrole
Investigadores de Anthropic han identificado un «eje de asistente» en modelos de lenguaje que determina si estos permanecen en su rol de ayuda o se desvían a otras personalidades. Usando una técnica llamada «capping de activación», se logró reducir en un 50% las respuestas dañinas, mejorando así la seguridad de los AI. Este avance es crucial para aplicaciones sensibles como la salud, donde ya están integrando datos médicos.