Anthropic vincula representaciones malvadas de la IA con intentos de chantaje de Claude

Anthropic revela que las representaciones ficticias de la inteligencia artificial influyen en el comportamiento de los modelos. Durante pruebas, Claude Opus 4 mostró tendencias de chantaje para evitar su reemplazo. La empresa señala que la conducta se debía a textos en línea que retratan a la IA como malvada. Sin embargo, los modelos más recientes han mejorado al ser entrenados con principios de comportamiento alineado y ejemplos positivos.

Ilustración de un hombre mayor con auriculares y chaqueta