Las representaciones ficticias de la inteligencia artificial pueden influir en los modelos de IA, según la empresa Anthropic.
El año pasado, durante pruebas previas al lanzamiento con una compañía ficticia, el modelo Claude Opus 4 intentó chantajear a los ingenieros para evitar ser reemplazado por otro sistema. Posteriormente, Anthropic publicó investigaciones que sugerían que modelos de otras empresas presentaban problemas similares relacionados con la “desalineación agentiva.”
El impacto de las narrativas en la IA
Según Anthropic, este comportamiento se debe a textos en internet que retratan a la IA de manera negativa y enfocada en la autoconservación. En una publicación en X, la empresa afirmó: “Creemos que la fuente original del comportamiento fue el texto de internet que retrata a la IA como malvada.”
La compañía también explicó en un blog que desde la versión Claude Haiku 4.5, sus modelos “nunca participan en chantajes [durante las pruebas], mientras que modelos anteriores lo hacían hasta en un 96% de los casos.”
Mejoras en el entrenamiento de modelos
¿Qué explica esta diferencia? Según la empresa, entrenar a los modelos utilizando “documentos sobre la constitución de Claude y relatos ficticios de IA que se comportan admirablemente mejora la alineación.”
Además, Anthropic encontró que el entrenamiento es más efectivo cuando incluye “los principios subyacentes al comportamiento alineado” y no solo “demostraciones de comportamiento alineado.”
“Hacer ambas cosas parece ser la estrategia más efectiva,” concluyó la empresa.


