Anthropic descubre el mecanismo neural para evitar que la IA se descontrole

Anthropic ha mapeado el interruptor neural que evita que la IA se desvíe de su propósito original.

Este descubrimiento es crucial en el desarrollo de modelos de lenguaje seguro y confiable.

Investigación de Anthropic sobre la IA

La investigación reciente de Anthropic ha identificado el Assistant Axis, una dimensión neural que determina si los modelos de lenguaje se mantienen en su rol de asistencia o se desvían hacia otras personalidades. Al analizar las activaciones internas de Gemma 2, Qwen 3 y Llama 3.3, se ha mapeado un espacio de 275 roles de personalidad.

El alejamiento del eje asistente ha aumentado el éxito de los jailbreak, la reafirmación de delirios y la promoción de autolesiones. Una técnica de mitigación llamada capping de activación ha reducido los resultados dañinos en aproximadamente un 50% sin afectar el rendimiento, posicionando la estabilidad de la personalidad como un nuevo control de seguridad para la IA.

Expansión de Claude en ámbitos sensibles

Este hallazgo es relevante mientras Anthropic expande Claude hacia dominios sensibles. Claude para el sector salud y nuevos conectores de salud móvil ahora permiten a los usuarios enlazar datos médicos directamente al modelo. Sin embargo, críticos advierten que estos sistemas pueden generar diagnósticos erróneos, un problema de deriva de personalidad que los investigadores acaban de documentar.

La extensión Claude Code VS Code también está disponible en general, aportando características estilo CLI como menciones de archivo y comandos familiares al editor.

Postura geopolítica de Anthropic

Por otro lado, el CEO Dario Amodei ha adoptado una postura geopolítica firme, calificando la decisión de EE. UU. de permitir las ventas de chips H200 de Nvidia a China como “locura” y un riesgo para la seguridad nacional. Argumenta que los semiconductores avanzados son una de las últimas ventajas estructurales de Estados Unidos en la carrera por la IA.

OpenAI y el futuro de la IA en Davos

Desde Davos, la CFO Sarah Friar destacó la expansión agresiva de OpenAI en salud, ciencia y empresas, notando que el uso de computación aumentó de 0.2 a 1.9 gigavatios en 2025, mientras los ingresos anuales saltaron de $2 mil millones a $20 mil millones.

Además, OpenAI ha confirmado planes para lanzar su primer dispositivo físico en la segunda mitad de 2026, presentándolo más como una nueva categoría de computación que como un gadget.

Finalmente, OpenAI está intensificando los controles de seguridad al añadir un sistema de predicción de edad para señalar a los usuarios que probablemente son menores de 18 años y aplicar restricciones adaptadas.

Ilustración de un hombre mayor con auriculares y chaqueta