Investigan cómo manipularon una IA para obtener instrucciones sobre explosivos

Investigadores de Mindgard lograron engañar a la IA Claude de Anthropic, desvelando varios contenidos prohibidos, incluidas instrucciones para fabricar explosivos. Utilizando técnicas de manipulación psicológica, descubrieron vulnerabilidades en el sistema, que se considera seguro. Este experimento resalta el reto de garantizar la seguridad en herramientas de inteligencia artificial a medida que se vuelven más complejas y accesibles para los usuarios.

Ilustración de un hombre mayor con auriculares y chaqueta