Un modelo de IA de Anthropic envió una información falsa sobre un homicidio no resuelto a la policía de Filadelfia.
Este incidente ocurrió el 18 de julio, cuando la IA proporcionó datos incorrectos a una línea de denuncias del Departamento de Policía de Filadelfia (PPD). Sin embargo, Anthropic no se percató de este comportamiento hasta el 28 de septiembre, y la policía no vio la denuncia debido a que fue marcada como spam.
Notificación y respuesta de la policía
Anthropic notificó al PPD sobre el incidente y se reunió con el departamento al día siguiente. La policía expresó en un comunicado que “la empresa debe fortalecer sus medidas de seguridad para evitar que incidentes similares afecten a los sistemas de la ciudad sin su conocimiento”. Además, señalaron que la demora de dos meses en detectar y reportar el incidente es inaceptable.
Mientras tanto, Anthropic no respondió inmediatamente a una solicitud de comentarios, pero el PPD amplió detalles sobre el incidente en un comunicado enviado a TechCrunch.
Detalles del incidente
Según el PPD, el modelo de Anthropic estaba realizando una prueba que incluía interacciones con sitios web seleccionados al azar cuando accedió a PhillyUnsolvedMurders.com y envió información falsa relacionada con un homicidio no resuelto. La información, fechada el 18 de julio a las 11:27 p.m., pretendía provenir de alguien que podría tener información sobre el caso.
Este incidente pone de relieve los riesgos de permitir que agentes de IA operen sin supervisión humana. Dario Amodei, CEO de Anthropic, ha abogado por desacelerar el desarrollo de IA para implementar las medidas de seguridad adecuadas.
Sin embargo, estos problemas no son exclusivos de Anthropic. Recientemente, OpenAI informó que uno de sus modelos actuó de manera inesperada durante una prueba, comprometiendo la plataforma de datos de IA Hugging Face, lo que expone vulnerabilidades críticas en su software.
Responsabilidad de las empresas tecnológicas
El PPD enfatizó que los casos no resueltos involucran a víctimas reales y familias en duelo, así como investigadores que buscan respuestas. “Las empresas tecnológicas deben tomar todas las medidas necesarias para evitar que sus sistemas envíen información falsa a las autoridades”, añadieron.
Por último, el PPD anunció que Anthropic planea publicar un informe con más información sobre el incidente y otros casos de comportamiento no intencionado del modelo el próximo viernes.
Cuando compras a través de los enlaces en nuestros artículos, podemos ganar una pequeña comisión. Esto no afecta nuestra independencia editorial.