Nuevo método protege a niños de contenido ilegal generado por IA

Los investigadores han desarrollado una técnica de auditoría para evaluar modelos de inteligencia artificial generativa, enfocándose en sus capacidades maliciosas sin solicitarles contenido ilegal.

El auge de la inteligencia artificial generativa

Con la creciente popularidad de la inteligencia artificial generativa, muchos modelos de código abierto están disponibles en línea para que cualquiera los adapte a sus necesidades. Sin embargo, estos modelos también pueden caer en manos de actores malintencionados que los optimizan para producir contenido ilegal, como discursos de odio o material de abuso sexual infantil (CSAM).

Este problema está en aumento; el Centro Nacional para Niños Desaparecidos y Explotados recibió más de 1.5 millones de informes sobre CSAM generado por IA en 2025, un incremento notable respecto a los 67,000 en 2024.

Técnica de auditoría innovadora

Tradicionalmente, los ingenieros prueban los modelos de IA para detectar capacidades dañinas solicitando resultados específicos, pero esto es inviable para el CSAM, ya que es ilegal generarlo en EE.UU. independientemente de la intención.

Para superar esta limitación y mejorar la seguridad de la IA, un grupo de científicos del MIT, liderado por el estudiante de posgrado Vinith Suriyakumar y los profesores asociados Ashia Wilson y Marzyeh Ghassemi, se unió a investigadores de Thorn para desarrollar un nuevo enfoque de auditoría que determina si un modelo puede generar CSAM sin necesidad de solicitarlo.

Su técnica examina las adaptaciones internas del modelo sin generar ninguna salida. Al analizar representaciones ocultas, puede inferir de manera confiable si un modelo se ha especializado en producir imágenes dañinas.

Resultados y futuro de la investigación

La técnica de auditoría identificó variaciones de modelos especializados en generar CSAM con una precisión del 100%. Plataformas de hospedaje podrían utilizar este método para marcar modelos inseguros y eliminarlos rápidamente o evitar su carga en primer lugar.

“Esto abre una nueva vía para que las plataformas que alojan modelos de código abierto y para las fuerzas del orden puedan evaluar si un modelo es capaz de generar CSAM. Antes, no teníamos forma de medir esto; era un gran punto ciego que algunas personas estaban aprovechando”, comenta Suriyakumar.

La investigación ha demostrado que, al centrarse en las modificaciones realizadas por el algoritmo LoRA, es posible auditar un modelo sin generar contenido dañino. En el futuro, los investigadores planean probar su técnica en un conjunto más amplio de variaciones de modelos.

Ilustración de un hombre mayor con auriculares y chaqueta