Los modelos de IA ahora pueden identificar de manera independiente vulnerabilidades críticas en software complejo. Recientemente, Claude detectó más de 500 vulnerabilidades zero-day (fallos de seguridad desconocidos para los mantenedores del software) en software de código abierto bien probado.
En este artículo, compartimos detalles de una colaboración con investigadores de Mozilla, donde Claude Opus 4.6 descubrió 22 vulnerabilidades en un período de dos semanas. Mozilla clasificó 14 de ellas como vulnerabilidades de alta severidad, lo que representa casi una quinta parte de todas las vulnerabilidades críticas de Firefox que fueron remediadas en 2025. Esto demuestra que la IA facilita la detección de vulnerabilidades de seguridad severas a velocidades muy aceleradas.
Como parte de esta colaboración, Mozilla recibió numerosos informes de nuestra parte, nos ayudó a comprender qué tipo de hallazgos requerían un informe de errores y distribuyó correcciones a cientos de millones de usuarios en Firefox 148.0. Su asociación y las lecciones técnicas aprendidas proporcionan un modelo de cómo investigadores de seguridad habilitados por IA y mantenedores pueden trabajar juntos para enfrentar este desafío.
De evaluaciones de modelos a una asociación de seguridad
A finales de 2025, observamos que Opus 4.5 estaba cerca de resolver todas las tareas en CyberGym, un estándar que evalúa si los LLM pueden reproducir vulnerabilidades de seguridad conocidas. Buscamos construir una evaluación más difícil y realista que contuviera una mayor concentración de vulnerabilidades técnicamente complejas, como las que se encuentran en navegadores web modernos. Así que creamos un conjunto de datos de vulnerabilidades y exposiciones comunes (CVE) relacionadas con Firefox para ver si Claude podía reproducirlas.
Elegimos Firefox porque es tanto una base de código compleja como uno de los proyectos de código abierto más seguros y bien probados en el mundo. Esto hace que sea una prueba más difícil de la capacidad de la IA para encontrar vulnerabilidades de seguridad novedosas en comparación con el software de código abierto que usamos anteriormente para probar nuestros modelos. Cientos de millones de usuarios confían en él a diario, y las vulnerabilidades del navegador son particularmente peligrosas porque los usuarios a menudo se encuentran con contenido no confiable y dependen del navegador para mantener su seguridad.
Nuestro primer paso fue utilizar Claude para encontrar CVEs previamente identificados en versiones antiguas de la base de código de Firefox. Nos sorprendió que Opus 4.6 pudiera reproducir un alto porcentaje de estos CVEs históricos, dado que cada uno de ellos requirió un esfuerzo humano significativo para descubrir. Sin embargo, aún no estaba claro cuánto debíamos confiar en este resultado, ya que era posible que al menos algunos de esos CVEs históricos ya estuvieran en los datos de entrenamiento de Claude.
Desde la identificación de vulnerabilidades hasta la escritura de exploits primitivos
Para medir los límites superiores de las habilidades de ciberseguridad de Claude, también desarrollamos una nueva evaluación para determinar si Claude podía explotar alguna de las vulnerabilidades que descubrimos. En otras palabras, queríamos entender si Claude podría desarrollar herramientas que un hacker utilizaría para aprovechar estas vulnerabilidades y ejecutar código malicioso.
Para ello, proporcionamos a Claude acceso a las vulnerabilidades que habíamos enviado a Mozilla y le pedimos que creara un exploit para cada una. Para demostrar que había explotado con éxito una vulnerabilidad, requerimos que Claude realizara un ataque real, específicamente, que leyera y escribiera un archivo local en un sistema objetivo, tal como lo haría un atacante.
Realizamos esta prueba varias cientos de veces con diferentes puntos de partida, gastando aproximadamente $4,000 en créditos de API. A pesar de ello, Opus 4.6 solo pudo convertir la vulnerabilidad en un exploit en dos casos. Esto nos dice dos cosas. Primero, Claude es mucho mejor encontrando estos errores que explotándolos. Segundo, el costo de identificar vulnerabilidades es significativamente más bajo que el de crear un exploit para ellas. Sin embargo, el hecho de que Claude pudiera tener éxito al desarrollar automáticamente un exploit rudimentario para el navegador, aunque solo en algunos casos, es preocupante.
La urgencia del momento
Los modelos de lenguaje de vanguardia son ahora investigadores de vulnerabilidades de clase mundial. Además de las 22 CVEs que identificamos en Firefox, hemos utilizado Claude Opus 4.6 para descubrir vulnerabilidades en otros proyectos de software importantes como el núcleo de Linux. En las próximas semanas y meses, continuaremos informando sobre cómo estamos utilizando nuestros modelos y trabajando con la comunidad de código abierto para mejorar la seguridad.
Opus 4.6 es actualmente mucho mejor para identificar y corregir vulnerabilidades que para explotarlas. Esto le da una ventaja a los defensores. Y con el reciente lanzamiento de Claude Code Security en una vista previa de investigación limitada, estamos llevando capacidades de descubrimiento de vulnerabilidades (y parches) directamente a los clientes y mantenedores de código abierto.
Sin embargo, considerando la velocidad de progreso, es poco probable que la brecha entre las capacidades de descubrimiento y explotación de vulnerabilidades de los modelos de vanguardia dure mucho tiempo. Si en el futuro los modelos de lenguaje superan esta barrera de explotación, necesitaremos considerar medidas adicionales para prevenir el mal uso de nuestros modelos por actores maliciosos.
Si estás interesado en apoyar nuestros esfuerzos de seguridad—escribiendo nuevos andamiajes para identificar vulnerabilidades en software de código abierto; triando, parcheando y reportando vulnerabilidades; y desarrollando un robusto proceso de divulgación coordinada para la era de la IA—aplica para trabajar en Anthropic aquí.


