IBM y UC Berkeley investigan fallos en agentes empresariales de automatización IT

Ayhan Sebin
Saurabh Jha
Rohan Arora
Daby Sow
Mert Cemri
Melissa Pan
Ion Stoica

ITBench HF Space
ITBench HF Dataset
MAST HF Dataset
ITBench Github
MAST Github

IBM Research y UC Berkeley colaboraron para investigar cómo los sistemas de LLM (Modelos de Lenguaje de Aprendizaje Automático) fallan en la automatización de TI en situaciones reales. Esto incluye tareas como la triage de incidentes, consultas de registros/métricas y acciones en Kubernetes dentro de bucles de herramientas a largo plazo.

Los benchmarks suelen reducir el rendimiento a un único número, indicando si un agente falló, pero no el por qué. Para abordar este problema de caja negra, aplicamos MAST (Taxonomía de Fallos de Sistemas Multi-Agente), que es una metodología emergente para diagnosticar la fiabilidad de los agentes. Al aprovechar MAST para analizar ITBench—el benchmark de la industria para la automatización en SRE, seguridad y FinOps—convertimos trazas de ejecución en bruto en firmas de fallo estructuradas, revelando exactamente qué falló y cómo solucionarlo. Anotamos 310 trazas de ITBench SRE a través de tres clases de modelos distintos: Gemini-3-Flash, Kimi-K2 y GPT-OSS-120B.

Ilustración de un hombre mayor con auriculares y chaqueta