AssetOpsBench: Nueva herramienta para evaluar inteligencia artificial en la industria

AssetOpsBench es un sistema integral de evaluación que conecta los estándares de inteligencia artificial con la realidad industrial, centrándose en la gestión del ciclo de vida de activos.


Introducción

Los estándares actuales de inteligencia artificial son efectivos en tareas aisladas como la programación, pero carecen de la capacidad para abordar la complejidad de las operaciones industriales. Para solucionar esto, presentamos AssetOpsBench, un marco diseñado para evaluar el rendimiento de los agentes en seis dimensiones críticas en aplicaciones industriales.

A diferencia de los benchmarks tradicionales, AssetOpsBench se centra en la coordinación entre múltiples agentes, superando la idea de agentes aislados. Este enfoque permite manejar modos de fallo complejos e integrar diversas corrientes de datos.

AssetOpsBench está diseñado para operaciones de activos, como unidades de refrigeración y manejo de aire. Incluye:

  • 2.3M puntos de telemetría de sensores
  • 140+ escenarios curados a través de 4 agentes
  • 4.2K órdenes de trabajo para diversos escenarios
  • 53 modos de fallo estructurados

Marco de Evaluación y Retroalimentación General

AssetOpsBench evalúa sistemas agenticos en seis dimensiones cualitativas que reflejan las restricciones operativas reales en la gestión de activos industriales. Este benchmark no se centra en un único criterio de éxito, sino que valora la calidad del rastro de decisiones y la capacidad de respuesta ante datos incompletos.

Cada ejecución de agente se puntúa en seis criterios: Finalización de Tareas, Precisión de Recuperación, Verificación de Resultados, Corrección de Secuencias, Claridad y Justificación, y Tasa de Alucinaciones.

Las evaluaciones iniciales muestran que muchos agentes de propósito general tienen un buen desempeño en razonamiento superficial, pero fallan en la coordinación multi-paso, lo que limita su efectividad en contextos industriales complejos.


Modos de Fallo en Flujos de Trabajo Agenticos Industriales

Un aporte central de AssetOpsBench es el tratamiento explícito de modos de fallo como señales de evaluación en flujos de trabajo industriales. En lugar de considerar el fallo como un resultado binario, se analizan las trayectorias de ejecución multi-agente para identificar dónde, cómo y por qué se descompone el comportamiento del agente bajo restricciones operativas realistas.

La análisis de fallos en AssetOpsBench se implementa a través de un pipeline dedicado, que combina razonamiento basado en LLM con agrupación estadística para identificar patrones de fallo interpretables.

Entre los modos de fallo recurrentes se incluyen:

  • Desalineación entre telemetría de sensores, alertas y órdenes de trabajo históricas
  • Conclusiones excesivas ante evidencia insuficiente
  • Agregación inconsistente de datos heterogéneos entre agentes
  • Selección de acciones prematuras sin verificación adecuada
  • Descoordinación multi-agente, como ignorar entradas o discrepancias en razonamiento-acción

AssetOpsBench no depende únicamente de una taxonomía de fallos predefinida, sino que está diseñado para descubrir nuevos patrones de fallo que emergen en la práctica.


Envía un Agente para Evaluación

AssetOpsBench-Live es un benchmark abierto y listo para competiciones, que invita a la comunidad a enviar implementaciones de agentes. Los agentes son evaluados en un entorno controlado que refleja las restricciones de gestión de activos industriales.

Para enviar un agente, los desarrolladores validan su implementación localmente en un entorno simulado. Luego, los agentes son empaquetados y enviados para ejecución remota en escenarios de evaluación ocultos.

Los agentes enviados se evalúan en seis dimensiones cualitativas, y los participantes reciben puntuaciones agregadas junto con retroalimentación sobre modos de fallo.

Este ciclo de evaluación impulsado por retroalimentación permite la mejora iterativa, donde los desarrolladores pueden diagnosticar patrones de fallo y refinar el diseño del agente.


Distribución de Fallos

En 881 trazas de ejecución de agentes, la distribución de fallos fue la siguiente:

  • Recuperación de Errores Ineficaz: 31.2%
  • Finalización Exagerada: 23.8%
  • Problemas de Formato: 21.4%
  • Errores de Herramienta No Gestionados: 10.3%
  • Retroalimentación Ignorada: 8.0%
  • Otros: 5.3%

Es fundamental que los agentes cuenten con estrategias de aclaración integradas para mejorar su rendimiento en situaciones ambiguas.

Esta evaluación consciente del fallo refleja las realidades de la gestión de activos industriales, donde el razonamiento cauteloso y consciente de la degradación es preferible a la automatización agresiva pero frágil.

Conclusión

AssetOpsBench representa un avance significativo en la evaluación de agentes de inteligencia artificial en entornos industriales, proporcionando un marco que no solo mide el rendimiento, sino que también ofrece insights valiosos sobre la operativa y las limitaciones de los sistemas utilizados.

Ilustración de un hombre mayor con auriculares y chaqueta