Los costos de evaluación en IA superan los límites económicos y afectan la investigación

Las evaluaciones de inteligencia artificial (IA) están convirtiéndose en un nuevo cuello de botella computacional. Recientemente, el Holistic Agent Leaderboard (HAL) gastó aproximadamente $40,000 para llevar a cabo 21,730 evaluaciones de agentes a través de 9 modelos y 9 benchmarks. Cada ejecución de GAIA en un modelo de frontera puede costar $2,829 antes de la caché. Además, Exgentic realizó un barrido de configuraciones de agentes que costó $22,000, encontrando una variación de costos de 33x en tareas idénticas, destacando la elección del andamiaje como un factor de costo primordial.

En el ámbito del aprendizaje automático científico, The Well requiere aproximadamente 960 horas de H100 para evaluar una nueva arquitectura y 3,840 horas para un barrido completo de cuatro baselines. Aunque se han propuesto técnicas de compresión para benchmarks estáticos, los nuevos benchmarks de agentes son ruidosos, sensibles al andamiaje y solo parcialmente compresibles.

Reduciendo costos en benchmarks de LLM estáticos

El problema de costos comenzó antes de los agentes. Cuando Stanford presentó HELM en 2022, los costos por modelo variaron entre $85 para el modelo code-cushman-001 de OpenAI y $10,926 para el J1-Jumbo de AI21 (178B). Además, los modelos abiertos requerían entre 540 y 4,200 horas de GPU, siendo BLOOM (176B) y OPT (175B) los más costosos. Un análisis de Perlitz et al. (2023) reafirma el patrón de costos de HELM, señalando que ejecutar Granite-13B a través de HELM puede consumir hasta 1,000 horas de GPU.

Otro hallazgo sorprendente provino del análisis de Pythia de EleutherAI: los desarrolladores pagan repetidamente por la evaluación durante el desarrollo del modelo. Pythia lanzó 154 checkpoints para cada uno de 16 modelos en 8 tamaños, acumulando 2,464 checkpoints si se cuentan por separado. Ejecutar el LM Evaluation Harness sobre todos esos checkpoints convierte la evaluación en un multiplicador del entrenamiento.

Las evaluaciones de agentes son más complejas

El Holistic Agent Leaderboard proporciona una contabilidad pública valiosa sobre la evaluación de agentes. HAL ejecuta arneses estandarizados de agentes a través de nueve benchmarks que cubren tareas de codificación, navegación web, ciencia y servicio al cliente. El costo destacado fue de $40,000 por 21,730 ejecuciones en 9 modelos y 9 benchmarks. Para abril de 2026, el leaderboard creció a 26,597 ejecuciones. Además, el costo de una sola ejecución varía significativamente entre las tareas de HAL.

La variación en los costos de ejecución también se presenta en la diferencia entre los gastos de cada modelo. Por ejemplo, Claude Opus 4.1 cobra $15 por millón de tokens de entrada y $75 por millón de salida, mientras que Gemini 2.0 Flash cobra $0.10 y $0.40 respectivamente.

Figura 1. Cada barra muestra el costo mínimo y máximo entre las configuraciones de HAL en un solo benchmark.
Ilustración de un hombre mayor con auriculares y chaqueta