Nuevo benchmark VAKRA evalúa el razonamiento y uso de herramientas en agentes AI
VAKRA es un nuevo benchmark para evaluar la capacidad de razonamiento y uso de herramientas por agentes de inteligencia artificial en entornos empresariales. A diferencia de pruebas tradicionales, VAKRA mide el razonamiento composicional a través de APIs y documentos, con trazas de ejecución completas. El conjunto incluye más de 8,000 APIs en 62 dominios y plantea desafíos que requieren múltiples pasos de razonamiento, mostrando las limitaciones actuales de los modelos en situaciones complejas.