Los agentes de voz conversacionales presentan un desafío único de evaluación, ya que deben cumplir dos objetivos simultáneamente: exactitud y experiencia conversacional. La exactitud implica completar la tarea del usuario de manera correcta, mientras que la experiencia conversacional se refiere a la manera natural y concisa de interactuar. Estos objetivos están interrelacionados, ya que malentender un código de confirmación puede hacer que un razonamiento perfecto se vuelva irrelevante.
Presentamos EVA, un marco de evaluación integral para agentes de voz que evalúa conversaciones habladas completas y multi-turno mediante una arquitectura realista de bot a bot. EVA genera dos puntuaciones principales: EVA-A (Exactitud) y EVA-X (Experiencia), y está diseñado para identificar fallas en cada dimensión. Es el primer marco que evalúa conjuntamente el éxito en la tarea y la experiencia conversacional.
Resultados y Metodología
También proporcionamos resultados de referencia para 20 sistemas de audio, revelando una constante relación entre exactitud y experiencia. Los agentes que tienen un buen desempeño en la finalización de tareas tienden a ofrecer peores experiencias de usuario.
El marco EVA se compone de cinco componentes centrales, incluyendo un simulador de usuario que actúa como un llamador, un agente de voz que se evalúa, un ejecutor de herramientas que responde a solicitudes, y un conjunto de métricas que evalúa las grabaciones de conversación.
Datos y Evaluación
Cada caso de prueba en nuestro marco es un registro de evaluación, estructurado para hacer las pruebas reproducibles. Lanzamos EVA con un conjunto de datos de aerolíneas sintético que abarca 50 escenarios y 15 herramientas, diseñados para evaluar razonamiento temporal y seguimiento de políticas.
EVA evalúa los agentes de voz en dos dimensiones fundamentales: EVA-A para exactitud y EVA-X para experiencia. Utiliza métricas diagnósticas para ofrecer una visión más detallada de por qué un modelo obtiene ciertos puntajes.
Hallazgos y Limitaciones
Identificamos que la transcripción de entidades nombradas es una de las principales áreas de fallo. Además, notamos que se necesita calibración adicional para casos de uso del mundo real. En cuanto a las limitaciones, las métricas pueden estar sujetas a sesgos inherentes y la simulación actual se limita a un solo dominio.
En el ámbito de la evaluación, planeamos añadir la evaluación de calidad prosódica y realizar pruebas de robustez bajo condiciones ruidosas. También estamos desarrollando conjuntos de datos adicionales con estructuras de políticas distintas y dinámicas conversacionales más complejas.
Para ver más detalles sobre los resultados iniciales y el análisis de errores, visita aquí.

