Avanzan los entornos adaptables para agentes conversacionales en comercio electrónico

El marco Ecom-RLVE extiende el RLVE para conversaciones de comercio electrónico, permitiendo interacciones más complejas con agentes conversacionales. EcomRLVE-GYM ofrece ocho ambientes verificables que abarcan desde la descubrimiento de productos hasta gestión de múltiples intenciones, facilitando la generación de problemas y recompensas verificables.

Este proyecto, que nació en el Pytorch OpenEnv Hackathon, continúa evolucionando. Se han presentado resultados iniciales que demuestran la transferencia de dificultad adaptativa a la finalización de tareas en el mundo real.

¿Por qué usar RL para agentes de compra?

Los modelos de lenguaje amplios pueden mantener conversaciones fluidas, pero su implementación como asistentes de compra enfrenta un desafío: fluidez ≠ finalización de tareas. Un cliente que solicita «encuéntrame un cargador USB-C por menos de $25 que envíe en dos días» necesita un agente que realice búsquedas de catálogo adecuadas y gestione múltiples restricciones.

La afinación supervisada puede enseñar el uso superficial de herramientas, pero no se adapta a la complejidad de configuraciones de restricciones y diálogos de información parcial requeridos en el comercio electrónico.

El aprendizaje por refuerzo con recompensas verificables (RLVR) ofrece una alternativa: el agente se optimiza por resultados. Sin embargo, construir funciones de recompensa que sean verificables y adaptativas es un reto significativo.

De RLVE-Gym a EcomRLVE-GYM

RLVE-Gym proporciona 400 entornos para tareas de razonamiento algorítmico, pero se limitaba a puzles de un solo turno. EcomRLVE-GYM llena este vacío, extendiendo el uso verificable a conversaciones multi-turno donde el agente debe actuar en lugar de solo razonar.

Esto transforma los resultados del servicio al cliente en verificables estructuralmente. Cada señal puede ser evaluada por un programa que tiene acceso al objetivo oculto, eliminando la necesidad de anotaciones humanas.

Aspectos del entrenamiento

Un episodio típico de EcomRLVE comienza con un objetivo oculto, donde el agente debe usar herramientas para satisfacer la solicitud de un usuario simulado. Cada acción se verifica algorítmicamente, eliminando la necesidad de un juez humano.

El sistema de recompensas se calcula completamente mediante código, considerando la precisión en los productos, la eficiencia en el número de turnos y verificaciones para evitar recomendaciones incorrectas. Si el agente comete errores, el usuario simulado puede corregirlo durante el diálogo.

Los ocho entornos

Los entornos cubren distintos escenarios de compra del mundo real, donde el agente debe completar tareas utilizando herramientas y es evaluado por un programa. Cada entorno utiliza una señal de recompensa en tres partes, que incluye recompensas por completar la tarea y penalizaciones por recomendaciones incorrectas.

La implementación de un sistema de puntuación riguroso crea incentivos para respuestas bien formadas desde el inicio.

Currículum de dificultad adaptativa

Un único número de dificultad controla múltiples aspectos de una tarea, permitiendo que el entorno se adapte a la complejidad de las conversaciones de comercio electrónico. Cada entorno avanza a problemas más difíciles solo cuando el agente alcanza un nivel de éxito confiable, asegurando que el entrenamiento se mantenga dentro del límite de capacidad del agente.

Por último, la simulación del usuario utiliza modelos de lenguaje avanzados para generar mensajes naturales, abarcando desde solicitudes con errores tipográficos hasta cambios de tema en medio de la conversación.

– Enlace contenido original: https://huggingface.co/blog/ecom-rlve
Ilustración de un hombre mayor con auriculares y chaqueta