Autores: Enzo Ruedas y Tess Boivin.
Recientes avances en los Modelos de Lenguaje Grande han posibilitado la evolución de sistemas de razonamiento de solo texto a sistemas multimodales. Esta transición comenzó con la integración de la percepción visual en los Modelos de Visión-Lenguaje (VLMs) y más recientemente con la generación de acciones robóticas en modelos de Visión-Lenguaje-Acción (VLA). Sin embargo, implementar estos modelos en plataformas robóticas embebidas sigue siendo un desafío debido a las limitaciones en computación, memoria y energía, así como a los requisitos de control en tiempo real.
En los sistemas de control síncronos, mientras el VLA realiza inferencias, el brazo permanece inactivo esperando comandos, lo que puede provocar comportamientos oscilatorios y correcciones retardadas. Para abordar esto, se puede utilizar la inferencia asincrónica, que permite un movimiento continuo al disociar la generación de la ejecución. No obstante, para que esto sea efectivo, la latencia de inferencia de extremo a extremo debe ser menor que la duración de ejecución de la acción.
Desafíos en plataformas embebidas
La implementación de modelos VLA en plataformas embebidas no se reduce a una mera compresión de modelos; más bien, se trata de un problema complejo de ingeniería de sistemas que requiere descomposición arquitectónica, programación consciente de la latencia y ejecución alineada con el hardware. Abordar estos desafíos es crucial para traducir los avances recientes en modelos fundamentales multimodales en sistemas robóticos embebidos prácticos y desplegables.
Esta guía presenta las mejores prácticas de NXP para la grabación de conjuntos de datos robóticos fiables, la afinación de políticas VLA (ACT y SmolVLA), y resalta el rendimiento en tiempo real que logra el NXP i.MX95 después de la optimización.
🎥 Grabación de Conjuntos de Datos: Lo que Realmente Importa
La calidad y consistencia de los datos son más importantes que la cantidad desordenada. Esta sección convierte lecciones aprendidas en listas de verificación concretas.
En nuestro caso, grabamos un conjunto de datos para la tarea: «Colocar la bolsa de té en la taza.»


