NVIDIA está ampliando NVIDIA Cosmos y sus modelos de fundación para abordar problemas complejos en robótica, desarrollo de vehículos autónomos y visión artificial industrial.
Para apoyar este esfuerzo, se presenta Cosmos Policy, nuestra investigación más reciente para mejorar el control y la planificación robótica mediante los modelos de fundación de Cosmos.
Resumen
-
Cosmos Policy: Una política avanzada de control robótico que mejora el modelo de fundación Cosmos Predict-2 para tareas de manipulación, codificando acciones y estados futuros en el modelo, logrando un rendimiento de vanguardia en benchmarks como LIBERO y RoboCasa.
-
Cosmos Cookoff: Un hackathon abierto donde los desarrolladores pueden trabajar directamente con los modelos de fundación y explorar el potencial de la inteligencia artificial física.
Descripción general: ¿Qué es Cosmos Policy?
Cosmos Policy es una política de control y planificación robótica, obtenida mediante el ajuste fino de Cosmos Predict, un modelo de fundación diseñado para predecir futuros estados. En lugar de introducir nuevos componentes arquitectónicos, Cosmos Policy adapta el modelo preentrenado a través de un único proceso de post-entrenamiento basado en datos de demostración robótica.
Una política es el cerebro de decisión del sistema, que traduce observaciones (como imágenes de cámaras) en acciones físicas (como mover un brazo robótico) para completar tareas.
¿Qué lo hace diferente?
La innovación de Cosmos Policy radica en cómo representa los datos. En vez de construir redes neuronales independientes para percepción y control, trata las acciones robóticas, estados físicos y puntajes de éxito como si fueran fotogramas en un video.
Todo esto se codifica como fotogramas latentes adicionales, aprendidos mediante el mismo proceso de difusión que se utiliza en la generación de videos, permitiendo al modelo heredar su comprensión previa de la física y cómo evolucionan las escenas con el tiempo.
Latente se refiere al lenguaje matemático comprimido que un modelo utiliza para entender los datos internamente (en lugar de píxeles sin procesar).
Como resultado, un único modelo puede:
- Predecir acciones para guiar el movimiento robótico mediante coordinación mano-ojo (control visuomotor).
- Predecir futuras observaciones robóticas para la modelación del mundo.
- Predecir retornos esperados (es decir, función de valor) para la planificación.
Estas tres capacidades se aprenden de manera conjunta en un único modelo unificado.
Cosmos Policy puede implementarse como una política directa, donde solo se generan acciones en tiempo de inferencia, o como una política de planificación, donde se evalúan múltiples acciones candidatas al predecir sus estados futuros y valores resultantes.
Modelo base: Cosmos Predict y su relevancia
El trabajo reciente en manipulación robótica ha dependido cada vez más de grandes modelos preentrenados para mejorar la generalización y la eficiencia de datos. Muchos de estos enfoques se basan en modelos de visión-lenguaje (VLMs) entrenados en grandes conjuntos de datos de imagen-texto, ajustados para predecir acciones robóticas.
Estos modelos aprenden a entender videos y describir lo que observan, pero no aprenden a realizar acciones físicamente. Un VLM puede sugerir acciones de alto nivel, como girar a la izquierda o recoger la taza púrpura, pero no sabe cómo ejecutarlas con precisión.
A diferencia de esto, los modelos de fundación son entrenados para predecir cómo evolucionan las escenas a lo largo del tiempo y generar dinámicas temporales con videos. Estas capacidades son directamente relevantes para el control robótico, donde las acciones deben considerar cómo cambian el entorno y el estado del robot con el tiempo.
Cosmos Predict se entrena para inteligencia física utilizando un objetivo de difusión sobre latentes espaciales y temporales continuos, permitiéndole modelar distribuciones complejas y multimodales a través de largos horizontes temporales.
Este diseño convierte a Cosmos Predict en una base natural para el control visuomotor:
- El modelo ya aprende transiciones de estado mediante la predicción de fotogramas futuros.
- Su formulación de difusión soporta salidas multimodales, lo que es crítico para tareas con múltiples secuencias de acciones válidas.
- El desnoisador basado en transformadores puede escalar a largas secuencias y múltiples modalidades.
Cosmos Policy se basa en el Cosmos Predict2 post-entrenado para generar acciones robóticas junto con observaciones futuras y estimaciones de valor, utilizando el proceso de difusión nativo del modelo. Esto permite que la política herede completamente la comprensión de estructura temporal e interacción física del modelo preentrenado, manteniéndose simple para entrenar e implementar.
Actualización Importante: La última versión de Cosmos Predict 2.5 está aquí. Consulta la tarjeta del modelo.
Resultados a Primera Vista
Cosmos Policy se evalúa en benchmarks de simulación y tareas de manipulación robótica en el mundo real, comparándose con políticas basadas en difusión entrenadas desde cero, políticas robóticas basadas en video y modelos ajustados de visión-lenguaje-acción (VLA).
Se evalúa Cosmos Policy en LIBERO y RoboCasa, dos benchmarks estándar para la manipulación robótica multi-tarea y de largo alcance.
En LIBERO, Cosmos Policy supera consistentemente a políticas de difusión anteriores y enfoques basados en VLA en diversas suites de tareas, especialmente en aquellas que requieren coordinación temporal precisa y ejecución de múltiples pasos.
| Modelo | SR Espacial (%) | SR de Objetos (%) | SR de Objetivos (%) | SR de Largo (%) | SR Promedio (%) |
|---|---|---|---|---|---|
| Política de Difusión | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| Dita | 97.4 | 94.8 | 93.2 | 83.6 | 92.3 |
| π0 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| UVA | — | — | — | 90.0 | — |
| UniVLA | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
| π0.5 | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| Política de Video | — | — | — | 94.0 | — |
| OpenVLA-OFT | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 |
| CogVLA | 98.6 | 98.8 | 96.6 | 95.4 | 97.4 |
| Cosmos Policy (nuestro) | 98.1 | 100.0 | 98.2 | 97.6 | 98.5 |
En RoboCasa, Cosmos Policy alcanza tasas de éxito más altas que las baselines entrenadas desde cero, demostrando una mejor generalización en diversos escenarios de manipulación en el hogar.
| Modelo | # Demostraciones de Entrenamiento por Tarea | SR Promedio (%) |
|---|---|---|
| GR00T-N1 | 300 | 49.6 |
| UVA | 50 | 50.0 |
| DP-VLA | 3000 | 57.3 |
| GR00T-N1 + DreamGen | 300 (+10000 sintéticos) | 57.6 |
| GR00T-N1 + DUST | 300 | 58.5 |
| UWM | 1000 | 60.8 |
| π0 | 300 | 62.5 |
| GR00T-N1.5 | 300 | 64.1 |
| Política de Video | 300 | 66.0 |
| FLARE | 300 | 66.4 |
| GR00T-N1.5 + HAMLET | 300 | 66.4 |
| Cosmos Policy (nuestro) | 50 | 67.1 |
En ambos benchmarks, inicializar desde Cosmos Predict proporciona una ventaja de rendimiento significativa en comparación con arquitecturas equivalentes que no utilizan preentrenamiento de video.
Planificación vs. Ejecución Directa de Políticas
Cuando se implementa como una política directa, Cosmos Policy ya iguala o supera el rendimiento de vanguardia en la mayoría de las tareas. Al agregar planificación basada en modelos, observamos un 12.5% más alto en la tasa de finalización de tareas en promedio en dos desafiantes tareas de manipulación en el mundo real.
Manipulación en el Mundo Real
Cosmos Policy también se evalúa en tareas de manipulación bimanual en el mundo real utilizando la plataforma robótica ALOHA. La política ejecuta con éxito tareas de manipulación de largo alcance directamente desde observaciones visuales.
Para más información sobre la arquitectura y resultados, haz clic aquí.
Próximos Pasos: Cosmos Cookoff
Cosmos Policy representa un primer paso hacia la adaptación de modelos de fundación para el control y planificación robótica. Estamos colaborando con adoptantes tempranos para evolucionar esta investigación en nuestra comunidad de robótica.
Simultáneamente, Cosmos Policy está disponible para desarrolladores a través de la práctica receta de Cosmos Cookbook, que muestra cómo adoptarlo y construir sobre él.
Para fomentar la experimentación práctica con los modelos de fundación de Cosmos, anunciamos el Cosmos Cookoff, un hackathon abierto enfocado en construir aplicaciones y flujos de trabajo utilizando modelos y recetas del cookbook de Cosmos. El Cookoff más reciente está activo, invitando a desarrolladores de IA física en robótica, vehículos autónomos y análisis de video a explorar, prototipar rápidamente y aprender de expertos.
Únete al Cosmos Cookoff
Cuándo: Del 29 de enero al 26 de febrero
Formato del Equipo: Hasta 4 miembros por equipo
Premios: $5,000 en efectivo, NVIDIA DGX Spark, NVIDIA GeForce RTX 5090 GPU, y más.
Jueces: Los proyectos serán evaluados por expertos de Datature, Hugging Face, Nebius, Nexar y NVIDIA, aportando una profunda experiencia en modelos abiertos, computación en la nube y despliegues de IA de visión en el mundo real.
Actualización Importante: La última versión de Cosmos Predict 2.5 está
Comienza
