La próxima generación de robots impulsados por inteligencia artificial, como humanoides y vehículos autónomos, depende de datos de entrenamiento de alta fidelidad y conscientes de la física. Sin conjuntos de datos diversos y representativos, estos sistemas no obtienen la capacitación adecuada y enfrentan riesgos durante las pruebas debido a una mala generalización, exposición limitada a variaciones del mundo real y comportamientos impredecibles en casos extremos.
La recopilación de conjuntos de datos masivos del mundo real para el entrenamiento es costosa, consume tiempo y a menudo está limitada por las posibilidades.
Avances en los Modelos de Fundación del Cosmos
NVIDIA Cosmos aborda este desafío al acelerar el desarrollo de modelos de fundación del mundo (WFM). En el núcleo de su plataforma, los WFMs del Cosmos aceleran la generación de datos sintéticos y sirven como base para el post-entrenamiento, desarrollando modelos de inteligencia artificial física específicos para resolver estos desafíos.
Este artículo explora los últimos avances en los WFMs del Cosmos, sus capacidades clave que impulsan la inteligencia artificial física y cómo utilizarlos.
Actualizaciones de Cosmos WFM
Los modelos de fundación del mundo de NVIDIA Cosmos han evolucionado rápidamente, con avances significativos que aceleran aún más la generación de datos sintéticos y el desarrollo de inteligencia artificial física. Un año después de su introducción, las actualizaciones clave incluyen:
- Cosmos Transfer 2.5—Aumento de la velocidad y escalabilidad en la ampliación de datos a partir de simulaciones y entradas espaciales 3D, lo que permite una mayor diversidad en entornos, condiciones de iluminación y variaciones de escena.
- Cosmos Predict 2.5—Generación mejorada de escenarios de cola larga para secuencias de hasta 30 segundos, logrando hasta un 10x más de precisión al ser post-entrenado con datos específicos de dominio. Soporta salidas multivista, diseños de cámaras personalizados y salidas de políticas alternativas como simulación de acciones.
- Cosmos Reason 2—Razonamiento de inteligencia artificial física avanzado con mejor comprensión espaciotemporal y precisión de marcas de tiempo. Añade detección de objetos con localización de puntos 2D/3D y coordenadas de cajas delimitadoras, junto con explicaciones y etiquetas de razonamiento. Soporta contexto ampliado de hasta 256K tokens de entrada.
Cosmos Transfer para vídeos fotorealistas
Cosmos Transfer genera escenas del mundo de alta fidelidad a partir de entradas estructurales, asegurando una alineación espacial precisa y composición de escena.
Empleando la arquitectura ControlNet, Cosmos Transfer preserva el conocimiento preentrenado, permitiendo salidas estructuradas y consistentes. Utiliza mapas de control espaciotemporales para alinear dinámicamente representaciones sintéticas y del mundo real, permitiendo un control detallado sobre la composición de la escena, la colocación de objetos y la dinámica del movimiento.
Entradas:
- Datos visuales o geométricos estructurados: mapas de segmentación, mapas de profundidad, mapas de bordes, puntos clave de movimiento humano, escaneos LiDAR, trayectorias, mapas HD y cajas delimitadoras 3D.
- Anotaciones de verdad fundamental: referencias de alta fidelidad para alineación precisa.
Salida: Secuencias de vídeo fotorealistas con diseño, colocación de objetos y movimiento controlados.
Capacidades clave:
- Generar datos sintéticos fotorealistas escalables que se alineen con la física del mundo real.
- Controlar interacciones de objetos y composición de escenas a través de entradas multimodales estructuradas.
Uso de Cosmos Transfer para datos sintéticos controlables
Con las API y SDK de inteligencia artificial generativa, NVIDIA Omniverse acelera la simulación de inteligencia artificial física. Los desarrolladores utilizan NVIDIA Omniverse, construido sobre OpenUSD, para crear escenas 3D que simulan con precisión entornos del mundo real para el entrenamiento y prueba de robots y vehículos autónomos. Estas simulaciones sirven como entradas de vídeo de verdad fundamental para Cosmos Transfer, combinadas con anotaciones e instrucciones de texto.
Este flujo de trabajo acelera la creación de conjuntos de datos de entrenamiento de alta calidad, asegurando que los agentes de inteligencia artificial generalicen efectivamente de la simulación al despliegue en el mundo real.


Cosmos Transfer mejora el desarrollo de la robótica al permitir iluminación, colores y texturas realistas en el Blueprint de Isaac GR00T para la generación de movimiento de manipulación sintética y el Blueprint de Omniverse para la Simulación de Vehículos Autónomos, variando condiciones ambientales y climáticas para el entrenamiento. Estos datos fotorealistas son cruciales para los modelos de políticas de post-entrenamiento, asegurando una transferencia fluida de la simulación a la realidad y apoyando el entrenamiento de modelos de percepción de inteligencia artificial y modelos de robots especializados como GR00T N1.
Cosmos Predict para generar estados futuros del mundo
Cosmos Predict WFM está diseñado para modelar estados futuros del mundo en formato de vídeo a partir de entradas multimodales, incluyendo texto, vídeo y secuencias de marcos de inicio y fin. Se construye utilizando arquitecturas basadas en transformadores que mejoran la consistencia temporal y la interpolación de marcos.
Capacidades clave:
- Genera estados del mundo realistas directamente a partir de indicaciones de texto.
- Predice los siguientes estados basándose en secuencias de vídeo, prediciendo marcos faltantes o extendiendo el movimiento.
- Generación de múltiples marcos entre una imagen de inicio y una final, creando una secuencia completa y suave.
Cosmos Predict WFM proporciona una base sólida para entrenar modelos de mundo descendentes en robótica y vehículos autónomos. Se pueden post-entrenar estos modelos para generar acciones en lugar de vídeo para el modelado de políticas o adaptarlo para la comprensión visual-lingüística para crear modelos de percepción de inteligencia artificial personalizados.
Cosmos Reason para razonar e interactuar inteligentemente
Cosmos Reason es un modelo de razonamiento multimodal completamente personalizable que está diseñado para comprender el movimiento, las interacciones de objetos y las relaciones espacio-temporales. Utilizando el razonamiento de cadena de pensamiento (CoT), el modelo interpreta la entrada visual, predice resultados basados en la indicación dada y recompensa la decisión óptima. A diferencia de los LLMs basados en texto, fundamenta el razonamiento en la física del mundo real, generando respuestas claras y conscientes del contexto en lenguaje natural.
Entradas: observaciones de vídeo y una consulta o instrucción basada en texto.
Salida: respuesta de texto generada a través del razonamiento CoT a largo plazo.
Capacidades clave:
- Conoce cómo se mueven, interactúan y cambian los objetos con el tiempo.
- Predice y recompensa la mejor acción siguiente basada en la observación de entrada.
- Refina continuamente la toma de decisiones.
- Diseñado para el post-entrenamiento para construir modelos de percepción de inteligencia artificial y inteligencia artificial incorporada.
Pipeline de entrenamiento
Cosmos Reason se entrena en tres etapas, mejorando su capacidad para razonar, predecir y responder a decisiones en escenarios del mundo real.
- Preentrenamiento: utiliza un Vision Transformer (ViT) para procesar fotogramas de vídeo en embeddings estructurados, alineándolos con texto para una comprensión compartida de objetos, acciones y relaciones espaciales.
- Ajuste fino supervisado (SFT): especializa el modelo en razonamiento físico a través de dos niveles clave. El ajuste fino general mejora la anclaje de lenguaje y la percepción multimodal utilizando conjuntos de datos diversos de vídeo-texto, mientras que más entrenamiento en datos de inteligencia artificial física agudiza la capacidad del modelo para razonar sobre interacciones del mundo real.

El aprendizaje por refuerzo (RL): El modelo evalúa diferentes caminos de razonamiento y se actualiza solo cuando surge una mejor decisión a través de retroalimentación de prueba y recompensa. En lugar de depender de datos etiquetados por humanos, utiliza recompensas basadas en reglas:
- Reconocimiento de entidades: Recompensar la identificación precisa de objetos y sus propiedades.
- Restricciones espaciales: Penalizar colocaciones físicamente imposibles mientras se refuerza la posición realista de los objetos.
- Razonamiento temporal: Fomentar la predicción correcta de secuencias basadas en relaciones de causa y efecto.
Cómo ejecutar el nuevo Cosmos Reason 2
Comenzar
Actualizado el 13 de marzo de 2026, con avances en los modelos de fundación del mundo de NVIDIA Cosmos.


