NVIDIA impulsa el progreso de la IA mediante el acceso a datos abiertos

Un enfoque colaborativo para escalar sistemas y agentes de IA confiables.

El avance de la IA se suele medir en términos de capacidad y eficiencia del modelo. Sin embargo, cada pipeline de entrenamiento depende fundamentalmente de una capa de datos que determina el comportamiento de esos modelos.

A medida que los sistemas autónomos adquieren mayor autonomía, los datos en los que se entrenan son cada vez más determinantes en lo que saben, cómo razonan y lo que pueden hacer de manera segura. No obstante, gran parte de los datos de entrenamiento actuales son opacos, fragmentados o están aislados en diferentes equipos.



Cuellos de botella en los datos de IA

La construcción de conjuntos de datos de alta calidad sigue siendo uno de los mayores cuellos de botella en el desarrollo de la IA. Las organizaciones a menudo invierten millones de dólares y meses—o incluso más de un año—en la recolección, anotación y validación de datos antes de iniciar el entrenamiento de un solo modelo. Incluso después de la implementación de modelos, el acceso a experiencia en el dominio y marcos de evaluación sigue siendo un desafío constante.

NVIDIA busca reducir esta fricción publicando conjuntos de datos con licencias permisivas en HuggingFace, junto con recetas de entrenamiento y marcos de evaluación en GitHub, que los desarrolladores pueden utilizar de inmediato. Hasta la fecha, se han compartido más de 2 petabytes de datos de entrenamiento listos para IA a través de más de 180 conjuntos de datos y más de 650 modelos abiertos. Y apenas estamos comenzando.



Conjuntos de datos abiertos del mundo real

Las liberaciones de datos abiertos de NVIDIA abarcan múltiples dominios, desde robótica y sistemas autónomos hasta IA soberana, biología y benchmarks de evaluación. Estos conjuntos, desarrollados por equipos de NVIDIA, demuestran cómo los datos compartidos pueden acelerar el desarrollo de IA en el mundo real.

A continuación, se presentan algunos ejemplos de nuestro ecosistema:



Colección de IA Física

Los sistemas robóticos requieren datos estructurados y multimodales. Esta colección incluye más de 500,000 trayectorias robóticas, 57 millones de agarres y 15TB de datos multimodales, incluyendo activos utilizados para desarrollar el modelo de razonamiento visión-lenguaje-acción NVIDIA GR00T en diversos tipos de agarres y configuraciones de sensores. Este conjunto ha sido descargado más de 10 millones de veces, incluyendo por empresas como Runway, que desarrolló su modelo de mundo GWM-Robotics utilizando el conjunto de datos GR00T, y la empresa de simulación robótica Lightwheel, que lo está usando para perfeccionar políticas robóticas.

Esta colección también incluye uno de los conjuntos de datos de AV más geográficamente diversos disponibles, con más de 1,700 horas de datos multi-sensor que abarcan 7 configuraciones de cámara, además de LiDAR y radar en 25 países y más de 2,500 ciudades. Esta amplitud respalda el benchmarking de percepción en diversos entornos de conducción y complementa conjuntos de datos académicos con una mayor usabilidad comercial.



Colección de Personas Nemotron

Las Personas Nemotron son conjuntos de datos de personas sintéticas completamente fundamentados en distribuciones demográficas del mundo real, que producen individuos culturalmente auténticos y diversos a gran escala.

La colección apoya el desarrollo de IA soberana e incluye actualmente conjuntos de datos a escala poblacional para:

  • Estados Unidos – 6 millones de personas
  • Japón – 6 millones de personas
  • India – 21 millones de personas
  • Brasil – 6 millones de personas (desarrolladas con WideLabs)
  • Singapur – 888,000 personas (desarrolladas con AI Singapore)

Estos conjuntos de datos ya están impulsando implementaciones reales a nivel global. CrowdStrike utilizó 2 millones de personas para mejorar la precisión de la traducción NL→CQL del 50.7% al 90.4%. En Japón, NTT Data y APTO utilizaron estos conjuntos de datos para iniciar inteligencia específica del dominio con datos mínimos propietarios, mejorando la precisión de QA legal del 15.3% al 79.3% y reduciendo las tasas de éxito de ataque del 7% al 0%.

Los conjuntos de datos también apoyaron el desarrollo de NVIDIA Nemotron-Nano-9B-v2-Japonés, un modelo de vanguardia de menos de 10B que alcanzó la cima de la tabla de clasificación Nejumi.



La Proteina

La Proteina es un conjunto de datos de proteínas completamente sintético y atomístico, diseñado para modelado biológico y flujos de trabajo de descubrimiento de fármacos. Con 455,000 estructuras y un aumento del 73% en la diversidad estructural en comparación con bases anteriores, proporciona representaciones moleculares listas para diseño sin PII ni restricciones de licencia. Un logro científico posible gracias a una colaboración abierta con investigadores de Oxford, Mila y CIFAR.



SPEED-Bench

SPEED-Bench es un benchmark estandarizado para evaluar el rendimiento de decodificación especulativa. Presenta dos divisiones: una división cualitativa que maximiza la diversidad semántica en 11 categorías de texto y una división de rendimiento organizada en cubos de longitud de secuencia de entrada (1K–32K) para construir curvas de rendimiento de Pareto precisas utilizando datos semánticos reales en lugar de tokens aleatorios. Ya se ha adoptado internamente como el benchmark principal para el rendimiento de Nemotron MTP, y proporciona a los equipos una metodología consistente para evaluar el rendimiento de borradores a través de complejidades de indicaciones y longitudes de contexto.



Retrieval-Synthetic-NVDocs-v1

Este conjunto de datos de recuperación sintética proporciona 110,000 tripletas de consulta, pasaje y respuesta generadas a partir de 15,000 archivos de documentación pública de NVIDIA. Diseñado para entrenar y evaluar sistemas de incrustación y RAG, el conjunto presenta pares de QA semánticamente ricos que abarcan múltiples tipos de razonamiento—factual, relacional, procedural, inferencial, temporal, causal y visual—junto con diversos tipos de consultas que incluyen consultas estructurales, de múltiples saltos y contextuales. La afinación en el dominio de modelos de incrustación demuestra ganancias sustanciales: afinar nvidia/llama-nemotron-embed-1b-v2 en este conjunto de datos genera un aumento del 11% en NDCG@10. El conjunto se puede generar en aproximadamente 3–4 días, y la afinación toma alrededor de dos horas en 8×A100 GPUs, lo que permite una rápida iteración desde el conjunto de datos hasta el modelo implementado.



Nemotron-ClimbMix

ClimbMix es un conjunto de datos de pre-entrenamiento de 400B tokens construido utilizando el algoritmo CLIMB, que utiliza agrupamiento basado en incrustaciones y refinamiento iterativo para identificar mezclas de datos de mayor calidad para el entrenamiento de modelos de lenguaje. El conjunto ya ha ganado una fuerte tracción en la comunidad: Andrej Karpathy destacó a Nemotron-ClimbMix como el que entrega la mayor mejora en la tabla de clasificación Time-to-GPT-2, lo que llevó a su adopción como la receta de datos predeterminada en NanoChat Speedrun y reduciendo el tiempo de cómputo H100 en aproximadamente un 33% en comparación con la configuración anterior FineWeb-Edu. ClimbMix se publica bajo la licencia CC-BY-NC-4.0.

Estas liberaciones reflejan una inversión continua en la capa de referencia compartida de la que dependen los desarrolladores de IA a través de modalidades y etapas del ciclo de vida del modelo.



Conjuntos de datos de entrenamiento de Nemotron

Un componente importante del trabajo de datos abiertos de NVIDIA es el conjunto de datos utilizados para entrenar y alinear la familia de modelos Nemotron. En el último año, estos conjuntos de datos han evolucionado para respaldar mejor las capacidades de razonamiento, codificación y multilingüismo en modelos de lenguaje avanzados.



Evolución del pre-entrenamiento de Nemotron

Gráfico de evolución del pre-entrenamiento de Nemotron

Las versiones anteriores se basaban en gran medida en corpora web generales, mientras que las versiones más recientes enfatizan dominios de mayor señal, como matemáticas, código y conocimientos STEM. Esta mayor densidad de señal permite a los modelos aprender capacidades más fuertes de razonamiento y resolución de problemas.

El stack de pre-entrenamiento de Nemotron incluye varios conjuntos de datos curados diseñados para diferentes capacidades:

  • Nemotron-CC – datos web deduplicados globalmente reescritos para mayor densidad de señal
  • Nemotron-CC-Math y Nemotron-CC-Code – razonamiento en matemáticas y código que preserva el formato de LaTeX y código
  • Nemotron-Pretraining-Code – conjuntos de datos de programación curados de grandes repositorios de código
  • Nemotron-Pretraining-Specialized – conjuntos de datos sintéticos para mejorar las capacidades en dominios clave como algoritmos, economía, lógica y razonamiento STEM

En conjunto, estos conjuntos de datos forman la base para modelos de lenguaje de propósito general capaces de razonamiento, codificación y comprensión multilingüe. Potencian a Nemotron, así como a modelos avanzados de socios como el de la empresa de seguridad de IA Primus-Labor-70B de Trend Micro.



Evolución del post-entrenamiento de Nemotron


Gráfico de evolución del post-entrenamiento de Nemotron

A medida que los modelos se vuelven más capaces, los datos de post-entrenamiento desempeñan un papel mayor en la configuración del comportamiento del modelo. Las versiones más recientes enfatizan la diversidad multilingüe, la supervisión de razonamiento estructurado y datos de interacción estilo agente.

Conjuntos clave en el stack de post-entrenamiento de Nemotron incluyen:

  • Nemotron-Instruction-Following-Chat – supervisión conversacional estructurada
  • Nemotron-Science – conjuntos de datos sintéticos de razonamiento científico
  • Nemotron-Math-Proofs – conjuntos de datos de razonamiento matemático formal
  • Nemotron-Agentic – conjuntos de datos que respaldan la planificación de múltiples pasos y el uso de herramientas
  • Nemotron-SWE – conjuntos de datos de ajuste de instrucciones para tareas de ingeniería de software

Estos conjuntos de datos proporcionan una supervisión estructurada que ayuda a los modelos a seguir instrucciones complejas, generar trazas de razonamiento y funcionar de manera confiable en tareas de múltiples pasos. Iteraciones tempranas se mezclaron con datos de dominio para desarrollar Apriel Nemotron 15B / Apriel 1.6 Thinker de ServiceNow, que superó a Gemini 2.5 Flash y Qwen3 en la escala de 15B parámetros, y SmolLM3 de Hugging Face, un popular modelo de lenguaje pequeño.

NVIDIA también está expandiendo este trabajo con conjuntos de datos abiertos de seguridad y aprendizaje por refuerzo, incluyendo Nemotron-Agentic-Safety (11K trazas de telemetría etiquetadas de flujos de trabajo de uso de herramientas) y Nemotron-RL, un corpus de 900K tareas que abarca matemáticas, codificación, herramientas, rompecabezas y razonamiento, que proporciona a los modelos un verdadero «gimnasio» de entrenamiento.



Co-diseño extremo

Diseñar conjuntos de datos de alta calidad a esta escala es un trabajo en equipo. Requiere una colaboración cercana entre estrategas de datos, investigadores de IA, ingenieros de infraestructura y expertos en políticas.

En NVIDIA, abordamos los datos de la misma manera que cualquier problema de ingeniería de software y hardware, a través de lo que llamamos co-diseño extremo: diseñando todos los componentes juntos para eliminar cuellos de botella a gran escala.

Cuando es posible, liberamos los conjuntos de datos así como los métodos detrás de ellos. La comunidad abierta y nuestros socios los ponen a prueba, identifican casos extremos y extienden los conjuntos de datos a nuevos dominios. Esos conocimientos se retroalimentan directamente en la siguiente iteración, mejorando tanto nuestros sistemas internos como el ecosistema de IA en general.
Screenshot 2026-03-10 at 11.23.40 AM

Keynote de CES 2026

NVIDIA también colabora con socios a través de iniciativas como ViDoRe y CVDP, dos consorcios que reúnen a socios de la industria y académicos para desarrollar benchmarks abiertos y marcos de evaluación para sistemas emergentes de IA.



Comienza a cocinar en la cocina abierta

En NVIDIA, pensamos en los datos abiertos como si fueran una cocina abierta. Los ingredientes son visibles, las recetas se comparten y todos pueden aprender de cómo se prepara el platillo.

Animamos a cualquier persona apasionada por la ciencia de datos y la construcción de modelos a explorar los conjuntos de datos abiertos de NVIDIA en Hugging Face, probar nuestros tutoriales y laboratorios de Nemotron, y unirse a la comunidad de Nemotron en Discord para colaborar en futuros conjuntos de datos.

La próxima generación de modelos de IA confiables y sistemas agentivos se construirá sobre fundamentos compartidos. Los datos abiertos son uno de ellos.

Ilustración de un hombre mayor con auriculares y chaqueta