NVIDIA lanza modelos Nemotron 3 para inteligencia artificial multimodal y segura

Agentic AI es un ecosistema donde modelos especializados colaboran en planificación, razonamiento, recuperación y seguridad. A medida que estos sistemas crecen, los desarrolladores requieren modelos capaces de entender datos multimodales del mundo real y comunicarse naturalmente con los usuarios de todo el mundo.

NVIDIA presentó, en GTC 2026, una nueva generación de modelos NVIDIA Nemotron diseñados para trabajar como un conjunto de agentes unificados:

Con datos abiertos, recetas de entrenamiento y herramientas de NVIDIA NeMo, la familia de modelos Nemotron proporciona un conjunto de herramientas integral para construir, evaluar y optimizar sistemas de IA agentic de calidad de producción.

Este artículo explora los últimos modelos Nemotron 3, su rendimiento y cómo los desarrolladores pueden utilizarlos para construir agentes de IA escalables, multimodales y en tiempo real.

Potenciar sistemas multi-agente con NVIDIA Nemotron 3 Super

Los sistemas multi-agente enfrentan el problema de la “explosión de contexto” con historias de tokens masivas, 15 veces más que el chat estándar, y un “impuesto de pensamiento” que requiere razonamiento en cadena para cada decisión. NVIDIA Nemotron 3 Super es un modelo híbrido abierto de mezcla de expertos (MoE) que activa solo 12 mil millones de parámetros por pasada, ofreciendo alta precisión y eficiencia a un costo computacional reducido.

Con una arquitectura híbrida que combina capas de Mamba y Transformer, predicción de múltiples tokens y precisión NVFP4 en GPUs Blackwell, Nemotron 3 Super logra hasta cinco veces mayor rendimiento que la generación anterior, reduciendo el uso de memoria y costos. Un “presupuesto de pensamiento” configurable permite a los desarrolladores limitar el razonamiento en cadena, manteniendo la latencia y los gastos predecibles, incluso para cargas de trabajo continuas de agentes.

Figura 1. Nemotron 3 Super ofrece inteligencia de primer nivel mientras lidera en rendimiento por GPU en el cuadrante de eficiencia más atractivo según Artificial Analysis.

Nemotron 3 Super utiliza MoE latente para invocar cuatro especialistas expertos con un costo de inferencia equivalente al de uno solo, comprimiendo tokens antes de que lleguen a los expertos.

Las evaluaciones externas respaldan esto. En el Índice de Inteligencia de Artificial Analysis para modelos de peso abierto con menos de 250 mil millones de parámetros, Nemotron 3 Super NVFP4 se encuentra entre los modelos más destacados, igualando las puntuaciones de inteligencia más altas de alternativas líderes.

Bar chart from Artificial Analysis showing intelligence index scores for open-weight models under 250B parameters; Nemotron-3-Super NVFP4 scores 42, matching the highest scores among leading models such as Qwen2.5 and Llama-3.1 70B.
Figura 2. Nemotron 3 Super se clasifica entre los mejores modelos de peso abierto con menos de 250 mil millones de parámetros en el Índice de Inteligencia de Artificial Analysis.

En el gráfico de inteligencia frente a eficiencia, Nemotron 3 Super se ubica en el cuadrante superior derecho más atractivo, combinando un sólido rendimiento en tareas con alta capacidad de salida por GPU, lo que lo convierte en una opción atractiva para agentes de producción sensibles al costo.

Nemotron 3 Super, con pesos abiertos, datos de entrenamiento abiertos y recetas de desarrollo abiertas, es ideal para desarrollo de software, investigación profunda, ciberseguridad e industria de servicios financieros.

Mantener a los agentes seguros con Nemotron 3 Content Safety

A medida que los agentes evolucionan de flujos de trabajo solo de texto a multimodales, las medidas de seguridad deben adaptarse a los insumos, la recuperación y las salidas. También deben aplicarse en casos de uso como copilotos empresariales y contenido generado por usuarios (como aplicaciones de citas o redes sociales), y detectar inyecciones de mensajes en sistemas agenticos como la atención médica, donde la autolesión es una preocupación.

Nemotron 3 Content Safety es un modelo de seguridad multimodal compacto de 4 mil millones de parámetros que detecta contenido inseguro o sensible en texto e imágenes. Construido sobre la base Gemma-3-4B con una cabeza de clasificación basada en adaptadores, ofrece clasificación de seguridad con alta precisión y baja latencia, ideal para canalizaciones de producción agentic. Fusiona características visuales y lingüísticas para producir una decisión simple de seguro/no seguro, con etiquetas de categoría granular opcionales. Un rápido interruptor de palabras clave permite a los desarrolladores elegir entre clasificación binaria rápida e informes de taxonomía completos, apoyando tanto caminos de baja latencia como inspección más profunda.

Chart showing Nemotron 3 Content Safety achieving 84% accuracy across multimodal, multilingual benchmarks.
Figura 3. La precisión del modelo frente a modelos de seguridad alternativos en benchmarks de contenido dañino multimodal y multilingüe.

El modelo utiliza la misma taxonomía de 23 categorías que Aegis 1-3, cubriendo clases como odio, acoso, violencia, contenido sexual, plagio y consejos no autorizados. Entrenado con conjuntos de datos Aegis de alta calidad y imágenes reales anotadas por humanos, en lugar de datos sintéticos, el modelo muestra un rendimiento sólido en benchmarks multimodales en sus 12 idiomas soportados, con una buena generalización cero disparo más allá de ellos.

Conversaciones naturales con Nemotron 3 VoiceChat

La IA de voz tradicional se basa en canalizaciones en cascada, reconocimiento automático de voz (ASR), un modelo de lenguaje grande (LLM) y texto a voz (TTS), todos los cuales introducen latencia, complejidad y múltiples puntos de falla.

Nemotron 3 VoiceChat es un modelo de voz de 12 mil millones de parámetros para IA conversacional en tiempo real y de doble vía, actualmente en acceso anticipado. A diferencia de las canalizaciones en cascada, VoiceChat analiza directamente la entrada de audio y genera la salida de audio en una arquitectura unificada y de LLM en streaming. Este modelo único elimina la orquestación de múltiples modelos. Basado en el backbone Nano v2 LLM con Nemotron speech (codificador Parakeet) y decodificador TTS, VoiceChat ofrece conversaciones naturales e interrumpibles con baja latencia.

Scatterplot titled “Conversational Dynamics (Full Duplex Bench) vs Speech Reasoning (Big Bench Audio)” comparing open‑source full‑duplex models. The x‑axis shows speech‑reasoning scores and the y‑axis shows conversational‑dynamics scores. Nemotron 3 VoiceChat (V1) and PersonaPlex. Nemotron 3 VoiceChat appears in the highlighted “most attractive” upper‑right quadrant.
Figura 4. Nemotron 3 VoiceChat y NVIDIA PersonaPlex lideran los modelos de código abierto de doble vía en las métricas de dinámica conversacional y razonamiento de voz, posicionándose en el cuadrante más atractivo del benchmark de Artificial Analysis.

Con una canalización de extremo a extremo optimizada, VoiceChat busca una latencia final de menos de 300 ms, procesando fragmentos de audio de 80 ms más rápido que el tiempo real. Un solo modelo significa menos puntos de falla, una carga técnica reducida y una implementación más sencilla para agentes conversacionales en atención médica, servicios financieros, telecomunicaciones, juegos y más.

Comprender el mundo con NVIDIA Nemotron 3 Omni

Los sistemas agenticos necesitan cada vez más entender datos del mundo real en diferentes formatos: video, audio, documentos, pantallas de interfaz de usuario, y razonar entre modalidades. Las soluciones existentes son, o bien de código cerrado, o enfrentan desafíos de cumplimiento para su implementación en empresas globales.

NVIDIA Nemotron 3 Nano Omni es el primer modelo de base abierto, listo para producción, que ofrece un entendimiento nativo omni, proporcionando razonamiento de video de alto contexto mejorado mediante transcripción de audio. Nano Omni está potenciado por Nemotron speech (codificador Parakeet), razonamiento de reconocimiento óptico de caracteres (OCR) de última generación con un backbone de lenguaje Nemotron 3 Nano, y el primer sistema entrenado para GUI de NVIDIA para aplicaciones agenticas reales.

La arquitectura utiliza capas de convolución 3D (Conv3D) para manejar de manera eficiente datos temporales y espaciales en video, y el muestreo de video eficiente (EVS) permite procesar videos más largos al mismo costo computacional, identificando y eliminando parches temporalmente estáticos. Mantente atento a las actualizaciones sobre el lanzamiento de este modelo.

Mejorar la búsqueda multimodal con Llama Nemotron Embed VL y Rerank VL

Los pipelines de RAG agentic dependen de la recuperación para fundamentar la generación en evidencia, no solo en mensajes. Sin embargo, los datos empresariales se encuentran en PDFs con gráficos, contratos escaneados, tablas y presentaciones, formatos que la recuperación solo de texto no puede manejar.

Llama Nemotron Embed VL y Llama Nemotron Rerank VL son modelos multimodales compactos que permiten una recuperación precisa de documentos visuales mientras permanecen compatibles con bases de datos vectoriales estándar. En el ViDoRe V3/MTEB Pareto curve, que traza la precisión de recuperación frente a los tokens procesados por segundo en una sola GPU NVIDIA H100, Llama Nemotron Embed VL ocupa la frontera de Pareto. Ofrece precisión competitiva o superior a alta capacidad de procesamiento en comparación con alternativas abiertas y comerciales.

Pareto curve for model accuracy vs performance for open and commercial embedding models. Benchmarked on 1xH100 by the MTEB leaderboard on the ViDoRe V3 benchmark
Figura 5. Curva de Pareto para la precisión del modelo frente al rendimiento para modelos de incrustación abiertos y comerciales. Evaluado en una H100 por el líder de MTEB en el benchmark de ViDoRe V3.

Llama Nemotron Embed VL es un modelo de incrustación densa de 1.7 mil millones de parámetros que codifica imágenes de página y texto en un vector unidimensional, con soporte para incrustaciones Matryoshka. Basado en NVIDIA Eagle, un modelo de visión-lenguaje de vanguardia con un backbone Llama 3.2 de 1B y un codificador de visión SigLip2 de 400M, utiliza aprendizaje contrastivo para la similitud entre consultas y documentos, permitiendo búsquedas con latencia de milisegundos en bases de datos vectoriales estándar.

Llama Nemotron Rerank VL es un reranker de codificador cruzado de 1.7 mil millones de parámetros que puntúa la relevancia consulta-página. Cuando se empareja con el modelo Llama Nemotron Embed VL, aumenta aún más la precisión al reordenar los fragmentos de texto e imágenes recuperados.

Evaluar y optimizar con NVIDIA NeMo

Construir agentes de producción requiere no solo modelos sólidos, sino también herramientas robustas para la evaluación y optimización. NVIDIA NeMo proporciona herramientas para evaluar, comparar y ajustar sistemas agentic:

  • NVIDIA NeMo Evaluator permite un benchmarking robusto y reproducible con soporte para evaluación agentic. Al proporcionar configuraciones de evaluación estandarizadas, los desarrolladores pueden evaluar el rendimiento, validar salidas y comparar modelos en condiciones consistentes.
  • NVIDIA NeMo Agent Toolkit es un marco de código abierto para perfilar y optimizar sistemas agentic de extremo a extremo. Lleva agentes de LangChain, AutoGen, AWS Strands u otros marcos, sin cambios en el código, y permite visibilidad sobre cuellos de botella de latencia, costos de tokens y sobrecarga de orquestación para enviar agentes de alto rendimiento a gran escala.

Comienza a construir con Nemotron

La IA agentic representa un cambio de sistemas que responden a sistemas que actúan. Es un conjunto coordinado de modelos, herramientas, memoria y medidas de seguridad que pueden planificar, ejecutar, criticar y adaptarse. Si solo se trata de un modelo más grande en la misma ventana de chat, no es agentic.

La familia de modelos Nemotron, liberada bajo las licencias de modelo abierto permisivas de NVIDIA, está construida para esta realidad multimodal. Nemotron 3 Super ancla el razonamiento y planificación de largo contexto. Nemotron 3 Content Safety supervisa cada paso, moderando insumos multimodales, contenido recuperado y salidas. Nemotron 3 VoiceChat convierte esa inteligencia en conversaciones de doble vía en tiempo real. Nemotron 3 Nano Omni (próximamente) dará a los agentes ojos y oídos a través de video, audio, documentos, gráficos e interfaces gráficas. Alrededor de ellos, las herramientas NeMo añaden recuperación, llamada de herramientas, evaluación y modelos que permiten a los agentes evaluar su propio trabajo y mejorar.

La eficiencia es el requisito oculto que hace viable la producción. Los verdaderos agentes realizan docenas o cientos de llamadas a modelos por tarea, por lo que los modelos Nemotron están dimensionados y optimizados para rendimiento, latencia y costo. Y dado que son abiertos y personalizables, los equipos pueden ajustar comportamientos, alinearse a sus propios datos y desplegarse donde sus equipos de seguridad y cumplimiento lo necesiten.

Con Nemotron y NVIDIA NeMo, obtienes los bloques de construcción para asistentes digitales confiables, repetibles y escalables para tus sistemas agentic de producción.

Comienza hoy: 

Mantente al día sobreNVIDIA Nemotron suscribiéndote a noticias de NVIDIA y siguiendo a NVIDIA AI en LinkedIn, X, Discord, y YouTube.

Visita la página de desarrolladores de Nemotron para obtener recursos para comenzar. Explora modelos y conjuntos de datos abiertos de Nemotron en Hugging Face y Blueprints en build.nvidia.com.

Participa en las transmisiones en vivo de Nemotron, tutoriales, y la comunidad de desarrolladores en el foro de NVIDIA y Discord.

Ilustración de un hombre mayor con auriculares y chaqueta