Agentic AI es un ecosistema donde modelos especializados colaboran en planificación, razonamiento, recuperación y seguridad. A medida que estos sistemas crecen, los desarrolladores requieren modelos capaces de entender datos multimodales del mundo real y comunicarse naturalmente con los usuarios de todo el mundo.
NVIDIA presentó, en GTC 2026, una nueva generación de modelos NVIDIA Nemotron diseñados para trabajar como un conjunto de agentes unificados:
Con datos abiertos, recetas de entrenamiento y herramientas de NVIDIA NeMo, la familia de modelos Nemotron proporciona un conjunto de herramientas integral para construir, evaluar y optimizar sistemas de IA agentic de calidad de producción.
Este artículo explora los últimos modelos Nemotron 3, su rendimiento y cómo los desarrolladores pueden utilizarlos para construir agentes de IA escalables, multimodales y en tiempo real.
Potenciar sistemas multi-agente con NVIDIA Nemotron 3 Super
Los sistemas multi-agente enfrentan el problema de la “explosión de contexto” con historias de tokens masivas, 15 veces más que el chat estándar, y un “impuesto de pensamiento” que requiere razonamiento en cadena para cada decisión. NVIDIA Nemotron 3 Super es un modelo híbrido abierto de mezcla de expertos (MoE) que activa solo 12 mil millones de parámetros por pasada, ofreciendo alta precisión y eficiencia a un costo computacional reducido.
Con una arquitectura híbrida que combina capas de Mamba y Transformer, predicción de múltiples tokens y precisión NVFP4 en GPUs Blackwell, Nemotron 3 Super logra hasta cinco veces mayor rendimiento que la generación anterior, reduciendo el uso de memoria y costos. Un “presupuesto de pensamiento” configurable permite a los desarrolladores limitar el razonamiento en cadena, manteniendo la latencia y los gastos predecibles, incluso para cargas de trabajo continuas de agentes.
Nemotron 3 Super utiliza MoE latente para invocar cuatro especialistas expertos con un costo de inferencia equivalente al de uno solo, comprimiendo tokens antes de que lleguen a los expertos.
Las evaluaciones externas respaldan esto. En el Índice de Inteligencia de Artificial Analysis para modelos de peso abierto con menos de 250 mil millones de parámetros, Nemotron 3 Super NVFP4 se encuentra entre los modelos más destacados, igualando las puntuaciones de inteligencia más altas de alternativas líderes.

En el gráfico de inteligencia frente a eficiencia, Nemotron 3 Super se ubica en el cuadrante superior derecho más atractivo, combinando un sólido rendimiento en tareas con alta capacidad de salida por GPU, lo que lo convierte en una opción atractiva para agentes de producción sensibles al costo.
Nemotron 3 Super, con pesos abiertos, datos de entrenamiento abiertos y recetas de desarrollo abiertas, es ideal para desarrollo de software, investigación profunda, ciberseguridad e industria de servicios financieros.
Mantener a los agentes seguros con Nemotron 3 Content Safety
A medida que los agentes evolucionan de flujos de trabajo solo de texto a multimodales, las medidas de seguridad deben adaptarse a los insumos, la recuperación y las salidas. También deben aplicarse en casos de uso como copilotos empresariales y contenido generado por usuarios (como aplicaciones de citas o redes sociales), y detectar inyecciones de mensajes en sistemas agenticos como la atención médica, donde la autolesión es una preocupación.
Nemotron 3 Content Safety es un modelo de seguridad multimodal compacto de 4 mil millones de parámetros que detecta contenido inseguro o sensible en texto e imágenes. Construido sobre la base Gemma-3-4B con una cabeza de clasificación basada en adaptadores, ofrece clasificación de seguridad con alta precisión y baja latencia, ideal para canalizaciones de producción agentic. Fusiona características visuales y lingüísticas para producir una decisión simple de seguro/no seguro, con etiquetas de categoría granular opcionales. Un rápido interruptor de palabras clave permite a los desarrolladores elegir entre clasificación binaria rápida e informes de taxonomía completos, apoyando tanto caminos de baja latencia como inspección más profunda.

El modelo utiliza la misma taxonomía de 23 categorías que Aegis 1-3, cubriendo clases como odio, acoso, violencia, contenido sexual, plagio y consejos no autorizados. Entrenado con conjuntos de datos Aegis de alta calidad y imágenes reales anotadas por humanos, en lugar de datos sintéticos, el modelo muestra un rendimiento sólido en benchmarks multimodales en sus 12 idiomas soportados, con una buena generalización cero disparo más allá de ellos.
Conversaciones naturales con Nemotron 3 VoiceChat
La IA de voz tradicional se basa en canalizaciones en cascada, reconocimiento automático de voz (ASR), un modelo de lenguaje grande (LLM) y texto a voz (TTS), todos los cuales introducen latencia, complejidad y múltiples puntos de falla.
Nemotron 3 VoiceChat es un modelo de voz de 12 mil millones de parámetros para IA conversacional en tiempo real y de doble vía, actualmente en acceso anticipado. A diferencia de las canalizaciones en cascada, VoiceChat analiza directamente la entrada de audio y genera la salida de audio en una arquitectura unificada y de LLM en streaming. Este modelo único elimina la orquestación de múltiples modelos. Basado en el backbone Nano v2 LLM con Nemotron speech (codificador Parakeet) y decodificador TTS, VoiceChat ofrece conversaciones naturales e interrumpibles con baja latencia.

Con una canalización de extremo a extremo optimizada, VoiceChat busca una latencia final de menos de 300 ms, procesando fragmentos de audio de 80 ms más rápido que el tiempo real. Un solo modelo significa menos puntos de falla, una carga técnica reducida y una implementación más sencilla para agentes conversacionales en atención médica, servicios financieros, telecomunicaciones, juegos y más.
Comprender el mundo con NVIDIA Nemotron 3 Omni
Los sistemas agenticos necesitan cada vez más entender datos del mundo real en diferentes formatos: video, audio, documentos, pantallas de interfaz de usuario, y razonar entre modalidades. Las soluciones existentes son, o bien de código cerrado, o enfrentan desafíos de cumplimiento para su implementación en empresas globales.
NVIDIA Nemotron 3 Nano Omni es el primer modelo de base abierto, listo para producción, que ofrece un entendimiento nativo omni, proporcionando razonamiento de video de alto contexto mejorado mediante transcripción de audio. Nano Omni está potenciado por Nemotron speech (codificador Parakeet), razonamiento de reconocimiento óptico de caracteres (OCR) de última generación con un backbone de lenguaje Nemotron 3 Nano, y el primer sistema entrenado para GUI de NVIDIA para aplicaciones agenticas reales.
La arquitectura utiliza capas de convolución 3D (Conv3D) para manejar de manera eficiente datos temporales y espaciales en video, y el muestreo de video eficiente (EVS) permite procesar videos más largos al mismo costo computacional, identificando y eliminando parches temporalmente estáticos. Mantente atento a las actualizaciones sobre el lanzamiento de este modelo.
Mejorar la búsqueda multimodal con Llama Nemotron Embed VL y Rerank VL
Los pipelines de RAG agentic dependen de la recuperación para fundamentar la generación en evidencia, no solo en mensajes. Sin embargo, los datos empresariales se encuentran en PDFs con gráficos, contratos escaneados, tablas y presentaciones, formatos que la recuperación solo de texto no puede manejar.
Llama Nemotron Embed VL y Llama Nemotron Rerank VL son modelos multimodales compactos que permiten una recuperación precisa de documentos visuales mientras permanecen compatibles con bases de datos vectoriales estándar. En el ViDoRe V3/MTEB Pareto curve, que traza la precisión de recuperación frente a los tokens procesados por segundo en una sola GPU NVIDIA H100, Llama Nemotron Embed VL ocupa la frontera de Pareto. Ofrece precisión competitiva o superior a alta capacidad de procesamiento en comparación con alternativas abiertas y comerciales.

Llama Nemotron Embed VL es un modelo de incrustación densa de 1.7 mil millones de parámetros que codifica imágenes de página y texto en un vector unidimensional, con soporte para incrustaciones Matryoshka. Basado en NVIDIA Eagle, un modelo de visión-lenguaje de vanguardia con un backbone Llama 3.2 de 1B y un codificador de visión SigLip2 de 400M, utiliza aprendizaje contrastivo para la similitud entre consultas y documentos, permitiendo búsquedas con latencia de milisegundos en bases de datos vectoriales estándar.
Llama Nemotron Rerank VL es un reranker de codificador cruzado de 1.7 mil millones de parámetros que puntúa la relevancia consulta-página. Cuando se empareja con el modelo Llama Nemotron Embed VL, aumenta aún más la precisión al reordenar los fragmentos de texto e imágenes recuperados.
Evaluar y optimizar con NVIDIA NeMo
Construir agentes de producción requiere no solo modelos sólidos, sino también herramientas robustas para la evaluación y optimización. NVIDIA NeMo proporciona herramientas para evaluar, comparar y ajustar sistemas agentic:
- NVIDIA NeMo Evaluator permite un benchmarking robusto y reproducible con soporte para evaluación agentic. Al proporcionar configuraciones de evaluación estandarizadas, los desarrolladores pueden evaluar el rendimiento, validar salidas y comparar modelos en condiciones consistentes.
- NVIDIA NeMo Agent Toolkit es un marco de código abierto para perfilar y optimizar sistemas agentic de extremo a extremo. Lleva agentes de LangChain, AutoGen, AWS Strands u otros marcos, sin cambios en el código, y permite visibilidad sobre cuellos de botella de latencia, costos de tokens y sobrecarga de orquestación para enviar agentes de alto rendimiento a gran escala.
Comienza a construir con Nemotron
La IA agentic representa un cambio de sistemas que responden a sistemas que actúan. Es un conjunto coordinado de modelos, herramientas, memoria y medidas de seguridad que pueden planificar, ejecutar, criticar y adaptarse. Si solo se trata de un modelo más grande en la misma ventana de chat, no es agentic.
La familia de modelos Nemotron, liberada bajo las licencias de modelo abierto permisivas de NVIDIA, está construida para esta realidad multimodal. Nemotron 3 Super ancla el razonamiento y planificación de largo contexto. Nemotron 3 Content Safety supervisa cada paso, moderando insumos multimodales, contenido recuperado y salidas. Nemotron 3 VoiceChat convierte esa inteligencia en conversaciones de doble vía en tiempo real. Nemotron 3 Nano Omni (próximamente) dará a los agentes ojos y oídos a través de video, audio, documentos, gráficos e interfaces gráficas. Alrededor de ellos, las herramientas NeMo añaden recuperación, llamada de herramientas, evaluación y modelos que permiten a los agentes evaluar su propio trabajo y mejorar.
La eficiencia es el requisito oculto que hace viable la producción. Los verdaderos agentes realizan docenas o cientos de llamadas a modelos por tarea, por lo que los modelos Nemotron están dimensionados y optimizados para rendimiento, latencia y costo. Y dado que son abiertos y personalizables, los equipos pueden ajustar comportamientos, alinearse a sus propios datos y desplegarse donde sus equipos de seguridad y cumplimiento lo necesiten.
Con Nemotron y NVIDIA NeMo, obtienes los bloques de construcción para asistentes digitales confiables, repetibles y escalables para tus sistemas agentic de producción.
Comienza hoy:
Mantente al día sobreNVIDIA Nemotron suscribiéndote a noticias de NVIDIA y siguiendo a NVIDIA AI en LinkedIn, X, Discord, y YouTube.
Visita la página de desarrolladores de Nemotron para obtener recursos para comenzar. Explora modelos y conjuntos de datos abiertos de Nemotron en Hugging Face y Blueprints en build.nvidia.com.
Participa en las transmisiones en vivo de Nemotron, tutoriales, y la comunidad de desarrolladores en el foro de NVIDIA y Discord.


