Los sistemas agentes razonan a través de pantallas, documentos, audio, video y texto en un único ciclo de percepción-acción. Sin embargo, dependen de cadenas de modelos fragmentadas, lo que incrementa la complejidad de orquestación y los costos de inferencia.
NVIDIA Nemotron 3 Nano Omni, una nueva adición a la familia Nemotron 3, integra el razonamiento multimodal en un modelo abierto y altamente eficiente. Su función principal es reemplazar las pilas fragmentadas de visión, lenguaje y audio, actuando como el sub-agente de percepción y contexto dentro de sistemas agentes.
Mejoras en eficiencia y precisión
Con Nemotron 3 Nano Omni, los agentes pueden percibir y razonar sobre entradas visuales, de audio y textuales dentro de un único ciclo de percepción-acción compartido. Esto mejora la convergencia y reduce tanto la complejidad de orquestación como los costos de inferencia.
Este modelo ofrece precisión de primer nivel en clasificaciones de inteligencia documental, destacando en plataformas como MMlongbench-Doc y OCRBenchV2, así como en comprensión de video y audio.
Además, MediaPerf, un benchmark de la industria que evalúa modelos de comprensión de video, muestra que Nemotron 3 Nano Omni logra la mayor capacidad de procesamiento y el costo de inferencia más bajo en etiquetado de video. Para más detalles, consulta este artículo.
Arquitectura del modelo
Construido sobre una arquitectura híbrida de mezcla de expertos (MoE) de 30B-A3B, Nemotron 3 Nano Omni activa el experto necesario para cada tarea y modalidad, ofreciendo un alto rendimiento y una sólida capacidad multimodal a gran escala. Además, cuenta con pesos, conjuntos de datos y recetas completamente abiertos, permitiendo a los desarrolladores personalizar, implementar e integrar sub-agentes multimodales en entornos locales, en la nube y empresariales.
La arquitectura de Nemotron 3 Nano Omni combina capas Mamba para eficiencia de secuencia y memoria con capas de transformadores para un razonamiento preciso. Esta combinación proporciona una mayor eficiencia en memoria y cómputo, siendo adecuada para roles de sub-agente.
Video 1. NVIDIA Nemotron 3 Nano Omni unifica video, audio, imagen y texto en una arquitectura MoE abierta.
Instrucciones de implementación y entrenamiento
Nemotron 3 Nano Omni es accesible para los desarrolladores y presenta una metodología de entrenamiento basada en datos multimodales. Esto incluye un ajuste fino supervisado para expandir la cobertura de modalidades y aprendizaje por refuerzo en múltiples entornos, optimizando su rendimiento para tareas multimodales.
Los pesos del modelo están disponibles en Hugging Face, y el modelo también estará disponible como un microservicio NVIDIA NIM.
De esta forma, los desarrolladores pueden implementar y adaptar el modelo en entornos de desarrollo locales, manteniendo el control de datos y asegurando la privacidad y la seguridad.


