Lanzamiento de Nemotron 3 Super: Innovador modelo de IA para razonamiento ágil y autónomo

Los sistemas de IA agentes requieren modelos con la profundidad especializada necesaria para resolver problemas técnicos de manera autónoma. Estos modelos deben sobresalir en razonamiento, codificación y análisis de contexto prolongado, asegurando eficiencia para operar continuamente a gran escala.

Los sistemas multi-agente generan hasta 15 veces más tokens que los chats estándar, re-enviando la historia, salidas de herramientas y pasos de razonamiento en cada interacción. Este fenómeno, denominado «explosión de contexto», puede causar desviaciones de los objetivos originales, complicando el uso de modelos de razonamiento masivos para cada subtarea.

Lanzamiento de Nemotron 3 Super

Hoy, lanzamos Nemotron 3 Super para abordar estas limitaciones. Este nuevo modelo de 120B, con 12B de parámetros activos, ofrece máxima eficiencia computacional y precisión para aplicaciones complejas de múltiples agentes, como desarrollo de software y triage de ciberseguridad.

Nemotron 3 Super supera el «impuesto de pensamiento» mediante su arquitectura híbrida de mezcla de expertos (MoE), logrando más de 5 veces el rendimiento en comparación con el anterior Nemotron Super. Además, cuenta con una ventana de contexto nativa de 1 millón de tokens que proporciona memoria a largo plazo para un razonamiento alineado y de alta precisión.

Características destacadas de Nemotron 3 Super

Nemotron 3 Super no solo es una versión más grande de Nano. Introduce innovaciones arquitectónicas que permiten mitigar los típicos compromisos entre eficiencia y precisión para modelos de razonamiento de alta capacidad:

  • MoE latente: Activa 4 veces más especialistas expertos sin aumentar los costos de inferencia, al comprimir tokens antes de llegar a los expertos.
  • Predicción de múltiples tokens (MTP): Predice múltiples tokens futuros en una sola pasada, reduciendo drásticamente el tiempo de generación para secuencias largas.
  • Híbrido Mamba-Transformer: Integra capas de Mamba para eficiencia de secuencia y capas de Transformer para razonamiento preciso, mejorando el rendimiento con 4 veces más eficiencia en memoria y computación.
  • Preentrenamiento nativo en NVFP4: Optimizado para NVIDIA Blackwell, lo que reduce significativamente los requisitos de memoria y acelera la inferencia en 4 veces.
  • Aprendizaje por refuerzo en múltiples entornos: Post-entrenado en 21 configuraciones de entorno usando NeMo Gym, con más de 1.2 millones de rollouts de entorno.

Estas ventajas crean un modelo adecuado para agentes autónomos de larga duración. En PinchBench, Nemotron 3 Super alcanza un 85.6% en el conjunto de pruebas, destacándose como el mejor modelo abierto en su categoría.

Implementación y recursos abiertos

Nemotron 3 Super está completamente abierto, con pesos, conjuntos de datos y recetas, lo que permite a los desarrolladores personalizar, optimizar y desplegar el modelo en su propia infraestructura.

Los pesos completos del modelo están disponibles en Hugging Face y a través de NVIDIA NIM.

Para comenzar, puedes seguir las instrucciones en nuestro repositorio de GitHub, que ofrece recetas para plataformas como OpenCode, OpenHands y OpenClaw.

Para más detalles técnicos, consulta el informe técnico de Nemotron 3 Super.

Ilustración de un hombre mayor con auriculares y chaqueta