El hardware, software y modelos co-diseñados son fundamentales para alcanzar la máxima producción en fábricas de IA y minimizar costos. La evaluación de este rendimiento trasciende las especificaciones de los chips.
MLPerf Inference v6.0 es la última versión de un conjunto de benchmarks que miden el rendimiento a través de diversas arquitecturas de modelos y casos de uso. En esta edición, los sistemas impulsados por las GPU NVIDIA Blackwell Ultra lograron el mayor rendimiento en una amplia variedad de modelos, acumulando un total de 291 victorias en MLPerf desde 2018, lo que representa nueve veces más que todos los demás participantes combinados.
Participación del ecosistema de NVIDIA
En esta ronda, el ecosistema de socios de NVIDIA tuvo una participación destacada, con 14 colaboradores, la cifra más alta en una sola plataforma. Entre ellos se encuentran ASUS, Cisco, CoreWeave, Dell Technologies, GigaComputing, Google Cloud, HPE, Lenovo, Nebius, Netweb Technology, Quanta Cloud Technology (QCT), Red Hat, Supermicro, y Lambda, quienes lograron un excelente rendimiento en la plataforma de NVIDIA.
Este artículo examina las últimas actualizaciones de benchmarks, el rendimiento líder de la industria en la plataforma de NVIDIA y la ingeniería integral que lo hace posible.
Nuevos benchmarks y récords de rendimiento
El conjunto de benchmarks de MLPerf Inference se actualiza regularmente para reflejar modelos y casos de uso relevantes. En esta ronda, solo la plataforma de NVIDIA presentó resultados en todos los nuevos modelos y escenarios, alcanzando el mejor rendimiento en todos ellos.
Esta edición de MLPerf Inference agregó varias pruebas, incluyendo:
- DeepSeek-R1 Interactive: Un nuevo escenario interactivo que ofrece 5 veces más velocidad en la tasa mínima de tokens y 1.3 veces menos tiempo para el primer token en comparación con el escenario de servidor.
- Qwen3-VL-235B-A22B: Modelo de visión-lenguaje con un total de 235B de parámetros, evaluado en dos escenarios: Offline y Server.
- GPT-OSS-120B: LLM de razonamiento con 120B de parámetros, que incluye tres escenarios: Offline, Server e Interactive.
- WAN-2.2-T2V-A14B: Modelo generativo de texto a video de 4B de parámetros, evaluado en dos escenarios: un solo flujo y offline.
- DLRMv3: Benchmark de recomendaciones generativas que reemplaza la prueba DLRM-DCNv2, utilizando una arquitectura basada en transformadores.
| Benchmark | DeepSeek-R1 | GPT-OSS-120B | Qwen3-VL | WAN-2.2 | DLRMv3 |
| Offline | 2,494,310 tokens/seg* | 1,046,150 tokens/seg | 79 muestras/seg | 0.059 muestras/seg | 104,637 muestras/seg |
| Server | 1,555,110 tokens/seg* | 1,096,770 tokens/seg | 68 consultas/seg | 21 seg** (Un solo flujo) | 99,997 consultas/seg |
| Interactive | 250,634 tokens/seg | 677,199 tokens/seg | *** | *** | *** |
* No es un nuevo escenario en MLPerf Inference v6.0
** WAN-2.2 incluye un escenario de flujo único, que mide la latencia de la solicitud completa, en lugar de un escenario de servidor. Cuanto menor, mejor.
*** No se probó en MLPerf Inference v6.0
Resultados de MLPerf Inference v6.0, Closed Division, obtenidos de www.mlcommons.org el 1 de abril de 2026. Resultados de la plataforma NVIDIA de las entradas: 6.0-0039, 6.0-0073, 6.0-0075, 6.0-0076, 6.0-0078, 6.0-0081, 6.0-0094. El nombre y logotipo de MLPerf son marcas registradas y no registradas de MLCommons Association en los Estados Unidos y otros países. Todos los derechos reservados. Su uso no autorizado está estrictamente prohibido. Consulte www.mlcommons.org para más información.

Actualizaciones de software NVIDIA TensorRT-LLM
NVIDIA optimiza continuamente el rendimiento de su pila de software para aumentar la producción de tokens en plataformas existentes, lo que reduce los costos de producción y permite a los operadores de fábricas de IA atender a más usuarios y generar más ingresos.
El rendimiento adicional también proporciona capacidad para ejecutar futuros modelos de IA y atender modelos existentes en situaciones exigentes, como tasas de tokens más altas. Esta mejora continua permite que las GPU de NVIDIA, introducidas hace años, sigan siendo productivas en la nube.
En esta ronda, NVIDIA GB300 NVL72 lanzó un rendimiento 2.7x mayor en comparación con sus presentaciones anteriores en el escenario de servidor del benchmark DeepSeek-R1. Esto significa que se generan 2.7 veces más tokens con la misma infraestructura y huella de energía, reduciendo el costo de producción de cada token en más del 60%. Este avance, logrado por el socio de NVIDIA Nebius, demuestra una ventaja clave de la plataforma de NVIDIA: un ecosistema abierto donde los clientes y socios pueden optimizar e innovar sobre nuestra pila de software.
Las mejoras en el rendimiento en los escenarios de DeepSeek R1 fueron impulsadas por varias optimizaciones de software, incluyendo:
- Kernels más rápidos: Una combinación de kernels de mayor rendimiento y uso de menos kernels mediante fusiones de kernels.
- Optimización de Parallelismo de Datos de Atención: Mejor equilibrio de las solicitudes de contexto entre diferentes rangos.
Las últimas características del software de servicio de inferencia NVIDIA TensorRT-LLM y el marco de servicio de inferencia distribuida de código abierto NVIDIA Dynamo se utilizaron para apoyar el nuevo y desafiante escenario DeepSeek-R1 Interactive. Esto incluye:
- Servicio desagregado: Capacidad en Dynamo para optimizar individualmente las configuraciones de cada fase de inferencia.
- Paralelismo de Expertos Amplio (WideEP): Mejora del tiempo de ejecución de modelos MoE al dividir expertos entre múltiples GPU, reduciendo cuellos de botella.
- Predicción de Múltiples Tokens (MTP): Aumento del rendimiento al predecir y verificar tokens adicionales en paralelo.
- Enrutamiento consciente de KV: Esta capacidad de Dynamo evalúa costos de cómputo en diferentes trabajadores.
NVIDIA fue la primera y única plataforma en presentar resultados de DeepSeek-R1 en MLPerf Inference cuando el benchmark debutó el año pasado. En esta ronda, NVIDIA no solo mejoró su rendimiento, sino que además fue la única plataforma en presentar resultados en el nuevo escenario interactivo.
Incluso en el Llama 3.1 405B, lanzado hace casi dos años, el rendimiento de GB300 NVL72 incrementó en 1.5x en el escenario de servidor.
| Benchmark | GB300 NVL72 v5.1 | GB300 NVL72 v6.0 | Aumento |
| DeepSeek-R1(Server) | 2,907 tokens/sec/gpu | 8,064 tokens/sec/gpu | 2.77x |
| DeepSeek-R1(Offline) | 5,842 tokens/sec/gpu | 9,821 tokens/sec/gpu | 1.68x |
| Llama 3.1 405B(Server) | 170 tokens/sec/gpu | 259 tokens/sec/gpu | 1.52x |
| Llama 3.1 405B(Offline) | 224 tokens/sec/gpu | 271 tokens/sec/gpu | 1.21x |
Asimismo, las presentaciones de NVIDIA en los nuevos benchmarks multimodales, de generación de video y de recomendaciones se basaron en frameworks de software de código abierto optimizados para la plataforma de NVIDIA. El envío de Qwen3-VL utilizó el framework de código abierto vLLM, mostrando cómo la comunidad está construyendo optimizaciones multimodales avanzadas para acelerar cargas de trabajo de inferencia basadas en imágenes. El envío de WAN-2.2 utilizó el TensorRT-LLM VisualGen, que acelera los pipelines de generación de video en GPUs de NVIDIA.
Para DLRMv3, la presentación se construyó sobre dos proyectos de código abierto: el recsys-example para inferencia de recomendaciones y NV Embedding Cache para búsquedas aceleradas en GPU. Ambos fueron críticos para alcanzar el rendimiento récord en este benchmark de recomendaciones generativas.
A través de una ingeniería extensa y continua, NVIDIA está incrementando el rendimiento en hardware existente y modelos existentes. A su vez, NVIDIA colabora estrechamente con constructores de modelos y frameworks de inferencia de código abierto para asegurar que los últimos modelos funcionen en la plataforma de NVIDIA desde su lanzamiento.
Escalado de inferencias con NVIDIA Quantum-X800 InfiniBand
NVIDIA también estableció nuevos récords de rendimiento a gran escala en el modelo DeepSeek-R1 al presentar resultados utilizando cuatro sistemas GB300 NVL72 interconectados con NVIDIA Quantum-X800 InfiniBand.
| DeepSeek-R1 | 4x GB300 NVL72 | Tokens/Segundo |
| Offline | 2,494,310 |
| Server | 1,555,110 |
Con 288 GPUs Blackwell Ultra, el mayor número jamás presentado a cualquier benchmark en MLPerf Inference, se establecieron nuevos récords de rendimiento a nivel de sistema, procesando millones de tokens por segundo.
Perspectivas sobre MLPerf Endpoints
La producción de inferencia implica un co-diseño extremo entre chips, arquitectura de sistemas, diseño de centros de datos y software. Los últimos resultados de MLPerf Inference v6.0 demuestran que NVIDIA ofrece un rendimiento de inferencia inigualable en una amplia gama de cargas de trabajo.
Las cargas de trabajo de inferencia de IA evolucionan rápidamente, a medida que los tamaños de los modelos crecen y aumentan las longitudes de contexto. NVIDIA ha estado trabajando, como parte del consorcio MLCommons, en la definición del benchmark MLPerf Endpoints, que proporcionará una imagen rigurosa de cómo funcionan los servicios desplegados bajo tráfico real de API.
Para conocer el rendimiento más reciente de la plataforma de NVIDIA en entrenamiento, inferencia y computación de alto rendimiento, visite nuestra página de rendimiento de productos de aprendizaje profundo.
Agradecimientos
Los resultados de MLPerf Inference v6.0 reflejan el trabajo de muchos ingenieros talentosos en la empresa. Agradecemos las contribuciones de los siguientes individuos (los apellidos ordenados):
Tomar Bar-on, Nitin Sai Bommi, Viraat Chandra, Alice Cheng, Jerry Chen, Xiaoming Chen, Jesus Corbal San Adrian, Ashutosh Dhar, Kefeng Duan, Wookje Han, Kyle Huang, Kris Hung, Rashid Kaleem, Khubaib Khubaib, Zihao Kong, Tin-Yin Lai, Tao Li, Forrest Lin, Wanqian Li, Alex Liu, Jintao Peng, Yuxian Qiu, Junyi Qiu, Xiaowei Shi, Olivia Stoner, Jacob Subag, Tong Tong, Harshil Vagadia, Shobhit Verma, June Yang, Tailing Yuan, Ben Zhang… y muchos otros en NVIDIA que hicieron posibles estos resultados.

