Los modelos de inteligencia artificial (IA) están experimentando un crecimiento notable en tamaño y complejidad, lo que requiere un rendimiento computacional cada vez mayor para su entrenamiento e inferencia. Esto supera lo que la Ley de Moore puede soportar. Por esta razón, NVIDIA participa en un diseño extremo, donde se integran múltiples chips y un amplio software para lograr avances significativos en el rendimiento y la eficiencia de la fábrica de IA.
Los formatos de IA de baja precisión son fundamentales para mejorar el rendimiento computacional y la eficiencia energética. Aprovechar las ventajas de numeraciones ultra-bajo-precisas en el entrenamiento e inferencia de IA, manteniendo una alta precisión, requiere un trabajo extenso en todos los niveles de la tecnología. Esto incluye la creación de formatos, su implementación en silicio, habilitación en diversas bibliotecas y colaboración con el ecosistema para desplegar nuevas recetas de entrenamiento y técnicas de optimización de inferencia. NVFP4, desarrollado para las GPUs de NVIDIA, ofrece beneficios de rendimiento y eficiencia energética de precisión en punto flotante de 4 bits mientras mantiene una precisión comparable a formatos de mayor precisión.
Para quienes buscan maximizar el rendimiento en entrenamiento e inferencia de IA, aquí hay tres aspectos clave sobre NVFP4.
1. NVFP4 permite grandes saltos de rendimiento en el entrenamiento y la inferencia
Las GPUs NVIDIA Blackwell Ultra ofrecen un rendimiento máximo de NVFP4 de hasta 15 petaFLOPS, tres veces más que FP8 en las mismas GPUs. Estos avances no solo se reflejan en especificaciones máximas, sino también en el rendimiento medido en cargas de trabajo de entrenamiento y inferencias.
En inferencia, como se muestra en un blog técnico reciente, el cambio de FP8 a NVFP4 resulta en mejoras drásticas en el rendimiento de tokens entregados en el modelo DeepSeek-R1, un popular modelo de mezcla de expertos con 671 mil millones de parámetros. Esto mejora la experiencia del usuario al aumentar la tasa de tokens entregados.
NVIDIA también publicó recientemente una receta de entrenamiento NVFP4, lo que permite a los creadores de modelos entrenar IA más rápido y a menor costo.

En la última versión de la suite de benchmarks MLPerf Training, múltiples sistemas NVIDIA GB300 NVL72, que suman 512 GPUs Blackwell Ultra, utilizaron precisión NVFP4 para completar el benchmark de pre-entrenamiento de Llama 3.1 405B en 64.6 minutos, lo que representa una velocidad 1.9 veces superior a la de los sistemas anteriores que utilizaron FP8.
2. NVFP4 ofrece gran precisión, comprobada en benchmarks de la industria
Para que las presentaciones de MLPerf Training e Inference en la división cerrada sean válidas, deben cumplir con los requisitos de precisión especificados por los benchmarks. En inferencia, las respuestas deben alcanzar ciertos umbrales de precisión, y en entrenamiento, los modelos deben ser entrenados hasta objetivos de calidad específicos.
NVIDIA logró presentar resultados en la división cerrada para cada prueba de modelo de lenguaje grande (LLM) utilizando NVFP4 en GPUs Blackwell y Blackwell Ultra en la última versión de MLPerf Training, incluyendo modelos como DeepSeek-R1 y Llama 3.1.

Estos resultados se lograron utilizando versiones cuantificadas de NVFP4, cumpliendo con estrictos requisitos de benchmark.
3. NVFP4 cuenta con amplio y creciente apoyo del ecosistema
Bibliotecas como NVIDIA Model Optimizer y LLM Compressor permiten a los desarrolladores cuantificar modelos entrenados a mayor precisión a NVFP4. Esto también incluye NVFP4 KV cache para soportar contextos largos y tamaños de lote grandes mientras se preserva la precisión. Además, frameworks de inferencia populares como NVIDIA TensorRT-LLM y vLLM ya soportan la ejecución de modelos en formato NVFP4.
El ecosistema también está adoptando NVFP4 para aumentar el rendimiento en producción en una variedad de modelos. Empresas como Black Forest Labs y Radical Numerics están trabajando con NVIDIA para escalar NVFP4 en sus implementaciones.
Black Forest Labs logró una mejora de hasta 6.3x en la inferencia de FLUX.2 utilizando optimizaciones como CUDA Graphs y NVFP4, según su CEO.
Radical Numerics está utilizando NVFP4 para acelerar el escalado de modelos científicos, mostrando gran optimismo hacia el uso de recetas de baja precisión para sus nuevas arquitecturas.
La NVIDIA Transformer Engine incorpora una implementación de la receta de entrenamiento NVFP4, permitiendo a los desarrolladores iniciar sus proyectos. NVIDIA continúa innovando y colaborando con el ecosistema para llevar los beneficios de NVFP4 a modelos más inteligentes y complejos.
Aprende más
El uso de NVFP4 puede generar grandes mejoras de rendimiento en las plataformas NVIDIA Blackwell y NVIDIA Rubin. A través de un diseño extremo, se logran estos avances con una excelente precisión en el entrenamiento y la inferencia de modelos. Las versiones NVFP4 de LLMs abiertos son ampliamente accesibles, permitiendo su uso con mayor rendimiento y menor costo por millón de tokens.
Descubre más sobre cómo los saltos arquitectónicos significativos habilitados por la plataforma Rubin permiten nuevos niveles de rendimiento en entrenamiento e inferencia de IA.


