NVIDIA impulsa el rendimiento de IA con tecnología NVFP4 innovadora

Los modelos de inteligencia artificial (IA) están experimentando un crecimiento notable en tamaño y complejidad, lo que requiere un rendimiento computacional cada vez mayor para su entrenamiento e inferencia. Esto supera lo que la Ley de Moore puede soportar. Por esta razón, NVIDIA participa en un diseño extremo, donde se integran múltiples chips y un amplio software para lograr avances significativos en el rendimiento y la eficiencia de la fábrica de IA.

Los formatos de IA de baja precisión son fundamentales para mejorar el rendimiento computacional y la eficiencia energética. Aprovechar las ventajas de numeraciones ultra-bajo-precisas en el entrenamiento e inferencia de IA, manteniendo una alta precisión, requiere un trabajo extenso en todos los niveles de la tecnología. Esto incluye la creación de formatos, su implementación en silicio, habilitación en diversas bibliotecas y colaboración con el ecosistema para desplegar nuevas recetas de entrenamiento y técnicas de optimización de inferencia. NVFP4, desarrollado para las GPUs de NVIDIA, ofrece beneficios de rendimiento y eficiencia energética de precisión en punto flotante de 4 bits mientras mantiene una precisión comparable a formatos de mayor precisión.

Para quienes buscan maximizar el rendimiento en entrenamiento e inferencia de IA, aquí hay tres aspectos clave sobre NVFP4.

1. NVFP4 permite grandes saltos de rendimiento en el entrenamiento y la inferencia

Las GPUs NVIDIA Blackwell Ultra ofrecen un rendimiento máximo de NVFP4 de hasta 15 petaFLOPS, tres veces más que FP8 en las mismas GPUs. Estos avances no solo se reflejan en especificaciones máximas, sino también en el rendimiento medido en cargas de trabajo de entrenamiento y inferencias.

En inferencia, como se muestra en un blog técnico reciente, el cambio de FP8 a NVFP4 resulta en mejoras drásticas en el rendimiento de tokens entregados en el modelo DeepSeek-R1, un popular modelo de mezcla de expertos con 671 mil millones de parámetros. Esto mejora la experiencia del usuario al aumentar la tasa de tokens entregados.

NVIDIA también publicó recientemente una receta de entrenamiento NVFP4, lo que permite a los creadores de modelos entrenar IA más rápido y a menor costo.

Two sets of bar charts, with performance starting with Hopper submissions in prior rounds, followed by Blackwell GB200 NVL72 submissions in v5.0, then finally Blackwell Ultra GB300 NVL72 submissions in v5.1. The speedups listed for Llama 3.1 405B are 1x, ~2x, and 4x+, and 1x, ~3x, and ~5x for Llama 2 70B LoRA, respectively.

En la última versión de la suite de benchmarks MLPerf Training, múltiples sistemas NVIDIA GB300 NVL72, que suman 512 GPUs Blackwell Ultra, utilizaron precisión NVFP4 para completar el benchmark de pre-entrenamiento de Llama 3.1 405B en 64.6 minutos, lo que representa una velocidad 1.9 veces superior a la de los sistemas anteriores que utilizaron FP8.

2. NVFP4 ofrece gran precisión, comprobada en benchmarks de la industria

Para que las presentaciones de MLPerf Training e Inference en la división cerrada sean válidas, deben cumplir con los requisitos de precisión especificados por los benchmarks. En inferencia, las respuestas deben alcanzar ciertos umbrales de precisión, y en entrenamiento, los modelos deben ser entrenados hasta objetivos de calidad específicos.

NVIDIA logró presentar resultados en la división cerrada para cada prueba de modelo de lenguaje grande (LLM) utilizando NVFP4 en GPUs Blackwell y Blackwell Ultra en la última versión de MLPerf Training, incluyendo modelos como DeepSeek-R1 y Llama 3.1.

 Bar chart showing accuracy scores on the DeepSeek-R1 0528 model, with FP8 baseline and with NVFP4. MMLU-PRO, GPQA Diamond, HLE, and LIVECODEBENCH NVFP4 accuracy is within 1% of the FP8 baseline, SCICODE and Math-500 are the same, and on AIME 2024, NVFP4 is 2% lower.

Estos resultados se lograron utilizando versiones cuantificadas de NVFP4, cumpliendo con estrictos requisitos de benchmark.

3. NVFP4 cuenta con amplio y creciente apoyo del ecosistema

Bibliotecas como NVIDIA Model Optimizer y LLM Compressor permiten a los desarrolladores cuantificar modelos entrenados a mayor precisión a NVFP4. Esto también incluye NVFP4 KV cache para soportar contextos largos y tamaños de lote grandes mientras se preserva la precisión. Además, frameworks de inferencia populares como NVIDIA TensorRT-LLM y vLLM ya soportan la ejecución de modelos en formato NVFP4.

El ecosistema también está adoptando NVFP4 para aumentar el rendimiento en producción en una variedad de modelos. Empresas como Black Forest Labs y Radical Numerics están trabajando con NVIDIA para escalar NVFP4 en sus implementaciones.

Black Forest Labs logró una mejora de hasta 6.3x en la inferencia de FLUX.2 utilizando optimizaciones como CUDA Graphs y NVFP4, según su CEO.

Radical Numerics está utilizando NVFP4 para acelerar el escalado de modelos científicos, mostrando gran optimismo hacia el uso de recetas de baja precisión para sus nuevas arquitecturas.

La NVIDIA Transformer Engine incorpora una implementación de la receta de entrenamiento NVFP4, permitiendo a los desarrolladores iniciar sus proyectos. NVIDIA continúa innovando y colaborando con el ecosistema para llevar los beneficios de NVFP4 a modelos más inteligentes y complejos.

Aprende más

El uso de NVFP4 puede generar grandes mejoras de rendimiento en las plataformas NVIDIA Blackwell y NVIDIA Rubin. A través de un diseño extremo, se logran estos avances con una excelente precisión en el entrenamiento y la inferencia de modelos. Las versiones NVFP4 de LLMs abiertos son ampliamente accesibles, permitiendo su uso con mayor rendimiento y menor costo por millón de tokens.

Descubre más sobre cómo los saltos arquitectónicos significativos habilitados por la plataforma Rubin permiten nuevos niveles de rendimiento en entrenamiento e inferencia de IA.

Ilustración de un hombre mayor con auriculares y chaqueta