Optimización de rendimiento en inferencias de IA con NVIDIA Run:ai y fracciones de GPU

A medida que las cargas de trabajo de inteligencia artificial (IA) crecen, es crucial lograr un alto rendimiento, un uso eficiente de los recursos y una latencia predecible. NVIDIA Run:ai aborda estos desafíos mediante programación inteligente y fraccionamiento dinámico de GPU, aplicable en cualquier entorno, ya sea en la nube, NCP o en instalaciones locales.

Este artículo presenta un esfuerzo conjunto de benchmarking entre NVIDIA y el proveedor de nube de IA Nebius, para evaluar cómo la asignación fraccionada de GPU en NVIDIA Run:ai puede mejorar el rendimiento de inferencia de modelos de lenguaje grande (LLM). La nube de IA de Nebius proporcionó la infraestructura necesaria, con GPUs NVIDIA dedicadas y rendimiento escalable.

Resultados del benchmarking

Los resultados muestran que los GPUs fraccionados aumentan drásticamente la capacidad efectiva sin comprometer los acuerdos de nivel de servicio (SLA) de latencia:

  • 77% de la capacidad total de GPU y 86% de la capacidad concurrente de usuarios utilizando solo 0.5 GPU, con un tiempo de respuesta de bajo un segundo.
  • Hasta 2x más usuarios concurrentes en modelos más pequeños usando 0.25 fracciones de GPU.
  • Hasta 3x más usuarios totales del sistema al ejecutar cargas de trabajo mixtas (chat, razonamiento, embeddings) en GPUs compartidos.
  • Escalado de rendimiento casi lineal en fracciones de 0.5, 0.25 y 0.125 GPU, con un impacto modesto en el tiempo de respuesta.
  • Autoscaling listo para producción sin picos de latencia o errores durante la expansión.

Este benchmarking demuestra que la programación de GPU fraccionadas es una capacidad fundamental para la inferencia eficiente de LLM a gran escala en producción.

Desafíos en la inferencia de LLM en empresas

Los departamentos de TI en empresas operan con un inventario fijo de GPUs. Desplegar LLM para inferencia requiere asignar GPUs dedicadas a instancias únicas, incluso con tráfico esporádico. Esto es necesario para cargar todos los pesos del modelo antes de una solicitud de inferencia, minimizando la latencia.

Como resultado, la mayoría de los LLMs consumen todos los GPUs asignados, dificultando la ejecución de más de un modelo con la misma piscina de GPUs. Este escenario requiere un mantenimiento manual de la asignación de GPUs a los LLMs, lo cual complica la escalabilidad y aprovechamiento de GPUs inactivas durante las horas de menor actividad.

Escalado de cargas de trabajo de inferencia con NVIDIA Run:ai y Nebius AI Cloud

La plataforma NVIDIA Run:ai aborda estos problemas con su programador de cargas de trabajo de IA de alto rendimiento, diseñado para clústeres de GPU a gran escala y asignación dinámica de GPU fraccionadas. Junto con la infraestructura de Nebius AI Cloud, se crea un marco flexible y listo para producción que maximiza el retorno de inversión en GPUs.

Las pruebas de benchmarking realizadas por NVIDIA y Nebius demostraron que NVIDIA Run:ai logró hasta 2x mayor capacidad de usuarios en hardware existente durante períodos pico, lo que confirma que las empresas pueden escalar significativamente las cargas de trabajo de inferencia sin aumentos proporcionales en la inversión en GPUs.

Fraccionamiento dinámico de GPU

NVIDIA Run:ai permite fraccionar GPUs en unidades más pequeñas que pueden servir múltiples cargas de trabajo simultáneamente. Los usuarios especifican sus requisitos de memoria y el programador asigna los recursos bajo demanda sin necesidad de configuración previa.

Se garantiza el aislamiento de memoria en tiempo de ejecución mientras los ciclos computacionales se distribuyen equitativamente entre los procesos activos. Los usuarios también pueden definir un mínimo garantizado con un límite superior que permite a las cargas consumir capacidad adicional cuando esté disponible.

Programación inteligente de cargas de trabajo

El programador de NVIDIA Run:ai actúa como el “cerebro” de la operación, analizando prioridades de carga, requisitos de recursos y capacidad del sistema para optimizar asignaciones. Este prioriza tareas sensibles a la latencia, como la inferencia en tiempo real, sobre trabajos de entrenamiento por lotes durante períodos pico.

El programador también escala automáticamente los LLMs según el número de usuarios consecutivos que realizan inferencia y la latencia de tokens, cumpliendo con los criterios establecidos por el administrador. Estas estrategias impulsan mayores tasas de utilización, reducen la complejidad operativa y disminuyen el costo total de propiedad.

Configuración de benchmarking

La pila de software se basa en las arquitecturas de referencia de NVIDIA (Figura 1), incluyendo el stack de IA de NVIDIA Enterprise para gestionar GPUs, el GPU Operator, y el NIM Operator para descargar diversos pesos de modelo.

Se ejecutaron benchmarks idénticos en dos configuraciones de hardware: un clúster on-premises con 64 GPUs NVIDIA H100 NVL y un clúster Nebius AI Cloud con 32 GPUs NVIDIA HGX B200. Este enfoque de doble entorno valida que los resultados son representativos tanto en infraestructuras autogestionadas como en despliegues en la nube pública.

Figura 1. Implementación de NVIDIA Run:ai en la Arquitectura de Referencia de NVIDIA Enterprise

Resultados del benchmarking utilizando NVIDIA Run:ai

Esta sección presenta observaciones basadas en los resultados capturados desde GenAI Perf.

Eficiencia de GPU fraccionadas a media asignación

Los resultados muestran que NVIDIA Run:ai no introduce penalizaciones de rendimiento medibles en comparación con la programación nativa de Kubernetes en todas las configuraciones de prueba.

Con 64 GPUs, NVIDIA Run:ai con asignación completa de GPU logró 10,200 usuarios concurrentes, mientras que el programador nativo alcanzó 9,934, confirmando que el programador no genera overhead.

Escalabilidad de usuarios concurrentes

Con 64 GPUs, la configuración de 0.5 GPU soportó 8,768 usuarios concurrentes, donde el TTFT para cada usuario no superó el segundo (1,000 ms), representando el 86% de la capacidad total de GPU. Esto demuestra que la asignación fraccionada permite a las empresas ejecutar múltiples modelos en GPUs compartidas sin una pérdida significativa de capacidad.

Graph showing CCU scaling from 1–64 GPUs for Meta Llama 3.1 8B. Three configurations compared: no Run:ai, Run:ai at 1.0 GPU, and Run:ai at 0.5 GPU. At 64 GPUs, 0.5 GPU delivers 86% of full CCU (8,768 vs 10,200).
Figura 2. Escalabilidad de usuarios concurrentes para Llama 3.1 8B impulsada por el clúster de GPU NVIDIA H100 NVL

Iniciar con el fraccionamiento de GPU en NVIDIA Run:ai

NVIDIA Run:ai permite una utilización eficiente de GPUs a través de una asignación dinámica y fraccionamiento. Combinado con las GPUs dedicadas de Nebius AI Cloud y la elasticidad de grado hyperscaler, las empresas pueden lograr mejoras en la utilización de GPUs bajo programación fraccionada, escalado de rendimiento casi lineal, y coexistencia limpia de cargas de trabajo mixtas.

Para un resumen ejecutivo de este benchmark, consulte Escalando Inferencia Eficiente de Grado de Producción con NVIDIA Run:ai en Nebius.

Ilustración de un hombre mayor con auriculares y chaqueta