Los sistemas NVIDIA GB200 NVL72 y NVIDIA GB300 NVL72, que incorporan la arquitectura Blackwell, son supercomputadoras a escala de rack. Están diseñados con 18 bandejas de cómputo estrechamente acopladas, grandes tejidos de GPU y redes de alta capacidad en un solo paquete.
Para arquitectos de IA y operadores de plataformas de HPC, el desafío no es solo organizar el hardware, sino transformar la infraestructura en recursos seguros, eficientes y fáciles de usar para los usuarios finales. La falta de coincidencia entre la topología del hardware a escala de rack y las abstracciones de los programadores es donde reside la mayor parte de la complejidad operativa.
Superando la complejidad operativa
Este es el vacío que un stack de software validado, como NVIDIA Mission Control, está diseñado para llenar. Este sistema proporciona planos de control a escala de rack para los sistemas NVIDIA Grace Blackwell NVL72.
Con un entendimiento nativo de NVIDIA NVLink y NVIDIA IMEX, se integra con plataformas de gestión de cargas de trabajo como Slurm y NVIDIA Run:ai.
Desafío principal: topología a escala de rack y programación de cargas de trabajo de IA
A nivel físico, los sistemas GB300 NVL72 y GB200 NVL72 son sofisticados y potentes. Cada uno ofrece un tejido denso de GPU conectado por interruptores NVLink, soportando NVIDIA Multi-Node NVLink (MNNVL) dentro del rack.
Sin embargo, los programadores no operan a nivel de interruptores y tejidos. Requieren:
- Grupos discretos de recursos de GPU que puedan asignarse de manera predecible.
- Fronteras de aislamiento claras para proteger las cargas de trabajo entre sí.
- Características de rendimiento consistentes que coincidan con las expectativas del usuario.
Identificadores clave en la programación de cargas de trabajo

Bajo el capó, la topología NVLink de un rack Grace Blackwell NVL72 se refleja en el stack de software a través de un par de identificadores a nivel de sistema: UUID de clúster y ID de clique.
Estos identificadores codifican la posición de una GPU en el tejido NVLink a través de dominios o racks, de manera que el software del sistema, los programadores y las herramientas de nivel superior puedan razonar sobre ellos.
Integración de Slurm y gestión de cargas de trabajo
Cuando se ejecutan cargas de trabajo en sistemas NVL72 basados en Blackwell, el ubicación de las tareas es tan importante como el número de GPU. Un trabajo de 16 GPU repartido en los nodos equivocados puede comportarse de manera muy diferente al mismo trabajo confinado a un solo tejido NVLink.
Es aquí donde el plugin de topología/bloque de Slurm se vuelve esencial, permitiendo que Slurm reconozca que no todos los nodos son iguales.
En los bloques de nodos de Grace Blackwell NVL72, las conexiones de menor latencia se mapean directamente a las particiones NVLink, grupos de GPU que comparten un tejido NVLink de alta capacidad.

Al habilitar el plugin de topología/bloque y exponer las particiones NVLink como bloques, Slurm adquiere el contexto necesario para tomar mejores decisiones. Los trabajos se colocan dentro de una única partición NVLink (o bloque) por defecto, preservando el rendimiento de MNNVL.
Gestión IMEX con Slurm
Para cargas de trabajo multi-nodo que dependen de MNNVL, IMEX permite que GPUs en diferentes bandejas de cómputo participen en un modelo de programación de memoria compartida.

Desde el punto de vista de la aplicación, usar MNNVL parece sencillo. Sin embargo, Mission Control asegura que varios aspectos se alineen al ejecutar trabajos MNNVL con Slurm:
- IMEX se ejecuta en exactamente el conjunto de bandejas de cómputo que participan en el trabajo.
- Esas bandejas pertenecen a una partición NVLink común.
- El ciclo de vida de IMEX es confiable y seguro, evitando interferencias entre trabajos.
Soporte multi-nodo NVLink para Kubernetes y NVIDIA Run:ai
Así como Slurm necesita ayuda para comprender los tejidos NVLink, Kubernetes también carece de conciencia nativa sobre interconexiones de alta capacidad a escala de rack como NVLink.
Para abordar esto, el ecosistema NVIDIA combina ComputeDomains (a través del controlador DRA de GPU de NVIDIA) y integración de NVIDIA Run:ai, elevando conceptos de NVLink e IMEX a primitivas listas para programadores.
Kubernetes y la colocación consciente de NVLink
En Kubernetes, el desafío es similar al de Slurm. Los pods de Kubernetes necesitan ser ubicados en nodos que compartan conectividad de alta capacidad. Kubernetes no comprende por sí mismo los dominios NVLink, por lo que las cargas de trabajo pueden dispersarse entre nodos que carecen de la conectividad necesaria para una ejecución eficiente multi-nodo.
La solución es el concepto de ComputeDomains proporcionado por el controlador DRA de NVIDIA para GPUs.
Aprenda más sobre operaciones avanzadas de IA
Visite la Guía del Administrador de Mission Control o la Guía del Usuario para obtener más información sobre la implementación.


