La capacidad de cómputo de grandes flotas de GPU ofrece oportunidades sin precedentes para innovar y proporcionar valor a los clientes de manera rápida. Sin embargo, estas innovaciones presentan diversos desafíos. A gran escala, los equipos deben manejar hardware heterogéneo, pilas de software en constante evolución, restricciones de energía ajustadas y cargas de trabajo multitenant variables. Un solo punto crítico, un controlador mal configurado o un sutil fallo de hardware pueden causar problemas significativos, como trabajos restringidos y gastos innecesarios.
La complejidad y el número de componentes en clústeres de gran escala pueden ser abrumadores. Por tanto, es esencial mantener visibilidad sobre las operaciones diarias y entender el estado operativo en cualquier momento. Monitorear la utilización de GPU e identificar cuellos de botella durante la ejecución de trabajos se vuelve más complicado. Identificar áreas de baja utilización y migrar cargas de trabajo hacia ellas es una excelente forma de asegurar el máximo retorno de inversión.
Monitoreo de GPU: Áreas clave
Por estas razones, el monitoreo consciente de GPU es fundamental a gran escala. Los equipos necesitan visibilidad más allá de saber si el nodo está activo. Necesitan confirmar si, en cualquier momento, cada acelerador está funcionando como se espera, de forma segura y consistente. Las áreas importantes del monitoreo de GPU incluyen la energía, la temperatura, el rendimiento, la salud y la configuración uniforme.
- Poder: Monitorear el uso de energía y el estrangulamiento para mantenerse dentro de los presupuestos del centro de datos, maximizando el rendimiento por vatio.
- Temperatura: Detectar puntos críticos y problemas de flujo de aire para evitar el estrangulamiento térmico y el envejecimiento prematuro de los componentes.
- Rendimiento: Observar la utilización, el ancho de banda de memoria, la salud de interconexiones y las razones de estrangulamiento para identificar regresiones e imbalances.
- Salud: Mostrar errores ECC y XID, páginas retiradas, anomalías HBM/NVLink/PCIe y otras señales RAS para detectar partes fallidas antes de que se presenten problemas.
- Configuración uniforme e integridad: Como parte de la validación del inventario de GPU, verificar controladores, firmware y configuraciones de BIOS consistentes para garantizar resultados reproducibles y operación segura, así como verificar la integridad del firmware.
¿Qué es NVIDIA Fleet Intelligence?
NVIDIA Fleet Intelligence es un servicio gestionado de bajo nivel y agnóstico al despliegue, utilizado independientemente de la pila de software o la elección de programador. Inicialmente, este servicio apoya a clientes de GPU y CPU en centros de datos que gestionan su propia infraestructura, así como ingenieros que requieren más información sobre el comportamiento de GPU y CPU.
El servicio aprovecha tecnología e IP del portafolio de productos de NVIDIA y aprendizajes de la operación de su flota de cientos de miles de GPUs a través de NVIDIA DGX Cloud.
Fleet Intelligence utiliza un agente de bajo impacto, basado en host, para transmitir telemetría de GPU a la nube completamente gestionada del servicio. NVIDIA lanza el agente de Fleet Intelligence como un proyecto de código abierto para auditoría. Este agente utiliza otras soluciones de código abierto de NVIDIA como GPUd, NVIDIA Data Center GPU Manager (DCGM) y el Attestation SDK. Para más información, visita NVIDIA/fleet-intelligence-agent en GitHub.
Características principales del servicio
Esta versión GA se centra en tres áreas principales:
- Inventario y visualización
- Informes, alertas y chequeos de salud
- Integridad y atestación
Inventario y visualización
Fleet Intelligence ofrece una rica capacidad para visualizar el inventario global de flotas en centros de datos y nubes. Un agente, con un impacto mínimo, se instala a través de gestores de paquetes de Linux o helm install en los nodos de trabajo de GPU.
Una vez inscrito, el agente captura información a nivel de nodo que se muestra en el portal de salud en NVIDIA NGC. Como usuario, puedes ver la utilización de tu flota de GPU a nivel global o por zonas de cómputo, incluyendo grupos de nodos inscritos en la misma ubicación física o en la nube.
En cualquier nivel de la infraestructura, se muestran inmediatamente anomalías, por ejemplo, por errores o umbrales superados en el consumo de energía o temperatura. Esto permite un acceso directo para revisar información detallada sobre lo que activó la alerta.
Informes, alertas y chequeos de salud
El agente de Fleet Intelligence utiliza tecnología de GPUd y DCGM. Las métricas proporcionadas por ambas herramientas son analizadas y comunicadas al Servicio de Salud para su revisión. El agente permite que Fleet Intelligence monitoree la salud de la flota en casi tiempo real, así como ejecutar chequeos de salud periódicos. Este recoge telemetría sobre host, GPUs, NVLink y redes para ofrecer una visión holística de la salud del sistema en general.
A medida que se recopilan las señales, el servicio analiza errores en el contexto del estado actual y la historia para proporcionar recomendaciones sobre acciones de remediación. El agente es de solo lectura, no realizará modificaciones en la configuración del host, y solo recogerá telemetría y datos de estado de la máquina. Para verificar los datos recopilados, puedes escribir una salida de muestra localmente o revisar el código fuente del repositorio público.

Integridad y atestación
Utilizando tecnología de soluciones de NVIDIA Confidential Computing, Fleet Intelligence verifica criptográficamente la integridad de la GPU, asegurando la autenticidad y confiabilidad de tu sistema. El agente de Fleet Intelligence utiliza el Attestation SDK para obtener mediciones de la GPU en tiempo de ejecución. Estas mediciones son firmadas digitalmente utilizando certificados en el dispositivo basados en la raíz de confianza de NVIDIA.
La evidencia se envía al NVIDIA Remote Attestation Service (NRAS) a través de un canal seguro para verificación. El servicio NRAS utiliza Reference Integrity Manifests (RIMs), estructuras generadas como parte de las construcciones de vBIOS. Este servicio valida que la evidencia coincida con los valores esperados y devuelve un resultado de aprobación o rechazo al servicio de Fleet Intelligence.
Finalmente, puedes acceder a tus paneles de inventario y ver los chequeos de integridad que se realizan diariamente o a demanda. Estas verificaciones aseguran que cada GPU de la flota tenga configuraciones conocidas y actualizadas. También puedes crear informes de Fleet Intelligence que detallen la información de la flota de GPU con el estado de integridad actual, los cuales pueden ser descargados y utilizados con otras herramientas de reporte.
Según Chuan Li, Director Científico en Lambda, «NVIDIA Fleet Intelligence brindó a nuestro equipo de investigación visibilidad completa de nuestra flota de GPU NVIDIA Blackwell/Hopper con una configuración mínima. Sus alertas detectan tanto fallos activos como señales de advertencia tempranas. Sus informes convierten la salud de toda la flota en información procesable.»
Iniciar con NVIDIA Fleet Intelligence
El servicio NVIDIA Fleet Intelligence proporciona información integral sobre energía, temperatura, rendimiento, salud y configuración de flotas de GPU y CPU de NVIDIA, asegurando que cada chip opere con eficiencia y confiabilidad óptimas. La integración de agentes de bajo impacto para telemetría en tiempo real, junto con robustos mecanismos de visualización y alertas, empodera a las empresas para maximizar el ROI y mantener estándares operativos óptimos.
El agente de Fleet Intelligence de código abierto y la incorporación de tecnologías de integridad y atestación de vanguardia subrayan el compromiso de NVIDIA con la transparencia y la seguridad. A medida que las empresas continúan escalando implementaciones de GPU y CPU, Fleet Intelligence proporciona herramientas esenciales para navegar en las complejidades de los modernos centros de datos, asegurando un rendimiento sostenible y predecible en diversos entornos.
Solicita acceso a NVIDIA Fleet Intelligence y experimenta de primera mano cómo puede mejorar la disponibilidad y la integridad de tu flota de GPU. Este servicio está disponible y se ofrece sin costo alguno a los propietarios, operadores y inquilinos de GPU en centros de datos de NVIDIA. Fleet Intelligence es compatible con arquitecturas de GPU de clase centro de datos de NVIDIA como Vera Rubin, Blackwell y Hopper. La atestación solo se admite en Vera Rubin y Blackwell.


