NVIDIA presenta Groq 3 LPX, acelerador de inferencia de baja latencia para IA

NVIDIA Groq 3 LPX es un nuevo acelerador de inferencia a escala de rack diseñado para la plataforma NVIDIA Vera Rubin. Este dispositivo se centra en las demandas de baja latencia y gran contexto de los sistemas agénticos. Co-diseñado con el NVIDIA Vera Rubin NVL72, LPX potencia la fábrica de IA con un motor optimizado para la generación rápida y predecible de tokens, mientras que Vera Rubin NVL72 actúa como un caballo de batalla flexible y de propósito general para el entrenamiento y la inferencia.

Este avance es crucial, ya que el futuro agéntico exige una nueva categoría de inferencia. A medida que las velocidades de generación se acercan a 1,000 tokens por segundo por usuario, los modelos superan la interacción a velocidad de conversación, evolucionando hacia una computación que simula y responde de manera continua. Esto permite experiencias más parecidas a la colaboración en tiempo real que a un chat por turnos.

La combinación de Vera Rubin NVL72 y LPX crea una arquitectura heterogénea que soporta un alto rendimiento de token y una experiencia de IA interactiva responsiva.

Presentando NVIDIA Groq 3 LPX

La integración de Vera Rubin y LPX ofrece un rendimiento extremo, proporcionando hasta 35 veces más rendimiento de inferencia por megavatio y hasta 10 veces más oportunidades de ingresos para modelos de un trillón de parámetros. Integrado con la arquitectura MGX ETL y alineado con la plataforma Vera Rubin, LPX proporciona una manera para que los centros de datos desplieguen un camino de inferencia de baja latencia junto a Vera Rubin NVL72.

Su arquitectura está compuesta por 256 aceleradores NVIDIA Groq 3 LPU interconectados, enfatizando una ejecución determinista y un alto ancho de banda de SRAM en chip, lo que permite mantener la inferencia interactiva responsiva.

Figura 1. Sistema de rack NVIDIA Groq 3 LPX

En escala de rack, LPX ofrece:

Especificación NVIDIA Groq 3 LPX
Cómputo de inferencia AI 315 PFLOPS
Capacidad total de SRAM 128 GB
Ancho de banda de SRAM en chip 40 PB/s
Densidad de escalado 256 chips
Ancho de banda de escalado 640 TB/s
Tabla 1. Especificaciones de NVIDIA Groq 3 LPX

LPX y Vera Rubin NVL72 crean una arquitectura de inferencia más heterogénea que soporta altos niveles de producción de tokens y experiencias AI interactivas responsivas.

Dentro de la bandeja de cómputo NVIDIA Groq 3 LPX

El acelerador LPX a escala de rack contiene 32 bandejas de cómputo de 1U refrigeradas por líquido, cada una diseñada para soportar inferencia de baja latencia a gran escala. Cada bandeja integra ocho aceleradores LPU, un procesador anfitrión y lógica de expansión de fabric en un diseño sin cables.

Los enlaces chip-a-chip (C2C) permiten una comunicación directa dentro de la bandeja y entre bandejas, siendo crucial para la eficiencia del sistema, ya que la inferencia interactiva depende de cómo se mueve eficientemente la data.

A 1U NVIDIA Groq 3 LPX compute tray showing eight Groq 3 LPU modules connected to an on-tray Fabric Expansion Logic, DRAM, Host CPU, BlueField-4 DPU, and backplane and front-panel connections in a cableless, liquid-cooled design.
Figura 2. Bandeja de cómputo y módulo NVIDIA Groq 3 LPX

Cada bandeja proporciona:

Recurso Por bandeja LPX
Chips LP30 8
SRAM en chip 4 GB
Ancho de banda de SRAM 1.2 PB/s
DRAM a través de lógica de expansión Hasta 256 GB
DRAM a través de CPU anfitrión Hasta 128 GB
Cómputo de inferencia AI (FP8) 9.6 PFLOPS
Ancho de banda de escalado 20 TB/s
Tabla 2. Especificaciones de la bandeja de cómputo NVIDIA Groq 3 LPX

LPX está diseñado para regímenes de inferencia donde la coordinación y la variabilidad pueden ser visibles. Esto es relevante a medida que las aplicaciones de IA se mueven hacia una generación interactiva.

Primer vistazo a la arquitectura del NVIDIA Groq 3 LPU

En el corazón de LPX se encuentra el NVIDIA Groq 3 LPU, diseñado para generar tokens de manera rápida y predecible. La arquitectura del LPU enfatiza la ejecución determinista y un alto ancho de banda de memoria en chip.

A simplified diagram of the NVIDIA Groq 3 LPU showing compute, memory, control, and chip-to-chip communication blocks, with callouts for tensor-first compute, high SRAM bandwidth, and direct chip-to-chip interconnect.
Figura 3. Arquitectura del chip NVIDIA Groq 3 LPU

Cómputo orientado a tensores y movimiento de datos explícito

Las operaciones aritméticas, acceso a memoria y transferencias interdispositivo operan sobre vectores de 320 bytes, simplificando la programación y sincronización.

  • Módulos de ejecución de matrices (MXM): Proporcionan capacidad de multiplicación y acumulación densa para operaciones tensoriales.
  • Módulos de ejecución vectorial (VXM): Manejan aritmética punto a punto y funciones de activación.
  • Módulos de ejecución de conmutación (SXM): Realizan movimientos de datos estructurados, como permutaciones y transposiciones.

El LPU permite que el acceso a memoria, cómputo y comunicación se superpongan, evitando depender de heurísticas de hardware.

MEM permite un ancho de banda extremo de memoria en chip

El bloque MEM es una arquitectura de memoria plana, donde 500 MB de SRAM en chip sirven como almacenamiento de trabajo principal para inferencia.

Debido a que la capacidad de SRAM en chip es finita, modelos más grandes se distribuyen entre varios aceleradores LPU interconectados.

Escalado C2C con comunicación predecible

Para escalar la inferencia entre múltiples dispositivos, el LPU incluye enlaces C2C de alto rendimiento que permiten un intercambio de datos determinista.

Ejecución determinista orquestada por el compilador

El LPU se basa en un modelo de ejecución espacial, donde el compilador programa explícitamente la computación y el movimiento de datos.

La transición hacia la inferencia interactiva

La inferencia AI abarca un amplio espectro de rendimiento. Por un lado, están los servicios optimizados para el rendimiento, mientras que por otro, los servicios optimizados para la latencia, donde los retrasos son inmediatamente visibles para los usuarios.

A medida que los modelos producen salidas más largas y las ventanas de contexto crecen, más carga de trabajo se desplaza al decodificador, donde los tokens se generan secuencialmente.

Lo que hace más difícil la inferencia interactiva

Las tendencias actuales hacen que la inferencia interactiva de baja latencia sea más importante y difícil de servir eficientemente. A medida que los modelos generan salidas más largas, la carga de trabajo se desplaza a la generación secuencial de tokens.

Esto se complica aún más en la IA agéntica, donde los sistemas pasan por ciclos de inferencia y razonamiento, donde la latencia se acumula en cada paso.

La era de la inferencia agéntica requiere una nueva arquitectura

La inferencia no es una carga de trabajo uniforme. Cada fase tiene diferentes demandas de hardware, y optimizar la canalización para un solo régimen obliga a compromisos.

Una arquitectura heterogénea combina el rendimiento interactivo de baja latencia con un alto rendimiento de la fábrica AI, lo que permite un aumento de la interactividad sin sacrificar la salida de la fábrica AI.

A conceptual chart showing how throughput-optimized hardware, low-latency hardware, and a heterogeneous combination each occupy different parts of the tradeoff between AI factory throughput and interactive responsiveness.
Figura 4. Inferencia heterogénea expande la frontera de Pareto

Vera Rubin NVL72 se encuentra con LPX

La inferencia moderna es una carrera de relevos. El hardware que maneja la carga de contexto no necesita anclar el sprint hacia el siguiente token.

LPX agrega un camino especializado optimizado para la generación rápida de tokens de baja latencia, facilitando un diseño de inferencia heterogénea.

Diagram comparing NVIDIA Rubin GPU and Groq 3 LPU, highlighting Rubin’s high FLOPS and large HBM memory versus Groq 3 LPU’s high-bandwidth on-chip SRAM for low-latency inference.
Figura 5. Uniendo procesadores de extremo FLOPS y ancho de banda

Fase de decodificación: Un ciclo de múltiples motores

La fase de prellenado está dominada por la ingesta de grandes entradas y la construcción de la caché KV, un trabajo que se beneficia de un cómputo paralelo denso.

La fase de decodificación es diferente, ya que diferentes partes de ese ciclo estresan diferentes cuellos de botella. En la plataforma Vera Rubin, la decodificación se entiende como un ciclo de dos motores.

Diagram showing decode as a two-engine loop where Rubin GPUs handle attention over the KV cache while LPUs execute feed-forward or MoE layers, exchanging intermediate activations (interim tensor state) each token to improve latency and throughput.
Figura 6. Decodificación AFD explicada

LPX está diseñado para operar como una unidad de cómputo coordinada, minimizando la sobrecarga de coordinación y reduciendo la variabilidad.

NVIDIA Dynamo hace que la decodificación heterogénea sea operativa

Para que la decodificación heterogénea sea práctica, se necesita un software que clasifique solicitudes y dirija el trabajo según los objetivos de latencia.

NVIDIA Dynamo proporciona esa capa de orquestación al coordinar la entrega disgregada y la decodificación disgregada a través de respaldos heterogéneos.

Diagram showing NVIDIA Dynamo coordinating heterogeneous inference across two racks. Large context is processed on VR NVL72 GPUs for prefill and KV cache creation. During decode, GPUs run attention over the KV cache while LPX runs FFN/MoE execution, with interim decode activations exchanged between GPU and LPX in a repeated loop to generate tokens.
Figura 7. Dynamo orquesta cómputo heterogéneo

Con programación impulsada por objetivos de latencia y transferencias de bajo costo, Dynamo ayuda a mantener sesiones interactivas fuera de largas colas, reduciendo la variabilidad y manteniendo una latencia estable.

Acelerando la decodificación especulativa con LPX

La decodificación especulativa se está convirtiendo en una técnica importante para reducir la latencia en la inferencia de LLM.

LPX es adecuado para actuar como el motor de generación de borradores en esta arquitectura, permitiendo una generación de tokens rápida.

Diagram showing speculative decoding where a GPU target model verifies tokens generated by a draft model running on LPX, allowing multiple tokens to be accepted per step and reducing inference latency.
Figura 8. Decodificación especulativa con verificación de GPU

Desbloqueando enjambres agénticos inteligentes

A medida que los casos de uso de IA evolucionan hacia flujos de trabajo agénticos, la capacidad de respuesta se convierte en un requisito. En este contexto, la inferencia heterogénea es esencial.

 Chart showing compute requirements increasing with interactivity as AI evolves from offline inference and simple chatbots to reasoning workflows, coding assistants, and autonomous multi-agent systems.
Figura 9. Requisitos de cómputo e interactividad para varios flujos de trabajo de IA

Desbloqueando una nueva categoría de experiencias AI en la frontera de Pareto

Un enfoque práctico para visualizar el compromiso entre rendimiento y costo es la frontera de Pareto, que traza la interactividad del usuario contra el rendimiento de la fábrica AI.

Alcanzar estos puntos de operación premium con una sola plataforma homogénea obliga a un compromiso entre la capacidad de respuesta y el rendimiento general de la fábrica AI.

Chart comparing AI factory efficiency (TPS per megawatt) versus interactivity (tokens per second per user), showing that combining Vera Rubin NVL72 with Groq 3 LPX maintains higher throughput at higher interactivity levels, 35 times compared with Grace Blackwell NVL72 systems at 400 TPS per user interactivity.
Figura 10. Desbloqueando una nueva categoría de experiencias AI con Vera Rubin NVL72 y Groq 3 LPX

Esta transición tiene un impacto económico directo, ya que una mayor capacidad de respuesta permite que una fábrica de IA sirva experiencias premium y aumenta el valor por unidad de infraestructura.

 Bar chart comparing estimated annual revenue per gigawatt across service tiers (Free, Medium, High, Premium, Ultra) for Blackwell, Rubin, and Rubin+LPX, showing higher revenue in the Premium and Ultra tiers with Rubin+LPX. A callout on the right summarizes total annual revenue increasing from B (Blackwell) to 0B (Rubin) to 0B (Rubin+LPX), highlighting a 10X expansion.
Figura 11. NVIDIA Vera Rubin NVL72 y LPX proporcionan una oportunidad de ingresos 10X

Lo que NVIDIA Groq 3 LPX permite a los desarrolladores

Los desarrolladores están construyendo sistemas que requieren tres cosas a la vez:

  • Responsividad: baja latencia y predecible para experiencias interactivas.
  • Capacidad: calidad de modelo fuerte y comprensión de contexto largo.
  • Escala: alta eficiencia de costo para servir a muchos usuarios concurrentes.

LPX amplía el conjunto de cargas de trabajo que una fábrica de IA puede atender eficientemente.

Aprende más

Profundiza en la arquitectura detrás de NVIDIA Groq 3 LPX y Vera Rubin comenzando con las páginas de productos de NVIDIA y los blogs técnicos que cubren la plataforma Vera Rubin, LPX, AFD, y Dynamo.

Recursos

Agradecimientos

Agradecimientos a Amr Elmeleegy, Andrew Bitar, Andrew Ling, Graham Steele, Itay Neeman, Jamie Li, Omar Kilani, Santosh Raghavan y Stuart Pitts, junto con muchos otros líderes de productos, ingenieros y arquitectos de NVIDIA que contribuyeron a este post.

Ilustración de un hombre mayor con auriculares y chaqueta