NVIDIA Groq 3 LPX es un nuevo acelerador de inferencia a escala de rack diseñado para la plataforma NVIDIA Vera Rubin. Este dispositivo se centra en las demandas de baja latencia y gran contexto de los sistemas agénticos. Co-diseñado con el NVIDIA Vera Rubin NVL72, LPX potencia la fábrica de IA con un motor optimizado para la generación rápida y predecible de tokens, mientras que Vera Rubin NVL72 actúa como un caballo de batalla flexible y de propósito general para el entrenamiento y la inferencia.
Este avance es crucial, ya que el futuro agéntico exige una nueva categoría de inferencia. A medida que las velocidades de generación se acercan a 1,000 tokens por segundo por usuario, los modelos superan la interacción a velocidad de conversación, evolucionando hacia una computación que simula y responde de manera continua. Esto permite experiencias más parecidas a la colaboración en tiempo real que a un chat por turnos.
La combinación de Vera Rubin NVL72 y LPX crea una arquitectura heterogénea que soporta un alto rendimiento de token y una experiencia de IA interactiva responsiva.
Presentando NVIDIA Groq 3 LPX
La integración de Vera Rubin y LPX ofrece un rendimiento extremo, proporcionando hasta 35 veces más rendimiento de inferencia por megavatio y hasta 10 veces más oportunidades de ingresos para modelos de un trillón de parámetros. Integrado con la arquitectura MGX ETL y alineado con la plataforma Vera Rubin, LPX proporciona una manera para que los centros de datos desplieguen un camino de inferencia de baja latencia junto a Vera Rubin NVL72.
Su arquitectura está compuesta por 256 aceleradores NVIDIA Groq 3 LPU interconectados, enfatizando una ejecución determinista y un alto ancho de banda de SRAM en chip, lo que permite mantener la inferencia interactiva responsiva.
En escala de rack, LPX ofrece:
| Especificación | NVIDIA Groq 3 LPX |
| Cómputo de inferencia AI | 315 PFLOPS |
| Capacidad total de SRAM | 128 GB |
| Ancho de banda de SRAM en chip | 40 PB/s |
| Densidad de escalado | 256 chips |
| Ancho de banda de escalado | 640 TB/s |
LPX y Vera Rubin NVL72 crean una arquitectura de inferencia más heterogénea que soporta altos niveles de producción de tokens y experiencias AI interactivas responsivas.
Dentro de la bandeja de cómputo NVIDIA Groq 3 LPX
El acelerador LPX a escala de rack contiene 32 bandejas de cómputo de 1U refrigeradas por líquido, cada una diseñada para soportar inferencia de baja latencia a gran escala. Cada bandeja integra ocho aceleradores LPU, un procesador anfitrión y lógica de expansión de fabric en un diseño sin cables.
Los enlaces chip-a-chip (C2C) permiten una comunicación directa dentro de la bandeja y entre bandejas, siendo crucial para la eficiencia del sistema, ya que la inferencia interactiva depende de cómo se mueve eficientemente la data.

Cada bandeja proporciona:
| Recurso | Por bandeja LPX |
| Chips LP30 | 8 |
| SRAM en chip | 4 GB |
| Ancho de banda de SRAM | 1.2 PB/s |
| DRAM a través de lógica de expansión | Hasta 256 GB |
| DRAM a través de CPU anfitrión | Hasta 128 GB |
| Cómputo de inferencia AI (FP8) | 9.6 PFLOPS |
| Ancho de banda de escalado | 20 TB/s |
LPX está diseñado para regímenes de inferencia donde la coordinación y la variabilidad pueden ser visibles. Esto es relevante a medida que las aplicaciones de IA se mueven hacia una generación interactiva.
Primer vistazo a la arquitectura del NVIDIA Groq 3 LPU
En el corazón de LPX se encuentra el NVIDIA Groq 3 LPU, diseñado para generar tokens de manera rápida y predecible. La arquitectura del LPU enfatiza la ejecución determinista y un alto ancho de banda de memoria en chip.

Cómputo orientado a tensores y movimiento de datos explícito
Las operaciones aritméticas, acceso a memoria y transferencias interdispositivo operan sobre vectores de 320 bytes, simplificando la programación y sincronización.
- Módulos de ejecución de matrices (MXM): Proporcionan capacidad de multiplicación y acumulación densa para operaciones tensoriales.
- Módulos de ejecución vectorial (VXM): Manejan aritmética punto a punto y funciones de activación.
- Módulos de ejecución de conmutación (SXM): Realizan movimientos de datos estructurados, como permutaciones y transposiciones.
El LPU permite que el acceso a memoria, cómputo y comunicación se superpongan, evitando depender de heurísticas de hardware.
MEM permite un ancho de banda extremo de memoria en chip
El bloque MEM es una arquitectura de memoria plana, donde 500 MB de SRAM en chip sirven como almacenamiento de trabajo principal para inferencia.
Debido a que la capacidad de SRAM en chip es finita, modelos más grandes se distribuyen entre varios aceleradores LPU interconectados.
Escalado C2C con comunicación predecible
Para escalar la inferencia entre múltiples dispositivos, el LPU incluye enlaces C2C de alto rendimiento que permiten un intercambio de datos determinista.
Ejecución determinista orquestada por el compilador
El LPU se basa en un modelo de ejecución espacial, donde el compilador programa explícitamente la computación y el movimiento de datos.
La transición hacia la inferencia interactiva
La inferencia AI abarca un amplio espectro de rendimiento. Por un lado, están los servicios optimizados para el rendimiento, mientras que por otro, los servicios optimizados para la latencia, donde los retrasos son inmediatamente visibles para los usuarios.
A medida que los modelos producen salidas más largas y las ventanas de contexto crecen, más carga de trabajo se desplaza al decodificador, donde los tokens se generan secuencialmente.
Lo que hace más difícil la inferencia interactiva
Las tendencias actuales hacen que la inferencia interactiva de baja latencia sea más importante y difícil de servir eficientemente. A medida que los modelos generan salidas más largas, la carga de trabajo se desplaza a la generación secuencial de tokens.
Esto se complica aún más en la IA agéntica, donde los sistemas pasan por ciclos de inferencia y razonamiento, donde la latencia se acumula en cada paso.
La era de la inferencia agéntica requiere una nueva arquitectura
La inferencia no es una carga de trabajo uniforme. Cada fase tiene diferentes demandas de hardware, y optimizar la canalización para un solo régimen obliga a compromisos.
Una arquitectura heterogénea combina el rendimiento interactivo de baja latencia con un alto rendimiento de la fábrica AI, lo que permite un aumento de la interactividad sin sacrificar la salida de la fábrica AI.

Vera Rubin NVL72 se encuentra con LPX
La inferencia moderna es una carrera de relevos. El hardware que maneja la carga de contexto no necesita anclar el sprint hacia el siguiente token.
LPX agrega un camino especializado optimizado para la generación rápida de tokens de baja latencia, facilitando un diseño de inferencia heterogénea.

Fase de decodificación: Un ciclo de múltiples motores
La fase de prellenado está dominada por la ingesta de grandes entradas y la construcción de la caché KV, un trabajo que se beneficia de un cómputo paralelo denso.
La fase de decodificación es diferente, ya que diferentes partes de ese ciclo estresan diferentes cuellos de botella. En la plataforma Vera Rubin, la decodificación se entiende como un ciclo de dos motores.

LPX está diseñado para operar como una unidad de cómputo coordinada, minimizando la sobrecarga de coordinación y reduciendo la variabilidad.
NVIDIA Dynamo hace que la decodificación heterogénea sea operativa
Para que la decodificación heterogénea sea práctica, se necesita un software que clasifique solicitudes y dirija el trabajo según los objetivos de latencia.
NVIDIA Dynamo proporciona esa capa de orquestación al coordinar la entrega disgregada y la decodificación disgregada a través de respaldos heterogéneos.

Con programación impulsada por objetivos de latencia y transferencias de bajo costo, Dynamo ayuda a mantener sesiones interactivas fuera de largas colas, reduciendo la variabilidad y manteniendo una latencia estable.
Acelerando la decodificación especulativa con LPX
La decodificación especulativa se está convirtiendo en una técnica importante para reducir la latencia en la inferencia de LLM.
LPX es adecuado para actuar como el motor de generación de borradores en esta arquitectura, permitiendo una generación de tokens rápida.

Desbloqueando enjambres agénticos inteligentes
A medida que los casos de uso de IA evolucionan hacia flujos de trabajo agénticos, la capacidad de respuesta se convierte en un requisito. En este contexto, la inferencia heterogénea es esencial.

Desbloqueando una nueva categoría de experiencias AI en la frontera de Pareto
Un enfoque práctico para visualizar el compromiso entre rendimiento y costo es la frontera de Pareto, que traza la interactividad del usuario contra el rendimiento de la fábrica AI.
Alcanzar estos puntos de operación premium con una sola plataforma homogénea obliga a un compromiso entre la capacidad de respuesta y el rendimiento general de la fábrica AI.

Esta transición tiene un impacto económico directo, ya que una mayor capacidad de respuesta permite que una fábrica de IA sirva experiencias premium y aumenta el valor por unidad de infraestructura.

Lo que NVIDIA Groq 3 LPX permite a los desarrolladores
Los desarrolladores están construyendo sistemas que requieren tres cosas a la vez:
- Responsividad: baja latencia y predecible para experiencias interactivas.
- Capacidad: calidad de modelo fuerte y comprensión de contexto largo.
- Escala: alta eficiencia de costo para servir a muchos usuarios concurrentes.
LPX amplía el conjunto de cargas de trabajo que una fábrica de IA puede atender eficientemente.
Aprende más
Profundiza en la arquitectura detrás de NVIDIA Groq 3 LPX y Vera Rubin comenzando con las páginas de productos de NVIDIA y los blogs técnicos que cubren la plataforma Vera Rubin, LPX, AFD, y Dynamo.
Recursos
Agradecimientos
Agradecimientos a Amr Elmeleegy, Andrew Bitar, Andrew Ling, Graham Steele, Itay Neeman, Jamie Li, Omar Kilani, Santosh Raghavan y Stuart Pitts, junto con muchos otros líderes de productos, ingenieros y arquitectos de NVIDIA que contribuyeron a este post.

