NVIDIA impulsa la creación de redes AI para optimizar la inteligencia distribuida

Los servicios nativos de IA están enfrentando un nuevo desafío en la infraestructura de IA. A medida que millones de usuarios, agentes y dispositivos demandan acceso a inteligencia, el enfoque se desplaza de la capacidad máxima de entrenamiento a la entrega de inferencias deterministas a gran escala, con latencias y economías de tokens sostenibles.

NVIDIA anunció en GTC 2026 que las empresas de telecomunicaciones y los proveedores de nube distribuida están transformando sus redes en redes de IA. Estas redes integran computación acelerada a través de una malla de puntos de presencia regionales (POPs), oficinas centrales, centros metropolitanos y ubicaciones de borde para satisfacer las necesidades de los servicios nativos de IA.

Este artículo explica cómo las redes de IA permiten experiencias de IA en tiempo real, multimodal y hiperpersonalizadas a gran escala mediante la ejecución de inferencias en infraestructura de IA distribuida, consciente de la carga de trabajo, los recursos y los indicadores clave de rendimiento (KPI).

Ubicación inteligente de cargas de trabajo en sitios distribuidos

El diseño de referencia de la red de IA de NVIDIA proporciona un marco unificado para construir infraestructuras de IA interconectadas y orquestadas. La Figura 1 muestra cómo se integran los activos de la red en una red de IA:

Figura 1. Vista de topología de una red de IA, que abarca fábricas de IA centralizadas y nodos de borde distribuidos a través de sitios de telecomunicaciones y CDN.

Un aspecto clave de este diseño es el plano de control de la red de IA, que convierte clústeres y regiones aislados en una plataforma programable única. Su enfoque principal es determinar de manera inteligente dónde debe ejecutarse cada carga de trabajo para cumplir con sus KPI:

  • Enrutamiento consciente de KPI, que sitúa las cargas de trabajo según requisitos de latencia, restricciones de soberanía y costos.
  • Ubicación consciente de recursos que tiene en cuenta continuamente la salud de los nodos, la utilización y las cuotas para evitar sitios sobrecargados o degradados antes de que los usuarios perciban picos de latencia.
Diagram of an AI grid control plane receiving diverse workloads and routing them across multiple grid nodes based on latency, cost, policy, node health, and capacity, with KV-cache–aware routing optimizing model placement and reuse.
Figura 2. Plano de control de la red de IA que trata los puntos finales distribuidos como una única plataforma lógica para el enrutamiento consciente de cargas de trabajo y recursos.

Cargas de trabajo que más se benefician de las redes de IA

La ubicación inteligente de cargas de trabajo es más relevante para aplicaciones donde la latencia, el ancho de banda, la personalización o la soberanía se convierten en restricciones de diseño primordiales.

La siguiente tabla relaciona estas clases de carga de trabajo con aplicaciones de ejemplo y los KPI que deben optimizar para ofrecer experiencias de usuario consistentes y económicas.

Clase de carga de trabajo Aplicaciones de ejemplo KPI objetivo
Bucles de control en tiempo real sensibles a la latencia IA física (robots, sensores), agentes conversacionales, AR/VR, dispositivos portátiles Latencia y jitter de extremo a extremo dentro del SLA
Multimodal intensivo en tokens y ancho de banda Cargas de trabajo de IA de visión y medios que pueden generar hasta 100 veces más datos en bruto que el texto Ancho de banda de red y economía de egress
Experiencias hiperpersonalizadas a gran escala Recomendaciones por usuario, copilotos en la aplicación, inserción dinámica de medios Alta concurrencia dentro de presupuestos de latencia y costo
Cargas de trabajo de datos soberanos y regulados IA gubernamental, atención médica, servicios financieros, datos empresariales regulados Datos, modelos y registros mantenidos en jurisdicción
Tabla 1. Clases de carga de trabajo de IA que se benefician de las redes de IA, con ejemplos de aplicaciones y los objetivos de optimización principales.

No solo las redes de IA aceleran aplicaciones de borde clásicas, sino que también desbloquean un nuevo conjunto de servicios nativos de IA centrados en la generación y personalización en tiempo real. Las siguientes secciones explican cómo las redes de IA permiten tres de estas cargas de trabajo a gran escala: voz, visión y medios.

Red de IA para voz

Por qué la latencia es crítica para la IA de voz

Los servicios de IA de voz de calidad humana son extremadamente sensibles a la latencia de extremo a extremo. Cuando las respuestas superan los 500 ms, las conversaciones parecen notablemente lentas para los usuarios. Por lo tanto, cumplir con este tiempo hasta el primer token (TTFT) en el cliente se convierte en un objetivo de nivel de servicio (SLO) difícil.

Diagram breaking down client TTFT into round-trip time, queueing latency, tokenization, prefill and decode, and voice activity detection, with emphasis on reducing network and queueing components by placing voice inference on edge grid nodes.
Figura 3. Descomposición del tiempo hasta el primer token (TTFT) del cliente, mostrando cómo la ubicación de la inferencia en nodos de borde reduce el tiempo de ida y vuelta y la latencia de cola para interacciones de voz.

El TTFT en el cliente (TTFT_Client) es la suma de cinco componentes:

  1. Tiempo de ida y vuelta de la red (RTT): tiempo que tarda el audio y los tokens en viajar entre el usuario y el punto final de inferencia a través de la red.
  2. Latencia de cola: tiempo que una solicitud espera en la GPU o servicio antes de comenzar a ejecutarse.
  3. Latencia de cómputo:
    1. Tokenización: tiempo para convertir el audio entrante en tokens que el modelo de voz puede procesar, incluyendo reconocimiento automático de voz (ASR) y conversión de texto a voz (TTS).
    2. Prefill y decodificación: tiempo que el modelo pasa procesando el aviso (prefill) y generando el primer token (decodificación).
  4. Detección de actividad de voz (VAD): detecta cuándo los usuarios comienzan y dejan de hablar para enmarcar con precisión cada turno.
  5. El RTT y la latencia de cola están determinados en gran medida por dónde se ejecuta la inferencia, lo que permite que las redes de IA ofrezcan mejoras significativas en la latencia.

Latencia de extremo a extremo

Chart comparing end-to-end latency percentiles (baseline and burst, P50 through P99) for a voice small language model on RTX PRO 6000 GPUs deployed in a single centralized cluster versus a four‑node AI grid, illustrating that the AI grid maintains sub‑50
Figura 4. Comparación de latencia de extremo a extremo para un modelo de lenguaje pequeño de voz ejecutándose en GPU RTX PRO 6000 en un clúster centralizado versus una red de IA de cuatro nodos bajo tráfico intenso.

El siguiente benchmark de Comcast compara el mismo modelo de lenguaje pequeño de voz (SLM) de Personal AI ejecutándose en 4 GPU RTX PRO 6000 en dos arquitecturas: un clúster centralizado único y una red de IA distribuida en 4 sitios, ambas sometidas a un tráfico intenso de sesiones concurrentes altamente correlacionadas, donde los servicios de IA de voz son más exigentes.

En todos los escenarios de prueba, desde el tráfico base del percentil 50 (P50) hasta el tráfico intenso del percentil 90 (P90), la implementación de la red de IA mantiene la latencia de extremo a extremo para interacciones de voz dentro del objetivo de 500 ms, incluso cuando las sesiones concurrentes aumentan. Esto se logra colocando la inferencia en nodos de borde regionales, reduciendo el tiempo de ida y vuelta y la latencia de cola.

Rendimiento y costo por token

Otro hallazgo clave de este benchmark es el rendimiento de throughput bajo tráfico intenso correlacionado. En lugar de degradarse bajo una carga más alta, el rendimiento aumenta a medida que los cuatro nodos de borde absorben la demanda en paralelo, alcanzando 42,362 tokens por segundo en condiciones intensas, lo que representa una ganancia del 80.9% respecto a la línea base, mientras que la implementación centralizada pierde rendimiento en las mismas condiciones.

Chart showing tokens-per-second throughput for a voice small language model under baseline and burst conditions on a centralized cluster compared to a four‑node AI grid, with the grid scaling throughput upward as concurrent sessions increase and the centralized setup flattening or dropping.
Figura 5. Throughput del modelo de voz bajo tráfico intenso en arquitecturas de implementación de red de IA y centralizada.

Como resultado, la inferencia en la red de IA se ejecuta con un costo por token un 52.8% menor que en una implementación centralizada en la línea base, y esa diferencia se amplía a un 76.1% menor en condiciones intensas a medida que la utilización de GPU distribuida mejora con la carga. Los clústeres centralizados consumen gran parte de su presupuesto de latencia en RTT, por lo que deben operar a menor utilización para evitar violaciones de latencia, mientras que las implementaciones de red de IA mantienen bajo el RTT y pueden utilizar las GPU de manera más intensa manteniendo el mismo objetivo de latencia.

Chart comparing normalized cost per token for voice inference on a centralized cluster and a four‑node AI grid at baseline and burst loads, illustrating that distributed edge deployment reduces cost as GPU utilization improves with traffic.
Figura 6. Costo de inferencia por token para implementaciones centralizadas frente a redes de IA.

En entornos de producción, las mejoras tanto en rendimiento como en costo por token pueden variar según la selección del modelo, las características de la carga de trabajo y las condiciones de la red en vivo.

Red de IA para visión

Metropolis en el borde: De la percepción a la acción

Las cargas de trabajo de visión IA mueven muchos más datos que los servicios basados en texto, generando a menudo terabits por segundo de tráfico de video concurrente a escala de ciudad. Para hacer esto práctico, la infraestructura de IA debe mantener la latencia lo suficientemente baja como para reaccionar en tiempo real, mantener el video en bruto en la jurisdicción correcta y evitar que el backhaul de la red se convierta en el costo dominante del sistema.

Para satisfacer estas necesidades, la plataforma de aplicación de visión IA Metropolis de NVIDIA puede ejecutarse en nodos de la red de IA en el borde, dentro de la jurisdicción del operador y en segmentos de red aislados. Las cámaras transmiten hacia nodos cercanos donde los modelos anonimizar información identificable, comprenden escenas a través de múltiples flujos y desencadenan acciones como redirigir el tráfico o despachar respondientes.

Segmentación de red, aumento de resolución y ancho de banda

En implementaciones de nube centralizadas, los datos de video recorren varios saltos de red para ser procesados y devueltos a los operadores. La distancia física adicional con cada salto de red añade un retraso inherente y aumenta la posibilidad de encontrar fallas o congestión.

En diseños más eficientes, los operadores pueden reducir el backhaul combinando análisis en el borde con aumento de resolución bajo demanda. Por ejemplo, las cámaras pueden transmitir a 360p (alrededor de 2 Mbps), y un modelo de Super Resolución reconstruye vistas en 4K solo cuando los operadores necesitan inspeccionar una escena, de modo que el video de alta resolución cruce enlaces regionales o de backbone solo bajo demanda.

Cuando se implementa en una red de IA, la inferencia se ejecuta en GPUs RTX PRO en nodos locales, y solo alertas ligeras y metadatos se envían a sistemas centralizados para el monitoreo de toda la flota, correlación entre sitios y análisis a largo plazo. El resultado son tiempos de respuesta de extremo a extremo consistentemente más bajos y predecibles.

Además, la segmentación de red puede proporcionar a los pipelines de Metropolis un ancho de banda dedicado y aislado para eventos críticos de seguridad y análisis, asegurando que las cargas de trabajo de visión críticas siempre tengan prioridad y reciban un rendimiento y latencia deterministas, sin sobredimensionar toda la red.

Diagram and metrics showing city‑scale camera feeds streaming to nearby AI grid edge nodes where Metropolis performs analytics, sending only structured events upstream, with examples such as reducing 25 Gbps of continuous 4K backhaul to about 300 Mbps of insight traffic for 1,000 cameras.
Figura 7. Impacto del ancho de banda de ejecutar pipelines de visión IA Metropolis en nodos de borde de la red de IA.

Para un despliegue representativo con 1,000 cámaras 4K, pasar de procesamiento centralizado a compresión en el borde y luego a análisis en el borde más superresolución puede reducir la carga continua de backbone de decenas de Gbps a un rango de Gbps de un solo dígito bajo. Los números mostrados en la Figura 7 son ilustrativos y variarán según la configuración de las cámaras, los perfiles de compresión, las elecciones de modelos y las condiciones de red en vivo, pero se espera que los ahorros relativos entre los modelos de implementación sigan el mismo patrón.

La hiperpersonalización es un desafío de infraestructura

La hiperpersonalización es donde IA para medios se convierte en continua y por sesión, con contenido, superposiciones, lenguaje y recomendaciones que se adaptan en tiempo real para cada espectador. Lo que hace que estas cargas de trabajo sean distintas es que el valor del resultado expira rápidamente: una inserción de anuncio tardía causa jitter, una superposición de deportes que se pierde el momento de transmisión es irrelevante, y una recomendación que llega demasiado tarde pierde el momento de compra.

La Tabla 2 a continuación destaca casos de uso representativos de IA en medios, los plazos en los que operan y cómo las redes de IA ejecutan cada uno para mantenerse dentro de estrictos presupuestos de tiempo:

Caso de uso Plazo Restricción Modelo de ejecución de la red de IA
Inserción de anuncios en tiempo real 16 ms Presupuesto de 60 fps por cuadro Contexto muestreado cada pocos segundos; shaders ligeros por cuadro renderizan rellenos deterministas
Superposiciones de análisis deportivos < 1 s Superar el feed de transmisión Telemetría transformada en superposiciones antes de que el momento expire al aire
Recomendaciones de comercio electrónico < 200 ms Umbral de rebote Reordenación de vectores en nodos de borde, priorizando explícitamente la velocidad sobre el razonamiento profundo
Traducción de video en vivo < 10 ms Sincronización de audio + subtítulos ASR, traducción y TTS corren en la red; la ubicación en el borde mantiene audio, subtítulos y video sincronizados
Tabla 2. Casos de uso de IA en medios, plazos, restricciones y cómo las redes de IA ejecutan cada carga de trabajo para cumplir con estrictos presupuestos de tiempo.

Las pruebas realizadas por Comcast y Decart validan que las redes de IA cumplen con tales plazos de manera consistente a gran escala, acercando la computación a donde se entrega el contenido y reduciendo el jitter mediante menos saltos de red y menor contención en cada salto. Esto resulta en absorber picos de demanda correlacionados regionalmente y evitando el backhaul que acompaña el enrutamiento del tráfico de inferencia a través de una instalación centralizada.

Al igual que con el tráfico de voz variable, distribuir la demanda de generación de video concurrente a través de múltiples sitios de borde permite a los operadores aumentar la utilización de las GPU, lo que a su vez impulsa un mayor rendimiento y reduce el costo efectivo de entregar cada stream.

En las redes de IA, las cargas de trabajo de medios se ejecutan como pipelines de streaming de baja latencia en nodos de borde distribuidos en lugar de como trabajos centralizados en nubes distantes.

NVIDIA Holoscan coordina el flujo de cuadros y segmentos de audio a través de estos nodos de red, desde la ingestión hasta la comprensión y renderización, de manera que la inserción de anuncios en tiempo real, las superposiciones y las etapas de personalización se ejecuten sin romper sus presupuestos de cuadros o respuesta.

Los servicios basados en NVIDIA Maxine manejan la mejora de video en tiempo real en los mismos nodos de borde, mientras que los servicios de voz y traducción como NVIDIA Riva y LipSync mantienen audio y video multilingües sincronizados sin saltos de red adicionales.

Modelos de generación de video y economía de egress

Los modelos de generación de video producen significativamente más datos que los LLM solo de texto. Por ejemplo, los modelos de generación de video Lucy 2 de Decart generan aproximadamente 5.5 Mbps/seg. En comparación con un LLM basado en texto, una sesión de generación de video de 10 minutos genera 825,000 veces más datos, aumentando drásticamente el ancho de banda de egress.

Bar chart showing data egress per 10‑minute session in gigabytes for two workloads: an LLM with negligible text output and a Lucy 2 video‑generation model with 3.3 GB of output, highlighting that video generation produces vastly more egress traffic than text.
Figura 8. Egress de datos para una sesión de 10 minutos, comparando la salida de texto de LLM con la salida del modelo de generación de video.

Al acercar la generación de video a los usuarios finales, las redes de IA hacen que las experiencias de medios impulsadas por IA sean económicamente viables e inmersivas, incluso a medida que crecen la personalización y la concurrencia.

Los servicios nativos de IA necesitan redes de IA

Las empresas de telecomunicaciones y los proveedores de entrega de contenido se están convirtiendo en centrales en la forma en que se entrega la inferencia para los servicios nativos de IA a gran escala, transformando la red en parte del camino de ejecución del modelo en lugar de un simple conducto. Con enrutamiento consciente de cargas de trabajo a través de fábricas de IA y sitios de borde distribuidos, los operadores pueden dirigir servicios de IA como voz, visión y medios al lugar correcto para que cada carga de trabajo cumpla con sus requisitos de latencia, concurrencia, costo y soberanía.

Comenzando

Explora el diseño de referencia de la red de IA para profundizar en la arquitectura y los patrones de implementación discutidos en este artículo.

Ilustración de un hombre mayor con auriculares y chaqueta