Los servicios nativos de IA están enfrentando un nuevo desafío en la infraestructura de IA. A medida que millones de usuarios, agentes y dispositivos demandan acceso a inteligencia, el enfoque se desplaza de la capacidad máxima de entrenamiento a la entrega de inferencias deterministas a gran escala, con latencias y economías de tokens sostenibles.
NVIDIA anunció en GTC 2026 que las empresas de telecomunicaciones y los proveedores de nube distribuida están transformando sus redes en redes de IA. Estas redes integran computación acelerada a través de una malla de puntos de presencia regionales (POPs), oficinas centrales, centros metropolitanos y ubicaciones de borde para satisfacer las necesidades de los servicios nativos de IA.
Este artículo explica cómo las redes de IA permiten experiencias de IA en tiempo real, multimodal y hiperpersonalizadas a gran escala mediante la ejecución de inferencias en infraestructura de IA distribuida, consciente de la carga de trabajo, los recursos y los indicadores clave de rendimiento (KPI).
Ubicación inteligente de cargas de trabajo en sitios distribuidos
El diseño de referencia de la red de IA de NVIDIA proporciona un marco unificado para construir infraestructuras de IA interconectadas y orquestadas. La Figura 1 muestra cómo se integran los activos de la red en una red de IA:
Un aspecto clave de este diseño es el plano de control de la red de IA, que convierte clústeres y regiones aislados en una plataforma programable única. Su enfoque principal es determinar de manera inteligente dónde debe ejecutarse cada carga de trabajo para cumplir con sus KPI:
- Enrutamiento consciente de KPI, que sitúa las cargas de trabajo según requisitos de latencia, restricciones de soberanía y costos.
- Ubicación consciente de recursos que tiene en cuenta continuamente la salud de los nodos, la utilización y las cuotas para evitar sitios sobrecargados o degradados antes de que los usuarios perciban picos de latencia.

Cargas de trabajo que más se benefician de las redes de IA
La ubicación inteligente de cargas de trabajo es más relevante para aplicaciones donde la latencia, el ancho de banda, la personalización o la soberanía se convierten en restricciones de diseño primordiales.
La siguiente tabla relaciona estas clases de carga de trabajo con aplicaciones de ejemplo y los KPI que deben optimizar para ofrecer experiencias de usuario consistentes y económicas.
| Clase de carga de trabajo | Aplicaciones de ejemplo | KPI objetivo |
| Bucles de control en tiempo real sensibles a la latencia | IA física (robots, sensores), agentes conversacionales, AR/VR, dispositivos portátiles | Latencia y jitter de extremo a extremo dentro del SLA |
| Multimodal intensivo en tokens y ancho de banda | Cargas de trabajo de IA de visión y medios que pueden generar hasta 100 veces más datos en bruto que el texto | Ancho de banda de red y economía de egress |
| Experiencias hiperpersonalizadas a gran escala | Recomendaciones por usuario, copilotos en la aplicación, inserción dinámica de medios | Alta concurrencia dentro de presupuestos de latencia y costo |
| Cargas de trabajo de datos soberanos y regulados | IA gubernamental, atención médica, servicios financieros, datos empresariales regulados | Datos, modelos y registros mantenidos en jurisdicción |
No solo las redes de IA aceleran aplicaciones de borde clásicas, sino que también desbloquean un nuevo conjunto de servicios nativos de IA centrados en la generación y personalización en tiempo real. Las siguientes secciones explican cómo las redes de IA permiten tres de estas cargas de trabajo a gran escala: voz, visión y medios.
Red de IA para voz
Por qué la latencia es crítica para la IA de voz
Los servicios de IA de voz de calidad humana son extremadamente sensibles a la latencia de extremo a extremo. Cuando las respuestas superan los 500 ms, las conversaciones parecen notablemente lentas para los usuarios. Por lo tanto, cumplir con este tiempo hasta el primer token (TTFT) en el cliente se convierte en un objetivo de nivel de servicio (SLO) difícil.

El TTFT en el cliente (TTFT_Client) es la suma de cinco componentes:
- Tiempo de ida y vuelta de la red (RTT): tiempo que tarda el audio y los tokens en viajar entre el usuario y el punto final de inferencia a través de la red.
- Latencia de cola: tiempo que una solicitud espera en la GPU o servicio antes de comenzar a ejecutarse.
- Latencia de cómputo:
- Tokenización: tiempo para convertir el audio entrante en tokens que el modelo de voz puede procesar, incluyendo reconocimiento automático de voz (ASR) y conversión de texto a voz (TTS).
- Prefill y decodificación: tiempo que el modelo pasa procesando el aviso (prefill) y generando el primer token (decodificación).
- Detección de actividad de voz (VAD): detecta cuándo los usuarios comienzan y dejan de hablar para enmarcar con precisión cada turno.
- El RTT y la latencia de cola están determinados en gran medida por dónde se ejecuta la inferencia, lo que permite que las redes de IA ofrezcan mejoras significativas en la latencia.
Latencia de extremo a extremo

El siguiente benchmark de Comcast compara el mismo modelo de lenguaje pequeño de voz (SLM) de Personal AI ejecutándose en 4 GPU RTX PRO 6000 en dos arquitecturas: un clúster centralizado único y una red de IA distribuida en 4 sitios, ambas sometidas a un tráfico intenso de sesiones concurrentes altamente correlacionadas, donde los servicios de IA de voz son más exigentes.
En todos los escenarios de prueba, desde el tráfico base del percentil 50 (P50) hasta el tráfico intenso del percentil 90 (P90), la implementación de la red de IA mantiene la latencia de extremo a extremo para interacciones de voz dentro del objetivo de 500 ms, incluso cuando las sesiones concurrentes aumentan. Esto se logra colocando la inferencia en nodos de borde regionales, reduciendo el tiempo de ida y vuelta y la latencia de cola.
Rendimiento y costo por token
Otro hallazgo clave de este benchmark es el rendimiento de throughput bajo tráfico intenso correlacionado. En lugar de degradarse bajo una carga más alta, el rendimiento aumenta a medida que los cuatro nodos de borde absorben la demanda en paralelo, alcanzando 42,362 tokens por segundo en condiciones intensas, lo que representa una ganancia del 80.9% respecto a la línea base, mientras que la implementación centralizada pierde rendimiento en las mismas condiciones.

Como resultado, la inferencia en la red de IA se ejecuta con un costo por token un 52.8% menor que en una implementación centralizada en la línea base, y esa diferencia se amplía a un 76.1% menor en condiciones intensas a medida que la utilización de GPU distribuida mejora con la carga. Los clústeres centralizados consumen gran parte de su presupuesto de latencia en RTT, por lo que deben operar a menor utilización para evitar violaciones de latencia, mientras que las implementaciones de red de IA mantienen bajo el RTT y pueden utilizar las GPU de manera más intensa manteniendo el mismo objetivo de latencia.

En entornos de producción, las mejoras tanto en rendimiento como en costo por token pueden variar según la selección del modelo, las características de la carga de trabajo y las condiciones de la red en vivo.
Red de IA para visión
Metropolis en el borde: De la percepción a la acción
Las cargas de trabajo de visión IA mueven muchos más datos que los servicios basados en texto, generando a menudo terabits por segundo de tráfico de video concurrente a escala de ciudad. Para hacer esto práctico, la infraestructura de IA debe mantener la latencia lo suficientemente baja como para reaccionar en tiempo real, mantener el video en bruto en la jurisdicción correcta y evitar que el backhaul de la red se convierta en el costo dominante del sistema.
Para satisfacer estas necesidades, la plataforma de aplicación de visión IA Metropolis de NVIDIA puede ejecutarse en nodos de la red de IA en el borde, dentro de la jurisdicción del operador y en segmentos de red aislados. Las cámaras transmiten hacia nodos cercanos donde los modelos anonimizar información identificable, comprenden escenas a través de múltiples flujos y desencadenan acciones como redirigir el tráfico o despachar respondientes.
Segmentación de red, aumento de resolución y ancho de banda
En implementaciones de nube centralizadas, los datos de video recorren varios saltos de red para ser procesados y devueltos a los operadores. La distancia física adicional con cada salto de red añade un retraso inherente y aumenta la posibilidad de encontrar fallas o congestión.
En diseños más eficientes, los operadores pueden reducir el backhaul combinando análisis en el borde con aumento de resolución bajo demanda. Por ejemplo, las cámaras pueden transmitir a 360p (alrededor de 2 Mbps), y un modelo de Super Resolución reconstruye vistas en 4K solo cuando los operadores necesitan inspeccionar una escena, de modo que el video de alta resolución cruce enlaces regionales o de backbone solo bajo demanda.
Cuando se implementa en una red de IA, la inferencia se ejecuta en GPUs RTX PRO en nodos locales, y solo alertas ligeras y metadatos se envían a sistemas centralizados para el monitoreo de toda la flota, correlación entre sitios y análisis a largo plazo. El resultado son tiempos de respuesta de extremo a extremo consistentemente más bajos y predecibles.
Además, la segmentación de red puede proporcionar a los pipelines de Metropolis un ancho de banda dedicado y aislado para eventos críticos de seguridad y análisis, asegurando que las cargas de trabajo de visión críticas siempre tengan prioridad y reciban un rendimiento y latencia deterministas, sin sobredimensionar toda la red.

Para un despliegue representativo con 1,000 cámaras 4K, pasar de procesamiento centralizado a compresión en el borde y luego a análisis en el borde más superresolución puede reducir la carga continua de backbone de decenas de Gbps a un rango de Gbps de un solo dígito bajo. Los números mostrados en la Figura 7 son ilustrativos y variarán según la configuración de las cámaras, los perfiles de compresión, las elecciones de modelos y las condiciones de red en vivo, pero se espera que los ahorros relativos entre los modelos de implementación sigan el mismo patrón.
La hiperpersonalización es un desafío de infraestructura
La hiperpersonalización es donde IA para medios se convierte en continua y por sesión, con contenido, superposiciones, lenguaje y recomendaciones que se adaptan en tiempo real para cada espectador. Lo que hace que estas cargas de trabajo sean distintas es que el valor del resultado expira rápidamente: una inserción de anuncio tardía causa jitter, una superposición de deportes que se pierde el momento de transmisión es irrelevante, y una recomendación que llega demasiado tarde pierde el momento de compra.
La Tabla 2 a continuación destaca casos de uso representativos de IA en medios, los plazos en los que operan y cómo las redes de IA ejecutan cada uno para mantenerse dentro de estrictos presupuestos de tiempo:
| Caso de uso | Plazo | Restricción | Modelo de ejecución de la red de IA |
| Inserción de anuncios en tiempo real | 16 ms | Presupuesto de 60 fps por cuadro | Contexto muestreado cada pocos segundos; shaders ligeros por cuadro renderizan rellenos deterministas |
| Superposiciones de análisis deportivos | < 1 s | Superar el feed de transmisión | Telemetría transformada en superposiciones antes de que el momento expire al aire |
| Recomendaciones de comercio electrónico | < 200 ms | Umbral de rebote | Reordenación de vectores en nodos de borde, priorizando explícitamente la velocidad sobre el razonamiento profundo |
| Traducción de video en vivo | < 10 ms | Sincronización de audio + subtítulos | ASR, traducción y TTS corren en la red; la ubicación en el borde mantiene audio, subtítulos y video sincronizados |
Las pruebas realizadas por Comcast y Decart validan que las redes de IA cumplen con tales plazos de manera consistente a gran escala, acercando la computación a donde se entrega el contenido y reduciendo el jitter mediante menos saltos de red y menor contención en cada salto. Esto resulta en absorber picos de demanda correlacionados regionalmente y evitando el backhaul que acompaña el enrutamiento del tráfico de inferencia a través de una instalación centralizada.
Al igual que con el tráfico de voz variable, distribuir la demanda de generación de video concurrente a través de múltiples sitios de borde permite a los operadores aumentar la utilización de las GPU, lo que a su vez impulsa un mayor rendimiento y reduce el costo efectivo de entregar cada stream.
En las redes de IA, las cargas de trabajo de medios se ejecutan como pipelines de streaming de baja latencia en nodos de borde distribuidos en lugar de como trabajos centralizados en nubes distantes.
NVIDIA Holoscan coordina el flujo de cuadros y segmentos de audio a través de estos nodos de red, desde la ingestión hasta la comprensión y renderización, de manera que la inserción de anuncios en tiempo real, las superposiciones y las etapas de personalización se ejecuten sin romper sus presupuestos de cuadros o respuesta.
Los servicios basados en NVIDIA Maxine manejan la mejora de video en tiempo real en los mismos nodos de borde, mientras que los servicios de voz y traducción como NVIDIA Riva y LipSync mantienen audio y video multilingües sincronizados sin saltos de red adicionales.
Modelos de generación de video y economía de egress
Los modelos de generación de video producen significativamente más datos que los LLM solo de texto. Por ejemplo, los modelos de generación de video Lucy 2 de Decart generan aproximadamente 5.5 Mbps/seg. En comparación con un LLM basado en texto, una sesión de generación de video de 10 minutos genera 825,000 veces más datos, aumentando drásticamente el ancho de banda de egress.

Al acercar la generación de video a los usuarios finales, las redes de IA hacen que las experiencias de medios impulsadas por IA sean económicamente viables e inmersivas, incluso a medida que crecen la personalización y la concurrencia.
Los servicios nativos de IA necesitan redes de IA
Las empresas de telecomunicaciones y los proveedores de entrega de contenido se están convirtiendo en centrales en la forma en que se entrega la inferencia para los servicios nativos de IA a gran escala, transformando la red en parte del camino de ejecución del modelo en lugar de un simple conducto. Con enrutamiento consciente de cargas de trabajo a través de fábricas de IA y sitios de borde distribuidos, los operadores pueden dirigir servicios de IA como voz, visión y medios al lugar correcto para que cada carga de trabajo cumpla con sus requisitos de latencia, concurrencia, costo y soberanía.
Comenzando
Explora el diseño de referencia de la red de IA para profundizar en la arquitectura y los patrones de implementación discutidos en este artículo.


