Los agentes de codificación están comenzando a generar código de producción a gran escala. Los agentes de Stripe generan más de 1,300 PRs por semana. Ramp atribuye el 30% de los PRs fusionados a los agentes. Spotify informa que más de 650 PRs son generados por agentes cada mes. Herramientas como Claude Code y Codex realizan cientos de llamadas API por sesión de codificación, cada una llevando el historial completo de la conversación. Detrás de cada uno de estos flujos de trabajo hay una pila de inferencia bajo una significativa presión de caché KV.
Tomemos como ejemplo Claude Code. Después de la primera llamada API que escribe el prefijo de la conversación en la caché KV, cada llamada subsiguiente al mismo trabajador alcanza un 85-97% de caché. Los equipos de agentes (o enjambres) empujan esto aún más con una tasa de aciertos de caché agregada del 97.2% entre 4 compañeros de Opus. Un ratio de lectura/escritura de 11.7x significa que el sistema lee de la caché casi 12 veces por cada token que escribe. Este es un patrón de acceso de escritura-una-vez-lectura-muchas (WORM): el prompt del sistema y el creciente prefijo de conversación se calculan una vez, y luego se sirven de la caché en cada llamada subsiguiente. Maximizar la tasa de reutilización de la caché entre todos los trabajadores y mantener los bloques KV calientes y enrutables es el objetivo central de la inferencia agente.
Cierre de la brecha en la infraestructura de API
Estos números provienen de una infraestructura API gestionada donde el proveedor controla la coincidencia de prefijos, la colocación de la caché y la eliminación. Para los equipos que ejecutan modelos de código abierto en sus propias GPU, nada de esto existe de forma predeterminada. Hemos estado desarrollando Dynamo para cerrar esa brecha. Este artículo detalla cómo estamos haciendo que Dynamo sea nativo para agentes en tres capas: la API de frontend, el enrutador y la gestión de caché KV.
A lo largo de este artículo, utilizamos tres términos de manera consistente:
- Harness: Marco de agentes que impulsa el flujo de trabajo (Claude Code, Codex, OpenClaw, OpenCode, etc.)
- Orchestrator: Capa de enrutamiento, programación y gestión de caché de Dynamo
- Runtime: Motor de inferencia que ejecuta el modelo y posee el gestor de caché KV (SGLang, vLLM, TRT-LLM)


