DeepSeek lanza V4 con capacidad de contexto de un millón de tokens para tareas agenticas

DeepSeek ha lanzado hoy la versión 4 de su modelo. Dos puntos de control de MoE están disponibles en el Hub: DeepSeek-V4-Pro con 1.6T de parámetros totales y 49B activos, y DeepSeek-V4-Flash con 284B totales y 13B activos. Ambos modelos poseen una ventana de contexto de 1M tokens, lo que les permite un rendimiento competitivo, aunque no se consideran de última generación. Sin embargo, la verdadera innovación radica en cómo DeepSeek v4 está diseñado para soportar eficientemente largas longitudes de contexto, posicionándose como uno de los mejores candidatos para tareas agentivas.

El enfoque de esta versión se centra en cargas de trabajo agentivas prolongadas. Ejecutar un modelo de frontera como agente puede fallar de maneras predecibles. Por ejemplo, el modelo puede detenerse, lo que obliga a reescribir la solicitud. La traza puede exceder el presupuesto de contexto, o la caché KV puede llenar la GPU, lo que degrada el rendimiento durante tareas largas. La versión 4 está construida para corregir estas fallas conocidas y guiar a la comunidad en el camino a seguir.

Este artículo aborda tres aspectos: las diferencias en la arquitectura que hacen que la inferencia de contexto largo sea más económica, las decisiones de post-entrenamiento específicas para agentes que se suman a esto, y algunos aprendizajes del documento que ayudan a entender estos cambios.

El problema de la caché KV para agentes

Una ventana de contexto de 1M tokens representa solo capacidad, no rendimiento. Su utilidad depende del costo de cada paso hacia adelante a esa profundidad. Para un agente que ejecuta una larga trayectoria de uso de herramientas, cada resultado de herramienta se agrega al contexto, y cada token subsiguiente incurre en el costo total de atención respecto a todo lo anterior.

Dos números son cruciales: FLOPs de inferencia por token y tamaño de la caché KV. Ambos crecen con la longitud de la secuencia. A 1M tokens, DeepSeek-V4-Pro requiere el 27% de los FLOPs de inferencia de un solo token en comparación con DeepSeek-V3.2, lo que le permite funcionar más rápido en el mismo hardware. Además, utiliza solo el 10% de la memoria de la caché KV. V4-Flash reduce aún más estos números, utilizando el 10% de los FLOPs y el 7% de la caché KV.

Al comparar la memoria de la caché KV con una arquitectura establecida como atención agrupada con 8 cabezas, almacenada en el formato bfloat16 habitual, DeepSeek v4 requiere aproximadamente el 2% del tamaño de la caché. Esto facilita su implementación para manejar contextos muy grandes.

Atención híbrida: CSA y HCA

El aumento de eficiencia proviene de dividir la atención en dos mecanismos que se intercalan a través de las capas.

La Atención Dispersa Comprimida (CSA) comprime las entradas KV en un factor de 4 a lo largo de la dimensión de la secuencia utilizando un agrupamiento controlado por softmax con un sesgo posicional aprendido. Un indexador rápido selecciona los bloques comprimidos más relevantes por consulta. Este enfoque hereda la idea de selección dispersa del modelo DeepSeek Sparse Attention en V3.2, pero opera sobre bloques que ya son 4 veces más cortos que la secuencia original.

Figure 3: Compressed Sparse Attention, showing compressor, lightning indexer over compressed blocks, and sliding-window branch
Figura 3: CSA. El compresor colapsa cada 4 tokens en una entrada KV comprimida. El indexador rápido selecciona los bloques comprimidos más relevantes por consulta.

La Atención Comprimida Heavily (HCA) comprime las entradas KV en un factor de 128 y elimina la selección dispersa. Cada consulta asiste densamente a cada bloque comprimido. La secuencia comprimida es lo suficientemente corta como para que la atención densa sea económica.

Figure 4: Heavily Compressed Attention, 128x compression with dense MQA over compressed blocks
Figura 4: HCA. Un compresor más pesado (128x vs. 4x) seguido de atención densa sobre la secuencia comprimida.

– Enlace contenido original: https://huggingface.co/blog/deepseekv4
Ilustración de un hombre mayor con auriculares y chaqueta