ESPACIO PUBLICITARIO DISPONIBLE · HABLEMOS

Desmontando DeepSeek-V4-Pro: MoE de 1,6 B, atención híbrida CSA/HCA y la revolución de memoria en 1M de tokens

365Finds Editorial

El 13 de agosto de 2026, DeepSeek presentó oficialmente su modelo insignia de pesos abiertos, DeepSeek-V4-Pro (versión 0813 GA). Este lanzamiento marca un cambio estructural en la industria, pasando del razonamiento denso y cadenas de pensamiento rígidas hacia arquitecturas Mixture-of-Experts (MoE) dispersas a gran escala con compresión dinámica de memoria para contextos largos. Con 1,6 billones de parámetros totales, solo ~49 mil millones de parámetros activos por token, una ventana de contexto de 1 millón de tokens y tres modos de razonamiento (Thinking Modes) configurables en tiempo de ejecución, el modelo proporciona una base sólida para la ingeniería de software compleja y los agentes autónomos.

Para superar el cuello de botella de memoria que supone procesar secuencias de un millón de tokens, DeepSeek-V4-Pro rediseña el mecanismo de atención. Al integrar la atención dispersa comprimida (CSA) y la atención fuertemente comprimida (HCA), el modelo reduce drásticamente el consumo de memoria del KV cache, preservando al mismo tiempo una alta precisión en la recuperación de información y el razonamiento lógico entre documentos extensos.

MoE de 1,6 B y enrutamiento dinámico de expertos

DeepSeek-V4-Pro ha sido preentrenado con más de 32 billones de tokens de texto y código multilingüe de alta calidad. A nivel estructural, amplía la segmentación fina de expertos y la topología de expertos compartidos característica de DeepSeek.

Parámetro arquitectónicoDeepSeek-V4-ProDeepSeek-V4-Flash
Parámetros totales1,6 B (1.600.000 M)284.000 M
Parámetros activos por token~49.000 M~13.000 M
Ventana de contexto1.000.000 tokens (1M)1.000.000 tokens (1M)
Volumen de preentrenamiento> 32 B tokens> 32 B tokens
LicenciaMIT LicenseMIT License
Pesos del modeloRepositorio en Hugging FaceRepositorio en Hugging Face

Durante el cálculo hacia adelante, una red de compuertas dinámicas distribuye los tokens de entrada hacia los subexpertos más idóneos, mientras que una proporción fija de expertos compartidos procesa la sintaxis general y el conocimiento básico. Este diseño previene los desequilibrios de carga habituales en los modelos MoE tradicionales y proporciona la capacidad expresiva de un modelo denso de 1,6 B con el coste operativo de ejecutar un modelo de 49.000 M.

CSA y HCA: superando la barrera de memoria en 1M de tokens

Bajo el mecanismo de atención completa convencional, la memoria del KV cache aumenta linealmente con la longitud de la secuencia, mientras que la complejidad computacional crece de forma cuadrática. Con 1 millón de tokens, mantener los estados KV en bruto requiere cientos de gigabytes de VRAM, lo que dificulta la viabilidad económica de los bucles de ejecución continua en agentes.

DeepSeek-V4-Pro implementa dos capas complementarias de atención comprimida:

Flujo de entrada (1M Tokens)
  │
  ├── Ventana deslizante local ──► HCA (Heavily Compressed Attention) ──► Atención local de alta fidelidad
  │
  └── Contexto global anterior ──► CSA (Compressed Sparse Attention)  ──► Selector dinámico y proyección
                                                                          │
                                                                          ▼
                                                              Reducción de memoria KV de ~70%-80%
  1. Atención dispersa comprimida (CSA): Una red ligera de puntuación evalúa y agrupa dinámicamente los bloques de memoria relevantes para la consulta actual, activando solo los tokens esenciales y almacenando el resto en proyecciones comprimidas de bajo rango.
  2. Atención fuertemente comprimida (HCA): Mantiene la fidelidad contextual completa en la ventana deslizante inmediata, aplicando cuantización multicapa y agregación de claves y valores al historial más distante.

La combinación de CSA y HCA disminuye el uso de memoria del KV cache en más del 70%, permitiendo a los agentes de programación ejecutar refactorizaciones complejas y análisis de repositorios enteros sin agotar la memoria.

Modos de pensamiento graduados (Thinking Modes)

Los primeros modelos orientados al razonamiento (como DeepSeek-R1) dependían de cadenas de pensamiento de longitud fija. Sin embargo, en entornos de producción, una transformación de formato simple y un rediseño de arquitectura demandan profundidades cognitivas muy diferentes.

DeepSeek-V4-Pro introduce tres modos de razonamiento seleccionables en tiempo de ejecución:

Estos modos cuentan con soporte directo a través de la documentación de la API y la guía de Responses API, lo que permite ajustar con precisión la latencia y el presupuesto de cómputo en cada etapa de la tarea.

Rendimiento en programación y agentes autónomos

En evaluaciones de ingeniería de software y control de terminales, DeepSeek-V4-Pro demuestra una sólida capacidad de integración con herramientas externas. En pruebas de referencia como Terminal-Bench 2.1 (operaciones avanzadas en terminal) y DeepSWE (resolución integral de incidencias en repositorios), el modelo supera a las versiones de código abierto precedentes y se sitúa al nivel de los principales modelos comerciales cerrados.

Si bien DeepSeek-V4-Flash representa una opción ágil para interacciones de baja latencia, la profundidad de 1,6 B parámetros y el modo de pensamiento Max de V4-Pro proporcionan ventajas estructurales determinantes para resolver fallos arquitectónicos complejos.

Estrategia de despliegue e integración

Los equipos técnicos que evalúen la incorporación de DeepSeek-V4-Pro disponen de dos vías principales:

El lanzamiento de DeepSeek-V4-Pro confirma la madurez de las arquitecturas abiertas para gestionar contextos masivos y razonamiento adaptativo, sentando las bases operativas para la nueva generación de sistemas de software autónomos.