Em 13 de agosto de 2026, a DeepSeek lançou oficialmente o DeepSeek-V4-Pro (versão 0813 GA), seu modelo carro-chefe de pesos abertos. Esse lançamento marca uma importante transição no setor, evoluindo do raciocínio denso e cadeias de pensamento rígidas para arquiteturas Mixture-of-Experts (MoE) esparsas em larga escala combinadas com compressão dinâmica de memória em contextos longos. Com 1,6 trilhão de parâmetros totais, apenas ~49 bilhões de parâmetros ativos por token, janela de contexto de 1 milhão de tokens e três modos de raciocínio (Thinking Modes) configuráveis em tempo de execução, o modelo fornece uma infraestrutura robusta para engenharia de software e agentes autônomos.
Para solucionar o gargalo de memória gerado por sequências de até um milhão de tokens, o DeepSeek-V4-Pro reestruturou profundamente o mecanismo de atenção. Ao integrar a Atenção Esparsa Comprimida (CSA) e a Atenção Fortemente Comprimida (HCA), o modelo reduz drasticamente o consumo de VRAM no KV cache, mantendo alta precisão na recuperação de dados e no raciocínio lógico entre múltiplos documentos.
MoE de 1,6 T e roteamento dinâmico de especialistas
O DeepSeek-V4-Pro foi pré-treinado com mais de 32 trilhões de tokens de texto e código multilíngue de alta qualidade. Na camada de arquitetura, ele expande a segmentação granular de especialistas e a topologia de especialistas compartilhados característica da DeepSeek.
| Parâmetro estrutural | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| Total de parâmetros | 1,6 T (1.600 B) | 284 B |
| Parâmetros ativos por token | ~49 B | ~13 B |
| Janela de contexto | 1.000.000 tokens (1M) | 1.000.000 tokens (1M) |
| Volume de pré-treinamento | > 32 T tokens | > 32 T tokens |
| Licença | MIT License | MIT License |
| Pesos do modelo | Repositório no Hugging Face | Repositório no Hugging Face |
Durante a computação direta, uma rede de roteamento dinâmico direciona os tokens de entrada para os especialistas mais adequados, enquanto uma proporção fixa de especialistas compartilhados processa sintaxe geral e conhecimentos fundamentais. Esse modelo elimina gargalos de sobrecarga comuns em sistemas MoE tradicionais e entrega o poder expressivo de um modelo denso de 1,6 T com o custo computacional de um modelo de 49 B.
CSA e HCA: superando o limite de memória em 1M de tokens
No mecanismo de atenção total tradicional, o consumo de memória do KV cache cresce linearmente com o comprimento da sequência, enquanto o esforço computacional aumenta de forma quadrática. Em 1 milhão de tokens, manter os estados KV brutos consome centenas de gigabytes de VRAM, inviabilizando economicamente fluxos de execução contínua em agentes.
O DeepSeek-V4-Pro implementa duas camadas integradas de atenção comprimida:
Sequência de entrada (1M Tokens)
│
├── Janela deslizante local ──► HCA (Heavily Compressed Attention) ──► Atenção local de alta fidelidade
│
└── Contexto global anterior ──► CSA (Compressed Sparse Attention) ──► Seletor dinâmico e projeção
│
▼
Redução de ~70%-80% no KV Cache
- Atenção Esparsa Comprimida (CSA): Uma rede leve de pontuação avalia e agrupa os blocos de memória cruciais para a consulta atual, ativando apenas tokens de alta relevância e armazenando os demais em projeções compactadas de baixo posto.
- Atenção Fortemente Comprimida (HCA): Garante fidelidade contextual na janela deslizante imediata, enquanto aplica quantização entre camadas e agrupamento de chaves e valores ao histórico mais distante.
A união de CSA e HCA diminui o consumo de memória do KV cache em mais de 70%, permitindo que agentes executem refatorações complexas e análises profundas de repositórios sem interrupção por falta de memória.
Modos de raciocínio ajustáveis (Thinking Modes)
Modelos de raciocínio anteriores (como o DeepSeek-R1) dependiam de cadeias de pensamento de extensão fixa. Contudo, em cenários de produção, transformações de dados simples e projetos complexos de arquitetura demandam níveis de reflexão completamente distintos.
O DeepSeek-V4-Pro introduz três modos nativos de raciocínio configuráveis em tempo de execução:
- Low (Leve): Focado em execução direta de comandos, extração estruturada e preenchimento ágil de código, minimizando o tempo até o primeiro token (TTFT) e o consumo de tokens.
- High (Padrão): Configuração padrão para criação de algoritmos, deduções lógicas e depuração de código, com formulação de hipóteses e validações sucessivas.
- Max (Extremo): Destinado a reestruturações amplas de código, projetos de protocolos distribuídos e análises de vulnerabilidades, realizando buscas profundas em múltiplos caminhos.
Esses modos são suportados nativamente pela documentação da API e guia de Responses API, permitindo calibrar com precisão o custo e a latência de cada etapa do fluxo de trabalho.
Desempenho em engenharia de software e agentes
Em testes práticos de manipulação de terminal e engenharia de software, o DeepSeek-V4-Pro demonstra alto nível de integração com ferramentas de desenvolvimento. Em índices consolidados como o Terminal-Bench 2.1 (execução de comandos e controle de ambiente) e o DeepSWE (resolução autônoma de problemas em repositórios), o modelo supera as versões de código aberto anteriores e se equipara aos principais modelos proprietários do mercado.
Embora o DeepSeek-V4-Flash seja uma alternativa leve para respostas interativas rápidas, a amplitude de 1,6 T parâmetros e o modo de raciocínio Max do V4-Pro garantem vantagens determinantes na resolução de falhas estruturais em projetos de grande porte.
Recomendações de implantação e infraestrutura
Equipes de engenharia que planejam adotar o DeepSeek-V4-Pro podem avaliar duas abordagens principais:
- APIs em nuvem gerenciada: O acesso direto pela plataforma oficial da DeepSeek ou pelo OpenRouter elimina a necessidade de manter clusters MoE de grande escala, permitindo ainda aproveitar tarifas reduzidas em horários de menor demanda para tarefas em lote.
- Ambiente local e privado: A execução dos pesos completos de 1,6 T exige nós empresariais com 8 GPUs H100/H200. Para desenvolvedores individuais ou nós de borda, recomenda-se utilizar a versão quantizada em 4-bit do V4-Flash ou servidores baseados em vLLM e SGLang compatíveis com núcleos CSA e HCA.
O DeepSeek-V4-Pro estabelece que modelos de pesos abertos podem processar contextos massivos e controlar dinamicamente o esforço de raciocínio. Ao otimizar o uso de memória e a eficiência de processamento, o modelo consolida uma base prática para a nova geração de softwares autônomos.