Le 13 août 2026, DeepSeek a officiellement lancé son modèle phare à poids ouverts, DeepSeek-V4-Pro (version finale 0813 GA). Cette annonce marque une transition décisive dans l'industrie, abandonnant le raisonnement dense monolithique et les chaînes de pensée rigides au profit d'architectures Mixture-of-Experts (MoE) éparses à très grande échelle, associées à une compression dynamique de la mémoire en contexte long. Avec 1,6 billion de paramètres totaux, seulement ~49 milliards de paramètres actifs par token, une fenêtre de contexte de 1 million de tokens et trois modes de raisonnement (Thinking Modes) sélectionnables à l'exécution, le modèle offre un socle technique robuste pour l'ingénierie logicielle complexe et les agents autonomes.
Pour surmonter le mur de mémoire rencontré lors du traitement de séquences atteignant un million de tokens, DeepSeek-V4-Pro a repensé le mécanisme d'attention. En associant l'attention éparse compressée (CSA) et l'attention fortement compressée (HCA), le modèle réduit significativement l'empreinte mémoire du KV cache tout en maintenant une grande fidélité dans la recherche documentaire et le raisonnement logique étendu.
MoE de 1,6 T et routage dynamique des experts
DeepSeek-V4-Pro a été pré-entraîné sur plus de 32 billions de tokens de texte et de code multilingues de haute qualité. Sur le plan architectural, il perfectionne la segmentation fine des experts et l'isolation des experts partagés caractéristiques de DeepSeek.
| Paramètre architectural | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 T (1 600 Mrd) | 284 Mrd |
| Paramètres actifs par token | ~49 Mrd | ~13 Mrd |
| Fenêtre de contexte | 1 000 000 tokens (1M) | 1 000 000 tokens (1M) |
| Volume de pré-entraînement | > 32 T tokens | > 32 T tokens |
| Licence | MIT License | MIT License |
| Poids du modèle | Dépôt Hugging Face | Dépôt Hugging Face |
Lors du calcul avant (forward pass), un réseau de routage dynamique distribue les tokens d'entrée vers les sous-experts les plus pertinents, tandis qu'une part fixe d'experts partagés traite la syntaxe générale et les connaissances de base. Cette approche élimine les goulots d'étranglement de charge courants dans les modèles MoE traditionnels et offre la puissance expressive d'un modèle dense de 1,6 T pour le coût opérationnel d'un modèle de 49 B.
CSA et HCA : franchir le mur de mémoire sur 1M de tokens
Dans un mécanisme d'attention standard (Full Attention), la mémoire requise par le KV cache augmente de manière linéaire avec la longueur de la séquence, tandis que la complexité de calcul croît de façon quadratique. À 1 million de tokens, conserver les états KV bruts nécessite des centaines de gigaoctets de VRAM, ce qui limite fortement la viabilité économique des boucles d'agents autonomes.
DeepSeek-V4-Pro résout ce problème grâce à deux couches d'attention compressée complémentaires :
Flux d'entrée (1M Tokens)
│
├── Fenêtre glissante locale ──► HCA (Heavily Compressed Attention) ──► Attention locale haute fidélité
│
└── Contexte global antérieur ──► CSA (Compressed Sparse Attention) ──► Sélecteur dynamique et projection
│
▼
Réduction de ~70%-80% de la mémoire KV
- Attention éparse compressée (CSA) : Un réseau d'évaluation léger identifie et regroupe dynamiquement les blocs de mémoire pertinents pour la requête en cours, n'activant que les tokens prioritaires et compressant le reste du contexte via des projections de faible rang.
- Attention fortement compressée (HCA) : Préserve la précision contextuelle dans la fenêtre glissante immédiate tout en appliquant une quantification inter-couches et une agrégation des clés/valeurs à l'historique distant.
La combinaison de CSA et HCA diminue l'utilisation de la mémoire du KV cache de plus de 70 %, permettant aux agents de programmation d'exécuter des refactorisations multi-fichiers et des analyses complètes de dépôts sans saturation mémoire.
Modes de pensée gradués (Thinking Modes)
Les premiers modèles de raisonnement (comme DeepSeek-R1) utilisaient des chaînes de pensée de longueur fixe. En production, les transformations de formats simples et la conception d'architectures logicielles requièrent des niveaux d'analyse très différents.
DeepSeek-V4-Pro propose trois modes de raisonnement sélectionnables à l'exécution :
- Low (Léger) : Adapté aux instructions directes, à l'extraction de données et à la complétion rapide de code, avec une latence minimale au premier token (TTFT) et une consommation réduite de tokens.
- High (Standard) : Mode par défaut pour la conception d'algorithmes, les preuves mathématiques et le débogage complexe avec formulation d'hypothèses et vérification progressive.
- Max (Exploration poussée) : Conçu pour les refactorisations de grande envergure, l'élaboration de protocoles réseau et les audits de sécurité, avec exploration multi-branches et validation rigoureuse.
Ces modes sont pris en charge nativement via la documentation de l'API et le guide Responses API, offrant un contrôle précis sur les coûts et les temps de réponse de chaque étape de travail.
Performances en programmation et sur les agents
Dans les évaluations portant sur l'ingénierie logicielle et le contrôle de terminaux, DeepSeek-V4-Pro montre une solide maîtrise des environnements techniques. Sur des benchmarks reconnus tels que Terminal-Bench 2.1 (opérations système et scripts de terminal) et DeepSWE (résolution de tickets dans des dépôts open source), le modèle surpasse les architectures ouvertes précédentes et rivalise avec les principaux modèles propriétaires.
Si DeepSeek-V4-Flash reste une solution adaptée aux interactions instantanées, l'envergure de 1,6 T paramètres et le mode de pensée Max de V4-Pro procurent des avantages décisifs pour résoudre des anomalies architecturales complexes sur des bases de code étendues.
Stratégie de déploiement et intégration
Les équipes techniques évaluant DeepSeek-V4-Pro peuvent envisager deux approches complémentaires :
- API cloud managée : L'accès via la plateforme officielle de DeepSeek ou OpenRouter évite la gestion d'un cluster MoE de grande taille, tout en tirant parti de la tarification par tranches horaires pour réduire les coûts des tâches asynchrones.
- Déploiement sur infrastructure privée : L'exécution des poids complets de 1,6 T nécessite des clusters d'entreprise équipés de 8 GPU H100/H200. Pour les postes de travail locaux ou les environnements légers, la version quantifiée en 4-bit de V4-Flash ou les moteurs d'inférence vLLM et SGLang compatibles CSA/HCA constituent des alternatives efficaces.
DeepSeek-V4-Pro démontre que les modèles à poids ouverts peuvent gérer des contextes très étendus tout en offrant un contrôle dynamique de l'effort de calcul. En réduisant la pression sur la mémoire et en optimisant les ressources de calcul, il pose les bases d'un déploiement pérenne pour les logiciels autonomes de nouvelle génération.