ESPACE PUBLICITAIRE DISPONIBLE · PARLONS-EN

Décryptage de DeepSeek-V4-Pro : MoE 1,6T, attention hybride CSA/HCA et révolution de mémoire sur 1M de tokens

365Finds Editorial

Le 13 août 2026, DeepSeek a officiellement lancé son modèle phare à poids ouverts, DeepSeek-V4-Pro (version finale 0813 GA). Cette annonce marque une transition décisive dans l'industrie, abandonnant le raisonnement dense monolithique et les chaînes de pensée rigides au profit d'architectures Mixture-of-Experts (MoE) éparses à très grande échelle, associées à une compression dynamique de la mémoire en contexte long. Avec 1,6 billion de paramètres totaux, seulement ~49 milliards de paramètres actifs par token, une fenêtre de contexte de 1 million de tokens et trois modes de raisonnement (Thinking Modes) sélectionnables à l'exécution, le modèle offre un socle technique robuste pour l'ingénierie logicielle complexe et les agents autonomes.

Pour surmonter le mur de mémoire rencontré lors du traitement de séquences atteignant un million de tokens, DeepSeek-V4-Pro a repensé le mécanisme d'attention. En associant l'attention éparse compressée (CSA) et l'attention fortement compressée (HCA), le modèle réduit significativement l'empreinte mémoire du KV cache tout en maintenant une grande fidélité dans la recherche documentaire et le raisonnement logique étendu.

MoE de 1,6 T et routage dynamique des experts

DeepSeek-V4-Pro a été pré-entraîné sur plus de 32 billions de tokens de texte et de code multilingues de haute qualité. Sur le plan architectural, il perfectionne la segmentation fine des experts et l'isolation des experts partagés caractéristiques de DeepSeek.

Paramètre architecturalDeepSeek-V4-ProDeepSeek-V4-Flash
Paramètres totaux1,6 T (1 600 Mrd)284 Mrd
Paramètres actifs par token~49 Mrd~13 Mrd
Fenêtre de contexte1 000 000 tokens (1M)1 000 000 tokens (1M)
Volume de pré-entraînement> 32 T tokens> 32 T tokens
LicenceMIT LicenseMIT License
Poids du modèleDépôt Hugging FaceDépôt Hugging Face

Lors du calcul avant (forward pass), un réseau de routage dynamique distribue les tokens d'entrée vers les sous-experts les plus pertinents, tandis qu'une part fixe d'experts partagés traite la syntaxe générale et les connaissances de base. Cette approche élimine les goulots d'étranglement de charge courants dans les modèles MoE traditionnels et offre la puissance expressive d'un modèle dense de 1,6 T pour le coût opérationnel d'un modèle de 49 B.

CSA et HCA : franchir le mur de mémoire sur 1M de tokens

Dans un mécanisme d'attention standard (Full Attention), la mémoire requise par le KV cache augmente de manière linéaire avec la longueur de la séquence, tandis que la complexité de calcul croît de façon quadratique. À 1 million de tokens, conserver les états KV bruts nécessite des centaines de gigaoctets de VRAM, ce qui limite fortement la viabilité économique des boucles d'agents autonomes.

DeepSeek-V4-Pro résout ce problème grâce à deux couches d'attention compressée complémentaires :

Flux d'entrée (1M Tokens)
  │
  ├── Fenêtre glissante locale ──► HCA (Heavily Compressed Attention) ──► Attention locale haute fidélité
  │
  └── Contexte global antérieur ──► CSA (Compressed Sparse Attention)  ──► Sélecteur dynamique et projection
                                                                           │
                                                                           ▼
                                                               Réduction de ~70%-80% de la mémoire KV
  1. Attention éparse compressée (CSA) : Un réseau d'évaluation léger identifie et regroupe dynamiquement les blocs de mémoire pertinents pour la requête en cours, n'activant que les tokens prioritaires et compressant le reste du contexte via des projections de faible rang.
  2. Attention fortement compressée (HCA) : Préserve la précision contextuelle dans la fenêtre glissante immédiate tout en appliquant une quantification inter-couches et une agrégation des clés/valeurs à l'historique distant.

La combinaison de CSA et HCA diminue l'utilisation de la mémoire du KV cache de plus de 70 %, permettant aux agents de programmation d'exécuter des refactorisations multi-fichiers et des analyses complètes de dépôts sans saturation mémoire.

Modes de pensée gradués (Thinking Modes)

Les premiers modèles de raisonnement (comme DeepSeek-R1) utilisaient des chaînes de pensée de longueur fixe. En production, les transformations de formats simples et la conception d'architectures logicielles requièrent des niveaux d'analyse très différents.

DeepSeek-V4-Pro propose trois modes de raisonnement sélectionnables à l'exécution :

Ces modes sont pris en charge nativement via la documentation de l'API et le guide Responses API, offrant un contrôle précis sur les coûts et les temps de réponse de chaque étape de travail.

Performances en programmation et sur les agents

Dans les évaluations portant sur l'ingénierie logicielle et le contrôle de terminaux, DeepSeek-V4-Pro montre une solide maîtrise des environnements techniques. Sur des benchmarks reconnus tels que Terminal-Bench 2.1 (opérations système et scripts de terminal) et DeepSWE (résolution de tickets dans des dépôts open source), le modèle surpasse les architectures ouvertes précédentes et rivalise avec les principaux modèles propriétaires.

Si DeepSeek-V4-Flash reste une solution adaptée aux interactions instantanées, l'envergure de 1,6 T paramètres et le mode de pensée Max de V4-Pro procurent des avantages décisifs pour résoudre des anomalies architecturales complexes sur des bases de code étendues.

Stratégie de déploiement et intégration

Les équipes techniques évaluant DeepSeek-V4-Pro peuvent envisager deux approches complémentaires :

DeepSeek-V4-Pro démontre que les modèles à poids ouverts peuvent gérer des contextes très étendus tout en offrant un contrôle dynamique de l'effort de calcul. En réduisant la pression sur la mémoire et en optimisant les ressources de calcul, il pose les bases d'un déploiement pérenne pour les logiciels autonomes de nouvelle génération.