Qu'est-ce que DeepSeek V4 GA ? De la preview à la disponibilité générale
Après trois mois de tests en preview, DeepSeek V4 GA est entré en production le 20 juillet 2026. Par rapport à la preview d'avril, la GA améliore les performances Agent, le raisonnement mathématique et la génération de code — et introduit pour la première fois la tarification peak-valley, marquant la transition de DeepSeek d'un accès quasi gratuit vers une exploitation commerciale structurée.
| Date | Jalon |
|---|---|
| 24 avril 2026 | Preview V4 + open source MIT : V4-Pro (1,6T) et V4-Flash (284B) |
| Mai 2026 | V4-Flash et V4-Pro optimisés production ; API disponible |
| Juin 2026 | Prix de sortie V4-Pro réduit de 75 % de façon permanente (à $0,87/M tokens) |
| 29 juin 2026 | E-mail à tous les utilisateurs API : GA mi-juillet, première annonce peak-valley |
| 19 juillet 2026 | Développeurs sélectionnés en accès gris GA ; presse : « version complète imminente » |
| 20 juillet 2026 | Release GA (date de publication de cet article) |
| 24 juillet 2026 | Noms legacy deepseek-chat et deepseek-reasoner définitivement retirés |
Synthèse : la preview était déjà performante ; la GA apporte des gains ciblés Agent, mathématiques et code, plus une structure de facturation commerciale formalisée. L'architecture MoE sous-jacente est inchangée — la GA consolide stabilité, optimisation et maturité tarifaire.
Manquer l'échéance de migration : le code appelant encore deepseek-chat cessera de fonctionner après le 24 juillet, 23:59 heure de Pékin.
Appels aveugles en peak : en semaine 09:00–12:00 et 14:00–18:00 heure de Pékin, les tarifs doublent — les jobs batch sans décalage horaire gonflent rapidement la facture.
Absence de routage Pro/Flash : utiliser V4-Pro pour du routage simple gaspille un budget que V4-Flash (sortie $0,28/M off-peak) pourrait absorber.
Ignorer le cache : sans Prompt Cache sur les system prompts répétés, vous manquez l'entrée Flash en cache à seulement $0,0028/M.
Mauvaise lecture des benchmarks : SWE-bench Verified 80,6 % est le record open source, mais Claude Fable 5 mène SWE-bench Pro (80,3 %) — ne choisissez pas un modèle de production sur un seul classement.
V4-Pro et V4-Flash : CSA, HCA, mHC et Muon décryptés
DeepSeek V4 apporte trois avancées architecturales qui réduisent la mémoire KV-cache à 10 % de V3.2 à 1M tokens (V4-Flash jusqu'à 7 %), rendant le contexte ultra-long économiquement viable.
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs par token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie max | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 (reste) | FP4 + FP8 mixte |
| Données de pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
2.1 Attention hybride : CSA + HCA
DeepSeek V4 remplace le MLA de V2/V3 par un hybride de deux mécanismes d'attention :
Compressed Sparse Attention : les séquences KV sont mises en pool 4× avec porte Softmax ; un « lightning indexer » FP4 sélectionne les clés sparse top-k (Pro : top-1024, Flash : top-512) avec fenêtre glissante 128 tokens. À 1M contexte, les FLOPs d'inférence ne représentent que 27 % de V3.2.
Heavily Compressed Attention : compression 128× des tokens puis attention dense globale pour les dépendances longue portée, en complément de CSA. V4-Flash : 2 premières couches en HCA, puis alternance CSA/HCA ; V4-Pro suit un schéma similaire.
2.2 Hyper-connexions contraintes (mHC) et optimiseur Muon
mHC enrichit les connexions résiduelles standard avec un flux résiduel à 4 canaux et des matrices de mélange contraintes au polytope de Birkhoff (doublement stochastique), stabilisant les signaux sur 61 couches. L'optimiseur Muon (remplaçant AdamW) applique une orthogonalisation Newton-Schulz aux gradients pour une convergence plus rapide et un entraînement plus stable.
| Mode de raisonnement | Comportement | Usage recommandé |
|---|---|---|
| Non-think | Pas de chaîne de pensée ; réponse la plus rapide | Q&R simples, routage |
| Think High | Raisonnement explicite (tags thinking) | Complexité moyenne, debug code |
| Think Max | Raisonnement maximal ; requiert 384K+ contexte | Mathématiques avancées, Agents longue chaîne |
Paramètres d'échantillonnage officiels : temperature=1.0, top_p=1.0 sur tous les modes.
Benchmarks : SWE-bench, rapport coût-performance et comparaison des modèles
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (open source #1) | 96,0 % | Non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified évalue la correction de bugs GitHub réels. 80,6 % est le record open source actuel, à égalité avec Gemini 3.1 Pro. SWE-bench Pro est plus exigeant — Claude Fable 5 mène avec 80,3 %.
Artificial Analysis : Claude Fable 5 coûte $3,48 par tâche Strategy & Ops (50 points) ; DeepSeek V4-Pro $0,03 pour une tâche comparable (38 points) — 116× moins cher pour un écart d'environ 12 points.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / auto-hébergé | Oui (MIT) | Non (fermé) | Non (fermé) |
| Fenêtre de contexte | 1M tokens | Non divulguée | 1M tokens |
| Sortie API (off-peak) | $0,87/M | ~$15/M | $50/M |
| Prix de sortie peak | $1,74/M | — | — |
| Capacité code | Très forte (proche Fable 5) | Très forte | La plus forte (SWE-bench Pro) |
| Confidentialité des données | Oui (déploiement privé) | Non | Non |
Recommandations par scénario : budget serré / volume élevé / déploiement privé → V4-Pro ou V4-Flash ; qualité code maximale, coût secondaire → Claude Fable 5 ; algorithmes et mathématiques avancés → GPT-5.6 Sol / Ultra ; ingestion massive de logs ou documents → V4-Flash (entrée en cache dès $0,0028/M).
Tarification peak-valley et migration API avant le 24 juillet
Le changement de facturation le plus notable de la GA : la tarification différenciée peak-valley, comparable aux tarifs horaires de l'électricité. Heures peak (heure de Pékin) : jours ouvrés 09:00–12:00 et 14:00–18:00 — tarifs doublés.
| Modèle | Poste | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / $0,0035 / 1M | 2× |
| V4-Pro | Entrée (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Sortie | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Entrée (cache hit) | ¥0,02 / $0,0028 / 1M | 2× |
| V4-Flash | Entrée (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Sortie | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Quatre leviers d'économie : (1) planifier les jobs non temps réel off-peak (après 18:00 ou avant 09:00 heure de Pékin) ; (2) construire un Prompt Cache pour les préfixes system répétés ; (3) router le léger vers Flash, escalader le raisonnement complexe vers Pro ; (4) surveiller les alertes e-mail DeepSeek 24 h avant tout changement tarifaire. Même en peak, la sortie V4-Pro à $1,74/M reste 8,6× moins chère que Claude Opus 4.8 ($15/M).
Échéance critique : les noms legacy deepseek-chat et deepseek-reasoner cessent de fonctionner le 24 juillet 2026 à 15:59 UTC (24 juillet, 23:59 heure de Pékin).
| Modèle legacy | Nouveau modèle | Remarque |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-think) | Rapide ; tâches légères |
deepseek-reasoner | deepseek-v4-flash (mode think) | Ou migration vers deepseek-v4-pro |
Six étapes de migration :
Rechercher dans le code : repérer toute référence à deepseek-chat et deepseek-reasoner.
Appliquer le mapping : chat léger → deepseek-v4-flash ; ancien reasoner → Flash en mode think ou deepseek-v4-pro.
Mettre à jour le SDK OpenAI : modifier uniquement le paramètre model ; conserver base_url à https://api.deepseek.com.
Activer le thinking (optionnel) : extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} remplace le comportement reasoner.
Compatibilité SDK Anthropic : V4 supporte OpenAI ChatCompletions et Anthropic Messages — mettre à jour model seulement.
Validation staging : régression complète avant le 24 juillet ; confirmer l'absence de noms legacy.
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)DeepSeek V4 GA vaut-il la migration ? Données citables et conclusion
DeepSeek V4 GA constitue l'un des jalons open source les plus significatifs de 2026. Sa valeur ne réside pas à battre Claude Fable 5 ou GPT-5.6 sur chaque graphique aujourd'hui — mais à offrir une performance open source incontestée à environ 1/10 à 1/100 du coût des modèles fermés flagship.
80,6 % / open source #1 : record SWE-bench Verified open source, à égalité avec Gemini 3.1 Pro.
10 % / 7 % : à 1M tokens, mémoire KV-cache à 10 % de V3.2 (Flash jusqu'à 7 %).
$0,03 / 116× : tâche Strategy & Ops V4-Pro à $0,03 vs Fable 5 à $3,48 — écart tarifaire 116× pour ~24 % d'écart de score.
Pour les entreprises soucieuses de souveraineté des données, les développeurs indépendants à budget contraint, les ingénieurs Agent nécessitant 1M tokens et les équipes produit IA orientées efficacité, DeepSeek V4 Pro demeure le choix le plus équilibré. La facturation peak-valley ajoute une couche de planification, mais reste très compétitive — signal de maturité, non de recul.
Alternatives : tests de charge Agent DeepSeek sur Mac personnel interrompus par veille et réseau ; API fermées seules ne rivalisent pas avec la licence MIT et la sortie $0,87/M off-peak de V4 ; manquer l'échéance du 24 juillet provoque des ruptures de service. Pour CI/CD iOS, automation Agent DeepSeek V4 24/7 et validation ds4 locale, la location Mac Mini M4 dédié KVMNODE est généralement l'hébergement le plus fiable : mémoire unifiée Apple Silicon, sudo ouvert, durées jour/semaine/mois flexibles. Détails : tarifs, centre d'aide, commander.
Données au 20 juillet 2026 · Sources : documentation officielle DeepSeek, arXiv:2606.19348, Hugging Face, Artificial Analysis