Pour les développeurs IA et équipes techniques qui suivent DeepSeek V4 GA, la tarification peak-valley et la migration API : le 20 juillet 2026, DeepSeek V4 a atteint la disponibilité générale — capacités Agent, raisonnement mathématique et génération de code renforcés par rapport à la preview d'avril, avec pour la première fois une facturation différenciée peak-valley. Ce guide professionnel couvre la chronologie preview → GA, l'architecture V4-Pro / V4-Flash (CSA + HCA / mHC / Muon), les benchmarks complets dont SWE-bench Verified 80,6 %, la comparaison vs GPT-5.6 Sol et Claude Fable 5, les grilles tarifaires peak-valley et stratégies d'économie, et l'échéance de migration API du 24 juillet avec six FAQ. Voir aussi inférence locale DeepSeek V4, test Kimi K3.
01

Qu'est-ce que DeepSeek V4 GA ? De la preview à la disponibilité générale

Après trois mois de tests en preview, DeepSeek V4 GA est entré en production le 20 juillet 2026. Par rapport à la preview d'avril, la GA améliore les performances Agent, le raisonnement mathématique et la génération de code — et introduit pour la première fois la tarification peak-valley, marquant la transition de DeepSeek d'un accès quasi gratuit vers une exploitation commerciale structurée.

DateJalon
24 avril 2026Preview V4 + open source MIT : V4-Pro (1,6T) et V4-Flash (284B)
Mai 2026V4-Flash et V4-Pro optimisés production ; API disponible
Juin 2026Prix de sortie V4-Pro réduit de 75 % de façon permanente (à $0,87/M tokens)
29 juin 2026E-mail à tous les utilisateurs API : GA mi-juillet, première annonce peak-valley
19 juillet 2026Développeurs sélectionnés en accès gris GA ; presse : « version complète imminente »
20 juillet 2026Release GA (date de publication de cet article)
24 juillet 2026Noms legacy deepseek-chat et deepseek-reasoner définitivement retirés

Synthèse : la preview était déjà performante ; la GA apporte des gains ciblés Agent, mathématiques et code, plus une structure de facturation commerciale formalisée. L'architecture MoE sous-jacente est inchangée — la GA consolide stabilité, optimisation et maturité tarifaire.

01

Manquer l'échéance de migration : le code appelant encore deepseek-chat cessera de fonctionner après le 24 juillet, 23:59 heure de Pékin.

02

Appels aveugles en peak : en semaine 09:00–12:00 et 14:00–18:00 heure de Pékin, les tarifs doublent — les jobs batch sans décalage horaire gonflent rapidement la facture.

03

Absence de routage Pro/Flash : utiliser V4-Pro pour du routage simple gaspille un budget que V4-Flash (sortie $0,28/M off-peak) pourrait absorber.

04

Ignorer le cache : sans Prompt Cache sur les system prompts répétés, vous manquez l'entrée Flash en cache à seulement $0,0028/M.

05

Mauvaise lecture des benchmarks : SWE-bench Verified 80,6 % est le record open source, mais Claude Fable 5 mène SWE-bench Pro (80,3 %) — ne choisissez pas un modèle de production sur un seul classement.

02

V4-Pro et V4-Flash : CSA, HCA, mHC et Muon décryptés

DeepSeek V4 apporte trois avancées architecturales qui réduisent la mémoire KV-cache à 10 % de V3.2 à 1M tokens (V4-Flash jusqu'à 7 %), rendant le contexte ultra-long économiquement viable.

SpécificationV4-ProV4-Flash
Paramètres totaux1,6 billion (1,6T)284 milliards (284B)
Paramètres actifs par token49 milliards (49B)13 milliards (13B)
Couches Transformer6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie max384K tokens384K tokens
PrécisionFP4 (experts) + FP8 (reste)FP4 + FP8 mixte
Données de pré-entraînement33T+ tokens32T+ tokens
LicenceMITMIT

2.1 Attention hybride : CSA + HCA

DeepSeek V4 remplace le MLA de V2/V3 par un hybride de deux mécanismes d'attention :

CSA

Compressed Sparse Attention : les séquences KV sont mises en pool avec porte Softmax ; un « lightning indexer » FP4 sélectionne les clés sparse top-k (Pro : top-1024, Flash : top-512) avec fenêtre glissante 128 tokens. À 1M contexte, les FLOPs d'inférence ne représentent que 27 % de V3.2.

HCA

Heavily Compressed Attention : compression 128× des tokens puis attention dense globale pour les dépendances longue portée, en complément de CSA. V4-Flash : 2 premières couches en HCA, puis alternance CSA/HCA ; V4-Pro suit un schéma similaire.

2.2 Hyper-connexions contraintes (mHC) et optimiseur Muon

mHC enrichit les connexions résiduelles standard avec un flux résiduel à 4 canaux et des matrices de mélange contraintes au polytope de Birkhoff (doublement stochastique), stabilisant les signaux sur 61 couches. L'optimiseur Muon (remplaçant AdamW) applique une orthogonalisation Newton-Schulz aux gradients pour une convergence plus rapide et un entraînement plus stable.

Mode de raisonnementComportementUsage recommandé
Non-thinkPas de chaîne de pensée ; réponse la plus rapideQ&R simples, routage
Think HighRaisonnement explicite (tags thinking)Complexité moyenne, debug code
Think MaxRaisonnement maximal ; requiert 384K+ contexteMathématiques avancées, Agents longue chaîne

Paramètres d'échantillonnage officiels : temperature=1.0, top_p=1.0 sur tous les modes.

03

Benchmarks : SWE-bench, rapport coût-performance et comparaison des modèles

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % (open source #1)96,0 %Non publié séparément~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified évalue la correction de bugs GitHub réels. 80,6 % est le record open source actuel, à égalité avec Gemini 3.1 Pro. SWE-bench Pro est plus exigeant — Claude Fable 5 mène avec 80,3 %.

Artificial Analysis : Claude Fable 5 coûte $3,48 par tâche Strategy & Ops (50 points) ; DeepSeek V4-Pro $0,03 pour une tâche comparable (38 points) — 116× moins cher pour un écart d'environ 12 points.

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open source / auto-hébergéOui (MIT)Non (fermé)Non (fermé)
Fenêtre de contexte1M tokensNon divulguée1M tokens
Sortie API (off-peak)$0,87/M~$15/M$50/M
Prix de sortie peak$1,74/M
Capacité codeTrès forte (proche Fable 5)Très forteLa plus forte (SWE-bench Pro)
Confidentialité des donnéesOui (déploiement privé)NonNon

Recommandations par scénario : budget serré / volume élevé / déploiement privé → V4-Pro ou V4-Flash ; qualité code maximale, coût secondaire → Claude Fable 5 ; algorithmes et mathématiques avancés → GPT-5.6 Sol / Ultra ; ingestion massive de logs ou documents → V4-Flash (entrée en cache dès $0,0028/M).

04

Tarification peak-valley et migration API avant le 24 juillet

Le changement de facturation le plus notable de la GA : la tarification différenciée peak-valley, comparable aux tarifs horaires de l'électricité. Heures peak (heure de Pékin) : jours ouvrés 09:00–12:00 et 14:00–18:00 — tarifs doublés.

ModèlePosteOff-peakPeak
V4-ProEntrée (cache hit)¥0,025 / $0,0035 / 1M
V4-ProEntrée (cache miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
V4-ProSortie¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashEntrée (cache hit)¥0,02 / $0,0028 / 1M
V4-FlashEntrée (cache miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
V4-FlashSortie¥2,00 / $0,28 / 1M¥4,00 / $0,56

Quatre leviers d'économie : (1) planifier les jobs non temps réel off-peak (après 18:00 ou avant 09:00 heure de Pékin) ; (2) construire un Prompt Cache pour les préfixes system répétés ; (3) router le léger vers Flash, escalader le raisonnement complexe vers Pro ; (4) surveiller les alertes e-mail DeepSeek 24 h avant tout changement tarifaire. Même en peak, la sortie V4-Pro à $1,74/M reste 8,6× moins chère que Claude Opus 4.8 ($15/M).

Échéance critique : les noms legacy deepseek-chat et deepseek-reasoner cessent de fonctionner le 24 juillet 2026 à 15:59 UTC (24 juillet, 23:59 heure de Pékin).

Modèle legacyNouveau modèleRemarque
deepseek-chatdeepseek-v4-flash (non-think)Rapide ; tâches légères
deepseek-reasonerdeepseek-v4-flash (mode think)Ou migration vers deepseek-v4-pro

Six étapes de migration :

01

Rechercher dans le code : repérer toute référence à deepseek-chat et deepseek-reasoner.

02

Appliquer le mapping : chat léger → deepseek-v4-flash ; ancien reasoner → Flash en mode think ou deepseek-v4-pro.

03

Mettre à jour le SDK OpenAI : modifier uniquement le paramètre model ; conserver base_url à https://api.deepseek.com.

04

Activer le thinking (optionnel) : extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} remplace le comportement reasoner.

05

Compatibilité SDK Anthropic : V4 supporte OpenAI ChatCompletions et Anthropic Messages — mettre à jour model seulement.

06

Validation staging : régression complète avant le 24 juillet ; confirmer l'absence de noms legacy.

python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
05

DeepSeek V4 GA vaut-il la migration ? Données citables et conclusion

DeepSeek V4 GA constitue l'un des jalons open source les plus significatifs de 2026. Sa valeur ne réside pas à battre Claude Fable 5 ou GPT-5.6 sur chaque graphique aujourd'hui — mais à offrir une performance open source incontestée à environ 1/10 à 1/100 du coût des modèles fermés flagship.

A

80,6 % / open source #1 : record SWE-bench Verified open source, à égalité avec Gemini 3.1 Pro.

B

10 % / 7 % : à 1M tokens, mémoire KV-cache à 10 % de V3.2 (Flash jusqu'à 7 %).

C

$0,03 / 116× : tâche Strategy & Ops V4-Pro à $0,03 vs Fable 5 à $3,48 — écart tarifaire 116× pour ~24 % d'écart de score.

Pour les entreprises soucieuses de souveraineté des données, les développeurs indépendants à budget contraint, les ingénieurs Agent nécessitant 1M tokens et les équipes produit IA orientées efficacité, DeepSeek V4 Pro demeure le choix le plus équilibré. La facturation peak-valley ajoute une couche de planification, mais reste très compétitive — signal de maturité, non de recul.

Alternatives : tests de charge Agent DeepSeek sur Mac personnel interrompus par veille et réseau ; API fermées seules ne rivalisent pas avec la licence MIT et la sortie $0,87/M off-peak de V4 ; manquer l'échéance du 24 juillet provoque des ruptures de service. Pour CI/CD iOS, automation Agent DeepSeek V4 24/7 et validation ds4 locale, la location Mac Mini M4 dédié KVMNODE est généralement l'hébergement le plus fiable : mémoire unifiée Apple Silicon, sudo ouvert, durées jour/semaine/mois flexibles. Détails : tarifs, centre d'aide, commander.

Données au 20 juillet 2026 · Sources : documentation officielle DeepSeek, arXiv:2606.19348, Hugging Face, Artificial Analysis