Pour les équipes qui évaluent DeepSeek V4 Flash en production, la question centrale n'est pas le nombre de paramètres — c'est ce que le passage officiel du 31 juillet 2026 modifie réellement. DeepSeek a promu V4-Flash-0731 : 284 milliards total / 13 milliards actifs, architecture identique à la preview d'avril, gains intégralement issus du post-entraînement. Cet article détaille la chronologie avril–août, la grille tarifaire face à Kimi K3 et Qwen3.8-Max, l'architecture CSA+HCA / mHC / Muon, le caveat Harness, l'AA Index 50 et le coût $0.03/tâche, plus une checklist API en six étapes. Contexte : migration V4 GA, analyse Kimi K3.
01

Ce que DeepSeek a réellement livré le 31 juillet

En synthèse : pas un nouveau modèle, mais un re-train. DeepSeek confirme que V4-Flash-0731 conserve l'architecture 284B/13B de la preview d'avril et que les gains proviennent « entièrement d'un post-entraînement renouvelé ». Le déploiement a concerné l'API uniquement — application et site web restent sur d'anciennes builds. Le changelog mentionne pour la première fois DeepSeek Harness comme « bientôt disponible » ; le framework agent n'est toujours pas public.

DateJalonDétail clé
24 avr.Preview V4V4-Pro (1,6T/49B) et V4-Flash (284B/13B) open weight, contexte 1M, MIT
24 juil.API legacy hors lignedeepseek-chat et deepseek-reasoner retirés
27 juil.Poids Kimi K3Moonshot 2,8T sur Hugging Face — pression concurrentielle
31 juil.V4-Flash-0731 officielAPI + sync HF ; Harness cité ; API seule, pas de MAJ app
Au 5 aoûtV4-Pro officiel + HarnessToujours « dès que possible » ; rumeur GA 10–20 août non confirmée
01

Confondre « officiel » et « nouveau » : Aucun changement d'architecture — uniquement du post-entraînement.

02

Lire les scores Harness comme capacité brute : Terminal Bench 2.0 etc. passent par le mode minimal Harness, framework non publié.

03

Ignorer la restriction API-only : App grand public et web non migrés automatiquement.

04

Croire une date Pro non sourcée : « 10–20 août » provient de sources anonymes — DeepSeek dit seulement « bientôt ».

05

Mélanger scores vendeur et AA : L'Intelligence Index et les runs agent DeepSeek n'utilisent pas le même harness.

02

Grille tarifaire et matrice concurrentielle

ModèleStatutTotal / actifsContexteInput (miss/hit $/M)Output ($/M)Licence
V4-Flash-0731Officiel (31 juil.)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-ProPreview (officiel en attente)1,6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3Poids publiés (27 juil.)2,8T / ~104B~1,05M$3.00 / $0.30$15.00Modified MIT
Qwen3.8-MaxAPI GA (3 août)2,4T / 95B1M$2.00 / ~$0.17–0.25$6.00Promis open

Artificial Analysis : V4-Flash Intelligence Index 50, coût par tâche environ $0.03 — soit ~1/29 de Kimi K3 (~$0.86), ~1/62 de GPT-5.6 Sol (~$1.86), ~1/105 de Claude Fable 5 (~$3.15). DeepSeek ne vise pas le « benchmark #1 », mais « assez d'intelligence + prix extrême ».

DeepSeek a annoncé des majorations heures de pointe (Pékin 9h–12h, 14h–18h, ×2) sans date d'entrée en vigueur. Les équipes européennes doivent évaluer résidence des données et DPA avant migration production.

03

CSA+HCA, mHC, Muon et le caveat des benchmarks Harness

L'architecture est restée identique ; l'histoire est le post-entraînement. V4-Flash-0731 dépasse en plusieurs benchmarks agent la preview V4-Pro plus volumineuse — signal que la qualité post-train rivalise avec la simple montée en paramètres en 2026.

CSA

Compressed Sparse Attention + Highly Compressed Attention (HCA) : Présenté en externe comme attention sparse DSA — réduit compute et charge KV à 1M tokens.

mHC

Manifold-Constrained Hyper-Connections : Chemins résiduels améliorés pour une propagation de signal plus stable en profondeur.

Muon

Optimiseur Muon : Remplace les optimiseurs classiques — convergence plus rapide, courbes d'entraînement plus stables.

DeepSeek affirme pour V4-Pro à 1M tokens seulement 27 % des FLOPs par token vs V3.2 et 10 % de KV cache — sans reproduction indépendante à ce stade. DeepSeek Harness est le framework agent cité pour la première fois le 31 juillet (fichiers, outils, shell). Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 ont été mesurés en mode minimal Harness. DeepSeek avertit : « les scores dépendent fortement du harness et ne reflètent pas à l'identique la capacité du modèle. »

04

Checklist API en six étapes

01

Vérifier l'ID modèle : deepseek-v4-flash pointe automatiquement vers V4-Flash-0731 — endpoints compatibles OpenAI et Anthropic.

02

Retirer les noms legacy : deepseek-chat et deepseek-reasoner hors ligne depuis le 24 juillet.

03

Séparer Flash et preview Pro : Tâches agent légères à haute fréquence → Flash ($0.28/M output) ; raisonnement lourd → preview Pro provisoirement.

04

Exploiter le prompt cache : Réutiliser system prompts et définitions d'outils — input à $0.0028/M en cache hit.

05

Ne pas sélectionner sur Harness seul : A/B avec Claude Code, Cursor ou stack agent maison en staging ; attendre reproduction communautaire.

06

Mesurer cache hit et timeouts : Retours communautaires sur faible taux de cache et timeouts classificateur — workload réel avant bascule totale.

python
from openai import OpenAI

client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analyse ces logs CI pour identifier l'échec de build..."}]
)
05

Kill line, surnom Liang et trois chiffres clés

Avant le 31 juillet, la communauté chinoise avait surnommé le PDG Liang Wenfeng « Liang Bai Kai » — V4-Pro n'avait pas honoré le GA mi-juillet promis. Après V4-Flash-0731, le surnom « Liang Sheng » est revenu. La thèse de la « kill line » : DeepSeek fixe un seuil « performance suffisante + prix extrême » — sans net avantage en qualité ou en coût, un concurrent perd en visibilité. Cela éclaire la baisse GPT-5.6 Luna −80 % et les guerres tarifaires parallèles.

Le 31 juillet, NVIDIA, Broadcom et AMD ont peu bougé — le marché intègre désormais les « percées DeepSeek » sans déclencher automatiquement des ventes massives sur les puces.

A

82,7 vs 67,9 / Terminal Bench 2.0 : Flash bat la preview Pro — mode minimal Harness, run vendeur, réglages max.

B

50 / AA Index : Pas en tête vs Kimi K3 ou GLM-5.2 — mais coût par tâche le plus bas.

C

$0.03 / tâche : Avantage coût — septième semaine #1 sur OpenRouter par volume d'appels.

Les alternatives cachent des coûts : dépendance API pure en charge agent massive ; tests agent 7×24 sur Mac personnel fragiles au sleep et au cache ; scores Harness pris pour argent comptant faussent le choix production. Pour CI/CD iOS et A/B multi-modèles, la location cloud Mac Mini dédiée KVMNODE est généralement le meilleur choix. Voir la page tarifs, le centre d'aide ou commander directement.

Données au 5 août 2026 · Sources : documentation API DeepSeek et changelog, rapport technique DeepSeek-V4, Artificial Analysis, presse financière