Ce que DeepSeek a réellement livré le 31 juillet
En synthèse : pas un nouveau modèle, mais un re-train. DeepSeek confirme que V4-Flash-0731 conserve l'architecture 284B/13B de la preview d'avril et que les gains proviennent « entièrement d'un post-entraînement renouvelé ». Le déploiement a concerné l'API uniquement — application et site web restent sur d'anciennes builds. Le changelog mentionne pour la première fois DeepSeek Harness comme « bientôt disponible » ; le framework agent n'est toujours pas public.
| Date | Jalon | Détail clé |
|---|---|---|
| 24 avr. | Preview V4 | V4-Pro (1,6T/49B) et V4-Flash (284B/13B) open weight, contexte 1M, MIT |
| 24 juil. | API legacy hors ligne | deepseek-chat et deepseek-reasoner retirés |
| 27 juil. | Poids Kimi K3 | Moonshot 2,8T sur Hugging Face — pression concurrentielle |
| 31 juil. | V4-Flash-0731 officiel | API + sync HF ; Harness cité ; API seule, pas de MAJ app |
| Au 5 août | V4-Pro officiel + Harness | Toujours « dès que possible » ; rumeur GA 10–20 août non confirmée |
Confondre « officiel » et « nouveau » : Aucun changement d'architecture — uniquement du post-entraînement.
Lire les scores Harness comme capacité brute : Terminal Bench 2.0 etc. passent par le mode minimal Harness, framework non publié.
Ignorer la restriction API-only : App grand public et web non migrés automatiquement.
Croire une date Pro non sourcée : « 10–20 août » provient de sources anonymes — DeepSeek dit seulement « bientôt ».
Mélanger scores vendeur et AA : L'Intelligence Index et les runs agent DeepSeek n'utilisent pas le même harness.
Grille tarifaire et matrice concurrentielle
| Modèle | Statut | Total / actifs | Contexte | Input (miss/hit $/M) | Output ($/M) | Licence |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Officiel (31 juil.) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | Preview (officiel en attente) | 1,6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | Poids publiés (27 juil.) | 2,8T / ~104B | ~1,05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| Qwen3.8-Max | API GA (3 août) | 2,4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | Promis open |
Artificial Analysis : V4-Flash Intelligence Index 50, coût par tâche environ $0.03 — soit ~1/29 de Kimi K3 (~$0.86), ~1/62 de GPT-5.6 Sol (~$1.86), ~1/105 de Claude Fable 5 (~$3.15). DeepSeek ne vise pas le « benchmark #1 », mais « assez d'intelligence + prix extrême ».
DeepSeek a annoncé des majorations heures de pointe (Pékin 9h–12h, 14h–18h, ×2) sans date d'entrée en vigueur. Les équipes européennes doivent évaluer résidence des données et DPA avant migration production.
CSA+HCA, mHC, Muon et le caveat des benchmarks Harness
L'architecture est restée identique ; l'histoire est le post-entraînement. V4-Flash-0731 dépasse en plusieurs benchmarks agent la preview V4-Pro plus volumineuse — signal que la qualité post-train rivalise avec la simple montée en paramètres en 2026.
Compressed Sparse Attention + Highly Compressed Attention (HCA) : Présenté en externe comme attention sparse DSA — réduit compute et charge KV à 1M tokens.
Manifold-Constrained Hyper-Connections : Chemins résiduels améliorés pour une propagation de signal plus stable en profondeur.
Optimiseur Muon : Remplace les optimiseurs classiques — convergence plus rapide, courbes d'entraînement plus stables.
DeepSeek affirme pour V4-Pro à 1M tokens seulement 27 % des FLOPs par token vs V3.2 et 10 % de KV cache — sans reproduction indépendante à ce stade. DeepSeek Harness est le framework agent cité pour la première fois le 31 juillet (fichiers, outils, shell). Terminal Bench 2.0 82,7 vs preview V4-Pro 67,9 ont été mesurés en mode minimal Harness. DeepSeek avertit : « les scores dépendent fortement du harness et ne reflètent pas à l'identique la capacité du modèle. »
Checklist API en six étapes
Vérifier l'ID modèle : deepseek-v4-flash pointe automatiquement vers V4-Flash-0731 — endpoints compatibles OpenAI et Anthropic.
Retirer les noms legacy : deepseek-chat et deepseek-reasoner hors ligne depuis le 24 juillet.
Séparer Flash et preview Pro : Tâches agent légères à haute fréquence → Flash ($0.28/M output) ; raisonnement lourd → preview Pro provisoirement.
Exploiter le prompt cache : Réutiliser system prompts et définitions d'outils — input à $0.0028/M en cache hit.
Ne pas sélectionner sur Harness seul : A/B avec Claude Code, Cursor ou stack agent maison en staging ; attendre reproduction communautaire.
Mesurer cache hit et timeouts : Retours communautaires sur faible taux de cache et timeouts classificateur — workload réel avant bascule totale.
from openai import OpenAI
client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Analyse ces logs CI pour identifier l'échec de build..."}]
)Kill line, surnom Liang et trois chiffres clés
Avant le 31 juillet, la communauté chinoise avait surnommé le PDG Liang Wenfeng « Liang Bai Kai » — V4-Pro n'avait pas honoré le GA mi-juillet promis. Après V4-Flash-0731, le surnom « Liang Sheng » est revenu. La thèse de la « kill line » : DeepSeek fixe un seuil « performance suffisante + prix extrême » — sans net avantage en qualité ou en coût, un concurrent perd en visibilité. Cela éclaire la baisse GPT-5.6 Luna −80 % et les guerres tarifaires parallèles.
Le 31 juillet, NVIDIA, Broadcom et AMD ont peu bougé — le marché intègre désormais les « percées DeepSeek » sans déclencher automatiquement des ventes massives sur les puces.
82,7 vs 67,9 / Terminal Bench 2.0 : Flash bat la preview Pro — mode minimal Harness, run vendeur, réglages max.
50 / AA Index : Pas en tête vs Kimi K3 ou GLM-5.2 — mais coût par tâche le plus bas.
$0.03 / tâche : Avantage coût — septième semaine #1 sur OpenRouter par volume d'appels.
Les alternatives cachent des coûts : dépendance API pure en charge agent massive ; tests agent 7×24 sur Mac personnel fragiles au sleep et au cache ; scores Harness pris pour argent comptant faussent le choix production. Pour CI/CD iOS et A/B multi-modèles, la location cloud Mac Mini dédiée KVMNODE est généralement le meilleur choix. Voir la page tarifs, le centre d'aide ou commander directement.
Données au 5 août 2026 · Sources : documentation API DeepSeek et changelog, rapport technique DeepSeek-V4, Artificial Analysis, presse financière