Was DeepSeek am 31. Juli wirklich veröffentlicht hat
Kurz: kein neues Modell, sondern ein Re-Train. DeepSeek bestätigte ausdrücklich, dass V4-Flash-0731 dieselbe 284B/13B-Architektur wie die April-Preview trägt und die Verbesserungen «vollständig aus erneutem Post-Training» stammen. Der Rollout betraf nur die API — App und Web blieben auf älteren Builds. Im Changelog tauchte erstmals DeepSeek Harness als «bald verfügbar» auf; das Agent-Framework selbst ist bis heute nicht öffentlich.
| Datum | Meilenstein | Kernpunkt |
|---|---|---|
| 24. Apr. | V4-Preview | V4-Pro (1,6T/49B) und V4-Flash (284B/13B) open weight, 1M Kontext, MIT |
| 24. Juli | Legacy-API offline | deepseek-chat und deepseek-reasoner abgeschaltet |
| 27. Juli | Kimi K3 Gewichte | Moonshot 2,8T auf Hugging Face — Druck auf DeepSeek |
| 31. Juli | V4-Flash-0731 offiziell | API + HF-Sync; Harness im Changelog; nur API, kein App-Update |
| Stand 5. Aug. | V4-Pro offiziell + Harness | Weiter «so bald wie möglich»; Gerücht 10.–20. Aug. GA unbestätigt |
«Offiziell» mit «neu» verwechseln: Keine Architekturänderung — nur Post-Training.
Harness-Scores als reine Modellfähigkeit lesen: Terminal Bench 2.0 etc. laufen über Harness-Minimalmodus, Framework noch nicht released.
API-only ignorieren: Verbraucher-App und Web nicht automatisch auf 0731.
Unbestätigtes Pro-Datum glauben: «10.–20. August» stammt aus anonymen Quellen — DeepSeek sagt nur «bald».
Vendor- und AA-Scores mischen: Artificial Analysis Index und DeepSeek-Agent-Runs nutzen unterschiedliche Harnesses.
Preistabelle und Wettbewerber-Matrix
| Modell | Status | Gesamt / aktiv | Kontext | Input (miss/hit $/M) | Output ($/M) | Lizenz |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell (31.07.) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | Preview (offiziell ausstehend) | 1,6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | Gewichte shipped (27.07.) | 2,8T / ~104B | ~1,05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| Qwen3.8-Max | API GA (03.08.) | 2,4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | Versprochen |
Artificial Analysis: V4-Flash Intelligence Index 50, Single-Task-Kosten ca. $0.03 — etwa 1/29 von Kimi K3 (~$0.86), 1/62 von GPT-5.6 Sol (~$1.86), 1/105 von Claude Fable 5 (~$3.15). DeepSeek setzt nicht auf «Benchmark #1», sondern auf «genug Intelligenz + extrem niedriger Preis».
DeepSeek kündigte Peak-Hour-Aufschläge an (Peking 9–12 Uhr, 14–18 Uhr, 2×), ohne festes Startdatum. EU-Teams: API-Verarbeitung in China kann DSGVO-Datenresidenz und Auftragsverarbeitung betreffen — Legal und DPA vor Produktions-Migration prüfen.
CSA+HCA, mHC, Muon und das Harness-Benchmark-Caveat
Die Architektur blieb identisch; die Story ist Post-Training. V4-Flash-0731 schlägt in mehreren Agent-Benchmarks das größere V4-Pro-Preview — ein Signal, dass 2026 Post-Training-Qualität mit Rohskalierung konkurriert.
Compressed Sparse Attention + Highly Compressed Attention (HCA): Extern als DSA-Sparse-Attention bekannt — senkt Compute und KV-Last bei 1M Kontext.
Manifold-Constrained Hyper-Connections: Verbesserte Residual-Pfade für stabilere Signalpropagation in tiefen Layern.
Muon-Optimierer: Ersetzt klassische Optimizer — schnellere Konvergenz, stabilere Trainingskurven.
DeepSeek behauptet für V4-Pro bei 1M Kontext nur 27 % der FLOPs pro Token vs. V3.2 und 10 % KV-Cache — noch ohne unabhängige Reproduktion. DeepSeek Harness ist das erstmals im 31.-Juli-Changelog genannte Agent-Framework (Dateizugriff, Tools, Shell). Terminal Bench 2.0 82,7 vs. V4-Pro-Preview 67,9 wurden im Harness-Minimalmodus gemessen. DeepSeek warnt selbst: «Scores sind stark harness-abhängig und gleichen sich nicht 1:1 mit Modellfähigkeit.»
Sechs-Schritte-API-Checkliste
Model-ID prüfen: deepseek-v4-flash zeigt automatisch auf V4-Flash-0731 — OpenAI- und Anthropic-kompatible Endpoints.
Legacy-Namen entfernen: deepseek-chat und deepseek-reasoner seit 24. Juli offline.
Flash vs. Pro-Preview trennen: Hohe Frequenz / leichte Agent-Tasks → Flash ($0.28/M Output); schwere Reasoning-Pfade vorerst Pro-Preview.
Prompt-Cache nutzen: System-Prompts und Tool-Defs wiederverwenden — Input auf $0.0028/M bei Cache-Hit.
Nicht nur Harness-Scores für Produktion: A/B mit Claude Code, Cursor oder eigenem Agent-Stack in Staging; auf Community-Reproduktion warten.
Cache-Hitrate und Timeouts messen: Community berichtet niedrige Cache-Treffer und Safety-Classifier-Timeouts — Real-Workload vor Vollmigration. EU: DSGVO-konforme Verarbeitung und AV-Vertrag klären.
from openai import OpenAI
client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Analysiere diese CI-Logs auf Build-Fehler..."}]
)Kill Line, Liang-Nickname und drei harte Zahlen
Vor dem 31. Juli verspottete die chinesische AI-Community CEO Liang Wenfeng als «Liang Bai Kai» — weil V4-Pro das versprochene Mitte-Juli-GA verpasste. Nach V4-Flash-0731 kehrte der Spitzname «Liang Sheng» zurück. Die «Kill Line»-These: DeepSeek setzt mit «ausreichender Leistung + Extrempreis» eine Schwelle — wer weder deutlich besser noch billiger ist, verliert Marktanteil. Das erklärt GPT-5.6 Luna −80 % und ähnliche Preiskämpfe.
Am 31. Juli reagierten NVIDIA, Broadcom und AMD kaum — der Markt gewöhnt sich an «DeepSeek-Effizienz», ohne automatisch Chip-Shorts auszulösen.
82,7 vs 67,9 / Terminal Bench 2.0: Flash schlägt Pro-Preview — Harness-Minimalmodus, Vendor-Run, max-Settings.
50 / AA Index: Nicht Spitze vs. Kimi K3 oder GLM-5.2 — aber niedrigste Task-Kosten.
$0.03 / Task: Kostenvorteil treibt siebte Woche #1 auf OpenRouter nach Call-Volume.
Praktische Alternativen haben versteckte Kosten: reine API-Abhängigkeit bei Agent-Massenlast; 7×24-Agent-Tests auf privatem Mac scheitern an Sleep und Cache; Harness-Scores blind übernehmen verzerrt Produktionsentscheidungen. Für iOS-CI/CD und Multi-Modell-A/B ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist die bessere Wahl. Siehe Preisseite, Hilfezentrum oder direkt bestellen.
Datenstand 5. August 2026 · Quellen: DeepSeek API-Docs und Changelog, DeepSeek-V4 Technical Report, Artificial Analysis, Finanzpresse