Wer DeepSeek V4 Flash produktiv einsetzen will, sollte zuerst klären, was der 31.-Juli-Release wirklich ändert — nicht wie viele Parameter neu dazukamen. Am 31. Juli 2026 stufte DeepSeek V4-Flash zum offiziellen V4-Flash-0731 hoch: 284B Gesamt / 13B aktiv, Architektur unverändert, Leistungsgewinne ausschließlich aus Post-Training. Dieser Artikel behandelt die Timeline April–August, die Preistabelle vs. Kimi K3 und Qwen3.8-Max, CSA+HCA / mHC / Muon, das Harness-Benchmark-Caveat, AA Index 50 und $0.03/Task sowie die Sechs-Schritte-API-Checkliste. Hintergrund: V4-GA-Migration, Kimi K3 erklärt.
01

Was DeepSeek am 31. Juli wirklich veröffentlicht hat

Kurz: kein neues Modell, sondern ein Re-Train. DeepSeek bestätigte ausdrücklich, dass V4-Flash-0731 dieselbe 284B/13B-Architektur wie die April-Preview trägt und die Verbesserungen «vollständig aus erneutem Post-Training» stammen. Der Rollout betraf nur die API — App und Web blieben auf älteren Builds. Im Changelog tauchte erstmals DeepSeek Harness als «bald verfügbar» auf; das Agent-Framework selbst ist bis heute nicht öffentlich.

DatumMeilensteinKernpunkt
24. Apr.V4-PreviewV4-Pro (1,6T/49B) und V4-Flash (284B/13B) open weight, 1M Kontext, MIT
24. JuliLegacy-API offlinedeepseek-chat und deepseek-reasoner abgeschaltet
27. JuliKimi K3 GewichteMoonshot 2,8T auf Hugging Face — Druck auf DeepSeek
31. JuliV4-Flash-0731 offiziellAPI + HF-Sync; Harness im Changelog; nur API, kein App-Update
Stand 5. Aug.V4-Pro offiziell + HarnessWeiter «so bald wie möglich»; Gerücht 10.–20. Aug. GA unbestätigt
01

«Offiziell» mit «neu» verwechseln: Keine Architekturänderung — nur Post-Training.

02

Harness-Scores als reine Modellfähigkeit lesen: Terminal Bench 2.0 etc. laufen über Harness-Minimalmodus, Framework noch nicht released.

03

API-only ignorieren: Verbraucher-App und Web nicht automatisch auf 0731.

04

Unbestätigtes Pro-Datum glauben: «10.–20. August» stammt aus anonymen Quellen — DeepSeek sagt nur «bald».

05

Vendor- und AA-Scores mischen: Artificial Analysis Index und DeepSeek-Agent-Runs nutzen unterschiedliche Harnesses.

02

Preistabelle und Wettbewerber-Matrix

ModellStatusGesamt / aktivKontextInput (miss/hit $/M)Output ($/M)Lizenz
V4-Flash-0731Offiziell (31.07.)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-ProPreview (offiziell ausstehend)1,6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3Gewichte shipped (27.07.)2,8T / ~104B~1,05M$3.00 / $0.30$15.00Modified MIT
Qwen3.8-MaxAPI GA (03.08.)2,4T / 95B1M$2.00 / ~$0.17–0.25$6.00Versprochen

Artificial Analysis: V4-Flash Intelligence Index 50, Single-Task-Kosten ca. $0.03 — etwa 1/29 von Kimi K3 (~$0.86), 1/62 von GPT-5.6 Sol (~$1.86), 1/105 von Claude Fable 5 (~$3.15). DeepSeek setzt nicht auf «Benchmark #1», sondern auf «genug Intelligenz + extrem niedriger Preis».

DeepSeek kündigte Peak-Hour-Aufschläge an (Peking 9–12 Uhr, 14–18 Uhr, 2×), ohne festes Startdatum. EU-Teams: API-Verarbeitung in China kann DSGVO-Datenresidenz und Auftragsverarbeitung betreffen — Legal und DPA vor Produktions-Migration prüfen.

03

CSA+HCA, mHC, Muon und das Harness-Benchmark-Caveat

Die Architektur blieb identisch; die Story ist Post-Training. V4-Flash-0731 schlägt in mehreren Agent-Benchmarks das größere V4-Pro-Preview — ein Signal, dass 2026 Post-Training-Qualität mit Rohskalierung konkurriert.

CSA

Compressed Sparse Attention + Highly Compressed Attention (HCA): Extern als DSA-Sparse-Attention bekannt — senkt Compute und KV-Last bei 1M Kontext.

mHC

Manifold-Constrained Hyper-Connections: Verbesserte Residual-Pfade für stabilere Signalpropagation in tiefen Layern.

Muon

Muon-Optimierer: Ersetzt klassische Optimizer — schnellere Konvergenz, stabilere Trainingskurven.

DeepSeek behauptet für V4-Pro bei 1M Kontext nur 27 % der FLOPs pro Token vs. V3.2 und 10 % KV-Cache — noch ohne unabhängige Reproduktion. DeepSeek Harness ist das erstmals im 31.-Juli-Changelog genannte Agent-Framework (Dateizugriff, Tools, Shell). Terminal Bench 2.0 82,7 vs. V4-Pro-Preview 67,9 wurden im Harness-Minimalmodus gemessen. DeepSeek warnt selbst: «Scores sind stark harness-abhängig und gleichen sich nicht 1:1 mit Modellfähigkeit.»

04

Sechs-Schritte-API-Checkliste

01

Model-ID prüfen: deepseek-v4-flash zeigt automatisch auf V4-Flash-0731 — OpenAI- und Anthropic-kompatible Endpoints.

02

Legacy-Namen entfernen: deepseek-chat und deepseek-reasoner seit 24. Juli offline.

03

Flash vs. Pro-Preview trennen: Hohe Frequenz / leichte Agent-Tasks → Flash ($0.28/M Output); schwere Reasoning-Pfade vorerst Pro-Preview.

04

Prompt-Cache nutzen: System-Prompts und Tool-Defs wiederverwenden — Input auf $0.0028/M bei Cache-Hit.

05

Nicht nur Harness-Scores für Produktion: A/B mit Claude Code, Cursor oder eigenem Agent-Stack in Staging; auf Community-Reproduktion warten.

06

Cache-Hitrate und Timeouts messen: Community berichtet niedrige Cache-Treffer und Safety-Classifier-Timeouts — Real-Workload vor Vollmigration. EU: DSGVO-konforme Verarbeitung und AV-Vertrag klären.

python
from openai import OpenAI

client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analysiere diese CI-Logs auf Build-Fehler..."}]
)
05

Kill Line, Liang-Nickname und drei harte Zahlen

Vor dem 31. Juli verspottete die chinesische AI-Community CEO Liang Wenfeng als «Liang Bai Kai» — weil V4-Pro das versprochene Mitte-Juli-GA verpasste. Nach V4-Flash-0731 kehrte der Spitzname «Liang Sheng» zurück. Die «Kill Line»-These: DeepSeek setzt mit «ausreichender Leistung + Extrempreis» eine Schwelle — wer weder deutlich besser noch billiger ist, verliert Marktanteil. Das erklärt GPT-5.6 Luna −80 % und ähnliche Preiskämpfe.

Am 31. Juli reagierten NVIDIA, Broadcom und AMD kaum — der Markt gewöhnt sich an «DeepSeek-Effizienz», ohne automatisch Chip-Shorts auszulösen.

A

82,7 vs 67,9 / Terminal Bench 2.0: Flash schlägt Pro-Preview — Harness-Minimalmodus, Vendor-Run, max-Settings.

B

50 / AA Index: Nicht Spitze vs. Kimi K3 oder GLM-5.2 — aber niedrigste Task-Kosten.

C

$0.03 / Task: Kostenvorteil treibt siebte Woche #1 auf OpenRouter nach Call-Volume.

Praktische Alternativen haben versteckte Kosten: reine API-Abhängigkeit bei Agent-Massenlast; 7×24-Agent-Tests auf privatem Mac scheitern an Sleep und Cache; Harness-Scores blind übernehmen verzerrt Produktionsentscheidungen. Für iOS-CI/CD und Multi-Modell-A/B ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist die bessere Wahl. Siehe Preisseite, Hilfezentrum oder direkt bestellen.

Datenstand 5. August 2026 · Quellen: DeepSeek API-Docs und Changelog, DeepSeek-V4 Technical Report, Artificial Analysis, Finanzpresse