Was ist DeepSeek V4 GA? Timeline von Preview zu General Availability
Nach drei Monaten Preview-Testing ging DeepSeek V4 GA am 20. Juli 2026 live. Gegenüber der April-Preview verbessert GA Agent-Performance, Mathe-Reasoning und Code-Generierung — und führt erstmals Peak-Valley-Preise ein. Das signalisiert den Übergang von nahezu kostenlosem Zugang zu disziplinierter kommerzieller Abrechnung.
| Datum | Meilenstein |
|---|---|
| 24. April 2026 | V4 Preview + MIT Open Source: V4-Pro (1,6T) und V4-Flash (284B) |
| Mai 2026 | Produktions-V4-Flash und V4-Pro; API allgemein verfügbar |
| Juni 2026 | V4-Pro Output-Preis dauerhaft −75 % (auf $0,87/M Tokens) |
| 29. Juni 2026 | E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Peak-Valley-Billing |
| 19. Juli 2026 | Ausgewählte Entwickler erhalten GA-Grauzugang; Medien: „Vollversion unmittelbar bevorstehend“ |
| 20. Juli 2026 | GA-Release (Publikationsdatum dieses Artikels) |
| 24. Juli 2026 | Legacy-Namen deepseek-chat und deepseek-reasoner dauerhaft abgeschaltet |
Kernaussage: Die Preview war bereits stark; GA liefert gezielte Agent-, Mathe- und Code-Upgrades plus formale kommerzielle Abrechnung. Die MoE-Architektur bleibt unverändert — GA fokussiert Stabilität, Optimierung und Preisreife.
Migration verpassen: Code mit deepseek-chat bricht nach 24. Juli, 23:59 Peking-Zeit ab.
Peak-Blindaufrufe: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppelt Sätze — Batch-Jobs ohne Off-Peak-Planung treiben Rechnungen schnell hoch.
Kein Pro/Flash-Routing: V4-Pro für einfaches Routing verschwendet Budget, das V4-Flash (Output $0,28/M Off-Peak) abdecken könnte.
Cache ignorieren: Ohne Prompt Cache bei wiederholten System-Prompts entgeht Flash cached Input ab nur $0,0028/M.
Benchmark-Fehldeutung: SWE-bench Verified 80,6 % ist Open-Source-Spitze, aber Claude Fable 5 führt SWE-bench Pro (80,3 %) — Produktionswahl nicht aus einem Leaderboard ableiten.
V4-Pro vs. V4-Flash: CSA, HCA, mHC und Muon erklärt
DeepSeek V4 liefert drei Architektur-Durchbrüche, die KV-Cache-Speicher bei 1M-Token-Kontext auf 10 % von V3.2 senken (V4-Flash bis 7 %) — Ultra-Long-Context wird wirtschaftlich tragfähig.
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter pro Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Layer | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Output | 384K Tokens | 384K Tokens |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
2.1 Hybrid-Attention: CSA + HCA
DeepSeek V4 ersetzt V2/V3 MLA durch ein Hybrid aus zwei Attention-Mechanismen:
Compressed Sparse Attention: KV-Sequenzen werden Softmax-gated und 4× gepoolt; ein FP4-„Lightning Indexer“ wählt top-k sparse Keys (Pro: top-1024, Flash: top-512) mit 128-Token-Sliding-Window. Bei 1M Kontext: Inferenz-FLOPs nur 27 % von V3.2.
Heavily Compressed Attention: Tokens werden 128× komprimiert, dann globale dense Attention für Long-Range-Abhängigkeiten — ergänzt CSA. V4-Flash: erste 2 Layer HCA, dann CSA/HCA alternierend; V4-Pro ähnlich.
2.2 mHC und Muon-Optimizer
mHC (manifold-constrained hyper-connections) erweitert Standard-Residuals um einen 4-Kanal-Residual-Stream mit Mischmatrizen auf dem Birkhoff-Polytop (doppelt stochastisch) — stabile Signale über 61 Layer. Der Muon-Optimizer (statt AdamW) nutzt Newton-Schulz-Orthogonalisierung der Gradienten für schnellere Konvergenz und stabileres Training.
| Reasoning-Modus | Verhalten | Ideal für |
|---|---|---|
| Non-think | Keine Chain-of-Thought; schnellste Antwort | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (thinking tags) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximales Reasoning; braucht 384K+ Kontext | Schwere Mathe, Long-Chain-Agents |
Offizielle Sampling-Defaults: temperature=1.0, top_p=1.0 in allen Modi.
Benchmarks: SWE-bench, Cost-Performance und Modellvergleich
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % (Open-Source #1) | 96,0 % | Nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified testet echte GitHub-Bugfixes. 80,6 % ist der aktuelle Open-Source-Höchstwert, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger — Claude Fable 5s 80,3 % führen dort.
Artificial Analysis: Claude Fable 5 kostet $3,48 pro Strategy & Ops Index-Task (50 Punkte); DeepSeek V4-Pro $0,03 für vergleichbaren Task (38 Punkte) — 116× günstiger bei ~12 Punkten Score-Abstand.
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source / Self-Host | Ja (MIT) | Nein (closed) | Nein (closed) |
| Kontextfenster | 1M Tokens | Nicht öffentlich | 1M Tokens |
| API Output (Off-Peak) | $0,87/M | ~$15/M | $50/M |
| Peak Output-Preis | $1,74/M | — | — |
| Code-Fähigkeit | Sehr stark (nahe Fable 5) | Sehr stark | Stärkste (SWE-bench Pro) |
| Datenschutz | Ja (Private Deploy); bei EU-Personendaten in Prompts/Logs: AV-Vertrag und DSGVO-konforme Auftragsverarbeitung prüfen | Nein | Nein |
Szenario-Empfehlungen: Knappes Budget / hohes Volumen / Private Deploy → V4-Pro oder V4-Flash; maximale Code-Qualität, Kosten sekundär → Claude Fable 5; harte Algorithmen und Mathe → GPT-5.6 Sol / Ultra; massive Log-/Dokument-Ingestion → V4-Flash (cached Input ab $0,0028/M).
Peak-Valley-Preise und Migration vor dem 24. Juli
Die größte GA-Abrechnungsänderung: Peak-Valley-Differenzierung, analog zu Zeitstromtarifen. Peak (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — Sätze verdoppelt.
| Modell | Position | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache Hit) | ¥0,025 / $0,0035 / 1M | 2× |
| V4-Pro | Input (Cache Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 |
| V4-Pro | Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 |
| V4-Flash | Input (Cache Hit) | ¥0,02 / $0,0028 / 1M | 2× |
| V4-Flash | Input (Cache Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 |
| V4-Flash | Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Vier Kostentipps: (1) Nicht-Echtzeit-Jobs Off-Peak (nach 18:00 oder vor 09:00 Peking-Zeit); (2) Prompt Cache für wiederholte System-Prefixe; (3) Leichtes an Flash, schweres Reasoning an Pro; (4) DeepSeek-E-Mail-Alerts 24 Stunden vor Abrechnungsänderungen beachten. Selbst im Peak bleibt V4-Pro Output $1,74/M 8,6× günstiger als Claude Opus 4.8 ($15/M).
Kritische Frist: Legacy-Namen deepseek-chat und deepseek-reasoner enden 24. Juli 2026, 15:59 UTC (24. Juli, 23:59 Peking-Zeit).
| Legacy-Modell | Neues Modell | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-think) | Schnell; leichte Tasks |
deepseek-reasoner | deepseek-v4-flash (think mode) | Oder Upgrade auf deepseek-v4-pro |
Sechs Migrationsschritte:
Codebase durchsuchen: Alle Referenzen auf deepseek-chat und deepseek-reasoner finden.
Mapping anwenden: Leichter Chat → deepseek-v4-flash; ehemaliger Reasoner → Flash think mode oder deepseek-v4-pro.
OpenAI SDK aktualisieren: Nur model ändern; base_url bleibt https://api.deepseek.com.
Thinking aktivieren (optional): extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} ersetzt Reasoner-Verhalten.
Anthropic SDK-Kompatibilität: V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — nur model updaten.
Staging-Validierung: Vollständige Regression vor 24. Juli; null Legacy-Modellnamen bestätigen.
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)Lohnt sich DeepSeek V4 GA? Zitierbare Daten und Fazit
DeepSeek V4 GA ist einer der wichtigsten Open-Model-Meilensteine 2026. Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 heute überall zu schlagen — sondern Open-Source-Spitzenleistung zu etwa 1/10 bis 1/100 der Closed-Flagship-Kosten zu liefern.
80,6 % / Open-Source #1: SWE-bench Verified Open-Source-Hoch, gleichauf mit Gemini 3.1 Pro.
10 % / 7 %: Bei 1M Tokens KV-Cache-Speicher nur 10 % von V3.2 (Flash bis 7 %).
$0,03 / 116×: V4-Pro Strategy & Ops Task $0,03 vs. Fable 5 $3,48 — 116× Preisabstand bei ~24 % Score-Differenz.
Für Teams ohne Offshore-Daten, Indie-Entwickler mit knappem Budget, Agent-Ingenieure mit 1M-Kontext und AI-Produkte mit Kosteneffizienz-Fokus bleibt DeepSeek V4 Pro die ausgewogenste Wahl. Peak-Valley-Billing erhöht Planungsaufwand, bleibt aber hochkompetitiv — Reifesignal, kein Rückzug vom Wertversprechen.
Alternativen: DeepSeek Agent-Lasttests auf privatem Mac scheitern an Sleep und Netzwerk bei Long-Context-Jobs; nur Closed APIs erreichen V4s MIT-Lizenz plus $0,87/M Off-Peak-Output bei Kosten und Datensouveränität nicht; Migration 24. Juli verpassen verursacht harte Produktionsausfälle. Für iOS CI/CD, DeepSeek V4 Agent 7×24 und lokale ds4-Inferenz-Validierung ist KVMNODE dediziertes Mac Mini M4 Cloud meist die stabilere Wahl: Apple Silicon Unified Memory, sudo, flexible Tages-/Wochen-/Monatslaufzeiten. Bei EU-Daten in Agent-Logs: AV-Vertrag und DSGVO-Rollen klären. Details: Preisseite, Hilfezentrum, Bestellen.
Stand: 20. Juli 2026 · Quellen: DeepSeek offizielle Docs, arXiv:2606.19348, Hugging Face, Artificial Analysis