Für AI-Entwickler und Engineering-Teams, die DeepSeek V4 GA, Peak-Valley-Preise und API-Migration verfolgen: Am 20. Juli 2026 erreichte DeepSeek V4 General Availability — Agent-Fähigkeit, Mathe-Reasoning und Code-Generierung gegenüber der April-Preview verbessert, erstmals mit Peak-Valley-Differenzierung. Dieser datenbasierte Leitfaden deckt die Preview-zu-GA-Timeline, V4-Pro / V4-Flash Architektur (CSA + HCA / mHC / Muon), SWE-bench Verified 80,6 % und vollständige Benchmarks, Vergleich vs. GPT-5.6 Sol und Claude Fable 5, Peak-Valley-Preistabellen und Kostentipps sowie die API-Migrationsfrist 24. Juli mit sechs FAQ ab. Ergänzend: DeepSeek V4 lokale Inferenz, Kimi K3 Test.
01

Was ist DeepSeek V4 GA? Timeline von Preview zu General Availability

Nach drei Monaten Preview-Testing ging DeepSeek V4 GA am 20. Juli 2026 live. Gegenüber der April-Preview verbessert GA Agent-Performance, Mathe-Reasoning und Code-Generierung — und führt erstmals Peak-Valley-Preise ein. Das signalisiert den Übergang von nahezu kostenlosem Zugang zu disziplinierter kommerzieller Abrechnung.

DatumMeilenstein
24. April 2026V4 Preview + MIT Open Source: V4-Pro (1,6T) und V4-Flash (284B)
Mai 2026Produktions-V4-Flash und V4-Pro; API allgemein verfügbar
Juni 2026V4-Pro Output-Preis dauerhaft −75 % (auf $0,87/M Tokens)
29. Juni 2026E-Mail an alle API-Nutzer: GA Mitte Juli, erste Offenlegung Peak-Valley-Billing
19. Juli 2026Ausgewählte Entwickler erhalten GA-Grauzugang; Medien: „Vollversion unmittelbar bevorstehend“
20. Juli 2026GA-Release (Publikationsdatum dieses Artikels)
24. Juli 2026Legacy-Namen deepseek-chat und deepseek-reasoner dauerhaft abgeschaltet

Kernaussage: Die Preview war bereits stark; GA liefert gezielte Agent-, Mathe- und Code-Upgrades plus formale kommerzielle Abrechnung. Die MoE-Architektur bleibt unverändert — GA fokussiert Stabilität, Optimierung und Preisreife.

01

Migration verpassen: Code mit deepseek-chat bricht nach 24. Juli, 23:59 Peking-Zeit ab.

02

Peak-Blindaufrufe: Werktags 09:00–12:00 und 14:00–18:00 Peking-Zeit verdoppelt Sätze — Batch-Jobs ohne Off-Peak-Planung treiben Rechnungen schnell hoch.

03

Kein Pro/Flash-Routing: V4-Pro für einfaches Routing verschwendet Budget, das V4-Flash (Output $0,28/M Off-Peak) abdecken könnte.

04

Cache ignorieren: Ohne Prompt Cache bei wiederholten System-Prompts entgeht Flash cached Input ab nur $0,0028/M.

05

Benchmark-Fehldeutung: SWE-bench Verified 80,6 % ist Open-Source-Spitze, aber Claude Fable 5 führt SWE-bench Pro (80,3 %) — Produktionswahl nicht aus einem Leaderboard ableiten.

02

V4-Pro vs. V4-Flash: CSA, HCA, mHC und Muon erklärt

DeepSeek V4 liefert drei Architektur-Durchbrüche, die KV-Cache-Speicher bei 1M-Token-Kontext auf 10 % von V3.2 senken (V4-Flash bis 7 %) — Ultra-Long-Context wird wirtschaftlich tragfähig.

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktive Parameter pro Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Layer6143
Kontextfenster1.000.000 Tokens1.000.000 Tokens
Max. Output384K Tokens384K Tokens
PräzisionFP4 (Experten) + FP8 (Rest)FP4 + FP8 gemischt
Pretraining-Daten33T+ Tokens32T+ Tokens
LizenzMITMIT

2.1 Hybrid-Attention: CSA + HCA

DeepSeek V4 ersetzt V2/V3 MLA durch ein Hybrid aus zwei Attention-Mechanismen:

CSA

Compressed Sparse Attention: KV-Sequenzen werden Softmax-gated und gepoolt; ein FP4-„Lightning Indexer“ wählt top-k sparse Keys (Pro: top-1024, Flash: top-512) mit 128-Token-Sliding-Window. Bei 1M Kontext: Inferenz-FLOPs nur 27 % von V3.2.

HCA

Heavily Compressed Attention: Tokens werden 128× komprimiert, dann globale dense Attention für Long-Range-Abhängigkeiten — ergänzt CSA. V4-Flash: erste 2 Layer HCA, dann CSA/HCA alternierend; V4-Pro ähnlich.

2.2 mHC und Muon-Optimizer

mHC (manifold-constrained hyper-connections) erweitert Standard-Residuals um einen 4-Kanal-Residual-Stream mit Mischmatrizen auf dem Birkhoff-Polytop (doppelt stochastisch) — stabile Signale über 61 Layer. Der Muon-Optimizer (statt AdamW) nutzt Newton-Schulz-Orthogonalisierung der Gradienten für schnellere Konvergenz und stabileres Training.

Reasoning-ModusVerhaltenIdeal für
Non-thinkKeine Chain-of-Thought; schnellste AntwortEinfache Q&A, Routing
Think HighExplizites Reasoning (thinking tags)Mittlere Komplexität, Code-Debug
Think MaxMaximales Reasoning; braucht 384K+ KontextSchwere Mathe, Long-Chain-Agents

Offizielle Sampling-Defaults: temperature=1.0, top_p=1.0 in allen Modi.

03

Benchmarks: SWE-bench, Cost-Performance und Modellvergleich

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % (Open-Source #1)96,0 %Nicht separat veröffentlicht~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified testet echte GitHub-Bugfixes. 80,6 % ist der aktuelle Open-Source-Höchstwert, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger — Claude Fable 5s 80,3 % führen dort.

Artificial Analysis: Claude Fable 5 kostet $3,48 pro Strategy & Ops Index-Task (50 Punkte); DeepSeek V4-Pro $0,03 für vergleichbaren Task (38 Punkte) — 116× günstiger bei ~12 Punkten Score-Abstand.

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open Source / Self-HostJa (MIT)Nein (closed)Nein (closed)
Kontextfenster1M TokensNicht öffentlich1M Tokens
API Output (Off-Peak)$0,87/M~$15/M$50/M
Peak Output-Preis$1,74/M
Code-FähigkeitSehr stark (nahe Fable 5)Sehr starkStärkste (SWE-bench Pro)
DatenschutzJa (Private Deploy); bei EU-Personendaten in Prompts/Logs: AV-Vertrag und DSGVO-konforme Auftragsverarbeitung prüfenNeinNein

Szenario-Empfehlungen: Knappes Budget / hohes Volumen / Private Deploy → V4-Pro oder V4-Flash; maximale Code-Qualität, Kosten sekundär → Claude Fable 5; harte Algorithmen und Mathe → GPT-5.6 Sol / Ultra; massive Log-/Dokument-Ingestion → V4-Flash (cached Input ab $0,0028/M).

04

Peak-Valley-Preise und Migration vor dem 24. Juli

Die größte GA-Abrechnungsänderung: Peak-Valley-Differenzierung, analog zu Zeitstromtarifen. Peak (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00 — Sätze verdoppelt.

ModellPositionOff-PeakPeak
V4-ProInput (Cache Hit)¥0,025 / $0,0035 / 1M
V4-ProInput (Cache Miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
V4-ProOutput¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (Cache Hit)¥0,02 / $0,0028 / 1M
V4-FlashInput (Cache Miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
V4-FlashOutput¥2,00 / $0,28 / 1M¥4,00 / $0,56

Vier Kostentipps: (1) Nicht-Echtzeit-Jobs Off-Peak (nach 18:00 oder vor 09:00 Peking-Zeit); (2) Prompt Cache für wiederholte System-Prefixe; (3) Leichtes an Flash, schweres Reasoning an Pro; (4) DeepSeek-E-Mail-Alerts 24 Stunden vor Abrechnungsänderungen beachten. Selbst im Peak bleibt V4-Pro Output $1,74/M 8,6× günstiger als Claude Opus 4.8 ($15/M).

Kritische Frist: Legacy-Namen deepseek-chat und deepseek-reasoner enden 24. Juli 2026, 15:59 UTC (24. Juli, 23:59 Peking-Zeit).

Legacy-ModellNeues ModellHinweis
deepseek-chatdeepseek-v4-flash (non-think)Schnell; leichte Tasks
deepseek-reasonerdeepseek-v4-flash (think mode)Oder Upgrade auf deepseek-v4-pro

Sechs Migrationsschritte:

01

Codebase durchsuchen: Alle Referenzen auf deepseek-chat und deepseek-reasoner finden.

02

Mapping anwenden: Leichter Chat → deepseek-v4-flash; ehemaliger Reasoner → Flash think mode oder deepseek-v4-pro.

03

OpenAI SDK aktualisieren: Nur model ändern; base_url bleibt https://api.deepseek.com.

04

Thinking aktivieren (optional): extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} ersetzt Reasoner-Verhalten.

05

Anthropic SDK-Kompatibilität: V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — nur model updaten.

06

Staging-Validierung: Vollständige Regression vor 24. Juli; null Legacy-Modellnamen bestätigen.

python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
05

Lohnt sich DeepSeek V4 GA? Zitierbare Daten und Fazit

DeepSeek V4 GA ist einer der wichtigsten Open-Model-Meilensteine 2026. Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 heute überall zu schlagen — sondern Open-Source-Spitzenleistung zu etwa 1/10 bis 1/100 der Closed-Flagship-Kosten zu liefern.

A

80,6 % / Open-Source #1: SWE-bench Verified Open-Source-Hoch, gleichauf mit Gemini 3.1 Pro.

B

10 % / 7 %: Bei 1M Tokens KV-Cache-Speicher nur 10 % von V3.2 (Flash bis 7 %).

C

$0,03 / 116×: V4-Pro Strategy & Ops Task $0,03 vs. Fable 5 $3,48 — 116× Preisabstand bei ~24 % Score-Differenz.

Für Teams ohne Offshore-Daten, Indie-Entwickler mit knappem Budget, Agent-Ingenieure mit 1M-Kontext und AI-Produkte mit Kosteneffizienz-Fokus bleibt DeepSeek V4 Pro die ausgewogenste Wahl. Peak-Valley-Billing erhöht Planungsaufwand, bleibt aber hochkompetitiv — Reifesignal, kein Rückzug vom Wertversprechen.

Alternativen: DeepSeek Agent-Lasttests auf privatem Mac scheitern an Sleep und Netzwerk bei Long-Context-Jobs; nur Closed APIs erreichen V4s MIT-Lizenz plus $0,87/M Off-Peak-Output bei Kosten und Datensouveränität nicht; Migration 24. Juli verpassen verursacht harte Produktionsausfälle. Für iOS CI/CD, DeepSeek V4 Agent 7×24 und lokale ds4-Inferenz-Validierung ist KVMNODE dediziertes Mac Mini M4 Cloud meist die stabilere Wahl: Apple Silicon Unified Memory, sudo, flexible Tages-/Wochen-/Monatslaufzeiten. Bei EU-Daten in Agent-Logs: AV-Vertrag und DSGVO-Rollen klären. Details: Preisseite, Hilfezentrum, Bestellen.

Stand: 20. Juli 2026 · Quellen: DeepSeek offizielle Docs, arXiv:2606.19348, Hugging Face, Artificial Analysis