Если вы оцениваете DeepSeek V4 Flash для продакшена, первый вопрос — не сколько параметров добавилось, а что именно поменял официальный релиз 31 июля 2026. DeepSeek перевёл билд в V4-Flash-0731: 284B total / 13B active, архитектура 1:1 как в апрельской preview, весь прирост — из post-training. Разбираем таймлайн апрель–август, pricing vs Kimi K3 и Qwen3.8-Max, стек CSA+HCA / mHC / Muon, caveat Harness-бенчмарков, AA Index 50 и $0.03/task, плюс чеклист API в шесть шагов. Контекст: миграция V4 GA, разбор Kimi K3.
01

Что DeepSeek реально выкатил 31 июля

Коротко: не новая модель, а re-train. DeepSeek прямо пишет, что V4-Flash-0731 сохраняет 284B/13B из апрельской preview, а улучшения «полностью из повторного post-training». Rollout затронул только API — consumer app и web остались на старых билдах. В changelog впервые упомянут DeepSeek Harness как «скоро»; сам agent framework до сих пор не опубликован.

ДатаВехаКлючевая деталь
24 апр.V4 previewV4-Pro (1.6T/49B) и V4-Flash (284B/13B) open weight, 1M context, MIT
24 июл.Legacy API offlinedeepseek-chat и deepseek-reasoner отключены
27 июл.Веса Kimi K3Moonshot 2.8T на Hugging Face — давление на DeepSeek
31 июл.V4-Flash-0731 officialAPI + HF sync; Harness в changelog; только API, app не обновлена
На 5 авг.V4-Pro official + HarnessВсё ещё «как можно скорее»; слух GA 10–20 авг. не подтверждён
01

Путать «official» с «новая архитектура»: Параметры и topology не менялись — только post-training.

02

Читать Harness-scores как raw model capability: Terminal Bench 2.0 и прочее гонялись в minimal mode Harness, framework не в open access.

03

Игнорировать API-only: App/web не автоматически на 0731.

04

Верить анонимной дате Pro GA: «10–20 августа» — без официального подтверждения.

05

Смешивать vendor runs и AA Index: Разные harnesses, разная методология — нельзя складывать в одну таблицу без оговорок.

02

Таблица цен и матрица конкурентов

МодельСтатусTotal / activeContextInput (miss/hit $/M)Output ($/M)Лицензия
V4-Flash-0731Official (31.07.)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-ProPreview (official pending)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3Weights shipped (27.07.)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Modified MIT
Qwen3.8-MaxAPI GA (03.08.)2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00Обещан open

Artificial Analysis: V4-Flash Intelligence Index 50, per-task cost ~$0.03 — примерно 1/29 от Kimi K3 (~$0.86), 1/62 от GPT-5.6 Sol (~$1.86), 1/105 от Claude Fable 5 (~$3.15). DeepSeek бьёт не в «#1 на лидерборде», а в «достаточный IQ + экстремальный $/token».

DeepSeek анонсировал peak-hour surcharge (Пекин 9–12, 14–18, ×2) без фиксированной даты старта. Для self-hosted inference веса на HF остаются MIT — API routing через Китай отдельный вопрос data residency.

03

CSA+HCA, mHC, Muon и caveat Harness-бенчмарков

Архитектура frozen; story — post-training. V4-Flash-0731 обгоняет более жирный V4-Pro preview на ряде agent benchmarks — сигнал, что в H2 2026 post-training quality конкурирует с raw scale.

CSA

Compressed Sparse Attention + Highly Compressed Attention (HCA): Внешне брендируется как DSA sparse attention — режет FLOPs и KV footprint на 1M context window.

mHC

Manifold-Constrained Hyper-Connections: Переработанные residual paths — стабильнее gradient flow в глубоких слоях.

Muon

Muon optimizer: Замена AdamW-класса на second-order momentum scheme — быстрее convergence, меньше training instability.

DeepSeek заявляет для V4-Pro на 1M tokens всего 27% FLOPs/token vs V3.2 и 10% KV cache — independent repro пока нет. DeepSeek Harness — agent runtime из changelog 31 июля (file I/O, tool calls, shell exec), аналог Claude Code. Terminal Bench 2.0 82.7 vs V4-Pro preview 67.9 сняты в Harness minimal mode. В changelog прямое предупреждение: scores сильно harness-dependent и ≠ pure model uplift.

04

Чеклист API в шесть шагов

01

Проверить model ID: deepseek-v4-flash автоматически резолвится в V4-Flash-0731 — OpenAI/Anthropic-compatible endpoints.

02

Вычистить legacy names: deepseek-chat и deepseek-reasoner offline с 24 июля.

03

Разделить Flash vs Pro preview: High-frequency light agent workloads → Flash ($0.28/M output); heavy reasoning — временно Pro preview.

04

Prompt cache strategy: Переиспользовать system prompt и tool schema prefix — input $0.0028/M на cache hit.

05

Не выбирать production stack по Harness score: A/B на Claude Code, Cursor или своём agent loop в staging; ждать community repro Terminal Bench.

06

Мониторить cache hit rate и timeouts: Репорты о низком cache hit и safety classifier timeouts — гонять real workload перед full cutover.

python
from openai import OpenAI

client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Разбери эти CI-логи на предмет build failure..."}]
)
05

Kill line, никнейм Liang и три hard numbers

До 31 июля китайское AI-коммьюнити клеймило CEO Liang Wenfeng «Liang Bai Kai» — V4-Pro не успел к обещанному mid-July GA. После V4-Flash-0731 вернулся «Liang Sheng». Тезис «kill line»: DeepSeek выставляет порог «достаточное качество + экстремальная цена» — без явного превосходства по IQ или $/token конкурент теряет share. Отсюда GPT-5.6 Luna −80% и плотные price wars.

31 июля NVIDIA, Broadcom и AMD почти не дрогнули — рынок привык к «DeepSeek efficiency breakthroughs» и не шортит чипы автоматически.

A

82.7 vs 67.9 / Terminal Bench 2.0: Flash beats Pro preview — Harness minimal mode, vendor run, max decoding settings.

B

50 / AA Index: Не топ vs Kimi K3 или GLM-5.2 — но lowest per-task cost в классе.

C

$0.03 / task: Cost edge держит седьмую неделю #1 на OpenRouter по call volume.

Скрытые costs альтернатив: pure API lock-in на agent burst traffic; 7×24 agent soak test на личном Mac ломается на sleep и cache miss; слепая вера Harness numbers искажает production pick. Для iOS CI/CD и multi-model A/B аренда выделенного Mac Mini M4 KVMNODE — обычно optimal. См. страницу цен, центр помощи или оформить заказ.

Данные на 5 августа 2026 · Источники: DeepSeek API docs и changelog, technical report DeepSeek-V4, Artificial Analysis, финпресса