Что DeepSeek реально выкатил 31 июля
Коротко: не новая модель, а re-train. DeepSeek прямо пишет, что V4-Flash-0731 сохраняет 284B/13B из апрельской preview, а улучшения «полностью из повторного post-training». Rollout затронул только API — consumer app и web остались на старых билдах. В changelog впервые упомянут DeepSeek Harness как «скоро»; сам agent framework до сих пор не опубликован.
| Дата | Веха | Ключевая деталь |
|---|---|---|
| 24 апр. | V4 preview | V4-Pro (1.6T/49B) и V4-Flash (284B/13B) open weight, 1M context, MIT |
| 24 июл. | Legacy API offline | deepseek-chat и deepseek-reasoner отключены |
| 27 июл. | Веса Kimi K3 | Moonshot 2.8T на Hugging Face — давление на DeepSeek |
| 31 июл. | V4-Flash-0731 official | API + HF sync; Harness в changelog; только API, app не обновлена |
| На 5 авг. | V4-Pro official + Harness | Всё ещё «как можно скорее»; слух GA 10–20 авг. не подтверждён |
Путать «official» с «новая архитектура»: Параметры и topology не менялись — только post-training.
Читать Harness-scores как raw model capability: Terminal Bench 2.0 и прочее гонялись в minimal mode Harness, framework не в open access.
Игнорировать API-only: App/web не автоматически на 0731.
Верить анонимной дате Pro GA: «10–20 августа» — без официального подтверждения.
Смешивать vendor runs и AA Index: Разные harnesses, разная методология — нельзя складывать в одну таблицу без оговорок.
Таблица цен и матрица конкурентов
| Модель | Статус | Total / active | Context | Input (miss/hit $/M) | Output ($/M) | Лицензия |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Official (31.07.) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | Preview (official pending) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | Weights shipped (27.07.) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| Qwen3.8-Max | API GA (03.08.) | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | Обещан open |
Artificial Analysis: V4-Flash Intelligence Index 50, per-task cost ~$0.03 — примерно 1/29 от Kimi K3 (~$0.86), 1/62 от GPT-5.6 Sol (~$1.86), 1/105 от Claude Fable 5 (~$3.15). DeepSeek бьёт не в «#1 на лидерборде», а в «достаточный IQ + экстремальный $/token».
DeepSeek анонсировал peak-hour surcharge (Пекин 9–12, 14–18, ×2) без фиксированной даты старта. Для self-hosted inference веса на HF остаются MIT — API routing через Китай отдельный вопрос data residency.
CSA+HCA, mHC, Muon и caveat Harness-бенчмарков
Архитектура frozen; story — post-training. V4-Flash-0731 обгоняет более жирный V4-Pro preview на ряде agent benchmarks — сигнал, что в H2 2026 post-training quality конкурирует с raw scale.
Compressed Sparse Attention + Highly Compressed Attention (HCA): Внешне брендируется как DSA sparse attention — режет FLOPs и KV footprint на 1M context window.
Manifold-Constrained Hyper-Connections: Переработанные residual paths — стабильнее gradient flow в глубоких слоях.
Muon optimizer: Замена AdamW-класса на second-order momentum scheme — быстрее convergence, меньше training instability.
DeepSeek заявляет для V4-Pro на 1M tokens всего 27% FLOPs/token vs V3.2 и 10% KV cache — independent repro пока нет. DeepSeek Harness — agent runtime из changelog 31 июля (file I/O, tool calls, shell exec), аналог Claude Code. Terminal Bench 2.0 82.7 vs V4-Pro preview 67.9 сняты в Harness minimal mode. В changelog прямое предупреждение: scores сильно harness-dependent и ≠ pure model uplift.
Чеклист API в шесть шагов
Проверить model ID: deepseek-v4-flash автоматически резолвится в V4-Flash-0731 — OpenAI/Anthropic-compatible endpoints.
Вычистить legacy names: deepseek-chat и deepseek-reasoner offline с 24 июля.
Разделить Flash vs Pro preview: High-frequency light agent workloads → Flash ($0.28/M output); heavy reasoning — временно Pro preview.
Prompt cache strategy: Переиспользовать system prompt и tool schema prefix — input $0.0028/M на cache hit.
Не выбирать production stack по Harness score: A/B на Claude Code, Cursor или своём agent loop в staging; ждать community repro Terminal Bench.
Мониторить cache hit rate и timeouts: Репорты о низком cache hit и safety classifier timeouts — гонять real workload перед full cutover.
from openai import OpenAI
client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Разбери эти CI-логи на предмет build failure..."}]
)Kill line, никнейм Liang и три hard numbers
До 31 июля китайское AI-коммьюнити клеймило CEO Liang Wenfeng «Liang Bai Kai» — V4-Pro не успел к обещанному mid-July GA. После V4-Flash-0731 вернулся «Liang Sheng». Тезис «kill line»: DeepSeek выставляет порог «достаточное качество + экстремальная цена» — без явного превосходства по IQ или $/token конкурент теряет share. Отсюда GPT-5.6 Luna −80% и плотные price wars.
31 июля NVIDIA, Broadcom и AMD почти не дрогнули — рынок привык к «DeepSeek efficiency breakthroughs» и не шортит чипы автоматически.
82.7 vs 67.9 / Terminal Bench 2.0: Flash beats Pro preview — Harness minimal mode, vendor run, max decoding settings.
50 / AA Index: Не топ vs Kimi K3 или GLM-5.2 — но lowest per-task cost в классе.
$0.03 / task: Cost edge держит седьмую неделю #1 на OpenRouter по call volume.
Скрытые costs альтернатив: pure API lock-in на agent burst traffic; 7×24 agent soak test на личном Mac ломается на sleep и cache miss; слепая вера Harness numbers искажает production pick. Для iOS CI/CD и multi-model A/B аренда выделенного Mac Mini M4 KVMNODE — обычно optimal. См. страницу цен, центр помощи или оформить заказ.
Данные на 5 августа 2026 · Источники: DeepSeek API docs и changelog, technical report DeepSeek-V4, Artificial Analysis, финпресса