面向关注 DeepSeek V4 FlashAPI 成本Agent 跑分可信度 的 AI 开发者与工程团队:2026 年 7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版——284B 参数规模不变,性能提升完全来自重新后训练,Agent 跑分反超自家更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。本文严格依据公开材料梳理4 月至 8 月时间线核心定价与参数表CSA+HCA / mHC / Muon 架构Harness 框架首次亮相与 Kimi K3 / GLM-5.2 / Qwen3.8-Max 横向对比跑分争议与「斩杀线」背景六步 API 核对清单。背景阅读 V4 满血版解读Kimi K3 全面开源Qwen3.8-Max 发布解读
01

DeepSeek V4 Flash 正式版上线:7 月 31 日到底发布了什么?

7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版:参数不变,仅重训,跑分反超更大的 V4-Pro 预览版,价格只要 Claude Opus 4.8 的几十分之一。更关键的是——这不是一次新模型发布,而是同一个 284B 参数模型重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。

日期事件关键信息
2026-04-24V4 预览版发布V4-Pro(1.6T/49B)与 V4-Flash(284B/13B)开源,100 万 token 上下文,MIT 协议
2026-07-24旧接口停用deepseek-chatdeepseek-reasoner 正式下线,流量切换至 V4 系列命名
2026-07-27Kimi K3 权重开源月之暗面 2.8T 权重上线 Hugging Face,给 DeepSeek 制造竞争压力
2026-07-31V4-Flash-0731 官方版API 公测 + HF 权重同步;changelog 首次点名 Harness「即将发布」;仅限 API,App/网页未更新
截至 2026-08-05V4-Pro 官方版仍为「尽快发布」,无官方确认日期;媒体传言 8/10–20 GA 未经证实
01

误读「正式版」为全新模型:架构与参数量与 4 月预览版完全相同,提升来自后训练而非扩容。

02

把 Harness 跑分当通用能力:Terminal Bench 2.0 等 Agent 分数全部基于尚未公开的 Harness 极简模式测得。

03

忽视 API-only 限制:7/31 更新仅限 API,消费者 App 与网页端仍是旧版本。

04

相信未证实 Pro 上线日期:「8 月 10–20 日 GA」来自未署名消息源,官方仅说「尽快发布」。

05

混淆厂商自报与第三方评测:Artificial Analysis Intelligence Index 与 DeepSeek 自报 Agent 跑分方法论不同,不可直接相加比较。

02

DeepSeek V4 Flash 定价与参数:和 Kimi K3、Qwen3.8-Max 差多少?

模型状态总参数/激活上下文输入价(未命中/命中,$/M)输出($/M)协议
DeepSeek-V4-Flash-0731官方正式版(07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro预览版(官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(07-27)2.8T / ~104B(社区估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2开源(2026-06)~744B / ~40B1M本文未核实本文未核实MIT
Qwen3.8-MaxAPI GA(08-02),权重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源

Artificial Analysis 第三方指数:V4-Flash Intelligence Index 为 50,单任务成本约 $0.03——仅为 Kimi K3($0.86)的约 1/29、GPT-5.6 Sol($1.86)的约 1/62、Claude Fable 5($3.15)的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」。

提示:以上定价均为厂商公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。

03

架构没变,后训练变强:CSA+HCA、mHC、Muon 与 Harness 是什么?

V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练质量正在逼近甚至超过单纯堆参数。

CSA

压缩稀疏注意力 + 高度压缩注意力(HCA):对外统一称 DSA 稀疏注意力,核心目的是在长上下文场景下降低计算和显存开销。

mHC

流形约束超连接:对传统残差连接结构做了改进,信号在深层网络中更稳定传播。

Muon

Muon 优化器:替换传统优化器,提升训练收敛速度和稳定性。

DeepSeek 官方公布:在 100 万 token 上下文场景下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%——尚未看到独立第三方机构复现验证,但若基本属实,意味着百万级上下文第一次有可能以接近主流上下文长度的成本大规模商用。

DeepSeek Harness 是 7 月 31 日 changelog 首次正式点名的自研 Agent 执行框架,用于读写文件、调用工具、执行命令、完成端到端工程任务,对标 Claude Code。官方公开的 Agent 跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 预览版 67.9 分)全部是用 Harness 的「极简模式」测出来的,且框架尚未公开发布。DeepSeek 在 changelog 里主动提示:「跑分对 harness 的选择非常敏感,不能简单等同于模型本身能力的提升。」

04

六步 API 核对清单:迁移、选型与成本压测

01

确认 model 名自动指向新版:使用 OpenAI 或 Anthropic 格式接入时,deepseek-v4-flash 会自动指向 V4-Flash-0731 官方版,无需改代码结构。

02

排查已停用旧名称:全库搜索 deepseek-chatdeepseek-reasoner——7 月 24 日起已正式下线。

03

区分 Flash 与 Pro 预览版:批量 Agent / 高频轻量任务优先 Flash(输出 $0.28/M);复杂推理可暂用 V4-Pro 预览版,等官方版上线再评估。

04

构建 Prompt Cache 策略:复用 system prompt 与工具定义前缀,利用缓存命中将输入成本压至 $0.0028/M 档。

05

勿仅凭 Harness 跑分做生产选型:用 Claude Code、Cursor 或自有 Agent 框架在 staging 环境 A/B,等待社区独立复现 Terminal Bench 2.0 分数。

06

监控缓存命中率与超时:海外开发者社区反馈正式版存在输入缓存命中率偏低、安全分类器偶发超时——用真实 workload 压测后再全量切换。Agent 7×24 常驻宿主见 帮助中心

python
from openai import OpenAI

client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "分析这段 CI 日志中的构建失败原因..."}],
)
05

跑分争议、「斩杀线」与行业背景:三条硬核数据

在 V4 正式版发布之前,因 Pro 版本迟迟没有兑现「7 月中旬全量上线」预期,中文 AI 社区一度把梁文锋戏称为「梁白开」。V4-Flash-0731 上线后表现超出预期,「梁圣」称号又还了回去——戏谑式昵称反转,是观察中国 AI 社区情绪风向的有趣侧面。

中文开发者社区流传「斩杀线」说法:DeepSeek 凭借「够用的性能 + 极端低价」给同行设下门槛——友商模型若性能没有明显超过 DeepSeek,又拿不出更低价格,就会在市场上失去存在感。这也解释了 GPT-5.6 Luna 一次性降价 80% 等密集调价动作。7 月 31 日当天,英伟达、博通、AMD 等算力芯片股并未明显波动——市场似乎已习惯「DeepSeek 式效率突破」,不再简单等同于利空算力股。

A

82.7 vs 67.9 / Terminal Bench 2.0:Flash 官方版反超 V4-Pro 预览版,但基于 Harness 极简模式 + max 档位(top_p=0.95, temperature=1.0),属厂商自报 + 特定框架结果。

B

50 / Intelligence Index:Artificial Analysis 第三方综合指数上 V4-Flash 并非最高,甚至落后于 Kimi K3 与 GLM-5.2——但单任务成本极低。

C

1/29 ~ 1/105 / 成本倍率:相对 Kimi K3、GPT-5.6 Sol、Claude Fable 5 的单任务成本,V4-Flash 分别约为 1/29、1/62、1/105——这也是其连续七周稳坐 OpenRouter 调用量第一的原因。

注意:V4-Pro 官方版与 Harness 上线时间、约 74 亿美元融资与 IPO 传闻等,目前主要来自财经媒体「据报道」或社区传言,尚无 DeepSeek 官方或监管备案直接确认,请与已核实事实区分对待。

摊开替代方案:完全依赖闭源 API在 Agent 大规模调用场景下成本难以匹敌 V4-Flash 的 $0.28/M 输出定价;在个人 Mac 上 7×24 跑 Agent 压测则受休眠、网络波动与缓存命中率影响;忽视 Harness 跑分局限性可能导致生产选型误判。对需要 iOS CI/CD、DeepSeek Agent 自动化与多模型 A/B 的生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、多区节点、按天/周/月弹性下单。详见 定价页订购入口

数据截至:2026 年 8 月 5 日 · 来源:DeepSeek 官方 API 文档与 changelog、技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》、Artificial Analysis(经财经媒体转引)、21 世纪经济报道、V2EX 社区讨论