面向關注 DeepSeek V4 FlashAPI 成本Agent 跑分可信度 的 AI 開發者與工程團隊:2026 年 7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版——284B 參數規模不變,效能提升完全來自重新後訓練,Agent 跑分反超自家更大的 V4-Pro 預覽版,價格僅為 Claude Opus 4.8 的數十分之一。本文嚴格依據公開材料梳理4 月至 8 月時間線核心定價與參數表CSA+HCA / mHC / Muon 架構Harness 框架首次亮相與 Kimi K3 / Qwen3.8-Max 橫向對比跑分爭議與「斬殺線」背景六步 API 核對清單。背景閱讀 V4 滿血版解讀Kimi K3 全面開源Qwen3.8-Max 發佈解讀
01

DeepSeek V4 Flash 正式版上線:7 月 31 日到底發佈了什麼?

7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版:參數不變,僅重訓,跑分反超更大的 V4-Pro 預覽版,價格只要 Claude Opus 4.8 的數十分之一。更關鍵的是——這不是一次新模型發佈,而是同一個 284B 參數模型重新做了一遍後訓練。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發佈」狀態,沒有確切日期。

日期事件關鍵資訊
2026-04-24V4 預覽版發佈V4-Pro(1.6T/49B)與 V4-Flash(284B/13B)開源,100 萬 token 上下文,MIT 協議
2026-07-24舊介面停用deepseek-chatdeepseek-reasoner 正式下線,流量切換至 V4 系列命名
2026-07-27Kimi K3 權重開源月之暗面 2.8T 權重上線 Hugging Face,給 DeepSeek 製造競爭壓力
2026-07-31V4-Flash-0731 官方版API 公測 + HF 權重同步;changelog 首次點名 Harness「即將發佈」;僅限 API,App/網頁未更新
截至 2026-08-05V4-Pro 官方版仍為「盡快發佈」,無官方確認日期;媒體傳言 8/10–20 GA 未經證實
01

誤讀「正式版」為全新模型:架構與參數量與 4 月預覽版完全相同,提升來自後訓練而非擴容。

02

把 Harness 跑分當通用能力:Terminal Bench 2.0 等 Agent 分數全部基於尚未公開的 Harness 極簡模式測得。

03

忽視 API-only 限制:7/31 更新僅限 API,消費者 App 與網頁端仍是舊版本。

04

相信未證實 Pro 上線日期:「8 月 10–20 日 GA」來自未署名消息源,官方僅說「盡快發佈」。

05

混淆廠商自報與第三方評測:Artificial Analysis Intelligence Index 與 DeepSeek 自報 Agent 跑分方法論不同,不可直接相加比較。

02

DeepSeek V4 Flash 定價與參數:和 Kimi K3、Qwen3.8-Max 差多少?

模型狀態總參數/活躍上下文輸入價(未命中/命中,$/M)輸出($/M)協議
DeepSeek-V4-Flash-0731官方正式版(07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro預覽版(官方版未發佈)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3權重開源(07-27)2.8T / ~104B(社群估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
Qwen3.8-MaxAPI GA(08-02),權重待釋出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承諾開源

Artificial Analysis 第三方指數:V4-Flash Intelligence Index 為 50,單任務成本約 $0.03——僅為 Kimi K3($0.86)的約 1/29、GPT-5.6 Sol($1.86)的約 1/62、Claude Fable 5($3.15)的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」。

提示:以上定價均為廠商公開資料。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。

03

架構沒變,後訓練變強:CSA+HCA、mHC、Muon 與 Harness 是什麼?

V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,DeepSeek 官方明確說明效能提升「完全來自重新進行的後訓練」。284B 總參數、13B 活躍參數的 Flash 版本,在多項 Agent 基準上反而超過了參數量是自己好幾倍的 V4-Pro 預覽版——2026 年下半年大模型競爭,後訓練品質正在逼近甚至超過單純堆參數。

CSA

壓縮稀疏注意力 + 高度壓縮注意力(HCA):對外統一稱 DSA 稀疏注意力,核心目的是在長上下文場景下降低運算與顯存開銷。

mHC

流形約束超連接:對傳統殘差連接結構做了改進,訊號在深層網路中更穩定傳播。

Muon

Muon 最佳化器:替換傳統最佳化器,提升訓練收斂速度與穩定性。

DeepSeek 官方公布:在 100 萬 token 上下文場景下,V4-Pro 相比前代 V3.2,單 token 推理所需 FLOPs 僅為 27%,KV Cache 佔用僅為 10%——尚未看到獨立第三方機構複現驗證,但若基本屬實,意味著百萬級上下文第一次有可能以接近主流上下文長度的成本大規模商用。

DeepSeek Harness 是 7 月 31 日 changelog 首次正式點名的自研 Agent 執行框架,用於讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。官方公開的 Agent 跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 預覽版 67.9 分)全部是用 Harness 的「極簡模式」測出來的,且框架尚未公開發佈。DeepSeek 在 changelog 裡主動提示:「跑分對 harness 的選擇非常敏感,不能簡單等同於模型本身能力的提升。」

04

六步 API 核對清單:遷移、選型與成本壓測

01

確認 model 名自動指向新版:使用 OpenAI 或 Anthropic 格式接入時,deepseek-v4-flash 會自動指向 V4-Flash-0731 官方版,無需改程式碼結構。

02

排查已停用舊名稱:全庫搜尋 deepseek-chatdeepseek-reasoner——7 月 24 日起已正式下線。

03

區分 Flash 與 Pro 預覽版:批次 Agent / 高頻輕量任務優先 Flash(輸出 $0.28/M);複雜推理可暫用 V4-Pro 預覽版,等官方版上線再評估。

04

建構 Prompt Cache 策略:複用 system prompt 與工具定義前綴,利用快取命中將輸入成本壓至 $0.0028/M 檔。

05

勿僅憑 Harness 跑分做生產選型:用 Claude Code、Cursor 或自有 Agent 框架在 staging 環境 A/B,等待社群獨立複現 Terminal Bench 2.0 分數。

06

監控快取命中率與逾時:海外開發者社群回饋正式版存在輸入快取命中率偏低、安全分類器偶發逾時——用真實 workload 壓測後再全量切換。Agent 7×24 常駐伺服器見 雲端幫助

python
from openai import OpenAI

client = OpenAI(api_key="your_key", base_url="https://api.deepseek.com")

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "分析這段 CI 日誌中的建置失敗原因..."}],
)
05

跑分爭議、「斬殺線」與產業背景:三條硬核數據

在 V4 正式版發佈之前,因 Pro 版本遲遲沒有兌現「7 月中旬全量上線」預期,中文 AI 社群一度把梁文鋒戲稱為「梁白開」。V4-Flash-0731 上線後表現超出預期,「梁聖」稱號又還了回去——戲謔式暱稱反轉,是觀察中國 AI 社群情緒風向的有趣側面。

中文開發者社群流傳「斬殺線」說法:DeepSeek 憑藉「夠用的效能 + 極端低價」給同業設下門檻——友商模型若效能沒有明顯超過 DeepSeek,又拿不出更低價格,就會在市場上失去存在感。這也解釋了 GPT-5.6 Luna 一次性降價 80% 等密集調價動作。7 月 31 日當天,輝達、博通、AMD 等算力晶片股並未明顯波動——市場似乎已習慣「DeepSeek 式效率突破」,不再簡單等同於利空算力股。

A

82.7 vs 67.9 / Terminal Bench 2.0:Flash 官方版反超 V4-Pro 預覽版,但基於 Harness 極簡模式 + max 檔位(top_p=0.95, temperature=1.0),屬廠商自報 + 特定框架結果。

B

50 / Intelligence Index:Artificial Analysis 第三方綜合指數上 V4-Flash 並非最高,甚至落後於 Kimi K3——但單任務成本極低。

C

1/29 ~ 1/105 / 成本倍率:相對 Kimi K3、GPT-5.6 Sol、Claude Fable 5 的單任務成本,V4-Flash 分別約為 1/29、1/62、1/105——這也是其連續七週穩坐 OpenRouter 呼叫量第一的原因。

注意:V4-Pro 官方版與 Harness 上線時間、約 74 億美元融資與 IPO 傳聞等,目前主要來自財經媒體「據報導」或社群傳言,尚無 DeepSeek 官方或監管備案直接確認,請與已核實事實區分對待。

攤開替代方案:完全依賴閉源 API在 Agent 大規模呼叫場景下成本難以匹敵 V4-Flash 的 $0.28/M 輸出定價;在個人 Mac 上 7×24 跑 Agent 壓測則受休眠、網路波動與快取命中率影響;忽視 Harness 跑分侷限性可能導致生產選型誤判。對需要 iOS CI/CD、DeepSeek Agent 自動化與多模型 A/B 的生產環境,KVMNODE 獨占 Mac Mini M4 雲端租賃通常是更優解:Apple Silicon 統一記憶體、開放 sudo、多區節點、按天/週/月彈性下單。詳見 定價頁雲端幫助直接訂購

資料截至:2026 年 8 月 5 日 · 來源:DeepSeek 官方 API 文件與 changelog、技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》、Artificial Analysis(經財經媒體轉引)、21 世紀經濟報導、V2EX 社群討論