DeepSeek V4 フル版とは?プレビュー版から GA 正式版までのタイムライン
3 か月の待機を経て、DeepSeek V4 フル版(GA 正式版)が 2026 年 7 月 20 日に正式公開されました。今年 4 月のプレビュー版と比べ、性能が全面強化されただけでなく、初めてピーク/オフピーク課金が導入され、DeepSeek が「ほぼ無料」から規律ある商用運営へ移行したことを示しています。
| 時期 | イベント |
|---|---|
| 2026 年 4 月 24 日 | V4 プレビュー版公開 + OSS(MIT)、V4-Pro(1.6T)と V4-Flash(284B)を含む |
| 2026 年 5 月 | V4-Flash / V4-Pro 本番チューニング版公開、API 利用可能 |
| 2026 年 6 月 | V4-Pro 価格を恒久的に 75% 値下げ(出力 $0.87/M tokens) |
| 2026 年 6 月 29 日 | 全 API ユーザーへメール、7 月中旬 GA とピーク/オフピーク課金を初公開 |
| 2026 年 7 月 19 日 | 複数開発者が GA グレーンテスト資格を取得、メディアが「フル版は明日公開も」と報道 |
| 2026 年 7 月 20 日 | GA 正式版公開(本記事公開日) |
| 2026 年 7 月 24 日 | 旧インターフェース名 deepseek-chat と deepseek-reasoner が永久停止 |
一言で:V4 プレビュー版はすでに強力でしたが、フル版は Agent 能力・数学推論・コード生成をさらに強化し、正式な商用課金体系を整備しました。基盤 MoE アーキテクチャは不変——GA アップグレードは安定性・最適化・商用料金構造に焦点を当てています。
移行期限の見落とし:deepseek-chat を使い続けるコードは 7 月 24 日 23:59(北京時間) 以降永久に失効します。
ピーク時間帯の無計画呼び出し:平日 09:00–12:00、14:00–18:00 は料金 2 倍。バッチ処理をオフピークに回さないと請求が急増します。
Pro/Flash の使い分け不足:単純ルーティングに V4-Pro を使うと、Flash(出力 $0.28/M)で済む軽量タスクを無駄に高コスト化します。
キャッシュヒットの無視:Prompt Cache を構築しないと、Flash キャッシュヒット $0.0028/M の極低コストを逃します。
ベンチマークの誤読:SWE-bench Verified 80.6% は OSS 最高ですが、SWE-bench Pro では Claude Fable 5(80.3%)が依然リード——単一ランキングで本番選定しないでください。
DeepSeek V4 Pro と Flash アーキテクチャ詳解:CSA、HCA、mHC、Muon
DeepSeek V4 は 3 つの主要アーキテクチャ革新により、1M token コンテキストで KV Cache メモリを V3.2 の 10%(V4-Flash は 7%)まで削減し、超長コンテキストを経済的に実現しています。
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2840 億(284B) |
| Token あたり活性パラメータ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート重み)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ量 | 33T+ tokens | 32T+ tokens |
| OSS ライセンス | MIT | MIT |
ハイブリッドアテンション(CSA + HCA)
DeepSeek V4 は V2/V3 時代の Multi-head Latent Attention(MLA)を廃止し、2 種類の新アテンション機構を組み合わせています。
Compressed Sparse Attention:KV 系列を Softmax ゲート付きプーリングで 4 倍圧縮。FP4「ライトニングインデクサー」で top-k 疎選択(Pro は top-1024、Flash は top-512)。直近 128 token のスライディングウィンドウを保持。1M コンテキスト推論 FLOPs は V3.2 の 27% のみ。
Heavily Compressed Attention:token を 128 倍圧縮後にグローバル密集アテンションを実行し、長距離依存を捕捉。CSA と相補。V4-Flash は最初 2 層が HCA、以降 CSA/HCA 交互。V4-Pro も同様の構造です。
Manifold-Constrained Hyper-Connections(mHC)と Muon オプティマイザ
mHC は従来の残差接続を強化し、4 チャネル残差ストリームを導入。双確率行列制約(Birkhoff 多面体)を満たす混合行列で、61 層の深いネットワークでも信号を安定伝播させます。Muon オプティマイザ(AdamW 代替)はニュートン-シュルツ直交化で勾配を処理し、収束を加速し訓練を安定化します。
| 推論モード | 特徴 | 適用シナリオ |
|---|---|---|
| Non-think | 思考チェーンなし、超高速応答 | 単純 Q&A、ルーティング |
| Think High | 明示的推論(thinking タグ) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論強度、384K+ コンテキスト必要 | 複雑数学、長チェーン Agent |
公式推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。
DeepSeek V4 ベンチマーク:SWE-bench Verified 80.6% とコスパ比較
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(OSS 最高) | 96.0% | 個別未公開 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified は実 GitHub リポジトリの Bug 修正を測定し、80.6% は現時点の OSS モデル最高値で、Gemini 3.1 Pro と並びます。SWE-bench Pro はより厳格で、Claude Fable 5 の 80.3% が現在リードしています。
Artificial Analysis 評価:Claude Fable 5 は Strategy & Ops 指数タスク 1 回あたり $3.48(50 点)、DeepSeek V4-Pro は同種タスク $0.03(38 点)——コストは Fable 5 の 116 倍、スコア差は約 12 点のみ。
| 観点 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| OSS / セルフホスト | MIT OSS | クローズド | クローズド |
| コンテキスト | 1M tokens | 未公開 | 1M tokens |
| API 出力(オフピーク) | $0.87/M | ~$15/M | $50/M |
| ピーク出力 | $1.74/M | — | — |
| コード能力 | 非常に強い(Fable 5 に接近) | 非常に強い | 最強(SWE-bench Pro) |
| データプライバシー | プライベートデプロイ可 | 不可 | 不可 |
シナリオ選定:予算重視 / 高頻度呼び出し / プライベートデプロイ → V4-Pro または V4-Flash;最高コード能力・コスト不問 → Claude Fable 5;複雑アルゴリズム + 数学推論 → GPT-5.6 Sol / Ultra;超大規模ログ/文書処理 → V4-Flash(キャッシュヒット入力 $0.0028/M)。
DeepSeek V4 ピーク/オフピーク課金詳解と API 移行 6 ステップ
GA 版で最も注目された変更は、DeepSeek 初のピーク/オフピーク差別料金です。電力の時間帯別料金に類似します。ピーク時間帯(北京時間):平日 09:00–12:00 と 14:00–18:00、料金 2 倍。
| モデル | 課金項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2 倍 |
| V4-Pro | 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2 倍 |
| V4-Flash | 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
節約 4 戦略:① 非リアルタイムタスクをオフピーク(18:00 以降または 09:00 前)に配置;② Prompt Cache でキャッシュヒット率を向上;③ Flash で振り分け、複雑推論は Pro へ;④ DeepSeek の料金変更 24 時間前メール通知を確認。ピーク時でも V4-Pro 出力 $1.74/M は Claude Opus 4.8($15/M)より 8.6 倍安いです。
重要:旧モデル名 deepseek-chat と deepseek-reasoner は 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) に永久停止されます。
| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考モード) | 高速、軽量タスク向け |
deepseek-reasoner | deepseek-v4-flash(思考モード) | または deepseek-v4-pro へアップグレード |
API 移行 6 ステップ:
全リポジトリ検索:コードベースで deepseek-chat と deepseek-reasoner の全参照を検索します。
マッピング置換:軽量チャット → deepseek-v4-flash;旧推論モード → Flash 思考モードまたは deepseek-v4-pro。
OpenAI SDK 更新:model のみ変更、base_url は https://api.deepseek.com のまま。
思考モード有効化(任意):extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} で旧 reasoner 動作を再現します。
Anthropic SDK 互換:V4 は OpenAI ChatCompletions と Anthropic Messages 形式の両方に対応。model の更新のみで足ります。
Staging 検証:7 月 24 日前にテスト環境で全量回帰を完了し、旧モデル名の呼び出し残存がないことを確認します。
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)DeepSeek V4 フル版はアップグレードに値するか?引用可能データとまとめ
DeepSeek V4 GA 正式版は 2026 年 OSS 大規模言語モデル分野で最も重要なマイルストーンの一つです。その価値は Claude Fable 5 や GPT-5.6 を上回ること(現時点ではまだ)ではなく、クローズドソース旗艦の 1/10 から 1/100 のコストで OSS モデル中最強性能を提供することにあります。
80.6% / OSS 1 位:SWE-bench Verified OSS 最高、Gemini 3.1 Pro と並列。
10% / 7%:1M token シナリオで KV Cache メモリは V3.2 の 10%(Flash は 7%)。
$0.03 / 116×:V4-Pro の Strategy & Ops タスク 1 回 $0.03、Fable 5 は $3.48——116 倍の価格差、24% の性能差。
データを国外に出したくない企業、予算の限られた個人開発者、1M token 長コンテキスト Agent エンジニア、コスパを最重視する AI プロダクトチームにとって、DeepSeek V4 Pro は現時点で弱点の少ない選択肢です。ピーク/オフピーク課金はコスト構造を複雑化しますが、本質的には依然として非常に競争力があります——「価格破壊者」から「ルールのある商用プラットフォーム」への移行は、成熟のシグナルです。
代替案を整理すると:個人 Mac のみで DeepSeek Agent 負荷テスト するとスリープとネットワーク変動で長コンテキストタスクが中断しやすいです。クローズドソース API のみに依存 すると、V4 の MIT OSS + $0.87/M 出力価格のコスト・データ主権面で劣ります。7 月 24 日移行期限を無視 すると本番サービスがハード停止します。iOS CI/CD、DeepSeek V4 Agent 7×24 自動化、ローカル ds4 推論検証が必要な本番環境では、KVMNODE 専用 Mac Mini M4 クラウドレンタルが通常より優れた選択 です。Apple Silicon 統合メモリ、sudo 開放、日/週/月の柔軟契約。詳細は 料金ページ、ヘルプセンター、または 直接注文をご覧ください。
データ截至:2026 年 7 月 20 日 · 出典:DeepSeek 公式ドキュメント、arXiv:2606.19348、HuggingFace、Artificial Analysis