TL;DR:7/16 API 公開、7/27 重み OSS——クローズドのプレミアムは維持できるか
核心結論:7 月 16 日に Kimi App / Work / Code / API が先行公開され、7 月 27 日にModified MITで完全重み + 技術レポートが公開されます。K3 はこれまで最大のオープンウェイト(2.8T)ですが、Fable 5 killer ではありません——Artificial Analysis Intelligence Index v4.1 で 57.1 点、3/189 位、Fable 5(59.9)と GPT-5.6 Sol(58.9)に及びません。強みは約 1/3 のコストで前沿に近い知能 + オープンウェイト + 100 万 tokenコンテキストです。
2026 年 7 月 16 日深夜、Moonshot AI(月之暗面)が API ドキュメント上部に「Kimi K3 リリース済み」のバナーを掲出しました——大規模発表会はなく、技術ブログ 1 本、料金ページ 1 つ、すぐ呼び出せるモデル ID kimi-k3 だけです。控えめな姿勢と 2.8 兆パラメータの規模が対照的です。完全な重みは 7 月 27 日に Hugging Face で Modified MIT ライセンスのもと公開され、K3 はダウンロード可能なオープンウェイトとして最大規模となります。
| 日付 | マイルストーン | 主な内容 |
|---|---|---|
| 2026-07-16 | API 正式公開 | Kimi App / Work / Code / API が全面利用可能;Artificial Analysis による独立評価開始 |
| 2026-07-17 | WAIC / 新華社 | 2026 世界人工知能大会開幕前夜、新華社などが K3 の意義を報道 |
| 2026-07-27 | Hugging Face 重み | 完全モデル重み(Modified MIT)+ 技術レポート;vLLM KDA / prefix caching Day-0 サポート |
なぜ今回の重み公開が重要なのか?Moonshot AI は過去 18 か月、DeepSeek の台頭に揺さぶられてきました——K2 で順位を第 7 位から前沿へ引き上げ、K2.5 でコーディング能力を固め、K3 は 2.8T 規模 + 1M コンテキスト + オープンウェイトの三連撃で、中国 AI が「低価格で市場を取る」から「知能の前沿に挑む」へ転換した象徴です。公開タイミングは WAIC と重なり、7 月 1 日に Anthropic が Fable 5 の海外ユーザーアクセスを一時制限した(現在は復旧)事実とも絡み、地政学とモデル競争が交錯しています。
規模記録:2.8T は最大のオープンウェイトで、DeepSeek V4 Pro(1.6T)を約 75% 上回ります。
知能ポジション:AA Index 57.1 で 3 位、首位との差はわずか 2.8 点——OSS/オープンウェイトとクローズド前沿の差は 2–3 点に縮小しました。
コスト優位:API 料金は西方の品質帯($3/$15)に揃いますが、実効コストはクローズド旗艦の約 1/3 です。
選定ミス:「パラメータ最大=全ベンチマーク 1 位」とは限りません。7/27 前にフル重みをローカル実行できると想定しないでください。FrontierSWE では Fable 5 が依然リードです。
Kimi K3 全仕様:2.8T Stable LatentMoE と KDA アーキテクチャ
Kimi K3 は単なるパラメータ積み上げではありません——アーキテクチャ層で複数のエンジニアリング革新を導入し、長コンテキストと超スパース MoE 学習のボトルネックを解決しています。Kimi K2 比で全体のスケール効率は約 2.5 倍向上しています。
| 仕様 | 値 |
|---|---|
| 総パラメータ数 | 2.8 兆(2.8T) |
| MoE アーキテクチャ | Stable LatentMoE:896 エキスパート / 16 活性化(スパース度 1.8%) |
| アテンション機構 | KDA + AttnRes + Gated MLA |
| コンテキストウィンドウ | 1,048,576 tokens(1M) |
| 入力モダリティ | テキスト、画像、動画(ネイティブ視覚理解) |
| 学習精度 | MXFP4 重み + MXFP8 活性化(量子化認識設計) |
| スケール効率 | K2 比で約 2.5 倍向上 |
| 長コンテキストデコード | KDA により 1M token でデコード速度 6.3 倍向上 |
| 技術コンポーネント | 役割 |
|---|---|
| Kimi Delta Attention(KDA) | 3:1 の線形/全アテンション交互、KV キャッシュメモリ 75% 削減、100 万 token デコード 6.3× 加速 |
| Attention Residuals(AttnRes) | 深度を跨ぐ選択的取得、約 25% の学習効率向上 |
| Quantile Balancing | ルータースコアの分位数からエキスパート割当を導出、ヒューリスティック超パラメータを排除 |
| Per-Head Muon | 各アテンションヘッドを独立最適化、大規模学習をより適応的に |
| Sigmoid Tanh Unit(SiTU) | 活性化関数の制御を改善 |
| Gated MLA | アテンション選択性を向上 |
オープンウェイト(Open Weights)vs オープンソース(Open Source):K3 はどちらか
7 月 27 日の公開前に整理すべき概念です:open weights と open source は同義ではありません。
| 観点 | オープンウェイト(Open Weights) | 完全オープンソース(Open Source) |
|---|---|---|
| モデル重み | ダウンロード可 | ダウンロード可 |
| 学習コード | 通常非公開 | 公開 |
| 学習データ | 通常非公開 | 公開または一覧公開 |
| 微調整 / 自ホスト | 許可 | 許可 |
| ライセンス例 | Modified MIT、Llama License | Apache 2.0、MIT(コード含む) |
| Kimi K3 | 7/27 以降はこの類 | 学習詳細は完全公開されていない |
K3 は 7 月 27 日にModified MIT ライセンスで完全重みを公開します——ダウンロード、微調整、自ホストは可能ですが、学習コードとデータは完全には公開されていません。r/LocalLLaMA や Hacker News では、多くの開発者がこれを「Llama 式フルスタック OSS」ではなく「オープンウェイトのマイルストーン」と位置づけています。データレジデンシーとモデル制御が必要な企業にはオープンウェイトで十分です。学習プロセスの再現を求める研究機関は、技術レポートの追加公開を待つ必要があります。
ベンチマーク:AA Index 57.1 で 3 位——勝ちどころと負けどころ
以下は Artificial Analysis と Moonshot AI 自己報告のコアベンチマークです(各モデルは異なる推論 harness を使用:K3 は Kimi Code、GPT は Codex、Claude は Claude Code)。Moonshot AI は公式ブログで弱点を率直に認め、GDPval、DeepSWE などの劣後を回避していません。
| 総合順位(AA Index v4.1) | スコア | 順位 |
|---|---|---|
| Claude Fable 5 | 59.9 | #1 |
| GPT-5.6 Sol | 58.9 | #2 |
| Kimi K3 | 57.1 | #3 / 189 |
K3 がリードする領域
| ベンチマーク | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Frontend Code Arena | #1 | — | — |
| Automation Bench | 30.8 | 29.1 | 29.7 |
| SpreadsheetBench 2 | リード | — | — |
| BrowseComp | 91.2 | 88.0 | 90.4 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 |
K3 が劣後する領域
| ベンチマーク | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 備考 |
|---|---|---|---|---|
| GDPval v2 Elo | 1668–1687 | 1760 | 1748 | 汎用対話品質に差 |
| DeepSWE | 67.5 | 70.0 | 73.0 | 複雑 Repo 級バグ修正 |
| 幻覚率 | K2.6 比で上昇 | — | — | 公式が継続改善が必要と認める |
| 出力 polish / 分散 | Fable / Sol より弱い | リード | リード | 長文の一貫性とスタイル安定性 |
公式の率直な姿勢:Moonshot AI は kimi.com/en/blog/kimi-k3 で K3 の不足を明示しています——DeepSWE、GDPval などの劣後を回避せず、Frontend Code Arena などの強みも誇張しません。方向性の参考として扱い、本番選定では自社評価セットで検証してください。
OSS/オープンウェイトとクローズド前沿の知能差は、2024 年の 10 点超から 2026 年の 2–3 点に縮小しました。K3 は Fable 5 killer ではありませんが、約 1/3 のコストで前沿に近い能力を提供し、クローズドのプレミアムが試されています。
API 料金と 6 ステップ操作チェックリスト:接続から 7/27 公開日まで
| 課金項目 | Kimi K3 | Claude Sonnet 5 | DeepSeek V4 Pro |
|---|---|---|---|
| 入力($/M) | $3.00 | $3.00 | $1.74 |
| キャッシュヒット入力 | $0.30 | — | $0.145 |
| 出力($/M) | $15.00 | $15.00 | $3.48 |
| コンテキスト | 1M | 200K | 128K |
K3 の標準価格は Claude Sonnet 5 と同水準($3/$15)で西方の品質帯に揃いますが、コンテキストウィンドウはその 5 倍です。Artificial Analysis の試算では、AA 単一タスクコストは $0.94、Sol より 9.4% 低く、Fable 5 より 65.8% 低いです。コーディングシナリオではキャッシュヒット率が 90%+ に達し、実効入力コストは約 $0.55/M まで下がります。
6 ステップ操作チェックリスト(API 接続 + 7/27 公開日準備):
API Key 接続:platform.kimi.ai でキーを作成し、base_url を https://api.moonshot.ai/v1、モデル ID を kimi-k3 に設定します。または kimi.com で無料アカウントを登録し App / Work / Code を直接利用します。
キャッシュ最適化:コーディング Agent ワークフローで system prompt とツール定義プレフィックスを再利用します。Mooncake 分推論アーキテクチャ下でキャッシュヒット率 90%+ が可能で、実効入力単価は $0.30/M まで下がります。
7/27 HF ファイル確認:Hugging Face リポジトリに完全重みシャード、config.json、tokenizer、LICENSE(Modified MIT 条項)がアップロードされていることを確認します。
量子化版の検証:MXFP4 / NVFP4 量子化版(4-bit 約 1.4TB)をダウンロードし、公式 tech report とパラメータ数・アーキテクチャ記述を照合します。
推論フレームワークのデプロイ:vLLM(KDA + prefix caching)または SGLang でサービスを起動し、公式 Day-0 コマンドを参照します。Ollama / GGUF 版はその後に続く見込みです。
ハードウェアと長コンテキストの再テスト:最低 64+ 加速カードのスーパーノード構成を確認します。1M token シナリオでデコード遅延と KDA 6.3× 加速が基準を満たすか再検証します。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "このコードを分析してください..."}]
)7/27 重み公開、自ホスト方案と業界動向
7 月 27 日の公開内容
Moonshot AI は公式 WeChat 公告で 7 月 27 日に完全モデル重みを公開すると明言しています。公開内容は次のとおりです。
Hugging Face 完全重み(Modified MIT ライセンス)
技術レポート(Tech Report)——アーキテクチャ、学習、ベンチマークの詳細
vLLM Day-0 サポート——KDA カーネル + prefix caching
Ollama / GGUF 量子化版——コミュニティは数日以内の追随を見込んでいます
自ホストのハードウェア要件と 3 つの適用シナリオ
| 構成項目 | 要件 | 参考 |
|---|---|---|
| 4-bit 量子化ストレージ | 約 1.4TB | MXFP4 / NVFP4 版 |
| 本番推論 | 64+ 加速カードのスーパーノード | K2.7 Code INT4 ~577GB と比較すると K3 はさらに大規模 |
| 一般的なチーム | API が正しい選択 | Northflank、VentureBeat などは多くのシナリオで API を推奨 |
| 自ホストシナリオ | 推奨度 | 理由 |
|---|---|---|
| データレジデンシー / コンプライアンス | 7/27 以降に可行 | 重みをローカル実行、データを国外に出さない |
| ドメイン微調整 | 7/27 以降に可行 | オープンウェイトで fine-tuning が可能 |
| 超高呼び出し量 | 要精算 | 64+ カード CAPEX vs API OPEX、自社 ROI モデルが必要 |
業界動向:中国 AI の波とクローズドプレミアムの試練
2026 年 7 月、中国 AI の OSS/オープンウェイトエコシステムは密集リリースの時期を迎えています——GLM-5.2、DeepSeek V4 Pro、MiniMax などが相次ぎ登場しました。Moonshot AI は DeepSeek R1 ショック後に順位約 7 位から、K2 → K2.5 → K3 の三連跳で comeback を果たしました。WAIC 2026 のタイミングと、7 月 1 日の Anthropic による Fable 5 海外ユーザー制限(復旧済み)が地政学的背景を形成しています——オープンウェイトはクローズド前沿との 2–3 点差を縮め、クローズド API の「品質プレミアム」が 3–5 倍の価格差を維持できるかが今後四半期の核心問題です。
2.8T / #1 オープンウェイト:最大のダウンロード可能オープンウェイト、DeepSeek V4 Pro(1.6T)を約 75% 上回ります。
57.1 / 2.8 点:AA Index v4.1 で 3 位(3/189)、Fable 5(59.9)との差はわずか 2.8 点、OSS/クローズドの知能格差は 2–3 点に。
$0.94 / 65.8%:AA 単一タスクコスト $0.94、Fable 5 より 65.8% 低く、Sol より 9.4% 低い——約 1/3 コストで前沿に近い知能。
まとめ:Kimi K3 オープンウェイト公開は 2026 年 AI 分野で最も重要なマイルストーンの一つです。Fable 5 killer ではありませんが、長時間コーディング、文書理解、1M コンテキストなどの重要領域で競争力を持ち、Modified MIT で完全重みのダウンロードを約束しています——中国 AI が「低価格で市場を取る」から「知能の前沿に挑む」へ転換した象徴です。注目すべき日程:7 月 22 日(本記事)→ 7 月 27 日 Hugging Face 重み + tech report。
代替案を整理します。個人 Mac だけで Kimi Code / API Agent を負荷試験すると、スリープや回線帯域の変動で長コンテキストタスクが中断しやすくなります。7/27 自ホストを待つ場合、64+ カードのスーパーノードが必要で中小チームには短期間では非現実的です。単一クローズド API に完全依存すると、K3 の 1M flat 料金優位をコンテキスト長とコストの両面でカバーしにくくなります。iOS CI/CD、Kimi Code 常駐、AI Agent 7×24 自動化の本番環境には、KVMNODE 専用 Mac Mini M4 クラウドレンタルが通常はより適した選択です。Apple Silicon 統一メモリ、sudo 開放、日/週/月の柔軟な契約。詳細は 料金ページ、ヘルプセンター、または 直接注文をご覧ください。
データ基準日:2026 年 7 月 22 日 · 出典:kimi.com/en/blog/kimi-k3、platform.kimi.ai、Artificial Analysis、VentureBeat、Northflank、r/LocalLLaMA、Hacker News