Kimi K3 はオープンソースか、それともオープンウェイトか?
結論から言えば、厳密な定義ではオープンソースではありません——Moonshot AI 自身もそうは言っていません。2026 年 7 月 27 日、Moonshot は Kimi K3 の完全重みと技術レポートを公開しました。これは 2.8 兆パラメータの Mixture-of-Experts モデルで、ネイティブな視覚理解に対応しています。約 1.56TB のダウンロードは Hugging Face で公開後 30 分以内にトレンド 1 位となり、K3 はこれまでで最大の完全オープンウェイトモデルとなりました。
| 日付 | マイルストーン | 主な内容 |
|---|---|---|
| 7 月 16 日 | API 公開 | Kimi App / Work / Code / API 稼働、重みは未公開 |
| 7 月 17 日 | WAIC 2026 | 国営メディアがパラメータ数世界最大のオープンモデルと報道 |
| 7 月 22–23 日 | 蒸留論争 | ホワイトハウス顧問 Kratsios が Moonshot の Anthropic Fable 向け工業規模蒸留を非難 |
| 7 月 27 日 | 完全重み公開 | 完全重み + 技術レポート + MoonEP / AgentEnv(FlashKDA は先行公開済み) |
| 7 月 28 日 | 商務部の反応 | 中国商務省がワシントンの「AI 覇権主義」を非難 |
オープンウェイトとオープンソースの混同:Moonshot は「open source」とは言わず、学習データと完全な学習コードは非公開です。
ライセンスゲートの過小評価:K3 には MaaS 収益 2,000 万ドル閾値と 1 億 MAU の帰属表示義務が追加され、K2 ファミリーにはありませんでした。
コンシューマー機器で動くと思い込む:2.8T パラメータ、896 エキスパート——Moonshot は 64 枚以上の加速カード超ノードを推奨しています。
パラメータ偏重でコストを無視:K3 はオープンウェイトの能力上限ですが、タスクあたり約 $0.95 で GLM-5.2(約 $0.47)より高価です。
地政学的コンプライアンスの軽視:米中蒸留論争と WAIC 2026 のタイミングが重なり、エンタープライズ調達にサプライチェーンリスクが加わります。
Kimi K3 仕様とアーキテクチャ:KDA、AttnRes、Per-Head Muon
| 仕様 | 値 |
|---|---|
| 総パラメータ数 | 2.8 兆 |
| アクティブパラメータ | 約 1,040 億 |
| エキスパート構成 | 896 ルーティングエキスパート、トークンあたり 16 活性化(スパース性約 1.8%) |
| アテンション | Kimi Delta Attention(KDA)+ Gated Multi-Head Latent Attention(MLA) |
| コンテキストウィンドウ | 1,000,000 トークン |
| マルチモーダル | ネイティブ視覚(ViT-V2、27 層) |
| 重み形式 | MXFP4 重み、MXFP8 活性化(SFT から量子化認識学習) |
| ダウンロードサイズ | 約 1.56TB(Hugging Face) |
| ライセンス | カスタム——Moonshot は「open weight」と呼び、「open source」とは言いません |
Kimi Delta Attention(KDA)は単一スカラーの忘却ゲートをチャネル単位のゲーティングに置き換えます。各特徴次元が独自の減衰率を持ち、chunkwise DPLR で線形時間の再帰を実現します。K3 は KDA と Gated MLA 層を交互に配置——100 万トークンウィンドウと最小 KV キャッシュの鍵です。
Attention Residuals(AttnRes)は均一な残差累積を、選択的かつ入力依存の動的集約に置き換えます——パラメータ増加 2% 未満で学習効率が約 25% 向上します。
Per-Head Muonは各アテンションヘッドを独立に最適化します。Stable LatentMoEは Quantile Balancing を用い、MoonEP が計算ランクごとの冗長エキスパート数の上界を数学的に証明します。
| コンポーネント | 解決する課題 | 主な効果 |
|---|---|---|
| KDA | 長系列での KV キャッシュ爆発 | 線形時間再帰、最小 VRAM |
| AttnRes | 深層での初期層シグナル希薄化 | 学習効率約 25% 向上 |
| Per-Head Muon | ヘッド間の均一オプティマイザ | 少ないアクティブパラメータでフロンティア級の結果 |
| Stable LatentMoE | 大規模 MoE のエキスパート負荷偏り | 896 中 16 活性化——スパース性 1.8% |
3 つのインフラ公開とベンチマーク:GPT-5.6、Claude、GLM-5.2 との比較
| 技術 | 役割 | 主な数値 |
|---|---|---|
| MoonEP | 超大規模 MoE 通信 | 過負荷エキスパートを複製、ランクごとの冗長エキスパート上界を証明 |
| FlashKDA | CUTLASS KDA カーネル | H20 で prefill が flash-linear-attention 基準比 1.72×–2.22× 高速 |
| AgentEnv | Firecracker microVM エージェントサンドボックス | checkpoint 約 133ms、再開約 49ms、メモリオーバーコミット最大 6.5 倍 |
SWE-bench Verified(独立評価、Vals AI、2026 年 7 月):
| モデル | スコア | 公開日 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| GLM-5.2(max) | 51(AA Index) | 従来のオープンウェイト首位 |
Artificial Analysis Intelligence Index(max 推論)では Kimi K3 は約 57 点——総合 3 位、オープンウェイト 1 位です。オープンウェイト層の能力上限ですが、タスクあたり約 $0.95 と GLM-5.2(約 $0.47)より高価です。現在 Arena.ai Frontend Code Arena で 1 位です。
商用ライセンスゲートと 6 ステップのデプロイチェックリスト
Moonshot は一貫して「オープンウェイト」リリースと呼び、「オープンソース」とは言いません。ライセンスは完全カスタム文書で、K2 ファミリーにはなかった 2 つの商用閾値があります:
| ゲート | トリガー | 要件 |
|---|---|---|
| MaaS 収益ゲート | Model-as-a-Service の収益が過去 12 か月で 2,000 万ドル超 | Moonshot AI との別途商用契約 |
| 帰属表示ゲート | 月間アクティブユーザー 1 億超、または月収 2,000 万ドル超 | 製品 UI に「Kimi K3」を目立つ形で表示 |
| トークン種別 | 100 万トークンあたりの価格 |
|---|---|
| 入力(キャッシュヒット) | $0.30 |
| 入力(キャッシュミス) | $3.00 |
| 出力(推論トレース含む) | $15.00 |
Mooncake 分離型推論アーキテクチャは典型的なコーディングワークロードでキャッシュヒット率 90% 超を維持——実運用の多くは $0.30 帯に近づきます。
API アクセス登録:platform.kimi.ai でキーを作成し、base_url を https://api.moonshot.ai/v1、モデル ID を kimi-k3 に設定します。
LICENSE の確認:Hugging Face 重みをダウンロードする前に、法務が MaaS 収益または MAU ゲートの適用可否を確認します。
OpenAI SDK 互換統合:多くの既存プロジェクトは base URL と API キーの変更だけで済みます。
キャッシュプレフィックス最適化:system prompt とツール定義プレフィックスを再利用——コーディングエージェントは 90% 超のキャッシュ率が可能で、実効入力コストは $0.30/M に低下します。
セルフホストのハードウェア確認:64 枚以上の加速カード超ノード容量を確認します。多くのチームには OpenRouter 等(既に 7 プロバイダー稼働)が現実的です。
推論スタックの選択:vLLM(KDA + prefix caching)または SGLang でデプロイ。FlashKDA は chunk_kda バックエンドの直接置換として利用できます。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "このコードの複雑さを分析してください..."}]
)米中 AI 論争の文脈と 3 つのハードデータ
Kimi K3 のオープンウェイト公開は WAIC 2026 と重なり、米中「モデル蒸留」論争の激化直後に行われました。ホワイトハウス科学顧問 Michael Kratsios が Moonshot の Anthropic Fable 向け大規模蒸留を非難し、財務長官 Scott Bessent が制裁を示唆。中国商務省は 7 月 28 日に「AI 覇権主義」と反撃しました。K3 公開 3 日後、Alibaba が Qwen3.8-Max-Preview を発表——K3 への直接応答と広く受け止められ、オープンウェイト競争は「3T クラブ」段階に入りました。
2.8T / オープンウェイト 1 位:これまでで最大の完全オープンウェイトモデル——Hugging Face で約 1.56TB、30 分でトレンド 1 位。
93.4% / 世界 3 位:SWE-bench Verified 独立スコア 93.4%、AA Index 約 57——総合 3 位、オープンウェイト 1 位。
11 日 / 3 インフラ:API 公開から完全重み公開まで 11 日、MoonEP・FlashKDA・AgentEnv を同時オープン。
実用的な代替案にも隠れたコストがあります:個人 Mac で Kimi Code エージェントを動かすとスリープやネットワーク断で止まります;フル K3 のセルフホストには 64 枚以上の加速カードが必要で、多くのチームは用意できません;単一のクローズド API 依存では K3 の 100 万トークン定価優位を活かしにくいです。本番 iOS CI/CD と 7×24 AI エージェント自動化には、KVMNODE 専用 Mac Mini M4 クラウドレンタルが通常は最適です:ネイティブ Apple Silicon、フル sudo、日/週/月の柔軟課金。料金ページ、ヘルプセンター、または直接注文をご覧ください。
データ基準日:2026 年 7 月 28 日 · 出典:Moonshot AI 公式ブログ、Hugging Face、GitHub moonshotai/FlashKDA、Vals AI SWE-bench Verified、Artificial Analysis Intelligence Index