本番環境で Kimi K3 を検討するなら、最初に確認すべきはパラメータ数ではなく、Moonshot AI のリリースが本当にオープンソースかどうかです。2026 年 7 月 27 日夜、同社は 2.8 兆パラメータ MoE モデルの完全重みと 100 万トークンコンテキストを公開し、MoonEP・FlashKDA・AgentEnv の 3 つのインフラも同時にオープンしました。本記事では11 日間のリリースタイムラインKDA / AttnRes / Per-Head Muon アーキテクチャSWE-bench と AA Index ベンチマーク2 つの商用ライセンスゲート6 ステップのデプロイチェックリストを解説します。背景:K3 オープンウェイト先行解説蒸留論争
01

Kimi K3 はオープンソースか、それともオープンウェイトか?

結論から言えば、厳密な定義ではオープンソースではありません——Moonshot AI 自身もそうは言っていません。2026 年 7 月 27 日、Moonshot は Kimi K3 の完全重みと技術レポートを公開しました。これは 2.8 兆パラメータの Mixture-of-Experts モデルで、ネイティブな視覚理解に対応しています。約 1.56TB のダウンロードは Hugging Face で公開後 30 分以内にトレンド 1 位となり、K3 はこれまでで最大の完全オープンウェイトモデルとなりました。

日付マイルストーン主な内容
7 月 16 日API 公開Kimi App / Work / Code / API 稼働、重みは未公開
7 月 17 日WAIC 2026国営メディアがパラメータ数世界最大のオープンモデルと報道
7 月 22–23 日蒸留論争ホワイトハウス顧問 Kratsios が Moonshot の Anthropic Fable 向け工業規模蒸留を非難
7 月 27 日完全重み公開完全重み + 技術レポート + MoonEP / AgentEnv(FlashKDA は先行公開済み)
7 月 28 日商務部の反応中国商務省がワシントンの「AI 覇権主義」を非難
01

オープンウェイトとオープンソースの混同:Moonshot は「open source」とは言わず、学習データと完全な学習コードは非公開です。

02

ライセンスゲートの過小評価:K3 には MaaS 収益 2,000 万ドル閾値と 1 億 MAU の帰属表示義務が追加され、K2 ファミリーにはありませんでした。

03

コンシューマー機器で動くと思い込む:2.8T パラメータ、896 エキスパート——Moonshot は 64 枚以上の加速カード超ノードを推奨しています。

04

パラメータ偏重でコストを無視:K3 はオープンウェイトの能力上限ですが、タスクあたり約 $0.95 で GLM-5.2(約 $0.47)より高価です。

05

地政学的コンプライアンスの軽視:米中蒸留論争と WAIC 2026 のタイミングが重なり、エンタープライズ調達にサプライチェーンリスクが加わります。

02

Kimi K3 仕様とアーキテクチャ:KDA、AttnRes、Per-Head Muon

仕様
総パラメータ数2.8 兆
アクティブパラメータ約 1,040 億
エキスパート構成896 ルーティングエキスパート、トークンあたり 16 活性化(スパース性約 1.8%)
アテンションKimi Delta Attention(KDA)+ Gated Multi-Head Latent Attention(MLA)
コンテキストウィンドウ1,000,000 トークン
マルチモーダルネイティブ視覚(ViT-V2、27 層)
重み形式MXFP4 重み、MXFP8 活性化(SFT から量子化認識学習)
ダウンロードサイズ約 1.56TB(Hugging Face)
ライセンスカスタム——Moonshot は「open weight」と呼び、「open source」とは言いません

Kimi Delta Attention(KDA)は単一スカラーの忘却ゲートをチャネル単位のゲーティングに置き換えます。各特徴次元が独自の減衰率を持ち、chunkwise DPLR で線形時間の再帰を実現します。K3 は KDA と Gated MLA 層を交互に配置——100 万トークンウィンドウと最小 KV キャッシュの鍵です。

Attention Residuals(AttnRes)は均一な残差累積を、選択的かつ入力依存の動的集約に置き換えます——パラメータ増加 2% 未満で学習効率が約 25% 向上します。

Per-Head Muonは各アテンションヘッドを独立に最適化します。Stable LatentMoEは Quantile Balancing を用い、MoonEP が計算ランクごとの冗長エキスパート数の上界を数学的に証明します。

コンポーネント解決する課題主な効果
KDA長系列での KV キャッシュ爆発線形時間再帰、最小 VRAM
AttnRes深層での初期層シグナル希薄化学習効率約 25% 向上
Per-Head Muonヘッド間の均一オプティマイザ少ないアクティブパラメータでフロンティア級の結果
Stable LatentMoE大規模 MoE のエキスパート負荷偏り896 中 16 活性化——スパース性 1.8%
03

3 つのインフラ公開とベンチマーク:GPT-5.6、Claude、GLM-5.2 との比較

技術役割主な数値
MoonEP超大規模 MoE 通信過負荷エキスパートを複製、ランクごとの冗長エキスパート上界を証明
FlashKDACUTLASS KDA カーネルH20 で prefill が flash-linear-attention 基準比 1.72×–2.22× 高速
AgentEnvFirecracker microVM エージェントサンドボックスcheckpoint 約 133ms、再開約 49ms、メモリオーバーコミット最大 6.5 倍

SWE-bench Verified(独立評価、Vals AI、2026 年 7 月):

モデルスコア公開日
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(max)51(AA Index)従来のオープンウェイト首位

Artificial Analysis Intelligence Index(max 推論)では Kimi K3 は約 57 点——総合 3 位、オープンウェイト 1 位です。オープンウェイト層の能力上限ですが、タスクあたり約 $0.95 と GLM-5.2(約 $0.47)より高価です。現在 Arena.ai Frontend Code Arena で 1 位です。

04

商用ライセンスゲートと 6 ステップのデプロイチェックリスト

Moonshot は一貫して「オープンウェイト」リリースと呼び、「オープンソース」とは言いません。ライセンスは完全カスタム文書で、K2 ファミリーにはなかった 2 つの商用閾値があります:

ゲートトリガー要件
MaaS 収益ゲートModel-as-a-Service の収益が過去 12 か月で 2,000 万ドル超Moonshot AI との別途商用契約
帰属表示ゲート月間アクティブユーザー 1 億超、または月収 2,000 万ドル超製品 UI に「Kimi K3」を目立つ形で表示
トークン種別100 万トークンあたりの価格
入力(キャッシュヒット)$0.30
入力(キャッシュミス)$3.00
出力(推論トレース含む)$15.00

Mooncake 分離型推論アーキテクチャは典型的なコーディングワークロードでキャッシュヒット率 90% 超を維持——実運用の多くは $0.30 帯に近づきます。

01

API アクセス登録:platform.kimi.ai でキーを作成し、base_urlhttps://api.moonshot.ai/v1、モデル ID を kimi-k3 に設定します。

02

LICENSE の確認:Hugging Face 重みをダウンロードする前に、法務が MaaS 収益または MAU ゲートの適用可否を確認します。

03

OpenAI SDK 互換統合:多くの既存プロジェクトは base URL と API キーの変更だけで済みます。

04

キャッシュプレフィックス最適化:system prompt とツール定義プレフィックスを再利用——コーディングエージェントは 90% 超のキャッシュ率が可能で、実効入力コストは $0.30/M に低下します。

05

セルフホストのハードウェア確認:64 枚以上の加速カード超ノード容量を確認します。多くのチームには OpenRouter 等(既に 7 プロバイダー稼働)が現実的です。

06

推論スタックの選択:vLLM(KDA + prefix caching)または SGLang でデプロイ。FlashKDA は chunk_kda バックエンドの直接置換として利用できます。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "このコードの複雑さを分析してください..."}]
)
05

米中 AI 論争の文脈と 3 つのハードデータ

Kimi K3 のオープンウェイト公開は WAIC 2026 と重なり、米中「モデル蒸留」論争の激化直後に行われました。ホワイトハウス科学顧問 Michael Kratsios が Moonshot の Anthropic Fable 向け大規模蒸留を非難し、財務長官 Scott Bessent が制裁を示唆。中国商務省は 7 月 28 日に「AI 覇権主義」と反撃しました。K3 公開 3 日後、Alibaba が Qwen3.8-Max-Preview を発表——K3 への直接応答と広く受け止められ、オープンウェイト競争は「3T クラブ」段階に入りました。

A

2.8T / オープンウェイト 1 位:これまでで最大の完全オープンウェイトモデル——Hugging Face で約 1.56TB、30 分でトレンド 1 位。

B

93.4% / 世界 3 位:SWE-bench Verified 独立スコア 93.4%、AA Index 約 57——総合 3 位、オープンウェイト 1 位。

C

11 日 / 3 インフラ:API 公開から完全重み公開まで 11 日、MoonEP・FlashKDA・AgentEnv を同時オープン。

実用的な代替案にも隠れたコストがあります:個人 Mac で Kimi Code エージェントを動かすとスリープやネットワーク断で止まります;フル K3 のセルフホストには 64 枚以上の加速カードが必要で、多くのチームは用意できません;単一のクローズド API 依存では K3 の 100 万トークン定価優位を活かしにくいです。本番 iOS CI/CD と 7×24 AI エージェント自動化には、KVMNODE 専用 Mac Mini M4 クラウドレンタルが通常は最適です:ネイティブ Apple Silicon、フル sudo、日/週/月の柔軟課金。料金ページヘルプセンター、または直接注文をご覧ください。

データ基準日:2026 年 7 月 28 日 · 出典:Moonshot AI 公式ブログ、Hugging Face、GitHub moonshotai/FlashKDA、Vals AI SWE-bench Verified、Artificial Analysis Intelligence Index