若您正在評估將 Kimi K3 用於正式環境,第一個問題不是參數量有多大,而是月之暗面的釋出算不算真正的開源。2026 年 7 月 27 日晚,這家中國 AI 實驗室釋出了 2.8 萬億參數 MoE 模型的完整權重,並具備 100 萬 token 上下文,同步開源 MoonEP、FlashKDA、AgentEnv 三項基礎設施。本文涵蓋11 天釋出時間軸KDA / AttnRes / Per-Head Muon 架構SWE-bench 與 AA Index 基準測試兩道商業許可門檻,以及六步部署清單。背景閱讀:K3 開源權重前瞻蒸餾爭議解讀
01

Kimi K3 是開源,還是僅開放權重?

簡短答案:嚴格定義下不是——月之暗面官方也從未如此宣稱。2026 年 7 月 27 日,Moonshot 釋出 Kimi K3 完整權重與技術報告,這是一個 2.8 萬億參數的混合專家(MoE)模型,具備原生視覺理解能力。約 1.56TB 的下載量在 Hugging Face 上線後 30 分鐘內登上趨勢榜第一——K3 成為迄今完整釋出的最大開放權重模型。

日期里程碑關鍵內容
7 月 16 日API 首發Kimi App / Work / Code / API 上線,權重尚未公開
7 月 17 日WAIC 2026官媒報導稱其為目前全球參數最大的開放模型
7 月 22–23 日蒸餾爭端升級白宮科技顧問 Kratsios 指控月之暗面對 Anthropic Fable 模型進行工業化蒸餾
7 月 27 日權重全面開源完整權重 + 技術報告 + MoonEP / AgentEnv(FlashKDA 此前已開源)
7 月 28 日商務部回應中國商務部指責美方「AI 霸權主義」
01

混淆「開源」與「開放權重」:官方從未使用 open source,只稱 open weight——訓練資料與完整訓練程式碼未公開。

02

低估許可證商業門檻:K3 新增 MaaS 年收入 2000 萬美元門檻與 1 億 MAU 歸屬展示義務,K2 系列沒有。

03

誤以為消費級硬體可跑滿血:2.8T 參數、896 個專家——官方建議 64 卡以上超節點伺服器。

04

只看參數不看成本:K3 是開放權重陣營能力天花板,但每任務約 $0.95,高於 GLM-5.2(約 $0.47)。

05

忽視地緣政治合規:中美蒸餾爭端疊加 WAIC 2026 時機,企業選型須評估供應鏈風險。

02

Kimi K3 規格與架構:KDA、AttnRes 與 Per-Head Muon

規格數值
總參數量2.8 萬億
啟用參數量約 1040 億
專家配置896 個路由專家,每 token 啟用 16 個(稀疏度約 1.8%)
注意力機制Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗1,000,000 token
多模態原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重、MXFP8 啟用(SFT 階段起量化感知訓練)
下載體積約 1.56TB(Hugging Face)
許可證自訂許可——官方稱 open weight,非 open source

Kimi Delta Attention(KDA)將單一純量遺忘門改為逐通道門控:每個特徵維度擁有獨立衰減率,以 chunkwise DPLR 實現線性時間遞迴。K3 將 KDA 與 Gated MLA 層交錯混合——這是 100 萬 token 視窗與極小 KV Cache 佔用的核心設計。

Attention Residuals(AttnRes)以選擇性、輸入相依的動態聚合取代均勻殘差累加——訓練效率提升約 25%,參數開銷不到 2%。

Per-Head Muon讓每個注意力頭獨立優化。Stable LatentMoE採用 Quantile Balancing,配合 MoonEP 從數學上證明每個運算節點冗餘專家數的上界。

架構元件解決的問題關鍵收益
KDA長序列 KV Cache 爆炸線性時間遞迴、極低 VRAM 佔用
AttnRes深層網路早期訊號稀釋約 25% 訓練效率提升
Per-Head Muon注意力頭收斂路徑單一更少啟用參數達到前沿級效果
Stable LatentMoE大規模 MoE 專家負載不均896 選 16,稀疏度 1.8%
03

三項基礎設施釋出與基準測試:對比 GPT-5.6、Claude、GLM-5.2

技術定位關鍵數據
MoonEP超大規模 MoE 通訊複製過載專家;證明每節點冗餘專家數上界
FlashKDACUTLASS KDA 核心H20 上 prefill 快 1.72×–2.22×(相較 flash-linear-attention 基線)
AgentEnvFirecracker microVM 智慧體沙箱checkpoint 約 133ms、恢復約 49ms、記憶體超分最高 6.5 倍

SWE-bench Verified(獨立評測,Vals AI,2026 年 7 月):

模型分數發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(max)51(AA Index)此前開放權重第一

在 Artificial Analysis 智能指數(max 推理檔)中,Kimi K3 約 57 分——全球第 3、開放權重第 1。它是開放權重陣營的能力天花板,但每任務約 $0.95,高於 GLM-5.2(約 $0.47)。目前在 Arena.ai Frontend Code Arena 榜單排名第一。

04

許可證商業門檻與六步部署清單

月之暗面始終稱此次為「開放權重」釋出,從未使用「開源」。許可證為完全自訂文件,包含兩道 K2 系列沒有的商業門檻:

門檻觸發條件要求
MaaS 收入門檻模型即服務業務連續 12 個月累計收入超過 2000 萬美元須與月之暗面另行簽署商業協議
歸屬展示門檻月活超過 1 億,或月收入超過 2000 萬美元產品介面顯著展示「Kimi K3」字樣
Token 類型價格(每百萬 token)
輸入(快取命中)$0.30
輸入(快取未命中)$3.00
輸出(含推理過程)$15.00

Mooncake 分離式推理架構在典型程式設計工作負載上快取命中率可達 90% 以上——多數實際呼叫成本更接近 $0.30 檔。

01

註冊 API 存取:在 platform.kimi.ai 建立金鑰,base_url 設為 https://api.moonshot.ai/v1,模型 ID kimi-k3

02

審閱 LICENSE:下載 Hugging Face 權重前,法務團隊須確認 MaaS 收入或 MAU 門檻是否適用。

03

OpenAI SDK 相容整合:多數現有專案只需變更 base URL 與 API Key。

04

快取前綴最佳化:複用 system prompt 與工具定義前綴——程式設計 Agent 命中率可達 90%+,有效輸入價降至 $0.30/M。

05

自架硬體檢查:確認 64 卡以上超節點容量;多數團隊更實際的路徑是透過 OpenRouter 等平台呼叫(目前已有 7 家服務商上線)。

06

選擇推理堆疊:以 vLLM(KDA + prefix caching)或 SGLang 部署;FlashKDA 可作為 chunk_kda 後端直接替換。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析這段程式碼的複雜度..."}]
)
05

中美 AI 爭端背景與三條硬核數據

Kimi K3 開放權重釋出恰逢 WAIC 2026,並在中美「模型蒸餾」爭端升級數日後落地:白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic Fable 模型發起大規模蒸餾行動,財政部長 Scott Bessent 暗示制裁。中國商務部於 7 月 28 日反擊,指責華盛頓搞「AI 霸權主義」。K3 釋出三天後,阿里巴巴發布 Qwen3.8-Max-Preview——普遍被解讀為直接回應,開放權重競賽正式進入「3T 俱樂部」。

A

2.8T / 開放權重第 1:迄今完整釋出的最大開放權重模型——Hugging Face 約 1.56TB,30 分鐘內登頂趨勢榜。

B

93.4% / 全球第 3:SWE-bench Verified 獨立評測 93.4%;AA Index 約 57——全球第三、開放權重第一。

C

11 天 / 三項 Infra:從 API 首發到權重全面開源僅 11 天,同步釋出 MoonEP、FlashKDA、AgentEnv。

實際替代方案都有隱藏成本:在個人 Mac 上跑 Kimi Code Agent會受休眠與網路中斷影響;自架完整 K3需要 64+ 卡超節點,多數團隊無法配置;依賴單一閉源 API則難以發揮 K3 百萬 token 定價優勢。對需要 iOS CI/CD 管線與 7×24 AI Agent 自動化的正式環境,KVMNODE 獨享 Mac Mini M4 雲端租用通常是更合適的選擇:原生 Apple Silicon、完整 sudo 權限、按天/週/月彈性計費。詳見定價頁說明中心,或直接下單

數據截至 2026 年 7 月 28 日 · 來源:Moonshot AI 官方部落格、Hugging Face、GitHub moonshotai/FlashKDA、Vals AI SWE-bench Verified、Artificial Analysis Intelligence Index