TL;DR:7/16 API 上線、7/27 權重開源,閉源溢價還守得住嗎?
核心結論:7 月 16 日 Kimi App / Work / Code / API 先行上線;7 月 27 日以修改版 MIT開放完整權重 + 技術報告。K3 是迄今最大開放權重(2.8T),但不是 Fable 5 killer——Artificial Analysis Intelligence Index v4.1 以 57.1 分排名 3/189,落後 Fable 5(59.9)與 GPT-5.6 Sol(58.9)。優勢在於約 1/3 成本接近前沿智能 + 開放權重 + 100 萬 token上下文。
2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文件頂部掛出橫幅「Kimi K3 已上線!」——沒有大型發佈會,只有一份技術部落格、一個定價頁面與一個可以立刻呼叫的模型 ID kimi-k3。低調姿態與 2.8 兆參數體量形成鮮明對比。完整權重將於 7 月 27 日在 Hugging Face 以修改版 MIT 協議開放,屆時 K3 將成為迄今參數規模最大的可下載開放權重模型。
| 日期 | 里程碑 | 關鍵內容 |
|---|---|---|
| 2026-07-16 | API 正式上線 | Kimi App / Work / Code / API 全面可用;Artificial Analysis 獨立評測啟動 |
| 2026-07-17 | WAIC / 新華社 | 2026 世界人工智慧大會開幕前夜,新華社等官媒報導 K3 里程碑意義 |
| 2026-07-27 | Hugging Face 權重 | 完整模型權重(修改版 MIT)+ 技術報告;vLLM KDA / prefix caching Day-0 支援 |
為什麼這次權重發佈意義重大?月之暗面在過去 18 個月經歷 DeepSeek 崛起帶來的衝擊——K2 將排名從第 7 拉回前沿,K2.5 鞏固程式設計能力,K3 則以 2.8T 規模 + 1M 上下文 + 開放權重三連擊,代表中國 AI 從「以低價換市場」轉向「挑戰智能前沿」。發佈時點恰在 WAIC 期間,且美國 Anthropic 於 7 月 1 日短暫下架 Fable 5 外國使用者存取後已恢復——地緣政治與模型競賽交織。
規模紀錄:2.8T 是迄今最大開放權重,超越 DeepSeek V4 Pro(1.6T)近 75%。
智能定位:AA Index 57.1 排名第三,與榜首差距僅 2.8 分——開源/開放權重與閉源前沿差距已縮至 2–3 分。
成本優勢:API 定價對齊西方品質檔($3/$15),但實際有效成本約閉源旗艦 1/3。
選型誤判:勿把「參數最大」等同於「每項 benchmark 第一」;勿在 7/27 前假設可本地跑滿血權重;勿忽視 FrontierSWE 上 Fable 5 仍領先。
Kimi K3 全量規格:2.8T Stable LatentMoE 與 KDA 架構
Kimi K3 不是簡單的參數堆疊——它在架構層面引入多項工程創新,解決長上下文與超稀疏 MoE 訓練的真實瓶頸。相較 Kimi K2,整體擴展效率提升約 2.5 倍。
| 規格 | 數值 |
|---|---|
| 總參數量 | 2.8 兆(2.8T) |
| MoE 架構 | Stable LatentMoE:896 專家 / 16 啟用(稀疏度 1.8%) |
| 注意力機制 | KDA + AttnRes + Gated MLA |
| 上下文視窗 | 1,048,576 tokens(1M) |
| 輸入模態 | 文字、影像、影片(原生視覺理解) |
| 訓練精度 | MXFP4 權重 + MXFP8 啟用(量化感知設計) |
| 擴展效率 | 相較 K2 提升約 2.5 倍 |
| 長上下文解碼 | KDA 在 1M token 下解碼速度提升 6.3 倍 |
| 技術元件 | 作用 |
|---|---|
| Kimi Delta Attention(KDA) | 3:1 線性/全注意力交替,KV 快取記憶體減少 75%,百萬 token 解碼 6.3× 加速 |
| Attention Residuals(AttnRes) | 跨深度選擇性檢索,約 25% 訓練效率提升 |
| Quantile Balancing | 從路由器得分分位數推導專家分配,消除啟發式超參 |
| Per-Head Muon | 針對每個注意力頭獨立最佳化,大規模訓練更自適應 |
| Sigmoid Tanh Unit(SiTU) | 改進啟用函數控制 |
| Gated MLA | 提升注意力選擇性 |
開放權重(Open Weights)vs 開源(Open Source):K3 屬於哪一類?
這是 7 月 27 日發佈前必須釐清的概念:open weights 與 open source 並非同義詞。
| 維度 | 開放權重(Open Weights) | 完全開源(Open Source) |
|---|---|---|
| 模型權重 | 可下載 | 可下載 |
| 訓練程式碼 | 通常不公開 | 公開 |
| 訓練資料 | 通常不公開 | 或至少公開清單 |
| 微調 / 自部署 | 允許 | 允許 |
| 協議範例 | 修改版 MIT、Llama License | Apache 2.0、MIT(含程式碼) |
| Kimi K3 | 7/27 起屬於此類 | 訓練細節未完全公開 |
K3 將於 7 月 27 日以修改版 MIT 協議開放完整權重——你可以下載、微調、自部署,但訓練程式碼與資料並未完全公開。社群 r/LocalLLaMA 與 Hacker News 討論中,多數開發者將此視為「開放權重里程碑」而非「Llama 式全棧開源」。對需要資料駐留與模型可控性的企業,開放權重已足夠;對需要複現訓練流程的研究機構,仍需等待更多技術報告細節。
Benchmark 跑分:AA Index 57.1 排名第三,贏在哪、輸在哪?
以下為 Artificial Analysis 與月之暗面自報核心基準(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。月之暗面在官方部落格中誠實承認短板——不迴避 GDPval、DeepSWE 等落後項。
| 綜合排名(AA Index v4.1) | 分數 | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | #1 |
| GPT-5.6 Sol | 58.9 | #2 |
| Kimi K3 | 57.1 | #3 / 189 |
K3 領先的賽道
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Frontend Code Arena | #1 | — | — |
| Automation Bench | 30.8 | 29.1 | 29.7 |
| SpreadsheetBench 2 | 領先 | — | — |
| BrowseComp | 91.2 | 88.0 | 90.4 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 |
K3 落後的賽道
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 備註 |
|---|---|---|---|---|
| GDPval v2 Elo | 1668–1687 | 1760 | 1748 | 通用對話品質仍有差距 |
| DeepSWE | 67.5 | 70.0 | 73.0 | 複雜 Repo 級修 Bug |
| 幻覺率 | 較 K2.6 上升 | — | — | 官方承認需持續最佳化 |
| 輸出 polish / 方差 | 弱於 Fable / Sol | 領先 | 領先 | 長文本一致性與風格穩定性 |
官方誠實表態:月之暗面在 kimi.com/en/blog/kimi-k3 中明確列出 K3 的不足——不迴避 DeepSWE、GDPval 等落後項,也不誇大 Frontend Code Arena 等優勢。建議作方向性參考,生產選型務必結合自有評測集驗證。
開源/開放權重與閉源前沿的智能差距,已從 2024 年的 10+ 分縮小到 2026 年的 2–3 分。K3 不是 Fable 5 killer,但以約 1/3 成本提供了接近前沿的能力——閉源溢價正在經受考驗。
API 定價與六步操作清單:從接入到 7/27 發佈日
| 計費項 | Kimi K3 | Claude Sonnet 5 | DeepSeek V4 Pro |
|---|---|---|---|
| 輸入($/M) | $3.00 | $3.00 | $1.74 |
| 快取命中輸入 | $0.30 | — | $0.145 |
| 輸出($/M) | $15.00 | $15.00 | $3.48 |
| 上下文 | 1M | 200K | 128K |
K3 標準價與 Claude Sonnet 5 持平($3/$15),對齊西方品質檔定價,但上下文視窗為其 5 倍。Artificial Analysis 測算:AA 單次任務成本 $0.94,比 Sol 低 9.4%,比 Fable 5 低 65.8%。程式設計場景快取命中率超 90%+,實際有效輸入成本可降至約 $0.55/M。
六步操作清單(API 接入 + 7/27 發佈日準備):
API Key 接入:在 platform.kimi.ai 建立金鑰,base_url 設為 https://api.moonshot.ai/v1,模型 ID kimi-k3。或在 kimi.com 註冊免費帳號直接使用 App / Work / Code。
快取最佳化:程式設計 Agent 工作流複用 system prompt 與工具定義前綴,Mooncake 分推理架構下快取命中率可達 90%+,有效輸入價降至 $0.30/M。
7/27 檢查 HF 檔案:確認 Hugging Face 儲存庫已上傳完整權重分片、config.json、tokenizer 與 LICENSE(修改版 MIT 條款)。
量化版本驗證:下載 MXFP4 / NVFP4 量化版(4-bit 約 1.4TB),對照官方 tech report 核對參數量與架構描述。
推理框架部署:使用 vLLM(KDA + prefix caching)或 SGLang 啟動伺服器服務,參考官方 Day-0 命令;Ollama / GGUF 版本預計隨後跟進。
硬體與長上下文複測:確認最低 64+ 加速卡超節點配置;在 1M token 場景下複測解碼延遲與 KDA 6.3× 加速是否達標。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "請幫我分析這段程式碼..."}]
)7/27 權重發佈、自部署方案與產業格局
7 月 27 日發佈內容
月之暗面在官方 WeChat 公告明確 7 月 27 日開放完整模型權重。屆時將包含:
Hugging Face 完整權重(修改版 MIT 協議)
技術報告(Tech Report)——架構、訓練與 benchmark 細節
vLLM Day-0 支援——KDA 核心 + prefix caching
Ollama / GGUF 量化版——社群預計隨後數日內跟進
自部署硬體要求與三種適用場景
| 配置項 | 要求 | 參考 |
|---|---|---|
| 4-bit 量化儲存 | 約 1.4TB | MXFP4 / NVFP4 版本 |
| 生產推理 | 64+ 加速卡超節點 | 與 K2.7 Code INT4 ~577GB 對比,K3 規模更大 |
| 一般團隊 | API 是正確選擇 | Northflank、VentureBeat 等均建議多數場景走 API |
| 自部署場景 | 是否推薦 | 原因 |
|---|---|---|
| 資料駐留 / 合規 | 7/27 後可行 | 權重本地執行,資料不出境 |
| 領域微調 | 7/27 後可行 | 開放權重允許 fine-tuning |
| 超高呼叫量 | 需精算 | 64+ 卡 CAPEX vs API OPEX,需自有 ROI 模型 |
產業格局:中國 AI 浪潮與閉源溢價考驗
2026 年 7 月,中國 AI 開源/開放權重生態迎來密集發佈潮:GLM-5.2、DeepSeek V4 Pro、MiniMax 等相繼亮相。月之暗面從 DeepSeek R1 衝擊後的排名約第 7 位,經由 K2 → K2.5 → K3 三連跳完成 comeback。WAIC 2026 時機與 7 月 1 日 Anthropic 短暫限制 Fable 5 外國使用者存取(已恢復)形成微妙的地緣政治背景——開放權重正在縮小與閉源前沿的 2–3 分差距,閉源 API 的「品質溢價」是否還能維持 3–5 倍價差,成為接下來季度的核心問題。
2.8T / #1 開放權重:迄今最大可下載開放權重,超越 DeepSeek V4 Pro(1.6T)近 75%。
57.1 / 2.8 分:AA Index v4.1 排名第三(3/189),與 Fable 5(59.9)差距僅 2.8 分,開源/閉源智能鴻溝縮至 2–3 分。
$0.94 / 65.8%:AA 單次任務成本 $0.94,比 Fable 5 低 65.8%,比 Sol 低 9.4%——約 1/3 成本接近前沿智能。
總結:Kimi K3 開放權重發佈是 2026 年 AI 領域最重要的里程碑之一。它不是 Fable 5 killer,但在程式設計長任務、文件理解與 1M 上下文等關鍵賽道具備競爭力,且以修改版 MIT 承諾完整權重下載——代表中國 AI 從「以低價換市場」轉向「挑戰智能前沿」。關注時間節點:7 月 22 日(本文)→ 7 月 27 日 Hugging Face 權重 + tech report。
攤開替代方案:僅靠個人 Mac 跑 Kimi Code / API Agent 壓測 受休眠與網路頻寬波動影響,長上下文任務易中斷;等待 7/27 自部署 需 64+ 卡超節點,中小團隊短期不可行;完全依賴單一閉源 API 則在上下文長度與成本上難以覆蓋 K3 的 1M flat 定價優勢。對需要 iOS CI/CD、Kimi Code 常駐與 AI Agent 7×24 自動化生產環境,KVMNODE 獨佔 Mac Mini M4 雲端租用通常是更優解:Apple Silicon 統一記憶體、開放 sudo、按天/週/月彈性下單。詳情見 定價頁、幫助中心,或 直接下單。
數據截至:2026 年 7 月 22 日 · 來源:kimi.com/en/blog/kimi-k3、platform.kimi.ai、Artificial Analysis、VentureBeat、Northflank、r/LocalLLaMA、Hacker News