TL;DR:7/16 API 上线、7/27 权重开源,闭源溢价还守得住吗?
📌 核心结论:7 月 16 日 Kimi App / Work / Code / API 先行上线;7 月 27 日以修改版 MIT开放完整权重 + 技术报告。K3 是迄今最大开放权重(2.8T),但不是 Fable 5 killer——Artificial Analysis Intelligence Index v4.1 以 57.1 分排名 3/189,落后 Fable 5(59.9)与 GPT-5.6 Sol(58.9)。优势在于约 1/3 成本接近前沿智能 + 开放权重 + 100 万 token上下文。
2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部挂出横幅「🎉 Kimi K3 已上线!」——没有大型发布会,只有一份技术博客、一个定价页面和一个可以立刻调用的模型 ID kimi-k3。低调姿态与 2.8 万亿参数体量形成鲜明对比。完整权重将于 7 月 27 日在 Hugging Face 以修改版 MIT 协议开放,届时 K3 将成为迄今参数规模最大的可下载开放权重模型。
| 日期 | 里程碑 | 关键内容 |
|---|---|---|
| 2026-07-16 | 🚀 API 正式上线 | Kimi App / Work / Code / API 全面可用;Artificial Analysis 独立评测启动 |
| 2026-07-17 | 🏛 WAIC / 新华社 | 2026 世界人工智能大会开幕前夜,新华社等官媒报道 K3 里程碑意义 |
| 2026-07-27 | 📦 Hugging Face 权重 | 完整模型权重(修改版 MIT)+ 技术报告;vLLM KDA / prefix caching Day-0 支持 |
为什么这次权重发布意义重大?月之暗面在过去 18 个月经历 DeepSeek 崛起带来的冲击——K2 将排名从第 7 拉回前沿,K2.5 巩固编程能力,K3 则以 2.8T 规模 + 1M 上下文 + 开放权重三连击,代表中国 AI 从「以低价换市场」转向「挑战智能前沿」。发布时点恰在 WAIC 期间,且美国 Anthropic 于 7 月 1 日短暂下架 Fable 5 外国用户访问后已恢复——地缘政治与模型竞赛交织。
规模纪录:2.8T 是迄今最大开放权重,超越 DeepSeek V4 Pro(1.6T)近 75%。
智能定位:AA Index 57.1 排名第三,与榜首差距仅 2.8 分——开源/开放权重与闭源前沿差距已缩至 2–3 分。
成本优势:API 定价对齐西方质量档($3/$15),但实际有效成本约闭源旗舰 1/3。
选型误判:勿把「参数最大」等同于「每项 benchmark 第一」;勿在 7/27 前假设可本地跑满血权重;勿忽视 FrontierSWE 上 Fable 5 仍领先。
Kimi K3 全量规格:2.8T Stable LatentMoE 与 KDA 架构
Kimi K3 不是简单的参数堆砌——它在架构层面引入多项工程创新,解决长上下文与超稀疏 MoE 训练的真实瓶颈。相较 Kimi K2,整体扩展效率提升约 2.5 倍。
| 规格 | 数值 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| MoE 架构 | Stable LatentMoE:896 专家 / 16 激活(稀疏度 1.8%) |
| 注意力机制 | KDA + AttnRes + Gated MLA |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 输入模态 | 文本、图像、视频(原生视觉理解) |
| 训练精度 | MXFP4 权重 + MXFP8 激活(量化感知设计) |
| 扩展效率 | 相较 K2 提升约 2.5 倍 |
| 长上下文解码 | KDA 在 1M token 下解码速度提升 6.3 倍 |
| 技术组件 | 作用 |
|---|---|
| Kimi Delta Attention(KDA) | 3:1 线性/全注意力交替,KV 缓存内存减少 75%,百万 token 解码 6.3× 加速 |
| Attention Residuals(AttnRes) | 跨深度选择性检索,约 25% 训练效率提升 |
| Quantile Balancing | 从路由器得分分位数推导专家分配,消除启发式超参 |
| Per-Head Muon | 针对每个注意力头独立优化,大规模训练更自适应 |
| Sigmoid Tanh Unit(SiTU) | 改进激活函数控制 |
| Gated MLA | 提升注意力选择性 |
开放权重(Open Weights)vs 开源(Open Source):K3 属于哪一类?
这是 7 月 27 日发布前必须厘清的概念:open weights 与 open source 并非同义词。
| 维度 | 开放权重(Open Weights) | 完全开源(Open Source) |
|---|---|---|
| 模型权重 | ✅ 可下载 | ✅ 可下载 |
| 训练代码 | ❌ 通常不公开 | ✅ 公开 |
| 训练数据 | ❌ 通常不公开 | ✅ 或至少公开清单 |
| 微调 / 自部署 | ✅ 允许 | ✅ 允许 |
| 协议示例 | 修改版 MIT、Llama License | Apache 2.0、MIT(含代码) |
| Kimi K3 | ✅ 7/27 起属于此类 | ❌ 训练细节未完全公开 |
K3 将于 7 月 27 日以修改版 MIT 协议开放完整权重——你可以下载、微调、自部署,但训练代码与数据并未完全公开。社区 r/LocalLLaMA 与 Hacker News 讨论中,多数开发者将此视为「开放权重里程碑」而非「Llama 式全栈开源」。对需要数据驻留与模型可控性的企业,开放权重已足够;对需要复现训练流程的研究机构,仍需等待更多技术报告细节。
Benchmark 跑分:AA Index 57.1 排名第三,赢在哪、输在哪?
以下为 Artificial Analysis 与月之暗面自报核心基准(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。月之暗面在官方博客中诚实承认短板——不回避 GDPval、DeepSWE 等落后项。
| 综合排名(AA Index v4.1) | 分数 | 排名 |
|---|---|---|
| Claude Fable 5 | 59.9 | #1 |
| GPT-5.6 Sol | 58.9 | #2 |
| Kimi K3 | 57.1 | #3 / 189 |
✅ K3 领先的赛道
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Frontend Code Arena | #1 | — | — |
| Automation Bench | 30.8 | 29.1 | 29.7 |
| SpreadsheetBench 2 | 领先 | — | — |
| BrowseComp | 91.2 | 88.0 | 90.4 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 |
❌ K3 落后的赛道
| 基准测试 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 备注 |
|---|---|---|---|---|
| GDPval v2 Elo | 1668–1687 | 1760 | 1748 | 通用对话质量仍有差距 |
| DeepSWE | 67.5 | 70.0 | 73.0 | 复杂 Repo 级修 Bug |
| 幻觉率 | 较 K2.6 上升 | — | — | 官方承认需持续优化 |
| 输出 polish / 方差 | 弱于 Fable / Sol | 领先 | 领先 | 长文本一致性与风格稳定性 |
官方诚实表态:月之暗面在 kimi.com/en/blog/kimi-k3 中明确列出 K3 的不足——不回避 DeepSWE、GDPval 等落后项,也不夸大 Frontend Code Arena 等优势。建议作方向性参考,生产选型务必结合自有评测集验证。
开源/开放权重与闭源前沿的智能差距,已从 2024 年的 10+ 分缩小到 2026 年的 2–3 分。K3 不是 Fable 5 killer,但以约 1/3 成本提供了接近前沿的能力——闭源溢价正在经受考验。
API 定价与六步操作清单:从接入到 7/27 发布日
| 计费项 | Kimi K3 | Claude Sonnet 5 | DeepSeek V4 Pro |
|---|---|---|---|
| 输入($/M) | $3.00 | $3.00 | $1.74 |
| 缓存命中输入 | $0.30 | — | $0.145 |
| 输出($/M) | $15.00 | $15.00 | $3.48 |
| 上下文 | 1M | 200K | 128K |
K3 标准价与 Claude Sonnet 5 持平($3/$15),对齐西方质量档定价,但上下文窗口为其 5 倍。Artificial Analysis 测算:AA 单次任务成本 $0.94,比 Sol 低 9.4%,比 Fable 5 低 65.8%。编程场景缓存命中率超 90%+,实际有效输入成本可降至约 $0.55/M。
六步操作清单(API 接入 + 7/27 发布日准备):
API Key 接入:在 platform.kimi.ai 创建密钥,base_url 设为 https://api.moonshot.ai/v1,模型 ID kimi-k3。或在 kimi.com 注册免费账号直接使用 App / Work / Code。
缓存优化:编程 Agent 工作流复用 system prompt 与工具定义前缀,Mooncake 分推理架构下缓存命中率可达 90%+,有效输入价降至 $0.30/M。
7/27 检查 HF 文件:确认 Hugging Face 仓库已上传完整权重分片、config.json、tokenizer 与 LICENSE(修改版 MIT 条款)。
量化版本验证:下载 MXFP4 / NVFP4 量化版(4-bit 约 1.4TB),对照官方 tech report 核对参数量与架构描述。
推理框架部署:使用 vLLM(KDA + prefix caching)或 SGLang 启动服务,参考官方 Day-0 命令;Ollama / GGUF 版本预计随后跟进。
硬件与长上下文复测:确认最低 64+ 加速卡超节点配置;在 1M token 场景下复测解码延迟与 KDA 6.3× 加速是否达标。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)7/27 权重发布、自部署方案与行业格局
📦 7 月 27 日发布内容
月之暗面在官方 WeChat 公告明确 7 月 27 日开放完整模型权重。届时将包含:
Hugging Face 完整权重(修改版 MIT 协议)
技术报告(Tech Report)——架构、训练与 benchmark 细节
vLLM Day-0 支持——KDA 内核 + prefix caching
Ollama / GGUF 量化版——社区预计随后数日内跟进
🖥 自部署硬件要求与三种适用场景
| 配置项 | 要求 | 参考 |
|---|---|---|
| 4-bit 量化存储 | 约 1.4TB | MXFP4 / NVFP4 版本 |
| 生产推理 | 64+ 加速卡超节点 | 与 K2.7 Code INT4 ~577GB 对比,K3 规模更大 |
| 普通团队 | API 是正确选择 | Northflank、VentureBeat 等均建议多数场景走 API |
| 自部署场景 | 是否推荐 | 原因 |
|---|---|---|
| 数据驻留 / 合规 | ✅ 7/27 后可行 | 权重本地运行,数据不出境 |
| 领域微调 | ✅ 7/27 后可行 | 开放权重允许 fine-tuning |
| 超高调用量 | ⚠️ 需精算 | 64+ 卡 CAPEX vs API OPEX,需自有 ROI 模型 |
🌏 行业格局:中国 AI 浪潮与闭源溢价考验
2026 年 7 月,中国 AI 开源/开放权重生态迎来密集发布潮:GLM-5.2、DeepSeek V4 Pro、MiniMax 等相继亮相。月之暗面从 DeepSeek R1 冲击后的排名第 7 位,经由 K2 → K2.5 → K3 三连跳完成 comeback。WAIC 2026 timing 与 7 月 1 日 Anthropic 短暂限制 Fable 5 外国用户访问(已恢复)形成微妙的地缘政治背景——开放权重正在缩小与闭源前沿的 2–3 分差距,闭源 API 的「质量溢价」是否还能维持 3–5 倍价差,成为接下来季度的核心问题。
2.8T / #1 开放权重:迄今最大可下载开放权重,超越 DeepSeek V4 Pro(1.6T)近 75%。
57.1 / 2.8 分:AA Index v4.1 排名第三(3/189),与 Fable 5(59.9)差距仅 2.8 分,开源/闭源智能鸿沟缩至 2–3 分。
$0.94 / 65.8%:AA 单次任务成本 $0.94,比 Fable 5 低 65.8%,比 Sol 低 9.4%——约 1/3 成本接近前沿智能。
总结:Kimi K3 开放权重发布是 2026 年 AI 领域最重要的里程碑之一。它不是 Fable 5 killer,但在编程长任务、文档理解与 1M 上下文等关键赛道具备竞争力,且以修改版 MIT 承诺完整权重下载——代表中国 AI 从「以低价换市场」转向「挑战智能前沿」。关注时间节点:7 月 22 日(本文)→ 7 月 27 日 Hugging Face 权重 + tech report。
摊开替代方案:仅靠个人 Mac 跑 Kimi Code / API Agent 压测 受休眠与网络波动影响,长上下文任务易中断;等待 7/27 自部署 需 64+ 卡超节点,中小团队短期不可行;完全依赖单一闭源 API 则在上下文长度与成本上难以覆盖 K3 的 1M flat 定价优势。对需要 iOS CI/CD、Kimi Code 常驻与 AI Agent 7×24 自动化生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、按天/周/月弹性下单。详情见 定价页、帮助中心,或 直接下单。
数据截至:2026 年 7 月 22 日 · 来源:kimi.com/en/blog/kimi-k3、platform.kimi.ai、Artificial Analysis、VentureBeat、Northflank、r/LocalLLaMA、Hacker News