Kimi K3 全面开源时间线:从 API 首发到权重公开,只用了 11 天
7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 的完整模型权重与技术报告,并同步开源支撑其训练的三项核心基础设施技术:MoonEP、FlashKDA、AgentEnv。Kimi K3 是一个拥有 2.8 万亿总参数的混合专家(MoE)模型,激活参数约 1040 亿,支持 100 万 token 上下文窗口,具备原生视觉理解能力——这是全球首个被完整开放的 3 万亿参数级别模型。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。
| 日期 | 里程碑 | 关键内容 |
|---|---|---|
| 7 月 16 日 | API 首发 | Kimi App / Work / Code / API 上线,权重尚未公开 |
| 7 月 17 日 | WAIC 2026 | 新华社报道称其为「目前全球参数最大的开源模型」 |
| 7 月 22–23 日 | 蒸馏争端升级 | 白宫科技顾问 Kratsios 指控月之暗面工业化蒸馏 Anthropic Fable 模型 |
| 7 月 27 日 | 权重全面开源 | 完整权重 + 技术报告 + MoonEP / AgentEnv(FlashKDA 此前已开源) |
| 7 月 28 日 | 商务部回应 | 中国商务部指责美方「AI 霸权主义」并威胁反制措施 |
混淆「开源」与「开放权重」:官方从未使用 open source,只称 open weight——训练数据与完整训练代码未公开。
低估许可证商业门槛:K3 新增 MaaS 年收入 2000 万美元门槛与 1 亿 MAU 展示义务,K2 时代没有。
误以为消费级硬件可跑满血:2.8T 参数 + 896 专家,官方建议 64 卡及以上超节点。
只看参数不看成本:K3 是开源阵营能力天花板,但每任务约 $0.95,高于 GLM-5.2(约 $0.47)。
忽视地缘政治合规:中美蒸馏争端叠加 WAIC 2026 窗口期,企业选型须评估供应链风险。
Kimi K3 核心参数与三大架构创新:KDA、AttnRes 和 Per-Head Muon
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(稀疏度约 1.8%) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
Kimi Delta Attention(KDA)将传统标量级遗忘门改为逐通道级别:每个特征维度拥有独立衰减率,采用 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 层交替混合,支撑 100 万 token 上下文同时将 KV Cache 开销压到极低。
Attention Residuals(AttnRes)将均匀残差累加改为选择性、输入依赖的动态聚合——每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,参数开销不到 2%。
Per-Head Muon让每个注意力头独立优化,而非统一策略「一锅烩」。Stable LatentMoE采用 Quantile Balancing 均衡策略,配合 MoonEP 从数学上证明每个计算节点冗余专家数的理论上界。
| 架构组件 | 解决的问题 | 关键收益 |
|---|---|---|
| KDA | 长序列 KV Cache 爆炸 | 线性时间递归 + 极低显存开销 |
| AttnRes | 深层网络早期信息稀释 | 约 25% 训练效率提升 |
| Per-Head Muon | 注意力头收敛路径单一 | 更少激活参数打出接近顶尖闭源效果 |
| Stable LatentMoE | 大规模 MoE 专家负载不均 | 896 选 16,稀疏度 1.8% |
三大开源 Infra 与跑分对比:Kimi K3 vs GPT-5.6、Claude、GLM-5.2
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 通信库 | 临时复制过载专家,数学证明冗余专家数上界,维持高通信效率 |
| FlashKDA | CUTLASS 实现的 KDA 高性能算子 | H20 上 prefill 速度提升 1.72–2.22 倍,可作为 chunk_kda 直接替代后端 |
| AgentEnv | Firecracker microVM 智能体沙箱 | checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍 |
SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月):
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| GLM-5.2(max) | 51(AA Index) | 此前开源第一 |
Kimi K3 在 Artificial Analysis 智能指数(max 推理档)约 57 分,全球第 3、开源模型第 1。它是开源阵营能力天花板,但每任务成本约 $0.95,比 GLM-5.2(约 $0.47)更贵——能力最强,而非性价比最优。目前在 Arena.ai Frontend Code Arena 榜单排名第一。
许可证两道商业门槛与六步接入部署清单
月之暗面官方材料从未使用「open source」,一直采用「open weight(开放权重)」表述。许可证是一份完全自定义文件,包含两道 K2 系列都没有的商业门槛:
| 门槛 | 触发条件 | 要求 |
|---|---|---|
| MaaS 收入门槛 | 运营模型即服务业务,连续 12 个月累计收入超 2000 万美元 | 须与月之暗面另行签署商业协议 |
| 规模展示门槛 | 月活超 1 亿,或月收入超 2000 万美元 | 产品界面显著展示「Kimi K3」字样 |
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际大部分调用成本更接近 $0.30 档。
注册 API 账号:在 platform.kimi.ai 创建密钥,base_url 设为 https://api.moonshot.ai/v1,模型 ID kimi-k3。
审阅 LICENSE:下载 Hugging Face 权重前,法务团队须确认 MaaS 收入门槛与 MAU 展示义务是否适用。
OpenAI SDK 兼容接入:大部分现有项目只需改 base URL 和 API Key 即可切换至 K3。
缓存前缀优化:复用 system prompt 与工具定义前缀,编程 Agent 场景命中率可达 90%+,有效输入价降至 $0.30/M。
自部署硬件评估:确认 64 卡及以上超节点配置;个人开发者更现实的路径是通过 OpenRouter 等第三方平台调用(目前已有 7 家服务商上线)。
推理框架选型:使用 vLLM(KDA + prefix caching)或 SGLang 启动服务;FlashKDA 可作为 flash-linear-attention 库 chunk_kda 的直接替代后端。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "分析这段代码的复杂度..."}]
)中美 AI 竞赛背景与三条硬核数据
Kimi K3 的开源节点并非孤立事件。它恰好卡在世界人工智能大会(WAIC 2026)窗口期,同时叠加了正在升级的中美「模型蒸馏」争端——美方指控月之暗面工业化蒸馏 Anthropic 模型训练 K3 并威胁制裁;中国商务部则在 7 月 28 日公开回应,指责美方搞「AI 霸权主义」。三天后,阿里巴巴发布了 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应,国产大模型竞争正式进入「3T 俱乐部」阶段。
2.8T / #1 开放权重:全球首个被完整开放的 3 万亿参数级别模型,Hugging Face 下载约 1.56TB,半小时登顶趋势榜。
93.4% / 全球第 3:SWE-bench Verified 独立复测 93.4%,AA Index 约 57 分全球第三、开源第一。
11 天 / 三项 Infra:从 API 首发到权重全面开源仅 11 天,同步放出 MoonEP、FlashKDA、AgentEnv 整套工程能力。
摊开替代方案:仅靠个人 Mac 跑 Kimi Code Agent 压测受休眠与网络波动影响,长上下文任务易中断;等待自部署满血 K3需 64+ 卡超节点,中小团队短期不可行;完全依赖单一闭源 API则在上下文长度与成本上难以覆盖 K3 的 1M flat 定价优势。对需要 iOS CI/CD、Kimi Code 常驻与 AI Agent 7×24 自动化生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、按天/周/月弹性下单。详见 定价页、帮助中心,或 直接下单。
数据截至:2026 年 7 月 28 日 · 来源:Moonshot AI 官方博客、Hugging Face、GitHub moonshotai/FlashKDA、Vals AI SWE-bench Verified、Artificial Analysis Intelligence Index