面向关注 Kimi K3 全面开源月之暗面开放权重大模型 的 AI 开发者与企业选型团队:7 月 27 日晚,月之暗面正式发布 2.8 万亿参数 MoE 模型完整权重,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施。本文覆盖11 天发布时间线KDA/AttnRes/Per-Head Muon 架构创新SWE-bench 与 AA Index 跑分对比自定义许可证两道商业门槛API 定价与六步部署清单,以及中美 AI 竞赛背景解读。背景阅读 K3 开源权重前瞻K3 蒸馏门解读
01

Kimi K3 全面开源时间线:从 API 首发到权重公开,只用了 11 天

7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 的完整模型权重与技术报告,并同步开源支撑其训练的三项核心基础设施技术:MoonEP、FlashKDA、AgentEnv。Kimi K3 是一个拥有 2.8 万亿总参数的混合专家(MoE)模型,激活参数约 1040 亿,支持 100 万 token 上下文窗口,具备原生视觉理解能力——这是全球首个被完整开放的 3 万亿参数级别模型。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。

日期里程碑关键内容
7 月 16 日API 首发Kimi App / Work / Code / API 上线,权重尚未公开
7 月 17 日WAIC 2026新华社报道称其为「目前全球参数最大的开源模型」
7 月 22–23 日蒸馏争端升级白宫科技顾问 Kratsios 指控月之暗面工业化蒸馏 Anthropic Fable 模型
7 月 27 日权重全面开源完整权重 + 技术报告 + MoonEP / AgentEnv(FlashKDA 此前已开源)
7 月 28 日商务部回应中国商务部指责美方「AI 霸权主义」并威胁反制措施
01

混淆「开源」与「开放权重」:官方从未使用 open source,只称 open weight——训练数据与完整训练代码未公开。

02

低估许可证商业门槛:K3 新增 MaaS 年收入 2000 万美元门槛与 1 亿 MAU 展示义务,K2 时代没有。

03

误以为消费级硬件可跑满血:2.8T 参数 + 896 专家,官方建议 64 卡及以上超节点。

04

只看参数不看成本:K3 是开源阵营能力天花板,但每任务约 $0.95,高于 GLM-5.2(约 $0.47)。

05

忽视地缘政治合规:中美蒸馏争端叠加 WAIC 2026 窗口期,企业选型须评估供应链风险。

02

Kimi K3 核心参数与三大架构创新:KDA、AttnRes 和 Per-Head Muon

项目参数
总参数量2.8 万亿(2.8T)
激活参数量约 1040 亿
专家配置896 个路由专家,每 token 激活 16 个(稀疏度约 1.8%)
注意力机制Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口100 万 token
多模态原生视觉理解(ViT-V2,27 层)
权重格式MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(官方称 open weight,非 open source)

Kimi Delta Attention(KDA)将传统标量级遗忘门改为逐通道级别:每个特征维度拥有独立衰减率,采用 chunkwise DPLR 公式实现线性时间递归,与少量 Gated MLA 层交替混合,支撑 100 万 token 上下文同时将 KV Cache 开销压到极低。

Attention Residuals(AttnRes)将均匀残差累加改为选择性、输入依赖的动态聚合——每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,参数开销不到 2%。

Per-Head Muon让每个注意力头独立优化,而非统一策略「一锅烩」。Stable LatentMoE采用 Quantile Balancing 均衡策略,配合 MoonEP 从数学上证明每个计算节点冗余专家数的理论上界。

架构组件解决的问题关键收益
KDA长序列 KV Cache 爆炸线性时间递归 + 极低显存开销
AttnRes深层网络早期信息稀释约 25% 训练效率提升
Per-Head Muon注意力头收敛路径单一更少激活参数打出接近顶尖闭源效果
Stable LatentMoE大规模 MoE 专家负载不均896 选 16,稀疏度 1.8%
03

三大开源 Infra 与跑分对比:Kimi K3 vs GPT-5.6、Claude、GLM-5.2

技术定位关键能力
MoonEP超大规模细粒度 MoE 通信库临时复制过载专家,数学证明冗余专家数上界,维持高通信效率
FlashKDACUTLASS 实现的 KDA 高性能算子H20 上 prefill 速度提升 1.72–2.22 倍,可作为 chunk_kda 直接替代后端
AgentEnvFirecracker microVM 智能体沙箱checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍

SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月):

模型分数发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
GLM-5.2(max)51(AA Index)此前开源第一

Kimi K3 在 Artificial Analysis 智能指数(max 推理档)约 57 分,全球第 3、开源模型第 1。它是开源阵营能力天花板,但每任务成本约 $0.95,比 GLM-5.2(约 $0.47)更贵——能力最强,而非性价比最优。目前在 Arena.ai Frontend Code Arena 榜单排名第一。

04

许可证两道商业门槛与六步接入部署清单

月之暗面官方材料从未使用「open source」,一直采用「open weight(开放权重)」表述。许可证是一份完全自定义文件,包含两道 K2 系列都没有的商业门槛:

门槛触发条件要求
MaaS 收入门槛运营模型即服务业务,连续 12 个月累计收入超 2000 万美元须与月之暗面另行签署商业协议
规模展示门槛月活超 1 亿,或月收入超 2000 万美元产品界面显著展示「Kimi K3」字样
Token 类型价格(每百万 token)
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00

Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际大部分调用成本更接近 $0.30 档。

01

注册 API 账号:在 platform.kimi.ai 创建密钥,base_url 设为 https://api.moonshot.ai/v1,模型 ID kimi-k3

02

审阅 LICENSE:下载 Hugging Face 权重前,法务团队须确认 MaaS 收入门槛与 MAU 展示义务是否适用。

03

OpenAI SDK 兼容接入:大部分现有项目只需改 base URL 和 API Key 即可切换至 K3。

04

缓存前缀优化:复用 system prompt 与工具定义前缀,编程 Agent 场景命中率可达 90%+,有效输入价降至 $0.30/M。

05

自部署硬件评估:确认 64 卡及以上超节点配置;个人开发者更现实的路径是通过 OpenRouter 等第三方平台调用(目前已有 7 家服务商上线)。

06

推理框架选型:使用 vLLM(KDA + prefix caching)或 SGLang 启动服务;FlashKDA 可作为 flash-linear-attention 库 chunk_kda 的直接替代后端。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析这段代码的复杂度..."}]
)
05

中美 AI 竞赛背景与三条硬核数据

Kimi K3 的开源节点并非孤立事件。它恰好卡在世界人工智能大会(WAIC 2026)窗口期,同时叠加了正在升级的中美「模型蒸馏」争端——美方指控月之暗面工业化蒸馏 Anthropic 模型训练 K3 并威胁制裁;中国商务部则在 7 月 28 日公开回应,指责美方搞「AI 霸权主义」。三天后,阿里巴巴发布了 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应,国产大模型竞争正式进入「3T 俱乐部」阶段。

A

2.8T / #1 开放权重:全球首个被完整开放的 3 万亿参数级别模型,Hugging Face 下载约 1.56TB,半小时登顶趋势榜。

B

93.4% / 全球第 3:SWE-bench Verified 独立复测 93.4%,AA Index 约 57 分全球第三、开源第一。

C

11 天 / 三项 Infra:从 API 首发到权重全面开源仅 11 天,同步放出 MoonEP、FlashKDA、AgentEnv 整套工程能力。

摊开替代方案:仅靠个人 Mac 跑 Kimi Code Agent 压测受休眠与网络波动影响,长上下文任务易中断;等待自部署满血 K3需 64+ 卡超节点,中小团队短期不可行;完全依赖单一闭源 API则在上下文长度与成本上难以覆盖 K3 的 1M flat 定价优势。对需要 iOS CI/CD、Kimi Code 常驻与 AI Agent 7×24 自动化生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、按天/周/月弹性下单。详见 定价页帮助中心,或 直接下单

数据截至:2026 年 7 月 28 日 · 来源:Moonshot AI 官方博客、Hugging Face、GitHub moonshotai/FlashKDA、Vals AI SWE-bench Verified、Artificial Analysis Intelligence Index