面向关注 Kimi K3 开源权重月之暗面开放权重大模型 的 AI 开发者与工程团队:API 已上线近一周,7 月 27 日完整权重即将落地。本文严格覆盖TL;DR 与发布时间表2.8T 全量规格与架构开放权重 vs 开源辨析与 Claude Fable 5 / GPT-5.6 Sol 跑分对比API 定价与六步操作清单7 月 27 日 Hugging Face 发布细节自部署硬件要求行业格局变化六条 FAQ。深度评测见 Kimi K3 深度评测,对比阅读 GPT-5.6 Sol 发布解读DeepSeek V4 满血版解读
01

TL;DR:7/16 API 上线、7/27 权重开源,闭源溢价还守得住吗?

📌 核心结论:7 月 16 日 Kimi App / Work / Code / API 先行上线;7 月 27 日以修改版 MIT开放完整权重 + 技术报告。K3 是迄今最大开放权重(2.8T),但不是 Fable 5 killer——Artificial Analysis Intelligence Index v4.1 以 57.1 分排名 3/189,落后 Fable 5(59.9)与 GPT-5.6 Sol(58.9)。优势在于约 1/3 成本接近前沿智能 + 开放权重 + 100 万 token上下文。

2026 年 7 月 16 日深夜,月之暗面(Moonshot AI)在 API 文档顶部挂出横幅「🎉 Kimi K3 已上线!」——没有大型发布会,只有一份技术博客、一个定价页面和一个可以立刻调用的模型 ID kimi-k3。低调姿态与 2.8 万亿参数体量形成鲜明对比。完整权重将于 7 月 27 日在 Hugging Face 以修改版 MIT 协议开放,届时 K3 将成为迄今参数规模最大的可下载开放权重模型。

日期里程碑关键内容
2026-07-16🚀 API 正式上线Kimi App / Work / Code / API 全面可用;Artificial Analysis 独立评测启动
2026-07-17🏛 WAIC / 新华社2026 世界人工智能大会开幕前夜,新华社等官媒报道 K3 里程碑意义
2026-07-27📦 Hugging Face 权重完整模型权重(修改版 MIT)+ 技术报告;vLLM KDA / prefix caching Day-0 支持

为什么这次权重发布意义重大?月之暗面在过去 18 个月经历 DeepSeek 崛起带来的冲击——K2 将排名从第 7 拉回前沿,K2.5 巩固编程能力,K3 则以 2.8T 规模 + 1M 上下文 + 开放权重三连击,代表中国 AI 从「以低价换市场」转向「挑战智能前沿」。发布时点恰在 WAIC 期间,且美国 Anthropic 于 7 月 1 日短暂下架 Fable 5 外国用户访问后已恢复——地缘政治与模型竞赛交织。

01

规模纪录:2.8T 是迄今最大开放权重,超越 DeepSeek V4 Pro(1.6T)近 75%。

02

智能定位:AA Index 57.1 排名第三,与榜首差距仅 2.8 分——开源/开放权重与闭源前沿差距已缩至 2–3 分

03

成本优势:API 定价对齐西方质量档($3/$15),但实际有效成本约闭源旗舰 1/3。

04

选型误判:勿把「参数最大」等同于「每项 benchmark 第一」;勿在 7/27 前假设可本地跑满血权重;勿忽视 FrontierSWE 上 Fable 5 仍领先。

02

Kimi K3 全量规格:2.8T Stable LatentMoE 与 KDA 架构

Kimi K3 不是简单的参数堆砌——它在架构层面引入多项工程创新,解决长上下文与超稀疏 MoE 训练的真实瓶颈。相较 Kimi K2,整体扩展效率提升约 2.5 倍

规格数值
总参数量2.8 万亿(2.8T)
MoE 架构Stable LatentMoE:896 专家 / 16 激活(稀疏度 1.8%)
注意力机制KDA + AttnRes + Gated MLA
上下文窗口1,048,576 tokens(1M)
输入模态文本、图像、视频(原生视觉理解)
训练精度MXFP4 权重 + MXFP8 激活(量化感知设计)
扩展效率相较 K2 提升约 2.5 倍
长上下文解码KDA 在 1M token 下解码速度提升 6.3 倍
技术组件作用
Kimi Delta Attention(KDA)3:1 线性/全注意力交替,KV 缓存内存减少 75%,百万 token 解码 6.3× 加速
Attention Residuals(AttnRes)跨深度选择性检索,约 25% 训练效率提升
Quantile Balancing从路由器得分分位数推导专家分配,消除启发式超参
Per-Head Muon针对每个注意力头独立优化,大规模训练更自适应
Sigmoid Tanh Unit(SiTU)改进激活函数控制
Gated MLA提升注意力选择性

开放权重(Open Weights)vs 开源(Open Source):K3 属于哪一类?

这是 7 月 27 日发布前必须厘清的概念:open weightsopen source 并非同义词。

维度开放权重(Open Weights)完全开源(Open Source)
模型权重✅ 可下载✅ 可下载
训练代码❌ 通常不公开✅ 公开
训练数据❌ 通常不公开✅ 或至少公开清单
微调 / 自部署✅ 允许✅ 允许
协议示例修改版 MIT、Llama LicenseApache 2.0、MIT(含代码)
Kimi K3✅ 7/27 起属于此类❌ 训练细节未完全公开

K3 将于 7 月 27 日以修改版 MIT 协议开放完整权重——你可以下载、微调、自部署,但训练代码与数据并未完全公开。社区 r/LocalLLaMA 与 Hacker News 讨论中,多数开发者将此视为「开放权重里程碑」而非「Llama 式全栈开源」。对需要数据驻留与模型可控性的企业,开放权重已足够;对需要复现训练流程的研究机构,仍需等待更多技术报告细节。

03

Benchmark 跑分:AA Index 57.1 排名第三,赢在哪、输在哪?

以下为 Artificial Analysis 与月之暗面自报核心基准(不同模型使用各自推理 harness:K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。月之暗面在官方博客中诚实承认短板——不回避 GDPval、DeepSWE 等落后项。

综合排名(AA Index v4.1)分数排名
Claude Fable 559.9#1
GPT-5.6 Sol58.9#2
Kimi K357.1#3 / 189

✅ K3 领先的赛道

基准测试Kimi K3Claude Fable 5GPT-5.6 Sol
Frontend Code Arena#1
Automation Bench30.829.129.7
SpreadsheetBench 2领先
BrowseComp91.288.090.4
SWE Marathon42.035.039.0
Terminal Bench 2.188.384.688.8
Program Bench77.876.877.6
FrontierSWE81.286.671.3

❌ K3 落后的赛道

基准测试Kimi K3Claude Fable 5GPT-5.6 Sol备注
GDPval v2 Elo1668–168717601748通用对话质量仍有差距
DeepSWE67.570.073.0复杂 Repo 级修 Bug
幻觉率较 K2.6 上升官方承认需持续优化
输出 polish / 方差弱于 Fable / Sol领先领先长文本一致性与风格稳定性

官方诚实表态:月之暗面在 kimi.com/en/blog/kimi-k3 中明确列出 K3 的不足——不回避 DeepSWE、GDPval 等落后项,也不夸大 Frontend Code Arena 等优势。建议作方向性参考,生产选型务必结合自有评测集验证。

开源/开放权重与闭源前沿的智能差距,已从 2024 年的 10+ 分缩小到 2026 年的 2–3 分。K3 不是 Fable 5 killer,但以约 1/3 成本提供了接近前沿的能力——闭源溢价正在经受考验。

04

API 定价与六步操作清单:从接入到 7/27 发布日

计费项Kimi K3Claude Sonnet 5DeepSeek V4 Pro
输入($/M)$3.00$3.00$1.74
缓存命中输入$0.30$0.145
输出($/M)$15.00$15.00$3.48
上下文1M200K128K

K3 标准价与 Claude Sonnet 5 持平($3/$15),对齐西方质量档定价,但上下文窗口为其 5 倍。Artificial Analysis 测算:AA 单次任务成本 $0.94,比 Sol 低 9.4%,比 Fable 5 低 65.8%。编程场景缓存命中率超 90%+,实际有效输入成本可降至约 $0.55/M。

六步操作清单(API 接入 + 7/27 发布日准备):

01

API Key 接入:platform.kimi.ai 创建密钥,base_url 设为 https://api.moonshot.ai/v1,模型 ID kimi-k3。或在 kimi.com 注册免费账号直接使用 App / Work / Code。

02

缓存优化:编程 Agent 工作流复用 system prompt 与工具定义前缀,Mooncake 分推理架构下缓存命中率可达 90%+,有效输入价降至 $0.30/M。

03

7/27 检查 HF 文件:确认 Hugging Face 仓库已上传完整权重分片、config.json、tokenizer 与 LICENSE(修改版 MIT 条款)。

04

量化版本验证:下载 MXFP4 / NVFP4 量化版(4-bit 约 1.4TB),对照官方 tech report 核对参数量与架构描述。

05

推理框架部署:使用 vLLM(KDA + prefix caching)或 SGLang 启动服务,参考官方 Day-0 命令;Ollama / GGUF 版本预计随后跟进。

06

硬件与长上下文复测:确认最低 64+ 加速卡超节点配置;在 1M token 场景下复测解码延迟与 KDA 6.3× 加速是否达标。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "帮我分析这段代码..."}]
)
05

7/27 权重发布、自部署方案与行业格局

📦 7 月 27 日发布内容

月之暗面在官方 WeChat 公告明确 7 月 27 日开放完整模型权重。届时将包含:

HF

Hugging Face 完整权重(修改版 MIT 协议)

📄

技术报告(Tech Report)——架构、训练与 benchmark 细节

vLLM Day-0 支持——KDA 内核 + prefix caching

🔜

Ollama / GGUF 量化版——社区预计随后数日内跟进

🖥 自部署硬件要求与三种适用场景

配置项要求参考
4-bit 量化存储约 1.4TBMXFP4 / NVFP4 版本
生产推理64+ 加速卡超节点与 K2.7 Code INT4 ~577GB 对比,K3 规模更大
普通团队API 是正确选择Northflank、VentureBeat 等均建议多数场景走 API
自部署场景是否推荐原因
数据驻留 / 合规✅ 7/27 后可行权重本地运行,数据不出境
领域微调✅ 7/27 后可行开放权重允许 fine-tuning
超高调用量⚠️ 需精算64+ 卡 CAPEX vs API OPEX,需自有 ROI 模型

🌏 行业格局:中国 AI 浪潮与闭源溢价考验

2026 年 7 月,中国 AI 开源/开放权重生态迎来密集发布潮:GLM-5.2DeepSeek V4 ProMiniMax 等相继亮相。月之暗面从 DeepSeek R1 冲击后的排名第 7 位,经由 K2 → K2.5 → K3 三连跳完成 comeback。WAIC 2026 timing 与 7 月 1 日 Anthropic 短暂限制 Fable 5 外国用户访问(已恢复)形成微妙的地缘政治背景——开放权重正在缩小与闭源前沿的 2–3 分差距,闭源 API 的「质量溢价」是否还能维持 3–5 倍价差,成为接下来季度的核心问题。

A

2.8T / #1 开放权重:迄今最大可下载开放权重,超越 DeepSeek V4 Pro(1.6T)近 75%。

B

57.1 / 2.8 分:AA Index v4.1 排名第三(3/189),与 Fable 5(59.9)差距仅 2.8 分,开源/闭源智能鸿沟缩至 2–3 分。

C

$0.94 / 65.8%:AA 单次任务成本 $0.94,比 Fable 5 低 65.8%,比 Sol 低 9.4%——约 1/3 成本接近前沿智能。

总结:Kimi K3 开放权重发布是 2026 年 AI 领域最重要的里程碑之一。它不是 Fable 5 killer,但在编程长任务、文档理解与 1M 上下文等关键赛道具备竞争力,且以修改版 MIT 承诺完整权重下载——代表中国 AI 从「以低价换市场」转向「挑战智能前沿」。关注时间节点:7 月 22 日(本文)→ 7 月 27 日 Hugging Face 权重 + tech report。

摊开替代方案:仅靠个人 Mac 跑 Kimi Code / API Agent 压测 受休眠与网络波动影响,长上下文任务易中断;等待 7/27 自部署 需 64+ 卡超节点,中小团队短期不可行;完全依赖单一闭源 API 则在上下文长度与成本上难以覆盖 K3 的 1M flat 定价优势。对需要 iOS CI/CD、Kimi Code 常驻与 AI Agent 7×24 自动化生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、按天/周/月弹性下单。详情见 定价页帮助中心,或 直接下单

数据截至:2026 年 7 月 22 日 · 来源:kimi.com/en/blog/kimi-k3platform.kimi.ai、Artificial Analysis、VentureBeat、Northflank、r/LocalLLaMA、Hacker News