从 Grok 4.5 到 4.6、4.7:xAI 今年夏天节奏有多快?
马斯克 7 月 28 日在 X 上回复 Vercel CEO Guillermo Rauch 时透露,xAI 将于 8 月 7 日前后发布参数规模达 1.5 万亿的 Grok 4.6,随后几周内还会推出 2.1 万亿参数的 Grok 4.7。这距离上一代 Grok 4.5 发布仅一个月,意味着 xAI 在今年夏天要连续推出三款前沿模型。目前官方尚未公布具体基准分数和定价,以下信息基于马斯克本人的公开表态及行业报道整理。
| 日期 | 里程碑 | 关键内容 |
|---|---|---|
| 2026-07-08 | Grok 4.5 发布 | 专为编程与智能体任务打造,与 Cursor 合作、使用真实开发者会话数据训练,50 万 token 上下文,定价 $2/$6 每百万 token |
| 2026-07-16 | Kimi K3 托管上线 | 月之暗面 Kimi K3 以托管服务形式上线 |
| 2026-07-26 | Kimi K3 全面开源 | 2.8 万亿参数、100 万 token 上下文,刷新开源模型规模纪录 |
| 2026-07-28 | 马斯克公开路线图 | 在回复 Rauch 的帖子中首次公开 Grok 4.6/4.7 时间表——本文主要信息来源 |
| ~2026-08-07 | Grok 4.6(目标) | 1.5 万亿参数,重点在 SFT 与 RL 升级,非单纯堆参数 |
| ~2026-08 末至 9 月初 | Grok 4.7(预估) | 2.1 万亿参数,马斯克称其全面优于 4.6 但推理稍慢、token 效率更高 |
需要提醒的是,马斯克给出的时间表历来存在弹性——业内常称之为「Musk time」,实际发布日期比预告晚几天到两周并不罕见,发布前建议以 xAI 官方账号或官网公告为准。
把马斯克推文当作官方公告:目前唯一信息源是 X 上的一条回复贴,xAI 官方博客和产品页尚未同步公告。
认为 1.5 万亿参数等于能力碾压:马斯克特意强调升级重点在 SFT & RL,而非参数规模本身。
忽视 Kimi K3 的竞争冲击:Grok 4.6 目标日期卡在 K3 全面开源后约 10 天,行业普遍解读为竞争压力驱动加速。
混淆 Grok 4.6 与 4.7 定位:4.6 偏后训练精修,4.7 更大但更慢、token 效率更高——两款 SKU 分工不同。
忽视 xAI 内容安全争议:7 月 xAI 首次就 AI 生成深度伪造内容起诉用户,企业选型须纳入合规风险评估。
核心数据一览:Grok 系列 vs 同期竞品横向对比
| 模型 | 发布/目标时间 | 参数规模 | 上下文 | 定价(输入/输出,每百万 token) | 状态 |
|---|---|---|---|---|---|
| Grok 4.5 | 2026-07-08 | 未公开 | 50 万 token | $2 / $6 | 已发布 |
| Grok 4.6(预告) | ~2026-08-07 | 1.5 万亿 | 未公开 | 未公开 | 官方预告,未发布 |
| Grok 4.7(预告) | ~8 月末-9 月初 | 2.1 万亿 | 未公开 | 未公开 | 官方预告,未发布 |
| Kimi K3 | 2026-07-26 开源 | 2.8 万亿(MoE) | 100 万 token | $0.30/$3 输入,$15 输出 | 已发布 |
| Claude Fable 5.1(传闻) | 传闻 8 月 | 未公开 | 未公开 | 传闻 $10/$50 | Anthropic 未确认 |
| GPT-5.6 Sol | 2026-06 | 未公开 | 未公开 | 未公开 | 已发布 |
注:Grok 4.6/4.7 参数规模、定价、基准分数均为厂商/马斯克自述,目前均未有第三方独立评测数据,表中「官方预告」信息务必以正式发布为准。
Kimi K3 在 Frontend Code Arena 编程榜单以 1679 分登顶,成为首个超越所有闭源模型的开源模型;马斯克本人也在 K3 相关评测下留言称「令人印象深刻」。
深度拆解:这次升级的重点不是「更大」,而是「更会学」
先说结论:Grok 4.6 的核心叙事是后训练(SFT + RL)精修,而非单纯参数堆量。
监督微调(SFT)是用人工标注或精选的高质量样本去纠正模型的输出习惯;强化学习(RL)则是用奖励信号让模型在真实任务链路中学会「怎么做才对」,尤其是多步骤的智能体任务。马斯克特意强调 Grok 4.6 的升级重点在「SFT & RL」而非参数规模本身,这与 Grok 4.5 的打法是延续的——Grok 4.5 当时凭借与 Cursor 合作获取的真实开发者会话数据,在保持较小输出 token 消耗的情况下拿到了 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成绩,处理同类任务所用的输出 token 数量远低于 Claude Opus 4.8(约 1.9 万 token 对 6.7 万 token)。
Grok 4.6 的 1.5 万亿参数相比 Grok 4.5 是明显的规模跃升,但马斯克没有回避「参数不是唯一变量」——他随后补充说 Grok 4.7 会更大(2.1 万亿)却「推理稍慢」,暗示 xAI 内部很清楚参数规模和推理速度之间存在权衡,未来会用两款不同定位的模型分别满足「更强」和「更快」的需求。
7 月 28 日——马斯克发布 Grok 4.6/4.7 路线图的同一天,OpenAI、Anthropic 等公司 1200 余名员工联署了「Pacing the Frontier」公开信,呼吁美国政府建立主动放缓前沿 AI 发展的治理工具。xAI 并未出现在签署名单中,这种「一边呼吁减速、一边加速迭代」的行业分裂现象本身就是值得持续观察的背景。
发布前 6 步:如何跟踪 Grok 4.6 并做好准备
关注 xAI 官方渠道:订阅 x.ai 博客、@xai 与 @elonmusk X 账号,以官方公告为准,勿仅依赖二手报道。
预留「Musk time」缓冲:历史经验表明实际发布可能比「约 8 月 7 日」晚几天到两周,项目排期勿卡死单日。
对比 Grok 4.5 基线:记录当前 API 定价($2/$6 每百万 token)与 SWE-Bench Pro 64.7% 等已公开基准,作为 4.6 发布后的对照标尺。
同步评估 Kimi K3 与 Claude Fable 5.1:8 月可能是扎堆发布月,勿在单一厂商官宣前锁定长期合同。
用真实任务测 token 效率:Grok 4.5 的核心优势之一是输出 token 更少,发布后用自有代码库跑一轮 SWE/Agent 任务对比总成本。
纳入安全合规审查:xAI 7 月首次就 CSAM 深度伪造起诉用户,企业接入前须评估内容安全策略与审计要求。
争议点、三条硬核数据与 2026 年 8 月发布密度
如果马斯克的时间表成立,Grok 4.6、Grok 4.7 将与传闻中的 Claude Fable 5.1 在同一个月内相继登场,叠加 7 月已经开源的 Kimi K3 带来的冲击,2026 年 8 月很可能成为大模型发布密度最高的月份之一。对开发者和企业用户而言,选型窗口期极短——上一代旗舰可能刚上线一个月就要面对新一代竞品,token 效率与真实任务成本(而非单纯的参数规模或跑分)会是更实际的决策依据。
1.5 万亿 / Grok 4.6 参数:马斯克 7 月 28 日 X 帖子自述,尚无第三方验证或官方模型卡。
4.2× / token 效率差距:Grok 4.5 在 SWE-Bench Pro 任务中约 1.9 万输出 token,Claude Opus 4.8 约 6.7 万——后训练精修带来的效率优势是 4.5 已验证的能力。
1679 分 / Kimi K3 Frontend Code Arena:K3 登顶该编程榜单,成为首个超越所有闭源模型的开源模型,Artificial Analysis 智能指数全球第三。
注意:基准分数与 Grok 4.6 定价目前全部空白;xAI 7 月对一名用户提起诉讼,指控其利用 Grok 绕过安全限制生成 CSAM——企业选型须纳入安全合规维度。
摊开替代方案:在个人 Mac 上跑 Agent 评测与多模型 A/B 测试受休眠与网络波动影响,长上下文任务易中断;完全依赖云端 API 做生产级 CI则在 8 月密集发布期面临频繁迁移成本;等待企业 GPU 集群审批往往赶不上模型迭代节奏。对需要 iOS CI/CD、本地模型推理与 AI Agent 7×24 自动化生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、按天/周/月弹性下单。详见 定价页、帮助中心,或 直接下单。
数据截至:2026 年 7 月 30 日 · 来源:xAI 官方 Grok 4.5 公告、马斯克 2026-07-28 X 帖子、Moonshot AI Kimi K3 发布、Chain Tech Daily / Tron Weekly 等报道、The Verge / TechTimes「Pacing the Frontier」报道、Ars Technica / TechCrunch xAI 安全争议报道