Qwen3.8-Max 发布时间线:从预览版到 GA,两周内节奏有多快?
2026 年 8 月 3 日,阿里巴巴将 Qwen3.8-Max 推进至 GA(全量可用),发布完整跑分表并同步上线「千问办公」Agent 产品。当天阿里港股上涨约 7%、美股上涨约 4.5%。但截至发稿,模型权重尚未登陆 Hugging Face / ModelScope——官网虽已标注「Open-Source」,具体开源协议与确切日期仍只有「下周」(预计 8 月 10 日前后)这一模糊承诺。
| 日期 | 事件 | 关键信息 |
|---|---|---|
| 7 月 16 日 | Kimi K3 发布 | 月之暗面发布 2.8T MoE,主打独立评测与透明技术报告 |
| 7 月 19 日 | Qwen3.8-Max 预览版 | 接入 Token Plan / Qoder / QoderWork,定价为正式价 10%;未公布激活参数与跑分;条款禁止自动化生产调用 |
| 7 月 27 日 | Kimi K3 权重开源 | Hugging Face 上线完整权重,同步开源注意力内核、MoE 通信库等基础设施 |
| 7 月 31 日 | DeepSeek V4-Flash | 参数规模不变,架构与训练优化让智能体/代码基准大幅超过 V4-Pro 预览版 |
| 8 月 3 日 | Qwen3.8-Max GA | 完整跑分表 + 千问办公上线;Arena 文本竞技场第 5(初步) |
| 预计 8 月 10 日前后 | 权重开源(承诺中) | Qwen3.8-Max 与精简版 Qwen3.8-27B 计划登陆 HF / ModelScope,协议条款未公布 |
混淆「已标注开源」与「权重已发布」:qwen.ai 在 GA 当天即打 Open-Source 标签,但仓库、许可证与确切日期均未公开。
把阿里自测跑分当定论:PaperBench、QwenSWEBench、RecreationBench 等多为自建基准,第三方尚未复现 GA 版分数。
忽视预览版透明度缺口:7 月 19 日预览阶段未公开激活参数、model card 与安全评估,多家机构建议勿迁移生产系统。
误读总参数为推理成本:2.4T 为 MoE 总容量,实际激活 950 亿——API 定价更接近千亿级模型,而非 2.4T 稠密模型。
只看榜单不看标注:Arena 文本 1496 分标注为 Preliminary(初步),前 4 名与第 6–8 名均为 Anthropic 模型。
Qwen3.8-Max 核心参数与竞品对比:Kimi K3、DeepSeek V4、Claude 怎么选?
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(每百万 token) | 输入 $2 / 输出 $6;隐式缓存命中 $0.25,显式缓存写入 $2.5、读取 $0.17 |
| 国内定价(官方口径) | 输入 12 元 / 输出 36 元,缓存命中低至 1.5 元 |
| Arena 文本(8 月 1 日快照) | 第 5 名,1496 分(Preliminary);前 8 中唯一非 Anthropic 模型 |
| Arena 视觉 | 第 2 名,仅次于 Claude Fable 5 |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0、Opus 4.8 的 69.2) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
| 模型 | 厂商 | 总/激活参数 | 上下文 | 定价(入/出,$/M) | 权重开源 | 独立第三方评测 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 亿 | 100 万 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T / ~500 亿 | ~104.8 万 | $3 / $15 | 已开源(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Flash | DeepSeek | 同 V4-Pro | 100 万 | 未完整公开 | 已开源 | 9 项智能体/代码基准超 V4-Pro |
| Claude Opus 5 | Anthropic | 未公开 | 100 万 | $5 / $25 | 闭源 | Arena 前列 |
| Claude Fable 5 | Anthropic | 未公开 | 100 万 | $10 / $50 | 闭源 | Arena 文本第 1 |
唯一可比的独立盲测(269 个文件的真实项目架构任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版 80 分——同档位、互有胜负,而非「全面碾压」。K3 优势在已开源与第三方评测;Qwen3.8-Max 优势在更低 API 价与更全多模态。
2.4 万亿参数背后:MoE 架构、推理档位与 Agent 生态卡位
为什么是 MoE + 混合注意力,而不是单纯堆参数? Qwen3.8-Max 将总参数做到 2.4 万亿,实际激活控制在 950 亿——推理成本跟踪激活量而非总量,因此 API 可压到 $2/$6,明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)。这是用架构效率换价格竞争力的路线,与 DeepSeek V4-Flash「不靠堆参数也能大幅提升智能体能力」形成同一叙事下的两种解法。
reasoning_effort 三档(low / medium / xhigh,默认 xhigh) 让开发者按任务复杂度在速度与深度间取舍,可通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调用——与当前主流 Agent 模型设计一致。
长程自主任务是本次核心卖点,但验证方式需审慎看待。 阿里案例包括 16 天无人工介入的自主编码、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli,但并非完整可复现的第三方审计。
生态一体化: API 同时兼容 OpenAI 与 Anthropic 协议,可接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链;「千问办公」对标腾讯 WorkBuddy、Moonshot Kimi Work。
提示:表中带「阿里自测」的数据均来自官方发布材料,尚无 Artificial Analysis、Arena 官方团队等对 GA 版的独立复现结果。
六步接入与评估清单:从 API 试用到生产迁移前该核对什么?
开通 QwenCloud API:在阿里云 Model Studio 创建密钥,确认兼容模式 Base URL 与模型 ID qwen3.8-max(以官方文档为准)。
选择接口协议:现有 OpenAI SDK 或 Anthropic 兼容客户端通常只需替换 base URL 与 API Key,便于与 Claude Code / OpenClaw 等并存 A/B。
配置 reasoning 档位:轻量任务用 low/medium 控成本,复杂 Agent 用 xhigh;通过 enable_thinking 或 reasoning.effort 显式指定。
启用缓存策略:复用 system prompt 与工具定义前缀,利用隐式/显式缓存降低输入成本(命中价 $0.25/M 或国内 1.5 元/M 档)。
自有 workload A/B:勿仅凭发布日跑分表决策;用真实代码库、长上下文与多模态任务与 Kimi K3 / DeepSeek V4 对比延迟与总成本。
等待权重开源后再定私有化路线:满血 2.4T 需数据中心级多节点;普通团队更现实目标是同期承诺的 Qwen3.8-27B。Agent 7×24 常驻宿主见 帮助中心。
from openai import OpenAI
client = OpenAI(
api_key="your_dashscope_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "分析这段 Swift 模块的依赖关系..."}],
extra_body={"enable_thinking": True}
)行业背景、三条硬核数据与「开源」争议怎么读
2026 年是万亿参数模型的「扩产年」,但 7 月 31 日 DeepSeek V4-Flash 已证明架构效率可逆转纯参数竞赛叙事。阿里罕见地承诺开源 Max 级权重,与 Kimi K3、DeepSeek 一起构成国产头部「集体转向开放权重」格局;千问亦已通过 Apple Intelligence 国行合作进入数亿部 iPhone 的系统级 AI 能力(经压缩后本地运行)。同一周,OpenAI / Anthropic 披露 Agent 安全评测失控事件,白宫 8 月 4 日召集巨头商讨自愿性网络安全测试框架——中美 AI 叙事形成鲜明对照。
2.4T / 950 亿激活:MoE「大容量、低激活」设计,API $2/$6 显著低于 Opus 5 与 Fable 5 标价。
1496 / Arena 文本第 5(Preliminary):前 8 名中唯一非 Anthropic 模型,但榜单状态仍为初步,非最终定论。
83 vs 80 / 独立盲测:同组 269 文件架构任务,Kimi K3 83 分、Qwen 预览版 80 分——差距很小,属同档位对决。
注意:官网 Open-Source 标签已上线,权重、许可证与确切开源日期待官方「下周」公告。跑分表脚注曾暗示竞品 Fable 5 可能涉及 fallback,但阿里自身测试方法论同样未公开到可第三方复现程度。
摊开替代方案:完全依赖闭源 API在 Agent 长程任务上成本与可控性难兼顾;等待满血 2.4T 自部署需多节点数据中心,中小团队短期不现实;在个人 Mac 上 7×24 跑 OpenClaw / Qwen Code Agent则受休眠、网络与并发队列影响。对需要 iOS CI/CD、多模型 A/B 与 AI Agent 自动化生产环境,KVMNODE 独占 Mac Mini M4 云端租赁通常是更优解:Apple Silicon 统一内存、开放 sudo、多区节点、按天/周/月弹性下单。详见 定价页、订购入口。
数据截至:2026 年 8 月 4 日 · 来源:阿里云官方公告与定价页、Arena.ai 公开排行榜(8 月 1 日快照)、Apidog / Yotta Labs / TechNode 等独立分析、Apple Intelligence 国行相关报道