claude-opus-4-5-20250929 等內部部署 ID。本文涵蓋 Claude Opus 5 vs Fable 5 跑分與定價、Kimi K3 為何自認 Claude、月之暗面是否偷師 Claude 的時程質疑、六步開發者路由指南,以及 7 月 27 日權重公開的影響。另見 Kimi K3 開源權重指南與 OpenRouter API 路由指南。Claude Opus 5 發佈:Fable 5 半價,Claude Max 新預設
Anthropic 於 2026 年 7 月 24 日(美國太平洋時間)正式釋出 Claude Opus 5,並立即設為 Claude Max 預設模型——Claude Pro 訂閱者可用的最強日常模型。模型 ID:claude-opus-5。已上線 Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry。定價維持 輸入 $5/M、輸出 $25/M,與 Opus 4.8 相同,但 Agent、程式設計與研究場景效能全面躍升。
定位很明確:Opus 5 不是旗艦,而是 Anthropic 希望開發者真正拿來用的日常模型——接近 Fable 級智能,卻不必付 Fable 價格,也無需接受 Fable 的 30 天資料留存政策。
| 規格 | Claude Opus 5 |
|---|---|
| 發佈日期 | 2026 年 7 月 24 日 |
| 定價 | 輸入 $5/M · 輸出 $25/M(與 Opus 4.8 相同) |
| 上下文視窗 | 1M tokens(預設且唯一檔位) |
| 最大輸出 | 128K tokens |
| 推理模式 | 預設開啟 Thinking;Effort 參數控制深度 |
| 資料留存 | 無強制留存(對比 Fable 5 / Mythos 5 可選 30 天留存) |
| 快速模式 | 約 2.5× 速度,2× 價格(與 Opus 4.8 相同) |
跑分亮點(Anthropic 官方):
Frontier-Bench v0.1:超越所有模型;軟體工程任務成本更低,效能達 Opus 4.8 的 2 倍以上。
CursorBench 3.2:max effort 下與 Fable 5 峰值差距 0.5% 以內,成本約 一半。high / xhigh / max 檔位性價比最佳。
ARC-AGI 3:新問題求解能力為次佳模型的 3 倍。
OSWorld 2.0:以不足 Fable 5 最佳分數 三分之一 的成本超越其紀錄。
Zapier AutomationBench:端到端帳戶健康工作流 100% 通過——此前模型均為 0%。
研究 / 生命科學:光譜至結構推理 +10.2 分;蛋白變異功能預測 +7.7 分。Box 回報整體準確率 +8%、資料分析 +11%、盡職調查 +17%。
安全與對齊:Anthropic 自動化行為稽核將 Opus 5 評為迄今對齊度最高的模型——欺騙率最低、最難被誘導濫用、對不可逆操作最安全。Opus 5 刻意不在雙用途網路或生物風險上領先(Mythos 5 保留該檔位)。網路安全分類器介入頻率比 Fable 5 低約 85%——可用於原始碼漏洞發現,但二進位掃描、滲透測試與 exploit 生成仍被阻擋。
Kimi K3 蒸餾爭議:白宮指控與「兩週時程」難題
月之暗面於 2026 年 7 月 16 日推出 Kimi K3——2.8T 參數稀疏 MoE(896 專家、16 啟用)、1M 上下文、原生視覺、基於 Kimi Delta Attention。完整權重預定 7 月 27 日公開。跑分強勁:93.5% GPQA-Diamond、91.2% BrowseComp,僅次 Fable 5 與 GPT-5.6 Sol,價格卻低得多。架構與 API 細節見 Kimi K3 開源權重發佈指南。
六天後,故事從技術競賽轉向地緣政治。
| 日期 | 事件 |
|---|---|
| 2026 年 2 月 | Anthropic 指控 Moonshot、DeepSeek、MiniMax 工業蒸餾;援引 340 萬+ 異常 API 呼叫,請求元資料指向月之暗面高層 |
| 2026 年 7 月 1 日 | Claude Fable 5 全面公開(此前為受限 rollout) |
| 2026 年 7 月 16 日 | Kimi K3 API 與產品上線 |
| 2026 年 7 月 22–23 日 | 白宮 OSTP 主任 Michael Kratsios 指控 Moonshot「大規模、隱密工業蒸餾」+ 經泰國走私未授權 Nvidia GB300 晶片 |
| 2026 年 7 月 23 日 | TechCrunch 刊出專家對蒸餾時程的質疑 |
| 2026 年 7 月 24 日 | Ryan Greenblatt 發佈「K3 自稱 Claude」統計分析 |
| 2026 年 7 月 27 日 | K3 完整權重計畫公開——待第三方獨立驗證 |
7 月 22–23 日,Michael Kratsios(白宮 OSTP)在 X 發文指控 Moonshot 以蒸餾竊取 Anthropic Fable 能力,並指稱經泰國繞道使用出口管制 Nvidia GB300 晶片。財政部長 Scott Bessent 呼應「美國 LLM 浮水印出現在中國模型上」的說法——但未說明具體含義。Moonshot 未回應訓練流程相關詢問,Kratsios 亦未公開證據。
Fable 5 7 月 1 日才全面公開。不可能在兩週內蒸餾那麼多資料、訓練模型並發佈。——Braden Hancock,Laude Institute / Snorkel AI 共同創辦人
TechCrunch 採訪多位獨立研究者,僅從時程角度質疑 Kimi K3 蒸餾爭議。Nathan Lambert(Allen Institute for AI)認為,隨中國實驗室轉向強化學習,蒸餾邊際效益遞減——若蒸餾 alone 能解釋 K3,競爭對手早該複製 GLM 或 K3。Elon Musk 曾作證 xAI 在打造 Grok 時蒸餾 OpenAI 模型,稱此為業界常態。爭議焦點不在「蒸餾是否存在」,而在「正常技術借鑑」與「隱密工業竊取」的界線。
注意:截至 7 月 25 日,K3 完整權重尚未公開。外部研究者無法獨立驗證參數量、架構或 benchmark 重現——這是爭議仍未定論的主因。
Kimi K3 為何自稱 Claude?Greenblatt 的部署 ID 證據
月之暗面是否偷師 Claude 討論中,最具技術含量的角度並非政治 rhetoric,而是行為證據。7 月 24 日前後,Redwood Research 首席科學家 Ryan Greenblatt 發佈交叉熵分析(GitHub:rgreenblatt/which_claude_is_k3),比較各模型對身份提示的回應。
發現:Kimi K3 過度傾向自稱 Claude——且不是模糊說法,有時會輸出 Anthropic 內部部署 ID 字串:
claude-opus-4-5-20250929 claude-sonnet-4-5-20250929
真正的 Claude 模型不會這樣行為。Claude Sonnet 4.5 會說「我是 Claude Sonnet 4.5」;Opus 4.5 要麼略過版本字串,要麼答錯。K3 對部署元資料的再現比教師模型自述更準確——難以用單純對話模仿解釋。
| 模型 | 自報身份訊號 | 鎖定世代 |
|---|---|---|
| Kimi K2 | 指向 Claude Sonnet 4 | 2025 年中 Claude 世代 |
| Kimi K3 | 指向 Claude Opus 4.5 / Sonnet 4.5 部署 ID | 2025 年底「Claude 4.5 世代」——非 Fable / Mythos |
| 真實 Claude 模型 | 僅輸出人類可讀產品名稱 | 現行產品線 |
Greenblatt 解讀:訓練資料很可能包含帶部署元資料標籤的 Claude 輸出——API 日誌或 metadata 標記的合成資料——這是比風格抄襲更難辯解的蒸餾形式。世代模式(K2 → Sonnet 4,K3 → Opus 4.5)顯示每次 Kimi 發版都吸收了當時最新的 Claude 世代。
暗示什麼:訓練於含內部部署字串的 Claude 標籤資料——不只是公開聊天紀錄。
不能證明什麼:Greenblatt 明確表示這不是蒸餾的定論證據——污染、洩漏 system prompt 或公開合成資料集理論上也能造成身份混淆。
為何重要:整起 saga 中首份技術(非政治)證據——比白宮 rhetoric 強,比訓練日誌鐵證弱。
社群解讀(r/LocalLLaMA):開源/閉源差距以「天」計的興奮;2.8T 本地跑不動的玩笑;實用派認為 K3 賣點是價格 + 較少拒答,而非打敗 Fable 5。
合規用語:引用蒸餾指控時請用「據稱」「依 Greenblatt 分析」「報導指出」。身份混淆是證據,不是判決。
開發者六步指南:Opus 5 vs Fable 5 vs Kimi K3 路由
| 模型 | 輸入($/M) | 輸出($/M) | 上下文 | 資料留存 |
|---|---|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 | 1M | 無強制要求 |
| Claude Fable 5 | ~$10.00 | ~$50.00 | 1M | 需 opt-in 30 天留存 |
| Kimi K3 | $3.00 | $15.00 | 1M | Moonshot API 條款 |
| GPT-5.6 Sol | ~$5.00 | ~$15.00 | 400K | OpenAI 條款 |
就 Claude Opus 5 vs Fable 5 而言,CursorBench 差距 0.5%,價格差約 50%。合規敏感工作負載中,Opus 5 無留存預設可能比 Fable 的邊際跑分優勢更重要。可經 OpenRouter 統一帳單跨供應商路由。
六步操作指南:
合規優先評估:若資料留存、出口管制暴露或供應商來源很重要,在 Moonshot 回應蒸餾指控前,Opus 5 無留存政策與 Anthropic 合約優於 K3。Fable 5 需 opt-in 30 天留存。
自有 eval 集對比 Opus 5 與 Fable 5:跑 CursorBench 級程式設計任務與自有 Agent harness。Opus 5 $5/$25 vs Fable ~$10/$50——確認 0.5% 差距對你的工作負載可接受,再付旗艦價。
等 7 月 27 日 K3 權重:Hugging Face 權重落地、第三方重現 benchmark 前,勿將生產路由綁死在 K3 架構宣稱上。API 試用可以;架構依賴決策不行。
自行驗證 Greenblatt 發現:對 K3、Fable 5、Opus 5 跑身份提示,檢查 K3 在你的 system prompt 設定下是否輸出部署 ID。記錄結果供合規團隊審閱。
混合模型路由:日常 coding + Agent → Opus 5;前沿 repo bug → Fable 5;成本敏感 bulk + 1M 上下文 → K3 API;終端機重度 → GPT-5.6 Sol。爭議未決的一週內勿 all-in 單一模型。
追蹤政策動態:關注美國開放權重限制、晶片出口執法、Moonshot 7 月 27 日授權條款。Anthropic 2 月 340 萬次呼叫指控與 7 月白宮升級可能觸發 API ToS 或路由政策變更。
from openai import OpenAI
client = OpenAI(
api_key="your_openrouter_key",
base_url="https://openrouter.ai/api/v1"
)
response = client.chat.completions.create(
model="anthropic/claude-opus-5",
messages=[{"role": "user", "content": "你是誰?僅回覆模型名稱與版本。"}]
)價格戰、三個硬數字,以及 7 月 27 日改變什麼
兩條新聞線指向同一產業轉折:前沿智能正在快速商品化。Anthropic 以不漲 Opus 價格推出 Opus 5,縮小旗艦與日常模型差距。Moonshot 推開放權重、1M flat 上下文與激進 API 定價——隨即被指控搭 Claude 輸出便車。Kimi K3 蒸餾爭議是首個公開引爆點:當有人以零頭成本逼近前沿,究竟是更好的工程,還是借來的智能?
| 情境 | 建議路徑 | 原因 |
|---|---|---|
| 合規敏感企業 | Claude Opus 5 API | 無強制留存;接近 Fable 跑分;Anthropic 合約清晰 |
| 前沿 coding / repo bug | Claude Fable 5 API | FrontierSWE、GDPval v2 領先,成本次要時首選 |
| 成本 + 1M 上下文實驗 | Kimi K3 API(7/27 前)→ 7/27 後自架 | $3/$15 與 1M flat 定價;權重落地前勿全押 |
| 來源未決風險 | 等 7/27 + 第三方稽核 | Greenblatt 證據具暗示性但非定論;權重解鎖外部驗證 |
| 多模型 Agent 生產 | OpenRouter 混合路由 | 單一帳單層;換模型無需重部署基礎設施 |
對開發者:合規與資料留存優先,本週 Opus 5 是輕鬆升級。絕對最低成本且可接受來源風險,等 7 月 27 日 outsiders 能驗證數字後再重評 K3。
0.5% / 50%:Opus 5 在 CursorBench 3.2 max effort 下與 Fable 5 差距 0.5% 以內,每 token 成本約一半($5/$25 vs ~$10/$50)。
340 萬 / 2 週:Anthropic 2 月指控 340 萬+ 異常 API 呼叫;Fable 5 公開至 K3 上線僅約 2 週——時程質疑派核心論點。
2.8T / 7 月 27 日:K3 宣稱 2.8T 參數——迄今最大待公開開放權重;外部驗證是整場蒸餾辯論的關卡。
總結:Opus 5 是 Anthropic 對價格戰的務實回應——接近旗艦 Agent 效能,無 Fable 定價與留存摩擦。K3 蒸餾 saga 在已有 compelling 成本故事上疊加來源疑問。請在自有工作負載驗證、合規需要時跑身份檢查,並把 7 月 27 日視為 Moonshot 宣稱的第一次真實考驗。
個人 Mac 跑多模型 Agent 工作流會受休眠與網路斷線影響,長上下文任務易中斷;等 7/27 自架需要 64+ 加速卡超節點,多數團隊缺硬體;只依賴單一閉源 API 則錯過 K3 的 1M flat 定價優勢。對 iOS CI/CD、Claude Code / Kimi Code 常駐 Agent 與 7×24 AI 生產環境,KVMNODE 獨佔 Mac Mini M4 雲端租用通常是更優主機:Apple Silicon 統一記憶體、開放 sudo、按天/週/月彈性下單。詳見 定價頁、幫助中心,或 直接下單。
數據截至:2026 年 7 月 25 日 · 跑分含 Anthropic 與 Moonshot 自報數字 · 來源:anthropic.com/news/claude-opus-5、TechCrunch、Ryan Greenblatt GitHub(rgreenblatt/which_claude_is_k3)、Moonshot/Kimi 官方部落格、CNBC、The Verge、r/LocalLLaMA