OPUS 5
半價旗艦
K3 蒸餾門.

Claude Opus 5 發布 Kimi K3 蒸餾門 自稱 Claude AI 週報 2026

導語:本週 AI 圈兩件大事表面無關,實則都指向同一主題——性價比與模型能力的真實來源痛點:開發者要在「Anthropic 新主力 Opus 5」與「月之暗面 K3 開源低價」之間做選型,卻被白宮蒸餾指控和 K3「自稱 Claude」的技術證據搞得一頭霧水。結論:Opus 5 用半價逼近 Fable 5 是合規用戶的務實升級;K3 爭議尚無定論,但 Greenblatt 的部署 ID 外洩是目前最有技術含量的間接證據。結構預告:Opus 5 解讀 → Opus vs Fable 對比表 → K3 蒸餾門時間軸 → 「自稱 Claude」技術分析 → 5 步 Mac 開發者選型 → 產業洞察 → FAQ。

30 秒讀懂 · TL;DR

Opus 57/24 發布 · Max 預設 · $5/$25 每百萬 tokens · CursorBench 與 Fable 5 差 0.5%
K37/16 發布 · 2.8T 參數 · 7/27 權重開源 · 白宮 7/22 指控蒸餾
硬核證據K3 自稱 Claude · 吐出 claude-opus-4-5-20250929 等內部 ID
專家反駁Fable 5 公開僅 7/1 起 · 到 K3 發布僅 2 週 · 深度蒸餾時間不夠

1. 痛點拆解:為什麼這兩件事同時洗版

  1. 旗艦太貴,日常模型不夠強。 Fable 5 能力頂尖但 $10/$50 定價 + 30 天資料留存門檻,Pro/Max 用戶一直在等「半價旗艦」——Opus 5 就是 Anthropic 的答案。
  2. 開源追平閉源,但來源成疑。 K3 跑分僅次 Fable 5 / GPT-5.6 Sol,價格卻低一個數量級;當白宮下場指控「產業級蒸餾」,開發者無法忽視合規與供應鏈風險。
  3. 政治喊話 vs 技術證據。 Kratsios 的 X 貼文缺乏公開證據鏈;真正讓社群坐直的是 Greenblatt 發現 K3 比 Claude 自己還準確地報出內部部署版本號——這是可複現的技術訊號,不是外交辭令。
  4. Mac 開發者路由困境。 Cursor / OpenClaw 多模型架構下,「合規 Claude API + 低價開源 fallback」的組合該怎麼配?參考 OpenRouter 多模型接入教學K3 開源權重倒數,本週事件直接衝擊路由表。

2. Claude Opus 5 發布:不是旗艦,但可能是最值得用的 Claude

2026 年 7 月 24 日,Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),並同步將其設為 Claude Max 預設模型,Claude Pro 用戶也可使用目前最強版本。定價與 Opus 4.8 完全相同:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens;上下文視窗 100 萬 tokens(預設且唯一檔位);最大輸出 128K tokens;Thinking 預設開啟。

2.1 關鍵基準:效能跳級,成本不變

基準Opus 5 表現對比說明
Frontier-Bench v0.1超越所有模型Opus 4.8 的 2 倍以上,單任務成本更低
CursorBench 3.2(max effort)與 Fable 5 峰值差 0.5%成本僅為 Fable 5 的 一半
ARC-AGI 3次優模型的 3 倍新穎問題解決能力躍升
OSWorld 2.0優於 Fable 5 最佳成績成本不到 Fable 5 的 1/3
Zapier AutomationBench100% 通過率此前模型均未通過端到端帳戶健康工作流

Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5.」Box 企業客戶實測:資料分析工作流 +11%,盡職調查 +17%,整體準確率 +8%

2.2 安全與資料留存:最對齊的一代,但不搶 Mythos 5 的風頭

Opus 5 是 Anthropic 迄今為止最對齊的模型——欺騙行為發生率最低,最不容易被誘導濫用。但在網路安全攻擊、生物安全等高風險雙用途能力上,Anthropic 刻意 未讓 Opus 5 衝到最前——該位置仍由受限發行的 Mythos 5 佔據。Opus 5 的網路安全分類器觸發頻率比 Fable 5 低約 85%,可用於原始碼級漏洞發現,但仍屏蔽二進位漏洞掃描、滲透測試、exploit 生成。

容易被忽略的細節:Opus 5 預設存取不強制資料留存。Fable 5 / Mythos 5 要求接受 30 天資料留存政策——對合規敏感的企業場景,Opus 5 可能是比 Fable 5 更實用的選擇。

3. Opus 5 vs Fable 5:決策對比表

維度Claude Opus 5Claude Fable 5
輸入 / 輸出定價$5 / $25 每百萬 tokens$10 / $50
CursorBench 3.2 峰值與 Fable 5 差 0.5%當前編程基準天花板
Claude Max 預設(7/24 起)
資料留存預設不要求需接受 30 天留存
雙用途風險能力刻意未達前沿更強(Mythos 5 受限發行)
適用場景日常編碼、Agent、企業合規工作流極限 benchmark、需最強 frontier 的任務

4. Kimi K3「蒸餾門」:白宮下場,專家質疑時間線

月之暗面於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 兆,稀疏 MoE(896 專家激活 16 個,約等效 500 億激活參數),100 萬 token 上下文 + 原生視覺理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整權重承諾 7 月 27 日 放出——爭議爆發時外部尚無法獨立驗證。

4.1 白宮指控與 Anthropic 前科

2026 年 7 月 22–23 日,白宮 OSTP 主任 Michael Kratsios 在 X 上指控月之暗面「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提及涉嫌使用未獲出口許可的 Nvidia GB300 晶片。財政部長 Scott Bessent 附和稱在多個中國模型上發現美國大模型「浮水印」,但未公開具體定義。

這並非空穴來風:2026 年 2 月 Anthropic 已公開指控月之暗面、DeepSeek、MiniMax,稱檢測到超過 340 萬次 異常 API 互動,「明顯偏離正常使用模式,反映刻意的能力提取」。

4.2 獨立專家:兩週內完成深度蒸餾不現實

"Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks." — Braden Hancock,Snorkel AI 聯合創辦人

Allen Institute 研究員 Nathan Lambert 補充:隨著中國模型逼近前沿,簡單監督微調式蒸餾的邊際收益正在變小,真正拉開差距的是強化學習訓練——若蒸餾真這麼好用,所有追趕者早就靠蒸餾追平了。

5. 最硬核證據:K3 會「自稱是 Claude」並吐出內部部署 ID

Redwood Research 首席科學家 Ryan Greenblatt(GitHub:rgreenblatt/which_claude_is_k3)在 7 月 24 日前後發布統計分析:Kimi K3 被問及「你是誰」時,異常高頻地自稱是 Claude,甚至會吐出 Claude 官方內部部署 ID 字串:

claude-opus-4-5-20250929 claude-sonnet-4-5-20250929

真正的 Claude 模型自己都不會這樣準確地報出這個內部版本號——Sonnet 4.5 只會簡單說「我是 Claude Sonnet 4.5」,Opus 4.5 甚至可能報錯或不報版本號。

Greenblatt 的解讀:模型說出「教師模型」的部署中繼資料,比教師模型自己說得還準,很難用「模仿對話風格」解釋,更可能指向訓練資料裡混入了帶有部署中繼資料標註的 Claude 資料(如 API 日誌或打標合成資料)。K3 自稱的身份鎖定在「Claude 4.5 時代」(2025 年末),K2 則指向更早的 Sonnet 4——呈現「逐代追新」規律。

重要澄清:Greenblatt 強調這不能直接證明蒸餾發生——身份混淆也可能來自資料污染或系統提示詞外洩。但結合 Anthropic 2 月指控,這是迄今最接地氣的技術證據,而不只是政治喊話。

6. 5 步落地:Mac 開發者如何調整模型路由

  1. 評估合規優先級。 若工作涉及企業資料、出口管制敏感場景,Opus 5 的無強制留存 + 官方 API 鏈路優先於 K3 等來源未完全澄清的開源模型。
  2. 更新 Cursor / OpenClaw 主模型。 Claude Max 用戶將預設切到 Opus 5;在 Cursor 中可顯式指定 claude-opus-5,對比 Fable 5 在實際專案上的 cost-per-task。
  3. 配置 OpenRouter Fallback 鏈。 主力 Opus 5 → 限流時 fallback DeepSeek V4 Flash 或 Kimi K3 API(若可接受來源風險)→ 免費層調試用 OpenRouter 免費模型
  4. 標記 7 月 27 日 K3 權重發布。 完整權重放出後,在隔離環境(非生產 Mac 節點)跑獨立 benchmark 與身份自認測試,複現 Greenblatt 統計。
  5. 分離壓測與日常開發。 長上下文 Agent 壓測、多模型 A/B 不要占滿主力 MacBook 統一記憶體——丟到遠端 Mac 節點做隔離驗收(見下文收束)。

7. 時間線速覽

日期事件
2026-02Anthropic 首次指控月之暗面/DeepSeek/MiniMax「產業級蒸餾攻擊」
2026-07-01Claude Fable 5 面向公眾正式可用
2026-07-16Kimi K3 API/產品正式發布
2026-07-22/23白宮 Kratsios 公開指控蒸餾 + 違規晶片
2026-07-24Claude Opus 5 發布;Greenblatt 發布 K3 身份自認分析
2026-07-27(計劃)Kimi K3 完整權重開源

8. 深度洞察:性價比戰爭與「能力來源」的公開攤牌

把 Opus 5 與 K3 爭議連起來看,2026 年下半年的 LLM 競爭已進入新階段:Frontier 能力正在商品化。Anthropic 用「半價逼近旗艦」回應市場對性價比的訴求——這不是降價清庫存,而是 deliberate 的產品線重構:Fable 5 守極限 frontier,Opus 5 接管日常主力,Mythos 5 鎖雙用途風險能力。

月之暗面則用「開源 + 低價 + 少拒答」衝擊同一市場。K3 爭議的本質,是行業第一次公開追問:當你的模型在 benchmark 上逼近 frontier、價格卻只有十分之一時,怎麼區分「 genuinely better engineering」和「 quietly riding on someone else's model」?

對 Mac 開發者而言,這不只是吃瓜。Cursor 的預設模型切換、OpenClaw 的 fallback 鏈、OpenRouter 的路由表——都會在接下來 30 天內因 Opus 5 預設化與 K3 權重開源而重寫。Greenblatt 的「部署 ID 外洩」角度之所以 valuable,是因為它提供了一個可複現、可量化的檢測思路:不必等政府調查,開發者自己就能跑 identity probe 測試。

社群 r/LocalLLaMA 的三派聲音同樣值得聽:歡呼「開源與閉源差距縮短到 days not months」;調侃「2.8T 參數沒人本地跑得動」;務實派認為 K3 真正的賣點是價格和無審查,而不是「打敗 Fable 5」。在 7 月 27 日權重放出前,所有架構聲明都只是「官方自評 + 外部猜測」。若要在遠端 Mac 節點跑 K3 驗證,統一記憶體頻寬規劃比盲目堆本地 GPU 更關鍵——2.8T MoE 即使稀疏激活,也需要專用伺服器級硬體才能做有意義的 benchmark。

9. 常見問題 FAQ

Q:Claude Opus 5 比 Claude Fable 5 便宜多少?
A:Token 單價約為 Fable 5 的一半($5/$25 vs 約 $10/$50),CursorBench 峰值成績相差不到 1%。

Q:Claude Opus 5 現在是 Claude Max 的預設模型嗎?
A:是的,7 月 24 日發布當天起成為 Claude Max 預設模型,也是 Claude Pro 最強可用版本。

Q:Kimi K3 真的蒸餾了 Claude 嗎?
A:截至本文發布仍屬未證實爭議。白宮缺乏公開證據;專家質疑兩週時間線;Greenblatt 的「自稱 Claude + 內部 ID」是目前最強技術間接證據。

Q:Kimi K3 完整權重什麼時候能下載?
A:官方承諾 2026 年 7 月 27 日,發布時尚未放出。

Q:為什麼 Kimi K3 會自稱是 Claude?
A:統計上 K3 身份自認行為異常偏向 Claude,並吐出內部部署 ID——可能指向訓練資料混入了帶中繼資料標註的 Claude 樣本,但不能直接等同「蒸餾已證實」。

10. 收束:合規 API 走 Opus 5,壓測與開源驗證隔離到 Mac 節點

在 Windows/Linux 雲主機上接 Claude API 或 Kimi K3,日常編碼都能跑。但若你要在 Mac 上跑 Cursor + Opus 5 長會話 Agent、OpenClaw 多模型 fallback 壓測,或在隔離環境複現 K3 身份自認測試,Apple Silicon 統一記憶體 + Metal 工具鏈 + 24/7 穩定運行仍是 friction 最小的路徑。

務實分工:主力開發機走 Opus 5 / OpenRouter 合規路由;把 Agent 壓測、K3 權重本地 benchmark、長上下文 batch 丟到 MACGPU 遠端 Mac mini M4 節點——按需租用、SSH 隔離,主力機不被 2.8T 參數實驗拖垮。在「半價旗艦 vs 來源成疑的開源 frontier」並存的本週,隔離驗收比 all-in 單一方案更可控。