OPUS 5
半價旗艦
K3 蒸餾門.
導語:本週 AI 圈兩件大事表面無關,實則都指向同一主題——性價比與模型能力的真實來源。痛點:開發者要在「Anthropic 新主力 Opus 5」與「月之暗面 K3 開源低價」之間做選型,卻被白宮蒸餾指控和 K3「自稱 Claude」的技術證據搞得一頭霧水。結論:Opus 5 用半價逼近 Fable 5 是合規用戶的務實升級;K3 爭議尚無定論,但 Greenblatt 的部署 ID 外洩是目前最有技術含量的間接證據。結構預告:Opus 5 解讀 → Opus vs Fable 對比表 → K3 蒸餾門時間軸 → 「自稱 Claude」技術分析 → 5 步 Mac 開發者選型 → 產業洞察 → FAQ。
30 秒讀懂 · TL;DR
| Opus 5 | 7/24 發布 · Max 預設 · $5/$25 每百萬 tokens · CursorBench 與 Fable 5 差 0.5% |
| K3 | 7/16 發布 · 2.8T 參數 · 7/27 權重開源 · 白宮 7/22 指控蒸餾 |
| 硬核證據 | K3 自稱 Claude · 吐出 claude-opus-4-5-20250929 等內部 ID |
| 專家反駁 | Fable 5 公開僅 7/1 起 · 到 K3 發布僅 2 週 · 深度蒸餾時間不夠 |
1. 痛點拆解:為什麼這兩件事同時洗版
- 旗艦太貴,日常模型不夠強。 Fable 5 能力頂尖但 $10/$50 定價 + 30 天資料留存門檻,Pro/Max 用戶一直在等「半價旗艦」——Opus 5 就是 Anthropic 的答案。
- 開源追平閉源,但來源成疑。 K3 跑分僅次 Fable 5 / GPT-5.6 Sol,價格卻低一個數量級;當白宮下場指控「產業級蒸餾」,開發者無法忽視合規與供應鏈風險。
- 政治喊話 vs 技術證據。 Kratsios 的 X 貼文缺乏公開證據鏈;真正讓社群坐直的是 Greenblatt 發現 K3 比 Claude 自己還準確地報出內部部署版本號——這是可複現的技術訊號,不是外交辭令。
- Mac 開發者路由困境。 Cursor / OpenClaw 多模型架構下,「合規 Claude API + 低價開源 fallback」的組合該怎麼配?參考 OpenRouter 多模型接入教學 與 K3 開源權重倒數,本週事件直接衝擊路由表。
2. Claude Opus 5 發布:不是旗艦,但可能是最值得用的 Claude
2026 年 7 月 24 日,Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),並同步將其設為 Claude Max 預設模型,Claude Pro 用戶也可使用目前最強版本。定價與 Opus 4.8 完全相同:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens;上下文視窗 100 萬 tokens(預設且唯一檔位);最大輸出 128K tokens;Thinking 預設開啟。
2.1 關鍵基準:效能跳級,成本不變
| 基準 | Opus 5 表現 | 對比說明 |
|---|---|---|
| Frontier-Bench v0.1 | 超越所有模型 | Opus 4.8 的 2 倍以上,單任務成本更低 |
| CursorBench 3.2(max effort) | 與 Fable 5 峰值差 0.5% | 成本僅為 Fable 5 的 一半 |
| ARC-AGI 3 | 次優模型的 3 倍 | 新穎問題解決能力躍升 |
| OSWorld 2.0 | 優於 Fable 5 最佳成績 | 成本不到 Fable 5 的 1/3 |
| Zapier AutomationBench | 100% 通過率 | 此前模型均未通過端到端帳戶健康工作流 |
Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5.」Box 企業客戶實測:資料分析工作流 +11%,盡職調查 +17%,整體準確率 +8%。
2.2 安全與資料留存:最對齊的一代,但不搶 Mythos 5 的風頭
Opus 5 是 Anthropic 迄今為止最對齊的模型——欺騙行為發生率最低,最不容易被誘導濫用。但在網路安全攻擊、生物安全等高風險雙用途能力上,Anthropic 刻意 未讓 Opus 5 衝到最前——該位置仍由受限發行的 Mythos 5 佔據。Opus 5 的網路安全分類器觸發頻率比 Fable 5 低約 85%,可用於原始碼級漏洞發現,但仍屏蔽二進位漏洞掃描、滲透測試、exploit 生成。
容易被忽略的細節:Opus 5 預設存取不強制資料留存。Fable 5 / Mythos 5 要求接受 30 天資料留存政策——對合規敏感的企業場景,Opus 5 可能是比 Fable 5 更實用的選擇。
3. Opus 5 vs Fable 5:決策對比表
| 維度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 輸入 / 輸出定價 | $5 / $25 每百萬 tokens | 約 $10 / $50 |
| CursorBench 3.2 峰值 | 與 Fable 5 差 0.5% | 當前編程基準天花板 |
| Claude Max 預設 | 是(7/24 起) | 否 |
| 資料留存 | 預設不要求 | 需接受 30 天留存 |
| 雙用途風險能力 | 刻意未達前沿 | 更強(Mythos 5 受限發行) |
| 適用場景 | 日常編碼、Agent、企業合規工作流 | 極限 benchmark、需最強 frontier 的任務 |
4. Kimi K3「蒸餾門」:白宮下場,專家質疑時間線
月之暗面於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 兆,稀疏 MoE(896 專家激活 16 個,約等效 500 億激活參數),100 萬 token 上下文 + 原生視覺理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整權重承諾 7 月 27 日 放出——爭議爆發時外部尚無法獨立驗證。
4.1 白宮指控與 Anthropic 前科
2026 年 7 月 22–23 日,白宮 OSTP 主任 Michael Kratsios 在 X 上指控月之暗面「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提及涉嫌使用未獲出口許可的 Nvidia GB300 晶片。財政部長 Scott Bessent 附和稱在多個中國模型上發現美國大模型「浮水印」,但未公開具體定義。
這並非空穴來風:2026 年 2 月 Anthropic 已公開指控月之暗面、DeepSeek、MiniMax,稱檢測到超過 340 萬次 異常 API 互動,「明顯偏離正常使用模式,反映刻意的能力提取」。
4.2 獨立專家:兩週內完成深度蒸餾不現實
"Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks." — Braden Hancock,Snorkel AI 聯合創辦人
Allen Institute 研究員 Nathan Lambert 補充:隨著中國模型逼近前沿,簡單監督微調式蒸餾的邊際收益正在變小,真正拉開差距的是強化學習訓練——若蒸餾真這麼好用,所有追趕者早就靠蒸餾追平了。
5. 最硬核證據:K3 會「自稱是 Claude」並吐出內部部署 ID
Redwood Research 首席科學家 Ryan Greenblatt(GitHub:rgreenblatt/which_claude_is_k3)在 7 月 24 日前後發布統計分析:Kimi K3 被問及「你是誰」時,異常高頻地自稱是 Claude,甚至會吐出 Claude 官方內部部署 ID 字串:
而真正的 Claude 模型自己都不會這樣準確地報出這個內部版本號——Sonnet 4.5 只會簡單說「我是 Claude Sonnet 4.5」,Opus 4.5 甚至可能報錯或不報版本號。
Greenblatt 的解讀:模型說出「教師模型」的部署中繼資料,比教師模型自己說得還準,很難用「模仿對話風格」解釋,更可能指向訓練資料裡混入了帶有部署中繼資料標註的 Claude 資料(如 API 日誌或打標合成資料)。K3 自稱的身份鎖定在「Claude 4.5 時代」(2025 年末),K2 則指向更早的 Sonnet 4——呈現「逐代追新」規律。
重要澄清:Greenblatt 強調這不能直接證明蒸餾發生——身份混淆也可能來自資料污染或系統提示詞外洩。但結合 Anthropic 2 月指控,這是迄今最接地氣的技術證據,而不只是政治喊話。
6. 5 步落地:Mac 開發者如何調整模型路由
- 評估合規優先級。 若工作涉及企業資料、出口管制敏感場景,Opus 5 的無強制留存 + 官方 API 鏈路優先於 K3 等來源未完全澄清的開源模型。
- 更新 Cursor / OpenClaw 主模型。 Claude Max 用戶將預設切到 Opus 5;在 Cursor 中可顯式指定
claude-opus-5,對比 Fable 5 在實際專案上的 cost-per-task。 - 配置 OpenRouter Fallback 鏈。 主力 Opus 5 → 限流時 fallback DeepSeek V4 Flash 或 Kimi K3 API(若可接受來源風險)→ 免費層調試用 OpenRouter 免費模型。
- 標記 7 月 27 日 K3 權重發布。 完整權重放出後,在隔離環境(非生產 Mac 節點)跑獨立 benchmark 與身份自認測試,複現 Greenblatt 統計。
- 分離壓測與日常開發。 長上下文 Agent 壓測、多模型 A/B 不要占滿主力 MacBook 統一記憶體——丟到遠端 Mac 節點做隔離驗收(見下文收束)。
7. 時間線速覽
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次指控月之暗面/DeepSeek/MiniMax「產業級蒸餾攻擊」 |
| 2026-07-01 | Claude Fable 5 面向公眾正式可用 |
| 2026-07-16 | Kimi K3 API/產品正式發布 |
| 2026-07-22/23 | 白宮 Kratsios 公開指控蒸餾 + 違規晶片 |
| 2026-07-24 | Claude Opus 5 發布;Greenblatt 發布 K3 身份自認分析 |
| 2026-07-27(計劃) | Kimi K3 完整權重開源 |
8. 深度洞察:性價比戰爭與「能力來源」的公開攤牌
把 Opus 5 與 K3 爭議連起來看,2026 年下半年的 LLM 競爭已進入新階段:Frontier 能力正在商品化。Anthropic 用「半價逼近旗艦」回應市場對性價比的訴求——這不是降價清庫存,而是 deliberate 的產品線重構:Fable 5 守極限 frontier,Opus 5 接管日常主力,Mythos 5 鎖雙用途風險能力。
月之暗面則用「開源 + 低價 + 少拒答」衝擊同一市場。K3 爭議的本質,是行業第一次公開追問:當你的模型在 benchmark 上逼近 frontier、價格卻只有十分之一時,怎麼區分「 genuinely better engineering」和「 quietly riding on someone else's model」?
對 Mac 開發者而言,這不只是吃瓜。Cursor 的預設模型切換、OpenClaw 的 fallback 鏈、OpenRouter 的路由表——都會在接下來 30 天內因 Opus 5 預設化與 K3 權重開源而重寫。Greenblatt 的「部署 ID 外洩」角度之所以 valuable,是因為它提供了一個可複現、可量化的檢測思路:不必等政府調查,開發者自己就能跑 identity probe 測試。
社群 r/LocalLLaMA 的三派聲音同樣值得聽:歡呼「開源與閉源差距縮短到 days not months」;調侃「2.8T 參數沒人本地跑得動」;務實派認為 K3 真正的賣點是價格和無審查,而不是「打敗 Fable 5」。在 7 月 27 日權重放出前,所有架構聲明都只是「官方自評 + 外部猜測」。若要在遠端 Mac 節點跑 K3 驗證,統一記憶體與頻寬規劃比盲目堆本地 GPU 更關鍵——2.8T MoE 即使稀疏激活,也需要專用伺服器級硬體才能做有意義的 benchmark。
9. 常見問題 FAQ
Q:Claude Opus 5 比 Claude Fable 5 便宜多少?
A:Token 單價約為 Fable 5 的一半($5/$25 vs 約 $10/$50),CursorBench 峰值成績相差不到 1%。
Q:Claude Opus 5 現在是 Claude Max 的預設模型嗎?
A:是的,7 月 24 日發布當天起成為 Claude Max 預設模型,也是 Claude Pro 最強可用版本。
Q:Kimi K3 真的蒸餾了 Claude 嗎?
A:截至本文發布仍屬未證實爭議。白宮缺乏公開證據;專家質疑兩週時間線;Greenblatt 的「自稱 Claude + 內部 ID」是目前最強技術間接證據。
Q:Kimi K3 完整權重什麼時候能下載?
A:官方承諾 2026 年 7 月 27 日,發布時尚未放出。
Q:為什麼 Kimi K3 會自稱是 Claude?
A:統計上 K3 身份自認行為異常偏向 Claude,並吐出內部部署 ID——可能指向訓練資料混入了帶中繼資料標註的 Claude 樣本,但不能直接等同「蒸餾已證實」。
10. 收束:合規 API 走 Opus 5,壓測與開源驗證隔離到 Mac 節點
在 Windows/Linux 雲主機上接 Claude API 或 Kimi K3,日常編碼都能跑。但若你要在 Mac 上跑 Cursor + Opus 5 長會話 Agent、OpenClaw 多模型 fallback 壓測,或在隔離環境複現 K3 身份自認測試,Apple Silicon 統一記憶體 + Metal 工具鏈 + 24/7 穩定運行仍是 friction 最小的路徑。
務實分工:主力開發機走 Opus 5 / OpenRouter 合規路由;把 Agent 壓測、K3 權重本地 benchmark、長上下文 batch 丟到 MACGPU 遠端 Mac mini M4 節點——按需租用、SSH 隔離,主力機不被 2.8T 參數實驗拖垮。在「半價旗艦 vs 來源成疑的開源 frontier」並存的本週,隔離驗收比 all-in 單一方案更可控。