OPUS 5
半价旗舰
K3 蒸馏门.
导语:本周 AI 圈两件大事表面无关,实则都指向同一主题——性价比与模型能力的真实来源。痛点:开发者要在「Anthropic 新主力 Opus 5」与「月之暗面 K3 开源低价」之间做选型,却被白宫蒸馏指控和 K3「自称 Claude」的技术证据搞得一头雾水。结论:Opus 5 用半价逼近 Fable 5 是合规用户的务实升级;K3 争议尚无定论,但 Greenblatt 的部署 ID 泄露是目前最有技术含量的间接证据。结构预告:Opus 5 解读 → Opus vs Fable 对比表 → K3 蒸馏门时间线 → 「自称 Claude」技术分析 → 5 步 Mac 开发者选型 → 行业洞察 → FAQ。
30 秒读懂 · TL;DR
| Opus 5 | 7/24 发布 · Max 默认 · $5/$25 每百万 tokens · CursorBench 与 Fable 5 差 0.5% |
| K3 | 7/16 发布 · 2.8T 参数 · 7/27 权重开源 · 白宫 7/22 指控蒸馏 |
| 硬核证据 | K3 自称 Claude · 吐出 claude-opus-4-5-20250929 等内部 ID |
| 专家反驳 | Fable 5 公开仅 7/1 起 · 到 K3 发布仅 2 周 · 深度蒸馏时间不够 |
1. 痛点拆解:为什么这两件事同时刷屏
- 旗舰太贵,日常模型不够强。 Fable 5 能力顶尖但 $10/$50 定价 + 30 天数据留存门槛,Pro/Max 用户一直在等「半价旗舰」——Opus 5 就是 Anthropic 的答案。
- 开源追平闭源,但来源成疑。 K3 跑分仅次于 Fable 5 / GPT-5.6 Sol,价格却低一个数量级;当白宫下场指控「工业级蒸馏」,开发者无法忽视合规与供应链风险。
- 政治喊话 vs 技术证据。 Kratsios 的 X 帖缺乏公开证据链;真正让社区坐直的是 Greenblatt 发现 K3 比 Claude 自己还准确地报出内部部署版本号——这是可复现的技术信号,不是外交辞令。
- Mac 开发者路由困境。 Cursor / OpenClaw 多模型架构下,「合规 Claude API + 低价开源 fallback」的组合该怎么配?参考 OpenRouter 多模型接入教程 与 K3 开源权重倒计时,本周事件直接冲击路由表。
2. Claude Opus 5 发布:不是旗舰,但可能是最值得用的 Claude
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用目前最强版本。定价与 Opus 4.8 完全相同:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens;上下文窗口 100 万 tokens(默认且唯一档位);最大输出 128K tokens;Thinking 默认开启。
2.1 关键基准:性能跳级,成本不变
| 基准 | Opus 5 表现 | 对比说明 |
|---|---|---|
| Frontier-Bench v0.1 | 超越所有模型 | Opus 4.8 的 2 倍以上,单任务成本更低 |
| CursorBench 3.2(max effort) | 与 Fable 5 峰值差 0.5% | 成本仅为 Fable 5 的 一半 |
| ARC-AGI 3 | 次优模型的 3 倍 | 新颖问题解决能力跃升 |
| OSWorld 2.0 | 优于 Fable 5 最佳成绩 | 成本不到 Fable 5 的 1/3 |
| Zapier AutomationBench | 100% 通过率 | 此前模型均未通过端到端账户健康工作流 |
Cursor 团队评价:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5.」Box 企业客户实测:数据分析工作流 +11%,尽职调查 +17%,整体准确率 +8%。
2.2 安全与数据留存:最对齐的一代,但不抢 Mythos 5 的风头
Opus 5 是 Anthropic 迄今为止最对齐的模型——欺骗行为发生率最低,最不容易被诱导滥用。但在网络安全攻击、生物安全等高风险双用途能力上,Anthropic 故意 未让 Opus 5 冲到最前——该位置仍由受限发行的 Mythos 5 占据。Opus 5 的网络安全分类器触发频率比 Fable 5 低约 85%,可用于源码级漏洞发现,但仍屏蔽二进制漏洞扫描、渗透测试、exploit 生成。
容易被忽略的细节:Opus 5 默认访问不强制数据留存。Fable 5 / Mythos 5 要求接受 30 天数据留存政策——对合规敏感的企业场景,Opus 5 可能是比 Fable 5 更实用的选择。
3. Opus 5 vs Fable 5:决策对比表
| 维度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 输入 / 输出定价 | $5 / $25 每百万 tokens | 约 $10 / $50 |
| CursorBench 3.2 峰值 | 与 Fable 5 差 0.5% | 当前编程基准天花板 |
| Claude Max 默认 | 是(7/24 起) | 否 |
| 数据留存 | 默认不要求 | 需接受 30 天留存 |
| 双用途风险能力 | 故意未达前沿 | 更强(Mythos 5 受限发行) |
| 适用场景 | 日常编码、Agent、企业合规工作流 | 极限 benchmark、需最强 frontier 的任务 |
4. Kimi K3「蒸馏门」:白宫下场,专家质疑时间线
月之暗面于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿,稀疏 MoE(896 专家激活 16 个,约等效 500 亿激活参数),100 万 token 上下文 + 原生视觉理解,GPQA-Diamond 93.5%、BrowseComp 91.2%。完整权重承诺 7 月 27 日 放出——争议爆发时外部尚无法独立验证。
4.1 白宫指控与 Anthropic 前科
2026 年 7 月 22–23 日,白宫 OSTP 主任 Michael Kratsios 在 X 上指控月之暗面「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提及涉嫌使用未获出口许可的 Nvidia GB300 芯片。财政部长 Scott Bessent 附和称在多个中国模型上发现美国大模型「水印」,但未公开具体定义。
这并非空穴来风:2026 年 2 月 Anthropic 已公开指控月之暗面、DeepSeek、MiniMax,称检测到超过 340 万次 异常 API 交互,「明显偏离正常使用模式,反映刻意的能力提取」。
4.2 独立专家:两周内完成深度蒸馏不现实
"Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks." — Braden Hancock,Snorkel AI 联合创始人
Allen Institute 研究员 Nathan Lambert 补充:随着中国模型逼近前沿,简单监督微调式蒸馏的边际收益正在变小,真正拉开差距的是强化学习训练——若蒸馏真这么好用,所有追赶者早就靠蒸馏追平了。
5. 最硬核证据:K3 会「自称是 Claude」并吐出内部部署 ID
Redwood Research 首席科学家 Ryan Greenblatt(GitHub:rgreenblatt/which_claude_is_k3)在 7 月 24 日前后发布统计分析:Kimi K3 被问及「你是谁」时,异常高频地自称是 Claude,甚至会吐出 Claude 官方内部部署 ID 字符串:
而真正的 Claude 模型自己都不会这样准确地报出这个内部版本号——Sonnet 4.5 只会简单说「我是 Claude Sonnet 4.5」,Opus 4.5 甚至可能报错或不报版本号。
Greenblatt 的解读:模型说出「教师模型」的部署元数据,比教师模型自己说得还准,很难用「模仿对话风格」解释,更可能指向训练数据里混入了带有部署元数据标注的 Claude 数据(如 API 日志或打标合成数据)。K3 自称的身份锁定在「Claude 4.5 时代」(2025 年末),K2 则指向更早的 Sonnet 4——呈现「逐代追新」规律。
重要澄清:Greenblatt 强调这不能直接证明蒸馏发生——身份混淆也可能来自数据污染或系统提示词泄露。但结合 Anthropic 2 月指控,这是迄今最接地气的技术证据,而不只是政治喊话。
6. 5 步落地:Mac 开发者如何调整模型路由
- 评估合规优先级。 若工作涉及企业数据、出口管制敏感场景,Opus 5 的无强制留存 + 官方 API 链路优先于 K3 等来源未完全澄清的开源模型。
- 更新 Cursor / OpenClaw 主模型。 Claude Max 用户将默认切到 Opus 5;在 Cursor 中可显式指定
claude-opus-5,对比 Fable 5 在实际项目上的 cost-per-task。 - 配置 OpenRouter Fallback 链。 主力 Opus 5 → 限流时 fallback DeepSeek V4 Flash 或 Kimi K3 API(若可接受来源风险)→ 免费层调试用 OpenRouter 免费模型。
- 标记 7 月 27 日 K3 权重发布。 完整权重放出后,在隔离环境(非生产 Mac 节点)跑独立 benchmark 与身份自认测试,复现 Greenblatt 统计。
- 分离压测与日常开发。 长上下文 Agent 压测、多模型 A/B 不要占满主力 MacBook 统一内存——丢到远程 Mac 节点做隔离验收(见下文收束)。
7. 时间线速览
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次指控月之暗面/DeepSeek/MiniMax「产业级蒸馏攻击」 |
| 2026-07-01 | Claude Fable 5 面向公众正式可用 |
| 2026-07-16 | Kimi K3 API/产品正式发布 |
| 2026-07-22/23 | 白宫 Kratsios 公开指控蒸馏 + 违规芯片 |
| 2026-07-24 | Claude Opus 5 发布;Greenblatt 发布 K3 身份自认分析 |
| 2026-07-27(计划) | Kimi K3 完整权重开源 |
8. 深度洞察:性价比战争与「能力来源」的公开摊牌
把 Opus 5 与 K3 争议连起来看,2026 年下半年的 LLM 竞争已进入新阶段:Frontier 能力正在商品化。Anthropic 用「半价逼近旗舰」回应市场对性价比的诉求——这不是降价清库存,而是 deliberate 的产品线重构:Fable 5 守极限 frontier,Opus 5 接管日常主力,Mythos 5 锁双用途风险能力。
月之暗面则用「开源 + 低价 + 少拒答」冲击同一市场。K3 争议的本质,是行业第一次公开追问:当你的模型在 benchmark 上逼近 frontier、价格却只有十分之一时,怎么区分「 genuinely better engineering」和「 quietly riding on someone else's model」?
对 Mac 开发者而言,这不只是吃瓜。Cursor 的默认模型切换、OpenClaw 的 fallback 链、OpenRouter 的路由表——都会在接下来 30 天内因 Opus 5 默认化与 K3 权重开源而重写。Greenblatt 的「部署 ID 泄露」角度之所以 valuable,是因为它提供了一个可复现、可量化的检测思路:不必等政府调查,开发者自己就能跑 identity probe 测试。
社区 r/LocalLLaMA 的三派声音同样值得听:欢呼「开源与闭源差距缩短到 days not months」;调侃「2.8T 参数没人本地跑得动」;务实派认为 K3 真正的卖点是价格和无审查,而不是「打败 Fable 5」。在 7 月 27 日权重放出前,所有架构声明都只是「官方自评 + 外部猜测」。
9. 常见问题 FAQ
Q:Claude Opus 5 比 Claude Fable 5 便宜多少?
A:Token 单价约为 Fable 5 的一半($5/$25 vs 约 $10/$50),CursorBench 峰值成绩相差不到 1%。
Q:Claude Opus 5 现在是 Claude Max 的默认模型吗?
A:是的,7 月 24 日发布当天起成为 Claude Max 默认模型,也是 Claude Pro 最强可用版本。
Q:Kimi K3 真的蒸馏了 Claude 吗?
A:截至本文发布仍属未证实争议。白宫缺乏公开证据;专家质疑两周时间线;Greenblatt 的「自称 Claude + 内部 ID」是目前最强技术间接证据。
Q:Kimi K3 完整权重什么时候能下载?
A:官方承诺 2026 年 7 月 27 日,发布时尚未放出。
Q:为什么 Kimi K3 会自称是 Claude?
A:统计上 K3 身份自认行为异常偏向 Claude,并吐出内部部署 ID——可能指向训练数据混入了带元数据标注的 Claude 样本,但不能直接等同「蒸馏已证实」。
10. 收束:合规 API 走 Opus 5,压测与开源验证隔离到 Mac 节点
在 Windows/Linux 云主机上接 Claude API 或 Kimi K3,日常编码都能跑。但若你要在 Mac 上跑 Cursor + Opus 5 长会话 Agent、OpenClaw 多模型 fallback 压测,或在隔离环境复现 K3 身份自认测试,Apple Silicon 统一内存 + Metal 工具链 + 24/7 稳定运行仍是 friction 最小的路径。
务实分工:主力开发机走 Opus 5 / OpenRouter 合规路由;把 Agent 压测、K3 权重本地 benchmark、长上下文 batch 丢到 MACGPU 远程 Mac mini M4 节点——按需租用、SSH 隔离,主力机不被 2.8T 参数实验拖垮。在「半价旗舰 vs 来源成疑的开源 frontier」并存的本周,隔离验收比 all-in 单一方案更可控。