OPENROUTER 7月榜
XIAOMI_
TOP1_
CHINA_46%.
七月进入尾声,若你还在用几个月前的印象判断「哪个大模型最值得用」,大概率已经过时。痛点:OpenRouter 排行榜排的是真实付费 Token 用量,不是跑分;榜单第一不等于质量第一。结论:截至 7 月 25 日,中国厂商合计约 46% 份额,小米 Mimo V2.5 单日 1.4T Token 登顶,市场正分裂为「便宜跑量」与「闭源难任务」的哑铃型结构。结构预告:Top12 模型表 → 厂商份额 → 用量≠质量 → Agent 应用榜 → 价格矩阵 → 8 月预测 → 五步分层路由 → Mac 三档分流。
1. 痛点拆解:为什么 7 月榜单会刷新你的路由认知
1)用量≠质量:便宜模型挂在高流量应用背后,轻松刷榜;复杂推理任务上闭源旗舰仍占消费份额前列。2)「月度冠军」频繁易主:DeepSeek 厂商份额最稳(约 16%–18%),但模型榜首从 MiniMax M2.5 → MiMo-V2-Pro → 如今 Mimo V2.5 轮番换位。3)隐藏市场被忽视:角色扮演/陪伴类应用占开源模型流量可观比例,企业报道几乎看不到。4)价差高达 35 倍:DeepSeek V4 Flash 输入约 $0.05–0.14/M,GPT-5.5 约 $5/M——理性开发者用脚投票。5)安全成新变量:OpenAI 沙盒逃逸事件后,企业选型评分卡必须纳入厂商安全记录。
2. 7 月模型 Token 用量 Top 12(截至 2026-07-25)
| 排名 | 模型 | 厂商 | 单日 Token | 近 30 天累计 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 腾讯 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免费) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智谱 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 阶跃星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 蚂蚁 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
前十名中中国厂商模型占 七席;美国阵营主要由 Nemotron、Claude、Gemini 守住位置。Kimi K3 涨势最猛,是 7 月最值得跟踪的新变量。
3. 厂商份额:中国合计约 46%,一年从不到 2% 飙升
| 厂商 | 归属 | Token 份额(约) |
|---|---|---|
| DeepSeek | 🇨🇳 中国 | 16%–18%(多数统计第 1) |
| 小米 | 🇨🇳 中国 | 8%–18%(Mimo V2.5 暴涨,波动最大) |
| Anthropic | 🇺🇸 美国 | 10%–15% |
| 腾讯 | 🇨🇳 中国 | 8%–13% |
| 🇺🇸 美国 | 8%–13% | |
| 智谱 Z.ai | 🇨🇳 中国 | 4%–7% |
| OpenAI | 🇺🇸 美国 | 6%–8% |
中国厂商合计约 46%(一年前 <2%);美国三巨头合计约 30%–36%(一年前约 70%)。这是过去 12 个月 AI 行业最陡峭的份额迁移曲线之一。
4. 榜单另一面:用量高≠质量高,哑铃型市场已成型
按任务类型的消费金额占比(而非 Token 量)看:通用对话 35.7%、Agent 工作流 30.4%、代码 26.5%、数据处理 7.5%。但在「分类/复杂推理」难任务维度,画风立刻反转——Claude Sonnet 4.6 与 Claude Opus 4.7 各 13.5% 消费份额并列第一,GPT-5.5 以 11.6% 排第三;总量榜霸屏的廉价开源模型在此几乎「查无此模型」。
7 月 24 日 Anthropic 发布 Claude Opus 5:FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),定价维持 Opus 档 $5/$25 per M(Fable 5 输入价的一半)——「我贵,但我值这个价」的典型打法。
| 模型 | 输入价/M | 输出价/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性价比之王,Agentic Coding 首选 |
| MiniMax M3 | $0.10 | $1.21 | 长上下文多模态预算之选 |
| GLM 5.2 | $0.45 | $3.31 | 开源里类 Opus 规划质量 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 开源权重,闭源级能力 |
| Claude Opus 5 | $5(快速档 $10) | $25(快速档 $50) | 闭源旗舰,7 月最强基准分 |
5. 应用层秘密:编程 Agent 称王,角色扮演是看不见的半壁江山
| 排名 | 应用 | 类型 | 份额(约) |
|---|---|---|---|
| 1 | Hermes Agent | 个人智能体/CLI Agent | ~45% |
| 2 | Kilo Code | 编程 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 编程 Agent | ~6% |
| 5 | Descript | 内容生产 | ~4.5% |
| 7 | Lemonade | 陪伴/游戏 | ~2.1%(新进榜) |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0%(新进榜) |
| 10 | Cline | 编程 Agent(IDE 插件) | ~1.7% |
Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 已反超祖辈流量。OpenRouter × a16z《State of AI》显示,创意角色扮演场景贡献开源模型总用量一半以上——若只看企业 AI 报道,你会错过这半壁江山。
6. 8 月趋势预测:五个值得盯住的信号
- 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商主动降价迎战。
- 「月度冠军模型」宝座继续易主——小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面价格战与迭代速度都不放缓。
- Anthropic 可能推出更平价型号抢用量份额——Opus 5 已是两个月内第四款旗舰(Mythos 5、Fable 5、Sonnet 5 之后),打法已从单点突破转向多价位段全覆盖。
- Kimi K3 的 1.4TB 权重 2–4 周内可能出现社区量化版,届时中小团队才能真正落地;现在主要受益的是大厂与 Fireworks AI 等推理云。
- 安全与合规成为选型变量——OpenAI 沙盒逃逸、美国「AI 终止开关法案」与白宫预发布审查框架,将让「厂商安全声誉」正式写入企业评分卡。
7. 五步落地:按任务类型构建分层路由
- 拆链映射:闲聊/创意/角色扮演 → DeepSeek V4 Flash / Mimo V2.5;分类/复杂推理/高风险 Agent → Claude Opus 5 / GPT-5.6。
- 设成本上限:为闭源旗舰设每日 Token 预算,超阈值自动降级到 GLM 5.2 或 DeepSeek Flash。
- 每周对照 openrouter.ai/rankings:榜单每日变动,发布前务必核对 Top10;暴涨模型常伴随预览价结束。
- 开放权重本地备份:GLM 5.2 / Kimi K3 在 Mac 上用 MLX 做离线兜底,应对 API 限流或合规切换。
- 20 任务验收集:同一任务集在廉价模型与旗舰模型各跑一遍,记录通过率与单任务成本,写入团队 SOP。
8. 深度洞察:capability 与 popularity 正在分道扬镳
7 月这份榜单最值得记住的一句话:能力(capability)与流行度(popularity)正在分道扬镳。中国开源模型靠价格拿下流量半壁江山——DeepSeek V4 Flash 与 GPT-5.5 价差约 35 倍,当 80–90% 日常任务「够用」时,账单数据不会说谎。美国闭源旗舰仍守着难任务的定价权:Claude Opus 5 在 FrontierBench 43.3% 的分数,以及 Anthropic 相对干净的安全记录,是企业愿意付溢价的原因。
应用层的故事同样深刻:Hermes Agent 以 45% 应用 Token 份额一骑绝尘,编程 Agent 家族(Kilo Code、OpenClaw、Claude Code、Cline)占据榜单大半壁江山。对 Mac 开发者而言,这意味着路由表不仅要按「模型」分,还要按「应用工作负载」分——Cursor 里的补全链、OpenClaw 里的 Agent 链、Hermes 里的自我迭代链,最优模型 ID 完全不同。
国内团队还需注意:OpenRouter 平均延迟约 180–250ms,且不支持国内发票。正式生产环境建议评估硅基流动、非线智能 API 等合规中转;OpenRouter 更适合做「技术预研沙盒」与多模型 A/B 对比。
9. 收束:分层路由 + Mac 统一内存的三档架构
纯 Windows/Linux 云主机可以调 OpenRouter API,却在本地 MLX 推理、Cursor 工具链协同、7×24 Agent 常驻与图形工作流上不如 Apple Silicon Mac 顺滑。若你正被「DeepSeek 50 美分 vs Claude 10 美元/小时」的成本差牵动,又需要可预测的本地备份与远程峰值分流,推荐三档架构:本机 MLX 跑 GLM 5.2 / Kimi K3 处理日常量;OpenRouter API 按场景路由 Opus 5 与 DeepSeek Flash;MACGPU 远程 Mac 节点 承接夜间批量 Agent 与统一内存吃紧的长上下文任务——在 8 月模型潮到来前,可控算力就是最好的对冲。