OPENROUTER 7月榜
XIAOMI_
TOP1_
CHINA_46%.

2026年7月OpenRouter大模型排行榜厂商份额图

七月进入尾声,若你还在用几个月前的印象判断「哪个大模型最值得用」,大概率已经过时。痛点:OpenRouter 排行榜排的是真实付费 Token 用量,不是跑分;榜单第一不等于质量第一。结论:截至 7 月 25 日,中国厂商合计约 46% 份额,小米 Mimo V2.5 单日 1.4T Token 登顶,市场正分裂为「便宜跑量」与「闭源难任务」的哑铃型结构。结构预告:Top12 模型表 → 厂商份额 → 用量≠质量 → Agent 应用榜 → 价格矩阵 → 8 月预测 → 五步分层路由 → Mac 三档分流。

1. 痛点拆解:为什么 7 月榜单会刷新你的路由认知

1)用量≠质量:便宜模型挂在高流量应用背后,轻松刷榜;复杂推理任务上闭源旗舰仍占消费份额前列。2)「月度冠军」频繁易主:DeepSeek 厂商份额最稳(约 16%–18%),但模型榜首从 MiniMax M2.5 → MiMo-V2-Pro → 如今 Mimo V2.5 轮番换位。3)隐藏市场被忽视:角色扮演/陪伴类应用占开源模型流量可观比例,企业报道几乎看不到。4)价差高达 35 倍:DeepSeek V4 Flash 输入约 $0.05–0.14/M,GPT-5.5 约 $5/M——理性开发者用脚投票。5)安全成新变量:OpenAI 沙盒逃逸事件后,企业选型评分卡必须纳入厂商安全记录。

2. 7 月模型 Token 用量 Top 12(截至 2026-07-25)

排名模型厂商单日 Token近 30 天累计
1Mimo V2.5小米1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3腾讯590B23.4T
4Nemotron 3 Ultra 550B(免费)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2智谱 Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 Flash阶跃星辰204.8B5.9T
9Kimi K3月之暗面157.6B1.6T(新上榜)
10Ling 3.0 Flash蚂蚁 InclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

前十名中中国厂商模型占 七席;美国阵营主要由 Nemotron、Claude、Gemini 守住位置。Kimi K3 涨势最猛,是 7 月最值得跟踪的新变量。

3. 厂商份额:中国合计约 46%,一年从不到 2% 飙升

厂商归属Token 份额(约)
DeepSeek🇨🇳 中国16%–18%(多数统计第 1)
小米🇨🇳 中国8%–18%(Mimo V2.5 暴涨,波动最大)
Anthropic🇺🇸 美国10%–15%
腾讯🇨🇳 中国8%–13%
Google🇺🇸 美国8%–13%
智谱 Z.ai🇨🇳 中国4%–7%
OpenAI🇺🇸 美国6%–8%

中国厂商合计约 46%(一年前 <2%);美国三巨头合计约 30%–36%(一年前约 70%)。这是过去 12 个月 AI 行业最陡峭的份额迁移曲线之一。

4. 榜单另一面:用量高≠质量高,哑铃型市场已成型

按任务类型的消费金额占比(而非 Token 量)看:通用对话 35.7%、Agent 工作流 30.4%、代码 26.5%、数据处理 7.5%。但在「分类/复杂推理」难任务维度,画风立刻反转——Claude Sonnet 4.6 与 Claude Opus 4.7 各 13.5% 消费份额并列第一,GPT-5.5 以 11.6% 排第三;总量榜霸屏的廉价开源模型在此几乎「查无此模型」。

7 月 24 日 Anthropic 发布 Claude Opus 5:FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),定价维持 Opus 档 $5/$25 per M(Fable 5 输入价的一半)——「我贵,但我值这个价」的典型打法。

模型输入价/M输出价/M定位
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28性价比之王,Agentic Coding 首选
MiniMax M3$0.10$1.21长上下文多模态预算之选
GLM 5.2$0.45$3.31开源里类 Opus 规划质量
Kimi K3~$3~$151.4TB 开源权重,闭源级能力
Claude Opus 5$5(快速档 $10)$25(快速档 $50)闭源旗舰,7 月最强基准分

5. 应用层秘密:编程 Agent 称王,角色扮演是看不见的半壁江山

排名应用类型份额(约)
1Hermes Agent个人智能体/CLI Agent~45%
2Kilo Code编程 Agent~13%
3OpenClaw通用 Agent~9%
4Claude Code编程 Agent~6%
5Descript内容生产~4.5%
7Lemonade陪伴/游戏~2.1%(新进榜)
8ISEKAI ZERO角色扮演~2.0%(新进榜)
10Cline编程 Agent(IDE 插件)~1.7%

Cline → Roo Code → Kilo Code 是同一代码血统的三次分叉,「孙子辈」Kilo Code 已反超祖辈流量。OpenRouter × a16z《State of AI》显示,创意角色扮演场景贡献开源模型总用量一半以上——若只看企业 AI 报道,你会错过这半壁江山。

6. 8 月趋势预测:五个值得盯住的信号

  1. 中国开源模型合计份额大概率继续爬升,年内有望突破 50%,除非美国厂商主动降价迎战。
  2. 「月度冠军模型」宝座继续易主——小米、DeepSeek、腾讯、智谱、MiniMax、月之暗面价格战与迭代速度都不放缓。
  3. Anthropic 可能推出更平价型号抢用量份额——Opus 5 已是两个月内第四款旗舰(Mythos 5、Fable 5、Sonnet 5 之后),打法已从单点突破转向多价位段全覆盖。
  4. Kimi K3 的 1.4TB 权重 2–4 周内可能出现社区量化版,届时中小团队才能真正落地;现在主要受益的是大厂与 Fireworks AI 等推理云。
  5. 安全与合规成为选型变量——OpenAI 沙盒逃逸、美国「AI 终止开关法案」与白宫预发布审查框架,将让「厂商安全声誉」正式写入企业评分卡。

7. 五步落地:按任务类型构建分层路由

  1. 拆链映射:闲聊/创意/角色扮演 → DeepSeek V4 Flash / Mimo V2.5;分类/复杂推理/高风险 Agent → Claude Opus 5 / GPT-5.6。
  2. 设成本上限:为闭源旗舰设每日 Token 预算,超阈值自动降级到 GLM 5.2 或 DeepSeek Flash。
  3. 每周对照 openrouter.ai/rankings:榜单每日变动,发布前务必核对 Top10;暴涨模型常伴随预览价结束。
  4. 开放权重本地备份:GLM 5.2 / Kimi K3 在 Mac 上用 MLX 做离线兜底,应对 API 限流或合规切换。
  5. 20 任务验收集:同一任务集在廉价模型与旗舰模型各跑一遍,记录通过率与单任务成本,写入团队 SOP。

8. 深度洞察:capability 与 popularity 正在分道扬镳

7 月这份榜单最值得记住的一句话:能力(capability)与流行度(popularity)正在分道扬镳。中国开源模型靠价格拿下流量半壁江山——DeepSeek V4 Flash 与 GPT-5.5 价差约 35 倍,当 80–90% 日常任务「够用」时,账单数据不会说谎。美国闭源旗舰仍守着难任务的定价权:Claude Opus 5 在 FrontierBench 43.3% 的分数,以及 Anthropic 相对干净的安全记录,是企业愿意付溢价的原因。

应用层的故事同样深刻:Hermes Agent 以 45% 应用 Token 份额一骑绝尘,编程 Agent 家族(Kilo Code、OpenClaw、Claude Code、Cline)占据榜单大半壁江山。对 Mac 开发者而言,这意味着路由表不仅要按「模型」分,还要按「应用工作负载」分——Cursor 里的补全链、OpenClaw 里的 Agent 链、Hermes 里的自我迭代链,最优模型 ID 完全不同。

国内团队还需注意:OpenRouter 平均延迟约 180–250ms,且不支持国内发票。正式生产环境建议评估硅基流动、非线智能 API 等合规中转;OpenRouter 更适合做「技术预研沙盒」与多模型 A/B 对比。

9. 收束:分层路由 + Mac 统一内存的三档架构

纯 Windows/Linux 云主机可以调 OpenRouter API,却在本地 MLX 推理、Cursor 工具链协同、7×24 Agent 常驻与图形工作流上不如 Apple Silicon Mac 顺滑。若你正被「DeepSeek 50 美分 vs Claude 10 美元/小时」的成本差牵动,又需要可预测的本地备份与远程峰值分流,推荐三档架构:本机 MLX 跑 GLM 5.2 / Kimi K3 处理日常量;OpenRouter API 按场景路由 Opus 5 与 DeepSeek Flash;MACGPU 远程 Mac 节点 承接夜间批量 Agent 与统一内存吃紧的长上下文任务——在 8 月模型潮到来前,可控算力就是最好的对冲。