OPENROUTER 7月榜
XIAOMI_
TOP1_
CHINA_46%.

2026年7月OpenRouter大模型排行榜廠商份額圖

七月進入尾聲,若你還在用幾個月前的印象判斷「哪個大模型最值得用」,大概率已經過時。痛點:OpenRouter 排行榜排的是真實付費 Token 用量,不是跑分;榜單第一不等於品質第一。結論:截至 7 月 25 日,中國廠商合計約 46% 份額,小米 Mimo V2.5 單日 1.4T Token 登頂,市場正分裂為「便宜跑量」與「閉源難任務」的雙峰型結構。結構預告:Top12 模型表 → 廠商份額 → 用量≠品質 → Agent 應用榜 → 價格矩陣 → 8 月預測 → 五步分層路由 → Mac 三檔分流。

1. 痛點拆解:為什麼 7 月榜單會刷新你的路由認知

1)用量≠品質:廉價模型掛在高流量應用背後,輕鬆刷榜;複雜推理任務上閉源旗艦仍占消費份額前列。2)「月度冠軍」頻繁易主:DeepSeek 廠商份額最穩(約 16%–18%),但模型榜首從 MiniMax M2.5 → MiMo-V2-Pro → 如今 Mimo V2.5 輪番換位。3)隱藏市場被忽視:角色扮演/陪伴類應用占開源模型流量可觀比例,企業報導幾乎看不到。4)價差高達 35 倍:DeepSeek V4 Flash 輸入約 $0.05–0.14/M,GPT-5.5 約 $5/M——理性開發者用腳投票。5)安全成新變數:OpenAI 沙盒逃逸事件後,企業選型評分卡必須納入廠商安全紀錄。

2. 7 月模型 Token 用量 Top 12(截至 2026-07-25)

排名模型廠商單日 Token近 30 天累計
1Mimo V2.5小米1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3騰訊590B23.4T
4Nemotron 3 Ultra 550B(免費)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2智譜 Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 Flash階躍星辰204.8B5.9T
9Kimi K3月之暗面157.6B1.6T(新上榜)
10Ling 3.0 Flash螞蟻 InclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

前十名中中國廠商模型占 七席;美國陣營主要由 Nemotron、Claude、Gemini 守住位置。Kimi K3 漲勢最猛,是 7 月最值得追蹤的新變數。

3. 廠商份額:中國合計約 46%,一年從不到 2% 飆升

廠商歸屬Token 份額(約)
DeepSeek🇨🇳 中國16%–18%(多數統計第 1)
小米🇨🇳 中國8%–18%(Mimo V2.5 暴漲,波動最大)
Anthropic🇺🇸 美國10%–15%
騰訊🇨🇳 中國8%–13%
Google🇺🇸 美國8%–13%
智譜 Z.ai🇨🇳 中國4%–7%
OpenAI🇺🇸 美國6%–8%

中國廠商合計約 46%(一年前 <2%);美國三巨頭合計約 30%–36%(一年前約 70%)。這是過去 12 個月 AI 產業最陡峭的份額遷移曲線之一。

4. 榜單另一面:用量高≠品質高,雙峰型市場已成型

按任務類型的消費金額占比(而非 Token 量)看:通用對話 35.7%、Agent 工作流 30.4%、程式碼 26.5%、資料處理 7.5%。但在「分類/複雜推理」難任務維度,畫風立刻反轉——Claude Sonnet 4.6 與 Claude Opus 4.7 各 13.5% 消費份額並列第一,GPT-5.5 以 11.6% 排第三;總量榜霸屏的廉價開源模型在此幾乎「查無此模型」。

7 月 24 日 Anthropic 發布 Claude Opus 5:FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),定價維持 Opus 檔 $5/$25 per M(Fable 5 輸入價的一半)——「我貴,但我值這個價」的典型打法。

模型輸入價/M輸出價/M定位
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.28性價比之王,Agentic Coding 首選
MiniMax M3$0.10$1.21長上下文多模態預算之選
GLM 5.2$0.45$3.31開源裡類 Opus 規劃品質
Kimi K3~$3~$151.4TB 開源權重,閉源級能力
Claude Opus 5$5(快速檔 $10)$25(快速檔 $50)閉源旗艦,7 月最強基準分

5. 應用層秘密:程式開發 Agent 稱王,角色扮演是看不見的半壁江山

排名應用類型份額(約)
1Hermes Agent個人智慧體/CLI Agent~45%
2Kilo Code程式開發 Agent~13%
3OpenClaw通用 Agent~9%
4Claude Code程式開發 Agent~6%
5Descript內容生產~4.5%
7Lemonade陪伴/遊戲~2.1%(新進榜)
8ISEKAI ZERO角色扮演~2.0%(新進榜)
10Cline程式開發 Agent(IDE 外掛)~1.7%

Cline → Roo Code → Kilo Code 是同一代碼血統的三次分叉,「孫子輩」Kilo Code 已反超祖輩流量。OpenRouter × a16z《State of AI》顯示,創意角色扮演場景貢獻開源模型總用量一半以上——若只看企業 AI 報導,你會錯過這半壁江山。

6. 8 月趨勢預測:五個值得盯住的訊號

  1. 中國開源模型合計份額大概率繼續爬升,年內有望突破 50%,除非美國廠商主動降價迎戰。
  2. 「月度冠軍模型」寶座繼續易主——小米、DeepSeek、騰訊、智譜、MiniMax、月之暗面價格戰與迭代速度都不放緩。
  3. Anthropic 可能推出更平價型號搶用量份額——Opus 5 已是兩個月內第四款旗艦(Mythos 5、Fable 5、Sonnet 5 之後),打法已從單點突破轉向多價位段全覆蓋。
  4. Kimi K3 的 1.4TB 權重 2–4 週內可能出現社群量化版,屆時中小團隊才能真正落地;現在主要受益的是大廠與 Fireworks AI 等推理雲。
  5. 安全與合規成為選型變數——OpenAI 沙盒逃逸、美國「AI 終止開關法案」與白宮預發布審查框架,將讓「廠商安全聲譽」正式寫入企業評分卡。

7. 五步落地:按任務類型建構分層路由

  1. 拆鏈對應:閒聊/創意/角色扮演 → DeepSeek V4 Flash / Mimo V2.5;分類/複雜推理/高風險 Agent → Claude Opus 5 / GPT-5.6。
  2. 設成本上限:為閉源旗艦設每日 Token 預算,超閾值自動降級到 GLM 5.2 或 DeepSeek Flash。
  3. 每週對照 openrouter.ai/rankings:榜單每日變動,發布前務必核對 Top10;暴漲模型常伴隨預覽價結束。
  4. 開放權重本機備援:GLM 5.2 / Kimi K3 在 Mac 上用 MLX 做離線兜底,應對 API 限流或合規切換。
  5. 20 任務驗收集:同一任務集在廉價模型與旗艦模型各跑一遍,記錄通過率與單任務成本,寫入團隊 SOP。

8. 深度洞察:capability 與 popularity 正在分道揚鑣

7 月這份榜單最值得記住的一句話:能力(capability)與流行度(popularity)正在分道揚鑣。中國開源模型靠價格拿下流量半壁江山——DeepSeek V4 Flash 與 GPT-5.5 價差約 35 倍,當 80–90% 日常任務「夠用」時,帳單資料不會說謊。美國閉源旗艦仍守著難任務的定價權:Claude Opus 5 在 FrontierBench 43.3% 的分數,以及 Anthropic 相對乾淨的安全紀錄,是企業願意付溢價的原因。

應用層的故事同樣深刻:Hermes Agent 以 45% 應用 Token 份額一騎絕塵,程式開發 Agent 家族(Kilo Code、OpenClaw、Claude Code、Cline)占據榜單大半壁江山。對 Mac 開發者而言,這意味著路由表不僅要按「模型」分,還要按「應用工作負載」分——Cursor 裡的補全鏈、OpenClaw 裡的 Agent 鏈、Hermes 裡的自我迭代鏈,最優模型 ID 完全不同。

港台團隊還需注意:OpenRouter 平均延遲約 180–250ms,且不提供本地發票。正式生產環境建議評估合規 API 中轉;OpenRouter 更適合做「技術預研沙盒」與多模型 A/B 對比。若需 7×24 Agent 常駐,遠端 Mac 節點的統一記憶體架構比傳統雲端伺服器更適合長上下文工作負載。

9. 收束:分層路由 + Mac 統一記憶體的三檔架構

純 Windows/Linux 雲端主機可以調 OpenRouter API,卻在本機 MLX 推理、Cursor 工具鏈協同、7×24 Agent 常駐與圖形工作流上不如 Apple Silicon Mac 順暢。若你正被「DeepSeek 50 美分 vs Claude 10 美元/小時」的成本差牽動,又需要可預測的本機備援與遠端峰值分流,推薦三檔架構:本機 MLX 跑 GLM 5.2 / Kimi K3 處理日常量;OpenRouter API 按場景路由 Opus 5 與 DeepSeek Flash;MACGPU 遠端 Mac 節點 承接夜間批次 Agent 與統一記憶體吃緊的長上下文任務——在 8 月模型潮到來前,可控算力就是最好的對沖。