OPENROUTER 7月榜
XIAOMI_
TOP1_
CHINA_46%.
七月進入尾聲,若你還在用幾個月前的印象判斷「哪個大模型最值得用」,大概率已經過時。痛點:OpenRouter 排行榜排的是真實付費 Token 用量,不是跑分;榜單第一不等於品質第一。結論:截至 7 月 25 日,中國廠商合計約 46% 份額,小米 Mimo V2.5 單日 1.4T Token 登頂,市場正分裂為「便宜跑量」與「閉源難任務」的雙峰型結構。結構預告:Top12 模型表 → 廠商份額 → 用量≠品質 → Agent 應用榜 → 價格矩陣 → 8 月預測 → 五步分層路由 → Mac 三檔分流。
1. 痛點拆解:為什麼 7 月榜單會刷新你的路由認知
1)用量≠品質:廉價模型掛在高流量應用背後,輕鬆刷榜;複雜推理任務上閉源旗艦仍占消費份額前列。2)「月度冠軍」頻繁易主:DeepSeek 廠商份額最穩(約 16%–18%),但模型榜首從 MiniMax M2.5 → MiMo-V2-Pro → 如今 Mimo V2.5 輪番換位。3)隱藏市場被忽視:角色扮演/陪伴類應用占開源模型流量可觀比例,企業報導幾乎看不到。4)價差高達 35 倍:DeepSeek V4 Flash 輸入約 $0.05–0.14/M,GPT-5.5 約 $5/M——理性開發者用腳投票。5)安全成新變數:OpenAI 沙盒逃逸事件後,企業選型評分卡必須納入廠商安全紀錄。
2. 7 月模型 Token 用量 Top 12(截至 2026-07-25)
| 排名 | 模型 | 廠商 | 單日 Token | 近 30 天累計 |
|---|---|---|---|---|
| 1 | Mimo V2.5 | 小米 | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | 騰訊 | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B(免費) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | 智譜 Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | 階躍星辰 | 204.8B | 5.9T |
| 9 | Kimi K3 | 月之暗面 | 157.6B | 1.6T(新上榜) |
| 10 | Ling 3.0 Flash | 螞蟻 InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
前十名中中國廠商模型占 七席;美國陣營主要由 Nemotron、Claude、Gemini 守住位置。Kimi K3 漲勢最猛,是 7 月最值得追蹤的新變數。
3. 廠商份額:中國合計約 46%,一年從不到 2% 飆升
| 廠商 | 歸屬 | Token 份額(約) |
|---|---|---|
| DeepSeek | 🇨🇳 中國 | 16%–18%(多數統計第 1) |
| 小米 | 🇨🇳 中國 | 8%–18%(Mimo V2.5 暴漲,波動最大) |
| Anthropic | 🇺🇸 美國 | 10%–15% |
| 騰訊 | 🇨🇳 中國 | 8%–13% |
| 🇺🇸 美國 | 8%–13% | |
| 智譜 Z.ai | 🇨🇳 中國 | 4%–7% |
| OpenAI | 🇺🇸 美國 | 6%–8% |
中國廠商合計約 46%(一年前 <2%);美國三巨頭合計約 30%–36%(一年前約 70%)。這是過去 12 個月 AI 產業最陡峭的份額遷移曲線之一。
4. 榜單另一面:用量高≠品質高,雙峰型市場已成型
按任務類型的消費金額占比(而非 Token 量)看:通用對話 35.7%、Agent 工作流 30.4%、程式碼 26.5%、資料處理 7.5%。但在「分類/複雜推理」難任務維度,畫風立刻反轉——Claude Sonnet 4.6 與 Claude Opus 4.7 各 13.5% 消費份額並列第一,GPT-5.5 以 11.6% 排第三;總量榜霸屏的廉價開源模型在此幾乎「查無此模型」。
7 月 24 日 Anthropic 發布 Claude Opus 5:FrontierBench v0.1 拿下 43.3%(反超 GPT-5.6 Sol 的 37.5%),定價維持 Opus 檔 $5/$25 per M(Fable 5 輸入價的一半)——「我貴,但我值這個價」的典型打法。
| 模型 | 輸入價/M | 輸出價/M | 定位 |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 性價比之王,Agentic Coding 首選 |
| MiniMax M3 | $0.10 | $1.21 | 長上下文多模態預算之選 |
| GLM 5.2 | $0.45 | $3.31 | 開源裡類 Opus 規劃品質 |
| Kimi K3 | ~$3 | ~$15 | 1.4TB 開源權重,閉源級能力 |
| Claude Opus 5 | $5(快速檔 $10) | $25(快速檔 $50) | 閉源旗艦,7 月最強基準分 |
5. 應用層秘密:程式開發 Agent 稱王,角色扮演是看不見的半壁江山
| 排名 | 應用 | 類型 | 份額(約) |
|---|---|---|---|
| 1 | Hermes Agent | 個人智慧體/CLI Agent | ~45% |
| 2 | Kilo Code | 程式開發 Agent | ~13% |
| 3 | OpenClaw | 通用 Agent | ~9% |
| 4 | Claude Code | 程式開發 Agent | ~6% |
| 5 | Descript | 內容生產 | ~4.5% |
| 7 | Lemonade | 陪伴/遊戲 | ~2.1%(新進榜) |
| 8 | ISEKAI ZERO | 角色扮演 | ~2.0%(新進榜) |
| 10 | Cline | 程式開發 Agent(IDE 外掛) | ~1.7% |
Cline → Roo Code → Kilo Code 是同一代碼血統的三次分叉,「孫子輩」Kilo Code 已反超祖輩流量。OpenRouter × a16z《State of AI》顯示,創意角色扮演場景貢獻開源模型總用量一半以上——若只看企業 AI 報導,你會錯過這半壁江山。
6. 8 月趨勢預測:五個值得盯住的訊號
- 中國開源模型合計份額大概率繼續爬升,年內有望突破 50%,除非美國廠商主動降價迎戰。
- 「月度冠軍模型」寶座繼續易主——小米、DeepSeek、騰訊、智譜、MiniMax、月之暗面價格戰與迭代速度都不放緩。
- Anthropic 可能推出更平價型號搶用量份額——Opus 5 已是兩個月內第四款旗艦(Mythos 5、Fable 5、Sonnet 5 之後),打法已從單點突破轉向多價位段全覆蓋。
- Kimi K3 的 1.4TB 權重 2–4 週內可能出現社群量化版,屆時中小團隊才能真正落地;現在主要受益的是大廠與 Fireworks AI 等推理雲。
- 安全與合規成為選型變數——OpenAI 沙盒逃逸、美國「AI 終止開關法案」與白宮預發布審查框架,將讓「廠商安全聲譽」正式寫入企業評分卡。
7. 五步落地:按任務類型建構分層路由
- 拆鏈對應:閒聊/創意/角色扮演 → DeepSeek V4 Flash / Mimo V2.5;分類/複雜推理/高風險 Agent → Claude Opus 5 / GPT-5.6。
- 設成本上限:為閉源旗艦設每日 Token 預算,超閾值自動降級到 GLM 5.2 或 DeepSeek Flash。
- 每週對照 openrouter.ai/rankings:榜單每日變動,發布前務必核對 Top10;暴漲模型常伴隨預覽價結束。
- 開放權重本機備援:GLM 5.2 / Kimi K3 在 Mac 上用 MLX 做離線兜底,應對 API 限流或合規切換。
- 20 任務驗收集:同一任務集在廉價模型與旗艦模型各跑一遍,記錄通過率與單任務成本,寫入團隊 SOP。
8. 深度洞察:capability 與 popularity 正在分道揚鑣
7 月這份榜單最值得記住的一句話:能力(capability)與流行度(popularity)正在分道揚鑣。中國開源模型靠價格拿下流量半壁江山——DeepSeek V4 Flash 與 GPT-5.5 價差約 35 倍,當 80–90% 日常任務「夠用」時,帳單資料不會說謊。美國閉源旗艦仍守著難任務的定價權:Claude Opus 5 在 FrontierBench 43.3% 的分數,以及 Anthropic 相對乾淨的安全紀錄,是企業願意付溢價的原因。
應用層的故事同樣深刻:Hermes Agent 以 45% 應用 Token 份額一騎絕塵,程式開發 Agent 家族(Kilo Code、OpenClaw、Claude Code、Cline)占據榜單大半壁江山。對 Mac 開發者而言,這意味著路由表不僅要按「模型」分,還要按「應用工作負載」分——Cursor 裡的補全鏈、OpenClaw 裡的 Agent 鏈、Hermes 裡的自我迭代鏈,最優模型 ID 完全不同。
港台團隊還需注意:OpenRouter 平均延遲約 180–250ms,且不提供本地發票。正式生產環境建議評估合規 API 中轉;OpenRouter 更適合做「技術預研沙盒」與多模型 A/B 對比。若需 7×24 Agent 常駐,遠端 Mac 節點的統一記憶體架構比傳統雲端伺服器更適合長上下文工作負載。
9. 收束:分層路由 + Mac 統一記憶體的三檔架構
純 Windows/Linux 雲端主機可以調 OpenRouter API,卻在本機 MLX 推理、Cursor 工具鏈協同、7×24 Agent 常駐與圖形工作流上不如 Apple Silicon Mac 順暢。若你正被「DeepSeek 50 美分 vs Claude 10 美元/小時」的成本差牽動,又需要可預測的本機備援與遠端峰值分流,推薦三檔架構:本機 MLX 跑 GLM 5.2 / Kimi K3 處理日常量;OpenRouter API 按場景路由 Opus 5 與 DeepSeek Flash;MACGPU 遠端 Mac 節點 承接夜間批次 Agent 與統一記憶體吃緊的長上下文任務——在 8 月模型潮到來前,可控算力就是最好的對沖。