OPENROUTER
ИЮЛЬ_2026_
XIAOMI_TOP1_
КИТАЙ_46%.
Если вы выбираете LLM по бенчмарку двухмесячной давности — вы уже отстаёте. Проблема: OpenRouter ранжирует реальный оплаченный объём токенов, не capability scores — и #1 по volume не равен #1 по quality. Итог: на 25 июля китайские лабы держат ~46% идентифицированной доли токенов; Mimo V2.5 от Xiaomi лидирует с 1,4T токенов/день, рынок раскалывается на штангу: дешёвый throughput vs premium hard tasks. Структура: Top 12 → доли провайдеров → usage vs quality → app leaderboard → pricing matrix → август → 5-step routing → трёхуровневый Mac split.
1. Pain points: почему данные июля должны переписать routing stack
1) Volume ≠ capability — дешёвая модель в high-traffic app обгоняет сильную модель, зарезервированную для hardest 10%. 2) «Модель месяца» ротируется — DeepSeek стабильный #1 провайдер (16–18% share), но daily crown в июле сменился MiniMax M2.5 → MiMo-V2-Pro → Mimo V2.5. 3) Половина рынка invisible в enterprise coverage — roleplay и companion apps гонят серьёзный open-model volume. 4) Pricing gap ≈ 35× — DeepSeek V4 Flash ~$0,05–0,14/M input vs GPT-5.5 ~$5/M. 5) Security — selection variable — после sandbox escape OpenAI vendor safety track records входят в enterprise scorecards.
2. Model Token Volume Top 12 (до 25 июля 2026)
| Ранг | Модель | Лаб | Токены/день | 30 дней |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot AI | 157,6B | 1,6T (новый) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Семь из top ten model slots — китайские лабы. Kimi K3 — fastest riser; ключевая variable на август.
3. Provider Share: Китай ~46%, год назад <2%
| Провайдер | Регион | Доля токенов (approx.) |
|---|---|---|
| DeepSeek | Китай | 16%–18% (#1 в большинстве windows) |
| Xiaomi | Китай | 8%–18% (volatile — spike Mimo V2.5) |
| Anthropic | US | 10%–15% |
| Tencent | Китай | 8%–13% |
| US | 8%–13% | |
| Z.ai | Китай | 4%–7% |
| OpenAI | US | 6%–8% |
Китайские лабы combined: ~46% (<2% год назад). US frontier trio combined: ~30%–36% (с ~70% в mid-2025). Одна из крутейших share migrations в истории AI.
4. Что coverage пропускает: usage rank ≠ quality signal
По spend category: general chat 35,7%, agentic workflows 30,4%, code 26,5%, data work 7,5%. В hardest bucket — classification/complex reasoning — картина flip: Claude Sonnet 4.6 и Claude Opus 4.7 tie 13,5% spend each; GPT-5.5 third 11,6%. Cheap open models на volume charts здесь barely register.
24 июля Anthropic shipped Claude Opus 5: 43,3% FrontierBench v0.1 (vs GPT-5.6 Sol 37,5%), Opus-tier pricing $5/$25 per M — half Fable 5 input price. Чистый «cost more, worth it» bet.
| Модель | Input/M | Output/M | Позиционирование |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Best value; agentic coding default |
| MiniMax M3 | $0,10 | $1,21 | Long-context multimodal на budget |
| GLM 5.2 | $0,45 | $3,31 | Closest open-weight Opus-style planner |
| Kimi K3 | ~$3 | ~$15 | 1,4TB open weights, closed-tier capability |
| Claude Opus 5 | $5 (fast tier $10) | $25 (fast tier $50) | Closed frontier; July benchmark leader |
5. App Layer: coding agents dominate; roleplay — invisible half
| Ранг | App | Категория | Доля (approx.) |
|---|---|---|---|
| 1 | Hermes Agent | Personal agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | General agent | ~9% |
| 4 | Claude Code | Coding agent | ~6% |
| 5 | Descript | Content production | ~4,5% |
| 7 | Lemonade | Companion / gaming | ~2,1% (new) |
| 8 | ISEKAI ZERO | Roleplay | ~2,0% (new) |
| 10 | Cline | Coding agent (IDE) | ~1,7% |
Cline → Roo Code → Kilo Code — три generation одной open-source lineage; youngest fork теперь leads volume. OpenRouter × a16z State of AI: creative roleplay больше половины всего open-model usage. Enterprise headlines — вы видите только half the market.
6. August Outlook: пять сигналов
- Chinese open-weight combined share likely → 50%, unless major US pricing move.
- Monthly #1 model keeps rotating — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot ship и re-price fast.
- Anthropic may ship cheaper volume tier — Opus 5 fourth flagship в under two months (Mythos 5, Fable 5, Sonnet 5), full price-tier coverage.
- Kimi K3 1,4TB weights — community quantization в 2–4 weeks; until then access для large teams и inference hosts (Fireworks AI).
- Security и governance — formal selection criteria — OpenAI sandbox escape, AI Kill Switch Act, White House pre-release review framework до 1 августа.
7. Five Steps: task-tier routing на август
- Map chains by task: chat/creative/roleplay → DeepSeek V4 Flash / Mimo V2.5; classification/complex reasoning/high-stakes agents → Claude Opus 5 / GPT-5.6.
- Spend caps: daily token budgets на frontier; auto-fallback GLM 5.2 или DeepSeek Flash на breach.
- openrouter.ai/rankings weekly: rankings shift daily — verify Top 10; preview pricing ends с rank spikes.
- Local open-weight backup: GLM 5.2 / Kimi K3 на Mac через MLX — offline fallback при rate limits; unified memory без PCIe bottleneck, Metal backend для sustained throughput.
- 20-task eval set: same tasks на cheap и frontier models; log pass rate и cost per task в team SOP.
8. Deep Dive: capability и popularity diverge
Линия июля: capability и popularity splitting apart. Chinese open-weight купили half market через price — ~35× gap DeepSeek V4 Flash vs GPT-5.5 когда 80–90% daily tasks «good enough». US closed-frontier labs держат other half через pricing power на hard tasks: Claude Opus 5 43,3% FrontierBench и relatively clean safety record Anthropic — почему enterprises платят premium.
App layer: Hermes Agent 45% tracked app token share; coding agent family (Kilo Code, OpenClaw, Claude Code, Cline) fills rest. Mac developers: routing tables split by workload — Cursor completions, OpenClaw agent chains, Hermes self-improvement loops часто need different optimal model IDs; local MLX inference на Apple Silicon с Metal даёт predictable tokens/sec без cold-start penalty облачного API.
Independent devs: OpenRouter — fastest A/B test dozens models behind one API key. Coding workloads: DeepSeek V4 Flash для cost, GLM 5.2 для Opus-style planning; premium closed только где cheap models actually fail.
9. Close: tiered routing + Mac unified memory
Windows/Linux cloud box вызывает OpenRouter APIs, но проигрывает на local MLX inference, Cursor toolchain synergy, 24/7 agent uptime, graphics workflows vs Apple Silicon Mac. Gap «DeepSeek cents vs Claude dollars per hour» + need predictable local backup + remote peak offload → three-tier stack: local MLX GLM 5.2 / Kimi K3 daily volume (Metal-accelerated decode, unified memory для long KV cache); OpenRouter API Opus 5 на hard steps, DeepSeek Flash на volume; MACGPU remote Mac nodes overnight batch agents и long-context jobs stressing unified memory — controlled compute hedge перед August model wave.