OPENROUTER
JUILLET_2026_
XIAOMI_TOP1_
CHINE_46%.

Classement OpenRouter juillet 2026 : parts de marché des modèles chinois

Choisir un LLM d'après un benchmark vieux de deux mois, c'est déjà être en retard. Le constat : OpenRouter classe le volume réel de tokens payés — pas les scores de capacité — et le numéro un du volume n'est pas le numéro un de la qualité. La lecture : au 25 juillet, les laboratoires chinois tiennent environ 46 % des parts de tokens identifiées ; le Mimo V2.5 de Xiaomi mène avec 1,4 T tokens/jour, et le marché se scinde en haltère : volume bon marché d'un côté, tâches exigeantes premium de l'autre. Le parcours : tableau Top 12 → parts fournisseurs → usage vs qualité → leaderboard apps → matrice tarifaire → perspectives août → routage en 5 étapes → architecture trois niveaux sur Mac.

1. Points de friction : pourquoi les données de juillet doivent reconfigurer votre routage

1) Volume ≠ capacité — un modèle économique intégré dans une app à fort trafic peut surpasser un modèle plus puissant réservé aux 10 % de tâches les plus difficiles. 2) Le « modèle du mois » tourne en boucle — DeepSeek reste le fournisseur #1 le plus stable (16–18 % de parts), mais la couronne quotidienne a passé de MiniMax M2.5 à MiMo-V2-Pro puis Mimo V2.5 en juillet seul. 3) La moitié du marché est invisible dans la couverture entreprise — les apps de roleplay et companion génèrent un volume open-model considérable. 4) Écart tarifaire ≈ 35× — DeepSeek V4 Flash à ~$0,05–0,14/M en entrée vs GPT-5.5 à ~$5/M. 5) La sécurité devient un critère de sélection — après l'incident d'évasion sandbox d'OpenAI, les historiques de sécurité des fournisseurs entrent dans les grilles d'évaluation enterprise.

2. Volume de tokens Top 12 (au 25 juillet 2026)

RangModèleLabTokens/jourTotal 30 jours
1Mimo V2.5Xiaomi1,4 T31,2 T
2DeepSeek V4 FlashDeepSeek943,9 B23,6 T
3Hy3Tencent590 B23,4 T
4Nemotron 3 Ultra 550B (free)NVIDIA428,6 B9 T
5DeepSeek V4 ProDeepSeek413,7 B11,6 T
6GLM 5.2Z.ai316,7 B13,3 T
7MiniMax M3MiniMax262,5 B15,1 T
8Step 3.7 FlashStepFun204,8 B5,9 T
9Kimi K3Moonshot AI157,6 B1,6 T (nouvelle entrée)
10Ling 3.0 FlashInclusionAI128,3 B417,3 B
11Gemini 3 Flash PreviewGoogle106,3 B4 T
12Claude Sonnet 5Anthropic99,5 B3,6 T

Sept des dix premières places de modèles reviennent à des laboratoires chinois. Kimi K3 est l'ascension la plus rapide — la variable clé à surveiller pour août.

3. Parts fournisseurs : Chine à ~46 %, contre moins de 2 % un an plus tôt

FournisseurOriginePart tokens (approx.)
DeepSeekChine16 %–18 % (#1 sur la plupart des fenêtres)
XiaomiChine8 %–18 % (très volatile — pic Mimo V2.5)
AnthropicUS10 %–15 %
TencentChine8 %–13 %
GoogleUS8 %–13 %
Z.aiChine4 %–7 %
OpenAIUS6 %–8 %

Laboratoires chinois combinés : ~46 % (moins de 2 % un an plus tôt). Trio frontier US combiné : ~30 %–36 % (en baisse depuis ~70 % mi-2025). L'une des migrations de parts les plus abruptes de l'histoire de l'IA.

4. Ce que la plupart des analyses manquent : le rang d'usage n'est pas un signal de qualité

Par catégorie de dépenses : chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, travail sur données 7,5 %. Dans le segment le plus exigeant — classification/raisonnement complexe — le tableau s'inverse : Claude Sonnet 4.6 et Claude Opus 4.7 partagent 13,5 % des dépenses chacun ; GPT-5.5 est troisième à 11,6 %. Les modèles open économiques qui dominent les charts de volume y sont quasi absents.

Le 24 juillet, Anthropic a livré Claude Opus 5 : 43,3 % sur FrontierBench v0.1 (vs 37,5 % de GPT-5.6 Sol), au tarif Opus $5/$25 par M — la moitié du prix d'entrée de Fable 5. Un signal clair : « nous coûtons plus et nous le valons ».

ModèleEntrée/MSortie/MPositionnement
DeepSeek V4 Flash~$0,05–0,14~$0,24–0,28Meilleur rapport valeur ; défaut agentic coding
MiniMax M3$0,10$1,21Multimodal long contexte à budget
GLM 5.2$0,45$3,31Planner open-weight le plus proche d'Opus
Kimi K3~$3~$151,4 TB poids ouverts, capacité tier closed
Claude Opus 5$5 (tier rapide $10)$25 (tier rapide $50)Frontier fermé ; leader benchmark juillet

5. Couche application : les agents de code dominent ; le roleplay est la moitié invisible

RangAppCatégoriePart (approx.)
1Hermes AgentAgent personnel / CLI~45 %
2Kilo CodeAgent de code~13 %
3OpenClawAgent général~9 %
4Claude CodeAgent de code~6 %
5DescriptProduction de contenu~4,5 %
7LemonadeCompanion / gaming~2,1 % (nouveau)
8ISEKAI ZERORoleplay~2,0 % (nouveau)
10ClineAgent de code (IDE)~1,7 %

Cline → Roo Code → Kilo Code représente trois générations de la même lignée open source — le fork le plus récent mène désormais le volume. Le rapport OpenRouter × a16z State of AI estime que le roleplay créatif représente plus de la moitié de toute l'usage open-model. Si votre vision de « l'usage IA » ne vient que des headlines entreprise, vous ignorez la moitié du marché.

6. Perspectives août : cinq signaux à suivre

  1. La part combinée chinoise open-weight grimpera probablement vers 50 %, sauf offensive tarifaire majeure d'un fournisseur US.
  2. Le modèle #1 mensuel continuera de tourner — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot shipent et re-pricent rapidement.
  3. Anthropic pourrait livrer un tier volume moins cher — Opus 5 est leur quatrième flagship en moins de deux mois (après Mythos 5, Fable 5, Sonnet 5), signal d'une couverture complète des tiers tarifaires.
  4. Les 1,4 TB de poids Kimi K3 verront probablement une quantification communautaire sous 2–4 semaines — jusqu'alors, l'accès pratique reste limité aux grands équipes et hôtes d'inférence comme Fireworks AI.
  5. Sécurité et gouvernance deviennent des critères formels — évasion sandbox OpenAI, AI Kill Switch Act proposé, et cadre White House de revue pré-release attendu avant le 1er août.

7. Cinq étapes : construire un routage par tier qui survive à août

  1. Mapper les chaînes par tâche : chat/créatif/roleplay → DeepSeek V4 Flash / Mimo V2.5 ; classification/raisonnement complexe/agents critiques → Claude Opus 5 / GPT-5.6.
  2. Plafonds de dépenses : budgets tokens quotidiens sur modèles frontier ; repli auto sur GLM 5.2 ou DeepSeek Flash en cas de dépassement.
  3. Consulter openrouter.ai/rankings chaque semaine : les classements bougent quotidiennement — vérifier le Top 10 avant citation ; les tarifs preview finissent souvent avec des pics de rang.
  4. Backup open-weight local : GLM 5.2 / Kimi K3 sur Mac via MLX pour repli offline lors de rate limits ou changements compliance.
  5. Exécuter un set d'évaluation 20 tâches : mêmes tâches sur modèles économiques et frontier ; journaliser taux de succès et coût par tâche dans le SOP d'équipe.

8. Analyse profonde : capacité et popularité divergent

La ligne à retenir de juillet : capacité et popularité se séparent. Les modèles open-weight chinois ont acheté la moitié du marché par le prix — un écart ~35× entre DeepSeek V4 Flash et GPT-5.5 quand 80–90 % des tâches quotidiennes sont « assez bonnes ». Les labs US closed frontier défendent l'autre moitié avec pricing power sur les tâches dures : le score FrontierBench 43,3 % de Claude Opus 5 et l'historique de sécurité relativement propre d'Anthropic expliquent pourquoi les entreprises paient encore premium.

À la couche app, Hermes Agent tient 45 % des parts de tokens d'apps trackées ; la famille agents de code (Kilo Code, OpenClaw, Claude Code, Cline) remplit le reste. Pour les développeurs Mac, les tables de routage doivent se scinder par workload — complétions Cursor, chaînes agent OpenClaw et boucles d'auto-amélioration Hermes exigent souvent des ID de modèle optimaux différents.

Indépendants : OpenRouter reste le moyen le plus rapide de A/B-tester des dizaines de modèles derrière une clé API. Commencer les workloads code avec DeepSeek V4 Flash pour le coût et GLM 5.2 pour la planification style Opus ; réserver les modèles fermés premium aux étapes où les modèles économiques échouent réellement.

9. Conclusion : routage par tiers + mémoire unifiée Mac

Une box cloud Windows/Linux peut appeler les APIs OpenRouter, mais elle est en retrait sur l'inférence MLX locale, la synergie toolchain Cursor, l'uptime agent 24/7 et les workflows graphiques face à un Mac Apple Silicon. Si vous naviguez l'écart « centimes DeepSeek vs dollars Claude par heure » et avez besoin d'un backup local prévisible plus offload remote aux pics, adoptez une stack trois niveaux : MLX local pour le volume quotidien GLM 5.2 / Kimi K3 ; API OpenRouter pour Opus 5 sur les étapes dures et DeepSeek Flash sur le volume ; nœuds Mac distants MACGPU pour agents batch nocturnes et jobs long contexte qui stressent la mémoire unifiée — un compute contrôlé est la meilleure couverture avant la vague de modèles d'août.