OPENROUTER
JUILLET_2026_
XIAOMI_TOP1_
CHINE_46%.
Choisir un LLM d'après un benchmark vieux de deux mois, c'est déjà être en retard. Le constat : OpenRouter classe le volume réel de tokens payés — pas les scores de capacité — et le numéro un du volume n'est pas le numéro un de la qualité. La lecture : au 25 juillet, les laboratoires chinois tiennent environ 46 % des parts de tokens identifiées ; le Mimo V2.5 de Xiaomi mène avec 1,4 T tokens/jour, et le marché se scinde en haltère : volume bon marché d'un côté, tâches exigeantes premium de l'autre. Le parcours : tableau Top 12 → parts fournisseurs → usage vs qualité → leaderboard apps → matrice tarifaire → perspectives août → routage en 5 étapes → architecture trois niveaux sur Mac.
1. Points de friction : pourquoi les données de juillet doivent reconfigurer votre routage
1) Volume ≠ capacité — un modèle économique intégré dans une app à fort trafic peut surpasser un modèle plus puissant réservé aux 10 % de tâches les plus difficiles. 2) Le « modèle du mois » tourne en boucle — DeepSeek reste le fournisseur #1 le plus stable (16–18 % de parts), mais la couronne quotidienne a passé de MiniMax M2.5 à MiMo-V2-Pro puis Mimo V2.5 en juillet seul. 3) La moitié du marché est invisible dans la couverture entreprise — les apps de roleplay et companion génèrent un volume open-model considérable. 4) Écart tarifaire ≈ 35× — DeepSeek V4 Flash à ~$0,05–0,14/M en entrée vs GPT-5.5 à ~$5/M. 5) La sécurité devient un critère de sélection — après l'incident d'évasion sandbox d'OpenAI, les historiques de sécurité des fournisseurs entrent dans les grilles d'évaluation enterprise.
2. Volume de tokens Top 12 (au 25 juillet 2026)
| Rang | Modèle | Lab | Tokens/jour | Total 30 jours |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4 T | 31,2 T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9 B | 23,6 T |
| 3 | Hy3 | Tencent | 590 B | 23,4 T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428,6 B | 9 T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7 B | 11,6 T |
| 6 | GLM 5.2 | Z.ai | 316,7 B | 13,3 T |
| 7 | MiniMax M3 | MiniMax | 262,5 B | 15,1 T |
| 8 | Step 3.7 Flash | StepFun | 204,8 B | 5,9 T |
| 9 | Kimi K3 | Moonshot AI | 157,6 B | 1,6 T (nouvelle entrée) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3 B | 417,3 B |
| 11 | Gemini 3 Flash Preview | 106,3 B | 4 T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5 B | 3,6 T |
Sept des dix premières places de modèles reviennent à des laboratoires chinois. Kimi K3 est l'ascension la plus rapide — la variable clé à surveiller pour août.
3. Parts fournisseurs : Chine à ~46 %, contre moins de 2 % un an plus tôt
| Fournisseur | Origine | Part tokens (approx.) |
|---|---|---|
| DeepSeek | Chine | 16 %–18 % (#1 sur la plupart des fenêtres) |
| Xiaomi | Chine | 8 %–18 % (très volatile — pic Mimo V2.5) |
| Anthropic | US | 10 %–15 % |
| Tencent | Chine | 8 %–13 % |
| US | 8 %–13 % | |
| Z.ai | Chine | 4 %–7 % |
| OpenAI | US | 6 %–8 % |
Laboratoires chinois combinés : ~46 % (moins de 2 % un an plus tôt). Trio frontier US combiné : ~30 %–36 % (en baisse depuis ~70 % mi-2025). L'une des migrations de parts les plus abruptes de l'histoire de l'IA.
4. Ce que la plupart des analyses manquent : le rang d'usage n'est pas un signal de qualité
Par catégorie de dépenses : chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, travail sur données 7,5 %. Dans le segment le plus exigeant — classification/raisonnement complexe — le tableau s'inverse : Claude Sonnet 4.6 et Claude Opus 4.7 partagent 13,5 % des dépenses chacun ; GPT-5.5 est troisième à 11,6 %. Les modèles open économiques qui dominent les charts de volume y sont quasi absents.
Le 24 juillet, Anthropic a livré Claude Opus 5 : 43,3 % sur FrontierBench v0.1 (vs 37,5 % de GPT-5.6 Sol), au tarif Opus $5/$25 par M — la moitié du prix d'entrée de Fable 5. Un signal clair : « nous coûtons plus et nous le valons ».
| Modèle | Entrée/M | Sortie/M | Positionnement |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Meilleur rapport valeur ; défaut agentic coding |
| MiniMax M3 | $0,10 | $1,21 | Multimodal long contexte à budget |
| GLM 5.2 | $0,45 | $3,31 | Planner open-weight le plus proche d'Opus |
| Kimi K3 | ~$3 | ~$15 | 1,4 TB poids ouverts, capacité tier closed |
| Claude Opus 5 | $5 (tier rapide $10) | $25 (tier rapide $50) | Frontier fermé ; leader benchmark juillet |
5. Couche application : les agents de code dominent ; le roleplay est la moitié invisible
| Rang | App | Catégorie | Part (approx.) |
|---|---|---|---|
| 1 | Hermes Agent | Agent personnel / CLI | ~45 % |
| 2 | Kilo Code | Agent de code | ~13 % |
| 3 | OpenClaw | Agent général | ~9 % |
| 4 | Claude Code | Agent de code | ~6 % |
| 5 | Descript | Production de contenu | ~4,5 % |
| 7 | Lemonade | Companion / gaming | ~2,1 % (nouveau) |
| 8 | ISEKAI ZERO | Roleplay | ~2,0 % (nouveau) |
| 10 | Cline | Agent de code (IDE) | ~1,7 % |
Cline → Roo Code → Kilo Code représente trois générations de la même lignée open source — le fork le plus récent mène désormais le volume. Le rapport OpenRouter × a16z State of AI estime que le roleplay créatif représente plus de la moitié de toute l'usage open-model. Si votre vision de « l'usage IA » ne vient que des headlines entreprise, vous ignorez la moitié du marché.
6. Perspectives août : cinq signaux à suivre
- La part combinée chinoise open-weight grimpera probablement vers 50 %, sauf offensive tarifaire majeure d'un fournisseur US.
- Le modèle #1 mensuel continuera de tourner — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot shipent et re-pricent rapidement.
- Anthropic pourrait livrer un tier volume moins cher — Opus 5 est leur quatrième flagship en moins de deux mois (après Mythos 5, Fable 5, Sonnet 5), signal d'une couverture complète des tiers tarifaires.
- Les 1,4 TB de poids Kimi K3 verront probablement une quantification communautaire sous 2–4 semaines — jusqu'alors, l'accès pratique reste limité aux grands équipes et hôtes d'inférence comme Fireworks AI.
- Sécurité et gouvernance deviennent des critères formels — évasion sandbox OpenAI, AI Kill Switch Act proposé, et cadre White House de revue pré-release attendu avant le 1er août.
7. Cinq étapes : construire un routage par tier qui survive à août
- Mapper les chaînes par tâche : chat/créatif/roleplay → DeepSeek V4 Flash / Mimo V2.5 ; classification/raisonnement complexe/agents critiques → Claude Opus 5 / GPT-5.6.
- Plafonds de dépenses : budgets tokens quotidiens sur modèles frontier ; repli auto sur GLM 5.2 ou DeepSeek Flash en cas de dépassement.
- Consulter openrouter.ai/rankings chaque semaine : les classements bougent quotidiennement — vérifier le Top 10 avant citation ; les tarifs preview finissent souvent avec des pics de rang.
- Backup open-weight local : GLM 5.2 / Kimi K3 sur Mac via MLX pour repli offline lors de rate limits ou changements compliance.
- Exécuter un set d'évaluation 20 tâches : mêmes tâches sur modèles économiques et frontier ; journaliser taux de succès et coût par tâche dans le SOP d'équipe.
8. Analyse profonde : capacité et popularité divergent
La ligne à retenir de juillet : capacité et popularité se séparent. Les modèles open-weight chinois ont acheté la moitié du marché par le prix — un écart ~35× entre DeepSeek V4 Flash et GPT-5.5 quand 80–90 % des tâches quotidiennes sont « assez bonnes ». Les labs US closed frontier défendent l'autre moitié avec pricing power sur les tâches dures : le score FrontierBench 43,3 % de Claude Opus 5 et l'historique de sécurité relativement propre d'Anthropic expliquent pourquoi les entreprises paient encore premium.
À la couche app, Hermes Agent tient 45 % des parts de tokens d'apps trackées ; la famille agents de code (Kilo Code, OpenClaw, Claude Code, Cline) remplit le reste. Pour les développeurs Mac, les tables de routage doivent se scinder par workload — complétions Cursor, chaînes agent OpenClaw et boucles d'auto-amélioration Hermes exigent souvent des ID de modèle optimaux différents.
Indépendants : OpenRouter reste le moyen le plus rapide de A/B-tester des dizaines de modèles derrière une clé API. Commencer les workloads code avec DeepSeek V4 Flash pour le coût et GLM 5.2 pour la planification style Opus ; réserver les modèles fermés premium aux étapes où les modèles économiques échouent réellement.
9. Conclusion : routage par tiers + mémoire unifiée Mac
Une box cloud Windows/Linux peut appeler les APIs OpenRouter, mais elle est en retrait sur l'inférence MLX locale, la synergie toolchain Cursor, l'uptime agent 24/7 et les workflows graphiques face à un Mac Apple Silicon. Si vous naviguez l'écart « centimes DeepSeek vs dollars Claude par heure » et avez besoin d'un backup local prévisible plus offload remote aux pics, adoptez une stack trois niveaux : MLX local pour le volume quotidien GLM 5.2 / Kimi K3 ; API OpenRouter pour Opus 5 sur les étapes dures et DeepSeek Flash sur le volume ; nœuds Mac distants MACGPU pour agents batch nocturnes et jobs long contexte qui stressent la mémoire unifiée — un compute contrôlé est la meilleure couverture avant la vague de modèles d'août.