2026 CHINE IA
HAUSSE_
PRIX_
OPENWEIGHT.
En cinq jours, trois laboratoires chinois ont pris des décisions qui, lues séparément, semblent se contredire. DeepSeek a relevé certains paliers d'API jusqu'à 1 100 %. Alibaba, la même semaine, a publié les poids d'un modèle phare à 2,4 billions de paramètres qu'il n'avait jamais ouvert. Zhipu a livré GLM-5.3 et multiplié par près de 6× ses scores de programmation — sans réentraîner le socle. Douleur : le pourcentage-titre ne se lit pas sur une facture, et l'équation « modèle chinois = moins cher » ne tient plus. Leçon : la concurrence bascule du prix affiché vers le pouvoir de tarifer. Parcours : chronologie, tableaux de prix et de spécifications, trois stratégies, comparatif, points non vérifiés, checklist en cinq gestes, puis FAQ.
1. Trois contraintes qui ont vraiment changé cette semaine
- Le « 1 100 % » n'est qu'une ligne de facturation, pas la facture. Il concerne l'entrée en cache hit aux heures de pointe — le palier qui était le plus proche de la gratuité. La sortie, qui pèse le plus sur les vrais relevés, a augmenté de 350 %. L'entrée en cache miss a augmenté de 200 %.
- L'API officielle n'est plus, par défaut, l'hôte le moins cher. Aux heures de pointe, le tarif DeepSeek dépasse désormais plusieurs revendeurs (GMI Cloud, Novita et d'autres affichent encore V4-Pro sous le nouveau pic officiel). Hors pointe, V4-Pro reste nettement sous Claude Opus 5, mais Qwen3.8-Max international (2 $ / 6 $) et GPT-5.6 Luna d'OpenAI (0,20 $ / 1,20 $) sous-cotent DeepSeek hors pointe sur au moins une dimension.
- Les poids ouverts ne sont pas Apache 2.0. Alibaba a joint une licence Qwen3.8-Max sur mesure : toute activité Model-as-a-Service ou « assistant de travail IA » dépassant 50 millions de dollars sur 12 mois doit négocier une autorisation commerciale distincte. Les rumeurs d'interdiction de téléchargement aux États-Unis, dans l'UE, au Royaume-Uni ou en Corée du Sud sont fausses — le texte publié ne contient aucune clause géographique.
2. Chronologie : ce qui s'est passé, et quand
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre les poids de Kimi K3 (2,8 T de paramètres), suscitant l'attention des autorités américaines de sécurité |
| 2–3 août 2026 | Alibaba préannonce, puis lance, Qwen3.8-Max en API hébergée |
| 10 août 2026 | Meta publie Muse Glimmer (30 B, Apache 2.0) et annonce l'ouverture prochaine des poids du phare Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie les poids ouverts Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en version générale et annonce une hausse au 17 août ; Google livre Gemini 3.7 Flash à prix réduit |
| 14 août 2026 | Zhipu livre GLM-5.3, en réutilisant le socle de 743 B de GLM-5.2 |
| 17 août 2026, 00:00 heure de Pékin | La nouvelle grille DeepSeek entre en vigueur |
Reculez encore d'un cran : le 30 juillet, OpenAI a baissé de 80 % son palier le moins cher (GPT-5.6 Luna), puis les 6 et 7 août a fait de Luna le modèle par défaut des comptes gratuits, avec un dialogue texte illimité. Pendant que les laboratoires chinois relevaient leurs tarifs et ouvraient des poids de prestige, les laboratoires américains baissaient les leurs et offraient le grand public — au même moment. Ce n'est pas un hasard : ce sont les deux faces d'une même bataille de prix.
3. Les chiffres : ce qui a réellement changé
Hausse DeepSeek (effective le 17 août, 00:00 heure de Pékin ; pointe de 9 h à 12 h et de 14 h à 18 h, heure de Pékin)
| Poste (par million de tokens) | Ancien prix | Hors pointe (nouveau) | Pointe (nouveau) | Hausse en pointe |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash cache miss (entrée) | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash sortie | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro cache hit (entrée) | ¥0,025 | ¥0,15 | ¥0,30 | ~1 100 % |
| V4-Pro cache miss (entrée) | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro sortie | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Le chiffre-titre de 1 100 % s'applique spécifiquement à l'entrée en cache hit aux heures de pointe — le palier qui commençait le plus près de zéro. La sortie, plus décisive pour la plupart des factures réelles, a augmenté de 350 %. Un modèle de coût indépendant, pour une charge lourde réaliste (environ 84 M de tokens par mois, surtout hors pointe, moitié cache hit), aboutit à une hausse de facture plus proche de 1,8× — réelle, mais loin des titres les plus alarmistes. Les médias ont aussi parlé de « 11 fois », de « plus de 1 100 % » et de « 350 % » : les trois formules sont exactes, à condition de nommer le poste.
Qwen3.8-2.4T-A95B (poids ouverts de Qwen3.8-Max) : spécifications clés
| Poste | Détail |
|---|---|
| Paramètres | 2,4 T au total, 95 B actifs par token (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | 262 144 tokens natifs (point de contrôle ouvert), extensible à ~1,01 M ; la version Max hébergée vaut 1 M par défaut |
| Cadence de sortie | Aperçu le 2 août → API le 3 août → poids ouverts le 12 août |
| Tarif API (international) | 2 $ / M en entrée, 6 $ / M en sortie |
| Licence | Pas Apache 2.0 — une licence Qwen3.8-Max sur mesure |
| Pourquoi cela compte | Première fois qu'Alibaba ouvre un modèle de rang Max (phare) ; Qwen3.5 / 3.6 / 3.7 Max étaient restés en API fermée |
GLM-5.3 contre GLM-5.2 : même socle, post-entraînement seulement
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 pts |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 pts |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 pts |
| CyberGym | 77,2 % | 84,5 % | +7,3 pts |
| AutomationBench | 26,2 % | 48,2 % | +22,0 pts |
Ce sont les chiffres déclarés par Zhipu — aucune reprise indépendante n'a encore été publiée. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %) : un résultat de premier rang parmi les modèles à poids ouverts, non une victoire de frontière.
4. Trois stratégies, trois logiques
DeepSeek : de la grille unique à la tarification horaire — un problème de capacité, pas un revirement de doctrine
La lecture la plus commode voudrait que « le modèle chinois le moins cher ait enfin cédé à la pression des marges ». La structure de la grille raconte autre chose : une entreprise qui, pour la première fois, rend visibles ses contraintes de calcul dans le barème. Le tarif plat, toujours bas, fonctionnait comme un outil d'acquisition tant que la capacité GPU suivait la demande. Quand les appels ont crû de façon exponentielle et que les puces n'ont plus suivi, il a fallu rendre l'écart explicite. La formule officielle — « encourager une planification plus souple des charges » — se traduit sans détour : le calcul de pointe est devenu rare, veuillez déplacer vous-même vos lots.
Un détail que la couverture internationale a largement manqué : aux heures de pointe, l'API officielle DeepSeek est désormais plus chère que plusieurs revendeurs tiers. L'hypothèse selon laquelle « le canal officiel est toujours le moins cher pour faire tourner DeepSeek » — un pilier de sa réputation — est rompue pour la première fois.
Alibaba : les poids ouverts achètent l'écosystème ; la licence sur mesure protège le plafond de revenus
Ouvrir Qwen3.8-Max n'est pas un geste de générosité simple. Alibaba a fait deux choses à la fois : publier le point de contrôle complet à 2,4 T pour un téléchargement libre, et y attacher une licence qui n'est plus l'Apache 2.0 des Qwen plus petits. Toute activité Model-as-a-Service ou « assistant de travail IA » dont le chiffre d'affaires dépasse 50 millions de dollars sur 12 mois doit négocier une autorisation commerciale distincte. Tout produit dépassant 100 millions d'utilisateurs actifs mensuels, ou 20 millions de dollars de revenus mensuels, doit afficher de façon visible le nom du modèle.
La logique est nette : céder les poids pour gagner l'esprit des développeurs — surtout à l'étranger, où l'étiquette « modèle made in China » hésite encore chez certains acheteurs d'entreprise — tout en gardant un levier de prix sur la poignée d'acteurs capables d'en faire un métier d'inférence concurrent. C'est un pari d'une autre nature que Muse Glimmer de Meta, livré sous Apache 2.0 sans clause additionnelle. « Poids ouverts » ne désigne pas le même objet d'un communiqué à l'autre.
Une rumeur mérite d'être tuée clairement : le texte de licence n'interdit pas les téléchargements depuis les États-Unis, l'Union européenne, le Royaume-Uni ou la Corée du Sud. Il n'y a aucune clause territoriale. Dans un cycle de publication aussi rapide, relire le fichier LICENSE — et non le fil d'annonce — prend quelques secondes et évite de relayer une assertion déjà démentie.
GLM-5.3 : pas de nouveau socle, seulement un pari plus large de post-entraînement
Le fait le plus intéressant n'est pas le score, c'est la méthode : le même socle de 743 B que GLM-5.2, aucun réentraînement, et un bond d'environ 6× sur Terminal-Bench 3.0 (4,6 % → 28,3 %) obtenu uniquement en élargissant les environnements d'apprentissage par renforcement au post-entraînement. Quand les lois d'échelle du préentraînement voient leurs rendements diminuer, l'échelle du RL en post-entraînement devient un levier de performance autonome, avec un plancher de coût bien plus bas que le réentraînement d'un modèle de fondation. C'est une barrière d'entrée nettement plus basse pour les laboratoires de second rang, et c'est pourquoi des équipes sans budget de type OpenAI peuvent encore refermer l'écart sur les bancs agents et de code.
5. Face à face : DeepSeek reste-t-il le phare le moins cher ?
| Modèle | Entrée (par million de tokens) | Sortie (par million de tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Non |
| DeepSeek V4-Pro (hors pointe) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Non |
| Qwen3.8-Max (API internationale) | 2,00 $ | 6,00 $ | Oui (licence sur mesure) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Non |
| Claude Opus 5 (implicite, d'après le ratio publié par Alibaba) | ~5,00 $ | ~25,00 $ | Non |
Conversion yuan-dollar à ~¥7,15 / 1 $, indicative. Même après la hausse, le hors-pointe de DeepSeek V4-Pro reste nettement sous Claude Opus 5, mais ce n'est plus l'option la moins chère du tableau : le tarif international de Qwen3.8-Max et Luna d'OpenAI sous-cotent désormais le hors-pointe DeepSeek. « Modèle chinois = modèle le moins cher » a tenu une bonne part de 2025 et le début de 2026 ; ce n'est plus une hypothèse sûre.
À citer : entrée cache hit V4-Pro en pointe, ¥0,025 → ¥0,30 (~1 100 %) ; sortie ¥6,0 → ¥27,0 (350 %) ; Qwen3.8-Max international 2 $ / 6 $ ; GLM-5.3 sur Terminal-Bench 3.0, 4,6 % → 28,3 % sur le même socle de 743 B, sans réentraînement.
6. Ce qui est contesté ou non vérifié
- Le titre « 1 100 % » est techniquement exact, mais trompeur sans contexte. Il ne s'applique qu'à l'entrée en cache hit aux heures de pointe. La sortie — le poste qui domine la plupart des factures — a augmenté de 350 %. Les rédactions ont souvent cité des paliers différents comme s'ils racontaient toute l'histoire.
- L'affirmation selon laquelle Qwen3.8-Max tournerait sur les puces maison Zhenwu M890 (et les supernœuds « Pangu AL128 »), reprise par plusieurs médias financiers chinois, n'a pas été confirmée de façon indépendante par la documentation technique d'Alibaba ni par un banc tiers. À traiter comme un reportage voisin du fournisseur, non vérifié.
- La « faille grave » de Cursor attribuée à GLM-5.3 vient de VentureBeat et d'une divulgation de Zhipu ; les détails techniques n'ont pas été rendus publics. À lire comme une découverte d'origine fournisseur, non auditée.
- Les reports selon lesquels le ministère chinois du Commerce préparerait des contrôles d'exportation de rétorsion sur les technologies d'IA et de semi-conducteurs restent spéculatifs, sourcés à des articles non confirmés, et non à une annonce officielle. Contexte de fond, pas un fait établi.
7. Checklist en cinq gestes : comment retarifer votre pile
- Séparez les lignes de facturation. Ne multipliez pas toute la facture par 1 100 %. Cache hit, cache miss et sortie ont trois deltas distincts. Les heures de pointe sont 9 h–12 h et 14 h–18 h, heure de Pékin.
- Déplacez les lots hors pointe. L'annonce officielle demande une planification plus souple. Un modèle indépendant d'une charge lourde, surtout hors pointe, à moitié cache hit, aboutit plutôt à 1,8×, pas à 11×.
- Lisez la licence Qwen, pas le fil d'annonce. Les projets personnels et l'usage interne d'entreprise ne sont pas touchés. Le verrou s'applique si vous exploitez un Model-as-a-Service ou un assistant de travail IA ayant gagné plus de 50 millions de dollars sur 12 mois consécutifs. Il n'y a pas d'interdiction géographique.
- Traitez les scores GLM-5.3 comme des autodéclarations. Le bond 4,6 % → 28,3 % sur Terminal-Bench est du post-entraînement seulement. Aucune reprise indépendante n'est publique. Le modèle reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %).
- Routez par palier, non par « modèle chinois le moins cher ». Hors pointe, DeepSeek V4-Pro sous-cote encore Claude Opus 5. Qwen3.8-Max international et GPT-5.6 Luna sous-cotent désormais DeepSeek hors pointe sur au moins une dimension. En pointe, comparez GMI Cloud et Novita au tarif officiel.
8. Pourquoi cela compte : deux guerres de prix en parallèle
Sur le mois écoulé, les laboratoires chinois de premier rang ont enchaîné les livraisons à un rythme que la presse financière intérieure a commencé à nommer « trois mises à jour par semaine » (一周三更) — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2,8 T de paramètres) et MiniMax H3 avant eux. Le récit chinois cadre largement ces sorties comme une « revalorisation forcée de l'industrie mondiale de l'IA » — un cadrage plus affirmatif que la plupart des couvertures anglophones des mêmes événements.
Pendant ce temps, les laboratoires américains jouent l'inverse côté grand public : OpenAI a baissé de 80 % son palier le moins cher (30 juillet), puis a rendu ce modèle gratuit et illimité une semaine plus tard (6–7 août) ; Google a livré, le 13 août, un modèle orienté code à la moitié du prix de son prédécesseur vieux de trois semaines. Les laboratoires chinois ouvrent des phares et introduisent une grille étagée, plus haute, là où le calcul manque ; les laboratoires américains courent vers le gratuit et le bon marché côté consommateur. Les deux stratégies sont réelles ; elles optimisent des étages différents de l'entonnoir.
Il y a aussi une couche géopolitique qu'il faut nommer avec soin. L'ouverture de Kimi K3 en juillet avait déjà attiré l'attention des autorités américaines ; le choix d'Alibaba d'ouvrir, dans cette fenêtre précise, un phare à 2,4 T a été lu par certains analystes comme une manière de figer l'influence internationale et un récit de « parité technologique » avant un éventuel resserrement réglementaire. C'est une interprétation informée, non un fait confirmé — mais c'est une part du contexte que l'on rate si l'on ne lit que la presse technique anglophone, qui a surtout traité ces sorties comme des nouvelles produit isolées, plutôt que comme un motif national coordonné.
Le geste de Meta n'est qu'un retour partiel à la posture open source de l'ère Llama. Muse Glimmer est un modèle distillé de 30 B, non le vrai phare. Mark Zuckerberg a dit que les poids du plus grand Muse Spark 1.2, encore fermé, arriveraient « bientôt ». Si cela se produit, ce serait le premier modèle américain de rang phare publié ouvertement. À l'heure où nous écrivons, cette publication n'a pas eu lieu ; à traiter comme une intention déclarée, non comme un fait.
Pour un opérateur, la réponse pratique n'est pas de choisir un camp. Elle consiste à scinder le grand livre : pointe contre hors pointe, cache hit contre miss, seuils de licence, autodéclarations contre reprises tierces. Les API cloud absorbent encore les pics et les tests A/B de prestige. Dès que le tarif officiel de pointe cesse d'être l'hôte le moins cher et que les points de contrôle ouverts sautent vers des MoE à billions de paramètres, la mémoire unifiée d'un portable et une pile d'agents toujours allumée cèdent d'ordinaire en premier. Un chemin de contrôle plus propre consiste à poser le long contexte et le travail d'agent 24 h/24 sur un nœud Mac distant facturé à l'usage, plutôt que d'envoyer chaque token par un seul SKU officiel d'heure de pointe.
9. FAQ
DeepSeek reste-t-il moins cher que GPT-5.6 ou Claude après la hausse ?
Son hors-pointe reste moins cher que Claude Opus 5, mais ce n'est plus l'option unique la moins chère : GPT-5.6 Luna d'OpenAI (0,20 $ / 1,20 $ par million de tokens) et le tarif international de Qwen3.8-Max (2 $ / 6 $) sous-cotent désormais le nouveau hors-pointe DeepSeek sur au moins une dimension. DeepSeek reste relativement bon marché pour un modèle de rang frontière, simplement plus le moins cher absolument.
Puis-je utiliser gratuitement les poids ouverts de Qwen3.8-Max dans un produit commercial ?
Oui, dans la plupart des cas — projets personnels et usage interne d'entreprise ne sont pas touchés. Le verrou ne s'applique que si vous exploitez un Model-as-a-Service ou un assistant de travail IA ayant gagné plus de 50 millions de dollars sur 12 mois consécutifs ; ce palier exige une licence commerciale distincte auprès d'Alibaba. Si le produit dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, le nom du modèle doit être affiché de façon visible.
Qwen3.8-Max est-il interdit ou restreint pour les utilisateurs des États-Unis, de l'UE ou du Royaume-Uni ?
Non. Cette affirmation a circulé en ligne, elle est fausse : la licence publiée ne contient aucune restriction géographique. Les limites sont liées au chiffre d'affaires, non au lieu où vous ou vos utilisateurs vous trouvez.
Quelle est la vraie différence entre GLM-5.3 et GLM-5.2 ?
Rien au niveau du socle — les deux utilisent le même modèle de fondation de 743 milliards de paramètres. Les gains (environ 6× sur Terminal-Bench 3.0) viennent entièrement de l'élargissement de l'apprentissage par renforcement en post-entraînement, sans réentraînement du socle.
Meta ouvrira-t-il vraiment son modèle phare, et pas seulement le plus petit Muse Glimmer ?
Pas encore. Muse Glimmer est un modèle distillé de 30 B, non le vrai phare. Zuckerberg a dit que les poids de Muse Spark 1.2 arriveraient « bientôt ». À l'heure où nous écrivons, cette publication n'a pas eu lieu ; à traiter comme une intention déclarée, non comme un fait.
10. Sources
- Annonce tarifaire officielle de DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et les discussions de la communauté V2EX
- Dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et reportage du South China Morning Post sur les clauses de licence
- Page technique officielle GLM-5.3 de Zhipu (Z.ai), plus couvertures VentureBeat et StableLearn
- Blog officiel de Meta AI Research et couverture VentureBeat de Muse Glimmer
- Médias financiers chinois (Yicai / 第一财经, Sohu Finance) sur le rythme et le cadrage du cycle chinois de poids ouverts
Les prix, clauses de licence et scores de benchmark reflètent l'information publique à la date de publication. Vérifiez les derniers avis officiels de prix et de licence avant toute republication, et notez que les détails signalés plus haut comme non vérifiés (puces domestiques, rapport de faille Cursor, rumeurs de contrôle à l'exportation) n'ont pas été confirmés de façon indépendante.
11. Clôture : après la hausse de pointe, il faut encore un lieu pour faire tourner la pile de contrôle
Les API hébergées fonctionnent encore. Les contraintes sont désormais explicites : le tarif officiel de pointe n'est plus garanti le moins cher, la licence sur mesure reprend les gros usages commerciaux, et un point de contrôle MoE à 2,4 T n'est pas un travail de portable. Les boîtiers GPU Windows et Linux restent corrects pour l'inférence à débit, mais ils sont d'ordinaire plus faibles pour les chaînes Cursor, un OpenClaw toujours allumé, les contrôles de quantification MLX et les flux proches du graphique. Quand les limites d'API se resserrent — quotas, heures de pointe, cache miss —, le réflexe n'est plus d'empiler un second SKU cloud. Il est de poser le long contexte et la résidence d'agent sur un Mac, puis, si le portable cède, sur un Mac distant MACGPU : on s'y connecte en SSH, on facture le nœud à l'usage, on garde le portable pour éditer, et l'on cesse d'envoyer chaque token par un seul SKU officiel d'heure de pointe.