QWEN3.8-MAX
OPEN_
SOURCE_
OU_PAS.
Réponse courte : pas encore. Le 3 août 2026, Alibaba a rendu son nouveau modèle phare Qwen3.8-Max disponible via son API cloud et l'a étiqueté « Open-Source » sur qwen.ai. À la date de publication, aucun dépôt sur Hugging Face ou ModelScope, aucune licence, aucune date confirmée — seule la promesse que les poids de Qwen3.8-Max et du plus compact Qwen3.8-27B arriveront « la semaine prochaine ». Point de friction : le label précède les poids ; tous les scores proviennent du banc d'essai d'Alibaba ; le classement Arena est marqué « Preliminary ». Synthèse : seul modèle non-Anthropic dans le top 8 d'Arena Text, au niveau de Kimi K3 — mais l'affirmation « première ligue mondiale » attend une vérification indépendante. Plan : enjeux → chronologie → specs → architecture → comparaison → controverse open source → contexte → 5 étapes → FAQ → architecture Mac.
1. Enjeux : pourquoi le 3 août mérite une lecture mesurée
1) Le label « Open-Source » avant les poids : qwen.ai l'a affiché le jour du GA — sans dépôt, licence ni calendrier ferme. 2) Tous les benchmarks sont auto-évalués : PaperBench, QwenSWEBench, RecreationBench — aucune reproduction par Artificial Analysis ou Arena.ai. 3) Transparence insuffisante en preview : le 19 juillet, paramètres actifs non divulgués, interdiction d'usage automatisé en production, absence de model card. 4) Déploiement local irréaliste : 2,4 billions de paramètres exigent un datacenter multi-nœuds ; voie pragmatique : API ou Qwen3.8-27B. 5) Divulgation tardive des paramètres actifs : Kimi K3 (~50B), DeepSeek (49B) — Alibaba n'a révélé « 95B » qu'au stade GA.
2. Chronologie : ce qui a été livré — et ce qui ne l'a pas été
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI publie Kimi K3, MoE 2,8T, avec benchmarks indépendants et rapport technique |
| 19 juillet 2026 | Preview Qwen3.8-Max via Token Plan, Qoder, QoderWork — 10 % du tarif final, sans paramètres actifs ni tableau de scores, ToS interdisant l'usage automatisé en production |
| 27 juillet 2026 | Kimi K3 publie ses poids sur Hugging Face, avec infrastructure (kernels d'attention, bibliothèque MoE) |
| 31 juillet 2026 | DeepSeek V4-Flash dépasse V4-Pro sur neuf benchmarks agentiques et code sans augmenter les paramètres |
| 3 août 2026 | Qwen3.8-Max en GA avec tableau complet et produit agent « Qwen Office » ; actions Alibaba HK +7 %, US +4,5 % |
| « Semaine prochaine » (vers le 10 août) | Poids open pour Qwen3.8-Max et Qwen3.8-27B promis sur Hugging Face et ModelScope — aucun dépôt, licence ou date à ce jour |
Du preview (19/7) au GA (3/8) : 15 jours seulement ; 7 jours après l'open weights de Kimi K3 — le rythme de la course chinoise aux billions s'accélère.
3. Les chiffres publiés par Alibaba
| Spécification | Qwen3.8-Max |
|---|---|
| Date GA | 3 août 2026 |
| Paramètres totaux / actifs | 2,4T / 95B |
| Architecture | MoE sparse + attention hybride, base Qwen3.5 |
| Fenêtre de contexte | 1M tokens (≈983K avec thinking ; 131K max output) |
| Modalités d'entrée | Texte, image, vidéo |
| Tarification API | $2 / $6 par million tokens in/out (cache implicite $0,25, cache explicite write $2,50, read $0,17) |
| Tarifs domestiques (officiel) | Input 12 CNY / M, output 36 CNY / M, cache hit dès 1,5 CNY |
| Arena Text Arena (snapshot 1/8) | #5, 1 496 points (« Preliminary ») — seul non-Anthropic dans le top 8 |
| Arena Vision Arena | #2, derrière Claude Fable 5 |
| PaperBench (Alibaba-run) | 93,0 (+28,2 vs génération précédente) |
| OSWorld-Verified (Alibaba-run) | 86,1 |
| SWE-bench Pro (Alibaba-run) | 67,7 — derrière Fable 5 (80,0) et Opus 4.8 (69,2) |
| HLE (Alibaba-run) | 43,6 — score le plus faible parmi les modèles phares ; Fable 5 : 53,3 |
| Poids open | Promis « semaine prochaine » ; non disponibles à la publication |
Chaque ligne « Alibaba-run » provient des supports de lancement du fournisseur. Aucune plateforme indépendante n'a reproduit les scores GA.
4. Sous le capot : ce que signifient 2,4 billions de paramètres
Pourquoi un MoE sparse plutôt qu'une simple montée en échelle ?
Qwen3.8-Max conserve la base Qwen3.5 et atteint 2,4T de paramètres totaux en n'activant que 95B par token. Le coût d'inférence suit le compte actif — d'où des tarifs API de $2/$6, nettement inférieurs à Claude Opus 5 ($5/$25) et Fable 5 ($10/$50). Un pari sur l'efficacité architecturale comme levier tarifaire.
Le paramètre reasoning_effort comme curseur de coût
Trois niveaux — low, medium, xhigh (défaut) — pour arbitrer latence et profondeur. Accessible via enable_thinking (API native) ou reasoning.effort (interface Anthropic-compatible).
Autonomie longue durée : démonstrations et limites
Cas présentés : projet de code non supervisé sur 16 jours, optimisation de conception de puce en 500+ étapes, RecreationBench (reconstruction en boîte noire sans réseau ni code source). Trace partielle sur GitHub (qwen-code-dev-bot/oh-my-cli) — pas de résultat audité de façon indépendante.
La distribution comme stratégie
Intégration à « Qwen Office », API compatible OpenAI et Anthropic — un simple changement de base URL pour Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
5. Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude/GPT
| Modèle | Labo | Total / actifs | Contexte | Prix (in/out par 1M) | Poids open ? | Benchmark indépendant |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2,4T / 95B | 1M | $2 / $6 | Promis, non livrés | Aucun |
| Kimi K3 | Moonshot AI | 2,8T / ~50B (16/896) | ~1,05M | $3 / $15 | Livrés le 27 juillet | AA Intelligence Index ≈ 57,11 |
| DeepSeek V4-Pro | DeepSeek | 1,6T / 49B | 1M | Non entièrement publié | Livrés | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | DeepSeek | Identique à V4-Pro | 1M | Non entièrement publié | Livrés | 9 benchmarks agent/code > V4-Pro |
| Claude Opus 5 | Anthropic | Non divulgué | 1M | $5 / $25 | Fermé | Arena top tier |
| Claude Fable 5 | Anthropic | Non divulgué | 1M | $10 / $50 | Fermé | Arena Text #1 |
Seul test indépendant comparable (269 fichiers, architecture logicielle, évaluation en aveugle) : Kimi K3 83/100, Qwen3.8-Max-Preview 80/100 — match serré, pas de domination. Qwen3.8-Max : API moins chère, multimodalité plus large. Kimi K3 : poids publics, scores tiers.
6. Le problème du label open source
- Le tag est en ligne avant les poids. Décision marketing — à traiter avec prudence tant qu'aucun dépôt n'existe.
- Chaque benchmark est auto-évalué — QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench inclus. Arena : « Preliminary ».
- Note de bas de page sur Fable 5 — « Fable 5 results may involve fallbacks » sans méthodologie équivalente publiée.
- Transparence en preview — plusieurs évaluateurs ont déconseillé la migration production sur la seule base de l'annonce.
Cela ne signifie pas que Qwen3.8-Max est faible — le blind test suggère un modèle de premier plan. Mais des affirmations comme « deuxième derrière Fable 5 » reposent entièrement sur la caractérisation d'Alibaba jusqu'à reproduction indépendante.
7. Cinq étapes pour intégrer Qwen3.8-Max
- Choisir la voie : API (QwenCloud) vs attendre les poids open vs Qwen3.8-27B local — 99 % des équipes : API ou attendre le 27B.
- Configurer les clients dual-protocole : interfaces OpenAI et Anthropic — Cursor, OpenClaw, Claude Code par changement de base URL.
- Sélectionner le niveau de raisonnement : low/medium pour le trafic courant, xhigh pour les tâches agent difficiles via
enable_thinkingoureasoning.effort. - Activer la stratégie de cache : cache implicite à $0,25/M pour les contextes répétés ; write $2,50, read $0,17 pour le cache explicite.
- Construire la chaîne de validation et fallback : tests A/B sur vos workloads ; tâches difficiles → API Qwen3.8-Max, trafic quotidien → DeepSeek V4-Flash ou Kimi K3.
8. Perspective : la course aux billions et le virage vers l'efficacité
2026 : la ère « tout scaler » touche peut-être à sa fin. DeepSeek V4-Pro (1,6T, avril), preview Qwen3.8-Max (2,4T, juillet), Kimi K3 (2,8T) — puis V4-Flash le 31 juillet : meilleurs scores agentiques sans paramètres supplémentaires. Le design « grand total, petite activation » de Qwen3.8-Max s'inscrit dans cette logique.
Alibaba revient à l'ouverture. Première promesse de poids open pour un modèle Max — aux côtés de Kimi K3 et DeepSeek, dans un mouvement plus large des labs chinois vers les poids ouverts.
Angle consommateur sous-estimé : Qwen sur iPhone en Chine. Après l'approbation CAC de juillet 2026, Apple Intelligence en Chine s'appuie sur Qwen — version 27B compressée (<4 Go) on-device sur iPhone 15 et plus récents. Une portée bien au-delà des classements API.
Marchés financiers : HK +7 %, US +4,5 % le jour du lancement — les investisseurs y voient le retour d'Alibaba dans la conversation frontier.
Moment réglementaire américain : OpenAI et Anthropic ont signalé des sorties d'agents de tests de cybersécurité ; la Maison Blanche a convoqué les grands labs le 4 août. Contraste saisissant : accélération des poids open en Chine, resserrement de la supervision agentique aux États-Unis.
Pour les développeurs Mac : le self-hosting 2,4T est irréaliste ; l'accès API est trivial. Qwen3.8-27B quantifié via MLX sur Apple Silicon une fois publié — une capacité de calcul prévisible comme meilleure couverture.
9. FAQ
Qwen3.8-Max est-il open source aujourd'hui ? Non. L'API est utilisable via Alibaba Cloud Model Studio ; les poids ne sont pas sur Hugging Face ni ModelScope. « Open-Source » décrit une intention, pas un artefact livré.
Qwen3.8-Max vs. Kimi K3 ? Pas de confrontation autoritaire unique. Blind test : 83 vs 80 — match serré. K3 : poids publics + score AA. Qwen : API moins chère + multimodalité.
Faut-il un datacenter pour 2,4T ? Pour la version complète, oui. L'API contourne le problème. Cible locale réaliste : Qwen3.8-27B.
Peut-on faire confiance aux benchmarks d'Alibaba ? Comme affirmation fournisseur — pas comme résultat vérifié. Arena « Preliminary ». Attendre les reproductions tierces ou tester sur vos workloads.
Pourquoi cela me concerne-t-il ? Qwen alimente déjà Apple Intelligence en Chine, on-device sur les iPhone récents — un modèle chinois intégré dans une plateforme consommateur mondiale.
10. Conclusion : API Qwen + architecture hybride Mac distant
Un serveur Windows ou Linux peut appeler l'API Qwen3.8-Max, mais il n'égale pas l'intégration Cursor, l'hébergement agent OpenClaw 24/7, les replis MLX quantifiés locaux et les workflows graphiques/multimédia d'un Mac Apple Silicon. Le checkpoint 2,4T exige un datacenter ; l'API ne demande qu'un changement de base URL. Si vous avez besoin de backup offline Qwen3.8-27B, offload agent long contexte et fonctionnement stable 24/7, adoptez une architecture à trois niveaux : MLX local pour les modèles quantifiés quotidiens ; API Qwen3.8-Max pour le code, le raisonnement et le multimodal difficile ; nœuds Mac distants MACGPU pour la résidence OpenClaw/Hermes et les workloads long contexte gourmands en mémoire unifiée — pendant que la course aux poids open s'intensifie, une capacité de calcul prévisible reste la meilleure couverture.