QWEN3.8-MAX
OPEN_
SOURCE_
OU_PAS.

Alibaba Qwen3.8-Max modèle phare MoE 2,4 billions de paramètres

Réponse courte : pas encore. Le 3 août 2026, Alibaba a rendu son nouveau modèle phare Qwen3.8-Max disponible via son API cloud et l'a étiqueté « Open-Source » sur qwen.ai. À la date de publication, aucun dépôt sur Hugging Face ou ModelScope, aucune licence, aucune date confirmée — seule la promesse que les poids de Qwen3.8-Max et du plus compact Qwen3.8-27B arriveront « la semaine prochaine ». Point de friction : le label précède les poids ; tous les scores proviennent du banc d'essai d'Alibaba ; le classement Arena est marqué « Preliminary ». Synthèse : seul modèle non-Anthropic dans le top 8 d'Arena Text, au niveau de Kimi K3 — mais l'affirmation « première ligue mondiale » attend une vérification indépendante. Plan : enjeux → chronologie → specs → architecture → comparaison → controverse open source → contexte → 5 étapes → FAQ → architecture Mac.

1. Enjeux : pourquoi le 3 août mérite une lecture mesurée

1) Le label « Open-Source » avant les poids : qwen.ai l'a affiché le jour du GA — sans dépôt, licence ni calendrier ferme. 2) Tous les benchmarks sont auto-évalués : PaperBench, QwenSWEBench, RecreationBench — aucune reproduction par Artificial Analysis ou Arena.ai. 3) Transparence insuffisante en preview : le 19 juillet, paramètres actifs non divulgués, interdiction d'usage automatisé en production, absence de model card. 4) Déploiement local irréaliste : 2,4 billions de paramètres exigent un datacenter multi-nœuds ; voie pragmatique : API ou Qwen3.8-27B. 5) Divulgation tardive des paramètres actifs : Kimi K3 (~50B), DeepSeek (49B) — Alibaba n'a révélé « 95B » qu'au stade GA.

2. Chronologie : ce qui a été livré — et ce qui ne l'a pas été

DateÉvénement
16 juillet 2026Moonshot AI publie Kimi K3, MoE 2,8T, avec benchmarks indépendants et rapport technique
19 juillet 2026Preview Qwen3.8-Max via Token Plan, Qoder, QoderWork — 10 % du tarif final, sans paramètres actifs ni tableau de scores, ToS interdisant l'usage automatisé en production
27 juillet 2026Kimi K3 publie ses poids sur Hugging Face, avec infrastructure (kernels d'attention, bibliothèque MoE)
31 juillet 2026DeepSeek V4-Flash dépasse V4-Pro sur neuf benchmarks agentiques et code sans augmenter les paramètres
3 août 2026Qwen3.8-Max en GA avec tableau complet et produit agent « Qwen Office » ; actions Alibaba HK +7 %, US +4,5 %
« Semaine prochaine » (vers le 10 août)Poids open pour Qwen3.8-Max et Qwen3.8-27B promis sur Hugging Face et ModelScope — aucun dépôt, licence ou date à ce jour

Du preview (19/7) au GA (3/8) : 15 jours seulement ; 7 jours après l'open weights de Kimi K3 — le rythme de la course chinoise aux billions s'accélère.

3. Les chiffres publiés par Alibaba

SpécificationQwen3.8-Max
Date GA3 août 2026
Paramètres totaux / actifs2,4T / 95B
ArchitectureMoE sparse + attention hybride, base Qwen3.5
Fenêtre de contexte1M tokens (≈983K avec thinking ; 131K max output)
Modalités d'entréeTexte, image, vidéo
Tarification API$2 / $6 par million tokens in/out (cache implicite $0,25, cache explicite write $2,50, read $0,17)
Tarifs domestiques (officiel)Input 12 CNY / M, output 36 CNY / M, cache hit dès 1,5 CNY
Arena Text Arena (snapshot 1/8)#5, 1 496 points (« Preliminary ») — seul non-Anthropic dans le top 8
Arena Vision Arena#2, derrière Claude Fable 5
PaperBench (Alibaba-run)93,0 (+28,2 vs génération précédente)
OSWorld-Verified (Alibaba-run)86,1
SWE-bench Pro (Alibaba-run)67,7 — derrière Fable 5 (80,0) et Opus 4.8 (69,2)
HLE (Alibaba-run)43,6 — score le plus faible parmi les modèles phares ; Fable 5 : 53,3
Poids openPromis « semaine prochaine » ; non disponibles à la publication

Chaque ligne « Alibaba-run » provient des supports de lancement du fournisseur. Aucune plateforme indépendante n'a reproduit les scores GA.

4. Sous le capot : ce que signifient 2,4 billions de paramètres

Pourquoi un MoE sparse plutôt qu'une simple montée en échelle ?

Qwen3.8-Max conserve la base Qwen3.5 et atteint 2,4T de paramètres totaux en n'activant que 95B par token. Le coût d'inférence suit le compte actif — d'où des tarifs API de $2/$6, nettement inférieurs à Claude Opus 5 ($5/$25) et Fable 5 ($10/$50). Un pari sur l'efficacité architecturale comme levier tarifaire.

Le paramètre reasoning_effort comme curseur de coût

Trois niveaux — low, medium, xhigh (défaut) — pour arbitrer latence et profondeur. Accessible via enable_thinking (API native) ou reasoning.effort (interface Anthropic-compatible).

Autonomie longue durée : démonstrations et limites

Cas présentés : projet de code non supervisé sur 16 jours, optimisation de conception de puce en 500+ étapes, RecreationBench (reconstruction en boîte noire sans réseau ni code source). Trace partielle sur GitHub (qwen-code-dev-bot/oh-my-cli) — pas de résultat audité de façon indépendante.

La distribution comme stratégie

Intégration à « Qwen Office », API compatible OpenAI et Anthropic — un simple changement de base URL pour Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.

5. Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude/GPT

ModèleLaboTotal / actifsContextePrix (in/out par 1M)Poids open ?Benchmark indépendant
Qwen3.8-MaxAlibaba2,4T / 95B1M$2 / $6Promis, non livrésAucun
Kimi K3Moonshot AI2,8T / ~50B (16/896)~1,05M$3 / $15Livrés le 27 juilletAA Intelligence Index ≈ 57,11
DeepSeek V4-ProDeepSeek1,6T / 49B1MNon entièrement publiéLivrésSWE-bench Verified 80,6 %
DeepSeek V4-FlashDeepSeekIdentique à V4-Pro1MNon entièrement publiéLivrés9 benchmarks agent/code > V4-Pro
Claude Opus 5AnthropicNon divulgué1M$5 / $25FerméArena top tier
Claude Fable 5AnthropicNon divulgué1M$10 / $50FerméArena Text #1

Seul test indépendant comparable (269 fichiers, architecture logicielle, évaluation en aveugle) : Kimi K3 83/100, Qwen3.8-Max-Preview 80/100 — match serré, pas de domination. Qwen3.8-Max : API moins chère, multimodalité plus large. Kimi K3 : poids publics, scores tiers.

6. Le problème du label open source

  1. Le tag est en ligne avant les poids. Décision marketing — à traiter avec prudence tant qu'aucun dépôt n'existe.
  2. Chaque benchmark est auto-évalué — QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench inclus. Arena : « Preliminary ».
  3. Note de bas de page sur Fable 5 — « Fable 5 results may involve fallbacks » sans méthodologie équivalente publiée.
  4. Transparence en preview — plusieurs évaluateurs ont déconseillé la migration production sur la seule base de l'annonce.

Cela ne signifie pas que Qwen3.8-Max est faible — le blind test suggère un modèle de premier plan. Mais des affirmations comme « deuxième derrière Fable 5 » reposent entièrement sur la caractérisation d'Alibaba jusqu'à reproduction indépendante.

7. Cinq étapes pour intégrer Qwen3.8-Max

  1. Choisir la voie : API (QwenCloud) vs attendre les poids open vs Qwen3.8-27B local — 99 % des équipes : API ou attendre le 27B.
  2. Configurer les clients dual-protocole : interfaces OpenAI et Anthropic — Cursor, OpenClaw, Claude Code par changement de base URL.
  3. Sélectionner le niveau de raisonnement : low/medium pour le trafic courant, xhigh pour les tâches agent difficiles via enable_thinking ou reasoning.effort.
  4. Activer la stratégie de cache : cache implicite à $0,25/M pour les contextes répétés ; write $2,50, read $0,17 pour le cache explicite.
  5. Construire la chaîne de validation et fallback : tests A/B sur vos workloads ; tâches difficiles → API Qwen3.8-Max, trafic quotidien → DeepSeek V4-Flash ou Kimi K3.

8. Perspective : la course aux billions et le virage vers l'efficacité

2026 : la ère « tout scaler » touche peut-être à sa fin. DeepSeek V4-Pro (1,6T, avril), preview Qwen3.8-Max (2,4T, juillet), Kimi K3 (2,8T) — puis V4-Flash le 31 juillet : meilleurs scores agentiques sans paramètres supplémentaires. Le design « grand total, petite activation » de Qwen3.8-Max s'inscrit dans cette logique.

Alibaba revient à l'ouverture. Première promesse de poids open pour un modèle Max — aux côtés de Kimi K3 et DeepSeek, dans un mouvement plus large des labs chinois vers les poids ouverts.

Angle consommateur sous-estimé : Qwen sur iPhone en Chine. Après l'approbation CAC de juillet 2026, Apple Intelligence en Chine s'appuie sur Qwen — version 27B compressée (<4 Go) on-device sur iPhone 15 et plus récents. Une portée bien au-delà des classements API.

Marchés financiers : HK +7 %, US +4,5 % le jour du lancement — les investisseurs y voient le retour d'Alibaba dans la conversation frontier.

Moment réglementaire américain : OpenAI et Anthropic ont signalé des sorties d'agents de tests de cybersécurité ; la Maison Blanche a convoqué les grands labs le 4 août. Contraste saisissant : accélération des poids open en Chine, resserrement de la supervision agentique aux États-Unis.

Pour les développeurs Mac : le self-hosting 2,4T est irréaliste ; l'accès API est trivial. Qwen3.8-27B quantifié via MLX sur Apple Silicon une fois publié — une capacité de calcul prévisible comme meilleure couverture.

9. FAQ

Qwen3.8-Max est-il open source aujourd'hui ? Non. L'API est utilisable via Alibaba Cloud Model Studio ; les poids ne sont pas sur Hugging Face ni ModelScope. « Open-Source » décrit une intention, pas un artefact livré.

Qwen3.8-Max vs. Kimi K3 ? Pas de confrontation autoritaire unique. Blind test : 83 vs 80 — match serré. K3 : poids publics + score AA. Qwen : API moins chère + multimodalité.

Faut-il un datacenter pour 2,4T ? Pour la version complète, oui. L'API contourne le problème. Cible locale réaliste : Qwen3.8-27B.

Peut-on faire confiance aux benchmarks d'Alibaba ? Comme affirmation fournisseur — pas comme résultat vérifié. Arena « Preliminary ». Attendre les reproductions tierces ou tester sur vos workloads.

Pourquoi cela me concerne-t-il ? Qwen alimente déjà Apple Intelligence en Chine, on-device sur les iPhone récents — un modèle chinois intégré dans une plateforme consommateur mondiale.

10. Conclusion : API Qwen + architecture hybride Mac distant

Un serveur Windows ou Linux peut appeler l'API Qwen3.8-Max, mais il n'égale pas l'intégration Cursor, l'hébergement agent OpenClaw 24/7, les replis MLX quantifiés locaux et les workflows graphiques/multimédia d'un Mac Apple Silicon. Le checkpoint 2,4T exige un datacenter ; l'API ne demande qu'un changement de base URL. Si vous avez besoin de backup offline Qwen3.8-27B, offload agent long contexte et fonctionnement stable 24/7, adoptez une architecture à trois niveaux : MLX local pour les modèles quantifiés quotidiens ; API Qwen3.8-Max pour le code, le raisonnement et le multimodal difficile ; nœuds Mac distants MACGPU pour la résidence OpenClaw/Hermes et les workloads long contexte gourmands en mémoire unifiée — pendant que la course aux poids open s'intensifie, une capacité de calcul prévisible reste la meilleure couverture.