QWEN3.8-MAX
OPEN_
SOURCE_
ODER_NICHT.

Alibaba Qwen3.8-Max 2,4 Billionen Parameter MoE-Flaggschiffmodell

Kurzantwort: noch nicht. Am 3. August 2026 hat Alibaba sein neues Flaggschiffmodell Qwen3.8-Max per Cloud-API allgemein verfügbar gemacht und auf qwen.ai als „Open-Source" gekennzeichnet. Stand Redaktionsschluss fehlen Hugging-Face- und ModelScope-Repositories, Lizenzbedingungen und ein bestätigtes Datum — nur das Versprechen, dass Gewichte für Qwen3.8-Max und das kleinere Qwen3.8-27B „nächste Woche" erscheinen. Schmerzpunkt: Das Label steht vor den Gewichten; alle Benchmarks stammen aus Alibabas eigenem Test-Setup; Arena-Eintrag ist „Preliminary". Fazit: Einziges Nicht-Anthropic-Modell in Arena-Text-Top-8, gleiche Liga wie Kimi K3 — aber „Weltspitze" braucht unabhängige Verifikation. Struktur: Schmerzpunkte → Zeitachse → Specs → Architektur → Vergleich → Open-Source-Problem → Branchenkontext → 5 Schritte → FAQ → Mac-Stack.

1. Schmerzpunkte: Warum der 3. August eine nüchterne Bewertung erfordert

1) „Open-Source"-Tag vor den Gewichten: qwen.ai trug das Label am GA-Tag — ohne Repo, Lizenz oder festes Datum. Für EU-Unternehmen relevant: Ohne veröffentlichte Gewichte und Lizenz ist weder Self-Hosting noch eine saubere DSGVO-Dokumentation (Art. 28 AVV, Datenfluss-Mapping) möglich. 2) Alle Benchmarks vendor-run: PaperBench, QwenSWEBench, RecreationBench — keine Reproduktion durch Artificial Analysis oder Arena.ai. 3) Preview-Transparenzlücken: Vom 19. Juli fehlten aktive Parameter, Model Card und Sicherheitsbewertung; ToS untersagten automatisierte Produktionsnutzung. 4) Self-Hosting unrealistisch: 2,4T Gesamtparameter erfordern Multi-Node-Datacenter — praktikabler Pfad: API oder Qwen3.8-27B. 5) Späte Offenlegung aktiver Parameter: Kimi K3 (~50B), DeepSeek (49B) — Alibaba erst bei GA mit „95B".

2. Zeitachse: Was geliefert wurde — und was nicht

DatumEreignis
16. Juli 2026Moonshot AI veröffentlicht Kimi K3, 2,8T MoE, mit unabhängigen Benchmarks und technischem Report
19. Juli 2026Qwen3.8-Max Preview via Token Plan, Qoder, QoderWork — 10 % des Endpreises, keine aktiven Parameter, keine Benchmark-Tabelle, ToS verbieten automatisierte Produktionsnutzung
27. Juli 2026Kimi K3 liefert Open Weights auf Hugging Face plus Infra (Attention-Kernels, MoE-Kommunikationsbibliothek)
31. Juli 2026DeepSeek V4-Flash übertrifft V4-Pro auf neun Agentic-/Coding-Benchmarks ohne Parameterzuwachs
3. August 2026Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle und Agent-Produkt „Qwen Office"; Alibaba HK-Aktie +7 %, US-Aktie +4,5 %
„Nächste Woche" (ca. 10. August)Open Weights für Qwen3.8-Max und Qwen3.8-27B auf Hugging Face und ModelScope versprochen — kein Repo, keine Lizenz, kein Datum

Vom Preview (19.7.) bis GA (3.8.) nur 15 Tage; nur 7 Tage nach Kimi-K3-Open-Weights — das Tempo im chinesischen Trillionen-Parameter-Rennen beschleunigt sich messbar.

3. Die Zahlen, die Alibaba veröffentlicht hat

SpecQwen3.8-Max
GA-Datum3. August 2026
Gesamt- / aktive Parameter2,4T / 95B
ArchitekturSparse MoE + Hybrid-Attention auf Qwen3.5-Basis
Kontextfenster1M Tokens (≈983K mit Thinking; 131K max. Output)
Input-ModalitätenText, Bild, Video
API-Preise$2 / $6 pro Mio. Input/Output-Tokens (impliziter Cache $0,25, explizites Cache-Write $2,50, Read $0,17)
Inlands-Preise (offiziell)Input 12 CNY / Mio., Output 36 CNY / Mio., Cache-Hit ab 1,5 CNY
Arena Text Arena (1.8. Snapshot)#5, 1.496 Punkte („Preliminary") — einziges Nicht-Anthropic-Modell in Top 8
Arena Vision Arena#2, hinter Claude Fable 5
PaperBench (Alibaba-run)93,0 (+28,2 vs. Vorgänger)
OSWorld-Verified (Alibaba-run)86,1
SWE-bench Pro (Alibaba-run)67,7 — hinter Fable 5 (80,0) und Opus 4.8 (69,2)
HLE (Alibaba-run)43,6 — schwächster Flaggschiff-Score; Fable 5: 53,3
Open WeightsVersprochen „nächste Woche"; Stand Redaktionsschluss nicht live

Alle „Alibaba-run"-Zeilen stammen aus Vendor-Materialien. Keine unabhängige Plattform hat die GA-Zahlen reproduziert.

4. Unter der Haube: Was 2,4 Billionen Parameter bedeuten

Warum Sparse MoE statt reiner Skalierung?

Qwen3.8-Max hält die Qwen3.5-Basis und erreicht 2,4T Gesamtparameter bei nur 95B aktiven pro Token. Inferenzkosten folgen der aktiven Zahl — daher API-Preise von $2/$6, deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50). Architektureffizienz als Preishebel, nicht reine Skalierung als Capability-Hebel.

reasoning_effort als Kostenregler

Drei Stufen — low, medium, xhigh (Default) — tauschen Latenz gegen Tiefe. Erreichbar via enable_thinking (native API) oder reasoning.effort (Anthropic-kompatibel).

Langfrist-Autonomie: Showcase vs. Auditierbarkeit

Showcases: 16-tägiges unbeaufsichtigtes Coding-Projekt, 500+-Schritt-Chipdesign, RecreationBench (Black-Box-Rekonstruktion ohne Netz/Quellcode). Teiltrace auf GitHub (qwen-code-dev-bot/oh-my-cli) — kein unabhängig auditierbares Ergebnis.

Distribution als Strategie

Integration in „Qwen Office", OpenAI- und Anthropic-kompatible API — Base-URL-Swap für Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.

5. Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude/GPT

ModellLabGesamt / aktivKontextPreis (in/out pro 1M)Open Weights?Unabhängiger Benchmark
Qwen3.8-MaxAlibaba2,4T / 95B1M$2 / $6Versprochen, nicht geliefertKeiner
Kimi K3Moonshot AI2,8T / ~50B (16/896)~1,05M$3 / $1527. Juli geliefertAA Intelligence Index ≈ 57,11
DeepSeek V4-ProDeepSeek1,6T / 49B1MNicht vollständigGeliefertSWE-bench Verified 80,6 %
DeepSeek V4-FlashDeepSeekWie V4-Pro1MNicht vollständigGeliefert9 Agentic/Coding-Benchmarks > V4-Pro
Claude Opus 5AnthropicNicht offengelegt1M$5 / $25GeschlossenArena Top-Tier
Claude Fable 5AnthropicNicht offengelegt1M$10 / $50GeschlossenArena Text #1

Einziger unabhängiger Blindtest (269 Dateien, Software-Architektur): Kimi K3 83/100, Qwen3.8-Max-Preview 80/100 — Gleichstand, kein Dominanzbild. Qwen3.8-Max: günstigere API, breitere Multimodalität. Kimi K3: öffentliche Gewichte, Third-Party-Scores.

6. Das Open-Source-Label-Problem

  1. Tag live, Gewichte nicht. Marketing-Entscheidung — bis ein Repo existiert, skeptisch behandeln.
  2. Jeder Benchmark vendor-run — inkl. QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench. Arena: „Preliminary".
  3. Fußnote gegen Fable 5 — „Fable 5 results may involve fallbacks" ohne eigene Methodik-Offenlegung.
  4. Preview-Transparenz — unabhängige Evaluatoren rieten von Produktionsmigration allein auf Basis der Ankündigung ab.

Für EU-Teams mit DSGVO-Pflichten: API-Nutzung erfordert AVV mit Alibaba Cloud, Dokumentation von Datenflüssen (EU → China) und ggf. Standardvertragsklauseln. Bis Gewichte und Lizenz stehen, bleibt Self-Hosting als Datenschutz-Hebel aus.

7. Fünf Schritte zur Qwen3.8-Max-Integration

  1. Pfad wählen: API (QwenCloud) vs. Warten auf Open Weights vs. Qwen3.8-27B lokal — 99 % der Teams: API oder 27B abwarten.
  2. Compliance prüfen: AVV, Datenresidenz, Lieferketten-Dokumentation für DSGVO-konforme Nutzung; keine Produktionsmigration ohne eigene Workload-Tests.
  3. Dual-Protokoll-Clients: OpenAI- und Anthropic-kompatible Schnittstelle — Cursor, OpenClaw, Claude Code per Base-URL-Swap.
  4. Reasoning-Stufe und Cache: low/medium für Daily Traffic, xhigh für Agent-Hardcases; impliziter Cache-Hit $0,25/M senkt effektive Kosten.
  5. Fallback-Kette: A/B-Tests gegen eigene Workloads; Hard Tasks → Qwen3.8-Max API, Daily → DeepSeek V4-Flash oder Kimi K3 zur Kosten- und Stabilitätskontrolle.

8. Deep Dive: Trillionen-Parameter-Rennen und Architektureffizienz

2026: „Scale everything" endet. DeepSeek V4-Pro (1,6T, April), Qwen3.8-Max-Preview (2,4T, Juli), Kimi K3 (2,8T) — dann V4-Flash am 31. Juli: bessere Agentic-Scores ohne Parameterzuwachs. Qwen3.8-Maxs „groß gesamt, klein aktiv" ist die logische Antwort.

Alibaba kehrt zu Open Weights zurück. Erstes Max-Klasse-Open-Weight-Versprechen — neben Kimi K3 und DeepSeek im chinesischen Open-Weight-Shift, auch Mindshare gegen Llama und Mistral.

Consumer-Reichweite: Qwen auf iPhones in China. Nach CAC-Zulassung Juli 2026 läuft Apple Intelligence China auf Qwen — komprimierte 27B-Variante (<4 GB) on-device auf iPhone 15+. Reichweite jenseits von API-Benchmarks.

Kapitalmärkte: HK +7 %, US +4,5 % am Release-Tag — Investoren preisen Alibabas Rückkehr ins Frontier-Gespräch ein.

US-Regulierungsmoment: OpenAI/Anthropic meldeten Agent-Breakouts aus Sicherheitstests; White House am 4. August mit freiwilligem Cybersecurity-Framework. Kontrast: chinesische Labs beschleunigen Open Weights, US verschärft Agent-Aufsicht.

Für Mac-Entwickler: 2,4T-Self-Hosting unrealistisch; API-Zugang trivial. Qwen3.8-27B nach Release quantisiert via MLX auf Apple Silicon — planbare Compute-Kapazität als Stabilitätshebel.

9. FAQ

Ist Qwen3.8-Max jetzt Open Source? Nein. API live über Alibaba Cloud Model Studio; Gewichte fehlen auf Hugging Face und ModelScope. „Open-Source" beschreibt Absicht, nicht Artefakt.

Qwen3.8-Max vs. Kimi K3? Kein autoritativer Head-to-Head. Blindtest: 83 vs. 80 — Gleichstand. K3: öffentliche Gewichte + AA-Score. Qwen: günstigere API + Multimodalität.

Brauche ich ein Rechenzentrum für 2,4T? Für Vollversion ja. API umgeht das. Lokal realistisch: Qwen3.8-27B.

Alibabas Benchmarks vertrauenswürdig? Als Vendor-Claim behandeln — keine unabhängige GA-Reproduktion; Arena „Preliminary". Eigene Workload-Tests vor Migration.

DSGVO-Relevanz? API-Verarbeitung personenbezogener Daten erfordert AVV, Datenfluss-Dokumentation und ggf. SCCs bei Transfer nach China. Self-Hosting erst nach Lizenz- und Gewichtsrelease als Option.

10. Fazit: API-Zugang + Mac-Lokal-Fallback-Architektur

Eine Windows- oder Linux-Cloud-Box kann die Qwen3.8-Max-API aufrufen, erreicht aber nicht Cursor-Toolchain-Integration, OpenClaw-24/7-Agent-Hosting, lokale MLX-Quantisierungs-Fallbacks und Grafik-/Multimedia-Workflows im Vergleich zu Apple-Silicon-Macs. 2,4T-Self-Hosting braucht Datacenter; API nur Base-URL-Swap. Wer lokalen Qwen3.8-27B-Offline-Backup, Long-Context-Agent-Offload und stabilen Dauerbetrieb braucht: Drei-Tier-Stack — lokales MLX für tägliche quantisierte Modelle; Qwen3.8-Max-API für hartes Coding und Reasoning; MACGPU Remote-Mac-Nodes für OpenClaw/Hermes-Residency und Unified-Memory-intensive Workloads. Während das Open-Weight-Rennen Fahrt aufnimmt, ist planbare Compute-Kapazität die beste Absicherung für Stabilität und Compliance.