QWEN3.8-MAX
OPEN_
SOURCE_
ODER_NICHT.
Kurzantwort: noch nicht. Am 3. August 2026 hat Alibaba sein neues Flaggschiffmodell Qwen3.8-Max per Cloud-API allgemein verfügbar gemacht und auf qwen.ai als „Open-Source" gekennzeichnet. Stand Redaktionsschluss fehlen Hugging-Face- und ModelScope-Repositories, Lizenzbedingungen und ein bestätigtes Datum — nur das Versprechen, dass Gewichte für Qwen3.8-Max und das kleinere Qwen3.8-27B „nächste Woche" erscheinen. Schmerzpunkt: Das Label steht vor den Gewichten; alle Benchmarks stammen aus Alibabas eigenem Test-Setup; Arena-Eintrag ist „Preliminary". Fazit: Einziges Nicht-Anthropic-Modell in Arena-Text-Top-8, gleiche Liga wie Kimi K3 — aber „Weltspitze" braucht unabhängige Verifikation. Struktur: Schmerzpunkte → Zeitachse → Specs → Architektur → Vergleich → Open-Source-Problem → Branchenkontext → 5 Schritte → FAQ → Mac-Stack.
1. Schmerzpunkte: Warum der 3. August eine nüchterne Bewertung erfordert
1) „Open-Source"-Tag vor den Gewichten: qwen.ai trug das Label am GA-Tag — ohne Repo, Lizenz oder festes Datum. Für EU-Unternehmen relevant: Ohne veröffentlichte Gewichte und Lizenz ist weder Self-Hosting noch eine saubere DSGVO-Dokumentation (Art. 28 AVV, Datenfluss-Mapping) möglich. 2) Alle Benchmarks vendor-run: PaperBench, QwenSWEBench, RecreationBench — keine Reproduktion durch Artificial Analysis oder Arena.ai. 3) Preview-Transparenzlücken: Vom 19. Juli fehlten aktive Parameter, Model Card und Sicherheitsbewertung; ToS untersagten automatisierte Produktionsnutzung. 4) Self-Hosting unrealistisch: 2,4T Gesamtparameter erfordern Multi-Node-Datacenter — praktikabler Pfad: API oder Qwen3.8-27B. 5) Späte Offenlegung aktiver Parameter: Kimi K3 (~50B), DeepSeek (49B) — Alibaba erst bei GA mit „95B".
2. Zeitachse: Was geliefert wurde — und was nicht
| Datum | Ereignis |
|---|---|
| 16. Juli 2026 | Moonshot AI veröffentlicht Kimi K3, 2,8T MoE, mit unabhängigen Benchmarks und technischem Report |
| 19. Juli 2026 | Qwen3.8-Max Preview via Token Plan, Qoder, QoderWork — 10 % des Endpreises, keine aktiven Parameter, keine Benchmark-Tabelle, ToS verbieten automatisierte Produktionsnutzung |
| 27. Juli 2026 | Kimi K3 liefert Open Weights auf Hugging Face plus Infra (Attention-Kernels, MoE-Kommunikationsbibliothek) |
| 31. Juli 2026 | DeepSeek V4-Flash übertrifft V4-Pro auf neun Agentic-/Coding-Benchmarks ohne Parameterzuwachs |
| 3. August 2026 | Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle und Agent-Produkt „Qwen Office"; Alibaba HK-Aktie +7 %, US-Aktie +4,5 % |
| „Nächste Woche" (ca. 10. August) | Open Weights für Qwen3.8-Max und Qwen3.8-27B auf Hugging Face und ModelScope versprochen — kein Repo, keine Lizenz, kein Datum |
Vom Preview (19.7.) bis GA (3.8.) nur 15 Tage; nur 7 Tage nach Kimi-K3-Open-Weights — das Tempo im chinesischen Trillionen-Parameter-Rennen beschleunigt sich messbar.
3. Die Zahlen, die Alibaba veröffentlicht hat
| Spec | Qwen3.8-Max |
|---|---|
| GA-Datum | 3. August 2026 |
| Gesamt- / aktive Parameter | 2,4T / 95B |
| Architektur | Sparse MoE + Hybrid-Attention auf Qwen3.5-Basis |
| Kontextfenster | 1M Tokens (≈983K mit Thinking; 131K max. Output) |
| Input-Modalitäten | Text, Bild, Video |
| API-Preise | $2 / $6 pro Mio. Input/Output-Tokens (impliziter Cache $0,25, explizites Cache-Write $2,50, Read $0,17) |
| Inlands-Preise (offiziell) | Input 12 CNY / Mio., Output 36 CNY / Mio., Cache-Hit ab 1,5 CNY |
| Arena Text Arena (1.8. Snapshot) | #5, 1.496 Punkte („Preliminary") — einziges Nicht-Anthropic-Modell in Top 8 |
| Arena Vision Arena | #2, hinter Claude Fable 5 |
| PaperBench (Alibaba-run) | 93,0 (+28,2 vs. Vorgänger) |
| OSWorld-Verified (Alibaba-run) | 86,1 |
| SWE-bench Pro (Alibaba-run) | 67,7 — hinter Fable 5 (80,0) und Opus 4.8 (69,2) |
| HLE (Alibaba-run) | 43,6 — schwächster Flaggschiff-Score; Fable 5: 53,3 |
| Open Weights | Versprochen „nächste Woche"; Stand Redaktionsschluss nicht live |
Alle „Alibaba-run"-Zeilen stammen aus Vendor-Materialien. Keine unabhängige Plattform hat die GA-Zahlen reproduziert.
4. Unter der Haube: Was 2,4 Billionen Parameter bedeuten
Warum Sparse MoE statt reiner Skalierung?
Qwen3.8-Max hält die Qwen3.5-Basis und erreicht 2,4T Gesamtparameter bei nur 95B aktiven pro Token. Inferenzkosten folgen der aktiven Zahl — daher API-Preise von $2/$6, deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50). Architektureffizienz als Preishebel, nicht reine Skalierung als Capability-Hebel.
reasoning_effort als Kostenregler
Drei Stufen — low, medium, xhigh (Default) — tauschen Latenz gegen Tiefe. Erreichbar via enable_thinking (native API) oder reasoning.effort (Anthropic-kompatibel).
Langfrist-Autonomie: Showcase vs. Auditierbarkeit
Showcases: 16-tägiges unbeaufsichtigtes Coding-Projekt, 500+-Schritt-Chipdesign, RecreationBench (Black-Box-Rekonstruktion ohne Netz/Quellcode). Teiltrace auf GitHub (qwen-code-dev-bot/oh-my-cli) — kein unabhängig auditierbares Ergebnis.
Distribution als Strategie
Integration in „Qwen Office", OpenAI- und Anthropic-kompatible API — Base-URL-Swap für Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw.
5. Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude/GPT
| Modell | Lab | Gesamt / aktiv | Kontext | Preis (in/out pro 1M) | Open Weights? | Unabhängiger Benchmark |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2,4T / 95B | 1M | $2 / $6 | Versprochen, nicht geliefert | Keiner |
| Kimi K3 | Moonshot AI | 2,8T / ~50B (16/896) | ~1,05M | $3 / $15 | 27. Juli geliefert | AA Intelligence Index ≈ 57,11 |
| DeepSeek V4-Pro | DeepSeek | 1,6T / 49B | 1M | Nicht vollständig | Geliefert | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | DeepSeek | Wie V4-Pro | 1M | Nicht vollständig | Geliefert | 9 Agentic/Coding-Benchmarks > V4-Pro |
| Claude Opus 5 | Anthropic | Nicht offengelegt | 1M | $5 / $25 | Geschlossen | Arena Top-Tier |
| Claude Fable 5 | Anthropic | Nicht offengelegt | 1M | $10 / $50 | Geschlossen | Arena Text #1 |
Einziger unabhängiger Blindtest (269 Dateien, Software-Architektur): Kimi K3 83/100, Qwen3.8-Max-Preview 80/100 — Gleichstand, kein Dominanzbild. Qwen3.8-Max: günstigere API, breitere Multimodalität. Kimi K3: öffentliche Gewichte, Third-Party-Scores.
6. Das Open-Source-Label-Problem
- Tag live, Gewichte nicht. Marketing-Entscheidung — bis ein Repo existiert, skeptisch behandeln.
- Jeder Benchmark vendor-run — inkl. QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench. Arena: „Preliminary".
- Fußnote gegen Fable 5 — „Fable 5 results may involve fallbacks" ohne eigene Methodik-Offenlegung.
- Preview-Transparenz — unabhängige Evaluatoren rieten von Produktionsmigration allein auf Basis der Ankündigung ab.
Für EU-Teams mit DSGVO-Pflichten: API-Nutzung erfordert AVV mit Alibaba Cloud, Dokumentation von Datenflüssen (EU → China) und ggf. Standardvertragsklauseln. Bis Gewichte und Lizenz stehen, bleibt Self-Hosting als Datenschutz-Hebel aus.
7. Fünf Schritte zur Qwen3.8-Max-Integration
- Pfad wählen: API (QwenCloud) vs. Warten auf Open Weights vs. Qwen3.8-27B lokal — 99 % der Teams: API oder 27B abwarten.
- Compliance prüfen: AVV, Datenresidenz, Lieferketten-Dokumentation für DSGVO-konforme Nutzung; keine Produktionsmigration ohne eigene Workload-Tests.
- Dual-Protokoll-Clients: OpenAI- und Anthropic-kompatible Schnittstelle — Cursor, OpenClaw, Claude Code per Base-URL-Swap.
- Reasoning-Stufe und Cache: low/medium für Daily Traffic, xhigh für Agent-Hardcases; impliziter Cache-Hit $0,25/M senkt effektive Kosten.
- Fallback-Kette: A/B-Tests gegen eigene Workloads; Hard Tasks → Qwen3.8-Max API, Daily → DeepSeek V4-Flash oder Kimi K3 zur Kosten- und Stabilitätskontrolle.
8. Deep Dive: Trillionen-Parameter-Rennen und Architektureffizienz
2026: „Scale everything" endet. DeepSeek V4-Pro (1,6T, April), Qwen3.8-Max-Preview (2,4T, Juli), Kimi K3 (2,8T) — dann V4-Flash am 31. Juli: bessere Agentic-Scores ohne Parameterzuwachs. Qwen3.8-Maxs „groß gesamt, klein aktiv" ist die logische Antwort.
Alibaba kehrt zu Open Weights zurück. Erstes Max-Klasse-Open-Weight-Versprechen — neben Kimi K3 und DeepSeek im chinesischen Open-Weight-Shift, auch Mindshare gegen Llama und Mistral.
Consumer-Reichweite: Qwen auf iPhones in China. Nach CAC-Zulassung Juli 2026 läuft Apple Intelligence China auf Qwen — komprimierte 27B-Variante (<4 GB) on-device auf iPhone 15+. Reichweite jenseits von API-Benchmarks.
Kapitalmärkte: HK +7 %, US +4,5 % am Release-Tag — Investoren preisen Alibabas Rückkehr ins Frontier-Gespräch ein.
US-Regulierungsmoment: OpenAI/Anthropic meldeten Agent-Breakouts aus Sicherheitstests; White House am 4. August mit freiwilligem Cybersecurity-Framework. Kontrast: chinesische Labs beschleunigen Open Weights, US verschärft Agent-Aufsicht.
Für Mac-Entwickler: 2,4T-Self-Hosting unrealistisch; API-Zugang trivial. Qwen3.8-27B nach Release quantisiert via MLX auf Apple Silicon — planbare Compute-Kapazität als Stabilitätshebel.
9. FAQ
Ist Qwen3.8-Max jetzt Open Source? Nein. API live über Alibaba Cloud Model Studio; Gewichte fehlen auf Hugging Face und ModelScope. „Open-Source" beschreibt Absicht, nicht Artefakt.
Qwen3.8-Max vs. Kimi K3? Kein autoritativer Head-to-Head. Blindtest: 83 vs. 80 — Gleichstand. K3: öffentliche Gewichte + AA-Score. Qwen: günstigere API + Multimodalität.
Brauche ich ein Rechenzentrum für 2,4T? Für Vollversion ja. API umgeht das. Lokal realistisch: Qwen3.8-27B.
Alibabas Benchmarks vertrauenswürdig? Als Vendor-Claim behandeln — keine unabhängige GA-Reproduktion; Arena „Preliminary". Eigene Workload-Tests vor Migration.
DSGVO-Relevanz? API-Verarbeitung personenbezogener Daten erfordert AVV, Datenfluss-Dokumentation und ggf. SCCs bei Transfer nach China. Self-Hosting erst nach Lizenz- und Gewichtsrelease als Option.
10. Fazit: API-Zugang + Mac-Lokal-Fallback-Architektur
Eine Windows- oder Linux-Cloud-Box kann die Qwen3.8-Max-API aufrufen, erreicht aber nicht Cursor-Toolchain-Integration, OpenClaw-24/7-Agent-Hosting, lokale MLX-Quantisierungs-Fallbacks und Grafik-/Multimedia-Workflows im Vergleich zu Apple-Silicon-Macs. 2,4T-Self-Hosting braucht Datacenter; API nur Base-URL-Swap. Wer lokalen Qwen3.8-27B-Offline-Backup, Long-Context-Agent-Offload und stabilen Dauerbetrieb braucht: Drei-Tier-Stack — lokales MLX für tägliche quantisierte Modelle; Qwen3.8-Max-API für hartes Coding und Reasoning; MACGPU Remote-Mac-Nodes für OpenClaw/Hermes-Residency und Unified-Memory-intensive Workloads. Während das Open-Weight-Rennen Fahrt aufnimmt, ist planbare Compute-Kapazität die beste Absicherung für Stabilität und Compliance.