2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.
Einleitung: Wer Ende Juli das DeepSeek-Changelog verfolgte, stellte etwas Gegenintuitives fest — kein neues Modell, sondern dieselbe 284B-Architektur mit frischem Post-Training, die in Agent-Benchmarks die eigene 1,6T-V4-Pro-Vorschau übertrifft, bei API-Kosten von nur einem Bruchteil von Claude Opus 4.8. Diese Analyse basiert auf verifizierten Primärquellen: vollständige Timeline April–August, Preistabellen, Post-Training- und Harness-Framework-Details, Quervergleich mit Kimi K3, GLM-5.2 und Qwen3.8-Max, dokumentierte Kontroversen, Brancheneinordnung sowie ein fünfstufiges Umsetzungs-Playbook mit FAQ — inklusive DSGVO-relevanter Hinweise zur Datenresidenz.
30 Sekunden · TL;DR
| Release | 2026-07-31 V4-Flash-0731 offizielle API-Beta · nur API, App/Web unverändert |
| Architektur | 284B / 13B aktiv, identisch zur April-Vorschau · Leistungsgewinn ausschließlich Post-Training |
| Preis | Input $0,14 (Cache-Miss) / $0,0028 (Hit) · Output $0,28/M |
| Agent | Terminal Bench 2.0 82,7 (Herstellerangabe + Harness Minimalmodus) · übertrifft V4-Pro-Vorschau 67,9 |
| Ausstehend | V4-Pro offiziell · Agent-Framework Harness · kein bestätigtes Datum |
1. Problemstellung: Warum 0731 datenrelevant ist
- Pro-Flaggschiff verzögert, Flash „überholt". Die Community nannte Liang Wenfeng scherzhaft „Liang Baikai" — V4-Pro sollte Mitte Juli GA werden, blieb aus. Am 31. Juli übertraf Flash 0731 mit weniger Parametern die Pro-Vorschau in Agent-Scores. Pro und Harness haben weiterhin kein fixes Datum.
- Benchmarks sind framework-abhängig. Terminal Bench 2.0 (82,7) und verwandte Agent-Metriken wurden mit dem noch nicht veröffentlichten Harness-Minimalmodus gemessen. DeepSeek warnt selbst: „Scores sind extrem sensitiv gegenüber Harness-Wahl" — kein 1:1-Transfer auf Claude Code oder Cursor.
- API-only-Update, Consumer-Lag. Die Beta gilt ausschließlich für die API. Wer chat.deepseek.com unverändert wahrnimmt, beobachtet korrekt zwei Release-Zyklen: Entwickler vs. Endnutzer.
2. Timeline: Von der April-Vorschau zur Juli-„Offiziellversion"
| Datum | Ereignis |
|---|---|
| 2026-04-24 | DeepSeek-V4-Vorschau veröffentlicht und open-sourced (MIT): V4-Pro (1,6T/49B aktiv) und V4-Flash (284B/13B aktiv), beide 1M Kontext |
| 2026-07-24 | Legacy-Aliase deepseek-chat und deepseek-reasoner deaktiviert; Traffic auf V4-Namensgebung umgestellt |
| 2026-07-27 | Moonshot AI Kimi K3 (2,8T) Open Weights auf Hugging Face — größter Open-Weight-Drop des Jahres, Wettbewerbsdruck auf DeepSeek |
| 2026-07-31 | V4-Flash-0731 offizielle API-Beta; Gewichte auf Hugging Face; Changelog nennt erstmals Agent-Framework „Harness", Release „bald" |
| Stand 2026-08-05 | V4-Pro offiziell weiterhin „so schnell wie möglich". Medien zitieren unbestätigte Quellen: GA-Fenster 10.–20. August — nicht offiziell bestätigt |
3. Kerndaten auf einen Blick
| Modell | Status | Gesamt / Aktiv | Kontext | Input (Miss/Hit, $/M) | Output ($/M) | Lizenz |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell (31.07.) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Vorschau (24.04., offiziell ausstehend) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open Weights (27.07.) | 2,8T / ~104B (Community-Schätzung) | ~1,05M | $3,00 / $0,30 | $15,00 | Kimi K3 License |
| GLM-5.2 | Open (Juni 2026) | ~744B / ~40B | 1M | Nicht verifiziert | Nicht verifiziert | MIT |
| Qwen3.8-Max | API GA (02.08.), Gewichte ausstehend | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Open-Source versprochen |
Alle Preise sind Herstellerangaben. DeepSeek kündigte künftige 2×-Spitzenpreise an (Peking-Zeit 9–12 Uhr, 14–18 Uhr); Inkrafttreten bis Redaktionsschluss unbekannt.
4. Technische Analyse: Woher die Leistung kommt
4.1 Architektur unverändert — Post-Training neu
V4-Flash-0731 ist in Parameterzahl und Struktur identisch zur April-Vorschau. DeepSeek bestätigt: Der gesamte Leistungssprung stammt aus erneutem Post-Training. 284B/13B schlägt 1,6T/49B in mehreren Agent-Benchmarks — ein Signal, dass Post-Training-Qualität 2026 nahe an reiner Skalierung heranrückt.
4.2 Hybride Aufmerksamkeit: CSA+HCA, mHC, Muon
Laut Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" drei Kernänderungen:
- Hybride Attention: Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA), extern „DSA Sparse Attention", senkt Compute und VRAM bei langem Kontext;
- Manifold-Constrained Hyper-Connections (mHC): verbesserte Residual-Verbindungen;
- Muon-Optimierer: schnellere Konvergenz und Trainingsstabilität.
Herstellerangabe bei 1M Token: V4-Pro benötigt 27 % der FLOPs pro Token vs. V3.2, KV-Cache nur 10 % (unabhängige Reproduktion ausstehend).
4.3 Harness: Erstes hauseigenes Agent-Framework
Am 31. Juli erstmals „DeepSeek Harness" im Changelog — Agent-Framework für Dateizugriff, Tool-Calls und End-to-End-Engineering, Positionierung gegen Claude Code. Alle veröffentlichten Agent-Scores nutzen Harness Minimalmodus (max, top_p=0,95, temperature=1,0). Offizielle Warnung: Harness-Wahl verzerrt Ergebnisse erheblich.
5. Quervergleich: Chinesisches Open-Source-Oligopol
| Modell | Labor | Release | Gesamt | AA Intelligence Index | Kosten/Aufgabe (AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 31.07. offiziell | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16.07. Preview / 27.07. Weights | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu/Z.ai | Juni 2026 | ~744B | ~1 Pkt. über Flash | Nicht verifiziert |
| Qwen3.8-Max | Alibaba | 02.08. GA | 2,4T | Nicht verifiziert | Nicht verifiziert |
| GPT-5.6 Sol | OpenAI | Closed | — | 9+ Pkt. über Flash | $1,86 |
| Claude Fable 5 | Anthropic | Closed | — | 9+ Pkt. über Flash | $3,15 |
Intelligence Index und Kosten/Aufgabe: Artificial Analysis (unabhängig). DeepSeek Agent-Scores: Herstellerangaben — nicht direkt vergleichbar.
Kernbefund: V4-Flash führt den AA-Index nicht an, liegt hinter Kimi K3 und GLM-5.2. Kosten/Aufgabe jedoch ~1/29 von K3, ~1/62 von GPT-5.6 Sol, ~1/105 von Claude Fable 5. DeepSeek optimiert „ausreichende Intelligenz + minimaler Preis" — erklärt sieben Wochen OpenRouter-Spitzenplatz der Vorschau.
6. Kontroversen: Benchmarks mit Vorbehalt lesen
- Harness-Abhängigkeit, vom Hersteller bestätigt. Terminal Bench 2.0 (82,7 vs. 67,9) = Herstellerangabe + unreleased Framework.
- Praxisfeedback aus Übersee. 21st Century Business Herald berichtet: niedrige Cache-Hit-Rate, gelegentliche Safety-Classifier-Timeouts — Widerspruch zur „Score-Explosion"-Narrative.
- Pro/Harness-Termine unbestätigt. „10.–20. August GA" = unbestätigte Medienquellen; offizielles Changelog: „so schnell wie möglich".
- Finanzierungs-/IPO-Gerüchte. ~7,4 Mrd. USD Finanzierung, ~48,7 Mrd. USD Bewertung — nur „laut Berichten", keine regulatorische Bestätigung.
7. Fünf-Schritte-Playbook für Entwickler
- Modellnamen migrieren: Global nach
deepseek-chat/deepseek-reasonersuchen →deepseek-v4-flashoderdeepseek-v4-pro(seit 24.07. deaktiviert). - Flash vs. Pro nach Workload: Batch-Agent, Routing, hohe Frequenz → Flash 0731; tiefes Reasoning → Pro-Vorschau, offizielle Version abwarten.
- Prompt Cache für Kosten: Wiederholte System-Prompts cachen; Hit-Kosten $0,0028/M.
- Spitzenpreise einplanen: Nicht-zeitkritische Jobs vor 9 Uhr oder nach 18 Uhr Peking-Zeit schedulen.
- Mac-basierte Abnahme: Cursor/OpenClaw mit Flash 0731 vs. Kimi K3/Qwen3.8-Max auf identischem SWE-bench-Subset — Latenz und Pass-Rate messen, nicht nur Hersteller-Leaderboards.
8. FAQ
F: Größter Unterschied V4 vs. V3.2?
A: Native 1M-Kontext; FLOPs 27 %, KV-Cache 10 % vs. V3.2 (Hersteller); Agent-Optimierung für Claude Code, OpenCode u. a.
F: Flash oder Pro im Alltag?
A: Batch, Agent-Pipelines, kostensensitiv → Flash 0731; tiefes Reasoning + Budget → Pro-Vorschau.
F: V4-Pro offiziell verfügbar?
A: Stand 05.08.2026 nein. Nur Flash 0731, API-only. „10.–20. August" = Gerücht.
F: Benchmarks vertrauenswürdig?
A: SWE-bench Verified (Dritte) relativ solide; Terminal Bench 2.0 Harness-abhängig — auf Community-Reproduktion warten.
F: Praktische Auswirkung?
A: OpenAI/Anthropic-kompatibles API; deepseek-v4-flash zeigt auf neue Version; alte Aliase sofort ersetzen. MIT-Lizenz erlaubt On-Prem für DSGVO-Datenresidenz.
9. Brancheneinordnung: „Kill Line" und Preiskrieg
Vor 0731: Community-Spott „Liang Baikai" wegen Pro-Verzögerung. Nach Release: „Liang Sheng" — Stimmungsbarometer der chinesischen AI-Community.
Substanzieller: „斩杀线" (Kill Line) — DeepSeek setzt mit „ausreichender Leistung + Extrempreis" eine Schwelle. Konkurrenten ohne klaren Qualitäts- oder Preisvorteil verlieren Relevanz. Erklärt GPT-5.6-Luna-Preissenkungen (~80 %) im selben Fenster. Zitat eines Incubator-Insiders (21st Century Business Herald): „Jedes LLM-Unternehmen muss vor Liang Wenfeng bleiben, um zu überleben."
Am 31. Juli keine signifikante Bewegung bei Nvidia, Broadcom, AMD — Markt hat „DeepSeek-Effizienz" normalisiert, im Gegensatz zum R1-Schock Anfang 2025.
Für Mac-Entwickler: MIT + 13B aktiv ermöglicht quantisierte V4-Flash-Experimente auf Apple Silicon Unified Memory (siehe AMX-2-Benchmarks). Produktions-Agent-Pipelines und SWE-bench-Regressionen in isolierter Umgebung fahren — Unified Memory nicht für Cursor/Xcode blockieren.
10. Fazit: API überall, Agent-Validierung auf Mac
OpenRouter-Routing, API-Key kopieren — Windows/Linux genügt. Für Cursor + V4-Flash Langkontext, OpenClaw-Agent-Vergleiche oder MLX-Quantisierungsabnahme bleibt Apple Silicon Unified Memory + Metal der reibungsärmste Pfad.
Pragmatisch: API als Daily Driver, Flash-0731-Batch-Agent-Drucktests, Harness-Regressionen und 1M-Dokument-Batches auf MACGPU Remote Mac mini M4 — on-demand, SSH-gesichert, DSGVO-freundliche Isolation, Hauptrechner stabil.