2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.

DeepSeek V4 Flash 0731 Benchmark- und Preisanalyse

Einleitung: Wer Ende Juli das DeepSeek-Changelog verfolgte, stellte etwas Gegenintuitives fest — kein neues Modell, sondern dieselbe 284B-Architektur mit frischem Post-Training, die in Agent-Benchmarks die eigene 1,6T-V4-Pro-Vorschau übertrifft, bei API-Kosten von nur einem Bruchteil von Claude Opus 4.8. Diese Analyse basiert auf verifizierten Primärquellen: vollständige Timeline April–August, Preistabellen, Post-Training- und Harness-Framework-Details, Quervergleich mit Kimi K3, GLM-5.2 und Qwen3.8-Max, dokumentierte Kontroversen, Brancheneinordnung sowie ein fünfstufiges Umsetzungs-Playbook mit FAQ — inklusive DSGVO-relevanter Hinweise zur Datenresidenz.

30 Sekunden · TL;DR

Release2026-07-31 V4-Flash-0731 offizielle API-Beta · nur API, App/Web unverändert
Architektur284B / 13B aktiv, identisch zur April-Vorschau · Leistungsgewinn ausschließlich Post-Training
PreisInput $0,14 (Cache-Miss) / $0,0028 (Hit) · Output $0,28/M
AgentTerminal Bench 2.0 82,7 (Herstellerangabe + Harness Minimalmodus) · übertrifft V4-Pro-Vorschau 67,9
AusstehendV4-Pro offiziell · Agent-Framework Harness · kein bestätigtes Datum

1. Problemstellung: Warum 0731 datenrelevant ist

  1. Pro-Flaggschiff verzögert, Flash „überholt". Die Community nannte Liang Wenfeng scherzhaft „Liang Baikai" — V4-Pro sollte Mitte Juli GA werden, blieb aus. Am 31. Juli übertraf Flash 0731 mit weniger Parametern die Pro-Vorschau in Agent-Scores. Pro und Harness haben weiterhin kein fixes Datum.
  2. Benchmarks sind framework-abhängig. Terminal Bench 2.0 (82,7) und verwandte Agent-Metriken wurden mit dem noch nicht veröffentlichten Harness-Minimalmodus gemessen. DeepSeek warnt selbst: „Scores sind extrem sensitiv gegenüber Harness-Wahl" — kein 1:1-Transfer auf Claude Code oder Cursor.
  3. API-only-Update, Consumer-Lag. Die Beta gilt ausschließlich für die API. Wer chat.deepseek.com unverändert wahrnimmt, beobachtet korrekt zwei Release-Zyklen: Entwickler vs. Endnutzer.

2. Timeline: Von der April-Vorschau zur Juli-„Offiziellversion"

DatumEreignis
2026-04-24DeepSeek-V4-Vorschau veröffentlicht und open-sourced (MIT): V4-Pro (1,6T/49B aktiv) und V4-Flash (284B/13B aktiv), beide 1M Kontext
2026-07-24Legacy-Aliase deepseek-chat und deepseek-reasoner deaktiviert; Traffic auf V4-Namensgebung umgestellt
2026-07-27Moonshot AI Kimi K3 (2,8T) Open Weights auf Hugging Face — größter Open-Weight-Drop des Jahres, Wettbewerbsdruck auf DeepSeek
2026-07-31V4-Flash-0731 offizielle API-Beta; Gewichte auf Hugging Face; Changelog nennt erstmals Agent-Framework „Harness", Release „bald"
Stand 2026-08-05V4-Pro offiziell weiterhin „so schnell wie möglich". Medien zitieren unbestätigte Quellen: GA-Fenster 10.–20. August — nicht offiziell bestätigt

3. Kerndaten auf einen Blick

ModellStatusGesamt / AktivKontextInput (Miss/Hit, $/M)Output ($/M)Lizenz
V4-Flash-0731Offiziell (31.07.)284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProVorschau (24.04., offiziell ausstehend)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open Weights (27.07.)2,8T / ~104B (Community-Schätzung)~1,05M$3,00 / $0,30$15,00Kimi K3 License
GLM-5.2Open (Juni 2026)~744B / ~40B1MNicht verifiziertNicht verifiziertMIT
Qwen3.8-MaxAPI GA (02.08.), Gewichte ausstehend2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Open-Source versprochen

Alle Preise sind Herstellerangaben. DeepSeek kündigte künftige 2×-Spitzenpreise an (Peking-Zeit 9–12 Uhr, 14–18 Uhr); Inkrafttreten bis Redaktionsschluss unbekannt.

4. Technische Analyse: Woher die Leistung kommt

4.1 Architektur unverändert — Post-Training neu

V4-Flash-0731 ist in Parameterzahl und Struktur identisch zur April-Vorschau. DeepSeek bestätigt: Der gesamte Leistungssprung stammt aus erneutem Post-Training. 284B/13B schlägt 1,6T/49B in mehreren Agent-Benchmarks — ein Signal, dass Post-Training-Qualität 2026 nahe an reiner Skalierung heranrückt.

4.2 Hybride Aufmerksamkeit: CSA+HCA, mHC, Muon

Laut Technical Report „DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence" drei Kernänderungen:

  1. Hybride Attention: Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA), extern „DSA Sparse Attention", senkt Compute und VRAM bei langem Kontext;
  2. Manifold-Constrained Hyper-Connections (mHC): verbesserte Residual-Verbindungen;
  3. Muon-Optimierer: schnellere Konvergenz und Trainingsstabilität.

Herstellerangabe bei 1M Token: V4-Pro benötigt 27 % der FLOPs pro Token vs. V3.2, KV-Cache nur 10 % (unabhängige Reproduktion ausstehend).

4.3 Harness: Erstes hauseigenes Agent-Framework

Am 31. Juli erstmals „DeepSeek Harness" im Changelog — Agent-Framework für Dateizugriff, Tool-Calls und End-to-End-Engineering, Positionierung gegen Claude Code. Alle veröffentlichten Agent-Scores nutzen Harness Minimalmodus (max, top_p=0,95, temperature=1,0). Offizielle Warnung: Harness-Wahl verzerrt Ergebnisse erheblich.

5. Quervergleich: Chinesisches Open-Source-Oligopol

ModellLaborReleaseGesamtAA Intelligence IndexKosten/Aufgabe (AA)
V4-Flash-0731DeepSeek31.07. offiziell284B50$0,03
Kimi K3Moonshot AI16.07. Preview / 27.07. Weights2,8T57$0,86
GLM-5.2Zhipu/Z.aiJuni 2026~744B~1 Pkt. über FlashNicht verifiziert
Qwen3.8-MaxAlibaba02.08. GA2,4TNicht verifiziertNicht verifiziert
GPT-5.6 SolOpenAIClosed9+ Pkt. über Flash$1,86
Claude Fable 5AnthropicClosed9+ Pkt. über Flash$3,15

Intelligence Index und Kosten/Aufgabe: Artificial Analysis (unabhängig). DeepSeek Agent-Scores: Herstellerangaben — nicht direkt vergleichbar.

Kernbefund: V4-Flash führt den AA-Index nicht an, liegt hinter Kimi K3 und GLM-5.2. Kosten/Aufgabe jedoch ~1/29 von K3, ~1/62 von GPT-5.6 Sol, ~1/105 von Claude Fable 5. DeepSeek optimiert „ausreichende Intelligenz + minimaler Preis" — erklärt sieben Wochen OpenRouter-Spitzenplatz der Vorschau.

6. Kontroversen: Benchmarks mit Vorbehalt lesen

  • Harness-Abhängigkeit, vom Hersteller bestätigt. Terminal Bench 2.0 (82,7 vs. 67,9) = Herstellerangabe + unreleased Framework.
  • Praxisfeedback aus Übersee. 21st Century Business Herald berichtet: niedrige Cache-Hit-Rate, gelegentliche Safety-Classifier-Timeouts — Widerspruch zur „Score-Explosion"-Narrative.
  • Pro/Harness-Termine unbestätigt. „10.–20. August GA" = unbestätigte Medienquellen; offizielles Changelog: „so schnell wie möglich".
  • Finanzierungs-/IPO-Gerüchte. ~7,4 Mrd. USD Finanzierung, ~48,7 Mrd. USD Bewertung — nur „laut Berichten", keine regulatorische Bestätigung.

7. Fünf-Schritte-Playbook für Entwickler

  1. Modellnamen migrieren: Global nach deepseek-chat / deepseek-reasoner suchen → deepseek-v4-flash oder deepseek-v4-pro (seit 24.07. deaktiviert).
  2. Flash vs. Pro nach Workload: Batch-Agent, Routing, hohe Frequenz → Flash 0731; tiefes Reasoning → Pro-Vorschau, offizielle Version abwarten.
  3. Prompt Cache für Kosten: Wiederholte System-Prompts cachen; Hit-Kosten $0,0028/M.
  4. Spitzenpreise einplanen: Nicht-zeitkritische Jobs vor 9 Uhr oder nach 18 Uhr Peking-Zeit schedulen.
  5. Mac-basierte Abnahme: Cursor/OpenClaw mit Flash 0731 vs. Kimi K3/Qwen3.8-Max auf identischem SWE-bench-Subset — Latenz und Pass-Rate messen, nicht nur Hersteller-Leaderboards.
from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # V4-Flash-0731 zeigt automatisch auf die neueste offizielle Version response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Fasse das 0731-Changelog zusammen."}] )

8. FAQ

F: Größter Unterschied V4 vs. V3.2?
A: Native 1M-Kontext; FLOPs 27 %, KV-Cache 10 % vs. V3.2 (Hersteller); Agent-Optimierung für Claude Code, OpenCode u. a.

F: Flash oder Pro im Alltag?
A: Batch, Agent-Pipelines, kostensensitiv → Flash 0731; tiefes Reasoning + Budget → Pro-Vorschau.

F: V4-Pro offiziell verfügbar?
A: Stand 05.08.2026 nein. Nur Flash 0731, API-only. „10.–20. August" = Gerücht.

F: Benchmarks vertrauenswürdig?
A: SWE-bench Verified (Dritte) relativ solide; Terminal Bench 2.0 Harness-abhängig — auf Community-Reproduktion warten.

F: Praktische Auswirkung?
A: OpenAI/Anthropic-kompatibles API; deepseek-v4-flash zeigt auf neue Version; alte Aliase sofort ersetzen. MIT-Lizenz erlaubt On-Prem für DSGVO-Datenresidenz.

9. Brancheneinordnung: „Kill Line" und Preiskrieg

Vor 0731: Community-Spott „Liang Baikai" wegen Pro-Verzögerung. Nach Release: „Liang Sheng" — Stimmungsbarometer der chinesischen AI-Community.

Substanzieller: „斩杀线" (Kill Line) — DeepSeek setzt mit „ausreichender Leistung + Extrempreis" eine Schwelle. Konkurrenten ohne klaren Qualitäts- oder Preisvorteil verlieren Relevanz. Erklärt GPT-5.6-Luna-Preissenkungen (~80 %) im selben Fenster. Zitat eines Incubator-Insiders (21st Century Business Herald): „Jedes LLM-Unternehmen muss vor Liang Wenfeng bleiben, um zu überleben."

Am 31. Juli keine signifikante Bewegung bei Nvidia, Broadcom, AMD — Markt hat „DeepSeek-Effizienz" normalisiert, im Gegensatz zum R1-Schock Anfang 2025.

Für Mac-Entwickler: MIT + 13B aktiv ermöglicht quantisierte V4-Flash-Experimente auf Apple Silicon Unified Memory (siehe AMX-2-Benchmarks). Produktions-Agent-Pipelines und SWE-bench-Regressionen in isolierter Umgebung fahren — Unified Memory nicht für Cursor/Xcode blockieren.

10. Fazit: API überall, Agent-Validierung auf Mac

OpenRouter-Routing, API-Key kopieren — Windows/Linux genügt. Für Cursor + V4-Flash Langkontext, OpenClaw-Agent-Vergleiche oder MLX-Quantisierungsabnahme bleibt Apple Silicon Unified Memory + Metal der reibungsärmste Pfad.

Pragmatisch: API als Daily Driver, Flash-0731-Batch-Agent-Drucktests, Harness-Regressionen und 1M-Dokument-Batches auf MACGPU Remote Mac mini M4 — on-demand, SSH-gesichert, DSGVO-freundliche Isolation, Hauptrechner stabil.