2026 DEEPSEEK V4
VOLLVERSION_
GA_RELEASE.
Einordnung: Nach drei Monaten Vorschau ist DeepSeek V4 am 20. Juli 2026 als GA-Vollversion live. Gegenüber der April-Vorschau: messbare Verbesserungen bei Agent-Orchestrierung, mathematischem Reasoning und Codegenerierung — plus erstmals Spitzen-/Nebentarif. Dieser Bericht deckt die vollständige Timeline, V4-Pro/Flash-Spezifikationen, CSA+HCA+mHC-Architektur, drei Inferenzmodi, Benchmark-Tabellen, Preismodell, API-Migration (Frist 24. Juli), Vergleich mit GPT-5.6 / Claude Fable 5, FAQ und strategische Einordnung ab.
30 Sekunden · TL;DR
| Release | 2026-07-20 GA · deepseek-chat endet am 24.07. |
| Skalierung | V4-Pro 1,6T (49B aktiv) · V4-Flash 284B (13B aktiv) · je 1M Kontext |
| Kernmetriken | SWE-bench Verified 80,6 % (Open-Source-Rekord) · LiveCodeBench 93,5 % · MIT |
| Preise | Spitzen-/Nebentarif · V4-Pro Ausgabe $0,87/M (Nebenzeit) / $1,74/M (Spitze) |
| Kostenverhältnis | 1/116 der Kosten von Claude Fable 5 ($0,03 vs. $3,48/Aufgabe) |
1. Problemstellung: Warum die Vollversion relevant ist
- Vorschau war stark, Produktion brauchte SLA. Seit dem 24. April 2026 stellten Teams zwei Fragen: Kommt noch Performance? Ändert sich die Preisstruktur? GA beantwortet beides — drei Monate Produktionstuning plus transparentes Spitzen-/Nebentarifmodell.
- Legacy-API endet in vier Tagen.
deepseek-chatunddeepseek-reasonerwerden am 24.07.2026, 15:59 UTC abgeschaltet. Cursor-, OpenClaw- oder Eigenbau-Agenten mit alten Modellnamen müssen jetzt migrieren. - Spitzen-/Nebentarif ist ein Steuerungsinstrument. Werktags 09–12 und 14–18 Uhr (Peking-Zeit) verdoppeln sich die Sätze — selbst in der Spitze bleibt V4-Pro ($1,74/M Ausgabe) 8,6× günstiger als Claude Opus 4.8 ($15/M). Entscheidend: Lastverschiebung und Flash-Routing.
2. Definition: Was ist DeepSeek V4 GA?
DeepSeek V4 GA ist die am 20. Juli 2026 veröffentlichte General-Availability-Version mit V4-Pro (1,6 Billionen Parameter MoE) und V4-Flash (284 Milliarden Parameter MoE), beide unter MIT-Lizenz, mit 1 Mio. Token Kontext und 384K maximaler Ausgabe.
Gegenüber der Vorschau: verbesserte Agent-Fähigkeiten, mathematisches Reasoning, Codegenerierung und Spitzen-/Nebentarif-API. Die Architektur CSA (Compressed Sparse Attention) + HCA (Heavily Compressed Attention) + mHC (Manifold-Constrained Hyper-Connections) stammt aus der Vorschau — GA liefert Stabilität, Tuning und kommerziellen Abschluss.
Kernaussage: Höchster SWE-bench Verified-Wert unter Open-Source-Modellen (80,6 %), nahezu Frontier-Leistung zu 1/10 bis 1/100 der Kosten geschlossener Flaggschiffe, mit privater Bereitstellung und 1M-Kontext.
3. Timeline: Vorschau bis GA
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Vorschau + Open Source (MIT), V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktions-Tuning-Versionen, API allgemein verfügbar |
| 2026-06 | V4-Pro dauerhaft 75 % günstiger (Ausgabe $0,87/M) |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Spitzen-/Nebentarif angekündigt |
| 2026-07-19 | GA-Grauzonen-Zugang für ausgewählte Entwickler, Medienberichte zur Vollversion |
| 2026-07-20 | GA-Vollversion live (Veröffentlichungsdatum dieses Artikels) |
| 2026-07-24 | deepseek-chat und deepseek-reasoner permanent abgeschaltet |
Vertiefung: DeepSeek Custom-Chip & Inferenz, Kimi K3 Test und KI-Preissenkungen Juni 2026.
4. Modellfamilie: V4-Pro vs. V4-Flash
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter/Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Max. Ausgabe | 384K Token | 384K Token |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining | 33T+ Token | 32T+ Token |
| Lizenz | MIT | MIT |
5. Architektur: CSA + HCA + mHC
Klassische Transformer skalieren KV-Cache linear mit der Kontextlänge — 1M Token war praktisch unbezahlbar. DeepSeek V4 ersetzt MLA (Multi-Head Latent Attention) aus V2/V3 durch drei Architektur-Innovationen:
5.1 CSA — Compressed Sparse Attention
- KV-Sequenz per Softmax-Gating-Pooling 4× komprimiert
- FP4 „Lightning Indexer“ für top-k-Sparse-Auswahl (V4-Pro: top-1024, V4-Flash: top-512)
- Sliding Window der letzten 128 Token
- Bei 1M Kontext: nur 27 % der Inferenz-FLOPs von DeepSeek V3.2
5.2 HCA — Heavily Compressed Attention
- Token 128× komprimiert, globale dichte Attention
- Ergänzt CSA für Langstrecken-Abhängigkeiten
- V4-Flash: erste 2 Schichten HCA, danach CSA/HCA alternierend; V4-Pro analog
Gesamteffekt: KV-Cache-Speicher bei 1M nur 10 % von V3.2 (V4-Flash: 7 %).
5.3 mHC & Muon-Optimierer
mHC erweitert Residual-Verbindungen um 4-Kanal-Residualfluss mit doublstochastisch beschränkten Mischmatrizen (Birkhoff-Polytop) — stabile Signalpropagation über 61 Schichten.
Training mit Muon-Optimierer (statt AdamW): Newton-Schulz-Orthogonalisierung der Gradienten für schnellere, stabilere Konvergenz.
5.4 Drei Inferenzmodi
| Modus | Eigenschaft | Anwendung |
|---|---|---|
| Non-think | Keine Thought Chain, maximale Latenz | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (<redacted_thinking>) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext | Komplexe Mathematik, lange Agent-Ketten |
Empfohlene Sampling-Parameter: temperature=1.0, top_p=1.0 (offiziell, alle Modi).
6. Benchmarks: Open-Source-Führung in Zahlen
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ Open-Source-Rekord | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Interpretation:
- SWE-bench Verified: V4-Pro 80,6 % — Open-Source-Spitze, gleichauf mit Gemini 3.1 Pro
- LiveCodeBench: V4-Pro 93,5 % — vor allen geschlossenen Konkurrenten
- SWE-bench Pro: Fable 5 mit 80,3 % — Multi-File-Repo-Bugfixes
- Terminal-Bench: GPT-5.6 Ultra 85,1 % — Terminal-/Toolchain-intensive Agenten
Hinweis: Benchmarks basieren auf DeepSeek-Eigenangaben und Drittquellen; unabhängige Reproduktionen laufen.
7. Kosten-Nutzen: Preis pro Aufgabe
Datenquelle: Artificial Analysis, Strategy & Ops Index:
| Modell | Kosten/Aufgabe | Score | Verhältnis |
|---|---|---|---|
| Claude Fable 5 | $3,48 | 50 Punkte | Referenz |
| DeepSeek V4-Pro | $0,03 | 38 Punkte | 1/116 der Fable-5-Kosten |
| DeepSeek V4-Flash | alle 6 Index-Aufgaben < $0,04 | — | Leichtaufgaben optimal |
Fable 5 kostet 116× mehr, liefert nur ~12 Punkte (31 %) mehr. Für die meisten Produktionsszenarien ist V4-Pro kostenoptimal.
8. Vergleich: V4 vs. GPT-5.6 Sol vs. Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source | ✅ MIT | ❌ geschlossen | ❌ geschlossen |
| Self-Hosting | ✅ | ❌ | ❌ |
| DSGVO / Datenresidenz | ✅ On-Prem möglich | ❌ US-API | ❌ US-API |
| Kontext | 1M Token | nicht veröffentlicht | 1M Token |
| Code | sehr stark (nahe Fable 5) | sehr stark | stärkste Klasse |
| API-Ausgabe (Nebenzeit) | $0,87/M | ~$15/M | $50/M |
| API-Ausgabe (Spitze) | $1,74/M | — | — |
| Agent-Fähigkeit | stark, Multi-Agent | stark | stärkste Klasse |
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Budget / hohe Frequenz / On-Prem | V4-Pro / Flash | $0,87/M, MIT, DSGVO-tauglich |
| Maximale Code-Qualität, Kosten egal | Claude Fable 5 | SWE-bench Pro 80,3 % |
| Algorithmen + Mathe-Reasoning | GPT-5.6 Sol / Ultra | Terminal-Bench-Führung |
| Große Log-/Dokumenten-Batches | V4-Flash | Cache-Treffer nur $0,0028/M Eingabe |
9. Spitzen-/Nebentarif: Vollständige Preistabelle
GA bringt erstmals zeitbasierte Differenzierung — analog zu Stromtarifen. Spitzenzeit (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00, alle Sätze verdoppelt.
| Modell | Position | Nebenzeit | Spitze |
|---|---|---|---|
| V4-Pro | Eingabe (Cache-Treffer) | ¥0,025 / $0,0035 / 1M | verdoppelt |
| Eingabe (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Ausgabe | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Eingabe (Cache-Treffer) | ¥0,02 / $0,0028 / 1M | verdoppelt |
| Eingabe (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Ausgabe | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
9.1 Vier Kostensenkungsmaßnahmen
- Nicht-echtzeitliche Jobs in Nebenzeit: Dokumenten-Batches, Annotation, Code-Review nach 18:00 oder vor 09:00
- Prompt-Cache nutzen: Wiederholte System-Prompts — V4-Flash Cache-Treffer ab $0,0028/M
- Flash-Routing: Intent-Erkennung auf Flash, komplexes Reasoning auf Pro — 60–80 % Kostenersparnis
- Rechnungsbenachrichtigung: DeepSeek kündigt Tarifänderungen 24 Stunden vorher per E-Mail an
Selbst in der Spitze: V4-Pro ($1,74/M) ist 8,6× günstiger als Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).
10. API-Migration (Frist 24. Juli) ⚠️
Warnung: deepseek-chat und deepseek-reasoner enden am 24.07.2026, 15:59 UTC (23:59 Peking-Zeit) permanent.
| Alt | Neu | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Schnell, leichte Aufgaben |
deepseek-reasoner | deepseek-v4-flash (Think) | oder deepseek-v4-pro für stärkeres Reasoning |
10.1 OpenAI SDK (Python)
10.2 Anthropic SDK
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — nur model aktualisieren:
11. Integration: Fünf Wege zum sofortigen Einsatz
- Web/App: chat.deepseek.com — V4 GA standardmäßig aktiv.
- Offizielle API: platform.deepseek.com — OpenAI-kompatibel, Modelle
deepseek-v4-pro/deepseek-v4-flash. - OpenRouter: Modell-ID
deepseek/deepseek-v4-pro— siehe OpenRouter Mac-Routing-Leitfaden. - Cursor / IDE: V4-Pro als Daily Driver, Fallback auf Claude Fable 5 für schwere Repo-Bugfixes.
- Codebase-Migration: Global nach
deepseek-chatunddeepseek-reasonersuchen, Staging testen, bis 24. Juli produktiv schalten.
12. FAQ
F: Unterschied GA vs. Vorschau?
A: Verbesserte Agent-/Mathe-/Code-Fähigkeiten, Spitzen-/Nebentarif, höhere Produktionsstabilität. Architektur unverändert.
F: V4-Pro oder V4-Flash?
A: Pro für komplexes Reasoning und lange Agent-Ketten; Flash für hohe Frequenz und Routing ($0,28/M Nebenzeit).
F: Spitzenzeiten?
A: Peking-Zeit Werktags 09:00–12:00 und 14:00–18:00, Sätze verdoppelt.
F: Wann endet deepseek-chat?
A: 24.07.2026, 15:59 UTC. Sofort auf deepseek-v4-flash oder deepseek-v4-pro migrieren.
F: Lokales Deployment / DSGVO?
A: MIT-Lizenz, Hugging Face verfügbar. On-Prem für Datenresidenz; V4-Pro braucht GPU-Cluster, Mac für API oder Quantisierung.
F: vs. Claude Fable 5?
A: Fable 5 führt SWE-bench; V4-Pro bei 1/116 der Kosten mit nahezu Frontier-Leistung und Self-Hosting.
13. Strategische Einordnung: Meilenstein für Open Source 2026
DeepSeek V4 GA markiert mehr als ein „Vorschau-Abschluss“ — es ist ein struktureller Wendepunkt im chinesischen Open-Source-Ökosystem Mitte 2026.
13.1 Vom Preisdisruptor zur disziplinierten Plattform
18 Monate lang zwang DeepSeek mit aggressiven Preisen (V3: $0,28/M Ausgabe) den Markt zur Reaktion. Spitzen-/Nebentarif signalisiert den Übergang von Subvention zu nachhaltigem Betrieb — ohne Wettbewerbsfähigkeit zu opfern: selbst Spitze $1,74/M bleibt 8,6× unter Opus 4.8. Das Modell ist ein Lastverschiebungsinstrument, kein reiner Kostentransfer.
13.2 Architektur und Langkontext-Ökonomie
1M Token ist 2026 kein Alleinstellungsmerkmal — Kimi K3 und Fable 5 bieten dasselbe. Der Unterschied: V4 macht 1M wirtschaftlich tragbar. CSA 4× + top-1024 + 128-Token-Fenster: 27 % FLOPs, 10 % KV-Cache vs. V3.2. Bei Kimi K3 $15/M vs. V4-Pro $0,87/M ist die Kostenlücke größenordnungsmäßig.
mHC und Muon ermöglichen stabiles Training über 61 Schichten bei 1,6T — der technische Unterbau für den Sprung von 671B auf 1,6T.
13.3 MIT-Lizenz als strategischer Faktor
Im Juli 2026 ist die Lizenz so wichtig wie die Parameterzahl. Llama-Einschränkungen und „nur Forschung“-Klauseln erzeugen Compliance-Risiken. MIT bei V4 bedeutet:
- Unbeschränktes On-Prem-Deployment ohne Meldepflicht — relevant für DSGVO und Branchenaufsicht
- Feintuning, Destillation, Closed-Source-Produkte erlaubt
- Datenresidenz für Behörden, Finanz, Gesundheit ohne US-API-Abhängigkeit
Kimi K3 beansprucht mit 2,8T den Größenrekord (siehe K3-Test), DeepSeek V4 konkurriert über Effizienz, Kostenstruktur und Lizenzfreiheit. Für Mac-Entwickler: MIT + Dual-SDK-Kompatibilität ermöglicht nahtlosen Wechsel in Cursor, Continue, OpenClaw — mit MLX-Quantisierungspotenzial. Siehe Apple Silicon V4 AMX-2-Benchmarks.
V4 GA schlägt Fable 5 und GPT-5.6 noch nicht auf allen Leaderboards — liefert aber die stärkste Open-Source-Performance zu 1/10 bis 1/100 der Kosten. Für DSGVO-sensible Unternehmen, budgetbewusste Teams und 1M-Agent-Ingenieure: V4-Pro ist die rationalste Wahl.
14. Fazit: API überall, Agent-Validierung auf Mac
API-Key registrieren, Modellnamen tauschen, OpenRouter-Routing — jedes Gerät reicht. Für Cursor + V4-Pro Langkontext-Agenten, Think-Max-Stresstests, Multi-Repo-SWE-bench-Regression oder MLX-Quantisierungsvalidierung bleibt Apple Silicon Unified Memory + Metal der reibungsärmste Weg.
Pragmatisch: API als Daily Driver, V4-Pro-Drucktests, 1M-Dokumenten-Batches und Spitzen-/Nebentarif-Cron-Jobs auf einen MACGPU Remote Mac mini M4 — on-demand, SSH-gesichert, Hauptrechner stabil.