2026 DEEPSEEK V4
VOLLVERSION_
GA_RELEASE.

DeepSeek V4 Vollversion GA: Architektur, Spitzen-/Nebentarif und Benchmark-Vergleich

Einordnung: Nach drei Monaten Vorschau ist DeepSeek V4 am 20. Juli 2026 als GA-Vollversion live. Gegenüber der April-Vorschau: messbare Verbesserungen bei Agent-Orchestrierung, mathematischem Reasoning und Codegenerierung — plus erstmals Spitzen-/Nebentarif. Dieser Bericht deckt die vollständige Timeline, V4-Pro/Flash-Spezifikationen, CSA+HCA+mHC-Architektur, drei Inferenzmodi, Benchmark-Tabellen, Preismodell, API-Migration (Frist 24. Juli), Vergleich mit GPT-5.6 / Claude Fable 5, FAQ und strategische Einordnung ab.

30 Sekunden · TL;DR

Release2026-07-20 GA · deepseek-chat endet am 24.07.
SkalierungV4-Pro 1,6T (49B aktiv) · V4-Flash 284B (13B aktiv) · je 1M Kontext
KernmetrikenSWE-bench Verified 80,6 % (Open-Source-Rekord) · LiveCodeBench 93,5 % · MIT
PreiseSpitzen-/Nebentarif · V4-Pro Ausgabe $0,87/M (Nebenzeit) / $1,74/M (Spitze)
Kostenverhältnis1/116 der Kosten von Claude Fable 5 ($0,03 vs. $3,48/Aufgabe)

1. Problemstellung: Warum die Vollversion relevant ist

  1. Vorschau war stark, Produktion brauchte SLA. Seit dem 24. April 2026 stellten Teams zwei Fragen: Kommt noch Performance? Ändert sich die Preisstruktur? GA beantwortet beides — drei Monate Produktionstuning plus transparentes Spitzen-/Nebentarifmodell.
  2. Legacy-API endet in vier Tagen. deepseek-chat und deepseek-reasoner werden am 24.07.2026, 15:59 UTC abgeschaltet. Cursor-, OpenClaw- oder Eigenbau-Agenten mit alten Modellnamen müssen jetzt migrieren.
  3. Spitzen-/Nebentarif ist ein Steuerungsinstrument. Werktags 09–12 und 14–18 Uhr (Peking-Zeit) verdoppeln sich die Sätze — selbst in der Spitze bleibt V4-Pro ($1,74/M Ausgabe) 8,6× günstiger als Claude Opus 4.8 ($15/M). Entscheidend: Lastverschiebung und Flash-Routing.

2. Definition: Was ist DeepSeek V4 GA?

DeepSeek V4 GA ist die am 20. Juli 2026 veröffentlichte General-Availability-Version mit V4-Pro (1,6 Billionen Parameter MoE) und V4-Flash (284 Milliarden Parameter MoE), beide unter MIT-Lizenz, mit 1 Mio. Token Kontext und 384K maximaler Ausgabe.

Gegenüber der Vorschau: verbesserte Agent-Fähigkeiten, mathematisches Reasoning, Codegenerierung und Spitzen-/Nebentarif-API. Die Architektur CSA (Compressed Sparse Attention) + HCA (Heavily Compressed Attention) + mHC (Manifold-Constrained Hyper-Connections) stammt aus der Vorschau — GA liefert Stabilität, Tuning und kommerziellen Abschluss.

Kernaussage: Höchster SWE-bench Verified-Wert unter Open-Source-Modellen (80,6 %), nahezu Frontier-Leistung zu 1/10 bis 1/100 der Kosten geschlossener Flaggschiffe, mit privater Bereitstellung und 1M-Kontext.

3. Timeline: Vorschau bis GA

DatumEreignis
2026-04-24V4-Vorschau + Open Source (MIT), V4-Pro (1,6T) und V4-Flash (284B)
2026-05Produktions-Tuning-Versionen, API allgemein verfügbar
2026-06V4-Pro dauerhaft 75 % günstiger (Ausgabe $0,87/M)
2026-06-29E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Spitzen-/Nebentarif angekündigt
2026-07-19GA-Grauzonen-Zugang für ausgewählte Entwickler, Medienberichte zur Vollversion
2026-07-20GA-Vollversion live (Veröffentlichungsdatum dieses Artikels)
2026-07-24deepseek-chat und deepseek-reasoner permanent abgeschaltet

Vertiefung: DeepSeek Custom-Chip & Inferenz, Kimi K3 Test und KI-Preissenkungen Juni 2026.

4. Modellfamilie: V4-Pro vs. V4-Flash

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktive Parameter/Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Schichten6143
Kontextfenster1.000.000 Token1.000.000 Token
Max. Ausgabe384K Token384K Token
PräzisionFP4 (Experten) + FP8 (Rest)FP4 + FP8 gemischt
Pretraining33T+ Token32T+ Token
LizenzMITMIT

5. Architektur: CSA + HCA + mHC

Klassische Transformer skalieren KV-Cache linear mit der Kontextlänge — 1M Token war praktisch unbezahlbar. DeepSeek V4 ersetzt MLA (Multi-Head Latent Attention) aus V2/V3 durch drei Architektur-Innovationen:

5.1 CSA — Compressed Sparse Attention

  • KV-Sequenz per Softmax-Gating-Pooling komprimiert
  • FP4 „Lightning Indexer“ für top-k-Sparse-Auswahl (V4-Pro: top-1024, V4-Flash: top-512)
  • Sliding Window der letzten 128 Token
  • Bei 1M Kontext: nur 27 % der Inferenz-FLOPs von DeepSeek V3.2

5.2 HCA — Heavily Compressed Attention

  • Token 128× komprimiert, globale dichte Attention
  • Ergänzt CSA für Langstrecken-Abhängigkeiten
  • V4-Flash: erste 2 Schichten HCA, danach CSA/HCA alternierend; V4-Pro analog

Gesamteffekt: KV-Cache-Speicher bei 1M nur 10 % von V3.2 (V4-Flash: 7 %).

5.3 mHC & Muon-Optimierer

mHC erweitert Residual-Verbindungen um 4-Kanal-Residualfluss mit doublstochastisch beschränkten Mischmatrizen (Birkhoff-Polytop) — stabile Signalpropagation über 61 Schichten.

Training mit Muon-Optimierer (statt AdamW): Newton-Schulz-Orthogonalisierung der Gradienten für schnellere, stabilere Konvergenz.

5.4 Drei Inferenzmodi

ModusEigenschaftAnwendung
Non-thinkKeine Thought Chain, maximale LatenzEinfache Q&A, Routing
Think HighExplizites Reasoning (<redacted_thinking>)Mittlere Komplexität, Code-Debug
Think MaxMaximale Reasoning-Tiefe, 384K+ KontextKomplexe Mathematik, lange Agent-Ketten

Empfohlene Sampling-Parameter: temperature=1.0, top_p=1.0 (offiziell, alle Modi).

6. Benchmarks: Open-Source-Führung in Zahlen

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ Open-Source-Rekord96,0 %nicht separat veröffentlicht~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Interpretation:

  • SWE-bench Verified: V4-Pro 80,6 % — Open-Source-Spitze, gleichauf mit Gemini 3.1 Pro
  • LiveCodeBench: V4-Pro 93,5 % — vor allen geschlossenen Konkurrenten
  • SWE-bench Pro: Fable 5 mit 80,3 % — Multi-File-Repo-Bugfixes
  • Terminal-Bench: GPT-5.6 Ultra 85,1 % — Terminal-/Toolchain-intensive Agenten

Hinweis: Benchmarks basieren auf DeepSeek-Eigenangaben und Drittquellen; unabhängige Reproduktionen laufen.

7. Kosten-Nutzen: Preis pro Aufgabe

Datenquelle: Artificial Analysis, Strategy & Ops Index:

ModellKosten/AufgabeScoreVerhältnis
Claude Fable 5$3,4850 PunkteReferenz
DeepSeek V4-Pro$0,0338 Punkte1/116 der Fable-5-Kosten
DeepSeek V4-Flashalle 6 Index-Aufgaben < $0,04Leichtaufgaben optimal

Fable 5 kostet 116× mehr, liefert nur ~12 Punkte (31 %) mehr. Für die meisten Produktionsszenarien ist V4-Pro kostenoptimal.

8. Vergleich: V4 vs. GPT-5.6 Sol vs. Claude Fable 5

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open Source✅ MIT❌ geschlossen❌ geschlossen
Self-Hosting
DSGVO / Datenresidenz✅ On-Prem möglich❌ US-API❌ US-API
Kontext1M Tokennicht veröffentlicht1M Token
Codesehr stark (nahe Fable 5)sehr starkstärkste Klasse
API-Ausgabe (Nebenzeit)$0,87/M~$15/M$50/M
API-Ausgabe (Spitze)$1,74/M
Agent-Fähigkeitstark, Multi-Agentstarkstärkste Klasse
SzenarioEmpfehlungBegründung
Budget / hohe Frequenz / On-PremV4-Pro / Flash$0,87/M, MIT, DSGVO-tauglich
Maximale Code-Qualität, Kosten egalClaude Fable 5SWE-bench Pro 80,3 %
Algorithmen + Mathe-ReasoningGPT-5.6 Sol / UltraTerminal-Bench-Führung
Große Log-/Dokumenten-BatchesV4-FlashCache-Treffer nur $0,0028/M Eingabe

9. Spitzen-/Nebentarif: Vollständige Preistabelle

GA bringt erstmals zeitbasierte Differenzierung — analog zu Stromtarifen. Spitzenzeit (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00, alle Sätze verdoppelt.

ModellPositionNebenzeitSpitze
V4-ProEingabe (Cache-Treffer)¥0,025 / $0,0035 / 1Mverdoppelt
Eingabe (Cache-Miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Ausgabe¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashEingabe (Cache-Treffer)¥0,02 / $0,0028 / 1Mverdoppelt
Eingabe (Cache-Miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Ausgabe¥2,00 / $0,28 / 1M¥4,00 / $0,56

9.1 Vier Kostensenkungsmaßnahmen

  1. Nicht-echtzeitliche Jobs in Nebenzeit: Dokumenten-Batches, Annotation, Code-Review nach 18:00 oder vor 09:00
  2. Prompt-Cache nutzen: Wiederholte System-Prompts — V4-Flash Cache-Treffer ab $0,0028/M
  3. Flash-Routing: Intent-Erkennung auf Flash, komplexes Reasoning auf Pro — 60–80 % Kostenersparnis
  4. Rechnungsbenachrichtigung: DeepSeek kündigt Tarifänderungen 24 Stunden vorher per E-Mail an

Selbst in der Spitze: V4-Pro ($1,74/M) ist 8,6× günstiger als Opus 4.8 ($15/M) und GPT-5.6 Sol (~$15/M).

10. API-Migration (Frist 24. Juli) ⚠️

Warnung: deepseek-chat und deepseek-reasoner enden am 24.07.2026, 15:59 UTC (23:59 Peking-Zeit) permanent.

AltNeuHinweis
deepseek-chatdeepseek-v4-flash (Non-think)Schnell, leichte Aufgaben
deepseek-reasonerdeepseek-v4-flash (Think)oder deepseek-v4-pro für stärkeres Reasoning

10.1 OpenAI SDK (Python)

from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # ❌ Alt (ungültig ab 24.07.) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ Neu — Non-think response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] ) # ✅ Neu — Think (Ersatz für deepseek-reasoner) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Solve this step by step..."}], extra_body={ "thinking": {"type": "enabled", "budget_tokens": 8000} } )

10.2 Anthropic SDK

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — nur model aktualisieren:

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Was ändert sich im V4 GA Release?"}] )

11. Integration: Fünf Wege zum sofortigen Einsatz

  1. Web/App: chat.deepseek.com — V4 GA standardmäßig aktiv.
  2. Offizielle API: platform.deepseek.com — OpenAI-kompatibel, Modelle deepseek-v4-pro / deepseek-v4-flash.
  3. OpenRouter: Modell-ID deepseek/deepseek-v4-pro — siehe OpenRouter Mac-Routing-Leitfaden.
  4. Cursor / IDE: V4-Pro als Daily Driver, Fallback auf Claude Fable 5 für schwere Repo-Bugfixes.
  5. Codebase-Migration: Global nach deepseek-chat und deepseek-reasoner suchen, Staging testen, bis 24. Juli produktiv schalten.

12. FAQ

F: Unterschied GA vs. Vorschau?
A: Verbesserte Agent-/Mathe-/Code-Fähigkeiten, Spitzen-/Nebentarif, höhere Produktionsstabilität. Architektur unverändert.

F: V4-Pro oder V4-Flash?
A: Pro für komplexes Reasoning und lange Agent-Ketten; Flash für hohe Frequenz und Routing ($0,28/M Nebenzeit).

F: Spitzenzeiten?
A: Peking-Zeit Werktags 09:00–12:00 und 14:00–18:00, Sätze verdoppelt.

F: Wann endet deepseek-chat?
A: 24.07.2026, 15:59 UTC. Sofort auf deepseek-v4-flash oder deepseek-v4-pro migrieren.

F: Lokales Deployment / DSGVO?
A: MIT-Lizenz, Hugging Face verfügbar. On-Prem für Datenresidenz; V4-Pro braucht GPU-Cluster, Mac für API oder Quantisierung.

F: vs. Claude Fable 5?
A: Fable 5 führt SWE-bench; V4-Pro bei 1/116 der Kosten mit nahezu Frontier-Leistung und Self-Hosting.

13. Strategische Einordnung: Meilenstein für Open Source 2026

DeepSeek V4 GA markiert mehr als ein „Vorschau-Abschluss“ — es ist ein struktureller Wendepunkt im chinesischen Open-Source-Ökosystem Mitte 2026.

13.1 Vom Preisdisruptor zur disziplinierten Plattform

18 Monate lang zwang DeepSeek mit aggressiven Preisen (V3: $0,28/M Ausgabe) den Markt zur Reaktion. Spitzen-/Nebentarif signalisiert den Übergang von Subvention zu nachhaltigem Betrieb — ohne Wettbewerbsfähigkeit zu opfern: selbst Spitze $1,74/M bleibt 8,6× unter Opus 4.8. Das Modell ist ein Lastverschiebungsinstrument, kein reiner Kostentransfer.

13.2 Architektur und Langkontext-Ökonomie

1M Token ist 2026 kein Alleinstellungsmerkmal — Kimi K3 und Fable 5 bieten dasselbe. Der Unterschied: V4 macht 1M wirtschaftlich tragbar. CSA 4× + top-1024 + 128-Token-Fenster: 27 % FLOPs, 10 % KV-Cache vs. V3.2. Bei Kimi K3 $15/M vs. V4-Pro $0,87/M ist die Kostenlücke größenordnungsmäßig.

mHC und Muon ermöglichen stabiles Training über 61 Schichten bei 1,6T — der technische Unterbau für den Sprung von 671B auf 1,6T.

13.3 MIT-Lizenz als strategischer Faktor

Im Juli 2026 ist die Lizenz so wichtig wie die Parameterzahl. Llama-Einschränkungen und „nur Forschung“-Klauseln erzeugen Compliance-Risiken. MIT bei V4 bedeutet:

  • Unbeschränktes On-Prem-Deployment ohne Meldepflicht — relevant für DSGVO und Branchenaufsicht
  • Feintuning, Destillation, Closed-Source-Produkte erlaubt
  • Datenresidenz für Behörden, Finanz, Gesundheit ohne US-API-Abhängigkeit

Kimi K3 beansprucht mit 2,8T den Größenrekord (siehe K3-Test), DeepSeek V4 konkurriert über Effizienz, Kostenstruktur und Lizenzfreiheit. Für Mac-Entwickler: MIT + Dual-SDK-Kompatibilität ermöglicht nahtlosen Wechsel in Cursor, Continue, OpenClaw — mit MLX-Quantisierungspotenzial. Siehe Apple Silicon V4 AMX-2-Benchmarks.

V4 GA schlägt Fable 5 und GPT-5.6 noch nicht auf allen Leaderboards — liefert aber die stärkste Open-Source-Performance zu 1/10 bis 1/100 der Kosten. Für DSGVO-sensible Unternehmen, budgetbewusste Teams und 1M-Agent-Ingenieure: V4-Pro ist die rationalste Wahl.

14. Fazit: API überall, Agent-Validierung auf Mac

API-Key registrieren, Modellnamen tauschen, OpenRouter-Routing — jedes Gerät reicht. Für Cursor + V4-Pro Langkontext-Agenten, Think-Max-Stresstests, Multi-Repo-SWE-bench-Regression oder MLX-Quantisierungsvalidierung bleibt Apple Silicon Unified Memory + Metal der reibungsärmste Weg.

Pragmatisch: API als Daily Driver, V4-Pro-Drucktests, 1M-Dokumenten-Batches und Spitzen-/Nebentarif-Cron-Jobs auf einen MACGPU Remote Mac mini M4 — on-demand, SSH-gesichert, Hauptrechner stabil.