2026 DEEPSEEK V4
SORTIE_
COMPLÈTE_GA.

DeepSeek V4 Sortie Complète GA : architecture, tarification pointe/creuse et benchmarks

Synthèse : Trois mois après la preview, DeepSeek V4 franchit le cap de la disponibilité générale le 20 juillet 2026. Au-delà des gains mesurables en orchestration d'agents, raisonnement mathématique et génération de code, la GA introduit une innovation tarifaire : la tarification pointe/creuse. Ce guide couvre l'intégralité des éléments : chronologie, spécifications V4-Pro/Flash, architecture CSA+HCA+mHC, trois modes d'inférence, tableaux de benchmarks, grille tarifaire, migration API (échéance 24 juillet), comparaison GPT-5.6 / Claude Fable 5, FAQ et analyse stratégique.

30 secondes · L'essentiel

Sortie2026-07-20 GA · deepseek-chat retiré le 24/07
ÉchelleV4-Pro 1,6T (49B actifs) · V4-Flash 284B (13B actifs) · 1M tokens chacun
PerformancesSWE-bench Verified 80,6 % (record open source) · LiveCodeBench 93,5 % · MIT
TarifsPointe/creuse · sortie V4-Pro $0,87/M (creuse) / $1,74/M (pointe)
Rapport coût1/116 du coût de Claude Fable 5 ($0,03 vs $3,48/tâche)

1. Enjeux : pourquoi la sortie complète compte

  1. La preview était prometteuse, la production exigeait des garanties. Depuis le 24 avril 2026, deux questions dominaient : la performance allait-elle encore progresser ? La tarification allait-elle changer ? La GA répond aux deux — trois mois de tuning production et un modèle tarifaire transparent.
  2. Les anciennes API disparaissent dans quatre jours. deepseek-chat et deepseek-reasoner seront retirés le 24 juill. 2026 à 15h59 UTC. Tout agent Cursor, OpenClaw ou maison utilisant ces noms doit migrer immédiatement.
  3. La tarification pointe/creuse est un levier de pilotage. En heures de pointe (09h–12h et 14h–18h, heure de Pékin), les tarifs doublent — mais V4-Pro reste 8,6× moins cher qu'Opus 4.8 ($15/M) même en pointe. La clé : décaler les charges et router vers Flash.

2. Définition : qu'est-ce que DeepSeek V4 GA ?

DeepSeek V4 GA est la version en disponibilité générale publiée le 20 juillet 2026, comprenant V4-Pro (1,6 billion de paramètres MoE) et V4-Flash (284 milliards de paramètres MoE), tous deux sous licence MIT, avec 1 million de tokens de contexte et 384K de sortie maximale.

Par rapport à la preview : capacités agentiques, raisonnement mathématique et génération de code améliorés, plus tarification API différenciée. L'architecture CSA + HCA + mHC date de la preview — la GA apporte stabilité, tuning et bouclage commercial.

En une phrase : le meilleur score SWE-bench Verified en open source (80,6 %), des performances proches de la frontière à 1/10 voire 1/100 du coût des modèles fermés, avec déploiement privé et contexte 1M.

3. Chronologie : de la preview à la GA

DateÉvénement
2026-04-24Preview V4 + open source (MIT), V4-Pro (1,6T) et V4-Flash (284B)
2026-05Versions tuning production, API généralement disponible
2026-06Baisse permanente de 75 % sur V4-Pro (sortie $0,87/M)
2026-06-29E-mail à tous les utilisateurs API : GA mi-juillet, première annonce tarification pointe/creuse
2026-07-19Accès bêta GA pour développeurs sélectionnés, couverture média
2026-07-20GA complète en ligne (date de publication de cet article)
2026-07-24deepseek-chat et deepseek-reasoner définitivement retirés

Pour approfondir : puce IA DeepSeek & inférence, test Kimi K3 et baisses de prix IA juin 2026.

4. Famille de modèles : V4-Pro vs V4-Flash

SpécificationV4-ProV4-Flash
Paramètres totaux1,6 billion (1,6T)284 milliards (284B)
Paramètres actifs/token49 milliards (49B)13 milliards (13B)
Couches Transformer6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie maximale384K tokens384K tokens
PrécisionFP4 (experts) + FP8 (reste)FP4 + FP8 mixte
Pré-entraînement33T+ tokens32T+ tokens
LicenceMITMIT

5. Architecture : CSA + HCA + mHC

Les Transformers classiques font croître le KV Cache linéairement — un contexte d'1M tokens était économiquement hors de portée. DeepSeek V4 remplace le MLA de V2/V3 par trois innovations architecturales :

5.1 CSA — Compressed Sparse Attention

  • Compression de la séquence KV par pooling à porte Softmax
  • Indexeur FP4 « Lightning » pour sélection sparse top-k (V4-Pro : top-1024, V4-Flash : top-512)
  • Fenêtre glissante des 128 derniers tokens
  • À 1M tokens : seulement 27 % des FLOPs d'inférence de V3.2

5.2 HCA — Heavily Compressed Attention

  • Compression 128× des tokens, attention dense globale
  • Complète CSA pour les dépendances longue portée
  • V4-Flash : 2 premières couches HCA, puis alternance CSA/HCA ; V4-Pro similaire

Effet global : mémoire KV Cache à 10 % de V3.2 (V4-Flash : 7 %).

5.3 mHC & optimiseur Muon

mHC enrichit les connexions résiduelles d'un flux résiduel à 4 canaux avec matrices de mélange contraintes doubly-stochastiques (polytope de Birkhoff) — propagation stable sur 61 couches.

Entraînement avec l'optimiseur Muon (à la place d'AdamW) : orthogonalisation Newton-Schulz des gradients pour une convergence plus rapide et stable.

5.4 Trois modes d'inférence

ModeCaractéristiqueUsage
Non-thinkPas de chaîne de pensée, latence minimaleQ&R simples, routage
Think HighRaisonnement explicite (<redacted_thinking>)Complexité moyenne, débogage code
Think MaxRaisonnement maximal, contexte 384K+Mathématiques complexes, agents longue chaîne

Paramètres d'échantillonnage recommandés : temperature=1.0, top_p=1.0 (officiel, tous modes).

6. Benchmarks : le palmarès open source

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ record open source96,0 %non publié séparément~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Lecture des résultats :

  • SWE-bench Verified : V4-Pro 80,6 % — tête du peloton open source, à égalité avec Gemini 3.1 Pro
  • LiveCodeBench : V4-Pro 93,5 % — devant tous les concurrents fermés
  • SWE-bench Pro : Fable 5 à 80,3 % — corrections multi-fichiers en dépôt
  • Terminal-Bench : GPT-5.6 Ultra 85,1 % — agents terminal et chaînes d'outils

Note : benchmarks issus des déclarations DeepSeek et de synthèses tierces ; reproductions indépendantes en cours.

7. Rapport coût-performance : prix par tâche

Source : Artificial Analysis, indice Strategy & Ops :

ModèleCoût/tâcheScoreRapport
Claude Fable 5$3,4850 pointsRéférence
DeepSeek V4-Pro$0,0338 points1/116 du coût Fable 5
DeepSeek V4-Flashtoutes les 6 tâches d'index < $0,04Tâches légères optimales

Fable 5 coûte 116× plus cher pour seulement ~12 points (31 %) de plus. Pour la plupart des déploiements production, V4-Pro est le choix rationnel.

8. Comparaison : V4 vs GPT-5.6 Sol vs Claude Fable 5

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open source✅ MIT❌ fermé❌ fermé
Auto-hébergement
Contexte1M tokensnon communiqué1M tokens
Codetrès fort (proche Fable 5)très fortmeilleure catégorie
Sortie API (creuse)$0,87/M~$15/M$50/M
Sortie API (pointe)$1,74/M
Capacités agentiquesfortes, multi-agentsfortesmeilleure catégorie
Confidentialité des données✅ déploiement privé
ScénarioRecommandationJustification
Budget / haute fréquence / auto-hébergementV4-Pro / Flash$0,87/M, MIT
Code maximal, coût secondaireClaude Fable 5SWE-bench Pro 80,3 %
Algorithmes + raisonnement mathématiqueGPT-5.6 Sol / UltraTerminal-Bench en tête
Traitement massif de logs/documentsV4-Flashcache hit entrée à $0,0028/M

9. Tarification pointe/creuse : grille complète

La GA introduit une différenciation temporelle — comparable aux tarifs électriques. Heures de pointe (heure de Pékin) : jours ouvrés 09h00–12h00 et 14h00–18h00, tous les tarifs doublent.

ModèlePosteCreusePointe
V4-ProEntrée (cache hit)¥0,025 / $0,0035 / 1M×2
Entrée (cache miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Sortie¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashEntrée (cache hit)¥0,02 / $0,0028 / 1M×2
Entrée (cache miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Sortie¥2,00 / $0,28 / 1M¥4,00 / $0,56

9.1 Quatre leviers d'optimisation des coûts

  1. Tâches non temps réel en heures creuses : traitement documentaire, annotation, revue de code après 18h ou avant 9h
  2. Exploiter le cache de prompts : prompts système répétés — V4-Flash cache hit dès $0,0028/M
  3. Routage Flash : reconnaissance d'intention sur Flash, raisonnement complexe sur Pro — économie de 60 à 80 %
  4. Notification tarifaire : DeepSeek annonce les changements 24 heures à l'avance par e-mail

Même en pointe : V4-Pro ($1,74/M) reste 8,6× moins cher qu'Opus 4.8 ($15/M) et GPT-5.6 Sol (~$15/M).

10. Migration API (échéance 24 juillet) ⚠️

Alerte : deepseek-chat et deepseek-reasoner seront définitivement retirés le 24 juill. 2026 à 15h59 UTC (23h59 heure de Pékin).

AncienNouveauNote
deepseek-chatdeepseek-v4-flash (Non-think)Rapide, tâches légères
deepseek-reasonerdeepseek-v4-flash (Think)ou deepseek-v4-pro pour un raisonnement supérieur

10.1 OpenAI SDK (Python)

from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # ❌ Ancien (invalide après le 24/07) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ Nouveau — Non-think response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] ) # ✅ Nouveau — Think (remplace deepseek-reasoner) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Solve this step by step..."}], extra_body={ "thinking": {"type": "enabled", "budget_tokens": 8000} } )

10.2 SDK Anthropic

V4 prend en charge OpenAI ChatCompletions et Anthropic Messages — mettez à jour uniquement model :

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "Qu'est-ce qui change dans la sortie V4 GA ?"}] )

11. Intégration : cinq voies d'accès immédiat

  1. Web/App : chat.deepseek.com — V4 GA activé par défaut.
  2. API officielle : platform.deepseek.com — compatible OpenAI, modèles deepseek-v4-pro / deepseek-v4-flash.
  3. OpenRouter : ID modèle deepseek/deepseek-v4-pro — voir guide routage Mac OpenRouter.
  4. Cursor / IDE : V4-Pro en usage quotidien, repli sur Claude Fable 5 pour les bugs repo complexes.
  5. Migration codebase : rechercher deepseek-chat et deepseek-reasoner, tester en staging, basculer en production avant le 24 juillet.

12. FAQ

Q : Différence GA vs preview ?
R : Capacités agentiques, mathématiques et code améliorées, tarification pointe/creuse, stabilité production accrue. Architecture inchangée.

Q : V4-Pro ou V4-Flash ?
R : Pro pour raisonnement complexe et agents longue chaîne ; Flash pour haute fréquence et routage ($0,28/M en creuse).

Q : Heures de pointe ?
R : Heure de Pékin, jours ouvrés 09h00–12h00 et 14h00–18h00, tarifs doublés.

Q : Quand deepseek-chat disparaît-il ?
R : 24 juill. 2026, 15h59 UTC. Migrer vers deepseek-v4-flash ou deepseek-v4-pro.

Q : Déploiement local ?
R : Licence MIT, poids sur Hugging Face. V4-Pro exige un cluster GPU ; Mac pour API ou quantification.

Q : vs Claude Fable 5 ?
R : Fable 5 domine SWE-bench ; V4-Pro à 1/116 du coût avec performances proches de la frontière et auto-hébergement.

13. Analyse : un tournant pour l'open source en 2026

La sortie GA de DeepSeek V4 dépasse la simple « graduation » de la preview — elle marque un tournant structurel dans l'écosystème open source chinois à mi-2026.

13.1 Du disrupteur tarifaire à la plateforme disciplinée

Pendant 18 mois, DeepSeek a imposé des tarifs agressifs (V3 : $0,28/M sortie) et forcé la réaction du marché. La tarification pointe/creuse signale le passage de la subvention à l'exploitation durable — sans sacrifier la compétitivité : même en pointe, $1,74/M reste 8,6× sous Opus 4.8. Le mécanisme est un outil de pilotage de la demande, non un simple transfert de coûts.

13.2 Architecture et économie du long contexte

1M tokens n'est plus un argument unique en 2026 — Kimi K3 et Fable 5 l'offrent aussi. La singularité de V4 : rendre 1M économiquement viable. CSA 4× + top-1024 + fenêtre 128 tokens : 27 % des FLOPs, 10 % du KV Cache vs V3.2. Kimi K3 à $15/M contre V4-Pro à $0,87/M — un écart de plusieurs ordres de grandeur.

mHC et Muon permettent un entraînement stable sur 61 couches à 1,6T — le socle technique du saut de 671B à 1,6T.

13.3 La licence MIT comme facteur stratégique

En juillet 2026, la licence pèse autant que le nombre de paramètres. Les restrictions Llama et les clauses « recherche uniquement » créent des risques de conformité. MIT chez V4 signifie :

  • Déploiement on-prem sans restriction ni redevance
  • Finetuning, distillation, produits propriétaires autorisés
  • Résidence des données pour secteurs régulés sans dépendance API US

Kimi K3 revendique le record de taille à 2,8T (voir test K3) ; DeepSeek V4 se distingue par l'efficacité, la structure de coûts et la liberté de licence. Pour les développeurs Mac : MIT + compatibilité dual-SDK pour Cursor, Continue, OpenClaw — avec potentiel de quantification MLX. Voir benchmarks Apple Silicon V4 AMX-2.

V4 GA ne domine pas encore tous les classements face à Fable 5 et GPT-5.6 — mais offre la meilleure performance open source à 1/10 voire 1/100 du coût. Pour les entreprises soucieuses de confidentialité, les équipes à budget contraint et les ingénieurs agents 1M : V4-Pro est le choix le plus équilibré.

14. Conclusion : l'API partout, la validation agent sur Mac

Enregistrer une clé API, changer un nom de modèle, router via OpenRouter — n'importe quel ordinateur suffit. Pour Cursor + agents V4-Pro long contexte, tests Think Max, régression SWE-bench multi-dépôts ou validation quantifiée MLX, la mémoire unifiée Apple Silicon et Metal restent le chemin le plus fluide.

L'approche pragmatique : API au quotidien, tests de charge V4-Pro, traitements documentaires 1M et jobs cron pointe/creuse sur un nœud Mac mini M4 MACGPU distant — à la demande, sécurisé en SSH, machine principale préservée.