2026 DEEPSEEK V4
SORTIE_
COMPLÈTE_GA.
Synthèse : Trois mois après la preview, DeepSeek V4 franchit le cap de la disponibilité générale le 20 juillet 2026. Au-delà des gains mesurables en orchestration d'agents, raisonnement mathématique et génération de code, la GA introduit une innovation tarifaire : la tarification pointe/creuse. Ce guide couvre l'intégralité des éléments : chronologie, spécifications V4-Pro/Flash, architecture CSA+HCA+mHC, trois modes d'inférence, tableaux de benchmarks, grille tarifaire, migration API (échéance 24 juillet), comparaison GPT-5.6 / Claude Fable 5, FAQ et analyse stratégique.
30 secondes · L'essentiel
| Sortie | 2026-07-20 GA · deepseek-chat retiré le 24/07 |
| Échelle | V4-Pro 1,6T (49B actifs) · V4-Flash 284B (13B actifs) · 1M tokens chacun |
| Performances | SWE-bench Verified 80,6 % (record open source) · LiveCodeBench 93,5 % · MIT |
| Tarifs | Pointe/creuse · sortie V4-Pro $0,87/M (creuse) / $1,74/M (pointe) |
| Rapport coût | 1/116 du coût de Claude Fable 5 ($0,03 vs $3,48/tâche) |
1. Enjeux : pourquoi la sortie complète compte
- La preview était prometteuse, la production exigeait des garanties. Depuis le 24 avril 2026, deux questions dominaient : la performance allait-elle encore progresser ? La tarification allait-elle changer ? La GA répond aux deux — trois mois de tuning production et un modèle tarifaire transparent.
- Les anciennes API disparaissent dans quatre jours.
deepseek-chatetdeepseek-reasonerseront retirés le 24 juill. 2026 à 15h59 UTC. Tout agent Cursor, OpenClaw ou maison utilisant ces noms doit migrer immédiatement. - La tarification pointe/creuse est un levier de pilotage. En heures de pointe (09h–12h et 14h–18h, heure de Pékin), les tarifs doublent — mais V4-Pro reste 8,6× moins cher qu'Opus 4.8 ($15/M) même en pointe. La clé : décaler les charges et router vers Flash.
2. Définition : qu'est-ce que DeepSeek V4 GA ?
DeepSeek V4 GA est la version en disponibilité générale publiée le 20 juillet 2026, comprenant V4-Pro (1,6 billion de paramètres MoE) et V4-Flash (284 milliards de paramètres MoE), tous deux sous licence MIT, avec 1 million de tokens de contexte et 384K de sortie maximale.
Par rapport à la preview : capacités agentiques, raisonnement mathématique et génération de code améliorés, plus tarification API différenciée. L'architecture CSA + HCA + mHC date de la preview — la GA apporte stabilité, tuning et bouclage commercial.
En une phrase : le meilleur score SWE-bench Verified en open source (80,6 %), des performances proches de la frontière à 1/10 voire 1/100 du coût des modèles fermés, avec déploiement privé et contexte 1M.
3. Chronologie : de la preview à la GA
| Date | Événement |
|---|---|
| 2026-04-24 | Preview V4 + open source (MIT), V4-Pro (1,6T) et V4-Flash (284B) |
| 2026-05 | Versions tuning production, API généralement disponible |
| 2026-06 | Baisse permanente de 75 % sur V4-Pro (sortie $0,87/M) |
| 2026-06-29 | E-mail à tous les utilisateurs API : GA mi-juillet, première annonce tarification pointe/creuse |
| 2026-07-19 | Accès bêta GA pour développeurs sélectionnés, couverture média |
| 2026-07-20 | GA complète en ligne (date de publication de cet article) |
| 2026-07-24 | deepseek-chat et deepseek-reasoner définitivement retirés |
Pour approfondir : puce IA DeepSeek & inférence, test Kimi K3 et baisses de prix IA juin 2026.
4. Famille de modèles : V4-Pro vs V4-Flash
| Spécification | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion (1,6T) | 284 milliards (284B) |
| Paramètres actifs/token | 49 milliards (49B) | 13 milliards (13B) |
| Couches Transformer | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Sortie maximale | 384K tokens | 384K tokens |
| Précision | FP4 (experts) + FP8 (reste) | FP4 + FP8 mixte |
| Pré-entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
5. Architecture : CSA + HCA + mHC
Les Transformers classiques font croître le KV Cache linéairement — un contexte d'1M tokens était économiquement hors de portée. DeepSeek V4 remplace le MLA de V2/V3 par trois innovations architecturales :
5.1 CSA — Compressed Sparse Attention
- Compression 4× de la séquence KV par pooling à porte Softmax
- Indexeur FP4 « Lightning » pour sélection sparse top-k (V4-Pro : top-1024, V4-Flash : top-512)
- Fenêtre glissante des 128 derniers tokens
- À 1M tokens : seulement 27 % des FLOPs d'inférence de V3.2
5.2 HCA — Heavily Compressed Attention
- Compression 128× des tokens, attention dense globale
- Complète CSA pour les dépendances longue portée
- V4-Flash : 2 premières couches HCA, puis alternance CSA/HCA ; V4-Pro similaire
Effet global : mémoire KV Cache à 10 % de V3.2 (V4-Flash : 7 %).
5.3 mHC & optimiseur Muon
mHC enrichit les connexions résiduelles d'un flux résiduel à 4 canaux avec matrices de mélange contraintes doubly-stochastiques (polytope de Birkhoff) — propagation stable sur 61 couches.
Entraînement avec l'optimiseur Muon (à la place d'AdamW) : orthogonalisation Newton-Schulz des gradients pour une convergence plus rapide et stable.
5.4 Trois modes d'inférence
| Mode | Caractéristique | Usage |
|---|---|---|
| Non-think | Pas de chaîne de pensée, latence minimale | Q&R simples, routage |
| Think High | Raisonnement explicite (<redacted_thinking>) | Complexité moyenne, débogage code |
| Think Max | Raisonnement maximal, contexte 384K+ | Mathématiques complexes, agents longue chaîne |
Paramètres d'échantillonnage recommandés : temperature=1.0, top_p=1.0 (officiel, tous modes).
6. Benchmarks : le palmarès open source
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ record open source | 96,0 % | non publié séparément | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Lecture des résultats :
- SWE-bench Verified : V4-Pro 80,6 % — tête du peloton open source, à égalité avec Gemini 3.1 Pro
- LiveCodeBench : V4-Pro 93,5 % — devant tous les concurrents fermés
- SWE-bench Pro : Fable 5 à 80,3 % — corrections multi-fichiers en dépôt
- Terminal-Bench : GPT-5.6 Ultra 85,1 % — agents terminal et chaînes d'outils
Note : benchmarks issus des déclarations DeepSeek et de synthèses tierces ; reproductions indépendantes en cours.
7. Rapport coût-performance : prix par tâche
Source : Artificial Analysis, indice Strategy & Ops :
| Modèle | Coût/tâche | Score | Rapport |
|---|---|---|---|
| Claude Fable 5 | $3,48 | 50 points | Référence |
| DeepSeek V4-Pro | $0,03 | 38 points | 1/116 du coût Fable 5 |
| DeepSeek V4-Flash | toutes les 6 tâches d'index < $0,04 | — | Tâches légères optimales |
Fable 5 coûte 116× plus cher pour seulement ~12 points (31 %) de plus. Pour la plupart des déploiements production, V4-Pro est le choix rationnel.
8. Comparaison : V4 vs GPT-5.6 Sol vs Claude Fable 5
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source | ✅ MIT | ❌ fermé | ❌ fermé |
| Auto-hébergement | ✅ | ❌ | ❌ |
| Contexte | 1M tokens | non communiqué | 1M tokens |
| Code | très fort (proche Fable 5) | très fort | meilleure catégorie |
| Sortie API (creuse) | $0,87/M | ~$15/M | $50/M |
| Sortie API (pointe) | $1,74/M | — | — |
| Capacités agentiques | fortes, multi-agents | fortes | meilleure catégorie |
| Confidentialité des données | ✅ déploiement privé | ❌ | ❌ |
| Scénario | Recommandation | Justification |
|---|---|---|
| Budget / haute fréquence / auto-hébergement | V4-Pro / Flash | $0,87/M, MIT |
| Code maximal, coût secondaire | Claude Fable 5 | SWE-bench Pro 80,3 % |
| Algorithmes + raisonnement mathématique | GPT-5.6 Sol / Ultra | Terminal-Bench en tête |
| Traitement massif de logs/documents | V4-Flash | cache hit entrée à $0,0028/M |
9. Tarification pointe/creuse : grille complète
La GA introduit une différenciation temporelle — comparable aux tarifs électriques. Heures de pointe (heure de Pékin) : jours ouvrés 09h00–12h00 et 14h00–18h00, tous les tarifs doublent.
| Modèle | Poste | Creuse | Pointe |
|---|---|---|---|
| V4-Pro | Entrée (cache hit) | ¥0,025 / $0,0035 / 1M | ×2 |
| Entrée (cache miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Sortie | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Entrée (cache hit) | ¥0,02 / $0,0028 / 1M | ×2 |
| Entrée (cache miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Sortie | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
9.1 Quatre leviers d'optimisation des coûts
- Tâches non temps réel en heures creuses : traitement documentaire, annotation, revue de code après 18h ou avant 9h
- Exploiter le cache de prompts : prompts système répétés — V4-Flash cache hit dès $0,0028/M
- Routage Flash : reconnaissance d'intention sur Flash, raisonnement complexe sur Pro — économie de 60 à 80 %
- Notification tarifaire : DeepSeek annonce les changements 24 heures à l'avance par e-mail
Même en pointe : V4-Pro ($1,74/M) reste 8,6× moins cher qu'Opus 4.8 ($15/M) et GPT-5.6 Sol (~$15/M).
10. Migration API (échéance 24 juillet) ⚠️
Alerte : deepseek-chat et deepseek-reasoner seront définitivement retirés le 24 juill. 2026 à 15h59 UTC (23h59 heure de Pékin).
| Ancien | Nouveau | Note |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Rapide, tâches légères |
deepseek-reasoner | deepseek-v4-flash (Think) | ou deepseek-v4-pro pour un raisonnement supérieur |
10.1 OpenAI SDK (Python)
10.2 SDK Anthropic
V4 prend en charge OpenAI ChatCompletions et Anthropic Messages — mettez à jour uniquement model :
11. Intégration : cinq voies d'accès immédiat
- Web/App : chat.deepseek.com — V4 GA activé par défaut.
- API officielle : platform.deepseek.com — compatible OpenAI, modèles
deepseek-v4-pro/deepseek-v4-flash. - OpenRouter : ID modèle
deepseek/deepseek-v4-pro— voir guide routage Mac OpenRouter. - Cursor / IDE : V4-Pro en usage quotidien, repli sur Claude Fable 5 pour les bugs repo complexes.
- Migration codebase : rechercher
deepseek-chatetdeepseek-reasoner, tester en staging, basculer en production avant le 24 juillet.
12. FAQ
Q : Différence GA vs preview ?
R : Capacités agentiques, mathématiques et code améliorées, tarification pointe/creuse, stabilité production accrue. Architecture inchangée.
Q : V4-Pro ou V4-Flash ?
R : Pro pour raisonnement complexe et agents longue chaîne ; Flash pour haute fréquence et routage ($0,28/M en creuse).
Q : Heures de pointe ?
R : Heure de Pékin, jours ouvrés 09h00–12h00 et 14h00–18h00, tarifs doublés.
Q : Quand deepseek-chat disparaît-il ?
R : 24 juill. 2026, 15h59 UTC. Migrer vers deepseek-v4-flash ou deepseek-v4-pro.
Q : Déploiement local ?
R : Licence MIT, poids sur Hugging Face. V4-Pro exige un cluster GPU ; Mac pour API ou quantification.
Q : vs Claude Fable 5 ?
R : Fable 5 domine SWE-bench ; V4-Pro à 1/116 du coût avec performances proches de la frontière et auto-hébergement.
13. Analyse : un tournant pour l'open source en 2026
La sortie GA de DeepSeek V4 dépasse la simple « graduation » de la preview — elle marque un tournant structurel dans l'écosystème open source chinois à mi-2026.
13.1 Du disrupteur tarifaire à la plateforme disciplinée
Pendant 18 mois, DeepSeek a imposé des tarifs agressifs (V3 : $0,28/M sortie) et forcé la réaction du marché. La tarification pointe/creuse signale le passage de la subvention à l'exploitation durable — sans sacrifier la compétitivité : même en pointe, $1,74/M reste 8,6× sous Opus 4.8. Le mécanisme est un outil de pilotage de la demande, non un simple transfert de coûts.
13.2 Architecture et économie du long contexte
1M tokens n'est plus un argument unique en 2026 — Kimi K3 et Fable 5 l'offrent aussi. La singularité de V4 : rendre 1M économiquement viable. CSA 4× + top-1024 + fenêtre 128 tokens : 27 % des FLOPs, 10 % du KV Cache vs V3.2. Kimi K3 à $15/M contre V4-Pro à $0,87/M — un écart de plusieurs ordres de grandeur.
mHC et Muon permettent un entraînement stable sur 61 couches à 1,6T — le socle technique du saut de 671B à 1,6T.
13.3 La licence MIT comme facteur stratégique
En juillet 2026, la licence pèse autant que le nombre de paramètres. Les restrictions Llama et les clauses « recherche uniquement » créent des risques de conformité. MIT chez V4 signifie :
- Déploiement on-prem sans restriction ni redevance
- Finetuning, distillation, produits propriétaires autorisés
- Résidence des données pour secteurs régulés sans dépendance API US
Kimi K3 revendique le record de taille à 2,8T (voir test K3) ; DeepSeek V4 se distingue par l'efficacité, la structure de coûts et la liberté de licence. Pour les développeurs Mac : MIT + compatibilité dual-SDK pour Cursor, Continue, OpenClaw — avec potentiel de quantification MLX. Voir benchmarks Apple Silicon V4 AMX-2.
V4 GA ne domine pas encore tous les classements face à Fable 5 et GPT-5.6 — mais offre la meilleure performance open source à 1/10 voire 1/100 du coût. Pour les entreprises soucieuses de confidentialité, les équipes à budget contraint et les ingénieurs agents 1M : V4-Pro est le choix le plus équilibré.
14. Conclusion : l'API partout, la validation agent sur Mac
Enregistrer une clé API, changer un nom de modèle, router via OpenRouter — n'importe quel ordinateur suffit. Pour Cursor + agents V4-Pro long contexte, tests Think Max, régression SWE-bench multi-dépôts ou validation quantifiée MLX, la mémoire unifiée Apple Silicon et Metal restent le chemin le plus fluide.
L'approche pragmatique : API au quotidien, tests de charge V4-Pro, traitements documentaires 1M et jobs cron pointe/creuse sur un nœud Mac mini M4 MACGPU distant — à la demande, sécurisé en SSH, machine principale préservée.