2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.
Chapeau : Fin juillet, le changelog DeepSeek révélait une singularité : aucun nouveau modèle, seulement le même V4-Flash à 284 milliards de paramètres, réentraîné en post-training — et pourtant capable de dépasser en benchmarks agents la V4-Pro preview de 1,6T, à un prix représentant une fraction infime de Claude Opus 4.8. Cette analyse retrace la chronologie d'avril à août, les tableaux tarifaires, la mécanique du post-entraînement et du framework Harness, le panorama concurrentiel chinois, les réserves méthodologiques, l'insight « kill line » et un guide d'intégration en cinq étapes, complété par une FAQ.
30 secondes · TL;DR
| Sortie | 2026-07-31 V4-Flash-0731 bêta API officielle · API uniquement, app/web inchangés |
| Architecture | 284B / 13B actifs, identique à la preview d'avril · gains uniquement post-entraînement |
| Tarifs | Entrée $0,14 (cache miss) / $0,0028 (hit) · Sortie $0,28/M |
| Agent | Terminal Bench 2.0 82,7 (auto-déclaré + Harness mode minimal) · dépasse V4-Pro preview 67,9 |
| En attente | V4-Pro officielle · framework Harness · aucune date confirmée |
1. Pourquoi le 0731 mérite attention
- Le flagship Pro tarde, le Flash surpasse. La communauté avait surnommé Liang Wenfeng « Liang Baikai » — promesse non tenue pour la GA Pro mi-juillet. Le 31 juillet, Flash 0731 inverse la narration, mais Pro et Harness restent sans calendrier.
- Des scores sensibles au framework. Terminal Bench 2.0 (82,7) repose sur le mode minimal de Harness, encore non publié. DeepSeek avertit : les scores agents « sont extrêmement sensibles au choix du harness » — ne pas les extrapoler à Claude Code ou Cursor.
- Mise à jour API-only. L'app et le chat web n'ont pas suivi. Deux rythmes de release coexistent : développeurs et utilisateurs finaux ne voient pas la même version.
2. Chronologie : de la preview d'avril à la version « officielle »
| Date | Événement |
|---|---|
| 2026-04-24 | Première publication DeepSeek-V4 en open source (MIT) : V4-Pro (1,6T/49B actifs) et V4-Flash (284B/13B actifs), contexte 1M |
| 2026-07-24 | Alias legacy deepseek-chat et deepseek-reasoner retirés ; trafic basculé vers la famille V4 |
| 2026-07-27 | Moonshot AI publie les poids ouverts de Kimi K3 (2,8T) sur Hugging Face — pression concurrentielle immédiate |
| 2026-07-31 | V4-Flash-0731 en bêta API officielle ; poids sur Hugging Face ; changelog mentionne pour la première fois « DeepSeek Harness » |
| Au 2026-08-05 | V4-Pro officielle toujours « dès que possible ». Médias chinois évoquent une GA 10–20 août — non confirmé par DeepSeek |
3. Données clés
| Modèle | Statut | Total / Actifs | Contexte | Entrée (miss/hit, $/M) | Sortie ($/M) | Licence |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Officiel (31/07) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Preview (24/04, officiel en attente) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Poids ouverts (27/07) | 2,8T / ~104B (estimation) | ~1,05M | $3,00 / $0,30 | $15,00 | Kimi K3 License |
| GLM-5.2 | Open (juin 2026) | ~744B / ~40B | 1M | Non vérifié | Non vérifié | MIT |
| Qwen3.8-Max | API GA (02/08), poids en attente | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Open source promis |
Tarifs auto-déclarés par les éditeurs. DeepSeek a annoncé une majoration ×2 en heures de pointe (9h–12h et 14h–18h, heure de Pékin) — date d'effet non précisée.
4. Analyse technique : d'où vient la performance
4.1 Architecture inchangée — post-entraînement renouvelé
V4-Flash-0731 est strictement identique en taille et structure à la preview d'avril. DeepSeek attribue l'intégralité du gain aux données et méthodes de post-entraînement. Un modèle 284B/13B qui dépasse un 1,6T/49B de la même famille illustre une tendance de fond : en 2026, la qualité du post-entraînement rivalise avec l'échelle brute.
4.2 Attention hybride : CSA+HCA, mHC, optimiseur Muon
Selon le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence » :
- Attention hybride : Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA), commercialisée sous « DSA Sparse Attention », réduit compute et mémoire en long contexte ;
- Hyper-connexions à contrainte de variété (mHC) : amélioration des connexions résiduelles ;
- Optimiseur Muon : convergence accélérée et stabilité d'entraînement.
À 1M tokens, V4-Pro nécessiterait 27 % des FLOPs par token et 10 % du KV Cache vs V3.2 (chiffres éditeur, reproduction indépendante en attente).
4.3 Harness : premier framework agent maison
Le 31 juillet marque la première mention officielle de DeepSeek Harness — framework d'exécution agentique (fichiers, outils, tâches d'ingénierie), positionné face à Claude Code. Tous les scores agents publiés utilisent le mode minimal de Harness (max, top_p=0,95, temperature=1,0), encore inaccessible au public.
5. Panorama : la guerre des modèles open source chinois
| Modèle | Laboratoire | Release | Total | AA Intelligence Index | Coût/tâche (AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 31/07 officiel | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot AI | 16/07 preview / 27/07 poids | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu/Z.ai | Juin 2026 | ~744B | ~1 pt au-dessus de Flash | Non vérifié |
| Qwen3.8-Max | Alibaba | 02/08 GA | 2,4T | Non vérifié | Non vérifié |
| GPT-5.6 Sol | OpenAI | Fermé | — | 9+ pts au-dessus | $1,86 |
| Claude Fable 5 | Anthropic | Fermé | — | 9+ pts au-dessus | $3,15 |
Intelligence Index et coût/tâche : Artificial Analysis (indépendant). Scores agents DeepSeek : auto-déclarés — non comparables directement.
Le paradoxe : V4-Flash ne domine pas l'index AA, mais son coût par tâche représente environ 1/29 de Kimi K3, 1/62 de GPT-5.6 Sol, 1/105 de Claude Fable 5. DeepSeek mise sur « intelligence suffisante à prix imbattable » — d'où sept semaines consécutives en tête d'OpenRouter pour la preview.
6. Réserves : lire les benchmarks avec discernement
- Dépendance au Harness, confirmée par l'éditeur. Terminal Bench 2.0 (82,7 vs 67,9) = auto-déclaration + framework non publié.
- Retours terrain. 21st Century Business Herald cite des taux de cache hit faibles et des timeouts occasionnels du classificateur de sécurité.
- Dates Pro/Harness non confirmées. Fenêtre « 10–20 août » = sources anonymes ; changelog officiel : « dès que possible ».
- Rumeurs de financement/IPO. ~7,4 Md$ levés, valorisation ~48,7 Md$ — informations « selon la presse », sans confirmation réglementaire.
7. Guide en cinq étapes pour les développeurs
- Migrer les noms de modèle : rechercher
deepseek-chat/deepseek-reasoner→ remplacer pardeepseek-v4-flashoudeepseek-v4-pro(désactivés depuis le 24/07). - Choisir Flash vs Pro : agents batch, routage, haute fréquence → Flash 0731 ; raisonnement profond → preview Pro.
- Exploiter le Prompt Cache : prompts système répétés ; coût hit $0,0028/M, quasi gratuit.
- Anticiper les heures de pointe : traitements batch hors 9h–12h et 14h–18h (Pékin).
- Valider sur Mac : Cursor/OpenClaw avec Flash 0731 vs Kimi K3/Qwen3.8-Max sur le même sous-ensemble SWE-bench — latence et taux de réussite réels.
8. FAQ
Q : Différence majeure V4 vs V3.2 ?
R : Contexte natif 1M ; FLOPs à 27 %, KV Cache à 10 % vs V3.2 (éditeur) ; optimisation agents pour Claude Code, OpenCode, etc.
Q : Flash ou Pro au quotidien ?
R : Batch, pipelines agents, budget serré → Flash 0731 ; raisonnement profond → preview Pro.
Q : V4-Pro officielle disponible ?
R : Non au 05/08/2026. Seul Flash 0731, API uniquement. « 10–20 août » = rumeur.
Q : Faut-il croire les benchmarks ?
R : SWE-bench Verified (tiers) relativement fiable ; Terminal Bench 2.0 dépend de Harness — attendre la reproduction communautaire.
Q : Impact pratique ?
R : API compatible OpenAI/Anthropic ; deepseek-v4-flash pointe vers la nouvelle version ; remplacer les anciens alias immédiatement.
9. Perspective : la « kill line » et la guerre des prix
Avant le 0731, la communauté chinoise raillait « Liang Baikai » ; après, « Liang Sheng » — un baromètre de sentiment aussi rapide que le marché lui-même.
Plus profondément, le concept de « 斩杀线 » (kill line) : DeepSeek trace une barre — performance suffisante, prix plancher — en deçà de laquelle les concurrents peinent à exister. Cela éclaire les baisses de prix de GPT-5.6 Luna (~80 %) dans la même période. Comme le résume un incubateur cité par 21st Century Business Herald : « Chaque éditeur de LLM doit rester devant Liang Wenfeng pour survivre. »
Le 31 juillet, Nvidia, Broadcom et AMD n'ont pas bougé — le marché a intégré l'efficacité DeepSeek, loin du choc R1 de début 2025.
Pour les développeurs Mac : licence MIT + 13B actifs ouvrent des expériences de quantification V4-Flash sur mémoire unifiée Apple Silicon (voir benchmarks AMX-2). Les pipelines agents de production méritent un environnement isolé — préserver la mémoire unifiée pour Cursor et Xcode.
10. Conclusion : l'API partout, la validation agent sur Mac
Router via OpenRouter, copier une clé API — n'importe quelle machine suffit. Pour Cursor + V4-Flash long contexte, comparaisons OpenClaw ou validation MLX quantifiée, la mémoire unifiée Apple Silicon et Metal demeurent le chemin le plus fluide.
L'approche pragmatique : API au quotidien, tests de charge agents Flash 0731, régressions Harness et traitements documentaires 1M sur un nœud Mac mini M4 MACGPU distant — à la demande, sécurisé en SSH, machine principale préservée.