2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.

DeepSeek V4 Flash 0731 — analyse benchmarks et tarification

Chapeau : Fin juillet, le changelog DeepSeek révélait une singularité : aucun nouveau modèle, seulement le même V4-Flash à 284 milliards de paramètres, réentraîné en post-training — et pourtant capable de dépasser en benchmarks agents la V4-Pro preview de 1,6T, à un prix représentant une fraction infime de Claude Opus 4.8. Cette analyse retrace la chronologie d'avril à août, les tableaux tarifaires, la mécanique du post-entraînement et du framework Harness, le panorama concurrentiel chinois, les réserves méthodologiques, l'insight « kill line » et un guide d'intégration en cinq étapes, complété par une FAQ.

30 secondes · TL;DR

Sortie2026-07-31 V4-Flash-0731 bêta API officielle · API uniquement, app/web inchangés
Architecture284B / 13B actifs, identique à la preview d'avril · gains uniquement post-entraînement
TarifsEntrée $0,14 (cache miss) / $0,0028 (hit) · Sortie $0,28/M
AgentTerminal Bench 2.0 82,7 (auto-déclaré + Harness mode minimal) · dépasse V4-Pro preview 67,9
En attenteV4-Pro officielle · framework Harness · aucune date confirmée

1. Pourquoi le 0731 mérite attention

  1. Le flagship Pro tarde, le Flash surpasse. La communauté avait surnommé Liang Wenfeng « Liang Baikai » — promesse non tenue pour la GA Pro mi-juillet. Le 31 juillet, Flash 0731 inverse la narration, mais Pro et Harness restent sans calendrier.
  2. Des scores sensibles au framework. Terminal Bench 2.0 (82,7) repose sur le mode minimal de Harness, encore non publié. DeepSeek avertit : les scores agents « sont extrêmement sensibles au choix du harness » — ne pas les extrapoler à Claude Code ou Cursor.
  3. Mise à jour API-only. L'app et le chat web n'ont pas suivi. Deux rythmes de release coexistent : développeurs et utilisateurs finaux ne voient pas la même version.

2. Chronologie : de la preview d'avril à la version « officielle »

DateÉvénement
2026-04-24Première publication DeepSeek-V4 en open source (MIT) : V4-Pro (1,6T/49B actifs) et V4-Flash (284B/13B actifs), contexte 1M
2026-07-24Alias legacy deepseek-chat et deepseek-reasoner retirés ; trafic basculé vers la famille V4
2026-07-27Moonshot AI publie les poids ouverts de Kimi K3 (2,8T) sur Hugging Face — pression concurrentielle immédiate
2026-07-31V4-Flash-0731 en bêta API officielle ; poids sur Hugging Face ; changelog mentionne pour la première fois « DeepSeek Harness »
Au 2026-08-05V4-Pro officielle toujours « dès que possible ». Médias chinois évoquent une GA 10–20 août — non confirmé par DeepSeek

3. Données clés

ModèleStatutTotal / ActifsContexteEntrée (miss/hit, $/M)Sortie ($/M)Licence
V4-Flash-0731Officiel (31/07)284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProPreview (24/04, officiel en attente)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Poids ouverts (27/07)2,8T / ~104B (estimation)~1,05M$3,00 / $0,30$15,00Kimi K3 License
GLM-5.2Open (juin 2026)~744B / ~40B1MNon vérifiéNon vérifiéMIT
Qwen3.8-MaxAPI GA (02/08), poids en attente2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Open source promis

Tarifs auto-déclarés par les éditeurs. DeepSeek a annoncé une majoration ×2 en heures de pointe (9h–12h et 14h–18h, heure de Pékin) — date d'effet non précisée.

4. Analyse technique : d'où vient la performance

4.1 Architecture inchangée — post-entraînement renouvelé

V4-Flash-0731 est strictement identique en taille et structure à la preview d'avril. DeepSeek attribue l'intégralité du gain aux données et méthodes de post-entraînement. Un modèle 284B/13B qui dépasse un 1,6T/49B de la même famille illustre une tendance de fond : en 2026, la qualité du post-entraînement rivalise avec l'échelle brute.

4.2 Attention hybride : CSA+HCA, mHC, optimiseur Muon

Selon le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence » :

  1. Attention hybride : Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA), commercialisée sous « DSA Sparse Attention », réduit compute et mémoire en long contexte ;
  2. Hyper-connexions à contrainte de variété (mHC) : amélioration des connexions résiduelles ;
  3. Optimiseur Muon : convergence accélérée et stabilité d'entraînement.

À 1M tokens, V4-Pro nécessiterait 27 % des FLOPs par token et 10 % du KV Cache vs V3.2 (chiffres éditeur, reproduction indépendante en attente).

4.3 Harness : premier framework agent maison

Le 31 juillet marque la première mention officielle de DeepSeek Harness — framework d'exécution agentique (fichiers, outils, tâches d'ingénierie), positionné face à Claude Code. Tous les scores agents publiés utilisent le mode minimal de Harness (max, top_p=0,95, temperature=1,0), encore inaccessible au public.

5. Panorama : la guerre des modèles open source chinois

ModèleLaboratoireReleaseTotalAA Intelligence IndexCoût/tâche (AA)
V4-Flash-0731DeepSeek31/07 officiel284B50$0,03
Kimi K3Moonshot AI16/07 preview / 27/07 poids2,8T57$0,86
GLM-5.2Zhipu/Z.aiJuin 2026~744B~1 pt au-dessus de FlashNon vérifié
Qwen3.8-MaxAlibaba02/08 GA2,4TNon vérifiéNon vérifié
GPT-5.6 SolOpenAIFermé9+ pts au-dessus$1,86
Claude Fable 5AnthropicFermé9+ pts au-dessus$3,15

Intelligence Index et coût/tâche : Artificial Analysis (indépendant). Scores agents DeepSeek : auto-déclarés — non comparables directement.

Le paradoxe : V4-Flash ne domine pas l'index AA, mais son coût par tâche représente environ 1/29 de Kimi K3, 1/62 de GPT-5.6 Sol, 1/105 de Claude Fable 5. DeepSeek mise sur « intelligence suffisante à prix imbattable » — d'où sept semaines consécutives en tête d'OpenRouter pour la preview.

6. Réserves : lire les benchmarks avec discernement

  • Dépendance au Harness, confirmée par l'éditeur. Terminal Bench 2.0 (82,7 vs 67,9) = auto-déclaration + framework non publié.
  • Retours terrain. 21st Century Business Herald cite des taux de cache hit faibles et des timeouts occasionnels du classificateur de sécurité.
  • Dates Pro/Harness non confirmées. Fenêtre « 10–20 août » = sources anonymes ; changelog officiel : « dès que possible ».
  • Rumeurs de financement/IPO. ~7,4 Md$ levés, valorisation ~48,7 Md$ — informations « selon la presse », sans confirmation réglementaire.

7. Guide en cinq étapes pour les développeurs

  1. Migrer les noms de modèle : rechercher deepseek-chat / deepseek-reasoner → remplacer par deepseek-v4-flash ou deepseek-v4-pro (désactivés depuis le 24/07).
  2. Choisir Flash vs Pro : agents batch, routage, haute fréquence → Flash 0731 ; raisonnement profond → preview Pro.
  3. Exploiter le Prompt Cache : prompts système répétés ; coût hit $0,0028/M, quasi gratuit.
  4. Anticiper les heures de pointe : traitements batch hors 9h–12h et 14h–18h (Pékin).
  5. Valider sur Mac : Cursor/OpenClaw avec Flash 0731 vs Kimi K3/Qwen3.8-Max sur le même sous-ensemble SWE-bench — latence et taux de réussite réels.
from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # V4-Flash-0731 pointe automatiquement vers la dernière version officielle response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Résume le changelog 0731."}] )

8. FAQ

Q : Différence majeure V4 vs V3.2 ?
R : Contexte natif 1M ; FLOPs à 27 %, KV Cache à 10 % vs V3.2 (éditeur) ; optimisation agents pour Claude Code, OpenCode, etc.

Q : Flash ou Pro au quotidien ?
R : Batch, pipelines agents, budget serré → Flash 0731 ; raisonnement profond → preview Pro.

Q : V4-Pro officielle disponible ?
R : Non au 05/08/2026. Seul Flash 0731, API uniquement. « 10–20 août » = rumeur.

Q : Faut-il croire les benchmarks ?
R : SWE-bench Verified (tiers) relativement fiable ; Terminal Bench 2.0 dépend de Harness — attendre la reproduction communautaire.

Q : Impact pratique ?
R : API compatible OpenAI/Anthropic ; deepseek-v4-flash pointe vers la nouvelle version ; remplacer les anciens alias immédiatement.

9. Perspective : la « kill line » et la guerre des prix

Avant le 0731, la communauté chinoise raillait « Liang Baikai » ; après, « Liang Sheng » — un baromètre de sentiment aussi rapide que le marché lui-même.

Plus profondément, le concept de « 斩杀线 » (kill line) : DeepSeek trace une barre — performance suffisante, prix plancher — en deçà de laquelle les concurrents peinent à exister. Cela éclaire les baisses de prix de GPT-5.6 Luna (~80 %) dans la même période. Comme le résume un incubateur cité par 21st Century Business Herald : « Chaque éditeur de LLM doit rester devant Liang Wenfeng pour survivre. »

Le 31 juillet, Nvidia, Broadcom et AMD n'ont pas bougé — le marché a intégré l'efficacité DeepSeek, loin du choc R1 de début 2025.

Pour les développeurs Mac : licence MIT + 13B actifs ouvrent des expériences de quantification V4-Flash sur mémoire unifiée Apple Silicon (voir benchmarks AMX-2). Les pipelines agents de production méritent un environnement isolé — préserver la mémoire unifiée pour Cursor et Xcode.

10. Conclusion : l'API partout, la validation agent sur Mac

Router via OpenRouter, copier une clé API — n'importe quelle machine suffit. Pour Cursor + V4-Flash long contexte, comparaisons OpenClaw ou validation MLX quantifiée, la mémoire unifiée Apple Silicon et Metal demeurent le chemin le plus fluide.

L'approche pragmatique : API au quotidien, tests de charge agents Flash 0731, régressions Harness et traitements documentaires 1M sur un nœud Mac mini M4 MACGPU distant — à la demande, sécurisé en SSH, machine principale préservée.