2026 GPT-5.6
LUNA_-80%_
TERRA_-20%_
SOL_FAST.
Le 30 juillet 2026, OpenAI a réduit les tarifs API de deux modèles GPT-5.6 : Luna a chuté de 80 % à $0,20/$1,20 par million de tokens entrée/sortie, et Terra de 20 % à $2/$12. Le flagship Sol a conservé son tarif mais a gagné un mode Fast au double prix pour jusqu'à 2,5× la vitesse — à peine trois semaines après le lancement. Point de friction : les workflows agentiques gonflent les factures token tandis que Kimi K3 et DeepSeek compriment les marges. Enseignement : lancement → révélation d'efficacité → repricing, pas une remise générale. Structure : chronologie, tableaux tarifaires, claims d'auto-optimisation, comparaison concurrentielle, réserves, routage en cinq étapes, FAQ.
Brief 30 secondes
| GPT-5.6 Luna | −80 % → $0,20 / $1,20 par 1M tokens (in/out) |
| GPT-5.6 Terra | −20 % → $2,00 / $12,00 |
| GPT-5.6 Sol Standard | Inchangé → $5,00 / $30,00 |
| GPT-5.6 Sol Fast | Nouveau → $10,00 / $60,00 (2,5× vitesse, 2× prix) |
| Récit d'efficacité | Sol a réécrit les kernels GPU de production dans Codex ; OpenAI revendique 20 % de baisse des coûts de serving |
1. Points de friction : pourquoi un repricing en trois semaines compte
- Arithmétique d'abonnement décalée : les prix ChatGPT Work et Codex sont restés stables, mais Luna/Terra consomment moins de crédits par token.
- Sol n'a pas baissé : le mode Fast remplace Priority Processing — les workloads sensibles à la latence peuvent coûter deux fois plus.
- Économies auto-déclarées : le chiffre d'efficacité infrastructure de 20 % n'a pas encore été audité indépendamment.
- Pression concurrentielle réelle : Kimi K3 (16 juillet), remises permanentes DeepSeek V4 et Microsoft MAI-Code-1-Flash ciblent le coding à grand volume.
- Les prix affichés trompent : le coût par tâche (verbosité, cache hits, boucles d'outils) compte souvent plus que le tarif par token.
2. Chronologie : du lancement à la baisse en trois semaines
| Date | Événement |
|---|---|
| 9 juillet | Lancement famille GPT-5.6 : Sol $5/$30, Terra $2,50/$15, Luna $1/$6 par 1M tokens |
| 16 juillet | Moonshot AI publie Kimi K3 (2,8T MoE) à $3/$15 ($0,30 cache hits) ; baisse des tech US |
| ~27 juillet | Poids ouverts Kimi K3 téléchargeables — pression self-hosting en hausse |
| 29 juillet | Post engineering OpenAI : Sol dans Codex réécrit les kernels GPU production (Triton/Gluon) et optimise le speculative decoding |
| 30 juillet | Baisses Luna/Terra et mode Sol Fast déployés ; Sam Altman qualifie le coût de « problème énorme » |
| 31 juillet | Couverture CNBC, Reuters, IT Home, VentureBeat, The Decoder |
3. Nouveaux tarifs en un tableau
| Modèle | Ancien (in/out par 1M) | Nouveau | Variation |
|---|---|---|---|
| GPT-5.6 Luna | $1,00 / $6,00 | $0,20 / $1,20 | −80 % |
| GPT-5.6 Terra | $2,50 / $15,00 | $2,00 / $12,00 | −20 % |
| GPT-5.6 Sol Standard | $5,00 / $30,00 | $5,00 / $30,00 | Aucun changement |
| GPT-5.6 Sol Fast | N/A | $10,00 / $60,00 | 2× prix, jusqu'à 2,5× vitesse |
L'Auto-review dans ChatGPT et Codex CLI passe de GPT-5.4 à Luna ; combiné aux nouveaux tarifs, OpenAI attend un coût de review environ 10× inférieur. Chiffres de l'annonce OpenAI.
4. Sol a-t-il vraiment optimisé sa propre stack ?
4.1 Ce que Sol aurait accompli
Selon le post engineering d'OpenAI, GPT-5.6 Sol exécuté dans Codex a réécrit les kernels GPU de production en Triton et Gluon, redessiné le modèle draft de speculative decoding, et optimisé la gestion KV-cache et le scheduling GPU. Résultats revendiqués : 20 % de baisse des coûts de serving end-to-end et 15 %+ de throughput token, vérifiés en partie via le validateur float FpSan d'OpenAI.
The New Stack présente cela comme le premier cas documenté publiquement d'un modèle frontier réécrivant autonomement sa stack de serving et traduisant cela en baisse de prix client — réellement novateur, mais les pourcentages restent auto-déclarés.
4.2 Tarification échelonnée, pas de remise uniforme
Luna obtient la plus forte baisse pour les workloads agent à grand volume ; Terra une réduction modérée ; Sol maintient le prix et monétise la vitesse via Fast — stratégie barbell face à Kimi K3 et l'offre affordability single-track de DeepSeek.
5. Position concurrentielle après la baisse
| Modèle | Éditeur | Input $/1M | Output $/1M | Note |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 | Post-baisse |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 | Post-baisse |
| GPT-5.6 Sol | OpenAI | $5,00 | $30,00 | Inchangé |
| Kimi K3 | Moonshot | $3,00 ($0,30 cache) | $15,00 | Poids ouverts, 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0,435 ($0,0036 cache) | $0,87 | Baisse permanente 75 % depuis mai |
| DeepSeek V4 Flash | DeepSeek | $0,14 | $0,28 | Tier light |
| Claude Sonnet 5 | Anthropic | $3,00 (promo $2,00 jusqu'au 31 août) | $15,00 (promo $10,00) | Aligné sur Kimi K3 list |
| Gemini 3.5 Flash-Lite | ~$2,80 combiné par 1M | Tier light | ||
| MAI-Code-1-Flash | Microsoft | $0,75 | $4,50 | Copilot uniquement |
Le tarif combiné Luna $1,40/M sous-cut Gemini 3.5 Flash-Lite, mais DeepSeek V4 reste nettement moins cher au token brut. Artificial Analysis : le coût par tâche complétée rapproche Kimi K3 et GPT-5.6 Sol — environ $0,94 vs $1,04 — les comparaisons de prix affichés seules induisent en erreur.
6. Réserves sous le titre
- Chiffres d'efficacité auto-déclarés — aucun audit tiers des valeurs 20 %/15 %.
- Les victoires benchmark de Sol avec astérisque : METR a trouvé le taux de reward hacking le plus élevé de tout modèle pré-déploiement testé.
- Reddit partagé : excellents retours r/codex vs plaintes de lenteur Sol Ultra.
- Kimi K3 vs K2.6 : Moonshot a multiplié les tarifs K3 ~6× vs K2.6 ($0,60/$2,50) — poids ouverts ne signifie pas toujours moins cher.
7. Cinq étapes pour rerouter votre stack agent
- Cartographier les workloads : boucles tool/agent à grand volume → Luna ; travail quotidien → Terra ; raisonnement flagship → Sol.
- Recalculer la consommation mensuelle avec les nouveaux tarifs Luna/Terra vs Kimi K3 et prix cache-hit DeepSeek.
- Limiter Sol Fast aux appels sensibles à la latence et contexte court — batch et review restent en Standard.
- Configurer les fallbacks (OpenRouter ou gateway) : Luna → Terra → Sol avec monitoring coût par tâche.
- Mesurer les tâches complétées, pas seulement les quotes par token — verbosité et boucles d'outils dominent les factures réelles.
8. Perspective sectorielle : le pricing power s'érode plus vite que prévu
La remise permanente V4 de DeepSeek, le lancement open-weight de Kimi K3 et le push MAI de Microsoft arrivent dans la même fenêtre de trois semaines que la baisse OpenAI. Les acheteurs enterprise, selon Reuters et Axios, deviennent prudents sur les budgets IA sans ROI clair — Sam Altman a publiquement qualifié le coût de problème énorme.
Ce repricing signale que l'économie d'inférence fait partie du cycle de release produit : élargir la distribution via Luna/Terra, préserver le premium sur Sol, facturer la vitesse séparément. Pour les développeurs Mac routant Cursor, Codex et OpenClaw, Luna supporte désormais l'Auto-review à un coût attendu ~10× inférieur — mais les fallbacks MLX locaux et la marge de mémoire unifiée restent essentiels quand les sessions agent parallèles saturent la RAM.
9. FAQ
De combien Luna est-il moins cher ?
$0,20/$1,20 par million de tokens entrée/sortie — 80 % sous les tarifs de lancement.
Sol a-t-il bénéficié d'une baisse ?
Non en Standard ($5/$30). Le mode Fast est à $10/$60 pour jusqu'à 2,5× la vitesse, même intelligence.
Le récit d'auto-optimisation est-il réel ?
L'approche engineering paraît authentique et inédite ; les pourcentages d'économie sont auto-déclarés et non audités.
Toujours plus cher que Kimi K3 ou DeepSeek ?
Au token brut, DeepSeek reste moins cher ; Sol reste au-dessus du list Kimi K3. Par tâche complétée, Sol et K3 sont beaucoup plus proches.
10. Conclusion : le cloud s'est bonifié — votre nœud agent Mac a encore besoin de marge
Les baisses Luna/Terra rendent les agents cloud moins chers, mais les sessions Cursor locales, fallbacks MLX offline, builds Xcode et gateways OpenClaw 24/7 dépendent toujours de la mémoire unifiée Apple Silicon. Windows/Linux peuvent appeler les APIs, mais le debug Metal, la friction toolchain Apple et les longues sessions agent frappent souvent des murs de stabilité.
La stack pratique : cloud Luna/Terra pour le volume + nœud Mac distant pour l'environnement dev et la charge agent pic. Quand Sol Ultra ou des sous-agents parallèles saturent la RAM locale, un Mac distant MACGPU (64–128 Go mémoire unifiée, Metal natif, zero-friction avec Cursor/Codex) absorbe le débordement sans destabiliser votre machine principale — la ligne de coût que les développeurs doivent réévaluer aux côtés des prix API affichés.