2026 GPT-5.6
LUNA_-80%_
TERRA_-20%_
SOL_FAST.
30 июля 2026 OpenAI снизил API-цены двух моделей GPT-5.6: Luna упала на 80 % до $0,20/$1,20 за миллион input/output токенов, Terra на 20 % до $2/$12. Флагман Sol сохранил тариф, но получил Fast mode вдвое дороже с throughput до 2,5× — всего через три недели после релиза. Боль: agent workflows раздувают token bills, Kimi K3 и DeepSeek сжимают маржу. Вывод: launch → efficiency reveal → repricing, не blanket discount. Структура: timeline, pricing tables, self-optimization claims, rival comparison, caveats, five-step routing, FAQ.
Brief за 30 секунд
| GPT-5.6 Luna | −80 % → $0,20 / $1,20 за 1M tokens (in/out) |
| GPT-5.6 Terra | −20 % → $2,00 / $12,00 |
| GPT-5.6 Sol Standard | Без изменений → $5,00 / $30,00 |
| GPT-5.6 Sol Fast | Новый → $10,00 / $60,00 (2,5× speed, 2× price) |
| Efficiency story | Sol переписал production GPU kernels в Codex; OpenAI заявляет −20 % serving cost |
1. Pain points: почему repricing через три недели критичен
- Subscription math сдвинулась: цены ChatGPT Work и Codex не изменились, но Luna/Terra потребляют меньше credits на token.
- Sol не подешевел: Fast mode заменяет Priority Processing — latency-sensitive workloads могут стоить вдвое дороже.
- Self-reported savings: 20 % infrastructure efficiency без independent audit.
- Конкурентное давление реально: Kimi K3 (16 июля), permanent DeepSeek V4 discounts, Microsoft MAI-Code-1-Flash — все бьют в high-volume coding.
- Sticker prices обманчивы: per-task cost (verbosity, cache hits, tool loops) часто важнее per-token rates — особенно при routing через MLX/Metal fallback на Mac.
2. Timeline: от launch до cut за три недели
| Дата | Событие |
|---|---|
| 9 июля | Launch семейства GPT-5.6: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 за 1M tokens |
| 16 июля | Moonshot AI выпускает Kimi K3 (2,8T MoE) по $3/$15 ($0,30 cache hits); US tech stocks просели |
| ~27 июля | Kimi K3 open weights downloadable — self-hosting pressure растёт |
| 29 июля | OpenAI engineering post: Sol в Codex переписал production GPU kernels (Triton/Gluon), tuned speculative decoding |
| 30 июля | Luna/Terra price cuts и Sol Fast mode; Sam Altman: cost — «huge issue» |
| 31 июля | CNBC, Reuters, IT Home, VentureBeat, The Decoder |
3. Новые цены в одной таблице
| Модель | Старое (in/out за 1M) | Новое | Изменение |
|---|---|---|---|
| GPT-5.6 Luna | $1,00 / $6,00 | $0,20 / $1,20 | −80 % |
| GPT-5.6 Terra | $2,50 / $15,00 | $2,00 / $12,00 | −20 % |
| GPT-5.6 Sol Standard | $5,00 / $30,00 | $5,00 / $30,00 | Без изменений |
| GPT-5.6 Sol Fast | N/A | $10,00 / $60,00 | 2× price, до 2,5× speed |
Auto-review в ChatGPT и Codex CLI переходит с GPT-5.4 на Luna; с новыми ценами OpenAI ожидает ~10× lower review cost. Данные из анонса OpenAI.
4. Sol действительно оптимизировал свой stack?
4.1 Что Sol сделал по отчётам
По engineering post OpenAI, GPT-5.6 Sol в Codex переписал production GPU kernels на Triton и Gluon, redesign draft model для speculative decoding, tuned KV-cache handling и GPU scheduling. Заявленные результаты: −20 % end-to-end serving cost и 15 %+ token throughput, частично проверено FpSan float validator OpenAI.
The New Stack называет это первым публично задокументированным случаем, когда frontier model автономно переписывает serving stack и это попадает в customer-facing price cut — genuinely novel, но проценты self-reported.
4.2 Tiered pricing, не uniform markdown
Luna получает deepest cut для high-volume agent workloads; Terra — modest trim; Sol держит price и monetizes speed через Fast — barbell strategy против Kimi K3 и single-track affordability DeepSeek.
5. Конкурентная позиция после cut
| Модель | Вендор | Input $/1M | Output $/1M | Примечание |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 | Post-cut |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 | Post-cut |
| GPT-5.6 Sol | OpenAI | $5,00 | $30,00 | Без изменений |
| Kimi K3 | Moonshot | $3,00 ($0,30 cache) | $15,00 | Open weights, 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0,435 ($0,0036 cache) | $0,87 | Permanent 75 % cut с мая |
| DeepSeek V4 Flash | DeepSeek | $0,14 | $0,28 | Light tier |
| Claude Sonnet 5 | Anthropic | $3,00 (promo $2,00 до 31 авг.) | $15,00 (promo $10,00) | Matches Kimi K3 list |
| Gemini 3.5 Flash-Lite | ~$2,80 combined за 1M | Light tier | ||
| MAI-Code-1-Flash | Microsoft | $0,75 | $4,50 | Copilot only |
Combined rate Luna $1,40/M undercuts Gemini 3.5 Flash-Lite, но DeepSeek V4 остаётся far cheaper на raw token price. Artificial Analysis: cost per completed task ставит Kimi K3 и GPT-5.6 Sol близко — ~$0,94 vs $1,04 — sticker comparisons alone misleading.
6. Caveats под headline
- Efficiency numbers self-reported — no third-party audit 20 %/15 % figures.
- Benchmark wins Sol с asterisk: METR нашёл highest reward-hacking rate среди pre-deployment tested models.
- Reddit split: strong r/codex coding reports vs Sol Ultra slowness complaints.
- Kimi K3 vs K2.6: Moonshot raised K3 pricing ~6× vs K2.6 ($0,60/$2,50) — open weights ≠ cheaper.
7. Пять шагов для reroute agent stack
- Map workloads: high-volume tool/agent loops → Luna; everyday work → Terra; flagship reasoning → Sol.
- Recompute monthly burn с новыми Luna/Terra rates vs Kimi K3 и DeepSeek cache-hit pricing.
- Gate Sol Fast на latency-sensitive, short-context calls — batch и review на Standard.
- Configure fallbacks (OpenRouter или gateway): Luna → Terra → Sol с per-task cost monitoring.
- Measure completed tasks, не только per-token quotes — verbosity и tool loops dominate real bills.
8. Industry insight: pricing power erodes faster than labs expected
Permanent V4 discount DeepSeek, Kimi K3 open-weight launch и Microsoft MAI push — всё в том же трёхнедельном окне, что и OpenAI cut. Enterprise buyers (Reuters, Axios) осторожнее с large AI budgets без clear ROI — Sam Altman публично назвал cost huge issue.
Repricing сигнализирует: inference economics теперь часть product release cycle — widen distribution через Luna/Terra, preserve premium на Sol, charge separately за speed. Для Mac developers с Cursor, Codex и OpenClaw Luna backs Auto-review ~10× lower expected cost — но local MLX fallbacks и unified-memory headroom критичны, когда parallel agent sessions spike и Metal throughput на M4 Max/M4 Ultra упирается в RAM bandwidth.
9. FAQ
Насколько дешевле Luna?
$0,20/$1,20 за миллион input/output tokens — 80 % ниже launch pricing.
Sol получил price cut?
Нет на Standard ($5/$30). Fast mode — $10/$60 за до 2,5× speed, same intelligence.
Self-optimization story реальна?
Engineering approach выглядит genuine и first-of-its-kind; percentage savings self-reported, unaudited.
Still дороже Kimi K3 или DeepSeek?
На raw token price DeepSeek cheaper; Sol above Kimi K3 list. Per completed task Sol и K3 much closer.
10. Closing: cloud подешевел — Mac agent base всё ещё нуждается в headroom
Luna/Terra cuts делают cloud agents cheaper, но local Cursor sessions, MLX offline fallbacks, Xcode builds и 24/7 OpenClaw gateways зависят от Apple Silicon unified memory. Windows/Linux вызывают APIs, но Metal debugging, Apple toolchain friction и long agent sessions часто hit stability walls — unified memory bandwidth на M-series определяет peak concurrent inference throughput.
Practical stack: cloud Luna/Terra для volume + remote Mac node для dev environment и peak agent load. Когда Sol Ultra или parallel sub-agents saturate local RAM, MACGPU remote Mac (64–128 GB unified memory, Metal-native, zero-friction с Cursor/Codex) absorbs overflow без destabilizing daily driver — cost line item, который developers должны re-evaluate alongside API sticker prices.