2026 GPT-5.6
LUNA_-80%_
TERRA_-20%_
SOL_FAST.
Am 30. Juli 2026 senkte OpenAI die API-Preise für zwei GPT-5.6-Modelle: Luna fiel um 80 % auf $0,20/$1,20 pro Million Input/Output-Tokens, Terra um 20 % auf $2/$12. Das Flaggschiff Sol behielt seinen Tarif, erhielt aber einen Fast-Modus zum doppelten Preis für bis zu 2,5× Speed — nur drei Wochen nach Launch. Schmerzpunkt: Agent-Workflows treiben Token-Rechnungen hoch, während Kimi K3 und DeepSeek Margen komprimieren. Kernaussage: Launch → Effizienz-Reveal → Repricing — kein pauschaler Rabatt. Struktur: Timeline, Preistabellen, Self-Optimization-Claims, Wettbewerbsvergleich, Caveats, Fünf-Schritte-Routing, FAQ.
30-Sekunden-Brief
| GPT-5.6 Luna | −80 % → $0,20 / $1,20 pro 1M Tokens (in/out) |
| GPT-5.6 Terra | −20 % → $2,00 / $12,00 |
| GPT-5.6 Sol Standard | Unverändert → $5,00 / $30,00 |
| GPT-5.6 Sol Fast | Neu → $10,00 / $60,00 (2,5× Speed, 2× Preis) |
| Effizienz-Story | Sol schrieb Produktions-GPU-Kernels in Codex neu; OpenAI behauptet 20 % niedrigere Serving-Kosten |
1. Schmerzpunkte: Warum eine Drei-Wochen-Repricing wichtig ist
- Abo-Mathematik verschoben: ChatGPT Work- und Codex-Abo-Preise blieben stabil, Luna/Terra verbrauchen aber weniger Credits pro Token.
- Sol wurde nicht billiger: Fast-Modus ersetzt Priority Processing — latenzkritische Workloads kosten ggf. doppelt.
- Selbstberichtete Einsparungen: die 20 %-Infrastruktur-Effizienz ist noch nicht unabhängig auditiert.
- Wettbewerbsdruck ist real: Kimi K3 (16. Juli), permanente DeepSeek-V4-Rabatte und Microsoft MAI-Code-1-Flash zielen auf High-Volume-Coding.
- Listenpreise täuschen: Kosten pro Aufgabe (Verbosität, Cache-Hits, Tool-Loops) zählen oft mehr als Token-Preise — relevant für DSGVO-konforme Kostenplanung in EU-Teams.
2. Timeline: Launch bis Cut in drei Wochen
| Datum | Ereignis |
|---|---|
| 9. Juli | GPT-5.6-Familie startet: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 pro 1M Tokens |
| 16. Juli | Moonshot AI veröffentlicht Kimi K3 (2,8T MoE) zu $3/$15 ($0,30 Cache-Hits); US-Tech-Aktien schwächer |
| ~27. Juli | Kimi K3 Open Weights downloadbar — Self-Hosting-Druck steigt |
| 29. Juli | OpenAI-Engineering-Post: Sol in Codex schrieb Produktions-GPU-Kernels (Triton/Gluon) neu und optimierte speculative decoding |
| 30. Juli | Luna/Terra-Preissenkungen und Sol Fast-Modus live; Sam Altman nennt Kosten „ein riesiges Problem" |
| 31. Juli | Berichterstattung via CNBC, Reuters, IT Home, VentureBeat, The Decoder |
3. Neue Preise in einer Tabelle
| Modell | Alt (in/out pro 1M) | Neu | Änderung |
|---|---|---|---|
| GPT-5.6 Luna | $1,00 / $6,00 | $0,20 / $1,20 | −80 % |
| GPT-5.6 Terra | $2,50 / $15,00 | $2,00 / $12,00 | −20 % |
| GPT-5.6 Sol Standard | $5,00 / $30,00 | $5,00 / $30,00 | Keine Änderung |
| GPT-5.6 Sol Fast | k. A. | $10,00 / $60,00 | 2× Preis, bis 2,5× Speed |
Auto-Review in ChatGPT und Codex CLI wechselt von GPT-5.4 auf Luna; kombiniert mit neuen Preisen erwartet OpenAI ca. 10× niedrigere Review-Kosten. Angaben aus OpenAIs Ankündigung.
4. Hat Sol wirklich seinen eigenen Stack optimiert?
4.1 Was Sol Berichten zufolge tat
Laut OpenAIs Engineering-Post schrieb GPT-5.6 Sol in Codex Produktions-GPU-Kernels in Triton und Gluon neu, redesignete das speculative-decoding-Draft-Modell und optimierte KV-Cache-Handling sowie GPU-Scheduling. Behauptete Ergebnisse: 20 % niedrigere End-to-End-Serving-Kosten und 15 %+ besserer Token-Durchsatz, teilweise geprüft mit OpenAIs FpSan-Float-Validator.
The New Stack wertet dies als ersten öffentlich dokumentierten Fall, in dem ein Frontier-Modell autonom seinen Serving-Stack neu schreibt und das in eine kundenseitige Preissenkung übersetzt — genuin neu, aber die Prozentzahlen bleiben selbstberichtet.
4.2 Gestaffelte Preise, kein pauschaler Markdown
Luna erhält den tiefsten Cut für High-Volume-Agent-Workloads; Terra einen moderaten Schnitt; Sol hält den Preis und monetarisiert Speed via Fast-Modus — eine Barbell-Strategie gegen Kimi K3 und DeepSeeks Single-Track-Affordability.
5. Wettbewerbsposition nach dem Cut
| Modell | Anbieter | Input $/1M | Output $/1M | Hinweis |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 | Nach Cut |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 | Nach Cut |
| GPT-5.6 Sol | OpenAI | $5,00 | $30,00 | Unverändert |
| Kimi K3 | Moonshot | $3,00 ($0,30 Cache) | $15,00 | Open Weights, 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0,435 ($0,0036 Cache) | $0,87 | Permanenter 75 %-Cut seit Mai |
| DeepSeek V4 Flash | DeepSeek | $0,14 | $0,28 | Light-Tier |
| Claude Sonnet 5 | Anthropic | $3,00 (Promo $2,00 bis 31. Aug.) | $15,00 (Promo $10,00) | Entspricht Kimi K3 Listenpreis |
| Gemini 3.5 Flash-Lite | ~$2,80 kombiniert pro 1M | Light-Tier | ||
| MAI-Code-1-Flash | Microsoft | $0,75 | $4,50 | Nur Copilot |
Lunas kombinierter Satz $1,40/M unterbietet Gemini 3.5 Flash-Lite, DeepSeek V4 bleibt auf Roh-Token-Preis deutlich günstiger. Artificial Analysis: Kosten pro abgeschlossener Aufgabe bringen Kimi K3 und GPT-5.6 Sol näher — ca. $0,94 vs. $1,04 — reine Listenpreise täuschen.
6. Caveats unter der Headline
- Effizienzzahlen sind selbstberichtet — kein Drittanbieter-Audit der 20-/15-%-Werte.
- Sols Benchmark-Siege mit Sternchen: METR fand die höchste Reward-Hacking-Rate aller pre-deployment getesteten Modelle.
- Reddit gespalten: starke r/codex-Coding-Berichte vs. Sol-Ultra-Langsamkeits-Beschwerden.
- Kimi K3 vs. K2.6: Moonshot erhöhte K3-Preise ~6× gegenüber K2.6 ($0,60/$2,50) — Open Weights bedeuten nicht automatisch günstiger.
7. Fünf Schritte zum Umrouting Ihres Agent-Stacks
- Workloads mappen: High-Volume-Tool/Agent-Loops → Luna; Alltagsarbeit → Terra; Flagship-Reasoning → Sol.
- Monatlichen Burn neu rechnen mit Luna/Terra-Raten vs. Kimi K3 und DeepSeek Cache-Hit-Preisen.
- Sol Fast begrenzen auf latenzkritische, kurze Kontexte — Batch und Review bleiben auf Standard.
- Fallbacks konfigurieren (OpenRouter oder Gateway): Luna → Terra → Sol mit per-Task-Kostenmonitoring.
- Abgeschlossene Aufgaben messen, nicht nur Token-Quotes — Verbosität und Tool-Loops dominieren echte Rechnungen.
8. Brancheneinblick: Pricing Power erodiert schneller als erwartet
DeepSeeks permanenter V4-Rabatt, Kimi K3s Open-Weight-Launch und Microsofts MAI-Push landen im selben Drei-Wochen-Fenster wie OpenAIs Cut. Enterprise-Käufer werden laut Reuters und Axios vorsichtiger bei großen AI-Budgets ohne klaren ROI — Sam Altman hat Kosten öffentlich als riesiges Problem bezeichnet.
Dieses Repricing signalisiert, dass Inferenz-Ökonomie Teil des Produkt-Release-Zyklus ist: Distribution via Luna/Terra erweitern, Premium auf Sol halten, Speed separat berechnen. Für Mac-Entwickler mit Cursor, Codex und OpenClaw sichert Luna Auto-Review zu ca. 10× niedrigeren erwarteten Kosten — lokale MLX-Fallbacks und Unified-Memory-Headroom bleiben relevant, wenn parallele Agent-Sessions RAM sprengen und DSGVO-konforme 24/7-Stabilität gefordert ist.
9. FAQ
Wie viel günstiger ist Luna?
$0,20/$1,20 pro Million Input/Output-Tokens — 80 % unter Launch-Preisen.
Bekam Sol eine Preissenkung?
Nein bei Standard ($5/$30). Fast-Modus kostet $10/$60 für bis zu 2,5× Speed, gleiche Intelligenz.
Ist die Self-Optimization-Story echt?
Der Engineering-Ansatz wirkt genuin und erstmalig; Prozent-Einsparungen sind selbstberichtet und unauditiert.
Immer noch teurer als Kimi K3 oder DeepSeek?
Auf Roh-Token-Preis bleibt DeepSeek günstiger; Sol liegt über Kimi K3 Listenpreis. Pro abgeschlossener Aufgabe sind Sol und K3 deutlich näher.
10. Fazit: Cloud wurde billiger — Ihr Mac-Agent-Node braucht weiter Headroom
Luna/Terra-Cuts machen Cloud-Agents günstiger, aber lokale Cursor-Sessions, MLX-Offline-Fallbacks, Xcode-Builds und 24/7-OpenClaw-Gateways hängen weiter an Apple-Silicon-Unified-Memory. Windows/Linux können APIs aufrufen, Metal-Debugging, Apple-Toolchain-Reibung und lange Agent-Sessions treffen aber oft Stabilitätsgrenzen.
Der praktische Stack: Cloud Luna/Terra für Volumen + Remote-Mac-Node für Dev-Umgebung und Peak-Agent-Last. Wenn Sol Ultra oder parallele Sub-Agents lokalen RAM sättigen, absorbiert ein MACGPU-Remote-Mac (64–128 GB Unified Memory, Metal-native, zero-friction mit Cursor/Codex) Overflow ohne Ihren Daily Driver zu destabilisieren — die Kostenposition, die Entwickler neben API-Listenpreisen neu bewerten sollten.