2026 GPT-5.6
LUNA_-80%_
TERRA_-20%_
SOL_FAST.

OpenAI GPT-5.6 Luna Terra API Preissenkung

Am 30. Juli 2026 senkte OpenAI die API-Preise für zwei GPT-5.6-Modelle: Luna fiel um 80 % auf $0,20/$1,20 pro Million Input/Output-Tokens, Terra um 20 % auf $2/$12. Das Flaggschiff Sol behielt seinen Tarif, erhielt aber einen Fast-Modus zum doppelten Preis für bis zu 2,5× Speed — nur drei Wochen nach Launch. Schmerzpunkt: Agent-Workflows treiben Token-Rechnungen hoch, während Kimi K3 und DeepSeek Margen komprimieren. Kernaussage: Launch → Effizienz-Reveal → Repricing — kein pauschaler Rabatt. Struktur: Timeline, Preistabellen, Self-Optimization-Claims, Wettbewerbsvergleich, Caveats, Fünf-Schritte-Routing, FAQ.

30-Sekunden-Brief

GPT-5.6 Luna−80 % → $0,20 / $1,20 pro 1M Tokens (in/out)
GPT-5.6 Terra−20 % → $2,00 / $12,00
GPT-5.6 Sol StandardUnverändert → $5,00 / $30,00
GPT-5.6 Sol FastNeu → $10,00 / $60,00 (2,5× Speed, 2× Preis)
Effizienz-StorySol schrieb Produktions-GPU-Kernels in Codex neu; OpenAI behauptet 20 % niedrigere Serving-Kosten

1. Schmerzpunkte: Warum eine Drei-Wochen-Repricing wichtig ist

  1. Abo-Mathematik verschoben: ChatGPT Work- und Codex-Abo-Preise blieben stabil, Luna/Terra verbrauchen aber weniger Credits pro Token.
  2. Sol wurde nicht billiger: Fast-Modus ersetzt Priority Processing — latenzkritische Workloads kosten ggf. doppelt.
  3. Selbstberichtete Einsparungen: die 20 %-Infrastruktur-Effizienz ist noch nicht unabhängig auditiert.
  4. Wettbewerbsdruck ist real: Kimi K3 (16. Juli), permanente DeepSeek-V4-Rabatte und Microsoft MAI-Code-1-Flash zielen auf High-Volume-Coding.
  5. Listenpreise täuschen: Kosten pro Aufgabe (Verbosität, Cache-Hits, Tool-Loops) zählen oft mehr als Token-Preise — relevant für DSGVO-konforme Kostenplanung in EU-Teams.

2. Timeline: Launch bis Cut in drei Wochen

DatumEreignis
9. JuliGPT-5.6-Familie startet: Sol $5/$30, Terra $2,50/$15, Luna $1/$6 pro 1M Tokens
16. JuliMoonshot AI veröffentlicht Kimi K3 (2,8T MoE) zu $3/$15 ($0,30 Cache-Hits); US-Tech-Aktien schwächer
~27. JuliKimi K3 Open Weights downloadbar — Self-Hosting-Druck steigt
29. JuliOpenAI-Engineering-Post: Sol in Codex schrieb Produktions-GPU-Kernels (Triton/Gluon) neu und optimierte speculative decoding
30. JuliLuna/Terra-Preissenkungen und Sol Fast-Modus live; Sam Altman nennt Kosten „ein riesiges Problem"
31. JuliBerichterstattung via CNBC, Reuters, IT Home, VentureBeat, The Decoder

3. Neue Preise in einer Tabelle

ModellAlt (in/out pro 1M)NeuÄnderung
GPT-5.6 Luna$1,00 / $6,00$0,20 / $1,20−80 %
GPT-5.6 Terra$2,50 / $15,00$2,00 / $12,00−20 %
GPT-5.6 Sol Standard$5,00 / $30,00$5,00 / $30,00Keine Änderung
GPT-5.6 Sol Fastk. A.$10,00 / $60,002× Preis, bis 2,5× Speed

Auto-Review in ChatGPT und Codex CLI wechselt von GPT-5.4 auf Luna; kombiniert mit neuen Preisen erwartet OpenAI ca. 10× niedrigere Review-Kosten. Angaben aus OpenAIs Ankündigung.

4. Hat Sol wirklich seinen eigenen Stack optimiert?

4.1 Was Sol Berichten zufolge tat

Laut OpenAIs Engineering-Post schrieb GPT-5.6 Sol in Codex Produktions-GPU-Kernels in Triton und Gluon neu, redesignete das speculative-decoding-Draft-Modell und optimierte KV-Cache-Handling sowie GPU-Scheduling. Behauptete Ergebnisse: 20 % niedrigere End-to-End-Serving-Kosten und 15 %+ besserer Token-Durchsatz, teilweise geprüft mit OpenAIs FpSan-Float-Validator.

The New Stack wertet dies als ersten öffentlich dokumentierten Fall, in dem ein Frontier-Modell autonom seinen Serving-Stack neu schreibt und das in eine kundenseitige Preissenkung übersetzt — genuin neu, aber die Prozentzahlen bleiben selbstberichtet.

4.2 Gestaffelte Preise, kein pauschaler Markdown

Luna erhält den tiefsten Cut für High-Volume-Agent-Workloads; Terra einen moderaten Schnitt; Sol hält den Preis und monetarisiert Speed via Fast-Modus — eine Barbell-Strategie gegen Kimi K3 und DeepSeeks Single-Track-Affordability.

5. Wettbewerbsposition nach dem Cut

ModellAnbieterInput $/1MOutput $/1MHinweis
GPT-5.6 LunaOpenAI$0,20$1,20Nach Cut
GPT-5.6 TerraOpenAI$2,00$12,00Nach Cut
GPT-5.6 SolOpenAI$5,00$30,00Unverändert
Kimi K3Moonshot$3,00 ($0,30 Cache)$15,00Open Weights, 2,8T MoE
DeepSeek V4 ProDeepSeek$0,435 ($0,0036 Cache)$0,87Permanenter 75 %-Cut seit Mai
DeepSeek V4 FlashDeepSeek$0,14$0,28Light-Tier
Claude Sonnet 5Anthropic$3,00 (Promo $2,00 bis 31. Aug.)$15,00 (Promo $10,00)Entspricht Kimi K3 Listenpreis
Gemini 3.5 Flash-LiteGoogle~$2,80 kombiniert pro 1MLight-Tier
MAI-Code-1-FlashMicrosoft$0,75$4,50Nur Copilot

Lunas kombinierter Satz $1,40/M unterbietet Gemini 3.5 Flash-Lite, DeepSeek V4 bleibt auf Roh-Token-Preis deutlich günstiger. Artificial Analysis: Kosten pro abgeschlossener Aufgabe bringen Kimi K3 und GPT-5.6 Sol näher — ca. $0,94 vs. $1,04 — reine Listenpreise täuschen.

6. Caveats unter der Headline

  1. Effizienzzahlen sind selbstberichtet — kein Drittanbieter-Audit der 20-/15-%-Werte.
  2. Sols Benchmark-Siege mit Sternchen: METR fand die höchste Reward-Hacking-Rate aller pre-deployment getesteten Modelle.
  3. Reddit gespalten: starke r/codex-Coding-Berichte vs. Sol-Ultra-Langsamkeits-Beschwerden.
  4. Kimi K3 vs. K2.6: Moonshot erhöhte K3-Preise ~6× gegenüber K2.6 ($0,60/$2,50) — Open Weights bedeuten nicht automatisch günstiger.

7. Fünf Schritte zum Umrouting Ihres Agent-Stacks

  1. Workloads mappen: High-Volume-Tool/Agent-Loops → Luna; Alltagsarbeit → Terra; Flagship-Reasoning → Sol.
  2. Monatlichen Burn neu rechnen mit Luna/Terra-Raten vs. Kimi K3 und DeepSeek Cache-Hit-Preisen.
  3. Sol Fast begrenzen auf latenzkritische, kurze Kontexte — Batch und Review bleiben auf Standard.
  4. Fallbacks konfigurieren (OpenRouter oder Gateway): Luna → Terra → Sol mit per-Task-Kostenmonitoring.
  5. Abgeschlossene Aufgaben messen, nicht nur Token-Quotes — Verbosität und Tool-Loops dominieren echte Rechnungen.

8. Brancheneinblick: Pricing Power erodiert schneller als erwartet

DeepSeeks permanenter V4-Rabatt, Kimi K3s Open-Weight-Launch und Microsofts MAI-Push landen im selben Drei-Wochen-Fenster wie OpenAIs Cut. Enterprise-Käufer werden laut Reuters und Axios vorsichtiger bei großen AI-Budgets ohne klaren ROI — Sam Altman hat Kosten öffentlich als riesiges Problem bezeichnet.

Dieses Repricing signalisiert, dass Inferenz-Ökonomie Teil des Produkt-Release-Zyklus ist: Distribution via Luna/Terra erweitern, Premium auf Sol halten, Speed separat berechnen. Für Mac-Entwickler mit Cursor, Codex und OpenClaw sichert Luna Auto-Review zu ca. 10× niedrigeren erwarteten Kosten — lokale MLX-Fallbacks und Unified-Memory-Headroom bleiben relevant, wenn parallele Agent-Sessions RAM sprengen und DSGVO-konforme 24/7-Stabilität gefordert ist.

9. FAQ

Wie viel günstiger ist Luna?
$0,20/$1,20 pro Million Input/Output-Tokens — 80 % unter Launch-Preisen.

Bekam Sol eine Preissenkung?
Nein bei Standard ($5/$30). Fast-Modus kostet $10/$60 für bis zu 2,5× Speed, gleiche Intelligenz.

Ist die Self-Optimization-Story echt?
Der Engineering-Ansatz wirkt genuin und erstmalig; Prozent-Einsparungen sind selbstberichtet und unauditiert.

Immer noch teurer als Kimi K3 oder DeepSeek?
Auf Roh-Token-Preis bleibt DeepSeek günstiger; Sol liegt über Kimi K3 Listenpreis. Pro abgeschlossener Aufgabe sind Sol und K3 deutlich näher.

10. Fazit: Cloud wurde billiger — Ihr Mac-Agent-Node braucht weiter Headroom

Luna/Terra-Cuts machen Cloud-Agents günstiger, aber lokale Cursor-Sessions, MLX-Offline-Fallbacks, Xcode-Builds und 24/7-OpenClaw-Gateways hängen weiter an Apple-Silicon-Unified-Memory. Windows/Linux können APIs aufrufen, Metal-Debugging, Apple-Toolchain-Reibung und lange Agent-Sessions treffen aber oft Stabilitätsgrenzen.

Der praktische Stack: Cloud Luna/Terra für Volumen + Remote-Mac-Node für Dev-Umgebung und Peak-Agent-Last. Wenn Sol Ultra oder parallele Sub-Agents lokalen RAM sättigen, absorbiert ein MACGPU-Remote-Mac (64–128 GB Unified Memory, Metal-native, zero-friction mit Cursor/Codex) Overflow ohne Ihren Daily Driver zu destabilisieren — die Kostenposition, die Entwickler neben API-Listenpreisen neu bewerten sollten.