GROK 4.6
7._AUG_
1,5T_
ZIEL.
Elon Musk kündigte am 28. Juli 2026 in einer X-Antwort an Vercel-CEO Guillermo Rauch Grok 4.6 „um den 7. August“ an — mit 1,5 Billionen Parametern und Fokus auf SFT/RL-Post-Training; wenige Wochen später soll Grok 4.7 mit 2,1 Billionen folgen. Problemstellung: Entwickler und Enterprise-Teams stehen vor „Musk time“-Planunsicherheit, null unabhängigen Benchmarks zu den angekündigten Specs und einem extrem komprimierten Evaluierungsfenster nach Kimi K3s Open-Weight-Schock. Fazit: Bis xAI eine Model Card veröffentlicht, sind Token-Effizienz und realer Task-Gesamtkosten — nicht Parameterzahl allein — die belastbare Entscheidungsbasis. Aufbau: Zeitplan, Spec-Tabellen, SFT/RL-Analyse, Wettbewerbsvergleich, Risiken, August-2026-Release-Engpass, Fünf-Schritte-Leitfaden, FAQ.
30-Sekunden-Executive-Summary
| Quelle | Musks X-Antwort vom 28. Juli (kein xAI-Blogpost) |
| Grok 4.6 | ~7. Aug. · 1,5T Parameter · SFT/RL-Upgrade-Fokus |
| Grok 4.7 | Ende Aug.–Anfang Sep. · 2,1T · besser als 4.6, leicht langsamer beim Serving |
| Wettbewerbskontext | ~10 Tage nach Kimi K3 Open Weights · Fable 5.1-Gerüchte im selben Monat |
| Preise / Benchmarks | Alles offen — keine Model Card, keine Drittpartei-Scores |
1. Pain Points: Warum diese Vorschau relevant ist — und warum Sie ihr nicht vollständig vertrauen sollten
- „Musk time“ hat eine Historie. Zeitpläne von xAI, Tesla und SpaceX sind in der Vergangenheit regelmäßig um Tage bis Wochen verschoben worden.
- Die einzige Quelle ist ein Tweet. Im Gegensatz zu Grok 4.5 mit 15 dokumentierten Benchmarks und veröffentlichter Model Card existieren für 4.6/4.7 null unabhängige Verifikationsdaten.
- Kimi K3 hat die Messlatte angehoben. K3s Open-Weight-Release am 26. Juli (2,8T, Frontend Code Arena 1.679 Punkte) zog selbst Musks Lob nach sich; die Beschleunigung der xAI-Roadmap ist die plausibelste Erklärung für den verkürzten Release-Zyklus.
2. Zeitplan: Grok 4.5 → 4.6 → 4.7
| Datum | Ereignis |
|---|---|
| 8. Juli 2026 | xAI liefert Grok 4.5: Coding/Agentic-Flaggschiff, Co-Training mit Cursor, 500K Kontext, $2/$6 pro 1M Input/Output-Tokens |
| 16. Juli | Moonshot AIs Kimi K3 gehostete Vorschau geht live |
| 26. Juli | Kimi K3 vollständiges Open-Weight-Release (2,8T, 1M Kontext) |
| 28. Juli | Musk postet Grok-4.6/4.7-Roadmap; am selben Tag veröffentlichen 1.200+ Mitarbeiter den Brief „Pacing the Frontier“ |
| ~7. Aug. | Grok-4.6-Ziel: 1,5T Parameter, SFT/RL-Upgrade-Fokus |
| ~Ende Aug.–Anfang Sep. | Grok-4.7-Ziel: 2,1T Parameter, breit besser als 4.6, leicht langsameres Serving, bessere Token-Effizienz |
3. Kerndaten-Tabelle
| Modell | Datum | Parameter | Fokus | Status |
|---|---|---|---|---|
| Grok 4.3 Beta | 17. Apr. 2026 | Nicht offengelegt | Baseline | Veröffentlicht |
| Grok 4.5 | 8. Juli 2026 | Nicht offengelegt | Coding/Agentic, Cursor Co-Training | Veröffentlicht, benchmarked |
| Grok 4.6 | ~7. Aug. | 1,5T | SFT/RL-Upgrade | Per Tweet angekündigt |
| Grok 4.7 | ~Ende Aug.–Anfang Sep. | 2,1T | Breites Upgrade gegenüber 4.6 | Per Tweet angekündigt |
4. Warum xAI Post-Training betont — nicht nur Skalierung
4.1 SFT und RL in technischen Begriffen
Supervised Fine-Tuning (SFT) formt Verhalten anhand kuratierter Beispiele; Reinforcement Learning (RL) trainiert mehrstufige agentische Sequenzen über Belohnungssignale. Musks Formulierung „significantly improved SFT & RL“ setzt Grok 4.5s Playbook fort: Reale Cursor-Entwicklersitzungen lieferten Terminal-Bench 2.1 83,3 %, SWE-Bench Pro 64,7 %, mit rund 15.954 Output-Tokens pro SWE-Bench-Pro-Task gegenüber 67.020 bei Opus 4.8 — eine 4,2× Effizienzlücke.
4.2 Skalierung vs. Latenz: das Trade-off
Grok 4.6 bei 1,5T ist ein realer Skalierungssprung, doch Musks Grok-4.7-Framing — größer bei 2,1T, „besser in jeder Hinsicht außer leicht langsamer beim Serving“ — deutet auf zwei SKUs mit unterschiedlichen Latenz/Qualitäts-Profilen hin, analog zu Anthropics Sonnet/Opus-Split und OpenAIs Mini/Full-Tiers.
4.3 Wettbewerbsdruck durch Kimi K3
Das Grok-4.6-Zieldatum liegt fast exakt 10 Tage nach K3s Open-Weight-Release. K3 führte Frontend Code Arena mit 1.679 Punkten an — als erstes Open-Weight-Modell, das alle Closed Models auf diesem Board schlägt — und rangierte dritt im Artificial-Analysis-Intelligence-Index.
5. Wettbewerbsvergleich: Grok vs. das Feld
| Modell | Anbieter | Parameter | Kontext | Preis (In/Out pro 1M) | Quelle |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | Nicht offengelegt | 500K | $2 / $6 | xAI offiziell |
| Grok 4.6 (angekündigt) | xAI | 1,5T | Nicht offengelegt | Nicht offengelegt | Musk X-Post (unverifiziert) |
| Kimi K3 | Moonshot AI | 2,8T (MoE, ~16/896 aktiv) | 1M | $0,30 Cache-Hit / $3 Miss In, $15 Out | Moonshot offiziell |
| Claude Fable 5.1 (Gerücht) | Anthropic | Nicht offengelegt | Nicht offengelegt | Gerücht $10 / $50 | 36kr, WinCentral-Leaks |
| GPT-5.6 Sol | OpenAI | Nicht offengelegt | Nicht offengelegt | Nicht offengelegt | OpenAI offiziell |
6. Risiken und Caveats vor Vertrauen in diesen Zeitplan
- Einzige Quelle ist ein Tweet — kein xAI-Blogpost, keine Model Card, keine Produktseite.
- Benchmarks und Preise fehlen — „1,5T Parameter“ und „SFT/RL-Upgrade“ sind unverifizierte Herstellerangaben.
- xAI-Sicherheitskontroversen — Klage im Juli 2026 wegen CSAM-Generierung über umgangene Safeguards; Common Sense Media stufte Grok im Januar 2026 unter die schlechtesten KI-Produkte für Kindersicherheit ein.
- Branchenspaltung beim KI-Tempo — am selben Tag wie Musks 4.6/4.7-Ankündigung veröffentlichten 1.200+ Mitarbeiter von OpenAI, Anthropic, Google DeepMind und Meta „Pacing the Frontier“; xAI fehlt auf der Unterzeichnerliste.
- DSGVO und Enterprise-Stabilität — EU-Teams müssen xAIs fehlende formale Model Cards, ungeklärte Datenverarbeitung und fehlende SLA-Zusagen in Vendor-Risk-Assessments neben technischen Metriken führen; ein Tweet allein erfüllt keine Audit-Anforderungen.
7. Brancheneinblick: August 2026 als Release-Engpass
Hält Musks Zeitplan, landen Grok 4.6 und 4.7 im selben Monat wie das gemunkelte Claude Fable 5.1 und nur Wochen nach Kimi K3s Open-Weight-Schock — August 2026 wird damit einer der dichtesten Frontier-Model-Release-Monate der Geschichte. Für Evaluierungsteams verkürzt sich die Nutzungsdauer jedes einzelnen Flaggschiffs auf Wochen statt Quartale.
Der tieferliegende Shift geht von Leaderboard-Rang zu Task-Gesamtkosten: Grok 4.5 bewies, dass Output-Token-Effizienz niedrigere Intelligence-Index-Scores ausgleichen kann; Kimi K3 machte Self-Hosting zur harten Option; ein Fable 5.1 würde Closed-Model-Prämien weiter unter Druck setzen. Drei Pfade — Closed API, Open Self-Hosting, Hybrid-Routing — stehen im August vor einem konzentrierten Stresstest.
Für Engineering-Teams ist das operative Risiko Routing-Table-Drift: Modell-Aliase, Fallback-Ketten und Cost Caps, die bisher quartalsweise gepflegt wurden, werden bei drei Trillionen-Parameter-Klasse-Releases im selben 30-Tage-Fenster zu wöchentlichen Incidents — mit direkten Auswirkungen auf Verfügbarkeit und DSGVO-konforme Datenhaltung.
8. Fünf-Schritte-Auswahlleitfaden vor Model-Card-Release
- Informationsquellen fixieren: xAI-Blog, Grok-Build-Konsole, Musks X-Account — angekündigte Specs nicht in SLAs vor Launch einbacken.
- Drei-Tier-Route aufbauen: Primary (aktuelles Grok 4.5 oder Kimi-K3-API) → High-Precision-Review (Claude/GPT) → Offline-Fallback (lokale MLX-quantisierte Open Weights).
- Token-Effizienz-Baseline: Output-Tokens pro realem Repo-Task jetzt erfassen; 20 produktionsnahe Tasks auf jedem neuen Modell vor Default-Switch.
- August-Release-Fenster-Playbook: 48-Stunden-Evaluierungsfenster pro Major Launch reservieren — kein Full-Production-Cutover am Tag eins.
- Vendor-Risk-Audit: xAIs jüngste Sicherheitslitigation neben technischen Benchmarks in Enterprise-Reviews einbeziehen; DSGVO-Dokumentationslücken explizit markieren.
9. FAQ
Wann genau erscheint Grok 4.6?
Musk nannte „um den 7. August 2026“ in einem X-Post; xAI hat kein offizielles Datum bestätigt.
Was unterscheidet Grok 4.6 von 4.7?
4.6: 1,5T mit SFT/RL-Fokus; 4.7: 2,1T, erwartet Wochen später, übertrifft 4.6 außer beim Serving-Tempo, wo Latenz gegen bessere Token-Effizienz getauscht wird.
Schlägt Grok 4.6 Kimi K3 oder Claude Fable 5.1?
Zu früh — keine veröffentlichten Grok-4.6-Benchmarks; K3 hat verifizierte Scores; Fable 5.1 ist von Anthropic unbestätigt.
Was kostet Grok 4.6?
Unbekannt. Grok 4.5 startete bei $2/$6 pro Million Input/Output-Tokens als Referenzpunkt.
Wo wird Grok 4.6 verfügbar sein?
Basierend auf Grok 4.5s Rollout: wahrscheinlich zuerst Grok Build, xAI-API und Konsole, dann Drittplattformen wie Cursor.
10. Abschluss: Frontier-API-Jagd + Mac-lokaler Open-Weight-Hedge
Ein Windows/Linux-Cloud-Server kann Grok-4.6-Schlagzeilen verfolgen und APIs aufrufen, scheitert aber bei lokalen Open-Weight-Baselines, Cursor/OpenClaw-Agent-Residency, MLX-quantisierten Kimi-K3-Fallbacks und Unified-Memory-Long-Context-Routing. Im August-Release-Engpass ist die knappe Ressource nicht „welches Modell am höchsten scored“, sondern auditierbare Compute-Kapazität für 48-Stunden-Real-Task-Vergleiche ohne Vendor Lock-in. Wer lokales MLX für K3-Quantisierung, 24/7-Remote-Nodes für OpenClaw-Multi-Model-Routing-Tests und Unified Memory für Agent-Session-Splitting braucht, setzt auf einen Drei-Tier-Stack: lokales MLX für Daily Work und Offline-Hedge; Frontier-Closed-APIs für Grok/Claude-Hard-Reasoning; MACGPU-Remote-Mac-Nodes für Agent-Residency und isolierte Evaluierung — der beste Hedge gegen „Musk time“ und einen Release-Monat-Routing-Sturm.