KIMI K3 OPEN WEIGHTS
JULY_27_
RELEASE.
Kernaussage: Moonshot AI veröffentlicht am 27. Juli 2026 die vollständigen 2,8 Billionen Parameter von Kimi K3 auf Hugging Face unter Modified MIT. Die API läuft seit dem 16. Juli. Dieser datenbasierte Leitfaden klärt API vs. Open Weights, listet alle Spezifikationen, vergleicht Benchmarks (AA Index 57,1 / 58,9 / 59,9), dokumentiert Preise ($3 / $0,30 / $15), Self-Hosting (1,4 TB · 64+ GPUs), die 5-Punkte-Release-Checkliste und die Branchenbedeutung.
30-Sekunden-Überblick · TL;DR
| 16.07. | API + Kimi App/Code live — Modell-ID kimi-k3 |
| 27.07. | Vollständige Gewichte Hugging Face · Modified MIT · Tech Report |
| Skalierung | 2,8T Parameter · 16/896 Experten · 1M Kontext |
| AA Index | K3 57,1 · Sol 58,9 · Fable 5 59,9 (Rang 3/189) |
| Self-Host | 4-bit ca. 1,4 TB · Produktion 64+ Beschleuniger |
1. Zeitachse: API 16.07. vs. Gewichte 27.07.
| Datum | Ereignis |
|---|---|
| 2026-07-16 | K3 via Kimi App / Work / Code / API. Artificial Analysis veröffentlicht unabhängige Bewertung |
| 2026-07-17 | WAIC Shanghai. Xinhua bezeichnet K3 als nationalen Meilenstein |
| 2026-07-27 | Vollständige Gewichte auf Hugging Face (Modified MIT) + Technischer Report |
Häufige Verwechslung: 16.07. = API-Nutzung, 27.07. = Gewicht-Download. vLLM KDA/prefix caching und Ollama/GGUF-Quantisierungen folgen nach der Gewicht-Freigabe. Architektur-Details: K3-Test vom 17.07.
2. Spezifikationen (Datentabelle)
| Parameter | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) — größtes Open-Weight-Modell |
| Architektur | Stable LatentMoE: 16 von 896 Experten aktiv (1,8 % Sparsity) |
| Attention | KDA + AttnRes + Gated MLA |
| Kontext | 1.048.576 Tokens (1M) |
| Modalitäten | Text + Bild (native Vision), Video in Produkt-Apps |
| Gewichtsformat | MXFP4 Gewichte + MXFP8 Aktivierungen |
| Training-Stabilität | Quantile Balancing · Per-Head Muon · SiTU |
| Long-Context-Decode | KDA: bis 6,3× schneller bei 1M Tokens |
| Skalierungseffizienz | ca. 2,5× vs. Kimi K2 bei gleichem Compute |
| API-Modell-ID | kimi-k3 |
| Lizenz | Modified MIT (Text am 27.07. bestätigen) |
3. Benchmarks: Siege und Niederlagen
3.1 K3 führt
| Benchmark | K3 | Vergleich |
|---|---|---|
| Frontend Code Arena | #1 | Blindtest: UI-Code über Fable/Sol |
| Automation Bench | 30,8 (#1) | — |
| SpreadsheetBench 2 | #1 | — |
| BrowseComp | 91,2 | 1M-Kontext ohne Kompression |
| SWE Marathon | 42,0 | Deutlich vor Fable 5 (35,0) und Sol (39,0) |
| Terminal Bench 2.1 | 88,3 | Sol 88,8 — nahezu gleich |
| Program Bench | 77,8 | Sol 77,6 knapp übertroffen |
| FrontierSWE | 81,2 | Sol 71,3 deutlich geschlagen; Fable 5 86,6 führt |
3.2 K3 liegt zurück
| Benchmark | K3 | Beste Konkurrenz |
|---|---|---|
| GDPval v2 Elo | 1668–1687 | Fable 5: 1760 · Sol: 1748 |
| DeepSWE | 67,5 | Sol: 73,0 |
| Halluzinationsrate | ↑ vs. K2.6 | Offiziell bestätigt; r/LocalLLaMA berichtet mehr Halluzinationen |
| Dialog-Polish / Stabilität | Höhere Varianz | Fable 5 / Sol überlegen |
Moonshot räumt offen ein: Gesamtleistung liegt hinter Fable 5 und GPT-5.6 Sol. Bekannte Schwächen: Sensibilität gegenüber Harness-Rückgaben, überaktives Verhalten bei vagen Prompts.
3.3 Artificial Analysis Intelligence Index v4.1
| Modell | Score | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | 1 |
| GPT-5.6 Sol | 58,9 | 2 |
| Kimi K3 | 57,1 | 3 / 189 |
Gap Open vs. Closed: von hunderten Punkten auf 2–3 Punkte geschrumpft. AA Einzelaufgabe: K3 $0,94 — 65,8 % günstiger als Fable 5, 9,4 % günstiger als Sol.
4. API-Preise (USD pro Million Tokens)
| Position | Preis |
|---|---|
| Input (Cache-Miss) | $3,00 |
| Input (Cache-Hit) | $0,30 |
| Output | $15,00 |
Coding-Workloads: Cache-Hit-Rate >90 % berichtet. Effektiver Input-Preis deutlich unter Nominalpreis. Höchste Preisklasse unter chinesischen Modellen, aber unter Claude Opus 4.8 Einzelaufgaben-Kosten.
5. Open Weights vs. Open Source
| Begriff | Was enthalten ist | K3 am 27.07. |
|---|---|---|
| Open Weights | Inferenz-Gewichte zum Download | ✓ Ja |
| Open Source | + Trainingscode + Trainingsdaten | ✗ Nein |
| Lizenz | Modified MIT (Details am Release-Tag) | ✓ Geplant |
r/LocalLLaMA diskutiert „benchmaxxed"-Kritik und Definitionen. Korrekte Terminologie ist entscheidend für Glaubwürdigkeit in der englischsprachigen Tech-Community.
6. Was am 27.07. passiert
- 2,8T Vollgewichte auf Moonshots Hugging-Face-Organisation
- Technischer Report (Architektur, Training, Evaluation)
- vLLM KDA / prefix caching — Release-Day-Support
- Folge: Ollama, GGUF (analog K2-Serie)
7. Self-Hosting: 1,4 TB · 64+ Beschleuniger
| Metrik | Wert | Referenz |
|---|---|---|
| 4-bit Gewichte | ca. 1,4 TB | — |
| Produktions-Setup | 64+ Beschleuniger | Expert + Tensor Parallelism |
| K2.7 Code INT4 | 577 GB | 1T-Modell — K3 ist 2,8× größer |
| Consumer-Hardware | Nicht praktikabel | API ($3/$15) ist Default |
Self-Hosting nur sinnvoll bei: (1) Data Residency / Offline, (2) Fine-Tuning auf eigenen Daten, (3) Volumen, das eigene Hardware rechtfertigt.
8. Release-Checkliste (5 Schritte)
| # | Prüfpunkt | Aktion |
|---|---|---|
| 1 | HF-Repository | Alle Gewicht-Dateien vollständig (keine fehlenden Shards) |
| 2 | LICENSE | Modified MIT Originaltext lesen (Commercial, Redistribution) |
| 3 | Quantisierung | MXFP4/NVFP4-Versionen und Qualität prüfen |
| 4 | Inferenz-Stack | vLLM/SGLang Startbefehle, KDA-Support verifizieren |
| 5 | Hardware + Re-Test | Mindest-Setup dokumentieren; 1M-Kontext unabhängig retesten |
9. Branchenanalyse (Datenpunkte)
| Trend | Daten / Fakt |
|---|---|
| Open-Closed-Gap | 2–3 AA-Punkte — Premium nur noch schwer begründbar |
| Geopolitik | WAIC-Timing; US-Fable/Mythos-Kurzban (01.07., Wiederherstellung) — Open Weights nicht abschaltbar |
| China-Welle | GLM-5.2 · DeepSeek V4 Pro (1,6T) · MiniMax — K3 als Spitze |
| Moonshot-Comeback | 2025: Rang 7 nach DeepSeek R1 → K2 → K2.5 → K3 |
Quellen: kimi.com · platform.kimi.ai · Artificial Analysis (16.07.2026) · VentureBeat · r/LocalLLaMA · Hacker News
10. Fünf konkrete Schritte
- API jetzt testen:
kimi-k3via platform.kimi.ai oder OpenRouter - 27.07. bookmarken: HF-Repo + LICENSE prüfen
- Benchmark-Mapping: SWE Marathon für Long-Coding · GDPval für Reasoning-Tiefe
- Self-Host nur bei 3 Kriterien: Residency · Fine-Tuning · High Volume
- Checkliste am Release-Tag ausführen: alle 5 Punkte abhaken
11. FAQ
Q: Wann werden die Gewichte veröffentlicht?
A: 27. Juli 2026 auf Hugging Face unter Modified MIT — 2,8T Vollgewichte.
Q: Ist K3 Open Source?
A: Open Weights, nicht vollständig Open Source. Kein Trainingscode/Daten.
Q: Was kostet K3?
A: $3 Input · $0,30 Cache · $15 Output pro Million Tokens. Web-App kostenlos.
Q: Consumer-GPU?
A: Nein. 1,4 TB (4-bit), 64+ Beschleuniger für Produktion.
Q: Besser als Fable 5 / Sol?
A: AA Index Rang 3 (57,1). Spezifische Benchmarks (Frontend Code Arena, SWE Marathon): ja. Gesamt: knapp dahinter.
Q: Welche Lizenz?
A: Modified MIT — LICENSE-File am 27.07. lesen.
12. Fazit: API überall, Agent-Tests auf Mac
API-Setup funktioniert auf Windows/Linux. Für Cursor + K3 Long-Context-Coding, Xcode-Agent-Integration und MLX-Quantisierungs-Validierung bleibt Apple Silicon Unified Memory + Metal der reibungsärmste Weg.
Pragmatische Trennung: Alltagsentwicklung via API, Kimi-Code-Stresstests, Multi-Repo-SWE-Marathon-Regressionen und 1M-Token-Batch-Jobs auf einen MACGPU Remote Mac mini M4 — On-Demand, SSH-gesichert. Vor dem 27.07. Agent-Workloads isolieren.