KIMI K3 OPEN WEIGHTS
JULY_27_
RELEASE.

Kimi K3 2,8T Open Weights Release und Benchmark-Vergleich

Kernaussage: Moonshot AI veröffentlicht am 27. Juli 2026 die vollständigen 2,8 Billionen Parameter von Kimi K3 auf Hugging Face unter Modified MIT. Die API läuft seit dem 16. Juli. Dieser datenbasierte Leitfaden klärt API vs. Open Weights, listet alle Spezifikationen, vergleicht Benchmarks (AA Index 57,1 / 58,9 / 59,9), dokumentiert Preise ($3 / $0,30 / $15), Self-Hosting (1,4 TB · 64+ GPUs), die 5-Punkte-Release-Checkliste und die Branchenbedeutung.

30-Sekunden-Überblick · TL;DR

16.07.API + Kimi App/Code live — Modell-ID kimi-k3
27.07.Vollständige Gewichte Hugging Face · Modified MIT · Tech Report
Skalierung2,8T Parameter · 16/896 Experten · 1M Kontext
AA IndexK3 57,1 · Sol 58,9 · Fable 5 59,9 (Rang 3/189)
Self-Host4-bit ca. 1,4 TB · Produktion 64+ Beschleuniger

1. Zeitachse: API 16.07. vs. Gewichte 27.07.

DatumEreignis
2026-07-16K3 via Kimi App / Work / Code / API. Artificial Analysis veröffentlicht unabhängige Bewertung
2026-07-17WAIC Shanghai. Xinhua bezeichnet K3 als nationalen Meilenstein
2026-07-27Vollständige Gewichte auf Hugging Face (Modified MIT) + Technischer Report

Häufige Verwechslung: 16.07. = API-Nutzung, 27.07. = Gewicht-Download. vLLM KDA/prefix caching und Ollama/GGUF-Quantisierungen folgen nach der Gewicht-Freigabe. Architektur-Details: K3-Test vom 17.07.

2. Spezifikationen (Datentabelle)

ParameterWert
Gesamtparameter2,8 Billionen (2,8T) — größtes Open-Weight-Modell
ArchitekturStable LatentMoE: 16 von 896 Experten aktiv (1,8 % Sparsity)
AttentionKDA + AttnRes + Gated MLA
Kontext1.048.576 Tokens (1M)
ModalitätenText + Bild (native Vision), Video in Produkt-Apps
GewichtsformatMXFP4 Gewichte + MXFP8 Aktivierungen
Training-StabilitätQuantile Balancing · Per-Head Muon · SiTU
Long-Context-DecodeKDA: bis 6,3× schneller bei 1M Tokens
Skalierungseffizienzca. 2,5× vs. Kimi K2 bei gleichem Compute
API-Modell-IDkimi-k3
LizenzModified MIT (Text am 27.07. bestätigen)

3. Benchmarks: Siege und Niederlagen

3.1 K3 führt

BenchmarkK3Vergleich
Frontend Code Arena#1Blindtest: UI-Code über Fable/Sol
Automation Bench30,8 (#1)
SpreadsheetBench 2#1
BrowseComp91,21M-Kontext ohne Kompression
SWE Marathon42,0Deutlich vor Fable 5 (35,0) und Sol (39,0)
Terminal Bench 2.188,3Sol 88,8 — nahezu gleich
Program Bench77,8Sol 77,6 knapp übertroffen
FrontierSWE81,2Sol 71,3 deutlich geschlagen; Fable 5 86,6 führt

3.2 K3 liegt zurück

BenchmarkK3Beste Konkurrenz
GDPval v2 Elo1668–1687Fable 5: 1760 · Sol: 1748
DeepSWE67,5Sol: 73,0
Halluzinationsrate↑ vs. K2.6Offiziell bestätigt; r/LocalLLaMA berichtet mehr Halluzinationen
Dialog-Polish / StabilitätHöhere VarianzFable 5 / Sol überlegen

Moonshot räumt offen ein: Gesamtleistung liegt hinter Fable 5 und GPT-5.6 Sol. Bekannte Schwächen: Sensibilität gegenüber Harness-Rückgaben, überaktives Verhalten bei vagen Prompts.

3.3 Artificial Analysis Intelligence Index v4.1

ModellScoreRang
Claude Fable 559,91
GPT-5.6 Sol58,92
Kimi K357,13 / 189

Gap Open vs. Closed: von hunderten Punkten auf 2–3 Punkte geschrumpft. AA Einzelaufgabe: K3 $0,9465,8 % günstiger als Fable 5, 9,4 % günstiger als Sol.

4. API-Preise (USD pro Million Tokens)

PositionPreis
Input (Cache-Miss)$3,00
Input (Cache-Hit)$0,30
Output$15,00

Coding-Workloads: Cache-Hit-Rate >90 % berichtet. Effektiver Input-Preis deutlich unter Nominalpreis. Höchste Preisklasse unter chinesischen Modellen, aber unter Claude Opus 4.8 Einzelaufgaben-Kosten.

5. Open Weights vs. Open Source

BegriffWas enthalten istK3 am 27.07.
Open WeightsInferenz-Gewichte zum Download✓ Ja
Open Source+ Trainingscode + Trainingsdaten✗ Nein
LizenzModified MIT (Details am Release-Tag)✓ Geplant

r/LocalLLaMA diskutiert „benchmaxxed"-Kritik und Definitionen. Korrekte Terminologie ist entscheidend für Glaubwürdigkeit in der englischsprachigen Tech-Community.

6. Was am 27.07. passiert

  • 2,8T Vollgewichte auf Moonshots Hugging-Face-Organisation
  • Technischer Report (Architektur, Training, Evaluation)
  • vLLM KDA / prefix caching — Release-Day-Support
  • Folge: Ollama, GGUF (analog K2-Serie)

7. Self-Hosting: 1,4 TB · 64+ Beschleuniger

MetrikWertReferenz
4-bit Gewichteca. 1,4 TB
Produktions-Setup64+ BeschleunigerExpert + Tensor Parallelism
K2.7 Code INT4577 GB1T-Modell — K3 ist 2,8× größer
Consumer-HardwareNicht praktikabelAPI ($3/$15) ist Default

Self-Hosting nur sinnvoll bei: (1) Data Residency / Offline, (2) Fine-Tuning auf eigenen Daten, (3) Volumen, das eigene Hardware rechtfertigt.

8. Release-Checkliste (5 Schritte)

#PrüfpunktAktion
1HF-RepositoryAlle Gewicht-Dateien vollständig (keine fehlenden Shards)
2LICENSEModified MIT Originaltext lesen (Commercial, Redistribution)
3QuantisierungMXFP4/NVFP4-Versionen und Qualität prüfen
4Inferenz-StackvLLM/SGLang Startbefehle, KDA-Support verifizieren
5Hardware + Re-TestMindest-Setup dokumentieren; 1M-Kontext unabhängig retesten

9. Branchenanalyse (Datenpunkte)

TrendDaten / Fakt
Open-Closed-Gap2–3 AA-Punkte — Premium nur noch schwer begründbar
GeopolitikWAIC-Timing; US-Fable/Mythos-Kurzban (01.07., Wiederherstellung) — Open Weights nicht abschaltbar
China-WelleGLM-5.2 · DeepSeek V4 Pro (1,6T) · MiniMax — K3 als Spitze
Moonshot-Comeback2025: Rang 7 nach DeepSeek R1 → K2 → K2.5 → K3

Quellen: kimi.com · platform.kimi.ai · Artificial Analysis (16.07.2026) · VentureBeat · r/LocalLLaMA · Hacker News

10. Fünf konkrete Schritte

  1. API jetzt testen: kimi-k3 via platform.kimi.ai oder OpenRouter
  2. 27.07. bookmarken: HF-Repo + LICENSE prüfen
  3. Benchmark-Mapping: SWE Marathon für Long-Coding · GDPval für Reasoning-Tiefe
  4. Self-Host nur bei 3 Kriterien: Residency · Fine-Tuning · High Volume
  5. Checkliste am Release-Tag ausführen: alle 5 Punkte abhaken

11. FAQ

Q: Wann werden die Gewichte veröffentlicht?
A: 27. Juli 2026 auf Hugging Face unter Modified MIT — 2,8T Vollgewichte.

Q: Ist K3 Open Source?
A: Open Weights, nicht vollständig Open Source. Kein Trainingscode/Daten.

Q: Was kostet K3?
A: $3 Input · $0,30 Cache · $15 Output pro Million Tokens. Web-App kostenlos.

Q: Consumer-GPU?
A: Nein. 1,4 TB (4-bit), 64+ Beschleuniger für Produktion.

Q: Besser als Fable 5 / Sol?
A: AA Index Rang 3 (57,1). Spezifische Benchmarks (Frontend Code Arena, SWE Marathon): ja. Gesamt: knapp dahinter.

Q: Welche Lizenz?
A: Modified MIT — LICENSE-File am 27.07. lesen.

12. Fazit: API überall, Agent-Tests auf Mac

API-Setup funktioniert auf Windows/Linux. Für Cursor + K3 Long-Context-Coding, Xcode-Agent-Integration und MLX-Quantisierungs-Validierung bleibt Apple Silicon Unified Memory + Metal der reibungsärmste Weg.

Pragmatische Trennung: Alltagsentwicklung via API, Kimi-Code-Stresstests, Multi-Repo-SWE-Marathon-Regressionen und 1M-Token-Batch-Jobs auf einen MACGPU Remote Mac mini M4 — On-Demand, SSH-gesichert. Vor dem 27.07. Agent-Workloads isolieren.