IST KIMI K3
OPEN_
SOURCE_
ODER_NICHT.

Kimi K3 2,8 Billionen Parameter Open-Weight MoE-Modell

Kurzantwort: nein, nicht im strengen Sinne — und Moonshot AI behauptet das auch nicht. Am 27. Juli 2026 veröffentlichte Moonshot vollständige Gewichte, den technischen Report und drei Infrastruktur-Technologien: MoonEP, FlashKDA und AgentEnv. Schmerzpunkt: „Open Source" und „Open Weight" sind nicht identisch; die Custom-Lizenz enthält zwei kommerzielle Gates, die die meiste Berichterstattung ignoriert. Fazit: K3 ist die Leistungsobergrenze der Open-Weight-Klasse (AA Index #3 global), nicht das Preis-Leistungs-Modell. Struktur: Lizenzklarheit → Specs → KDA/AttnRes-Architektur → Infra-Stack → Benchmarks → Preise/Self-Hosting → geopolitischer Kontext → 5-Schritte-Integration → FAQ.

1. Schmerzpunkte: Warum der 27. Juli die Bewertung verändert

1) Terminologie-Falle: Moonshot sagt durchgängig „open weight", nie „open source" — Trainingsdaten und vollständiger Trainingscode sind nicht öffentlich. 2) Zwei Lizenz-Gates: Model-as-a-Service-Umsatz über 20 Mio. $ in 12 Monaten oder Produkte mit über 100 Mio. MAU / 20 Mio. $ monatlichem Umsatz lösen Zusatzbedingungen aus. 3) Self-Hosting unrealistisch: 1,56 TB Download, 64+ Beschleuniger-Supernode empfohlen — API oder OpenRouter ist der praktikable Weg. 4) Nicht die günstigste Option: ~0,95 $/Task im Intelligence Index vs. GLM-5.2 bei ~0,47 $. 5) Geopolitischer Overlay: US-Distillationsvorwürfe und Chinas Gegenantwort vom 28. Juli erhöhen Compliance- und Reputationsrisiken bei der Anbieterwahl — relevant für EU-Unternehmen unter DSGVO und Lieferkettenprüfung.

2. Zeitachse: API-Launch bis Vollgewichte in 11 Tagen

DatumEreignis
16. JuliK3 startet auf kimi.com, Kimi Work, Kimi Code und API — Gewichte zurückgehalten
17. JuliBranchenanalyse der Architektur; Staatsmedien nennen es größtes Open-Modell nach Parameterzahl
22.–23. JuliUS-Behörden werfen Moonshot industrielle Distillation von Anthropics Fable-Modell vor
27. Juli, 23:00Vollgewichte, technischer Report, MoonEP und AgentEnv open-sourced (FlashKDA bereits öffentlich)
28. JuliChinas Handelsministerium reagiert; inländische Medien berichten Release-Details

Der 1,56 TB-Release auf Hugging Face erreichte innerhalb von 30 Minuten Platz #1 der Trending-Liste — nur 11 Tage nach dem API-only-Launch.

3. Kimi K3 auf einen Blick

SpecWert
Gesamtparameter2,8 Billionen
Aktive Parameter~104 Milliarden
ArchitekturMixture-of-Experts (MoE)
Experten896 geroutet, 16 pro Token aktiviert + Shared Experts
AttentionKimi Delta Attention (KDA) + Gated MLA
Kontextfenster1.000.000 Tokens
MultimodalitätNative Vision (ViT-V2, 27 Layer)
GewichtsformatMXFP4-Gewichte, MXFP8-Aktivierungen (QAT ab SFT-Stage)
Download-Größe~1,56 TB (Hugging Face)
LizenzCustom — „open weight", nicht „open source"

4. Architektur: KDA, Attention Residuals, Per-Head Muon

Kimi Delta Attention (KDA)

Standard-Gated DeltaNet nutzt ein skalares Vergessens-Gate. KDA ersetzt es durch kanalweises Gating — jede Feature-Dimension erhält eine eigene Decay-Rate. Implementiert als chunkweise DPLR-Rekurrenz, verschachtelt mit Gated-MLA-Global-Attention-Layern. Dieses Hybrid-Design unterstützt 1M-Token-Kontext bei geringer KV-Cache-Größe.

Attention Residuals (AttnRes)

Uniforme Residual-Akkumulation verwässert frühe Layer-Information in der Tiefe. AttnRes nutzt selektive, input-abhängige Aggregation über vorhergehende Layer — ein RMSNorm und ein Pseudo-Query-Vektor pro Layer, ~25 % höhere Trainingseffizienz bei unter 2 % zusätzlichen Parametern.

Stable LatentMoE

896 Experten, 16 pro Token aktiviert (~1,8 % Sparsity). Quantile Balancing plus MoonEP adressiert Expert-Load-Imbalance mit bewiesener Obergrenze redundanter Experten pro Rank.

5. Drei Infrastruktur-Releases

TechnologieRolleKernzahlen
MoonEPMoE-Kommunikation in extreme SkalaDupliziert überlastete Experten temporär; beweist Obergrenze redundanter Experten pro Rank
FlashKDACUTLASS-basierter KDA-Kernel1,72×–2,22× schnelleres Prefill auf H20 vs. flash-linear-attention-Baseline; Drop-in via chunk_kda
AgentEnvFirecracker-microVM-Agent-Sandbox (mit KVCache.ai)Checkpoint 133 ms, Resume 49 ms, bis zu 6,5× Memory-Overcommit (Herstellerangabe, nicht unabhängig verifiziert)

6. Benchmarks vs. GPT-5.6, Claude und GLM-5.2

SWE-bench Verified (Vals AI unabhängige Evaluation, Juli 2026)

ModellScoreRelease
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (max reasoning): Claude Fable 5 (60) > GPT-5.6 Sol (59) > Kimi K3 (~57, #3 gesamt, #1 open-weight) > GLM-5.2 (51) > DeepSeek V4 Pro (44).

~0,95 $/Task im Intelligence Index — ~60 % günstiger als Claude Fable 5 (~2,40 $), aber teurer als GLM-5.2 (~0,47 $). Leistungsobergrenze der Open-Weight-Klasse, nicht das Preis-Leistungs-Modell. K3 führt auf Arena.ais Frontend Code Arena.

7. Lizenz: Zwei kommerzielle Gates

  1. MaaS-Umsatz-Gate: Model-as-a-Service-Unternehmen mit mehr als 20 Millionen $ aggregiertem Umsatz in 12 Monaten benötigen eine separate kommerzielle Vereinbarung mit Moonshot.
  2. Attributions-Gate: Produkte mit über 100 Millionen MAU oder 20 Millionen $ monatlichem Umsatz müssen „Kimi K3" prominent in der UI anzeigen.

Für nahezu jedes Startup und mittelständisches Unternehmen ist keines der Gates praktisch relevant. Die erste Klausel betrifft nur Unternehmen, die K3-Inferenz in direkter Konkurrenz zur Moonshot-API in großem Maßstab weiterverkaufen. Bei Verarbeitung personenbezogener Daten über die API: Auftragsverarbeitungsvertrag (AVV) und DSGVO-konforme Datenfluss-Dokumentation prüfen.

8. API-Preise und Self-Hosting

Token-TypPreis pro Million Tokens
Input (Cache Hit)0,30 $
Input (Cache Miss)3,00 $
Output (inkl. Reasoning Trace)15,00 $

Endpoint: https://api.moonshot.ai/v1, Modell-ID kimi-k3, OpenAI-SDK-kompatibel. Mooncake disaggregiertes Serving erreicht laut Berichten 90 %+ Cache-Hit-Raten bei Coding-Workloads — realer Input-Preis liegt näher an 0,30 $ als 3,00 $. Self-Hosting erfordert einen 64+ Beschleuniger-Supernode; OpenRouter listet bereits sieben Anbieter.

9. Fünf Schritte zur K3-Integration

  1. Pfad wählen: API vs. Third-Party-Hosting vs. Self-Deploy — 99 % der Teams sollten die ersten beiden wählen.
  2. Lizenz prüfen: MaaS-Umsatz- und MAU-Schwellenwerte gegen das Geschäftsmodell abgleichen.
  3. OpenAI-kompatible Clients einbinden: Cursor, OpenClaw oder Custom Agents — nur Base URL und API-Key ändern.
  4. Cache Hits nutzen: Wiederholter Code-Kontext auf Mooncake-Architektur senkt effektive Kosten Richtung 0,30 $-Tier.
  5. Fallback-Kette aufbauen: Harte Tasks an K3, Daily Traffic an GLM-5.2 oder DeepSeek V4 Flash zur Kostenkontrolle.

10. Deep Dive: WAIC 2026 und das „3T-Club"-Rennen

K3s Release fiel in die WAIC 2026 und Tage nach der Eskalation des US-China-Distillationsstreits — White-House-Berater Michael Kratsios warf Moonshot industrielle Distillation von Anthropics Fable-Modell vor; Chinas Handelsministerium reagierte am 28. Juli mit Vorwürfen der „AI-Hegemonie". Die Veröffentlichung von Vollgewichten, technischem Report und drei Infra-Technologien liest sich als bewusstes Signal: Moonshot setzt auf technische Transparenz als klarste Antwort auf Methodenfragen.

Drei Tage später präsentierte Alibaba — ein Moonshot-Investor — Qwen3.8-Max-Preview mit 2,4 Billionen Parametern, weitgehend als direkte Antwort gelesen. Chinas Open-Weight-Rennen ist in das „3T-Club"-Stadium eingetreten — Parameterskalierung, architektonische Innovation und Infra-Open-Sourcing bewegen sich im Gleichschritt.

Für Mac-Entwickler ist Self-Hosting von K3 unrealistisch, API-Zugang trivial. Lokale MLX-Fallbacks mit quantisierten GLM-5.2-Klassen-Modellen bleiben auf Apple Silicon praktikabel. K3s echter Wert: der Nachweis, dass Open-Weight-Modelle Frontier-Fähigkeit annähern können — und damit Preis- und Benchmark-Baselines für das gesamte Ökosystem verschieben.

11. FAQ

Ist Kimi K3 Open Source? Nein, nicht nach OSI-Definition. Open Weight: trainierte Gewichte, technischer Report und einige Infra-Tools sind öffentlich; Trainingsdaten und vollständiger Trainingscode nicht.

Kann ich es kommerziell nutzen? Ja, für die überwiegende Mehrheit der Use Cases. Einschränkungen gelten nur bei den oben beschriebenen MaaS-Umsatz- und Skalenschwellen.

Wie viel Hardware für Self-Hosting? Moonshot empfiehlt 64+ Beschleuniger auf einem Supernode. Die meisten Entwickler sollten die offizielle API oder OpenRouter nutzen.

Wie unterscheidet sich K3 von K2? ~3× K2.5s Parameterzahl, AttnRes und Per-Head Muon, erweiterter Kontext und Multimodalität; Lizenz fügt neues MaaS-Umsatz-Gate hinzu.

12. Fazit: API-Zugang + Mac-Lokal-Fallback-Architektur

Eine Windows- oder Linux-Cloud-Box kann die Kimi-K3-API aufrufen, erreicht aber nicht Cursor-Toolchain-Integration, OpenClaw-24/7-Agent-Hosting, lokale MLX-Quantisierungs-Fallbacks und Grafik-/Multimedia-Workflows im Vergleich zu Apple-Silicon-Macs. K3-Self-Hosting braucht einen 64-GPU-Supernode; API-Zugang nur eine Base-URL-Änderung. Wer zusätzlich lokalen GLM-5.2-Offline-Backup, Long-Context-Agent-Offload und stabilen Dauerbetrieb braucht, profitiert von einem Drei-Tier-Stack: lokales MLX für tägliche quantisierte Open Models; Kimi-K3-API für hartes Coding und Reasoning; MACGPU Remote-Mac-Nodes für OpenClaw/Hermes-Residency und Unified-Memory-intensive Long-Context-Workloads — während das 3T-Club-Rennen Fahrt aufnimmt, ist planbare Compute-Kapazität die beste Absicherung.