KIMI K3
OPEN_
SOURCE_
OU_PAS.

Kimi K3 modèle MoE open weight 2,8 billions de paramètres

Réponse brève : non, au sens strict — et Moonshot AI ne prétend pas le contraire. Le 27 juillet 2026, Moonshot a publié les poids complets, le rapport technique et trois technologies d'infrastructure : MoonEP, FlashKDA et AgentEnv. Point sensible : « open source » et « open weight » ne sont pas synonymes, et la licence personnalisée impose deux gates commerciales que la plupart des analyses passent sous silence. Conclusion : K3 représente le plafond de capacité de la catégorie open weight (AA Index #3 mondial), non le choix économique optimal. Structure : clarté licence → specs → architecture KDA/AttnRes → stack infra → benchmarks → tarifs/auto-hébergement → contexte géopolitique → intégration en 5 étapes → FAQ.

1. Points sensibles : pourquoi le 27 juillet change l'évaluation

1) Piège terminologique : Moonshot emploie systématiquement « open weight », jamais « open source » — les données d'entraînement et le code complet ne sont pas publics. 2) Deux gates de licence : un chiffre d'affaires Model-as-a-Service supérieur à 20 M$ sur 12 mois, ou des produits dépassant 100 M MAU / 20 M$ de revenus mensuels, déclenchent des conditions additionnelles. 3) Auto-hébergement irréaliste : téléchargement de 1,56 To, supernœud de 64+ accélérateurs recommandé — l'API ou OpenRouter constitue la voie pragmatique. 4) Pas l'option la moins chère : ~0,95 $/tâche sur l'Intelligence Index vs GLM-5.2 à ~0,47 $. 5) Contexte géopolitique : les allégations américaines de distillation et la réponse chinoise du 28 juillet ajoutent des risques de conformité et de réputation au choix du fournisseur.

2. Chronologie : du lancement API aux poids complets en 11 jours

DateÉvénement
16 juilletK3 disponible sur kimi.com, Kimi Work, Kimi Code et API — poids retenus
17 juilletAnalyse architecturale sectorielle ; médias d'État le qualifient de plus grand modèle open par nombre de paramètres
22–23 juilletOfficiels américains accusent Moonshot de distillation industrielle depuis le modèle Fable d'Anthropic
27 juillet, 23h00Poids complets, rapport technique, MoonEP et AgentEnv open-sourcés (FlashKDA déjà public)
28 juilletLe ministère chinois du Commerce réagit ; médias nationaux couvrent les détails de la release

La release de 1,56 To sur Hugging Face a atteint la #1 des tendances en trente minutes — seulement 11 jours après le lancement API-only.

3. Kimi K3 en un coup d'œil

SpecValeur
Paramètres totaux2,8 billions
Paramètres actifs~104 milliards
ArchitectureMixture-of-Experts (MoE)
Experts896 routés, 16 activés par token + experts partagés
AttentionKimi Delta Attention (KDA) + Gated MLA
Fenêtre de contexte1 000 000 tokens
MultimodalitéVision native (ViT-V2, 27 couches)
Format des poidsPoids MXFP4, activations MXFP8 (QAT dès la phase SFT)
Taille du téléchargement~1,56 To (Hugging Face)
LicencePersonnalisée — « open weight », pas « open source »

4. Architecture : KDA, Attention Residuals, Per-Head Muon

Kimi Delta Attention (KDA)

Le Gated DeltaNet standard applique une porte d'oubli scalaire. KDA la remplace par un gating canal par canal — chaque dimension de feature possède son propre taux de décroissance. Implémenté en récurrence DPLR par chunks, entrelacé avec des couches d'attention globale Gated MLA. Ce design hybride supporte un contexte de 1M tokens tout en maintenant une taille de cache KV réduite.

Attention Residuals (AttnRes)

L'accumulation résiduelle uniforme dilue l'information des premières couches en profondeur. AttnRes emploie une agrégation sélective, dépendante de l'entrée à travers les couches précédentes — un RMSNorm et un pseudo-vecteur de requête par couche, offrant ~25 % d'efficacité d'entraînement supérieure pour moins de 2 % de coût paramétrique additionnel.

Stable LatentMoE

896 experts, 16 activés par token (~1,8 % de sparsité). Quantile Balancing plus MoonEP adressent le déséquilibre de charge des experts avec une borne supérieure prouvée d'experts redondants par rank.

5. Trois releases d'infrastructure

TechnologieRôleChiffres clés
MoonEPCommunication MoE à très grande échelleDuplique temporairement les experts surchargés ; prouve la borne supérieure d'experts redondants par rank
FlashKDAKernel KDA basé sur CUTLASSPrefill 1,72×–2,22× plus rapide sur H20 vs baseline flash-linear-attention ; drop-in via chunk_kda
AgentEnvSandbox agent microVM Firecracker (avec KVCache.ai)Checkpoint 133 ms, reprise 49 ms, jusqu'à 6,5× de surcommit mémoire (chiffres éditeur, non vérifiés indépendamment)

6. Benchmarks vs GPT-5.6, Claude et GLM-5.2

SWE-bench Verified (évaluation indépendante Vals AI, juillet 2026)

ModèleScoreRelease
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Artificial Analysis Intelligence Index (max reasoning) : Claude Fable 5 (60) > GPT-5.6 Sol (59) > Kimi K3 (~57, #3 global, #1 open weight) > GLM-5.2 (51) > DeepSeek V4 Pro (44).

~0,95 $/tâche sur l'Intelligence Index — ~60 % moins cher que Claude Fable 5 (~2,40 $) mais plus onéreux que GLM-5.2 (~0,47 $). Plafond de capacité de la catégorie open weight, non le choix économique. K3 domine le Frontend Code Arena d'Arena.ai.

7. Licence : deux gates commerciales

  1. Gate revenus MaaS : les entreprises Model-as-a-Service générant plus de 20 millions de dollars de revenus agrégés sur 12 mois glissants requièrent un accord commercial distinct avec Moonshot.
  2. Gate attribution : les produits dépassant 100 millions de MAU ou 20 millions de dollars de revenus mensuels doivent afficher « Kimi K3 » de manière visible dans l'interface.

Pour la quasi-totalité des startups et PME, aucun gate n'est une contrainte pratique. La première clause ne concerne que les entreprises revendant l'inférence K3 à grande échelle en concurrence directe avec l'API Moonshot.

8. Tarifs API et auto-hébergement

Type de tokenPrix par million de tokens
Input (cache hit)0,30 $
Input (cache miss)3,00 $
Output (incl. trace de raisonnement)15,00 $

Endpoint : https://api.moonshot.ai/v1, ID modèle kimi-k3, compatible SDK OpenAI. Le serving disaggregé Mooncake atteindrait 90 %+ de taux de cache hit sur les workloads de codage — le coût input réel se rapproche de 0,30 $ plutôt que 3,00 $. L'auto-hébergement requiert un supernœud de 64+ accélérateurs ; OpenRouter répertorie déjà sept fournisseurs.

9. Cinq étapes pour intégrer K3

  1. Choisir votre voie : API vs hébergement tiers vs auto-déploiement — 99 % des équipes devraient opter pour les deux premières.
  2. Auditer la licence : vérifier les seuils de revenus MaaS et MAU contre votre modèle économique.
  3. Brancher les clients compatibles OpenAI : Cursor, OpenClaw ou agents personnalisés — modifier uniquement l'URL de base et la clé API.
  4. Exploiter les cache hits : le contexte code répété sur l'architecture Mooncake oriente le coût effectif vers le palier 0,30 $.
  5. Construire une chaîne de fallback : router les tâches difficiles vers K3, le trafic quotidien vers GLM-5.2 ou DeepSeek V4 Flash pour maîtriser les dépenses.

10. Approfondissement : WAIC 2026 et la course au « club 3T »

La release de K3 coïncide avec la WAIC 2026 et quelques jours après l'escalade du différend US-Chine sur la distillation — le conseiller de la Maison-Blanche Michael Kratsios accuse Moonshot de distillation industrielle depuis le modèle Fable d'Anthropic ; le ministère chinois du Commerce réplique le 28 juillet en dénonçant « l'hégémonisme IA » de Washington. Publier poids complets, rapport technique et trois technologies d'infrastructure constitue un signal délibéré : Moonshot parie sur la transparence technique comme réponse la plus claire aux questions sur ses méthodes.

Trois jours plus tard, Alibaba — investisseur de Moonshot — dévoile Qwen3.8-Max-Preview à 2,4 billions de paramètres, largement interprété comme réponse directe. La course open weight chinoise entre dans ce que certains nomment le « club 3T » — échelle paramétrique, innovation architecturale et open-sourcing infra avancent de concert.

Pour les développeurs Mac, l'auto-hébergement de K3 n'est pas réaliste, l'accès API est trivial. Les fallbacks MLX locaux avec modèles quantifiés de classe GLM-5.2 restent viables sur Apple Silicon. La valeur réelle de K3 : démontrer que les modèles open weight peuvent approcher la capacité frontier, repositionnant tarifs et benchmarks pour l'ensemble de l'écosystème.

11. FAQ

Kimi K3 est-il open source ? Non, au sens OSI. Open weight : poids entraînés, rapport technique et certains outils infra sont publics ; données d'entraînement et code complet ne le sont pas.

Puis-je l'utiliser commercialement ? Oui, pour la grande majorité des cas d'usage. Des restrictions s'appliquent uniquement aux seuils de revenus MaaS et d'échelle décrits ci-dessus.

Quel matériel pour l'auto-hébergement ? Moonshot recommande 64+ accélérateurs sur un supernœud. La plupart des développeurs devraient utiliser l'API officielle ou OpenRouter.

En quoi K3 diffère-t-il de K2 ? ~3× le nombre de paramètres de K2.5, ajoute AttnRes et Per-Head Muon, étend contexte et multimodalité ; la licence introduit un nouveau seuil de revenus MaaS.

12. Conclusion : accès API + architecture de fallback Mac local

Une machine cloud Windows ou Linux peut appeler l'API Kimi K3, mais demeure en retrait sur l'intégration toolchain Cursor, l'hébergement agent OpenClaw 24/7, les fallbacks MLX quantifiés locaux et les workflows graphiques/multimédia comparé aux Mac Apple Silicon. L'auto-hébergement K3 exige un supernœud 64 GPU ; l'accès API ne demande qu'un changement d'URL de base. Si vous recherchez également un backup offline GLM-5.2 local, un offload agent long contexte et un fonctionnement stable permanent, une architecture à trois niveaux s'impose : MLX local pour les modèles open quantifiés quotidiens ; API Kimi K3 pour le codage et raisonnement exigeants ; nœuds Mac distants MACGPU pour la résidence OpenClaw/Hermes et les workloads long contexte gourmands en mémoire unifiée — alors que la course au club 3T s'intensifie, un compute prévisible constitue la meilleure couverture.