KIMI K3
POIDS_OUVERTS_
27_JUILLET.
Synthèse : Moonshot AI (月之暗面) publiera le 27 juillet 2026 les poids complets de Kimi K3 — un modèle MoE de 2,8 billions de paramètres avec une fenêtre de contexte d'1 048 576 tokens — sous licence Modified MIT sur Hugging Face. L'API est en ligne depuis le 16 juillet ; cette publication marque la distinction entre accès cloud et souveraineté technique. À cinq jours du téléchargement, voici l'essentiel : chronologie, spécifications, benchmarks, tarification, nuance open weights / open source, exigences matérielles (1,4 To), checklist du 27 juillet, portée industrielle et FAQ.
Essentiel · Lecture 30 secondes
| API en ligne | 2026-07-16 · Kimi App, Kimi Work, Kimi Code, API kimi-k3 |
| Poids ouverts | 2026-07-27 · Hugging Face · licence Modified MIT · rapport technique |
| Échelle | 2,8T paramètres · plus grand modèle open weights jamais publié |
| Intelligence | AA Index 57,1 (3e/189) · ~1/3 du coût de Fable 5 par tâche |
| Auto-hébergement | ~1,4 To en 4-bit · 64+ accélérateurs recommandés |
1. Chronologie : deux dates, deux réalités
La confusion la plus fréquente concerne la différence entre la mise en service API et la publication des poids. Ce ne sont pas la même chose — et la distinction conditionne votre stratégie d'intégration.
| Date | Événement | Ce que vous pouvez faire |
|---|---|---|
| 2026-07-16 | Lancement API et produits Kimi ; évaluation indépendante d'Artificial Analysis | Appeler kimi-k3 via API, kimi.com, OpenRouter — sans téléchargement local |
| 2026-07-17 | Ouverture du WAIC à Shanghai ; Xinhua qualifie K3 de jalon national | Contexte industriel et annonces complémentaires possibles |
| 2026-07-27 | Poids complets + rapport technique + support vLLM (KDA, prefix caching) | Téléchargement HF, fine-tuning, déploiement on-premise — sous contraintes matérielles |
Pour l'architecture KDA, AttnRes et Stable LatentMoE en profondeur, consultez notre guide développeur Kimi K3 du 17 juillet.
2. Spécifications essentielles
| Paramètre | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Architecture | MoE sparse Stable LatentMoE — 896 experts, 16 actifs par token (1,8 %) |
| Attention | Kimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA |
| Contexte | 1 048 576 tokens (~1M) |
| Modalités | Texte + image (vision native) ; vidéo côté produit ; sortie texte |
| Format des poids | MXFP4 (poids) + MXFP8 (activations) — entraînement natif basse précision |
| Efficacité d'extension | ~2,5× vs Kimi K2 à budget compute équivalent |
| Décodage long contexte | KDA : jusqu'à 6,3× plus rapide à 1M tokens ; KV cache −75 % |
| ID API | kimi-k3 |
| Licence (poids) | Modified MIT — texte complet le 27 juillet |
3. Benchmarks : où K3 excelle, où il cède
3.1 Intelligence globale (Artificial Analysis, 16 juillet)
| Modèle | Intelligence Index | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | 1 |
| GPT-5.6 Sol | 58,9 | 2 |
| Kimi K3 | 57,1 | 3 / 189 |
L'écart avec le leader se compte en 2,8 points — plus en "frontière adjacente" qu'en "modèle de second rang". Moonshot a rarement reconnu publiquement ce retard, listant aussi les faiblesses connues (sensibilité au contenu de raisonnement renvoyé par le harness, sur-initiative en cas d'intention floue, taux d'hallucination supérieur à K2.6).
3.2 Tableau comparatif détaillé
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Frontend Code Arena | 1er (préférence devs) | — | — |
| SWE Marathon | 42,0 | 35,0 | 39,0 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 |
| FrontierSWE | 81,2 | 86,6 | 71,3 |
| BrowseComp | 91,2 | 88,0 | 90,4 |
| Automation Bench | 30,8 | 29,1 | 29,7 |
| DeepSWE | 67,5 | 70,0 | 73,0 |
| GDPval v2 Elo | 1668–1687 | 1760 | 1748 |
| GPQA-Diamond | 93,5 | 92,6 | 94,1 |
Données croisées Moonshot + Artificial Analysis. Harness distincts (Kimi Code, Claude Code, Codex) — utiles en orientation, non définitifs.
4. Tarification API et coût réel
| Poste | Prix ($/M tokens) |
|---|---|
| Entrée (cache miss) | 3,00 |
| Entrée (cache hit, automatique) | 0,30 |
| Sortie | 15,00 |
Moonshot aligne volontairement ses tarifs sur les standards occidentaux — le positionnement le plus élevé parmi les éditeurs chinois, mais nettement inférieur à Claude Opus 4.8 en coût par tâche.
- Artificial Analysis : coût moyen par tâche 0,94 $ — −65,8 % vs Fable 5, −9,4 % vs GPT-5.6 Sol
- Cache hit > 90 % sur les workloads de codage (architecture Mooncake split-inference) — coût effectif d'entrée proche de 0,55 $/M
- Comparaison : DeepSeek V4 Pro à 3,48 $/M en sortie — bien moins cher, mais contexte 128K et 1,6T paramètres
5. Open weights vs open source : une nuance indispensable
Le 27 juillet, Moonshot publie les open weights — l'intégralité des poids du modèle — et non un projet open source au sens strict. La distinction compte pour les équipes juridiques, les chercheurs et la communauté r/LocalLLaMA.
| Dimension | Open weights (K3) | Open source (idéal) |
|---|---|---|
| Poids du modèle | Oui — 2,8T téléchargeables | Oui |
| Code d'entraînement | Non | Oui |
| Données d'entraînement | Non | Oui (ou documentées) |
| Licence | Modified MIT | MIT / Apache 2.0 typique |
| Usage | Inférence, fine-tuning, déploiement privé | Reproduction complète |
La licence Modified MIT sera publiée en intégralité le 27 juillet. Vérifiez les clauses de redistribution commerciale et les restrictions éventuelles avant tout déploiement en production.
6. Exigences matérielles : la vérité sur 1,4 To
Les titres promettant un déploiement « sur votre laptop » sont trompeurs. Kimi K3 appartient à la catégorie des supernœuds d'inférence — pas des modèles consumer.
| Paramètre | Valeur |
|---|---|
| Poids quantifiés 4-bit | ~1,4 To |
| Recommandation officielle | 64+ accélérateurs (ex. NVIDIA H100) — parallélisme expert + tensoriel |
| Référence K2.7 Code (1T, INT4) | ~577 Go VRAM — K3 = 2,8× cette échelle |
| Quantisation native | MXFP4 / NVFP4 — support day-0 attendu dans transformers, vLLM, SGLang |
Quand l'auto-hébergement se justifie :
- Exigence stricte de souveraineté des données (pas d'egress vers API cloud)
- Fine-tuning sur corpus propriétaire à volume élevé
- Volume d'inférence suffisant pour amortir le coût matériel
Pour la majorité des équipes, l'API à 3 $/15 $ reste la réponse correcte jusqu'à preuve du contraire.
7. Checklist du 27 juillet
À utiliser dès la publication des poids — copiez cette liste dans votre runbook de déploiement.
- Repository Hugging Face Moonshot : fichiers de poids complets (pas de shards manquants)
- Texte intégral de la licence Modified MIT — relecture juridique
- Versions quantifiées MXFP4 / NVFP4 disponibles
- Rapport technique publié (architecture, entraînement, évaluation)
- Commandes de lancement
vLLM/SGLangdocumentées (KDA, prefix caching) - Configuration matérielle minimale viable confirmée par Moonshot ou partenaires
- Reproduction indépendante du contexte 1M (pas seulement les benchmarks courts)
- Suivi communautaire Ollama / GGUF (comme pour la série K2)
8. Portée industrielle : pourquoi le 27 juillet compte
- Écart open/closed quasi clos au sommet. De « centaines de points » à « deux-trois points » sur l'Intelligence Index — la prime des modèles fermés ne se justifie plus uniquement par la capacité brute.
- Résilience réglementaire. En juin 2026, les modèles Fable/Mythos d'Anthropic ont été brièvement retirés pour les utilisateurs étrangers avant rétablissement le 1er juillet. Les poids open source, une fois publiés, ne peuvent être « éteints » par une directive export.
- Écosystème chinois convergent. GLM-5.2 (Z.ai), DeepSeek V4 Pro (1,6T), MiniMax M3 — K3 en est le sommet à 2,8T.
- Retour en force de Moonshot. Après le choc DeepSeek R1 début 2025 (7e place domestique), la lignée K2 → K2.5 → K3 reconstruit la crédibilité open weights.
Le 27 juillet offrira à la communauté sa première base téléchargeable au-delà de 2T — fondation pour agents, fine-tuning vertical et déploiements corporate sans dépendance API fermée.
9. Accès immédiat : API en attendant les poids
- kimi.com — compte gratuit, raisonnement max par défaut
- platform.kimi.ai — clé API, compatible OpenAI
- OpenRouter —
moonshotai/kimi-k3, tarifs officiels, contexte 1M
10. Questions fréquentes
Q : Quand les poids seront-ils disponibles ?
R : Le 27 juillet 2026 sur Hugging Face, avec rapport technique et support vLLM. L'API est en ligne depuis le 16 juillet.
Q : K3 est-il open source ?
R : Open weights oui, open source strict non. Licence Modified MIT ; pas de code ni de données d'entraînement.
Q : Quel est le coût API ?
R : 3 $/M entrée, 15 $/M sortie, 0,30 $/M cache hit. Coût par tâche estimé à 0,94 $ (Artificial Analysis).
Q : Puis-je l'exécuter sur mon MacBook ?
R : Non pour l'inférence complète (~1,4 To en 4-bit). Surveillez les quantifications communautaires MLX/GGUF post-release pour des variantes distillées.
Q : K3 bat-il Fable 5 ou GPT-5.6 Sol ?
R : Globalement non (57,1 vs 59,9 / 58,9). Oui sur SWE Marathon, Frontend Code Arena, BrowseComp — à ~1/3 du coût de Fable 5.
Q : Quelle licence s'applique ?
R : Modified MIT — texte complet le 27 juillet. Relisez avant déploiement commercial.
11. Conclusion : API dès aujourd'hui, tests agent sur Mac distant
Inscription kimi.com, clé API, routage OpenRouter — tout environnement convient. Pour Cursor + Kimi K3 en contexte 1M, régressions SWE Marathon ou validation quantification MLX, Apple Silicon Unified Memory + Metal demeure le chemin le moins frictionnel.
Avant le 27 juillet, isolez les workloads agent lourds sur un Mac mini M4 MACGPU distant — démarrage à la demande, accès SSH — afin de préserver la réactivité de votre machine principale pendant que la communauté prépare l'infrastructure de déploiement 1,4 To.