KIMI K3
POIDS_OUVERTS_
27_JUILLET.

Kimi K3 poids ouverts 2,8T — calendrier de sortie et benchmarks

Synthèse : Moonshot AI (月之暗面) publiera le 27 juillet 2026 les poids complets de Kimi K3 — un modèle MoE de 2,8 billions de paramètres avec une fenêtre de contexte d'1 048 576 tokens — sous licence Modified MIT sur Hugging Face. L'API est en ligne depuis le 16 juillet ; cette publication marque la distinction entre accès cloud et souveraineté technique. À cinq jours du téléchargement, voici l'essentiel : chronologie, spécifications, benchmarks, tarification, nuance open weights / open source, exigences matérielles (1,4 To), checklist du 27 juillet, portée industrielle et FAQ.

Essentiel · Lecture 30 secondes

API en ligne2026-07-16 · Kimi App, Kimi Work, Kimi Code, API kimi-k3
Poids ouverts2026-07-27 · Hugging Face · licence Modified MIT · rapport technique
Échelle2,8T paramètres · plus grand modèle open weights jamais publié
IntelligenceAA Index 57,1 (3e/189) · ~1/3 du coût de Fable 5 par tâche
Auto-hébergement~1,4 To en 4-bit · 64+ accélérateurs recommandés

1. Chronologie : deux dates, deux réalités

La confusion la plus fréquente concerne la différence entre la mise en service API et la publication des poids. Ce ne sont pas la même chose — et la distinction conditionne votre stratégie d'intégration.

DateÉvénementCe que vous pouvez faire
2026-07-16Lancement API et produits Kimi ; évaluation indépendante d'Artificial AnalysisAppeler kimi-k3 via API, kimi.com, OpenRouter — sans téléchargement local
2026-07-17Ouverture du WAIC à Shanghai ; Xinhua qualifie K3 de jalon nationalContexte industriel et annonces complémentaires possibles
2026-07-27Poids complets + rapport technique + support vLLM (KDA, prefix caching)Téléchargement HF, fine-tuning, déploiement on-premise — sous contraintes matérielles

Pour l'architecture KDA, AttnRes et Stable LatentMoE en profondeur, consultez notre guide développeur Kimi K3 du 17 juillet.

2. Spécifications essentielles

ParamètreValeur
Paramètres totaux2,8 billions (2,8T)
ArchitectureMoE sparse Stable LatentMoE — 896 experts, 16 actifs par token (1,8 %)
AttentionKimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA
Contexte1 048 576 tokens (~1M)
ModalitésTexte + image (vision native) ; vidéo côté produit ; sortie texte
Format des poidsMXFP4 (poids) + MXFP8 (activations) — entraînement natif basse précision
Efficacité d'extension~2,5× vs Kimi K2 à budget compute équivalent
Décodage long contexteKDA : jusqu'à 6,3× plus rapide à 1M tokens ; KV cache −75 %
ID APIkimi-k3
Licence (poids)Modified MIT — texte complet le 27 juillet

3. Benchmarks : où K3 excelle, où il cède

3.1 Intelligence globale (Artificial Analysis, 16 juillet)

ModèleIntelligence IndexRang
Claude Fable 559,91
GPT-5.6 Sol58,92
Kimi K357,13 / 189

L'écart avec le leader se compte en 2,8 points — plus en "frontière adjacente" qu'en "modèle de second rang". Moonshot a rarement reconnu publiquement ce retard, listant aussi les faiblesses connues (sensibilité au contenu de raisonnement renvoyé par le harness, sur-initiative en cas d'intention floue, taux d'hallucination supérieur à K2.6).

3.2 Tableau comparatif détaillé

BenchmarkKimi K3Claude Fable 5GPT-5.6 Sol
Frontend Code Arena1er (préférence devs)
SWE Marathon42,035,039,0
Program Bench77,876,877,6
Terminal Bench 2.188,384,688,8
FrontierSWE81,286,671,3
BrowseComp91,288,090,4
Automation Bench30,829,129,7
DeepSWE67,570,073,0
GDPval v2 Elo1668–168717601748
GPQA-Diamond93,592,694,1

Données croisées Moonshot + Artificial Analysis. Harness distincts (Kimi Code, Claude Code, Codex) — utiles en orientation, non définitifs.

4. Tarification API et coût réel

PostePrix ($/M tokens)
Entrée (cache miss)3,00
Entrée (cache hit, automatique)0,30
Sortie15,00

Moonshot aligne volontairement ses tarifs sur les standards occidentaux — le positionnement le plus élevé parmi les éditeurs chinois, mais nettement inférieur à Claude Opus 4.8 en coût par tâche.

  • Artificial Analysis : coût moyen par tâche 0,94 $−65,8 % vs Fable 5, −9,4 % vs GPT-5.6 Sol
  • Cache hit > 90 % sur les workloads de codage (architecture Mooncake split-inference) — coût effectif d'entrée proche de 0,55 $/M
  • Comparaison : DeepSeek V4 Pro à 3,48 $/M en sortie — bien moins cher, mais contexte 128K et 1,6T paramètres

5. Open weights vs open source : une nuance indispensable

Le 27 juillet, Moonshot publie les open weights — l'intégralité des poids du modèle — et non un projet open source au sens strict. La distinction compte pour les équipes juridiques, les chercheurs et la communauté r/LocalLLaMA.

DimensionOpen weights (K3)Open source (idéal)
Poids du modèleOui — 2,8T téléchargeablesOui
Code d'entraînementNonOui
Données d'entraînementNonOui (ou documentées)
LicenceModified MITMIT / Apache 2.0 typique
UsageInférence, fine-tuning, déploiement privéReproduction complète

La licence Modified MIT sera publiée en intégralité le 27 juillet. Vérifiez les clauses de redistribution commerciale et les restrictions éventuelles avant tout déploiement en production.

6. Exigences matérielles : la vérité sur 1,4 To

Les titres promettant un déploiement « sur votre laptop » sont trompeurs. Kimi K3 appartient à la catégorie des supernœuds d'inférence — pas des modèles consumer.

ParamètreValeur
Poids quantifiés 4-bit~1,4 To
Recommandation officielle64+ accélérateurs (ex. NVIDIA H100) — parallélisme expert + tensoriel
Référence K2.7 Code (1T, INT4)~577 Go VRAM — K3 = 2,8× cette échelle
Quantisation nativeMXFP4 / NVFP4 — support day-0 attendu dans transformers, vLLM, SGLang

Quand l'auto-hébergement se justifie :

  1. Exigence stricte de souveraineté des données (pas d'egress vers API cloud)
  2. Fine-tuning sur corpus propriétaire à volume élevé
  3. Volume d'inférence suffisant pour amortir le coût matériel

Pour la majorité des équipes, l'API à 3 $/15 $ reste la réponse correcte jusqu'à preuve du contraire.

7. Checklist du 27 juillet

À utiliser dès la publication des poids — copiez cette liste dans votre runbook de déploiement.

  • Repository Hugging Face Moonshot : fichiers de poids complets (pas de shards manquants)
  • Texte intégral de la licence Modified MIT — relecture juridique
  • Versions quantifiées MXFP4 / NVFP4 disponibles
  • Rapport technique publié (architecture, entraînement, évaluation)
  • Commandes de lancement vLLM / SGLang documentées (KDA, prefix caching)
  • Configuration matérielle minimale viable confirmée par Moonshot ou partenaires
  • Reproduction indépendante du contexte 1M (pas seulement les benchmarks courts)
  • Suivi communautaire Ollama / GGUF (comme pour la série K2)

8. Portée industrielle : pourquoi le 27 juillet compte

  1. Écart open/closed quasi clos au sommet. De « centaines de points » à « deux-trois points » sur l'Intelligence Index — la prime des modèles fermés ne se justifie plus uniquement par la capacité brute.
  2. Résilience réglementaire. En juin 2026, les modèles Fable/Mythos d'Anthropic ont été brièvement retirés pour les utilisateurs étrangers avant rétablissement le 1er juillet. Les poids open source, une fois publiés, ne peuvent être « éteints » par une directive export.
  3. Écosystème chinois convergent. GLM-5.2 (Z.ai), DeepSeek V4 Pro (1,6T), MiniMax M3 — K3 en est le sommet à 2,8T.
  4. Retour en force de Moonshot. Après le choc DeepSeek R1 début 2025 (7e place domestique), la lignée K2 → K2.5 → K3 reconstruit la crédibilité open weights.

Le 27 juillet offrira à la communauté sa première base téléchargeable au-delà de 2T — fondation pour agents, fine-tuning vertical et déploiements corporate sans dépendance API fermée.

9. Accès immédiat : API en attendant les poids

from openai import OpenAI client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", base_url="https://api.moonshot.ai/v1" ) response = client.chat.completions.create( model="kimi-k3", messages=[{"role": "user", "content": "Analysez ce dépôt et identifiez les goulots d'étranglement..."}] ) print(response.choices[0].message.content)
  • kimi.com — compte gratuit, raisonnement max par défaut
  • platform.kimi.ai — clé API, compatible OpenAI
  • OpenRoutermoonshotai/kimi-k3, tarifs officiels, contexte 1M

10. Questions fréquentes

Q : Quand les poids seront-ils disponibles ?
R : Le 27 juillet 2026 sur Hugging Face, avec rapport technique et support vLLM. L'API est en ligne depuis le 16 juillet.

Q : K3 est-il open source ?
R : Open weights oui, open source strict non. Licence Modified MIT ; pas de code ni de données d'entraînement.

Q : Quel est le coût API ?
R : 3 $/M entrée, 15 $/M sortie, 0,30 $/M cache hit. Coût par tâche estimé à 0,94 $ (Artificial Analysis).

Q : Puis-je l'exécuter sur mon MacBook ?
R : Non pour l'inférence complète (~1,4 To en 4-bit). Surveillez les quantifications communautaires MLX/GGUF post-release pour des variantes distillées.

Q : K3 bat-il Fable 5 ou GPT-5.6 Sol ?
R : Globalement non (57,1 vs 59,9 / 58,9). Oui sur SWE Marathon, Frontend Code Arena, BrowseComp — à ~1/3 du coût de Fable 5.

Q : Quelle licence s'applique ?
R : Modified MIT — texte complet le 27 juillet. Relisez avant déploiement commercial.

11. Conclusion : API dès aujourd'hui, tests agent sur Mac distant

Inscription kimi.com, clé API, routage OpenRouter — tout environnement convient. Pour Cursor + Kimi K3 en contexte 1M, régressions SWE Marathon ou validation quantification MLX, Apple Silicon Unified Memory + Metal demeure le chemin le moins frictionnel.

Avant le 27 juillet, isolez les workloads agent lourds sur un Mac mini M4 MACGPU distant — démarrage à la demande, accès SSH — afin de préserver la réactivité de votre machine principale pendant que la communauté prépare l'infrastructure de déploiement 1,4 To.