Kimi K3 est-il open source ou seulement open weight ?
Réponse courte : non, pas au sens strict — et Moonshot AI ne le prétend pas. Le 27 juillet 2026, Moonshot a publié les poids complets et le rapport technique de Kimi K3, un modèle Mixture-of-Experts de 2,8 billions de paramètres avec compréhension visuelle native. Le téléchargement de 1,56 To a atteint la 1re place des tendances Hugging Face en trente minutes — K3 est le plus grand modèle open weight jamais publié en intégralité.
| Date | Jalon | Détail clé |
|---|---|---|
| 16 juillet | Lancement API | Kimi App / Work / Code / API en ligne ; poids pas encore publics |
| 17 juillet | WAIC 2026 | Les médias d'État le présentent comme le plus grand modèle ouvert par nombre de paramètres |
| 22–23 juillet | Litige de distillation | Le conseiller Kratsios accuse Moonshot de distillation industrielle contre le modèle Fable d'Anthropic |
| 27 juillet | Poids complets | Poids intégraux + rapport technique + MoonEP / AgentEnv (FlashKDA déjà ouvert) |
| 28 juillet | Réponse MOFCOM | Le ministère chinois du Commerce accuse Washington d'« hégémonisme IA » |
Confondre open weight et open source : Moonshot n'utilise jamais « open source » — données d'entraînement et code complet non publics.
Sous-estimer les seuils de licence : K3 ajoute un seuil MaaS de 20 M$ et une attribution 100 M MAU absents de la famille K2.
Penser qu'un PC grand public suffit : 2,8T paramètres, 896 experts — Moonshot recommande des supernœuds 64+ accélérateurs.
Privilégier les paramètres au coût : K3 est le plafond open weight, mais ~0,95 $/tâche vs ~0,47 $ pour GLM-5.2.
Ignorer la conformité géopolitique : Le litige US-Chine sur la distillation, combiné au timing WAIC 2026, ajoute un risque supply-chain pour les acheteurs entreprise.
Spécifications et architecture Kimi K3 : KDA, AttnRes et Per-Head Muon
| Spécification | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions |
| Paramètres actifs | ~104 milliards |
| Config experts | 896 experts routés, 16 activés par token (~1,8 % sparsité) |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Fenêtre de contexte | 1 000 000 tokens |
| Multimodalité | Vision native (ViT-V2, 27 couches) |
| Format des poids | Poids MXFP4, activations MXFP8 (quantization-aware dès SFT) |
| Taille du téléchargement | ~1,56 To (Hugging Face) |
| Licence | Custom — Moonshot dit « open weight », pas « open source » |
Kimi Delta Attention (KDA) remplace une porte d'oubli scalaire unique par un gating canal par canal : chaque dimension de feature a son propre taux de décroissance, implémenté en chunkwise DPLR pour une récurrence en temps linéaire. K3 alterne KDA et couches Gated MLA — le design hybride derrière la fenêtre 1M et l'empreinte KV cache minimale.
Attention Residuals (AttnRes) remplacent l'accumulation résiduelle uniforme par une agrégation sélective dépendante de l'entrée sur toutes les couches précédentes — ~25 % d'efficacité d'entraînement en plus pour moins de 2 % de paramètres.
Per-Head Muon optimise chaque tête d'attention indépendamment. Stable LatentMoE utilise Quantile Balancing avec la preuve mathématique de MoonEP sur les bornes supérieures d'experts redondants par rang de calcul.
| Composant | Problème résolu | Gain clé |
|---|---|---|
| KDA | Explosion du KV cache sur longues séquences | Récurrence linéaire, VRAM minimale |
| AttnRes | Dilution du signal des couches précoces en profondeur | ~25 % d'efficacité d'entraînement |
| Per-Head Muon | Optimiseur uniforme sur les têtes | Résultats frontier avec moins de paramètres actifs |
| Stable LatentMoE | Déséquilibre de charge des experts à grande échelle | 896 routés, 16 actifs — 1,8 % sparsité |
Trois releases d'infrastructure et benchmarks vs GPT-5.6, Claude, GLM-5.2
| Technologie | Rôle | Chiffres clés |
|---|---|---|
| MoonEP | Communication MoE à très grande échelle | Duplique les experts surchargés ; prouve la borne supérieure d'experts redondants par rang |
| FlashKDA | Kernel CUTLASS KDA | Prefill 1,72×–2,22× plus rapide sur H20 vs baseline flash-linear-attention |
| AgentEnv | Sandbox agent Firecracker microVM | Checkpoint ~133 ms, reprise ~49 ms, surcommit mémoire jusqu'à 6,5× |
SWE-bench Verified (évaluation indépendante, Vals AI, juillet 2026) :
| Modèle | Score | Date de sortie |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| GLM-5.2 (max) | 51 (AA Index) | Leader open weight précédent |
Sur l'Artificial Analysis Intelligence Index (max reasoning), Kimi K3 obtient ~57 — 3e au global, 1er parmi les modèles open weight. C'est le plafond de capacité du tier open weight, mais à environ 0,95 $/tâche il coûte plus que GLM-5.2 (~0,47 $). K3 mène actuellement le classement Arena.ai Frontend Code Arena.
Seuils commerciaux de licence et checklist de déploiement en six étapes
Moonshot appelle systématiquement cela une release « open weight », jamais « open source ». La licence est un document entièrement custom avec deux seuils commerciaux absents de la famille K2 :
| Seuil | Déclencheur | Exigence |
|---|---|---|
| Seuil revenus MaaS | Revenus Model-as-a-Service dépassant 20 M$ sur 12 mois glissants | Accord commercial séparé avec Moonshot AI |
| Seuil attribution | 100 M+ utilisateurs actifs mensuels ou 20 M$+ de revenus mensuels | Afficher « Kimi K3 » de façon visible dans l'UI produit |
| Type de token | Prix par million de tokens |
|---|---|
| Entrée (cache hit) | 0,30 $ |
| Entrée (cache miss) | 3,00 $ |
| Sortie (trace de raisonnement incluse) | 15,00 $ |
L'architecture de serving disaggregée Mooncake de Moonshot maintient des taux de cache hit au-dessus de 90 % sur les workloads de code typiques — la plupart des usages réels se rapprochent du tarif 0,30 $.
Enregistrer l'accès API : Créer une clé sur platform.kimi.ai, base_url à https://api.moonshot.ai/v1, ID modèle kimi-k3.
Relire la LICENSE : Avant de télécharger les poids Hugging Face, le juridique doit confirmer si les seuils MaaS ou MAU s'appliquent.
Intégration compatible OpenAI SDK : La plupart des projets n'ont besoin que d'un changement de base URL et de clé API.
Optimisation des préfixes cache : Réutiliser les system prompts et préfixes de définition d'outils — les agents code atteignent 90 %+ de cache, coût d'entrée effectif à 0,30 $/M.
Vérification matériel self-host : Confirmer la capacité supernœud 64+ accélérateurs ; pour la plupart des équipes, OpenRouter ou hôtes similaires (7 fournisseurs déjà live) est la voie pratique.
Choisir une stack d'inférence : Déployer via vLLM (KDA + prefix caching) ou SGLang ; FlashKDA remplace directement le backend chunk_kda.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analyse la complexité de ce code..."}]
)Contexte du différend IA US-Chine et trois chiffres clés
La release open weight de Kimi K3 est tombée pendant le WAIC 2026 et quelques jours après l'escalade du différend US-Chine sur la « distillation de modèles » : le conseiller scientifique Michael Kratsios a accusé Moonshot d'une campagne de distillation à grande échelle contre le modèle Fable d'Anthropic, le secrétaire au Trésor Scott Bessent évoquant des sanctions. Le ministère chinois du Commerce a répliqué le 28 juillet en accusant Washington d'« hégémonisme IA ». Trois jours après K3, Alibaba a dévoilé Qwen3.8-Max-Preview — largement lu comme une réponse directe, poussant la course open weight dans le « club 3T ».
2,8T / #1 open weight : Le plus grand modèle open weight jamais publié en intégralité — 1,56 To sur Hugging Face, #1 trending en 30 minutes.
93,4 % / #3 mondial : Score SWE-bench Verified indépendant 93,4 % ; AA Index ~57 — troisième global, premier open weight.
11 jours / trois infra : Du lancement API à la release complète des poids en 11 jours, avec MoonEP, FlashKDA et AgentEnv ouverts en parallèle.
Les alternatives pratiques ont des coûts cachés : faire tourner des agents Kimi Code sur un Mac personnel échoue au sleep et aux coupures réseau ; self-hoster K3 complet exige 64+ accélérateurs que la plupart des équipes ne peuvent pas provisionner ; s'appuyer sur une seule API fermée sacrifie l'avantage tarifaire flat 1M tokens de K3. Pour des pipelines iOS CI/CD en production et une automatisation d'agents IA 24/7, la location cloud Mac Mini dédiée KVMNODE est généralement le meilleur choix : Apple Silicon natif, accès sudo complet, facturation flexible jour/semaine/mois. Voir la page tarifs, le centre d'aide ou commander directement.
Données au 28 juillet 2026 · Sources : blog officiel Moonshot AI, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index