Si vous évaluez Kimi K3 pour la production, la première question n'est pas le nombre de paramètres — c'est de savoir si la release de Moonshot AI est vraiment open source. Le soir du 27 juillet 2026, le labo chinois a publié les poids complets d'un modèle MoE de 2,8 billions de paramètres avec une fenêtre de contexte d'1 million de tokens, plus trois releases d'infrastructure : MoonEP, FlashKDA et AgentEnv. Cet article couvre la timeline de 11 jours, l'architecture KDA / AttnRes / Per-Head Muon, les benchmarks SWE-bench et AA Index, deux seuils commerciaux de licence et une checklist de déploiement en six étapes. Contexte : aperçu K3 open weight, controverse de distillation.
01

Kimi K3 est-il open source ou seulement open weight ?

Réponse courte : non, pas au sens strict — et Moonshot AI ne le prétend pas. Le 27 juillet 2026, Moonshot a publié les poids complets et le rapport technique de Kimi K3, un modèle Mixture-of-Experts de 2,8 billions de paramètres avec compréhension visuelle native. Le téléchargement de 1,56 To a atteint la 1re place des tendances Hugging Face en trente minutes — K3 est le plus grand modèle open weight jamais publié en intégralité.

DateJalonDétail clé
16 juilletLancement APIKimi App / Work / Code / API en ligne ; poids pas encore publics
17 juilletWAIC 2026Les médias d'État le présentent comme le plus grand modèle ouvert par nombre de paramètres
22–23 juilletLitige de distillationLe conseiller Kratsios accuse Moonshot de distillation industrielle contre le modèle Fable d'Anthropic
27 juilletPoids completsPoids intégraux + rapport technique + MoonEP / AgentEnv (FlashKDA déjà ouvert)
28 juilletRéponse MOFCOMLe ministère chinois du Commerce accuse Washington d'« hégémonisme IA »
01

Confondre open weight et open source : Moonshot n'utilise jamais « open source » — données d'entraînement et code complet non publics.

02

Sous-estimer les seuils de licence : K3 ajoute un seuil MaaS de 20 M$ et une attribution 100 M MAU absents de la famille K2.

03

Penser qu'un PC grand public suffit : 2,8T paramètres, 896 experts — Moonshot recommande des supernœuds 64+ accélérateurs.

04

Privilégier les paramètres au coût : K3 est le plafond open weight, mais ~0,95 $/tâche vs ~0,47 $ pour GLM-5.2.

05

Ignorer la conformité géopolitique : Le litige US-Chine sur la distillation, combiné au timing WAIC 2026, ajoute un risque supply-chain pour les acheteurs entreprise.

02

Spécifications et architecture Kimi K3 : KDA, AttnRes et Per-Head Muon

SpécificationValeur
Paramètres totaux2,8 billions
Paramètres actifs~104 milliards
Config experts896 experts routés, 16 activés par token (~1,8 % sparsité)
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Fenêtre de contexte1 000 000 tokens
MultimodalitéVision native (ViT-V2, 27 couches)
Format des poidsPoids MXFP4, activations MXFP8 (quantization-aware dès SFT)
Taille du téléchargement~1,56 To (Hugging Face)
LicenceCustom — Moonshot dit « open weight », pas « open source »

Kimi Delta Attention (KDA) remplace une porte d'oubli scalaire unique par un gating canal par canal : chaque dimension de feature a son propre taux de décroissance, implémenté en chunkwise DPLR pour une récurrence en temps linéaire. K3 alterne KDA et couches Gated MLA — le design hybride derrière la fenêtre 1M et l'empreinte KV cache minimale.

Attention Residuals (AttnRes) remplacent l'accumulation résiduelle uniforme par une agrégation sélective dépendante de l'entrée sur toutes les couches précédentes — ~25 % d'efficacité d'entraînement en plus pour moins de 2 % de paramètres.

Per-Head Muon optimise chaque tête d'attention indépendamment. Stable LatentMoE utilise Quantile Balancing avec la preuve mathématique de MoonEP sur les bornes supérieures d'experts redondants par rang de calcul.

ComposantProblème résoluGain clé
KDAExplosion du KV cache sur longues séquencesRécurrence linéaire, VRAM minimale
AttnResDilution du signal des couches précoces en profondeur~25 % d'efficacité d'entraînement
Per-Head MuonOptimiseur uniforme sur les têtesRésultats frontier avec moins de paramètres actifs
Stable LatentMoEDéséquilibre de charge des experts à grande échelle896 routés, 16 actifs — 1,8 % sparsité
03

Trois releases d'infrastructure et benchmarks vs GPT-5.6, Claude, GLM-5.2

TechnologieRôleChiffres clés
MoonEPCommunication MoE à très grande échelleDuplique les experts surchargés ; prouve la borne supérieure d'experts redondants par rang
FlashKDAKernel CUTLASS KDAPrefill 1,72×–2,22× plus rapide sur H20 vs baseline flash-linear-attention
AgentEnvSandbox agent Firecracker microVMCheckpoint ~133 ms, reprise ~49 ms, surcommit mémoire jusqu'à 6,5×

SWE-bench Verified (évaluation indépendante, Vals AI, juillet 2026) :

ModèleScoreDate de sortie
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
GLM-5.2 (max)51 (AA Index)Leader open weight précédent

Sur l'Artificial Analysis Intelligence Index (max reasoning), Kimi K3 obtient ~57 — 3e au global, 1er parmi les modèles open weight. C'est le plafond de capacité du tier open weight, mais à environ 0,95 $/tâche il coûte plus que GLM-5.2 (~0,47 $). K3 mène actuellement le classement Arena.ai Frontend Code Arena.

04

Seuils commerciaux de licence et checklist de déploiement en six étapes

Moonshot appelle systématiquement cela une release « open weight », jamais « open source ». La licence est un document entièrement custom avec deux seuils commerciaux absents de la famille K2 :

SeuilDéclencheurExigence
Seuil revenus MaaSRevenus Model-as-a-Service dépassant 20 M$ sur 12 mois glissantsAccord commercial séparé avec Moonshot AI
Seuil attribution100 M+ utilisateurs actifs mensuels ou 20 M$+ de revenus mensuelsAfficher « Kimi K3 » de façon visible dans l'UI produit
Type de tokenPrix par million de tokens
Entrée (cache hit)0,30 $
Entrée (cache miss)3,00 $
Sortie (trace de raisonnement incluse)15,00 $

L'architecture de serving disaggregée Mooncake de Moonshot maintient des taux de cache hit au-dessus de 90 % sur les workloads de code typiques — la plupart des usages réels se rapprochent du tarif 0,30 $.

01

Enregistrer l'accès API : Créer une clé sur platform.kimi.ai, base_url à https://api.moonshot.ai/v1, ID modèle kimi-k3.

02

Relire la LICENSE : Avant de télécharger les poids Hugging Face, le juridique doit confirmer si les seuils MaaS ou MAU s'appliquent.

03

Intégration compatible OpenAI SDK : La plupart des projets n'ont besoin que d'un changement de base URL et de clé API.

04

Optimisation des préfixes cache : Réutiliser les system prompts et préfixes de définition d'outils — les agents code atteignent 90 %+ de cache, coût d'entrée effectif à 0,30 $/M.

05

Vérification matériel self-host : Confirmer la capacité supernœud 64+ accélérateurs ; pour la plupart des équipes, OpenRouter ou hôtes similaires (7 fournisseurs déjà live) est la voie pratique.

06

Choisir une stack d'inférence : Déployer via vLLM (KDA + prefix caching) ou SGLang ; FlashKDA remplace directement le backend chunk_kda.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse la complexité de ce code..."}]
)
05

Contexte du différend IA US-Chine et trois chiffres clés

La release open weight de Kimi K3 est tombée pendant le WAIC 2026 et quelques jours après l'escalade du différend US-Chine sur la « distillation de modèles » : le conseiller scientifique Michael Kratsios a accusé Moonshot d'une campagne de distillation à grande échelle contre le modèle Fable d'Anthropic, le secrétaire au Trésor Scott Bessent évoquant des sanctions. Le ministère chinois du Commerce a répliqué le 28 juillet en accusant Washington d'« hégémonisme IA ». Trois jours après K3, Alibaba a dévoilé Qwen3.8-Max-Preview — largement lu comme une réponse directe, poussant la course open weight dans le « club 3T ».

A

2,8T / #1 open weight : Le plus grand modèle open weight jamais publié en intégralité — 1,56 To sur Hugging Face, #1 trending en 30 minutes.

B

93,4 % / #3 mondial : Score SWE-bench Verified indépendant 93,4 % ; AA Index ~57 — troisième global, premier open weight.

C

11 jours / trois infra : Du lancement API à la release complète des poids en 11 jours, avec MoonEP, FlashKDA et AgentEnv ouverts en parallèle.

Les alternatives pratiques ont des coûts cachés : faire tourner des agents Kimi Code sur un Mac personnel échoue au sleep et aux coupures réseau ; self-hoster K3 complet exige 64+ accélérateurs que la plupart des équipes ne peuvent pas provisionner ; s'appuyer sur une seule API fermée sacrifie l'avantage tarifaire flat 1M tokens de K3. Pour des pipelines iOS CI/CD en production et une automatisation d'agents IA 24/7, la location cloud Mac Mini dédiée KVMNODE est généralement le meilleur choix : Apple Silicon natif, accès sudo complet, facturation flexible jour/semaine/mois. Voir la page tarifs, le centre d'aide ou commander directement.

Données au 28 juillet 2026 · Sources : blog officiel Moonshot AI, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index