Kimi K3 open weights : ce qui sort le 27 juillet et la chronologie complète
Moonshot AI a lancé Kimi K3 le 16 juillet 2026 — API, Kimi App, Kimi Work et Kimi Code en ligne du jour au lendemain avec l'ID modèle kimi-k3. Les poids suivent 11 jours plus tard : le 27 juillet apportent le checkpoint 2,8T complet, le rapport technique, la licence Modified MIT et les builds vLLM/SGLang Day-0 attendus sur Hugging Face.
Cette séparation — API d'abord, poids ensuite — est volontaire. Moonshot a validé inférence production, tarification et économie du cache avant d'ouvrir le plus grand modèle téléchargeable de l'histoire. Pour la plupart des équipes, l'API reste la voie correcte en juillet et au-delà ; le self-hosting cible la résidence des données, le fine-tuning ou les volumes extrêmes.
| Date | Jalon |
|---|---|
| 16 juillet 2026 | API K3 live (Kimi App / Work / Code / platform.kimi.ai) ; évaluation Artificial Analysis ; plus grand modèle open-weights-class appelable à 2,8T |
| 17 juillet 2026 | Ouverture WAIC 2026 à Shanghai ; Xinhua et médias d'État présentent K3 comme jalon national IA ; récit ARR Moonshot >300 M$ gagne en traction |
| 27 juillet 2026 | Poids complets + rapport technique sur Hugging Face sous Modified MIT ; builds quant MXFP4/NVFP4 ; vLLM KDA + prefix caching ; suivi Ollama/GGUF attendu sous quelques jours |
Le jour J, vous obtenez : poids modèle complets (pas une variante distillée), configs d'inférence vLLM et SGLang, artefacts MXFP4/NVFP4 quantization-aware et un rapport technique documentant KDA, AttnRes et Stable LatentMoE. Ce que vous n'obtenez pas : données d'entraînement, codebase d'entraînement complète ou licence MIT standard non modifiée.
Record d'échelle : 2,8T fait de K3 la plus grande release open weights — ~75 % au-dessus de DeepSeek V4 Pro (1,6T), premier checkpoint au-delà de 2T paramètres.
Niveau intelligence : AA Index 57,1, rang 3/189 — near-frontier, pas #1. Écart avec Fable 5 : 2,8 points, pas 28.
Niveau coût : Tâche AA unique à 0,94 $ — 9,4 % sous Sol, 65,8 % sous Fable 5. Open weights plus contexte 1M flat pricing est la proposition de valeur.
Erreurs fréquentes : Traiter le 27 juillet comme un « ChatGPT local gratuit » ; ignorer clauses commerciales Modified MIT ; supposer viabilité GPU consumer ; attendre de battre Fable 5 sur chaque benchmark code.
Open weights vs open source : Modified MIT et specs d'architecture complètes
Open weights signifie télécharger, inspecter, fine-tuner et déployer les paramètres entraînés. Open source signifie traditionnellement code complet, données et liberté de licence pour reproduire l'entraînement from scratch. Kimi K3 est clairement dans le premier camp : Moonshot livre poids et rapport technique sous Modified MIT, pas une stack open source reproductible.
Impact pratique : chercheurs et entreprises peuvent fine-tuner K3, exécuter une inférence privée et auditer le comportement des poids. Ils ne peuvent pas réentraîner K3 depuis les seuls artefacts publics ni invoquer une licence MIT standard sans lire les modifications Moonshot — surtout sur redistribution commerciale. L'industrie utilise de plus en plus « open weights » car les labs frontier n'ouvrent rarement tout.
| Spec | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Architecture | Stable LatentMoE — 896 experts, 16 actifs (sparsité 1,8 %) |
| Stack attention | Kimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA |
| Fenêtre de contexte | 1 048 576 tokens (1M) |
| Modalités d'entrée | Texte, image, vidéo |
| Précision entraînement | Poids MXFP4, activations MXFP8 (design quantization-aware) |
| Scaling vs K2 | ~2,5× efficacité de scaling |
| KDA decode à 1M | Jusqu'à 6,3× plus rapide vs full attention ; 75 % moins de mémoire KV-cache |
| Techniques MoE | Quantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU) |
| Licence release | Modified MIT (Hugging Face, 27 juillet) |
Pourquoi l'architecture compte pour le self-hosting
Le ratio 3:1 linear-to-full attention de KDA rend l'inférence million-token discutable — sans lui, la mémoire KV-cache à 1M tokens serait prohibitive. AttnRes ajoute une récupération sélective en profondeur (~25 % gain d'efficacité d'entraînement). Stable LatentMoE avec Quantile Balancing supprime les heuristiques de routage d'experts fragiles à l'échelle 896 experts.
Modified MIT open weights permet d'exécuter et fine-tuner le modèle ; il ne permet pas de cloner la run d'entraînement Moonshot. Pour la plupart des équipes production, cette distinction est un atout — pas un défaut.
Les artefacts quantifiés release (MXFP4/NVFP4) visent un déploiement vLLM et SGLang Day-0. Moonshot a entraîné quantization-aware pour que l'inférence INT4/FP4 ne dégrade pas la qualité comme une quantisation post-hoc sur d'autres modèles frontier.
Benchmarks vs Claude Fable 5 et GPT-5.6 : gains, pertes et écarts honnêtes
K3 est compétitif — pas dominant. Le blog Moonshot reconnaît des faiblesses vs K2.6 sur le taux d'hallucination et vs Fable 5/Sol sur polish et variance de sortie. Ci-dessous : scores agrégés Artificial Analysis plus benchmarks auto-déclarés Moonshot (harness différents par éditeur).
| Modèle | AA Intelligence Index v4.1 | Rang AA (sur 189) | Coût tâche unique (AA) |
|---|---|---|---|
| Claude Fable 5 | 59,9 | 1 | ~2,75 $ |
| GPT-5.6 Sol | 58,9 | 2 | ~1,04 $ |
| Kimi K3 | 57,1 | 3 | 0,94 $ |
Où K3 gagne :
Frontend Code Arena #1 — génération UI/frontend devant rivaux fermés.
Automation Bench (30,8), SpreadsheetBench 2, BrowseComp (91,2) — usage d'outils agentique et recherche web.
SWE Marathon (42,0, #1) — sessions de code multi-heures.
Terminal Bench 2.1 (88,3), Program Bench (77,8), FrontierSWE (81,2) — solide mais pas toujours #1.
OmniDocBench (91,1, #1) — compréhension documentaire multimodale avec synergie contexte 1M.
Où K3 perd :
GDPval v2 Elo : K3 à 1668–1687 vs Fable 5 (1760) et Sol (1748) — écart de polish en raisonnement général.
DeepSWE : K3 67,5 vs Sol 73,0 — debug repo profond favorise GPT-5.6.
FrontierSWE : Fable 5 mène à 86,6 ; K3 à 81,2 solide mais pas proche.
Hallucinations vs K2.6 : Moonshot admet une régression sur fiabilité factuelle dans certains domaines.
Polish / variance de sortie : Fable 5 et Sol produisent une prose plus cohérente et moins d'erreurs de format sur tâches ouvertes.
Attention : Benchmarks tâches auto-déclarés avec harness non unifiés (K3 Kimi Code, GPT Codex, Claude Claude Code). Référence directionnelle — validez sur vos jeux d'évaluation avant routage production.
L'écart intelligence open/closed s'est réduit à environ 2–3 points AA Index au tier frontier. Le pitch K3 n'est pas « nous battons Claude » — c'est « nous sommes à portée de frappe à un tiers du prix, avec poids téléchargeables et contexte 1M ».
Tarifs API et six étapes pour exécuter Kimi K3 (incl. checklist release day)
| Modèle | Entrée ($/M) | Entrée cache ($/M) | Sortie ($/M) | Contexte |
|---|---|---|---|---|
| Kimi K3 | 3,00 $ | 0,30 $ | 15,00 $ | 1M |
| Claude Sonnet 5 | 3,00 $ | — | 15,00 $ | 200K |
| Claude Fable 5 | ~15,00 $ | — | ~50,00 $ | 1M |
| GPT-5.6 Sol | ~5,00 $ | — | ~15,00 $ | 400K |
| DeepSeek V4 Pro | 1,74 $ | 0,145 $ | 3,48 $ | 128K |
Le tarif standard K3 s'aligne sur les modèles quality-tier occidentaux (3 $/15 $) mais offre une fenêtre de contexte 5× plus large que les API classe Sonnet sans surcoût longueur. Entrée cache à 0,30 $/M (un dixième du standard) plus taux de cache >90 % en workflows code rend le coût effectif d'entrée très bas. Tarif tâche unique AA à 0,94 $, soit 9,4 % sous Sol et 65,8 % sous Fable 5 — l'argument coût near-frontier en un chiffre.
Six étapes opérationnelles :
Démarrer sur l'API aujourd'hui : Inscription sur kimi.com (gratuit, raisonnement max) ou clé sur platform.kimi.ai. base_url = https://api.moonshot.ai/v1, modèle kimi-k3.
Optimiser le cache : Réutiliser system prompts et préfixes de définitions d'outils dans les workflows agent. Inférence disaggregée Mooncake vise 90 %+ hits — entrée effective peut descendre vers ~0,55 $/M (validation pondérée OpenRouter 7 jours).
Router via OpenRouter : ID modèle moonshotai/kimi-k3 — tarifs officiels, sans markup, contexte 1M complet.
Self-host vs API : L'API convient à la plupart des équipes. Self-host uniquement pour résidence des données, fine-tuning custom ou volume soutenu battant 3 $/15 $ à votre échelle.
Checklist release day 27 juillet : (a) Confirmer repo Hugging Face et manifeste fichiers ; (b) lire LICENSE Modified MIT ; (c) choisir variante quant (MXFP4 vs NVFP4) ; (d) extraire commandes launch vLLM/SGLang de la model card ; (e) vérifier hardware minimum (64+ accélérateurs, ~1,4 To en 4 bits) ; (f) retester workloads long contexte — comportement KDA peut différer de l'API.
Routage multi-modèles : Longues sessions code → K3 ; bugs repo complexes → Fable 5 ; agents terminal-heavy → GPT-5.6 Sol. Ne pas tout miser sur un modèle.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysez cette codebase pour des failles de sécurité..."}]
)Réalité self-hosting, contexte sectoriel et ce que change le 27 juillet
Calcul self-deploy : poids K3 quantifiés 4 bits autour de ~1,4 To. Inférence production requiert un supernœud 64+ accélérateurs — pas un MacBook, pas une RTX 4090 seule. Référence : Kimi K2.7 Code INT4 près de ~577 Go ; K3 à 2,8T est une classe d'infrastructure différente.
Trois scénarios où le self-hosting a du sens : (1) Résidence des données — workloads ne pouvant quitter votre VPC ; (2) Fine-tuning — adaptateurs domaine sur open weights ; (3) Volume élevé — débit token soutenu où capex bat opex. Tous les autres devraient utiliser l'API jusqu'au 27 juillet et probablement après.
| Scénario | Voie recommandée | Pourquoi |
|---|---|---|
| La plupart des développeurs (maintenant) | API Kimi K3 | Pas de capex matériel ; contexte 1M ; tier 0,94 $/tâche |
| Résidence données / fine-tuning | Self-host post 27.7. | Poids Modified MIT ; inférence VPC privée |
| Bugs niveau repo complexe | API Claude Fable 5 | FrontierSWE et GDPval v2 en tête |
| Agents terminal-heavy | API GPT-5.6 Sol | Avantage DeepSWE et Terminal Bench |
| Inférence bulk sensible au coût | DeepSeek V4 Pro | Sortie 3,48 $/M, licence MIT |
Contexte sectoriel : L'écart open/closed au frontier est désormais de 2–3 points AA, pas 20. La géopolitique façonne le récit — K3 lancé à la veille de la WAIC 2026, tandis que Claude Fable 5 d'Anthropic a subi une brève suspension export-control US le 1er juillet (depuis rétablie) poussant les développeurs étrangers vers des alternatives. La vague open weights chinoise — GLM-5.2, DeepSeek V4 Pro, MiniMax, désormais Kimi K3 — n'est plus des « copies bon marché » mais une poussée coordonnée au tier frontier.
La trajectoire Moonshot compte : après DeepSeek R1, Kimi est tombé brièvement au rang 7 sur certains leaderboards. La séquence K2 → K2.5 → K3 est un retour délibéré — chaque génération ajoutant contexte, échelle MoE, et désormais la plus grande release open weights de l'histoire. Revenus API >70 % du total ; utilisateurs payants overseas +400 %. Ce n'est pas de l'open weights caritatif ; c'est une plateforme commerciale avec un moat téléchargeable.
57,1 / 3/189 : AA Intelligence Index rang 3 sur 189 modèles — near-frontier, 2,8 points derrière Fable 5.
0,94 $ / 65,8 % : Coût tâche AA unique 0,94 $ — 65,8 % sous Fable 5, 9,4 % sous Sol.
2,8T / 27 juillet : Plus grande release open weights ; premier checkpoint au-delà de 2T sous Modified MIT.
Synthèse : Le 27 juillet est un jalon pour open weights — non parce que K3 bat chaque modèle fermé, mais parce qu'il met 2,8T paramètres near-frontier en forme téléchargeable à des tarifs API sous Claude et GPT en coût par tâche. Validez sur vos workloads, lisez la licence Modified MIT et planifiez le matériel honnêtement avant self-hosting.
Alternatives : agents Kimi Code sur Mac personnel subissent veille et coupures réseau sur jobs long contexte ; attendre self-hosting 27.7. exige un supernœud 64+ cartes que la plupart des équipes n'ont pas ; une seule API fermée rate l'avantage 1M flat pricing de K3. Pour CI/CD iOS, Kimi Code persistant et production agent IA 24/7, location Mac Mini M4 dédié KVMNODE est souvent le meilleur hôte : mémoire unifiée Apple Silicon, sudo ouvert, durées flexibles jour/semaine/mois. Voir tarifs, centre d'aide ou commander.
Données au 22 juillet 2026 · Benchmarks incluant auto-déclaration Moonshot AI · Sources : kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News