En bref : Moonshot AI publie ses poids Kimi K3 complets à 2,8 billions de paramètres le 27 juillet 2026 sous Modified MIT sur Hugging Face — la plus grande release open weights à ce jour, avec rapport technique et support vLLM Day-0. K3 n'est pas un tueur de Claude Fable 5 : Artificial Analysis le classe à 57,1 (3e sur 189), derrière Fable 5 (59,9) et GPT-5.6 Sol (58,9). Ce qu'il est : intelligence near-frontier à environ un tiers du coût des modèles fermés, plus une fenêtre de 1 M tokens qu'aucune API fermée ne propose en tarif flat. Ce guide couvre la chronologie 16 → 27 juillet, open weights vs open source, specs d'architecture complètes, benchmarks gagnants et limites honnêtes, tarifs API (3 $ / 0,30 $ cache / 15 $), réalité matérielle self-host, six étapes opérationnelles incluant checklist release day et contexte sectoriel. Pour l'architecture : test Kimi K3 ; voir aussi guide GPT-5.6 Sol et alternatives Claude Fable 5.
01

Kimi K3 open weights : ce qui sort le 27 juillet et la chronologie complète

Moonshot AI a lancé Kimi K3 le 16 juillet 2026 — API, Kimi App, Kimi Work et Kimi Code en ligne du jour au lendemain avec l'ID modèle kimi-k3. Les poids suivent 11 jours plus tard : le 27 juillet apportent le checkpoint 2,8T complet, le rapport technique, la licence Modified MIT et les builds vLLM/SGLang Day-0 attendus sur Hugging Face.

Cette séparation — API d'abord, poids ensuite — est volontaire. Moonshot a validé inférence production, tarification et économie du cache avant d'ouvrir le plus grand modèle téléchargeable de l'histoire. Pour la plupart des équipes, l'API reste la voie correcte en juillet et au-delà ; le self-hosting cible la résidence des données, le fine-tuning ou les volumes extrêmes.

DateJalon
16 juillet 2026API K3 live (Kimi App / Work / Code / platform.kimi.ai) ; évaluation Artificial Analysis ; plus grand modèle open-weights-class appelable à 2,8T
17 juillet 2026Ouverture WAIC 2026 à Shanghai ; Xinhua et médias d'État présentent K3 comme jalon national IA ; récit ARR Moonshot >300 M$ gagne en traction
27 juillet 2026Poids complets + rapport technique sur Hugging Face sous Modified MIT ; builds quant MXFP4/NVFP4 ; vLLM KDA + prefix caching ; suivi Ollama/GGUF attendu sous quelques jours

Le jour J, vous obtenez : poids modèle complets (pas une variante distillée), configs d'inférence vLLM et SGLang, artefacts MXFP4/NVFP4 quantization-aware et un rapport technique documentant KDA, AttnRes et Stable LatentMoE. Ce que vous n'obtenez pas : données d'entraînement, codebase d'entraînement complète ou licence MIT standard non modifiée.

01

Record d'échelle : 2,8T fait de K3 la plus grande release open weights — ~75 % au-dessus de DeepSeek V4 Pro (1,6T), premier checkpoint au-delà de 2T paramètres.

02

Niveau intelligence : AA Index 57,1, rang 3/189 — near-frontier, pas #1. Écart avec Fable 5 : 2,8 points, pas 28.

03

Niveau coût : Tâche AA unique à 0,94 $9,4 % sous Sol, 65,8 % sous Fable 5. Open weights plus contexte 1M flat pricing est la proposition de valeur.

04

Erreurs fréquentes : Traiter le 27 juillet comme un « ChatGPT local gratuit » ; ignorer clauses commerciales Modified MIT ; supposer viabilité GPU consumer ; attendre de battre Fable 5 sur chaque benchmark code.

02

Open weights vs open source : Modified MIT et specs d'architecture complètes

Open weights signifie télécharger, inspecter, fine-tuner et déployer les paramètres entraînés. Open source signifie traditionnellement code complet, données et liberté de licence pour reproduire l'entraînement from scratch. Kimi K3 est clairement dans le premier camp : Moonshot livre poids et rapport technique sous Modified MIT, pas une stack open source reproductible.

Impact pratique : chercheurs et entreprises peuvent fine-tuner K3, exécuter une inférence privée et auditer le comportement des poids. Ils ne peuvent pas réentraîner K3 depuis les seuls artefacts publics ni invoquer une licence MIT standard sans lire les modifications Moonshot — surtout sur redistribution commerciale. L'industrie utilise de plus en plus « open weights » car les labs frontier n'ouvrent rarement tout.

SpecValeur
Paramètres totaux2,8 billions (2,8T)
ArchitectureStable LatentMoE — 896 experts, 16 actifs (sparsité 1,8 %)
Stack attentionKimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA
Fenêtre de contexte1 048 576 tokens (1M)
Modalités d'entréeTexte, image, vidéo
Précision entraînementPoids MXFP4, activations MXFP8 (design quantization-aware)
Scaling vs K2~2,5× efficacité de scaling
KDA decode à 1MJusqu'à 6,3× plus rapide vs full attention ; 75 % moins de mémoire KV-cache
Techniques MoEQuantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU)
Licence releaseModified MIT (Hugging Face, 27 juillet)

Pourquoi l'architecture compte pour le self-hosting

Le ratio 3:1 linear-to-full attention de KDA rend l'inférence million-token discutable — sans lui, la mémoire KV-cache à 1M tokens serait prohibitive. AttnRes ajoute une récupération sélective en profondeur (~25 % gain d'efficacité d'entraînement). Stable LatentMoE avec Quantile Balancing supprime les heuristiques de routage d'experts fragiles à l'échelle 896 experts.

Modified MIT open weights permet d'exécuter et fine-tuner le modèle ; il ne permet pas de cloner la run d'entraînement Moonshot. Pour la plupart des équipes production, cette distinction est un atout — pas un défaut.

Les artefacts quantifiés release (MXFP4/NVFP4) visent un déploiement vLLM et SGLang Day-0. Moonshot a entraîné quantization-aware pour que l'inférence INT4/FP4 ne dégrade pas la qualité comme une quantisation post-hoc sur d'autres modèles frontier.

03

Benchmarks vs Claude Fable 5 et GPT-5.6 : gains, pertes et écarts honnêtes

K3 est compétitif — pas dominant. Le blog Moonshot reconnaît des faiblesses vs K2.6 sur le taux d'hallucination et vs Fable 5/Sol sur polish et variance de sortie. Ci-dessous : scores agrégés Artificial Analysis plus benchmarks auto-déclarés Moonshot (harness différents par éditeur).

ModèleAA Intelligence Index v4.1Rang AA (sur 189)Coût tâche unique (AA)
Claude Fable 559,91~2,75 $
GPT-5.6 Sol58,92~1,04 $
Kimi K357,130,94 $

Où K3 gagne :

01

Frontend Code Arena #1 — génération UI/frontend devant rivaux fermés.

02

Automation Bench (30,8), SpreadsheetBench 2, BrowseComp (91,2) — usage d'outils agentique et recherche web.

03

SWE Marathon (42,0, #1) — sessions de code multi-heures.

04

Terminal Bench 2.1 (88,3), Program Bench (77,8), FrontierSWE (81,2) — solide mais pas toujours #1.

05

OmniDocBench (91,1, #1) — compréhension documentaire multimodale avec synergie contexte 1M.

Où K3 perd :

01

GDPval v2 Elo : K3 à 1668–1687 vs Fable 5 (1760) et Sol (1748) — écart de polish en raisonnement général.

02

DeepSWE : K3 67,5 vs Sol 73,0 — debug repo profond favorise GPT-5.6.

03

FrontierSWE : Fable 5 mène à 86,6 ; K3 à 81,2 solide mais pas proche.

04

Hallucinations vs K2.6 : Moonshot admet une régression sur fiabilité factuelle dans certains domaines.

05

Polish / variance de sortie : Fable 5 et Sol produisent une prose plus cohérente et moins d'erreurs de format sur tâches ouvertes.

Attention : Benchmarks tâches auto-déclarés avec harness non unifiés (K3 Kimi Code, GPT Codex, Claude Claude Code). Référence directionnelle — validez sur vos jeux d'évaluation avant routage production.

L'écart intelligence open/closed s'est réduit à environ 2–3 points AA Index au tier frontier. Le pitch K3 n'est pas « nous battons Claude » — c'est « nous sommes à portée de frappe à un tiers du prix, avec poids téléchargeables et contexte 1M ».

04

Tarifs API et six étapes pour exécuter Kimi K3 (incl. checklist release day)

ModèleEntrée ($/M)Entrée cache ($/M)Sortie ($/M)Contexte
Kimi K33,00 $0,30 $15,00 $1M
Claude Sonnet 53,00 $15,00 $200K
Claude Fable 5~15,00 $~50,00 $1M
GPT-5.6 Sol~5,00 $~15,00 $400K
DeepSeek V4 Pro1,74 $0,145 $3,48 $128K

Le tarif standard K3 s'aligne sur les modèles quality-tier occidentaux (3 $/15 $) mais offre une fenêtre de contexte 5× plus large que les API classe Sonnet sans surcoût longueur. Entrée cache à 0,30 $/M (un dixième du standard) plus taux de cache >90 % en workflows code rend le coût effectif d'entrée très bas. Tarif tâche unique AA à 0,94 $, soit 9,4 % sous Sol et 65,8 % sous Fable 5 — l'argument coût near-frontier en un chiffre.

Six étapes opérationnelles :

01

Démarrer sur l'API aujourd'hui : Inscription sur kimi.com (gratuit, raisonnement max) ou clé sur platform.kimi.ai. base_url = https://api.moonshot.ai/v1, modèle kimi-k3.

02

Optimiser le cache : Réutiliser system prompts et préfixes de définitions d'outils dans les workflows agent. Inférence disaggregée Mooncake vise 90 %+ hits — entrée effective peut descendre vers ~0,55 $/M (validation pondérée OpenRouter 7 jours).

03

Router via OpenRouter : ID modèle moonshotai/kimi-k3 — tarifs officiels, sans markup, contexte 1M complet.

04

Self-host vs API : L'API convient à la plupart des équipes. Self-host uniquement pour résidence des données, fine-tuning custom ou volume soutenu battant 3 $/15 $ à votre échelle.

05

Checklist release day 27 juillet : (a) Confirmer repo Hugging Face et manifeste fichiers ; (b) lire LICENSE Modified MIT ; (c) choisir variante quant (MXFP4 vs NVFP4) ; (d) extraire commandes launch vLLM/SGLang de la model card ; (e) vérifier hardware minimum (64+ accélérateurs, ~1,4 To en 4 bits) ; (f) retester workloads long contexte — comportement KDA peut différer de l'API.

06

Routage multi-modèles : Longues sessions code → K3 ; bugs repo complexes → Fable 5 ; agents terminal-heavy → GPT-5.6 Sol. Ne pas tout miser sur un modèle.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysez cette codebase pour des failles de sécurité..."}]
)
05

Réalité self-hosting, contexte sectoriel et ce que change le 27 juillet

Calcul self-deploy : poids K3 quantifiés 4 bits autour de ~1,4 To. Inférence production requiert un supernœud 64+ accélérateurs — pas un MacBook, pas une RTX 4090 seule. Référence : Kimi K2.7 Code INT4 près de ~577 Go ; K3 à 2,8T est une classe d'infrastructure différente.

Trois scénarios où le self-hosting a du sens : (1) Résidence des données — workloads ne pouvant quitter votre VPC ; (2) Fine-tuning — adaptateurs domaine sur open weights ; (3) Volume élevé — débit token soutenu où capex bat opex. Tous les autres devraient utiliser l'API jusqu'au 27 juillet et probablement après.

ScénarioVoie recommandéePourquoi
La plupart des développeurs (maintenant)API Kimi K3Pas de capex matériel ; contexte 1M ; tier 0,94 $/tâche
Résidence données / fine-tuningSelf-host post 27.7.Poids Modified MIT ; inférence VPC privée
Bugs niveau repo complexeAPI Claude Fable 5FrontierSWE et GDPval v2 en tête
Agents terminal-heavyAPI GPT-5.6 SolAvantage DeepSWE et Terminal Bench
Inférence bulk sensible au coûtDeepSeek V4 ProSortie 3,48 $/M, licence MIT

Contexte sectoriel : L'écart open/closed au frontier est désormais de 2–3 points AA, pas 20. La géopolitique façonne le récit — K3 lancé à la veille de la WAIC 2026, tandis que Claude Fable 5 d'Anthropic a subi une brève suspension export-control US le 1er juillet (depuis rétablie) poussant les développeurs étrangers vers des alternatives. La vague open weights chinoise — GLM-5.2, DeepSeek V4 Pro, MiniMax, désormais Kimi K3 — n'est plus des « copies bon marché » mais une poussée coordonnée au tier frontier.

La trajectoire Moonshot compte : après DeepSeek R1, Kimi est tombé brièvement au rang 7 sur certains leaderboards. La séquence K2 → K2.5 → K3 est un retour délibéré — chaque génération ajoutant contexte, échelle MoE, et désormais la plus grande release open weights de l'histoire. Revenus API >70 % du total ; utilisateurs payants overseas +400 %. Ce n'est pas de l'open weights caritatif ; c'est une plateforme commerciale avec un moat téléchargeable.

A

57,1 / 3/189 : AA Intelligence Index rang 3 sur 189 modèles — near-frontier, 2,8 points derrière Fable 5.

B

0,94 $ / 65,8 % : Coût tâche AA unique 0,94 $ — 65,8 % sous Fable 5, 9,4 % sous Sol.

C

2,8T / 27 juillet : Plus grande release open weights ; premier checkpoint au-delà de 2T sous Modified MIT.

Synthèse : Le 27 juillet est un jalon pour open weights — non parce que K3 bat chaque modèle fermé, mais parce qu'il met 2,8T paramètres near-frontier en forme téléchargeable à des tarifs API sous Claude et GPT en coût par tâche. Validez sur vos workloads, lisez la licence Modified MIT et planifiez le matériel honnêtement avant self-hosting.

Alternatives : agents Kimi Code sur Mac personnel subissent veille et coupures réseau sur jobs long contexte ; attendre self-hosting 27.7. exige un supernœud 64+ cartes que la plupart des équipes n'ont pas ; une seule API fermée rate l'avantage 1M flat pricing de K3. Pour CI/CD iOS, Kimi Code persistant et production agent IA 24/7, location Mac Mini M4 dédié KVMNODE est souvent le meilleur hôte : mémoire unifiée Apple Silicon, sudo ouvert, durées flexibles jour/semaine/mois. Voir tarifs, centre d'aide ou commander.

Données au 22 juillet 2026 · Benchmarks incluant auto-déclaration Moonshot AI · Sources : kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News