Ist Kimi K3 Open Source oder nur Open Weight?
Kurz: Nein — zumindest nicht im strengen Sinn, und Moonshot AI behauptet das auch nicht. Am 27. Juli 2026 veröffentlichte Moonshot die vollständigen Gewichte und den Technical Report für Kimi K3, ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell mit nativer Bildverständnis-Fähigkeit. Der 1,56-TB-Download erreichte innerhalb von dreißig Minuten Platz 1 auf Hugging Faces Trending-Liste — K3 ist das größte je vollständig veröffentlichte Open-Weight-Modell.
| Datum | Meilenstein | Kernpunkt |
|---|---|---|
| 16. Juli | API-Start | Kimi App / Work / Code / API live; Gewichte noch nicht öffentlich |
| 17. Juli | WAIC 2026 | Staatsmedien nennen es das weltweit größte Open Model nach Parameterzahl |
| 22.–23. Juli | Destillations-Streit | Weißhaus-Berater Kratsios wirft Moonshot industrielle Destillation gegen Anthropics Fable-Modell vor |
| 27. Juli | Vollständige Gewichte | Komplette Weights + Technical Report + MoonEP / AgentEnv (FlashKDA bereits offen) |
| 28. Juli | MOFCOM-Reaktion | Chinas Handelsministerium wirft Washington „AI-Hegemonismus“ vor |
Open Weight mit Open Source verwechseln: Moonshot verwendet nie „open source“ — Trainingsdaten und vollständiger Trainingscode sind nicht öffentlich.
Lizenz-Gates unterschätzen: K3 fügt eine $20M-MaaS-Umsatzschwelle und 100M-MAU-Attributionspflicht hinzu, die in der K2-Familie fehlten.
Annehmen, Consumer-Hardware reicht: 2,8T Parameter über 896 Experten — Moonshot empfiehlt Supernodes mit 64+ Beschleunigern.
Parameter statt Kosten priorisieren: K3 ist die Open-Weight-Fähigkeitsobergrenze, kostet aber ~$0,95/Aufgabe vs. GLM-5.2s ~$0,47.
Geopolitische Compliance ignorieren: Der US-China-Destillationsstreit plus WAIC-2026-Timing erhöht Lieferkettenrisiken — relevant auch für DSGVO-konforme EU-Deployments.
Kimi-K3-Spezifikationen und Architektur: KDA, AttnRes und Per-Head Muon
| Spezifikation | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen |
| Aktive Parameter | ~104 Milliarden |
| Experten-Konfiguration | 896 geroutete Experten, 16 pro Token aktiv (~1,8 % Sparsity) |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Kontextfenster | 1.000.000 Token |
| Multimodalität | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4-Gewichte, MXFP8-Aktivierungen (quantization-aware ab SFT) |
| Download-Größe | ~1,56 TB (Hugging Face) |
| Lizenz | Custom — Moonshot nennt es „open weight“, nicht „open source“ |
Kimi Delta Attention (KDA) ersetzt ein einzelnes skalares Vergessens-Gate durch kanalweises Gating: Jede Feature-Dimension erhält eine eigene Abklingrate, implementiert als chunkwise DPLR für lineare Rekurrenz. K3 wechselt KDA mit Gated-MLA-Layern ab — das Hybrid-Design hinter dem 1M-Token-Fenster und minimalem KV-Cache-Footprint.
Attention Residuals (AttnRes) ersetzen gleichmäßige Residual-Akkumulation durch selektive, inputabhängige Aggregation über alle vorherigen Layer — etwa 25 % höhere Trainingseffizienz bei unter 2 % zusätzlichen Parametern.
Per-Head Muon optimiert jeden Attention-Head unabhängig. Stable LatentMoE nutzt Quantile Balancing mit MoonEPs mathematischem Beweis redundanter Experten-Obergrenzen pro Compute-Rank.
| Komponente | Gelöstes Problem | Kernvorteil |
|---|---|---|
| KDA | KV-Cache-Explosion bei langen Sequenzen | Lineare Rekurrenz, minimaler VRAM |
| AttnRes | Signalverdünnung in frühen Layern bei Tiefe | ~25 % Trainingseffizienz-Boost |
| Per-Head Muon | Einheitlicher Optimizer über Heads | Frontier-Klasse bei weniger aktiven Parametern |
| Stable LatentMoE | Experten-Lastungleichgewicht im großen Maßstab | 896 geroutet, 16 aktiv — 1,8 % Sparsity |
Drei Infrastruktur-Releases und Benchmarks vs. GPT-5.6, Claude, GLM-5.2
| Technologie | Rolle | Kernzahlen |
|---|---|---|
| MoonEP | MoE-Kommunikation im Extremmaßstab | Dupliziert überlastete Experten; beweist redundante Experten-Obergrenze pro Rank |
| FlashKDA | CUTLASS-KDA-Kernel | 1,72×–2,22× schnelleres Prefill auf H20 vs. flash-linear-attention-Baseline |
| AgentEnv | Firecracker-microVM-Agent-Sandbox | Checkpoint ~133 ms, Resume ~49 ms, bis zu 6,5× Memory-Overcommit |
SWE-bench Verified (unabhängige Evaluation, Vals AI, Juli 2026):
| Modell | Score | Release-Datum |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| GLM-5.2 (max) | 51 (AA Index) | Bisheriger Open-Weight-Führer |
Im Artificial Analysis Intelligence Index (max reasoning) erreicht Kimi K3 ~57 Punkte — Platz 3 gesamt, Platz 1 unter Open-Weight-Modellen. Es ist die Fähigkeitsobergrenze der Open-Weight-Stufe, kostet aber etwa $0,95/Aufgabe — mehr als GLM-5.2 (~$0,47). K3 führt aktuell die Arena.ai Frontend Code Arena an.
Kommerzielle Lizenz-Gates und Sechs-Schritte-Deployment-Checkliste
Moonshot nennt dies durchgängig eine „open-weight“-Veröffentlichung, nie „open source“. Die Lizenz ist ein vollständig individuelles Dokument mit zwei kommerziellen Schwellen, die in der K2-Familie nicht existierten:
| Gate | Auslöser | Anforderung |
|---|---|---|
| MaaS-Umsatz-Gate | Model-as-a-Service-Umsatz übersteigt $20M in beliebigen 12 Monaten | Separates Kommerzabkommen mit Moonshot AI |
| Attributions-Gate | 100M+ monatliche aktive Nutzer oder $20M+ Monatsumsatz | „Kimi K3“ prominent in der Produkt-UI anzeigen |
| Token-Typ | Preis pro Million Token |
|---|---|
| Input (Cache Hit) | $0,30 |
| Input (Cache Miss) | $3,00 |
| Output (inkl. Reasoning Trace) | $15,00 |
Moonshots disaggregierte Mooncake-Serving-Architektur hält Cache-Hit-Raten bei typischen Coding-Workloads über 90 % — der Großteil realer Nutzung liegt näher an $0,30.
API-Zugang registrieren: Key auf platform.kimi.ai erstellen, base_url auf https://api.moonshot.ai/v1, Modell-ID kimi-k3.
LICENSE prüfen: Vor dem Hugging-Face-Download sollte Legal klären, ob MaaS-Umsatz- oder MAU-Gates greifen — auch im Hinblick auf DSGVO und Datenresidenz.
OpenAI-SDK-kompatible Integration: Die meisten Projekte brauchen nur base URL und API-Key-Wechsel.
Cache-Prefix-Optimierung: System-Prompts und Tool-Definition-Präfixe wiederverwenden — Coding-Agents erreichen 90 %+ Cache-Rate, effektive Input-Kosten sinken auf $0,30/M.
Self-Hosting-Hardware prüfen: Supernode mit 64+ Beschleunigern bestätigen; für die meisten Teams ist OpenRouter oder ähnliche Hosts (7 Anbieter live) der praktikable Weg.
Inferenz-Stack wählen: Deployment via vLLM (KDA + Prefix Caching) oder SGLang; FlashKDA ersetzt direkt das chunk_kda-Backend.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere die Komplexität dieses Codes..."}]
)US-China-AI-Kontext und drei harte Zahlen
Kimi K3s Open-Weight-Release fiel in die WAIC 2026 und Tage nach der Eskalation des US-China-„Model-Distillation“-Streits: Weißhaus-Wissenschaftsberater Michael Kratsios warf Moonshot eine groß angelegte Destillationskampagne gegen Anthropics Fable-Modell vor, Finanzminister Scott Bessent deutete Sanktionen an. Chinas Handelsministerium reagierte am 28. Juli mit dem Vorwurf „AI-Hegemonismus“. Drei Tage nach K3 präsentierte Alibaba Qwen3.8-Max-Preview — weithin als direkte Antwort gelesen, der Open-Weight-Wettlauf tritt in den „3T-Club“ ein.
2,8T / #1 Open Weight: Das größte je vollständig veröffentlichte Open-Weight-Modell — 1,56 TB auf Hugging Face, #1 Trending in 30 Minuten.
93,4 % / #3 global: Unabhängiger SWE-bench-Verified-Score 93,4 %; AA Index ~57 — dritter Platz gesamt, erster unter Open-Weight-Modellen.
11 Tage / drei Infra-Releases: Vom API-Start bis zur vollständigen Gewichtsveröffentlichung in 11 Tagen, mit MoonEP, FlashKDA und AgentEnv parallel geöffnet.
Praktische Alternativen haben versteckte Kosten: Kimi-Code-Agents auf einem privaten Mac scheitern an Sleep und Netzwerkausfällen; volles K3-Self-Hosting braucht 64+ Beschleuniger, die die meisten Teams nicht bereitstellen; eine einzelne Closed API opfert K3s 1M-Token-Flat-Pricing-Vorteil. Für produktive iOS-CI/CD-Pipelines und 24/7-AI-Agent-Automatisierung ist KVMNODE dedizierte Mac-Mini-Cloud-Miete meist die bessere Wahl: natives Apple Silicon mit Metal-Beschleunigung, voller sudo-Zugang, flexible Tages-/Wochen-/Monatsabrechnung. Siehe Preisseite, Hilfezentrum oder direkt bestellen.
Datenstand: 28. Juli 2026 · Quellen: Moonshot AI Official Blog, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index