Wer Kimi K3 produktiv einsetzen will, sollte zuerst klären, ob Moonshot AIs Release wirklich Open Source ist — nicht wie viele Parameter das Modell hat. Am Abend des 27. Juli 2026 veröffentlichte das chinesische Lab die vollständigen Gewichte eines 2,8-Billionen-Parameter-MoE-Modells mit 1-Million-Token-Kontext sowie drei Infrastruktur-Releases: MoonEP, FlashKDA und AgentEnv. Dieser Artikel behandelt die 11-Tage-Timeline, KDA / AttnRes / Per-Head-Muon-Architektur, SWE-bench- und AA-Index-Benchmarks, zwei kommerzielle Lizenz-Gates und eine Sechs-Schritte-Deployment-Checkliste. Hintergrund: K3-Open-Weights-Vorschau, Destillations-Kontroverse.
01

Ist Kimi K3 Open Source oder nur Open Weight?

Kurz: Nein — zumindest nicht im strengen Sinn, und Moonshot AI behauptet das auch nicht. Am 27. Juli 2026 veröffentlichte Moonshot die vollständigen Gewichte und den Technical Report für Kimi K3, ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell mit nativer Bildverständnis-Fähigkeit. Der 1,56-TB-Download erreichte innerhalb von dreißig Minuten Platz 1 auf Hugging Faces Trending-Liste — K3 ist das größte je vollständig veröffentlichte Open-Weight-Modell.

DatumMeilensteinKernpunkt
16. JuliAPI-StartKimi App / Work / Code / API live; Gewichte noch nicht öffentlich
17. JuliWAIC 2026Staatsmedien nennen es das weltweit größte Open Model nach Parameterzahl
22.–23. JuliDestillations-StreitWeißhaus-Berater Kratsios wirft Moonshot industrielle Destillation gegen Anthropics Fable-Modell vor
27. JuliVollständige GewichteKomplette Weights + Technical Report + MoonEP / AgentEnv (FlashKDA bereits offen)
28. JuliMOFCOM-ReaktionChinas Handelsministerium wirft Washington „AI-Hegemonismus“ vor
01

Open Weight mit Open Source verwechseln: Moonshot verwendet nie „open source“ — Trainingsdaten und vollständiger Trainingscode sind nicht öffentlich.

02

Lizenz-Gates unterschätzen: K3 fügt eine $20M-MaaS-Umsatzschwelle und 100M-MAU-Attributionspflicht hinzu, die in der K2-Familie fehlten.

03

Annehmen, Consumer-Hardware reicht: 2,8T Parameter über 896 Experten — Moonshot empfiehlt Supernodes mit 64+ Beschleunigern.

04

Parameter statt Kosten priorisieren: K3 ist die Open-Weight-Fähigkeitsobergrenze, kostet aber ~$0,95/Aufgabe vs. GLM-5.2s ~$0,47.

05

Geopolitische Compliance ignorieren: Der US-China-Destillationsstreit plus WAIC-2026-Timing erhöht Lieferkettenrisiken — relevant auch für DSGVO-konforme EU-Deployments.

02

Kimi-K3-Spezifikationen und Architektur: KDA, AttnRes und Per-Head Muon

SpezifikationWert
Gesamtparameter2,8 Billionen
Aktive Parameter~104 Milliarden
Experten-Konfiguration896 geroutete Experten, 16 pro Token aktiv (~1,8 % Sparsity)
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Kontextfenster1.000.000 Token
MultimodalitätNative Vision (ViT-V2, 27 Layer)
GewichtsformatMXFP4-Gewichte, MXFP8-Aktivierungen (quantization-aware ab SFT)
Download-Größe~1,56 TB (Hugging Face)
LizenzCustom — Moonshot nennt es „open weight“, nicht „open source“

Kimi Delta Attention (KDA) ersetzt ein einzelnes skalares Vergessens-Gate durch kanalweises Gating: Jede Feature-Dimension erhält eine eigene Abklingrate, implementiert als chunkwise DPLR für lineare Rekurrenz. K3 wechselt KDA mit Gated-MLA-Layern ab — das Hybrid-Design hinter dem 1M-Token-Fenster und minimalem KV-Cache-Footprint.

Attention Residuals (AttnRes) ersetzen gleichmäßige Residual-Akkumulation durch selektive, inputabhängige Aggregation über alle vorherigen Layer — etwa 25 % höhere Trainingseffizienz bei unter 2 % zusätzlichen Parametern.

Per-Head Muon optimiert jeden Attention-Head unabhängig. Stable LatentMoE nutzt Quantile Balancing mit MoonEPs mathematischem Beweis redundanter Experten-Obergrenzen pro Compute-Rank.

KomponenteGelöstes ProblemKernvorteil
KDAKV-Cache-Explosion bei langen SequenzenLineare Rekurrenz, minimaler VRAM
AttnResSignalverdünnung in frühen Layern bei Tiefe~25 % Trainingseffizienz-Boost
Per-Head MuonEinheitlicher Optimizer über HeadsFrontier-Klasse bei weniger aktiven Parametern
Stable LatentMoEExperten-Lastungleichgewicht im großen Maßstab896 geroutet, 16 aktiv — 1,8 % Sparsity
03

Drei Infrastruktur-Releases und Benchmarks vs. GPT-5.6, Claude, GLM-5.2

TechnologieRolleKernzahlen
MoonEPMoE-Kommunikation im ExtremmaßstabDupliziert überlastete Experten; beweist redundante Experten-Obergrenze pro Rank
FlashKDACUTLASS-KDA-Kernel1,72×–2,22× schnelleres Prefill auf H20 vs. flash-linear-attention-Baseline
AgentEnvFirecracker-microVM-Agent-SandboxCheckpoint ~133 ms, Resume ~49 ms, bis zu 6,5× Memory-Overcommit

SWE-bench Verified (unabhängige Evaluation, Vals AI, Juli 2026):

ModellScoreRelease-Datum
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
GLM-5.2 (max)51 (AA Index)Bisheriger Open-Weight-Führer

Im Artificial Analysis Intelligence Index (max reasoning) erreicht Kimi K3 ~57 Punkte — Platz 3 gesamt, Platz 1 unter Open-Weight-Modellen. Es ist die Fähigkeitsobergrenze der Open-Weight-Stufe, kostet aber etwa $0,95/Aufgabe — mehr als GLM-5.2 (~$0,47). K3 führt aktuell die Arena.ai Frontend Code Arena an.

04

Kommerzielle Lizenz-Gates und Sechs-Schritte-Deployment-Checkliste

Moonshot nennt dies durchgängig eine „open-weight“-Veröffentlichung, nie „open source“. Die Lizenz ist ein vollständig individuelles Dokument mit zwei kommerziellen Schwellen, die in der K2-Familie nicht existierten:

GateAuslöserAnforderung
MaaS-Umsatz-GateModel-as-a-Service-Umsatz übersteigt $20M in beliebigen 12 MonatenSeparates Kommerzabkommen mit Moonshot AI
Attributions-Gate100M+ monatliche aktive Nutzer oder $20M+ Monatsumsatz„Kimi K3“ prominent in der Produkt-UI anzeigen
Token-TypPreis pro Million Token
Input (Cache Hit)$0,30
Input (Cache Miss)$3,00
Output (inkl. Reasoning Trace)$15,00

Moonshots disaggregierte Mooncake-Serving-Architektur hält Cache-Hit-Raten bei typischen Coding-Workloads über 90 % — der Großteil realer Nutzung liegt näher an $0,30.

01

API-Zugang registrieren: Key auf platform.kimi.ai erstellen, base_url auf https://api.moonshot.ai/v1, Modell-ID kimi-k3.

02

LICENSE prüfen: Vor dem Hugging-Face-Download sollte Legal klären, ob MaaS-Umsatz- oder MAU-Gates greifen — auch im Hinblick auf DSGVO und Datenresidenz.

03

OpenAI-SDK-kompatible Integration: Die meisten Projekte brauchen nur base URL und API-Key-Wechsel.

04

Cache-Prefix-Optimierung: System-Prompts und Tool-Definition-Präfixe wiederverwenden — Coding-Agents erreichen 90 %+ Cache-Rate, effektive Input-Kosten sinken auf $0,30/M.

05

Self-Hosting-Hardware prüfen: Supernode mit 64+ Beschleunigern bestätigen; für die meisten Teams ist OpenRouter oder ähnliche Hosts (7 Anbieter live) der praktikable Weg.

06

Inferenz-Stack wählen: Deployment via vLLM (KDA + Prefix Caching) oder SGLang; FlashKDA ersetzt direkt das chunk_kda-Backend.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere die Komplexität dieses Codes..."}]
)
05

US-China-AI-Kontext und drei harte Zahlen

Kimi K3s Open-Weight-Release fiel in die WAIC 2026 und Tage nach der Eskalation des US-China-„Model-Distillation“-Streits: Weißhaus-Wissenschaftsberater Michael Kratsios warf Moonshot eine groß angelegte Destillationskampagne gegen Anthropics Fable-Modell vor, Finanzminister Scott Bessent deutete Sanktionen an. Chinas Handelsministerium reagierte am 28. Juli mit dem Vorwurf „AI-Hegemonismus“. Drei Tage nach K3 präsentierte Alibaba Qwen3.8-Max-Preview — weithin als direkte Antwort gelesen, der Open-Weight-Wettlauf tritt in den „3T-Club“ ein.

A

2,8T / #1 Open Weight: Das größte je vollständig veröffentlichte Open-Weight-Modell — 1,56 TB auf Hugging Face, #1 Trending in 30 Minuten.

B

93,4 % / #3 global: Unabhängiger SWE-bench-Verified-Score 93,4 %; AA Index ~57 — dritter Platz gesamt, erster unter Open-Weight-Modellen.

C

11 Tage / drei Infra-Releases: Vom API-Start bis zur vollständigen Gewichtsveröffentlichung in 11 Tagen, mit MoonEP, FlashKDA und AgentEnv parallel geöffnet.

Praktische Alternativen haben versteckte Kosten: Kimi-Code-Agents auf einem privaten Mac scheitern an Sleep und Netzwerkausfällen; volles K3-Self-Hosting braucht 64+ Beschleuniger, die die meisten Teams nicht bereitstellen; eine einzelne Closed API opfert K3s 1M-Token-Flat-Pricing-Vorteil. Für produktive iOS-CI/CD-Pipelines und 24/7-AI-Agent-Automatisierung ist KVMNODE dedizierte Mac-Mini-Cloud-Miete meist die bessere Wahl: natives Apple Silicon mit Metal-Beschleunigung, voller sudo-Zugang, flexible Tages-/Wochen-/Monatsabrechnung. Siehe Preisseite, Hilfezentrum oder direkt bestellen.

Datenstand: 28. Juli 2026 · Quellen: Moonshot AI Official Blog, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index