Kimi K3 Open Weights: Was am 27. Juli kommt und die vollständige Timeline
Moonshot AI startete Kimi K3 am 16. Juli 2026 — API, Kimi App, Kimi Work und Kimi Code gingen über Nacht live mit Model-ID kimi-k3. Die Weights folgen 11 Tage später: Am 27. Juli kommen der vollständige 2,8T-Checkpoint, Technical Report, Modified-MIT-Lizenz und erwartete Day-0 vLLM/SGLang-Builds auf Hugging Face.
Diese Trennung — API zuerst, Weights danach — ist beabsichtigt. Moonshot validierte Produktions-Inferenz, Preise und Cache-Ökonomie, bevor das größte downloadbare Modell der Geschichte geöffnet wird. Für die meisten Teams bleibt die API durch Juli und darüber hinaus der richtige Weg; Self-Hosting ist ein Spezialfall für Data Residency, Fine-Tuning oder extremes Volumen — bei EU-Personendaten in Prompts sind AV-Vertrag und DSGVO-konforme Auftragsverarbeitung zu prüfen.
| Datum | Meilenstein |
|---|---|
| 16. Juli 2026 | K3-API live (Kimi App / Work / Code / platform.kimi.ai); Artificial-Analysis-Evaluierung startet; größtes aufrufbares Open-Weights-Class-Modell mit 2,8T |
| 17. Juli 2026 | WAIC 2026 startet in Shanghai; Xinhua und Staatsmedien rahmen K3 als nationalen AI-Meilenstein; Moonshot-ARR->$300M-Narrativ gewinnt an Traktion |
| 27. Juli 2026 | Vollständige Weights + Technical Report auf Hugging Face unter Modified MIT; MXFP4/NVFP4-Quant-Builds; vLLM KDA + Prefix Caching; Ollama/GGUF-Follow-up innerhalb weniger Tage erwartet |
Am Release-Tag erhalten Sie: vollständige Model Weights (keine destillierte Variante), Inferenz-Configs für vLLM und SGLang, quantisierungsbewusste MXFP4/NVFP4-Artefakte und einen Technical Report zu KDA, AttnRes und Stable LatentMoE. Nicht enthalten: Trainingsdaten, vollständige Trainings-Codebasis oder eine unmodifizierte Standard-MIT-Lizenz.
Größenrekord: 2,8T macht K3 zum größten Open-Weights-Release ever — ~75 % größer als DeepSeek V4 Pro (1,6T), erster Checkpoint über 2T Parameter.
Intelligenz-Tier: AA Index 57,1, Rang 3/189 — nahe Frontier, nicht #1. Abstand zu Fable 5: 2,8 Punkte, nicht 28.
Kosten-Tier: Einzelne AA-Aufgabe bei $0,94 — 9,4 % unter Sol, 65,8 % unter Fable 5. Open Weights plus Flat-1M-Kontext-Preis ist das Wertversprechen.
Typische Fehler: 27. Juli als "kostenloses lokales ChatGPT" behandeln; Modified-MIT-Kommerzklauseln ignorieren; Consumer-GPU-Viabilität annehmen; erwarten, Fable 5 in jedem Coding-Benchmark zu schlagen.
Open Weights vs. Open Source: Modified MIT und vollständige Architektur-Specs
Open Weights bedeutet: trainierte Parameter downloaden, prüfen, fine-tunen und deployen. Open Source bedeutet traditionell vollständiger Code, Daten und Lizenzfreiheit, Training von Grund auf zu reproduzieren. Kimi K3 steht klar im ersten Lager: Moonshot liefert Weights und Technical Report unter Modified MIT, nicht einen reproduzierbaren Open-Source-Stack.
Praktische Auswirkung: Forscher und Unternehmen können K3 fine-tunen, private Inferenz betreiben und Weight-Verhalten auditieren. Retraining allein aus öffentlichen Artefakten oder Standard-MIT-Behauptung ohne Moonshots Modifikationen — besonders bei kommerzieller Weiterverbreitung — ist nicht möglich. Die Branche nutzt zunehmend "Open Weights", weil Frontier-Labs selten alles öffnen.
| Spec | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Architektur | Stable LatentMoE — 896 Experten, 16 aktiv (1,8 % Sparsity) |
| Attention-Stack | Kimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA |
| Kontextfenster | 1.048.576 Tokens (1M) |
| Input-Modalitäten | Text, Bild, Video |
| Trainingspräzision | MXFP4 Weights, MXFP8 Aktivierungen (quantization-aware Design) |
| Scaling vs. K2 | ~2,5× bessere Scaling-Effizienz |
| KDA Decode bei 1M | Bis 6,3× schneller vs. Full Attention; 75 % weniger KV-Cache-Speicher |
| MoE-Techniken | Quantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU) |
| Release-Lizenz | Modified MIT (Hugging Face, 27. Juli) |
Warum die Architektur für Self-Hosting zählt
KDA's 3:1 Linear-zu-Full-Attention-Verhältnis macht Millionen-Token-Inferenz überhaupt diskutierbar — ohne es wäre KV-Cache-Speicher bei 1M Tokens prohibitiv. AttnRes ergänzt selektiven Tiefenabruf (~25 % Trainings-Effizienzgewinn). Stable LatentMoE mit Quantile Balancing entfernt fragile Expert-Routing-Heuristiken, die bei 896-Experten-Skala brechen.
Modified-MIT Open Weights erlaubt Betrieb und Fine-Tuning; sie erlauben kein Klonen von Moonshots Trainingslauf. Für die meisten Produktionsteams ist diese Unterscheidung ein Feature — kein Bug.
Quantisierte Release-Artefakte (MXFP4/NVFP4) sind für Day-0 vLLM- und SGLang-Deployment ausgelegt. Moonshot trainierte quantization-aware, sodass INT4/FP4-Inferenz Qualität nicht kollabiert wie post-hoc-Quantisierung bei anderen Frontier-Modellen.
Benchmarks vs. Claude Fable 5 und GPT-5.6: Gewinne, Verluste und ehrliche Lücken
K3 ist wettbewerbsfähig — nicht dominant. Moonshots Blog räumt Schwächen vs. K2.6 bei Halluzinationsrate und vs. Fable 5/Sol bei Polish und Output-Varianz ein. Unten: Artificial-Analysis-Aggregat plus Moonshot-Self-Report (unterschiedliche Harness pro Anbieter).
| Modell | AA Intelligence Index v4.1 | AA-Rang (von 189) | Einzelaufgabe-Kosten (AA) |
|---|---|---|---|
| Claude Fable 5 | 59,9 | 1 | ~$2,75 |
| GPT-5.6 Sol | 58,9 | 2 | ~$1,04 |
| Kimi K3 | 57,1 | 3 | $0,94 |
Wo K3 gewinnt:
Frontend Code Arena #1 — UI/Frontend-Generierung vor geschlossenen Rivalen.
Automation Bench (30,8), SpreadsheetBench 2, BrowseComp (91,2) — agentische Tool-Nutzung und Web-Recherche.
SWE Marathon (42,0, #1) — mehrstündige Coding-Sessions.
Terminal Bench 2.1 (88,3), Program Bench (77,8), FrontierSWE (81,2) — stark, aber nicht immer #1.
OmniDocBench (91,1, #1) — multimodales Dokumentverständnis mit 1M-Kontext-Synergie.
Wo K3 verliert:
GDPval v2 Elo: K3 bei 1668–1687 vs. Fable 5 (1760) und Sol (1748) — Lücke bei allgemeinem Reasoning-Polish.
DeepSWE: K3 67,5 vs. Sol 73,0 — tiefes Repo-Debugging favorisiert GPT-5.6.
FrontierSWE: Fable 5 führt mit 86,6; K3 bei 81,2 solide, aber nicht nah dran.
Halluzinationen vs. K2.6: Moonshot räumt Regression bei faktischer Zuverlässigkeit in einigen Domänen ein.
Output-Polish / Varianz: Fable 5 und Sol liefern konsistentere Prosa und weniger Format-Fehler bei offenen Aufgaben.
Hinweis: Task-Benchmarks sind Hersteller-Self-Report mit nicht vereinheitlichten Harnesses (K3 Kimi Code, GPT Codex, Claude Claude Code). Als Richtungswert nutzen — vor Produktions-Routing mit eigenen Evals validieren.
Die Open/Closed-Intelligenzlücke an der Frontier ist auf ca. 2–3 AA-Index-Punkte geschrumpft. K3's Pitch ist nicht "wir schlagen Claude" — sondern "wir sind in Schlagdistanz zu einem Drittel des Preises, mit downloadbaren Weights und 1M Kontext."
API-Preise und sechs Schritte zum Betrieb von Kimi K3 (inkl. Release-Day-Checkliste)
| Modell | Input ($/M) | Gecachter Input ($/M) | Output ($/M) | Kontext |
|---|---|---|---|---|
| Kimi K3 | $3,00 | $0,30 | $15,00 | 1M |
| Claude Sonnet 5 | $3,00 | — | $15,00 | 200K |
| Claude Fable 5 | ~$15,00 | — | ~$50,00 | 1M |
| GPT-5.6 Sol | ~$5,00 | — | ~$15,00 | 400K |
| DeepSeek V4 Pro | $1,74 | $0,145 | $3,48 | 128K |
K3-Standardpreis entspricht westlichen Quality-Tier-Modellen ($3/$15), liefert aber ein 5× größeres Kontextfenster als Sonnet-Klasse ohne Längenzuschlag. Gecachter Input bei $0,30/M (ein Zehntel Standard) plus 90 %+ Cache-Hit-Raten in Coding-Workflows senkt effektive Input-Kosten stark. AA-Einzelaufgabe bei $0,94 liegt 9,4 % unter Sol und 65,8 % unter Fable 5 — die Near-Frontier-Kostenstory in einer Zahl. Bei Cloud-API mit Verarbeitung außerhalb der EU: DSGVO-Rollen und Auftragsverarbeitung dokumentieren.
Sechs operative Schritte:
Heute über API starten: Registrierung auf kimi.com (kostenlos, Max Reasoning) oder Key auf platform.kimi.ai. base_url = https://api.moonshot.ai/v1, Modell kimi-k3.
Cache optimieren: System-Prompts und Tool-Definition-Prefixes in Agent-Workflows wiederverwenden. Mooncake disaggregierte Inferenz zielt auf 90 %+ Cache-Hits — effektiver Input kann Richtung ~$0,55/M sinken (OpenRouter 7-Tage-gewichtet).
Routing über OpenRouter: Model-ID moonshotai/kimi-k3 — offizielle Preise, kein Markup, voller 1M-Kontext.
Self-Host vs. API entscheiden: API ist für die meisten Teams richtig. Self-Host nur bei Data Residency, Custom Fine-Tuning oder Dauervolumen, das $3/$15 bei Ihrer Skala schlägt.
Release-Day-Checkliste 27. Juli: (a) Hugging-Face-Repo und Datei-Manifest prüfen; (b) Modified-MIT-LICENSE lesen; (c) Quant-Variante wählen (MXFP4 vs. NVFP4); (d) vLLM/SGLang-Launch-Befehle aus Model Card ziehen; (e) Mindest-Hardware verifizieren (64+ Beschleuniger, ~1,4 TB bei 4-Bit); (f) Long-Context-Workloads retesten — KDA-Verhalten kann von API abweichen.
Mixed-Model-Routing: Lange Coding-Sessions → K3; komplexe Repo-Bugs → Fable 5; terminal-lastige Agenten → GPT-5.6 Sol. Nicht alles auf ein Modell setzen.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere diese Codebasis auf Sicherheitslücken..."}]
)Self-Hosting-Realität, Branchenkontext und was der 27. Juli ändert
Self-Deploy-Rechnung: 4-Bit-quantisierte K3-Weights landen bei ca. ~1,4 TB. Produktions-Inferenz braucht einen Supernode mit 64+ Beschleunigern — kein MacBook, keine einzelne RTX 4090. Referenz: Kimi K2.7 Code INT4 nahe ~577 GB; K3 mit 2,8T ist eine andere Infrastrukturklasse.
Drei Szenarien, in denen Self-Hosting Sinn ergibt: (1) Data Residency — Workloads, die Ihre VPC nicht verlassen dürfen; bei personenbezogenen EU-Daten DSGVO-konforme Verarbeitung sicherstellen; (2) Fine-Tuning — Domain-Adapter auf Open Weights; (3) Hohes Volumen — anhaltender Token-Durchsatz, wo Capex Opex schlägt. Alle anderen sollten die API durch den 27. Juli und wahrscheinlich danach nutzen.
| Szenario | Empfohlener Weg | Warum |
|---|---|---|
| Die meisten Entwickler (jetzt) | Kimi K3 API | Kein Hardware-Capex; 1M Kontext; $0,94/Aufgabe-Tier |
| Data Residency / Fine-Tuning | Self-Host ab 27.7. | Modified-MIT-Weights; private VPC-Inferenz |
| Komplexe Repo-Level-Bugs | Claude Fable 5 API | FrontierSWE und GDPval v2 führen |
| Terminal-lastige Agenten | GPT-5.6 Sol API | DeepSWE und Terminal Bench Vorsprung |
| Kostensensitive Bulk-Inferenz | DeepSeek V4 Pro | Output $3,48/M, MIT-Lizenz |
Branchenkontext: Die Open/Closed-Lücke an der Frontier beträgt jetzt 2–3 AA-Punkte, nicht 20. Geopolitik prägt das Narrativ — K3 startete am Vorabend der WAIC 2026, während Anthropics Claude Fable 5 am 1. Juli kurz unter US-Exportkontrolle geriet (seitdem wiederhergestellt) und ausländische Entwickler zu Alternativen trieb. Chinas Open-Weights-Welle — GLM-5.2, DeepSeek V4 Pro, MiniMax, jetzt Kimi K3 — ist nicht mehr "günstige Kopien", sondern koordinierter Frontier-Push.
Moonshots Bogen zählt: Nach DeepSeek R1 fiel Kimi kurz auf Rang 7 einiger Leaderboards. Die Sequenz K2 → K2.5 → K3 ist ein gezieltes Comeback — jede Generation mit mehr Kontext, MoE-Skala und jetzt dem größten Open-Weights-Drop der Geschichte. API-Umsatz über 70 % des Gesamtumsatzes; überseeische zahlende Nutzer +400 %. Das ist kein Wohltätigkeits-Open-Weights; es ist eine kommerzielle Plattform mit downloadbarem Moat.
57,1 / 3/189: AA Intelligence Index Rang 3 von 189 Modellen — nahe Frontier, 2,8 Punkte hinter Fable 5.
$0,94 / 65,8 %: Einzelne AA-Aufgabe $0,94 — 65,8 % unter Fable 5, 9,4 % unter Sol.
2,8T / 27. Juli: Größtes Open-Weights-Release ever; erster Checkpoint über 2T Parameter unter Modified MIT.
Fazit: Der 27. Juli ist ein Meilenstein für Open Weights — nicht weil K3 jedes geschlossene Modell schlägt, sondern weil er 2,8T nahe-Frontier-Parameter downloadbar zu API-Preisen liefert, die Claude und GPT pro Aufgabe unterbieten. Auf Ihren Workloads validieren, Modified-MIT-Lizenz lesen und Hardware ehrlich planen vor Self-Hosting.
Alternativen im Überblick: Kimi Code Agenten auf privatem Mac brechen bei Sleep und Netzwerk bei Long-Context-Jobs ab; Warten auf Self-Hosting ab 27.7. braucht einen 64+-Karten-Supernode, den die meisten Teams nicht haben; nur eine geschlossene API verfehlt K3's 1M-Flat-Pricing-Vorteil. Für iOS CI/CD, persistentes Kimi Code und 24/7 AI-Agent-Produktion ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist der stabilere Host: Apple Silicon Unified Memory, offenes sudo, flexible Tages-/Wochen-/Monatslaufzeiten. Siehe Preisseite, Hilfezentrum oder direkt bestellen.
Stand: 22. Juli 2026 · Benchmarks inkl. Moonshot-AI-Self-Report · Quellen: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News