Kernaussage: Moonshot AIs vollständige 2,8-Billionen-Parameter Kimi K3 Weights erscheinen am 27. Juli 2026 unter Modified MIT auf Hugging Face — das größte Open-Weights-Release bisher, mit Technical Report und Day-0 vLLM-Support. K3 ist kein Claude-Fable-5-Killer: Artificial Analysis rankt es mit 57,1 (3. von 189), hinter Fable 5 (59,9) und GPT-5.6 Sol (58,9). Was es ist: nahe-Frontier-Intelligenz zu etwa einem Drittel der Kosten geschlossener Flaggschiffe plus ein 1M-Token-Kontext, den keine geschlossene API zu Flat-Pricing bietet. Dieser Leitfaden deckt die Timeline 16. → 27. Juli, Open Weights vs. Open Source, vollständige Architektur-Specs, Benchmark-Gewinne und ehrliche Verluste, API-Preise ($3 / $0,30 Cache / $15), Self-Host-Hardware-Realität, sechs operative Schritte inkl. Release-Day-Checkliste und Branchenkontext ab. Architektur-Deep-Dive: Kimi K3 Review; außerdem GPT-5.6 Sol Release und Claude Fable 5 Alternativen.
01

Kimi K3 Open Weights: Was am 27. Juli kommt und die vollständige Timeline

Moonshot AI startete Kimi K3 am 16. Juli 2026 — API, Kimi App, Kimi Work und Kimi Code gingen über Nacht live mit Model-ID kimi-k3. Die Weights folgen 11 Tage später: Am 27. Juli kommen der vollständige 2,8T-Checkpoint, Technical Report, Modified-MIT-Lizenz und erwartete Day-0 vLLM/SGLang-Builds auf Hugging Face.

Diese Trennung — API zuerst, Weights danach — ist beabsichtigt. Moonshot validierte Produktions-Inferenz, Preise und Cache-Ökonomie, bevor das größte downloadbare Modell der Geschichte geöffnet wird. Für die meisten Teams bleibt die API durch Juli und darüber hinaus der richtige Weg; Self-Hosting ist ein Spezialfall für Data Residency, Fine-Tuning oder extremes Volumen — bei EU-Personendaten in Prompts sind AV-Vertrag und DSGVO-konforme Auftragsverarbeitung zu prüfen.

DatumMeilenstein
16. Juli 2026K3-API live (Kimi App / Work / Code / platform.kimi.ai); Artificial-Analysis-Evaluierung startet; größtes aufrufbares Open-Weights-Class-Modell mit 2,8T
17. Juli 2026WAIC 2026 startet in Shanghai; Xinhua und Staatsmedien rahmen K3 als nationalen AI-Meilenstein; Moonshot-ARR->$300M-Narrativ gewinnt an Traktion
27. Juli 2026Vollständige Weights + Technical Report auf Hugging Face unter Modified MIT; MXFP4/NVFP4-Quant-Builds; vLLM KDA + Prefix Caching; Ollama/GGUF-Follow-up innerhalb weniger Tage erwartet

Am Release-Tag erhalten Sie: vollständige Model Weights (keine destillierte Variante), Inferenz-Configs für vLLM und SGLang, quantisierungsbewusste MXFP4/NVFP4-Artefakte und einen Technical Report zu KDA, AttnRes und Stable LatentMoE. Nicht enthalten: Trainingsdaten, vollständige Trainings-Codebasis oder eine unmodifizierte Standard-MIT-Lizenz.

01

Größenrekord: 2,8T macht K3 zum größten Open-Weights-Release ever — ~75 % größer als DeepSeek V4 Pro (1,6T), erster Checkpoint über 2T Parameter.

02

Intelligenz-Tier: AA Index 57,1, Rang 3/189 — nahe Frontier, nicht #1. Abstand zu Fable 5: 2,8 Punkte, nicht 28.

03

Kosten-Tier: Einzelne AA-Aufgabe bei $0,949,4 % unter Sol, 65,8 % unter Fable 5. Open Weights plus Flat-1M-Kontext-Preis ist das Wertversprechen.

04

Typische Fehler: 27. Juli als "kostenloses lokales ChatGPT" behandeln; Modified-MIT-Kommerzklauseln ignorieren; Consumer-GPU-Viabilität annehmen; erwarten, Fable 5 in jedem Coding-Benchmark zu schlagen.

02

Open Weights vs. Open Source: Modified MIT und vollständige Architektur-Specs

Open Weights bedeutet: trainierte Parameter downloaden, prüfen, fine-tunen und deployen. Open Source bedeutet traditionell vollständiger Code, Daten und Lizenzfreiheit, Training von Grund auf zu reproduzieren. Kimi K3 steht klar im ersten Lager: Moonshot liefert Weights und Technical Report unter Modified MIT, nicht einen reproduzierbaren Open-Source-Stack.

Praktische Auswirkung: Forscher und Unternehmen können K3 fine-tunen, private Inferenz betreiben und Weight-Verhalten auditieren. Retraining allein aus öffentlichen Artefakten oder Standard-MIT-Behauptung ohne Moonshots Modifikationen — besonders bei kommerzieller Weiterverbreitung — ist nicht möglich. Die Branche nutzt zunehmend "Open Weights", weil Frontier-Labs selten alles öffnen.

SpecWert
Gesamtparameter2,8 Billionen (2,8T)
ArchitekturStable LatentMoE — 896 Experten, 16 aktiv (1,8 % Sparsity)
Attention-StackKimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA
Kontextfenster1.048.576 Tokens (1M)
Input-ModalitätenText, Bild, Video
TrainingspräzisionMXFP4 Weights, MXFP8 Aktivierungen (quantization-aware Design)
Scaling vs. K2~2,5× bessere Scaling-Effizienz
KDA Decode bei 1MBis 6,3× schneller vs. Full Attention; 75 % weniger KV-Cache-Speicher
MoE-TechnikenQuantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU)
Release-LizenzModified MIT (Hugging Face, 27. Juli)

Warum die Architektur für Self-Hosting zählt

KDA's 3:1 Linear-zu-Full-Attention-Verhältnis macht Millionen-Token-Inferenz überhaupt diskutierbar — ohne es wäre KV-Cache-Speicher bei 1M Tokens prohibitiv. AttnRes ergänzt selektiven Tiefenabruf (~25 % Trainings-Effizienzgewinn). Stable LatentMoE mit Quantile Balancing entfernt fragile Expert-Routing-Heuristiken, die bei 896-Experten-Skala brechen.

Modified-MIT Open Weights erlaubt Betrieb und Fine-Tuning; sie erlauben kein Klonen von Moonshots Trainingslauf. Für die meisten Produktionsteams ist diese Unterscheidung ein Feature — kein Bug.

Quantisierte Release-Artefakte (MXFP4/NVFP4) sind für Day-0 vLLM- und SGLang-Deployment ausgelegt. Moonshot trainierte quantization-aware, sodass INT4/FP4-Inferenz Qualität nicht kollabiert wie post-hoc-Quantisierung bei anderen Frontier-Modellen.

03

Benchmarks vs. Claude Fable 5 und GPT-5.6: Gewinne, Verluste und ehrliche Lücken

K3 ist wettbewerbsfähig — nicht dominant. Moonshots Blog räumt Schwächen vs. K2.6 bei Halluzinationsrate und vs. Fable 5/Sol bei Polish und Output-Varianz ein. Unten: Artificial-Analysis-Aggregat plus Moonshot-Self-Report (unterschiedliche Harness pro Anbieter).

ModellAA Intelligence Index v4.1AA-Rang (von 189)Einzelaufgabe-Kosten (AA)
Claude Fable 559,91~$2,75
GPT-5.6 Sol58,92~$1,04
Kimi K357,13$0,94

Wo K3 gewinnt:

01

Frontend Code Arena #1 — UI/Frontend-Generierung vor geschlossenen Rivalen.

02

Automation Bench (30,8), SpreadsheetBench 2, BrowseComp (91,2) — agentische Tool-Nutzung und Web-Recherche.

03

SWE Marathon (42,0, #1) — mehrstündige Coding-Sessions.

04

Terminal Bench 2.1 (88,3), Program Bench (77,8), FrontierSWE (81,2) — stark, aber nicht immer #1.

05

OmniDocBench (91,1, #1) — multimodales Dokumentverständnis mit 1M-Kontext-Synergie.

Wo K3 verliert:

01

GDPval v2 Elo: K3 bei 1668–1687 vs. Fable 5 (1760) und Sol (1748) — Lücke bei allgemeinem Reasoning-Polish.

02

DeepSWE: K3 67,5 vs. Sol 73,0 — tiefes Repo-Debugging favorisiert GPT-5.6.

03

FrontierSWE: Fable 5 führt mit 86,6; K3 bei 81,2 solide, aber nicht nah dran.

04

Halluzinationen vs. K2.6: Moonshot räumt Regression bei faktischer Zuverlässigkeit in einigen Domänen ein.

05

Output-Polish / Varianz: Fable 5 und Sol liefern konsistentere Prosa und weniger Format-Fehler bei offenen Aufgaben.

Hinweis: Task-Benchmarks sind Hersteller-Self-Report mit nicht vereinheitlichten Harnesses (K3 Kimi Code, GPT Codex, Claude Claude Code). Als Richtungswert nutzen — vor Produktions-Routing mit eigenen Evals validieren.

Die Open/Closed-Intelligenzlücke an der Frontier ist auf ca. 2–3 AA-Index-Punkte geschrumpft. K3's Pitch ist nicht "wir schlagen Claude" — sondern "wir sind in Schlagdistanz zu einem Drittel des Preises, mit downloadbaren Weights und 1M Kontext."

04

API-Preise und sechs Schritte zum Betrieb von Kimi K3 (inkl. Release-Day-Checkliste)

ModellInput ($/M)Gecachter Input ($/M)Output ($/M)Kontext
Kimi K3$3,00$0,30$15,001M
Claude Sonnet 5$3,00$15,00200K
Claude Fable 5~$15,00~$50,001M
GPT-5.6 Sol~$5,00~$15,00400K
DeepSeek V4 Pro$1,74$0,145$3,48128K

K3-Standardpreis entspricht westlichen Quality-Tier-Modellen ($3/$15), liefert aber ein 5× größeres Kontextfenster als Sonnet-Klasse ohne Längenzuschlag. Gecachter Input bei $0,30/M (ein Zehntel Standard) plus 90 %+ Cache-Hit-Raten in Coding-Workflows senkt effektive Input-Kosten stark. AA-Einzelaufgabe bei $0,94 liegt 9,4 % unter Sol und 65,8 % unter Fable 5 — die Near-Frontier-Kostenstory in einer Zahl. Bei Cloud-API mit Verarbeitung außerhalb der EU: DSGVO-Rollen und Auftragsverarbeitung dokumentieren.

Sechs operative Schritte:

01

Heute über API starten: Registrierung auf kimi.com (kostenlos, Max Reasoning) oder Key auf platform.kimi.ai. base_url = https://api.moonshot.ai/v1, Modell kimi-k3.

02

Cache optimieren: System-Prompts und Tool-Definition-Prefixes in Agent-Workflows wiederverwenden. Mooncake disaggregierte Inferenz zielt auf 90 %+ Cache-Hits — effektiver Input kann Richtung ~$0,55/M sinken (OpenRouter 7-Tage-gewichtet).

03

Routing über OpenRouter: Model-ID moonshotai/kimi-k3 — offizielle Preise, kein Markup, voller 1M-Kontext.

04

Self-Host vs. API entscheiden: API ist für die meisten Teams richtig. Self-Host nur bei Data Residency, Custom Fine-Tuning oder Dauervolumen, das $3/$15 bei Ihrer Skala schlägt.

05

Release-Day-Checkliste 27. Juli: (a) Hugging-Face-Repo und Datei-Manifest prüfen; (b) Modified-MIT-LICENSE lesen; (c) Quant-Variante wählen (MXFP4 vs. NVFP4); (d) vLLM/SGLang-Launch-Befehle aus Model Card ziehen; (e) Mindest-Hardware verifizieren (64+ Beschleuniger, ~1,4 TB bei 4-Bit); (f) Long-Context-Workloads retesten — KDA-Verhalten kann von API abweichen.

06

Mixed-Model-Routing: Lange Coding-Sessions → K3; komplexe Repo-Bugs → Fable 5; terminal-lastige Agenten → GPT-5.6 Sol. Nicht alles auf ein Modell setzen.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diese Codebasis auf Sicherheitslücken..."}]
)
05

Self-Hosting-Realität, Branchenkontext und was der 27. Juli ändert

Self-Deploy-Rechnung: 4-Bit-quantisierte K3-Weights landen bei ca. ~1,4 TB. Produktions-Inferenz braucht einen Supernode mit 64+ Beschleunigern — kein MacBook, keine einzelne RTX 4090. Referenz: Kimi K2.7 Code INT4 nahe ~577 GB; K3 mit 2,8T ist eine andere Infrastrukturklasse.

Drei Szenarien, in denen Self-Hosting Sinn ergibt: (1) Data Residency — Workloads, die Ihre VPC nicht verlassen dürfen; bei personenbezogenen EU-Daten DSGVO-konforme Verarbeitung sicherstellen; (2) Fine-Tuning — Domain-Adapter auf Open Weights; (3) Hohes Volumen — anhaltender Token-Durchsatz, wo Capex Opex schlägt. Alle anderen sollten die API durch den 27. Juli und wahrscheinlich danach nutzen.

SzenarioEmpfohlener WegWarum
Die meisten Entwickler (jetzt)Kimi K3 APIKein Hardware-Capex; 1M Kontext; $0,94/Aufgabe-Tier
Data Residency / Fine-TuningSelf-Host ab 27.7.Modified-MIT-Weights; private VPC-Inferenz
Komplexe Repo-Level-BugsClaude Fable 5 APIFrontierSWE und GDPval v2 führen
Terminal-lastige AgentenGPT-5.6 Sol APIDeepSWE und Terminal Bench Vorsprung
Kostensensitive Bulk-InferenzDeepSeek V4 ProOutput $3,48/M, MIT-Lizenz

Branchenkontext: Die Open/Closed-Lücke an der Frontier beträgt jetzt 2–3 AA-Punkte, nicht 20. Geopolitik prägt das Narrativ — K3 startete am Vorabend der WAIC 2026, während Anthropics Claude Fable 5 am 1. Juli kurz unter US-Exportkontrolle geriet (seitdem wiederhergestellt) und ausländische Entwickler zu Alternativen trieb. Chinas Open-Weights-Welle — GLM-5.2, DeepSeek V4 Pro, MiniMax, jetzt Kimi K3 — ist nicht mehr "günstige Kopien", sondern koordinierter Frontier-Push.

Moonshots Bogen zählt: Nach DeepSeek R1 fiel Kimi kurz auf Rang 7 einiger Leaderboards. Die Sequenz K2 → K2.5 → K3 ist ein gezieltes Comeback — jede Generation mit mehr Kontext, MoE-Skala und jetzt dem größten Open-Weights-Drop der Geschichte. API-Umsatz über 70 % des Gesamtumsatzes; überseeische zahlende Nutzer +400 %. Das ist kein Wohltätigkeits-Open-Weights; es ist eine kommerzielle Plattform mit downloadbarem Moat.

A

57,1 / 3/189: AA Intelligence Index Rang 3 von 189 Modellen — nahe Frontier, 2,8 Punkte hinter Fable 5.

B

$0,94 / 65,8 %: Einzelne AA-Aufgabe $0,94 — 65,8 % unter Fable 5, 9,4 % unter Sol.

C

2,8T / 27. Juli: Größtes Open-Weights-Release ever; erster Checkpoint über 2T Parameter unter Modified MIT.

Fazit: Der 27. Juli ist ein Meilenstein für Open Weights — nicht weil K3 jedes geschlossene Modell schlägt, sondern weil er 2,8T nahe-Frontier-Parameter downloadbar zu API-Preisen liefert, die Claude und GPT pro Aufgabe unterbieten. Auf Ihren Workloads validieren, Modified-MIT-Lizenz lesen und Hardware ehrlich planen vor Self-Hosting.

Alternativen im Überblick: Kimi Code Agenten auf privatem Mac brechen bei Sleep und Netzwerk bei Long-Context-Jobs ab; Warten auf Self-Hosting ab 27.7. braucht einen 64+-Karten-Supernode, den die meisten Teams nicht haben; nur eine geschlossene API verfehlt K3's 1M-Flat-Pricing-Vorteil. Für iOS CI/CD, persistentes Kimi Code und 24/7 AI-Agent-Produktion ist KVMNODE dedizierte Mac Mini M4 Cloud-Miete meist der stabilere Host: Apple Silicon Unified Memory, offenes sudo, flexible Tages-/Wochen-/Monatslaufzeiten. Siehe Preisseite, Hilfezentrum oder direkt bestellen.

Stand: 22. Juli 2026 · Benchmarks inkl. Moonshot-AI-Self-Report · Quellen: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News