Kimi K3 Open Weights: что выходит 27 июля и полный таймлайн
Moonshot AI запустила Kimi K3 16 июля 2026 — API, Kimi App, Kimi Work и Kimi Code за ночь с model ID kimi-k3. Веса идут через 11 дней: 27 июля — полный 2.8T checkpoint, technical report, Modified MIT и ожидаемые Day-0 vLLM/SGLang билды на Hugging Face.
Схема «API сначала, веса потом» — осознанная. Moonshot прогнал продакшен-инференс, pricing и cache economics до открытия крупнейшей скачиваемой модели в истории. Для большинства команд API остаётся правильным путём через июль и дальше; self-host — ниша под data residency, fine-tuning или экстремальный объём.
| Дата | Веха |
|---|---|
| 16 июля 2026 | API K3 live (Kimi App / Work / Code / platform.kimi.ai); старт оценки Artificial Analysis; крупнейшая вызываемая open-weights-class модель на 2.8T |
| 17 июля 2026 | Открытие WAIC 2026 в Шанхае; Xinhua и госСМИ подают K3 как национальный AI-милистоун; нарратив ARR Moonshot >$300M набирает обороты |
| 27 июля 2026 | Полные веса + technical report на Hugging Face под Modified MIT; MXFP4/NVFP4 quant builds; vLLM KDA + prefix caching; Ollama/GGUF follow-up в течение дней |
В день релиза вы получаете: полные model weights (не distilled), inference configs для vLLM и SGLang, quantization-aware MXFP4/NVFP4 артефакты и technical report по KDA, AttnRes и Stable LatentMoE. Не получаете: training data, полный training codebase или стандартную unmodified MIT лицензию.
Рекорд масштаба: 2.8T — крупнейший open weights релиз ever, ~на 75% больше DeepSeek V4 Pro (1.6T), первый checkpoint выше 2T параметров.
Tier интеллекта: AA Index 57,1, ранг 3/189 — near-frontier, не #1. Отрыв от Fable 5 — 2,8 пункта, не 28.
Tier цены: одна AA-задача $0,94 — 9,4% ниже Sol, 65,8% ниже Fable 5. Open weights + flat 1M context — value prop.
Типичные косяки: 27 июля как «бесплатный локальный ChatGPT»; игнор commercial clauses Modified MIT; consumer GPU viability; ждать победы над Fable 5 на каждом coding benchmark.
Open weights vs open source: Modified MIT и полные specs архитектуры
Open weights — скачать, аудитить, fine-tune и деплоить обученные параметры. Open source классически — полный код, data и свобода лицензии воспроизвести training с нуля. Kimi K3 явно в первом лагере: Moonshot отдаёт weights и technical report под Modified MIT, не reproducible open-source stack.
На практике: исследователи и enterprise fine-tune K3, крутят private inference, аудитят поведение весов. Retrain K3 только из публичных артефактов или claim standard MIT без чтения модификаций Moonshot — особенно по commercial redistribution — нельзя. Индустрия всё чаще говорит «open weights», потому что frontier labs редко открывают всё.
| Spec | Значение |
|---|---|
| Всего параметров | 2,8 трлн (2.8T) |
| Архитектура | Stable LatentMoE — 896 experts, 16 active (1.8% sparsity) |
| Attention stack | Kimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA |
| Окно контекста | 1 048 576 tokens (1M) |
| Входные модальности | Text, image, video |
| Training precision | MXFP4 weights, MXFP8 activations (quantization-aware design) |
| Scaling vs K2 | ~2.5× scaling efficiency |
| KDA decode at 1M | До 6.3× быстрее vs full attention; на 75% меньше KV-cache memory |
| MoE techniques | Quantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU) |
| Release license | Modified MIT (Hugging Face, 27 июля) |
Почему архитектура важна для self-hosting
Соотношение KDA 3:1 linear-to-full attention — причина, по которой million-token inference вообще обсуждается. Без него KV-cache на 1M tokens был бы prohibitive. AttnRes добавляет cross-depth selective retrieval (~25% training efficiency gain). Stable LatentMoE с Quantile Balancing убирает хрупкие expert-routing heuristics на масштабе 896 experts.
Modified MIT open weights позволяет запускать и fine-tune модель; не позволяет клонировать training run Moonshot. Для большинства prod-команд это feature, не bug.
Quantized release artifacts (MXFP4/NVFP4) заточены под Day-0 vLLM и SGLang. Moonshot тренировала quantization-aware — INT4/FP4 inference не рушит quality как post-hoc quant на других frontier моделях.
Бенчмарки vs Claude Fable 5 и GPT-5.6: победы, провалы и честные gaps
K3 конкурентоспособен — не доминирует. Блог Moonshot признаёт слабости vs K2.6 по hallucination rate и vs Fable 5/Sol по polish и output variance. Ниже — aggregate Artificial Analysis плюс self-reported benchmarks Moonshot (разные harness у вендоров).
| Модель | AA Intelligence Index v4.1 | AA rank (из 189) | Cost одной задачи (AA) |
|---|---|---|---|
| Claude Fable 5 | 59,9 | 1 | ~$2,75 |
| GPT-5.6 Sol | 58,9 | 2 | ~$1,04 |
| Kimi K3 | 57,1 | 3 | $0,94 |
Где K3 выигрывает:
Frontend Code Arena #1 — UI/frontend generation впереди closed rivals.
Automation Bench (30.8), SpreadsheetBench 2, BrowseComp (91.2) — agentic tool-use и web research.
SWE Marathon (42.0, #1) — multi-hour coding sessions.
Terminal Bench 2.1 (88.3), Program Bench (77.8), FrontierSWE (81.2) — сильно, но не всегда #1.
OmniDocBench (91.1, #1) — multimodal document understanding + synergy 1M context.
Где K3 проигрывает:
GDPval v2 Elo: K3 1668–1687 vs Fable 5 (1760) и Sol (1748) — gap в general reasoning polish.
DeepSWE: K3 67.5 vs Sol 73.0 — deep repo debugging всё ещё за GPT-5.6.
FrontierSWE: Fable 5 лидирует 86.6; K3 81.2 solid, но не close.
Hallucinations vs K2.6: Moonshot признаёт regression по factual reliability в некоторых доменах.
Output polish / variance: Fable 5 и Sol дают более consistent prose и меньше format slips на open-ended tasks.
Важно: task benchmarks — vendor self-report с non-unified harness (K3 Kimi Code, GPT Codex, Claude Claude Code). Ориентир; перед prod routing валидируйте на своих eval sets.
Open/closed intelligence gap на frontier сузился до ~2–3 AA Index points. Pitch K3 — не «мы бьём Claude», а «мы в striking distance за треть цены, с downloadable weights и 1M context».
Цены API и шесть шагов запуска Kimi K3 (с release-day checklist)
| Модель | Input ($/M) | Cached input ($/M) | Output ($/M) | Context |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $0.30 | $15.00 | 1M |
| Claude Sonnet 5 | $3.00 | — | $15.00 | 200K |
| Claude Fable 5 | ~$15.00 | — | ~$50.00 | 1M |
| GPT-5.6 Sol | ~$5.00 | — | ~$15.00 | 400K |
| DeepSeek V4 Pro | $1.74 | $0.145 | $3.48 | 128K |
Standard pricing K3 совпадает с western quality-tier ($3/$15), но context window в 5× больше Sonnet-class API без length surcharge. Cached input $0.30/M (1/10 standard) плюс 90%+ cache hit в coding workflows — effective input cost очень низкий. AA single-task $0.94: 9.4% ниже Sol, 65.8% ниже Fable 5 — near-frontier cost story в одной цифре.
Шесть операционных шагов:
Старт через API сегодня: регистрация на kimi.com (free, max reasoning) или key на platform.kimi.ai. base_url = https://api.moonshot.ai/v1, model kimi-k3.
Оптимизация cache: reuse system prompts и tool-definition prefixes в agent workflows. Mooncake disaggregated inference — 90%+ cache hits; effective input ~$0.55/M (OpenRouter 7-day weighted).
Route через OpenRouter: model ID moonshotai/kimi-k3 — official pricing, no markup, full 1M context.
Self-host vs API: API — default для большинства. Self-host только под data residency, custom fine-tuning или sustained volume, где capex бьёт $3/$15 на вашем scale.
Release-day checklist 27 июля: (a) Hugging Face repo и file manifest; (b) Modified MIT LICENSE; (c) quant variant MXFP4 vs NVFP4; (d) vLLM/SGLang launch commands из model card; (e) minimum hardware 64+ accelerators, ~1.4 TB at 4-bit; (f) retest long-context — KDA behavior может отличаться от API.
Mixed model routing: long coding sessions → K3; complex repo bugs → Fable 5; terminal-heavy agents → GPT-5.6 Sol. Не all-in на одну модель.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Проанализируй эту codebase на security issues..."}]
)Self-hosting reality, контекст индустрии и что меняет 27 июля
Self-deploy math: 4-bit quantized K3 weights — около ~1.4 TB. Production inference требует supernode 64+ accelerators — не MacBook, не single RTX 4090. Scale reference: Kimi K2.7 Code INT4 ~577 GB; K3 на 2.8T — другой infrastructure class.
Три сценария, где self-hosting имеет смысл: (1) Data residency — workloads не покидают ваш VPC; (2) Fine-tuning — domain adapters поверх open weights; (3) High volume — sustained token throughput, где capex бьёт opex. Остальным — API через 27 июля и скорее всего после.
| Сценарий | Рекомендуемый путь | Почему |
|---|---|---|
| Большинство dev (сейчас) | Kimi K3 API | Нет hardware capex; 1M context; tier $0.94/task |
| Data residency / fine-tuning | Self-host post 27.7. | Modified MIT weights; private VPC inference |
| Complex repo-level bugs | Claude Fable 5 API | FrontierSWE и GDPval v2 lead |
| Terminal-heavy agents | GPT-5.6 Sol API | DeepSWE и Terminal Bench edge |
| Cost-sensitive bulk inference | DeepSeek V4 Pro | Output $3.48/M, MIT license |
Контекст индустрии: open/closed gap на frontier — 2–3 AA points, не 20. Geopolitics формирует narrative — K3 накануне WAIC 2026, Anthropic Claude Fable 5 1 июля кратко под US export-control (восстановлен), foreign devs ушли к alternatives. Китайская open-weights волна — GLM-5.2, DeepSeek V4 Pro, MiniMax, теперь Kimi K3 — уже не «cheap copies», а coordinated frontier push.
Arc Moonshot: после DeepSeek R1 Kimi падала до rank 7 на некоторых leaderboards. Последовательность K2 → K2.5 → K3 — deliberate comeback: context, MoE scale, теперь крупнейший open weights drop. API revenue >70% total; overseas paid users +400%. Не charity open weights — commercial platform play с downloadable moat.
57.1 / 3/189: AA Intelligence Index rank 3 of 189 — near-frontier, 2.8 points behind Fable 5.
$0.94 / 65.8%: single AA task $0.94 — 65.8% below Fable 5, 9.4% below Sol.
2.8T / 27 июля: largest open weights release; first checkpoint above 2T under Modified MIT.
Итог: 27 июля — landmark для open weights не потому, что K3 бьёт каждую closed model, а потому что кладёт 2.8T near-frontier parameters в downloadable form по API prices ниже Claude/GPT per task. Валидируйте workloads, читайте Modified MIT, планируйте hardware честно до self-hosting.
Альтернативы: Kimi Code agents на личном Mac — sleep и network drops на long-context jobs; ждать self-host 27.7. — supernode 64+ cards, которого у большинства нет; single closed API — мимо 1M flat pricing K3. Для iOS CI/CD, persistent Kimi Code и 24/7 AI agent production аренда dedicated Mac Mini M4 KVMNODE обычно стабильнее: Apple Silicon unified memory, open sudo, flexible daily/weekly/monthly terms. Цены, центр помощи, оформить заказ.
Данные на 22 июля 2026 · benchmarks incl. Moonshot AI self-report · sources: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News