Коротко: Moonshot AI выкладывает полные веса Kimi K3 на 2,8 трлн параметров 27 июля 2026 под Modified MIT на Hugging Face — крупнейший open weights релиз на сегодня, с technical report и Day-0 vLLM. K3 не убийца Claude Fable 5: Artificial Analysis даёт 57,1 (3-е из 189), за Fable 5 (59,9) и GPT-5.6 Sol (58,9). Что K3 реально даёт: near-frontier интеллект примерно за треть цены закрытых флагманов плюс контекст 1M токенов, которого нет у closed API с flat pricing. Гайд: таймлайн 16 → 27 июля, open weights vs open source, полные specs архитектуры, бенчмарки — победы и честные провалы, API ($3 / $0.30 cache / $15), железо для self-host, шесть операционных шагов с release-day checklist и контекст индустрии. Архитектура: обзор Kimi K3; также GPT-5.6 Sol и альтернативы Claude Fable 5.
01

Kimi K3 Open Weights: что выходит 27 июля и полный таймлайн

Moonshot AI запустила Kimi K3 16 июля 2026 — API, Kimi App, Kimi Work и Kimi Code за ночь с model ID kimi-k3. Веса идут через 11 дней: 27 июля — полный 2.8T checkpoint, technical report, Modified MIT и ожидаемые Day-0 vLLM/SGLang билды на Hugging Face.

Схема «API сначала, веса потом» — осознанная. Moonshot прогнал продакшен-инференс, pricing и cache economics до открытия крупнейшей скачиваемой модели в истории. Для большинства команд API остаётся правильным путём через июль и дальше; self-host — ниша под data residency, fine-tuning или экстремальный объём.

ДатаВеха
16 июля 2026API K3 live (Kimi App / Work / Code / platform.kimi.ai); старт оценки Artificial Analysis; крупнейшая вызываемая open-weights-class модель на 2.8T
17 июля 2026Открытие WAIC 2026 в Шанхае; Xinhua и госСМИ подают K3 как национальный AI-милистоун; нарратив ARR Moonshot >$300M набирает обороты
27 июля 2026Полные веса + technical report на Hugging Face под Modified MIT; MXFP4/NVFP4 quant builds; vLLM KDA + prefix caching; Ollama/GGUF follow-up в течение дней

В день релиза вы получаете: полные model weights (не distilled), inference configs для vLLM и SGLang, quantization-aware MXFP4/NVFP4 артефакты и technical report по KDA, AttnRes и Stable LatentMoE. Не получаете: training data, полный training codebase или стандартную unmodified MIT лицензию.

01

Рекорд масштаба: 2.8T — крупнейший open weights релиз ever, ~на 75% больше DeepSeek V4 Pro (1.6T), первый checkpoint выше 2T параметров.

02

Tier интеллекта: AA Index 57,1, ранг 3/189 — near-frontier, не #1. Отрыв от Fable 5 — 2,8 пункта, не 28.

03

Tier цены: одна AA-задача $0,949,4% ниже Sol, 65,8% ниже Fable 5. Open weights + flat 1M context — value prop.

04

Типичные косяки: 27 июля как «бесплатный локальный ChatGPT»; игнор commercial clauses Modified MIT; consumer GPU viability; ждать победы над Fable 5 на каждом coding benchmark.

02

Open weights vs open source: Modified MIT и полные specs архитектуры

Open weights — скачать, аудитить, fine-tune и деплоить обученные параметры. Open source классически — полный код, data и свобода лицензии воспроизвести training с нуля. Kimi K3 явно в первом лагере: Moonshot отдаёт weights и technical report под Modified MIT, не reproducible open-source stack.

На практике: исследователи и enterprise fine-tune K3, крутят private inference, аудитят поведение весов. Retrain K3 только из публичных артефактов или claim standard MIT без чтения модификаций Moonshot — особенно по commercial redistribution — нельзя. Индустрия всё чаще говорит «open weights», потому что frontier labs редко открывают всё.

SpecЗначение
Всего параметров2,8 трлн (2.8T)
АрхитектураStable LatentMoE — 896 experts, 16 active (1.8% sparsity)
Attention stackKimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA
Окно контекста1 048 576 tokens (1M)
Входные модальностиText, image, video
Training precisionMXFP4 weights, MXFP8 activations (quantization-aware design)
Scaling vs K2~2.5× scaling efficiency
KDA decode at 1MДо 6.3× быстрее vs full attention; на 75% меньше KV-cache memory
MoE techniquesQuantile Balancing, Per-Head Muon, Sigmoid Tanh Unit (SiTU)
Release licenseModified MIT (Hugging Face, 27 июля)

Почему архитектура важна для self-hosting

Соотношение KDA 3:1 linear-to-full attention — причина, по которой million-token inference вообще обсуждается. Без него KV-cache на 1M tokens был бы prohibitive. AttnRes добавляет cross-depth selective retrieval (~25% training efficiency gain). Stable LatentMoE с Quantile Balancing убирает хрупкие expert-routing heuristics на масштабе 896 experts.

Modified MIT open weights позволяет запускать и fine-tune модель; не позволяет клонировать training run Moonshot. Для большинства prod-команд это feature, не bug.

Quantized release artifacts (MXFP4/NVFP4) заточены под Day-0 vLLM и SGLang. Moonshot тренировала quantization-aware — INT4/FP4 inference не рушит quality как post-hoc quant на других frontier моделях.

03

Бенчмарки vs Claude Fable 5 и GPT-5.6: победы, провалы и честные gaps

K3 конкурентоспособен — не доминирует. Блог Moonshot признаёт слабости vs K2.6 по hallucination rate и vs Fable 5/Sol по polish и output variance. Ниже — aggregate Artificial Analysis плюс self-reported benchmarks Moonshot (разные harness у вендоров).

МодельAA Intelligence Index v4.1AA rank (из 189)Cost одной задачи (AA)
Claude Fable 559,91~$2,75
GPT-5.6 Sol58,92~$1,04
Kimi K357,13$0,94

Где K3 выигрывает:

01

Frontend Code Arena #1 — UI/frontend generation впереди closed rivals.

02

Automation Bench (30.8), SpreadsheetBench 2, BrowseComp (91.2) — agentic tool-use и web research.

03

SWE Marathon (42.0, #1) — multi-hour coding sessions.

04

Terminal Bench 2.1 (88.3), Program Bench (77.8), FrontierSWE (81.2) — сильно, но не всегда #1.

05

OmniDocBench (91.1, #1) — multimodal document understanding + synergy 1M context.

Где K3 проигрывает:

01

GDPval v2 Elo: K3 1668–1687 vs Fable 5 (1760) и Sol (1748) — gap в general reasoning polish.

02

DeepSWE: K3 67.5 vs Sol 73.0 — deep repo debugging всё ещё за GPT-5.6.

03

FrontierSWE: Fable 5 лидирует 86.6; K3 81.2 solid, но не close.

04

Hallucinations vs K2.6: Moonshot признаёт regression по factual reliability в некоторых доменах.

05

Output polish / variance: Fable 5 и Sol дают более consistent prose и меньше format slips на open-ended tasks.

Важно: task benchmarks — vendor self-report с non-unified harness (K3 Kimi Code, GPT Codex, Claude Claude Code). Ориентир; перед prod routing валидируйте на своих eval sets.

Open/closed intelligence gap на frontier сузился до ~2–3 AA Index points. Pitch K3 — не «мы бьём Claude», а «мы в striking distance за треть цены, с downloadable weights и 1M context».

04

Цены API и шесть шагов запуска Kimi K3 (с release-day checklist)

МодельInput ($/M)Cached input ($/M)Output ($/M)Context
Kimi K3$3.00$0.30$15.001M
Claude Sonnet 5$3.00$15.00200K
Claude Fable 5~$15.00~$50.001M
GPT-5.6 Sol~$5.00~$15.00400K
DeepSeek V4 Pro$1.74$0.145$3.48128K

Standard pricing K3 совпадает с western quality-tier ($3/$15), но context window в 5× больше Sonnet-class API без length surcharge. Cached input $0.30/M (1/10 standard) плюс 90%+ cache hit в coding workflows — effective input cost очень низкий. AA single-task $0.94: 9.4% ниже Sol, 65.8% ниже Fable 5 — near-frontier cost story в одной цифре.

Шесть операционных шагов:

01

Старт через API сегодня: регистрация на kimi.com (free, max reasoning) или key на platform.kimi.ai. base_url = https://api.moonshot.ai/v1, model kimi-k3.

02

Оптимизация cache: reuse system prompts и tool-definition prefixes в agent workflows. Mooncake disaggregated inference — 90%+ cache hits; effective input ~$0.55/M (OpenRouter 7-day weighted).

03

Route через OpenRouter: model ID moonshotai/kimi-k3 — official pricing, no markup, full 1M context.

04

Self-host vs API: API — default для большинства. Self-host только под data residency, custom fine-tuning или sustained volume, где capex бьёт $3/$15 на вашем scale.

05

Release-day checklist 27 июля: (a) Hugging Face repo и file manifest; (b) Modified MIT LICENSE; (c) quant variant MXFP4 vs NVFP4; (d) vLLM/SGLang launch commands из model card; (e) minimum hardware 64+ accelerators, ~1.4 TB at 4-bit; (f) retest long-context — KDA behavior может отличаться от API.

06

Mixed model routing: long coding sessions → K3; complex repo bugs → Fable 5; terminal-heavy agents → GPT-5.6 Sol. Не all-in на одну модель.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Проанализируй эту codebase на security issues..."}]
)
05

Self-hosting reality, контекст индустрии и что меняет 27 июля

Self-deploy math: 4-bit quantized K3 weights — около ~1.4 TB. Production inference требует supernode 64+ accelerators — не MacBook, не single RTX 4090. Scale reference: Kimi K2.7 Code INT4 ~577 GB; K3 на 2.8T — другой infrastructure class.

Три сценария, где self-hosting имеет смысл: (1) Data residency — workloads не покидают ваш VPC; (2) Fine-tuning — domain adapters поверх open weights; (3) High volume — sustained token throughput, где capex бьёт opex. Остальным — API через 27 июля и скорее всего после.

СценарийРекомендуемый путьПочему
Большинство dev (сейчас)Kimi K3 APIНет hardware capex; 1M context; tier $0.94/task
Data residency / fine-tuningSelf-host post 27.7.Modified MIT weights; private VPC inference
Complex repo-level bugsClaude Fable 5 APIFrontierSWE и GDPval v2 lead
Terminal-heavy agentsGPT-5.6 Sol APIDeepSWE и Terminal Bench edge
Cost-sensitive bulk inferenceDeepSeek V4 ProOutput $3.48/M, MIT license

Контекст индустрии: open/closed gap на frontier — 2–3 AA points, не 20. Geopolitics формирует narrative — K3 накануне WAIC 2026, Anthropic Claude Fable 5 1 июля кратко под US export-control (восстановлен), foreign devs ушли к alternatives. Китайская open-weights волна — GLM-5.2, DeepSeek V4 Pro, MiniMax, теперь Kimi K3 — уже не «cheap copies», а coordinated frontier push.

Arc Moonshot: после DeepSeek R1 Kimi падала до rank 7 на некоторых leaderboards. Последовательность K2 → K2.5 → K3 — deliberate comeback: context, MoE scale, теперь крупнейший open weights drop. API revenue >70% total; overseas paid users +400%. Не charity open weights — commercial platform play с downloadable moat.

A

57.1 / 3/189: AA Intelligence Index rank 3 of 189 — near-frontier, 2.8 points behind Fable 5.

B

$0.94 / 65.8%: single AA task $0.94 — 65.8% below Fable 5, 9.4% below Sol.

C

2.8T / 27 июля: largest open weights release; first checkpoint above 2T under Modified MIT.

Итог: 27 июля — landmark для open weights не потому, что K3 бьёт каждую closed model, а потому что кладёт 2.8T near-frontier parameters в downloadable form по API prices ниже Claude/GPT per task. Валидируйте workloads, читайте Modified MIT, планируйте hardware честно до self-hosting.

Альтернативы: Kimi Code agents на личном Mac — sleep и network drops на long-context jobs; ждать self-host 27.7. — supernode 64+ cards, которого у большинства нет; single closed API — мимо 1M flat pricing K3. Для iOS CI/CD, persistent Kimi Code и 24/7 AI agent production аренда dedicated Mac Mini M4 KVMNODE обычно стабильнее: Apple Silicon unified memory, open sudo, flexible daily/weekly/monthly terms. Цены, центр помощи, оформить заказ.

Данные на 22 июля 2026 · benchmarks incl. Moonshot AI self-report · sources: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis, VentureBeat, Northflank, r/LocalLLaMA, Hacker News