Если вы оцениваете Kimi K3 для продакшена, первый вопрос — не сколько у модели параметров, а является ли релиз Moonshot AI настоящим open source. Вечером 27 июля 2026 года китайская лаборатория опубликовала полные веса MoE-модели на 2,8 трлн параметров с контекстом в 1 млн токенов, а также три инфраструктурных релиза: MoonEP, FlashKDA и AgentEnv. В статье — 11-дневный таймлайн, архитектура KDA / AttnRes / Per-Head Muon, бенчмарки SWE-bench и AA Index, два коммерческих порога лицензии и чеклист развёртывания из шести шагов. Контекст: обзор open weights K3, контроверсия дистилляции.
01

Kimi K3 — open source или только open weight?

Короткий ответ: нет, в строгом смысле — и Moonshot AI сама так не заявляет. 27 июля 2026 Moonshot опубликовала полные веса и technical report Kimi K3 — Mixture-of-Experts на 2,8 трлн параметров с нативным пониманием изображений. Загрузка ~1,56 ТБ за 30 минут вышла на 1-е место трендов Hugging Face — K3 стал крупнейшей когда-либо полностью опубликованной open-weight моделью.

ДатаВехаКлючевой момент
16 июляЗапуск APIKimi App / Work / Code / API в работе; веса ещё не публичны
17 июляWAIC 2026ГосСМИ называют модель крупнейшей open model по числу параметров
22–23 июляСпор о дистилляцииСоветник Белого дома Kratsios обвиняет Moonshot в промышленной дистилляции модели Fable Anthropic
27 июляПолные весаПолные веса + technical report + MoonEP / AgentEnv (FlashKDA уже открыт)
28 июляОтвет MOFCOMМинкоммерции КНР обвиняет Вашингтон в «AI-гегемонизме»
01

Путать open weight с open source: Moonshot никогда не говорит «open source» — обучающие данные и полный код обучения не публичны.

02

Недооценивать пороги лицензии: K3 добавляет порог MaaS $20M и требование атрибуции 100M MAU, которых не было в семействе K2.

03

Думать, что consumer-железо потянет: 2,8T параметров, 896 экспертов — Moonshot рекомендует supernode с 64+ ускорителями.

04

Гнаться за параметрами, а не за стоимостью: K3 — потолок open weight, но ~$0,95/задача против ~$0,47 у GLM-5.2.

05

Игнорировать геополитический комплаенс: Спор США–Китай о дистилляции на фоне WAIC 2026 добавляет риск supply-chain для enterprise-закупок.

02

Спецификации и архитектура Kimi K3: KDA, AttnRes и Per-Head Muon

СпецификацияЗначение
Всего параметров2,8 трлн
Активных параметров~104 млрд
Конфигурация экспертов896 маршрутизируемых экспертов, 16 активных на токен (~1,8% sparsity)
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA)
Контекстное окно1 000 000 токенов
МультимодальностьНативное зрение (ViT-V2, 27 слоёв)
Формат весовВеса MXFP4, активации MXFP8 (quantization-aware с SFT)
Размер загрузки~1,56 ТБ (Hugging Face)
ЛицензияCustom — Moonshot называет «open weight», не «open source»

Kimi Delta Attention (KDA) заменяет одно скалярное gate забывания на поканальное gating: каждое измерение признака получает свою скорость затухания, реализовано как chunkwise DPLR для линейной по времени рекурсии. K3 чередует KDA со слоями Gated MLA — гибридный дизайн за окном 1M и минимальным KV cache.

Attention Residuals (AttnRes) заменяют равномерное накопление residual на селективную, зависящую от входа агрегацию по всем предыдущим слоям — ~25% выше эффективность обучения при менее чем 2% дополнительных параметров.

Per-Head Muon оптимизирует каждую голову attention независимо. Stable LatentMoE использует Quantile Balancing с математическим доказательством MoonEP верхних границ избыточных экспертов на compute rank.

КомпонентРешаемая проблемаКлючевой выигрыш
KDAВзрыв KV cache на длинных последовательностяхЛинейная рекурсия, минимальный VRAM
AttnResРазбавление сигнала ранних слоёв на глубине~25% прирост эффективности обучения
Per-Head MuonЕдиный оптимизатор для головFrontier-класс при меньшем числе активных параметров
Stable LatentMoEДисбаланс нагрузки экспертов в масштабе896 маршрутизируемых, 16 активных — 1,8% sparsity
03

Три инфраструктурных релиза и бенчмарки vs GPT-5.6, Claude, GLM-5.2

ТехнологияРольКлючевые цифры
MoonEPMoE-коммуникация в экстремальном масштабеДублирует перегруженных экспертов; доказывает верхнюю границу избыточных экспертов на rank
FlashKDACUTLASS KDA kernelPrefill в 1,72×–2,22× быстрее на H20 vs baseline flash-linear-attention
AgentEnvFirecracker microVM sandbox для агентовCheckpoint ~133 ms, resume ~49 ms, overcommit памяти до 6,5×

SWE-bench Verified (независимая оценка, Vals AI, июль 2026):

МодельОценкаДата релиза
Claude Opus 597%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393,4%2026-07-16
GLM-5.2 (max)51 (AA Index)Прежний лидер open weight

В Artificial Analysis Intelligence Index (max reasoning) Kimi K3 набирает ~57 — 3-е место в общем рейтинге, 1-е среди open-weight моделей. Это потолок возможностей open-weight tier, но при ~$0,95/задача дороже GLM-5.2 (~$0,47). K3 сейчас лидирует в Arena.ai Frontend Code Arena.

04

Коммерческие пороги лицензии и чеклист развёртывания из шести шагов

Moonshot последовательно называет это «open-weight» релизом, никогда «open source». Лицензия — полностью кастомный документ с двумя коммерческими порогами, которых не было в семействе K2:

ПорогТриггерТребование
Порог выручки MaaSВыручка Model-as-a-Service превышает $20M за любые 12 месяцевОтдельное коммерческое соглашение с Moonshot AI
Порог атрибуции100M+ MAU или $20M+ месячной выручкиЗаметно отображать «Kimi K3» в UI продукта
Тип токенаЦена за миллион токенов
Input (cache hit)$0,30
Input (cache miss)$3,00
Output (включая reasoning trace)$15,00

Дизагрегированная serving-архитектура Mooncake Moonshot держит cache hit rate выше 90% на типичных coding workloads — большинство реального использования ближе к $0,30.

01

Регистрация API: Создайте ключ на platform.kimi.ai, base_urlhttps://api.moonshot.ai/v1, ID модели kimi-k3.

02

Проверка LICENSE: Перед загрузкой весов с Hugging Face юристы должны подтвердить, применимы ли пороги MaaS или MAU.

03

Интеграция совместимая с OpenAI SDK: Большинству проектов достаточно сменить base URL и API key.

04

Оптимизация префиксов кэша: Переиспользуйте system prompt и префиксы определений инструментов — coding-агенты достигают 90%+ cache rate, эффективная цена input падает до $0,30/M.

05

Проверка железа для self-host: Подтвердите supernode на 64+ ускорителей; для большинства команд практичнее OpenRouter или аналоги (уже 7 провайдеров).

06

Выбор inference stack: Развёртывание через vLLM (KDA + prefix caching) или SGLang; FlashKDA напрямую заменяет backend chunk_kda.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Проанализируй сложность этого кода..."}]
)
05

Контекст спора США–Китай в AI и три твёрдые цифры

Open-weight релиз Kimi K3 пришёлся на WAIC 2026 и через несколько дней после эскалации спора США–Китай о «дистилляции моделей»: научный советник Белого дома Michael Kratsios обвинил Moonshot в крупномасштабной дистилляции против модели Fable Anthropic, министр финансов Scott Bessent намекнул на санкции. Минкоммерции КНР 28 июля ответила обвинением в «AI-гегемонизме». Через три дня после K3 Alibaba представила Qwen3.8-Max-Preview — широко воспринято как прямой ответ, гонка open weight вошла в «клуб 3T».

A

2,8T / #1 open weight: Крупнейшая когда-либо полностью опубликованная open-weight модель — 1,56 ТБ на Hugging Face, #1 в трендах за 30 минут.

B

93,4% / #3 в мире: Независимый SWE-bench Verified 93,4%; AA Index ~57 — третье место в общем рейтинге, первое среди open weight.

C

11 дней / три infra: От запуска API до полных весов за 11 дней, с параллельным открытием MoonEP, FlashKDA и AgentEnv.

Практические альтернативы тоже имеют скрытые издержки: запуск Kimi Code agents на личном Mac ломается на sleep и обрывах сети; self-host полного K3 требует 64+ ускорителей, которые большинство команд не может выделить; зависимость от одного закрытого API лишает преимущества flat pricing K3 на 1M токенов. Для продакшен iOS CI/CD и автоматизации AI-агентов 24/7 аренда выделенного Mac Mini в облаке KVMNODE обычно лучше: нативный Apple Silicon, полный sudo, гибкая оплата по дням/неделям/месяцам. См. страницу цен, центр помощи или оформить заказ.

Данные на 28 июля 2026 · Источники: официальный блог Moonshot AI, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index