Kimi K3 — open source или только open weight?
Короткий ответ: нет, в строгом смысле — и Moonshot AI сама так не заявляет. 27 июля 2026 Moonshot опубликовала полные веса и technical report Kimi K3 — Mixture-of-Experts на 2,8 трлн параметров с нативным пониманием изображений. Загрузка ~1,56 ТБ за 30 минут вышла на 1-е место трендов Hugging Face — K3 стал крупнейшей когда-либо полностью опубликованной open-weight моделью.
| Дата | Веха | Ключевой момент |
|---|---|---|
| 16 июля | Запуск API | Kimi App / Work / Code / API в работе; веса ещё не публичны |
| 17 июля | WAIC 2026 | ГосСМИ называют модель крупнейшей open model по числу параметров |
| 22–23 июля | Спор о дистилляции | Советник Белого дома Kratsios обвиняет Moonshot в промышленной дистилляции модели Fable Anthropic |
| 27 июля | Полные веса | Полные веса + technical report + MoonEP / AgentEnv (FlashKDA уже открыт) |
| 28 июля | Ответ MOFCOM | Минкоммерции КНР обвиняет Вашингтон в «AI-гегемонизме» |
Путать open weight с open source: Moonshot никогда не говорит «open source» — обучающие данные и полный код обучения не публичны.
Недооценивать пороги лицензии: K3 добавляет порог MaaS $20M и требование атрибуции 100M MAU, которых не было в семействе K2.
Думать, что consumer-железо потянет: 2,8T параметров, 896 экспертов — Moonshot рекомендует supernode с 64+ ускорителями.
Гнаться за параметрами, а не за стоимостью: K3 — потолок open weight, но ~$0,95/задача против ~$0,47 у GLM-5.2.
Игнорировать геополитический комплаенс: Спор США–Китай о дистилляции на фоне WAIC 2026 добавляет риск supply-chain для enterprise-закупок.
Спецификации и архитектура Kimi K3: KDA, AttnRes и Per-Head Muon
| Спецификация | Значение |
|---|---|
| Всего параметров | 2,8 трлн |
| Активных параметров | ~104 млрд |
| Конфигурация экспертов | 896 маршрутизируемых экспертов, 16 активных на токен (~1,8% sparsity) |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| Контекстное окно | 1 000 000 токенов |
| Мультимодальность | Нативное зрение (ViT-V2, 27 слоёв) |
| Формат весов | Веса MXFP4, активации MXFP8 (quantization-aware с SFT) |
| Размер загрузки | ~1,56 ТБ (Hugging Face) |
| Лицензия | Custom — Moonshot называет «open weight», не «open source» |
Kimi Delta Attention (KDA) заменяет одно скалярное gate забывания на поканальное gating: каждое измерение признака получает свою скорость затухания, реализовано как chunkwise DPLR для линейной по времени рекурсии. K3 чередует KDA со слоями Gated MLA — гибридный дизайн за окном 1M и минимальным KV cache.
Attention Residuals (AttnRes) заменяют равномерное накопление residual на селективную, зависящую от входа агрегацию по всем предыдущим слоям — ~25% выше эффективность обучения при менее чем 2% дополнительных параметров.
Per-Head Muon оптимизирует каждую голову attention независимо. Stable LatentMoE использует Quantile Balancing с математическим доказательством MoonEP верхних границ избыточных экспертов на compute rank.
| Компонент | Решаемая проблема | Ключевой выигрыш |
|---|---|---|
| KDA | Взрыв KV cache на длинных последовательностях | Линейная рекурсия, минимальный VRAM |
| AttnRes | Разбавление сигнала ранних слоёв на глубине | ~25% прирост эффективности обучения |
| Per-Head Muon | Единый оптимизатор для голов | Frontier-класс при меньшем числе активных параметров |
| Stable LatentMoE | Дисбаланс нагрузки экспертов в масштабе | 896 маршрутизируемых, 16 активных — 1,8% sparsity |
Три инфраструктурных релиза и бенчмарки vs GPT-5.6, Claude, GLM-5.2
| Технология | Роль | Ключевые цифры |
|---|---|---|
| MoonEP | MoE-коммуникация в экстремальном масштабе | Дублирует перегруженных экспертов; доказывает верхнюю границу избыточных экспертов на rank |
| FlashKDA | CUTLASS KDA kernel | Prefill в 1,72×–2,22× быстрее на H20 vs baseline flash-linear-attention |
| AgentEnv | Firecracker microVM sandbox для агентов | Checkpoint ~133 ms, resume ~49 ms, overcommit памяти до 6,5× |
SWE-bench Verified (независимая оценка, Vals AI, июль 2026):
| Модель | Оценка | Дата релиза |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| GLM-5.2 (max) | 51 (AA Index) | Прежний лидер open weight |
В Artificial Analysis Intelligence Index (max reasoning) Kimi K3 набирает ~57 — 3-е место в общем рейтинге, 1-е среди open-weight моделей. Это потолок возможностей open-weight tier, но при ~$0,95/задача дороже GLM-5.2 (~$0,47). K3 сейчас лидирует в Arena.ai Frontend Code Arena.
Коммерческие пороги лицензии и чеклист развёртывания из шести шагов
Moonshot последовательно называет это «open-weight» релизом, никогда «open source». Лицензия — полностью кастомный документ с двумя коммерческими порогами, которых не было в семействе K2:
| Порог | Триггер | Требование |
|---|---|---|
| Порог выручки MaaS | Выручка Model-as-a-Service превышает $20M за любые 12 месяцев | Отдельное коммерческое соглашение с Moonshot AI |
| Порог атрибуции | 100M+ MAU или $20M+ месячной выручки | Заметно отображать «Kimi K3» в UI продукта |
| Тип токена | Цена за миллион токенов |
|---|---|
| Input (cache hit) | $0,30 |
| Input (cache miss) | $3,00 |
| Output (включая reasoning trace) | $15,00 |
Дизагрегированная serving-архитектура Mooncake Moonshot держит cache hit rate выше 90% на типичных coding workloads — большинство реального использования ближе к $0,30.
Регистрация API: Создайте ключ на platform.kimi.ai, base_url — https://api.moonshot.ai/v1, ID модели kimi-k3.
Проверка LICENSE: Перед загрузкой весов с Hugging Face юристы должны подтвердить, применимы ли пороги MaaS или MAU.
Интеграция совместимая с OpenAI SDK: Большинству проектов достаточно сменить base URL и API key.
Оптимизация префиксов кэша: Переиспользуйте system prompt и префиксы определений инструментов — coding-агенты достигают 90%+ cache rate, эффективная цена input падает до $0,30/M.
Проверка железа для self-host: Подтвердите supernode на 64+ ускорителей; для большинства команд практичнее OpenRouter или аналоги (уже 7 провайдеров).
Выбор inference stack: Развёртывание через vLLM (KDA + prefix caching) или SGLang; FlashKDA напрямую заменяет backend chunk_kda.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Проанализируй сложность этого кода..."}]
)Контекст спора США–Китай в AI и три твёрдые цифры
Open-weight релиз Kimi K3 пришёлся на WAIC 2026 и через несколько дней после эскалации спора США–Китай о «дистилляции моделей»: научный советник Белого дома Michael Kratsios обвинил Moonshot в крупномасштабной дистилляции против модели Fable Anthropic, министр финансов Scott Bessent намекнул на санкции. Минкоммерции КНР 28 июля ответила обвинением в «AI-гегемонизме». Через три дня после K3 Alibaba представила Qwen3.8-Max-Preview — широко воспринято как прямой ответ, гонка open weight вошла в «клуб 3T».
2,8T / #1 open weight: Крупнейшая когда-либо полностью опубликованная open-weight модель — 1,56 ТБ на Hugging Face, #1 в трендах за 30 минут.
93,4% / #3 в мире: Независимый SWE-bench Verified 93,4%; AA Index ~57 — третье место в общем рейтинге, первое среди open weight.
11 дней / три infra: От запуска API до полных весов за 11 дней, с параллельным открытием MoonEP, FlashKDA и AgentEnv.
Практические альтернативы тоже имеют скрытые издержки: запуск Kimi Code agents на личном Mac ломается на sleep и обрывах сети; self-host полного K3 требует 64+ ускорителей, которые большинство команд не может выделить; зависимость от одного закрытого API лишает преимущества flat pricing K3 на 1M токенов. Для продакшен iOS CI/CD и автоматизации AI-агентов 24/7 аренда выделенного Mac Mini в облаке KVMNODE обычно лучше: нативный Apple Silicon, полный sudo, гибкая оплата по дням/неделям/месяцам. См. страницу цен, центр помощи или оформить заказ.
Данные на 28 июля 2026 · Источники: официальный блог Moonshot AI, Hugging Face, GitHub moonshotai/FlashKDA, Vals AI SWE-bench Verified, Artificial Analysis Intelligence Index