Таймлайн: что произошло и когда
Отодвиньте кадр шире — и картина становится жёстче: 30 июля OpenAI срезал цены на самый дешёвый SKU (GPT-5.6 Luna, −80%), а 6–7 августа сделал Luna бесплатным дефолтом с безлимитными текстовыми чатами. Пока китайские лаборатории поднимали тарифы и открывали веса флагманов, американские лаборатории резали цены и уходили в free на consumer-слое — в тот же календарный интервал. Это не совпадение, а две стороны одной ценовой войны.
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открывает веса Kimi K3 (2.8T параметров), что вызывает scrutiny со стороны US security |
| 2–3 августа 2026 | Alibaba сначала показывает preview, затем запускает Qwen3.8-Max как hosted API |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0), анонсирует open weights для флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует open weights Qwen3.8-2.4T-A95B на Hugging Face/ModelScope; xAI выпускает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает Gemini 3.7 Flash со скидкой |
| 14 августа 2026 | Zhipu выпускает GLM-5.3, переиспользуя базу GLM-5.2 на 743B |
| 17 августа 2026, 00:00 по пекинскому времени | Новый прайс DeepSeek вступает в силу |
Заголовочные проценты смешивают позиции биллинга: «11x», «свыше 1,100%» и «350%» все верны — они относятся к cache-hit input, output и cache-miss input.
Open weights — не Apache 2.0: у Qwen3.8-Max кастомная лицензия, которая сохраняет ценовой рычаг над крупными коммерческими пользователями.
Та же база, большой скачок: GLM-5.3 не переобучала foundation model; работу сделал масштабированный post-training RL.
Формула «китайская модель = самая дешёвая» ломается: DeepSeek off-peak всё ещё дешевле Claude Opus 5, но уже не абсолютный минимум на рынке.
Два фуннела, один месяц: китайские лаборатории открывают веса флагманов и поднимают дифференцированные тарифы; американские уходят в free и cheap на consumer-слое.
Цифры: тарифы DeepSeek, спецификации Qwen3.8, скоры GLM-5.3
Новый прайс DeepSeek вступил в силу в 00:00 по пекинскому времени 17 августа. Пиковые часы — 9:00–12:00 и 14:00–18:00 по пекинскому времени. Заголовочные «1,100%» относятся строго к peak-hour cache-hit input — позиции, которая стартовала ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350%.
| Позиция биллинга (за 1M токенов) | Старая цена | Новый off-peak | Новый peak | Рост peak |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Qwen3.8-2.4T-A95B — первый случай, когда Alibaba открыла веса Max-tier (флагманской) модели; Qwen3.5/3.6/3.7 Max оставались только API.
| Спецификация | Деталь |
|---|---|
| Параметры | 2.4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared) |
| Контекстное окно | 262,144 токена native (open checkpoint), расширяется до ~1.01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API live 3 августа → open weights 12 августа |
| Цены API (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — кастомная «Qwen3.8-Max License» |
Эти цифры GLM — собственные скоры Zhipu; независимого third-party re-run пока нет. GLM-5.3 всё ещё отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%) на Terminal-Bench 3.0; это топ среди open-weight, не победа на frontier.
| Бенчмарк | GLM-5.2 | GLM-5.3 | Изменение |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Независимое моделирование стоимости показало: реалистичная тяжёлая нагрузка (примерно 84M токенов/месяц, в основном off-peak, половина cache hit) даёт рост счёта ближе к 1.8x — ощутимо, но далеко от самых пугающих заголовков.
Три стратегии: DeepSeek, Alibaba и Zhipu
DeepSeek: от плоского тарифа к тарифу по времени суток — это проблема ёмкости, а не смена стратегии. Самое дешёвое прочтение: «самая дешёвая китайская модель наконец сдалась под давлением маржи». Структура прайса говорит об обратном: компания впервые сделала свои compute-ограничения видимыми в прайс-листе. Старый плоский, всегда дешёвый тариф работал как инструмент захвата клиентов, пока GPU-ёмкость успевала за спросом. Когда usage рос экспоненциально, а ёмкость — нет, что-то пришлось сделать явным: формулировка «поощрять более гибкое планирование нагрузки» в официальном анонсе — корпоративный язык для «пиковый compute теперь дефицит, сдвиньте нагрузку сами».
Деталь, которую международное покрытие почти пропустило: в пиковые часы официальный API DeepSeek теперь дороже нескольких сторонних реселлеров (GMI Cloud, Novita и другие сейчас ставят V4 Pro ниже нового peak-тарифа DeepSeek). Допущение «официальный API — всегда самый дешёвый способ крутить DeepSeek» — часть репутации модели — сломано впервые.
Alibaba: open weights покупают goodwill экосистемы; кастомная лицензия защищает потолок выручки. Открытие весов Qwen3.8-Max — не жест щедрости. Alibaba сделала два хода одновременно: опубликовала полный чекпоинт на 2.4T параметров для бесплатной загрузки и повесила кастомную лицензию — не permissive Apache 2.0, как у младших Qwen, — которая требует от любого бизнеса «Model-as-a-Service» или «AI Work Assistant» с выручкой свыше $50 million за любые 12 месяцев отдельной коммерческой лицензии, а от продуктов с 100M+ MAU или $20M+ месячной выручки — заметно отображать имя модели.
Логика: отдать веса, чтобы забрать mindshare разработчиков (особенно за рубежом, где «модель made-in-China» всё ещё вызывает паузу у enterprise-закупщиков), и сохранить ценовой рычаг над горсткой компаний, которые реально способны построить конкурирующий inference-бизнес поверх этих весов. Это другая ставка, чем Muse Glimmer у Meta под unrestricted Apache 2.0: «open weights» в этих двух релизах означает разное.
Слух, который стоит закрыть явно: в сети ходили утверждения, что лицензия Alibaba запрещает загрузку из США, ЕС, Великобритании и Южной Кореи. Это ложь. В опубликованном тексте лицензии нет географической или территориальной оговорки любого вида — полезное напоминание: в цикле релизов такой плотности проверка первоисточника (файл LICENSE, не тред анонса) занимает секунды и избавляет от повторения опровергнутого claim.
GLM-5.3: новой базовой модели нет, есть более крупная ставка на post-training — и в этом сюжет. Самый интересный факт про GLM-5.3 — не скор, а метод: та же база на 743B параметров, что у GLM-5.2, без повторного обучения, и скачок примерно в 6x на Terminal-Bench 3.0 (4.6% → 28.3%) исключительно за счёт масштабирования reinforcement learning environments в post-training. Это подтверждает тренд, который копится месяцами: по мере убывающей отдачи pretraining scaling laws post-training RL становится независимым рычагом качества с гораздо более низким cost floor, чем обучение новой foundation model. Барьер входа заметно ниже — поэтому mid-tier лаборатории без compute-бюджета масштаба OpenAI всё ещё закрывают разрыв на agentic и coding бенчмарках.
Замечание: Считайте vendor-reported скоры GLM самоотчётом, пока не выйдет third-party re-run. Результат 28.3% на Terminal-Bench 3.0 — топ среди open-weight, не победа над GPT-5.6 Sol или Claude Fable 5.
Остаётся ли DeepSeek самым дешёвым frontier-классом?
Конверсия RMB→USD по курсу ~¥7.15/$1, оценка. Короткий ответ: нет. Даже после повышения off-peak тариф DeepSeek V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не абсолютный минимум на столе — и международный прайс Qwen3.8-Max, и Luna от OpenAI теперь подрезают off-peak DeepSeek. «Китайская модель = самая дешёвая» держалось большую часть 2025 и начала 2026; как рабочее допущение это больше не безопасно.
| Модель | Input (за 1M токенов) | Output (за 1M токенов) | Open weights? |
|---|---|---|---|
| DeepSeek V4-Pro (peak) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (off-peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, по собственному comparison ratio Alibaba) | ~$5.00 | ~$25.00 | Нет |
Поставьте это в более широкий кадр — и проявляется паттерн. Примерно за последний месяц ведущие китайские лаборатории выпускали крупные релизы в темпе, который отечественные финансовые СМИ уже называют «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba и Zhipu, плюс раньше Moonshot с Kimi K3 (open-weight 16 июля, 2.8T параметров) и MiniMax H3. Китайское покрытие в целом читает это как китайские open-weight релизы, «принуждающие глобальную индустрию ИИ к переоценке цен».
Тем временем американские лаборатории играют противоположную партию на consumer-слое: OpenAI срезал цены на 80% на самом дешёвом SKU (30 июля), затем через неделю сделал эту модель бесплатной и безлимитной для всех пользователей (6–7 августа); Google выпустил coding-модель за половину цены трёхнедельного предшественника (13 августа). Пока китайские лаборатории открывают веса флагманов и вводят дифференцированные, более высокие тарифы на compute-ограниченном верхнем конце, американские лаборатории гонят к free и cheap на consumer-конце. Обе стратегии реальны; они оптимизируют разные части воронки.
Есть и геополитический слой, который стоит назвать аккуратно. Open-weight релиз Kimi K3 у Moonshot в июле уже вызвал US security scrutiny; выбор Alibaba именно этого окна для открытия весов флагмана на 2.4T часть аналитиков читает как ход закрепить международный mindshare и нарратив «технологического паритета» до возможного ужесточения регуляторики. Это обоснованная интерпретация, не подтверждённый факт — но это часть контекста, которую почти не видно, если читать только англоязычную tech-прессу: там релизы идут как изолированные product news, а не как скоординированный национальный паттерн.
Спорные утверждения, проверка счёта из шести шагов и три цитируемые цифры
Заголовок «1,100%» технически точен, но без контекста вводит в заблуждение. Он относится только к peak-hour cache-hit input — позиции, которая стартовала ближе всего к нулю. Output — статья, которая доминирует в большинстве реальных счетов — вырос на 350%. Разные издания цитировали разные позиции так, будто это вся история.
Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (несколько китайских финансовых изданий подавали это как доказательство полностью отечественного silicon inference stack), Alibaba в своей технической документации не подтверждала, независимых бенчмарков тоже нет. Считайте это vendor-adjacent, непроверенным репортажем, пока не будет подтверждения.
Сообщение, что GLM-5.3 обнаружила «серьёзную уязвимость» в Cursor, идёт из репортажа VentureBeat и собственного disclosure Zhipu; конкретные технические детали уязвимости не опубликованы, поэтому claim нужно читать как vendor-sourced, не независимо аудированный security finding.
Сообщения, что Министерство коммерции КНР (MOFCOM) может готовить ответные экспортные ограничения на AI/полупроводниковые технологии, спекулятивны и опираются на неподтверждённые медиа-репортажи, не на официальный анонс. Это фоновый контекст, не установленный факт.
Осторожно: Перед перепечаткой сверяйте актуальный официальный прайс и текст лицензии. Детали выше, помеченные как непроверенные (claims про отечественные чипы, репортаж про уязвимость Cursor и слухи про экспортный контроль), независимо не подтверждены.
Разнести позиции биллинга: Не применяйте «1,100%» ко всему инвойсу. Зафиксируйте старые и новые цены отдельно для cache-hit input, cache-miss input и output.
Привязать трафик к пекинским пиковым окнам: Peak — 9:00–12:00 и 14:00–18:00 по пекинскому времени; off-peak — половина peak-тарифа. Сдвиг нагрузки меняет счёт сильнее, чем смена модели, у многих команд.
Измерить cache-hit rate: Cache-hit input в абсолютных цифрах остаётся дешёвым. Cache-miss input и output доминируют в тяжёлых счетах.
Сравнить официальный peak с реселлерами: GMI Cloud, Novita и другие могут всё ещё подрезать официальный peak DeepSeek. «Официальный всегда дешевле» больше не держится.
Прочитать лицензию Qwen до self-hosting: Личное и внутреннее использование в основном не затронуто. Бизнес MaaS или AI Work Assistant свыше $50M за любые 12 месяцев требует отдельной коммерческой лицензии. Продукты с 100M+ MAU или $20M+ месячной выручки должны отображать имя модели. Географического запрета нет.
Вынести evals и 24/7 агентов на ноду, которая умеет уходить в off-peak: Ноутбуки уходят в sleep и роняют сеть. Для изолированных evals, post-training экспериментов или iOS CI начните с центра помощи.
V4-Pro peak cache-hit input ¥0.30 / 1M токенов: С ¥0.025, около 1,100%. Отсюда заголовочная цифра.
Qwen3.8-2.4T-A95B: 2.4T всего, 95B активных, нативный контекст 262K; международный API $2 input / $6 output за миллион токенов.
GLM-5.3 Terminal-Bench 3.0: 4.6% → 28.3% (+23.7 pts) на той же базе 743B, без повторного обучения; всё ещё ниже GPT-5.6 Sol на 34.6% и Claude Fable 5 на 33.7%.
Слабые альтернативы назвать легко. Мигрировать по заголовочному множителю завышает счёт для off-peak пользователей с высоким cache. Считать веса Qwen лицензией Apache 2.0 подставит крупные коммерческие деплои. Крутить 24/7 evals и агентов на ноутбуке, который уходит в sleep, упирается в сеть и привилегии. Для более стабильной продакшен-среды под iOS CI/CD и автоматизацию AI-агентов облачная аренда Mac Mini у KVMNODE обычно сильнее: выделенный Apple Silicon, открытый sudo, мультирегион, сроки день/неделя/месяц. См. цены и заказ.
На 17 августа 2026. Источники: официальный прайс DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и V2EX; официальные репозитории Qwen от Alibaba (Hugging Face / ModelScope) и репортаж South China Morning Post по лицензии; техническая страница Zhipu (Z.ai) по GLM-5.3, плюс VentureBeat и StableLearn; официальный блог Meta AI Research и VentureBeat по Muse Glimmer; Yicai и Sohu Finance о темпе китайского open-weight цикла.