Таймлайн: пять дней, три лаборатории
На поверхности ходы противоречат друг другу. DeepSeek поднимает отдельные строки до ~1100%. Alibaba в ту же неделю публикует checkpoint флагмана, который раньше не отдавали весами. Zhipu выпускает GLM-5.3 и поднимает coding-метрики примерно вшестеро без повторного pretraining. Вместе это не «ещё один релиз», а смена объекта конкуренции: не цена, а право её задавать.
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открывает Kimi K3 (2,8 трлн параметров); интерес США по линии безопасности уже был |
| 2–3 августа | Alibaba анонсирует и запускает Qwen3.8-Max как hosted API |
| 10 августа | Meta выпускает Muse Glimmer (30B, Apache 2.0) и обещает веса флагмана Muse Spark 1.2 |
| 12 августа | Alibaba кладёт Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выпускает Grok 4.6 |
| 13 августа | DeepSeek-V4-Pro выходит в GA и объявляет повышение с 17 августа; Google снижает Gemini 3.7 Flash |
| 14 августа | Zhipu выпускает GLM-5.3 на базисе GLM-5.2 (743B) |
| 17 августа, 00:00 по Пекину | Новый тариф DeepSeek вступает в силу |
Шире: 30 июля OpenAI снижает самый дешёвый ярус GPT-5.6 Luna на 80%, 6–7 августа делает Luna дефолтом бесплатных аккаунтов с безлимитным текстом. Пока китайские лаборатории добавляют повышение и открытие весов, американские — бесплатность и снижение на потребительском слое. Это две стороны одной ценовой войны.
Цифры: что именно изменилось
Тариф DeepSeek (с 17 августа, 00:00 по Пекину)
Пик: 9–12 и 14–18 по пекинскому времени. Ниже — USD за 1 млн tokens, пересчёт по курсу исходной записки.
| Позиция | Было | Вне пика | Пик | Рост в пике |
|---|---|---|---|---|
| V4-Flash вход, cache hit | $0.0028 | $0.007 | $0.014 | ~400% |
| V4-Flash вход, cache miss | $0.14 | $0.21 | $0.42 | 200% |
| V4-Flash выход | $0.28 | $0.63 | $1.26 | 350% |
| V4-Pro вход, cache hit | $0.0035 | $0.021 | $0.042 | ~1100% |
| V4-Pro вход, cache miss | $0.42 | $0.63 | $1.26 | 200% |
| V4-Pro выход | $0.84 | $1.89 | $3.78 | 350% |
Заголовок «1100%» относится только к cache-hit входу в пике — строке, которая почти была нулевой. Выход, который обычно доминирует в счёте, вырос на 350%. Сторонние модели для тяжёлой нагрузки (~84 млн tokens/мес, в основном вне пика, ~50% hit) дают рост ближе к 1.8×, а не к headline.
Qwen3.8-2.4T-A95B: спецификация
Впервые Alibaba открывает Max-ярус. Qwen3.5 / 3.6 / 3.7 Max оставались только API.
GLM-5.3 vs GLM-5.2: тот же базис, только post-training
| Бенчмарк | GLM-5.2 | GLM-5.3 | Дельта |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
Цифры — самоотчёт Zhipu, независимого прогона нет. На Terminal-Bench 3.0 впереди GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это первый эшелон open-weight, не победа frontier.
Вне пикового API: контролируемый локальный контур
Локальные eval, агенты и macOS-toolchain на выделенном физическом Apple Silicon с Root/sudo — сценарии и дневная аренда у RUVCLOUD.
Три модели поведения
DeepSeek: с плоского тарифа на time-of-day. Это дефицит compute
Удобная интерпретация — «наконец взяли маржу». Структура тарифа ближе к обратному: ограничение по GPU впервые вынесено в прайс. Плоская низкая цена работала, пока поставка чипов держала спрос. Когда вызовы выросли экспоненциально, формулировка «более гибкое планирование нагрузки» означает «пиковый compute кончился, сдвиньте нагрузку сами».
Деталь, которую международные обзоры часто пропускают: в пике официальный API уже дороже части реселлеров (GMI Cloud, Novita и другие держат V4 Pro ниже нового пика). Гипотеза «официал всегда дешевле» сломана впервые.
Alibaba: веса покупают экосистему, кастомная лицензия держит потолок выручки
Открытие — не благотворительность. Checkpoint на 2,4 трлн скачивается бесплатно, но лицензия не Apache 2.0 младших Qwen. Бизнес «Model-as-a-Service» или «AI Work Assistant» с выручкой свыше $50 млн за любые 12 месяцев требует отдельной коммерческой лицензии. Продукт с 100M+ MAU или $20M+ месячной выручки обязан явно показывать имя модели.
Логика: отдать веса за mindshare разработчиков (особенно международных) и оставить рычаг над теми, кто способен построить поверх inference-бизнес. Muse Glimmer под неограниченным Apache 2.0 — другая ставка. «Open weights» здесь не одна и та же степень открытости.
Слух о запрете скачивания из США, ЕС, Великобритании и Южной Кореи ложен. В тексте нет территориальной оговорки. LICENSE-файл быстрее треда анонса.
GLM-5.3: не новый базис, а масштаб post-training
Интересен метод: тот же 743B, что у GLM-5.2, без retraining, Terminal-Bench 3.0 с 4.6% до 28.3% за счёт масштаба RL-сред в post-training. Когда предельная отдача pretraining падает, RL-масштаб становится отдельным рычагом с более низким порогом входа, чем новый foundation.
Сравнение: DeepSeek всё ещё самый дешёвый флагман?
| Модель | Вход / 1M | Выход / 1M | Открытые веса |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | $1.26 | $3.78 | Нет |
| DeepSeek V4-Pro (вне пика) | $0.63 | $1.89 | Нет |
| Qwen3.8-Max (международный API) | $2 | $6 | Да (своя лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (оценка по кратности Alibaba) | ~$5 | ~$25 | Нет |
Короткий ответ: нет. Внепиковый V4-Pro всё ещё ниже Claude Opus 5, но уже не дно таблицы. Международный Qwen3.8-Max и Luna подрезают новый внепик хотя бы по одной оси. «Китайская модель = самая дешёвая» держалось в 2025 и начале 2026; как аксиома это больше не работает.
Спорное и непроверенное
- «1100%» формально верно и без контекста вводит в заблуждение. Только cache-hit вход в пике. Выход: +350%.
- Инференс на Zhenwu M890 есть в финансовых пересказах, нет в техдоках Alibaba и сторонних бенчмарках. Не верифицировано.
- «Серьёзная уязвимость Cursor» от GLM-5.3 — VentureBeat и Zhipu. Технических деталей нет. Заявление вендора, не аудит.
- Ответные экспортные ограничения — медиа-гипотеза, не официальное объявление.
Почему это важно: две ценовые войны параллельно
Примерно месяц топ-лаборатории Китая выпускают крупные обновления в темпе, который местная деловая пресса называет «три релиза в неделю» — DeepSeek, Alibaba, Zhipu, плюс Kimi K3 (16 июля, 2,8 трлн) и MiniMax H3. Локальная рамка: открытые веса «заставляют мир пересчитать цену ИИ».
Американские лаборатории идут наоборот на потребительском слое: −80% у OpenAI 30 июля, через неделю бесплатно и без лимита; Google 13 августа — coding-модель за половину цены трёхнедельного предшественника. Сверху — ступенчатый рост и открытые флагманы. Снизу — бесплатно и дёшево. Обе стратегии реальны, оптимизируют разные части воронки.
Геополитический слой: открытие Kimi K3 уже вызвало интерес США; окно Alibaba для 2,4 трлн читают как фиксацию международного присутствия до возможного ужесточения. Это интерпретация, не факт. По eval-контуру см. разбор sandbox-побегов.
Цены, лицензия и бенчмарки — на момент публикации. Первичные входы: Hugging Face, ModelScope, условия лицензии у South China Morning Post.
Итог
DeepSeek вписал дефицит compute в тариф. Alibaba обменяла флагманские веса на экосистему и оставила коммерческий потолок. Zhipu показала, что масштаб post-training без нового базиса достаточен для первого эшелона open-weight. Вопрос сместился с «кто дешевле» на «кто задаёт час, лицензию и счёт».
Если команде нужен настоящий macOS для агентов, локальных eval или внепиковых батчей, пиковый API и свой шкаф — две строки одной таблицы. Выделенные физические узлы Apple Silicon с полным Root/sudo — на странице цен; аренда по дням, когда локальная машина дешевле и контролируемее.
Ещё по теме
FAQ
DeepSeek после повышения всё ещё дешевле GPT-5.6 и Claude?
Вне пика — дешевле Claude Opus 5, но уже не абсолютный минимум. GPT-5.6 Luna ($0.20 / $1.20) и международный Qwen3.8-Max ($2 / $6) подрезают новый внепик хотя бы по одной оси. Для флагмана всё ещё относительно дёшево, но не «самый дешёвый» как аксиома.
Можно ли бесплатно использовать веса Qwen3.8-Max в коммерческом продукте?
В большинстве случаев да — личные проекты и внутреннее использование не затронуты. Порог: «Model-as-a-Service» или «AI Work Assistant» с выручкой свыше $50 млн за 12 месяцев — отдельная коммерческая лицензия. При 100M+ MAU или $20M+ месячной выручки нужно явно указывать имя модели.
Запрещена ли загрузка для США, ЕС или Великобритании?
Нет. В опубликованной лицензии нет географических ограничений. Ограничения завязаны на выручку, не на локацию.
В чём реальное отличие GLM-5.3 от GLM-5.2?
На уровне базиса — ни в чём: те же 743 млрд параметров. Скачок ~в 6 раз на Terminal-Bench 3.0 целиком из масштаба RL в post-training, без повторного обучения фундамента.
Meta действительно откроет флагман, а не только Muse Glimmer?
Пока нет. Muse Glimmer — дистиллят 30B. Zuckerberg говорил, что веса закрытого Muse Spark 1.2 будут «скоро». До поставки это намерение, не факт.