2026 КИТАЙ AI
CENA_
VOYNA_
REPRICE.
За пять дней три китайские лаборатории сделали ходы, которые на поверхности противоречат друг другу. DeepSeek поднял пиковые API-тарифы до 1100% по отдельным строкам биллинга. Alibaba в ту же неделю выложила веса флагмана на 2.4T параметров — впервые Max-tier. Zhipu выпустила GLM-5.3: тот же базис 743B, без повторного претрейна, Terminal-Bench вырос примерно в 6 раз. Боль: headline-проценты не равны реальному счёту, а формула «китайская модель = самая дешёвая» больше не держится. Вывод: лаборатории конкурируют уже не ценой, а правом назначать цену. Структура: таймлайн, таблицы тарифов и спеков, три стратегии, head-to-head, непроверенные утверждения, пятишаговый чек-лист и FAQ.
1. Три ограничения, которые реально сдвинулись на этой неделе
- Заголовок 1100% — одна строка биллинга, не весь инвойс. Это пиковый cache-hit input, тариф, который стартовал почти с нуля. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Cache-miss input — на 200%. Путать эти дельты — значит умножать весь трафик на 11x и врать себе в capacity-планировании.
- Официальный API больше не гарантированно самый дешёвый хост. В пиковые часы прайс DeepSeek сидит выше ряда реселлеров (GMI Cloud, Novita и другие сейчас держат V4 Pro ниже нового официального пика). Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но международный Qwen3.8-Max ($2/$6) и OpenAI GPT-5.6 Luna ($0.20/$1.20) подрезают off-peak DeepSeek хотя бы по одной оси. Пропускная способность пика стала дефицитом; цена это просто озвучила.
- Открытые веса — не Apache 2.0. Alibaba повесила кастомную Qwen3.8-Max License: любой Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любой 12-месячный период обязан отдельно торговать коммерческую лицензию. Слухи про запрет скачивания из US, EU, UK или Южной Кореи — ложь: в опубликованном тексте нет географической оговорки.
2. Таймлайн: что случилось и когда
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открыла веса Kimi K3 (2.8T параметров), что вызвало внимание американской security-проверки |
| 2–3 августа 2026 | Alibaba анонсирует, затем поднимает Qwen3.8-Max как hosted API |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0) и дразнит открытыми весами флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует открытые веса Qwen3.8-2.4T-A95B на Hugging Face/ModelScope; xAI выпускает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает уценённый Gemini 3.7 Flash |
| 14 августа 2026 | Zhipu выпускает GLM-5.3, переиспользуя базис GLM-5.2 на 743B |
| 17 августа 2026, 00:00 по Пекину | Новый прайс DeepSeek вступает в силу |
Откиньте камеру дальше: 30 июля OpenAI срезала цены на самый дешёвый тир (GPT-5.6 Luna, минус 80%), затем 6–7 августа сделала Luna дефолтом для бесплатных пользователей с безлимитным текстовым чатом. Пока китайские лаборатории поднимали тарифы и открывали веса флагманов, американские резали цены и уходили в бесплатный consumer-слой — в тот же календарный слот. Это не совпадение. Это две стороны одной войны за биллинг.
3. Цифры: что реально изменилось
Подорожание DeepSeek (с 17 августа, 00:00 по Пекину; пик 9:00–12:00 и 14:00–18:00 по Пекину)
| Строка биллинга (за 1M токенов) | Старый тариф | Новый off-peak | Новый пик | Рост в пике |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1,100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Цифра 1,100% в заголовках относится строго к пиковому cache-hit input. Независимый cost-моделинг тяжёлой нагрузки (примерно 84M токенов/месяц, в основном off-peak, половина cache hits) даёт рост счёта ближе к 1.8x — реально, но далеко от самых страшных headline. Если ваш пайплайн сидит в пике Пекина и бьёт cache miss, дельта приближается к headline. Если нет — вы платите за чужой нарратив.
Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max): ключевые спеки
| Спека | Деталь |
|---|---|
| Параметры | 2.4T всего, 95B активных на токен (MoE, 512 экспертов, 10 routed + 1 shared) |
| Контекст | 262,144 токенов native (открытый чекпоинт), расширяется до ~1.01M; hosted Max по умолчанию 1M |
| Ритм релиза | Превью 2 августа → API 3 августа → открытые веса 12 августа |
| API-тариф (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — кастомная Qwen3.8-Max License |
| Почему важно | Впервые Alibaba открыла веса Max-tier флагмана; Qwen3.5/3.6/3.7 Max оставались API-only |
GLM-5.3 vs GLM-5.2: тот же базис, только post-training
| Бенчмарк | GLM-5.2 | GLM-5.3 | Дельта |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Это собственные цифры Zhipu — независимого third-party re-run пока нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это верхний эшелон open-weight, не абсолютный frontier-win. Для coding-агентов дельта важнее маркетинга: 4.6% → 28.3% без нового претрейна.
4. Разбор трёх стратегий
DeepSeek: time-of-day биллинг — это дефицит пропускной способности, не смена стратегии
Самое дешёвое прочтение: «самая дешёвая китайская модель сдалась марже». Структура прайса говорит об обратном: компания впервые сделала compute-ограничение видимым в тарифной сетке. Плоский всегда-дешёвый тариф работал как инструмент набора клиентов, пока GPU-ёмкость успевала за спросом. Когда вызовы росли экспоненциально, а ёмкость — нет, что-то должно было стать явным. Формула в официальном анонсе про «более гибкое планирование нагрузки» — корпоративный перевод фразы «пиковый compute закончился, сдвиньте нагрузку сами».
Деталь, которую международные обзоры почти пропустили: в пике официальный API DeepSeek теперь дороже нескольких реселлеров. Гипотеза «официальный эндпоинт всегда самый дешёвый способ гонять DeepSeek» сломалась впервые. Для оператора это не новость про бренд. Это новость про маршрутизацию: peak SKU больше не default, а строка в матрице latency/цена/лимиты.
Alibaba: открытые веса покупают экосистему; кастомная лицензия держит потолок выручки
Alibaba сделала две вещи одновременно: выложила полный чекпоинт на 2.4T параметров для бесплатного скачивания и повесила кастомную лицензию. Любой Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любой 12-месячный период обязан отдельно торговать коммерческую лицензию. Продукты с 100M+ MAU или $20M+ месячной выручки обязаны заметно показывать имя модели.
Логика: отдать веса за mindshare разработчиков (особенно за рубежом), сохранив рычаг цены над теми, кто способен поднять конкурирующий inference-бизнес поверх этого чекпоинта. Это другой уровень «открытости», чем Muse Glimmer от Meta под чистым Apache 2.0. Скачать 2.4T MoE на ноутбук «просто посмотреть» — не задача. Это задача на unified memory, Metal-стек и узел, который не умрёт на KV-кэше.
Слух, который стоит убить явно: лицензия Alibaba якобы запрещает скачивание из US, EU, UK и Южной Кореи. Это ложь. В опубликованном тексте нет географической или территориальной оговорки. Ограничения завязаны на выручку сервиса, не на паспорт пользователя.
GLM-5.3: новый базис не нужен — нужен больший post-training
Самый интересный факт — метод, не скор. Тот же базис 743B, что у GLM-5.2, без повторного претрейна, и скачок примерно в 6 раз на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт масштабирования RL-окружений в post-training. Когда pretraining scaling laws дают убывающую отдачу, post-training RL становится отдельным рычагом с гораздо более низким полом затрат, чем новый foundation. Для mid-tier лабораторий это снижает входной барьер. Для инженера это значит: бенч маркируйте агентный стек на свежем чекпоинте, не ждите «ещё один 743B с нуля».
5. Head-to-head: DeepSeek всё ещё самый дешёвый frontier-класс?
| Модель | Input (за 1M токенов) | Output (за 1M токенов) | Открытые веса? |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (off-peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2.00 | $6.00 | Да (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, по собственной пропорции Alibaba) | ~$5.00 | ~$25.00 | Нет |
Курс ~¥7.15/$1, ориентир. Даже после повышения off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не абсолютный минимум: и international-тариф Qwen3.8-Max, и Luna от OpenAI подрезают off-peak DeepSeek. «Китайская модель = самая дешёвая» держалось большую часть 2025 и начала 2026. Сейчас это небезопасное допущение для capacity-бюджета.
Цитата в один абзац: V4-Pro пиковый cache-hit input ¥0.025 → ¥0.30 (~1,100%); output ¥6.0 → ¥27.0 (350%); Qwen3.8-Max international $2/$6; GLM-5.3 Terminal-Bench 3.0 4.6% → 28.3% на том же базисе 743B, без повторного претрейна.
6. Что спорно или не подтверждено
- Заголовок 1,100% технически верен, но без контекста врёт. Он относится только к пиковому cache-hit input. Output — статья, которая доминирует в большинстве реальных счетов — вырос на 350%.
- Утверждения, что Qwen3.8-Max крутится на собственных чипах Alibaba Zhenwu M890 (и супернодах «Pangu AL128»), которые разошлись в китайских финансовых изданиях, не подтверждены собственной технической документацией Alibaba и не закрыты third-party бенчмарками. Держать как vendor-adjacent, непроверенный репортаж.
- Сообщение, что GLM-5.3 «нашла серьёзную уязвимость» в Cursor, идёт из VentureBeat и собственного disclosure Zhipu; технические детали не опубликованы. Читать как vendor-sourced, не как независимый аудит.
- Репортажи, что Минкоммерции КНР готовит ответные экспортные ограничения по AI/полупроводникам, спекулятивны и опираются на неподтверждённые СМИ, не на официальный анонс.
7. Пятишаговый чек-лист: как пересчитать свой стек
- Разделите строки биллинга. Не умножайте весь инвойс на 1,100%. Cache-hit input, cache-miss input и output имеют три разные дельты. Пик — 9:00–12:00 и 14:00–18:00 по Пекину.
- Уведите batch с пика. Официальный анонс просит более гибкое планирование нагрузки. Независимый моделинг тяжёлой, в основном off-peak, наполовину cache-hit нагрузки даёт около 1.8x счёта, не 11x. Если API-лимиты и пиковый прайс душат пропускную способность — это сигнал маршрутизировать, не сигнал «платить headline».
- Читайте лицензию Qwen, не тред анонса. Личные проекты и внутреннее enterprise-использование не затронуты. Ловушка срабатывает, если вы крутите Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любой последовательный 12-месячный период. Географического бана нет.
- Скоры GLM-5.3 — vendor self-report. Скачок Terminal-Bench 4.6% → 28.3% — только post-training. Публичного независимого re-run нет. Модель всё ещё отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%).
- Маршрутизируйте по тирам, не по слогану «самая дешёвая китайская модель». Off-peak DeepSeek V4-Pro всё ещё дешевле Claude Opus 5. International Qwen3.8-Max и GPT-5.6 Luna теперь подрезают off-peak DeepSeek хотя бы по одной оси. В пике сравнивайте GMI Cloud и Novita с официальным листом. Когда облачный SKU упирается в лимит и цену — следующий контур это Mac: Metal, unified memory, локальный прогон. Если ноутбук не держит 2.4T MoE и круглосуточного агента — арендуйте удалённый Mac MACGPU.
8. Почему это важно: две ценовые войны параллельно
За примерно последний месяц китайские лаборатории выпускали крупные релизы в темпе, который отечественная финансовая пресса уже называет «три обновления модели в неделю» (一周三更) — DeepSeek, Alibaba и Zhipu, плюс Kimi K3 от Moonshot (открытые веса 16 июля, 2.8T параметров) и MiniMax H3 до них. Китайское покрытие широко формулирует это как открытые веса, которые «вынуждают глобальную AI-индустрию пересчитать цены».
Американские лаборатории в это же время играют противоположную партию на consumer-слое: OpenAI срезала 80% на самом дешёвом тире (30 июля), затем через неделю сделала эту модель бесплатной и безлимитной для всех пользователей (6–7 августа); Google 13 августа выпустила coding-модель за половину цены трёхнедельного предшественника. Китай открывает веса флагманов и вводит ступенчатый, более высокий прайс на compute-ограниченном верхнем конце; США бегут к бесплатному и дешёвому на нижнем. Обе стратегии реальны. Они оптимизируют разные участки воронки.
Есть и геополитический слой, который стоит назвать аккуратно. Открытие весов Kimi K3 в июле уже вызвало американскую security-проверку; выбор Alibaba именно этого окна для флагмана 2.4T часть аналитиков читает как попытку закрепить международный mindshare и нарратив «технологического паритета» до возможного ужесточения регуляторики. Это обоснованная интерпретация, не подтверждённый факт — но часть контекста, которую почти не видно, если читать только англоязычную tech-прессу, где эти релизы идут как изолированные продукт-новости, а не как национальный паттерн.
Ход Meta — лишь частичный возврат к open-source позе эпохи Llama. Muse Glimmer — дистиллированная 30B, не настоящий флагман. Марк Цукерберг заявил, что открытые веса более крупной закрытой Muse Spark 1.2 будут «скоро». Если это случится, это будет первый американский flagship-tier, выпущенный открыто. На момент публикации релиза нет; держать как заявленное намерение, не как факт.
Для оператора практический ответ — не выбрать лагерь. Разделить книгу: пик vs off-peak, cache hit vs miss, пороги лицензии, vendor self-report vs third-party re-run. Облачные API по-прежнему закрывают burst и A/B флагманов. Когда официальный пик перестаёт быть самым дешёвым хостом, а открытый чекпоинт прыгает в триллионный MoE, первым обычно сдаётся ноутбук: unified memory кончается, Metal-очередь встаёт, агент 24/7 не живёт на крышке. Чистый контур контроля — посадить long-context и круглосуточных агентов на тарифицируемый удалённый Mac-узел, а не гонять каждый токен через один официальный peak-hour SKU.
9. FAQ
DeepSeek после повышения всё ещё дешевле GPT-5.6 или Claude?
Off-peak всё ещё дешевле Claude Opus 5, но это уже не единственный минимум: GPT-5.6 Luna ($0.20/$1.20 за миллион токенов) и international-тариф Qwen3.8-Max ($2/$6) теперь подрезают новый off-peak DeepSeek хотя бы по одной оси. Для frontier-класса DeepSeek всё ещё относительно дешёв, просто больше не абсолютный минимум.
Можно ли бесплатно использовать открытые веса Qwen3.8-Max в коммерческом продукте?
Да, для большинства сценариев — личные проекты и внутреннее enterprise-использование не затронуты. Ловушка срабатывает только если вы крутите Model-as-a-Service или AI Work Assistant с выручкой свыше $50 million за любой последовательный 12-месячный период; этот тир требует отдельной коммерческой лицензии у Alibaba.
Qwen3.8-Max запрещён или ограничен для пользователей US, EU или UK?
Нет. Этот тезис гулял в сети и ложен — в опубликованной лицензии нет географического ограничения любого вида. Ограничения завязаны на выручку, не на то, где вы или ваши пользователи находятся.
Что реально отличается между GLM-5.3 и GLM-5.2?
На уровне базиса — ничего: оба используют одну и ту же foundation-модель на 743B параметров. Прирост (примерно 6x на Terminal-Bench 3.0) целиком из масштабирования reinforcement learning в post-training, без повторного претрейна базиса.
Meta реально откроет флагман, а не только маленький Muse Glimmer?
Пока нет. Muse Glimmer — дистиллированная 30B, не настоящий флагман. Цукерберг сказал, что открытые веса Muse Spark 1.2 будут «скоро». На момент публикации релиза нет; держать как заявленное намерение, не как факт.
10. Источники
- Официальный анонс тарифов DeepSeek, перекрёстно сверенный с Wall Street CN, IT Home, AIGC.cn и обсуждением на V2EX
- Официальные репозитории Qwen от Alibaba (Hugging Face / ModelScope) и репортаж South China Morning Post по условиям лицензии
- Официальная техническая страница GLM-5.3 от Zhipu (Z.ai), плюс покрытие VentureBeat и StableLearn
- Официальный блог Meta AI Research и покрытие VentureBeat по Muse Glimmer
- Китайские финансовые издания (Yicai / 第一财经, Sohu Finance) о темпе и фрейминге цикла открытых весов
Тарифы, условия лицензии и бенчмарк-цифры отражают публично доступную информацию на момент публикации. Перед перепечаткой сверяйте актуальный официальный прайс и текст лицензии. Детали, помеченные выше как непроверенные (отечественные чипы, отчёт об уязвимости Cursor, слухи об экспортном контроле), независимо не подтверждены.
11. Финал: после пикового повышения контрольный стек всё равно надо куда-то посадить
Hosted API не умерли. Ограничения стали явными: пиковый лист больше не гарантирует минимум, кастомная лицензия возвращает крупных коммерческих пользователей, чекпоинт 2.4T MoE — не задача для крышки ноутбука. Цепочка для оператора прямая. Сначала лимиты и пиковый биллинг API перестают давать нужную пропускную способность. Затем вы переносите контроль на Mac: Metal, unified memory, MLX-квантизация, toolchain Cursor и агенты, которые Windows/Linux GPU-боксы обычно хуже держат в одном воспроизводимом контуре. Если локальный Mac не тянет long-context и резидентность 24/7 — арендуйте удалённый Mac MACGPU: SSH, тарификация узла, ноутбук остаётся для правки, ни один токен не обязан идти через официальный peak-hour SKU.