
GLM-5.3-Flash раскрыт: анонимная "Ox Alpha" все это время была открытой мультимодальной фронтирной моделью Zhipu
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Модель, которая неделю удерживалась на вершине рейтингов использования сторонних платформ для программирования, наконец обрела имя и цену. 26 августа 2026 года Zhipu AI подтвердила, что бесплатная модель «Ox Alpha», которую разработчики активно использовали с 20 августа, — это GLM-5.3-Flash: модель смеси экспертов с 320 миллиардами параметров всего и 18 миллиардами активных (320B-A18B), первый нативно мультимодальный релиз в серии GLM-5 и одна из самых дешёвых фронтир-моделей в любом прейскуранте на момент запуска. Zhipu устанавливает цену на GLM-5.3-Flash на уровне одной десятой тарифа API своей флагманской модели GLM-5.3 — или одной двадцатой в рамках ограниченной по времени скидки, — а открытые веса под лицензией MIT в тот же день появились на Hugging Face. В отличие от GLM-5.3, чьи веса всё ещё ожидаются к концу месяца, эту модель можно развернуть у себя уже на этой неделе, а не на следующей.
Вот краткая версия: {{1}}Zhipu открыл исходный код своей самой дешевой на данный момент большой модели; она превосходит собственную GLM-5.2 в бенчмарках, несмотря на использование лишь малой доли активных параметров,{{/1}} и, согласно материалам запуска Zhipu, вендор оценивает её показатель Artificial Analysis Intelligence Index в 57 баллов — что соответствует Claude Opus 4.8. {{2}}Каждый показатель бенчмарка, связанный с этим запуском, предоставлен самим вендором и на момент написания не был воспроизведён независимо;{{/2}} цены и количество параметров — актуальный факт.
Что на самом деле было выпущено
GLM-5.3-Flash — это MoE с 45 слоями и 320B суммарных / 18B активных параметров, что делает его активную часть чуть больше половины от ~32B активных параметров GLM-5.2. Ключевая возможность — мультимодальность: она нативно принимает текст, изображения и видео — первая модель GLM-5, которая это делает — а не маршрутизирует визуальные данные через отдельный адаптер. Контекст достигает 1 миллиона токенов, и Zhipu заявляет, что стоимость обслуживания длинного контекста составляет примерно треть от стоимости GLM-5.3.
Что касается архитектуры, Zhipu описывает её как первую открытую фронтирную модель, использующую гибридную конструкцию «разреженное внимание плюс линейное внимание», в паре с гиперсвязями с ограничением многообразия (mHC) для масштабирования и механизмом IndexPool, который сжимает четыре ключевых вектора индексатора в один взвешенный пул для снижения задержки при обработке длинного контекста. Предварительное обучение проводилось на мультимодальном корпусе из 30 триллионов токенов. Всё это пока не прошло независимую проверку — это описание собственной модели от Zhipu, — но утверждения об эффективности обслуживания достаточно конкретны, чтобы проверить их, как только веса попадут в открытый стек инференса.
Технические характеристики на день запуска, с первого взгляда:
• Параметры — 320B всего / 18B активных, 45 слоёв, MoE.
• Модальность — нативный ввод текста, изображений и видео; вывод текста.
• Окно контекста — до 1 000 000 токенов.
• Лицензия — MIT, открытые веса будут доступны на Hugging Face при запуске.
• Цена — $0.15 / $0.50 за миллион токенов (входных / выходных), $0.03 за миллион кэшированных входных токенов; акция со скидкой 50% до 9 сентября 2026 года снижает это до $0.075 / $0.25 / $0.015. По прайс-листу это примерно десятая часть от $1.40 / $4.40 у GLM-5.3.

Неделя Ox Alpha
Раскрытие завершает неделю догадок. 20 августа на сторонней AI API-платформе появилась анонимная модель с контекстным окном в 1 миллион токенов, поддержкой текста, изображений и видео на входе и нулевой ценой — и она быстро стала самой вызываемой моделью в еженедельных чартах платформы. Сообщество за 48 часов вычислило, что она относится к семейству GLM от Zhipu, — та же схема «сначала анонимно, затем заявлено», которая ранее позволила опознать модели других китайских лабораторий, — и аналитики в основном предположили, что это GLM-5.3 в варианте Flash. Анонс 26 августа подтвердил догадку и добавил деталь: бесплатная неделя была намеренным тестом. В Zhipu заявляют, что анонимный запуск установил рекорды по объёму вызовов на платформах для программирования, где модель была доступна, при этом весь трафик обслуживался отечественными китайскими чипами.
Этот контекст бесплатной недели важен для ожиданий по ценообразованию. Модель, которую раздавали бесплатно в течение недели, а затем запустили по ставке в десять раз ниже флагманской, с ограниченным по времени дисконтом в двадцатую часть цены, — это намеренный шаг по созданию рынка в бюджетном сегменте, и именно оговорка «ограниченный по времени» — то, за чем стоит следить. Скидка — это ценовое решение, которое можно отыграть назад; открытые веса MIT — нельзя.

Сколько это стоит, в реальных долларах
Zhipu's rate card is out in actual dollars, not just ratios: {{1}}$0.15 per million input tokens, $0.50 per million output tokens, and $0.03 per million cached input tokens{{/1}}. Against GLM-5.3's published $1.40 / $4.40, that lands at {{2}}roughly a tenth at list{{/2}}, and {{3}}a 50%-off launch promo running through September 9, 2026{{/3}} brings it to {{4}}$0.075 / $0.25 / $0.015 — roughly a twentieth{{/4}}. Zhipu also puts the model's cost per AA Intelligence Index task at about {{5}}$0.045, vendor-reported{{/5}}, which is the number behind the "1/40 of Opus 4.8" framing. For a model that scores in the same band as models priced 10–40x higher, the headline economics are real; the fine print is that {{6}}the launch discount is temporary and per-task cost depends on how verbose the model turns out to be in production{{/6}}.
{{1}}История эффективности — вот откуда, по утверждению Zhipu, берётся преимущество в стоимости.{{/1}} {{2}}По сравнению с GLM-5.3, вендор отчитывается о снижении вычислительной нагрузки на механизм внимания (attention compute) в 3,0 раза и объёма KV-кэша в 4,4 раза, а также заявляет о самой низкой вычислительной нагрузке на внимание среди сравниваемых бюджетных моделей — GLM-5.3, DeepSeek V4 Flash и Kimi K3, — признавая при этом, что его KV-кэш всё ещё немного больше, чем у DeepSeek V4 Flash и Kimi K3.{{/2}} {{3}}Что касается инференса, Zhipu сообщает о трёхкратном улучшении сквозной производительности обслуживания по сравнению с базовым уровнем на отечественных китайских чипах, достигая стоимости за токен, которую называет сопоставимой с массовыми графическими процессорами NVIDIA.{{/3}} {{4}}Все эти цифры предоставлены вендором, и ни одна из них пока не подтверждена независимо; именно их стоит проверить на основе открытых весов.{{/4}}
Почему это раскрытие важно
Если убрать бенчмарки, запуск всё равно меняет ландшафт открытых моделей в двух отношениях. Во-первых, это мультимодальная модель с открытыми весами во фронтирной категории по бюджетной цене — сочетание лицензии MIT, контекста в 1 млн токенов, нативной поддержки изображений и видео и стоимости в несколько центов за задачу не имеет прямых аналогов среди фронтирных лабораторий США, чьи эквивалентные мультимодальные модели стоят на порядок дороже и выходят закрытыми. Во-вторых, она подрывает собственный флагман Zhipu: GLM-5.3 — это модель на 743 млрд параметров, которая в этом месяце набрала независимо измеренные 60 баллов в AA Intelligence Index, а GLM-5.3-Flash позиционируется как «frontier intelligence, flash cost» в противовес тому же семейству. История Zhipu в том, что меньшая и более дешёвая модель способна уловить большую часть возможностей флагмана — и если заявления вендора о кодинге и агентности подтвердятся, это тот же аргумент об экономике пост-обучения, вокруг которого индустрия ходит весь год.
Одна оговорка не даёт потерять перспективу. Показатель AA Index 57 у GLM-5.3-Flash взят из материалов запуска самой Zhipu, а не из рейтинга Artificial Analysis, а сравнение по коду с Claude Opus 4.8 — это внутренняя оценка Zhipu в бенчмарке Z.ai Code Bench. Считайте 57 и паритет по коду заявлениями, пока не появятся независимые измерения: модель широко тестировалась анонимно, поэтому сторонние цифры должны появиться быстро.
Попробуйте, и как вписывается слой маршрутизации
Доступ с первого дня осуществляется через собственный API Zhipu, открытые веса на Hugging Face (zai-org/GLM-5.3-Flash, MIT) и продукты Zhipu для разработки — ZCode и GLM Coding Plan, включающий набор ежедневных карточек опыта. Для самостоятельного развертывания лицензия MIT в сочетании с поддержкой vLLM и SGLang означает, что приведенные выше заявления об эффективности обслуживания можно проверить напрямую.
Что касается маршрутизации, сам GLM-5.3-Flash на момент этого обновления ещё не в списке OrcaRouter. Остальные модели семейства GLM уже там: GLM-5.3 заработал у нас в тот же день, когда открылся API Zhipu, по прайсу Zhipu с нулевой наценкой. Именно этот механизм переноса цен важен для такого запуска: изменение цены вендора — сохранится ли скидка или тариф позже поменяется — отображается у нас в тот же день, без переговоров. Если вы хотите, чтобы Flash, когда он появится, работал на одном ключе вместе с остальной линейкой GLM, это как раз та схема; а пока самый быстрый способ протестировать его самостоятельно — веса на Hugging Face.

Что посмотреть дальше
Три вещи определят реальную историю в ближайшие пару недель. Во-первых, независимое измерение Artificial Analysis для модели 57 — модель уже работала в открытом доступе как Ox Alpha, так что таблица лидеров быстро догонит. Во-вторых, будет ли продлена акция со скидкой 50% — которая сейчас должна закончиться 9 сентября 2026 года, — поскольку это определяет постоянную стоимость Flash. В-третьих, веса GLM-5.3, которые всё ещё обещаны примерно на 28 августа — на ту же неделю, когда стали доступны веса Flash с лицензией MIT, что даст сообществу открытых весов возможность сравнить сразу два уровня одного семейства.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
