
GLM-5.3-FlashX выпускается по цене в 2,5 раза выше, чем модель, на которой он работает
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Число, на которое стоит обратить внимание, — не 200. Это 2,5. 18 сентября 2026 года Z.ai разместила GLM-5.3-FlashX в своём API с выдачей до 200 выходных токенов в секунду — и оценила её в 2,5× от того, что взимает за GLM-5.3-Flash, модель с открытыми весами, на основе которой она построена. В самой модели ничего не изменилось. Те же веса, та же основа mixture-of-experts 320B-A18B, тот же контекст на 1 млн токенов, та же нативная обработка текста, изображений, видео и файлов. Изменилось то, что находится под ней — стек обслуживания, — а также то, что Z.ai теперь взимает плату за привилегию находиться ближе к началу очереди.
Это делает FlashX редким явлением на рынке моделей: запуск без прикреплённого бенчмарка. Z.ai не опубликовала никакой оценки, специфичной для FlashX, потому что нет новой модели, которую можно было бы оценить. Все показатели возможностей, применимые к GLM-5.3-Flash, применимы и здесь, включая те, что менее лестны, чем предполагало освещение запуска.
Вся дельта за один проход
• Скорость — GLM-5.3-FlashX до 200 ток/с (пиковое значение по данным производителя) против GLM-5.3-Flash на 98 ток/с по измерениям Artificial Analysis на собственном API Z.aibr> • Цена — $0.37 за 1 млн входных / $1.25 за 1 млн выходных против $0.15 / $0.50 по прайс-листуbr> • Кэшированный ввод — $0.075 за 1 млн против $0.03 за 1 млнbr> • Интеллект — идентичен; FlashX наследует показатели базовой моделиbr> • Контекст — 1 млн токенов в обоих случаяхbr> • Веса — GLM-5.3-Flash — это открытые веса под лицензией MIT; FlashX — хостинговый тариф, собственных весов у него нет
200 и 98 — это числа разного рода, и об этом стоит сказать прямо. Одно — это потолок, которого, по словам поставщика, сервис может достичь. Другое — то, что независимая лаборатория измерила на реальных запросах. Пользователь, решающий, платить ли в 2,5 раза больше, должен воспринимать 200 как рекламу и пойти измерить собственную рабочую нагрузку.

То, что говорит Z.ai, выполняет работу
Ускорение обусловлено инфраструктурой, а не математикой. Z.ai описывает FlashX как работающий на кластере из примерно 100 000 отечественных китайских ускорителей со специально созданным стеком обслуживания: движок инференса на основе SGLang, квантование W8A8, смешанное квантование кэша INT8/FP8/BF16 и архитектура с разделением этапов encode–prefill–decode, которая отделяет этап мультимодального кодирования от этапов генерации токенов, чтобы они не блокировали друг друга. Компания сообщает о примерно 3-кратном увеличении сквозной пропускной способности сервиса по сравнению с первоначальным базовым уровнем на том же оборудовании и заявляет, что инфраструктурный агент на базе GLM-5.3 помог настроить этот стек.
Всё это заявлено производителем и на данный момент не воспроизведено никем за пределами Z.ai. Это также самая правдоподобная часть истории: запуски сервисного уровня, подобные этому, обычно представляют собой инженерные достижения, а описанные архитектурные решения — стандартный набор инструментов именно для такого прироста. Но гарантией они не являются. Показатель в 200 ток/с — это пик, а пики достигаются на коротких выводах, прогретых кэшах и не перегруженном кластере. Длинноконтекстные мультимодальные запросы — именно та рабочая нагрузка, на которую FlashX явно нацелен, — с наименьшей вероятностью достигнут этого пика.
Цена — это и есть само решение о продукте.
По прейскуранту GLM-5.3-FlashX стоит $0,37 за миллион входных токенов и $1,25 за миллион выходных токенов, при этом кэшированный ввод — $0,075, а хранение кэша бесплатно в течение ограниченного времени. В локальных ценах Z.ai это ¥2 на входе и ¥7 на выходе против ¥0,8 и ¥2,8 для базовой Flash — то же соотношение 2,5×, выраженное в валюте, в которой Z.ai продаётся на внутреннем рынке.

Арифметика быстро становится неудобной в том направлении, которое люди редко проверяют. Выходные токены — это то место, где множитель кусается сильнее всего, потому что вывод — это дорогая сторона у каждой модели в этом семействе: вывод FlashX стоит в 2,5 раза дороже вывода Flash, а вывод уже примерно в 3,4 раза дороже ввода у обоих. Пакетное задание, которое генерирует миллион выходных токенов в день, переходит с $0,50 на $1,25 — разница в $274 в год для рабочей нагрузки, которую по определению никто не ждёт.
Окупается это за счёт задержки, которую можно амортизировать. Агентный цикл, выполняющий десять последовательных вызовов, десятикратно экономит разницу, приходящуюся на один вызов, и если эта разница составляет две-три секунды, вы возвращаете себе полминуты реального времени на задачу. Для интерактивного автодополнения кода, диалога в реальном времени или любого конвейера, где человек или вышестоящий сервис ждёт следующего токена, такой компромисс обычно оправдан. Z.ai также прямо указывает, что модель сейчас не входит в её GLM Coding Plan, поэтому подписчики не получают FlashX в составе подписки — они платят за него по токенам.
Если ваш стек уже работает более чем с одним провайдером, переключение — это изменение строки модели, и ничего больше. Именно в этом практическая причина существования маршрутизации как слоя: в OrcaRouter прайс-лист вендора транслируется с наценкой 0%, поэтому изменение цены Z.ai или промо-скидка вступают в силу в тот же день, когда это происходит у апстрима, а единая точка входа перед 200+ моделями означает, что сравнить FlashX с Flash — это правка конфигурации, а не интеграционный проект. Отказоустойчивость здесь тоже важна — совершенно новый уровень обслуживания на совершенно новом кластере — это именно та зависимость, за которой стоит иметь резерв.
Что не изменилось — и почему это важнее
FlashX полностью наследует профиль возможностей GLM-5.3-Flash, а этот профиль уже, чем подразумевалось в материалах к запуску. В материалах Z.ai базовая модель ставится на один уровень с Claude Opus 4.8 в Индексе интеллекта Artificial Analysis. Сама Artificial Analysis в настоящее время указывает GLM-5.3-Flash на уровне 42 в этом индексе, измеренном через собственный API Z.ai, — это солидный результат, заметно выше медианы для открытых моделей его класса и далеко от фронтирного уровня, на который намекает сравнение от вендора. Оба утверждения верны; просто это не одно и то же утверждение, и разрыв между ними — причина, по которой этот блог помечает числа вендоров как числа вендоров.
Базовая модель по-настоящему способна и по-настоящему открыта. GLM-5.3-Flash вышла 26 августа 2026 года под лицензией MIT с весами на Hugging Face, а её гибридная схема внимания, сочетающая линейный и разреженный подходы — сжатие IndexPool, гиперсвязи с ограничением на многообразии, — сокращает вычисления на внимание примерно в 3 раза и KV-кэш примерно в 4,4 раза по сравнению с GLM-5.3; именно это делает модель на 320B с 18B активных параметров достаточно дешёвой, чтобы её вообще можно было обслуживать. Объём вывода ограничен 131 072 токенами. Она быстра для своей цены, но не быстра для своего класса: Artificial Analysis замерила 98 токенов в секунду при медиане среди аналогов выше 70, но ниже, чем у самых быстрых моделей в рейтинге.
FlashX ничего из этого не меняет. Он меняет лишь то, как долго вам приходится ждать.
Честное прочтение
Покупайте FlashX, если ваша нагрузка ограничена задержкой и вы уже решили, что GLM-5.3-Flash — подходящая модель: агент, который выстраивает цепочки вызовов, редактор, дополняющий текст прямо в строке, голосовой или чатовый интерфейс, где пауза и есть продукт. Оставайтесь на GLM-5.3-Flash или на открытых весах, которые вы можете хостить у себя, если ваша работа пакетная, офлайн или ограничена пропускной способностью, а не задержкой. Интеллект, за который вы платите в 2,5 раза больше, — это интеллект, который у вас уже был.
Открытый вопрос — что независимые измерения говорят о 200. Никто за пределами Z.ai пока не публиковал показатели пропускной способности FlashX, и пока кто-нибудь этого не сделает, честная позиция состоит в том, что FlashX — перспективный уровень обслуживания, продаваемый на основе пикового показателя. Примечательно также, что это коммерческая проверка: лаборатория, которая потратила год, раздавая почти фронтирную модель за одну десятую цены своего флагмана, теперь спрашивает, будут ли разработчики платить за скорость как таковую. Ответ определит, как будет назначаться цена на следующий уровень.

Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
