
GLM-5.3-FlashX против GLM-5.3-Flash: те же веса, цена в 2,5 раза выше, одно отличающееся число
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Вы не можете купить GLM-5.3-FlashX и получить более совершенную модель. Это не критика — это вся суть. GLM-5.3-FlashX, запущенная в API Z.ai 18 сентября 2026 года, использует те же самые веса, что и GLM-5.3-Flash: ту же архитектуру смеси экспертов с 320 млрд общих и 18 млрд активных параметров, тот же контекст в 1 млн токенов, тот же встроенный ввод текста, изображений, видео и файлов, тот же лимит вывода в 131 072 токена. Z.ai не опубликовала ни одного бенчмарка FlashX, потому что бенчмаркать там нечего. Различие лишь в том, как быстро выдаются токены и сколько они стоят, и эти два числа — единственное, о чём покупателю нужно рассуждать.
Это более однозначное решение, чем в большинстве сравнений моделей, и более трудное, потому что за ним нет истории о возможностях, за которой можно спрятаться. Либо задержка для вас стоит этих 2,5×, либо нет.
Одна модель, два ценника
• Что такое FlashX — это уровень обслуживания, а не выпуск модели; те же веса, те же оценки, те же ограниченияbr> • Цена ввода — $0.37 за 1 млн токенов на FlashX против $0.15 за 1 млн на Flash по прайс-листуbr> • Цена вывода — $1.25 за 1 млн против $0.50 за 1 млн — множитель, который реально влияет на счётbr> • Кэшированный ввод — $0.075 за 1 млн против $0.03 за 1 млнbr> • Скорость — до 200 выходных токенов в секунду (пиковое значение по данным вендора) против 98 ток/с, независимо измеренных Artificial Analysisbr> • Доступ по подписке — GLM-5.3-Flash включён в GLM Coding Plan от Z.ai с квотой ×3; FlashX не включёнbr> • Самостоятельный хостинг — GLM-5.3-Flash — это открытые веса под лицензией MIT на Hugging Face; у FlashX нет весов для скачивания

На домашнем рынке Z.ai то же соотношение указано прямо: ¥2 за вход и ¥7 за выход для FlashX против ¥0,8 и ¥2,8 для Flash. Несколько китайских изданий описывают запуск одинаково — скорость в 5 раз выше при цене в 2,5 раза выше — и каждое из них отмечает, что интеллект не изменился.
Латентность — это отдельная статья расходов, и она не тарифицируется по токенам.
Причина, по которой 2,5× не обязательно означает плохую сделку, в том, что цена токена и стоимость задачи — разные величины. Пакетное задание, которое за ночь генерирует миллион выходных токенов, платит $0,50 на Flash и $1,25 на FlashX только за выходные данные и ничего не получает обратно за дополнительные $0,75, потому что никто не ждёт. Цикл агента, который делает десять последовательных вызовов, платит ту же надбавку за токен, но каждый вызов возвращается быстрее, и экономия проявляется в реальном времени, а не в счёте. Если FlashX действительно возвращает результат за долю времени, десять ходов могут вернуть десятки секунд задержки на задачу — и если эта задача блокирует человека или вышестоящий сервис, секунды стоят больше, чем токены.
Собственное позиционирование Z.ai в точности следует этой линии. Оно нацеливает FlashX на программирование с высокой конкурентностью, многошаговые вызовы агентов, диалог в реальном времени, автодополнение кода и мультимодальную работу с длинным контекстом, а нагрузки, чувствительные к цене и нечувствительные к задержке — офлайн-пакетную обработку, массовую генерацию, всё, что запланировано — направляет обратно к базовому Flash. Это правильное разделение, и стоит отметить, что именно вендор его и проводит.
Слабое место этих рассуждений — пропускная способность. 200 токенов в секунду у FlashX — это пик, о котором сообщает поставщик; 98 у базовой модели — медиана, измеренная независимой лабораторией. Пиковые значения достигаются на коротких выводах с прогретым кэшем и простаивающим кластером. Длинноконтекстный мультимодальный запрос — именно та рабочая нагрузка, для которой и позиционируется FlashX, — меньше всего способен к этому приблизиться, а за пределами Z.ai никто не публиковал цифр, которые могли бы разрешить этот вопрос. Если ваша рабочая нагрузка ограничена пропускной способностью, а не задержкой, пиковое значение мало что говорит о том, что вы действительно получите.
Аварийный выход, которого нет у FlashX
В этом сравнении есть третий вариант, и он существует только потому, что базовая модель открыта. GLM-5.3-Flash вышел 26 августа 2026 года под лицензией MIT, с весами на Hugging Face и ModelScope, и сегодня его обслуживают стеки инференса, включая SGLang, vLLM, TokenSpeed и KTransformers. Если ваш объём достаточно велик, чтобы оправдать затраты на оборудование, честное сравнение — не Flash против FlashX, а $1,25 за миллион выходных токенов у FlashX против вашей собственной амортизированной стоимости за токен на ваших собственных ускорителях.

У этого варианта есть реальная цена входа. Для обслуживания релиза FP8 требуется порядка 328 ГБ памяти GPU, что для большинства команд означает развёртывание на нескольких узлах, а для остальных — заведомо неприемлемый вариант. Но об этом стоит сказать, потому что именно эта асимметрия делает ценообразование FlashX намеренной проверкой, а не неизбежностью: Z.ai берёт надбавку за конфигурацию обслуживания, которую для базовой модели клиенты в принципе могут собрать сами. Надбавка — за удобство, а не за возможности, а у удобства есть рыночная цена, которая со временем снижается.
В чём на самом деле суть изменения цены
Экономика, стоящая за этим запуском, необычайно прозрачна. GLM-5.3-Flash был выпущен по цене в одну десятую от цены GLM-5.3 — а во время промоакции по случаю запуска — вдвое дешевле этой суммы — и активно использовался, включая период анонимного предрелизного тестирования, которое Z.ai с тех пор подтвердила. FlashX — первый случай, когда это семейство двинулось в обратном направлении: та же модель, но по более высокой цене. Аналитики, цитируемые китайской финансовой прессой, расценивают это как намеренную коммерческую проверку того, готовы ли разработчики платить за скорость как таковую, после года покупки доли рынка с почти фронтирными возможностями по бросовым ценам.
Это прочтение подтверждают две детали. FlashX исключён из GLM Coding Plan, тогда как базовый Flash включён с тройной квотой, поэтому подписчики не могут вписать новый уровень в уже существующую подписку — им приходится платить за токен. А цена фиксированная, без скидки в непиковые часы, в отличие от структуры цен по времени суток, которую некоторые конкуренты используют, чтобы заполнить простаивающие мощности. Фиксированный множитель 2,5× в скоростном тарифе — это цена для тех, кто не может ждать, и Z.ai выясняет, сколько таких есть.
Выбирая между ними
Берите FlashX, если человек или сервис блокируется в ожидании следующего токена, а сама модель уже является правильным выбором — встроенное автодополнение, интерактивные агенты, чат в реальном времени, всё, где пауза и есть продукт. Берите GLM-5.3-Flash для пакетной, офлайн- и массовой работы, для всего, что можно запланировать, и для любой нагрузки, где вы платите за объём вывода, а не за задержку вывода. Если у вас большой объём и ваша команда может запускать ускорители, оцените стоимость самостоятельно развёрнутых базовых весов, прежде чем оценивать FlashX; это сравнение выходит выгоднее, чем можно предположить по тарифам за токены.
Как бы вы ни пошли, в месте вызова обращайтесь с ними как с взаимозаменяемыми. Они принимают одни и те же промпты, возвращают один и тот же формат и дают одно и то же качество — меняется только строка модели, а это самый дешёвый вид A/B-теста. На OrcaRouter цена вендора по прайс-листу передаётся с наценкой 0 %, поэтому изменение цен Z.ai или акция применяются в тот же день, когда они появляются у апстрима, а оба тарифа находятся за одной конечной точкой перед более чем 200 моделями. Для решения, которое полностью зависит от измеренной задержки, возможность переключаться между ними прямо в ходе эксперимента, не трогая свою интеграцию, — это и есть большая часть работы.
Вывод уже, чем при обычном сравнении моделей, и в этом весь смысл. FlashX — не лучшая модель и не притворяется лучшей. Это та же самая модель с более короткой очередью, продаваемая по цене, которая имеет смысл, только если вашей проблемой была очередь. Измерьте собственное время до первого токена на обоих вариантах, прежде чем принимать решение — заявленные вендором 200 — это потолок, ваша рабочая нагрузка — единственный бенчмарк, который имеет значение, а разница между двумя уровнями — всего лишь одно изменение конфигурации.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
