Титульная карточка для GLM-5.3-FlashX vs GLM-5.3-Flash с подзаголовком «Те же веса, два ценника», плашками «200 vs 98 tok/s», «$0.37 / $1.25 vs $0.15 / $0.50» и «Одинаковый интеллект», а также строкой внизу «GLM-5.3-FlashX выпущена 18 сентября 2026 года».
Guides & Insights

GLM-5.3-FlashX против GLM-5.3-Flash: те же веса, цена в 2,5 раза выше, одно отличающееся число

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вы не можете купить GLM-5.3-FlashX и получить более совершенную модель. Это не критика — это вся суть. GLM-5.3-FlashX, запущенная в API Z.ai 18 сентября 2026 года, использует те же самые веса, что и GLM-5.3-Flash: ту же архитектуру смеси экспертов с 320 млрд общих и 18 млрд активных параметров, тот же контекст в 1 млн токенов, тот же встроенный ввод текста, изображений, видео и файлов, тот же лимит вывода в 131 072 токена. Z.ai не опубликовала ни одного бенчмарка FlashX, потому что бенчмаркать там нечего. Различие лишь в том, как быстро выдаются токены и сколько они стоят, и эти два числа — единственное, о чём покупателю нужно рассуждать.

Это более однозначное решение, чем в большинстве сравнений моделей, и более трудное, потому что за ним нет истории о возможностях, за которой можно спрятаться. Либо задержка для вас стоит этих 2,5×, либо нет.

Одна модель, два ценника

• Что такое FlashX — это уровень обслуживания, а не выпуск модели; те же веса, те же оценки, те же ограниченияbr> • Цена ввода — $0.37 за 1 млн токенов на FlashX против $0.15 за 1 млн на Flash по прайс-листуbr> • Цена вывода — $1.25 за 1 млн против $0.50 за 1 млн — множитель, который реально влияет на счётbr> • Кэшированный ввод — $0.075 за 1 млн против $0.03 за 1 млнbr> • Скорость — до 200 выходных токенов в секунду (пиковое значение по данным вендора) против 98 ток/с, независимо измеренных Artificial Analysisbr> • Доступ по подписке — GLM-5.3-Flash включён в GLM Coding Plan от Z.ai с квотой ×3; FlashX не включёнbr> • Самостоятельный хостинг — GLM-5.3-Flash — это открытые веса под лицензией MIT на Hugging Face; у FlashX нет весов для скачивания

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

На домашнем рынке Z.ai то же соотношение указано прямо: ¥2 за вход и ¥7 за выход для FlashX против ¥0,8 и ¥2,8 для Flash. Несколько китайских изданий описывают запуск одинаково — скорость в 5 раз выше при цене в 2,5 раза выше — и каждое из них отмечает, что интеллект не изменился.

Латентность — это отдельная статья расходов, и она не тарифицируется по токенам.

Причина, по которой 2,5× не обязательно означает плохую сделку, в том, что цена токена и стоимость задачи — разные величины. Пакетное задание, которое за ночь генерирует миллион выходных токенов, платит $0,50 на Flash и $1,25 на FlashX только за выходные данные и ничего не получает обратно за дополнительные $0,75, потому что никто не ждёт. Цикл агента, который делает десять последовательных вызовов, платит ту же надбавку за токен, но каждый вызов возвращается быстрее, и экономия проявляется в реальном времени, а не в счёте. Если FlashX действительно возвращает результат за долю времени, десять ходов могут вернуть десятки секунд задержки на задачу — и если эта задача блокирует человека или вышестоящий сервис, секунды стоят больше, чем токены.

Собственное позиционирование Z.ai в точности следует этой линии. Оно нацеливает FlashX на программирование с высокой конкурентностью, многошаговые вызовы агентов, диалог в реальном времени, автодополнение кода и мультимодальную работу с длинным контекстом, а нагрузки, чувствительные к цене и нечувствительные к задержке — офлайн-пакетную обработку, массовую генерацию, всё, что запланировано — направляет обратно к базовому Flash. Это правильное разделение, и стоит отметить, что именно вендор его и проводит.

Слабое место этих рассуждений — пропускная способность. 200 токенов в секунду у FlashX — это пик, о котором сообщает поставщик; 98 у базовой модели — медиана, измеренная независимой лабораторией. Пиковые значения достигаются на коротких выводах с прогретым кэшем и простаивающим кластером. Длинноконтекстный мультимодальный запрос — именно та рабочая нагрузка, для которой и позиционируется FlashX, — меньше всего способен к этому приблизиться, а за пределами Z.ai никто не публиковал цифр, которые могли бы разрешить этот вопрос. Если ваша рабочая нагрузка ограничена пропускной способностью, а не задержкой, пиковое значение мало что говорит о том, что вы действительно получите.

Аварийный выход, которого нет у FlashX

В этом сравнении есть третий вариант, и он существует только потому, что базовая модель открыта. GLM-5.3-Flash вышел 26 августа 2026 года под лицензией MIT, с весами на Hugging Face и ModelScope, и сегодня его обслуживают стеки инференса, включая SGLang, vLLM, TokenSpeed и KTransformers. Если ваш объём достаточно велик, чтобы оправдать затраты на оборудование, честное сравнение — не Flash против FlashX, а $1,25 за миллион выходных токенов у FlashX против вашей собственной амортизированной стоимости за токен на ваших собственных ускорителях.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

У этого варианта есть реальная цена входа. Для обслуживания релиза FP8 требуется порядка 328 ГБ памяти GPU, что для большинства команд означает развёртывание на нескольких узлах, а для остальных — заведомо неприемлемый вариант. Но об этом стоит сказать, потому что именно эта асимметрия делает ценообразование FlashX намеренной проверкой, а не неизбежностью: Z.ai берёт надбавку за конфигурацию обслуживания, которую для базовой модели клиенты в принципе могут собрать сами. Надбавка — за удобство, а не за возможности, а у удобства есть рыночная цена, которая со временем снижается.

В чём на самом деле суть изменения цены

Экономика, стоящая за этим запуском, необычайно прозрачна. GLM-5.3-Flash был выпущен по цене в одну десятую от цены GLM-5.3 — а во время промоакции по случаю запуска — вдвое дешевле этой суммы — и активно использовался, включая период анонимного предрелизного тестирования, которое Z.ai с тех пор подтвердила. FlashX — первый случай, когда это семейство двинулось в обратном направлении: та же модель, но по более высокой цене. Аналитики, цитируемые китайской финансовой прессой, расценивают это как намеренную коммерческую проверку того, готовы ли разработчики платить за скорость как таковую, после года покупки доли рынка с почти фронтирными возможностями по бросовым ценам.

Это прочтение подтверждают две детали. FlashX исключён из GLM Coding Plan, тогда как базовый Flash включён с тройной квотой, поэтому подписчики не могут вписать новый уровень в уже существующую подписку — им приходится платить за токен. А цена фиксированная, без скидки в непиковые часы, в отличие от структуры цен по времени суток, которую некоторые конкуренты используют, чтобы заполнить простаивающие мощности. Фиксированный множитель 2,5× в скоростном тарифе — это цена для тех, кто не может ждать, и Z.ai выясняет, сколько таких есть.

Выбирая между ними

Берите FlashX, если человек или сервис блокируется в ожидании следующего токена, а сама модель уже является правильным выбором — встроенное автодополнение, интерактивные агенты, чат в реальном времени, всё, где пауза и есть продукт. Берите GLM-5.3-Flash для пакетной, офлайн- и массовой работы, для всего, что можно запланировать, и для любой нагрузки, где вы платите за объём вывода, а не за задержку вывода. Если у вас большой объём и ваша команда может запускать ускорители, оцените стоимость самостоятельно развёрнутых базовых весов, прежде чем оценивать FlashX; это сравнение выходит выгоднее, чем можно предположить по тарифам за токены.

Как бы вы ни пошли, в месте вызова обращайтесь с ними как с взаимозаменяемыми. Они принимают одни и те же промпты, возвращают один и тот же формат и дают одно и то же качество — меняется только строка модели, а это самый дешёвый вид A/B-теста. На OrcaRouter цена вендора по прайс-листу передаётся с наценкой 0 %, поэтому изменение цен Z.ai или акция применяются в тот же день, когда они появляются у апстрима, а оба тарифа находятся за одной конечной точкой перед более чем 200 моделями. Для решения, которое полностью зависит от измеренной задержки, возможность переключаться между ними прямо в ходе эксперимента, не трогая свою интеграцию, — это и есть большая часть работы.

Вывод уже, чем при обычном сравнении моделей, и в этом весь смысл. FlashX — не лучшая модель и не притворяется лучшей. Это та же самая модель с более короткой очередью, продаваемая по цене, которая имеет смысл, только если вашей проблемой была очередь. Измерьте собственное время до первого токена на обоих вариантах, прежде чем принимать решение — заявленные вендором 200 — это потолок, ваша рабочая нагрузка — единственный бенчмарк, который имеет значение, а разница между двумя уровнями — всего лишь одно изменение конфигурации.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно