Титульная карточка для GLM-5.3-FlashX против DeepSeek V4.1 Flash с подзаголовком «Скоростной уровень, который медленнее дешёвой модели», с чипами «200 против 214.7 ток/с», «$0.37 / $1.25 против $0.15 / $0.60» и «AA 42 против 40», а также строкой в нижнем колонтитуле «GLM-5.3-FlashX выпущена 18 сентября 2026 года».
Guides & Insights

GLM-5.3-FlashX против DeepSeek V4.1 Flash: скоростной уровень, который медленнее дешёвой модели

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У премиального скоростного тарифа Z.ai есть проблема, и называется она DeepSeek V4.1 Flash. Когда Z.ai запустила GLM-5.3-FlashX 18 сентября 2026 года, новый тариф продавали с одним числом: до 200 выходных токенов в секунду — примерно в пять раз выше пропускной способности GLM-5.3-Flash, на основе которого он создан, — за цену в 2,5 раза выше. Независимые измерения уже показывают, что бюджетная модель DeepSeek выдаёт 214,7 токена в секунду при времени до первого токена 1,15 секунды — быстрее по обоим показателям, чем потолок, который рекламирует Z.ai, и по цене, к которой FlashX даже близко не подходит. Если вы покупаете скорость, рынок изменился ещё до появления FlashX.

Эта формулировка несправедлива к FlashX в одном конкретном смысле и справедлива во всех остальных. Обе модели — производные с открытыми весами и контекстом 1M, спроектированные с прицелом на экономичность, и обе действительно хороши в том, для чего их создавали. Но они создавались для разных половин одной и той же задачи, и разрыв в цене между ними теперь настолько велик, что на вопрос «какая лучше» для большинства рабочих нагрузок можно ответить одной строкой.

В чём каждый из них на самом деле впереди

• Цена по прайс-листу — GLM-5.3-FlashX $0.37 / $1.25 за 1 млн входных/выходных токенов против DeepSeek V4.1 Flash $0.15 / $0.60 в непиковые часы, $0.30 / $1.20 в пиковыеbr> • Кэшированный ввод — FlashX $0.075 за 1 млн против DeepSeek $0.003 в непиковые часы — разрыв в 25 раз, который сильно накапливается в агентных циклахbr> • Измеренная пропускная способность — FlashX до 200 ток/с (пик по данным вендора, независимые показатели не опубликованы) против DeepSeek 214.7 ток/с (Artificial Analysis, на API DeepSeek)br> • Время до первого токена — не опубликовано для FlashX против измеренных 1.15 с для DeepSeek V4.1 Flashbr> • Независимый интеллект — FlashX наследует 42 балла GLM-5.3-Flash в Artificial Analysis Intelligence Index против 40 у DeepSeek V4.1 Flashbr> • Архитектура — 320B всего / 18B активных MoE против 552B всего при примерно 8B активных на этапе prefill и 16B на этапе decodebr> • Входная модальность — текст, изображение, видео и файлы против текста и изображенияbr> • Лимит вывода — 131,072 токена против примерно 384,000br> • Открытые веса — GLM-5.3-Flash имеет лицензию MIT; FlashX — это хостинговый тариф без собственных весов, а DeepSeek V4.1 Flash имеет лицензию MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Прочитайте этот список дважды, потому что его форма и есть суть истории. FlashX выигрывает ровно в двух строках, и обе узкие: преимущество в два пункта в независимом индексе интеллекта и ввод видео. DeepSeek выигрывает по цене, цене с кэшированием, измеренной скорости, длине вывода и широте модальностей в том смысле, который имеет значение — он принимает изображения и выдаёт длинные ответы. Разрыв в два пункта в индексе находится в пределах шума одного прогона бенчмарка и не должен быть тем, что определяет вашу архитектуру.

Уровень скорости, который медленнее, чем у дешёвой модели

На этом стоит остановиться подробнее. Z.ai создала FlashX, чтобы решить реальную проблему: GLM-5.3-Flash работает медленно. Artificial Analysis измерила его на уровне 98 выходных токенов в секунду — это выше медианы среди аналогичных открытых моделей с открытыми весами такого размера, но всё ещё далеко от интерактивного уровня. Решением компании стала перестройка стека обслуживания — примерно 100 000 отечественных ускорителей, движок на базе SGLang, квантование W8A8, KV-кэш смешанной точности и архитектура с разделением этапов кодирования, префилла и декодирования, — и она сообщает о примерно 3-кратном росте сквозной пропускной способности по сравнению с базовым вариантом на том же оборудовании.

DeepSeek решила ту же проблему на уровне архитектуры — и сделала это первой. Разделение Causal Encoder–Decoder в V4.1 Flash активирует около 8 млрд параметров при prefill и 16 млрд при декодировании, а не единый фиксированный показатель, а Compressed Sparse Attention 2 с FP4-кэшированием KV сокращает глобальный кэш до 890 байт на токен — это примерно четверть HBM и одна восьмая от SSD-хранилища, необходимого её предшественнику. В результате модель работает со скоростью 214,7 токена в секунду по замерам независимой лаборатории, через тот же API от самой компании, причём премиум-тариф не требуется.

200 у Z.ai — это пиковое значение от производителя, а 214,7 у DeepSeek — независимая медиана. Это наименее выгодное из возможных сравнений для Z.ai, и именно поэтому к нему не стоит относиться слишком уверенно. Вполне возможно, что FlashX обойдёт DeepSeek на прогретом запросе с коротким выводом и без перегрузки. Но узнать это невозможно, потому что никто за пределами Z.ai не публиковал данные о пропускной способности FlashX. Что известно сегодня, так это то, что обе модели находятся в одном диапазоне скорости, а одна из них стоит втрое дешевле.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Где ценовое преимущество DeepSeek становится структурным

DeepSeek V4.1 Flash взимает $0,15 за миллион входных токенов и $0,60 за миллион выходных токенов в непиковые часы, а в двух окнах по будням (01:00–04:00 и 06:00–10:00 UTC) цена удваивается до $0,30 и $1,20. У FlashX — $0,37 и $1,25 фиксированно. Сопоставьте это, и фиксированное ценообразование, которое выглядит как преимущество, на самом деле оказывается более дорогой схемой для всех, кто может планировать работу.

Именно строка кэшированного ввода определяет экономику агентских рабочих нагрузок. DeepSeek берёт $0.003 за миллион кэшированных входных токенов в непиковые часы; FlashX берёт $0.075 — в двадцать пять раз больше. Агент, который заново отправляет длинный системный промпт и схему инструментов на каждом шаге, платит эту разницу на каждом шаге, и это та единственная статья расходов, которая с наибольшей вероятностью будет доминировать в реальном счёте. Z.ai указывает хранение кэша как бесплатное на ограниченное время, но это скидка на хранение, а не на чтения, которые фактически накапливаются.

Есть противовес, и это честность относительно того, чего стоят собственные цифры DeepSeek. Оценки, проводимые поставщиком, на которых основаны заявленные показатели V4.1 Flash, были получены при максимальном уровне усилий, и DeepSeek документирует, что переход от уровня усилий 25 к уровню 100 поднимает DeepSWE v1.1 с 66,0 до 74,2, потребляя при этом примерно в 2,5 раза больше выходных токенов. При 2,5-кратном объёме токенов эффективная стоимость конфигурации с высоким уровнем усилий намного ближе к FlashX, чем кажется по ценнику, — и модель, согласно документации, очень многословна: 250 млн выходных токенов в Intelligence Index против медианы 130 млн. Дешёвый тариф за токен у болтливой модели — не то же самое, что дешёвая задача. Всем, кто сравнивает эти две модели по цене, следует сравнивать стоимость за выполненную задачу, а не стоимость за миллион токенов, и ожидать, что придётся измерять, а не оценивать.

Как конкретно принять решение

Если ваша рабочая нагрузка — это долгоработающий агент со стабильным префиксом, выбирайте DeepSeek V4.1 Flash, и уже одно соотношение кэшированного ввода решает дело. Если вам нужно понимание видео или ввод файлов в рамках одного вызова, FlashX — единственный из двух, который это поддерживает; это реальное различие в возможностях, а не различие из таблицы характеристик. Если вам нужны длинные сгенерированные ответы, ограничение вывода DeepSeek примерно в 384K против 131,072 у FlashX имеет значение для генерации отчётов, длинных файлов кода и всего, что синтезирует, а не просто отвечает. Если вам нужен самый высокий независимый балл по одному показателю бенчмарка, 42 у FlashX против 40 — это реально, но слишком мало, чтобы на этом строить выводы.

Обе модели доступны из одной точки входа, если ваш стек уже настроен на маршрутизацию, — это самый дешёвый способ решить этот вопрос. В OrcaRouter цена из прайс-листа поставщика транслируется с наценкой 0%, поэтому скидка DeepSeek в непиковые часы и любое будущее изменение цены Z.ai вступают в силу в тот же день, когда происходят, а переключение между ними — это строка с именем модели, а не интеграция. Автоматическое переключение при сбое стоит иметь именно для FlashX: это сервисный уровень, существующий всего три недели, на новом кластере, и отказ, от которого вы страхуетесь, — это потолок мощности, а не модель, которая перестаёт работать.

Откровенно говоря: DeepSeek V4.1 Flash — лучший выбор по умолчанию для большинства production-задач: дешевле за токен, дешевле за кешированный токен, по замерам быстрее и способен выдавать более длинные ответы. GLM-5.3-FlashX — верное решение в более узкой нише, где нужен ввод видео или файлов и хочется, чтобы за ним стоял чуть более высокий независимый индекс. Z.ai назначила премиальную цену за скоростной тариф и вывела его на рынок, где быстрая дешёвая модель уже существовала. Вот и всё сравнение.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно