
GLM-5.3-FlashX против DeepSeek V4.1 Flash: скоростной уровень, который медленнее дешёвой модели
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
У премиального скоростного тарифа Z.ai есть проблема, и называется она DeepSeek V4.1 Flash. Когда Z.ai запустила GLM-5.3-FlashX 18 сентября 2026 года, новый тариф продавали с одним числом: до 200 выходных токенов в секунду — примерно в пять раз выше пропускной способности GLM-5.3-Flash, на основе которого он создан, — за цену в 2,5 раза выше. Независимые измерения уже показывают, что бюджетная модель DeepSeek выдаёт 214,7 токена в секунду при времени до первого токена 1,15 секунды — быстрее по обоим показателям, чем потолок, который рекламирует Z.ai, и по цене, к которой FlashX даже близко не подходит. Если вы покупаете скорость, рынок изменился ещё до появления FlashX.
Эта формулировка несправедлива к FlashX в одном конкретном смысле и справедлива во всех остальных. Обе модели — производные с открытыми весами и контекстом 1M, спроектированные с прицелом на экономичность, и обе действительно хороши в том, для чего их создавали. Но они создавались для разных половин одной и той же задачи, и разрыв в цене между ними теперь настолько велик, что на вопрос «какая лучше» для большинства рабочих нагрузок можно ответить одной строкой.
В чём каждый из них на самом деле впереди
• Цена по прайс-листу — GLM-5.3-FlashX $0.37 / $1.25 за 1 млн входных/выходных токенов против DeepSeek V4.1 Flash $0.15 / $0.60 в непиковые часы, $0.30 / $1.20 в пиковыеbr> • Кэшированный ввод — FlashX $0.075 за 1 млн против DeepSeek $0.003 в непиковые часы — разрыв в 25 раз, который сильно накапливается в агентных циклахbr> • Измеренная пропускная способность — FlashX до 200 ток/с (пик по данным вендора, независимые показатели не опубликованы) против DeepSeek 214.7 ток/с (Artificial Analysis, на API DeepSeek)br> • Время до первого токена — не опубликовано для FlashX против измеренных 1.15 с для DeepSeek V4.1 Flashbr> • Независимый интеллект — FlashX наследует 42 балла GLM-5.3-Flash в Artificial Analysis Intelligence Index против 40 у DeepSeek V4.1 Flashbr> • Архитектура — 320B всего / 18B активных MoE против 552B всего при примерно 8B активных на этапе prefill и 16B на этапе decodebr> • Входная модальность — текст, изображение, видео и файлы против текста и изображенияbr> • Лимит вывода — 131,072 токена против примерно 384,000br> • Открытые веса — GLM-5.3-Flash имеет лицензию MIT; FlashX — это хостинговый тариф без собственных весов, а DeepSeek V4.1 Flash имеет лицензию MIT

Прочитайте этот список дважды, потому что его форма и есть суть истории. FlashX выигрывает ровно в двух строках, и обе узкие: преимущество в два пункта в независимом индексе интеллекта и ввод видео. DeepSeek выигрывает по цене, цене с кэшированием, измеренной скорости, длине вывода и широте модальностей в том смысле, который имеет значение — он принимает изображения и выдаёт длинные ответы. Разрыв в два пункта в индексе находится в пределах шума одного прогона бенчмарка и не должен быть тем, что определяет вашу архитектуру.
Уровень скорости, который медленнее, чем у дешёвой модели
На этом стоит остановиться подробнее. Z.ai создала FlashX, чтобы решить реальную проблему: GLM-5.3-Flash работает медленно. Artificial Analysis измерила его на уровне 98 выходных токенов в секунду — это выше медианы среди аналогичных открытых моделей с открытыми весами такого размера, но всё ещё далеко от интерактивного уровня. Решением компании стала перестройка стека обслуживания — примерно 100 000 отечественных ускорителей, движок на базе SGLang, квантование W8A8, KV-кэш смешанной точности и архитектура с разделением этапов кодирования, префилла и декодирования, — и она сообщает о примерно 3-кратном росте сквозной пропускной способности по сравнению с базовым вариантом на том же оборудовании.
DeepSeek решила ту же проблему на уровне архитектуры — и сделала это первой. Разделение Causal Encoder–Decoder в V4.1 Flash активирует около 8 млрд параметров при prefill и 16 млрд при декодировании, а не единый фиксированный показатель, а Compressed Sparse Attention 2 с FP4-кэшированием KV сокращает глобальный кэш до 890 байт на токен — это примерно четверть HBM и одна восьмая от SSD-хранилища, необходимого её предшественнику. В результате модель работает со скоростью 214,7 токена в секунду по замерам независимой лаборатории, через тот же API от самой компании, причём премиум-тариф не требуется.
200 у Z.ai — это пиковое значение от производителя, а 214,7 у DeepSeek — независимая медиана. Это наименее выгодное из возможных сравнений для Z.ai, и именно поэтому к нему не стоит относиться слишком уверенно. Вполне возможно, что FlashX обойдёт DeepSeek на прогретом запросе с коротким выводом и без перегрузки. Но узнать это невозможно, потому что никто за пределами Z.ai не публиковал данные о пропускной способности FlashX. Что известно сегодня, так это то, что обе модели находятся в одном диапазоне скорости, а одна из них стоит втрое дешевле.

Где ценовое преимущество DeepSeek становится структурным
DeepSeek V4.1 Flash взимает $0,15 за миллион входных токенов и $0,60 за миллион выходных токенов в непиковые часы, а в двух окнах по будням (01:00–04:00 и 06:00–10:00 UTC) цена удваивается до $0,30 и $1,20. У FlashX — $0,37 и $1,25 фиксированно. Сопоставьте это, и фиксированное ценообразование, которое выглядит как преимущество, на самом деле оказывается более дорогой схемой для всех, кто может планировать работу.
Именно строка кэшированного ввода определяет экономику агентских рабочих нагрузок. DeepSeek берёт $0.003 за миллион кэшированных входных токенов в непиковые часы; FlashX берёт $0.075 — в двадцать пять раз больше. Агент, который заново отправляет длинный системный промпт и схему инструментов на каждом шаге, платит эту разницу на каждом шаге, и это та единственная статья расходов, которая с наибольшей вероятностью будет доминировать в реальном счёте. Z.ai указывает хранение кэша как бесплатное на ограниченное время, но это скидка на хранение, а не на чтения, которые фактически накапливаются.
Есть противовес, и это честность относительно того, чего стоят собственные цифры DeepSeek. Оценки, проводимые поставщиком, на которых основаны заявленные показатели V4.1 Flash, были получены при максимальном уровне усилий, и DeepSeek документирует, что переход от уровня усилий 25 к уровню 100 поднимает DeepSWE v1.1 с 66,0 до 74,2, потребляя при этом примерно в 2,5 раза больше выходных токенов. При 2,5-кратном объёме токенов эффективная стоимость конфигурации с высоким уровнем усилий намного ближе к FlashX, чем кажется по ценнику, — и модель, согласно документации, очень многословна: 250 млн выходных токенов в Intelligence Index против медианы 130 млн. Дешёвый тариф за токен у болтливой модели — не то же самое, что дешёвая задача. Всем, кто сравнивает эти две модели по цене, следует сравнивать стоимость за выполненную задачу, а не стоимость за миллион токенов, и ожидать, что придётся измерять, а не оценивать.
Как конкретно принять решение
Если ваша рабочая нагрузка — это долгоработающий агент со стабильным префиксом, выбирайте DeepSeek V4.1 Flash, и уже одно соотношение кэшированного ввода решает дело. Если вам нужно понимание видео или ввод файлов в рамках одного вызова, FlashX — единственный из двух, который это поддерживает; это реальное различие в возможностях, а не различие из таблицы характеристик. Если вам нужны длинные сгенерированные ответы, ограничение вывода DeepSeek примерно в 384K против 131,072 у FlashX имеет значение для генерации отчётов, длинных файлов кода и всего, что синтезирует, а не просто отвечает. Если вам нужен самый высокий независимый балл по одному показателю бенчмарка, 42 у FlashX против 40 — это реально, но слишком мало, чтобы на этом строить выводы.
Обе модели доступны из одной точки входа, если ваш стек уже настроен на маршрутизацию, — это самый дешёвый способ решить этот вопрос. В OrcaRouter цена из прайс-листа поставщика транслируется с наценкой 0%, поэтому скидка DeepSeek в непиковые часы и любое будущее изменение цены Z.ai вступают в силу в тот же день, когда происходят, а переключение между ними — это строка с именем модели, а не интеграция. Автоматическое переключение при сбое стоит иметь именно для FlashX: это сервисный уровень, существующий всего три недели, на новом кластере, и отказ, от которого вы страхуетесь, — это потолок мощности, а не модель, которая перестаёт работать.
Откровенно говоря: DeepSeek V4.1 Flash — лучший выбор по умолчанию для большинства production-задач: дешевле за токен, дешевле за кешированный токен, по замерам быстрее и способен выдавать более длинные ответы. GLM-5.3-FlashX — верное решение в более узкой нише, где нужен ввод видео или файлов и хочется, чтобы за ним стоял чуть более высокий независимый индекс. Z.ai назначила премиальную цену за скоростной тариф и вывела его на рынок, где быстрая дешёвая модель уже существовала. Вот и всё сравнение.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
