
DeepSeek V4.1 Flash против GLM-5.2: две модели под лицензией MIT, один скучный ответ
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
DeepSeek V4.1 Flash и GLM-5.2 — это объекты одного и того же типа, и именно эту часть большинство сравнений пропускает. Обе — модели со смесью экспертов, обе распространяются по лицензии MIT со скачиваемыми весами, обе поддерживают контекст в миллион токенов, и обе доступны через API, размещённый у поставщика, который их не обучал. GLM-5.2 появилась первой и на момент выпуска была моделью с открытыми весами, набравшей наивысший балл в индексе Artificial Analysis — 51. DeepSeek V4.1 Flash появилась 10 сентября 2026 года как меньшая, более новая и более дешёвая модель в новом семействе архитектур DeepSeek. Важное сравнение между ними не в том, какая из них умнее. Оно в том, какую из них вы можете запустить и во сколько это обойдётся — для тех задач, которые у вас действительно есть.
То, что у них общего, а это большая часть.
Начните с совпадений, потому что они устраняют большинство обычных критериев выбора. Если вы выбираете между открытой моделью и закрытой, вы взвешиваете риск привязки к поставщику, взвешиваете возможность тонкой настройки, взвешиваете, может ли поставщик изменить условия для вас. Ничего из этого здесь не применимо. И DeepSeek V4.1 Flash, и GLM-5.2 имеют лицензию MIT, а их веса можно загрузить и развернуть самостоятельно. Обе принимают на вход 1 млн токенов. Обе — архитектуры MoE, а значит, обе недороги в эксплуатации относительно общего числа параметров, потому что на каждый токен активируется лишь часть весов.
Итак, сравнение — это не открытые против закрытых и не длинный контекст против короткого. Это набор из четырёх или пяти чисел, и эти числа указывают в одну сторону по затратам и в другую — по зрелости.
Где они на самом деле расходятся
• Цена за 1 млн токенов — DeepSeek V4.1 Flash: $0.15 за вход / $0.60 за выход в непиковые часы против GLM-5.2: $1.40 за вход / $4.40 за выход. Это чуть более чем в 9 раз больше цены за вход и чуть более чем в 7 раз больше цены за выход.
• Кэшированный ввод — V4.1 Flash $0,003 за 1 млн в непиковое время против GLM-5.2 $0,26 за 1 млн. Почти в 90 раз — по статье расходов, которая составляет основную часть счёта агентного цикла.
• Параметры — V4.1 Flash: 552B всего при 8B активных на входе и 16B на выходе, против GLM-5.2 — примерно 745B всего при около 40B активных. GLM-5.2 активирует примерно в два с половиной раза больше параметров на токен.
• Максимальный объём вывода — 384K токенов у V4.1 Flash против 128K токенов у GLM-5.2. Потолок втрое выше.
• Контекстное окно — 1 млн токенов каждое. Уровень.
• Независимая оценка по индексу — GLM-5.2 набирает 51 балл в Индексе Artificial Analysis, это самый высокий показатель среди всех моделей с открытыми весами на момент её выпуска. У DeepSeek V4.1 Flash пока нет опубликованного значения Индекса.
• Наблюдаемая задержка до первого токена — V4.1 Flash 2,63 с на p50 и 9,05 с на p95 против GLM-5.2 2,36 с на p50 и 10,00 с на p95, по собственной 7-дневной телеметрии OrcaRouter. Медианы — на одном уровне. Хвосты — нет.
Ценовое направление и направление зрелости противоположны. GLM-5.2 — это модель с независимой оценкой и более длинной историей. DeepSeek V4.1 Flash — это модель с более дешёвыми токенами: цена ввода в девять раз ниже, а потолок вывода втрое выше. Нет такого прочтения этого списка, при котором одна модель просто доминирует.

Хвост — это недооценённая строка
Большинство сравнений моделей с открытыми весами начинаются с индексной оценки. Вместо этого внимания заслуживает телеметрия задержки, но не по той причине, которую вы ожидаете: медианы находятся на одном уровне. p50 времени до первого токена у GLM-5.2 составляет 2,36 с против 2,63 с у V4.1 Flash — это не разрыв, а шум в общей сети. Тот, кто приводит преимущество в первом токене для более дешёвой модели, смотрит не на тот процентиль.
p95 — это то, где эти двое расходятся, причём направление противоположно тому, что предполагала бы разница в цене. Худшее время ожидания у GLM-5.2 составляет 10,00 с; у V4.1 Flash — 9,05 с. Это важнее, чем медиана, потому что запросы, которые замечает пользователь, — это медленные запросы. Инструмент, который обычно мгновенен и иногда застревает на десять секунд, воспринимается как ненадёжный так, как не воспринимается инструмент со стабильными тремя секундами, а в цикле агента, который за один ход разветвляет десять вызовов, именно p95 решает, уложится ли ход в пределы человеческого терпения. Хвост GLM-5.2 — не дефект; это более крупная модель, активирующая примерно 40 миллиардов параметров на токен, и она стоит столько, сколько стоит. Но именно поэтому модель лучше подходит для асинхронной работы — очереди, пакетного задания, фонового агента, за которым никто не следит, — чем для интерфейса запрос-ответ.
Ни одна из моделей не публикует показатель пропускной способности на доступных нам страницах, и об этом стоит сказать прямо, а не заполнять пробел домыслами. Время до первого токена — единственное измерение задержки, по которому эти две модели можно сравнить на общих данных, и при честном прочтении по этому измерению они находятся на одном уровне по медиане и близки на хвосте.
Что решает индексный балл, а что — нет
51 балл GLM-5.2 в Artificial Analysis Index — это реальный, независимо полученный показатель, и это сильнейший отдельный аргумент в пользу модели. При этом это композитный показатель: одно число, агрегирующее несколько наборов оценок, из-за чего он хорошо подходит для обобщённой характеристики общих возможностей и плохо предсказывает производительность в какой-либо одной конкретной задаче. Модель, набирающая 51 балл, и модель без опубликованного балла — это не то же самое, что модель, набирающая 51 балл, и модель, набирающая 40 баллов.
Честная позиция по DeepSeek V4.1 Flash такова: его независимая доказательная база пока скудна, и причина — возраст. Он находится в общем доступе двенадцать дней. Единственный недавний сторонний срез, в котором он фигурирует, — таблица лидеров Agents on Rails по агентному программированию, опубликованная 21 сентября 2026 года, — поставил его на 17% при максимальном усилии, в середине поля, выше GLM-5.3 Flash с 15% и ниже Gemini 3.8 Flash с 23%. Это всего одна таблица, измеряющая одну узкую вещь, и она не заменяет оценку Index. Любой, кто утверждает, что V4.1 Flash прямо сейчас превосходит GLM-5.2 по возможностям, экстраполирует из архитектуры и цены, а не сообщает результат измерения.
Аргументы в пользу каждого, изложенные ясно.
DeepSeek V4.1 Flash — это модель, к которой стоит обратиться, когда рабочая нагрузка характеризуется большим объёмом, чувствительностью к задержке или большим объёмом вывода. Одна девятая цены за вход и примерно одна девяностая цены за чтение из кэша — это структурное преимущество в агентном цикле, который перечитывает контекст на каждом шаге, а потолок вывода в 384K — это иная категория артефакта, чем 128K. Если ваша задача — классификация, извлечение, длинная структурированная генерация или высоконагруженный исполнитель внутри агентного конвейера, разница в стоимости не маргинальна — это разница между жизнеспособным конвейером и нежизнеспособным.
GLM-5.2 — это модель, к которой стоит обратиться, когда нужно опубликованное, независимо проверенное значение возможностей, чтобы обосновать решение, или когда работа асинхронна и десятисекундное ожидание в худшем случае остаётся незаметным. Это зрелый выбор: оценка существует, поведение задокументировано, модель достаточно долго находится в продакшене, чтобы другие успели обнаружить её границы. В этом есть реальная ценность, и её не передаёт колонка с ценой.
Там, где ни один вариант явно не является правильным — а речь об универсальном ассистенте, обрабатывающем смешанный трафик, — полезно не выбирать. Стоит направить основную часть трафика дешёвой модели, а дорогую приберечь для запросов, которым она нужна.
Запуск обоих как единой системы
Поскольку обе модели имеют открытые веса и обе размещены у провайдера, паттерн разделения и маршрутизации здесь настраивается необычно дёшево, и именно в этом случае слой маршрутизации OrcaRouter оправдывает своё место, а не выглядит наспех прикрученной рекламной уловкой. Обе модели доступны через один ключ, поэтому решение о маршрутизации — это конфигурация, а не вторая интеграция: правило, которое направляет короткие запросы с высокой нагрузкой в DeepSeek V4.1 Flash, а длительные асинхронные задачи — в GLM-5.2, занимает несколько строк, а не ветвление в коде вашего приложения.
Две особенности платформы имеют значение именно для этого сочетания. OrcaRouter передаёт прайс-листовые цены провайдеров без наценки — 0%, поэтому приведённые выше цифры — это собственные тарифы вендоров, и пиковое расписание DeepSeek применяется ровно так, как его определяет DeepSeek: пик — 01:00–04:00 и 06:00–10:00 UTC по будням, а выходные полностью вне пика; на такой дешёвой модели это решение о расписании стоит принимать осознанно. А DSL маршрутизации позволяет объединить несколько моделей в один вызов — это естественный способ использовать две модели с открытыми весами, чьи сильные стороны не пересекаются: дешёвая генерирует, более сильная проверяет, а вызывающая сторона видит один ответ. За обоими путями стоит автоматическое переключение при сбое, что важно, когда одной из двух моделей всего двенадцать дней и её поведение на ваших данных пока неизвестно.
Причина, по которой это правильная конфигурация, а не компромисс, состоит в том, что две модели различаются по осям, которые не конкурируют между собой. Одна — быстрая и дешёвая; другая — оценённая и медленная. Конвейер, использующий обе, — это не перестраховка, а подбор инструментов под задачи.

Что посмотреть
• Опубликованный показатель Artificial Analysis Index для DeepSeek V4.1 Flash. Пока его нет, сравнение возможностей этих двух моделей — это аргумент, а не измерение, и это единственное доказательство, которое позволило бы разрешить его.
• Улучшится ли профиль задержки GLM-5.2. Его p95 в 10,00 с — это показатель, который с наибольшей вероятностью изменится по мере оптимизации хостинг-провайдеров, и в настоящее время это крупнейшее единичное измеренное различие между двумя моделями — ожидание в хвосте, а не цена.
• Будет ли меняться расписание пиковых часов DeepSeek. Для модели по цене $0,15 за миллион входных токенов пиковый множитель — крупнейшая отдельная переменная в модели затрат.
Пока не появится первый из них, точная формулировка такова: DeepSeek V4.1 Flash примерно в девять раз дешевле по входу и почти в девяносто раз дешевле по кэшированному входу, чем GLM-5.2, а его потолок вывода втрое выше; GLM-5.2 — это модель с независимой оценкой и более длительной историей, и её медиана времени до первого токена на одном уровне с более дешёвой моделью, хотя в худшем случае это не так. Обе под MIT. До обеих — один ключ. Выбирайте по рабочей нагрузке, а не по победителю.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
