Титульная карточка: DeepSeek V4.1 Flash против GLM-5.2 — две модели с лицензией MIT, один скучный ответ
Guides & Insights

DeepSeek V4.1 Flash против GLM-5.2: две модели под лицензией MIT, один скучный ответ

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4.1 Flash и GLM-5.2 — это объекты одного и того же типа, и именно эту часть большинство сравнений пропускает. Обе — модели со смесью экспертов, обе распространяются по лицензии MIT со скачиваемыми весами, обе поддерживают контекст в миллион токенов, и обе доступны через API, размещённый у поставщика, который их не обучал. GLM-5.2 появилась первой и на момент выпуска была моделью с открытыми весами, набравшей наивысший балл в индексе Artificial Analysis — 51. DeepSeek V4.1 Flash появилась 10 сентября 2026 года как меньшая, более новая и более дешёвая модель в новом семействе архитектур DeepSeek. Важное сравнение между ними не в том, какая из них умнее. Оно в том, какую из них вы можете запустить и во сколько это обойдётся — для тех задач, которые у вас действительно есть.

То, что у них общего, а это большая часть.

Начните с совпадений, потому что они устраняют большинство обычных критериев выбора. Если вы выбираете между открытой моделью и закрытой, вы взвешиваете риск привязки к поставщику, взвешиваете возможность тонкой настройки, взвешиваете, может ли поставщик изменить условия для вас. Ничего из этого здесь не применимо. И DeepSeek V4.1 Flash, и GLM-5.2 имеют лицензию MIT, а их веса можно загрузить и развернуть самостоятельно. Обе принимают на вход 1 млн токенов. Обе — архитектуры MoE, а значит, обе недороги в эксплуатации относительно общего числа параметров, потому что на каждый токен активируется лишь часть весов.

Итак, сравнение — это не открытые против закрытых и не длинный контекст против короткого. Это набор из четырёх или пяти чисел, и эти числа указывают в одну сторону по затратам и в другую — по зрелости.

Где они на самом деле расходятся

• Цена за 1 млн токенов — DeepSeek V4.1 Flash: $0.15 за вход / $0.60 за выход в непиковые часы против GLM-5.2: $1.40 за вход / $4.40 за выход. Это чуть более чем в 9 раз больше цены за вход и чуть более чем в 7 раз больше цены за выход.

• Кэшированный ввод — V4.1 Flash $0,003 за 1 млн в непиковое время против GLM-5.2 $0,26 за 1 млн. Почти в 90 раз — по статье расходов, которая составляет основную часть счёта агентного цикла.

• Параметры — V4.1 Flash: 552B всего при 8B активных на входе и 16B на выходе, против GLM-5.2 — примерно 745B всего при около 40B активных. GLM-5.2 активирует примерно в два с половиной раза больше параметров на токен.

• Максимальный объём вывода — 384K токенов у V4.1 Flash против 128K токенов у GLM-5.2. Потолок втрое выше.

• Контекстное окно — 1 млн токенов каждое. Уровень.

• Независимая оценка по индексу — GLM-5.2 набирает 51 балл в Индексе Artificial Analysis, это самый высокий показатель среди всех моделей с открытыми весами на момент её выпуска. У DeepSeek V4.1 Flash пока нет опубликованного значения Индекса.

• Наблюдаемая задержка до первого токена — V4.1 Flash 2,63 с на p50 и 9,05 с на p95 против GLM-5.2 2,36 с на p50 и 10,00 с на p95, по собственной 7-дневной телеметрии OrcaRouter. Медианы — на одном уровне. Хвосты — нет.

Ценовое направление и направление зрелости противоположны. GLM-5.2 — это модель с независимой оценкой и более длинной историей. DeepSeek V4.1 Flash — это модель с более дешёвыми токенами: цена ввода в девять раз ниже, а потолок вывода втрое выше. Нет такого прочтения этого списка, при котором одна модель просто доминирует.

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

Хвост — это недооценённая строка

Большинство сравнений моделей с открытыми весами начинаются с индексной оценки. Вместо этого внимания заслуживает телеметрия задержки, но не по той причине, которую вы ожидаете: медианы находятся на одном уровне. p50 времени до первого токена у GLM-5.2 составляет 2,36 с против 2,63 с у V4.1 Flash — это не разрыв, а шум в общей сети. Тот, кто приводит преимущество в первом токене для более дешёвой модели, смотрит не на тот процентиль.

p95 — это то, где эти двое расходятся, причём направление противоположно тому, что предполагала бы разница в цене. Худшее время ожидания у GLM-5.2 составляет 10,00 с; у V4.1 Flash — 9,05 с. Это важнее, чем медиана, потому что запросы, которые замечает пользователь, — это медленные запросы. Инструмент, который обычно мгновенен и иногда застревает на десять секунд, воспринимается как ненадёжный так, как не воспринимается инструмент со стабильными тремя секундами, а в цикле агента, который за один ход разветвляет десять вызовов, именно p95 решает, уложится ли ход в пределы человеческого терпения. Хвост GLM-5.2 — не дефект; это более крупная модель, активирующая примерно 40 миллиардов параметров на токен, и она стоит столько, сколько стоит. Но именно поэтому модель лучше подходит для асинхронной работы — очереди, пакетного задания, фонового агента, за которым никто не следит, — чем для интерфейса запрос-ответ.

Ни одна из моделей не публикует показатель пропускной способности на доступных нам страницах, и об этом стоит сказать прямо, а не заполнять пробел домыслами. Время до первого токена — единственное измерение задержки, по которому эти две модели можно сравнить на общих данных, и при честном прочтении по этому измерению они находятся на одном уровне по медиане и близки на хвосте.

Что решает индексный балл, а что — нет

51 балл GLM-5.2 в Artificial Analysis Index — это реальный, независимо полученный показатель, и это сильнейший отдельный аргумент в пользу модели. При этом это композитный показатель: одно число, агрегирующее несколько наборов оценок, из-за чего он хорошо подходит для обобщённой характеристики общих возможностей и плохо предсказывает производительность в какой-либо одной конкретной задаче. Модель, набирающая 51 балл, и модель без опубликованного балла — это не то же самое, что модель, набирающая 51 балл, и модель, набирающая 40 баллов.

Честная позиция по DeepSeek V4.1 Flash такова: его независимая доказательная база пока скудна, и причина — возраст. Он находится в общем доступе двенадцать дней. Единственный недавний сторонний срез, в котором он фигурирует, — таблица лидеров Agents on Rails по агентному программированию, опубликованная 21 сентября 2026 года, — поставил его на 17% при максимальном усилии, в середине поля, выше GLM-5.3 Flash с 15% и ниже Gemini 3.8 Flash с 23%. Это всего одна таблица, измеряющая одну узкую вещь, и она не заменяет оценку Index. Любой, кто утверждает, что V4.1 Flash прямо сейчас превосходит GLM-5.2 по возможностям, экстраполирует из архитектуры и цены, а не сообщает результат измерения.

Аргументы в пользу каждого, изложенные ясно.

DeepSeek V4.1 Flash — это модель, к которой стоит обратиться, когда рабочая нагрузка характеризуется большим объёмом, чувствительностью к задержке или большим объёмом вывода. Одна девятая цены за вход и примерно одна девяностая цены за чтение из кэша — это структурное преимущество в агентном цикле, который перечитывает контекст на каждом шаге, а потолок вывода в 384K — это иная категория артефакта, чем 128K. Если ваша задача — классификация, извлечение, длинная структурированная генерация или высоконагруженный исполнитель внутри агентного конвейера, разница в стоимости не маргинальна — это разница между жизнеспособным конвейером и нежизнеспособным.

GLM-5.2 — это модель, к которой стоит обратиться, когда нужно опубликованное, независимо проверенное значение возможностей, чтобы обосновать решение, или когда работа асинхронна и десятисекундное ожидание в худшем случае остаётся незаметным. Это зрелый выбор: оценка существует, поведение задокументировано, модель достаточно долго находится в продакшене, чтобы другие успели обнаружить её границы. В этом есть реальная ценность, и её не передаёт колонка с ценой.

Там, где ни один вариант явно не является правильным — а речь об универсальном ассистенте, обрабатывающем смешанный трафик, — полезно не выбирать. Стоит направить основную часть трафика дешёвой модели, а дорогую приберечь для запросов, которым она нужна.

Запуск обоих как единой системы

Поскольку обе модели имеют открытые веса и обе размещены у провайдера, паттерн разделения и маршрутизации здесь настраивается необычно дёшево, и именно в этом случае слой маршрутизации OrcaRouter оправдывает своё место, а не выглядит наспех прикрученной рекламной уловкой. Обе модели доступны через один ключ, поэтому решение о маршрутизации — это конфигурация, а не вторая интеграция: правило, которое направляет короткие запросы с высокой нагрузкой в DeepSeek V4.1 Flash, а длительные асинхронные задачи — в GLM-5.2, занимает несколько строк, а не ветвление в коде вашего приложения.

Две особенности платформы имеют значение именно для этого сочетания. OrcaRouter передаёт прайс-листовые цены провайдеров без наценки — 0%, поэтому приведённые выше цифры — это собственные тарифы вендоров, и пиковое расписание DeepSeek применяется ровно так, как его определяет DeepSeek: пик — 01:00–04:00 и 06:00–10:00 UTC по будням, а выходные полностью вне пика; на такой дешёвой модели это решение о расписании стоит принимать осознанно. А DSL маршрутизации позволяет объединить несколько моделей в один вызов — это естественный способ использовать две модели с открытыми весами, чьи сильные стороны не пересекаются: дешёвая генерирует, более сильная проверяет, а вызывающая сторона видит один ответ. За обоими путями стоит автоматическое переключение при сбое, что важно, когда одной из двух моделей всего двенадцать дней и её поведение на ваших данных пока неизвестно.

Причина, по которой это правильная конфигурация, а не компромисс, состоит в том, что две модели различаются по осям, которые не конкурируют между собой. Одна — быстрая и дешёвая; другая — оценённая и медленная. Конвейер, использующий обе, — это не перестраховка, а подбор инструментов под задачи.

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

Что посмотреть

• Опубликованный показатель Artificial Analysis Index для DeepSeek V4.1 Flash. Пока его нет, сравнение возможностей этих двух моделей — это аргумент, а не измерение, и это единственное доказательство, которое позволило бы разрешить его.

• Улучшится ли профиль задержки GLM-5.2. Его p95 в 10,00 с — это показатель, который с наибольшей вероятностью изменится по мере оптимизации хостинг-провайдеров, и в настоящее время это крупнейшее единичное измеренное различие между двумя моделями — ожидание в хвосте, а не цена.

• Будет ли меняться расписание пиковых часов DeepSeek. Для модели по цене $0,15 за миллион входных токенов пиковый множитель — крупнейшая отдельная переменная в модели затрат.

Пока не появится первый из них, точная формулировка такова: DeepSeek V4.1 Flash примерно в девять раз дешевле по входу и почти в девяносто раз дешевле по кэшированному входу, чем GLM-5.2, а его потолок вывода втрое выше; GLM-5.2 — это модель с независимой оценкой и более длительной историей, и её медиана времени до первого токена на одном уровне с более дешёвой моделью, хотя в худшем случае это не так. Обе под MIT. До обеих — один ключ. Выбирайте по рабочей нагрузке, а не по победителю.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно