
DeepSeek V4.1 Flash против DeepSeek V4 Pro: передача, которую DeepSeek запланировала, а затем отменила
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
DeepSeek V4.1 Flash вышел 10 сентября 2026 года, а DeepSeek V4 Pro к этому моменту уже должен был исчезнуть. План, объявленный за два дня до релиза Flash и окончательно утверждённый в день релиза, предусматривал, что 14 сентября 2026 года в 12:00 по пекинскому времени все запросы к deepseek-v4-pro будут незаметно перенаправляться на более новую и дешёвую deepseek-flash и тарифицироваться по ставкам Flash. DeepSeek отменила это 11 сентября 2026 года после возражений разработчиков, и 14 сентября 2026 года крайний срок прошёл, а V4 Pro всё ещё работал, и его тарификация не изменилась. Так что это не сравнение новинок — модели слева восемь дней, а модель справа — флагман годичной давности, четвёртый месяц в общем доступе. Это сравнение двух моделей, производитель которых опубликовал бенчмарки, показавшие победу дешёвой модели, а затем обнаружил, что пользователи не согласны, и отступил. Эта последовательность событий — самое полезное из всего, что кто-либо публиковал об обеих этих моделях в этом месяце, потому что это ровно то решение, которое вам предстоит принять самому.
Что на самом деле произошло, по порядку
Здесь хронология важнее любого отдельного показателя, потому что главное — это разворот, а объявление было намеренно тихим.
• 2026-09-09 — DeepSeek сообщает пользователям, что до выхода V4.1 Pro запросы к V4 Pro будут перенаправляться на V4.1 Flash и тарифицироваться по тарифам Flash. Суть в том, что Flash полностью превзошёл Pro по производительности, стоимости, скорости и времени выполнения задач.
• 2026-09-10 — DeepSeek V4.1 Flash становится общедоступной в приложении, веб-версии и API. Веса публикуются на Hugging Face под лицензией MIT. Название модели в API теперь deepseek-flash. Модели предыдущего поколения deepseek-v4-flash и deepseek-v4-flash-vision-exp полностью выведены из эксплуатации, а их устаревшие идентификаторы временно перенаправлены на V4.1 Flash. Отключение Pro отложено на 2026-09-14, 12:00 по пекинскому времени (04:00 UTC).
• 2026-09-11 — DeepSeek меняет решение. В ответ на запросы пользователей компания сообщает: сервис V4 Pro API продолжит работу после 2026-09-14, тарификация остаётся без изменений, а автоматическое переключение на V4.1 Flash отменяется.
• 2026-09-14 — срок истекает. V4 Pro по-прежнему обслуживается по цене $0.66 / $1.98 за миллион токенов в непиковые часы.
Асимметрия в этой последовательности — это и есть вся статья. Пользователей Flash мигрировали, хотели они того или нет, — по старому ID V4 Flash теперь отвечает другая модель. Пользователи Pro получили отсрочку, и причина не в том, что V4 Pro показывает лучшие результаты в бенчмарках. А в том, что production-системы были настроены под V4 Pro: промпты, агентные каркасы, eval-стенды и допущения о воспроизводимости, которые замена бэкенда делает недействительными без каких-либо изменений кода на стороне вызывающего. На странице сравнения DeepSeek до сих пор обе модели указаны рядом, и это говорит о том, что компания намерена обслуживать обе.
Рядом: два SKU
Всё нижеследующее — это собственная опубликованная спецификация DeepSeek, если не указан источник. Цены указаны за миллион токенов для непикового времени, а ставка для пикового времени приведена в скобках — у DeepSeek пиковые часы приходятся на период с 01:00 до 04:00 и снова с 06:00 до 10:00 UTC с понедельника по пятницу, а все остальные часы являются непиковыми со ставкой, равной половине пиковой.
• Название модели API — deepseek-flash (DeepSeek-V4.1-Flash) против deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• Ввод, промах кэша — $0.15 ($0.30) против $0.66 ($1.32).
• Ввод, попадание в кэш — $0.003 ($0.006) против $0.022 ($0.044).
• Вывод — $0.60 ($1.20) против $1.98 ($3.96).
• Контекст / максимальный вывод — 1M токенов / 384K у обоих. Идентично.
• Ввод изображений — нативно поддерживается во Flash; для V4 Pro указан как неподдерживаемый.
• Лимит параллельных запросов — 2 500 у Flash против 500 у V4 Pro.
• Заявленные параметры — Flash: 552 млрд всего — цифра от вендора, против которой сообщество выдвигает убедительное возражение (подробнее об этом ниже). V4 Pro: 1,6 трлн всего, ~49 млрд активных — эти данные также приводит Artificial Analysis, и их подтверждает страница с рецептом для vLLM.
• Активный бюджет на токен — Flash по замыслу активирует примерно 8B на этапе предзаполнения и 16B на этапе декодирования, что и является смыслом его архитектуры; Pro активирует ~49B на токен.
• Лицензия — открытые веса MIT для обоих.
• дата GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, после апрельского превью.

Разница в цене — вот и весь аргумент.
Ввод на Pro стоит в 4,4 раза дороже. Вывод — в 3,3 раза. Попадания в кэш — уровень, который доминирует в длительном запуске агента со стабильным системным промптом, — в 7,3 раза. Поскольку в пиковые часы каждый уровень удваивается с обеих сторон, соотношение на пике идентично; разрыв не является артефактом скидки.
Нагрузите её работой. Возьмём кодинг-агента, обрабатывающего 10 млн входных токенов в месяц с долей попаданий в кэш 70% и 2 млн выходных токенов. На V4.1 Flash в непиковые часы это $0.45 свежего ввода, $0.021 кэшированного ввода и $1.20 вывода: $1.67. На V4 Pro в непиковые часы это $1.98, $0.154 и $3.96: $6.09. Примерно в 3,6 раза, на намеренно ничем не примечательной нагрузке.
Это собственный прайс-лист DeepSeek, и он та цена, которую вы фактически платите здесь: OrcaRouter передаёт тарифы из прайс-листов провайдеров с наценкой 0%, поэтому изменение цен DeepSeek отражается на нашей стороне в тот же день, а не переупаковывается. Обе модели используют один и тот же ключ, что важно для раздела ниже — того, где речь о тестировании миграции, которую вам больше не нужно выполнять.

Где DeepSeek V4.1 Flash по-настоящему выигрывает
Самое убедительное доказательство в пользу Flash — это не таблица бенчмарков DeepSeek. Это Artificial Analysis, которая независима, и данные считываются напрямую с её страниц моделей.
• Индекс интеллекта — Flash (Reasoning, Max Effort) набирает 40 баллов и занимает #6 место среди 113 моделей. V4 Pro 0813 (Reasoning, Max Effort) набирает 36 баллов и находится на #7 месте. Тот же индекс, та же настройка усилий, разница в четыре балла — и при этом более дешёвая модель впереди.
• Скорость вывода — 214,4 токена/с против 94,4 токена/с. Это в 2,3 раза, и это измеренный факт, а не заявление.
• Время до первого токена — 1,21 с против 1,74 с.
• DeepSWE v1.1 — 74,2 у Flash в отслеживаемом рейтинге, первое место, впереди GPT-6 Astra с 74,10, Claude Opus 5 с 74,00 и Gemini 3.8 Flash с 73,70. 62,7 у V4 Pro 0813 на том же бенчмарке — это собственный показатель DeepSeek. Разрыв на вершине составляет 0,2 балла, то есть это ничья, а не победа, — но отрыв в 11,5 балла от Pro — это не ничья.
• Эффективность обслуживания — Декодер Flash получает свой глобальный KV из конечного скрытого состояния энкодера, а не пересчитывает его для каждого слоя, что и даёт асимметричную активацию 8B-prefill / 16B-decode. Профиль InferenceX от SemiAnalysis оценивает KV-кэш примерно в 890 байт на токен — около четверти от показателя V4 Flash — при этом постоянное хранилище KV сокращается примерно до одной восьмой. Именно поэтому цена такая, какая есть, и именно поэтому модель доступна при 2 500 одновременных запросов, тогда как Pro ограничен 500.
• Зрение в обслуживаемом API — а не только в весах. На собственной странице цен DeepSeek указано, что ввод изображений поддерживается для Flash и не поддерживается для V4 Pro, и DeepSeek описывает его как свой первый флагман с нативным мультимодальным пониманием. Это первый флагман DeepSeek, в котором для чтения скриншота не нужен отдельный эндпоинт.
Все остальные ключевые цифры, которые вам будут приводить, — Terminal-Bench 2.1 на 90.6, GPQA Diamond на 90.9, Codeforces 3471 — принадлежат самому DeepSeek и не воспроизведены нами, поэтому их следует воспринимать с учётом этого.
Где DeepSeek V4 Pro всё ещё остаётся правильным выбором
После такой недели было бы легко списать V4 Pro со счетов. Но отмена пометки об устаревании говорит об обратном, и таблица характеристик — тоже.
Pro несёт 1,6 трлн общих параметров и активирует ~49 млрд на токен, против 16 млрд у Flash при декодировании. Что бы ни говорил индекс, ёмкость на токен — это реальный ресурс, и нагрузки, где это проявляется, — долгосрочные: многочасовые запуски агентов, крупные рефакторинги, задачи, где ранний неверный шаг стоит всей траектории. Разрыв в четыре пункта по индексу измеряет среднее по десяти оценкам, а не хвост вашего распределения.
Pro — тоже известная величина. Он находится в общем доступе с 2026-08-13 после апрельского превью, и сборка 0813 получила свою производительность благодаря посттренингу, а не архитектуре: то же число параметров, та же форма, что и у превью, но другое поведение. Это четыре месяца общественных инструментов, опубликованных агентных обвязок, шаблонов промптов и режимов отказа. Flash находится в общем доступе восемь дней, и экосистема вокруг него соответственно скудна. Если надёжность вашей команды основана на точном знании того, как именно модель отказывает, то Pro — это то место, где живёт такое знание.
И обслуживание не прекратилось. Обязательство DeepSeek выражено прямо, тарификация не изменилась, веса распространяются под лицензией MIT, и V4 Pro по-прежнему в нашем каталоге по тому же тарифу из прайс-листа. Отменённое прекращение поддержки — это не отсрочка казни, а заявление о том, что DeepSeek намерена и дальше обслуживать этот уровень.

Три вещи, которые можно поставить в упрёк обеим моделям
Защитные механизмы, потому что ошибка в этом решении обойдётся слишком дорого.
• Количество параметров — предмет споров. 552B — это цифра DeepSeek. Один заслуживающий доверия анализ сообщества утверждает, что выпущенный чекпоинт составляет 748B — это каркас трансформера на 552B плюс таблица условной памяти Engram примерно на 196B, которая представляет собой структуру поиска, используемую в двух точках сети, а не слой, через который проходит сигнал. Опубликованная для скачивания версия занимает 510,3 ГБ и состоит из 48 шардов safetensors с плотными весами FP8 и маршрутизируемыми экспертами FP4. Оба числа могут быть верны одновременно — в зависимости от того, считаете ли вы извлечение отдельно от вычислений. Рассматривайте 552B как заявленное производителем и проверьте занимаемое место на диске, прежде чем планировать развёртывание.
• Балл в таблице лидеров — это витрина, а не контракт. 74,2 у DeepSWE v1.1 — это бенчмарк тестового стенда. Самостоятельно опубликованный аудит EyesTech Systems Lab утверждает, что эти оценки класса Flash обваливаются при переносе в изолированные реальные многофайловые репозитории — что ставит DeepSeek V4.1 Flash на 31,4% в SWE-bench Pro против 74,2% в заголовке, более сильное падение, чем у фронтирных моделей в его собственном сравнении. Этот аудит не является независимым — автор продаёт инструмент для обнаружения именно той эксплуатации тестового стенда, которую он описывает — и мы не видели его воспроизведения. И всё же это правильная позиция: проверяйте на своих собственных репозиториях, прежде чем мигрировать.
• Многословность — это статья расходов.Artificial Analysis измерила, что V4.1 Flash сгенерировала 250 млн выходных токенов в ходе прогона по своему Intelligence Index при медиане 140 млн для сопоставимых моделей с открытыми весами, и называет её крайне многословной. Вывод — это дорогая сторона в данной таблице цен, поэтому модель, которая размышляет вслух, съедает собственную экономию. При нагрузке с интенсивными рассуждениями закладывайте бюджет на количество токенов, а не только на цену токена.
И ещё одно, сказанное прямо, чтобы никто не строил планы на основе слухов: DeepSeek V4.1 Pro не выпущен. Отменённая миграция подавалась как временная мера «перед запуском V4.1 Pro», и в этом ничего не изменилось.
Выберите DeepSeek V4.1 Flash, если
• Ваша нагрузка отличается большим объёмом, чувствительностью к задержкам или ограничениями по стоимости — классификация, извлечение данных, маршрутизация, суммирование, чат, большинство задач генерации кода.
• Вам нужен ввод изображений на том же эндпоинте, что и текст. Это первая флагманская модель DeepSeek, в которой это один вызов, а не вторая модель.
• Ваши промпты можно кэшировать. При 7,3× на попаданиях в кэш разрыв максимален именно там, где сосредоточен трафик агентов, а стабильный системный промпт составляет большую часть входных данных длительного запуска.
• На этой неделе вы начинаете с чистого листа, и у вас нет обвязки, настроенной под особенности конкретной модели. Защищать нечего.
• Вам нужен более высокий предел параллелизма. 2 500 против 500 — это пятикратная разница в том, сколько вы можете пропустить, прежде чем начнёте стоять в очереди.
Выберите DeepSeek V4 Pro, если
• У вас уже есть продакшен, настроенный против этого. Разворот означает, что у вас есть время — используйте его, чтобы протестировать, а не чтобы избегать вопроса.
• Ваши задачи долгосрочные, а неудача обходится дорого, и вы измерили, что ~49B активных параметров на токен дают вам то, чего не даёт 16B у Flash, — на ваших данных, а не в таблице лидеров.
• Вам нужно предсказуемое поведение только с текстом, без визуального пути, о котором нужно было бы рассуждать, или у вас есть базовые показатели оценки, которые замена модели сделала бы недействительными в середине исследования.
• Ваша схема доступа отличается малым объёмом и высокими ставками, где 3,6× на небольшом счёте не является решающим фактором.
Если вы уже построили на DeepSeek V4 Pro
Полезное изменение, произошедшее 2026-09-11, заключается в том, что ваша миграция перестала быть дедлайном и стала решением. Это однозначно лучше для вас и однозначно хуже для вашего почтового ящика, потому что решение всё ещё нужно принять, а теперь никто не принимает его за вас.
Начните с расчёта цены. Разрыв в 3,3–4,4× — это та сумма, которую вы оставляете на столе, а разобранный выше пример превращает её в месячную цифру примерно за минуту. Затем проверьте это единственным способом, который действительно имеет значение: отзеркальте часть продакшн-трафика на Flash, оставьте Pro на основном пути и сравните результаты на своих задачах. Поскольку обе модели отвечают по одному и тому же ключу по прайс-листовой цене провайдера с автоматическим переключением при сбое, такой теневой прогон — это изменение маршрутизации, а не вторая интеграция, и роутер может вернуть запрос обратно на Pro без того, чтобы вы писали фолбэк. Команды, сжигающие токены на миграцию, о которой они не просили, — вот причина, по которой слой маршрутизации вообще существует.
Не считайте Flash готовой заменой. Это другая архитектура — 40-слойный причинный энкодер–декодер с асимметричной активацией — и при рассуждении он более многословен. Поведение на уровне промптов не будет чисто переноситься ни в одном из направлений, поэтому оценивайте миграцию по выходам, а не по индексу.
Что посмотреть
Три вещи определяют, как это сочетание будет выглядеть через месяц. Во-первых, выйдет ли V4.1 Pro и восстановит ли настоящий уровень Pro — вся отменённая миграция была явно временной мерой ради него, так что в дорожной карте DeepSeek всё ещё зияет дыра в форме флагмана. Во-вторых, переживёт ли эта передышка следующий ценовой шаг DeepSeek; компания, готовая однажды запланировать тихую перемаршрутизацию, усвоила, что не может, а не что не должна. В-третьих, воспроизведёт ли кто-нибудь за пределами DeepSeek показатели бенчмарка Flash на неизменённых репозиториях — единственный результат, который разрешил бы спор об эффективности против ёмкости, на котором держится всё это сравнение. А до тех пор честная позиция — та, которую подразумевает сам разворот: Flash — лучший выбор по умолчанию для всего нового, Pro — лучшая ставка для всего уже построенного, и DeepSeek только что сообщила вам, что будет обслуживать оба, пока вы сами не поймёте, к какому из них относитесь.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
