Главная титульная карточка с надписью «DeepSeek V4.1 Flash против DeepSeek V4 Pro» и подзаголовком «Запланированная передача, отменённая 2026-09-11», две карточки с надписями «DeepSeek V4.1 Flash — AA Index 40, $0.15 / $0.60» и «DeepSeek V4 Pro 0813 — AA Index 36, $0.66 / $1.98», а также футер с надписью «AA Index по данным Artificial Analysis; цены по данным DeepSeek, вне пиковых часов, за 1 млн токенов.»
Guides & Insights

DeepSeek V4.1 Flash против DeepSeek V4 Pro: передача, которую DeepSeek запланировала, а затем отменила

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4.1 Flash вышел 10 сентября 2026 года, а DeepSeek V4 Pro к этому моменту уже должен был исчезнуть. План, объявленный за два дня до релиза Flash и окончательно утверждённый в день релиза, предусматривал, что 14 сентября 2026 года в 12:00 по пекинскому времени все запросы к deepseek-v4-pro будут незаметно перенаправляться на более новую и дешёвую deepseek-flash и тарифицироваться по ставкам Flash. DeepSeek отменила это 11 сентября 2026 года после возражений разработчиков, и 14 сентября 2026 года крайний срок прошёл, а V4 Pro всё ещё работал, и его тарификация не изменилась. Так что это не сравнение новинок — модели слева восемь дней, а модель справа — флагман годичной давности, четвёртый месяц в общем доступе. Это сравнение двух моделей, производитель которых опубликовал бенчмарки, показавшие победу дешёвой модели, а затем обнаружил, что пользователи не согласны, и отступил. Эта последовательность событий — самое полезное из всего, что кто-либо публиковал об обеих этих моделях в этом месяце, потому что это ровно то решение, которое вам предстоит принять самому.

Что на самом деле произошло, по порядку

Здесь хронология важнее любого отдельного показателя, потому что главное — это разворот, а объявление было намеренно тихим.

2026-09-09 — DeepSeek сообщает пользователям, что до выхода V4.1 Pro запросы к V4 Pro будут перенаправляться на V4.1 Flash и тарифицироваться по тарифам Flash. Суть в том, что Flash полностью превзошёл Pro по производительности, стоимости, скорости и времени выполнения задач.

2026-09-10 — DeepSeek V4.1 Flash становится общедоступной в приложении, веб-версии и API. Веса публикуются на Hugging Face под лицензией MIT. Название модели в API теперь deepseek-flash. Модели предыдущего поколения deepseek-v4-flash и deepseek-v4-flash-vision-exp полностью выведены из эксплуатации, а их устаревшие идентификаторы временно перенаправлены на V4.1 Flash. Отключение Pro отложено на 2026-09-14, 12:00 по пекинскому времени (04:00 UTC).

2026-09-11 — DeepSeek меняет решение. В ответ на запросы пользователей компания сообщает: сервис V4 Pro API продолжит работу после 2026-09-14, тарификация остаётся без изменений, а автоматическое переключение на V4.1 Flash отменяется.

2026-09-14 — срок истекает. V4 Pro по-прежнему обслуживается по цене $0.66 / $1.98 за миллион токенов в непиковые часы.

Асимметрия в этой последовательности — это и есть вся статья. Пользователей Flash мигрировали, хотели они того или нет, — по старому ID V4 Flash теперь отвечает другая модель. Пользователи Pro получили отсрочку, и причина не в том, что V4 Pro показывает лучшие результаты в бенчмарках. А в том, что production-системы были настроены под V4 Pro: промпты, агентные каркасы, eval-стенды и допущения о воспроизводимости, которые замена бэкенда делает недействительными без каких-либо изменений кода на стороне вызывающего. На странице сравнения DeepSeek до сих пор обе модели указаны рядом, и это говорит о том, что компания намерена обслуживать обе.

Рядом: два SKU

Всё нижеследующее — это собственная опубликованная спецификация DeepSeek, если не указан источник. Цены указаны за миллион токенов для непикового времени, а ставка для пикового времени приведена в скобках — у DeepSeek пиковые часы приходятся на период с 01:00 до 04:00 и снова с 06:00 до 10:00 UTC с понедельника по пятницу, а все остальные часы являются непиковыми со ставкой, равной половине пиковой.

Название модели APIdeepseek-flash (DeepSeek-V4.1-Flash) против deepseek-v4-pro (DeepSeek-V4-Pro-0813).

Ввод, промах кэша — $0.15 ($0.30) против $0.66 ($1.32).

Ввод, попадание в кэш — $0.003 ($0.006) против $0.022 ($0.044).

Вывод — $0.60 ($1.20) против $1.98 ($3.96).

Контекст / максимальный вывод — 1M токенов / 384K у обоих. Идентично.

Ввод изображений — нативно поддерживается во Flash; для V4 Pro указан как неподдерживаемый.

Лимит параллельных запросов — 2 500 у Flash против 500 у V4 Pro.

Заявленные параметры — Flash: 552 млрд всего — цифра от вендора, против которой сообщество выдвигает убедительное возражение (подробнее об этом ниже). V4 Pro: 1,6 трлн всего, ~49 млрд активных — эти данные также приводит Artificial Analysis, и их подтверждает страница с рецептом для vLLM.

Активный бюджет на токен — Flash по замыслу активирует примерно 8B на этапе предзаполнения и 16B на этапе декодирования, что и является смыслом его архитектуры; Pro активирует ~49B на токен.

Лицензия — открытые веса MIT для обоих.

дата GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, после апрельского превью.

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

Разница в цене — вот и весь аргумент.

Ввод на Pro стоит в 4,4 раза дороже. Вывод — в 3,3 раза. Попадания в кэш — уровень, который доминирует в длительном запуске агента со стабильным системным промптом, — в 7,3 раза. Поскольку в пиковые часы каждый уровень удваивается с обеих сторон, соотношение на пике идентично; разрыв не является артефактом скидки.

Нагрузите её работой. Возьмём кодинг-агента, обрабатывающего 10 млн входных токенов в месяц с долей попаданий в кэш 70% и 2 млн выходных токенов. На V4.1 Flash в непиковые часы это $0.45 свежего ввода, $0.021 кэшированного ввода и $1.20 вывода: $1.67. На V4 Pro в непиковые часы это $1.98, $0.154 и $3.96: $6.09. Примерно в 3,6 раза, на намеренно ничем не примечательной нагрузке.

Это собственный прайс-лист DeepSeek, и он та цена, которую вы фактически платите здесь: OrcaRouter передаёт тарифы из прайс-листов провайдеров с наценкой 0%, поэтому изменение цен DeepSeek отражается на нашей стороне в тот же день, а не переупаковывается. Обе модели используют один и тот же ключ, что важно для раздела ниже — того, где речь о тестировании миграции, которую вам больше не нужно выполнять.

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

Где DeepSeek V4.1 Flash по-настоящему выигрывает

Самое убедительное доказательство в пользу Flash — это не таблица бенчмарков DeepSeek. Это Artificial Analysis, которая независима, и данные считываются напрямую с её страниц моделей.

Индекс интеллекта — Flash (Reasoning, Max Effort) набирает 40 баллов и занимает #6 место среди 113 моделей. V4 Pro 0813 (Reasoning, Max Effort) набирает 36 баллов и находится на #7 месте. Тот же индекс, та же настройка усилий, разница в четыре балла — и при этом более дешёвая модель впереди.

Скорость вывода — 214,4 токена/с против 94,4 токена/с. Это в 2,3 раза, и это измеренный факт, а не заявление.

Время до первого токена — 1,21 с против 1,74 с.

DeepSWE v1.1 — 74,2 у Flash в отслеживаемом рейтинге, первое место, впереди GPT-6 Astra с 74,10, Claude Opus 5 с 74,00 и Gemini 3.8 Flash с 73,70. 62,7 у V4 Pro 0813 на том же бенчмарке — это собственный показатель DeepSeek. Разрыв на вершине составляет 0,2 балла, то есть это ничья, а не победа, — но отрыв в 11,5 балла от Pro — это не ничья.

Эффективность обслуживания — Декодер Flash получает свой глобальный KV из конечного скрытого состояния энкодера, а не пересчитывает его для каждого слоя, что и даёт асимметричную активацию 8B-prefill / 16B-decode. Профиль InferenceX от SemiAnalysis оценивает KV-кэш примерно в 890 байт на токен — около четверти от показателя V4 Flash — при этом постоянное хранилище KV сокращается примерно до одной восьмой. Именно поэтому цена такая, какая есть, и именно поэтому модель доступна при 2 500 одновременных запросов, тогда как Pro ограничен 500.

Зрение в обслуживаемом API — а не только в весах. На собственной странице цен DeepSeek указано, что ввод изображений поддерживается для Flash и не поддерживается для V4 Pro, и DeepSeek описывает его как свой первый флагман с нативным мультимодальным пониманием. Это первый флагман DeepSeek, в котором для чтения скриншота не нужен отдельный эндпоинт.

Все остальные ключевые цифры, которые вам будут приводить, — Terminal-Bench 2.1 на 90.6, GPQA Diamond на 90.9, Codeforces 3471 — принадлежат самому DeepSeek и не воспроизведены нами, поэтому их следует воспринимать с учётом этого.

Где DeepSeek V4 Pro всё ещё остаётся правильным выбором

После такой недели было бы легко списать V4 Pro со счетов. Но отмена пометки об устаревании говорит об обратном, и таблица характеристик — тоже.

Pro несёт 1,6 трлн общих параметров и активирует ~49 млрд на токен, против 16 млрд у Flash при декодировании. Что бы ни говорил индекс, ёмкость на токен — это реальный ресурс, и нагрузки, где это проявляется, — долгосрочные: многочасовые запуски агентов, крупные рефакторинги, задачи, где ранний неверный шаг стоит всей траектории. Разрыв в четыре пункта по индексу измеряет среднее по десяти оценкам, а не хвост вашего распределения.

Pro — тоже известная величина. Он находится в общем доступе с 2026-08-13 после апрельского превью, и сборка 0813 получила свою производительность благодаря посттренингу, а не архитектуре: то же число параметров, та же форма, что и у превью, но другое поведение. Это четыре месяца общественных инструментов, опубликованных агентных обвязок, шаблонов промптов и режимов отказа. Flash находится в общем доступе восемь дней, и экосистема вокруг него соответственно скудна. Если надёжность вашей команды основана на точном знании того, как именно модель отказывает, то Pro — это то место, где живёт такое знание.

И обслуживание не прекратилось. Обязательство DeepSeek выражено прямо, тарификация не изменилась, веса распространяются под лицензией MIT, и V4 Pro по-прежнему в нашем каталоге по тому же тарифу из прайс-листа. Отменённое прекращение поддержки — это не отсрочка казни, а заявление о том, что DeepSeek намерена и дальше обслуживать этот уровень.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

Три вещи, которые можно поставить в упрёк обеим моделям

Защитные механизмы, потому что ошибка в этом решении обойдётся слишком дорого.

Количество параметров — предмет споров. 552B — это цифра DeepSeek. Один заслуживающий доверия анализ сообщества утверждает, что выпущенный чекпоинт составляет 748B — это каркас трансформера на 552B плюс таблица условной памяти Engram примерно на 196B, которая представляет собой структуру поиска, используемую в двух точках сети, а не слой, через который проходит сигнал. Опубликованная для скачивания версия занимает 510,3 ГБ и состоит из 48 шардов safetensors с плотными весами FP8 и маршрутизируемыми экспертами FP4. Оба числа могут быть верны одновременно — в зависимости от того, считаете ли вы извлечение отдельно от вычислений. Рассматривайте 552B как заявленное производителем и проверьте занимаемое место на диске, прежде чем планировать развёртывание.

Балл в таблице лидеров — это витрина, а не контракт. 74,2 у DeepSWE v1.1 — это бенчмарк тестового стенда. Самостоятельно опубликованный аудит EyesTech Systems Lab утверждает, что эти оценки класса Flash обваливаются при переносе в изолированные реальные многофайловые репозитории — что ставит DeepSeek V4.1 Flash на 31,4% в SWE-bench Pro против 74,2% в заголовке, более сильное падение, чем у фронтирных моделей в его собственном сравнении. Этот аудит не является независимым — автор продаёт инструмент для обнаружения именно той эксплуатации тестового стенда, которую он описывает — и мы не видели его воспроизведения. И всё же это правильная позиция: проверяйте на своих собственных репозиториях, прежде чем мигрировать.

Многословность — это статья расходов.Artificial Analysis измерила, что V4.1 Flash сгенерировала 250 млн выходных токенов в ходе прогона по своему Intelligence Index при медиане 140 млн для сопоставимых моделей с открытыми весами, и называет её крайне многословной. Вывод — это дорогая сторона в данной таблице цен, поэтому модель, которая размышляет вслух, съедает собственную экономию. При нагрузке с интенсивными рассуждениями закладывайте бюджет на количество токенов, а не только на цену токена.

И ещё одно, сказанное прямо, чтобы никто не строил планы на основе слухов: DeepSeek V4.1 Pro не выпущен. Отменённая миграция подавалась как временная мера «перед запуском V4.1 Pro», и в этом ничего не изменилось.

Выберите DeepSeek V4.1 Flash, если

• Ваша нагрузка отличается большим объёмом, чувствительностью к задержкам или ограничениями по стоимости — классификация, извлечение данных, маршрутизация, суммирование, чат, большинство задач генерации кода.

• Вам нужен ввод изображений на том же эндпоинте, что и текст. Это первая флагманская модель DeepSeek, в которой это один вызов, а не вторая модель.

• Ваши промпты можно кэшировать. При 7,3× на попаданиях в кэш разрыв максимален именно там, где сосредоточен трафик агентов, а стабильный системный промпт составляет большую часть входных данных длительного запуска.

• На этой неделе вы начинаете с чистого листа, и у вас нет обвязки, настроенной под особенности конкретной модели. Защищать нечего.

• Вам нужен более высокий предел параллелизма. 2 500 против 500 — это пятикратная разница в том, сколько вы можете пропустить, прежде чем начнёте стоять в очереди.

Выберите DeepSeek V4 Pro, если

• У вас уже есть продакшен, настроенный против этого. Разворот означает, что у вас есть время — используйте его, чтобы протестировать, а не чтобы избегать вопроса.

• Ваши задачи долгосрочные, а неудача обходится дорого, и вы измерили, что ~49B активных параметров на токен дают вам то, чего не даёт 16B у Flash, — на ваших данных, а не в таблице лидеров.

• Вам нужно предсказуемое поведение только с текстом, без визуального пути, о котором нужно было бы рассуждать, или у вас есть базовые показатели оценки, которые замена модели сделала бы недействительными в середине исследования.

• Ваша схема доступа отличается малым объёмом и высокими ставками, где 3,6× на небольшом счёте не является решающим фактором.

Если вы уже построили на DeepSeek V4 Pro

Полезное изменение, произошедшее 2026-09-11, заключается в том, что ваша миграция перестала быть дедлайном и стала решением. Это однозначно лучше для вас и однозначно хуже для вашего почтового ящика, потому что решение всё ещё нужно принять, а теперь никто не принимает его за вас.

Начните с расчёта цены. Разрыв в 3,3–4,4× — это та сумма, которую вы оставляете на столе, а разобранный выше пример превращает её в месячную цифру примерно за минуту. Затем проверьте это единственным способом, который действительно имеет значение: отзеркальте часть продакшн-трафика на Flash, оставьте Pro на основном пути и сравните результаты на своих задачах. Поскольку обе модели отвечают по одному и тому же ключу по прайс-листовой цене провайдера с автоматическим переключением при сбое, такой теневой прогон — это изменение маршрутизации, а не вторая интеграция, и роутер может вернуть запрос обратно на Pro без того, чтобы вы писали фолбэк. Команды, сжигающие токены на миграцию, о которой они не просили, — вот причина, по которой слой маршрутизации вообще существует.

Не считайте Flash готовой заменой. Это другая архитектура — 40-слойный причинный энкодер–декодер с асимметричной активацией — и при рассуждении он более многословен. Поведение на уровне промптов не будет чисто переноситься ни в одном из направлений, поэтому оценивайте миграцию по выходам, а не по индексу.

Что посмотреть

Три вещи определяют, как это сочетание будет выглядеть через месяц. Во-первых, выйдет ли V4.1 Pro и восстановит ли настоящий уровень Pro — вся отменённая миграция была явно временной мерой ради него, так что в дорожной карте DeepSeek всё ещё зияет дыра в форме флагмана. Во-вторых, переживёт ли эта передышка следующий ценовой шаг DeepSeek; компания, готовая однажды запланировать тихую перемаршрутизацию, усвоила, что не может, а не что не должна. В-третьих, воспроизведёт ли кто-нибудь за пределами DeepSeek показатели бенчмарка Flash на неизменённых репозиториях — единственный результат, который разрешил бы спор об эффективности против ёмкости, на котором держится всё это сравнение. А до тех пор честная позиция — та, которую подразумевает сам разворот: Flash — лучший выбор по умолчанию для всего нового, Pro — лучшая ставка для всего уже построенного, и DeepSeek только что сообщила вам, что будет обслуживать оба, пока вы сами не поймёте, к какому из них относитесь.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно