Титульная карточка Hero: DeepSeek V4.1 Flash против DeepSeek V4 Pro — тот же вендор, разные поколения
Guides & Insights

DeepSeek V4.1 Flash против DeepSeek V4 Pro: один и тот же вендор, разные поколения

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Интересное в сравнении DeepSeek V4.1 Flash с DeepSeek V4 Pro заключается в том, что более новая модель — не более крупная. DeepSeek V4 Pro — это модель mixture-of-experts с 1,6 трлн параметров, из которых активны 49 млрд, и она всё ещё обслуживается. DeepSeek V4.1 Flash — это MoE с 552 млрд параметров, 8 млрд активны на входе и 16 млрд — на выходе, и именно эта модель была создана DeepSeek в качестве замены. Обе присутствуют в прайс-листе одного и того же провайдера, обе поддерживают контекст в миллион токенов, и обе распространяются под лицензией MIT. Выбор между ними — не вопрос размера. Это вопрос о том, за какую архитектуру вы хотите платить, и ответ изменился 10 сентября 2026 года.

Что на самом деле различается — при сравнении бок о бок

• Параметры — V4.1 Flash: 552B всего / 8B активных на входе и 16B на выходе против V4 Pro: 1.6T всего / 49B активных. V4 Pro примерно в три раза больше по общему числу параметров и в шесть раз больше по количеству активных на входе.

• Архитектура — V4.1 Flash представляет собой каузальный кодер-декодер, новую базовую архитектуру по сравнению с более ранним дизайном V4 Pro. Это существенное различие между ними и причина, по которой «.1» не является точечным релизом.

• Цена за 1 млн токенов — V4.1 Flash: $0,15 за вход / $0,60 за выход в непиковые часы против V4 Pro: $0,66 за вход / $1,98 за выход, по данным каталога OrcaRouter.

• Кэшированный ввод — V4.1 Flash $0,003 за 1M против V4 Pro $0,024 за 1M.

• KV-кэш на токен — 890 байт у V4.1 Flash против большего объёма у V4 Pro. При миллионе токенов контекста именно эта статья расходов решает, остаётся ли длинный транскрипт работы агента резидентным.

• Контекст и вывод — 1M контекста и 384K максимального вывода на обоих. Уровень.

• Наблюдаемая задержка до первого токена — V4.1 Flash 2,63 с p50 против V4 Pro 3,58 с p50, по 7-дневной телеметрии OrcaRouter, при p95 на уровне 10,00 с для V4 Pro.

• Входные модальности — V4.1 Flash принимает текст и изображения, тогда как V4 Pro работает только с текстом на входе и выходе, на тех же листингах. Более новая модель является более широкой из двух по входным данным, а также более дешёвой по стоимости.

Прочитайте список без вендорской подачи — и картина окажется необычной. Преемник дешевле по каждой позиции, быстрее выдаёт первый токен, шире по входу и меньше по каждой позиции. Именно так выглядит настоящее архитектурное изменение, когда оно выходит, и именно поэтому у вопроса «что лучше» здесь есть короткий ответ, а под ним — более длинный.

Two-column scoreboard: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — total parameters 552B vs 1.6T, active parameters 8B input and 16B output vs 49B, architecture Causal Encoder-Decoder vs an earlier design, price per 1M tokens $0.15 input and $0.60 output vs $0.66 and $1.98, max output 384K tokens vs 384K tokens, and release date 2026-09-10 vs still served and not retired

График V4 Pro, потому что он важен для всех, кто всё ещё использует его.

DeepSeek V4 Pro планировалось вывести из эксплуатации. API должен был быть отключён 14 сентября 2026 года в 12:00 по пекинскому времени, а трафик — перенаправлен на V4.1 Flash. Этого не произошло. 11 сентября поставщик отменил своё решение, заявив: «В ответ на запросы пользователей мы решили продолжать предоставлять API-сервисы для DeepSeek V4 Pro после 14 сентября 2026 года, при этом способ оплаты остаётся неизменным».

Из этого следуют две вещи, и в отношении обеих стоит быть точным, потому что ситуация провоцирует вчитываться слишком сильно.

Первое: V4 Pro не устарел. Это поддерживаемая модель с неизменной ценой, и именно на неё собственное уведомление DeepSeek направляет существующий трафик V4 Pro. Если у вас есть production-путь, привязанный к ней, ничего не отняли.

Второе заключается в том, что DeepSeek V4.1 Pro не существует. В уведомлении о выводе из эксплуатации говорилось, что трафик V4 Pro обслуживается V4.1 Flash «до запуска V4.1-Pro», что породило определённое количество предположений о более крупном собрате. По состоянию на 22 сентября 2026 года не существует API V4.1 Pro, нет карточки модели, нет весов и нет анонса. В сообщении от 21 сентября 2026 года говорилось о модели с 2 триллионами параметров, которую ожидают в середине — конце октября; это основанное на единственном источнике утверждение о неанонсированном продукте, и относиться к нему следует соответственно. Любой, кто планирует мощности в расчёте на запуск V4.1 Pro, планирует на основе слухов.

Какой из них на самом деле вызвать?

Случай миграции прост, и именно его сама DeepSeek реализовала, направив трафик V4 Pro на новую модель. Судя по приведённым выше цифрам, V4.1 Flash дешевле, быстрее выдаёт первый токен и быстрее в установившемся режиме, а его KV-кэш на токен меньше. Если ваша рабочая нагрузка — это нагрузка V4 Pro, которая не делает чего-то, что под силу только 49B активных параметров, новая модель — лучший инструмент с точки зрения стоимости и задержки, и здесь не нужно взвешивать компромиссы.

Доводы в пользу того, чтобы остаться на V4 Pro, связаны с тем, что даёт гораздо большее число активных параметров при сложных рассуждениях и долгосрочной агентной работе, и эти доводы вам придётся строить на собственных оценках, а не на спецификации. Причина в том, что две модели не сравниваются на общем публичном лидерборде так, чтобы изолировать их: DeepSeek V4.1 Flash фигурирует в свипе Agents on Rails от 21 сентября 2026 года с 17% при максимальном усилии, тогда как V4 Pro в этом лидерборде нет. Нет числа для прямого очного сравнения, на которое можно указать. Есть лишь правдоподобный аргумент, вытекающий из архитектуры — шестикратное число активных параметров — это слишком много мощности, чтобы от неё отказываться, — и это аргумент, а не измерение.

Два практических замечания для тех, кто переносит трафик между ними. Во-первых, расписание часов пик применяется к обеим моделям, поэтому сравнение затрат, выполненное не в то время суток, даст ошибку в два раза; пиковые часы — 01:00–04:00 и 06:00–10:00 UTC по будням, а выходные полностью относятся к непиковым. Во-вторых, у обеих моделей одинаковые контекстное окно и предельный объём вывода, поэтому миграция не изменяет ваш бюджет промпта — что делает переход необычно низкорисковым на стороне приложения.

Запуск обоих через один эндпоинт

Ситуация, когда вам действительно нужны оба, — это переходный период, и она встречается чаще, чем кажется: команда, которая хочет перейти на V4.1 Flash, но у неё есть один пайплайн, поведение которого на новой архитектуре ещё не проверено. Запуск двух параллельно через разных поставщиков означает два контракта и два набора ключей для того, что на уровне модели является одним провайдером.

Обе модели доступны на OrcaRouter под одним ключом, что сводит это к решению о маршрутизации. OrcaRouter передаёт тарифы из прайс-листа провайдера без наценки — 0%, поэтому приведённые выше цифры — это собственные тарифы DeepSeek, а не наши, и расписание пиковых и непиковых часов DeepSeek применяется ровно так, как его определяет DeepSeek, — включая изменение цены в середине переходного периода, которое вступает в силу на нашей стороне в тот же день. Вы можете направить долю трафика на новую модель и сравнить результаты или маршрутизировать по типу задачи, а за новым маршрутом настроить автоматическое переключение при сбое, чтобы, если V4.1 Flash поведёт себя неожиданно на ваших данных, запрос попадал на V4 Pro, а не на страницу ошибки.

Учитывая, что поставщик уже однажды передумал насчёт того, какая из этих моделей будет выведена из эксплуатации, сохранение доступа к обеим через одну интеграцию — это вариант, который не требует предугадывать следующий разворот.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model id with a flagship badge, 1M-token context, 384K max output, text input and text output, $0.66 input and $1.98 output per 1M tokens, a cache rate of $0.024, and observed time to first token of 3.58 s at p50 and 10.00 s at p95

Что посмотреть

• Изменятся ли снова цена или статус прекращения поддержки V4 Pro. Сентябрьский разворот недвусмысленно указывал на то, что тарификация останется неизменной, и именно этого обязательства следует требовать от поставщика.

• Станет ли V4.1 Pro реальностью. Пока нет ни карточки модели, ни релиза весов, история про 2T-параметров — это слух из одного источника.

• Независимая оценка, в рамках которой обе модели запускаются на одном и том же стенде. Пока её не существует, честное сравнение между этими двумя — это стоимость, задержка и архитектура, которые измеримы, плюс обоснованное предположение о возможностях, которое — нет.

Пока не появится третий из них, точная сводка такова: DeepSeek V4.1 Flash — более дешёвый и быстрый преемник DeepSeek V4 Pro, V4 Pro по-прежнему поддерживается по неизменной цене, а вопрос о том, теряет ли новая архитектура в возможностях, сейчас не освещается ни в одном публичном бенчмарке.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно