Титульная карточка для 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash' с подзаголовком 'Тот же тариф Flash. Переобученная модель.', бейджами 'ВЫПУЩЕНО 10 СЕНТЯБРЯ 2026' и 'ОБНОВЛЕНИЕ FLASH-УРОВНЯ', и логотипом OrcaRouter, размещённым в правом нижнем углу.
Guides & Insights

DeepSeek V4.1 Flash против DeepSeek V4 Flash: та же тарифная карта Flash, но переобученная модель

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Неделя, за которую DeepSeek V4.1 Flash превратился из гипотетического преемника в официально выпускаемую модель Flash, была короткой и бурной. 8 сентября модель появилась в виде двухдневного API-теста под идентификатором deepseek-v4.1-flash-expires-on-0910 — сборки, которую сама DeepSeek назвала «промежуточной версией». 9 сентября на её открытой платформе сообщили, что официальный релиз DeepSeek V4.1 Flash состоится примерно 10 сентября и что эта модель «всесторонне превосходит» DeepSeek V4 Pro по возможностям, стоимости, скорости и сквозному времени. 10 сентября уведомление о релизе сопровождалось новым прайс-листом серии Flash, вступившим в силу в 12:00 по пекинскому времени, — такого у DeepSeek V4 Flash не было с августовского повышения цен. Как бы то ни было, текстовая рабочая лошадка DeepSeek V4 Flash больше не является самым новым способом выполнять рабочие нагрузки Flash, и эта статья о том, что это реально меняет для приложения, которое вы используете сегодня.

Сравнения на таком раннем этапе неизбежно однобоки, и об этом стоит сказать до того, как появятся цифры. У DeepSeek V4 Flash есть опубликованная карточка спецификаций, месяц продакшн-трафика после обновления DeepSeek-V4-Flash-0731, открытые веса и независимые измерения от Artificial Analysis. У DeepSeek V4.1 Flash есть официальный анонс, два дня общественных тестов скорости, но ни опубликованной карточки, ни технического отчёта, ни сторонних оценок пока нет. Заявления вендора ниже обозначены как заявления вендора; цифры сообщества — как измеренные сообществом.

Уровень Flash только что сбросился — три изменения, одна неделя

DeepSeek V4 Flash, модель со смесью экспертов на 284 млрд параметров и 13 млрд активных, с момента обновления 31 июля является разумным недорогим и высокопроизводительным выбором по умолчанию для значительной доли производственного текстового трафика. Три анонса за три дня пошатнули её позиции:

• 8 сентября — DeepSeek открыл для любого API-аккаунта временную бета-версию V4.1 Flash, ограниченную 20 одновременными запросами, срок действия которой истекал 10 сентября, под именем модели, которое само содержало дату истечения.

• 9 сентября — открытая платформа объявила об официальном выпуске DeepSeek V4.1 Flash примерно на 10 сентября, описав новую структуру модели с нативной мультимодальной поддержкой и заявив, что она превосходит DeepSeek V4 Pro по производительности, стоимости, скорости и общему времени выполнения.

• 10 сентября — официальный релиз приносит новый прайс-лист серии Flash, вступающий в силу в 12:00 по пекинскому времени, снижая тарифы, которые DeepSeek V4 Flash взимал с момента повышения 17 августа, вызвавшего резкую критику со стороны разработчиков.

Последнее из них заслуживает отдельного упоминания, потому что это редкий случай снижения цены, которое действительно является снижением цены. В новом прайс-листе непиковый ввод с попаданием в кэш дешевеет с ¥0.05 до ¥0.02 за миллион токенов — на 60%, — тогда как ввод без попадания в кэш снижается с ¥1.5 до ¥1, а вывод — с ¥4.5 до ¥4. Тарифы в пиковые часы вдвое выше непиковых. В пересчёте на доллары США это примерно $0.003 за миллион ввода с попаданием в кэш, $0.14 за ввод без попадания в кэш и $0.56 за вывод в непиковое время, а в пиковое — вдвое больше. 24-дневный разрыв между августовским повышением и этим снижением не был случайностью планирования: сброс цен является частью запуска V4.1 Flash.

Тот же уровень, другая модель

Простое прочтение таково: V4.1 Flash — это V4 Flash с выкрученной на максимум ручкой скорости. Но это не так. Обновление 0731 было пост-тренировочным обновлением существующей базы DeepSeek V4 Flash — та же архитектура, та же компоновка mixture-of-experts с 284B всего / 13B активных параметров. Описание DeepSeek для V4.1 Flash указывает на нечто большее: новую структуру модели, которую несколько изданий расценили как новый прогон предварительного обучения, а не как дообучение. Это различие важно, потому что переобученная модель не наследует поведение старой модели так, как это делает обновление, — промптинг, вызов инструментов и стиль вывода могут измениться даже там, где возможности остаются прежними.

Архитектура — DeepSeek V4.1 Flash: новая структура модели, описанная DeepSeek как созданная с нуля разработка с нативной поддержкой мультимодального ввода. DeepSeek V4 Flash: пост-тренировочное обновление V4-Flash-0731 MoE-модели с 284B общих / 13B активных параметров.

• Ввод — V4.1 Flash изначально поддерживает ввод текста и изображений в базовой модели; DeepSeek V4 Flash работает только с текстом, а для изображений требуется отдельная подключаемая сборка DeepSeek-V4-Flash-Vision-Exp.

• Контекст и вывод — DeepSeek V4 Flash заявляет контекст в 1M и максимальный вывод в 384K; в материалах запуска DeepSeek говорится, что V4.1 Flash сохраняет окно контекста в масштабе миллиона токенов, но официальная карточка модели ещё не опубликована.

• Параллельность — DeepSeek V4 Flash имеет потолок в 2 500 одновременных запросов; бета-версия V4.1 Flash была ограничена 20 запросами, а заявление DeepSeek о «высокой параллельности» для релизной сборки на момент написания ещё не подтверждалось опубликованной цифрой.

• Веса — DeepSeek V4 Flash имеет открытые веса по лицензии MIT; о V4.1 Flash ничего не объявлено.

• Независимая оценка — DeepSeek V4 Flash протестирован Artificial Analysis; DeepSeek V4.1 Flash пока не имеет сторонних оценок.

Вопрос «текст против мультимодальности» заслуживает дополнительного предложения даже в текстовом сравнении, потому что именно он решает, для кого предназначен V4.1 Flash. Если ваш конвейер использовал DeepSeek V4 Flash для текста и DeepSeek-V4-Flash-Vision-Exp для изображений, то V4.1 Flash — это первая сборка DeepSeek, которая покрывает оба пути одной моделью: одну конечную точку нужно поддерживать, без энкодера, прикрученного сбоку.

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

Где они действительно расходятся: производительность и стоимость выполненной задачи

При одинаковых ценах эти две модели различаются по скорости, и именно скорость даёт самые громкие цифры. Artificial Analysis измеряет DeepSeek V4 Flash 0731 примерно на 120–140 исходящих токенов в секунду на собственном API DeepSeek, в зависимости от конфигурации и окна измерения. Тестеры первого дня V4.1 Flash сообщали об устойчивой генерации от примерно 280 до 500 токенов в секунду в зависимости от задачи, с пиками выше 500 при небольшой параллельности; более высокие цифры получены сообществом, а не опубликованы вендором, и количество токенов в секунду никогда не является внутренним свойством модели. Тем не менее, направление согласуется во всех отчётах первого дня, и собственное заявление DeepSeek о более быстрой генерации и меньшем общем времени выполнения указывает в ту же сторону.

Этот разрыв в скорости меняет экономику, даже если обе модели находятся в одном тарифе, потому что вы платите за токен, а токены поступают быстрее. Задача по извлечению данных из длинного контекста или генерации кода, которая на V4 Flash занимала минуту, на V4.1 Flash может завершиться за долю этого времени при той же цене за токен — несколько тестировщиков в первый день сообщили о пяти-шестикратном ускорении сквозного процесса именно для этих классов задач. Ранние жалобы на бета-версию о том, что «она тратит деньги быстрее», были оборотной стороной той же медали: при неизменной цене за токен модель, которая генерирует токены в два-три раза быстрее, быстрее расходует баланс в минуту. Снизится ли фактически счёт за задачу, зависит от того, завершит ли новая модель работу с меньшим числом токенов и меньшим числом повторов, а этого пока никто не может доказать.

На самой карточке цен эти две модели расположены бок о бок. За миллион токенов вне пиковых часов по прайсу от 10 сентября: ¥0,02 за ввод при попадании в кэш, ¥1 за ввод при промахе кэша и ¥4 за вывод, в пик — вдвое больше. Тот же список, который применялся к уровню Flash до урезания, составлял ¥0,05, ¥1,5 и ¥4,5. Для нагрузки с активным использованием кэша главным событием является урезание: ¥0,02 против ¥0,05 — это снижение на 60% на токенах, которые составляют большую часть входного потока автодополнения или агентского цикла. Для задания по приёму новых данных, которое не попадает в кэш, экономия ближе к трети. Ничто из этого не делает V4.1 Flash дешевле за токен, чем V4 Flash — у них общий прайс-лист, — но более высокая пропускная способность архитектуры является отличительным фактором, и она не стоит ничего дополнительно.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

Квитанции предназначены для V4 Flash; претензии — для V4.1 Flash

Самый важный факт о бенчмарках в этом сравнении прямо сейчас — что для новой модели бенчмарка нет. Главное заявление DeepSeek V4.1 Flash — о том, что она всесторонне превосходит DeepSeek V4 Pro по возможностям, стоимости и скорости, — исходит от вендора и не подтверждено независимыми тестами. Ни количество параметров, ни таблица результатов, ни технический отчет не опубликованы, и Artificial Analysis не проводил измерений на момент написания. Для семейства моделей, чей последний флагманский запуск подвергся независимой проверке, утверждение «поверьте нам, она лучше Pro» стоит воспринимать скептически, пока его не проверит третья сторона.

DeepSeek V4 Flash, напротив, имеет реальную доказательную базу. Artificial Analysis относит reasoning-сборку 0731 к ведущим моделям своего класса, оценивает её значительно выше медианы для сопоставимых моделей с открытыми весами и фиксирует скорость генерации на собственном API DeepSeek в указанном выше диапазоне ~120–140 токенов в секунду. Именно с этими цифрами будут сравнивать V4.1 Flash, когда появятся её собственные результаты, и они задают более высокую планку, чем подразумевает ярлык «быстрый дешёвый Flash». Модель, которую заменяет новая сборка, не слабая; это по-настоящему сильная рабочая лошадка с открытыми весами. Именно это делает решение об обновлении реальным, а не символическим.

Маршрутизация выполняет основную работу — внутри DeepSeek и для вас.

{{1}}Наименее освещаемый аспект этого запуска — то, что DeepSeek маршрутизирует трафик между своими собственными моделями.{{/1}} {{2}}Её анонс недвусмыслен: как только V4.1 Flash станет доступна и до тех пор, пока не выйдет V4.1 Pro, каждый API-запрос, адресованный deepseek-v4-pro, будет обслуживаться моделью DeepSeek V4.1 Flash и тарифицироваться по цене уровня Flash.{{/2}} {{3}}Пользователи V4 Pro получают новую архитектуру и небольшую долю стоимости за токен, не меняя ни строчки кода.{{/3}} {{4}}Обратите внимание, что не маршрутизируется: вызовы deepseek-v4-flash.{{/4}} {{5}}Старая модель Flash продолжает обслуживать тех, кто по-прежнему указывает на неё, — именно поэтому это сравнение и существует: если вы на V4 Pro, переключение происходит без вашего участия, а если вы на V4 Flash, это решение вам придётся принять самостоятельно.{{/5}}

Продавец, тихо решающий, что более дешёвая модель должна обслуживать звонки, предназначенные для его премиальной, — это яркое подтверждение V4.1 Flash — и это также та же логика, которую маршрутизирующий слой применяет к разным поставщикам. Именно этот пробел заполняет такая платформа, как OrcaRouter: один API для более чем 200 моделей, с прейскурантными ценами провайдеров, передаваемыми без наценки (0%), поэтому снижение цен DeepSeek на Flash от 10 сентября у нас действует в тот же день.DeepSeek V4 Flash на OrcaRouter остаётся доступным для вызовов по тому же ключу, что и все остальные модели, которые вы используете, что делает безопасный способ внедрения новой модели с первого дня действительно дешёвым: направьте часть трафика на DeepSeek V4.1 Flash через собственный API DeepSeek, оставьте DeepSeek V4 Flash в качестве автоматического запасного варианта в том же правиле маршрутизации, и пусть переключение при сбое обрабатывает пограничные случаи, пока новая архитектура оправдывает своё существование.

DeepSeek V4.1 Flash против DeepSeek V4 Flash: какую стоит вызывать?

Если бы честный ответ заключался в том, что одна из моделей подходит всем, статьи бы не было. Теперь эти две модели соответствуют разным профилям риска, и разделение необычайно чёткое.

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

Переходите на DeepSeek V4.1 Flash, если вы сегодня начинаете новую нагрузку Flash, если задержка и пропускная способность являются основным ограничением, если вам нужен ввод изображений без необходимости сопровождать вторую модель или если вы готовы позволить собственной маршрутизации DeepSeek снять риск с заявления об уровне Pro. Модель доступна в собственном API DeepSeek под именем deepseek-v4.1-flash, тарифицируется по той же Flash-карте, что и заменяемая модель, и все сигналы первого дня говорят о том, что она значительно быстрее.

Оставайтесь на DeepSeek V4 Flash, если вы обслуживаете производственный трафик при опубликованном пределе в 2500 одновременных запросов, если вы полагаетесь на его открытые веса для самостоятельного хостинга или соблюдения нормативных требований, или если ваши промпты, оценки и логика вызова инструментов были настроены под поведение версии 0731 и не могут с первого дня выдержать особенности переобученной модели. Новый прогон предварительного обучения — это изменение поведения, а не просто изменение скорости, и сборка 0731 — это версия с месячной историей проверенной работы.

Для большинства команд обоснованный выбор по умолчанию — это золотая середина: использовать DeepSeek V4.1 Flash как стандарт для новых задач, оставить DeepSeek V4 Flash как резерв для рабочей нагрузки, которая приносит доход, и позволить первому независимому рейтингу — а также опубликованной карте спецификаций и показателю параллельных запросов — урегулировать спор, который не под силу двухдневной бета-версии. Уровень Flash только что получил новый движок; старый не устарел — он является эталоном.

Интересно, как выглядит трафик Pro-класса, пока DeepSeek направляет его на V4.1 Flash по ценам Flash? DeepSeek V4 Pro на OrcaRouter — оба на одном ключе, тарифицируются по прайс-листу DeepSeek.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube