Титульная карточка Hero с надписью «Цены DeepSeek V4.1 Flash», строкой «$0.15 за вход, $0.60 за выход, $0.003 за попадание в кэш», подписью «За 1M токенов, вне пиковых часов. В пиковые часы каждый тариф удваивается.» и тремя карточками с надписями «Попадание в кэш: в 50 раз дешевле промаха», «Контекст 1M токенов» и «Открытые веса, лицензия MIT».
Guides & Insights

Цены на DeepSeek V4.1 Flash: полная тарифная сетка и показатель попаданий в кэш, который определяет ваш счёт

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4.1 Flash находится в общем доступе с 2026-09-10, и по состоянию на сегодня его опубликованная тарифная сетка — самое дешёвое в верхнем сегменте рынка моделей: $0,15 за миллион входных токенов, $0,60 за миллион выходных и $0,003 за миллион при попаданиях в кэш. Эти три цифры относятся к колонке внепиковых тарифов. В будние дни в периоды пиковой нагрузки DeepSeek каждая из них удваивается, включая попадания в кэш. Важное сравнение — не с собственным устаревающим флагманом DeepSeek — DeepSeek-V4-Pro-0813 указан по цене $0,66 / $1,98 за миллион вне пика, так что Flash обходит своего же собрата примерно в 4 раза по входу, — а с закрытым передовым эшелоном, с которым покупатели фактически сравнивают цены: GPT-5.6 Sol, Claude Opus 5 и Gemini 3.8 Flash, каждая из которых берёт на порядок больше за токен.

Одна поправка, прежде чем перейти к цифрам, потому что утечка, предшествовавшая этому запуску, всё ещё гуляет. Цифры, которые распространились до GA, описывали снижение цен, вступающее в силу «завтра». Цены настоящие; подача — нет. V4.1 Flash вышел 2026-09-10, когда эти тарифы уже действовали, а в собственном журнале изменений DeepSeek снижение зафиксировано как часть релиза, а не как отдельное более позднее снижение. Всё ниже взято с актуальной страницы цен DeepSeek на сегодня, 2026-09-16.

Полная тарифная сетка по состоянию на 2026-09-16

DeepSeek публикует одну таблицу, охватывающую актуальные SKU, где каждая позиция разбита на столбцы для пикового и непикового периода. Для идентификатора модели deepseek-flash, который обслуживает DeepSeek-V4.1-Flash, опубликованные тарифы следующие:

Ввод, промах кэша — $0,15 за 1 млн токенов в непиковые часы; $0,30 за 1 млн в пиковые часы

Ввод, попадание в кэш — $0.003 за 1 млн токенов в непиковое время; $0.006 за 1 млн в пиковое время

Вывод — $0,60 за 1 млн токенов в непиковые часы; $1,20 за 1 млн в пиковые часы

Контекстное окно — 1 млн токенов при максимальном объёме вывода 384K

Лимит параллелизма — 2 500 одновременных запросов на Flash SKU

Устаревшие идентификаторы моделейdeepseek-v4-flash и deepseek-v4-flash-vision-exp выведены как отдельные продукты, но по-прежнему направляются на V4.1 Flash и тарифицируются по ценам Flash

Разрыв между первыми двумя строками — вот и вся суть этого листа. Попадание в кэш обходится в 50 раз дешевле, чем промах кэша в непиковые часы, — скидка 98%, и именно так Artificial Analysis отображает это в своей модели затрат. Ничто другое на карточке не сдвигает счёт настолько сильно.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Пик — это не ошибка округления, и он приурочен к Пекину.

Пиковые интервалы DeepSeek — с понедельника по пятницу, 01:00–04:00 UTC и 06:00–10:00 UTC. Всё вне этих интервалов — включая все часы выходных — тарифицируется по половинной ставке. Удвоение применяется ко всем трём тарифным строкам, поэтому промах кэша в пиковые часы стоит $0.30, а вывод в пиковые часы — $1.20.

То, на какое время приходятся эти окна, целиком зависит от того, где вы находитесь. В Пекине это 09:00–12:00 и 14:00–18:00 — два рабочих блока, в чём и суть. В Берлине в сентябре второе окно — 08:00–12:00 CEST: всё утро европейской команды приходится на пик. В Нью-Йорке то же окно — 02:00–06:00 EDT. Команда из США, работающая в обычные часы, фактически никогда не платит по пиковому тарифу, а команда из ЕС каждое утро до обеда платит вдвое больше. Если вы выбираете, когда запускать пакетное задание, это решение стоимостью 0,15 доллара за миллион токенов, и принять его ничего не стоит.

Что на самом деле тарификация с учётом попаданий в кэш делает со счётом агента

Попадания в кэш на DeepSeek происходят автоматически — в документации сказано, что дисковое кэширование включено по умолчанию для всех пользователей без изменения кода — так что скидка — это не то, что вам нужно специально проектировать. Это также осуществляется по мере возможности, а не гарантируется: DeepSeek заявляет, что фиксированного TTL нет, неиспользуемый кэш очищается "обычно в течение нескольких часов или нескольких дней", и система не обещает 100% попаданий. Стоит прочитать в ответе prompt_cache_hit_tokens и prompt_cache_miss_tokens поля, прежде чем строить на этом какие-либо модели.

Арифметика важнее прилагательного. Возьмём агента для программирования со стабильным префиксом в 40 000 токенов — системный промпт, схемы инструментов, контекст репозитория — и запустим сессию на 60 ходов, где каждый ход добавляет около 2 000 токенов вывода инструментов, а модель генерирует около 1 200 токенов. Суммарный вход за сессию — 5,94 млн токенов, суммарный выход — 72 000 токенов.

При тарификации без кеширования вообще, в непиковые часы: 5,94 млн входных данных по $0,15 — это $0,891, плюс 72 000 выходных данных по $0,60 — это $0,043 — около $0,93 за сеанс.

При выставлении счёта с кэшированным префиксом, что фактически и происходит по умолчанию: 5,782 млн из этих входных токенов поступают как попадания в кэш по $0,003 ($0,017), 158 000 поступают как промахи кэша по $0,15 ($0,024), а те же 72 000 выходных токенов стоят $0,043. Около $0,084 — примерно в 11 раз дешевле. Доля входных данных падает с 95% счёта до 49%, на одну только кэшированную часть приходится 21%, а выходные токены становятся самой крупной отдельной строкой. Та же модель, та же сессия, тот же вывод — единственное, что изменилось, — это то, был ли повторно использован префикс.

Обратите внимание, чего нет в таблице DeepSeek: строки о плате за запись в кэш. Anthropic взимает 1,25x от базовой цены ввода за заполнение 5-минутного кэша и 2x за час; в карточке DeepSeek перечислены только попадания и промахи, а в руководстве по кэшированию не упоминается плата за запись или хранение. Если вы сравниваете экономику кэширования у разных поставщиков, а не заявленные тарифы на токены, это отсутствие значит больше, чем предполагает 50-кратная скидка на попадания.

Именно поэтому сквозная детализация цен на DeepSeek V4.1 Flash в OrcaRouter здесь важна. Мы выставляем счёт по собственному прайс-листу провайдера с нулевой наценкой, поэтому изменение цены поставщиком вступает в силу на нашей стороне в тот же день, а не после пересчёта цен — и столбцы попаданий в кэш и пиковых/непиковых тарифов, которые вы видите выше, — это именно те, по которым вы фактически платите, а не их усреднённое приближение.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

В сравнении с DeepSeek-V4-Pro-0813: 4-кратный разрыв и несостоявшаяся отставка

Очевидное внутреннее сравнение — это флагманский SKU, и оно менее драматично, чем предполагает заявленная ставка. DeepSeek-V4-Pro-0813, идентификатор модели deepseek-v4-pro, указан по цене $0.66 за 1 млн входных токенов при промахе кэша и $1.98 за 1 млн выходных вне пика, удваиваясь в пиковые часы до $1.32 и $3.96. Его попадания в кэш стоят $0.022 вне пика — более чем в 7 раз дороже, чем у Flash.

Ввод при промахе кэша — $0,15 против $0,66 в непиковые часы, так что Flash в 4,4 раза дешевле

Вывод — $0,60 против $1,98 в непиковые часы, так что Flash в 3,3 раза дешевле

Ввод с попаданием в кэш — $0,003 против $0,022 в непиковое время, так что Flash дешевле в 7,3 раза

Контекст и верхняя граница вывода — идентично при 1M и 384K на обоих SKU

Параллелизм — 2 500 у Flash против 500 у V4 Pro, разница в 5 раз, которая полностью исчезает из прайс-листа

В этом сравнении легко ошибиться в трёх вещах. Во-первых, аргумент в пользу повторного использования сильнее для флагмана в абсолютных числах, хотя у Flash множитель больше: кеширование одного миллиона токенов экономит $0.638 на V4 Pro и $0.147 на Flash, потому что у флагмана изначально гораздо выше доля промахов. Во-вторых, модель, которую все ожидали увидеть исчезнувшей, не исчезла: DeepSeek объявила, что прекратит обслуживать V4 Pro 2026-09-14 и направит эти запросы на Flash, вызвала недовольство разработчиков из-за подмены бэкенд-модели в производственных процессах и отменила это решение 2026-09-11. V4 Pro по-прежнему обслуживается по неизменным тарифам. В-третьих, и именно в эту ловушку попали материалы об утечке — V4.1 Pro не выпускалась. DeepSeek-V4-Pro-0813 остаётся флагманским SKU, и вендор не выпустил преемника под этим названием. Любой, кто оценивает миграцию на «V4.1 Pro», оценивает модель, которой не существует.

Против закрытого фронтирного уровня

По сравнению с закрытыми моделями, которые покупатели действительно включают в шорт-лист, главное — это множитель. Все приведённые ниже цифры взяты из опубликованных на сегодня страниц с ценами самих поставщиков.

GPT-5.6 Sol — по прайс-листу стоит $5.00 за 1 млн входных токенов и $30.00 за 1 млн выходных на тарифе OpenAI с коротким контекстом; сейчас действует промо-цена $4.00 / $20.00, которая, по словам OpenAI, доступна как минимум до 2026-11-21, а кэшированный ввод стоит $0.40. По сравнению с промо-ценой DeepSeek V4.1 Flash дешевле на входе в 26,7 раза и на выходе в 33,3 раза; по сравнению с прайс-листом — в 33 и 50 раз. Кэш-хит Sol стоит в 133 раза дороже, чем у Flash.

Claude Opus 5 — $5.00 за 1 млн входных и $25.00 за 1 млн выходных токенов, при этом попадания в кеш — $0.50 за 1 млн в опубликованном прайс-листе Anthropic. Это в 33 раза больше тарифа Flash за вход, в 42 раза — за выход и в 167 раз — за попадание в кеш. 5-минутные записи в кеш Anthropic добавляют сверху ещё 1.25x; в таблице DeepSeek нет аналогичной строки.

Gemini 3.8 Flash — $0,75 за 1 млн входных токенов и $3,75 за 1 млн выходных токенов до 2026-12-31, при этом обе ставки должны удвоиться с 2027-01-01, кэшированный ввод — $0,075, и — вот строка, которая повторяется в реальном счёте — кэш-хранилище по $0,50 за 1 млн токенов в час. Flash в 5 раз дешевле по входным данным, в 6,25 раза — по выходным и в 25 раз — по попаданиям в кэш по сравнению с ним, а DeepSeek ничего не берёт за хранение кэша.

Контекст возможностей — вот что делает эту картину честной. В Intelligence Index v4.3 от Artificial Analysis DeepSeek V4.1 Flash (reasoning, max effort) набирает 40 баллов и занимает 6-е место из 113 моделей, при $0,27 за задачу индекса и 214,4 выходных токена в секунду. Это по-настоящему близкая к фронтиру позиция при цене в 26 раз ниже, чем у уровня, с которым его сравнивают, — но то же измерение показывает, что это одна из самых многословных моделей, которые тестировала AA: она сгенерировала 250 млн выходных токенов за весь прогон индекса против медианных 140 млн. Многословность не меняет цену за токен, но счёт она меняет. Модель, которая пишет на 62% больше токенов, чем медиана, всё равно обходится здесь гораздо дешевле, но «дёшево за токен» и «дёшево за задачу» — это разные утверждения, и платите вы только за второе.

Есть ли бесплатный тариф?

Нет. На собственной странице тарифов DeepSeek не указано ни бесплатного уровня API, ни бесплатной месячной квоты, ни бесплатной модели — оплата производится по мере использования за счёт пополненного или предоставленного баланса, причём предоставленный баланс расходуется в первую очередь. Потребительское приложение для чата бесплатно; API за deepseek-flash — нет, и на платформе DeepSeek для него нет бесплатной конечной точки. Несколько сторонних шлюзов рекламируют бесплатный или пробный доступ к этой модели, и мы рассматривали бы все их как площадки для прототипирования, а не как продакшен-бэкенды, потому что эти условия меняются без предупреждения, и ни один из них не приводит тарифную сетку самого поставщика.

Заявления об эффективности, стоящие за ценой

Цена не является субсидией — по крайней мере, по собственным утверждениям DeepSeek. В карточке модели и техническом отчёте поставщика V4.1 Flash описывается как смесь экспертов на 552 млрд параметров в архитектуре Causal Encoder-Decoder, которая активирует примерно 8 млрд параметров на токен во время префилла и 16 млрд во время декодирования — асимметрично по замыслу: дёшево при чтении и дороже при записи. Что касается памяти, DeepSeek сообщает о глобальном KV-кэше примерно в 890 байт на токен — примерно четверть от аналогичного показателя DeepSeek-V4-Flash — и о постоянном объёме кэша примерно в одну восьмую от него при идентичных рабочих нагрузках; этого удаётся достичь за счёт отбрасывания состояния скользящего окна и повторного воспроизведения последних 128 токенов при попадании в кэш. Это измерения, заявленные поставщиком на его собственном оборудовании, и технический отчёт не утверждает математическую эквивалентность полному вычислению для пути воспроизведения.

Количество параметров — единственный показатель в этом релизе, который действительно не устоялся, и стоит точно объяснить почему. В описании DeepSeek указано 552 млрд — это основная часть, та, что выполняет вычисления. Рядом с ней находится Engram — таблица поиска для условной памяти, которую карточка модели оценивает в 196 млрд параметров; доступ к ней осуществляется через поиск по токенам, а не путём вычислений через неё. Сложите их — и получите около 748 млрд; именно на этом числе в течение нескольких часов после публикации весов настаивал широко читаемый анализ сообщества на r/LocalLLaMA, а собственная панель файлов репозитория Hugging Face поднимает его ещё выше — к 763 млрд. В отчётах сообщества о развёртывании чекпойнт оценивали примерно в 510 ГБ, распределённых по 48 шардам; он поставляется нативно квантованным в виде плотных весов FP8 с экспертами FP4.Считайте итоговое значение спорным, а цифру по основной части — заявленной вендором. Именно количество активных параметров определяет скорость; именно резидентные веса решают, запустится ли модель вообще.

Селф-хостинг — реальная альтернатива этой цене, по лицензии MIT.

Веса доступны по адресу deepseek-ai/DeepSeek-V4.1-Flash под лицензией MIT, которая разрешает коммерческое использование, модификацию и распространение. Это превращает тарифную сетку API в выбор, а не в плату: при MIT ничто в лицензии не мешает вам обслуживать эту модель самостоятельно и платить за вычисления, а не за токены.

Дешёвым это не делает. Чекпойнт — это примерно 510 ГБ резидентных весов до кэша и активаций, DeepSeek нигде в репозитории не указывает требований к GPU, а описания развёртывания от сообщества оценивают практический минимум как узел с несколькими GPU, а не как рабочую станцию. Три сервинг-стека выпустили поддержку день-0 2026-09-10 — vLLM, SGLang с Miles и адаптация NeuWare от Cambricon на базе vLLM для собственных ускорителей — но в день релиза vLLM и SGLang выпустили специальные preview-образы, а не официальные пакеты, а в llama.cpp ещё не влили поддержку архитектуры V4.1. Самостоятельный хостинг на потребительском железе сегодня не является альтернативой цене API; альтернатива — арендованный узел с 8 GPU. Если ваш объём достаточно велик, чтобы амортизировать это, лицензия это позволяет; если нет, $0.15 за миллион токенов — более дешёвый ответ, и это даже не близко.

Что тарифная сетка на самом деле предлагает вам решить

Три вещи, в порядке того, сколько денег они экономят. Держите стабильный префикс промпта, и пусть кэш делает своё дело — он автоматический, это 50-кратная скидка, и в агентном цикле на 60 ходов он превращает сессию стоимостью $0.93 в сессию стоимостью $0.084. Запускайте пакетный трафик вне интервалов 01:00–04:00 и 06:00–10:00 UTC по будням — для команды из США это ничего не меняет, а для европейской команды означает перенос утренней задачи на вторую половину дня. А если вы сравниваете цену с собственным флагманом DeepSeek, помните, что флагман всё ещё продаётся со скидкой — запланированный вывод из эксплуатации был отменён 2026-09-11, оба SKU находятся за одним ключом, а переключение между ними — это смена model-id, а не миграция.

Что тарифная сетка не сообщает вам, так это достаточно ли модель хороша для вашей рабочей нагрузки, а данные для этого новее и скуднее, чем прайс-лист. Позиция в индексе Artificial Analysis — это единичное измерение при максимальном уровне усилий рассуждения, строки бенчмарков поставщика заявлены самим поставщиком, а число параметров оспаривается. Цена — это устоявшаяся часть данного релиза. Рассчитывайте стоимость миграции исходя из неё и проверьте возможности, прежде чем окончательно выбрать её.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно