Титульная карточка-хиро для DeepSeek V4.1 Flash с подзаголовком «Двухдневная бета-версия API: всё, что мы знаем на данный момент», бейджами-таблетками с надписями «INTERMEDIATE BUILD» и «API TEST - EXPIRES 09-10», нижней строкой «Официальный пост о релизе ожидается совсем скоро» и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

DeepSeek V4.1 Flash выходит в двухдневную API-бету: новая архитектура, нативная мультимодальность и амбиции уровня Pro

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4.1 Flash появился ровно там, где Deep​Seek испытывает свои разработки перед анонсом: в живом API, под идентификатором модели, который содержит собственный срок действия. Этот идентификатор — deepseek-v4.1-flash-expires-on-0910 — начал обслуживаться 8 сентября 2026 года, после того как команда Deep​Seek опубликовала в своих официальных группах сообщества внутренний тест «промежуточной версии», и завершающее 0910 — это вся история в миниатюре. Это сборка, помещённая в реальную среду API для ограниченного теста, который должен быть отключён примерно 10 сентября, до официального поста о релизе, который, по ожиданиям инсайдеров, заметивших модель, выйдет «очень скоро». Это не запуск. Нет ни карточки модели, ни технического отчёта, ни записи в журнале изменений; более того, этим вечером на публичной странице Models & Pricing компании Deep​Seek по‑прежнему значатся только DeepSeek V4 Flash, DeepSeek V4 Pro и DeepSeek-V4-Flash-Vision-Exp.

Everything below should be read with that asterisk in mind. The official channel here is a community-group announcement and an accompanying feedback form, not a release note. What follows is the union of that announcement, the coverage from Chinese media within hours of it, and first-day measurements from developers who pointed their own keys at the endpoint — with the vendor's claims and the community's numbers labelled as what they are.

Что на самом деле произошло сегодня

Примерно в 15:00 по пекинскому времени 8 сентября команда Deep​Seek сообщила своим официальным группам сообщества, что промежуточная версия — описанная на китайском как «中间版本», то есть промежуточная контрольная точка — открыта для ограниченного тестирования в реальной среде API перед выпуском финальной версии. Любой, у кого есть ключ API Deep​Seek, может вызвать её: сохраните свой существующий базовый URL и ключ и укажите имя модели deepseek-v4.1-flash-expires-on-0910. На этом всё — никакой отдельной конечной точки, никакого листа ожидания и никакой новой консоли.

На практике пределы узки. В суффиксе заложен план: тестовая версия «автоматически истечёт и отключится 10 сентября», оставляя примерно два дня работы. Каждая учётная запись ограничена 20 одновременными запросами — против лимита в 2500 одновременных запросов, который Deep​Seek публикует для deepseek-v4-flash, — что является сильным намёком на намерение: это для функционального тестирования и оценки, а не для направления на него продакшн-трафика.

• Что это — контрольная точка «промежуточной версии», размещённая в действующем API для кратковременного тестирования перед официальной сборкой.

• Где запускается — собственный API DeepSeek; базовый URL и ключ без изменений, название модели заменено на deepseek-v4.1-flash-expires-on-0910.

• Как долго — в названии указано expires-on-0910; ожидается, что тест будет отключен примерно 10 сентября.

• Кто может его вызывать — любой аккаунт с ключом Deep​Seek, до 20 одновременных запросов на аккаунт.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

Что выставляет счёт бета-версия: прайс-лист DeepSeek V4 Flash

Deep​Seek сообщил, что тест тарифицируется по тем же ставкам, что и deepseek-v4-flash, и применяется текущий прайс-лист именно этой модели. После пересмотра цен 16 августа 2026 года Deep​Seek использует пиковые и внепиковые тарифы; точные значения являются официальными для уровня Flash:

• Ввод, кэш-попадание — $0,007 за 1M токенов вне пикового времени, $0,014 в пиковое время

• Ввод, промах кэша — $0.22 за 1M токенов в непиковое время, $0.44 в пиковое.

• Выход — $0,66 за 1 млн токенов вне пиковых часов, $1,32 в пиковые

• Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC, понедельник–пятница; все остальные часы — непиковые, по половине пиковой ставки

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

Заметьте, что не изменилось: цена за токен. Поэтому утверждение DeepSeek о том, что V4.1 Flash «обходится дешевле», — это утверждение об эффективности, а не о снижении тарифа. В первый день несколько тестировщиков убедились в этом дорогой ценой: пятиминутная сессия списала с их баланса заметно больше, чем то же реальное время работы в DeepSeek V4 Flash, потому что модель расходует токены гораздо быстрее. Снизится ли реальная стоимость задачи, зависит от того, справится ли модель с работой с меньшим числом токенов и меньшим числом повторных попыток, — а этого по двухдневным тестам скорости никто оценить не может.

Что означает «новая архитектура, нативная мультимодальность» — пока не проверено.

Официальное описание V4.1 Flash от Deep​Seek сводится к четырём утверждениям: новая структура модели, нативная мультимодальная поддержка, более высокие возможности и более быстрая генерация. Именно утверждение об архитектуре бросается в глаза, потому что оно ломает устоявшуюся схему. Предыдущее обновление, DeepSeek V4 Flash 0731, было пост-обучающим апдейтом, сохранившим ту же архитектуру и масштаб, что и у превью; формулировки Deep​Seek здесь указывают на структурные изменения, и некоторые издания сочли это признаком того, что модель переобучали, а не дообучали. Всё остальное — лишь домыслы. Спекуляции сообщества насчёт изменённых механизмов внимания, экспертных сетей или встроенного зрительного модуля — это именно спекуляции. Не опубликовано ни количества параметров, ни размера контекстного окна, ни таблицы с бенчмарками, ни технического отчёта.

Формулировка «native multimodal» важна по конкретной причине. DeepSeek-V4-Flash-Vision-Exp (выпущена 21 августа, веса открыты с 31 августа) представляет собой текстовую базу DeepSeek V4 Flash с прикрученным к ней визуальным энкодером — в собственных материалах DeepSeek эта связка описывалась как текстовая модель плюс внешний визуальный тракт. V4.1 Flash описывается как мультимодальная с самого основания: ввод изображений и текста обрабатывается самой базовой моделью. В принципе, это реальное архитектурное различие, однако спецификация модальностей не опубликована: тестировщики проверяли только «текст плюс изображения», и читателю следует считать «мультимодальность» подтверждённой лишь в этом смысле, пока не появится карточка модели. Входит ли в планы более широкий набор входных данных — на момент написания этого текста скорее неизвестно, чем подтверждено.

Скорость — это главное, и это коллективное измерение.

Число, которое гуляет по сети в первый день, — примерно {{1}}420 выходных токенов в секунду при генерации длинных текстов{{/1}}, при этом сообщается, что пики превышали {{2}}500 токенов/с на отдельных запусках{{/2}}. Один широко разошедшийся по сети тест сгенерировал более {{3}}71 000 токенов менее чем за три минуты{{/3}}. Все эти цифры неофициальны: это замеры разработчиков на бета-эндпоинте в неконтролируемых условиях, и собственного бенчмарка скорости у {{4}}Deep​Seek{{/4}} нет. Для сравнения, {{5}}Artificial Analysis оценивает скорость публичного эндпоинта DeepSeek V4 Flash 0731 примерно в 128 токенов/с, так что ранние отчёты указывают на скачок сырой пропускной способности примерно втрое или больше{{/5}} — с обычной оговоркой, что пропускная способность зависит от длины входа, числа одновременных запросов и состояния серверов.

Сквозные сравнения с DeepSeek-V4-Flash-Vision-Exp выглядят наиболее показательными, поскольку в них одна и та же задача измеряется вплотную друг к другу. Тестировщики сообщили примерно о 6-кратном ускорении сквозного выполнения на задаче генерации SVG-кода, около 5,2× на извлечении из длинного контекста в 49k токенов, примерно 5× на крупной задаче генерации и оптимизации SQL, 4,6× на алгоритмической задаче и 3,9× на задаче асинхронного рефакторинга. Относитесь к этим цифрам как к ориентировочным, а не точным: сквозные показатели для одной и той же задачи включают время обдумывания, задержку до первого токена и скорость генерации, и они получены от отдельных тестировщиков, а не в контролируемом наборе тестов. Интересный сигнал — это устойчивое направление во всех результатах, а не какой-то отдельный множитель.

Вопрос, лежащий в основе бета-версии

Самый стратегически важный момент скрыт в форме обратной связи, которую Deep​Seek приложил к тесту. Наряду с вопросами об агентных фреймворках и реальных сценариях, в ней напрямую спрашивают тестировщиков, может ли промежуточная версия DeepSeek V4.1 Flash «полностью заменить онлайновую DeepSeek V4 Pro». Это примечательный вопрос для компании, чтобы задавать его пользователям, потому что DeepSeek V4 Pro стоит на три ценовых уровня выше Flash: по текущим официальным тарифам модель Pro взимает $0,66 за 1 млн входных токенов (при промахе кэша) и $1,98 за 1 млн выходных токенов вне пиковых часов, тогда как DeepSeek V4 Flash — $0,22 и $0,66 соответственно, ровно 3× по каждой позиции. Если модель уровня Flash действительно приближается к возможностям уровня Pro по ценам уровня Flash, то для большой части пользователей ответ на этот вопрос очевиден — и Deep​Seek это знает.

В сочетании с формулировкой «новая структура» анкета намекает на то, что V4.1 Flash — это первый видимый шаг чего-то большего, чем точечное обновление: линейка Flash перепозиционируется, чтобы сократить разрыв с флагманской моделью, — так же, как Deep​Seek неоднократно использовал более дешёвую и быструю модель, чтобы переопределить ожидания рынка относительно того, что даёт ценовая категория. Ничто из этого не подтверждается бенчмарком; это стратегическое прочтение вопроса из двух предложений. Но это самое интересное, что Deep​Seek сказал о V4.1 Flash за весь день.

Где это попробовать, и что пока запускать в продакшене

В окне тестирования единственный способ получить доступ к V4.1 Flash — это собственный API Deep​Seek: стороннего хостинга сборки, которая истечёт через два дня, нет, и никто не должен подключать производственный контур к идентификатору модели, которому назначено перестать отвечать. Разумное использование ближайших двух дней — оценка: прогоните свои репрезентативные нагрузки, измерьте качество и реальную экономику токенов и относитесь к любой цифре скорости, которую вы видите, как к неофициальной, пока не появится официальный релиз с карточкой модели.

Для трафика, который должен продолжать работать, публичная линейка Deep​Seek не изменилась, и именно здесь маршрутизирующий слой оправдывает своё существование. На OrcaRouter модели DeepSeek V4 Flash, DeepSeek V4 Pro и DeepSeek-V4-Flash-Vision-Exp доступны через один API по прейскурантной цене Deep​Seek с нулевой наценкой — поэтому августовское снижение цен действует у нас с того дня, как оно появилось, а не тогда, когда до него дошла маржинальная таблица. Когда официальная V4.1 Flash в конце концов поступит к провайдерам, та же схема станет способом внедрить её с низкой стоимостью перехода: направьте часть трафика на новую модель, оставьте DeepSeek V4 Flash или V4 Pro в качестве автоматического резерва, и пусть язык DSL маршрутизатора решает, какие запросы стоит отправлять на непроверенную модель, а какие должны остаться на рабочей лошадке. Вам не придётся ставить производственный маршрут на двухдневную бету, чтобы выяснить, хороша ли она.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

Открытые вопросы

• Когда выйдет официальный релиз? Сигнал, который обратил внимание на эту модель, говорит, что пост о релизе ожидается «очень скоро»; двухдневный срок жизни беты позволяет предположить, что Deep​Seek не собирается заставлять мир долго ждать.

• Соответствует ли финальная сборка этой? Независимые тестировщики, отслеживающие циклы тестирования DeepSeek, отмечают, что компания, по-видимому, запускает несколько кандидатных сборок параллельно, и самый быстрый кандидат на раннем этапе тестирования не всегда оказывается тем, который выходит в релиз — поэтому сегодняшние показатели скорости могут не описывать GA-модель.

• Каковы технические характеристики? Количество параметров, детали архитектуры, длина контекста и полный список входных модальностей не опубликованы — а именно это в первую очередь необходимо настоящему обзору.

• Сохраняется ли цена, и выдерживает ли «более низкая стоимость» контакт с реальными рабочими нагрузками? Бета-версия выставляет счета по тарифам DeepSeek V4 Flash; запуск может принести новый прайс-лист, а стоимость в расчете на задачу не измерена.

• Действительно ли он потянет работу уровня Pro? Опросник задаёт этот вопрос, но ответить на него могут лишь независимые оценки на агентных бенчмарках и бенчмарках на рассуждение — тех самых, что сегодня отделяют уровень Flash от уровня Pro.

Если у вас есть ключ Deep​Seek, суть в двухдневном отсчёте: вызывайте deepseek-v4.1-flash-expires-on-0910, пока он не исчез, запускайте собственные задачи и фиксируйте результаты под ярлыком «измерено сообществом, условия варьируются». Всем остальным стоит следить за релизным постом и вопросом, стоящим за ним: не начала ли самая дешёвая линейка Deep​Seek нацеливаться на самую дорогую.

Пока двухдневная бета-версия налаживается, стабильная модель Flash, которую можно запустить уже сегодня, находится всего в одном API-вызове: DeepSeek V4 Flash на OrcaRouter — по прайс-листу Deep​Seek, с наценкой 0%.

И флагман, с которым бета-опросник постоянно просит тестеров сравнить V4.1 Flash, — это DeepSeek V4 Pro на OrcaRouter.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно