
DeepSeek V4.1 Flash выходит в двухдневную API-бету: новая архитектура, нативная мультимодальность и амбиции уровня Pro
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
DeepSeek V4.1 Flash появился ровно там, где DeepSeek испытывает свои разработки перед анонсом: в живом API, под идентификатором модели, который содержит собственный срок действия. Этот идентификатор — deepseek-v4.1-flash-expires-on-0910 — начал обслуживаться 8 сентября 2026 года, после того как команда DeepSeek опубликовала в своих официальных группах сообщества внутренний тест «промежуточной версии», и завершающее 0910 — это вся история в миниатюре. Это сборка, помещённая в реальную среду API для ограниченного теста, который должен быть отключён примерно 10 сентября, до официального поста о релизе, который, по ожиданиям инсайдеров, заметивших модель, выйдет «очень скоро». Это не запуск. Нет ни карточки модели, ни технического отчёта, ни записи в журнале изменений; более того, этим вечером на публичной странице Models & Pricing компании DeepSeek по‑прежнему значатся только DeepSeek V4 Flash, DeepSeek V4 Pro и DeepSeek-V4-Flash-Vision-Exp.
Everything below should be read with that asterisk in mind. The official channel here is a community-group announcement and an accompanying feedback form, not a release note. What follows is the union of that announcement, the coverage from Chinese media within hours of it, and first-day measurements from developers who pointed their own keys at the endpoint — with the vendor's claims and the community's numbers labelled as what they are.
Что на самом деле произошло сегодня
Примерно в 15:00 по пекинскому времени 8 сентября команда DeepSeek сообщила своим официальным группам сообщества, что промежуточная версия — описанная на китайском как «中间版本», то есть промежуточная контрольная точка — открыта для ограниченного тестирования в реальной среде API перед выпуском финальной версии. Любой, у кого есть ключ API DeepSeek, может вызвать её: сохраните свой существующий базовый URL и ключ и укажите имя модели deepseek-v4.1-flash-expires-on-0910. На этом всё — никакой отдельной конечной точки, никакого листа ожидания и никакой новой консоли.
На практике пределы узки. В суффиксе заложен план: тестовая версия «автоматически истечёт и отключится 10 сентября», оставляя примерно два дня работы. Каждая учётная запись ограничена 20 одновременными запросами — против лимита в 2500 одновременных запросов, который DeepSeek публикует для deepseek-v4-flash, — что является сильным намёком на намерение: это для функционального тестирования и оценки, а не для направления на него продакшн-трафика.
• Что это — контрольная точка «промежуточной версии», размещённая в действующем API для кратковременного тестирования перед официальной сборкой.
• Где запускается — собственный API DeepSeek; базовый URL и ключ без изменений, название модели заменено на deepseek-v4.1-flash-expires-on-0910.
• Как долго — в названии указано expires-on-0910; ожидается, что тест будет отключен примерно 10 сентября.
• Кто может его вызывать — любой аккаунт с ключом DeepSeek, до 20 одновременных запросов на аккаунт.

Что выставляет счёт бета-версия: прайс-лист DeepSeek V4 Flash
DeepSeek сообщил, что тест тарифицируется по тем же ставкам, что и deepseek-v4-flash, и применяется текущий прайс-лист именно этой модели. После пересмотра цен 16 августа 2026 года DeepSeek использует пиковые и внепиковые тарифы; точные значения являются официальными для уровня Flash:
• Ввод, кэш-попадание — $0,007 за 1M токенов вне пикового времени, $0,014 в пиковое время
• Ввод, промах кэша — $0.22 за 1M токенов в непиковое время, $0.44 в пиковое.
• Выход — $0,66 за 1 млн токенов вне пиковых часов, $1,32 в пиковые
• Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC, понедельник–пятница; все остальные часы — непиковые, по половине пиковой ставки

Заметьте, что не изменилось: цена за токен. Поэтому утверждение DeepSeek о том, что V4.1 Flash «обходится дешевле», — это утверждение об эффективности, а не о снижении тарифа. В первый день несколько тестировщиков убедились в этом дорогой ценой: пятиминутная сессия списала с их баланса заметно больше, чем то же реальное время работы в DeepSeek V4 Flash, потому что модель расходует токены гораздо быстрее. Снизится ли реальная стоимость задачи, зависит от того, справится ли модель с работой с меньшим числом токенов и меньшим числом повторных попыток, — а этого по двухдневным тестам скорости никто оценить не может.
Что означает «новая архитектура, нативная мультимодальность» — пока не проверено.
Официальное описание V4.1 Flash от DeepSeek сводится к четырём утверждениям: новая структура модели, нативная мультимодальная поддержка, более высокие возможности и более быстрая генерация. Именно утверждение об архитектуре бросается в глаза, потому что оно ломает устоявшуюся схему. Предыдущее обновление, DeepSeek V4 Flash 0731, было пост-обучающим апдейтом, сохранившим ту же архитектуру и масштаб, что и у превью; формулировки DeepSeek здесь указывают на структурные изменения, и некоторые издания сочли это признаком того, что модель переобучали, а не дообучали. Всё остальное — лишь домыслы. Спекуляции сообщества насчёт изменённых механизмов внимания, экспертных сетей или встроенного зрительного модуля — это именно спекуляции. Не опубликовано ни количества параметров, ни размера контекстного окна, ни таблицы с бенчмарками, ни технического отчёта.
Формулировка «native multimodal» важна по конкретной причине. DeepSeek-V4-Flash-Vision-Exp (выпущена 21 августа, веса открыты с 31 августа) представляет собой текстовую базу DeepSeek V4 Flash с прикрученным к ней визуальным энкодером — в собственных материалах DeepSeek эта связка описывалась как текстовая модель плюс внешний визуальный тракт. V4.1 Flash описывается как мультимодальная с самого основания: ввод изображений и текста обрабатывается самой базовой моделью. В принципе, это реальное архитектурное различие, однако спецификация модальностей не опубликована: тестировщики проверяли только «текст плюс изображения», и читателю следует считать «мультимодальность» подтверждённой лишь в этом смысле, пока не появится карточка модели. Входит ли в планы более широкий набор входных данных — на момент написания этого текста скорее неизвестно, чем подтверждено.
Скорость — это главное, и это коллективное измерение.
Число, которое гуляет по сети в первый день, — примерно {{1}}420 выходных токенов в секунду при генерации длинных текстов{{/1}}, при этом сообщается, что пики превышали {{2}}500 токенов/с на отдельных запусках{{/2}}. Один широко разошедшийся по сети тест сгенерировал более {{3}}71 000 токенов менее чем за три минуты{{/3}}. Все эти цифры неофициальны: это замеры разработчиков на бета-эндпоинте в неконтролируемых условиях, и собственного бенчмарка скорости у {{4}}DeepSeek{{/4}} нет. Для сравнения, {{5}}Artificial Analysis оценивает скорость публичного эндпоинта DeepSeek V4 Flash 0731 примерно в 128 токенов/с, так что ранние отчёты указывают на скачок сырой пропускной способности примерно втрое или больше{{/5}} — с обычной оговоркой, что пропускная способность зависит от длины входа, числа одновременных запросов и состояния серверов.
Сквозные сравнения с DeepSeek-V4-Flash-Vision-Exp выглядят наиболее показательными, поскольку в них одна и та же задача измеряется вплотную друг к другу. Тестировщики сообщили примерно о 6-кратном ускорении сквозного выполнения на задаче генерации SVG-кода, около 5,2× на извлечении из длинного контекста в 49k токенов, примерно 5× на крупной задаче генерации и оптимизации SQL, 4,6× на алгоритмической задаче и 3,9× на задаче асинхронного рефакторинга. Относитесь к этим цифрам как к ориентировочным, а не точным: сквозные показатели для одной и той же задачи включают время обдумывания, задержку до первого токена и скорость генерации, и они получены от отдельных тестировщиков, а не в контролируемом наборе тестов. Интересный сигнал — это устойчивое направление во всех результатах, а не какой-то отдельный множитель.
Вопрос, лежащий в основе бета-версии
Самый стратегически важный момент скрыт в форме обратной связи, которую DeepSeek приложил к тесту. Наряду с вопросами об агентных фреймворках и реальных сценариях, в ней напрямую спрашивают тестировщиков, может ли промежуточная версия DeepSeek V4.1 Flash «полностью заменить онлайновую DeepSeek V4 Pro». Это примечательный вопрос для компании, чтобы задавать его пользователям, потому что DeepSeek V4 Pro стоит на три ценовых уровня выше Flash: по текущим официальным тарифам модель Pro взимает $0,66 за 1 млн входных токенов (при промахе кэша) и $1,98 за 1 млн выходных токенов вне пиковых часов, тогда как DeepSeek V4 Flash — $0,22 и $0,66 соответственно, ровно 3× по каждой позиции. Если модель уровня Flash действительно приближается к возможностям уровня Pro по ценам уровня Flash, то для большой части пользователей ответ на этот вопрос очевиден — и DeepSeek это знает.
В сочетании с формулировкой «новая структура» анкета намекает на то, что V4.1 Flash — это первый видимый шаг чего-то большего, чем точечное обновление: линейка Flash перепозиционируется, чтобы сократить разрыв с флагманской моделью, — так же, как DeepSeek неоднократно использовал более дешёвую и быструю модель, чтобы переопределить ожидания рынка относительно того, что даёт ценовая категория. Ничто из этого не подтверждается бенчмарком; это стратегическое прочтение вопроса из двух предложений. Но это самое интересное, что DeepSeek сказал о V4.1 Flash за весь день.
Где это попробовать, и что пока запускать в продакшене
В окне тестирования единственный способ получить доступ к V4.1 Flash — это собственный API DeepSeek: стороннего хостинга сборки, которая истечёт через два дня, нет, и никто не должен подключать производственный контур к идентификатору модели, которому назначено перестать отвечать. Разумное использование ближайших двух дней — оценка: прогоните свои репрезентативные нагрузки, измерьте качество и реальную экономику токенов и относитесь к любой цифре скорости, которую вы видите, как к неофициальной, пока не появится официальный релиз с карточкой модели.
Для трафика, который должен продолжать работать, публичная линейка DeepSeek не изменилась, и именно здесь маршрутизирующий слой оправдывает своё существование. На OrcaRouter модели DeepSeek V4 Flash, DeepSeek V4 Pro и DeepSeek-V4-Flash-Vision-Exp доступны через один API по прейскурантной цене DeepSeek с нулевой наценкой — поэтому августовское снижение цен действует у нас с того дня, как оно появилось, а не тогда, когда до него дошла маржинальная таблица. Когда официальная V4.1 Flash в конце концов поступит к провайдерам, та же схема станет способом внедрить её с низкой стоимостью перехода: направьте часть трафика на новую модель, оставьте DeepSeek V4 Flash или V4 Pro в качестве автоматического резерва, и пусть язык DSL маршрутизатора решает, какие запросы стоит отправлять на непроверенную модель, а какие должны остаться на рабочей лошадке. Вам не придётся ставить производственный маршрут на двухдневную бету, чтобы выяснить, хороша ли она.

Открытые вопросы
• Когда выйдет официальный релиз? Сигнал, который обратил внимание на эту модель, говорит, что пост о релизе ожидается «очень скоро»; двухдневный срок жизни беты позволяет предположить, что DeepSeek не собирается заставлять мир долго ждать.
• Соответствует ли финальная сборка этой? Независимые тестировщики, отслеживающие циклы тестирования DeepSeek, отмечают, что компания, по-видимому, запускает несколько кандидатных сборок параллельно, и самый быстрый кандидат на раннем этапе тестирования не всегда оказывается тем, который выходит в релиз — поэтому сегодняшние показатели скорости могут не описывать GA-модель.
• Каковы технические характеристики? Количество параметров, детали архитектуры, длина контекста и полный список входных модальностей не опубликованы — а именно это в первую очередь необходимо настоящему обзору.
• Сохраняется ли цена, и выдерживает ли «более низкая стоимость» контакт с реальными рабочими нагрузками? Бета-версия выставляет счета по тарифам DeepSeek V4 Flash; запуск может принести новый прайс-лист, а стоимость в расчете на задачу не измерена.
• Действительно ли он потянет работу уровня Pro? Опросник задаёт этот вопрос, но ответить на него могут лишь независимые оценки на агентных бенчмарках и бенчмарках на рассуждение — тех самых, что сегодня отделяют уровень Flash от уровня Pro.
Если у вас есть ключ DeepSeek, суть в двухдневном отсчёте: вызывайте deepseek-v4.1-flash-expires-on-0910, пока он не исчез, запускайте собственные задачи и фиксируйте результаты под ярлыком «измерено сообществом, условия варьируются». Всем остальным стоит следить за релизным постом и вопросом, стоящим за ним: не начала ли самая дешёвая линейка DeepSeek нацеливаться на самую дорогую.
Пока двухдневная бета-версия налаживается, стабильная модель Flash, которую можно запустить уже сегодня, находится всего в одном API-вызове: DeepSeek V4 Flash на OrcaRouter — по прайс-листу DeepSeek, с наценкой 0%.
И флагман, с которым бета-опросник постоянно просит тестеров сравнить V4.1 Flash, — это DeepSeek V4 Pro на OrcaRouter.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
