
DeepSeek V4.1 Flash: совершенно новая базовая модель под номером точечного релиза
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Интеллект49Кодинг
DeepSeek V4.1 Flash вышел 10 сентября 2026 года: открытые веса по лицензии MIT, контекст в миллион токенов, совершенно новая архитектура Causal Encoder-Decoder и основа смеси экспертов с 552 миллиардами параметров, которую сама DeepSeek в своей карточке модели относит к тому, что компания называет «новым семейством архитектур». Если трекер, обративший внимание на название, прав, это также первый случай, когда DeepSeek присвоила номер версии .1 совершенно новой базовой модели — обычно такой ярлык означает доработку, а не перестройку. DeepSeek V4.1 Pro, флагманская модель, на которую теперь намекает этот номер, до сих пор не существует.
Это расхождение важнее, чем просто придирка к названию. Любой, кто сравнивает поколения DeepSeek по номерам версий, воспримет переход «от V4 Flash к V4.1 Flash» как патч и соответствующим образом распределит внимание. Лежащая в основе архитектура говорит об обратном, а решение самой компании отказаться от флагманской модели с 1,6 триллиона параметров в пользу модели Flash говорит об обратном ещё громче.

Что на самом деле вышло 10 сентября
Это не утечка и не бета. Двухдневный API-тест, начавшийся 8 сентября под идентификатором модели deepseek-v4.1-flash-expires-on-0910 закончился так, как и было указано в его суффиксе, а настоящий релиз сегодня вышел в веб-приложении, мобильном приложении и собственном API DeepSeek, с весами и техническим отчётом, опубликованными на Hugging Face под deepseek-ai/DeepSeek-V4.1-Flash.
Практические детали важнее церемонии:
• Имя модели — deepseek-flash. Прежние названия deepseek-v4-flash и deepseek-v4-flash-vision-exp по-прежнему принимаются, но они больше не ведут к тем же моделям, что раньше: обе сняты с эксплуатации, а запросы с этими именами обслуживаются моделью DeepSeek V4.1 Flash и тарифицируются по тарифу Flash.
• Что в коробке — 552B параметров базовой модели, окно контекста на 1M токенов, максимальный вывод 384K, вывод JSON, вызов функций и режим мышления, включённый по умолчанию, с уровнями усилия: низкий, высокий и максимальный.
• Лицензия — MIT, веса включены, с папкой для инференса и отдельным модулем кодирования в репозитории. DeepSeek явно приглашает сообщество открытого кода создать поддержку инференса, что является стандартным сигналом того, что запуск с первого дня в основных рантаймах — это вопрос дней, а не недель.
Тот .1, который не является точечным релизом
Утверждение, с которого началась эта статья, появилось у teortaxesTex — псевдонимного, но внимательно следящего за DeepSeek наблюдателя — в посте от 10 сентября: что это «первый случай, когда DeepSeek присваивает совершенно новой базовой модели версию с суффиксом .1», что V4.1 «отличается от V4 сильнее, чем, скажем, LLaMA 3 от LLaMA 1», и что в DeepSeek «не считают, что это тянет на V5» — при том, что автор поста не может объяснить, почему именно нет.
Рассматривайте причинную часть как умозаключение, а структурную — как проверяемый факт. Умозаключение — почему DeepSeek выбрал .1 вместо V5 — это лишь чьё-то личное прочтение, не более; никто за пределами компании не объяснял это решение, и в собственных материалах DeepSeek оно никогда не обсуждается. Проверяемая часть — это архитектура, и она не похожа на точечный релиз. В журнале изменений DeepSeek V4.1 Flash описан как «самая маленькая модель в нашем новом семействе архитектур» — странная фраза для описания обновления версии: обновление версии расширяет семейство, а не основывает его.
Есть реальная цена за эту двусмысленность, и она ложится на покупателей, а не на DeepSeek. Номера версий — это самый дешёвый сигнал для разработчика: «это новое поколение или перенастройка, и какой части моего бюджета на оценку она заслуживает?» DeepSeek теперь сделал этот сигнал ненадёжным в одном направлении — модель, которая основывает семейство архитектур, находится на расстоянии одного десятичного знака от модели, изменившей свой рецепт пост-обучения. Компания оставляет свой маркер V5 в резерве. Все, кто проводит оценку миграции, платят за эту путаницу.
Что означает «новая архитектура» в весах
Карточка модели необычно конкретна, что позволяет легко проверить заявление о поколении без единого бенчмарка. Выделяются четыре момента.

• Асимметричная активация — разделение на каузальный кодер-декодер представляет собой трансформер из 40 слоёв, организованный как 20-слойный каузальный кодер, за которым следует 20-слойный декодер, при этом глобальный KV-кэш декодера проецируется из финальных скрытых состояний кодера, а не выводится из собственных слоёв декодера. Смысл такой конструкции в том, что модель активирует только 8B параметров на токен во время префилла и 16B во время декодирования. Задачи агента с высокой долей входных данных — длинные документы, длинные трассировки инструментов — получают дешёвую половину модели; генерация получает дорогую половину.
• Сжатие KV-кэша, измеряемое на токен — DeepSeek-V4.1-Flash использует основное KV-кэширование FP4 объёмом 890 байт на токен, что, по данным карточки, составляет примерно четверть от DeepSeek V4 Flash. Китайские обзоры пошли дальше и представили сжатие по сравнению с моделью V4 первого поколения как сокращение в 437 раз; эта большая цифра является расчётом от поставщика на другой базе, поэтому к ней следует относиться как к заявлению, а не как к измерению.
• SWA Bounded Replay — скользящее оконное внимание обычно вынуждает сохранять KV-состояние на SSD для восстановления контекста. Этот метод восстанавливает недостающие SWA KV-состояния, повторно обрабатывая только самое последнее окно токенов, сокращая постоянный объём KV примерно до одной восьмой от показателя DeepSeek V4 Flash.
• Compressed Sparse Attention 2 — каждый слой внимания работает в одном из трех статических режимов (Full, Reindex или Reuse), разделяя состояние KV и индексатора между слоями, при этом иерархический разреженный индексатор ограничивает стоимость более глубоких слоев независимо от длины контекста.
Прочитайте эти четыре вместе, и стратегическая картина становится ясной: это в первую очередь архитектура, ориентированная на разреженность и эффективность кэша, спроектированная так, чтобы ту же структуру можно было масштабировать позже. Упоминание «нового семейства архитектур» несёт реальный смысл — это заявление о том, что впереди будет больше.
Бенчмарки: заявленные производителем и пока не опровергнутые.
DeepSeek опубликовала набор бенчмарков вместе с релизом. По собственным оценкам компании, V4.1 Flash показывает GPQA Diamond 90.9, рейтинг Codeforces 3471, MathArena Apex 65.6, Terminal-Bench 2.1 — 90.6, DeepSWE v1.1 — 74.2 и 63.9 на HLE с инструментами — последний показатель сопровождается сноской, ограничивающей базовое значение 36.8 только чисто текстовым подмножеством этого бенчмарка.
Эти цифры стоит называть своими именами. Они предоставлены вендором, опубликованы без сопутствующей независимой оценки, и именно ими DeepSeek обосновал вывод на пенсию собственного флагмана — а значит, именно их стоит проверять в первую очередь. По состоянию на запуск 10 сентября Artificial Analysis еще не публиковал замеров DeepSeek V4.1 Flash, а собственная страница модели на Hugging Face по-прежнему содержала примечание, что модель «не развернута ни одним инференс-провайдером». Ключевое утверждение этого релиза — что модель Flash-уровня всесторонне превосходит флагман с 1,6 трлн параметров по производительности, стоимости, скорости и общему времени обработки — на данный момент является лишь заявлением вендора без внешнего аудита.
Есть и честная оговорка с другой стороны. Тот же отчёт вендора показывает, что V4.1 Flash выигрывает 13 из 16 сравнений против Kimi K3 и 11 из 13 против GLM-5.3, при этом всё ещё уступая GPT-5.6 Sol и Claude Opus 5 на более новых задачах Terminal-Bench 3.0 и 4.0, а также в ProgramBench. Это связная картина — сильнее всего в программировании, работе с терминалом и автоматизации агентов, под которые оптимизирована эта архитектура, слабее в задачах на передовые рассуждения — и именно так выглядел бы настоящий шаг между поколениями.
Цена и коммутатор маршрутизации, которые стоит внести в календарь.
С запуском вступили в силу новые цены, и это та же тарифная сетка Flash, что и раньше, а не снижение: на deepseek-flash ввод с попаданием в кэш стоит $0,003 за миллион токенов вне пиковых часов и $0,006 в пиковые, ввод без попадания в кэш — $0,15 и $0,30, а вывод — $0,60 и $1,20. Пиковые часы ровно вдвое дороже непиковых и действуют с 01:00 до 04:00 и с 06:00 до 10:00 UTC по будням.
Сокращение приходится на трафик Pro вместо этого. DeepSeek V4 Pro стоит $0,022 и $0,044 за ввод с попаданием в кэш, $0,66 и $1,32 за ввод без попадания в кэш и $1,98 и $3,96 за вывод — так что направление запросов с именем Pro на V4.1 Flash снижает стоимость их вывода примерно на 70%, а по заявлению DeepSeek — повышает возможности, которые на них отвечают.

Это перенаправление запланировано, а не гипотетическое. После 12:00 по пекинскому времени 14 сентября 2026 года запросы, указывающие deepseek-v4-pro, будут направляться на V4.1 Flash и тарифицироваться по ценам Flash, а также останутся там, пока не выйдет DeepSeek V4.1 Pro. Если ваша интеграция жёстко прописывает имя модели Pro, ничего не сломается — вы получите другую модель примерно за треть цены вывода, без изменения кода и без уведомления, кроме записи в журнале изменений. Если вы маршрутизируете по уровню возможностей, а не по имени модели, 14 сентября — дата для повторного тестирования.
Что это значит, если вы позвоните в DeepSeek сегодня
OrcaRouter пока не поддерживает DeepSeek V4.1 Flash — на сегодняшний день страница модели deepseek-v4.1-flash возвращает «model not found», и мы предпочитаем заявить об этом прямо, чем намекать на обратное. Отсюда следуют два момента. Во-первых, перенаправление, анонсированное DeepSeek, — это поведение на стороне API самого DeepSeek, поэтому переключение 14 сентября происходит на собственном эндпоинте DeepSeek, независимо от того, как вы к нему обращаетесь. Во-вторых, если вы хотите получить новую архитектуру уже сегодня, вы обращаетесь к вендору напрямую.
Что мы делаем — это маршрутизируем остальную линейку DeepSeek через один ключ: DeepSeek V4 Flash и DeepSeek V4 Pro, наряду с более чем 200 другими моделями. Цены там — это цена из прайс-листа провайдера DeepSeek, передаваемая с нулевой наценкой, что важно для такого релиза, как этот: когда вендор снижает тариф, снижение вступает в силу на нашей стороне в тот же день, а не после цикла пересмотра цен. И когда V4.1 Flash действительно появится в каталоге, вышеупомянутая половинная ставка для непиковых часов — это и есть тариф, а не скидка, которую мы согласовываем.
Аргумент о маршрутизации для такой новой модели на самом деле не о цене. Он о том, какую часть вашего производственного пути вы ставите на архитектуру первой недели без независимого бенчмарка и без стороннего обслуживания. Держать новую модель за уровнем, который вы можете переключить — или тестировать её на ключе, не являющемся вашим производственным ключом, — это разница между оценкой и инцидентом.
Что бы решило вопрос о названии?
Три вещи, в порядке возрастания того, насколько много они рассказали бы вам.
Независимая оценка DeepSeek V4.1 Flash проверила бы заявление об архитектуре на чужом испытательном стенде. Это единственное измерение, которое превращает таблицу вендора в факт, и это наиболее вероятная следующая новость.
DeepSeek V4.1 Pro проверит на прочность заявление о семействе. В уведомлении о маршрутизации оно названо конечной точкой окна Pro-to-Flash, что делает его моделью, вокруг которой построен весь этот релиз, — и при этом именно о нём DeepSeek сообщил меньше всего: ни карточки, ни количества параметров, ни даты, ни весов, ни цены.
И полезный, хоть и негламурный, вопрос: повторит ли DeepSeek это снова. Второй ярлык .1 на ещё одной новой базовой модели превратил бы аномалию в норму, а норма — это то, что разработчик может заложить в свои планы. Одна модель — это курьёз. Обманчивость именования становится полезной, только когда появляется закономерность.
{{1}}Пока что практический вывод четко разделяется в зависимости от того, кто вы есть. Если вы используете DeepSeek V4 Pro, отметьте 14 сентября в календаре и повторно запустите свои оценки до этой даты, потому что модель, стоящая за этим названием, меняется независимо от того, просите вы об этом или нет. Если вы используете DeepSeek V4 Flash, вас уже переводят по той же цене на архитектуру, которую DeepSeek создал для масштабирования. А если вы ждали V5, честный ответ таков: похоже, DeepSeek выпустил поколение, но отказался его называть — а это то, что можно сделать лишь один раз, прежде чем люди перестанут доверять номеру.{{/1}}
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
