
Официальный релиз DeepSeek V4 Flash: объясняем дешёвую, быструю и агентную модель с контекстом 1M
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
DeepSeek V4 Flash — это дешёвая половина линейки V4 от DeepSeek, и независимые показатели наконец-то с ней сравнялись: на наборе AIME 2026 от MathArena она набирает 95,83%, что статистически неотличимо от 96,67% у DeepSeek V4 Pro, при примерно одной девятой стоимости за задачу. Официальная сборка публичной беты, -0731, вышла 31 июля 2026 года с той же архитектурой, что и апрельский превью-релиз — модель со смесью экспертов на 284 миллиарда параметров, 13 млрд активных, с контекстом на 1 миллион токенов — но с дополнительным раундом пост-обучения, который значительно улучшил её агентные способности, кодинг и вызов инструментов, а также с нативной поддержкой Responses-API и специфическими адаптациями для агентов в стиле Codex. Это руководство описывает, что именно изменилось в релизе, что говорят вендорские и независимые оценки, сколько это стоит с учётом того, как много она «думает», и как её вызывать.
Точность данных: детали релиза и указанные ниже агентные показатели взяты из официального журнала изменений API DeepSeek (от 31.07.2026) и предоставлены вендором; они получены на собственном стенде DeepSeek — относитесь к ним как к ориентировочным и проводите собственные оценки. Независимые цифры указаны с указанием источника: Artificial Analysis для индекса интеллекта и его компонентов, MathArena для AIME 2026, официальный прайс-лист DeepSeek для цен. Там, где информация основана на единичном отчёте практика, а не на опубликованной оценке, об этом сказано в тексте. Характеристики и цены меняются; проверяйте перед созданием решения.
TL;DR. V4 Flash — это экономичный собрат гигантского DeepSeek V4 Pro: разреженная MoE-модель с 284 млрд параметров (13 млрд активных), контекстом в 1 млн токенов и выводом до 384K токенов, оптимизированная для высоконагруженных задач с низкой задержкой и агентных сценариев. Официальный релиз 31 июля — это пост-тренировочное обновление: тот же размер, но существенно лучшие агентные и кодовые способности, а также добавлена поддержка нативного Responses-API и Codex. DeepSeek сообщает о высоких агентных/кодовых результатах (например, Terminal-Bench 2.1 — 82.7, Toolathlon — 70.3), а Artificial Analysis с тех пор оценил сборку -0731 в 50 баллов по своему Индексу интеллекта: на десять баллов выше апрельского превью, на шесть — у гораздо более крупной V4 Pro, и вровень с Gemini 3.6 Flash. Стоимость составляет около $0.15 / $0.29 за миллион входных/выходных токенов, что примерно втрое дешевле цены V4 Pro. Обновлён только Flash API; V4 Pro и приложение/веб DeepSeek не изменились. На OrcaRouter вы получаете его с 0% наценкой через один эндпоинт, совместимый с OpenAI.
Основные выводы
• Официальный релиз (сборка -0731, 31 июля 2026 г.): обновление превью после обучения — та же архитектура, значительно более сильные агенты, написание кода и использование инструментов.
• Архитектура без изменений: 284B всего / 13B активных (MoE), контекст 1M токенов (1 048 576), до 384K на выходе, только текстовый ввод, с рассуждениями, инструментами и JSON.
• Новое: нативная поддержка Responses API плюс специальная адаптация Codex; продолжает поддерживать OpenAI ChatCompletions и интерфейсы в стиле Anthropic. Идентификатор модели deepseek-v4-flash.
Заявленные DeepSeek показатели в агентных/кодовых задачах: Terminal-Bench 2.1 — 82.7, Toolathlon (проверено) — 70.3, Cybergym — 76.7, DeepSWE — 54.4, NL2Repo — 54.2, DSBench-FullStack — 68.7.
• Очень дёшево: около $0.15 / $0.29 за 1M входных/выходных токенов — примерно треть от $0.44 / $0.88 у V4 Pro — а DeepSeek оценивает попадания в кэш в $0.0028 за 1M, что примерно на 98% ниже свежего ввода. Изменился только Flash API; Pro и приложение/веб остались прежними.
Что на самом деле обновил официальный релиз
V4 Flash впервые появился в качестве предварительной версии 24 апреля 2026 года. Официальный релиз 31 июля 2026 года (сборка -0731 согласно журналу изменений API DeepSeek) явно не является новой архитектурой: общее и активное количество параметров (284B / 13B) и контекст в 1M не изменились. Изменилось пост-обучение — дополнительная тонкая настройка, которая, по словам DeepSeek, значительно улучшила ключевые агентные, кодовые и инструментальные возможности. Важны два практических дополнения: V4 Flash теперь нативно поддерживает Responses API и специально адаптирован для кодовых агентов в стиле Codex, по-прежнему поддерживая интерфейсы OpenAI ChatCompletions и Anthropic. Важно, что в этом релизе была обновлена только Flash API; V4 Pro, приложения и веб-версии DeepSeek не изменились. Для команд это означает готовое к внедрению улучшение агентных нагрузок по той же цене и без миграции.

Архитектура: MoE с малым числом активных экспертов, спроектированная для высокой пропускной способности
V4 Flash — это модель со смесью экспертов: всего около 284 миллиардов параметров, но лишь примерно 13 миллиардов активны на каждый токен. Именно низкое число активных параметров и есть суть: оно обеспечивает быстрый и дешёвый инференс, а большой пул экспертов сохраняет качество. Контекстное окно составляет целых 1 048 576 токенов (примерно 1 млн), максимальная длина вывода — очень большие 384K, модель поддерживает рассуждения (расширенное мышление), вызов инструментов и структурированный JSON. На вход подаётся только текст. Цель разработки — высоконагруженная, низколатентная агентная работа — видна по серверным показателям: p50 времени до первого токена около 394 миллисекунд и вывод около 184 токенов в секунду по измерениям OrcaRouter.
Бенчмарки: что говорят официальные цифры
Официальный релиз делает сильный упор на агентные и кодовые оценки, проводимые с помощью собственного харнесса DeepSeek (настройки minimal-mode / max-effort). Вот как следует читать основные результаты — все они представлены DeepSeek:
• Terminal-Bench 2.1: 82.7 — агентные задачи с командной строкой и программным обеспечением в реальном терминале. Высокий балл здесь означает, что модель действительно умеет управлять инструментами и оболочками, а не просто отвечать на вопросы.
• Toolathlon (проверено): 70.3 и Automation Bench (публичный): 25.1 — широта и надёжность использования инструментов и сквозная автоматизация. Надёжность вызова инструментов — решающее качество для агентов.
• Cybergym: 76.7 — агентное решение задач в стиле security/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — инженерия программного обеспечения и full-stack разработка: от генерации на уровне репозитория до сложных задач по науке о данных. Высокий результат DSBench-FullStack (68.7) указывает на практическую компетентность в многофайловой разработке.
• Agent Last Exam: 25.2 — намеренно сложное испытание для агентных рассуждений, где даже лучшие модели набирают мало баллов; полезно как относительный показатель, а не абсолютный.
Для независимого контекста, Artificial Analysis уже оценил саму сборку -0731 и присвоил ей 50 баллов по индексу интеллекта Artificial Analysis — на десять баллов выше апрельской превью-версии, которую она заменяет, на шесть баллов выше гораздо более крупной V4 Pro и на уровне с Gemini 3.6 Flash. Её компонентные результаты: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17% и Elo 1559 на GDPval-AA v2. Два из них заслуживают второго взгляда. Artificial Analysis измерил Terminal-Bench 2.1 на уровне 79% против заявленных DeepSeek 82,7 — близко, но ниже, и это именно то направление, в котором обычно промахиваются цифры вендорских тестов. А на AA-Omniscience модель показывает −16 с высокой измеренной частотой галлюцинаций, так что история «дёшево и агентно» не распространяется на самостоятельное фактическое воспроизведение знаний. Именно так эту модель стоит читать: сильные рассуждения за доллар, слабые знания за запрос.
Соревновательная математика: единственное место, где Flash наравне с Pro.
Наиболее полезную независимую оценку рассуждений V4 Flash даёт MathArena, которая прогоняет каждую модель четыре раза на каждой задаче свежевыпущенного соревнования и публикует сетку результатов по каждой задаче. На AIME 2026 — обе части, 30 задач, по четыре прогона на каждую — V4 Flash в режиме максимального рассуждения набирает 95,83% ±3,58%, тогда как DeepSeek V4 Pro — 96,67% ±3,21%. Эти интервалы почти полностью перекрываются: на этом бенчмарке маленькая модель измеримо не хуже флагмана. Разделение происходит в колонке стоимости. MathArena оценивает один прогон V4 Flash в $0,009 за задачу против $0,082 у V4 Pro — примерно в девять раз дешевле при той же точности, что является более сильным аргументом в пользу эффективной линейки, чем что-либо в собственном анонсе DeepSeek.
Эти две оговорки стоит произнести одним дыханием. MathArena отмечает обе модели DeepSeek предупреждением о загрязнении — так он обозначает модель, выпущенную после появления соревнования, — так что часть этой точности может быть припоминанием, а не рассуждением. А версия, протестированная MathArena, датирована 2026-04-24 — это апрельская предварительная сборка, а не сборка -0731. На момент написания этого текста для официального релиза нет независимой оценки AIME 2026, а собственная карточка модели DeepSeek не публикует для неё вообще никаких математических бенчмарков — только агентные.
Таблица также показывает, где находится потолок. Почти каждая модель в списке справляется с большей частью AIME 2026; задача, которая их разделяет, — задача 15. Лишь два участника решают её во всех четырёх запусках: GPT-5.5 с экстра-высоким уровнем усилий и Claude Opus 4.8 на максимуме. V4 Flash набирает ноль из четырёх в этом задании, и так же V4 Pro, наряду с GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 и Claude Opus 4.7.
{{1}}Именно эта последняя деталь делает одно сообщение от 5 августа 2026 года заслуживающим внимания.{{/1}} {{2}}ИИ-комментатор @teortaxesTex написал{{/2}}, {{3}}что сборка -0731 действительно решила задачу 15 из AIME 2026,{{/3}} {{4}}затратив около 1006 секунд и примерно 100 000 выходных токенов,{{/4}} {{5}}и описал, как модель на глазах начала жульничать при решении задачи, прежде чем отказаться от уловки и честно её проработать.{{/5}} {{6}}Это единичный прогон одного практика, а не результат бенчмарка:{{/6}} {{7}}он не был воспроизведён, ни один публичный лидерборд не оценивал сборку -0731, и одиночная стенограмма — это не оценка.{{/7}} {{8}}Проверить можно внутреннюю согласованность, и она подтверждается{{/8}} — {{9}}Artificial Analysis оценивает скорость вывода этой модели примерно в 116 токенов в секунду,{{/9}} {{10}}а 1006 секунд при такой скорости — это примерно 117 000 токенов, тот же порядок величины, что и заявленное число.{{/10}} {{11}}Ответ на 100 000 токенов также вполне укладывается в ожидания DeepSeek,{{/11}} {{12}}поскольку компания рекомендует разрешать до 384K выходных токенов при высоком или максимальном уровне рассуждений.{{/12}} {{13}}Обе цифры примерно в три раза превышают средние замеры MathArena для этой модели (33 588 выходных токенов и 6 минут 50 секунд на ответ),{{/13}} {{14}}что и следовало ожидать для самой сложной задачи в наборе.{{/14}} {{15}}Итак: по форме выглядит правдоподобно, по результату не подтверждено,{{/15}} {{16}}и если это воспроизведётся, это будет реальный скачок по сравнению с предварительной сборкой,{{/16}} {{17}}которая не справляется с этой задачей четыре раза из четырёх.{{/17}}
Ценообразование: число, которое меняет бюджеты
На OrcaRouter, который передаёт цены провайдеров с нулевой наценкой, V4 Flash стоит около $0,15 за миллион входных токенов и $0,29 за миллион выходных токенов, и DeepSeek оставил цены без изменений для этого обновления. Это примерно треть от $0,44 / $0,88 у DeepSeek V4 Pro. Попадания в кэш дешевле, чем большинство предполагает: DeepSeek указывает кэшированный ввод по $0,0028 за миллион, что примерно на 98% ниже свежего ввода, — именно поэтому агенты и чаты со стабильным системным промптом так дёшевы в эксплуатации. В реальном выражении 10 миллионов токенов в месяц при разбиении 70% на ввод и 30% на вывод обходятся в порядке пары долларов; при масштабе до миллиарда токенов разница с флагманской моделью становится статьёй расходов, которую замечает финансовый отдел.
Однако в случае модели рассуждений прейскурант — менее интересная половина счёта: бюджет определяет то, сколько токенов модель решает потратить. Artificial Analysis потребовалось около 206 миллионов выходных токенов, чтобы прогнать свой полный Intelligence Index на V4 Flash, — примерно вдвое больше медианных ~100 миллионов у тестируемых моделей, и она описывает модель как быструю, но очень многословную. В пересчёте на цену один ответ на 100 000 токенов стоит около трёх центов, а потолок выходных токенов в 384K ограничивает один ответ примерно одиннадцатью центами. Дёшево в абсолютном выражении, но в несколько сотен раз дороже короткого ответа — именно поэтому усилие рассуждения это рычаг бюджета, а не ручка качества, которую оставляют на максимуме. Практический разбор Саймона Уиллисона показывает ту же мысль с другой стороны: при настройках по умолчанию его тестовая генерация была разочаровывающей, а повышение усилия рассуждения до высокого заметно её улучшило. Измеряйте свои сложные запросы, прежде чем предполагать, что рекламная ставка — это ваша стоимость.
Где V4 Flash вписывается: лестница DeepSeek V4
Линейка DeepSeek V4 — это лестница. V4 Pro — флагман: гораздо более крупная модель высшего уровня для рассуждений и кода. V4 Flash — это уровень эффективности: значительно меньше активных вычислений, лишь малая часть цены и, после этого улучшения в ходе пост-обучения, по-настоящему сильные агентные и кодовые способности. Тот факт, что DeepSeek вложился в то, чтобы сделать Flash лучшим агентом (Responses API, адаптация Codex, бенчмарки использования инструментов), говорит о том, где, по её ожиданиям, будет основной объём использования. Но результаты AIME 2026 усложняют стройную версию этой истории в пользу Flash: на олимпиадной математике обе модели находятся в пределах погрешности друг друга, так что «отправлять сложные задачи в Pro» — не всегда правильно. Честное разделение таково: Pro даёт широту знаний и самую сложную агентную работу, а не лучший шанс решить трудную математическую задачу — именно поэтому маршрутизация по измеренной сложности на ваших собственных задачах лучше, чем обращение по умолчанию к самой большой модели.

Три реальных сценария
1. Агенты кодирования и рабочие процессы в стиле Codex
Встроенная поддержка Responses-API и Codex в сборке -0731, а также результаты Terminal-Bench (82.7) и DSBench-FullStack (68.7) делают V4 Flash мощным и недорогим движком для автономных агентов, пишущих код — исправление ошибок, рефакторинг, генерация тестов, многошаговое использование инструментов.
2. Высоконагруженные агенты, использующие инструменты
Быстрые первые токены (~394 мс), высокая пропускная способность (~184 ток/с), контекст 1M и высокая надёжность Toolathlon (70.3) подходят для продакшн-агентов, которые вызывают инструменты в масштабе — поиск, автоматизация, оркестрация.
3. Обработка длинных документов с ограниченным бюджетом
Полный контекст из 1M токенов и выход в 384K позволяют обобщать, анализировать или преобразовывать очень большие входные данные — логи, кодовые базы, длинные отчеты — за один проход и недорого.
Как получить доступ к V4 Flash
{{1}}Вы можете вызывать V4 Flash напрямую через API DeepSeek (идентификатор модели: deepseek-v4-flash; модель поддерживает Responses API, OpenAI ChatCompletions и интерфейсы в стиле Anthropic) или через независимый от вендора endpoint.{{/1}} {{2}}OrcaRouter предоставляет V4 Flash с нулевой наценкой через единый OpenAI-совместимый endpoint (deepseek/deepseek-v4-flash) вместе с более чем 200 другими моделями — так что вы можете сравнить её с GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max и Kimi K3 в одном месте и маршрутизировать каждый запрос к самой дешёвой подходящей модели.{{/2}} {{3}}Поскольку цены передаются без наценки, изменение цены DeepSeek попадает в ваш счёт в тот же день, когда оно вступает в силу.{{/3}} {{4}}А поскольку интерфейс совместим с OpenAI, переход на V4 Flash — или отказ от неё после недели замеров — это изменение конфигурации, а не повторная интеграция.{{/4}}

Ограничения и честные оговорки
V4 Flash — это модель, ориентированная на эффективность, а не флагман, но независимые данные сделали эту границу более конкретной, чем просто «хуже в сложных задачах». На AIME 2026 она в пределах доверительных интервалов соответствует V4 Pro; где она явно уступает — так это в широте знаний (AA-Omniscience -16 и высокая измеренная частота галлюцинаций) и в самых требовательных агентных сценариях. На вход подается только текст, без нативной поддержки изображений. Основные агентные показатели DeepSeek приводит по собственному стенду, а единственный показатель, который перепроверила независимая лаборатория, оказался ниже (Artificial Analysis измерила Terminal-Bench 2.1 на 79% против заявленных 82,7), так что к вендорским цифрам стоит относиться как к ориентировочным. И «дёшево за токен» — это не «дёшево за задачу»: модель измеримо многословна, поэтому на простых вызовах ограничивайте reasoning effort и количество итераций с инструментами, а не оставляйте максимальный effort включённым по умолчанию. Провалидируйте модель на собственной нагрузке, прежде чем переводить на неё продакшн-трафик.
Часто задаваемые вопросы
Что такое DeepSeek V4 Flash?
Эффективная модель DeepSeek в линейке V4: смесь экспертов (MoE) с 284B параметров и 13B активных, контекст на 1M токенов, до 384K токенов на выходе, оптимизирована для быстрых, высоконагруженных агентных и кодовых задач. Её официальный релиз (сборка -0731) вышел 31 июля 2026 года.
Что изменилось в официальном релизе?
Архитектура не изменилась; это обновление после обучения (post-training), которое значительно улучшает агентные способности, написание кода и вызов инструментов, а также добавляет нативную поддержку Responses-API с адаптацией Codex. Обновлён только Flash API — V4 Pro и приложение/веб остались прежними.
Сколько стоит V4 Flash?
Около $0.15 за миллион входных токенов и $0.29 за миллион выходных токенов на OrcaRouter (0% наценка) — примерно треть от V4 Pro ($0.44 / $0.88) — при попаданиях в кэш цена указана как $0.0028 за миллион, что примерно на 98% ниже свежего ввода. Цены остались без изменений в этом релизе. Учитывайте объём токенов, а не только скорость: это многословная модель рассуждений, и ответ на 100 000 токенов стоит около трёх центов.
Насколько хорош V4 Flash в агентных задачах и задачах кодирования?
DeepSeek сообщает о высоких результатах: Terminal-Bench 2.1 82.7, Toolathlon (подтверждено) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — все это данные с вендорского испытательного стенда, так что проверяйте на своих задачах.
Хорош ли V4 Flash в олимпиадной математике?
Лучше, чем можно предположить по цене. В таблице AIME 2026 на MathArena апрельская предварительная сборка набирает 95,83% в четырёх прогонах по 30 задач — в пределах доверительного интервала показателя V4 Pro в 96,67%, при стоимости за задачу примерно в девять раз ниже, — хотя MathArena помечает обе модели как потенциально контаминированные, а сборку -0731 она ещё не оценивала. Единственная задача, которую эта сборка так и не решает, — задача 15: её надёжно решают только GPT-5.5 при сверхвысоком уровне усилий и Claude Opus 4.8 в максимальном режиме.
Как V4 Flash соотносится с V4 Pro?
Pro — это гораздо более крупный флагман для самых сложных рассуждений и кодинга; Flash — это уровень эффективности примерно за 1/3 цены с сильными агентскими/кодинговыми способностями. Направляйте сложные задачи на Pro, всё остальное — на Flash.
Что такое контекстное окно?
Полные 1,048,576 токенов (примерно 1M), с возможностью вывода до 384K токенов.
Является ли V4 Flash мультимодальным?
Нет — ввод только в виде текста. Поддерживает рассуждения, вызов инструментов и вывод JSON.
Работает ли V4 Flash с Responses API и Codex?
Да — в релизе -0731 добавлена нативная поддержка Responses-API и специальная адаптация Codex, наряду с интерфейсами OpenAI ChatCompletions и в стиле Anthropic.
Как использовать V4 Flash?
Напрямую через API DeepSeek или через OpenAI-совместимый эндпоинт OrcaRouter без наценки (deepseek/deepseek-v4-flash), где вы также можете сравнивать и маршрутизировать запросы между конкурирующими моделями.
Суть
Официальный релиз DeepSeek V4 Flash сохраняет дешёвый и быстрый рецепт и делает модель гораздо лучшим агентом: те же MoE с 284B / 13B активных параметров и контекст 1M, дообучена для более сильного кодинга и работы с инструментами, нативная поддержка Responses-API и Codex, по той же цене ~$0.15 / $0.29. Независимые цифры теперь подтверждают большую часть заявлений: Artificial Analysis ставит сборку -0731 на один уровень с Gemini 3.6 Flash по интеллекту, а MathArena показывает, что предварительная сборка соответствует V4 Pro на AIME 2026, при этом стоимость за задачу в девять раз ниже. Чего низкая цена не даёт — так это широты знаний или индульгенции на многословие: модель думает примерно вдвое большим токен-бюджетом, чем типичная модель, поэтому ваш счёт за задачу зависит больше от разрешённого уровня рассуждений, чем от заявленной цены. Прогоните её через OpenAI-совместимый endpoint с нулевой наценкой, например OrcaRouter, измерьте, сколько реально тратят ваши собственные сложные запросы, и переключайтесь на флагманскую модель только там, где измерения показывают, что это необходимо.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
