
Официальный релиз DeepSeek V4 Flash: объясняем дешёвую, быструю и агентную модель с контекстом 1M
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 224 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleНОВИНКАGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleНОВИНКАGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
- anthropicAnthropic: Claude Fable 52026-06-0960Интеллект77Кодинг
- qwenQwen: Qwen3.7 Plus2026-06-0139Интеллект56Кодинг59Математика
Эффективная модель DeepSeek, V4 Flash, перешла из предварительной версии в официальный публичный бета-релиз — сборка code>-0731/code> вышла 31 июля 2026 года. Архитектура не изменилась (это по-прежнему модель на основе смеси экспертов с 284 миллиардами параметров и контекстом в 1 миллион токенов), но дополнительный этап пост-обучения значительно улучшил её агентные способности, навыки программирования и вызова инструментов, и теперь она нативно поддерживает Responses API со специальными адаптациями для агентов в стиле Codex. В этом руководстве объясняется, что такое V4 Flash, что именно улучшил официальный релиз, как интерпретировать её бенчмарки (по данным DeepSeek), сколько она стоит и как её использовать — каждая цифра с указанием источника.
Примечание о точности: детали релиза и результаты бенчмарков ниже взяты из официального журнала изменений API DeepSeek (от 2026-07-31); архитектура, контекст и цены перепроверены по странице модели OrcaRouter; композитные показатели Artificial Analysis независимы. Бенчмарки, представленные DeepSeek, используют собственные настройки тестовой среды — относитесь к ним как к данным производителя и проводите собственные оценки. Характеристики и цены меняются; проверяйте перед разработкой.
TL;DR. V4 Flash — экономичный собрат гигантского DeepSeek V4 Pro: MoE с 284B параметров (13B активных), контекстом в 1M токенов и до 384K на выходе, оптимизированный для высоконагруженной, низколатентной агентной работы. Официальный релиз 31 июля — это апгрейд после пост-обучения: тот же размер, заметно лучшие агенты и кодинг, а также нативная поддержка Responses-API и Codex. DeepSeek сообщает о высоких результатах в агентных/кодовых бенчмарках (например, Terminal-Bench 2.1 — 82.7, Toolathlon — 70.3), а стоимость составляет около $0,15 / $0,29 за миллион входных/выходных токенов — примерно треть цены V4 Pro. Обновлён только Flash API; V4 Pro и приложение/веб-версия DeepSeek не изменились. На OrcaRouter вы получаете его с 0% наценкой через один OpenAI-совместимый эндпоинт.
Основные выводы
• Официальный релиз (сборка -0731, 31 июля 2026 г.): обновление превью после обучения — та же архитектура, значительно более сильные агенты, написание кода и использование инструментов.
• Архитектура без изменений: 284B всего / 13B активных (MoE), контекст 1M токенов (1 048 576), до 384K на выходе, только текстовый ввод, с рассуждениями, инструментами и JSON.
• Новое: нативная поддержка Responses API плюс специальная адаптация Codex; сохраняется поддержка интерфейсов OpenAI ChatCompletions и в стиле Anthropic. Идентификатор модели code>deepseek-v4-flash/code>.
Заявленные DeepSeek показатели в агентных/кодовых задачах: Terminal-Bench 2.1 — 82.7, Toolathlon (проверено) — 70.3, Cybergym — 76.7, DeepSWE — 54.4, NL2Repo — 54.2, DSBench-FullStack — 68.7.
• Очень дёшево: около $0.15 / $0.29 за 1 млн входных/выходных токенов, ~$0.02 за чтение из кэша (OrcaRouter, наценка 0%) — примерно треть от $0.44 / $0.88 у V4 Pro. Изменился только Flash API; Pro и приложение/веб остались прежними.
Что на самом деле обновил официальный релиз
V4 Flash впервые появился в качестве предварительной версии 24 апреля 2026 года. Официальный релиз от 31 июля 2026 года (code>-0731/code> сборка, согласно журналу изменений API DeepSeek) явно не является новой архитектурой: общее и активное количество параметров (284B / 13B) и контекст в 1M не изменились. Что изменилось — это пост-обучение: дополнительная тонкая настройка, которая, по словам DeepSeek, значительно улучшила агентные способности, способности к программированию и вызову инструментов. Важны два практических дополнения: V4 Flash теперь нативно поддерживает Responses API и специально адаптирован для кодинг-агентов в стиле Codex, сохраняя при этом совместимость с OpenAI ChatCompletions и интерфейсами в стиле Anthropic. Важно, что в этом релизе была обновлена только Flash API; V4 Pro и приложения/веб-версии DeepSeek остались без изменений. Для команд это означает бесшовное улучшение агентных нагрузок по той же цене и без миграции.

Архитектура: MoE с малым числом активных экспертов, спроектированная для высокой пропускной способности
V4 Flash — это модель со смесью экспертов: всего около 284 миллиардов параметров, но лишь примерно 13 миллиардов активны на каждый токен. Именно низкое число активных параметров и есть суть: оно обеспечивает быстрый и дешёвый инференс, а большой пул экспертов сохраняет качество. Контекстное окно составляет целых 1 048 576 токенов (примерно 1 млн), максимальная длина вывода — очень большие 384K, модель поддерживает рассуждения (расширенное мышление), вызов инструментов и структурированный JSON. На вход подаётся только текст. Цель разработки — высоконагруженная, низколатентная агентная работа — видна по серверным показателям: p50 времени до первого токена около 394 миллисекунд и вывод около 184 токенов в секунду по измерениям OrcaRouter.
Бенчмарки: что говорят официальные цифры
Официальный релиз делает сильный упор на агентные и кодовые оценки, проводимые с помощью собственного харнесса DeepSeek (настройки minimal-mode / max-effort). Вот как следует читать основные результаты — все они представлены DeepSeek:
• Terminal-Bench 2.1: 82.7 — агентные задачи с командной строкой и программным обеспечением в реальном терминале. Высокий балл здесь означает, что модель действительно умеет управлять инструментами и оболочками, а не просто отвечать на вопросы.
• Toolathlon (проверено): 70.3 и Automation Bench (публичный): 25.1 — широта и надёжность использования инструментов и сквозная автоматизация. Надёжность вызова инструментов — решающее качество для агентов.
• Cybergym: 76.7 — агентное решение задач в стиле security/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — инженерия программного обеспечения и full-stack разработка: от генерации на уровне репозитория до сложных задач по науке о данных. Высокий результат DSBench-FullStack (68.7) указывает на практическую компетентность в многофайловой разработке.
• Agent Last Exam: 25.2 — намеренно сложное испытание для агентных рассуждений, где даже лучшие модели набирают мало баллов; полезно как относительный показатель, а не абсолютный.
Для контекста: Artificial Analysis (оценка от 2026-06-25, предварительная сборка) разместила V4 Flash примерно на 56.2 AA Coding, 40.3 AA Intelligence и 50.0 AA Math — универсальная модель с уклоном в кодинг, выше медианы открытых моделей. Официальное улучшение после дообучения нацелено именно на ось агентности/кодинга, так что ожидайте, что новая сборка окажется сильнее именно в этих задачах. Как всегда, цифры вендорских тестовых стендов оптимистичны; проверяйте на своих собственных нагрузках.
Ценообразование: число, которое меняет бюджеты
На OrcaRouter, который передаёт цены провайдера без наценки (0%), V4 Flash стоит около $0,15 за миллион входных токенов и $0,29 за миллион выходных токенов, а чтение из кэша — около $0,02. При этом DeepSeek сохранил низкие цены в этом релизе (без повышения за обновление). Это примерно треть от $0,44 / $0,88 у DeepSeek V4 Pro. В реальном выражении: 10 миллионов токенов в месяц при соотношении 70% входных / 30% выходных обходятся на V4 Flash примерно в пару долларов; при масштабировании до миллиарда токенов разница с флагманом становится строкой бюджета, которую замечает финансовый отдел. Промпт-кэширование снижает затраты ещё сильнее для агентов и чатов со стабильным системным промптом, поскольку кэшированные входные токены тарифицируются примерно в десять раз дешевле новых. Более дешёвые агентные возможности по той же низкой цене — вот вся суть этого релиза.
Где V4 Flash вписывается: лестница DeepSeek V4
Линейка V4 от DeepSeek — это лестница. V4 Pro — флагман, значительно более крупная модель высшего уровня для рассуждений и кода. V4 Flash — это уровень эффективности: гораздо меньше активных вычислений, цена в разы ниже, а после этого пост-тренировочного обновления — действительно сильные агентные и кодовые способности. Тот факт, что DeepSeek вложился в то, чтобы сделать Flash лучшим агентом (Responses API, адаптация для Codex, бенчмарки использования инструментов) говорит о том, где компания ожидает основной объём: повседневный агентный и кодовый трафик на Flash, а самые сложные рассуждения — на Pro. Это отражает общеотраслевой паттерн «дешёвый по умолчанию плюс премиальный флагман» — и именно поэтому маршрутизация по сложности лучше, чем выбор по умолчанию самой большой модели.

Три реальных сценария
1. Агенты кодирования и рабочие процессы в стиле Codex
Встроенная поддержка Responses-API и Codex в сборке -0731, а также результаты Terminal-Bench (82.7) и DSBench-FullStack (68.7) делают V4 Flash мощным и недорогим движком для автономных агентов, пишущих код — исправление ошибок, рефакторинг, генерация тестов, многошаговое использование инструментов.
2. Высоконагруженные агенты, использующие инструменты
Быстрые первые токены (~394 мс), высокая пропускная способность (~184 ток/с), контекст 1M и высокая надёжность Toolathlon (70.3) подходят для продакшн-агентов, которые вызывают инструменты в масштабе — поиск, автоматизация, оркестрация.
3. Обработка длинных документов с ограниченным бюджетом
Полный контекст из 1M токенов и выход в 384K позволяют обобщать, анализировать или преобразовывать очень большие входные данные — логи, кодовые базы, длинные отчеты — за один проход и недорого.
Как получить доступ к V4 Flash
Вы можете вызывать V4 Flash напрямую через API DeepSeek (идентификатор модели code>deepseek-v4-flash/code>; он поддерживает Responses API, OpenAI ChatCompletions и интерфейсы в стиле Anthropic), или через не зависящий от поставщика endpoint. a href="https://www.orcarouter.ai/">OrcaRouter/a> предоставляет V4 Flash с нулевой наценкой через единый OpenAI-совместимый endpoint (code>deepseek/deepseek-v4-flash/code>) наряду с 185+ другими моделями — так что вы можете сравнить его с GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 и Kimi K3 в одном месте и направлять каждый запрос туда, где это дешевле всего. Поскольку он совместим с OpenAI, переход на V4 Flash — или отказ от него — это изменение конфигурации, а не повторная интеграция.

Ограничения и честные оговорки
V4 Flash — это модель эффективности, а не флагман: на самых сложных задачах рассуждения она уступает V4 Pro и ведущим западным моделям. Ввод только текстовый (без нативной поддержки изображений). Приведённые здесь результаты бенчмарков предоставлены DeepSeek и получены с использованием собственной системы тестирования, поэтому относитесь к точным цифрам как к ориентировочным и ожидайте, что независимые оценки будут несколько ниже. И «дёшево за токен» — это не «дёшево за задачу», если позволяете цепочкам рассуждений или агентским циклам работать слишком долго — ограничивайте усилия на рассуждения и количество итераций инструментов для простых запросов. Проверяйте модель на своей собственной нагрузке, прежде чем переводить на неё производственный трафик.
Часто задаваемые вопросы
Что такое DeepSeek V4 Flash?
Эффективная модель DeepSeek в линейке V4: смесь экспертов (MoE) с 284B параметров и 13B активных, контекст на 1M токенов, до 384K токенов на выходе, оптимизирована для быстрых, высоконагруженных агентных и кодовых задач. Её официальный релиз (сборка -0731) вышел 31 июля 2026 года.
Что изменилось в официальном релизе?
Архитектура не изменилась; это обновление после обучения (post-training), которое значительно улучшает агентные способности, написание кода и вызов инструментов, а также добавляет нативную поддержку Responses-API с адаптацией Codex. Обновлён только Flash API — V4 Pro и приложение/веб остались прежними.
Сколько стоит V4 Flash?
Примерно $0.15 за миллион входных токенов и $0.29 за миллион выходных токенов на OrcaRouter (0% наценки), с чтениями из кэша ~$0.02 — примерно треть от $0.44 / $0.88 у V4 Pro. В этом релизе цены остались низкими.
Насколько хорош V4 Flash в агентных задачах и задачах кодирования?
DeepSeek сообщает о высоких результатах: Terminal-Bench 2.1 82.7, Toolathlon (подтверждено) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — все это данные с вендорского испытательного стенда, так что проверяйте на своих задачах.
Как V4 Flash соотносится с V4 Pro?
Pro — это гораздо более крупный флагман для самых сложных рассуждений и кодинга; Flash — это уровень эффективности примерно за 1/3 цены с сильными агентскими/кодинговыми способностями. Направляйте сложные задачи на Pro, всё остальное — на Flash.
Что такое контекстное окно?
Полные 1,048,576 токенов (примерно 1M), с возможностью вывода до 384K токенов.
Является ли V4 Flash мультимодальным?
Нет — ввод только в виде текста. Поддерживает рассуждения, вызов инструментов и вывод JSON.
Работает ли V4 Flash с Responses API и Codex?
Да — в релизе -0731 добавлена нативная поддержка Responses-API и специальная адаптация Codex, наряду с интерфейсами OpenAI ChatCompletions и в стиле Anthropic.
Как использовать V4 Flash?
Напрямую через API DeepSeek, или через совместимый с OpenAI endpoint OrcaRouter с 0% наценкой (code>deepseek/deepseek-v4-flash/code>), где вы также можете сравнивать и маршрутизировать запросы между конкурирующими моделями.
Суть
Официальный релиз DeepSeek V4 Flash сохраняет дешёвую и быструю формулу и делает её гораздо лучшим агентом: та же архитектура MoE (284B / 13B активных) и контекст на 1M токенов, но с пост-обучением для более сильного кодинга и использования инструментов, нативной поддержкой Responses-API и Codex — по той же цене ~$0.15 / $0.29. Это не флагман и не мультимодальная модель, но для подавляющего большинства агентных и кодинговых задач, а также работы с длинными документами это один из лучших вариантов по соотношению цены за токен в 2026 году. Попробуйте её через OpenAI-совместимый endpoint с нулевой наценкой, например OrcaRouter, и направляйте самые сложные запросы (их меньшинство) на флагманскую модель — такую комбинацию трудно превзойти по цене.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
