Официальный релиз DeepSeek V4 Flash: объясняем дешёвую, быструю и агентную модель с контекстом 1M
Guides & Insights

Официальный релиз DeepSeek V4 Flash: объясняем дешёвую, быструю и агентную модель с контекстом 1M

Автор

jinhao song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Эффективная модель DeepSeek, V4 Flash, перешла из предварительной версии в официальный публичный бета-релиз — сборка code>-0731/code> вышла 31 июля 2026 года. Архитектура не изменилась (это по-прежнему модель на основе смеси экспертов с 284 миллиардами параметров и контекстом в 1 миллион токенов), но дополнительный этап пост-обучения значительно улучшил её агентные способности, навыки программирования и вызова инструментов, и теперь она нативно поддерживает Responses API со специальными адаптациями для агентов в стиле Codex. В этом руководстве объясняется, что такое V4 Flash, что именно улучшил официальный релиз, как интерпретировать её бенчмарки (по данным DeepSeek), сколько она стоит и как её использовать — каждая цифра с указанием источника.

Примечание о точности: детали релиза и результаты бенчмарков ниже взяты из официального журнала изменений API DeepSeek (от 2026-07-31); архитектура, контекст и цены перепроверены по странице модели OrcaRouter; композитные показатели Artificial Analysis независимы. Бенчмарки, представленные DeepSeek, используют собственные настройки тестовой среды — относитесь к ним как к данным производителя и проводите собственные оценки. Характеристики и цены меняются; проверяйте перед разработкой.

TL;DR. V4 Flash — экономичный собрат гигантского DeepSeek V4 Pro: MoE с 284B параметров (13B активных), контекстом в 1M токенов и до 384K на выходе, оптимизированный для высоконагруженной, низколатентной агентной работы. Официальный релиз 31 июля — это апгрейд после пост-обучения: тот же размер, заметно лучшие агенты и кодинг, а также нативная поддержка Responses-API и Codex. DeepSeek сообщает о высоких результатах в агентных/кодовых бенчмарках (например, Terminal-Bench 2.1 — 82.7, Toolathlon — 70.3), а стоимость составляет около $0,15 / $0,29 за миллион входных/выходных токенов — примерно треть цены V4 Pro. Обновлён только Flash API; V4 Pro и приложение/веб-версия DeepSeek не изменились. На OrcaRouter вы получаете его с 0% наценкой через один OpenAI-совместимый эндпоинт.

Основные выводы

• Официальный релиз (сборка -0731, 31 июля 2026 г.): обновление превью после обучения — та же архитектура, значительно более сильные агенты, написание кода и использование инструментов.

• Архитектура без изменений: 284B всего / 13B активных (MoE), контекст 1M токенов (1 048 576), до 384K на выходе, только текстовый ввод, с рассуждениями, инструментами и JSON.

• Новое: нативная поддержка Responses API плюс специальная адаптация Codex; сохраняется поддержка интерфейсов OpenAI ChatCompletions и в стиле Anthropic. Идентификатор модели code>deepseek-v4-flash/code>.

Заявленные DeepSeek показатели в агентных/кодовых задачах: Terminal-Bench 2.1 — 82.7, Toolathlon (проверено) — 70.3, Cybergym — 76.7, DeepSWE — 54.4, NL2Repo — 54.2, DSBench-FullStack — 68.7.

• Очень дёшево: около $0.15 / $0.29 за 1 млн входных/выходных токенов, ~$0.02 за чтение из кэша (OrcaRouter, наценка 0%) — примерно треть от $0.44 / $0.88 у V4 Pro. Изменился только Flash API; Pro и приложение/веб остались прежними.

Что на самом деле обновил официальный релиз

V4 Flash впервые появился в качестве предварительной версии 24 апреля 2026 года. Официальный релиз от 31 июля 2026 года (code>-0731/code> сборка, согласно журналу изменений API DeepSeek) явно не является новой архитектурой: общее и активное количество параметров (284B / 13B) и контекст в 1M не изменились. Что изменилось — это пост-обучение: дополнительная тонкая настройка, которая, по словам DeepSeek, значительно улучшила агентные способности, способности к программированию и вызову инструментов. Важны два практических дополнения: V4 Flash теперь нативно поддерживает Responses API и специально адаптирован для кодинг-агентов в стиле Codex, сохраняя при этом совместимость с OpenAI ChatCompletions и интерфейсами в стиле Anthropic. Важно, что в этом релизе была обновлена только Flash API; V4 Pro и приложения/веб-версии DeepSeek остались без изменений. Для команд это означает бесшовное улучшение агентных нагрузок по той же цене и без миграции.

Архитектура: MoE с малым числом активных экспертов, спроектированная для высокой пропускной способности

V4 Flash — это модель со смесью экспертов: всего около 284 миллиардов параметров, но лишь примерно 13 миллиардов активны на каждый токен. Именно низкое число активных параметров и есть суть: оно обеспечивает быстрый и дешёвый инференс, а большой пул экспертов сохраняет качество. Контекстное окно составляет целых 1 048 576 токенов (примерно 1 млн), максимальная длина вывода — очень большие 384K, модель поддерживает рассуждения (расширенное мышление), вызов инструментов и структурированный JSON. На вход подаётся только текст. Цель разработки — высоконагруженная, низколатентная агентная работа — видна по серверным показателям: p50 времени до первого токена около 394 миллисекунд и вывод около 184 токенов в секунду по измерениям OrcaRouter.

Бенчмарки: что говорят официальные цифры

Официальный релиз делает сильный упор на агентные и кодовые оценки, проводимые с помощью собственного харнесса DeepSeek (настройки minimal-mode / max-effort). Вот как следует читать основные результаты — все они представлены DeepSeek:

• Terminal-Bench 2.1: 82.7 — агентные задачи с командной строкой и программным обеспечением в реальном терминале. Высокий балл здесь означает, что модель действительно умеет управлять инструментами и оболочками, а не просто отвечать на вопросы.

• Toolathlon (проверено): 70.3 и Automation Bench (публичный): 25.1 — широта и надёжность использования инструментов и сквозная автоматизация. Надёжность вызова инструментов — решающее качество для агентов.

• Cybergym: 76.7 — агентное решение задач в стиле security/CTF.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — инженерия программного обеспечения и full-stack разработка: от генерации на уровне репозитория до сложных задач по науке о данных. Высокий результат DSBench-FullStack (68.7) указывает на практическую компетентность в многофайловой разработке.

• Agent Last Exam: 25.2 — намеренно сложное испытание для агентных рассуждений, где даже лучшие модели набирают мало баллов; полезно как относительный показатель, а не абсолютный.

Для контекста: Artificial Analysis (оценка от 2026-06-25, предварительная сборка) разместила V4 Flash примерно на 56.2 AA Coding, 40.3 AA Intelligence и 50.0 AA Math — универсальная модель с уклоном в кодинг, выше медианы открытых моделей. Официальное улучшение после дообучения нацелено именно на ось агентности/кодинга, так что ожидайте, что новая сборка окажется сильнее именно в этих задачах. Как всегда, цифры вендорских тестовых стендов оптимистичны; проверяйте на своих собственных нагрузках.

Ценообразование: число, которое меняет бюджеты

На OrcaRouter, который передаёт цены провайдера без наценки (0%), V4 Flash стоит около $0,15 за миллион входных токенов и $0,29 за миллион выходных токенов, а чтение из кэша — около $0,02. При этом DeepSeek сохранил низкие цены в этом релизе (без повышения за обновление). Это примерно треть от $0,44 / $0,88 у DeepSeek V4 Pro. В реальном выражении: 10 миллионов токенов в месяц при соотношении 70% входных / 30% выходных обходятся на V4 Flash примерно в пару долларов; при масштабировании до миллиарда токенов разница с флагманом становится строкой бюджета, которую замечает финансовый отдел. Промпт-кэширование снижает затраты ещё сильнее для агентов и чатов со стабильным системным промптом, поскольку кэшированные входные токены тарифицируются примерно в десять раз дешевле новых. Более дешёвые агентные возможности по той же низкой цене — вот вся суть этого релиза.

Где V4 Flash вписывается: лестница DeepSeek V4

Линейка V4 от DeepSeek — это лестница. V4 Pro — флагман, значительно более крупная модель высшего уровня для рассуждений и кода. V4 Flash — это уровень эффективности: гораздо меньше активных вычислений, цена в разы ниже, а после этого пост-тренировочного обновления — действительно сильные агентные и кодовые способности. Тот факт, что DeepSeek вложился в то, чтобы сделать Flash лучшим агентом (Responses API, адаптация для Codex, бенчмарки использования инструментов) говорит о том, где компания ожидает основной объём: повседневный агентный и кодовый трафик на Flash, а самые сложные рассуждения — на Pro. Это отражает общеотраслевой паттерн «дешёвый по умолчанию плюс премиальный флагман» — и именно поэтому маршрутизация по сложности лучше, чем выбор по умолчанию самой большой модели.

Три реальных сценария

1. Агенты кодирования и рабочие процессы в стиле Codex

Встроенная поддержка Responses-API и Codex в сборке -0731, а также результаты Terminal-Bench (82.7) и DSBench-FullStack (68.7) делают V4 Flash мощным и недорогим движком для автономных агентов, пишущих код — исправление ошибок, рефакторинг, генерация тестов, многошаговое использование инструментов.

2. Высоконагруженные агенты, использующие инструменты

Быстрые первые токены (~394 мс), высокая пропускная способность (~184 ток/с), контекст 1M и высокая надёжность Toolathlon (70.3) подходят для продакшн-агентов, которые вызывают инструменты в масштабе — поиск, автоматизация, оркестрация.

3. Обработка длинных документов с ограниченным бюджетом

Полный контекст из 1M токенов и выход в 384K позволяют обобщать, анализировать или преобразовывать очень большие входные данные — логи, кодовые базы, длинные отчеты — за один проход и недорого.

Как получить доступ к V4 Flash

Вы можете вызывать V4 Flash напрямую через API DeepSeek (идентификатор модели code>deepseek-v4-flash/code>; он поддерживает Responses API, OpenAI ChatCompletions и интерфейсы в стиле Anthropic), или через не зависящий от поставщика endpoint. a href="https://www.orcarouter.ai/">OrcaRouter/a> предоставляет V4 Flash с нулевой наценкой через единый OpenAI-совместимый endpoint (code>deepseek/deepseek-v4-flash/code>) наряду с 185+ другими моделями — так что вы можете сравнить его с GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 и Kimi K3 в одном месте и направлять каждый запрос туда, где это дешевле всего. Поскольку он совместим с OpenAI, переход на V4 Flash — или отказ от него — это изменение конфигурации, а не повторная интеграция.

Ограничения и честные оговорки

V4 Flash — это модель эффективности, а не флагман: на самых сложных задачах рассуждения она уступает V4 Pro и ведущим западным моделям. Ввод только текстовый (без нативной поддержки изображений). Приведённые здесь результаты бенчмарков предоставлены DeepSeek и получены с использованием собственной системы тестирования, поэтому относитесь к точным цифрам как к ориентировочным и ожидайте, что независимые оценки будут несколько ниже. И «дёшево за токен» — это не «дёшево за задачу», если позволяете цепочкам рассуждений или агентским циклам работать слишком долго — ограничивайте усилия на рассуждения и количество итераций инструментов для простых запросов. Проверяйте модель на своей собственной нагрузке, прежде чем переводить на неё производственный трафик.

Часто задаваемые вопросы

Что такое DeepSeek V4 Flash?

Эффективная модель DeepSeek в линейке V4: смесь экспертов (MoE) с 284B параметров и 13B активных, контекст на 1M токенов, до 384K токенов на выходе, оптимизирована для быстрых, высоконагруженных агентных и кодовых задач. Её официальный релиз (сборка -0731) вышел 31 июля 2026 года.

Что изменилось в официальном релизе?

Архитектура не изменилась; это обновление после обучения (post-training), которое значительно улучшает агентные способности, написание кода и вызов инструментов, а также добавляет нативную поддержку Responses-API с адаптацией Codex. Обновлён только Flash API — V4 Pro и приложение/веб остались прежними.

Сколько стоит V4 Flash?

Примерно $0.15 за миллион входных токенов и $0.29 за миллион выходных токенов на OrcaRouter (0% наценки), с чтениями из кэша ~$0.02 — примерно треть от $0.44 / $0.88 у V4 Pro. В этом релизе цены остались низкими.

Насколько хорош V4 Flash в агентных задачах и задачах кодирования?

DeepSeek сообщает о высоких результатах: Terminal-Bench 2.1 82.7, Toolathlon (подтверждено) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — все это данные с вендорского испытательного стенда, так что проверяйте на своих задачах.

Как V4 Flash соотносится с V4 Pro?

Pro — это гораздо более крупный флагман для самых сложных рассуждений и кодинга; Flash — это уровень эффективности примерно за 1/3 цены с сильными агентскими/кодинговыми способностями. Направляйте сложные задачи на Pro, всё остальное — на Flash.

Что такое контекстное окно?

Полные 1,048,576 токенов (примерно 1M), с возможностью вывода до 384K токенов.

Является ли V4 Flash мультимодальным?

Нет — ввод только в виде текста. Поддерживает рассуждения, вызов инструментов и вывод JSON.

Работает ли V4 Flash с Responses API и Codex?

Да — в релизе -0731 добавлена нативная поддержка Responses-API и специальная адаптация Codex, наряду с интерфейсами OpenAI ChatCompletions и в стиле Anthropic.

Как использовать V4 Flash?

Напрямую через API DeepSeek, или через совместимый с OpenAI endpoint OrcaRouter с 0% наценкой (code>deepseek/deepseek-v4-flash/code>), где вы также можете сравнивать и маршрутизировать запросы между конкурирующими моделями.

Суть

Официальный релиз DeepSeek V4 Flash сохраняет дешёвую и быструю формулу и делает её гораздо лучшим агентом: та же архитектура MoE (284B / 13B активных) и контекст на 1M токенов, но с пост-обучением для более сильного кодинга и использования инструментов, нативной поддержкой Responses-API и Codex — по той же цене ~$0.15 / $0.29. Это не флагман и не мультимодальная модель, но для подавляющего большинства агентных и кодинговых задач, а также работы с длинными документами это один из лучших вариантов по соотношению цены за токен в 2026 году. Попробуйте её через OpenAI-совместимый endpoint с нулевой наценкой, например OrcaRouter, и направляйте самые сложные запросы (их меньшинство) на флагманскую модель — такую комбинацию трудно превзойти по цене.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube