Главная титульная карточка для 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' с подзаголовком 'Одна цена — один видит', линейной иконкой глаза слева и линейной иконкой текстового документа справа, разделёнными тонким нейтральным разделителем, и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) против DeepSeek V4 Flash: Цена та же, а видит только один

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4 Flash Vision (Exp) и DeepSeek V4 Flash — это одна и та же модель, отличающаяся ровно одной деталью, и вся суть именно в этой детали: визуальная модель видит изображения, а текстовая — нет. Выпущенная сегодня, 21 августа 2026 года, в качестве экспериментального релиза, DeepSeek V4 Flash Vision (Exp) сохраняет текстовый мозг DeepSeek V4 Flash без изменений — тот же контекст в 1 млн токенов, те же 384K максимального вывода, те же цены на токены — и добавляет ввод изображений, который меняет её результаты на агентных бенчмарках, где текстовая модель тихо проваливается. Единственный реальный вопрос — обходится ли вам «экспериментальный» статус дороже, чем он экономит.

Эти две модели

DeepSeek V4 Flash — это официальная бюджетная рабочая лошадка компании: модель на основе смеси экспертов (Mixture-of-Experts) с примерно 284 млрд параметров в сумме и 13 млрд активных, только текстовая, оптимизированная для повседневных нагрузок с высокой степенью параллелизма, с бюджетом на параллельную обработку 2500 токенов в секунду в API вендора. DeepSeek V4 Flash Vision (Exp) — это модель того же семейства весов с добавленным кодировщиком изображений, тарифицируется так же и помечена как экспериментальная. Всё, что ниже «глаз», является общим.

{{1}}• Параметры — Vision-Exp: 284B всего / 13B активных MoE против V4-Flash: 284B всего / 13B активных MoE (одно семейство){{/1}}

• Входные данные — Vision-Exp: текст + изображения (JPEG, PNG, GIF, WebP) против V4-Flash: только текст

• Контекст — Vision-Exp: 1M токенов против V4-Flash: 1M токенов

• Максимальный выход — Vision-Exp: 384K токенов против V4-Flash: 384K токенов

• Режимы мышления — оба поддерживают мышление и отсутствие мышления

• Форматы API — оба: Chat Completions, Messages, Responses

• Цена — идентична (оба тарифицируются по пиковым/непиковым тарифам токенов V4-Flash)

• Статус — Vision-Exp: экспериментальный, без даты GA, в отличие от V4-Flash: официальный релиз (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Где зрение меняет счёт

На чистом тексте Deep​Seek утверждает, что они сопоставимы, и нет причин сомневаться в этом — модель зрения построена на той же текстовой способности. Расхождение проявляется в агентных бенчмарках, содержащих скриншоты, диаграммы и изображения интерфейсов, где текстовая модель буквально игнорирует мультимодальный контент. Все цифры ниже взяты из сегодняшнего анонса производителя и не воспроизводились независимо:

• ApexBench Pass@1 — Vision-Exp 36.5 против V4-Flash 26.2

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 против V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 против V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 против V4-Flash 54.4

• Chartography — Vision-Exp 64.3 (V4-Flash не может выполнить)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash не может выполнить)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

Самый большой скачок — ApexBench, где добавление зрения поднимает результат с 26.2 до 36.5 — разница в десять пунктов, которая объясняется не тем, что модель стала думать усерднее, а тем, что она наконец читает задание. Для агента, который действует через экран — браузер, рабочий стол, терминал с отображаемым выводом — текстовая модель была слепа именно к тем частям задачи, которые несут информацию.

У вопроса о цене есть один ответ.

Разницы в цене нет, и именно здесь сравнение становится очевидным в одну сторону. DeepSeek V4 Flash Vision (Exp) тарифицируется по точно таким же ставкам, что и DeepSeek V4 Flash, которые с 16 августа 2026 года составляют: пиковые/непиковые:

• Ввод, промах кэша — $0.22 за 1 млн токенов в непиковое время, $0.44 в пиковое (обе модели)

• Вход, попадание в кэш — $0.007 за 1 млн токенов в непиковые часы, $0.014 в пиковые (обе модели)

• Вывод — $0.66 за 1M токенов в непиковые часы, $1.32 в пиковые (обе модели)

• Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC для обеих моделей.

Единственная дополнительная стоимость, которую приносит зрение, — это само изображение: каждое изображение токенизируется до 384 токенов, так что скриншот стоит примерно 0,0085 цента вне пиковых часов. Даже агент с интенсивным использованием зрения, обрабатывающий 50 изображений за запуск, добавляет менее цента к входным данным. Выбирать текстовую модель ради экономии денег — значит выбирать копейки вместо зрения — такая экономия ненастоящая.

Когда что выбирать

Выбирайте DeepSeek V4 Flash Vision (Exp), если ваш пайплайн может когда-либо получать изображение. Агенты UI-тестирования и контроля качества на основе скриншотов, агенты веб-браузинга, которым нужно читать страницу, на которой они находятся, извлечение графиков и диаграмм, скриншоты документов, снимки сообщений об ошибках с экрана пользователя — в каждом из этих случаев визуальная модель является строго лучшей моделью по той же цене. По заявлению вендора, потери качества текста нет, так что единственная причина не использовать её — стабильность.

Выбирайте DeepSeek V4 Flash, если ваш трафик — это чистый текст, и в нём ничего не изменится. Для завершения кода, поиска и текстовых агентных циклов обе модели показывают одинаковые результаты на тексте, а официальный релиз по определению является более безопасным выбором. Если вы уже используете V4-Flash и никогда не отправляете изображения, нет причин переключаться — и нет причин не иметь эту опцию в вашей конфигурации маршрутизации.

Единственное реальное отличие: экспериментальный статус

Всё, что выше глаз, идентично; стоимость зрения незначительна; бенчмарки в пользу модели со зрением. Единственный обоснованный фактор, который может удержать вас на DeepSeek V4 Flash в продакшене, — это то, что модель со зрением экспериментальна. Deep​Seek маркирует её как экспериментальную, не называет даты GA и говорит, что она не рекомендуется для продакшена. Текстовый мозг, стоящий за ней, проверен, но путь зрения новый, а экспериментальная поверхность API — это именно то место, где вам не нужен тихий сбой в 2 часа ночи.

Это единственное место, где сравнение не определяется спецификациями, и это также единственное место, где роутер меняет ответ. На OrcaRouter обе модели доступны — deepseek/deepseek-v4-flash-vision-exp и deepseek/deepseek-v4-flash — за одним API-ключом по цене провайдера, с нулевой наценкой. Поскольку одна и та же платформа маршрутизирует обе модели, вы можете задействовать vision-модель там, где она окупает себя, а остальное привязать к официальному релизу, с автоматическим переключением при сбое, чтобы сбой экспериментальной модели никогда не обрушил весь пайплайн. Вы получаете прирост на десять пунктов ApexBench на вызовах, которым это нужно, и стабильность официального релиза на вызовах, которым это не нужно, без второго контракта и второго пути в коде.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

Суть

Если ваша рабочая нагрузка может принимать изображения, DeepSeek V4 Flash Vision (Exp) превосходит DeepSeek V4 Flash по всем значимым параметрам и уступает лишь по одному, который можно обойти инженерными средствами: экспериментальному статусу. Если нагрузка — чистый текст, модели одинаковы по выводу, а официальный релиз выигрывает по стабильности. На самом деле они не конкуренты: vision-модель — это текстовая модель с разблокированным навыком, без доплаты. Единственное решение, которое стоит принять, — какой объём трафика вы готовы направить на экспериментальный API, и это решение о маршрутизации, а не о модели.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube