Титульная карточка для DeepSeek-V4-Flash-Vision-Exp с подзаголовком «Та же цена, что и у V4-Flash, теперь с глазами», линейная иконка «глаз и ценник», небольшой скруглённый бейдж с надписью «ЭКСПЕРИМЕНТАЛЬНАЯ • API • 2026-08-21» и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) запускается в API: та же цена, что и у V4-Flash, теперь с глазами

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

DeepSeek V4 Flash Vision (Exp) стал доступен на API-платформе Deep​Seek сегодня, 21 августа 2026 года, и самое важное число в этом анонсе — не бенчмарк, а цена: эта экспериментальная модель с поддержкой зрения тарифицируется ровно по тем же ставкам за токены, что и DeepSeek V4 Flash, текстовая рабочая лошадка, чьи чисто текстовые возможности она в точности повторяет. Это первый случай, когда собственный API Deep​Seek вообще принимает изображения, и это значит, что самый дешёвый способ запускать агента с контекстом в 1M только что получил мультимодальность бесплатно.

Что на самом деле было выпущено

DeepSeek V4 Flash Vision (Exp) — это экспериментальная мультимодальная модель, доступная по идентификатору модели deepseek-v4-flash-vision-exp. Она принимает на вход текст и изображения и выдаёт текст на выходе, работая в окне контекста объёмом 1M токенов с максимальным выводом 384K, в режимах как с рассуждениями, так и без. Она поддерживает формат Chat Completions, Messages в стиле Anthropic и формат Responses — ту тройку, которая нужна агентному фреймворку для подключения модели без специального адаптера.

При вводе изображений Deep​Seek принимает JPEG, PNG, GIF и WebP, которые передаются тремя способами: встроенная строка base64, внешний URL или файл, загруженный через новый Files API. Видео- или аудиовход пока отсутствует — «зрение» здесь работает только с неподвижными изображениями.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Собственное позиционирование Deep​Seek, в примечании к выпуску: возможности чисто текстовой модели — агенты, рассуждения, знание мира — на уровне официального релиза DeepSeek V4 Flash, в то время как мультимодальные возможности агента совершают большой скачок и приближаются к Opus-4.8. Это заявление вендора, не подтверждённое независимыми тестами, и его стоит внимательно прочитать, потому что детали бенчмарков за ним интереснее, чем заголовок.

Почему скачок в бенчмарках больше, чем кажется

Все следующие показатели являются собственными данными Deep​Seek, опубликованными сегодня в примечании к запуску, и не были независимо проверены. В агентных бенчмарках, содержащих скриншоты и изображения, текстовый DeepSeek V4 Flash не читает их — он просто игнорирует мультимодальные части задачи. DeepSeek V4 Flash Vision (Exp) действительно смотрит, поэтому дельты такие большие:

• ApexBench Pass@1 — Vision-Exp 36.5 против V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 против V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 против V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 против V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 против V4-Flash 54.4 (Opus-4.8 58.0)

• Картография — Vision-Exp 64.3 (только текстовая V4-Flash не может выполнить это)

• ZeroBench Pass@5 — Vision-Exp 35.0 (текстовая V4-Flash не может его выполнить)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Два из этих чисел заслуживают второго взгляда. На Agents' Last Exam Vision-Exp (27.3) немного опережает Opus-4.8 (25.7), а на DeepSWE он также обходит Opus-4.8 (59.3 против 58.0). Именно на этом на самом деле держится «близость к Opus-4.8» — не на одном громком результате, а на целой группе агентных бенчмарков, где возможность видеть экран устраняет большую часть разрыва с передовой мультимодальной моделью, при этом цена на неё примерно на порядок ниже.

Сколько стоит изображение, с точностью до десятичного знака

Изображения токенизируются для биллинга — до 384 токенов каждое — и затем тарифицируются по тем же ставкам за токен, что и DeepSeek V4 Flash. Поскольку DeepSeek перевел все свои модели на пиковые и непиковые тарифы 16 августа 2026 года, точные цифры зависят от времени вашего обращения:

• Ввод, промах кэша — $0.22 за 1M токенов в непиковое время, $0.44 в пиковое.

• Ввод, кэш-попадание — $0,007 за 1M токенов вне пикового времени, $0,014 в пиковое время

• Выход — $0,66 за 1 млн токенов вне пиковых часов, $1,32 в пиковые

• Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC (все остальные часы — вне пиковых)

Сделайте расчёт — и стоимость зрения почти исчезает. Одно изображение при своём пределе в 384 токена стоит около 0.0085 цента в непиковые часы и 0.017 цента в пиковые как входные данные. Агент, читающий 50 скриншотов за один запуск, добавляет примерно полцента входных токенов — ещё до того, как модель напишет свой первый выходной токен. Deep​Seek также ограничивает разрешение перед инференсом: при низком уровне детализации изображение масштабируется до 512×512, а при высоком/оригинальном — предварительно масштабируется (маленькие — примерно до 384×384, большие — примерно до 800×800), поэтому исходное изображение с высоким разрешением никогда не подаётся в модель в своём изначальном количестве пикселей.

Вспомогательный состав: бесплатный Files API и Harness 0.1.1

Два инфраструктурных компонента выпущены вместе с моделью. Files API работает и бесплатен: загрузите изображение один раз, ссылайтесь на него по file_id и повторно используйте в разных запросах, не отправляя байты заново — это важно для браузерного агента, который удерживает страницу в контексте на протяжении нескольких шагов. И Deep​Seek Harness 0.1.1, выпущенный в тот же день, поддерживает новую модель из коробки, поэтому харнесс, который проводит бенчмарки и запускает агентные рабочие нагрузки Deep​Seek, может сразу нацелиться на неё.

Производственное предостережение, выраженное прямо

Это экспериментальная модель. Deep​Seek явно обозначает её как таковую, не объявлял даты GA и рекомендует не запускать её напрямую в производстве; заявленный план — итерировать на основе обратной связи и выпустить стабильную версию позже. Практическое следствие: текстовый мозг проверен — это то же семейство весов, которое питает V4-Flash, — но визуальный путь — это новый код, и никто за пределами Deep​Seek не подвергал его нагрузочному тестированию в масштабе.

Это именно та ситуация, когда маршрутизирующий слой оправдывает своё существование. В OrcaRouter и deepseek/deepseek-v4-flash-vision-exp, и deepseek/deepseek-v4-flash работают за одним API, по прейскурантной цене Deep​Seek без какой-либо наценки. Вы можете направлять трафик с изображениями на экспериментальную модель и в той же конфигурации настроить автоматический переход на запасную модель при первой же ошибке или тайм-ауте — это снижает риск всей проблемы «нового кода». Маршрутизирующий DSL также позволяет отправлять на модель зрения только те вызовы, которые действительно содержат изображения, а чисто текстовый трафик оставлять на DeepSeek V4 Flash, получая прирост в бенчмарках там, где он есть, и не платя ничего лишнего там, где его нет.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Что посмотреть дальше

Открытые вопросы — обычные для экспериментального запуска. Когда DeepSeek V4 Flash Vision (Exp) выйдет в GA, и удержится ли цена? Последует ли за этим видео- или аудиовход — сегодня модель работает только со статичными изображениями, что оставляет крупные мультимодальные фронт-модели без конкурентов в работе с движущимися медиа. И воспроизведут ли независимые оценки (первый сторонний прогон на ApexBench или Terminal-Bench) опубликованные цифры? Интересно то, что даже если все бенчмарки просядут, единственное утверждение, которое уже сейчас экономически оправдано — зрение по цене текста — это факт о ценообразовании, а не заявление на основе бенчмарков, и оно не нуждается в воспроизведении.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube