
DeepSeek V4 Flash Vision (Exp) запускается в API: та же цена, что и у V4-Flash, теперь с глазами
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
DeepSeek V4 Flash Vision (Exp) стал доступен на API-платформе DeepSeek сегодня, 21 августа 2026 года, и самое важное число в этом анонсе — не бенчмарк, а цена: эта экспериментальная модель с поддержкой зрения тарифицируется ровно по тем же ставкам за токены, что и DeepSeek V4 Flash, текстовая рабочая лошадка, чьи чисто текстовые возможности она в точности повторяет. Это первый случай, когда собственный API DeepSeek вообще принимает изображения, и это значит, что самый дешёвый способ запускать агента с контекстом в 1M только что получил мультимодальность бесплатно.
Что на самом деле было выпущено
DeepSeek V4 Flash Vision (Exp) — это экспериментальная мультимодальная модель, доступная по идентификатору модели deepseek-v4-flash-vision-exp. Она принимает на вход текст и изображения и выдаёт текст на выходе, работая в окне контекста объёмом 1M токенов с максимальным выводом 384K, в режимах как с рассуждениями, так и без. Она поддерживает формат Chat Completions, Messages в стиле Anthropic и формат Responses — ту тройку, которая нужна агентному фреймворку для подключения модели без специального адаптера.
При вводе изображений DeepSeek принимает JPEG, PNG, GIF и WebP, которые передаются тремя способами: встроенная строка base64, внешний URL или файл, загруженный через новый Files API. Видео- или аудиовход пока отсутствует — «зрение» здесь работает только с неподвижными изображениями.

Собственное позиционирование DeepSeek, в примечании к выпуску: возможности чисто текстовой модели — агенты, рассуждения, знание мира — на уровне официального релиза DeepSeek V4 Flash, в то время как мультимодальные возможности агента совершают большой скачок и приближаются к Opus-4.8. Это заявление вендора, не подтверждённое независимыми тестами, и его стоит внимательно прочитать, потому что детали бенчмарков за ним интереснее, чем заголовок.
Почему скачок в бенчмарках больше, чем кажется
Все следующие показатели являются собственными данными DeepSeek, опубликованными сегодня в примечании к запуску, и не были независимо проверены. В агентных бенчмарках, содержащих скриншоты и изображения, текстовый DeepSeek V4 Flash не читает их — он просто игнорирует мультимодальные части задачи. DeepSeek V4 Flash Vision (Exp) действительно смотрит, поэтому дельты такие большие:
• ApexBench Pass@1 — Vision-Exp 36.5 против V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 против V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 против V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 против V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 против V4-Flash 54.4 (Opus-4.8 58.0)
• Картография — Vision-Exp 64.3 (только текстовая V4-Flash не может выполнить это)
• ZeroBench Pass@5 — Vision-Exp 35.0 (текстовая V4-Flash не может его выполнить)

Два из этих чисел заслуживают второго взгляда. На Agents' Last Exam Vision-Exp (27.3) немного опережает Opus-4.8 (25.7), а на DeepSWE он также обходит Opus-4.8 (59.3 против 58.0). Именно на этом на самом деле держится «близость к Opus-4.8» — не на одном громком результате, а на целой группе агентных бенчмарков, где возможность видеть экран устраняет большую часть разрыва с передовой мультимодальной моделью, при этом цена на неё примерно на порядок ниже.
Сколько стоит изображение, с точностью до десятичного знака
Изображения токенизируются для биллинга — до 384 токенов каждое — и затем тарифицируются по тем же ставкам за токен, что и DeepSeek V4 Flash. Поскольку DeepSeek перевел все свои модели на пиковые и непиковые тарифы 16 августа 2026 года, точные цифры зависят от времени вашего обращения:
• Ввод, промах кэша — $0.22 за 1M токенов в непиковое время, $0.44 в пиковое.
• Ввод, кэш-попадание — $0,007 за 1M токенов вне пикового времени, $0,014 в пиковое время
• Выход — $0,66 за 1 млн токенов вне пиковых часов, $1,32 в пиковые
• Пиковые часы — 01:00–04:00 и 06:00–10:00 UTC (все остальные часы — вне пиковых)
Сделайте расчёт — и стоимость зрения почти исчезает. Одно изображение при своём пределе в 384 токена стоит около 0.0085 цента в непиковые часы и 0.017 цента в пиковые как входные данные. Агент, читающий 50 скриншотов за один запуск, добавляет примерно полцента входных токенов — ещё до того, как модель напишет свой первый выходной токен. DeepSeek также ограничивает разрешение перед инференсом: при низком уровне детализации изображение масштабируется до 512×512, а при высоком/оригинальном — предварительно масштабируется (маленькие — примерно до 384×384, большие — примерно до 800×800), поэтому исходное изображение с высоким разрешением никогда не подаётся в модель в своём изначальном количестве пикселей.
Вспомогательный состав: бесплатный Files API и Harness 0.1.1
Два инфраструктурных компонента выпущены вместе с моделью. Files API работает и бесплатен: загрузите изображение один раз, ссылайтесь на него по file_id и повторно используйте в разных запросах, не отправляя байты заново — это важно для браузерного агента, который удерживает страницу в контексте на протяжении нескольких шагов. И DeepSeek Harness 0.1.1, выпущенный в тот же день, поддерживает новую модель из коробки, поэтому харнесс, который проводит бенчмарки и запускает агентные рабочие нагрузки DeepSeek, может сразу нацелиться на неё.
Производственное предостережение, выраженное прямо
Это экспериментальная модель. DeepSeek явно обозначает её как таковую, не объявлял даты GA и рекомендует не запускать её напрямую в производстве; заявленный план — итерировать на основе обратной связи и выпустить стабильную версию позже. Практическое следствие: текстовый мозг проверен — это то же семейство весов, которое питает V4-Flash, — но визуальный путь — это новый код, и никто за пределами DeepSeek не подвергал его нагрузочному тестированию в масштабе.
Это именно та ситуация, когда маршрутизирующий слой оправдывает своё существование. В OrcaRouter и deepseek/deepseek-v4-flash-vision-exp, и deepseek/deepseek-v4-flash работают за одним API, по прейскурантной цене DeepSeek без какой-либо наценки. Вы можете направлять трафик с изображениями на экспериментальную модель и в той же конфигурации настроить автоматический переход на запасную модель при первой же ошибке или тайм-ауте — это снижает риск всей проблемы «нового кода». Маршрутизирующий DSL также позволяет отправлять на модель зрения только те вызовы, которые действительно содержат изображения, а чисто текстовый трафик оставлять на DeepSeek V4 Flash, получая прирост в бенчмарках там, где он есть, и не платя ничего лишнего там, где его нет.

Что посмотреть дальше
Открытые вопросы — обычные для экспериментального запуска. Когда DeepSeek V4 Flash Vision (Exp) выйдет в GA, и удержится ли цена? Последует ли за этим видео- или аудиовход — сегодня модель работает только со статичными изображениями, что оставляет крупные мультимодальные фронт-модели без конкурентов в работе с движущимися медиа. И воспроизведут ли независимые оценки (первый сторонний прогон на ApexBench или Terminal-Bench) опубликованные цифры? Интересно то, что даже если все бенчмарки просядут, единственное утверждение, которое уже сейчас экономически оправдано — зрение по цене текста — это факт о ценообразовании, а не заявление на основе бенчмарков, и оно не нуждается в воспроизведении.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
