
Ling-3.0-flash-VL против DeepSeek V4 Flash Vision Exp: две ставки на открытое компьютерное зрение
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Ling-3.0-flash-VL и DeepSeek V4 Flash Vision Exp — это две открытовесные модели зрения в этом классе весов, которые команда может реально скачать и запустить уже сегодня, и их создали люди, расходящиеся во мнениях о том, для чего нужно зрение. Ling-3.0-flash-VL из лаборатории inclusionAI группы Ant Group активирует около 5,5 млрд из своих 124 млрд параметров на токен и рассматривает зрение как нечто, что следует применять внутри цикла обратной связи — сгенерировать, отрисовать, посмотреть, исправить — при минимально возможной стоимости инференса. DeepSeek V4 Flash Vision Exp, первая мультимодальная разработка DeepSeek, сочетает контекстное окно на 1 млн токенов с максимальным объёмом вывода в 384 тыс. токенов и относится к зрению как к ещё одному входу, который агент читает на пути к завершению долгой задачи. Одна оптимизирована под то, насколько дёшево ей думать. Другая оптимизирована под то, как много она способна удержать, пока это делает.
Именно это различие, а не дельта в бенчмарке, должно определять выбор. У этих двух моделей нет общего протокола оценки, с которым можно было бы их сравнивать, и лишь у одной из них вообще есть независимый балл. Далее — честная картина противостояния: архитектурные ставки, характеристики, которые действительно расходятся, ситуация с бенчмарками, включая то, почему она так скудна, сколько стоит каждая, и какая из них в какой задаче выигрывает — плюс часть, где мы прямо скажем, какая из двух представлена в нашем каталоге.
Две ставки, сформулированные точно
Что касается Ling, то здесь ставка делается на разреженность активаций как основной рычаг управления затратами. Ling-3.0-flash-VL — это разреженная смесь экспертов (mixture-of-experts) с общим числом параметров 124B — в карточке модели указано около 124,8B, а в кулинарной книге SGLang описано 5,1B активных, тогда как карточка говорит примерно о 5,5B — работающая на 42-слойном гибридном стволе, который чередует Kimi Delta Attention с гейтированными блоками MLA в соотношении 5:1. Визуальный энкодер с произвольным разрешением и двухслойный MLP-проектор подают данные в этот ствол, а VideoRoPE отвечает за пространственное и временное позиционирование, чтобы видеокадры выстраивались в согласованном порядке. Архитектурное следствие — модель, которая на каждый токен требует лишь малую долю затрат плотной модели на 124B, и именно поэтому она оказывается на фронтире зависимости интеллекта от числа активных параметров.
Сторона DeepSeek — это ставка на контекст и выносливость агентов. DeepSeek V4 Flash Vision Exp берёт текстовую архитектуру DeepSeek-V4-Flash, добавляет визуальный энкодер и выравнивающий модуль, а затем продолжает обучение — один источник оценивает результат примерно в 305 млрд параметров, что DeepSeek подробно не подтвердила. Модель имеет контекстное окно в 1 048 576 токенов и максимальный вывод в 384 000 токенов, поддерживает вывод JSON, вызовы инструментов, Responses API, Anthropic API и продолжение по префиксу разговора, и DeepSeek чётко заявила, что это не модель ответов на визуальные вопросы. Это восприятие для агентов: чтение скриншотов веб-страниц, программных интерфейсов и графиков, а затем переход к вызовам инструментов. Изображения преобразуются в токены и тарифицируются как токены, с ограничением в 384 токена на изображение.
Прочитайте эти два абзаца вместе — и форма решения проявится. Если ваш рабочий сценарий — «посмотреть на это, что-то решить, действовать, посмотреть снова», то именно количество активных параметров Ling делает этот цикл доступным по затратам, а его дизайн визуальной обратной связи нацелен ровно на это. Если ваш рабочий сценарий — «прочитать этот 400-страничный документ с рисунками и продолжать», то контекстное окно DeepSeek — это и есть ключевая возможность, и ничто на стороне Ling не может с ним конкурировать.
Почему сравнение по бенчмаркам менее убедительно, чем кажется
Это тот раздел, который большинство сравнений пропускают, а его пропуск даёт таблицу чисел, которая ничего не значит. Вот каково реальное состояние доказательств.
Ling-3.0-flash-VL имеет одно независимое измерение: 25 в Artificial Analysis Intelligence Index v4.3, занявшее #2 место из 64 в своем размерном классе при медиане класса 8. В карточке производителя отдельно заявлено 42 по протоколу Intelligence Index v4.1.1, который является устаревшей шкалой и несопоставим — считайте 42 невоспроизведенным.
DeepSeek V4 Flash Vision Exp имеет вообще нет страницы на Artificial Analysis. Все опубликованные для него цифры — собственные данные DeepSeek из анонса выпуска, и некоторые из них явно указаны относительно Opus-4.8, а не фиксированного протокола. Это не критика цифр; это утверждение о том, что с ними можно делать. Нельзя поставить модель с независимой оценкой и модель, оценённую только поставщиком, в один столбец и объявить победителя, и любая страница, которая это делает, фабрикует результат.
Что правомерно — это сравнивать каждую модель с её собственными заявленными результатами, с приложенной информацией о происхождении:
• Ling-3.0-flash-VL, независимая оценка — Intelligence Index 25 на v4.3, #2 из 64 в классе, медиана класса 8, по данным Artificial Analysisbr /> • Ling-3.0-flash-VL, от производителя — 42 на устаревшем протоколе v4.1.1, и 1 441 против 1 440 у GPT-5.4 в Image-to-WebDev Arena под именем "linthium"; оба показателя от производителя, и разрыв в арене находится в пределах шума Elobr /> • DeepSeek V4 Flash Vision Exp, от производителя — Terminal Bench 2.1 83.9; DeepSWE 59.3 против 58.0 у Opus-4.8; Agents' Last Exam 27.3 против 25.7 у Opus-4.8; Toolathlon-Verified 75.9; Cybergym 75.3; Chartography 64.3; NL2Repo 57.7; DSBench-Hard 63.6; ZeroBench Pass@5 35.0; ApexBench Pass@1 36.5; AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp, независимая оценка — не опубликовано
Обратите внимание, из чего в основном состоит список DeepSeek: из оценок агентных возможностей и программной инженерии, а не из оценок компьютерного зрения. Собственная формулировка DeepSeek такова: на чисто текстовых задачах vision-модель показывает такие же результаты, как официальная DeepSeek-V4-Flash, без регрессии, а прирост достигается на мультимодальных агентных бенчмарках — где DeepSeek описывает результат как приближающийся к Opus-4.8, а не превосходящий его, и признаёт разрыв примерно в десять пунктов на структурированных задачах по data science и коду NL2Repo и DSBench-Hard. Это необычно осторожный набор заявлений, и он говорит о том, что модель продают как улучшение восприятия для существующего агентного стека, а не как новый потолок.

Характеристики, которые действительно различаются
По большей части обе спецификации совпадают: обе имеют открытые веса под лицензией MIT, обе принимают на вход текст и изображения и возвращают текст, обе поставляются с весами BF16 и квантованными сборками, для обеих опубликованы рецепты развёртывания, и обе так или иначе работают с видео. Расхождения сосредоточены в четырёх местах.
• Параметры — Ling-3.0-flash-VL содержит 124 млрд параметров всего при примерно 5,5 млрд активных на токен; DeepSeek V4 Flash Vision Exp, по сообщениям, около 305 млрд, при этом цифра активных параметров не опубликованаbr /> • Контекстное окно — Ling-3.0-flash-VL составляет 262 тыс. токенов по данным Artificial Analysis против 256 тыс., указанных в её собственной карточке модели; DeepSeek V4 Flash Vision Exp нативно работает с 1 048 576 токенамиbr /> • Максимальный вывод — Ling-3.0-flash-VL значительно короче, десятки тысяч токенов; DeepSeek V4 Flash Vision Exp достигает 384 000br /> • Обработка изображений — Ling-3.0-flash-VL принимает до 40 изображений на запрос размером до 16 384 × 784 пикселей каждое, только в формате base64; DeepSeek V4 Flash Vision Exp принимает base64, внешние URL или ссылку на Files API и ограничивает стоимость изображения 384 токенами на изображениеbr /> • Активные параметры — Ling-3.0-flash-VL активирует примерно 5,5 млрд на токен; DeepSeek V4 Flash Vision Exp не опубликовала цифру активных параметров
Строка, посвящённая работе с изображениями, — та, которую чаще всего недооценивают. Жёсткий лимит в 384 токена на изображение означает, что плотный график или полноэкранный скриншот сжимается примерно до того же бюджета, что и миниатюра, — это дёшево, но потери при этом важны для задач точного чтения. Подход Ling идёт в противоположную сторону: очень большой бюджет пикселей на изображение, передача только через base64 и, следовательно, гораздо более тяжёлая полезная нагрузка запроса. Что лучше, полностью зависит от того, что представляют собой ваши изображения: фотографии документов, которые нужно точно распознать, или скриншоты UI, которые нужно понять приблизительно.
Вторая недооценённая строка — максимальный объём вывода. Потолок Ling-3.0-flash-VL в десятки тысяч токенов подходит для цикла «описать, затем исправить» и ограничивает всё, что хочет выдавать крупный артефакт — длинный сгенерированный файл, полную перезапись документа, diff на несколько тысяч строк. Вывод DeepSeek в 384K существует именно потому, что его целевая рабочая нагрузка заканчивается крупным результатом вызова инструмента или сгенерированным артефактом. Если ваш конвейер ожидает, что модель вернёт что-то длинное, эта единственная строка решает исход сравнения ещё до того, как это сделает любой бенчмарк.
Цена и разница между бесплатным и без цены
У DeepSeek V4 Flash Vision Exp в нашем каталоге есть конкретная цифра: $0.24 за 1 млн входных токенов и $0.73 за 1 млн выходных токенов, при контекстном окне в 1 048 576 токенов и максимальном выводе в 384 000 токенов, доступна по адресу deepseek/deepseek-v4-flash-vision-exp. Это опубликованный тариф, оплачиваемый так же, как и текстовая V4-Flash, при этом изображения конвертируются в токены — до 384 на изображение. Это тариф, который можно вписать в таблицу.
У Ling-3.0-flash-VL её нет. На странице Artificial Analysis он указан как $0.00 за 1 млн входных токенов и $0.00 за 1 млн выходных токенов при медианных значениях у аналогов $0.14 и $0.40 — но это отражает бесплатный пробный период, действующий в Ling Studio от Ant, а не тариф. В документации Ant по мультимодальным моделям цена за токен для этой vision-модели не публикуется, так что нулевую цену не с чем сверить. Цена текстового «собрата» Ling-3.0-flash указывалась на уровне около $0.075 за 1 млн входных и $0.22 за 1 млн выходных токенов, а доменные релизы Ling от Ant запускались как бесплатные API, что позволяет предположить похожую итоговую картину — но предположение это не цена.
Сопоставьте их честно, и сравнение затрат будет таким: у одной модели есть тариф, у другой — промо-окно и правдоподобная догадка. Любой, кто утверждает, что Ling-3.0-flash-VL дешевле, чем DeepSeek V4 Flash Vision Exp, сравнивает бесплатную пробную версию с прайс-листовой ценой. Обоснованное утверждение состоит в том, что Ling-3.0-flash-VL, весьма вероятно, будет дешевле в расчёте на токен, когда цена появится, потому что 5,5 млрд активных параметров — это структурное преимущество, которое не сотрёт никакое изменение тарифа, — с той оговоркой, что многословность Ling-3.0-flash-VL частично его съедает. Artificial Analysis фиксирует, что она сожгла 160 млн выходных токенов в Intelligence Index, заняв 8-е место из 64 при медиане 84 млн и получив пометку «очень многословная». Вы платите за каждый выходной токен, поэтому модель, которая говорит почти вдвое больше, чтобы прийти к тому же ответу, возвращает часть того, что выигрывает за счёт разреженной активации.
Какой именно и для чего
Честное дерево решений сначала разветвляется по контексту и длине вывода, прежде чем разветвляться по чему-либо ещё, потому что именно по этим измерениям две модели не являются взаимозаменяемыми.
Выбирайте DeepSeek V4 Flash Vision Exp, когда ваша задача длинная и завершается артефактом: многосотстраничные документы с иллюстрациями, кодовые базы, читаемые от начала до конца, агентные циклы, которым нужно выдавать большой результат, рабочие нагрузки, где вы хотите передавать изображение по URL или через ссылку на Files API, а не в base64, и конвейеры, где вам нужен Responses API, продолжение по префиксу или опубликованный тариф за токен, под который можно планировать бюджет. Это также единственный из двух, чей вендор заявляет паритет со своей собственной текстовой моделью на текстовых задачах, что важно, если одна модель заменяет две в вашем стеке.
Выбирайте Ling-3.0-flash-VL, когда вашим ограничивающим фактором является стоимость одного вызова, а цикл короткий: автоматизация GUI, повторная проверка скриншотов, генерация фронтенда с циклом «отрендерить и исправить», точечная проверка медицинских или финансовых документов, где нужна высокая детализация на изображение и можно принять небольшой объём вывода. Число активных параметров — 5,5 млрд — это причина выбрать её, лицензия MIT — причина, по которой её безопасно разворачивать самостоятельно, а архитектура с циклом обратной связи по изображению нацелена ровно на паттерн «наблюдай — действуй — проверяй — исправляй». Учтите, что вы выбираете модель без объявленной цены со свободным путём входа и без каких-либо обязательств относительно того, что будет дальше.
А если вам на самом деле нужна одна модель, которая уверенно распознаёт изображения без обеих крайностей — ни трюка с разреженностью на 5,5 млрд, ни окна на миллион токенов — то ни одна из этих двух не является интересным ответом, и обычные vision-модели среднего уровня подойдут вам лучше и дешевле, чем любая из специализированных.
Запуск их, и где мы честно вписываемся
DeepSeek V4 Flash Vision Exp появилась в нашем каталоге. Вы можете вызывать её через OpenAI-совместимый эндпоинт OrcaRouter, указав строку модели deepseek/deepseek-v4-flash-vision-exp, с тем же ключом, который вы используете для всего остального, по опубликованному тарифу $0.24/$0.73 без каких-либо надбавок — цена провайдера передаётся напрямую, так что если DeepSeek снизит тариф, это дойдёт до вас в тот же день, а не при следующем продлении контракта. Если вы впервые выводите vision-модель в продакшен, то на уровне маршрутизации безопаснее начать именно с этой из двух, потому что можно настроить цепочку резервирования, чтобы при ошибке провайдера запрос повторился по другому маршруту ещё до того, как начнёт формироваться ваш ответ. Вряд ли кому-то хочется, чтобы первый продакшен-вызов vision-модели стал тем самым, который научит его, что бывает при отказе единственного провайдера.

Ling-3.0-flash-VL отсутствует в нашем каталоге, и мы не собираемся намекать на обратное. До него можно добраться через собственную платформу Ant, которая публикует эндпоинт, совместимый с OpenAI, и эндпоинт, совместимый с Anthropic, через бесплатный пробный доступ в Ling Studio и через открытые веса на Hugging Face, которые вы можете развернуть самостоятельно с помощью опубликованного рецепта SGLang или собственного форка vLLM от Ant. Одно, что стоит проверить, прежде чем вкладываться в этот путь: в примерах API от Ant используется идентификатор Ling-3.0-flash-VL-rc1, метка релиз-кандидата, и вопрос о том, совпадает ли отдаваемый чекпоинт с открытыми весами, публично не решён. Если вы проводите бенчмарки против хостируемого API, ожидая, что цифры перенесутся на самостоятельно развёрнутое развёртывание BF16, сначала проверьте это предположение.

Резюме, выдерживающее проверку: это не конкурирующие ответы на один вопрос. DeepSeek V4 Flash Vision Exp — это слой восприятия с длинным контекстом для агентов, с опубликованной ценой и таблицей бенчмарков от вендора, которая опирается на агентные оценки. Ling-3.0-flash-VL — это недорогая в обслуживании vision-модель с одной подлинно независимой оценкой, бесплатным тарифом без указанной цены и дизайном, нацеленным на короткие корректирующие циклы. Сопоставьте профиль вашей нагрузки с профилем модели, и тот факт, что только у одной из них есть независимая оценка на табло, должен влиять на то, сколько веса вы придаёте маркетингу другой.
Тот же ключ открывает доступ к остальной части каталога, и вы можете просмотреть полный каталог моделей, чтобы увидеть, что ещё находится за одним OpenAI-совместимым эндпоинтом.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
