
Ling-3.0-flash-VL против Ling 3.0 Flash: один мозг на 124B, теперь с глазами
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
Ling-3.0-flash-VL и Ling 3.0 Flash не соперники, и воспринимать эту пару как соревнование моделей — значит прийти к неверному выводу. Ling-3.0-flash-VL — это визуально-языковая контрольная точка, которую на этой неделе выпустила лаборатория inclusionAI из Ant Group: веса доступны на Hugging Face под лицензией MIT с 4 сентября 2026 года. Она построена непосредственно на базе Ling 3.0 Flash — текстовой модели лаборатории с открытыми весами на 124 миллиарда параметров, которая с конца июля является основой быстрого уровня сервисов. Обе модели используют одну и ту же гибридную линейную архитектуру MoE, ту же экономику разреженной активации, тот же рецепт обслуживания с контекстом 256K и ту же лицензию MIT. Что добавляет VL-контрольная точка, так это то, чего у текстовой модели никогда не было: встроенный ввод изображений и видео, реализованный через энкодер ViT, двухслойный проектор MLP и временное кодирование VideoRoPE. Таким образом, сравнение сводится к одному практическому вопросу — если ваша рабочая нагрузка никогда не сталкивается с картинками, заслуживает ли перехода модель, у которой есть глаза?
Причина, по которой этот вопрос вообще стоит задать, заключается в том, что inclusionAI не позиционирует Ling-3.0-flash-VL как отдельную линейку продуктов. В карточке модели она называется «нашей следующей нативной мультимодальной моделью», построенной на Ling-3.0-flash и наследующей языковые способности, рассуждение и работу с длинным контекстом этой модели, а также расширяющей их зрением, которое участвует в полном цикле понимания, рассуждения, действия и проверки, — а не зрением как дополнительным входом. Для семейства моделей, чей более ранний флагманский выпуск был явно текстовым, это реальный сдвиг, и он меняет то, на какую контрольную точку следует ориентироваться команде, работающей с текстом и инструментами.
Две контрольные точки, один базовый каркас
Ling 3.0 Flash, соперник в этом сравнении, является более зрелой моделью из этой пары. Анонсированная в конце июля 2026 года и опубликованная с открытым исходным кодом под лицензией MIT 7 августа, она представляет собой гибридную линейную модель со смесью экспертов с 124B общих параметров и примерно 5.1B активных на токен — 35 слоёв KDA и 7 слоёв Gated MLA, сложенных в соотношении 5:1, 512 маршрутизируемых экспертов с 8 активируемыми, нативный контекст 256K, обслуживаемый в объёме 262 144 токенов. Она работает только с текстом, поддерживает вызов инструментов, мышление включено по умолчанию через шаблон чата, и у неё необычно низкая стоимость для её размера. Также именно она является документированной половиной пары: Artificial Analysis включает её в свой живой рейтинг, где она занимает первое место среди 63 моделей своего класса, и зафиксировал выходную скорость примерно 313 токенов в секунду через API поставщика.
Ling-3.0-flash-VL сохраняет эту архитектуру и добавляет поверх визуальный стек. В карточке описан визуальный энкодер ViT, чьи признаки выравниваются в текстовое пространство двухслойным MLP-проектором, а VideoRoPE кодирует и пространственное положение, и временной порядок, чтобы модель могла выполнять локализацию событий и рассуждения по длинным видео. Основой остаётся тот же гибрид KDA-to-MLA с соотношением 5:1, на этот раз в объёме 124B суммарно / 5.5B активных на токен, с 42-слойным корпусом. Входные данные — текст, изображение и видео; вывод — текст. Контекст заявлен до 1M токенов, при этом рекомендованный рецепт SGLang обслуживает 256K через масштабирование YaRN. Как и текстовый собрат, она по умолчанию включает режим рассуждений (отключается по запросу с помощью chat_template_kwargs) и работает либо под SGLang, либо под кастомным форком vLLM от inclusionAI. Релиз BF16 занимает около 250 ГБ на диске в 64 шардах safetensor — тот же класс в четверть терабайта, что и веса текстовой модели.
Насколько это свежо? На момент написания репозиторий VL имеет всего несколько десятков загрузок, его карточка модели всё ещё обновлялась, а Artificial Analysis ещё не включил его в список. Всё, что ниже не приписано явно Artificial Analysis, является собственным отчётом inclusionAI.

Табло
Асимметрия здесь — не качество, а модальность. Шесть измерений охватывают решение:
• Интеллект (карточка вендора, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, по данным вендора. Ling 3.0 Flash: 38 — более раннее значение индекса, которое приводит карточка.
• AA live board на сегодня (v4.3) — Ling-3.0-flash-VL: пока нет в списке. Ling 3.0 Flash: оценочно 25-е место; в своём классе — №1 из 63.
• Входные данные — Ling-3.0-flash-VL: текст, изображения и видео. Ling 3.0 Flash: только текст.
• Контекст — оба заявляют до 1M токенов; оба фактически обслуживаются на 256K (262 144) сегодня.
• Цена — Ling-3.0-flash-VL: официальной цены пока нет; только открытые веса по лицензии MIT. Ling 3.0 Flash: около $0,07 за 1 млн входных токенов и $0,22 за 1 млн выходных токенов в собственном API поставщика.
• Выбирайте модель: Ling-3.0-flash-VL — для документов, скриншотов, диаграмм, видео и GUI-агентов. Ling 3.0 Flash — для вызовов инструментов при интенсивной работе с текстом и длительных агентных конвейеров.

Табло, в которое текстовая модель не может войти.
Именно здесь они по-настоящему расходятся, и это расхождение структурное, а не конкурентное: на бенчмарках изображений и видео только текстовый Ling 3.0 Flash вообще не представлен, потому что не может принимать такие входные данные. Собственная таблица Ling-3.0-flash-VL — оценка inclusionAI, не воспроизведённая независимо, частично проведённая внутри компании, а частично против API конкурентов в официальных условиях тестирования — публикует числа по трём категориям, которые карточка модели выделяет. В понимании сложных изображений модель показывает MMMU-Pro 79.0 и MathVision 84.87, при этом значительно более низкие 19.88 на Humanity's Last Exam-Multimodal отражают, насколько сложен этот набор для всех. В работе с документами и графиками она сильна: OmniDocBench1.5 — 91.35 и CharXiv_RQ — 81.30. А в агентно-мультимодальных наборах, которые делают этот релиз интересным — ClawEval-MM 59.9, WebVoyager 90.83, Vision2Web 57.69, — ей предлагается прочитать интерфейс и действовать на его основе, а это именно та задача GUI-агента, которую текстовая модель выполнить не может.
Если прочитать их в контексте, вырисовывается целостная картина: это не модель, нацеленная на победу в викторинах по изображениям, а модель, нацеленная на превращение пикселей в действие — считывать макет, следовать за графиком, выполнять действия на странице. На собственной диаграмме вендора она возглавляет тройное сравнение (Qwen3.8-27B с высоким уровнем рассуждений, Gemini 3.5 Flash-Lite и Kimi-K2.6) на OmniDocBench, WebVoyager и ClawEval-MM, но уступает на сложных наборах знаний и рассуждений вроде MathVision и HLE-MM. Ко всем этим цифрам стоит относиться как к заявлениям inclusionAI, пока их не подтвердит независимая лаборатория, — но направление настройки ясно и последовательно.
Единственное число, о котором стоит поспорить: 42 против 38
С наибольшей вероятностью команду, работающую только с текстом, побудит переключиться именно утверждение из заголовка: inclusionAI сообщает, что Ling-3.0-flash-VL набрал 42 балла в Artificial Analysis Intelligence Index (v4.1.1) — на четыре пункта выше 38 баллов, которые тот же inclusionAI приписывает Ling 3.0 Flash в той же версии индекса. Обратите внимание, что именно измеряет этот индекс: его сводная метрика v4.1.1 опирается на текстовые и агентные наборы тестов — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam и тому подобное, и ни один из них не является задачами на изображения. Итак, вендор утверждает, что добавление визуального обучения к общей базовой модели улучшило текстовый интеллект модели на четыре пункта, а не просто позволило ей описывать картинки. Это поразительное и вполне правдоподобное утверждение — мультимодальная настройка на инструкциях обычно повышает текстовые способности.
Две оговорки по источникам удерживают эту цифру в пропорции. Первая: 38 — это показатель более ранней версии индекса: Artificial Analysis с тех пор перевела свою публичную таблицу на новую версию индекса (v4.3), где сейчас Ling 3.0 Flash указывается с оценочным значением около 25, хотя модель по-прежнему занимает первое место среди 63 моделей своего класса. Пара 42 против 38 от самого вендора относится к старой шкале, так что её не следует читать как «на четыре пункта выше того, где AA оценивает текстовую модель сегодня». Вторая: 42 — это собственная цифра inclusionAI для модели, которой ещё нет в списке Artificial Analysis, а inclusionAI не публиковала результаты контрольной точки VL по отдельным текстовым наборам (SWE-Bench, Terminal-Bench), которые выделены на её собственной диаграмме текстовых моделей. Четыре пункта — это ровно такой прирост, который стоит воспроизвести, прежде чем на его основании переносить конвейер, работающий только с текстом.

Цена: у одного есть указанная цена, а у другого — нет.
Сейчас в сравнении стоимости участвует только одна цена. Модель Ling 3.0 Flash доступна для вызова через собственный API вендора уже сегодня: примерно $0,07 за 1 млн входных токенов и $0,22 за 1 млн выходных. Цены установлены вендором и подтверждены в листинге Artificial Analysis; кэшированный ввод стоит дешевле, а скидки периода запуска уже закончились. У модели Ling-3.0-flash-VL нигде нет опубликованной цены API; вы пока не можете оплачивать её по токенам. Если она нужна вам на этой неделе, придется развернуть её самостоятельно: веса под лицензией MIT, примерно 250 ГБ в BF16, на том же классе аппаратного обеспечения, что уже требуется текстовой модели, — 4 GPU по 141 ГБ (H20-3e или H200), либо узел Blackwell с 4 GPU при тензорном параллелизме 4, либо 8 GPU по 80 ГБ H100/H800 при TP8.
Это переосмысляет экономику для команды, работающей только с текстом. Если вы покупаете токены, текстовая модель по $0.07/$0.22 — дёшева и проверена. Если вы уже самостоятельно хостите текстовую модель на 124B параметров, VL-чекпойнт — это не вторая покупка инфраструктуры, а ещё ~250 ГБ весов на том же классе машин; такое оправдано только нагрузками, которые действительно потребляют пиксели. Модель с глазами окупает себя только тогда, когда глаза находятся в контуре.
Кто должен выбирать
• Только текст и большие объёмы — оставайтесь на Ling 3.0 Flash. Вы получаете проверенную модель с рейтингом AA, реальную цену за токен и отлаженный вызов инструментов. Прирост в четыре пункта по индексу у VL-модели не воспроизведён, а её пропускная способность при работе с текстом не измерена; доказательств того, что она лучше как текстовая модель, пока нет — есть лишь утверждение об этом.
• Визуальное восприятие входит в цикл — документы, скриншоты, диаграммы, фотографии, видеокадры или интерфейс, который ваш агент должен читать и по которому кликать. Ling-3.0-flash-VL — очевидный выбор, потому что это та же самая известная вам базовая модель рассуждений с добавленным стеком компьютерного зрения, а не отдельная мультимодальная модель, которую нужно переоценивать с нуля.
• Смешанный трафик, решение не принято — низкорискованный шаг: оставить доступными обе модели и маршрутизировать по запросу, а не перестраивать архитектуру вокруг одной из них. Именно это свойство и даёт модельный шлюз: один API для более чем 200 моделей, передача цен провайдеров без наценки (0%) и автоматическое переключение при деградации провайдера. Ни один из чекпойнтов Ling пока не подключён к эндпоинту OrcaRouter — у текстовой модели указана цена вендора, а у VL-модели вообще нет цены на размещение, — но когда у VL появится такая цена, перевод части трафика на неё и измерение результатов станут изменением конфигурации, а не интеграционным проектом.
Чего всё ещё не хватает
• Независимый прогон Ling-3.0-flash-VL на текущем Artificial Analysis Intelligence Index — 42 это цифра, которую inclusionAI приводит для более ранней версии индекса.
• Цена любого размещённого API для модели VL — самое большое препятствие для повседневного использования.
• Опубликованы текстовые сплиты (SWE-Bench Pro, Terminal-Bench 2.1) для VL-контрольной точки, чтобы команда, работающая преимущественно с текстом, могла убедиться, что стек компьютерного зрения не обошёлся ей ничем.
• Сквозная задержка или пропускная способность для VL при обработке изображений — скорость текстовой модели измеряется, а скорость визуальной модели — нет.
• Нейтральное подтверждение графика vision-бенчмарка, часть испытаний которого проводилась на собственном стенде inclusionAI; как минимум один внутренний бенчмарк также запланирован к выпуску позднее.
Вердикт
Это не соревнование по качеству моделей; это решение о модальности, к которому приложено заявление из четырёх пунктов. Если на входе у вас текст, оставайтесь на Ling 3.0 Flash: он дешевле, входит в список AA и протестирован, а преимущество VL-модели над ним сейчас — лишь цифра от вендора по более старой индексной шкале. Если ваши задачи начинаются с экрана — страница документа, скриншот, диаграмма, видеокадр, графический интерфейс, которым ваш агент должен управлять, — Ling-3.0-flash-VL — это тот же мозг на 124B, который вы уже знаете, но теперь он умеет видеть; это действительно новая опция, которой ещё неделю назад не было в быстром тарифе Ling. Внедряйте её там, где зрение действительно нужно, проверьте цифру 42, прежде чем переносить что-либо на её основе, и сохраняйте выбор обратимым на уровне маршрутизации, пока не появятся независимая оценка и публичная цена.
