
Ling-3.0-flash-VL: визуальная модель Ant с 5,5 млрд активных параметров занимает 25-е место в Intelligence Index
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
У Ling-3.0-flash-VL теперь есть показатель бенчмарка, который никто в Ant Group не набирал вручную, и именно в этом новость. Первая нативно мультимодальная модель из лаборатории inclusionAI компании Ant получила оценку 25 в Artificial Analysis Intelligence Index — это независимый прогон по текущей шкале v4.3, опубликованный вместе со страницей модели, где перечислены её скорость, задержка и цена. Он появился через три недели после того, как в собственной карточке модели от вендора было заявлено 42 по тому же индексу, и самое полезное, что может сделать читатель с этими двумя числами, — понять, почему они не противоречат друг другу: Ant измеряла по протоколу Intelligence Index v4.1.1, Artificial Analysis измеряла по v4.3, а это разные линейки, построенные на разных наборах оценок. Число от вендора не столько не выдержало контакта с третьей стороной, сколько было заново снято по шкале, которой не существовало, когда его записывали.
Модель, лежащая в основе оценки, — это разреженная смесь экспертов с 124 млрд общих параметров и примерно 5,5 млрд активных на токен, выпущенная под лицензией MIT с весами BF16 и FP8, принимающая текст, изображения и видео и возвращающая текст. Эта цифра активных параметров — и есть весь аргумент в пользу этой штуки. При 5,5 млрд активных параметров Ling-3.0-flash-VL находится на том, что стало самой интересной кривой в открытых моделях — фронтире интеллекта, отложенном по активированным параметрам, а не по общему размеру, — и она там потому, что выполняет приличный объём работы на единицу вычислительных затрат на инференс, а не потому, что она огромна.
В этом материале рассказывается о том, что на самом деле вышло и когда, что говорит независимый прогон, почему заявление о Парето-оптимальности выдерживает проверку лучше большинства, сколько стоит модель и где её на самом деле можно вызвать. Коротко, для тех, кому нужно только это: Ling-3.0-flash-VL реально существует, имеет открытые веса, необычно дешёва в обслуживании, измеримо выше среднего для своего размерного класса и заметно более многословна и медленнее доходит до релиза, чем предполагает сырой балл. Заявленная производителем оценка 42 так и не была независимо воспроизведена и не сопоставима с 25, которые сейчас в таблице.
Что на самом деле вышло, и хронология, которую постоянно упрощают
Coverage of this release tends to collapse several separate events into one launch date, and the dates matter because they explain why early write-ups described a model that nobody outside Ant could score. The Hugging Face repository inclusionAI/Ling-3.0-flash-VL was created on September 4, 2026 — 64 shards of BF16 weights, an MIT license, a custom-code stack for the bailing_moe_v3_vl architecture, and, for a few days, almost nobody downloading it. The FP8 quantization followed on September 8, roughly 126 GB across 64 shards, with the vision tower kept at higher precision than the expert weights. Artificial Analysis lists the release as September 10, 2026, which is the date its own page anchors to, and the model page carrying the score went live around then.
Итак, «выпущена в сентябре 2026 года» — это точно, но бесполезно. Практическая последовательность была такой: веса — 4-го, второй формат точности — 8-го, независимое измерение — 10-го. Причина, по которой это важно, в том, что модель с весами на диске, но без размещённой конечной точки и без оценки от третьей стороны для большинства команд ещё не является тем, что можно оценить, — это загрузка, под которую нужно готовить инфраструктуру. Ling-3.0-flash-VL перешла эту черту, когда появились и API, и независимая оценка.
Поддержка сервинга появилась вместе с весами, а не после них. Ant опубликовала руководство по развёртыванию SGLang и поддерживает настроенный под Ling форк vLLM для этой архитектуры — ту часть открытого релиза, которая обычно отстаёт на недели. Здесь она не отстала.
Число на табло и то, что на карточке
Вот независимая картина от Artificial Analysis — единственное стороннее измерение этой модели, которое на данный момент существует:
• Индекс интеллекта — 25 на v4.3, занимает 2-е место из 64 в своём размерном классе при медиане по классу 8br /> • Всего параметров — 124 млрдbr /> • Активные параметры — 5,5 млрд на токенbr /> • Скорость вывода — 142,9 токенов/с, 10-е место из 64, при медиане среди аналогов 105,1br /> • Время до первого токена — 2,21 секунды, при медиане среди аналогов 2,29br /> • Контекстное окно — 262 тыс. токенов по данным Artificial Analysis против 256 тыс., указанных в самой карточке моделиbr /> • Лицензия — MIT, открытые веса
А вот и вендорская цифра, рядом с которой её так часто печатают: 42 по протоколу Artificial Analysis Intelligence Index v4.1.1, на четыре балла выше того, что набрала текстовая Ling-3.0-flash на том же протоколе. Это утверждение есть в карточке модели, для него не опубликовано никаких следов оценки, и это не та цифра, которую сообщает Artificial Analysis. Одновременно верны две вещи: 42 не воспроизведена, и это не свидетельство чего-либо нечестного, потому что v4.1.1 и v4.3 измеряют не одно и то же. Artificial Analysis пересмотрела свой индекс в сентябре 2026 года и заново оценила всю свою таблицу; v4.3 включает десять оценок, в том числе AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 и Humanity's Last Exam. Любая статья, которая до сих пор цитирует 42 рядом с 25, не называя версию, сравнивает два разных теста и называет это падением.

Деталь, которую стоит отметить помимо заголовочного результата, — это многословность. Artificial Analysis фиксирует, что Ling-3.0-flash-VL тратит 160M выходных токенов на прохождение Intelligence Index, занимая 8-е место из 64 при медиане 84M, и помечает её как «очень многословную». Для модели, чья заявка — дешёвый инференс за счёт малого числа активных параметров, это бьёт прямо по заявке. Вы платите за токен, а не за параметр. Модель, которая активирует 5,5B, но выдаёт почти вдвое больше токенов, чем медиана, чтобы ответить на те же вопросы, частично возвращает это структурное преимущество обратно на кассе — а это ровно тот эффект, который скрывает таблица цен за токен и обнажает измерение стоимости за задачу.
Утверждение Парето, слегка проверенное на прочность
Утверждение о том, что Ling-3.0-flash-VL находится на границе Парето «интеллект — активные параметры», необычно: независимые данные его подтверждают, а не просто допускают. Медиана по классу в этом индексе — 8; Ling-3.0-flash-VL набирает 25; и делает это, активируя 5,5 млрд параметров на токен. Для команд, чьим жёстким ограничением является пропускная способность, доступная для обслуживания, — один ускоритель, фиксированный бюджет запросов, развёртывание на периферии, — это соотношение решает всё, и это по-настоящему сильный результат.
Две оговорки не позволяют считать это чистой победой. Первая — расхождение в количестве параметров: в карточке модели указано примерно 5,5 млрд активных параметров, тогда как в сборнике рецептов SGLang описана модель с 5,1 млрд активных параметров. Оба — документы Ant, разница невелика, и она слегка меняет форму кривой, а не её направление. Вторая — «фронтир» — это относительное утверждение об области, которая меняется каждую неделю. Быть лучшим по интеллекту на активный параметр при заданном размере — это позиция, которую удерживаешь, пока не выйдет следующая модель в этом диапазоне, а в этом диапазоне тесно.
Собственная главная демонстрация вендора — то, что Ling-3.0-flash-VL, выступая на Image-to-WebDev Arena под ником «linthium», набрала 1,441 против GPT-5.4 с его 1,440 — должна восприниматься скорее как приём для привлечения внимания, чем как результат. Разрыв в одно очко находится в пределах шума аренного Elo, к тому же он заявлен самим вендором, и это не тот разрыв, который что-либо решает. Заявление о возможностях за этим интереснее самой цифры: модель построена для цикла визуальной обратной связи, в котором она генерирует фронтенд-код по макету, рендерит собственный результат, смотрит на рендер и исправляет — наблюдать, действовать, проверять, исправлять, а не один раз описать и остановиться.

Во что это обходится — а это не так очевидно, как кажется
На странице Artificial Analysis указано, что Ling-3.0-flash-VL стоит $0.00 за 1 млн входных и $0.00 за 1 млн выходных токенов, тогда как медианные показатели у аналогов составляют $0.14 и $0.40. Это не цена. Это лишь её видимость. Artificial Analysis назначает цену для того эндпоинта, который видит, а эндпоинт, который он видит, бесплатен: модель работает в Ling Studio от Ant в режиме бесплатного пробного доступа, и именно бесплатный промо-доступ и отражается в листинге. Собственная мультимодальная документация Ant вообще не публикует цену за токен для этой визуальной модели, так что сверить ноль с прайс-листом вендора невозможно. Для понимания масштаба: текстовый «собрат» Ling-3.0-flash фигурировал в листингах примерно по $0.075 за 1 млн входных и $0.22 за 1 млн выходных токенов, а доменно-специфичные варианты Ling от Ant тоже запускались как бесплатные API.
Treat the zero as a testing window rather than a tariff. Free tiers on freshly released models are a customer-acquisition instrument, and the honest planning assumption is that Ling-3.0-flash-VL will eventually carry a price somewhere in the neighbourhood of its text sibling. There is also a live ambiguity the arrival of a paid endpoint will not resolve: Ant's own API examples use the model identifier Ling-3.0-flash-VL-rc1, a release-candidate marker, and it remains unclear whether the served checkpoint is byte-identical to the September 4 open weights. If you are benchmarking your own prompts against the hosted API and expecting the results to transfer to a self-hosted BF16 build, that is an assumption you should test before you build on it.
Картина затрат переворачивается в зависимости от того, на какой стороне вы находитесь. Для команды, у которой уже есть ускорители, сборка FP8 объемом примерно 126 ГБ помещается в узел из восьми ускорителей класса 80 ГБ, а количество активных параметров 5,5 млрд означает, что вы платите амортизированную стоимость этого узла за очень малый объем вычислений на токен — самая дешевая возможная версия этой модели — та, которую вы обслуживаете сами. Для команды без ускорителей вопрос в том, появится ли платный эндпоинт до закрытия бесплатного тарифа.
Где вы действительно можете позвонить, включая ту часть, где мы говорим «нет».
Ling-3.0-flash-VL is reachable through Ant's own platform — an OpenAI-compatible endpoint at api.ant-ling.com/v1/chat/completions and an Anthropic-compatible one alongside it — plus free trial access on Ling Studio, plus open weights you can serve yourself. Independent gateways have begun listing it as well, and that is genuinely the fastest way to try it without provisioning anything.
The thing worth stating plainly is that OrcaRouter does not route Ling-3.0-flash-VL today. It is not on our model catalogue, so anything you read here about calling it through us would be fiction, and we would rather you knew that up front. What we do route is the vision model most directly comparable to it: DeepSeek V4 Flash Vision Exp, DeepSeek's experimental multimodal build, which is live on our catalogue with a 1M-token context window and a published rate. If your actual requirement is a capable vision model behind one OpenAI-compatible endpoint — with a fallback chain configured so a provider hiccup retries before your response starts, and provider list pricing passed through with nothing added on top, so a vendor price change reaches you the same day it lands — that is the model to try first while Ling-3.0-flash-VL remains off-catalogue.

Что смотреть отсюда
Три вещи определят, будет ли этот релиз выглядеть значимым через полгода. Первая — второй независимый прогон: одна оценка от одного оценщика — это лишь одна точка данных, и интересный вопрос в том, сохранится ли позиция Ling-3.0-flash-VL на кривой «интеллект — число активных параметров» при другом испытательном стенде. Вторая — реальное ценообразование. Пока Ant не опубликует тарифную сетку для vision-модели, любое сравнение затрат с её участием — это оценка, переодетая в число, а бесплатный уровень выполняет работу, которую иначе выполняла бы цена. Третья — разница в качестве FP8: в той сборке vision-башню намеренно держали на более высокой точности, чем веса экспертов, и совпадает ли квантованная версия с BF16 на мелкозернистых визуальных задачах — именно тот вопрос, который всплывает только когда люди запускают её в продакшене, а не бенчмаркают.
Вердикт, доступный сегодня, уже́, чем подразумевалось в материалах о запуске, и полезнее, чем одна только оценка. Ling-3.0-flash-VL — это настоящая, лицензированная по MIT, самостоятельно размещаемая модель компьютерного зрения, которая активирует лишь малую часть своих 124B параметров, набирает 25 баллов в текущем независимом индексе при медиане класса 8 и отчасти отдаёт это преимущество обратно из-за многословности. Это хорошая модель с честной формой. 42 на карточке — это число с линейки, которой больше не существует.
