
Ling-3.0-flash-VL: Ant открывает мультимодальную модель в быстрой линейке Ling
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
{{1}}4 сентября 2026 года лаборатория inclusionAI компании Ant Group опубликовала на Hugging Face веса Ling-3.0-flash-VL под лицензией MIT и в тот же день обновила документацию для разработчиков платформы Ant Ling, приведя её в соответствие.{{/1}} Ling-3.0-flash-VL — первый чекпойнт с поддержкой зрения в семействе Ling-3.0-flash: та же разреженная смесь экспертов примерно на 124 миллиарда параметров, которая сделала текстовую версию Ling-3.0-flash одной из самых обсуждаемых недорогих моделей рассуждения конца лета, теперь читает не только текст, но и изображения и короткие видеоклипы. {{2}}FP8-квантование последовало 8 сентября — утром, когда пишется этот текст.{{/2}} Так что за четыре дня у релиза появились три направления, через которые читатель может с ним работать, — открытые веса, официальный API на платформе Ant Ling и заявленный поставщиком результат 42 по протоколу Artificial Analysis Intelligence Index версии 4.1.1, на четыре пункта выше независимо измеренных 38 у родственной текстовой версии. {{3}}Чего у него пока нет — так это официального анонса: карточка на Hugging Face и руководство для разработчиков и есть весь запуск, поэтому в этом материале мы отделяем то, что заявляет поставщик, от того, что может проверить сторонний наблюдатель.{{/3}}
Релиз важен тем, что он делает с продуктовой картой Ant. К середине 2026 года мультимодальные разработки в портфеле моделей Ant находились в отдельной линейке Ming, а Ling-3.0-flash позиционировался — в том числе и в собственном объяснении этого блога для текстовой модели — как быстрый уровень для текста и инструментов, предназначенный для агентов, программирования и глубоких исследований. Ling-3.0-flash-VL разрушает эту границу: он привносит визуальную информацию в модель рассуждений, построенную вокруг необычно малого объёма активируемых параметров и длительных агентных сессий, и передаёт результат разработчикам сразу тремя способами. Это делает его совершенно иным решением по сравнению с более ранними предметно-ориентированными вариантами (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), которые были выпущены как бесплатные API без весов. Эта модель открытая, работает на платной платформе Ant и настолько новая, что никто за пределами вендора ещё не опубликовал независимый запуск. Последний факт — самый важный в этой статье.
Что и когда вышло
Каждая указанная ниже дата может быть проверена по репозиториям и документации; ни одна из них не опирается на несуществующий пресс-релиз.
• 4 сентября — репозиторий Hugging Face inclusionAI/Ling-3.0-flash-VL был создан в 15:24 UTC с 64 шардами весов в формате bf16, полным стеком кастомного кода для bailing_moe_v3_vl архитектуры, шаблоном чата с включённым по умолчанию мышлением и лицензией MIT. На момент написания количество загрузок исчисляется десятками: такой релиз в первый день поймал бы только тот, кто следит за репозиториями.
4 сентября — портал разработчиков Ling-platform компании Ant добавил учебное пособие по мультимодальному пониманию, документирующее модель в официальном API (собственная пометка «последнее обновление» на странице указывает 4 сентября 2026 года). На следующий день китайские разработческие СМИ сообщили об этой возможности, представив её как понимание изображений и коротких видео для визуальных вопросов-ответов и анализа контента.
• С 5 сентября — поддержка обслуживания и развертывания появилась быстро: поваренная книга по развертыванию SGLang для модели, кастомный форк vLLM, поддерживаемый организацией inclusionAI, и запись в библиотеке развертывания с собственными весами (bring-your-own-weights) с готовой конечной точкой chat-completions. Это среды выполнения и инфраструктура, а не анонсы, но они говорят вам, что модель создавалась для обслуживания, а не просто для публикации.
• 8 сентября — FP8-квантизация inclusionAI/Ling-3.0-flash-VL-fp8 появилась (64 шарда, ~126 ГБ), при этом визуальная башня намеренно сохранена в более высокой точности, а веса MoE сжаты до FP8 E4M3. Для самостоятельного размещения на меньшем количестве или менее мощных GPU именно эту контрольную точку скачает большинство пользователей.

Приведённая выше карточка — самое близкое к анонсу, что есть в этом релизе: описание модели, архитектура, ссылки на рецепты SGLang и vLLM — и никаких других объявлений, которые мы смогли найти. Обратите внимание на несоответствие, о котором стоит сказать сразу: в карточке модели указано, что «активируется только 5,5 млрд параметров на токен», тогда как в кулинарной книге SGLang, написанной примерно в то же время, описывается модель с «5,1 млрд активных» параметров. Для совершенно нового чекпоинта разница, скорее всего, объясняется учётом vision-башни, а не двумя разными моделями, но это как раз та деталь, которую следует пометить как нерешённую, а не сгладить.
Модель на 124B с активацией 5.5B — теперь с глазами
Ling-3.0-flash-VL сохраняет рецепт гибридного разреженного MoE, который определил текстового собрата. В карточке описывается 42-слойный бэкбон с чередованием слоёв Kimi-Delta-Attention и Gated-MLA в соотношении 5:1 — тот же структурный ритм, что и у Ling-3.0-flash, — с общим числом параметров около 124,8 миллиарда, при этом на каждый токен активируется лишь небольшая их доля. Новым является стек восприятия: визуальный энкодер ViT, подающий данные через двухслойный проектор MLP в языковой бэкбон, а также VideoRoPE для кодирования пространственной и временной позиции, благодаря чему видеокадры поступают в порядке, который модель может осмыслить. Входные данные — текст, изображение и видео; выходные — текст.
• Параметры — всего 124B, ~5.5B активируется на токен согласно карточке вендора (см. примечание об учёте выше).
Контекст — заявлено как «{{1}}до 1M токенов{{/1}}»; существующие сегодня рецепты развертывания используют {{2}}256K с помощью масштабирования YaRN rope{{/2}}, что является честной практической цифрой, на которую стоит ориентироваться, пока кто-то не опубликует проверенный более длинный прогон.
• Thinking — режим рассуждений включён по умолчанию через чат-шаблон; как официальные примеры API, так и рецепты развёртывания показывают переключатель enable_thinking: false, задаваемый для каждого запроса при вызовах, чувствительных к задержке.
— Лицензия — MIT, оба формата точности, без оговорок. Это та же чистая лицензия, которая сделала августовское открытие исходного кода текстовой модели примечательным, и именно она является единственной причиной, по которой самостоятельный хостинг — реальный вариант, а не серая зона.
Замысел разработки важен не меньше, чем технические характеристики. Ant позиционирует Ling-3.0-flash-VL как модель, которая {{1}}«привносит визуальную информацию в полный процесс понимания, рассуждения, действия и верификации»{{/1}} — а это язык агентных рабочих нагрузок, а не подписей к изображениям. {{2}}Модель, способная просмотреть 30-секундную запись экрана, удерживать в контексте длительную сессию вызова инструментов и сохранять стоимость активации на уровне около 5 млрд параметров, нацелена непосредственно на агентов компьютерного использования и агентов, работающих с короткими видео.{{/2}} {{3}}Это совершенно иной продукт, чем модели «зрение-язык», оптимизированные для ответов на вопросы по одному изображению, и именно в этой рамке следует рассматривать все приведённые ниже бенчмарки.{{/3}}
Что на самом деле принимает официальный API
Документация платформы Ant Ling описывает Ling-3.0-flash-VL для двух форм API: конечная точка, совместимая с OpenAI, по адресу api.ant-ling.com/v1/chat/completions и совместимая с Anthropic — по адресу api.ant-ling.com/anthropic/v1/messages. Прежде чем создавать решение на её основе, стоит знать об ограничениях:
• Изображения — только JPEG и PNG, только в формате base64, до 40 изображений на запрос, каждое изображение — до 16 384 × 784 пикселей, а каждая base64-строка — до 32 МБ. OpenAI-совместимый image_url.detail-параметр игнорируется; движок сам определяет разрешение.
• Видео — MP4, MOV или WMV, один клип на запрос, длительностью не более 30 секунд, с фиксированной частотой 2 кадра в секунду (до 32 кадров), в формате base64 объёмом до 32 МБ. Видео работает только на OpenAI-совместимом эндпоинте; Anthropic-совместимый эндпоинт принимает текст и изображения, но не видео.
• Идентификатор модели — в примерах curl из руководства модель называется Ling-3.0-flash-VL-rc1, а не Ling-3.0-flash-VL. Этот -rc1 суффикс — это маркер кандидата в релизы и действительно открытый вопрос: нигде в документации не сказано, какие веса обслуживает платформа и соответствует ли контрольная точка API сборке открытых весов от 4 сентября. Если вы оцениваете API по сравнению с открытыми весами, это первое, что нужно проверить, а не предполагать.

На странице выше описаны ограничения входных данных: форматы изображений и видео, лимиты на запросы и два варианта конечных точек. Также там подтверждается, что модель — это действующий коммерческий API-сервис, а не заглушка, существующая только в документации.
Цифры — и кто их сообщил

Главное число на карточке — 42 по протоколу Artificial Analysis Intelligence Index версии 4.1.1, которое, по словам Ant, на четыре пункта опережает результат текстовой модели Ling-3.0-flash, равный 38. Различие в этом предложении имеет решающее значение. 38 — это измерение Artificial Analysis: проведено независимо, опубликовано в их лидерборде и одобрительно цитируется в отраслевых обзорах текстовой модели. 42 — это утверждение на собственной карточке модели от Ant, сделанное по протоколу индекса AA, но ещё не опубликованное Artificial Analysis, у которой на момент написания не было страницы для Ling-3.0-flash-VL. Никто за пределами Ant ещё не запускал эту контрольную точку. Относитесь к 42 как к цифре от вендора из того же семейства, которое дало подлинные 38 для текстовой модели, — это повод присмотреться, а не число, которое можно цитировать как установленный факт.
Всё остальное в релизе носит качественный или методологический характер. В карточке модель описывается через диаграмму способностей «понимать, рассуждать, действовать» и упоминается агентная оценка Terminal-Bench, проведённая по протоколу в стиле AA, однако числовых текстовых результатов, которые мы могли бы воспроизвести здесь, не публикуется; в руководстве по развёртыванию перечислены показатели точности (MMMU-Pro, GSM8K), привязанные к конкретным конфигурациям обслуживания, — их стоит прочитать, но это измерения, смежные с инфраструктурой, а не независимые оценки. Честное резюме коротко: правдоподобная, недорогая в обслуживании, способная к работе с изображениями модель рассуждений, у которой пока нет публичного независимого рейтинга.
Сколько это стоит, и о чём говорит семейная история
В мультимодальном руководстве Ant не указана цена за токен для Ling-3.0-flash-VL, поэтому всё, что здесь приводится, — лишь предположения, о чём прямо сказано. Полезным ориентиром служит текстовый аналог на той же платформе: официальная цена Ling-3.0-flash составляет около $0,075 за 1 млн входных токенов и $0,22 за 1 млн выходных, при этом чтение из кэша примерно на 80% дешевле; в китайской консоли цена указана в юанях (¥0,40 за входные / ¥1,20 за выходные токены за 1 млн) после ранней акции со скидкой 75%, завершившейся 31 августа. Обслуживание мультимодальной модели 124B-A5.5B дороже, чем текстовой 124B-A5.1B: визуальная башня плотная и выполняется для каждого токена изображения, — поэтому разумный априор — цена в этом диапазоне или немного выше. История семейства указывает и в другую сторону: доменные варианты Fin и Sante были запущены как бесплатные API, так что Ant уже показал, что готов использовать нулевое ценообразование, чтобы стимулировать внедрение нужного ему варианта Ling. Последует ли VL за платным диапазоном текстовой модели или за образцом бесплатных вариантов, пока просто не обнародовано.
Для варианта самостоятельного хостинга цифры конкретны, поскольку файлы находятся в открытом доступе. Релиз bf16 — это загрузка объёмом примерно 250 ГБ, разбитая на 64 шарда, что требует нескольких GPU на всём, кроме самых больших одиночных узлов, тогда как релиз FP8 (~126 ГБ, визуальный энкодер остаётся в bf16) легко помещается на узел с 8 ускорителями класса 80 ГБ и является версией, которую большинство команд будут запускать на практике. Заявления о пропускной способности из сборника рецептов для обслуживания существуют, но они связаны с вендорами; ожидайте обычную оговорку: реальные токены/с зависят от вашего оборудования и вашего батча.
Где уместен слой маршрутизации — честно
На момент запуска ни один крупный сторонний шлюз моделей, который мы проверили, не включает Ling-3.0-flash-VL, и OrcaRouter — платформа маршрутизации, к которой принадлежит этот блог, — также его не обслуживает. Ничто в этой статье не должно быть истолковано так, будто модель там присутствует. Таково честное состояние модели, которой всего четыре дня, и это стоит сказать прямо, потому что вариантов, которые у читателя сегодня действительно есть, ровно два: воспользоваться официальным API Ant или самостоятельно разместить веса MIT. Маршрутизация — это следующий шаг. Когда такая модель появится у сторонних провайдеров, экономика транзитного маршрутизатора делает его предпочтительным для оценки: цена провайдера по прайс-листу передаётся с нулевой наценкой, поэтому снижение цены вендором (или эксперимент с бесплатным тарифом, как запуски Fin и Sante) вступает в силу в тот же день, когда о нём объявляют, а автоматическое переключение при сбое позволяет направить реальную рабочую нагрузку на открытую модель, которой несколько дней, не ставя свой стек в зависимость от времени безотказной работы одного вендора или поведения одной контрольной точки. Для семейства, которое уже один раз меняло цены и раздробилось на четыре варианта за шесть недель, это не гипотеза — это разница между ручным повторным тестированием при каждом изменении Ant и однократным повторным тестированием через один API.
Что посмотреть
Этот релиз настолько новый, что полезные сигналы — это в основном проверки, которые может запустить любой. Во-первых, появится ли Ling-3.0-flash-VL в списке Artificial Analysis (или другой независимой лаборатории) и подтвердит или исправит цифру 42 — этот единственный показатель отделяет «лучшую модель семейства» от «ещё одного вендорского числа». Во-вторых, соответствует ли идентификатор -rc1 в официальном API открытым весам от 4 сентября; если нет, то API и локальный путь — это разные модели, и каждое сравнение, которое вы читаете, должно указывать, какую из них оно использует. В-третьих, ценообразование: опубликованный тариф VL на платформе Ling, и следует ли он платной вилке текстовой модели или стратегии бесплатного API Fin/Sante. В-четвёртых, сохраняет ли чекпоинт FP8 точность, заявленную в карточке модели, при реальном обслуживании — визуальный модуль, оставленный в bf16, это хороший знак, но заявления о квантованной визуальной части требуют прогона, а не конфигурации. И в-пятых, вопрос продуктовой карты: теперь, когда зрение встроено в быструю линейку Ling, следите, сохранит ли Ant бренд Ming как отдельный мультимодальный бренд или позволит двум направлениям слиться.
Для разработчика краткосрочный ответ короток. Если вы хотите строить на этом уже сегодня, официальный API — это путь без инфраструктуры, а веса FP8 — это путь самостоятельного хостинга, и оба реальны уже на этой неделе. Если вы хотите строить на числе 42, подождите, пока кто-то за пределами Ant воспроизведёт его. Всё, что действительно полезно в Ling-3.0-flash-VL — веса MIT, правдоподобная архитектура, агрессивный дизайн «цена-за-активацию» и оценка вендора, к которой стоит отнестись серьёзно — уже на месте; всё, что сделало бы её безопасным выбором по умолчанию, всё ещё остаётся нерешённым.
