Ling-3.0-flash: Что мы теперь знаем о MoE быстрого уровня с открытыми весами от Ant Group
Guides & Insights

Ling-3.0-flash: Что мы теперь знаем о MoE быстрого уровня с открытыми весами от Ant Group

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Лаборатория InclusionAI компании Ant Group официально выпустила Ling-3.0-flash — анонсирован 24 июля 2026 года и опубликован с открытым исходным кодом под лицензией MIT 7 августа — и картина сильно изменилась с момента предварительного обзора, который мы публиковали здесь в июле. Это нативная гибридная модель смеси экспертов с рассуждениями, имеющая 124B общих параметров и всего 5.1B активных на токен, созданная как быстрый и недорогой уровень семейства Ling. Два числа, которые изменили всё: Artificial Analysis теперь оценивает её в 38 баллов по Индексу интеллекта (на 24 балла выше, чем у предыдущего поколения быстрого уровня, Ling-2.6-flash) и помещает её на границу Парето для открытых весов по соотношению интеллекта и общего числа параметров. Веса доступны на Hugging Face и ModelScope.

Когда мы впервые рассказали об этой модели 24 июля, честное резюме было таким: только API, без весов, без заявления о лицензии, без независимого бенчмарка. Все четыре этих утверждения теперь устарели. Ant открыл исходный код весов под лицензией MIT 7 августа, а Artificial Analysis с тех пор опубликовал полную независимую оценку. Это обновление пересматривает исходный бриф соответствующим образом — ярлыки «непроверено», которые доминировали в июльском посте, теперь применяются к гораздо более узкому набору утверждений, в первую очередь к показателям пиковой скорости Ant, а не к модели в целом.

Кратко.Ling-3.0-flash — это быстрый открытый MoE от Ant Group: 124B всего / 5.1B активных параметров, лицензия MIT, нативный контекст 256K (при обслуживании — 262K). Artificial Analysis оценивает его индекс интеллекта в 38 — на 24 пункта выше, чем у Ling-2.6-flash предыдущего поколения, и он находится на границе Парето среди моделей с открытыми весами по соотношению интеллекта к общему количеству параметров — с измеренной скоростью вывода около 368 токенов/сек. Веса доступны на Hugging Face и ModelScope под лицензией MIT. Пока это только данные от вендора: заявление о пиковой пропускной способности более 1,100+ токенов/сек, показатель времени до первого токена менее 100 мс и таблица бенчмарков из карточки модели. Цены в собственном API: $0.075 за входные и $0.22 за выходные токены за 1M токенов (скидка 80% при попадании в кэш); бесплатный тариф на запуске закончился 3 августа.

Основные выводы

• Это быстрый/дешевый уровень, а не флагман. Флагман предыдущего поколения с 1 трлн параметров остается самой крупной моделью InclusionAI; Ling-3.0-flash — меньший и более быстрый собрат, предназначенный для больших объемов текста и вызова инструментов.

• Веса теперь открыты под лицензией MIT. Веса появились на Hugging Face (inclusionAI/Ling-3.0-flash) и ModelScope 7 августа под лицензией MIT — разворот по сравнению с июльской картиной «только через API».

• У него наконец появилась независимая оценка. Artificial Analysis измеряет индекс интеллекта на уровне 38 — на 24 выше, чем у Ling-2.6-flash, — и помещает модель на фронт Парето среди моделей с открытыми весами по соотношению интеллекта и общего числа параметров.

• Скорость теперь измерена лишь частично.AA показывает примерно 368 токенов/сек на выходе и ~1,98 с до первого токена; заявленный пиковый показатель Ant в 1100+ токенов/сек по-прежнему остается лишь заявлением вендора.

• Цены установлены, и бесплатный запуск окончен. Собственный API указывает $0,075 за вход / $0,22 за выход за 1 млн токенов со скидкой 80% при попадании в кэш; бесплатный тариф на время запуска закончился 3 августа.

• Это одна из трёх моделей семейства. InclusionAI делит свою линейку на Ling (универсальная текстовая и инструментальная MoE, эта модель), Ring (рассуждения) и Ming (мультимодальная).

Примечание о том, как читать это обновление: это пересмотренная версия предварительного обзора от 24 июля, написанная после того, как веса стали открытыми и появились первые независимые результаты. Каждая спецификация, бенчмарк и цена ниже снабжены указанием источника. Там, где единственным источником является Ant Group — заявления о пиковой скорости и таблица бенчмарков в карточке модели — мы говорим об этом прямо. Там, где Artificial Analysis провела независимые измерения, мы ссылаемся на них.

Что мы на самом деле знаем

Архитектура теперь полностью задокументирована в карточке модели. Ling-3.0-flash использует нативный гибридный стек линейного внимания — слои Kimi Delta Attention (KDA) и Gated MLA, чередующиеся в соотношении 5:1 (35 KDA + 7 MLA), с тонкозернистым диагональным гейтированием KDA — поверх разреженного MoE с разреженностью 1/64 (512 маршрутизируемых экспертов, 8 активируемых на токен). Именно так он достигает 124 млрд общих параметров при всего 5,1 млрд активных. Контекстное окно нативно составляет 256K, в конфигурациях инференса используется 262 144 токена, а Ant утверждает, что архитектура масштабируется до 1M. Максимальная длина выходных данных не раскрывается. Модель работает только с текстом и поддерживает вызов инструментов; мультимодальный ввод реализован в отдельной линейке Ming.

Лаборатория публикует два формата весов — BF16 (примерно 255 ГБ) и FP8 (примерно 128 ГБ) — а на квантованные варианты от сообщества уже есть ссылки в карточке модели. Собственные рецепты развёртывания лаборатории ориентированы на SGLang и vLLM.

Доступность: открытые веса по лицензии MIT

7 августа команда InclusionAI из Ant Group опубликовала веса модели с открытым исходным кодом под лицензией MIT на Hugging Face (inclusionAI/Ling-3.0-flash) и ModelScope. Это разрешительная лицензия, допускающая коммерческое использование, — та же, под которой выпускались Ling 2.0 и Ling 2.6, — а значит, вы можете самостоятельно размещать, дообучать и развертывать Ling-3.0-flash, а не арендовать его через API. Модель также доступна через собственный разработческий API Ant и несколько сторонних платформ. Для быстрой модели по такой цене более интересный вопрос — выбрать самостоятельное размещение (FP8 работает примерно в 128 ГБ) или остаться на API.

Независимые оценки: индекс интеллекта AA — 38.

Самое большое изменение по сравнению с июльским постом — теперь существуют независимые показатели. У Artificial Analysis есть страница для Ling-3.0-flash, и она оценивает модель в 38 баллов по Индексу интеллекта — на 24 пункта выше предыдущего поколения быстрого уровня, Ling-2.6-flash (14), и на уровне MiMo-V2.5 и Qwen 3.6 27B, активируя лишь малую долю их параметров. Artificial Analysis также помещает модель на границу Парето среди моделей с открытыми весами по соотношению интеллекта к общему числу параметров: ни одна модель с открытыми весами и меньшим общим числом параметров не набирает больше. Лидер открытых весов flash-уровня на AA, DeepSeek V4 Flash, по-прежнему набирает больше (индекс 52 при максимальных усилиях рассуждения).

Результаты в области агентности и длинного контекста также демонстрируют уверенную динамику. В банковском наборе тестов τ3-Bench от AA Ling-3.0-flash набирает 27%, занимая второе место среди моделей с открытыми весами флэш-уровня после DeepSeek V4 Flash (39%). В GDPval-AA v2 её Elo достигает 1108, что выше 545 у Ling-2.6-flash. Ant обучала модель в 10 000+ интерактивных средах (по данным вендора) и позиционирует её как исполнительный узел для агентных рабочих процессов — быстрый, дешёвый и одноразовый, а тяжёлые рассуждения оставлены более крупной флагманской модели.

Одно предостережение относительно источников: таблица бенчмарков на карточке модели Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — предоставлена вендором и ещё не была независимо воспроизведена. Относитесь к ней как к собственным заявлениям лаборатории, в той же категории, что и приведённые ниже показатели пиковой скорости.

Скорость: измеренная, затем заявленная.

История о скорости теперь состоит из двух разных историй. Независимо, Artificial Analysis измеряет примерно 368 токенов/сек на выходе и ~1,98 сек до первого токена на собственном API — действительно быстро для MoE с 5,1 млрд активных параметров, и этого достаточно, чтобы модель заняла место в верхней части своего класса по скорости. Отдельно Ant Group заявляет о средней скорости вывода более 1 100 токенов/сек на указанных конфигурациях GPU и времени до первого токена менее 100 мс с кластерным иерархическим кэширующим слоем на основе SGLang HiCache и Mooncake. Второй набор цифр — только от вендора: он измерен на оборудовании и пакетных конфигурациях, которые контролирует Ant Group, и независимого повторного прогона опубликовано не было. Для планирования используйте цифры AA; рассматривайте показатель 1 100+ ток/сек как маркетинговый потолок, который нужно проверить на собственной нагрузке.

Цены: дёшево, и акция закончилась

Artificial Analysis указывает для собственного API цену $0.075 за 1M входных токенов и $0.22 за 1M выходных, при этом попадания в кэш стоят $0.015 (−80%) — все цены установлены вендором. Запущенный бесплатный тариф (500 тыс. бесплатных токенов в день, бесплатный доступ к API) закончился 3 августа, а Ant провёл временную акцию со скидкой 75% на Ling Studio до 31 августа 2026 года, после чего применяется стандартный прайс. Даже по полному прайсу $0.075/$0.22 уверенно относят Ling-3.0-flash к дешёвому ценовому сегменту для модели с индексом 38.

При таких низких ценах стоимость переключения важнее, чем цена за токен. OrcaRouter существует, чтобы сделать это переключение дешёвым: один API для 200+ моделей, цены провайдеров передаются без наценки (0%), и автоматический переход между провайдерами — так что когда новая открытая модель вроде этой хорошо выглядит на бумаге, вы можете протестировать её на реальной нагрузке без второго контракта, и при необходимости откатиться на другую модель за тем же ключом, если она не справляется с конкретной задачей.

Семья Линг / Ринг / Минг

Ling-3.0-flash не существует изолированно — InclusionAI организует свои выпуски в три именованных семейства, каждое из которых предназначено для своей задачи. Ling — это универсальная линия MoE для повседневной генерации текста и вызова инструментов, и Ling-3.0-flash находится на её быстром/дешёвом конце, на ступень ниже флагмана предыдущего поколения с 1T параметров. Ring — это линия, ориентированная на рассуждения, созданная для многошаговых цепочек мышления. Ming — это мультимодальная линия. Если ваша задача требует более серьёзных рассуждений или ввода изображений, подходящая модель InclusionAI, вероятно, не Ling-3.0-flash — она создана для объёма и скорости в нише текста и инструментов.

Для кого это: три сценария

1. Высоконагруженные, чувствительные к задержкам конвейеры обработки текста или вызова инструментов

Это родная стихия модели. С независимым индексом 38, лицензией MIT и измеренной скоростью примерно 368 ток/с ставка на быстрый уровень теперь проверяема, а не гипотетична — вы можете прогнать через него собственный набор для оценки или скачать веса и развернуть у себя. Только не стройте свою систему вокруг заявленного вендором потолка в 1100+ ток/с, пока не измерите его на своей нагрузке.

2. Команды, которым нужен длинный контекст при ограниченном бюджете

Нативный контекст 256K (обслуживаемый 262K) с заявленным путём до 1M по цене $0.075/$0.22 — привлекательное сочетание для задач с интенсивным поиском или обработкой документов. Цифры длинного контекста в карточке модели указаны вендором, поэтому внесите модель в шорт-лист наряду с проверенными вариантами длинного контекста и проверьте на собственном корпусе данных перед принятием решения.

3. Наблюдатели, отслеживающие ландшафт MoE в Китае и дорожную карту InclusionAI

Июльский вопрос — останется ли InclusionAI открытым? — теперь получил ответ: да, MIT, и быстро. Появление Ling-3.0-flash на фронтьере Парето AA с 5.1B активных параметров — важный показатель для тех, кто наблюдает, как китайские лаборатории конкурируют за счёт эффективности, а не сырого количества параметров.

Что ещё не проверено?

Короткий список, теперь, когда основные пробелы закрыты. Заявления вендора о пиковой скорости (1,100+ ток/с, TTFT менее 100 мс) не подтверждены независимыми повторными замерами. Таблица бенчмарков в карточке модели предоставлена самим вендором. Варианты FP4/INT4 и путь развёртывания на одном DGX-Spark также указаны вендором. Что касается знаний, индекс Omniscience от AA показывает, что улучшение по сравнению с предыдущим поколением достигнуто в основном за счёт воздержания от ответа — галлюцинации снизились (97% → 44%), тогда как точность выросла лишь незначительно (16% → 18%) — так что не принимайте скачок заголовочного индекса за всеобъемлющий скачок в знаниях.

Когда не следует использовать это

Не берите Ling-3.0-flash для мультимодальных задач — это линейка Ming. Пропустите её и в том случае, если вам нужен тяжёлый флагман для рассуждений, а не быстрый исполнитель — это вотчина Ring. Если планируете собственный хостинг, закладывайте на реальное железо: BF16 — это примерно 255 ГБ, FP8 — примерно 128 ГБ. И если для вас важна какая-то характеристика, проверьте её — цифры пиковой скорости и длинного контекста принадлежат Ant, пока независимая лаборатория не перепроверит их.

Часто задаваемые вопросы

Имеет ли Ling-3.0-flash открытые веса?

Да. Веса были опубликованы с открытым исходным кодом 7 августа под лицензией MIT на Hugging Face (inclusionAI/Ling-3.0-flash) и ModelScope. Это разрешительная лицензия, допускающая коммерческое использование, — та же, под которой выпускались Ling 2.0 и Ling 2.6.

Как Ling-3.0-flash показывает себя в бенчмарках?

Искусственный анализ измеряет Индекс интеллекта на уровне 38, что на 24 пункта выше, чем у Ling-2.6-flash, и помещает модель на границу Парето для открытых весов по соотношению интеллекта к общему числу параметров. Таблица бенчмарков на карточке модели Ant (например, SWE-Bench Pro 56.6) предоставлена поставщиком и не была независимо воспроизведена.

Насколько это на самом деле быстро?

Artificial Analysis измеряет примерно 368 токенов/сек на выходе с временем до первого токена около 1,98 с на собственном API. Ant заявляет пиковую пропускную способность более 1100 токенов/сек и TTFT менее 100 мс на указанных конфигурациях GPU — это данные производителя без независимого повторного измерения.

Сколько стоит Ling-3.0-flash?

AA указывает цену на собственный API: $0,075 за 1 млн входных токенов и $0,22 за 1 млн выходных, со скидкой 80% при попадании в кэш. Бесплатный тариф на время запуска закончился 3 августа, а временная скидка 75% на Ling Studio действует до 31 августа 2026 года.

Насколько велико контекстное окно?

256K в нативном режиме, предоставляется в объёме 262 144 токенов; Ant утверждает, что архитектура масштабируется до 1M. Максимальная длина выходных данных не раскрывается.

В чём разница между Ling, Ring и Ming?

Ling — это универсальная линия MoE от InclusionAI для работы с текстом и вызова инструментов, а Ling-3.0-flash находится на её быстром/недорогом конце. Ring — это линия, ориентированная на рассуждения. Ming занимается мультимодальными задачами. Это отдельные семейства для разных задач, а не уровни одной модели.

Является ли Ling-3.0-flash тем же, что и предыдущий флагман 1T?

Нет. Ling-3.0-flash — это более новая, меньшая по размеру версия быстрого уровня (124B всего / 5.1B активных). Флагманская модель предыдущего поколения с 1T параметров остается более крупной моделью.

Стоит ли мне использовать Ling-3.0-flash в продакшене сегодня?

Более оправданно, чем в июле, теперь, когда есть независимая оценка и лицензия MIT. Сначала прогоните собственный оценочный набор, проверьте заявленные поставщиком показатели скорости на вашей рабочей нагрузке и решите, что выбрать: API или самостоятельный хостинг (FP8 работает примерно в 128 ГБ). Оставшиеся цифры, доступные только от поставщика, достаточно узки, чтобы планировать с их учётом.

Суть

Модель Ling-3.0-flash за две недели прошла путь от «технических характеристик и заявлений вендора» до «открытых весов и независимой оценки». Показатель AA Intelligence Index, равный 38, при 5,1 млрд активных параметров — на границе Парето для моделей с открытыми весами, лицензия MIT, цена $0,075/$0,22 — делает её одной из самых эффективных моделей с открытыми весами, доступных на данный момент, и при этом такой, которую можно запустить самостоятельно. Оговорок стало меньше, чем раньше: показатели пиковой скорости и характеристики из model card по-прежнему заявлены Ant, пока независимая лаборатория не воспроизведёт их. Для больших объёмов текста и вызова инструментов по такой цене она заслужила полноценную оценку.