Ling-3.0-flash: Что мы на самом деле знаем о новом быстром уровне MoE от Ant Group (и чего не знаем)
Guides & Insights

Ling-3.0-flash: Что мы на самом деле знаем о новом быстром уровне MoE от Ant Group (и чего не знаем)

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Лаборатория InclusionAI, входящая в Ant Group, выпустила Ling-3.0-flash примерно 23 июля 2026 года — то есть на момент этого обзора модель существует всего несколько дней. Это языковая модель на основе смеси экспертов (MoE) с общим количеством параметров 124B и примерно 5.1B активных на токен (коэффициент разреженности около 24:1), предназначенная для генерации текста и вызова инструментов. Она позиционируется как быстрый и дешёвый вариант в семействе Ling; флагманская позиция по-прежнему принадлежит гораздо более крупной модели Ling-2.6-1T (1T всего / 63B активных). Доступ на данный момент осуществляется только через API — через собственный портал разработчиков Ant, через OpenRouter как inclusionai/ling-3.0-flash и через ZenMux.

Это полная подтверждённая картина, и стоит сразу объяснить, почему этот обзор выглядит более осторожным, чем типичное описание модели. Нет весов Hugging Face, нет репозитория GitHub для Ling-V3 и нет четкого заявления о лицензии — это серьезное изменение по сравнению с Ling 2.0 и Ling 2.6, обе из которых выпускались с открытыми весами под лицензией MIT. Также отсутствуют какие-либо независимые бенчмарк-данные: Artificial Analysis, наиболее часто цитируемый сторонний оценщик для моделей этого класса, пока не имеет страницы для данной модели. Все показатели производительности и скорости, циркулирующие сейчас, восходят непосредственно к самой Ant Group.

Суть. Ling-3.0-flash — это модель MoE с 124 млрд параметров (5.1 млрд активных) от InclusionAI, подразделения Ant Group, выпущенная за последние несколько дней, доступная только через API, без весов на Hugging Face и с неподтвержденной лицензией. Заявления поставщика — пиковая пропускная способность 1000 токенов/с, время до первого токена менее 100 мс — пока не имеют независимой проверки, и для этой конкретной модели нет оценки Artificial Analysis. Предыдущее поколение Ling-2.6-flash набрало всего 14 баллов по индексу Artificial Analysis Intelligence (Ling-2.6-1T набрал 26), что является полезным контекстом, но не заменой реальных возможностей 3.0-flash. Ценообразование (¥0.40 за входные / ¥1.20 за выходные токены на 1 млн токенов, в настоящее время бесплатно в течение недели запуска с 500 тыс. бесплатных токенов в день) носит явно рекламный характер и, вероятно, изменится. Относитесь ко всему здесь как к предварительной информации, а не окончательному выводу.

Основные выводы

Это быстрый/дешевый уровень, не флагман.Ling-2.6-1T остается крупнейшей моделью InclusionAI; Ling-3.0-flash является меньшей, более дешевой, более быстрой родственной моделью, предназначенной для использования с большими объемами.

Независимого бенчмарка пока не существует. У Artificial Analysis нет страницы для Ling-3.0-flash. Единственные публичные цифры принадлежат самой Ant Group, и в документах Ant в настоящее время вообще нет таблицы бенчмарков для этой модели.

Заявления о скорости исходят только от вендора. Пиковая скорость 1000 токенов/сек и время до первого токена менее 100 мс получены от Ant Group, при этом нет стороннего теста пропускной способности, который подтвердил бы любой из этих показателей.

Нет открытых весов, лицензия не подтверждена. Нет репозитория на Hugging Face и нет проекта Ling-V3 на GitHub. Предыдущие поколения Ling были под лицензией MIT; неизвестно, последует ли за ними 3.0-flash.

Цена — это акция недели запуска. ¥0.40/¥1.20 за 1M токенов на платформе Ant в настоящее время не взимается, с 500k бесплатных токенов в день и бесплатным листингом OpenRouter — ничто из этого не должно считаться действующим после окончания акции.

Это одна часть семейства из трех моделей. InclusionAI делит свою линейку на Ling (универсальный MoE, эта модель), Ring (ориентированный на рассуждения) и Ming (мультимодальный).

Замечание о том, как читать этот обзор: каждая спецификация, бенчмарк и цена ниже помечены источником. Если единственным источником является Ant Group, мы прямо об этом говорим и делаем соответствующие оговорки. Если у моделей Ling предыдущих поколений есть независимые оценки, мы ссылаемся на них для контекста, но не взамен данных о самой Ling-3.0-flash, которой пока не существует. Вероятно, потребуется последующее обновление, когда независимые тесты догонят.

Что мы на самом деле знаем

Архитектурно Ling-3.0-flash — это разреженная MoE-модель: всего 124 млрд параметров, из которых на любой заданный токен активно около 5,1 млрд, что делает её дешёвой и быстрой в работе по сравнению с общим размером. Контекстное окно составляет 256К токенов, согласно документации Ant; поставщик утверждает, что его можно расширить до 1 млн; в листинге OpenRouter указано 262 144 токена, что согласуется с цифрой 256К. Максимальная длина вывода нигде не указана из того, что нам удалось найти. Модель поддерживает стандартную генерацию текста и вызов инструментов, но о мультимодальном вводе или выводе не упоминалось — эта возможность относится к отдельной линейке Ming.

Что касается доступности, ситуация такова: модель существует только через API и одинакова на всех трёх найденных платформах: собственной платформе разработчиков Ant Group, OpenRouter (указана как inclusionai/ling-3.0-flash) и ZenMux. Ни одна из них не предоставляет загружаемые веса. Не существует страницы организации GitHub для проекта «Ling-V3», а документация Ant не указывает лицензию для этой конкретной модели — существенный пробел, поскольку Ling 2.0 и Ling 2.6 были выпущены с открытыми весами под лицензией MIT. Пока InclusionAI не прояснит этот момент, не стоит предполагать, что Ling-3.0-flash станет открытой, но и не стоит предполагать обратного.

Пробелы: что не подтверждено

Самый большой разрыв — это бенчмарки. На момент написания этого текста Artificial Analysis — независимый оценщик, наиболее часто цитируемый для данного класса моделей, — не имеет страницы для Ling-3.0-flash; URL-шаблон, который обычно её содержит, возвращает ошибку 404. Это означает, что в настоящее время нет никаких сторонних показателей по рассуждениям, кодированию или математике для этой модели — ни от Artificial Analysis, ни от любого другого независимого оценщика, которого мы смогли найти. Собственная документация Ant усугубляет ситуацию: она вообще не публикует таблицу бенчмарков для 3.0-flash, ни вендорскую, ни какую-либо ещё, что необычно для релиза модели и само по себе заслуживает упоминания.

Для контекста: у моделей Ling предыдущего поколения есть независимые оценки. Ling-2.6-flash набрала 14 баллов по Индексу искусственного интеллекта Artificial Analysis, а более крупная Ling-2.6-1T — 26 баллов; обе значительно отставали от ведущих моделей с открытым весом, отслеживаемых Artificial Analysis на тот момент. Собственные данные поставщика Ant для Ling-2.6-flash утверждали 61,2% на SWE-bench Verified и 73,85% на AIME2026. Ни одно из этих чисел не должно напрямую переноситься на Ling-3.0-flash; новое поколение с новой архитектурой может двигаться в любом направлении, и пока независимый оценщик не проведёт тестирование, любое заявление о возможностях 3.0-flash — это догадка, выдаваемая за факт.

Заявления вендора о скорости: быстро на бумаге, непроверено на практике.

Заголовочная презентация производительности Ling-3.0-flash от Ant Group — это не качество рассуждений, а сырая скорость. Вендор заявляет пиковую пропускную способность в 1000 токенов в секунду и время до первого токена менее 100 миллисекунд — оба показателя были бы действительно быстрыми, если бы подтвердились. Но «если бы подтвердились» играет ключевую роль в этом предложении: эти цифры взяты исключительно из собственных материалов Ant Group, измерены в условиях, которые Ant контролирует и не полностью раскрывает (аппаратное обеспечение, размер батча, длина промпта и нагрузка — все существенно влияет на показатели пропускной способности). Ни одна независимая лаборатория не опубликовала повторных измерений. Пока кто-то за пределами Ant не проведет сопоставимый тест, относитесь к 1000 tok/s и sub-100ms TTFT как к маркетинговым цифрам, которые стоит проверять на своей рабочей нагрузке, а не как к установленным фактам.

Ценообразование: почему это подвижная цель

На собственной платформе Ant Group цены на Ling-3.0-flash составляют ¥0.40 за 1 млн входных токенов и ¥1.20 за 1 млн выходных токенов — дешево по замыслу, что соответствует его позиционированию как быстрого/дешевого уровня. Но эти прейскурантные цены на самом деле никто сейчас не платит: Ant проводит бесплатную рекламную акцию в честь недели запуска и отдельно предлагает 500 тыс. бесплатных токенов в день на своей платформе. В списке OpenRouter указан вариант ling-3.0-flash:free по $0/$0. Ничего из этого не следует путать со стабильной ценой. Рекламные акции при запуске заканчиваются, бесплатные уровни ограничиваются, а сами показатели ¥0.40/¥1.20 могут измениться после получения реальных данных об использовании. Если вы планируете производственные расходы на эту модель, рассчитывайте бюджет по прейскурантной цене, а не по рекламной, и перепроверьте перед принятием обязательств.

Семья Линг / Ринг / Минг

Ling-3.0-flash не существует изолированно — InclusionAI организует свои релизы в три именованных семейства, каждое из которых предназначено для разных задач. Ling — это универсальная линейка MoE, охватывающая повседневную генерацию текста и вызов инструментов; Ling-3.0-flash находится на быстром/дешевом конце этой линейки, а Ling-2.6-1T остается флагманским продуктом крупнее. Ring — это ориентированная на рассуждения линейка InclusionAI, созданная для задач, которые опираются на многошаговую цепочку рассуждений, а не на сырую пропускную способность. Ming — это мультимодальная линейка, работающая с изображениями и другими нетекстовыми модальностями, к которым Ling сам не прикасается. Если ваша задача требует более тяжелых рассуждений или мультимодального ввода, правильная модель InclusionAI, вероятно, не Ling-3.0-flash — она создана для объема и скорости в рамках текстового и инструментального направления, а не для выхода на территорию других двух семейств.

Для кого это: три сценария

1. Высоконагруженные, чувствительные к задержкам конвейеры текста или вызова инструментов — в качестве пилотного проекта, а не обязательства.

Если ваша нагрузка в основном состоит из генерации текста или вызова инструментов, чувствительных к пропускной способности — чаты, лёгкие агенты, высокочастотные API-вызовы — позиционирование Ling-3.0-flash (малое количество активных параметров, заявленный TTFT менее 100 мс, почти бесплатные стартовые цены) делает его достойным пилотного внедрения. Загвоздка в том, что «достойно пилота» — это не то же самое, что «стоит переводить на него продакшн-трафик». При отсутствии независимых бенчмарков именно вы сейчас являетесь бенчмарком: прогоните через него собственный набор для оценки, прежде чем доверять ему что-либо, ориентированное на клиентов, и не стройте модели затрат на основе текущих рекламных цен.

2. Команды, которым нужен длинный контекст в условиях ограниченного бюджета

Окно контекста в 256K (с заявлением производителя о возможности расширения до 1M) при действительно низкой прейскурантной цене является привлекательным сочетанием для задач, связанных с интенсивным поиском или обработкой документов, при условии, что фактическое качество рассуждений модели сохраняется на протяжении этой длины контекста — что, опять же, не было проверено ни одним независимым источником. Это разумный кандидат для включения в шорт-лист наряду с устоявшимися дешевыми вариантами с длинным контекстом, но его следует оценивать в сравнении с ними, а не принимать на основе только спецификаций Ant.

3. Наблюдатели, отслеживающие ландшафт MoE в Китае и дорожную карту InclusionAI

Для команд, которые отслеживают конкурентную ситуацию среди китайских лабораторий, разрабатывающих открытые и полуоткрытые модели, а не разворачивают какую-либо одну модель в производстве, Ling-3.0-flash является полезной точкой отсчёта: она показывает, что InclusionAI быстро итерационно улучшает свой быстрый уровень, возможно, отступая от открытых весов (по крайней мере, сейчас) и продолжает делать ставку на трёхсемейную структуру (Ling/Ring/Ming), а не на одну универсальную модель. Стоит сохранить и пересмотреть, когда появятся ясность по бенчмаркам и лицензиям.

Когда не следует использовать это

Пропустите Ling-3.0-flash для всего, где нужно сослаться на подтверждённое заявление о возможностях — независимого бенчмарка нет, поэтому любое утверждение о его рассуждениях, программировании или математических способностях сейчас неопровержимо. Пропустите его, если вам нужны открытые веса для самостоятельного хостинга, дообучения или соблюдения требований — их нет, а лицензия для этой конкретной модели даже не объявлена, не говоря уже о подтверждении её разрешительности. Пропустите его для мультимодальных задач — это работа линейки Ming, а не Ling. И будьте осторожны, строя модель затрат на основе сегодняшних цен: бесплатная неделя запуска, 500 000 бесплатных токенов в день и бесплатный тариф OpenRouter — всё это промоакции, а прейскурант ¥0,40/¥1,20, к которому, скорее всего, вернутся, ещё не был проверен на реальных сценариях использования.

Часто задаваемые вопросы

Имеет ли Ling-3.0-flash открытые веса?

В настоящее время нет. На момент написания нет репозитория Hugging Face и проекта Ling-V3 на GitHub. Предыдущие поколения Ling (2.0 и 2.6) были выпущены под лицензией MIT с открытыми весами, но ничто не подтверждает, что Ling-3.0-flash последует этому образцу — или же нет.

Как Ling-3.0-flash показывает себя в бенчмарках?

Пока для неё нет независимых бенчмарков — на Artificial Analysis нет страницы для этой модели. В собственной документации Ant Group также не публикуется таблица бенчмарков для неё. Для грубой исторической справки: Ling-2.6-flash предыдущего поколения набрала 14 баллов по Индексу искусственного интеллекта Artificial Analysis, а Ling-2.6-1T — 26, но ни одно из этих чисел не следует переносить на новое поколение.

Насколько это на самом деле быстро?

Ant Group заявляет о пиковой пропускной способности 1000 токенов/с и времени до первого токена менее 100 мс. Оба показателя являются только данными от вендора, и на данный момент не опубликовано независимых повторных измерений. Относитесь к ним как к заявлениям, которые нужно проверить на своей нагрузке, а не как к подтверждённой производительности.

Сколько стоит Ling-3.0-flash?

Стандартные цены на платформе Ant составляют ¥0.40 за 1 млн входных токенов и ¥1.20 за 1 млн выходных токенов, но в рамках рекламной акции в честь запуска в настоящее время это бесплатно, также доступно 500 тысяч бесплатных токенов в день. OpenRouter также предлагает бесплатный вариант. Ожидается, что эти рекламные условия изменятся.

Насколько велико контекстное окно?

256K токенов согласно документации Ant, с утверждением вендора, что это можно расширить до 1M. В листинге OpenRouter указано 262 144 токена, что соответствует 256K. Максимальная длина вывода не раскрыта.

В чем разница между Ling, Ring и Ming?

Ling — это универсальная текстовая и инструментальная MoE-линейка от InclusionAI, а Ling-3.0-flash находится на её быстром/дешёвом конце. Ring — это линейка, ориентированная на рассуждения. Ming занимается мультимодальными задачами. Это отдельные семейства моделей, созданные для разных задач, а не уровни одной и той же модели.

Ling-3.0-flash то же самое, что Ling-2.6-1T?

№ Ling-2.6-1T — это более крупный флагман InclusionAI (1T всего / 63B активных параметров) и остается отдельной, более крупной моделью. Ling-3.0-flash (124B всего / ~5.1B активных) — это более новый, меньший и более быстрый выпуск.

Стоит ли мне использовать Ling-3.0-flash в продакшене сегодня?

Только после проведения собственной оценки. При отсутствии независимого бенчмарка, неподтвержденной лицензии и текущих промо-ценах разумно провести пилотное тестирование, но преждевременно доверять ему критически важные для производства или требующие соблюдения нормативных требований рабочие нагрузки без собственного тестирования и плана действий на случай окончания промо-условий.

Суть

Ling-3.0-flash — это действительно новый релиз, за которым стоит следить: модель MoE с 124B/5.1B активных параметров, нацеленная на быструю, дешёвую обработку больших объёмов текста и вызов инструментов, и выпущена лабораторией, которая уже создавала заслуживающие доверия модели. Но сейчас это только спецификация и набор заявлений от вендора, а не проверенный продукт: нет независимых бенчмарков, открытых весов, подтверждённой лицензии, а цены явно рекламные. Это не повод отказываться от неё — это повод осторожно протестировать, на практике проверить утверждения, важные именно для вас, и вернуться к этому краткому обзору, как только Artificial Analysis или другой независимый оценщик опубликует реальные цифры.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube