
Ling-3.0-flash: Что мы на самом деле знаем о новом быстром уровне MoE от Ant Group (и чего не знаем)
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 199 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
Лаборатория InclusionAI, входящая в Ant Group, выпустила Ling-3.0-flash примерно 23 июля 2026 года — то есть на момент этого обзора модель существует всего несколько дней. Это языковая модель на основе смеси экспертов (MoE) с общим количеством параметров 124B и примерно 5.1B активных на токен (коэффициент разреженности около 24:1), предназначенная для генерации текста и вызова инструментов. Она позиционируется как быстрый и дешёвый вариант в семействе Ling; флагманская позиция по-прежнему принадлежит гораздо более крупной модели Ling-2.6-1T (1T всего / 63B активных). Доступ на данный момент осуществляется только через API — через собственный портал разработчиков Ant, через OpenRouter как inclusionai/ling-3.0-flash и через ZenMux.
Это полная подтверждённая картина, и стоит сразу объяснить, почему этот обзор выглядит более осторожным, чем типичное описание модели. Нет весов Hugging Face, нет репозитория GitHub для Ling-V3 и нет четкого заявления о лицензии — это серьезное изменение по сравнению с Ling 2.0 и Ling 2.6, обе из которых выпускались с открытыми весами под лицензией MIT. Также отсутствуют какие-либо независимые бенчмарк-данные: Artificial Analysis, наиболее часто цитируемый сторонний оценщик для моделей этого класса, пока не имеет страницы для данной модели. Все показатели производительности и скорости, циркулирующие сейчас, восходят непосредственно к самой Ant Group.
Суть. Ling-3.0-flash — это модель MoE с 124 млрд параметров (5.1 млрд активных) от InclusionAI, подразделения Ant Group, выпущенная за последние несколько дней, доступная только через API, без весов на Hugging Face и с неподтвержденной лицензией. Заявления поставщика — пиковая пропускная способность 1000 токенов/с, время до первого токена менее 100 мс — пока не имеют независимой проверки, и для этой конкретной модели нет оценки Artificial Analysis. Предыдущее поколение Ling-2.6-flash набрало всего 14 баллов по индексу Artificial Analysis Intelligence (Ling-2.6-1T набрал 26), что является полезным контекстом, но не заменой реальных возможностей 3.0-flash. Ценообразование (¥0.40 за входные / ¥1.20 за выходные токены на 1 млн токенов, в настоящее время бесплатно в течение недели запуска с 500 тыс. бесплатных токенов в день) носит явно рекламный характер и, вероятно, изменится. Относитесь ко всему здесь как к предварительной информации, а не окончательному выводу.
Основные выводы
• Это быстрый/дешевый уровень, не флагман.Ling-2.6-1T остается крупнейшей моделью InclusionAI; Ling-3.0-flash является меньшей, более дешевой, более быстрой родственной моделью, предназначенной для использования с большими объемами.
• Независимого бенчмарка пока не существует. У Artificial Analysis нет страницы для Ling-3.0-flash. Единственные публичные цифры принадлежат самой Ant Group, и в документах Ant в настоящее время вообще нет таблицы бенчмарков для этой модели.
• Заявления о скорости исходят только от вендора. Пиковая скорость 1000 токенов/сек и время до первого токена менее 100 мс получены от Ant Group, при этом нет стороннего теста пропускной способности, который подтвердил бы любой из этих показателей.
• Нет открытых весов, лицензия не подтверждена. Нет репозитория на Hugging Face и нет проекта Ling-V3 на GitHub. Предыдущие поколения Ling были под лицензией MIT; неизвестно, последует ли за ними 3.0-flash.
• Цена — это акция недели запуска. ¥0.40/¥1.20 за 1M токенов на платформе Ant в настоящее время не взимается, с 500k бесплатных токенов в день и бесплатным листингом OpenRouter — ничто из этого не должно считаться действующим после окончания акции.
• Это одна часть семейства из трех моделей. InclusionAI делит свою линейку на Ling (универсальный MoE, эта модель), Ring (ориентированный на рассуждения) и Ming (мультимодальный).
Замечание о том, как читать этот обзор: каждая спецификация, бенчмарк и цена ниже помечены источником. Если единственным источником является Ant Group, мы прямо об этом говорим и делаем соответствующие оговорки. Если у моделей Ling предыдущих поколений есть независимые оценки, мы ссылаемся на них для контекста, но не взамен данных о самой Ling-3.0-flash, которой пока не существует. Вероятно, потребуется последующее обновление, когда независимые тесты догонят.
Что мы на самом деле знаем
Архитектурно Ling-3.0-flash — это разреженная MoE-модель: всего 124 млрд параметров, из которых на любой заданный токен активно около 5,1 млрд, что делает её дешёвой и быстрой в работе по сравнению с общим размером. Контекстное окно составляет 256К токенов, согласно документации Ant; поставщик утверждает, что его можно расширить до 1 млн; в листинге OpenRouter указано 262 144 токена, что согласуется с цифрой 256К. Максимальная длина вывода нигде не указана из того, что нам удалось найти. Модель поддерживает стандартную генерацию текста и вызов инструментов, но о мультимодальном вводе или выводе не упоминалось — эта возможность относится к отдельной линейке Ming.
Что касается доступности, ситуация такова: модель существует только через API и одинакова на всех трёх найденных платформах: собственной платформе разработчиков Ant Group, OpenRouter (указана как inclusionai/ling-3.0-flash) и ZenMux. Ни одна из них не предоставляет загружаемые веса. Не существует страницы организации GitHub для проекта «Ling-V3», а документация Ant не указывает лицензию для этой конкретной модели — существенный пробел, поскольку Ling 2.0 и Ling 2.6 были выпущены с открытыми весами под лицензией MIT. Пока InclusionAI не прояснит этот момент, не стоит предполагать, что Ling-3.0-flash станет открытой, но и не стоит предполагать обратного.

Пробелы: что не подтверждено
Самый большой разрыв — это бенчмарки. На момент написания этого текста Artificial Analysis — независимый оценщик, наиболее часто цитируемый для данного класса моделей, — не имеет страницы для Ling-3.0-flash; URL-шаблон, который обычно её содержит, возвращает ошибку 404. Это означает, что в настоящее время нет никаких сторонних показателей по рассуждениям, кодированию или математике для этой модели — ни от Artificial Analysis, ни от любого другого независимого оценщика, которого мы смогли найти. Собственная документация Ant усугубляет ситуацию: она вообще не публикует таблицу бенчмарков для 3.0-flash, ни вендорскую, ни какую-либо ещё, что необычно для релиза модели и само по себе заслуживает упоминания.
Для контекста: у моделей Ling предыдущего поколения есть независимые оценки. Ling-2.6-flash набрала 14 баллов по Индексу искусственного интеллекта Artificial Analysis, а более крупная Ling-2.6-1T — 26 баллов; обе значительно отставали от ведущих моделей с открытым весом, отслеживаемых Artificial Analysis на тот момент. Собственные данные поставщика Ant для Ling-2.6-flash утверждали 61,2% на SWE-bench Verified и 73,85% на AIME2026. Ни одно из этих чисел не должно напрямую переноситься на Ling-3.0-flash; новое поколение с новой архитектурой может двигаться в любом направлении, и пока независимый оценщик не проведёт тестирование, любое заявление о возможностях 3.0-flash — это догадка, выдаваемая за факт.
Заявления вендора о скорости: быстро на бумаге, непроверено на практике.
Заголовочная презентация производительности Ling-3.0-flash от Ant Group — это не качество рассуждений, а сырая скорость. Вендор заявляет пиковую пропускную способность в 1000 токенов в секунду и время до первого токена менее 100 миллисекунд — оба показателя были бы действительно быстрыми, если бы подтвердились. Но «если бы подтвердились» играет ключевую роль в этом предложении: эти цифры взяты исключительно из собственных материалов Ant Group, измерены в условиях, которые Ant контролирует и не полностью раскрывает (аппаратное обеспечение, размер батча, длина промпта и нагрузка — все существенно влияет на показатели пропускной способности). Ни одна независимая лаборатория не опубликовала повторных измерений. Пока кто-то за пределами Ant не проведет сопоставимый тест, относитесь к 1000 tok/s и sub-100ms TTFT как к маркетинговым цифрам, которые стоит проверять на своей рабочей нагрузке, а не как к установленным фактам.

Ценообразование: почему это подвижная цель
На собственной платформе Ant Group цены на Ling-3.0-flash составляют ¥0.40 за 1 млн входных токенов и ¥1.20 за 1 млн выходных токенов — дешево по замыслу, что соответствует его позиционированию как быстрого/дешевого уровня. Но эти прейскурантные цены на самом деле никто сейчас не платит: Ant проводит бесплатную рекламную акцию в честь недели запуска и отдельно предлагает 500 тыс. бесплатных токенов в день на своей платформе. В списке OpenRouter указан вариант ling-3.0-flash:free по $0/$0. Ничего из этого не следует путать со стабильной ценой. Рекламные акции при запуске заканчиваются, бесплатные уровни ограничиваются, а сами показатели ¥0.40/¥1.20 могут измениться после получения реальных данных об использовании. Если вы планируете производственные расходы на эту модель, рассчитывайте бюджет по прейскурантной цене, а не по рекламной, и перепроверьте перед принятием обязательств.
Семья Линг / Ринг / Минг
Ling-3.0-flash не существует изолированно — InclusionAI организует свои релизы в три именованных семейства, каждое из которых предназначено для разных задач. Ling — это универсальная линейка MoE, охватывающая повседневную генерацию текста и вызов инструментов; Ling-3.0-flash находится на быстром/дешевом конце этой линейки, а Ling-2.6-1T остается флагманским продуктом крупнее. Ring — это ориентированная на рассуждения линейка InclusionAI, созданная для задач, которые опираются на многошаговую цепочку рассуждений, а не на сырую пропускную способность. Ming — это мультимодальная линейка, работающая с изображениями и другими нетекстовыми модальностями, к которым Ling сам не прикасается. Если ваша задача требует более тяжелых рассуждений или мультимодального ввода, правильная модель InclusionAI, вероятно, не Ling-3.0-flash — она создана для объема и скорости в рамках текстового и инструментального направления, а не для выхода на территорию других двух семейств.
Для кого это: три сценария
1. Высоконагруженные, чувствительные к задержкам конвейеры текста или вызова инструментов — в качестве пилотного проекта, а не обязательства.
Если ваша нагрузка в основном состоит из генерации текста или вызова инструментов, чувствительных к пропускной способности — чаты, лёгкие агенты, высокочастотные API-вызовы — позиционирование Ling-3.0-flash (малое количество активных параметров, заявленный TTFT менее 100 мс, почти бесплатные стартовые цены) делает его достойным пилотного внедрения. Загвоздка в том, что «достойно пилота» — это не то же самое, что «стоит переводить на него продакшн-трафик». При отсутствии независимых бенчмарков именно вы сейчас являетесь бенчмарком: прогоните через него собственный набор для оценки, прежде чем доверять ему что-либо, ориентированное на клиентов, и не стройте модели затрат на основе текущих рекламных цен.
2. Команды, которым нужен длинный контекст в условиях ограниченного бюджета
Окно контекста в 256K (с заявлением производителя о возможности расширения до 1M) при действительно низкой прейскурантной цене является привлекательным сочетанием для задач, связанных с интенсивным поиском или обработкой документов, при условии, что фактическое качество рассуждений модели сохраняется на протяжении этой длины контекста — что, опять же, не было проверено ни одним независимым источником. Это разумный кандидат для включения в шорт-лист наряду с устоявшимися дешевыми вариантами с длинным контекстом, но его следует оценивать в сравнении с ними, а не принимать на основе только спецификаций Ant.
3. Наблюдатели, отслеживающие ландшафт MoE в Китае и дорожную карту InclusionAI
Для команд, которые отслеживают конкурентную ситуацию среди китайских лабораторий, разрабатывающих открытые и полуоткрытые модели, а не разворачивают какую-либо одну модель в производстве, Ling-3.0-flash является полезной точкой отсчёта: она показывает, что InclusionAI быстро итерационно улучшает свой быстрый уровень, возможно, отступая от открытых весов (по крайней мере, сейчас) и продолжает делать ставку на трёхсемейную структуру (Ling/Ring/Ming), а не на одну универсальную модель. Стоит сохранить и пересмотреть, когда появятся ясность по бенчмаркам и лицензиям.
Когда не следует использовать это
Пропустите Ling-3.0-flash для всего, где нужно сослаться на подтверждённое заявление о возможностях — независимого бенчмарка нет, поэтому любое утверждение о его рассуждениях, программировании или математических способностях сейчас неопровержимо. Пропустите его, если вам нужны открытые веса для самостоятельного хостинга, дообучения или соблюдения требований — их нет, а лицензия для этой конкретной модели даже не объявлена, не говоря уже о подтверждении её разрешительности. Пропустите его для мультимодальных задач — это работа линейки Ming, а не Ling. И будьте осторожны, строя модель затрат на основе сегодняшних цен: бесплатная неделя запуска, 500 000 бесплатных токенов в день и бесплатный тариф OpenRouter — всё это промоакции, а прейскурант ¥0,40/¥1,20, к которому, скорее всего, вернутся, ещё не был проверен на реальных сценариях использования.
Часто задаваемые вопросы
Имеет ли Ling-3.0-flash открытые веса?
В настоящее время нет. На момент написания нет репозитория Hugging Face и проекта Ling-V3 на GitHub. Предыдущие поколения Ling (2.0 и 2.6) были выпущены под лицензией MIT с открытыми весами, но ничто не подтверждает, что Ling-3.0-flash последует этому образцу — или же нет.
Как Ling-3.0-flash показывает себя в бенчмарках?
Пока для неё нет независимых бенчмарков — на Artificial Analysis нет страницы для этой модели. В собственной документации Ant Group также не публикуется таблица бенчмарков для неё. Для грубой исторической справки: Ling-2.6-flash предыдущего поколения набрала 14 баллов по Индексу искусственного интеллекта Artificial Analysis, а Ling-2.6-1T — 26, но ни одно из этих чисел не следует переносить на новое поколение.
Насколько это на самом деле быстро?
Ant Group заявляет о пиковой пропускной способности 1000 токенов/с и времени до первого токена менее 100 мс. Оба показателя являются только данными от вендора, и на данный момент не опубликовано независимых повторных измерений. Относитесь к ним как к заявлениям, которые нужно проверить на своей нагрузке, а не как к подтверждённой производительности.
Сколько стоит Ling-3.0-flash?
Стандартные цены на платформе Ant составляют ¥0.40 за 1 млн входных токенов и ¥1.20 за 1 млн выходных токенов, но в рамках рекламной акции в честь запуска в настоящее время это бесплатно, также доступно 500 тысяч бесплатных токенов в день. OpenRouter также предлагает бесплатный вариант. Ожидается, что эти рекламные условия изменятся.
Насколько велико контекстное окно?
256K токенов согласно документации Ant, с утверждением вендора, что это можно расширить до 1M. В листинге OpenRouter указано 262 144 токена, что соответствует 256K. Максимальная длина вывода не раскрыта.
В чем разница между Ling, Ring и Ming?
Ling — это универсальная текстовая и инструментальная MoE-линейка от InclusionAI, а Ling-3.0-flash находится на её быстром/дешёвом конце. Ring — это линейка, ориентированная на рассуждения. Ming занимается мультимодальными задачами. Это отдельные семейства моделей, созданные для разных задач, а не уровни одной и той же модели.
Ling-3.0-flash то же самое, что Ling-2.6-1T?
№ Ling-2.6-1T — это более крупный флагман InclusionAI (1T всего / 63B активных параметров) и остается отдельной, более крупной моделью. Ling-3.0-flash (124B всего / ~5.1B активных) — это более новый, меньший и более быстрый выпуск.
Стоит ли мне использовать Ling-3.0-flash в продакшене сегодня?
Только после проведения собственной оценки. При отсутствии независимого бенчмарка, неподтвержденной лицензии и текущих промо-ценах разумно провести пилотное тестирование, но преждевременно доверять ему критически важные для производства или требующие соблюдения нормативных требований рабочие нагрузки без собственного тестирования и плана действий на случай окончания промо-условий.
Суть
Ling-3.0-flash — это действительно новый релиз, за которым стоит следить: модель MoE с 124B/5.1B активных параметров, нацеленная на быструю, дешёвую обработку больших объёмов текста и вызов инструментов, и выпущена лабораторией, которая уже создавала заслуживающие доверия модели. Но сейчас это только спецификация и набор заявлений от вендора, а не проверенный продукт: нет независимых бенчмарков, открытых весов, подтверждённой лицензии, а цены явно рекламные. Это не повод отказываться от неё — это повод осторожно протестировать, на практике проверить утверждения, важные именно для вас, и вернуться к этому краткому обзору, как только Artificial Analysis или другой независимый оценщик опубликует реальные цифры.

