Сгенерированная редакционная карточка-герой под названием «Ling-3.1-flash vs Ling-3.0-flash» с подзаголовком «Одну можно скачать уже сегодня. Другая — лишь строчка в пресс-релизе». Две колонки для сравнения: «Ling-3.1-flash (анонсирована)» перечисляет «~560 млрд всего / ~25 млрд активных», «контекст до 1 млн токенов» и «нет весов, нет лицензии»; «Ling-3.0-flash (выпущена)» перечисляет «124 млрд всего / 5,1 млрд активных», «обслуживаемый контекст 262 144 токена» и «веса под лицензией MIT на Hugging Face».
Guides & Insights

Ling-3.1-flash против Ling-3.0-flash: что на самом деле меняют окно в 1 млн токенов и в 4,5 раза больше параметров

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У семейства Ling от Ant Group появилась новая быстрая линейка, и на этот раз о ней известно лишь из одного предложения. О Ling-3.1-flash объявили 30 сентября 2026 года — примерно 560 млрд общих параметров, около 25 млрд активных на токен, контекстное окно заявлено до 1 млн токенов, и приложена дежурная фраза: «Мы планируем в ближайшее время открыть исходный код модели». Модель, которую Ling-3.1-flash заменяет на вершине быстрой линейки, Ling-3.0-flash, — совсем другой зверь во всех смыслах: 124 млрд общих параметров, 5,1 млрд активных на токен, обслуживаемый контекст в 262 144 токена, веса под лицензией MIT на Hugging Face с 7 августа и независимый Artificial Analysis Intelligence Index со значением 20. Одну из этих моделей можно скачать уже сегодня. О другой можно только прочитать. Сравнивать их действительно полезно, но только если сравнение начинается с этого.

Арифметика в заголовке проста и слегка вводит в заблуждение. Ling-3.1-flash имеет примерно в 4,5 раза больше общего числа параметров, чем Ling-3.0-flash, и примерно в 4,9 раза больше активных параметров — 25B против 5,1B на токен. При поверхностном чтении можно сказать: «модель намного больше, следовательно, модель намного умнее». Более внимательное чтение показывает, что Ant примерно сохранила коэффициент разреженности, масштабируя тело, и это даёт вам ёмкость, а не обязательно глубину рассуждений на токен: модель, которая направляет 25B из своих 560B через каждый токен, выполняет больше работы на токен, чем модель, направляющая 5,1B, но она также тратит примерно в пять раз больше вычислений на токен, чтобы сделать это. То, чем обернётся этот компромисс, полностью зависит от того, эффективно ли архитектура Ant обрабатывает дополнительные параметры, — и на этот вопрос в анонсе ответа нет.

Две модели бок о бок

Поставьте опубликованные факты рядом друг с другом, и поколения чётко разделятся. Каждая строка ниже указывает, что фактически опубликовал Ant или независимый оценщик; если число отсутствует, оно отсутствует потому, что его никто не публиковал.

• Всего параметров — Ling-3.1-flash: ~560 млрд (поставщик). Ling-3.0-flash: 124 млрд (карточка модели).

• Активные параметры на токен — Ling-3.1-flash: ~25B (по данным вендора). Ling-3.0-flash: 5.1B (карточка модели).

• Контекстное окно — Ling-3.1-flash: до 1M токенов (по данным вендора). Ling-3.0-flash: 256K нативно, обслуживается при 262,144 (карточка модели и рецепты инференса).

• Веса и лицензия — Ling-3.1-flash: не опубликованы; нет репозитория, нет лицензии (проверено 30 сентября и снова 1 октября 2026 г.). Ling-3.0-flash: MIT, на Hugging Face как inclusionAI/Ling-3.0-flash и на ModelScope с 7 августа 2026 г.

• Форматы весов — Ling-3.1-flash: недоступны. Ling-3.0-flash: BF16 (~255 ГБ) и FP8 (~128 ГБ) от лаборатории, а также квантованные версии от сообщества.

• Происхождение бенчмарка — Ling-3.1-flash: полностью со слов вендора, нет публичного набора тестов, нет весов для повторного запуска. Ling-3.0-flash: независимо оценён Artificial Analysis с Индексом интеллекта 20, а также опубликованы измеренная скорость вывода и объём генерации токенов.

• Доступность — Ling-3.1-flash: только в собственном продукте Ant — Ling Studio. Ling-3.0-flash: можно развернуть самостоятельно, а также вызывать через API для разработчиков Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Для чего, вероятно, нужна дополнительная мощность

Однострочное описание Ling-3.1-flash от Ant — самая информативная вещь в релизе. Приложение Ling Studio позиционирует его для «агентов общего назначения, поиска, рутинной офисной работы и разработки программного обеспечения/кода» — это ориентация на офисную работу и агентов, а не на бенчмарки для рассуждений. Это согласуется с тем, как организовано семейство: Ling — это линейка общего назначения для текста и инструментов, Ring — линейка для рассуждений, а Ming отвечает за мультимодальность. Ling-3.0-flash занимал ту же нишу на одно поколение раньше, и он был явно быстрым и дешёвым сегментом, а не флагманом.

Взгляните на это масштабирование под таким углом — и оно обретает смысл. Агентные рабочие нагрузки и нагрузки с вызовом инструментов долгие, повторяющиеся и требовательные к контексту: один цикл агента может сжечь десятки тысяч токенов накопленного вывода инструментов, прежде чем предпримет действие, так что окно в 1M токенов — это функциональное требование, а не красивая строчка в спецификации. Увеличение общего числа параметров при сохранении большой активной доли — вот как вы добавляете модели знания о мире и глубину следования инструкциям, при этом она всё ещё должна быть достаточно быстрой, чтобы работать внутри цикла. Ant здесь строит не более медленный, более умный флагман; он строит более крупный быстрый уровень.

Контраргумент — это стоимость, и это та же арифметика, но с другой стороны. Дополнительная мощность не бесплатна во время инференса — за неё платят на каждом токене, а Ant вообще не опубликовала цену для Ling-3.1-flash: ни прайс-листа API, ни скидки за кэш, ничего сопоставимого с $0.075/$0.22 за миллион токенов, которые указаны для предыдущего поколения. Это то недостающее число, которое решило бы это сравнение, и его нет.

Бенчмарки и кто их проводил

Ling-3.1-flash выходит с тремя оценками, которые по отдельности выглядят сильно: 1 673 Elo в GDPVal-AA v2.1, 75,16 в FrontierSWE и 65,35 в HealthBench Professional. Все три — собственные показатели Ant, взятые из анонса, и ни один из них не был воспроизведён сторонней лабораторией. Практическое следствие состоит в том, что их можно сравнивать с цифрами других производителей, но не с независимыми, — а 20-балльный Intelligence Index от Artificial Analysis для Ling-3.0-flash — это независимый показатель в другой шкале, так что поставить их рядом означало бы сравнивать результат измерения с утверждением. На момент написания на Artificial Analysis нет страницы Ling-3.1-flash.

Одну сноску на собственной диаграмме Ant стоит отметить отдельно. В карточке указано, что результат HealthBench Professional оценивался в «среде AQ», а возможности Ling-3.1-flash в области здравоохранения в настоящее время можно испытать только в AQ. Никакая публичная документация не объясняет, что такое AQ. Заглавный результат с нерасшифрованным уточнением о среде — это не то, что сторонняя команда может воспроизвести, даже когда веса уже будут доступны.

Какой из них действительно использовать на этой неделе

Вопрос о поколениях решается по-разному в зависимости от того, что нужно вам сегодня, и почти для всех ответ прямо сейчас — не более новая модель.

Если вам нужно запустить что-то на этой неделе, Ling-3.0-flash — единственный из двух, существующий в пригодной для использования форме: веса под лицензией MIT, которые можно развернуть у себя, FP8, если вам нужен меньший объём, опубликованные цены на API от разработчика и независимая оценка, которая показывает, что вы получаете. Это по-настоящему хорошая модель в своём классе — независимая оценка поместила её на границу Парето для открытых весов по уровню интеллекта относительно общего числа параметров и высоко оценила её скорость, с оговоркой, что она необычно многословна и сгенерировала около 260 млн токенов в ходе оценки против медианы около 100 млн.

Если вы планируете на следующие шесть месяцев, Ling-3.1-flash — это направление движения, а не готовый компонент. Конкретные моменты, за которыми стоит следить, прежде чем он им станет: откроются ли веса на самом деле и под какой лицензией, действительно ли обслуживаемое окно составляет 1M или это расширение более короткого нативного контекста, сколько это стоит за миллион токенов и воспроизведёт ли независимая лаборатория 75.16 на FrontierSWE. Любой из этих пунктов, если бы он реализовался, стал бы поводом заново провести сравнение. Ни один не реализовался.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Как это вписывается в стек маршрутизации

Ни одной модели Ling сегодня нет в нашем каталоге — Ling-3.0-flash, Ling-3.0-flash-VL и Ling-3.1-flash все возвращают not-found при запросе к API моделей OrcaRouter, так что честный ответ на вопрос «можно ли вызвать её через вас» — пока нет. А вот в чём маршрутизирующий слой действительно полезен на такой неделе, как эта, — это вторая половина задачи: модели, с которыми вы бы сравнивали кандидата. Claude Opus 5, GPT-5.6 Sol и DeepSeek-V4.1-Flash — все это живые маршруты по каталожной цене провайдера без наценки, и роутер, который держит их за одним ключом с автоматическим переключением при сбое, — это способ удерживать оценочный стенд нацеленным на движущуюся цель, не поддерживая четыре отдельные интеграции. Когда веса Ling-3.1-flash выйдут и лицензию можно будет прочитать, решение будет той же формы: добавить одну конечную точку, а не перестраивать весь стек.

Кратко о поколениях. Ling-3.0-flash — это выпущенная, независимо оценённая модель с разрешительной лицензией, которую можно развернуть самостоятельно уже сегодня. Ling-3.1-flash — это более крупное, с более длинным контекстом, более дорогое в эксплуатации обещание, которое Ant ещё не предоставила ни в какой форме, пригодной для использования разработчиком. Отношение ко второй как к улучшению первой — именно та ошибка, к которой подталкивает этот релиз, и цифры пока этого не подтверждают.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".