Титульная карточка для «Ling-3.1-flash достигает 41 в AA Intelligence Index», с подзаголовком «560B общих / 25B активных MoE от Ant Group». Большая скруглённая карточка содержит число «41» с подписью «Artificial Analysis Intelligence Index v4.3.2»; ниже неё вторая маленькая карточка гласит «против 20» с подписью «Ling-3.0-flash». Строка в нижнем колонтитуле гласит: «Значение индекса независимо измерено Artificial Analysis; модель выпущена 2026-10-01». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

Ling-3.1-flash набирает 41 балл в индексе интеллекта Artificial Analysis: 560B MoE вдвое превосходит предшественника

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ling-3.1-flash, смесь экспертов Ant Group на 560 миллиардов параметров, теперь имеет число, которое не написала собственная лаборатория модели: 41 в Artificial Analysis Intelligence Index. Индекс рассчитывает независимый оценщик, на оборудовании, которое контролирует оценщик, по фиксированному набору — и он ставит модель на 21 балл выше её непосредственного предшественника, Ling-3.0-flash, который всё ещё занимает 20 в том же индексе. Ant объявила Ling-3.1-flash в конце сентября 2026 года, Artificial Analysis датирует релиз 1 октября, и она на три месяца моложе модели, чей показатель удваивает.

Этот разрыв — и есть суть. Изменение на 21 пункт по композитному показателю, который формируют десять различных оценок, — не то, что может подделать график вендора, и не то, о чём этот блог мог бы написать две недели назад, когда единственным существовавшим измерением Ling-3.1-flash была собственная бенчмарк-карта Ant: 1 673 Elo в GDPval-AA v2.1, 75,16 в FrontierSWE, 65,35 в HealthBench Professional. Эти цифры были реальными заявлениями реальной лаборатории, но невоспроизведёнными. 41 — иной по своей природе. Это первая цифра в этом релизе, за которую может отвечать третья сторона.

Что на самом деле измеряет 41

Artificial Analysis Intelligence Index v4.3.2 — это взвешенная композитная оценка из десяти испытаний: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. Читать композитную оценку в отрыве от контекста — ошибка, поэтому строки по каждому отдельному испытанию важнее, чем итоговый показатель:

• GDPval-AA — 1 621,75 для Ling-3.1-flash против 948,35 для Ling-3.0-flash. Это самый крупный единичный скачок в наборе, и именно на нём держится большая часть изменения индекса.

• GDP.pdf — 0.100 all-pass, вырос с 0.054. По абсолютным значениям всё ещё низко, но это почти удвоение.

• AA-LCR v1.1: рассуждения на длинном контексте — 0,83 против 0,73 у предшественника и на одном уровне с DeepSeek V4.1 Flash (Max) при 0,84.

• SciCode — 0.541 против 0.420. Прирост в сфере научного программирования, а не в качестве чата.

• CritPt рассуждения по физике — 0.180 против 0.017 ранее. В десять раз больше, чем у предшественника, на небольшой базе.

• AA-Omniscience — +2,22 против −17,88 у Ling-3.0-flash. Об этом показателе речь пойдёт ниже, поскольку он идёт вразрез с основным тезисом.

Ling-3.0-flash не просто уступил Ling-3.1-flash в этих строках; на двух из них он потерпел крах. Он набрал 0.032 в AutomationBench-AA и ровно 0.000 в Terminal-Bench 4.0. Именно в этом контексте следует читать 41 — предшественник был эффективной, дешёвой моделью с открытыми весами, у которой практически полностью отсутствовала способность к агентной работе в терминале.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

Откуда взялся прирост: агентная работа, а не разговоры

Сравните вклад Ling-3.1-flash в индекс с двумя моделями уровня Flash, с которыми его чаще всего ставят в один ряд, — и проявится закономерность, которую скрывает агрегированный показатель. DeepSeek V4.1 Flash (Max) набирает 39 по тому же индексу, а GLM 5.3 Flash — 42, так что все три оказываются внутри диапазона шириной в три пункта. Но приходят туда из разных мест.

• Агентная работа в терминале — Ling-3.1-flash 0.333 на Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.

• Агентная работа в реальном мире — Ling-3.1-flash 1 621,75 Elo на GDPval-AA, DeepSeek V4.1 Flash (Max) 1 600, GLM 5.3 Flash 1 646,86.

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.

• Наука о программировании — Ling-3.1-flash 0,541 в SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.

Узкое прочтение: Ling-3.1-flash конкурентоспособна на агентных бенчмарках и немного опережает на SciCode. Полезное прочтение: она самая сильная из трёх по двум агентно-терминальным метрикам, которые большинство людей имеет в виду, когда говорит «может ли она вести цикл работы с инструментами», — и она уступает обеим по метрике надёжности знаний. Это конкретный профиль, а не общая победа, и это стоит назвать, прежде чем кто-либо станет выбирать рабочую нагрузку исключительно по числу в индексе.

Счёт, который приходит вместе с более крупной моделью

Ling-3.0-flash стоила $0.07 за миллион входных токенов и $0.22 за миллион выходных токенов в собственном API Ant, и она распространялась с открытыми весами под лицензией MIT. Ling-3.1-flash пока не обладает ни тем, ни другим. Artificial Analysis фиксирует стоимость её работы на уровне $0.30 за миллион входных и $0.90 за миллион выходных — при тарифе за попадание в кэш $0.06, что даёт 80% скидку на входные токены — измеренную относительно собственного API InclusionAI в качестве провайдера обслуживания. Это примерно четырёхкратное увеличение цены на входные токены по сравнению с моделью, которую она заменяет, за прирост индекса на 21 пункт.

Выгоден ли такой компромисс, полностью зависит от рабочей нагрузки, и сам индекс может рассчитать его стоимость: запуск всех десяти оценок Intelligence Index для Ling-3.1-flash стоит около $960 по этим тарифам, тогда как для DeepSeek V4.1 Flash (Max) — примерно $477, а для GLM 5.3 Flash — $280. Причина не только в тарифной сетке. Ling-3.1-flash — очень разговорчивая модель рассуждений: она израсходовала 220 млн выходных токенов, проходя этот индекс, что значительно выше медианы для её ценового сегмента, а её оценочные прогоны в среднем занимают около 357 секунд на задачу против 285 секунд у DeepSeek V4.1 Flash (Max) и 979 секунд у GLM 5.3 Flash. В пересчёте на задачу Ling-3.1-flash обходится примерно в $0,99 против $0,27 у DeepSeek и $0,25 у GLM 5.3 Flash.

Ничего из этого не видно с 41, и всё это ложится на инвойс. Модель может выиграть индекс и потерять бюджет.

Две цифры, которые спорят с заголовком

Первый — надёжность знаний. Ling-3.1-flash набирает +2,22 балла в AA-Omniscience — тесте, который измеряет, знает ли модель, что она знает: правильные ответы приносят баллы, галлюцинации отнимают баллы, а отказы не стоят ничего. Точность ответов составляет 29,1%, а уровень галлюцинаций — 37,9%. Рядом с собратьями по семейству это самый слабый профиль в группе: GLM 5.3 Flash набирает +7,47 при уровне галлюцинаций 27,6%, а DeepSeek V4.1 Flash (Max) — −5,30 при ошеломляющих 96,5% галлюцинаций среди вопросов, на которые были даны ответы. Композитный показатель вознаграждает Ling-3.1-flash за демонстрируемые возможности, а не за надёжность, с которой они демонстрируются, а модель, которая выдумывает треть того, что утверждает, нуждается в retrieval-обвязке вокруг неё в продакшене.

Второй момент — это контекст. Artificial Analysis указывает Ling-3.1-flash с окном контекста в 1 000 000 токенов. В собственных материалах Ant к выпуску тоже упоминается 1M как целевой показатель. Но документация для разработчиков от Ant, где окна моделей этого семейства перечислены по каждой модели, для Ling-3.0-flash указывает нативные 256K с расширением до 1M, а записи для Ling-3.1-flash там пока нет вообще. Характерная строка для длинного контекста, которую всё же измерили — AA-LCR на 0,83 — это оценка рассуждения над длинным контекстом, а не измерение фактически предоставляемого окна. Считайте 1M заявленным потолком и проверьте реально доступное окно собственным запросом с длинным контекстом, прежде чем проектировать с расчётом на него.

Как это выглядит в таблице характеристик

Поэлементная картина по измерениям, сначала субъект, в каждой строке:

• Общее число параметров — Ling-3.1-flash 560B против DeepSeek V4.1 Flash (Max) 552B против GLM 5.3 Flash 320B.

• Активных параметров на токен — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash задействует больше всего параметров, и это одна из причин, по которой стоимость его обслуживания находится на таком уровне.

• Веса и лицензия — Ling-3.1-flash не опубликованы (проприетарная, текст лицензии отсутствует) против DeepSeek V4.1 Flash (Max), открытого под MIT, против GLM 5.3 Flash, открытого под MIT.

• Заявленный контекст — Ling-3.1-flash 1M против DeepSeek V4.1 Flash (Max) 1M против GLM 5.3 Flash 1M. Все три заявляют один и тот же потолок; только у двух из них есть скачиваемый чекпойнт, по которому это можно проверить.

• Модальность — Ling-3.1-flash: текст на входе, текст на выходе; DeepSeek V4.1 Flash (Max): текст и изображение на входе; GLM 5.3 Flash: текст, изображение и видео на входе. Это единственная ось, по которой Ling-3.1-flash просто отстаёт, и ни одна строка бенчмарка этого не компенсирует.

• Цена в API вендора — Ling-3.1-flash $0.30 / $0.90 за миллион входных / выходных токенов против DeepSeek V4.1 Flash (Max) $0.30 / $1.20 против GLM 5.3 Flash $0.15 / $0.50.

• Балл по индексу — 41 против 39 против 42. Разброс в три балла при сравнении трёх вариантов — это не рейтинг; это ничья, разрешаемая тем, на какую оценку больше похожа рабочая нагрузка читателя.

Где вы можете это назвать

Ling-3.1-flash сегодня отсутствует в каталоге OrcaRouter — запрос к нашему публичному API моделей для модели от InclusionAI возвращает not-found, и мы не будем утверждать обратное. Сейчас он работает на собственном API Ant и на сторонних платформах, где представлен этот релиз, и это честно отражает границы его доступности. Что стоит отметить для всех, кто сравнивает три модели выше: две другие доступны для маршрутизации прямо сейчас. DeepSeek V4.1 Flash и GLM 5.3 Flash обе присутствуют в каталоге OrcaRouter по ценам из прайс-листов своих провайдеров с нулевой наценкой, под одним API-ключом, с автоматическим переключением при сбое между ними. Если из сравнения выше следует, что для вашей рабочей нагрузки важнее надёжность знаний, чем агентная работа в терминале, то стоит попробовать GLM 5.3 Flash — и вы можете сравнить его с DeepSeek V4.1 Flash на том же ключе без второго контракта и без единой строки нового клиентского кода.

Что меняет 41, а что — нет

Что оно меняет — так это положение релиза. Ling-3.1-flash больше не спецификация с приложенной диаграммой от вендора; это модель с независимо измеренной позицией, и эта позиция — настоящий поколенческий скачок в агентных возможностях по сравнению с Ling-3.0-flash — скачок того рода, который возникает из-за изменения дизайна, а не из-за больших вычислений по тому же рецепту. А чего оно не меняет — так это ничего в вопросах закупки. Веса по-прежнему закрыты, лицензия по-прежнему не прописана, модальность по-прежнему только текстовая, а цена примерно в четыре раза выше, чем у предшественника, за прирост, сосредоточенный в агентных и терминальных задачах.

Если ваша работа — это агентные циклы, управление инструментами и длинные цепочки инструментов, то 41 — самое значимое число, опубликованное об этой модели на сегодня, и оно заслуживает серьёзного внимания, пока доступность всё ещё расширяется. Если ваша работа — мультимодальность, критичное к знаниям вопросно-ответное применение или чувствительный к бюджету высокообъёмный инференс, то 41 не покрывает вашу задачу — а GLM 5.3 Flash, уже доступный для маршрутизации и уже открытый под лицензией MIT при половине цены за вывод, — лучше позиционированная модель из трёх. Индекс показывает, где находится Ling-3.1-flash. Он не говорит, стоит ли вам обращать на это внимание, и ответ на этот вопрос даёт то, что вы создаёте.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube