
Ling-3.1-flash набирает 41 балл в индексе интеллекта Artificial Analysis: 560B MoE вдвое превосходит предшественника
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Ling-3.1-flash, смесь экспертов Ant Group на 560 миллиардов параметров, теперь имеет число, которое не написала собственная лаборатория модели: 41 в Artificial Analysis Intelligence Index. Индекс рассчитывает независимый оценщик, на оборудовании, которое контролирует оценщик, по фиксированному набору — и он ставит модель на 21 балл выше её непосредственного предшественника, Ling-3.0-flash, который всё ещё занимает 20 в том же индексе. Ant объявила Ling-3.1-flash в конце сентября 2026 года, Artificial Analysis датирует релиз 1 октября, и она на три месяца моложе модели, чей показатель удваивает.
Этот разрыв — и есть суть. Изменение на 21 пункт по композитному показателю, который формируют десять различных оценок, — не то, что может подделать график вендора, и не то, о чём этот блог мог бы написать две недели назад, когда единственным существовавшим измерением Ling-3.1-flash была собственная бенчмарк-карта Ant: 1 673 Elo в GDPval-AA v2.1, 75,16 в FrontierSWE, 65,35 в HealthBench Professional. Эти цифры были реальными заявлениями реальной лаборатории, но невоспроизведёнными. 41 — иной по своей природе. Это первая цифра в этом релизе, за которую может отвечать третья сторона.
Что на самом деле измеряет 41
Artificial Analysis Intelligence Index v4.3.2 — это взвешенная композитная оценка из десяти испытаний: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. Читать композитную оценку в отрыве от контекста — ошибка, поэтому строки по каждому отдельному испытанию важнее, чем итоговый показатель:
• GDPval-AA — 1 621,75 для Ling-3.1-flash против 948,35 для Ling-3.0-flash. Это самый крупный единичный скачок в наборе, и именно на нём держится большая часть изменения индекса.
• GDP.pdf — 0.100 all-pass, вырос с 0.054. По абсолютным значениям всё ещё низко, но это почти удвоение.
• AA-LCR v1.1: рассуждения на длинном контексте — 0,83 против 0,73 у предшественника и на одном уровне с DeepSeek V4.1 Flash (Max) при 0,84.
• SciCode — 0.541 против 0.420. Прирост в сфере научного программирования, а не в качестве чата.
• CritPt рассуждения по физике — 0.180 против 0.017 ранее. В десять раз больше, чем у предшественника, на небольшой базе.
• AA-Omniscience — +2,22 против −17,88 у Ling-3.0-flash. Об этом показателе речь пойдёт ниже, поскольку он идёт вразрез с основным тезисом.
Ling-3.0-flash не просто уступил Ling-3.1-flash в этих строках; на двух из них он потерпел крах. Он набрал 0.032 в AutomationBench-AA и ровно 0.000 в Terminal-Bench 4.0. Именно в этом контексте следует читать 41 — предшественник был эффективной, дешёвой моделью с открытыми весами, у которой практически полностью отсутствовала способность к агентной работе в терминале.

Откуда взялся прирост: агентная работа, а не разговоры
Сравните вклад Ling-3.1-flash в индекс с двумя моделями уровня Flash, с которыми его чаще всего ставят в один ряд, — и проявится закономерность, которую скрывает агрегированный показатель. DeepSeek V4.1 Flash (Max) набирает 39 по тому же индексу, а GLM 5.3 Flash — 42, так что все три оказываются внутри диапазона шириной в три пункта. Но приходят туда из разных мест.
• Агентная работа в терминале — Ling-3.1-flash 0.333 на Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• Агентная работа в реальном мире — Ling-3.1-flash 1 621,75 Elo на GDPval-AA, DeepSeek V4.1 Flash (Max) 1 600, GLM 5.3 Flash 1 646,86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• Наука о программировании — Ling-3.1-flash 0,541 в SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.
Узкое прочтение: Ling-3.1-flash конкурентоспособна на агентных бенчмарках и немного опережает на SciCode. Полезное прочтение: она самая сильная из трёх по двум агентно-терминальным метрикам, которые большинство людей имеет в виду, когда говорит «может ли она вести цикл работы с инструментами», — и она уступает обеим по метрике надёжности знаний. Это конкретный профиль, а не общая победа, и это стоит назвать, прежде чем кто-либо станет выбирать рабочую нагрузку исключительно по числу в индексе.
Счёт, который приходит вместе с более крупной моделью
Ling-3.0-flash стоила $0.07 за миллион входных токенов и $0.22 за миллион выходных токенов в собственном API Ant, и она распространялась с открытыми весами под лицензией MIT. Ling-3.1-flash пока не обладает ни тем, ни другим. Artificial Analysis фиксирует стоимость её работы на уровне $0.30 за миллион входных и $0.90 за миллион выходных — при тарифе за попадание в кэш $0.06, что даёт 80% скидку на входные токены — измеренную относительно собственного API InclusionAI в качестве провайдера обслуживания. Это примерно четырёхкратное увеличение цены на входные токены по сравнению с моделью, которую она заменяет, за прирост индекса на 21 пункт.
Выгоден ли такой компромисс, полностью зависит от рабочей нагрузки, и сам индекс может рассчитать его стоимость: запуск всех десяти оценок Intelligence Index для Ling-3.1-flash стоит около $960 по этим тарифам, тогда как для DeepSeek V4.1 Flash (Max) — примерно $477, а для GLM 5.3 Flash — $280. Причина не только в тарифной сетке. Ling-3.1-flash — очень разговорчивая модель рассуждений: она израсходовала 220 млн выходных токенов, проходя этот индекс, что значительно выше медианы для её ценового сегмента, а её оценочные прогоны в среднем занимают около 357 секунд на задачу против 285 секунд у DeepSeek V4.1 Flash (Max) и 979 секунд у GLM 5.3 Flash. В пересчёте на задачу Ling-3.1-flash обходится примерно в $0,99 против $0,27 у DeepSeek и $0,25 у GLM 5.3 Flash.
Ничего из этого не видно с 41, и всё это ложится на инвойс. Модель может выиграть индекс и потерять бюджет.
Две цифры, которые спорят с заголовком
Первый — надёжность знаний. Ling-3.1-flash набирает +2,22 балла в AA-Omniscience — тесте, который измеряет, знает ли модель, что она знает: правильные ответы приносят баллы, галлюцинации отнимают баллы, а отказы не стоят ничего. Точность ответов составляет 29,1%, а уровень галлюцинаций — 37,9%. Рядом с собратьями по семейству это самый слабый профиль в группе: GLM 5.3 Flash набирает +7,47 при уровне галлюцинаций 27,6%, а DeepSeek V4.1 Flash (Max) — −5,30 при ошеломляющих 96,5% галлюцинаций среди вопросов, на которые были даны ответы. Композитный показатель вознаграждает Ling-3.1-flash за демонстрируемые возможности, а не за надёжность, с которой они демонстрируются, а модель, которая выдумывает треть того, что утверждает, нуждается в retrieval-обвязке вокруг неё в продакшене.
Второй момент — это контекст. Artificial Analysis указывает Ling-3.1-flash с окном контекста в 1 000 000 токенов. В собственных материалах Ant к выпуску тоже упоминается 1M как целевой показатель. Но документация для разработчиков от Ant, где окна моделей этого семейства перечислены по каждой модели, для Ling-3.0-flash указывает нативные 256K с расширением до 1M, а записи для Ling-3.1-flash там пока нет вообще. Характерная строка для длинного контекста, которую всё же измерили — AA-LCR на 0,83 — это оценка рассуждения над длинным контекстом, а не измерение фактически предоставляемого окна. Считайте 1M заявленным потолком и проверьте реально доступное окно собственным запросом с длинным контекстом, прежде чем проектировать с расчётом на него.
Как это выглядит в таблице характеристик
Поэлементная картина по измерениям, сначала субъект, в каждой строке:
• Общее число параметров — Ling-3.1-flash 560B против DeepSeek V4.1 Flash (Max) 552B против GLM 5.3 Flash 320B.
• Активных параметров на токен — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash задействует больше всего параметров, и это одна из причин, по которой стоимость его обслуживания находится на таком уровне.
• Веса и лицензия — Ling-3.1-flash не опубликованы (проприетарная, текст лицензии отсутствует) против DeepSeek V4.1 Flash (Max), открытого под MIT, против GLM 5.3 Flash, открытого под MIT.
• Заявленный контекст — Ling-3.1-flash 1M против DeepSeek V4.1 Flash (Max) 1M против GLM 5.3 Flash 1M. Все три заявляют один и тот же потолок; только у двух из них есть скачиваемый чекпойнт, по которому это можно проверить.
• Модальность — Ling-3.1-flash: текст на входе, текст на выходе; DeepSeek V4.1 Flash (Max): текст и изображение на входе; GLM 5.3 Flash: текст, изображение и видео на входе. Это единственная ось, по которой Ling-3.1-flash просто отстаёт, и ни одна строка бенчмарка этого не компенсирует.
• Цена в API вендора — Ling-3.1-flash $0.30 / $0.90 за миллион входных / выходных токенов против DeepSeek V4.1 Flash (Max) $0.30 / $1.20 против GLM 5.3 Flash $0.15 / $0.50.
• Балл по индексу — 41 против 39 против 42. Разброс в три балла при сравнении трёх вариантов — это не рейтинг; это ничья, разрешаемая тем, на какую оценку больше похожа рабочая нагрузка читателя.
Где вы можете это назвать
Ling-3.1-flash сегодня отсутствует в каталоге OrcaRouter — запрос к нашему публичному API моделей для модели от InclusionAI возвращает not-found, и мы не будем утверждать обратное. Сейчас он работает на собственном API Ant и на сторонних платформах, где представлен этот релиз, и это честно отражает границы его доступности. Что стоит отметить для всех, кто сравнивает три модели выше: две другие доступны для маршрутизации прямо сейчас. DeepSeek V4.1 Flash и GLM 5.3 Flash обе присутствуют в каталоге OrcaRouter по ценам из прайс-листов своих провайдеров с нулевой наценкой, под одним API-ключом, с автоматическим переключением при сбое между ними. Если из сравнения выше следует, что для вашей рабочей нагрузки важнее надёжность знаний, чем агентная работа в терминале, то стоит попробовать GLM 5.3 Flash — и вы можете сравнить его с DeepSeek V4.1 Flash на том же ключе без второго контракта и без единой строки нового клиентского кода.
Что меняет 41, а что — нет
Что оно меняет — так это положение релиза. Ling-3.1-flash больше не спецификация с приложенной диаграммой от вендора; это модель с независимо измеренной позицией, и эта позиция — настоящий поколенческий скачок в агентных возможностях по сравнению с Ling-3.0-flash — скачок того рода, который возникает из-за изменения дизайна, а не из-за больших вычислений по тому же рецепту. А чего оно не меняет — так это ничего в вопросах закупки. Веса по-прежнему закрыты, лицензия по-прежнему не прописана, модальность по-прежнему только текстовая, а цена примерно в четыре раза выше, чем у предшественника, за прирост, сосредоточенный в агентных и терминальных задачах.
Если ваша работа — это агентные циклы, управление инструментами и длинные цепочки инструментов, то 41 — самое значимое число, опубликованное об этой модели на сегодня, и оно заслуживает серьёзного внимания, пока доступность всё ещё расширяется. Если ваша работа — мультимодальность, критичное к знаниям вопросно-ответное применение или чувствительный к бюджету высокообъёмный инференс, то 41 не покрывает вашу задачу — а GLM 5.3 Flash, уже доступный для маршрутизации и уже открытый под лицензией MIT при половине цены за вывод, — лучше позиционированная модель из трёх. Индекс показывает, где находится Ling-3.1-flash. Он не говорит, стоит ли вам обращать на это внимание, и ответ на этот вопрос даёт то, что вы создаёте.


Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
