
Ling-3.1-flash против GLM-5.3-Flash: вчетверо выше пропускная способность ценой одного пункта индекса
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Ling-3.1-flash и GLM-5.3-Flash отстоят друг от друга на один пункт в Индексе интеллекта Artificial Analysis — 41 против 42, — из-за чего кажется, что выбор между ними — это одно и то же решение дважды. Но это не так. GLM-5.3-Flash генерирует вывод со скоростью 53,0 токена в секунду в собственном API Z.ai; Ling-3.1-flash генерирует его со скоростью 211,0 токена в секунду в API InclusionAI. Это четырёхкратная разница в пропускной способности, и она намного больше, чем всё, чем индекс их разделяет. Одна модель из этих двух более способна почти по всем осям качества и открыта под MIT. Другая — та, что финиширует первой, закрыта и не имеет опубликованной цены, лицензии или чекпоинта. Выбор между ними — это вопрос о том, чего ждёт ваша рабочая нагрузка.
Ось Ling-3.1-flash безоговорочно побеждает
Скорость — не второстепенная деталь, когда вы выбираете между моделями с одинаковым уровнем возможностей, и здесь именно она — весь аргумент в пользу модели Ant.
• Пропускная способность вывода — Ling-3.1-flash 211,0 токенов в секунду в API InclusionAI против GLM-5.3-Flash 53,0 токена в секунду в Z.ai. Скорость генерации в четыре раза выше.
• Время до первого токена — Ling-3.1-flash 1,80 секунды против GLM-5.3-Flash 3,18 секунды. Модель Ant начинает отвечать, пока модель Z.ai всё ещё думает, что важнее пропускной способности в интерактивном и потоковом использовании.
• Время на одну задачу Intelligence Index — Ling-3.1-flash около 357 секунд против GLM-5.3-Flash около 979 секунд. Одна задача оценки занимает у GLM-5.3-Flash почти в три раза больше времени от начала до конца, поскольку он и медленнее на токен, и медленнее запускается.
Для агентного цикла, совершающего дюжину последовательных вызовов, для продукта, где человек смотрит, как приходят токены, это не решающий аргумент — это и есть главная причина предпочесть одну модель. GLM-5.3-Flash — лучшая модель на бумаге и более медленная в пути запроса.
Где GLM-5.5-Flash просто лучше
Во всех остальных случаях — а список достаточно длинный — преимущество в пропускной способности должно заслужить своё место.
• Надёжность знаний — GLM-5.3-Flash набирает +7,47 в AA-Omniscience, лучший результат среди трёх моделей уровня Flash, при уровне галлюцинаций 27,6% на вопросы, на которые были даны ответы. Ling-3.1-flash набирает +2,22 при уровне галлюцинаций 37,9%. В показателе, который штрафует выдумывание сильнее, чем отказ, разрыв реален и указывает в ту же сторону, что и индекс.
• Научные знания — GLM-5.3-Flash набирает 0,912 на GPQA Diamond. У Ling-3.1-flash не опубликовано строки с GPQA Diamond. У DeepSeek V4.1 Flash (Max) — тоже. Модель с результатом 0,91 на вопросах по науке уровня выпускника — это иной инструмент, чем та, которую на них не измеряли.
• Модальность — GLM-5.3-Flash принимает текст, изображения и видео. Ling-3.1-flash принимает только текст. Это не разрыв в производительности, который можно закрыть с помощью бенчмарка; это отсутствующая возможность.
• Веса и лицензия — GLM-5.3-Flash имеет открытые веса под MIT, его можно скачать и развернуть самостоятельно. Ling-3.1-flash не опубликовала ни одного чекпоинта, ни текста лицензии и числится как проприетарная.
• Агентная работа со знаниями — GLM-5.3-Flash 1 453,73 Elo в AA-Briefcase v1.1 против 1 400,35 у Ling-3.1-flash, на бенчмарке, построенном специально вокруг задач работы со знаниями, а не управления терминалом.
• Цена — GLM-5.3-Flash опубликована по цене $0.15 за миллион входных и $0.50 за миллион выходных в API Z.ai, против $0.30 и $0.90 у Ling-3.1-flash. Вдвое ниже тариф на ввод и примерно вдвое ниже на вывод, у модели с более высоким индексным баллом и открытыми весами.

Строки, в которых модель Ant отвечает
Ling-3.1-flash не проигрывает по всем пунктам. В агентной работе с терминалом он немного впереди, а по coding-science — на одном уровне:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 против GLM-5.3-Flash 0.328. Фактически ничья, и оба находятся ниже передового уровня.
• SciCode — Ling-3.1-flash 0.541 против GLM-5.3-Flash 0.516. Победа с минимальным перевесом.
• AutomationBench-AA — 0,617 против 0,604. Очередная победа с минимальным перевесом.
• GDPval-AA — Ling-3.1-flash 1 621,75 Эло против GLM-5.3-Flash 1 646,86. GLM отыгрывает этот пункт.
Прочитайте четыре строки вместе — и картина станет ясной. Там, где две модели вообще можно различить, это различие находится в пределах шума одного прогона оценки. Разница в один пункт по индексу между ними — не ранжирование; это подбрасывание монеты с небольшим перевесом в сторону GLM благодаря строкам надёжности. А вот что не является подбрасыванием монеты — это четырёхкратный разрыв в пропускной способности и двукратный разрыв в цене, и оба они указывают в противоположную сторону.
Есть также деталь обслуживания, которую стоит отметить, потому что она меняет величину этого разрыва в пропускной способности в зависимости от того, где вы вызываете модель. Собственный API Z.ai показывает 53,0 токена в секунду. Измерение за семь дней в нашем собственном каталоге для GLM-5.3-Flash на наших маршрутах показывает 150,6 токена в секунду вывода при медианной задержке первого токена 4,2 секунды. Те же веса, обслуживаемые из другого развёртывания, работают почти в три раза быстрее. Показатели пропускной способности у поставщика — это свойство провайдера, а не модели.
Спецификация, строка за строкой
Подлежащее первым в каждой строке:
• Размер — Ling-3.1-flash 560B всего / 25B активных против GLM-5.3-Flash 320B всего / 18B активных.
• Заявленный контекст — 1 млн токенов у обеих. Строка оценки рассуждений на длинном контексте у GLM-5.3-Flash — 0,80 в AA-LCR; у Ling-3.1-flash — 0,83. Оба близки к показателю DeepSeek V4.1 Flash (Max) — 0,84, то есть рассуждения на длинном контексте больше не являются фактором различия на этом уровне.
• Потолок вывода — GLM-5.3-Flash: 128 000 токенов в нашем каталоге, против Ling-3.1-flash без опубликованного максимума. Один из них можно рассчитать под длительную генерацию, а другой — нет.
• Индекс — 41 vs 42.
• Пропускная способность — 211,0 токенов в секунду против 53,0 на API поставщиков, 150,6 измерено на наших маршрутах.
• Веса — проприетарные, без лицензии, в отличие от открытых под MIT.
• Модальность — только текст против текста, изображения и видео на входе.
• Цена — $0.30 / $0.90 за миллион входных / выходных данных против $0.15 / $0.50 в API Z.ai.
Как на самом деле запустить это сравнение
GLM-5.3-Flash уже в каталоге OrcaRouter: $0.075 за миллион входных токенов, $0.25 за миллион выходных и $0.0173 за миллион чтений из кэша — читайте актуальную карточку, а не этот абзац, потому что тарифы меняются и сквозная схема означает, что изменение цены поставщика отражается на нашей стороне в тот же день. Ценность этой схемы для этого конкретного сравнения в том, что открытость GLM-5.3-Flash и ценовое преимущество — это две вещи, которые делают его разумным выбором по умолчанию, а закрытый маршрут с 0%-ной наценкой — это способ продолжать тестировать Ling-3.1-flash против него, не заводя отношений с вендором.
Ling-3.1-flash отсутствует в нашем каталоге — проверка через наш публичный API моделей возвращает «не найдено» для модели под InclusionAI, и в этом материале мы не будем подразумевать, что мы её обслуживаем. Она работает через собственный API Ant и сторонние платформы, на которых вышел релиз, — и это честно отражает масштаб её доступности.
Продуктивная форма этого сравнения — не «или-или». GLM-5.3-Flash открыт, самый дешёвый, мультимодален, надёжнее в вопросах знаний и доступен через 23 провайдера — это путь по умолчанию. Сильная сторона Ling-3.1-flash — пропускная способность и TTFT в агентных циклах, а его цена — то, что он закрытый, только текстовый, дороже и доступен через меньшее число дверей. Направляйте интерактивную и чувствительную к задержкам работу в быструю модель, оставляйте пакетную, насыщенную знаниями и мультимодальную работу на открытой, и поставьте между ними резервный вариант, чтобы медленный вышестоящий сервис не превращался в медленный продукт.
Какой выбрать?
Если ваши критерии оценки — это возможности, стоимость, открытость и модальность, то GLM-5.3-Flash побеждает в этом противостоянии, и с заметным отрывом — более высокий индексный балл, лучший профиль надёжности знаний в своём классе, 0.912 GPQA Diamond, веса MIT, видеовход, вдвое меньшая цена и 23 провайдера за ним. Если ваши критерии включают то, сколько ждёт пользователь или сколько последовательных вызовов может сделать задача, то Ling-3.1-flash — это модель, которая доводит дело до конца, и её четырёхкратная скорость генерации — не погрешность округления в цикле агента.
Что бы это разрешило, так это деталь обслуживания, которую ни один поставщик не публикует в сопоставимой форме: фактическая пропускная способность на вашей рабочей нагрузке через вашего провайдера. Обе модели поддерживают один и тот же совместимый с OpenAI формат chat-completions, что означает, что переключение между ними — это изменение конфигурации, а не миграция — и для двух моделей, различающихся на один пункт индекса и в четыре раза по скорости, измерение этого одного числа на вашем собственном трафике — лучшее применение послеобеденного времени, чем чтение очередной строки бенчмарка.


Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
