Главная титульная карточка для «Ling-3.1-flash vs GLM-5.3-Flash» с подзаголовком «Четырёхкратная пропускная способность против одного пункта индекса». Две скруглённые карточки расположены рядом с чётким промежутком: слева, с подписью «Ling-3.1-flash», указано «Скорость: 211 ток/с», «Индекс AA: 41», «Лицензия: не опубликована»; справа, с подписью «GLM-5.3-Flash», указано «Скорость: 53 ток/с», «Индекс AA: 42», «Лицензия: MIT». Строка нижнего колонтитула гласит: «Пропускная способность на собственном API каждого поставщика; индекс по данным Artificial Analysis». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Ling-3.1-flash против GLM-5.3-Flash: вчетверо выше пропускная способность ценой одного пункта индекса

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ling-3.1-flash и GLM-5.3-Flash отстоят друг от друга на один пункт в Индексе интеллекта Artificial Analysis — 41 против 42, — из-за чего кажется, что выбор между ними — это одно и то же решение дважды. Но это не так. GLM-5.3-Flash генерирует вывод со скоростью 53,0 токена в секунду в собственном API Z.ai; Ling-3.1-flash генерирует его со скоростью 211,0 токена в секунду в API InclusionAI. Это четырёхкратная разница в пропускной способности, и она намного больше, чем всё, чем индекс их разделяет. Одна модель из этих двух более способна почти по всем осям качества и открыта под MIT. Другая — та, что финиширует первой, закрыта и не имеет опубликованной цены, лицензии или чекпоинта. Выбор между ними — это вопрос о том, чего ждёт ваша рабочая нагрузка.

Ось Ling-3.1-flash безоговорочно побеждает

Скорость — не второстепенная деталь, когда вы выбираете между моделями с одинаковым уровнем возможностей, и здесь именно она — весь аргумент в пользу модели Ant.

• Пропускная способность вывода — Ling-3.1-flash 211,0 токенов в секунду в API InclusionAI против GLM-5.3-Flash 53,0 токена в секунду в Z.ai. Скорость генерации в четыре раза выше.

• Время до первого токена — Ling-3.1-flash 1,80 секунды против GLM-5.3-Flash 3,18 секунды. Модель Ant начинает отвечать, пока модель Z.ai всё ещё думает, что важнее пропускной способности в интерактивном и потоковом использовании.

• Время на одну задачу Intelligence Index — Ling-3.1-flash около 357 секунд против GLM-5.3-Flash около 979 секунд. Одна задача оценки занимает у GLM-5.3-Flash почти в три раза больше времени от начала до конца, поскольку он и медленнее на токен, и медленнее запускается.

Для агентного цикла, совершающего дюжину последовательных вызовов, для продукта, где человек смотрит, как приходят токены, это не решающий аргумент — это и есть главная причина предпочесть одну модель. GLM-5.3-Flash — лучшая модель на бумаге и более медленная в пути запроса.

Где GLM-5.5-Flash просто лучше

Во всех остальных случаях — а список достаточно длинный — преимущество в пропускной способности должно заслужить своё место.

• Надёжность знаний — GLM-5.3-Flash набирает +7,47 в AA-Omniscience, лучший результат среди трёх моделей уровня Flash, при уровне галлюцинаций 27,6% на вопросы, на которые были даны ответы. Ling-3.1-flash набирает +2,22 при уровне галлюцинаций 37,9%. В показателе, который штрафует выдумывание сильнее, чем отказ, разрыв реален и указывает в ту же сторону, что и индекс.

• Научные знания — GLM-5.3-Flash набирает 0,912 на GPQA Diamond. У Ling-3.1-flash не опубликовано строки с GPQA Diamond. У DeepSeek V4.1 Flash (Max) — тоже. Модель с результатом 0,91 на вопросах по науке уровня выпускника — это иной инструмент, чем та, которую на них не измеряли.

• Модальность — GLM-5.3-Flash принимает текст, изображения и видео. Ling-3.1-flash принимает только текст. Это не разрыв в производительности, который можно закрыть с помощью бенчмарка; это отсутствующая возможность.

• Веса и лицензия — GLM-5.3-Flash имеет открытые веса под MIT, его можно скачать и развернуть самостоятельно. Ling-3.1-flash не опубликовала ни одного чекпоинта, ни текста лицензии и числится как проприетарная.

• Агентная работа со знаниями — GLM-5.3-Flash 1 453,73 Elo в AA-Briefcase v1.1 против 1 400,35 у Ling-3.1-flash, на бенчмарке, построенном специально вокруг задач работы со знаниями, а не управления терминалом.

• Цена — GLM-5.3-Flash опубликована по цене $0.15 за миллион входных и $0.50 за миллион выходных в API Z.ai, против $0.30 и $0.90 у Ling-3.1-flash. Вдвое ниже тариф на ввод и примерно вдвое ниже на вывод, у модели с более высоким индексным баллом и открытыми весами.

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Строки, в которых модель Ant отвечает

Ling-3.1-flash не проигрывает по всем пунктам. В агентной работе с терминалом он немного впереди, а по coding-science — на одном уровне:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 против GLM-5.3-Flash 0.328. Фактически ничья, и оба находятся ниже передового уровня.

• SciCode — Ling-3.1-flash 0.541 против GLM-5.3-Flash 0.516. Победа с минимальным перевесом.

• AutomationBench-AA — 0,617 против 0,604. Очередная победа с минимальным перевесом.

• GDPval-AA — Ling-3.1-flash 1 621,75 Эло против GLM-5.3-Flash 1 646,86. GLM отыгрывает этот пункт.

Прочитайте четыре строки вместе — и картина станет ясной. Там, где две модели вообще можно различить, это различие находится в пределах шума одного прогона оценки. Разница в один пункт по индексу между ними — не ранжирование; это подбрасывание монеты с небольшим перевесом в сторону GLM благодаря строкам надёжности. А вот что не является подбрасыванием монеты — это четырёхкратный разрыв в пропускной способности и двукратный разрыв в цене, и оба они указывают в противоположную сторону.

Есть также деталь обслуживания, которую стоит отметить, потому что она меняет величину этого разрыва в пропускной способности в зависимости от того, где вы вызываете модель. Собственный API Z.ai показывает 53,0 токена в секунду. Измерение за семь дней в нашем собственном каталоге для GLM-5.3-Flash на наших маршрутах показывает 150,6 токена в секунду вывода при медианной задержке первого токена 4,2 секунды. Те же веса, обслуживаемые из другого развёртывания, работают почти в три раза быстрее. Показатели пропускной способности у поставщика — это свойство провайдера, а не модели.

Спецификация, строка за строкой

Подлежащее первым в каждой строке:

• Размер — Ling-3.1-flash 560B всего / 25B активных против GLM-5.3-Flash 320B всего / 18B активных.

• Заявленный контекст — 1 млн токенов у обеих. Строка оценки рассуждений на длинном контексте у GLM-5.3-Flash — 0,80 в AA-LCR; у Ling-3.1-flash — 0,83. Оба близки к показателю DeepSeek V4.1 Flash (Max) — 0,84, то есть рассуждения на длинном контексте больше не являются фактором различия на этом уровне.

• Потолок вывода — GLM-5.3-Flash: 128 000 токенов в нашем каталоге, против Ling-3.1-flash без опубликованного максимума. Один из них можно рассчитать под длительную генерацию, а другой — нет.

• Индекс — 41 vs 42.

• Пропускная способность — 211,0 токенов в секунду против 53,0 на API поставщиков, 150,6 измерено на наших маршрутах.

• Веса — проприетарные, без лицензии, в отличие от открытых под MIT.

• Модальность — только текст против текста, изображения и видео на входе.

• Цена — $0.30 / $0.90 за миллион входных / выходных данных против $0.15 / $0.50 в API Z.ai.

Как на самом деле запустить это сравнение

GLM-5.3-Flash уже в каталоге OrcaRouter: $0.075 за миллион входных токенов, $0.25 за миллион выходных и $0.0173 за миллион чтений из кэша — читайте актуальную карточку, а не этот абзац, потому что тарифы меняются и сквозная схема означает, что изменение цены поставщика отражается на нашей стороне в тот же день. Ценность этой схемы для этого конкретного сравнения в том, что открытость GLM-5.3-Flash и ценовое преимущество — это две вещи, которые делают его разумным выбором по умолчанию, а закрытый маршрут с 0%-ной наценкой — это способ продолжать тестировать Ling-3.1-flash против него, не заводя отношений с вендором.

Ling-3.1-flash отсутствует в нашем каталоге — проверка через наш публичный API моделей возвращает «не найдено» для модели под InclusionAI, и в этом материале мы не будем подразумевать, что мы её обслуживаем. Она работает через собственный API Ant и сторонние платформы, на которых вышел релиз, — и это честно отражает масштаб её доступности.

Продуктивная форма этого сравнения — не «или-или». GLM-5.3-Flash открыт, самый дешёвый, мультимодален, надёжнее в вопросах знаний и доступен через 23 провайдера — это путь по умолчанию. Сильная сторона Ling-3.1-flash — пропускная способность и TTFT в агентных циклах, а его цена — то, что он закрытый, только текстовый, дороже и доступен через меньшее число дверей. Направляйте интерактивную и чувствительную к задержкам работу в быструю модель, оставляйте пакетную, насыщенную знаниями и мультимодальную работу на открытой, и поставьте между ними резервный вариант, чтобы медленный вышестоящий сервис не превращался в медленный продукт.

Какой выбрать?

Если ваши критерии оценки — это возможности, стоимость, открытость и модальность, то GLM-5.3-Flash побеждает в этом противостоянии, и с заметным отрывом — более высокий индексный балл, лучший профиль надёжности знаний в своём классе, 0.912 GPQA Diamond, веса MIT, видеовход, вдвое меньшая цена и 23 провайдера за ним. Если ваши критерии включают то, сколько ждёт пользователь или сколько последовательных вызовов может сделать задача, то Ling-3.1-flash — это модель, которая доводит дело до конца, и её четырёхкратная скорость генерации — не погрешность округления в цикле агента.

Что бы это разрешило, так это деталь обслуживания, которую ни один поставщик не публикует в сопоставимой форме: фактическая пропускная способность на вашей рабочей нагрузке через вашего провайдера. Обе модели поддерживают один и тот же совместимый с OpenAI формат chat-completions, что означает, что переключение между ними — это изменение конфигурации, а не миграция — и для двух моделей, различающихся на один пункт индекса и в четыре раза по скорости, измерение этого одного числа на вашем собственном трафике — лучшее применение послеобеденного времени, чем чтение очередной строки бенчмарка.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube