Главная карточка для сравнения GLM-5.3 и GLM-5.2 с подзаголовком «Тот же мозг, удвоенные бенчмарки», с двумя карточками моделей, использующими единый связанный базовый блок 743B MoE, и изогнутой стрелкой улучшения с подписью «только пост-обучение», указывающей от GLM-5.2 к GLM-5.3.
Guides & Insights

GLM-5.3 против GLM-5.2: тот же мозг, удвоенные бенчмарки

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Собственная трактовка Zhipu AI обновления с GLM-5.2 до G​LM-5.3 честна: учебник не изменился, изменилась только подготовка ученика. G​LM-5.3, выпущенный 14 августа 2026 года, построен на той же самой базе MoE с 743 миллиардами параметров, что и GLM-5.2, который в июне возглавил рейтинг моделей с открытыми весами в индексе Artificial Analysis Intelligence. Архитектура не изменилась, ресурсоёмкость не изменилась, цена $1.40 / $4.40 за миллион токенов не изменилась — и тем не менее Z.ai сообщает, что заново обученная модель вдвое или более превосходит предшественника на нескольких бенчмарках по коду и безопасности, которые публикуют обе версии. Делает ли это G​LM-5.3 обязательным обновлением или поводом подождать, зависит от того, насколько вы доверяете модели, которая так сильно улучшилась без изменения собственной архитектуры, и от того, хотите ли вы, чтобы её новая кибервозможность была ограничена двухнедельным окном безопасности.

Тот же мозг, переобученный

Всё, что делало GLM-5.2 практичным сервером, сохраняется: 743B MoE с примерно 40B активных параметров, разреженное внимание IndexShare, сократившее FLOPs при контексте в 1M, лицензия MIT, окно контекста в 1M и эффективная пропускная способность по токенам — ~145–168 токенов/сек по независимым замерам. G​LM-5.3 отличается только в одном измерении — пост-обучении. Z.ai увеличила масштаб этапа обучения с подкреплением с помощью фреймворков IndexShare, SAO и Slime, добавила в десятки раз больше сред для задач с длинным горизонтом и расширила их от отладки кода до обнаружения уязвимостей безопасности и системной инженерии. Результат — модель, которая ведёт себя иначе на том же оборудовании, и именно поэтому вопрос об обновлении ставится не как «нужны ли мне новые GPU», а как «нужно ли мне новое поведение».

Дельта бенчмарка в обоих направлениях.

Если рассматривать это как сравнение до и после на основе опубликованных данных Z.ai, {{1}}этот скачок — крупнейший в истории открытых весов{{/1}}. Terminal-Bench 3.0 — {{2}}более сложная версия, по которой оценивались обе модели{{/2}} — вырос с 4.6 до 28.3, {{3}}шестикратный скачок{{/3}}. DeepSWE v1.1 вырос с 46.2 до 66.9, {{4}}а это разница между «хорошей открытой моделью» и «моделью, конкурентоспособной с закрытыми лидерами»{{/4}}. Набор CLI-задач The Agents' Last Exam вырос с 23.8 до 28.5. Результаты обнаружения уязвимостей CyberGym выросли с 77.2 до 84.5. ExploitBench {{5}}более чем удваивает показатели{{/5}}, поднимаясь с 24.4 до 54.4, а пропускная способность ExploitGym выросла с 29 и 39 выполненных задач (за два и шесть часов) до 105 и 130. Z.ai резюмирует это как примерно 50-процентное улучшение в программировании, и характер прироста — сконцентрированный в долгосрочном кодинге, автоматизации терминала и безопасности — {{6}}согласуется с моделью, прошедшей только пост-обучение{{/6}}: {{7}}базовые знания остались прежними, но способность реально выполнять многошаговую работу стала сильнее{{/7}}.

• Terminal-Bench 3.0 — GLM-5.2 4.6 против GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 против G​LM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 против GLM-5.3 28.5

• Обнаружение уязвимостей CyberGym — GLM-5.2 77.2 против G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 против G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

Возможность, которую никто не планировал

Достижения в области безопасности заслуживают отдельного абзаца, потому что, по словам Z.ai, они не были запланированы. Команда пост-обучения добавила среды для обнаружения уязвимостей, рассчитывая на скромное улучшение; вместо этого модель начала соединять полноценные эксплойты в цепочки — эмерджентное поведение, которое вынудило Z.ai примерно на две недели задержать выпуск весов для укрепления безопасности. В ходе реальных испытаний с командами безопасности G​LM-5.3 способствовала обнаружению 2 436 уязвимостей в 269 проектах, 1 097 из которых имели среднюю или высокую степень риска, включая дефекты, которые десятилетиями оставались незамеченными в широко распространённом программном обеспечении. GLM-5.2 обладала возможностями в области безопасности в обычном смысле — она могла читать код в поисках ошибок. G​LM-5.3 обладает ими в ином смысле: она и есть то, из-за чего существует то самое окно безопасности. Это изменение не степени, а сути, и это единственная и самая веская причина считать две модели разными продуктами, несмотря на общую основу.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

Оговорка о согласованности

Противо весом каждого числа выше является то, что раннее стороннее тестирование описывает G​LM-5.3 как непоследовательную модель, чего нельзя было сказать о GLM-5.2. Независимые рецензенты сообщают, что одна и та же модель ведёт себя как едва проходящий аутсорс-инженер на одних задачах и выдаёт результаты профессионального уровня на других, причём разница коррелирует с тем, насколько чётко были сформулированы требования. Это ровно тот профиль сбоев, который можно предсказать для модели, чьи улучшения целиком получены за счёт пост-тренировки с акцентом на окружение: она обобщает на основе тех форм задач, на которых обучалась, а плохо сформулированные промпты выпадают за их пределы. Ни один из независимых результатов не является таким же чистым, как опубликованные таблицы Z.ai, и ни одна цифра Z.ai до сих пор не воспроизведена независимо. Для продакшена это аргумент в пользу явной оценки на собственной нагрузке перед миграцией — та же оговорка, которую требовала GLM-5.2, но теперь с более широким разбросом между лучшим и худшим случаями.

Цена, доступ и вопрос ожидания

Цены идентичны, что устраняет обычное трение при обновлении: обе модели стоят $1.40 / $4.40 за миллион токенов, при этом G​LM-5.3 требует включённого режима мышления. Доступ — это реальная разница. GLM-5.2 доступен для скачивания уже сегодня под лицензией MIT, может быть развёрнут самостоятельно в субтерабайтном размере FP8 и вызывается через OrcaRouter по прейскурантной цене без наценки — модель, на которую можно направлять запросы прямо сейчас, стабильная и независимо оценённая. G​LM-5.3 можно использовать уже сейчас через ZCode / AutoClaw от Z.ai и G​LM Coding Plan, но публичный API и веса заблокированы на время окна безопасности, а все его показатели бенчмарков сообщены вендором и ждут независимых повторных прогонов. Поэтому честный ответ на вопрос «стоит ли ждать» состоит из двух частей: для производственного трафика, который не должен регрессировать, GLM-5.2 остаётся сегодня безопасной ставкой на открытые веса; и как только API G​LM-5.3 откроется и независимые прогоны подтвердятся, переход будет сменой маршрута, а не переписыванием — вы сохраняете ту же настройку с одним ключом и меняете полосу движения. Для исследовательских работ и оценки безопасности G​LM-5.3 стоит попробовать уже сейчас через инструменты Z.ai, с пониманием того, что его заявленное превосходство не подтверждено, а поведение более изменчиво, чем у модели, которую он заменяет.

Честный вердикт

G​LM-5.3 — более сильная модель по собственным показателям Z.ai {{1}}— значительно лучше в долгосрочном кодинге и принципиально иная по безопасности —{{/1}} и она бесплатна для вашего пайплайна, поскольку база, размер и цена не изменились. Но «лучше на оценках вендора» и «лучше в вашем пайплайне» разделяют две вещи, которые у GLM-5.2 уже есть, а у G​LM-5.3 пока нет: {{2}}независимое воспроизведение и релизные веса.{{/2}} Если вы уже запускаете GLM-5.2, путь обновления — самый дешёвый в истории открытых весов: то же железо, та же цена, тот же API и две недели ожидания весов. Решение заключается не столько в том, лучше ли G​LM-5.3, чем GLM-5.2, {{3}}сколько в том, готовы ли вы доверить продакшн модели,{{/3}} чьи улучшения и чья недавно появившаяся возможность в области безопасности {{4}}ещё не подтверждены никем, кроме Z.ai.{{/4}}

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube