
GLM-5.3 против GLM-5.2: тот же мозг, удвоенные бенчмарки
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Собственная трактовка Zhipu AI обновления с GLM-5.2 до GLM-5.3 честна: учебник не изменился, изменилась только подготовка ученика. GLM-5.3, выпущенный 14 августа 2026 года, построен на той же самой базе MoE с 743 миллиардами параметров, что и GLM-5.2, который в июне возглавил рейтинг моделей с открытыми весами в индексе Artificial Analysis Intelligence. Архитектура не изменилась, ресурсоёмкость не изменилась, цена $1.40 / $4.40 за миллион токенов не изменилась — и тем не менее Z.ai сообщает, что заново обученная модель вдвое или более превосходит предшественника на нескольких бенчмарках по коду и безопасности, которые публикуют обе версии. Делает ли это GLM-5.3 обязательным обновлением или поводом подождать, зависит от того, насколько вы доверяете модели, которая так сильно улучшилась без изменения собственной архитектуры, и от того, хотите ли вы, чтобы её новая кибервозможность была ограничена двухнедельным окном безопасности.
Тот же мозг, переобученный
Всё, что делало GLM-5.2 практичным сервером, сохраняется: 743B MoE с примерно 40B активных параметров, разреженное внимание IndexShare, сократившее FLOPs при контексте в 1M, лицензия MIT, окно контекста в 1M и эффективная пропускная способность по токенам — ~145–168 токенов/сек по независимым замерам. GLM-5.3 отличается только в одном измерении — пост-обучении. Z.ai увеличила масштаб этапа обучения с подкреплением с помощью фреймворков IndexShare, SAO и Slime, добавила в десятки раз больше сред для задач с длинным горизонтом и расширила их от отладки кода до обнаружения уязвимостей безопасности и системной инженерии. Результат — модель, которая ведёт себя иначе на том же оборудовании, и именно поэтому вопрос об обновлении ставится не как «нужны ли мне новые GPU», а как «нужно ли мне новое поведение».
Дельта бенчмарка в обоих направлениях.
Если рассматривать это как сравнение до и после на основе опубликованных данных Z.ai, {{1}}этот скачок — крупнейший в истории открытых весов{{/1}}. Terminal-Bench 3.0 — {{2}}более сложная версия, по которой оценивались обе модели{{/2}} — вырос с 4.6 до 28.3, {{3}}шестикратный скачок{{/3}}. DeepSWE v1.1 вырос с 46.2 до 66.9, {{4}}а это разница между «хорошей открытой моделью» и «моделью, конкурентоспособной с закрытыми лидерами»{{/4}}. Набор CLI-задач The Agents' Last Exam вырос с 23.8 до 28.5. Результаты обнаружения уязвимостей CyberGym выросли с 77.2 до 84.5. ExploitBench {{5}}более чем удваивает показатели{{/5}}, поднимаясь с 24.4 до 54.4, а пропускная способность ExploitGym выросла с 29 и 39 выполненных задач (за два и шесть часов) до 105 и 130. Z.ai резюмирует это как примерно 50-процентное улучшение в программировании, и характер прироста — сконцентрированный в долгосрочном кодинге, автоматизации терминала и безопасности — {{6}}согласуется с моделью, прошедшей только пост-обучение{{/6}}: {{7}}базовые знания остались прежними, но способность реально выполнять многошаговую работу стала сильнее{{/7}}.
• Terminal-Bench 3.0 — GLM-5.2 4.6 против GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 против GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 против GLM-5.3 28.5
• Обнаружение уязвимостей CyberGym — GLM-5.2 77.2 против GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 против GLM-5.3 54.4


Возможность, которую никто не планировал
Достижения в области безопасности заслуживают отдельного абзаца, потому что, по словам Z.ai, они не были запланированы. Команда пост-обучения добавила среды для обнаружения уязвимостей, рассчитывая на скромное улучшение; вместо этого модель начала соединять полноценные эксплойты в цепочки — эмерджентное поведение, которое вынудило Z.ai примерно на две недели задержать выпуск весов для укрепления безопасности. В ходе реальных испытаний с командами безопасности GLM-5.3 способствовала обнаружению 2 436 уязвимостей в 269 проектах, 1 097 из которых имели среднюю или высокую степень риска, включая дефекты, которые десятилетиями оставались незамеченными в широко распространённом программном обеспечении. GLM-5.2 обладала возможностями в области безопасности в обычном смысле — она могла читать код в поисках ошибок. GLM-5.3 обладает ими в ином смысле: она и есть то, из-за чего существует то самое окно безопасности. Это изменение не степени, а сути, и это единственная и самая веская причина считать две модели разными продуктами, несмотря на общую основу.

Оговорка о согласованности
Противо весом каждого числа выше является то, что раннее стороннее тестирование описывает GLM-5.3 как непоследовательную модель, чего нельзя было сказать о GLM-5.2. Независимые рецензенты сообщают, что одна и та же модель ведёт себя как едва проходящий аутсорс-инженер на одних задачах и выдаёт результаты профессионального уровня на других, причём разница коррелирует с тем, насколько чётко были сформулированы требования. Это ровно тот профиль сбоев, который можно предсказать для модели, чьи улучшения целиком получены за счёт пост-тренировки с акцентом на окружение: она обобщает на основе тех форм задач, на которых обучалась, а плохо сформулированные промпты выпадают за их пределы. Ни один из независимых результатов не является таким же чистым, как опубликованные таблицы Z.ai, и ни одна цифра Z.ai до сих пор не воспроизведена независимо. Для продакшена это аргумент в пользу явной оценки на собственной нагрузке перед миграцией — та же оговорка, которую требовала GLM-5.2, но теперь с более широким разбросом между лучшим и худшим случаями.
Цена, доступ и вопрос ожидания
Цены идентичны, что устраняет обычное трение при обновлении: обе модели стоят $1.40 / $4.40 за миллион токенов, при этом GLM-5.3 требует включённого режима мышления. Доступ — это реальная разница. GLM-5.2 доступен для скачивания уже сегодня под лицензией MIT, может быть развёрнут самостоятельно в субтерабайтном размере FP8 и вызывается через OrcaRouter по прейскурантной цене без наценки — модель, на которую можно направлять запросы прямо сейчас, стабильная и независимо оценённая. GLM-5.3 можно использовать уже сейчас через ZCode / AutoClaw от Z.ai и GLM Coding Plan, но публичный API и веса заблокированы на время окна безопасности, а все его показатели бенчмарков сообщены вендором и ждут независимых повторных прогонов. Поэтому честный ответ на вопрос «стоит ли ждать» состоит из двух частей: для производственного трафика, который не должен регрессировать, GLM-5.2 остаётся сегодня безопасной ставкой на открытые веса; и как только API GLM-5.3 откроется и независимые прогоны подтвердятся, переход будет сменой маршрута, а не переписыванием — вы сохраняете ту же настройку с одним ключом и меняете полосу движения. Для исследовательских работ и оценки безопасности GLM-5.3 стоит попробовать уже сейчас через инструменты Z.ai, с пониманием того, что его заявленное превосходство не подтверждено, а поведение более изменчиво, чем у модели, которую он заменяет.
Честный вердикт
GLM-5.3 — более сильная модель по собственным показателям Z.ai {{1}}— значительно лучше в долгосрочном кодинге и принципиально иная по безопасности —{{/1}} и она бесплатна для вашего пайплайна, поскольку база, размер и цена не изменились. Но «лучше на оценках вендора» и «лучше в вашем пайплайне» разделяют две вещи, которые у GLM-5.2 уже есть, а у GLM-5.3 пока нет: {{2}}независимое воспроизведение и релизные веса.{{/2}} Если вы уже запускаете GLM-5.2, путь обновления — самый дешёвый в истории открытых весов: то же железо, та же цена, тот же API и две недели ожидания весов. Решение заключается не столько в том, лучше ли GLM-5.3, чем GLM-5.2, {{3}}сколько в том, готовы ли вы доверить продакшн модели,{{/3}} чьи улучшения и чья недавно появившаяся возможность в области безопасности {{4}}ещё не подтверждены никем, кроме Z.ai.{{/4}}
