Титульная карточка для сравнения GLM-5.3 и Kimi K3: слева — куб поменьше с надписью GLM-5.3 и подписью «743B, базовая модель после пост-обучения»; справа — куб побольше с надписью Kimi K3 и подписью «2.8T, базовая модель, созданная с нуля».
Guides & Insights

GLM-5.3 против Kimi K3: выжать максимум из базы на 743B или построить модель на 2.8T — какая ставка сыграет?

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Гонка китайских моделей с открытыми весами только что раскололась на два ответа на один и тот же вопрос. Компания Moonshot AI построила Kimi K3 с нуля — базовую модель смеси экспертов с 2,8 триллиона параметров, крупнейшую из когда-либо выпущенных моделей с открытыми весами, анонсированную 16 июля 2026 года, с весами, опубликованными 27 июля. G​LM-5.3 — это противоположная ставка: Z.ai сохранила ту самую базовую модель на 743 миллиарда параметров, которая лежала в основе GLM-5.2, и потратила весь цикл релиза на пост-обучение, утверждая, что потолок интеллекта базовой модели никогда не был проблемой. Обе — флагманы с контекстом в 1M, ориентированные на кодинг и агентов, и обе заявляют, что являются лучшей открытой моделью для кодинга на рынке. Обе не могут быть лучшим способом потратить один и тот же бюджет, и бенчмарки действительно расходятся ровно пополам — что делает это не столько сравнением, сколько референдумом о том, как строить следующую фронтирную модель.

Две ставки на то, как построить передовую модель.

Z.ai называет G​LM-5.3 «глубоким копанием», а не сменой поколения. Основа — байт-в-байт та же модель на 743B параметров, что и GLM-5.2; вся разница — в пост-обучении, прогнанном через open-source фреймворк slime на задачах, охватывающих целые инженерные сессии, — диагностику, исправление, проверку и выкат в реальных кластерах, системах хранения и кодовых базах, причём некоторые из них занимают несколько дней работы старшего инженера. Заявленный вендором прирост велик: скачок на 50% в собственном Code Bench, Terminal-Bench 3.0 — с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, а также кибервозможность, которая вынудила провести проверку безопасности перед публикацией весов. Moonshot пошёл другим путём. Kimi K3 — это совершенно новая основа: 2.8T суммарных параметров, из которых около 104B активны на каждый токен (16 из 896 экспертов), архитектура Kimi Delta Attention, нативный ввод изображений и видео, всегда включённые рассуждения, которые нельзя отключить, и контекстное окно на 1M как для входа, так и для выхода. Если Z.ai ставит на то, что больше той же модели достаточно, то Moonshot ставит на то, что потолком была сама основа.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

Прямое сравнение с указанием происхождения

Единственное место, где обе модели фигурируют на одной странице, — это собственная таблица запуска Z.ai, поэтому именно оттуда берутся цифры для сравнения — они помечены как предоставленные производителем, а не независимо проверенные. Отдельные цифры Kimi K3 согласуются с тем, что Moonshot опубликовал в июле, и с тем, что измеряет Artificial Analysis, но пока ни одна нейтральная лаборатория не протестировала обе модели.

Terminal-Bench 3.0 — G​LM-5.3 с 28.3 против Kimi K3 с 17.4 (таблица Z.ai). Самый большой разрыв в кодировании в этом сравнении на самой новой и сложной версии.

Terminal-Bench 2.1 — G​LM-5.3 с 88.2 против Kimi K3 с 88.3. Почти ничья.

DeepSWE v1.1 — G​LM-5.3: 66,9 против 67,5 у Kimi K3. Kimi выигрывает с минимальным отрывом.

SWE-Marathon v1.1 — G​LM-5.3 показал 42,5 против 48,1 у Kimi K3. Лучшая победа Kimi в кодинге.

ExploitGym — G​LM-5.3: 105/130 против 36/70 у Kimi K3. Почти полный разгром для G​LM.

GDPval-AA v2 (интеллектуальная работа) — G​LM-5.3: 1 769 против 1 682 у Kimi K3.

Доступ — G​LM-5.3: подписка Coding Plan, доступ к весам ограничен примерно до 28 августа. Kimi K3: API работает по цене $3 / $15, веса доступны для скачивания с 27 июля.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

Ров безопасности — это настоящее разделение.

Если отбросить бенчмарки по написанию кода, решающее различие — кибербезопасность. G​LM-5.3 показывает 84,5 в CyberGym против 80,0 у Kimi K3, а его результат в ExploitBench — 54,4 — почти вдвое выше, чем 32,2 у Kimi K3. На ExploitGym разрыв — это уже не разница, а другая категория: 105 и 130 против 36 и 70 на прогонах длительностью 2 и 6 часов. Именно поэтому два релиза на практике ощущаются настолько по-разному: веса Kimi K3 открыто опубликованы под лицензией Modified MIT, тогда как веса G​LM-5.3 придержаны для усиления безопасности — как раз потому, что в Z.ai говорят: модель настолько хороша в поиске и использовании уязвимостей, что немедленная публикация весов показалась безответственной. Если ваша работа связана с аудитом чужого кода или защитой своего от автоматизированного поиска уязвимостей, это самый значимый пункт во всём сравнении — и при этом наименее независимо проверенный.

Где Kimi K3 дает отпор

Победы Kimi K3 сосредоточены там, где G​LM-5.3 слабее всего: в долгосрочной работе с репозиториями. Kimi K3 сохраняет преимущество на DeepSWE и SWE-Marathon, лидирует на Toolathlon Verified, а его окно вывода в 1M токенов позволяет написать целую кодовую базу или длинный трейс агента за один проход. Его всегда включённые рассуждения передают полный трейс в API, который разработчики назвали гораздо более полезным для отладки агентов, чем непрозрачные сводные объяснения, — с операционным нюансом: вы должны дословно передавать поля рассуждений обратно между вызовами инструментов, и предзаполнения ассистента не предусмотрено. В индексе интеллекта Artificial Analysis Kimi K3 набирает 57 баллов, занимая четвёртое место в общем зачёте, со стоимостью примерно $0.94 за задачу, измеренной на его стандартном наборе. Это также самая дорогая модель, выпущенная китайской лабораторией: $3 за миллион входных токенов и $15 за миллион выходных, ценообразование уровня Sonnet, тогда как G​LM-5.3 ещё нельзя оценить по токенам вообще, потому что она существует только внутри подписочного плана.

Реальность доступа и стоимости

Kimi K3 уже доступен на OrcaRouter по собственной цене Moonshot — $3 / $15 за миллион токенов, $0.30 за кэшированное чтение, наценка 0% — так что работу агента с контекстом в 1M можно вызывать на том же ключе, что и остальную часть вашего стека, а открытые веса — это вариант выхода, если вы хотите развернуть модель у себя. А вот G​LM-5.3 достать сложно: месячная подписка от $18 до $168 с балльной системой, которая расходует кредиты с множителем 6.9x на ввод и 24x на вывод, непиковые тарифы, вдвое уменьшающие расход вне окна 14:00–18:00 по китайскому времени, и отсутствие API с оплатой за токены до завершения проверки безопасности. Маршрутизирующий уровень фактически сглаживает эту асимметрию на двухнедельный период: когда API G​LM-5.3 появится на том же ключе, вызов через панель сможет запустить обе флагманские модели с открытыми весами на ваших собственных задачах и позволить судье согласовать их результаты — а если вы не можете ждать, уже выпущенные веса Kimi K3 делают её единственной из двух, которую сегодня можно полностью развернуть локально.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

Какая ставка выплачивается?

Честный вердикт после недели использования: обе ставки окупаются, но при разных нагрузках. Если ваша работа связана с терминалом, примыкает к сфере безопасности и оркестрируется агентами, G​LM-5.3 — более сильное направление по данным, опубликованным Z.ai, а разрыв в кибербезопасности достаточно велик, чтобы стоило подождать две недели до выхода весов и проверить самостоятельно. Если ваша работа — длительные сессии с репозиториями, мультимодальный ввод или что-то, где веса нужны уже сегодня, Kimi K3 — единственная из двух, которая реально доступна, и её успехи в работе с большими репозиториями можно проверить прямо сейчас через живой API. Единственное, что нужно чётко понимать: каждая цифра в этом прямом сравнении взята из таблицы Z.ai, поэтому относитесь к расхождениям в кодинге как к ориентировочным, пока независимая лаборатория не протестирует обе модели. Именно такую проверку и обеспечит двухнедельное ожидание.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube