
GLM-5.3 против Kimi K3: выжать максимум из базы на 743B или построить модель на 2.8T — какая ставка сыграет?
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0455Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0247Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0247Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0157Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2646Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1849Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1541Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1251Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0547Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0347Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2140Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Интеллект49Кодинг
Гонка китайских моделей с открытыми весами только что раскололась на два ответа на один и тот же вопрос. Компания Moonshot AI построила Kimi K3 с нуля — базовую модель смеси экспертов с 2,8 триллиона параметров, крупнейшую из когда-либо выпущенных моделей с открытыми весами, анонсированную 16 июля 2026 года, с весами, опубликованными 27 июля. GLM-5.3 — это противоположная ставка: Z.ai сохранила ту самую базовую модель на 743 миллиарда параметров, которая лежала в основе GLM-5.2, и потратила весь цикл релиза на пост-обучение, утверждая, что потолок интеллекта базовой модели никогда не был проблемой. Обе — флагманы с контекстом в 1M, ориентированные на кодинг и агентов, и обе заявляют, что являются лучшей открытой моделью для кодинга на рынке. Обе не могут быть лучшим способом потратить один и тот же бюджет, и бенчмарки действительно расходятся ровно пополам — что делает это не столько сравнением, сколько референдумом о том, как строить следующую фронтирную модель.
Две ставки на то, как построить передовую модель.
Z.ai называет GLM-5.3 «глубоким копанием», а не сменой поколения. Основа — байт-в-байт та же модель на 743B параметров, что и GLM-5.2; вся разница — в пост-обучении, прогнанном через open-source фреймворк slime на задачах, охватывающих целые инженерные сессии, — диагностику, исправление, проверку и выкат в реальных кластерах, системах хранения и кодовых базах, причём некоторые из них занимают несколько дней работы старшего инженера. Заявленный вендором прирост велик: скачок на 50% в собственном Code Bench, Terminal-Bench 3.0 — с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, а также кибервозможность, которая вынудила провести проверку безопасности перед публикацией весов. Moonshot пошёл другим путём. Kimi K3 — это совершенно новая основа: 2.8T суммарных параметров, из которых около 104B активны на каждый токен (16 из 896 экспертов), архитектура Kimi Delta Attention, нативный ввод изображений и видео, всегда включённые рассуждения, которые нельзя отключить, и контекстное окно на 1M как для входа, так и для выхода. Если Z.ai ставит на то, что больше той же модели достаточно, то Moonshot ставит на то, что потолком была сама основа.

Прямое сравнение с указанием происхождения
Единственное место, где обе модели фигурируют на одной странице, — это собственная таблица запуска Z.ai, поэтому именно оттуда берутся цифры для сравнения — они помечены как предоставленные производителем, а не независимо проверенные. Отдельные цифры Kimi K3 согласуются с тем, что Moonshot опубликовал в июле, и с тем, что измеряет Artificial Analysis, но пока ни одна нейтральная лаборатория не протестировала обе модели.
• Terminal-Bench 3.0 — GLM-5.3 с 28.3 против Kimi K3 с 17.4 (таблица Z.ai). Самый большой разрыв в кодировании в этом сравнении на самой новой и сложной версии.
• Terminal-Bench 2.1 — GLM-5.3 с 88.2 против Kimi K3 с 88.3. Почти ничья.
• DeepSWE v1.1 — GLM-5.3: 66,9 против 67,5 у Kimi K3. Kimi выигрывает с минимальным отрывом.
• SWE-Marathon v1.1 — GLM-5.3 показал 42,5 против 48,1 у Kimi K3. Лучшая победа Kimi в кодинге.
• ExploitGym — GLM-5.3: 105/130 против 36/70 у Kimi K3. Почти полный разгром для GLM.
• GDPval-AA v2 (интеллектуальная работа) — GLM-5.3: 1 769 против 1 682 у Kimi K3.
• Доступ — GLM-5.3: подписка Coding Plan, доступ к весам ограничен примерно до 28 августа. Kimi K3: API работает по цене $3 / $15, веса доступны для скачивания с 27 июля.

Ров безопасности — это настоящее разделение.
Если отбросить бенчмарки по написанию кода, решающее различие — кибербезопасность. GLM-5.3 показывает 84,5 в CyberGym против 80,0 у Kimi K3, а его результат в ExploitBench — 54,4 — почти вдвое выше, чем 32,2 у Kimi K3. На ExploitGym разрыв — это уже не разница, а другая категория: 105 и 130 против 36 и 70 на прогонах длительностью 2 и 6 часов. Именно поэтому два релиза на практике ощущаются настолько по-разному: веса Kimi K3 открыто опубликованы под лицензией Modified MIT, тогда как веса GLM-5.3 придержаны для усиления безопасности — как раз потому, что в Z.ai говорят: модель настолько хороша в поиске и использовании уязвимостей, что немедленная публикация весов показалась безответственной. Если ваша работа связана с аудитом чужого кода или защитой своего от автоматизированного поиска уязвимостей, это самый значимый пункт во всём сравнении — и при этом наименее независимо проверенный.
Где Kimi K3 дает отпор
Победы Kimi K3 сосредоточены там, где GLM-5.3 слабее всего: в долгосрочной работе с репозиториями. Kimi K3 сохраняет преимущество на DeepSWE и SWE-Marathon, лидирует на Toolathlon Verified, а его окно вывода в 1M токенов позволяет написать целую кодовую базу или длинный трейс агента за один проход. Его всегда включённые рассуждения передают полный трейс в API, который разработчики назвали гораздо более полезным для отладки агентов, чем непрозрачные сводные объяснения, — с операционным нюансом: вы должны дословно передавать поля рассуждений обратно между вызовами инструментов, и предзаполнения ассистента не предусмотрено. В индексе интеллекта Artificial Analysis Kimi K3 набирает 57 баллов, занимая четвёртое место в общем зачёте, со стоимостью примерно $0.94 за задачу, измеренной на его стандартном наборе. Это также самая дорогая модель, выпущенная китайской лабораторией: $3 за миллион входных токенов и $15 за миллион выходных, ценообразование уровня Sonnet, тогда как GLM-5.3 ещё нельзя оценить по токенам вообще, потому что она существует только внутри подписочного плана.
Реальность доступа и стоимости
Kimi K3 уже доступен на OrcaRouter по собственной цене Moonshot — $3 / $15 за миллион токенов, $0.30 за кэшированное чтение, наценка 0% — так что работу агента с контекстом в 1M можно вызывать на том же ключе, что и остальную часть вашего стека, а открытые веса — это вариант выхода, если вы хотите развернуть модель у себя. А вот GLM-5.3 достать сложно: месячная подписка от $18 до $168 с балльной системой, которая расходует кредиты с множителем 6.9x на ввод и 24x на вывод, непиковые тарифы, вдвое уменьшающие расход вне окна 14:00–18:00 по китайскому времени, и отсутствие API с оплатой за токены до завершения проверки безопасности. Маршрутизирующий уровень фактически сглаживает эту асимметрию на двухнедельный период: когда API GLM-5.3 появится на том же ключе, вызов через панель сможет запустить обе флагманские модели с открытыми весами на ваших собственных задачах и позволить судье согласовать их результаты — а если вы не можете ждать, уже выпущенные веса Kimi K3 делают её единственной из двух, которую сегодня можно полностью развернуть локально.

Какая ставка выплачивается?
Честный вердикт после недели использования: обе ставки окупаются, но при разных нагрузках. Если ваша работа связана с терминалом, примыкает к сфере безопасности и оркестрируется агентами, GLM-5.3 — более сильное направление по данным, опубликованным Z.ai, а разрыв в кибербезопасности достаточно велик, чтобы стоило подождать две недели до выхода весов и проверить самостоятельно. Если ваша работа — длительные сессии с репозиториями, мультимодальный ввод или что-то, где веса нужны уже сегодня, Kimi K3 — единственная из двух, которая реально доступна, и её успехи в работе с большими репозиториями можно проверить прямо сейчас через живой API. Единственное, что нужно чётко понимать: каждая цифра в этом прямом сравнении взята из таблицы Z.ai, поэтому относитесь к расхождениям в кодинге как к ориентировочным, пока независимая лаборатория не протестирует обе модели. Именно такую проверку и обеспечит двухнедельное ожидание.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
