Титульная карточка для GLM-5.2 vs Kimi K3 с подзаголовком «Дешевле и быстрее или больше и лучше», три закруглённых бейджа-пилюли с надписями «контекст 1M токенов у каждого», «AA Index 34 vs 44» и «$1.40 / $4.40 vs $3.00 / $15.00», строка футера «Тарифные карты поставщиков и Artificial Analysis, 2026-09-23», и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

GLM-5.2 против Kimi K3: дешевле и быстрее или больше и лучше

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GLM-5.2 и Kimi K3 появились с разницей в месяц в середине 2026 года и почти идеально зеркально противоположны друг другу. Kimi K3, выпущенная 2026-07-16 (открытые веса — 2026-07-27), — более крупная и, на бумаге, лучшая модель: 2,8 триллиона параметров, 104 миллиарда из них активных, и более высокий результат практически на всех бенчмарках, на которых их тестировали. GLM-5.2 доступна с 2026-06-16, она меньше из двух — 753 миллиарда параметров при 40 миллиардах активных — а стоимость выходного токена у неё примерно втрое ниже, медианное время ответа меньше, и распространяется она под MIT, а не под специальной лицензией с триггерами по выручке.

Это решение — в одном абзаце. Далее — доказательства, стоящие за ним: расчёт цены на задаче, которую вы, возможно, действительно запустите, измерения, где эти два значения настолько близки, что разница — это шум, и одно популярное число, которое нельзя сравнивать с числом, напечатанным рядом с ним.

Где стоят эти двое

Обе, как правило, доступны через собственные API своих вендоров, обе маршрутизируются на OrcaRouter, и у обеих есть веса, доступные для скачивания. Различия, которые важны ещё до того, как вы хоть сколько-нибудь приблизитесь к бенчмарку:

• Выпуск — GLM-5.2 16 июня 2026 г. против Kimi K3 16 июля 2026 г. (страницы моделей Artificial Analysis; собственная страница модели Kimi K3 на OrcaRouter датирует её на день раньше — 15 июля 2026 г.)

• Веса — GLM-5.2 открыт под MIT против Kimi K3, открытого под лицензией Kimi K3, которая требует отдельного соглашения при годовом доходе от model-as-a-service свыше $20 млн и заметной атрибуции при более 100 млн ежемесячных пользователей (внутренние исследования и разработка освобождены)

• Размер — GLM-5.2: 753 млрд всего / 40 млрд активных против Kimi K3: 2,8 трлн всего / 104 млрд активных

• Контекст — 1 000 000 токенов у GLM-5.2 против 1 048 576 токенов у Kimi K3

• Ввод — GLM-5.2: текст на входе, текст на выходе, в сравнении с Kimi K3: текст и изображения на входе, текст на выходе

• Опубликованный максимум выходных токенов — 128 000 токенов у GLM-5.2, а на странице OrcaRouter для Kimi K3 он не опубликован

На OrcaRouter оба доступны через один ключ на одном OpenAI-совместимом эндпоинте по адресу https://api.orcarouter.ai/v1, и мы передаём прайс-листовую цену провайдера как есть, без каких-либо наценок — поэтому все приведённые ниже цифры принадлежат вендору, а не нам.

Сколько стоит миллион токенов в задаче, которая чего-то стоит

Сначала тарифы поставщиков, взятые с их собственных страниц с ценами 23.09.2026. Z.ai указывает GLM-5.2 по цене $1.40 за миллион входных токенов, $0.26 за миллион кэшированных входных токенов и $4.40 за миллион выходных токенов. Moonshot указывает Kimi K3 по цене $3.00 за входные, $0.30 за чтение кэша, $15.00 за выходные — плюс плата за запись в кэш в размере $3.00 за миллион для пятиминутного кэша и $6.00 за миллион для часового кэша. Это опубликованные цены, а не независимо проверенные, и любой из поставщиков может их изменить.

Дайте им задачу, которая в основном состоит из чтения: обзор кодовой базы объёмом 600 000 токенов с письменным ответом на 8 000 токенов. На GLM-5.2 это 0,6 × $1,40 = $0,84 за вход плюс 0,008 × $4,40 = $0,035 за выход, или около $0,88. На Kimi K3 это 0,6 × $3,00 = $1,80 плюс 0,008 × $15,00 = $0,12, или около $1,92. Примерно в 2,2 раза больше затрат за ту же задачу.

Запустите это снова, когда кодовая база уже лежит в кэше провайдера. Строка ввода падает до тарифа чтения кэша, и две цены, различавшиеся в 2,1 раза, превращаются в $0,26 против $0,30 за миллион — разрыв 15%. Это наименее обсуждаемое число в сравнении и то, что важнее всего для агента, который перечитывает один и тот же контекст на каждом ходу. У него также есть звёздочка: Kimi K3 выставляет отдельный счёт за запись в кэш, а на странице GLM-5.2 плата за запись вообще не указана, поэтому холодный старт на Kimi K3 обходится заметно дороже, чем предполагает заявленная цена $3.00.

• Чтение на 600 тыс. токенов с ответом на 8 тыс. токенов — GLM-5.2 около $0,88 против Kimi K3 около $1,92

• Та же строка кэшированного ввода — GLM-5.2 $0.16 против Kimi K3 $0.18 за 600 тыс. токенов

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Независимая модель согласна с направлением, но не с величиной. Artificial Analysis смешивает токены попаданий в кэш, входные и выходные токены в соотношении 7:2:1 и добавляет токены рассуждений, которые модель фактически тратит; его показатели для этих двух — снятые 2026-09-23 в рамках его индекса v4.3.2 — оценивают GLM-5.2 в $0,902 за миллион смешанных токенов против $2,31 у Kimi K3, а стоимость выполнения одной из его оценочных задач — в $0,96 против $2,00. Один полный прогон Intelligence Index стоит $1 559 на GLM-5.2 и $3 658 на Kimi K3.

В этой модели затрат скрыта контринтуитивная деталь. Kimi K3 использует меньше выходных токенов на задачу, чем GLM-5.2 — 48 000 против 64 000 — и меньше токенов рассуждений, 32 000 против 51 000. Это более экономичная модель в расчёте на единицу работы, и всё же она обходится примерно вдвое дороже на задачу, потому что её цена за токен в 2,1 раза выше на входе и в 3,4 раза выше на выходе. Дешевизна в расчёте на задачу и дешевизна в расчёте на токен — разные свойства, и это сочетание, в котором они указывают в противоположные стороны.

Контекстное окно и что в него на самом деле помещается

На бумаге эти две величины различаются в пределах 5%: 1,000,000 токенов против 1,048,576. Было бы глупо представлять это как победу Kimi K3. Обе модели — модели с миллионом токенов, и размер окна не является фактором, который их различает; честный вопрос в том, что каждая из них всё ещё способна сделать с текстом, спрятанным в середине этого окна.

Именно это измеряет оценка длинноконтекстного рассуждения от Artificial Analysis, и это один из наиболее крупных разрывов в наборе данных: Kimi K3 набирает 89% против 78% у GLM-5.2. Если ваша задача — загрузить большой корпус и задавать вопросы, требующие связывания фактов с противоположных концов этого корпуса, то дополнительные 48 576 токенов — не причина выбирать Kimi K3; причина — преимущество в одиннадцать пунктов по длинному контексту.

Нижняя граница под окном тоже различается. GLM-5.2 заявляет максимальный объём вывода в 128 000 токенов; на странице Kimi K3 аналогичный показатель не публикуется, поэтому мы не будем его указывать. Если вы генерируете длинные документы, а не читаете их, эту асимметрию стоит проверить применительно к своей рабочей нагрузке, прежде чем покупать любой из них.

Скорость: единственная ось, где GLM-5.2 безоговорочно доминирует.

Два независимых измерения здесь указывают в одну сторону, и об этом стоит сказать именно потому, что они не во всём совпадают.

Наши собственные данные маршрутизации за семь дней, завершившихся 2026-09-23, показывают, что GLM-5.2 отвечает при медианном времени до первого токена 3,28 секунды против 8,09 секунды у Kimi K3 и выдаёт поток 68,1 токена в секунду против 43,4. У обеих моделей p95 времени до первого токена составляет ровно 10,00 секунды. Artificial Analysis, проводя отдельные измерения, указывает для GLM-5.2 68,2 выходных токена в секунду против 36,7 у Kimi K3, 41,29 секунды сквозного времени против 72,13 и 33,95 секунды до первого ответа против 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

Два источника расходятся в одном пункте, и это стоит отметить, а не сглаживать. Artificial Analysis ставит Kimi K3 немного впереди по чистому времени до первого токена — 4,08 секунды против 4,62, — тогда как наша собственная маршрутизация показывает, что GLM-5.2 почти в два с половиной раза быстрее на p50. Разные эндпоинты, разные вышестоящие провайдеры, разные окна. Считайте направление по пропускной способности — GLM-5.2 уверенно быстрее — надёжным, а любую отдельную цифру времени до первого токена, нашу или их, — свойством конкретной недели.

На нашей странице GLM-5.2 есть ещё одно число, которое мы не собираемся молча опускать: за те же семь дней там указана частота ошибок 9,2% против 0,26% у Kimi K3. Столь большой разрыв с примерно равной вероятностью может быть как неудачной неделей для апстрим-провайдеров, обслуживающих GLM-5.2, так и свойством самой модели, а семи дней — слишком короткое окно, чтобы различить эти варианты. Это как раз та проблема, ради решения которой существует маршрутизация: когда у провайдера сбоит каждый одиннадцатый запрос, автоматическое переключение при сбое перенаправляет трафик без того, чтобы кому-то пришлось поднимать дежурного.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Бенчмарки: настоящая победа, но не такая широкая, как в заголовке.

Kimi K3 побеждает почти во всех тестах, на которых прогоняли обе модели. Это показатели Artificial Analysis в рамках редакции индекса v4.3.2, обе модели в режиме максимального рассуждения, данные на 2026-09-23:

• Индекс интеллекта — Kimi K3 44 против GLM-5.2 34

• AA-Briefcase v1.1 — 1510 против 1233

• GDPval-AA v2.1 — 1524 против 1358

• AutomationBench-AA — 58% против 28%

• Terminal-Bench 4.0 — 13% против 1%

• SciCode — 59% против 51%

• Humanity's Last Exam — 47% против 41%

• GDP.pdf — 22% против 10%

• AA-LCR v1.1 — 89% против 78%

• CritPt — 23% против 21%

Две оговорки, прежде чем кто-либо сделает скриншот того списка.

Сначала — о пересмотре индекса. В публикациях об июльском запуске Kimi K3 ему приписывали 57 баллов в Intelligence Index, а GLM-5.2 — 51. На актуальных страницах сегодня указаны 44 и 34. Это не одно и то же измерение: Artificial Analysis пересматривает индекс и заново оценивает модели по нему, а поставить июльский показатель рядом с сентябрьским — самая простая ошибка, которую можно допустить в этом сопоставлении. Направление устойчиво во всех срезах; абсолютные числа несопоставимы между пересмотрами.

Во-вторых, уровни. Terminal-Bench 4.0 с 13% и 1% — это жёсткая оценка, и на такой высоте соотношение говорит больше, чем любое из этих чисел по отдельности. AA-Omniscience, проверяющий, знает ли модель границы собственных знаний, ставит GLM-5.2 на 4 против 20 у Kimi K3 — нижняя планка, о которой стоит знать, если вы планируете запускать любую из них без присмотра.

Ещё одна деталь, которую Artificial Analysis отмечает в листинге GLM-5.2: конфигурация с максимальным уровнем рассуждений помечена как устаревшая в пользу более новой GLM-5.3. Это не меняет ни одну из приведённых выше цифр — они являются снимком GLM-5.2 на момент измерения, — но это означает, что дорожная карта Z.ai уже ушла дальше этой модели. На маршрутизируемом эндпоинте это обходится сменой строки модели, а не миграцией, и в этом главный аргумент за то, чтобы не жёстко зашивать ни одно из этих имён в ваше приложение.

Агенты и использование инструментов: где разрыв шире всего

Если какой-то один блок этой таблицы и должен решать вопрос о покупке, то это именно он. Работа агентов на длинном горизонте — та область, где преимущество Kimi K3 наиболее велико и наиболее стабильно:

• AutomationBench-AA — 58% против 28%, разрыв в 30 пунктов

• GDPval-AA v2.1 — 1524 против 1358

• AA-Briefcase v1.1 — 1510 против 1233

• Terminal-Bench 4.0 — 13% против 1%

Собственные релизные материалы Moonshot опираются на ту же историю — выпуск весов K3 сопровождался техническим отчётом, охватывающим вендорский стек обучения с экспертной параллелизацией и стенд для агентной среды, — но материалы вендора есть материалы вендора, а приведённые выше цифры — независимые.

Сторонний агрегатор LLM Stats, который рассчитывает собственный композитный показатель по общему набору бенчмарков, приходит к тому же выводу с другой стороны: из одиннадцати бенчмарков, которые он оценивает для обеих моделей, Kimi K3 выигрывает все одиннадцать, а его оценки по категориям ставят Kimi K3 вперёд в использовании инструментов (30,8 против 19,6), агентах (38,3 против 29,6) и кодинге (42,3 против 34,8). Это собственные композитные показатели LLM Stats при их собственных весах, на общем наборе, который невелик, так что относитесь к ним как к подтверждению, а не как к лабораторному результату. Одиннадцать из одиннадцати — это всё равно не близкий счёт.

Программирование

То же направление, меньший разрыв. В оценках программирования, где Artificial Analysis приводит баллы для обеих моделей, Kimi K3 лидирует в SciCode — 59% против 51%; в общем наборе LLM Stats она берёт DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench и Terminal-Bench 2.1. Лестные цифры GLM-5.2 — 99,2% на AIME 2026, 94,4% на HMMT 2025, 91,2% на GPQA в том виде, как их приводят сторонние агрегаторы — заявлены вендором и не воспроизведены, и большинство из них измеряют соревновательную математику, а не разработку ПО.

Практический вывод: для агента-программиста, который работает долго, редактирует множество файлов и должен восстанавливаться после собственных ошибок, агентное преимущество Kimi K3 — более релевантный сигнал, чем оценки обеих моделей по математике. Для быстрого, дешёвого ассистента по коду, работающего преимущественно в один проход, преимущество GLM-5.2 в пропускной способности перевешивает издержки разрыва в бенчмарках.

Там, где они достаточно близки, чтобы это не имело значения

• Цена кэшированного ввода — $0,26 против $0,30 за миллион, разрыв в 15% против разрыва в 3,4 раза на выходе

• Контекстное окно — 1 000 000 против 1 048 576 токенов

• p95 времени до первого токена — 10,00 с против 10,00 с при нашей собственной маршрутизации

• CritPt — 23% против 21%

• Математика — LLM Stats ставит GLM-5.2 чуть выше в своём составном показателе по математике (41,4 против 40,9), тогда как Kimi K3 лидирует в математике с изображениями; судя по имеющимся данным, ни одна из моделей не доминирует в арифметике

Любой, кто говорит вам, что одна из этих моделей вдвое превосходит другую по всем параметрам, смотрит лишь на одну строку таблицы.

Выберите GLM-5.2, если…

Вы оплачиваете счёт, и именно счёт является ограничением. GLM-5.2 стоит примерно треть цены за вывод, а также дешевле по строке кэшированного ввода, имеет лицензию MIT и не содержит порога по выручке, с которым нужно сверяться, быстрее по медиане и значительно быстрее при потоковой передаче, а его окно в миллион токенов достаточно близко к окну Kimi K3, чтобы эта разница когда-либо что-то решала. Если ваша нагрузка — это текст на входе и текст на выходе, и она в основном связана с чтением, а не с длинными цепочками вызовов инструментов, то дополнительные баллы Kimi K3 в бенчмарках — это баллы, которые ваше приложение никогда не наберёт.

Выбирайте Kimi K3, если…

Работа носит агентный характер и занимает много времени. Разрыв в 30 пунктов в AutomationBench, лидерство в GDPval и AA-Briefcase, преимущество в одиннадцать пунктов в рассуждениях на длинном контексте и триумф в общем наборе LLM Stats — всё указывает в одну сторону: Kimi K3 — лучшая модель, которой можно передать многошаговую задачу и уйти. К тому же только она из двух принимает изображения. За это вы будете платить примерно вдвое больше за задачу, а если ваш рабочий набор активно кэшируется, то меньше чем вдвое, — но аргумент в её пользу не в цене и не в скорости.

Обе модели маршрутизируются на OrcaRouter с помощью одного ключа через одну конечную точку, совместимую с OpenAI, по прайс-листовым ценам провайдеров без каких-либо наценок, и обе находятся за одним и тем же автоматическим переключением при сбое. Это самый дешёвый способ выяснить, какая из них на самом деле нужна вашей рабочей нагрузке, потому что переключение между ними — это строка модели, а не контракт.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно