Титульная карточка для GLM 5.3 Prime vs GLM-5.3 с надписью «GLM 5.3 Prime vs GLM-5.3: одна модель, два трека», подзаголовком «Те же веса, тот же контекст, те же оценки — разница в 2,0-кратном множителе цены», с тремя чипами: «Цена / 1M: $2,80 / $8,80 против $1,40 / $4,40», «Заявленная скорость: 1,5–2x пропускной способности вывода» и «Стоимость за токен в секунду: от 1,0x до 1,33x», и строкой в футере «GLM-5.3: анонсирован 14 августа 2026 г., API — 18 августа, веса открыты 25 августа».
Guides & Insights

GLM 5.3 Prime против GLM-5.3: вдвое дороже за те же веса и секундомер

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В этом сравнении нет вопроса о качестве, и именно это делает его необычным. GLM 5.3 Prime и GLM-5.3 — это одна и та же модель: те же веса, тот же контекст на 1,000,000 токенов, тот же потолок вывода на 131,072 токена, то же обязательное рассуждение с теми же тремя уровнями усилий, те же оценки во всех опубликованных бенчмарках. GLM-5.3 был анонсирован 14 августа 2026 года, появился в API 18 августа, а его веса были открыты 25 августа; идентификатор Prime появился в конце сентября как второй способ купить то же самое. Единственная строка в сравнении, которая отличается, — это та, что важна для вашего счёта, и она отличается ровно в 2,0 раза.

Так что вопрос не в том, какую модель использовать. Вопрос в том, стоит ли канал обслуживания, обещающий в 1,5–2 раза большую пропускную способность вывода, вдвое большей цены, — а это арифметика, которую можно уложить в один абзац. В большинстве материалов об этой паре пропускают арифметику и спорят о бенчмарках, которые по построению идентичны. Вот и весь расчёт.

Единственные строки, которые различаются

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3 - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Context: 1,000,000 tokens', 'Max output: 131,072 tokens', 'Weights: none, hosted lane', 'Throughput: 1.5-2x, vendor-reported'; the GLM-5.3 column reads 'Price / 1M: $1.40 / $4.40', 'Cached input: $0.26', 'Context: 1,000,000 tokens', 'Max output: 131,072 tokens', 'Weights: open since Aug 25, 2026', 'Throughput: standard lane'; the footer reads 'Same weights, same scores, 2.0x the price. Prime has no independent measurement.'

• Цена — GLM 5.3 Prime $2.80 / $8.80 за 1 млн против GLM-5.3 $1.40 / $4.40 за 1 млн
• Кэшированный ввод — $0.56 за 1 млн против $0.26 за 1 млн
• Множитель — 2,0× по каждой строке, в обоих направлениях, без исключений
• Пропускная способность — заявленные производителем 1,5–2× на ускоренном канале против стандартного; независимых измерений для Prime ID не существует
• Индекс интеллекта — 45 у обоих, потому что это одна модель, оценённая один раз
• Контекст — 1 000 000 токенов у обоих
• Макс. вывод — 131 072 токена у обоих
• Рассуждение — обязательно у обоих, низкий / высокий / макс., по умолчанию макс. у обоих
• Модальность — текст на входе, текст на выходе, у обоих
• Веса — веса GLM-5.3 можно скачать по специальной лицензии; у Prime весов нет вообще
• Доступность — GLM-5.3 в собственном API Z.ai и на каждой платформе, где он представлен; Prime — на одной платформе, через одного названного вышестоящего провайдера

Обратите внимание, что одинаковые строки делают с обычной сравнительной статьёй. Здесь нет аргумента о глубине рассуждений, нет аргумента о длинном контексте, нет аргумента о вызове инструментов, нет аргумента о лицензии на обслуживание, который разделял бы эти два продукта, потому что канал обслуживания не меняет поведение модели. Если вы читали очное сравнение этой пары, где Prime признали «более способной» в какой-то задаче, этот вывод — шум: одни и те же веса не дают другого распределения, а различаются они только тем, как быстро поступают токены и сколько из них модель выдаёт при уровне усилий рассуждения по умолчанию.

Точка безубыточности, как надо

Посчитайте стоимость обеих линий за единицу работы — и всё сведётся к одному соотношению. Если Prime обеспечивает в 2,0 раза большую пропускную способность при цене в 2,0 раза выше, вы покупаете тот же результат за ту же стоимость и просто обмениваете деньги на сокращение календарного времени — чистая покупка меньшей задержки без надбавки и без скидки. Если Prime обеспечивает в 1,5 раза большую пропускную способность при цене в 2,0 раза выше, вы платите примерно в 1,33 раза больше за каждый токен в секунду — надбавку в одну треть за привилегию ждать меньше. Это два конца заявленного самим поставщиком диапазона, и оба конца — наилучший сценарий, потому что они предполагают, что коэффициент 1,5–2× сохранится на вашей рабочей нагрузке, а не в условиях бенчмарка поставщика.

Наценка на практике оказывается хуже, чем это, по одной причине: пропускная способность измеряется на прогретом, коротком запросе без конкуренции, и это метрика, наиболее чувствительная ко всему остальному. Сессия агента с длинным контекстом перечитывает растущий транскрипт на каждом ходу, из-за чего нагрузка ложится на prefill и на чтение из кэша, а не на декодирование в установившемся режиме — а Prime ещё и берёт двойную плату за чтение из кэша. Независимое измерение базовой модели даёт для GLM-5.3 примерно 61 выходной токен в секунду против среднего по классу значения 67, но эта цифра — медиана по стандартизированному набору оценок, а не хвост, в который вы попадёте под нагрузкой. Честный вывод таков: стоимость Prime за единицу пропускной способности находится где-то между 1,0× и 1,33× от базового тарифа, и чтобы удержаться на отметке 1,0×, идеальный сценарий поставщика должен соблюдаться в точности.

Одинаковые веса означают больше, чем кажется

A screenshot of the Artificial Analysis model page for GLM-5.3 (max) (captured September 24, 2026) showing an Intelligence Index score of 45 against a class median of 18, 210M tokens generated during evaluation, a 1M-token context window with 114 models in the class, $1.40 per 1M input and $4.40 per 1M output tokens with an 81% cache discount, a cost of $2.01 per Index task, and the comparison line 'At 61 tokens per second, GLM-5.3 (max) is slower than average (67).'

Практическая выгода общего набора весов в том, что всё, что вы построили с расчётом на GLM-5.3, переживает переключение в обоих направлениях. Формы промптов переносятся, схемы инструментов переносятся, ключи кэша переносятся, а оценка, которую вы проводили, чтобы обосновать выбор флагманской модели, остаётся действительной для обоих идентификаторов. Здесь нет повторной настройки, повторного создания базовых показателей, нет сюрпризов в режимах отказа, потому что режимы отказа принадлежат модели, а не каналу, который её обслуживает.

Это работает в обе стороны, и именно второе направление стоит усвоить. Если стандартный уровень рассуждений GLM-5.3 — max — делает её многословной в вашей задаче, Prime унаследует эту многословность вместе со всем остальным. Более быстрый канал, который генерирует больше токенов, чем вам нужно, не быстрее от начала до конца. Прежде чем платить вдвое за ускорение, снизьте уровень усилий до high или low и измерьте — настройка усилий обычно влияет на сквозную задержку сильнее, чем обслуживающий канал, и ничего не стоит.

Единственная асимметрия, которую не показывает прайс-лист

Веса GLM-5.3 открыты. Любой, у кого есть оборудование, может скачать их и обслуживать модель по себестоимости — без счёта за токены и без необходимости выбирать между каналами обслуживания. Самый компактный практичный вариант квантования требует порядка 217 ГБ памяти ускорителей, что для большинства команд означает развёртывание на нескольких узлах, а для некоторых — погрешность округления; кроме того, лицензия устанавливает порог выручки, при превышении которого крупные операторы model-as-a-service обязаны пройти проверку безопасности, прежде чем предоставлять её на коммерческой основе.

У Prime нет весов. Это хостинговый канал на чужом развёртывании, и в его листинге указан ровно один вышестоящий провайдер за эндпоинтом. Вот асимметрия, которую стоит назвать: для базовой модели вы выбираете между ценой за токен и вашими собственными амортизированными затратами, а для Prime — между ценой за токен и ничем иным. Команда, уже запускающая GLM-5.3 на своём оборудовании, имеет в этом сравнении третий вариант, который прайс-лист никогда не показывает, и обычно он самый дешёвый из трёх.

Где секундомер действительно выигрывает

Есть рабочие нагрузки, в которых надбавка 1,33× за токен очевидно оправдана, и у всех у них есть одно общее свойство: узким местом является что-то помимо вашего бюджета токенов. Человек, ожидающий ответа в интерфейсе чата. Синхронный шаг в конвейере, где следующий этап не может начаться, пока модель не вернёт результат. Цикл агента, выполняющий десять последовательных вызовов, где задержка каждого вызова умножается на длину цепочки, а суммарное реальное время — это именно то, что действительно ощущает ваш пользователь. В таких случаях вы покупаете не токены — вы выкупаете обратно время, которое эти токены собирались занять, и 2× в счёте — это не то число, которое решает, будет ли работать эта функция.

За пределами этого сценария арифметика быстро оборачивается против Prime. Ночную пакетную генерацию не волнует, как быстро возвращается отдельный запрос. Масштабную классификацию это тоже не волнует, а в больших объёмах двухкратная надбавка за чтение кэша превращается в реальную статью расходов. А любая нагрузка, в которой длина собственных рассуждений модели является доминирующим слагаемым, — трудная математическая задача, длинная цепочка планирования, — платит за ускорение той части запроса, которая никогда не была медленной.

Обе полосы, один ключ, без второй интеграции

A tall screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 24, 2026) showing the model's code samples with model set to z-ai/glm-5.3, the supported-parameter list, a PRICING block reading $1.26 per 1M input tokens, $3.96 per 1M output tokens and $0.234 per 1M cache read in USD, a token and cost estimator, and a PERFORMANCE panel for the last 7 days reading p50 TTFT 3.91 s, output speed 73.6 tokens per second, p95 TTFT 10.00 s and an error rate of 0.128%.

Большинство команд в итоге решают это не выбором одной дорожки, а маршрутизацией между ними, и это имеет смысл только в том случае, если оба идентификатора доступны одинаковым способом. OrcaRouter предоставляет GLM-5.3 по прайсовой ставке провайдера — $1.40 и $4.40 за миллион токенов, без наценки с нашей стороны — цена провайдера передаётся как есть, а не пересчитывается, поэтому изменение ставки вендора вступает в силу у нас в тот же день, когда оно появляется у них. GLM-5.3-Flash тоже здесь, по $0.07 и $0.25, и это важно, потому что маршрут с эскалацией от дешёвой модели к флагманской — именно та схема, которую хочет большая часть продакшен-трафика.

Оба ID находятся за одним API-ключом вместе с более чем 200 другими моделями, что превращает выбор дорожки в изменение имени модели внутри одного пути вызова, а не во второй контракт и вторую интеграцию. DSL маршрутизации — это то, где это становится полезным для данной конкретной пары: направляйте чувствительные к задержке вызовы в ускоренную дорожку, а всё остальное — в стандартную, или эскалируйте при неудачной проверке, а не по догадке. Автоматическое переключение при сбое покрывает случай, когда один вышестоящий провайдер деградирует, что и представляет собой конкретный риск, который несёт быстрый уровень от одного поставщика.

Одного мы не станем подразумевать: OrcaRouter не размещает у себя GLM 5.3 Prime, и страница его модели здесь возвращает 404. Если вам нужен именно ускоренный канал, вы купите его на платформе, которая его продаёт. Что мы можем сделать — так это дать вам базовый канал, модель Flash и одно место для маршрутизации между ними.

Как принять решение за тридцать секунд

Спросите, ждёт ли что-либо ответа. Если человек или нижестоящий сервис заблокирован, а нагрузка ограничена задержкой, а не пропускной способностью, и вы уже подтвердили, что усилие рассуждения — не настоящий источник вашей задержки, то надбавка Prime — это цена этой возможности, и её следует заплатить. Если ничего не ждёт — пакетные задания, офлайн-оценка, массовое извлечение, всё, где очередь поглощает задержку, — вы платите надбавку в одну треть за единицу пропускной способности ради числа, на которое никто никогда не посмотрит, и базовый маршрут — правильный ответ.

Более широкая мысль здесь о том, как продавалось это семейство. GLM-5.3 вышла один раз, в августе, а сентябрь принёс для неё как минимум четыре разные цены — в зависимости от того, в каком канале, на какой платформе и на какую родственную модель вы попадёте. Prime — самая дорогая из них и меньше всего описана, потому что компания, чьё имя стоит на весах, не указывает её в списке. Это не аргумент против её покупки. Это аргумент за то, чтобы знать, прежде чем направлять через неё продакшен-трафик, что единственное, что вы покупаете по сравнению с базовой моделью, — это секундомер, и что этот секундомер тарифицируется по токенам.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно