Титульная карточка для GLM 5.3 Prime с надписью 'GLM 5.3 Prime: вдвое дороже, те же веса', с подзаголовком 'GLM-5.3, август 2026, перепродано как более быстрый канал обслуживания в сентябре', с тремя чипами: 'Ввод / 1M: $2.80 против $1.40', 'Вывод / 1M: $8.80 против $4.40' и 'Множитель: ровно 2.0x', и нижней строкой 'Те же веса, тот же контекст, те же бенчмарки — разница только в цене.'
Guides & Insights

GLM 5.3 Prime: те же веса GLM-5.3, но ровно вдвое дороже по прайс-листу

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GLM 5.3 Prime стоит $2,80 за миллион входных токенов и $8,80 за миллион выходных токенов. GLM-5.3, модель, на которой он работает, стоит $1,40 и $4,40. Это не разница из-за округления и не промо-разброс — это ровно в 2,0 раза больше по обоим пунктам, и это единственное, в чём два продукта расходятся. GLM 5.3 Prime — не новая модель. Он несёт собственные веса GLM-5.3, те, что Z.ai открыла 25 августа 2026 года, за более быстрым стеком обслуживания. Сам GLM-5.3 был анонсирован 14 августа 2026 года и появился в API 18 августа. Ничего в базовой модели не изменилось, когда в конце сентября появился идентификатор Prime. Изменилось то, что кто-то повесил на неё второй ценник.

Если вы читаете это потому, что в списке моделей рядом со знакомым именем вам попалось незнакомое, короткий ответ таков: вы смотрите на уровень обслуживания, а не на релиз. Более длинный ответ стоит двух минут, потому что арифметика на удивление чистая, а происхождение на удивление туманное.

Что такое уровень «Prime», в одном абзаце

Уровень обслуживания — это второй идентификатор продукта, указывающий на те же веса и настроенный на пропускную способность, а не на стоимость. Вы не получаете более крупную модель, более длинный контекст, лучший режим рассуждения или более широкий набор инструментов. Вы быстрее выдаёте токены, и вы платите за эту привилегию за каждый токен, а не за сэкономленное реальное время. Этот компромисс реален и иногда оправдан — многошаговый цикл агента, делающий десять последовательных вызовов, действительно выигрывает от того, что каждый вызов возвращается быстрее — но это покупка задержки, а не покупка возможностей, и цена должна назначаться соответственно.

В описании поставщика для GLM 5.3 Prime прямо сказано то, о чём обычно умалчивают: это «высокоскоростной вариант GLM-5.3 от Z.ai, наследующий все его возможности и обеспечивающий в 1,5–2 раза большую пропускную способность вывода за счёт ускорения инференса». Все возможности. То же контекстное окно размером 1 000 000 токенов. Тот же предел вывода в 131 072 токена. Текст на входе, текст на выходе. Рассуждение обязательно, с низкими, высокими и максимальными уровнями усилий, а максимальный по умолчанию — идентично базовой модели.

Тарифная карта, бок о бок

• Ввод — GLM 5.3 Prime $2,80 за 1 млн против GLM-5.3 $1,40 за 1 млн
• Вывод — GLM 5.3 Prime $8,80 за 1 млн против GLM-5.3 $4,40 за 1 млн
• Кэшированный ввод — GLM 5.3 Prime $0,56 за 1 млн против GLM-5.3 $0,26 за 1 млн
• Множитель — 2,0× для всех трёх строк, в обоих направлениях
• Контекст — 1 000 000 токенов у обоих
• Макс. вывод — 131 072 токена у обоих
• Рассуждение — обязательно для обоих, те же три уровня усилий, одинаковое значение по умолчанию

Строку кэша как раз и упускают. Чтение из кэша — самый дешёвый токен, который вы когда-либо купите у передовой модели, и именно на него рабочие нагрузки агентов фактически тратят свой бюджет — системный промпт, определения инструментов и растущий транскрипт перечитываются на каждом ходу. Удвоение тарифа на кэш удваивает самую крупную статью расходов в длинной сессии агента, а значит, эффективная наценка на реальной нагрузке ближе к 2×, чем предполагает заявленная разница в цене на свежие входные токены. Если вы надеялись, что на практике быстрый путь окажется дешевле, потому что вы агрессивно кэшируете, — это не так.

Кто на самом деле это продаёт?

Вот здесь листинг становится интересным, и здесь внимательному читателю стоит замедлиться. В собственной документации Z.ai, в обзоре моделей и на опубликованной странице цен не указано ни одного Prime SKU. Поищите в идентификаторах моделей вендора glm-5.3-prime — и вы не найдёте ничего. Собственный скоростной уровень Z.ai — это совершенно другой продукт на другой линейке: GLM-5.3-FlashX, который относится к более дешёвому семейству Flash, был запущен 18 сентября 2026 года и стоит $0.37 и $1.25 за миллион токенов.

Итак, Prime — это продукт на стороне платформы, построенный на весах Z.ai. Две детали указывают на то, чья это платформа. Первая — формулировка «пропускная способность вывода в 1,5–2 раза», которую крупный облачный провайдер использует для собственного режима ускоренного обслуживания — режима, включаемого сменой идентификатора модели, причём возможности и лимиты использования, как явно указано, не меняются. Вторая — в листинге указан ровно один вышестоящий провайдер за эндпоинтом. Единственный провайдер за SKU быстрого уровня — это не то, как обслуживается модель с открытыми весами; так со стороны выглядит собственное ускоренное развёртывание платформы.

Ничто из этого не делает GLM 5.3 Prime плохим продуктом. Это делает его продуктом с одним поставщиком, а это вопрос устойчивости, который стоит задать, прежде чем направлять через него продакшен-трафик.

Чего стоит заявленная скорость

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-FlashX - the two speed tiers'. The GLM 5.3 Prime column reads 'Input / 1M: $2.80', 'Output / 1M: $8.80', 'Cached input: $0.56', 'Runs on: GLM-5.3 weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: 2.0x'; the GLM-5.3-FlashX column reads 'Input / 1M: $0.37', 'Output / 1M: $1.25', 'Cached input: not listed', 'Runs on: Flash family weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: under 0.3x'; the footer reads 'Both are serving tiers, not models. Prime per its tier listing; FlashX per the vendor rate card.'

Цифра 1,5–2× — это утверждение о пропускной способности, измеренной в собственных условиях поставщика, а пропускная способность — это метрика, наиболее чувствительная к этим условиям. Количество выходных токенов в секунду на прогретом кэше с коротким запросом и простаивающем кластере — это не то число, которое видит агент с длинным контекстом. Независимое измерение базовой модели даёт для GLM-5.3 примерно 61 выходной токен в секунду, а для GLM-5.3-Flash — около 46, на наборе, где среднее по классу составляет 67 — так что более дешёвая ветка также является и более медленной, что противоположно тому, на что намекают названия. Это медианы по стандартизированному оценочному набору, а не пиковые значения.

Есть также и менее очевидная цена. Уровень усилий на рассуждение по умолчанию для обоих ID — max — это настройка, которая создаёт самые длинные цепочки рассуждений. Скорость и многословность здесь тянут в противоположные стороны: быстрый уровень, который к тому же рассуждает на максимальной длине, всё равно может быть медленным от начала до конца на сложной задаче, потому что узкое место — это количество токенов, которые модель решает сгенерировать, а не скорость, с которой она их генерирует. Если ваша рабочая нагрузка требует много рассуждений, снизьте уровень до high или low, прежде чем платить вдвое за ускорение — уровень усилий изменит вашу задержку сильнее, чем уровень обслуживания.

Три способа купить одну и ту же модель

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text input and text output with tools, JSON and reasoning, a 2026-08-18 date beside 'Public benchmarks by Z.ai', a p50 time to first token of 3.91 seconds, and a stat strip reading $1.26 input, $3.96 output, 3.91 s p50 TTFT, 10.00 s p95 TTFT and 1,733.9M tokens.

GLM-5.3 теперь существует в трёх доступных для покупки формах, и это не три модели:

• GLM-5.3 за $1.40 / $4.40 — базовый тариф, полные возможности, версия с опубликованными открытыми весами, которую вы можете развернуть у себя
• GLM 5.3 Prime за $2.80 / $8.80 — те же веса через ускоренный стек, один вышестоящий поставщик, веса не передаются
• GLM-5.3-FlashX за $0.37 / $1.25 — вовсе не GLM-5.3, а скоростной уровень на более дешёвом семействе Flash, и, бесспорно, самый дешёвый способ купить низкую задержку

Третья строка — вот на что стоит засмотреться. Если на самом деле вам нужны более быстрые токены и неважно, из какого именно GLM вы их получаете, FlashX обеспечивает ускорение на модели, которая уже стоит примерно десятую часть флагмана, — меньше чем за половину того, что флагман стоит без ускорения. Prime имеет смысл только в том случае, если вам конкретно нужно качество рассуждений GLM-5.3 и конкретно нужно получить его раньше.

Где это находится на нашей стороне

A tall screenshot of the same OrcaRouter model page for GLM 5.3 (captured September 24, 2026) showing the PRICING block reading $1.26 per 1M input tokens, $3.96 per 1M output tokens and $0.234 per 1M cache read in USD, a token and cost estimator, and a PERFORMANCE panel for the last 7 days reading p50 TTFT 3.91 s, output speed 73.6 tokens per second, p95 TTFT 10.00 s and an error rate of 0.14%.

Скажем прямо: OrcaRouter не хостит GLM 5.3 Prime, и мы также не хостим GLM-5.3-FlashX. Обе страницы этих моделей выдают 404 на нашем сайте. Если вам нужен ускоренный тариф, его придётся купить на платформе, которая его продаёт, либо для базовой модели — через собственный API вендора.

Что мы действительно размещаем — это GLM-5.3 и GLM-5.3-Flash, по каталожной цене провайдера, без какой-либо наценки с нашей стороны — те же $1.40 и $4.40, которые вы видите в собственном прайс-листе Z.ai, переданные напрямую, а не переоценённые. Для модели, чья цена менялась дважды за шесть недель, это значит больше, чем кажется. Поскольку мы не добавляем спред, изменение цены вендором вступает в силу на нашей стороне в тот же день, когда и у них, — без миграции и без обращения в поддержку. Оба идентификатора доступны через один API-ключ наряду с более чем 200 другими моделями, так что A/B-сравнение GLM-5.3 и GLM-5.3-Flash — это изменение названия модели в одной строке, а не второй контракт, и автоматическое переключение при сбое подстрахует вас, если отдельный вышестоящий провайдер начнёт работать хуже — а это именно тот риск, который несёт быстрый тариф с единственным поставщиком.

Стоит ли вам платить в 2 раза больше?

Платите за это, если человек или вышестоящий сервис заблокирован в ожидании ответа, нагрузка ограничена задержкой, а не пропускной способностью, и вы уже убедились, что именно усилие рассуждений является реальной причиной вашей задержки. Не платите за это, если вы запускаете пакетную генерацию на ночь, если ваш объём достаточно велик, чтобы двукратная надбавка за токены перевешивала сэкономленное реальное время, или если вы надеялись, что этот уровень незаметно окажется лучшей моделью. Это не так. Это GLM-5.3 с работающим секундомером, а секундомер выставляет счёт по токенам.

Честная формулировка для всего семейства GLM-5.3 на данный момент такова: Z.ai выпустила одну модель в августе, а рынок потратил сентябрь на её переупаковку по четырём разным ценам. GLM 5.3 Prime — самая дорогая из этих упаковок. Это также та, у которой самый скудный документальный след, потому что компания, чьё имя стоит на весах, не указывает её. Это не причина избегать её. Это причина точно знать, что вы покупаете, прежде чем ставить её на производственный путь.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно