Титульная карточка для GLM 5.3 Prime против GLM-5.3-Flash с надписью «GLM 5.3 Prime против GLM-5.3-Flash: 18-кратный разрыв», с подзаголовком «Один — это канал обслуживания только для текста, другой — мультимодальная модель», с тремя плашками с надписями «Цена / 1M: $2.80 / $8.80 против $0.15 / $0.50», «Модальность: только текст против текста, изображения, видео» и «Лицензия: индивидуальная против MIT», а также строка нижнего колонтитула «GLM-5.3 анонсирована 14 августа 2026 г.; GLM-5.3-Flash выпущена 26 августа 2026 г.»
Guides & Insights

GLM 5.3 Prime vs GLM-5.3-Flash: 18-кратный разрыв в цене между двумя разными моделями

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вот сравнение в одну строку для всех, кто пришёл с уже наполовину принятым решением о покупке: GLM 5.3 Prime — это GLM-5.3, чьи флагманские веса продаются через ускоренный уровень обслуживания по цене $2.80 и $8.80 за миллион токенов, а GLM-5.3-Flash — это отдельная нативно мультимодальная модель с собственными открытыми весами по цене $0.15 и $0.50. Разница между ними — примерно в восемнадцать раз как на входе, так и на выходе. Это не разница в уровне — это другая модель на другой позиции в семействе, и единственная причина, по которой эти два названия стоят рядом друг с другом в списке моделей, — то, что оба появились в пределах шести недель друг от друга.

Ошибиться здесь дорого в обе стороны. Если считать Flash дешёвой версией Prime, вы удивитесь, чего он не умеет. Если считать Prime более быстрым Flash, вы переплатите в восемнадцать раз за модель, которая не способна увидеть изображение.

Начните с того, чем каждое из них на самом деле является

GLM-5.3-Flash — это мультимодальная смесь экспертов на 320 миллиардов параметров, из которых активны 18 миллиардов, выпущенная 26 августа 2026 года под лицензией MIT, а её веса доступны на Hugging Face и ModelScope. Она нативно принимает текст, изображения, видео и файлы в одном запросе, имеет контекстное окно в 1 000 000 токенов и предельный объём вывода в 128 000 токенов, а также была предобучена отдельно, а не дистиллирована из флагманской модели. Её гибридная схема внимания, сочетающая линейное и разреженное внимание, сокращает вычисления для внимания примерно втрое и уменьшает KV-кэш более чем в четыре раза по сравнению с GLM-5.3 — и именно на архитектурном уровне, а не за счёт скидки, кроется источник её преимущества по стоимости.

GLM 5.3 Prime — это GLM-5.3 — разреженная смесь экспертов с 40 миллиардами активных параметров, анонсированная 14 августа 2026 года, появившаяся в API с 18 августа, с открытием весов 25 августа, — обслуживается через высокоскоростной канал. Тот же контекст в 1 000 000 токенов, тот же потолок вывода в 131 072 токена, текст на входе и текст на выходе, обязательное рассуждение на низком, высоком или максимальном уровне усилий, причём максимальный используется по умолчанию. В собственной документации Z.ai Prime SKU не указан; этот уровень существует на сторонней платформе, которая называет одного вышестоящего провайдера, стоящего за ним.

Табло

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-Flash - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Modality: text only', 'Weights: none', 'Intelligence Index: 45, same as GLM-5.3', 'Speed: 1.5-2x, vendor-reported'; the GLM-5.3-Flash column reads 'Price / 1M: $0.15 / $0.50', 'Cached input: $0.03', 'Modality: text, image, video, file', 'Weights: open, MIT', 'Intelligence Index: 42', 'Speed: 46 tokens/sec, independently measured'; the footer reads 'Flash figures per Artificial Analysis v4.3.2; Prime speed is vendor-reported with no independent measurement.'

• Цена — GLM 5.3 Prime $2,80 / $8,80 за 1 млн токенов против GLM-5.3-Flash $0,15 / $0,50 за 1 млн токенов
• Кэшированный ввод — $0,56 за 1 млн токенов против $0,03 за 1 млн токенов
• Множитель — примерно 18× на вводе и выводе, до какого-либо кэширования
• Модальность — только текст против текста, изображений, видео и файлов на входе
• Параметры — 40B активных параметров у флагманской MoE против 320B общих / 18B активных
• Веса — открытые, по специальной лицензии с порогом выручки против MIT, доступны для скачивания уже сегодня
• Максимальный вывод — 131 072 токена против 128 000 токенов
• Контекст — 1 000 000 токенов у обоих
• Индекс интеллекта — GLM-5.3 набирает 45 баллов в индексе v4.3.2; GLM-5.3-Flash набирает 42
• Стоимость одной задачи в индексе — $2,01 для флагмана против $0,25 для Flash
• Скорость — около 61 выходного токена в секунду против примерно 46, при этом оба показателя — независимо измеренные медианы
• Доступ по подписке — Prime не входит в Coding Plan от Z.ai; Flash входит, с квотой 3×

Две строки в том списке заслуживают большего, чем пункт маркированного списка. Первая — это разрыв в интеллекте: три пункта по Artificial Analysis Intelligence Index, 45 против 42, в редакции v4.3.2. Более ранняя редакция того же индекса оценивала эти модели в 60 и 57, и эта старая пара всё ещё широко фигурирует в материалах о запуске — не путайте эти две редакции, потому что числа не сопоставимы между редакциями. Три пункта — это узкий разрыв, который проявляется как чуть больший дрейф на очень длинных агентных цепочках и повышенная чувствительность к неоднозначным инструкциям, а не как иной класс модели.

Второй — скорость, и она переворачивает интуицию, которую создают названия. Flash оказывается медленнее из двух при независимом измерении — около 46 выходных токенов в секунду против 61 у флагмана, в классе, где среднее — 67. Flash оправдывает своё название ценой и мультимодальностью, а не задержкой. Это важно для сравнения, потому что обычная причина обратиться к маленькой модели — она отвечает быстрее, а здесь это не так.

Решение, которое действительно принимать именно вам

Поскольку две модели различаются сразу по трём осям — модальности, лицензии и цене, — выбор обычно решается по первой оси и вообще не доходит до арифметики. Flash читает изображения и видео; Prime не умеет читать ничего, кроме текста. Если ваша рабочая нагрузка касается скриншота, отсканированной страницы, снимка интерфейса или кадра видео, сравнение заканчивается ещё до того, как в дело вступает цена, и вы покупаете Flash.

Если ваша рабочая нагрузка — исключительно текст, а вопрос действительно о качестве, честный ответ таков: разрыв в три пункта по индексу — это всё, что вы покупаете за 18×. Стоит ли это того, полностью зависит от того, можете ли вы проверить результат. Там, где ответ можно проверить — код, который компилируется, запрос, возвращающий строки, структурированное извлечение, проходящее валидацию по схеме, — случайный промах Flash дёшево поймать и дёшево повторить, а за одну восемнадцатую цены вы можете повторять очень много раз. Там, где результат — это текст, который должен оценивать человек, или длинный многошаговый план без промежуточной проверки, разрыв труднее компенсировать, и доплату легче оправдать.

Где открытые веса меняют математику

Flash распространяется под лицензией MIT, а его самая компактная пригодная для использования квантизация требует порядка 93 ГБ памяти ускорителя — это один узел с большим объёмом памяти для многих команд и погрешность округления в счёте для некоторых. GLM-5.3 поставляется со специальной лицензией, которая требует, чтобы крупные операторы model-as-a-service с доходом выше определённого порога проходили проверку безопасности, а его минимальная практичная квантизация составляет около 217 ГБ, что для большинства означает развёртывание на нескольких узлах.

Эта асимметрия означает, что реальное сравнение для команды с большими объёмами — это не $8.80 у Prime против $0.50 у Flash. Это $8.80 у Prime против вашей собственной амортизированной стоимости за миллион выходных токенов на оборудовании, которое у вас уже есть, при работе с весами, которые можно скачать сегодня без разговоров о лицензии. Для команды, у которой есть оборудование и объёмы, это число часто оказывается наименьшим из трёх, и оно доступно только на стороне Flash в этом сравнении.

Покупая оба, и покупая их вместе

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input with text output, a 2026-08-26 date beside 'Public benchmarks by Z.ai', a 320B total / 18B active parameter line, a p50 time to first token of 6.86 seconds, and a stat strip reading $0.07 input, $0.25 output, 6.86 s p50 TTFT, 10.00 s p95 TTFT and 22,120.9M tokens.

Большинству продакшен-систем не нужно выбирать. Паттерн, который подходит этой паре, — это маршрутизатор: Flash на пути по умолчанию для текстовой и мультимодальной работы, флагман — при эскалации, когда задача долгосрочная или первая попытка не прошла проверку. Это два ID моделей и одна функция принятия решений, и цена немного ошибиться в этом разделении — несколько центов на тысячу запросов, а не архитектурная проблема.

Мы размещаем GLM-5.3-Flash по $0.07 и $0.25 за миллион токенов — ниже собственного прайса вендора в $0.15 и $0.50 — а GLM-5.3 по прайсовой ставке провайдера $1.40 и $4.40, причём оба — с нулевой наценкой с нашей стороны — прайс провайдера передаётся как есть, а не переоценивается, поэтому изменение тарифа вендора отражается на нашей стороне в тот же день, когда и на их. Оба идентификатора доступны по одному ключу наряду с более чем 200 другими моделями, что превращает переход с Flash на флагманскую модель в смену названия модели внутри одного пути вызова, а не во вторую интеграцию. Автоматическое переключение при сбое покрывает случай, когда единственный вышестоящий провайдер за быстрым тарифом деградирует, а для такого тарифа, как Prime, где указан ровно один поставщик, это не гипотетическая проблема.

Скажем прямо об ограничениях: OrcaRouter не хостит GLM 5.3 Prime, и мы также не хостим GLM-5.3-FlashX. Обе страницы моделей возвращают здесь 404. Если вам нужно ускорение Prime, вы приобретёте его на платформе, которая его продаёт.

Что мы бы вам на самом деле сказали

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 24, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, a 1M-token context window, $0.15 per 1M input and $0.50 per 1M output tokens with an 83% cache discount, and the comparison line 'At 46 tokens per second, GLM 5.3 Flash is notably slow (67).'

Если вы дочитали до этого места в поисках победителя, ответ таков: эта пара никогда не была состязанием. Flash побеждает по стоимости, по модальности, по лицензии и по возможности развёртывания, причём побеждает по всем четырём с большим отрывом. Единственное, что может предъявить флагман, — это три пункта в индексе и примерно на 15 больше выходных токенов в секунду, и за это он берёт в восемнадцать раз больше. Для подавляющего большинства текстовых рабочих нагрузок Flash — правильный выбор по умолчанию, и бремя доказательства лежит на дорогом варианте.

Место, где нужно быть осторожным, — это середина. Команда, которой нужно флагманское качество рассуждений на тексте и которая также должна читать изображения, в итоге будет запускать обе модели, и возникает соблазн направлять всё во флагманскую, потому что именно у неё есть репутация. Именно тогда 18× тихо превращается в реальную статью расходов. Направляйте мультимодальную работу во Flash, переключайтесь на старшую модель при сбое и проверьте, какова ваша фактическая частота эскалации, прежде чем предполагать, что она высока.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно