
GLM 5.3 Prime vs GLM-5.3-Flash: 18-кратный разрыв в цене между двумя разными моделями
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Вот сравнение в одну строку для всех, кто пришёл с уже наполовину принятым решением о покупке: GLM 5.3 Prime — это GLM-5.3, чьи флагманские веса продаются через ускоренный уровень обслуживания по цене $2.80 и $8.80 за миллион токенов, а GLM-5.3-Flash — это отдельная нативно мультимодальная модель с собственными открытыми весами по цене $0.15 и $0.50. Разница между ними — примерно в восемнадцать раз как на входе, так и на выходе. Это не разница в уровне — это другая модель на другой позиции в семействе, и единственная причина, по которой эти два названия стоят рядом друг с другом в списке моделей, — то, что оба появились в пределах шести недель друг от друга.
Ошибиться здесь дорого в обе стороны. Если считать Flash дешёвой версией Prime, вы удивитесь, чего он не умеет. Если считать Prime более быстрым Flash, вы переплатите в восемнадцать раз за модель, которая не способна увидеть изображение.
Начните с того, чем каждое из них на самом деле является
GLM-5.3-Flash — это мультимодальная смесь экспертов на 320 миллиардов параметров, из которых активны 18 миллиардов, выпущенная 26 августа 2026 года под лицензией MIT, а её веса доступны на Hugging Face и ModelScope. Она нативно принимает текст, изображения, видео и файлы в одном запросе, имеет контекстное окно в 1 000 000 токенов и предельный объём вывода в 128 000 токенов, а также была предобучена отдельно, а не дистиллирована из флагманской модели. Её гибридная схема внимания, сочетающая линейное и разреженное внимание, сокращает вычисления для внимания примерно втрое и уменьшает KV-кэш более чем в четыре раза по сравнению с GLM-5.3 — и именно на архитектурном уровне, а не за счёт скидки, кроется источник её преимущества по стоимости.
GLM 5.3 Prime — это GLM-5.3 — разреженная смесь экспертов с 40 миллиардами активных параметров, анонсированная 14 августа 2026 года, появившаяся в API с 18 августа, с открытием весов 25 августа, — обслуживается через высокоскоростной канал. Тот же контекст в 1 000 000 токенов, тот же потолок вывода в 131 072 токена, текст на входе и текст на выходе, обязательное рассуждение на низком, высоком или максимальном уровне усилий, причём максимальный используется по умолчанию. В собственной документации Z.ai Prime SKU не указан; этот уровень существует на сторонней платформе, которая называет одного вышестоящего провайдера, стоящего за ним.
Табло

• Цена — GLM 5.3 Prime $2,80 / $8,80 за 1 млн токенов против GLM-5.3-Flash $0,15 / $0,50 за 1 млн токенов
• Кэшированный ввод — $0,56 за 1 млн токенов против $0,03 за 1 млн токенов
• Множитель — примерно 18× на вводе и выводе, до какого-либо кэширования
• Модальность — только текст против текста, изображений, видео и файлов на входе
• Параметры — 40B активных параметров у флагманской MoE против 320B общих / 18B активных
• Веса — открытые, по специальной лицензии с порогом выручки против MIT, доступны для скачивания уже сегодня
• Максимальный вывод — 131 072 токена против 128 000 токенов
• Контекст — 1 000 000 токенов у обоих
• Индекс интеллекта — GLM-5.3 набирает 45 баллов в индексе v4.3.2; GLM-5.3-Flash набирает 42
• Стоимость одной задачи в индексе — $2,01 для флагмана против $0,25 для Flash
• Скорость — около 61 выходного токена в секунду против примерно 46, при этом оба показателя — независимо измеренные медианы
• Доступ по подписке — Prime не входит в Coding Plan от Z.ai; Flash входит, с квотой 3×
Две строки в том списке заслуживают большего, чем пункт маркированного списка. Первая — это разрыв в интеллекте: три пункта по Artificial Analysis Intelligence Index, 45 против 42, в редакции v4.3.2. Более ранняя редакция того же индекса оценивала эти модели в 60 и 57, и эта старая пара всё ещё широко фигурирует в материалах о запуске — не путайте эти две редакции, потому что числа не сопоставимы между редакциями. Три пункта — это узкий разрыв, который проявляется как чуть больший дрейф на очень длинных агентных цепочках и повышенная чувствительность к неоднозначным инструкциям, а не как иной класс модели.
Второй — скорость, и она переворачивает интуицию, которую создают названия. Flash оказывается медленнее из двух при независимом измерении — около 46 выходных токенов в секунду против 61 у флагмана, в классе, где среднее — 67. Flash оправдывает своё название ценой и мультимодальностью, а не задержкой. Это важно для сравнения, потому что обычная причина обратиться к маленькой модели — она отвечает быстрее, а здесь это не так.
Решение, которое действительно принимать именно вам
Поскольку две модели различаются сразу по трём осям — модальности, лицензии и цене, — выбор обычно решается по первой оси и вообще не доходит до арифметики. Flash читает изображения и видео; Prime не умеет читать ничего, кроме текста. Если ваша рабочая нагрузка касается скриншота, отсканированной страницы, снимка интерфейса или кадра видео, сравнение заканчивается ещё до того, как в дело вступает цена, и вы покупаете Flash.
Если ваша рабочая нагрузка — исключительно текст, а вопрос действительно о качестве, честный ответ таков: разрыв в три пункта по индексу — это всё, что вы покупаете за 18×. Стоит ли это того, полностью зависит от того, можете ли вы проверить результат. Там, где ответ можно проверить — код, который компилируется, запрос, возвращающий строки, структурированное извлечение, проходящее валидацию по схеме, — случайный промах Flash дёшево поймать и дёшево повторить, а за одну восемнадцатую цены вы можете повторять очень много раз. Там, где результат — это текст, который должен оценивать человек, или длинный многошаговый план без промежуточной проверки, разрыв труднее компенсировать, и доплату легче оправдать.
Где открытые веса меняют математику
Flash распространяется под лицензией MIT, а его самая компактная пригодная для использования квантизация требует порядка 93 ГБ памяти ускорителя — это один узел с большим объёмом памяти для многих команд и погрешность округления в счёте для некоторых. GLM-5.3 поставляется со специальной лицензией, которая требует, чтобы крупные операторы model-as-a-service с доходом выше определённого порога проходили проверку безопасности, а его минимальная практичная квантизация составляет около 217 ГБ, что для большинства означает развёртывание на нескольких узлах.
Эта асимметрия означает, что реальное сравнение для команды с большими объёмами — это не $8.80 у Prime против $0.50 у Flash. Это $8.80 у Prime против вашей собственной амортизированной стоимости за миллион выходных токенов на оборудовании, которое у вас уже есть, при работе с весами, которые можно скачать сегодня без разговоров о лицензии. Для команды, у которой есть оборудование и объёмы, это число часто оказывается наименьшим из трёх, и оно доступно только на стороне Flash в этом сравнении.
Покупая оба, и покупая их вместе

Большинству продакшен-систем не нужно выбирать. Паттерн, который подходит этой паре, — это маршрутизатор: Flash на пути по умолчанию для текстовой и мультимодальной работы, флагман — при эскалации, когда задача долгосрочная или первая попытка не прошла проверку. Это два ID моделей и одна функция принятия решений, и цена немного ошибиться в этом разделении — несколько центов на тысячу запросов, а не архитектурная проблема.
Мы размещаем GLM-5.3-Flash по $0.07 и $0.25 за миллион токенов — ниже собственного прайса вендора в $0.15 и $0.50 — а GLM-5.3 по прайсовой ставке провайдера $1.40 и $4.40, причём оба — с нулевой наценкой с нашей стороны — прайс провайдера передаётся как есть, а не переоценивается, поэтому изменение тарифа вендора отражается на нашей стороне в тот же день, когда и на их. Оба идентификатора доступны по одному ключу наряду с более чем 200 другими моделями, что превращает переход с Flash на флагманскую модель в смену названия модели внутри одного пути вызова, а не во вторую интеграцию. Автоматическое переключение при сбое покрывает случай, когда единственный вышестоящий провайдер за быстрым тарифом деградирует, а для такого тарифа, как Prime, где указан ровно один поставщик, это не гипотетическая проблема.
Скажем прямо об ограничениях: OrcaRouter не хостит GLM 5.3 Prime, и мы также не хостим GLM-5.3-FlashX. Обе страницы моделей возвращают здесь 404. Если вам нужно ускорение Prime, вы приобретёте его на платформе, которая его продаёт.
Что мы бы вам на самом деле сказали

Если вы дочитали до этого места в поисках победителя, ответ таков: эта пара никогда не была состязанием. Flash побеждает по стоимости, по модальности, по лицензии и по возможности развёртывания, причём побеждает по всем четырём с большим отрывом. Единственное, что может предъявить флагман, — это три пункта в индексе и примерно на 15 больше выходных токенов в секунду, и за это он берёт в восемнадцать раз больше. Для подавляющего большинства текстовых рабочих нагрузок Flash — правильный выбор по умолчанию, и бремя доказательства лежит на дорогом варианте.
Место, где нужно быть осторожным, — это середина. Команда, которой нужно флагманское качество рассуждений на тексте и которая также должна читать изображения, в итоге будет запускать обе модели, и возникает соблазн направлять всё во флагманскую, потому что именно у неё есть репутация. Именно тогда 18× тихо превращается в реальную статью расходов. Направляйте мультимодальную работу во Flash, переключайтесь на старшую модель при сбое и проверьте, какова ваша фактическая частота эскалации, прежде чем предполагать, что она высока.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
