Сгенерированная титульная карточка для «Claude Haiku 5.5 против GLM-5.3-FlashX — платить в 2,5 раза больше за те же веса», на которой два названия моделей расположены по обе стороны от разделителя, а подпись — «Две модели среднего ценового сегмента, четыре тарифные карты, один порог 100K», с нижним колонтитулом «Цены из прайс-листов Anthropic и Z.ai, октябрь 2026 г.» Настоящий логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Claude Haiku 5.5 против GLM-5.3-FlashX: платить в 2,5 раза больше за те же веса — и стоит ли оно того

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое полезное, что стоит знать о GLM-5.3-FlashX перед сравнением с Claude Haiku 5.5, — это то, что она работает на тех же весах, что и GLM-5.3-Flash, а её вызов стоит в 2,5 раза дороже. Z​.ai запустила FlashX через собственный API 18 сентября 2026 года по цене $0.37 за миллион входных токенов и $1.25 за миллион выходных токенов — против $0.15 и $0.50 у базовой модели, из которой она получена. В самой модели ничего не изменилось; изменилось то, где она работает и насколько быстро обещают обеспечить её работу там. Понимание этой связки — вот что здесь главное, потому что это означает, что перед нами не сравнение двух уровней возможностей, а сравнение ценового уровня и уровня обслуживания, и Haiku 5.5 оказывается в середине этого спора, подходя к нему с совершенно другой стороны.

Две модели, четыре цены, один порог

Выстройте четыре соответствующие тарифные карты в ряд — и контуры решения проступят яснее, чем при сравнении любой отдельной пары:

• Claude Haiku 5.5, до 100 000 токенов — $0,10 за миллион входных токенов, $0,50 за миллион выходных токенов (прайс-лист Anthropic)

• Claude Haiku 5.5, более 100 000 токенов — $0,50 за ввод, $2,50 за вывод за миллион (прайс-лист Anthropic)

• GLM-5.3-Flash — $0.15 за вход, $0.50 за выход за миллион (прайс-лист Z.ai)

• GLM-5.3-FlashX — $0,37 за ввод, $1,25 за вывод за миллион (список Z​.ai)

• Контекст — 1 миллион токенов на всех четырёх (по данным производителя)

• Открытые веса — GLM-5.3-Flash и FlashX наследуют веса базовой модели под лицензией MIT; Claude Haiku 5.5 — закрытая модель (публикуется производителем)

• Независимая оценка — GLM-5.3-Flash показал 41.807 балла в Artificial Analysis Intelligence Index; у Claude Haiku 5.5 — 43.395 (Artificial Analysis)

Первое, что бросается в глаза, — цена FlashX почти в точности совпадает с тарифом Claude Haiku 5.5 для длинного контекста: $0,37 против $0,50 на входе, $1,25 против $2,50 на выходе. Это не случайность рынка; именно столько стоит тариф обслуживания, когда лежащая в основе модель относится к среднему классу, а поставщик берёт плату за пропускную способность, а не за возможности. Второе: GLM-5.3-FlashX — это дорогая версия модели; новый Haiku от Anthropic дешевле её при коротком контексте и сопоставим с ней при длинном. Третье: все четыре числа укладываются в пятикратный разброс друг относительно друга, а это гораздо более узкий диапазон, чем подразумевает трактовка «дешёвая модель против дорогой модели» в большинстве прямых сравнений.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GLM-5.3-FlashX — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, input price (over 100K) $0.50 per million. Right column GLM-5.3-FlashX: input price $0.37 per million, output price $1.25 per million, and a serving-premium row. A footer labels the sources. The real OrcaRouter logo is composited bottom-right.

Что такое FlashX на самом деле

GLM-5.3-FlashX — не новая модель. Это GLM-5.3-Flash, обслуживаемая на собственной инфраструктуре Z​.ai, с заявленной пиковой скоростью до 200 выходных токенов в секунду по сравнению с измеренной скоростью базовой модели и ценой в 2,5 раза выше каталожной цены базовой модели. Предложение Z​.ai простое: те же ответы, но больше их в секунду, и вы платите за обслуживание, а не за веса. Для нагрузки, ограниченной пропускной способностью — пакетной классификации, извлечения больших объёмов данных, всего, где ограничением является задержка, а не стоимость, — это логично и продавать, и покупать.

Что это не так — так это не апгрейд возможностей, и ценообразование честно это отражает: если бы FlashX была лучшей моделью, Z​.ai не смогла бы брать плату за веса базовой модели отдельно. Множитель 2,5 — это надбавка за обслуживание. Стоит ли за это платить — вопрос о том, что является узким местом вашей рабочей нагрузки, и для конвейера, ограниченного задержкой, ответ будет иным, чем для конвейера, ограниченного стоимостью.

На момент написания у Artificial Analysis нет отдельной страницы для FlashX, и об этом стоит сказать прямо, а не замалчивать: независимый показатель, публикуемый в рейтинге для GLM-5.3-Flash — 41,807 в Intelligence Index, 52,14 выходных токена в секунду (измерено), 0,328 в Terminal-Bench Hard — это показатель для базовой модели, а не для версии, обслуживаемой в 2,5 раза быстрее. Собственное заявление вендора о пропускной способности FlashX — это пиковый показатель, и он приводится со слов вендора. Никто из независимых не публиковал данных о пропускной способности самого FlashX, поэтому любое сравнение измеренной скорости Haiku 5.5 со скоростью FlashX — это сравнение с числом, которое Z.ai сообщила о собственном обслуживании.

Множитель 2,5x от Z.ai — не единственное, что делает FlashX дорогим по сравнению с его базой. Поскольку базовые веса лицензированы по MIT и размещаются у третьих сторон, рабочая нагрузка, которой действительно нужна пропускная способность больше, чем обеспечивает эндпоинт одного поставщика, часто может получить её, распределившись между несколькими поставщиками тех же весов по базовой цене или рядом с ней, вместо того чтобы платить за премиальный уровень одного поставщика. Это реальная альтернатива, с которой конкурирует тарифная сетка FlashX, и Z.ai это знает — вероятно, поэтому в презентации делается упор на пиковую пропускную способность, а не на уникальность.

A screenshot of Z.ai's documentation pricing page, showing the API pricing table for the GLM model line with per-million input and output rates, captured in English.

Где расходятся пути Haiku 5.5 и FlashX

Сопоставьте эти две по параметрам, которые определяют реальную рабочую нагрузку, и расхождение окажется достаточно чётким, чтобы на его основе сделать выбор:

• Цена при контексте менее 100K — Haiku 5.5 $0.10 / $0.50 против FlashX $0.37 / $1.25; Haiku выигрывает по обоим показателям

• Цена за контекст свыше 100K — Haiku 5.5 $0.50 / $2.50 против FlashX $0.37 / $1.25; FlashX выигрывает по обоим показателям

• Пропускная способность — заявленный производителем пик 200 ток/с для FlashX против опубликованных Anthropic данных по обслуживанию для Haiku 5.5, где подобный пик не заявлен

• Независимый индекс — Haiku 5.5 43.395 против GLM-5.3-Flash 41.807 (Artificial Analysis; независимой оценки для самого FlashX нет)

• Веса — FlashX наследует открытые веса под лицензией MIT; Haiku 5.5 закрыта и доступна только через API

• Самостоятельный хостинг — возможен для FlashX благодаря открытым весам; невозможен для Haiku 5.5

• Набор функций инструментов/агентов — регулируемая шкала усилий в Haiku 5.5, отсутствует в линейке G​LM Flash

Интересная ячейка — вторая. Claude Haiku 5.5 — это модель, которая при коротких запросах в пять раз дешевле GLM-5.3-FlashX и немного дороже GLM-5.3-FlashX при длинных, потому что цена Haiku по прайс-листу увеличивается в 5 раз при 100 000 токенов, тогда как FlashX берёт единую ставку. Если ваш трафик в основном короткий, Haiku — очевидный выбор уже только по цене. Если в основном длинный, FlashX вообще не конкурирует с ценой короткого тарифа Haiku — он конкурирует с длинным тарифом Haiku и выигрывает это сравнение примерно на треть.

Сравнение возможностей оказывается более близким, чем хотелось бы обоим поставщикам. 41.807 против 43.395 по одному и тому же независимому индексу — это разрыв менее четырёх процентов, вполне в пределах погрешности большинства оценок на уровне приложений и слишком малый, чтобы на его основании делать выбор. Ни одна из моделей не превосходит другую в общих рассуждениях; решение принимается по тарифной сетке и пропускной способности, а не по тому, какая из них умнее.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', showing an Intelligence Index of 43.395 and speed rank #10 of 182, with the cost comparison block reading $0.10 input.

Разница в лицензии — это реальное различие

То, что FlashX изначально имеет открытые веса, по одному критерию важнее разрыва в цене: его можно развернуть самостоятельно, и его может обслуживать кто угодно. Claude Haiku 5.5 не может ни того, ни другого. Для команды с требованием соответствия, чтобы инференс выполнялся на собственном оборудовании, или с достаточно стабильным объёмом, при котором амортизация GPU дешевле оплаты за токен, линейка GLM — единственная из двух, которая вообще отвечает на этот вопрос. Для всех остальных — большинства, которые хотят модель за API и предпочли бы не запускать сервинг-слой, — лицензия — это сноска, а цена — аргумент.

Это также означает, что у двух моделей разные режимы отказов, когда у провайдера чёрный день. Закрытая модель, обслуживаемая только своим вендором и облачными партнёрами этого вендора, падает, когда падают они. Открытую модель с несколькими независимыми хостами можно переключать между ними при отказе — при условии, что нечто выполняет это переключение. Это реальное операционное различие, и это как раз то, что проявляется только в тот день, когда это действительно важно.

Маршрутизация обоих без второго контракта

Если решение выше не сводится к одному победителю для вашего трафика — а обычно так и происходит, ведь две модели обыгрывают друг друга на разных половинах прайс-листа, — практический вопрос в том, как запустить обе, не поддерживая две интеграции. OrcaRouter предоставляет z-ai/glm-5.3-flash по $0,15 и $0,50 за миллион по прайс-листу вендора, а также qwen/qwen3.8-flash и остальной каталог из более чем 200 моделей — на одном ключе и одном счёте. Изменение цен Anthropic на Claude Haiku 5.5 или Z.ai на линейку Flash передаётся без наценки в тот же день, а не с отставанием от собственного тарифного листа реселлера, так что приведённые выше цифры остаются теми, что вы действительно платите.

Мы не обслуживаем Claude Haiku 5.5 и не обслуживаем GLM-5.3-FlashX — ни той, ни другой нет в нашем каталоге; для них обращайтесь напрямую в A​nthropic и Z​.ai. А обслуживаем мы GLM-5.3-Flash — базовую модель, лежащую в основе FlashX, и это верный выбор для множества рабочих нагрузок, где 2,5-кратная наценка за обслуживание покупает пропускную способность, о которой никто не просил. Там, где производственный путь действительно зависит от одной из двух моделей, которые мы не хостим, наш механизм переключения при отказе — это способ попробовать её, не ставя на неё весь путь: направьте запрос на неё, оставьте рабочую модель в качестве резерва и позвольте слою маршрутизации решить, какая из них ответит.

Какой выбрать?

При объёме менее 100 000 токенов на запрос Claude Haiku 5.5 выигрывает по цене и достаточно близок к FlashX по возможностям, так что выбор очевиден. При объёме более 100 000 токенов GLM-5.3-FlashX дешевле, чем тариф Claude Haiku 5.5 для длинного контекста, и именно эту модель стоит выбирать, если размер запроса определяется задачей, а не выбором, — хотя базовая GLM-5.3-Flash ещё дешевле, и единственная причина платить в 2,5 раза больше — если вам конкретно нужна заявленная пропускная способность FlashX.

Отбросить нужно представление, будто один из них — это бюджетный вариант, а другой — производительный. Оба они — модели среднего ценового сегмента с фиксированными, широко опубликованными тарифными сетками, и интересная переменная здесь не в том, какой из них лучше, а в том, для какой половины вашего трафика каждый из них дешевле. Сначала получите распределение размеров ваших запросов; приведённое выше сравнение цен в двух столбцах подскажет вам остальное.

каталог из более чем 200 моделей

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно