
Claude Haiku 5.5 vs GLM 5.3 Flash: абсолютно равны в бенчмарке, на который ссылаются оба вендора
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Прогоните Claude Haiku 5.5 и GLM 5.3 Flash через Terminal Bench 4.0 — и получите одно и то же число: 0.32828 для обоих. Не близкое — идентичное, до пяти знаков после запятой, на бенчмарке, который вендор ставит во главу угла в своих собственных материалах к запуску и который также стоит во главе угла в материалах к запуску Z.ai. Для двух моделей, построенных на совершенно разных стеках, вендорами из разных стран, выпущенных с разницей в шесть недель, это совпадение, на котором стоит остановиться.
К тому же это не тот показатель, по которому следует принимать решение. Везде в остальном эти две модели резко расходятся, и сам характер этого расхождения настолько необычен, что он должен изменить ваше восприятие громких заявлений любого из двух поставщиков. Одна из них выигрывает по составному индексу и показателю стоимости за задачу. Другая выигрывает почти во всём, что похоже на реальное развёртывание.
Они разделены не по способности. Они разделены по форме.
Начните с того единственного числа, которое говорит: «это один и тот же класс моделей».
• SciCode — 0,5498 у Claude Haiku 5.5 против 0,5162 у GLM 5.3 Flash. Два очка в пользу Anthropic на бенчмарке, где два очка — это шум.
• Terminal Bench 4.0 — 0.32828 против 0.32828. Ровно ничья.
• Контекстное окно — один миллион токенов для обоих.
• Цена вывода, первый уровень — $0,50 за миллион токенов для обоих.
Четыре строки, четыре почти совпадения. Если бы вы на этом остановились, вы бы решили, что эти модели взаимозаменяемы, и выбрали бы по цене. Этот вывод был бы неверным, и следующий набор строк показывает, почему.
Там, где они расходятся, направление остаётся неизменным.
Строки, которые действительно их разделяют, не разбросаны. Они образуют две группы, и каждая модель безраздельно владеет одной группой.
Агентная группа принадлежит GLM 5.3 Flash. Частичный балл AutomationBench составляет 0,6037 у GLM 5.3 Flash против 0,3541 у Claude Haiku 5.5 — разрыв в 25 пунктов, наибольшее единичное различие между этими двумя моделями по любому общему измерению. Tau-Bench Banking показывает 0,4722 у GLM 5.3 Flash; у Claude Haiku 5.5 нет опубликованного показателя по этой строке. GPQA показывает 0,9121 у GLM 5.3 Flash; и снова нет данных Anthropic для сравнения. По показателям того, способна ли модель удерживать многошаговую задачу и надёжно использовать инструменты внутри структурированной предметной области, модель Z.ai впереди с отрывом, который затмевает разницу в сводном индексе, идущую в обратную сторону.
Группа совокупных показателей и стоимости принадлежит Claude Haiku 5.5.Индекс интеллекта Artificial Analysis v4.3.2 показывает 43,40 против 41,81 — 1,59 пункта, и именно эту цифру приводит каждое резюме этого противостояния. Стоимость одной завершённой задачи Index составляет $0,21 против $0,25. Фактическое время на одну задачу Index — 424,6 секунды против 1 035,4 секунды: модель Anthropic справляется менее чем за половину этого времени.
Такова суть этого выбора. Claude Haiku 5.5 быстрее, дешевле в расчёте на завершённую задачу и выше по совокупному показателю. GLM 5.3 Flash надёжнее в том конкретном классе работы, ради которого и покупают дешёвые модели.

Какому из них верить?
Ни то, ни другое само по себе — а само разногласие и есть информация.
Индекс интеллекта — это взвешенная комбинация показателей в категориях рассуждения, науки, программирования и агентных задач. Он предназначен для того, чтобы ответить на вопрос «примерно насколько эта модель способна» одним числом, и он с этой задачей справляется. Чего он не может — так это сказать, идёт ли преимущество в 1,59 пункта из категорий, к которым относится ваша рабочая нагрузка, или из тех, которых она никогда не касается. Здесь преимущество в значительной степени обусловлено такими строками, как SciCode и Humanity's Last Exam — 0,5498 против 0,5162 и 0,4439 против 0,3985 — тогда как отставание в 25 пунктов приходится на AutomationBench и имеет противоположный знак.
Команда, которая создаёт ассистента для программирования в терминальном цикле, заметит преимущество SciCode. Команда, которая создаёт агента, обязанного выполнять банковский рабочий процесс от начала до конца, заметит разрыв AutomationBench — и будет замечать его каждый божий день. Эти две команды смотрят на один и тот же индекс и должны прийти к противоположным выводам.
Практический шаг — читать сводный показатель как фильтр, а не как рейтинг. Если две модели находятся в пределах примерно двух пунктов индекса, сводный показатель сообщил вам, что они в одном диапазоне, и не сказал ничего о том, какую из них выбрать. В этот момент единственные строки, которые стоит читать, — это те, что соответствуют вашей рабочей нагрузке; и если поставщик не опубликовал нужную вам строку, само её отсутствие — это точка данных, а не пробел, который нужно заполнить предположением.
Строка про токенизатор, которую никто не включает в таблицу сравнения
В собственной документации Anthropic есть одно предложение, которое меняет любое сравнение цен с участием Claude Haiku 5.5, и его легко пропустить при чтении. Модель использует более новый токенизатор, общий с Claude 4.7 и последующими версиями, который насчитывает в одном и том же тексте примерно на 30% больше токенов, чем модель, которую она заменяет.
Сопоставьте это с тарифной сеткой — и арифметика окажется менее лестной, чем предполагает ценник. Входная ставка Claude Haiku 5.5 составляет $0.10 за миллион токенов против $0.15 у GLM 5.3 Flash — преимущество в 1,5 раза. Если на тот же промпт уходит на 30% больше токенов, эффективное преимущество на идентичном тексте заметно сужается, хотя и не исчезает. Ставки за вывод идентичны — $0.50 в первом уровне, поэтому там эффект токенизатора действует без какой-либо компенсации.
Измеренный результат — это честная версия утверждения: по собственным подсчётам Artificial Analysis, Claude Haiku 5.5 сгенерировала 162 164 выходных токенов на задачу Индекса против 68 673 у GLM 5.3 Flash — в 2,4 раза больше — и всё же обошлась в $0,21 за завершённую задачу против $0,25. Преимущество в стоимости сохраняется, несмотря на многословность, и то, что от него осталось, меньше, чем указано в тарифной сетке.
Только у одного из этих двух ставки указаны как фиксированные. Цена Claude Haiku 5.5 повышается после 100 000 токенов промпта до $0.50 за ввод и $2.50 за вывод; у GLM 5.3 Flash аналогичный порог не опубликован. Для большинства чатов и трафика с помощью по коду этот скачок никогда не срабатывает. Для работы с длинными документами или агентных задач с большим контекстом он срабатывает постоянно, и в этот момент сравнение меняется на противоположное — гораздо сильнее, чем предполагают цифры первого уровня.

Линия, которая решает всё раньше, чем это сделают любые числа.
Всё вышесказанное предполагает, что вы можете свободно выбирать между этими двумя моделями. Большая часть команд не может, и причина — одна строка в таблице характеристик, которую обсуждение бенчмарков обычно замалчивает.
GLM 5.3 Flash — открытые веса, выпущена под лицензией MIT, имеет 320 млрд общих параметров при 18 млрд активных. Её можно скачать, развернуть самостоятельно, дообучить, квантовать, закрепить на версии и запускать внутри тенанта, который вы контролируете. Claude Haiku 5.5 — проприетарная и доступна только через API, без опубликованного количества параметров, без лицензии и без репозитория.
Если в вашем документе с требованиями сказано, что модель должна работать на вашем собственном оборудовании, или что конкретный чекпойнт должен оставаться доступным для вызова в течение следующих трёх лет, это сравнение закончено ещё до того, как будет прочитана колонка с ценой. Это не формальность. Это самая распространённая причина, по которой команды вообще оказываются на модели среднего уровня с открытыми весами, и это причина, по которой преимущество в 25 баллов на AutomationBench — не единственное, что тянет в сторону Z.ai.
Это работает и в обратную сторону, и та же честность применима здесь. Anthropic публикует обязательство не выводить Claude Haiku 5.5 из эксплуатации ранее октября 2027 года и поддерживает модель в собственном API, располагая системной картой и документированным набором оценок. Выпуск с открытыми весами не становится автоматически более долговечным — вместе с весами вы наследуете и операционную нагрузку, а файл лицензии — не договор поддержки. Что из этих двух вариантов вам нужен — вопрос о вашей команде, а не о моделях.
Обе стороны на одну клавишу, если хочешь решить это эмпирически
GLM 5.3 Flash присутствует в каталоге OrcaRouter по прейскурантной цене Z.ai с наценкой 0%, передаётся напрямую, а не усредняется, поэтому указанный выше тариф — это тариф в счёте, и любые изменения, которые вносит Z.ai, отражаются на нашей стороне в тот же день. Claude Haiku 5.5 отсутствует в нашем каталоге — до него можно добраться через собственный API Anthropic — и лучше заявить об этом прямо, чем оставлять это подразумеваемым.
Что каталог действительно упрощает — так это форму теста, которую на самом деле требует это сопоставление. Расхождение между составным индексом и агентными строками — это гипотеза о вашейрабочей нагрузке, и единственный способ её разрешить — прогнать обе модели на одном и том же трейсе. Когда GLM 5.3 Flash стоит на маршруте, а на другой стороне того же шлюза — плечо Anthropic, это превращается в изменение конфигурации, а не в две интеграции — один API для более чем 200 моделей, один ключ, автоматическое переключение при отказе под капотом, и DSL маршрутизации, когда нужно разделить трафик по классам задач и увидеть затраты в едином счёте.

Вердикт, изложенный так, как его подтверждают цифры.
Если ваша работа — это текст на входе и текст на выходе, ваши промпты остаются в пределах первого ценового уровня, и вы платите за токены при реальных объёмах, то Claude Haiku 5.5 здесь лучшая модель: выше сводный показатель, дешевле за завершённую задачу и более чем вдвое быстрее на задачу. Главный показатель terminal-benchmark ничего не решает, и его не следует использовать, чтобы что-либо определить.
Если ваша работа — это агент, который должен выполнять задачу без надзора, GLM 5.3 Flash опережает по метрике, измеряющей именно это, и из двух его дешевле модифицировать, поскольку веса доступны.
Ничья на 0,32828 — это подходящий образ для данной пары, но не потому, что модели равны. Это единственная строка, где две модели, у которых почти нет ничего общего, случайно попадают на одну и ту же цифру, — и то, что эту цифру принимают за итог сравнения, и есть способ принять закупочное решение на основе наименее информативного числа в таблице.
