Сгенерированная hero-карточка с заголовком «Claude Haiku 5.5 против Qwen3.8 27B» и надзаголовком «ОТКРЫТЫЕ ВЕСА ПРОТИВ API», где Claude Haiku 5.5 показан с ценой за ввод $0.10, за вывод $0.50 и индексом 43.40 против Qwen3.8 27B с ценой за ввод $0.50, за вывод $3.00 и индексом 33.70, а над полосой указано «Стоимость за выполненную задачу $0.21 против $1.01».
Engineering & Research

Claude Haiku 5.5 против Qwen3.8 27B: чистая победа в API и почему открытые веса всё ещё существуют

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Большинство сравнений в этой серии сводятся к компромиссу. Это — нет, и само отсутствие компромисса и есть вывод. Claude Haiku 5.5Выпущенная 7 октября 2026 годаQwen3.8 27B — открытую 27B плотную модель с открытыми весами от 14 августа 2026 года — по составному показателю интеллекта, по стоимости за токен, по стоимости за выполненную задачу, по контекстному окну, по предельному объёму ответа, по агентному программированию и по строкам научных рассуждений, и делает это через единственный проприетарный API, не требующий аппаратного обеспечения. Единственная строка, в которой Qwen3.8 27B одерживает безоговорочную победу, — это видеовход, а вторая — лицензия.

Это не повод списывать модель со счетов, потому что лицензия Apache-2.0 и видеомодальность — не утешительные призы. Это повод точно сформулировать, почему кто-то вообще выбрал бы сторону открытых весов, и перестать делать вид, что спор идёт о бенчмарках.

Числа, на которых фактически запускались обе модели

За миллион токенов в долларах США. Тарифы поставщика взяты из его собственной документации по ценам; общие измерения — это Artificial Analysis Intelligence Index v4.3.2, снятые 2026-10-08, причём оба в их конфигурации с наивысшим опубликованным уровнем усилий.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• Ввод — Claude Haiku 5.5: $0,10 до 100 000 токенов и $0,50 свыше; Qwen3.8 27B — $0,50 по зафиксированному советом тарифу третьей стороны.

• Вывод — Claude Haiku 5.5 $0.50 до 100 000 и $2.50 свыше; Qwen3.8 27B $3.00.

• Кэшированный ввод — Claude Haiku 5.5: $0,01 и $0,05, скидка 90%; Qwen3.8 27B: $0,10, скидка 80%.

• Независимая оценка — 43,40 у Claude Haiku 5.5 (Max) против 33,70 у Qwen3.8 27B (Xhigh). Разрыв в 9,70 балла — самый широкий в этой партии.

• Стоимость за завершённую задачу — $0,21 против $1,01, в одном и том же прогоне оценки. Разрыв в 4,7 раза, к тому же самый широкий здесь.

• Контекст и вывод — 1 млн токенов и ограничение ответа в 128 000 токенов для Claude Haiku 5.5; контекст в 256 тыс. токенов для Qwen3.8 27B.

• Модальность — обе принимают текст и изображения и возвращают текст. Qwen3.8 27B добавляет ввод видео; Claude Haiku 5.5 — нет.

• Веса — Qwen3.8 27B — это 27B плотных параметров под лицензией Apache 2.0, доступна для скачивания. Claude Haiku 5.5 — проприетарная модель, доступная только через API.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

Почему разрыв в расчёте на задачу в четыре раза превышает разрыв в расчёте на токен

В тарифной карточке уже видно 5-кратное различие по входу и 6-кратное по выходу в пользу поставщика, так что направление не вызывает сомнений. Что стоит отметить, так это то, что показатель на задачу меньше, чем показатель на токен, что противоположно тому, что произошло в других сопоставлениях этого пакета, и причина поучительна.

Claude Haiku 5.5 выдаёт 162 164 токена вывода на задачу Intelligence Index — 129 047 на рассуждения и 33 118 на ответ. Qwen3.8 27B выдаёт 66 797, из них 47 711 на рассуждения и 19 087 на ответ. Модель поставщика расходует в 2,4 раза больше токенов на задачу, поэтому её 6-кратное преимущество по скорости вывода сжимается до 4,7-кратного преимущества на задачу. Оно всё ещё огромно. Просто это не то число, которое рекламирует тарифная карта.

Математика смеси — более наглядный способ увидеть её пропорции. При смеси 7:2:1 с преобладанием входных данных — именно такое соотношение чаще всего встречается в реальном продакшен-трафике — Claude Haiku 5.5 обходится в $0,077 за миллион токенов против $0,470 у Qwen3.8 27B. При сбалансированной смеси 1:1 это $0,30 против $1,75. Единственное, что когда-либо закрывает этот разрыв, — это порог вендора в 100 000 токенов: после него тарифы Claude Haiku 5.5 становятся $0,50 и $2,50 на весь запрос, и две модели сходятся примерно на одной цене — и тогда вы ни за что переплачиваете ради преимущества в 9,7 пункта по оценке.

Где карта поставщика и независимый совет расходятся

Это тот набор строк, на котором стоит задержаться, потому что собственная карточка модели Qwen3.8 27B выглядит значительно сильнее, чем независимые измерения, и именно из-за этого различия утверждение «модель на 27B, сопоставимая с гораздо более крупными» нуждается во втором источнике.

Опубликованные самим вендором цифры, как они зафиксированы на нашей странице каталога для этой модели, включают 90,3 в LiveCodeBench v6, 89,2 в GPQA Diamond, 84,3 в OSWorld-Verified и 79,0 в QwenSWEBench. Они сообщены вендором и не воспроизведены, и они описывают модель, которая конкурентоспособна значительно выше своего весового класса.

В независимом прогоне Artificial Analysis Qwen3.8 27B набирает 0,0556 в Terminal-Bench 4.0, 0,4664 в SciCode, 0,3392 в Humanity's Last Exam и 1423,21 в GDPval-AA v2.1. Поставьте 0,0556 рядом с 84,3, которые карточка вендора указывает для OSWorld, и характер расхождения становится ясен: в агентной работе с компьютерами и терминалами независимый лидерборд помещает эту модель примерно туда, где и должна находиться плотная 27B-модель, а карточка вендора — нет.

Две строки, впрочем, указывают в другую сторону, и о них стоит сказать по той же причине. Qwen3.8 27B набирает 0,4824 в AutomationBench против 0,3541 у Claude Haiku 5.5 — независимая победа с отрывом в 12,8 пункта на самом близком к бенчмарку бизнес-автоматизации из того, что есть у любой из этих таблиц. Это реальная цифра из того же прогона, в строке, наиболее близкой к тому, для чего люди на самом деле развёртывают малые модели.

Честное прочтение таково: дело не в том, что «вендор всё завысил». Дело в том, что карточка модели измеряет задачи, выбранные её авторами, независимый совет измеряет фиксированный набор, а сильные стороны Qwen3.8 27B есть в списке вендора и отсутствуют в списке совета.

Экономика меняется, когда вы владеете оборудованием

Все тарифы, приведённые выше, — это цены API, а для Qwen3.8 27B это неверная система отсчёта.

Это плотная модель на 27B под лицензией Apache 2.0. Она помещается на одном современном ускорителе при квантовании, которое устроило бы большинство команд, а значит, предельная стоимость токена перестаёт быть счётчиком вендора и начинает определяться вашей собственной загрузкой. Именно поэтому цена за вызов различается в зависимости от хоста так, как не могла бы ни одна из проприетарных моделей в этом сравнении: в таблице указана сторонняя ставка $0.50 за вход и $3.00 за выход, а в каталоге OrcaRouter она идёт по $0.33 за вход и $2.40 за выход, причём строки за чтение из кэша нет вообще, потому что мы запускаем веса на собственной инфраструктуре, а не перепродаём чей-то эндпоинт.

Для команды, которая уже платит за GPU, сравнение — это не $0,21 против $1,01 за задачу. Это тариф, выставленный вендором, против приростной стоимости запроса на оборудовании, которым вы владеете, и это разные числа. Это аргумент в пользу лагеря открытых весов, и единственный, который выдерживает столкновение с таблицей бенчмарков.

Есть второе, менее очевидное следствие того, что лицензия — Apache 2.0: модель можно поставлять в составе продукта, дообучать на собственном трафике, фиксировать на определённой ревизии и проверять вплоть до весов. Ничего из этого ни за какую цену не доступно от проприетарной модели, доступной только через API, а для регулируемых рабочих нагрузок это часто становится решающим ограничением, а не предпочтением.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Вызов любого из них

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 отсутствует в каталоге. До него можно добраться напрямую через API вендора, а также через AWS, Azure и основные облачные платформы — и это будет точной формулировкой. Что действительно есть в каталоге из линейки вендора — этоClaude Sonnet 5.5 и Claude Opus 5.5, что превращает переход с самостоятельно размещённой небольшой модели на размещённую агентную модель среднего уровня в изменение маршрутизации, а не во вторую интеграцию — автоматическое переключение при сбое так или иначе лежит в его основе.

Вердикт, который необычно однобокий

Как API-вызов для текста или изображений, Claude Haiku 5.5 побеждает в этом сравнении по каждой строке, не связанной с лицензированием. Девять целых семь десятых индексного пункта, в 4,7 раза дешевле за выполненную задачу, в четыре раза большее контекстное окно, вдвое больший потолок ответа и в пять-шесть раз более низкий ценник в режиме коротких промптов. Нет никакого аргумента о форме рабочей нагрузки, который спасает Qwen3.8 27B по цене, потому что недостаток поставщика — интенсивное использование выходных токенов — стоит гораздо меньше, чем его преимущество в тарифе.

Спасает всё то, что цена API не отражает: лицензия, допускающая распространение, веса, которые можно хранить у себя и фиксировать, видеовход и путь самостоятельного хостинга, где стоимость за токен — это ваше собственное железо, а не карта поставщика. Если вы ищете самый дешёвый способ классифицировать, извлекать, суммировать и маршрутизировать текст, ответ — Claude Haiku 5.5, и отрыв от остальных огромен. Если же вы ищете модель, которую можно встроить в собственный продукт, развернуть на собственном железе и под собственным аудитом, то вопрос о разнице в бенчмарках перестал быть главным уже несколько абзацев назад.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно