
Claude Haiku 5.5 против Qwen3.8 27B: чистая победа в API и почему открытые веса всё ещё существуют
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Большинство сравнений в этой серии сводятся к компромиссу. Это — нет, и само отсутствие компромисса и есть вывод. Claude Haiku 5.5Выпущенная 7 октября 2026 годаQwen3.8 27B — открытую 27B плотную модель с открытыми весами от 14 августа 2026 года — по составному показателю интеллекта, по стоимости за токен, по стоимости за выполненную задачу, по контекстному окну, по предельному объёму ответа, по агентному программированию и по строкам научных рассуждений, и делает это через единственный проприетарный API, не требующий аппаратного обеспечения. Единственная строка, в которой Qwen3.8 27B одерживает безоговорочную победу, — это видеовход, а вторая — лицензия.
Это не повод списывать модель со счетов, потому что лицензия Apache-2.0 и видеомодальность — не утешительные призы. Это повод точно сформулировать, почему кто-то вообще выбрал бы сторону открытых весов, и перестать делать вид, что спор идёт о бенчмарках.
Числа, на которых фактически запускались обе модели
За миллион токенов в долларах США. Тарифы поставщика взяты из его собственной документации по ценам; общие измерения — это Artificial Analysis Intelligence Index v4.3.2, снятые 2026-10-08, причём оба в их конфигурации с наивысшим опубликованным уровнем усилий.

• Ввод — Claude Haiku 5.5: $0,10 до 100 000 токенов и $0,50 свыше; Qwen3.8 27B — $0,50 по зафиксированному советом тарифу третьей стороны.
• Вывод — Claude Haiku 5.5 $0.50 до 100 000 и $2.50 свыше; Qwen3.8 27B $3.00.
• Кэшированный ввод — Claude Haiku 5.5: $0,01 и $0,05, скидка 90%; Qwen3.8 27B: $0,10, скидка 80%.
• Независимая оценка — 43,40 у Claude Haiku 5.5 (Max) против 33,70 у Qwen3.8 27B (Xhigh). Разрыв в 9,70 балла — самый широкий в этой партии.
• Стоимость за завершённую задачу — $0,21 против $1,01, в одном и том же прогоне оценки. Разрыв в 4,7 раза, к тому же самый широкий здесь.
• Контекст и вывод — 1 млн токенов и ограничение ответа в 128 000 токенов для Claude Haiku 5.5; контекст в 256 тыс. токенов для Qwen3.8 27B.
• Модальность — обе принимают текст и изображения и возвращают текст. Qwen3.8 27B добавляет ввод видео; Claude Haiku 5.5 — нет.
• Веса — Qwen3.8 27B — это 27B плотных параметров под лицензией Apache 2.0, доступна для скачивания. Claude Haiku 5.5 — проприетарная модель, доступная только через API.

Почему разрыв в расчёте на задачу в четыре раза превышает разрыв в расчёте на токен
В тарифной карточке уже видно 5-кратное различие по входу и 6-кратное по выходу в пользу поставщика, так что направление не вызывает сомнений. Что стоит отметить, так это то, что показатель на задачу меньше, чем показатель на токен, что противоположно тому, что произошло в других сопоставлениях этого пакета, и причина поучительна.
Claude Haiku 5.5 выдаёт 162 164 токена вывода на задачу Intelligence Index — 129 047 на рассуждения и 33 118 на ответ. Qwen3.8 27B выдаёт 66 797, из них 47 711 на рассуждения и 19 087 на ответ. Модель поставщика расходует в 2,4 раза больше токенов на задачу, поэтому её 6-кратное преимущество по скорости вывода сжимается до 4,7-кратного преимущества на задачу. Оно всё ещё огромно. Просто это не то число, которое рекламирует тарифная карта.
Математика смеси — более наглядный способ увидеть её пропорции. При смеси 7:2:1 с преобладанием входных данных — именно такое соотношение чаще всего встречается в реальном продакшен-трафике — Claude Haiku 5.5 обходится в $0,077 за миллион токенов против $0,470 у Qwen3.8 27B. При сбалансированной смеси 1:1 это $0,30 против $1,75. Единственное, что когда-либо закрывает этот разрыв, — это порог вендора в 100 000 токенов: после него тарифы Claude Haiku 5.5 становятся $0,50 и $2,50 на весь запрос, и две модели сходятся примерно на одной цене — и тогда вы ни за что переплачиваете ради преимущества в 9,7 пункта по оценке.
Где карта поставщика и независимый совет расходятся
Это тот набор строк, на котором стоит задержаться, потому что собственная карточка модели Qwen3.8 27B выглядит значительно сильнее, чем независимые измерения, и именно из-за этого различия утверждение «модель на 27B, сопоставимая с гораздо более крупными» нуждается во втором источнике.
Опубликованные самим вендором цифры, как они зафиксированы на нашей странице каталога для этой модели, включают 90,3 в LiveCodeBench v6, 89,2 в GPQA Diamond, 84,3 в OSWorld-Verified и 79,0 в QwenSWEBench. Они сообщены вендором и не воспроизведены, и они описывают модель, которая конкурентоспособна значительно выше своего весового класса.
В независимом прогоне Artificial Analysis Qwen3.8 27B набирает 0,0556 в Terminal-Bench 4.0, 0,4664 в SciCode, 0,3392 в Humanity's Last Exam и 1423,21 в GDPval-AA v2.1. Поставьте 0,0556 рядом с 84,3, которые карточка вендора указывает для OSWorld, и характер расхождения становится ясен: в агентной работе с компьютерами и терминалами независимый лидерборд помещает эту модель примерно туда, где и должна находиться плотная 27B-модель, а карточка вендора — нет.
Две строки, впрочем, указывают в другую сторону, и о них стоит сказать по той же причине. Qwen3.8 27B набирает 0,4824 в AutomationBench против 0,3541 у Claude Haiku 5.5 — независимая победа с отрывом в 12,8 пункта на самом близком к бенчмарку бизнес-автоматизации из того, что есть у любой из этих таблиц. Это реальная цифра из того же прогона, в строке, наиболее близкой к тому, для чего люди на самом деле развёртывают малые модели.
Честное прочтение таково: дело не в том, что «вендор всё завысил». Дело в том, что карточка модели измеряет задачи, выбранные её авторами, независимый совет измеряет фиксированный набор, а сильные стороны Qwen3.8 27B есть в списке вендора и отсутствуют в списке совета.
Экономика меняется, когда вы владеете оборудованием
Все тарифы, приведённые выше, — это цены API, а для Qwen3.8 27B это неверная система отсчёта.
Это плотная модель на 27B под лицензией Apache 2.0. Она помещается на одном современном ускорителе при квантовании, которое устроило бы большинство команд, а значит, предельная стоимость токена перестаёт быть счётчиком вендора и начинает определяться вашей собственной загрузкой. Именно поэтому цена за вызов различается в зависимости от хоста так, как не могла бы ни одна из проприетарных моделей в этом сравнении: в таблице указана сторонняя ставка $0.50 за вход и $3.00 за выход, а в каталоге OrcaRouter она идёт по $0.33 за вход и $2.40 за выход, причём строки за чтение из кэша нет вообще, потому что мы запускаем веса на собственной инфраструктуре, а не перепродаём чей-то эндпоинт.
Для команды, которая уже платит за GPU, сравнение — это не $0,21 против $1,01 за задачу. Это тариф, выставленный вендором, против приростной стоимости запроса на оборудовании, которым вы владеете, и это разные числа. Это аргумент в пользу лагеря открытых весов, и единственный, который выдерживает столкновение с таблицей бенчмарков.
Есть второе, менее очевидное следствие того, что лицензия — Apache 2.0: модель можно поставлять в составе продукта, дообучать на собственном трафике, фиксировать на определённой ревизии и проверять вплоть до весов. Ничего из этого ни за какую цену не доступно от проприетарной модели, доступной только через API, а для регулируемых рабочих нагрузок это часто становится решающим ограничением, а не предпочтением.

Вызов любого из них
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 отсутствует в каталоге. До него можно добраться напрямую через API вендора, а также через AWS, Azure и основные облачные платформы — и это будет точной формулировкой. Что действительно есть в каталоге из линейки вендора — этоClaude Sonnet 5.5 и Claude Opus 5.5, что превращает переход с самостоятельно размещённой небольшой модели на размещённую агентную модель среднего уровня в изменение маршрутизации, а не во вторую интеграцию — автоматическое переключение при сбое так или иначе лежит в его основе.
Вердикт, который необычно однобокий
Как API-вызов для текста или изображений, Claude Haiku 5.5 побеждает в этом сравнении по каждой строке, не связанной с лицензированием. Девять целых семь десятых индексного пункта, в 4,7 раза дешевле за выполненную задачу, в четыре раза большее контекстное окно, вдвое больший потолок ответа и в пять-шесть раз более низкий ценник в режиме коротких промптов. Нет никакого аргумента о форме рабочей нагрузки, который спасает Qwen3.8 27B по цене, потому что недостаток поставщика — интенсивное использование выходных токенов — стоит гораздо меньше, чем его преимущество в тарифе.
Спасает всё то, что цена API не отражает: лицензия, допускающая распространение, веса, которые можно хранить у себя и фиксировать, видеовход и путь самостоятельного хостинга, где стоимость за токен — это ваше собственное железо, а не карта поставщика. Если вы ищете самый дешёвый способ классифицировать, извлекать, суммировать и маршрутизировать текст, ответ — Claude Haiku 5.5, и отрыв от остальных огромен. Если же вы ищете модель, которую можно встроить в собственный продукт, развернуть на собственном железе и под собственным аудитом, то вопрос о разнице в бенчмарках перестал быть главным уже несколько абзацев назад.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
