Сгенерированная титульная карточка с надписью «Claude Haiku 5.5 vs Qwen3.8-Flash-Next» и подзаголовком «Модель с открытыми весами — не дешёвый вариант», столбчатая диаграмма с подписью «Стоимость за выполненную задачу Intelligence Index», где для Claude Haiku 5.5 указано $0.21, а для Qwen3.8-Flash-Next — $0.37, и строка в нижнем колонтитуле: «Независимые показатели по данным Artificial Analysis; цены — по данным Anthropic и Alibaba». Настоящий логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Claude Haiku 5.5 против Qwen3.8-Flash-Next: модель с открытыми весами — не дешёвый вариант

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Интуитивно кажется, что открытая модель из быстрого сегмента Alibaba обойдёт по цене закрытую малую модель Anthropic, и по двум цифрам на ценнике так и выходит: Qwen3.8-Flash-Next подаётся по цене $0.15 за миллион входных токенов и $0.47 за миллион выходных в собственном API Alibaba — против $0.10 и $0.50 у Claude Haiku 5.5. Но если прогнать обе модели на одном и том же наборе бенчмарков, порядок меняется. Artificial Analysis измеряет Claude Haiku 5.5 при максимальном уровне усилий в $0.21 за выполненную задачу Intelligence Index; Qwen3.8-Flash-Next на том же измерении стоит $0.37 — при результате на три балла ниже. Более дешёвый ценник принадлежит модели с более крупным счётом, и причина та же, что решает большинство подобных сравнений: тарифная сетка — это не цена, и модель с открытыми весами окупает себя где-то помимо счёта за управляемый API. Это «где-то ещё» и есть настоящая тема данного сравнения.

Что представляет собой каждый

Оба появились с разницей в шесть недель, и это артефакты разного типа.

• Claude Haiku 5.5 — модель с закрытыми весами, выпущенная 7 октября 2026 года и доступная через Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry и Claude Platform on AWS. Контекст на 1 млн токенов, до 128 000 выходных токенов в синхронном Messages API, адаптивное мышление с регулятором усилий от низкого до максимального и уровнем по умолчанию средний, срез знаний на июнь 2026 года и тарифная сетка, которая ступенчато меняется на отметке 100 000 токенов.

• Qwen3.8-Flash-Next — открытая модель смеси экспертов, выпущенная 26 августа 2026 года под лицензией qwen-community-1.0; Alibaba описывает её как экспериментальную предварительную версию архитектуры, которая ляжет в основу Qwen4. Она хранит 125 млрд параметров основной модели плюс отдельную таблицу n-граммовых эмбеддингов на 51 млрд — примерно 176 млрд без учёта модуля предсказания нескольких токенов на 4 млрд — и активирует 6 млрд на токен, имея 512 экспертов, маршрутизацию top-10 и 48 слоёв. Она изначально поддерживает 262 144 токена контекста с возможностью расширения до 1 млн с помощью YaRN и принимает на вход текст, изображения и видео.

• Qwen3.8-Flash — коммерческий аналог, предоставляемый в виде сервиса, также работает с 26 августа 2026 года в QwenCloud от Alibaba по цене $0,16 за миллион входных и $0,47 за миллион выходных токенов при контексте по умолчанию в 1 млн токенов. Стоит отличать от Flash-Next: один — это контрольная точка, которую можно скачать и изучить, другой — платный управляемый эндпоинт.

Различие между последними двумя — вот в чём вся суть того, почему это сравнение интересно. Claude Haiku 5.5 и Qwen3.8-Flash-Next соревнуются лишь в очень немногом, ведь только один из них можно запустить на собственном оборудовании.

Взвешенный законопроект, который указывает в противоположном направлении.

Все приведённые ниже независимые показатели взяты из Artificial Analysis по Intelligence Index v4.3.2. Тарифные сетки Anthropic и Alibaba — это собственные опубликованные цены поставщиков.

• Индекс интеллекта: Claude Haiku 5.5 при максимальном усилии — 43 балла, второе место из 182 моделей. Qwen3.8-Flash-Next — 40 баллов, шестое место из 117 в своём классе. Разница в три балла в пользу Anthropic.

• Стоимость за задачу — $0,21 против $0,37. Модель, более дорогая в расчёте на токен, на 43% дешевле в расчёте на выполненную задачу.

• Выходные токены в прогоне Index — 440 миллионов у Claude Haiku 5.5 и 240 миллионов у Qwen3.8-Flash-Next, при медиане в 100 миллионов. Модель Qwen пишет эффективнее, но задача с ней всё равно дороже, а это говорит о том, что разрыв обусловлен не только объёмом токенов, но и сочетанием входных данных и оценки, которые применяет оценщик.

• Скорость вывода — 241,9 токена в секунду против 56,0. Claude Haiku 5.5 более чем в четыре раза быстрее при том же измерении, а его время до первого токена в 295 секунд в том запуске — это артефакт работы в режиме максимального усилия, а не сетевая характеристика; время до первого токена у Qwen3.8-Flash-Next составляет 2,53 секунды.

• Структура тарифной сетки — Claude Haiku 5.5 переходит с $0.10 и $0.50 на $0.50 и $2.50 при 100 000 токенов. Qwen3.8-Flash держит ровные $0.16 и $0.47 независимо от длины, что даёт реальное преимущество на длинных промптах и является единственным местом, где аргумент о ценнике выдерживает соприкосновение с длинным документом.

• Токенизатор — Claude Haiku 5.5 использует более новый токенизатор, общий с Claude 4.7 и более поздними версиями, поэтому один и тот же текст считается примерно на 30 % большим числом токенов, чем в предыдущей Haiku. Это раздувает промпты в сторону порога в 100 000 токенов; это собственная документация Anthropic, и это играет против модели именно в случае длинных промптов, где фиксированная цена Qwen выглядит лучше всего.

Итак, суть компромисса такова: платить больше за токен — получать более быстрый и немного более умный ответ, который обходится дешевле в расчёте на выполненную задачу, но с резким скачком тарифа, за которым нужно следить при длинных входных данных. Или платить меньше за токен и получить более медленную модель, которая обходится дороже в расчёте на выполненную задачу, с фиксированной ставкой и нативным окном в 262 144 токена.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Где открытые веса действительно меняют арифметику

Всё вышесказанное — это сравнение двух управляемых API, и Qwen3.8-Flash-Next не создавался для того, чтобы выиграть в нём. Его довод в том, что его не обязательно арендовать.

• Поддержка сервинга с первого дня. SGLang выпустил страницу с рецептами и отдельный образ; у vLLM есть сборка для него, тогда как pull request с поддержкой архитектуры всё ещё открыт. NVIDIA проверила оба решения, а также TensorRT LLM на стойке GB300 NVL72, а NeMo охватывает дообучение.

• Планка требований к оборудованию для чекпоинта на 176B невысока. Таблица n-gram-эмбеддингов на 51B может размещаться в оперативной памяти хоста, а не в VRAM, поскольку адреса её обращений известны заранее, и их можно предзагружать. Именно это позволяет запускать модель на кластерах DGX Spark и рабочих станциях с 4×RTX PRO 6000, а квантования от сообщества, выпущенные в тот же день, — 1-битные сборки, которые умещаются в 75 ГБ ОЗУ при примерно 80% полной точности, — делают её доступной на оборудовании, которым владеет небольшая команда.

Доступна тонкая настройка. Не в смысле хостингового API для тонкой настройки: веса принадлежат вам, они распространяются по лицензии сообщества с обычными условиями, а сама техника задокументирована в техническом отчёте, который включает абляции и отрицательные результаты.

• Окно меньше, чем кажется. 262 144 токена нативно, расширяемо до 1 млн с помощью YaRN — против 1 млн нативно у Claude Haiku 5.5, без оговорки о rope-масштабировании. В задачах с длинными документами, где плоская ставка Qwen выглядит наиболее привлекательно, модель, которая действительно способна удержать документ, — это другая.

• Бенчмарки заявлены производителем. В собственной таблице Alibaba Flash-Next опережает DeepSeek-V4-Flash-0731 в DeepSWE 1.1 (58,7 против 54,4), SWE-bench Pro (62,5 против 56,0) и GPQA Diamond (91,7 против 90,8), но уступает ему в NL2Repo-Bench (48,1 против 54,2) — генерация кода на уровне репозитория, единственное агентное измерение, в котором меньшая модель не дотягивает. Ни один из этих результатов не был воспроизведён третьей стороной, а модели уже шесть недель.

Вот она — честная граница между ними. Claude Haiku 5.5 — это сервис с оплатой по факту потребления, с фиксированным потолком качества и без операционной поверхности. Qwen3.8-Flash-Next — это артефакт, кривая затрат которого загибается вниз, к цене электроэнергии, а потолок качества — это то, что вы способны обслужить, плюс риск невоспроизведённой таблицы бенчмарков и архитектуры, которую всё ещё осваивают среды исполнения.

Реалистичный способ принять решение

Три вопроса решают это, и только первый касается бенчмарков.

У вас есть GPU — или вы хотите их заполучить? Если нет, сценарий самостоятельного хостинга остаётся теоретическим, и всё сводится к приведённому выше сравнению управляемых решений — а оно указывает на Claude Haiku 5.5 по стоимости за задачу, скорости и оценке, с той оговоркой, что его шаг в 100 000 токенов наказывает длинные промпты. Если же у вас простаивают ускорители ниже целевого уровня загрузки, Qwen3.8-Flash-Next — одна из немногих открытых моделей, где декодирование с 6B активных параметров действительно дёшево запускать в больших объёмах, и показатель $0.37 за задачу перестаёт быть релевантным.

Какова средняя длина промпта? Это единственное место, где аргумент о ценнике срабатывает. При объёме менее 100 000 токенов — после токенизатора, который раздувает примерно на 30 % — Claude Haiku 5.5 дешевле по любому счётчику. Выше него фиксированные $0,16 и $0,47 — лучший вариант, а его преимущество растёт с длиной вплоть до нативного окна в 262 144 токена, за пределами которого расширение YaRN — это уже другая инженерная задача.

Какую вариативность задержки допускает рабочая нагрузка? 241,9 выходных токенов в секунду против 56,0 — это огромный разрыв, а развёртывание в собственной инфраструктуре добавляет к этому ожидание в очереди. Агент поддержки в реальном времени или управления браузером — рабочие нагрузки, которые Anthropic называет для этого уровня, — почувствует разницу.

Для всех, кто хочет получить ответы на второй и третий вопросы, а не рассуждать о них, самый дешёвый инструмент — общий эндпоинт. Qwen3.8-Flash-Next пока нет в каталоге OrcaRouter, как и Claude Haiku 5.5; родственная модель Qwen, которую мы маршрутизируем, — Qwen3.8-Flash, по прайс-листовой цене провайдера, передаваемой напрямую с наценкой 0%, что является ближайшим доступным эквивалентом модели в этом сравнении и правильным базовым ориентиром для теста стоимости длинных промптов. На стороне Anthropic Claude Haiku 4.5, Claude Sonnet 5.5 и Claude Opus 5.5 сегодня все доступны для вызова с одного и того же ключа, так что ценовой эксперимент с двумя поколениями — это конфигурация, а не второй контракт; и поскольку ценообразование основано на прямом переносе, а не на смешении, снижение цены поставщиком на любом из направлений отражается на нашей стороне в тот же день, когда о нём объявляют. Именно автоматическое переключение при сбое делает эксперимент безопасным для запуска на реальном трафике: preview-модель или невоспроизведённая таблица бенчмарков — это ровно тот случай, когда стоит направить маршрут на что-то новое, а за ним находится проверенная модель.

Что изменило бы ответ?

Две вещи, и обе можно проверить. Первая — независимая оценка Qwen3.8-Flash-Next на стенде, который также запускает Claude Haiku 5.5: таблица вендора сравнивается с DeepSeek, а 40 в независимом рейтинге — это единственная позиция. Следить стоит за оценкой кодинга на уровне репозитория, потому что именно в NL2Repo модель, как уже показывали, отстаёт. Вторая — получится ли довести до конца работу над рантаймом: поддержка vLLM всё ещё вливается через открытые пул-реквесты, и пока это не произойдёт, самостоятельный хостинг этой архитектуры — упражнение для команд, которым такое по душе, а не поддерживаемый путь.

А пока что резюме короткое. Qwen3.8-Flash-Next — более интересная модель для владения и более дорогая для аренды. Claude Haiku 5.5 — более дешёвый, быстрый и набирающий больше баллов управляемый эндпоинт, с тарифной сеткой, которая наказывает за всё длинное. Выбирайте в зависимости от того, покупаете ли вы токены или покупаете чекпойнт, — и если вы покупаете токены, учтите, что модель с открытыми весами — не такая скидка, как вы предполагали.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.