
Claude Haiku 5.5 против Qwen3.8-Flash-Next: модель с открытыми весами — не дешёвый вариант
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Интуитивно кажется, что открытая модель из быстрого сегмента Alibaba обойдёт по цене закрытую малую модель Anthropic, и по двум цифрам на ценнике так и выходит: Qwen3.8-Flash-Next подаётся по цене $0.15 за миллион входных токенов и $0.47 за миллион выходных в собственном API Alibaba — против $0.10 и $0.50 у Claude Haiku 5.5. Но если прогнать обе модели на одном и том же наборе бенчмарков, порядок меняется. Artificial Analysis измеряет Claude Haiku 5.5 при максимальном уровне усилий в $0.21 за выполненную задачу Intelligence Index; Qwen3.8-Flash-Next на том же измерении стоит $0.37 — при результате на три балла ниже. Более дешёвый ценник принадлежит модели с более крупным счётом, и причина та же, что решает большинство подобных сравнений: тарифная сетка — это не цена, и модель с открытыми весами окупает себя где-то помимо счёта за управляемый API. Это «где-то ещё» и есть настоящая тема данного сравнения.
Что представляет собой каждый
Оба появились с разницей в шесть недель, и это артефакты разного типа.
• Claude Haiku 5.5 — модель с закрытыми весами, выпущенная 7 октября 2026 года и доступная через Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry и Claude Platform on AWS. Контекст на 1 млн токенов, до 128 000 выходных токенов в синхронном Messages API, адаптивное мышление с регулятором усилий от низкого до максимального и уровнем по умолчанию средний, срез знаний на июнь 2026 года и тарифная сетка, которая ступенчато меняется на отметке 100 000 токенов.
• Qwen3.8-Flash-Next — открытая модель смеси экспертов, выпущенная 26 августа 2026 года под лицензией qwen-community-1.0; Alibaba описывает её как экспериментальную предварительную версию архитектуры, которая ляжет в основу Qwen4. Она хранит 125 млрд параметров основной модели плюс отдельную таблицу n-граммовых эмбеддингов на 51 млрд — примерно 176 млрд без учёта модуля предсказания нескольких токенов на 4 млрд — и активирует 6 млрд на токен, имея 512 экспертов, маршрутизацию top-10 и 48 слоёв. Она изначально поддерживает 262 144 токена контекста с возможностью расширения до 1 млн с помощью YaRN и принимает на вход текст, изображения и видео.
• Qwen3.8-Flash — коммерческий аналог, предоставляемый в виде сервиса, также работает с 26 августа 2026 года в QwenCloud от Alibaba по цене $0,16 за миллион входных и $0,47 за миллион выходных токенов при контексте по умолчанию в 1 млн токенов. Стоит отличать от Flash-Next: один — это контрольная точка, которую можно скачать и изучить, другой — платный управляемый эндпоинт.
Различие между последними двумя — вот в чём вся суть того, почему это сравнение интересно. Claude Haiku 5.5 и Qwen3.8-Flash-Next соревнуются лишь в очень немногом, ведь только один из них можно запустить на собственном оборудовании.
Взвешенный законопроект, который указывает в противоположном направлении.
Все приведённые ниже независимые показатели взяты из Artificial Analysis по Intelligence Index v4.3.2. Тарифные сетки Anthropic и Alibaba — это собственные опубликованные цены поставщиков.
• Индекс интеллекта: Claude Haiku 5.5 при максимальном усилии — 43 балла, второе место из 182 моделей. Qwen3.8-Flash-Next — 40 баллов, шестое место из 117 в своём классе. Разница в три балла в пользу Anthropic.
• Стоимость за задачу — $0,21 против $0,37. Модель, более дорогая в расчёте на токен, на 43% дешевле в расчёте на выполненную задачу.
• Выходные токены в прогоне Index — 440 миллионов у Claude Haiku 5.5 и 240 миллионов у Qwen3.8-Flash-Next, при медиане в 100 миллионов. Модель Qwen пишет эффективнее, но задача с ней всё равно дороже, а это говорит о том, что разрыв обусловлен не только объёмом токенов, но и сочетанием входных данных и оценки, которые применяет оценщик.
• Скорость вывода — 241,9 токена в секунду против 56,0. Claude Haiku 5.5 более чем в четыре раза быстрее при том же измерении, а его время до первого токена в 295 секунд в том запуске — это артефакт работы в режиме максимального усилия, а не сетевая характеристика; время до первого токена у Qwen3.8-Flash-Next составляет 2,53 секунды.
• Структура тарифной сетки — Claude Haiku 5.5 переходит с $0.10 и $0.50 на $0.50 и $2.50 при 100 000 токенов. Qwen3.8-Flash держит ровные $0.16 и $0.47 независимо от длины, что даёт реальное преимущество на длинных промптах и является единственным местом, где аргумент о ценнике выдерживает соприкосновение с длинным документом.
• Токенизатор — Claude Haiku 5.5 использует более новый токенизатор, общий с Claude 4.7 и более поздними версиями, поэтому один и тот же текст считается примерно на 30 % большим числом токенов, чем в предыдущей Haiku. Это раздувает промпты в сторону порога в 100 000 токенов; это собственная документация Anthropic, и это играет против модели именно в случае длинных промптов, где фиксированная цена Qwen выглядит лучше всего.
Итак, суть компромисса такова: платить больше за токен — получать более быстрый и немного более умный ответ, который обходится дешевле в расчёте на выполненную задачу, но с резким скачком тарифа, за которым нужно следить при длинных входных данных. Или платить меньше за токен и получить более медленную модель, которая обходится дороже в расчёте на выполненную задачу, с фиксированной ставкой и нативным окном в 262 144 токена.


Где открытые веса действительно меняют арифметику
Всё вышесказанное — это сравнение двух управляемых API, и Qwen3.8-Flash-Next не создавался для того, чтобы выиграть в нём. Его довод в том, что его не обязательно арендовать.
• Поддержка сервинга с первого дня. SGLang выпустил страницу с рецептами и отдельный образ; у vLLM есть сборка для него, тогда как pull request с поддержкой архитектуры всё ещё открыт. NVIDIA проверила оба решения, а также TensorRT LLM на стойке GB300 NVL72, а NeMo охватывает дообучение.
• Планка требований к оборудованию для чекпоинта на 176B невысока. Таблица n-gram-эмбеддингов на 51B может размещаться в оперативной памяти хоста, а не в VRAM, поскольку адреса её обращений известны заранее, и их можно предзагружать. Именно это позволяет запускать модель на кластерах DGX Spark и рабочих станциях с 4×RTX PRO 6000, а квантования от сообщества, выпущенные в тот же день, — 1-битные сборки, которые умещаются в 75 ГБ ОЗУ при примерно 80% полной точности, — делают её доступной на оборудовании, которым владеет небольшая команда.
Доступна тонкая настройка. Не в смысле хостингового API для тонкой настройки: веса принадлежат вам, они распространяются по лицензии сообщества с обычными условиями, а сама техника задокументирована в техническом отчёте, который включает абляции и отрицательные результаты.
• Окно меньше, чем кажется. 262 144 токена нативно, расширяемо до 1 млн с помощью YaRN — против 1 млн нативно у Claude Haiku 5.5, без оговорки о rope-масштабировании. В задачах с длинными документами, где плоская ставка Qwen выглядит наиболее привлекательно, модель, которая действительно способна удержать документ, — это другая.
• Бенчмарки заявлены производителем. В собственной таблице Alibaba Flash-Next опережает DeepSeek-V4-Flash-0731 в DeepSWE 1.1 (58,7 против 54,4), SWE-bench Pro (62,5 против 56,0) и GPQA Diamond (91,7 против 90,8), но уступает ему в NL2Repo-Bench (48,1 против 54,2) — генерация кода на уровне репозитория, единственное агентное измерение, в котором меньшая модель не дотягивает. Ни один из этих результатов не был воспроизведён третьей стороной, а модели уже шесть недель.
Вот она — честная граница между ними. Claude Haiku 5.5 — это сервис с оплатой по факту потребления, с фиксированным потолком качества и без операционной поверхности. Qwen3.8-Flash-Next — это артефакт, кривая затрат которого загибается вниз, к цене электроэнергии, а потолок качества — это то, что вы способны обслужить, плюс риск невоспроизведённой таблицы бенчмарков и архитектуры, которую всё ещё осваивают среды исполнения.
Реалистичный способ принять решение
Три вопроса решают это, и только первый касается бенчмарков.
У вас есть GPU — или вы хотите их заполучить? Если нет, сценарий самостоятельного хостинга остаётся теоретическим, и всё сводится к приведённому выше сравнению управляемых решений — а оно указывает на Claude Haiku 5.5 по стоимости за задачу, скорости и оценке, с той оговоркой, что его шаг в 100 000 токенов наказывает длинные промпты. Если же у вас простаивают ускорители ниже целевого уровня загрузки, Qwen3.8-Flash-Next — одна из немногих открытых моделей, где декодирование с 6B активных параметров действительно дёшево запускать в больших объёмах, и показатель $0.37 за задачу перестаёт быть релевантным.
Какова средняя длина промпта? Это единственное место, где аргумент о ценнике срабатывает. При объёме менее 100 000 токенов — после токенизатора, который раздувает примерно на 30 % — Claude Haiku 5.5 дешевле по любому счётчику. Выше него фиксированные $0,16 и $0,47 — лучший вариант, а его преимущество растёт с длиной вплоть до нативного окна в 262 144 токена, за пределами которого расширение YaRN — это уже другая инженерная задача.
Какую вариативность задержки допускает рабочая нагрузка? 241,9 выходных токенов в секунду против 56,0 — это огромный разрыв, а развёртывание в собственной инфраструктуре добавляет к этому ожидание в очереди. Агент поддержки в реальном времени или управления браузером — рабочие нагрузки, которые Anthropic называет для этого уровня, — почувствует разницу.
Для всех, кто хочет получить ответы на второй и третий вопросы, а не рассуждать о них, самый дешёвый инструмент — общий эндпоинт. Qwen3.8-Flash-Next пока нет в каталоге OrcaRouter, как и Claude Haiku 5.5; родственная модель Qwen, которую мы маршрутизируем, — Qwen3.8-Flash, по прайс-листовой цене провайдера, передаваемой напрямую с наценкой 0%, что является ближайшим доступным эквивалентом модели в этом сравнении и правильным базовым ориентиром для теста стоимости длинных промптов. На стороне Anthropic Claude Haiku 4.5, Claude Sonnet 5.5 и Claude Opus 5.5 сегодня все доступны для вызова с одного и того же ключа, так что ценовой эксперимент с двумя поколениями — это конфигурация, а не второй контракт; и поскольку ценообразование основано на прямом переносе, а не на смешении, снижение цены поставщиком на любом из направлений отражается на нашей стороне в тот же день, когда о нём объявляют. Именно автоматическое переключение при сбое делает эксперимент безопасным для запуска на реальном трафике: preview-модель или невоспроизведённая таблица бенчмарков — это ровно тот случай, когда стоит направить маршрут на что-то новое, а за ним находится проверенная модель.
Что изменило бы ответ?
Две вещи, и обе можно проверить. Первая — независимая оценка Qwen3.8-Flash-Next на стенде, который также запускает Claude Haiku 5.5: таблица вендора сравнивается с DeepSeek, а 40 в независимом рейтинге — это единственная позиция. Следить стоит за оценкой кодинга на уровне репозитория, потому что именно в NL2Repo модель, как уже показывали, отстаёт. Вторая — получится ли довести до конца работу над рантаймом: поддержка vLLM всё ещё вливается через открытые пул-реквесты, и пока это не произойдёт, самостоятельный хостинг этой архитектуры — упражнение для команд, которым такое по душе, а не поддерживаемый путь.
А пока что резюме короткое. Qwen3.8-Flash-Next — более интересная модель для владения и более дорогая для аренды. Claude Haiku 5.5 — более дешёвый, быстрый и набирающий больше баллов управляемый эндпоинт, с тарифной сеткой, которая наказывает за всё длинное. Выбирайте в зависимости от того, покупаете ли вы токены или покупаете чекпойнт, — и если вы покупаете токены, учтите, что модель с открытыми весами — не такая скидка, как вы предполагали.

