Hero-карточка с заголовком Claude Sonnet 5.5 против Qwen3.8 Max, с подзаголовком: шесть недель, два уровня, один вердикт по стоимости, с плашками: на входе $2 у обоих, на выходе $10 против $6, и Индекс 56 против 45, а также с нижним колонтитулом со ссылкой на Artificial Analysis v4.3.2 и цены вендоров.
Guides & Insights

Claude Sonnet 5.5 против Qwen3.8 Max: шесть недель, два уровня, один вердикт по стоимости

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Прогоните арифметику по трём промптам — и сравнение в основном разрешится ещё до того, как вы доберётесь до бенчмарков. Короткий вызов для ответа службы поддержки: 2 000 входных токенов, 500 выходных. У Qwen3.8 Max при $2 за миллион входных и $6 за миллион выходных это четыре десятых цента; у Claude Sonnet 5.5 при $2 и $10 — девять десятых. Рефакторинг репозитория: 400 000 входных, 30 000 выходных — сорок три цента против восьмидесяти трёх. Долгая агентная сессия, которая действительно расходует свой бюджет: два миллиона входных токенов, 200 000 выходных, то есть $5,20 против $6,30, как только числа становятся достаточно большими, чтобы входная часть начала доминировать.

Разрыв, который начинается как разница в 2,25× по цене вывода, сужается примерно до 1,2× в агентном масштабе, и это масштабирование — не курьёз. Qwen3.8 Max и Claude Sonnet 5.5 — обе модели с 1M токенов и высокими потолками вывода, обе по цене $2 за миллион на входе, и обе выпущены с разницей в восемь недель друг от друга — модель вендора 3 августа 2026 года с датированным обновлением 2 сентября, у Anthropic — 28 сентября. Разница между ними не в тарифной сетке. Она в том, сколько каждая из них тратит, чтобы закончить.

Что и когда вышло

Qwen3.8 Max — это самый мощный уровень Alibaba на сегодняшний день. В собственном руководстве по миграции Alibaba противопоставляет его напрямую GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro и рекомендует его всякий раз, когда задаче требуется максимально сильное доступное рассуждение. Он обладает контекстным окном на 1 млн токенов, принимает текст, изображения и видео на входе и выдаёт текст — именно возможность ввода видео является той единственной способностью, которой здесь нет у Claude Sonnet 5.5. Цены составляют $2 за миллион входных токенов и $6 за миллион выходных, при этом чтение из кэша — $0.25, а запись в кэш — $2.50. К записи от 3 августа в нашем каталоге добавляется обновление от 2 сентября, указанное как Qwen3.8 Max (0902), которое имеет те же основные тарифы и потолок вывода в 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 — вторая модель в поколении 5.5 от Anthropic, выпущенная 28 сентября 2026 года, через шесть дней после Claude Opus 5.5. Она поставляется как claude-sonnet-5-5 в Claude API, а также в Amazon Bedrock, Google Cloud и Microsoft Foundry, с окном в 1 млн токенов и потолком синхронного вывода 128K, который расширяется до 300K в Message Batches API при использовании заголовка output-300k-2026-03-24, при этом тарифы Claude Sonnet 5 остались ровно теми же: $2 за ввод, $10 за вывод, $0.20 за чтение из кэша, $2.50 за запись в кэш. Нулевое хранение данных с момента запуска, прекращение поддержки не ранее 28 сентября 2027 года.

Итак, ставка за ввод одинакова, контекстные окна одного размера, и оба поставщика обновились в пределах месяца друг от друга. Всё, что их отличает, — на стороне оплаты за вывод или в бенчмарках.

Бенчмарки: таблица вендора против независимого индекса

Здесь существуют два вида доказательств, и они не взаимозаменяемы.

Таблица запуска Anthropic основана на данных вендора, не воспроизведена ни одной третьей стороной и охватывает восемь оценок. Строки, которые имеют значение

• Terminal-Bench 4.0 — Claude Sonnet 5.5: 70,6% против 10,3% у Claude Sonnet 5

• CursorBench 4.0 — 55,5% против 34,1% у Claude Sonnet 5

• GDPval-AA v2.1 — 1844 против 1449 у Claude Sonnet 5, 1846 у Claude Opus 5.5 и 1487 у GPT-6 Sol

• Humanity's Last Exam с инструментами — 64,5% против 54,9%; Claude Opus 5.5 находится на уровне 67,7%

• OSWorld 2.1, частично — 80,1% против 57,0%

• Картография, без инструментов — 61,6% против 15,6%

Alibaba не публикует напрямую эквивалентную таблицу из четырёх столбцов, поэтому единственные показатели, которые можно разместить на одной оси, — это независимые. Artificial Analysis, редакция v4.3.2

• Сводный индекс интеллекта — Claude Sonnet 5.5: 56, 3-е место из 216; Qwen3.8 Max: 45, 27-е место

• Стоимость одной задачи Intelligence Index — $7.60 против $5.41

• Скорость вывода — модель Anthropic сравнивается с базовым показателем Claude Sonnet 5, измеренным на уровне 78,7 токенов в секунду; Qwen3.8 Max показывает 39,1

• Многословность — 410 млн выходных токенов на Index против 190 млн

Собственные оценки Qwen3.8 Max по каждому тесту выглядят прилично, а не маргинально: 92,8% на GPQA Diamond, 88,8% на Terminal-Bench 2.1, 80,3% на воспроизведении длинного контекста, 47,8% на tau-banking. По сводному показателю он проигрывает, потому что нигде не побеждает с решающим преимуществом, а более новая линейка Anthropic выигрывает несколько позиций с явным преимуществом. Также обратите внимание, что на независимой странице Qwen3.8 Max указана дата выпуска 2 сентября 2026 года и показатель контекста 984K — она описывает обновление (0902), а не августовскую сборку, и смешивать показатели между ними было бы ошибкой.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

То, чего не хватает в обоих столбцах, так же важно, как и то, что в них есть. Никто независимо не воспроизвёл показатели Anthropic по OSWorld или Terminal-Bench. Никто не опубликовал ни одного показателя Chartography или CursorBench для Qwen3.8 Max. Композитный показатель — единственное значение, измеренное одинаковым образом на обеих моделях, и именно поэтому цифра стоимости за задачу под ним играет такую большую роль.

Число, которое всё решает, и его нет ни в одной из тарифных карт

Artificial Analysis выставляет счёт обеим моделям одинаково: запустить десять оценок из Индекса, посчитать токены, умножить на прейскурантную цену. Claude Sonnet 5.5 обходится в $7.60 за задачу, а Qwen3.8 Max — в $5.41: наценка 40% для модели Anthropic, несмотря на более высокий сводный балл. Показатели многословности объясняют направление — 410 млн токенов против 190 млн, — а показатели скорости объясняют остальное: модель, которая выдаёт меньше токенов и тратит больше времени на каждый токен, — это не та модель, что платит за вывод по двойному тарифу.

Собственное заявление Anthropic об эффективности вписывается в ту же картину, а не противоречит ей. Компания утверждает, что Claude Sonnet 5.5 генерирует вывод более чем на 30% быстрее, чем Claude Sonnet 5, и стоит «до 30% меньше за задачу» при одинаковых ценах — это утверждение о количестве токенов на задачу, а не о тарифах. Выдержит ли оно проверку против модели, которая тратит менее половины такого количества токенов, — именно это подразумевает цифра $7.60, а один независимый запуск — это всего одна точка данных.

Практическое следствие: тариф за вывод $6 против $10 — это число, на которое будет смотреть отдел закупок, и это наименее прогностичное число в статье. Прогностичное число — это количество токенов на задачу на ваших собственных промптах, и ни один из поставщиков не предоставит его вам.

Входные данные, видео и ловушка миграции

Разница в возможностях, которая проявляется сразу, — это модальность. Qwen3.8 Max принимает видео наряду с текстом и изображениями; Claude Sonnet 5.5 принимает текст и изображения. Для анализа записей экрана, конвейеров обработки видеозаписей встреч или чего угодно, что рассматривает видео как полноценный входной формат, это не разрыв в показателях бенчмарков — это бинарный вопрос соответствия, и только одна из этих моделей его проходит.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

Разница, которая проявляется неделю спустя, носит поведенческий характер. Claude Sonnet 5.5 вносит пять критических изменений в код, работающий на Claude Sonnet 5. Не заданный по умолчанию temperature, top_p или top_k теперь возвращает 400. Отправка thinking: {"type": "disabled"} возвращает 400 с указанием на between_tools, новую самую низкую настройку thinking, которая принимается при уровнях усилий low, medium и high и отклоняется при xhigh или max. Принудительное использование инструментов — tool_choice со значением "any" или именованного инструмента — сразу возвращает 400. Более старый computer_20251124 инструмент computer-use отклоняется в Claude API и Google Cloud. А блоки thinking привязаны к модели и учётной записи, которые их создали, поэтому reasoning можно перенести из Claude Sonnet 5, но не в другое семейство, а отредактированный префикс разговора может превратить повтор в ошибку.

Qwen3.8 Max ничего этого не требует. Это модель в формате OpenAI с обычной поверхностью запросов, а переход на неё с другого уровня Qwen — это смена строки модели.

Взвесьте обе издержки честно. Выбор модели Qwen стоит вам разрыва в одиннадцать пунктов по композитному показателю и цифр поставщика Anthropic, которые вы всё равно не можете проверить независимо. Выбор модели Anthropic стоит вам ввода видео и чек-листа из четырёх изменений API, каждое из которых при первом же вызове громко упадёт с ошибкой 400 — это хороший вид сбоя, но в любом случае день работы.

Где OrcaRouter вписывается

Причина маршрутизировать, а не выбирать, состоит в том, что решающее число — стоимость одной задачи на вашем трафике — нельзя вычислить по документации ни одного из поставщиков.

OrcaRouter — это единая конечная точка, совместимая с OpenAI, поверх более 200 моделей, с прайс-листом провайдера, передаваемым без наценки, так что снижение цены или изменение тарифа с любой из сторон вступает в силу в тот же день, когда о нём объявлено. Обе сборки Qwen3.8 Max есть в каталоге по цене самого Alibaba — $2 / $6 — августовская версия и обновление (0902) — наряду с Claude Sonnet 5, моделью, на которой по-прежнему работает большая часть трафика Claude API, доступной для маршрутизации с 30 июня по цене Anthropic $2 / $10 с измеренной скоростью 150 выходных токенов в секунду. Сам Claude Sonnet 5.5 пока отсутствует в нашем каталоге; пока это так, честный путь к нему — собственный API вендора и три облака, которые перечисляет Anthropic, а способ попробовать его, не перенося рабочую нагрузку, — это часть трафика за автоматическим переключением при сбое на Claude Sonnet 5 или Qwen3.8 Max.

Какой именно, для какой работы?

Qwen3.8 Max побеждает по видеовходу, по скорости вывода, по измеренной стоимости на задачу индексирования и по трудозатратам на интеграцию. Это правильный выбор по умолчанию для больших объёмов хорошо специфицированной работы, где разрыв в двенадцать пунктов по совокупному показателю не отражается на качестве результатов.

Claude Sonnet 5.5 побеждает по независимому композитному показателю, в оценках агентного программирования — где данные производителя Anthropic показали скачок на 60 пунктов по сравнению с его собственным предшественником на Terminal-Bench 4.0 — по потолку пакетного вывода в 300K и по решению, продиктованному задачей, которое не может принять тарифная сетка: это та модель, которую стоит выбрать, когда задача настолько сложна, что правильность важнее дешевизны.

То, что изменило бы ответ для любого из них, — это одно и то же, и это не выпуск нового бенчмарка. Это количество токенов на задачу на ваших собственных промптах, при ваших собственных настройках усилия, для обеих моделей. Параметр усилия Anthropic и потолок вывода Qwen — оба представляют собой рычаги влияния на это число, и оба задаёте вы, а не прайс-лист вендора.

Одно это сравнение точно проясняет: при $2 за миллион на входе входная часть счёта больше не является различием между китайским флагманом и моделью среднего уровня от Anthropic. Эта гонка ещё несколько месяцев назад сместилась на выходную сторону и к количеству токенов.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно