
Claude Sonnet 5.5 против Qwen3.8 Max: шесть недель, два уровня, один вердикт по стоимости
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 984 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 195 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Прогоните арифметику по трём промптам — и сравнение в основном разрешится ещё до того, как вы доберётесь до бенчмарков. Короткий вызов для ответа службы поддержки: 2 000 входных токенов, 500 выходных. У Qwen3.8 Max при $2 за миллион входных и $6 за миллион выходных это четыре десятых цента; у Claude Sonnet 5.5 при $2 и $10 — девять десятых. Рефакторинг репозитория: 400 000 входных, 30 000 выходных — сорок три цента против восьмидесяти трёх. Долгая агентная сессия, которая действительно расходует свой бюджет: два миллиона входных токенов, 200 000 выходных, то есть $5,20 против $6,30, как только числа становятся достаточно большими, чтобы входная часть начала доминировать.
Разрыв, который начинается как разница в 2,25× по цене вывода, сужается примерно до 1,2× в агентном масштабе, и это масштабирование — не курьёз. Qwen3.8 Max и Claude Sonnet 5.5 — обе модели с 1M токенов и высокими потолками вывода, обе по цене $2 за миллион на входе, и обе выпущены с разницей в восемь недель друг от друга — модель вендора 3 августа 2026 года с датированным обновлением 2 сентября, у Anthropic — 28 сентября. Разница между ними не в тарифной сетке. Она в том, сколько каждая из них тратит, чтобы закончить.
Что и когда вышло
Qwen3.8 Max — это самый мощный уровень Alibaba на сегодняшний день. В собственном руководстве по миграции Alibaba противопоставляет его напрямую GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro и рекомендует его всякий раз, когда задаче требуется максимально сильное доступное рассуждение. Он обладает контекстным окном на 1 млн токенов, принимает текст, изображения и видео на входе и выдаёт текст — именно возможность ввода видео является той единственной способностью, которой здесь нет у Claude Sonnet 5.5. Цены составляют $2 за миллион входных токенов и $6 за миллион выходных, при этом чтение из кэша — $0.25, а запись в кэш — $2.50. К записи от 3 августа в нашем каталоге добавляется обновление от 2 сентября, указанное как Qwen3.8 Max (0902), которое имеет те же основные тарифы и потолок вывода в 131K.

Claude Sonnet 5.5 — вторая модель в поколении 5.5 от Anthropic, выпущенная 28 сентября 2026 года, через шесть дней после Claude Opus 5.5. Она поставляется как claude-sonnet-5-5 в Claude API, а также в Amazon Bedrock, Google Cloud и Microsoft Foundry, с окном в 1 млн токенов и потолком синхронного вывода 128K, который расширяется до 300K в Message Batches API при использовании заголовка output-300k-2026-03-24, при этом тарифы Claude Sonnet 5 остались ровно теми же: $2 за ввод, $10 за вывод, $0.20 за чтение из кэша, $2.50 за запись в кэш. Нулевое хранение данных с момента запуска, прекращение поддержки не ранее 28 сентября 2027 года.
Итак, ставка за ввод одинакова, контекстные окна одного размера, и оба поставщика обновились в пределах месяца друг от друга. Всё, что их отличает, — на стороне оплаты за вывод или в бенчмарках.
Бенчмарки: таблица вендора против независимого индекса
Здесь существуют два вида доказательств, и они не взаимозаменяемы.
Таблица запуска Anthropic основана на данных вендора, не воспроизведена ни одной третьей стороной и охватывает восемь оценок. Строки, которые имеют значение
• Terminal-Bench 4.0 — Claude Sonnet 5.5: 70,6% против 10,3% у Claude Sonnet 5
• CursorBench 4.0 — 55,5% против 34,1% у Claude Sonnet 5
• GDPval-AA v2.1 — 1844 против 1449 у Claude Sonnet 5, 1846 у Claude Opus 5.5 и 1487 у GPT-6 Sol
• Humanity's Last Exam с инструментами — 64,5% против 54,9%; Claude Opus 5.5 находится на уровне 67,7%
• OSWorld 2.1, частично — 80,1% против 57,0%
• Картография, без инструментов — 61,6% против 15,6%
Alibaba не публикует напрямую эквивалентную таблицу из четырёх столбцов, поэтому единственные показатели, которые можно разместить на одной оси, — это независимые. Artificial Analysis, редакция v4.3.2
• Сводный индекс интеллекта — Claude Sonnet 5.5: 56, 3-е место из 216; Qwen3.8 Max: 45, 27-е место
• Стоимость одной задачи Intelligence Index — $7.60 против $5.41
• Скорость вывода — модель Anthropic сравнивается с базовым показателем Claude Sonnet 5, измеренным на уровне 78,7 токенов в секунду; Qwen3.8 Max показывает 39,1
• Многословность — 410 млн выходных токенов на Index против 190 млн
Собственные оценки Qwen3.8 Max по каждому тесту выглядят прилично, а не маргинально: 92,8% на GPQA Diamond, 88,8% на Terminal-Bench 2.1, 80,3% на воспроизведении длинного контекста, 47,8% на tau-banking. По сводному показателю он проигрывает, потому что нигде не побеждает с решающим преимуществом, а более новая линейка Anthropic выигрывает несколько позиций с явным преимуществом. Также обратите внимание, что на независимой странице Qwen3.8 Max указана дата выпуска 2 сентября 2026 года и показатель контекста 984K — она описывает обновление (0902), а не августовскую сборку, и смешивать показатели между ними было бы ошибкой.

То, чего не хватает в обоих столбцах, так же важно, как и то, что в них есть. Никто независимо не воспроизвёл показатели Anthropic по OSWorld или Terminal-Bench. Никто не опубликовал ни одного показателя Chartography или CursorBench для Qwen3.8 Max. Композитный показатель — единственное значение, измеренное одинаковым образом на обеих моделях, и именно поэтому цифра стоимости за задачу под ним играет такую большую роль.
Число, которое всё решает, и его нет ни в одной из тарифных карт
Artificial Analysis выставляет счёт обеим моделям одинаково: запустить десять оценок из Индекса, посчитать токены, умножить на прейскурантную цену. Claude Sonnet 5.5 обходится в $7.60 за задачу, а Qwen3.8 Max — в $5.41: наценка 40% для модели Anthropic, несмотря на более высокий сводный балл. Показатели многословности объясняют направление — 410 млн токенов против 190 млн, — а показатели скорости объясняют остальное: модель, которая выдаёт меньше токенов и тратит больше времени на каждый токен, — это не та модель, что платит за вывод по двойному тарифу.
Собственное заявление Anthropic об эффективности вписывается в ту же картину, а не противоречит ей. Компания утверждает, что Claude Sonnet 5.5 генерирует вывод более чем на 30% быстрее, чем Claude Sonnet 5, и стоит «до 30% меньше за задачу» при одинаковых ценах — это утверждение о количестве токенов на задачу, а не о тарифах. Выдержит ли оно проверку против модели, которая тратит менее половины такого количества токенов, — именно это подразумевает цифра $7.60, а один независимый запуск — это всего одна точка данных.
Практическое следствие: тариф за вывод $6 против $10 — это число, на которое будет смотреть отдел закупок, и это наименее прогностичное число в статье. Прогностичное число — это количество токенов на задачу на ваших собственных промптах, и ни один из поставщиков не предоставит его вам.
Входные данные, видео и ловушка миграции
Разница в возможностях, которая проявляется сразу, — это модальность. Qwen3.8 Max принимает видео наряду с текстом и изображениями; Claude Sonnet 5.5 принимает текст и изображения. Для анализа записей экрана, конвейеров обработки видеозаписей встреч или чего угодно, что рассматривает видео как полноценный входной формат, это не разрыв в показателях бенчмарков — это бинарный вопрос соответствия, и только одна из этих моделей его проходит.

Разница, которая проявляется неделю спустя, носит поведенческий характер. Claude Sonnet 5.5 вносит пять критических изменений в код, работающий на Claude Sonnet 5. Не заданный по умолчанию temperature, top_p или top_k теперь возвращает 400. Отправка thinking: {"type": "disabled"} возвращает 400 с указанием на between_tools, новую самую низкую настройку thinking, которая принимается при уровнях усилий low, medium и high и отклоняется при xhigh или max. Принудительное использование инструментов — tool_choice со значением "any" или именованного инструмента — сразу возвращает 400. Более старый computer_20251124 инструмент computer-use отклоняется в Claude API и Google Cloud. А блоки thinking привязаны к модели и учётной записи, которые их создали, поэтому reasoning можно перенести из Claude Sonnet 5, но не в другое семейство, а отредактированный префикс разговора может превратить повтор в ошибку.
Qwen3.8 Max ничего этого не требует. Это модель в формате OpenAI с обычной поверхностью запросов, а переход на неё с другого уровня Qwen — это смена строки модели.
Взвесьте обе издержки честно. Выбор модели Qwen стоит вам разрыва в одиннадцать пунктов по композитному показателю и цифр поставщика Anthropic, которые вы всё равно не можете проверить независимо. Выбор модели Anthropic стоит вам ввода видео и чек-листа из четырёх изменений API, каждое из которых при первом же вызове громко упадёт с ошибкой 400 — это хороший вид сбоя, но в любом случае день работы.
Где OrcaRouter вписывается
Причина маршрутизировать, а не выбирать, состоит в том, что решающее число — стоимость одной задачи на вашем трафике — нельзя вычислить по документации ни одного из поставщиков.
OrcaRouter — это единая конечная точка, совместимая с OpenAI, поверх более 200 моделей, с прайс-листом провайдера, передаваемым без наценки, так что снижение цены или изменение тарифа с любой из сторон вступает в силу в тот же день, когда о нём объявлено. Обе сборки Qwen3.8 Max есть в каталоге по цене самого Alibaba — $2 / $6 — августовская версия и обновление (0902) — наряду с Claude Sonnet 5, моделью, на которой по-прежнему работает большая часть трафика Claude API, доступной для маршрутизации с 30 июня по цене Anthropic $2 / $10 с измеренной скоростью 150 выходных токенов в секунду. Сам Claude Sonnet 5.5 пока отсутствует в нашем каталоге; пока это так, честный путь к нему — собственный API вендора и три облака, которые перечисляет Anthropic, а способ попробовать его, не перенося рабочую нагрузку, — это часть трафика за автоматическим переключением при сбое на Claude Sonnet 5 или Qwen3.8 Max.
Какой именно, для какой работы?
Qwen3.8 Max побеждает по видеовходу, по скорости вывода, по измеренной стоимости на задачу индексирования и по трудозатратам на интеграцию. Это правильный выбор по умолчанию для больших объёмов хорошо специфицированной работы, где разрыв в двенадцать пунктов по совокупному показателю не отражается на качестве результатов.
Claude Sonnet 5.5 побеждает по независимому композитному показателю, в оценках агентного программирования — где данные производителя Anthropic показали скачок на 60 пунктов по сравнению с его собственным предшественником на Terminal-Bench 4.0 — по потолку пакетного вывода в 300K и по решению, продиктованному задачей, которое не может принять тарифная сетка: это та модель, которую стоит выбрать, когда задача настолько сложна, что правильность важнее дешевизны.
То, что изменило бы ответ для любого из них, — это одно и то же, и это не выпуск нового бенчмарка. Это количество токенов на задачу на ваших собственных промптах, при ваших собственных настройках усилия, для обеих моделей. Параметр усилия Anthropic и потолок вывода Qwen — оба представляют собой рычаги влияния на это число, и оба задаёте вы, а не прайс-лист вендора.
Одно это сравнение точно проясняет: при $2 за миллион на входе входная часть счёта больше не является различием между китайским флагманом и моделью среднего уровня от Anthropic. Эта гонка ещё несколько месяцев назад сместилась на выходную сторону и к количеству токенов.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
