Сгенерирована главная титульная карточка для Claude Sonnet 5.5 vs Claude Opus 5.5 с подзаголовком «Бенчмарки сходятся, а счёт — нет», где слева показаны $2.00 и $10.00 за миллион токенов, а справа — $4.00 и $20.00, с логотипом OrcaRouter, наложенным в правом нижнем углу.
Guides & Insights

Claude Sonnet 5.5 против Claude Opus 5.5: бенчмарки сходятся, а счёт — нет

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Claude Sonnet 5.5 стал общедоступным 28 сентября 2026 года по цене $2.00 за миллион входных токенов и $10.00 за миллион выходных токенов. Claude Opus 5.5, флагман Anthro​pic, вышел на шесть дней раньше, 22 сентября, по цене $4.00 и $20.00 — ровно вдвое больше по обеим позициям. Очевидное прочтение таково: Opus 5.5 — это потолок, а Sonnet 5.5 — компромисс, на который идёшь, когда бюджет реально ограничен. Собственная таблица запуска Anthro​pic не поддерживает такое прочтение. Согласно цифрам, опубликованным компанией, Claude Sonnet 5.5 показывает 1844 против 1846 у Opus 5.5 на GDPval-AA v2.1, 1811 против 1822 на AA-Briefcase v1.1 и 70,6% против 66,4% на Terminal-Bench 4.0 — он выигрывает в том единственном бенчмарке, который измеряет работу, фактически выполняемую внутри терминала. Двумя строками ниже этих цифр собственная подпись Anthro​pic гласит, что Opus 5.5 «остаётся явно сильнее в сложной работе с открытым результатом». Оба утверждения верны, и понять, как удерживать их одновременно, — это во многом то, для чего и нужно это сравнение.

Что говорит таблица запусков — и о чём она умалчивает

Закономерность в блоке бенчмарков Anthropic такова: это модель, которая сократила большую часть разрыва, а не та, что вырвалась вперёд. GDPval-AA v2.1, экономически взвешенный набор задач, — это ничья с разницей в два пункта. AA-Briefcase v1.1, оценка документов и результатов работы, — ничья с разницей в одиннадцать пунктов. CursorBench 4.0 показывает обратную картину: 55,5% у Sonnet 5.5 против 57,8% у Opus 5.5. OSWorld 2.1 достигает 80,1% против 81,8%, а Humanity's Last Exam — 64,5% с инструментами против 67,7%. Только Terminal-Bench 4.0 ломает эту закономерность, и ломает жёстко — 70,6% против 66,4%, преимущество Sonnet в четыре пункта в агентной работе с командной строкой.

Читайте подписи к строкам, а не числа, и проявится кое-что другое. Несколько из этих записей Opus 5.5 несут пометку об усилии — 66,4% при Xhigh — а в сноске указано, что конфигурация Max набирает на FrontierCode меньше, а не больше, чем Xhigh. Более высокое усилие не монотонно. Команда, следящая за бюджетом, которая полагает, что «максимальное усилие» — это бесплатное улучшение, покупает токены ради худшего ответа как минимум в одном из собственных тестов Anthropic. А на FrontierCode 1.1 та же сноска помещает Sonnet 5.5 на 46,2% в конфигурации Max против 54,4% у Opus 5.5 — это самое наглядное отдельное число, показывающее, где флагман всё ещё отрывается вперёд: длительная работа с кодом в рамках определения задачи, которое вознаграждает упорство.

Есть ещё одна оговорка, которую стоит прямо озвучить, а не прятать. Anthropic отмечает, что публикуемые ею прогоны GDPval-AA и AA-Briefcase были выполнены на предрелизном развёртывании, которое содержало баг структурированных выходных данных. Это затрагивает обе модели в одной и той же таблице, поэтому сравнение не аннулируется, но это означает, что абсолютные цифры следует воспринимать как снимок, а не как окончательный результат. Вендорские таблицы бенчмарков — это маркетинговые артефакты с приложением по методологии, и к этой таблице прилагается соответствующее приложение.

Где оказывается независимое измерение

Artificial Analysis оценивает обе модели в рамках единого тестового стенда, в той же конфигурации, которую она называет «Adaptive Reasoning, Max Effort, Default Fallback», по Intelligence Index v4.3. Claude Opus 5.5 набирает 58. Claude Sonnet 5.5 набирает 56. Это разрыв в два балла по шкале, где тот же оценщик присваивает Opus 5 51 балл, Sonnet 5 — 38, DeepSeek V4 Pro — 36, а Gemini 3.1 Pro Preview — 30. Новый Sonnet, оказавшийся на два балла ниже флагманской модели и на пять баллов выше предыдущего поколения Opus, — это основное утверждение этого релиза, и это утверждение третьей стороны, а не самого производителя.

Затем та же страница переворачивает экономику этого. Artificial Analysis сообщает, что один прогон оценки Sonnet 5.5 стоит $7,60 за задачу против $5,98 у Opus 5.5, хотя Sonnet 5.5 вдвое дешевле за токен. Причина прямо на странице: Sonnet 5.5 сгенерировала 410 млн токенов по всему набору индекса против медианы в 88 млн у отслеживаемых моделей — «очень многословна», по словам оценивающего. Opus 5.5 сгенерировала 260 млн на том же наборе. При $10 за миллион выходных токенов против $20 коэффициент многословности примерно 1,6 всё равно приводит к тому, что Sonnet 5.5 платит примерно на 27% больше за завершённую задачу.

Это та часть сравнения, которую не может показать прайс-лист за токены, и именно поэтому две цифры сосуществуют без противоречия. В расчёте на токен Sonnet 5.5 вдвое дешевле. В расчёте на завершённую задачу, в наборе оценок с открытыми запросами и без дисциплины по длине вывода, он может оказаться дороже. То, какое из этих описаний соответствует вашей рабочей нагрузке, и есть настоящее решение.

Уровни усилий, потолки вывода и форма интеграции

Для покупателя механически важные характеристики этих двух моделей почти идентичны.

• Контекст — 1,000,000 токенов в обоих случаях, от одного и того же провайдера, поэтому допущения промпт-инжиниринга переносятся без изменений

• Максимальный объём вывода — 128 000 токенов в обоих вариантах; массовая генерация здесь не является отличительным фактором

• Модальность — ввод текста, изображений и файлов в обоих; ни один из них не принимает аудио или видео

• Управление рассуждениями — адаптивное мышление в обоих случаях, при этом глубина задаётся параметром усилия, а не бюджетом токенов на размышление. На Claude Platform по умолчанию используется высокий уровень; в приложениях Claude — средний.

• Запись в кэш — $5,00 за миллион для Claude Opus 5.5 против $2,50 для Claude Sonnet 5.5, единственная строка, где более дешёвая модель также дешевле для подачи с перестроенным префиксом

• Чтение из кэша — $0,20 за миллион у обоих, точная ничья по строке, которая доминирует в длительных запусках агентов

Поскольку поверхности совпадают, миграция между ними — это изменение строки модели и повторное измерение трудозатрат, а не интеграционный проект. Это необычно для разных поставщиков, и именно поэтому эту конкретную пару вообще стоит сравнивать: два кандидата различаются ценой и глубиной, а не API, который вам придётся писать.

Одно операционное различие заслуживает отдельного упоминания. Anthropic заявляет, что Claude Sonnet 5.5 — первый Sonnet, выпущенный со средствами киберзащиты и резервными механизмами на тех же условиях, что и её модели верхнего уровня: запросы по кибербезопасности с повышенным риском явно перенаправляются к предыдущему Sonnet, а не обрабатываются моделью, которую вы указали. Если ваша рабочая нагрузка затрагивает эту область, строка модели не гарантирует, какая модель ответила, — на любом из уровней. Anthropic также отмечает: если вы запускаете Sonnet с отключённым thinking, необходимо переключиться на поведение between-tools, а это изменение кода, а не флаг конфигурации. Ни то, ни другое не является причиной избегать этой модели; и то и другое — причины узнать об этом до выпуска.

В OrcaRouter Claude Opus 5.5 уже сегодня доступен для маршрутизации по тем же учётным данным, что и любая другая модель в каталоге, по каталожной цене провайдера с нулевой наценкой, с доступным под ним автоматическим переключением при сбое. Claude Sonnet 5.5 пока не является маршрутом на нашей платформе — модели всего один день, и пока она не добавлена в список, честно будет сказать, что попасть к ней можно только через собственный API Anthropic. Все, кто сейчас использует Opus 5.5 через нас, смогут в день её появления рассчитать стоимость перехода, не меняя ничего другого в своей интеграции.

Что куда положить?

Разделение, которое следует из цифр: Claude Sonnet 5.5 — для агентной работы, привязанной к терминалу, где он сильнее из двух по собственному показателю Anthropic в Terminal-Bench 4.0 и вдвое дешевле; Claude Sonnet 5.5 — для всего, что связано с пропускной способностью, поскольку разница в стоимости сокращается только тогда, когда задача вынуждает к длинным выводам; Claude Opus 5.5 — для работы класса FrontierCode, долгосрочных рефакторингов в крупных кодовых базах и любой нагрузки, где разрыв 54,4% против 46,2% отражает форму вашей реальной задачи, а не строку в таблице лидеров.

Если ваши задачи не имеют чёткого завершения и вы не можете предсказать длину вывода, считайте цену за токен совершенно неподходящим показателем. Прежде чем делать окончательный выбор, в течение недели измеряйте количество токенов на завершённую задачу на собственном трафике; цифра artificial-analysis — $7.60 против $5.98 — предупреждает, что дешёвая модель может проиграть по метрике, за которую вы фактически платите.

Честный вердикт: это больше не компромисс между возможностями и стоимостью. Это вопрос о том, ограничена ли ваша работа. Для ограниченных, массовых, инструментально-ориентированных задач более дешёвая модель также оказывается и лучшей по имеющимся данным, а флагманская модель не стоит вдвое больше. Для открытых, долгосрочных задач собственное утверждение Anthropic — что Opus 5.5 остаётся явно сильнее — это то, чему стоит верить, и никакое сближение результатов бенчмарков пока этого не меняет.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.