
Claude Sonnet 5.5 против Claude Opus 5.5: бенчмарки сходятся, а счёт — нет
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 984 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 195 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Claude Sonnet 5.5 стал общедоступным 28 сентября 2026 года по цене $2.00 за миллион входных токенов и $10.00 за миллион выходных токенов. Claude Opus 5.5, флагман Anthropic, вышел на шесть дней раньше, 22 сентября, по цене $4.00 и $20.00 — ровно вдвое больше по обеим позициям. Очевидное прочтение таково: Opus 5.5 — это потолок, а Sonnet 5.5 — компромисс, на который идёшь, когда бюджет реально ограничен. Собственная таблица запуска Anthropic не поддерживает такое прочтение. Согласно цифрам, опубликованным компанией, Claude Sonnet 5.5 показывает 1844 против 1846 у Opus 5.5 на GDPval-AA v2.1, 1811 против 1822 на AA-Briefcase v1.1 и 70,6% против 66,4% на Terminal-Bench 4.0 — он выигрывает в том единственном бенчмарке, который измеряет работу, фактически выполняемую внутри терминала. Двумя строками ниже этих цифр собственная подпись Anthropic гласит, что Opus 5.5 «остаётся явно сильнее в сложной работе с открытым результатом». Оба утверждения верны, и понять, как удерживать их одновременно, — это во многом то, для чего и нужно это сравнение.
Что говорит таблица запусков — и о чём она умалчивает
Закономерность в блоке бенчмарков Anthropic такова: это модель, которая сократила большую часть разрыва, а не та, что вырвалась вперёд. GDPval-AA v2.1, экономически взвешенный набор задач, — это ничья с разницей в два пункта. AA-Briefcase v1.1, оценка документов и результатов работы, — ничья с разницей в одиннадцать пунктов. CursorBench 4.0 показывает обратную картину: 55,5% у Sonnet 5.5 против 57,8% у Opus 5.5. OSWorld 2.1 достигает 80,1% против 81,8%, а Humanity's Last Exam — 64,5% с инструментами против 67,7%. Только Terminal-Bench 4.0 ломает эту закономерность, и ломает жёстко — 70,6% против 66,4%, преимущество Sonnet в четыре пункта в агентной работе с командной строкой.
Читайте подписи к строкам, а не числа, и проявится кое-что другое. Несколько из этих записей Opus 5.5 несут пометку об усилии — 66,4% при Xhigh — а в сноске указано, что конфигурация Max набирает на FrontierCode меньше, а не больше, чем Xhigh. Более высокое усилие не монотонно. Команда, следящая за бюджетом, которая полагает, что «максимальное усилие» — это бесплатное улучшение, покупает токены ради худшего ответа как минимум в одном из собственных тестов Anthropic. А на FrontierCode 1.1 та же сноска помещает Sonnet 5.5 на 46,2% в конфигурации Max против 54,4% у Opus 5.5 — это самое наглядное отдельное число, показывающее, где флагман всё ещё отрывается вперёд: длительная работа с кодом в рамках определения задачи, которое вознаграждает упорство.
Есть ещё одна оговорка, которую стоит прямо озвучить, а не прятать. Anthropic отмечает, что публикуемые ею прогоны GDPval-AA и AA-Briefcase были выполнены на предрелизном развёртывании, которое содержало баг структурированных выходных данных. Это затрагивает обе модели в одной и той же таблице, поэтому сравнение не аннулируется, но это означает, что абсолютные цифры следует воспринимать как снимок, а не как окончательный результат. Вендорские таблицы бенчмарков — это маркетинговые артефакты с приложением по методологии, и к этой таблице прилагается соответствующее приложение.
Где оказывается независимое измерение
Artificial Analysis оценивает обе модели в рамках единого тестового стенда, в той же конфигурации, которую она называет «Adaptive Reasoning, Max Effort, Default Fallback», по Intelligence Index v4.3. Claude Opus 5.5 набирает 58. Claude Sonnet 5.5 набирает 56. Это разрыв в два балла по шкале, где тот же оценщик присваивает Opus 5 51 балл, Sonnet 5 — 38, DeepSeek V4 Pro — 36, а Gemini 3.1 Pro Preview — 30. Новый Sonnet, оказавшийся на два балла ниже флагманской модели и на пять баллов выше предыдущего поколения Opus, — это основное утверждение этого релиза, и это утверждение третьей стороны, а не самого производителя.
Затем та же страница переворачивает экономику этого. Artificial Analysis сообщает, что один прогон оценки Sonnet 5.5 стоит $7,60 за задачу против $5,98 у Opus 5.5, хотя Sonnet 5.5 вдвое дешевле за токен. Причина прямо на странице: Sonnet 5.5 сгенерировала 410 млн токенов по всему набору индекса против медианы в 88 млн у отслеживаемых моделей — «очень многословна», по словам оценивающего. Opus 5.5 сгенерировала 260 млн на том же наборе. При $10 за миллион выходных токенов против $20 коэффициент многословности примерно 1,6 всё равно приводит к тому, что Sonnet 5.5 платит примерно на 27% больше за завершённую задачу.
Это та часть сравнения, которую не может показать прайс-лист за токены, и именно поэтому две цифры сосуществуют без противоречия. В расчёте на токен Sonnet 5.5 вдвое дешевле. В расчёте на завершённую задачу, в наборе оценок с открытыми запросами и без дисциплины по длине вывода, он может оказаться дороже. То, какое из этих описаний соответствует вашей рабочей нагрузке, и есть настоящее решение.
Уровни усилий, потолки вывода и форма интеграции
Для покупателя механически важные характеристики этих двух моделей почти идентичны.
• Контекст — 1,000,000 токенов в обоих случаях, от одного и того же провайдера, поэтому допущения промпт-инжиниринга переносятся без изменений
• Максимальный объём вывода — 128 000 токенов в обоих вариантах; массовая генерация здесь не является отличительным фактором
• Модальность — ввод текста, изображений и файлов в обоих; ни один из них не принимает аудио или видео
• Управление рассуждениями — адаптивное мышление в обоих случаях, при этом глубина задаётся параметром усилия, а не бюджетом токенов на размышление. На Claude Platform по умолчанию используется высокий уровень; в приложениях Claude — средний.
• Запись в кэш — $5,00 за миллион для Claude Opus 5.5 против $2,50 для Claude Sonnet 5.5, единственная строка, где более дешёвая модель также дешевле для подачи с перестроенным префиксом
• Чтение из кэша — $0,20 за миллион у обоих, точная ничья по строке, которая доминирует в длительных запусках агентов
Поскольку поверхности совпадают, миграция между ними — это изменение строки модели и повторное измерение трудозатрат, а не интеграционный проект. Это необычно для разных поставщиков, и именно поэтому эту конкретную пару вообще стоит сравнивать: два кандидата различаются ценой и глубиной, а не API, который вам придётся писать.
Одно операционное различие заслуживает отдельного упоминания. Anthropic заявляет, что Claude Sonnet 5.5 — первый Sonnet, выпущенный со средствами киберзащиты и резервными механизмами на тех же условиях, что и её модели верхнего уровня: запросы по кибербезопасности с повышенным риском явно перенаправляются к предыдущему Sonnet, а не обрабатываются моделью, которую вы указали. Если ваша рабочая нагрузка затрагивает эту область, строка модели не гарантирует, какая модель ответила, — на любом из уровней. Anthropic также отмечает: если вы запускаете Sonnet с отключённым thinking, необходимо переключиться на поведение between-tools, а это изменение кода, а не флаг конфигурации. Ни то, ни другое не является причиной избегать этой модели; и то и другое — причины узнать об этом до выпуска.
В OrcaRouter Claude Opus 5.5 уже сегодня доступен для маршрутизации по тем же учётным данным, что и любая другая модель в каталоге, по каталожной цене провайдера с нулевой наценкой, с доступным под ним автоматическим переключением при сбое. Claude Sonnet 5.5 пока не является маршрутом на нашей платформе — модели всего один день, и пока она не добавлена в список, честно будет сказать, что попасть к ней можно только через собственный API Anthropic. Все, кто сейчас использует Opus 5.5 через нас, смогут в день её появления рассчитать стоимость перехода, не меняя ничего другого в своей интеграции.
Что куда положить?
Разделение, которое следует из цифр: Claude Sonnet 5.5 — для агентной работы, привязанной к терминалу, где он сильнее из двух по собственному показателю Anthropic в Terminal-Bench 4.0 и вдвое дешевле; Claude Sonnet 5.5 — для всего, что связано с пропускной способностью, поскольку разница в стоимости сокращается только тогда, когда задача вынуждает к длинным выводам; Claude Opus 5.5 — для работы класса FrontierCode, долгосрочных рефакторингов в крупных кодовых базах и любой нагрузки, где разрыв 54,4% против 46,2% отражает форму вашей реальной задачи, а не строку в таблице лидеров.
Если ваши задачи не имеют чёткого завершения и вы не можете предсказать длину вывода, считайте цену за токен совершенно неподходящим показателем. Прежде чем делать окончательный выбор, в течение недели измеряйте количество токенов на завершённую задачу на собственном трафике; цифра artificial-analysis — $7.60 против $5.98 — предупреждает, что дешёвая модель может проиграть по метрике, за которую вы фактически платите.
Честный вердикт: это больше не компромисс между возможностями и стоимостью. Это вопрос о том, ограничена ли ваша работа. Для ограниченных, массовых, инструментально-ориентированных задач более дешёвая модель также оказывается и лучшей по имеющимся данным, а флагманская модель не стоит вдвое больше. Для открытых, долгосрочных задач собственное утверждение Anthropic — что Opus 5.5 остаётся явно сильнее — это то, чему стоит верить, и никакое сближение результатов бенчмарков пока этого не меняет.



