Титульная карточка Hero для Claude Opus 5.5 vs Claude Opus 5 с заголовком «Уровни усилий не означают одно и то же», с бейджами «medium vs high по умолчанию», «$4.00 vs $5.00» и «$0.20 vs $0.50 за кэш», а также логотипом OrcaRouter в правом нижнем углу.
Engineering & Research

Claude Opus 5.5 против Claude Opus 5: уровни усилий означают не одно и то же

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Первое, что нужно знать, прежде чем сравнивать Claude Opus 5.5 с Claude Opus 5 — это то, что две модели не используют одну и ту же шкалу усилий, и почти все очные сравнения, которые вы прочтёте на этой неделе, это игнорируют. Opus 5 по умолчанию работает на уровне усилий high. Opus 5.5 по умолчанию работает на уровне medium, и на одноимённом уровне она думает больше за ход, чем её предшественница. Так что «Opus 5.5 с настройками по умолчанию против Opus 5 с настройками по умолчанию» — это не контролируемый эксперимент, а сравнение двух разных объёмов размышлений. Производитель говорит то же самое в своём руководстве по миграции: тестируйте несколько уровней усилий и не используйте повторно настройки Opus 5, потому что одноимённые уровни не соответствуют одному и тому же бюджету размышлений. Как только вы это учтёте, разрыв между двумя моделями в одних местах сузится, в других — расширится, а решение об обновлении будет зависеть уже не от сырых возможностей, а от стоимости каждой завершённой задачи — и от четырёх изменений в API, которые сломают код, работающий сегодня на Opus 5.

Что же на самом деле различается — характеристика за характеристикой?

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

Эти две модели на бумаге ближе друг к другу, чем можно предположить по номерам версий:

• Цена — Claude Opus 5.5: $4.00 за миллион входных токенов / $20.00 за миллион выходных токенов против Claude Opus 5: $5.00 / $25.00

• Чтение из кэша — $0,20 за миллион против $0,50 за миллион, снижение на 60% по статье затрат, которая доминирует в агентных запусках

• Запись в кэш — $5 за миллион для 5-минутного окна и $8 для 1-часового окна на 5.5, против $6.25 на Opus 5

• Контекст и вывод — 1 млн токенов контекста и 128 тыс. токенов вывода в обоих; оба достигают 300 тыс. токенов вывода в Batch API с output-300k-2026-03-24 бета-заголовком

• Уровень усилий по умолчанию — средний на Opus 5.5 против высокого на Opus 5

• Мышление — адаптивное и всегда включено в обоих, но в Opus 5.5 его больше нельзя отключить вообще

• Дата отсечки знаний — июнь 2026 г. против мая 2026 г.

• Задержка — Anthropic оценивает задержку Opus 5.5 как «умеренную» на фоне текущей линейки и утверждает, что он генерирует вывод более чем на 30% быстрее, чем Opus 5

• Прекращение поддержки — не ранее 22 сентября 2027 г. для Opus 5.5 и не ранее 24 июля 2027 г. для Opus 5

Обратите внимание на то, что не отличается: контекстное окно, потолок вывода, скидка за пакетную обработку и всегда включённая модель адаптивного мышления. Opus 5.5 — это не модель с большим контекстом или более длинным выводом. Это более дешёвая, быстрая и более токен-эффективная модель в тех же рамках.

Бенчмарки, и звёздочка об усилиях у каждого из них

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Эти цифры взяты из материалов запуска Anthropic — они предоставлены производителем и получены на его собственных моделях, — и здесь параметр усилий важнее, чем название модели:

• Terminal-Bench 4.0 — 66,4% против 52,3%, причём прогон Opus 5.5 выполнялся с уровнем усилия xhigh, а не с уровнем по умолчанию

Вы — профессиональный движок локализации программного обеспечения. Переведите сообщение пользователя на русский язык. Текст содержит нумерованные маркеры {{1}}...{{/1}}. Сохраняйте КАЖДЫЙ маркер байт-в-байт: те же номера, те же открывающие/закрывающие пары, и переводите только текст МЕЖДУ ними. Вы МОЖЕТЕ переместить фрагмент {{n}}...{{/n}} туда, куда требует порядок слов в целевом языке. Любой текст внутри фрагмента {{n}}...{{/n}} должен быть переведён ТОЧНО как есть (не переводите его). Сохраняйте URL-адреса и названия брендов/продуктов. Выводите ТОЛЬКО переведённый текст с его маркерами — без вступления, без кавычек, без объяснений. {{1}}FrontierCode v1.1 (Main) — 54.4% vs 48.0%, and 54.6% for Opus 5.5 at the default medium effort{{/1}}

• CursorBench 4.0 — 57,8% против 46,6% и 52,5% на среднем уровне

• GDPval-AA v2.1 — 1846 Elo против 1708

• AutomationBench — 40.0% против 26.9%

• Humanity's Last Exam, с инструментами — 67,7% против 63,6%

• Terminal-Bench-Science 0.1 — 58,7% против 29,0%, самый широкий разрыв в наборе

• OSWorld 2.0 — 81,8 % частично против 74,0 %

• Картография, с инструментами — 89,0% против 83,4%

Именно результат FrontierCode и стоит изучать. Opus 5.5 набирает 54,4 % при xhigh и 54,6 % при medium — статистически одно и то же число, при малой доле бюджета размышлений. Какое бы улучшение ни внесла Anthropic, на этом бенчмарке оно не проистекает из более напряжённого размышления. У CursorBench обратная картина: 57,8 % при xhigh против 52,5 % при medium — разрыв в пять пунктов, который говорит о том, что на некоторых задачах усилие всё ещё приносит реальную точность. Урок не в том, чтобы «использовать medium» или «использовать xhigh»; он в том, что правильный уровень усилий теперь нужно измерять для каждой рабочей нагрузки отдельно, а старая привычка оставлять Opus 5 на его высоком уровне по умолчанию больше ничего вам не говорит о новой модели.

Anthropic добавляет оговорку, которую стоит повторить: на этом уровне возможностей разрывы в бенчмарках — «менее надёжный ориентир для реальных различий», а компания утверждает, что её внутренний разрыв с Claude Fable 5.1 меньше, чем следует из опубликованных оценок. Это вендор, который говорит вам не делать слишком далеко идущих выводов из его собственной таблицы.

Стоимость одной выполненной задачи — вот сравнение, которое всё решает.

Цена за токен — неправильная единица измерения для агента, и именно это сравнение наглядно это демонстрирует. Собственный разобранный пример Anthropic: анализ слияния, который занял у Opus 5.5 63 минуты и обошёлся на 50% дешевле, чем та же задача на Opus 5, занявшая 93 минуты. Тарифная сетка объясняет часть этого — снижение на 20% на входные и выходные данные, на 60% на чтение из кэша, — но не всё. Остальное — это то, что модель использует меньше токенов и меньше шагов, чтобы прийти к тому же результату. Отзывы клиентов, опубликованные вместе с запуском, указывают в ту же сторону: Box сообщает о трети токенов и о том, что ответы стали примерно на 40% менее многословными, Kiro — примерно о половине токенов при на 40% меньшем числе вызовов, Factory — о на 20–25% меньшем числе выходных токенов, GitHub — об одном из самых низких показателей по числу токенов и шагов, которые он измерял.

Это опубликованные поставщиком отзывы клиентов, а не проверенные аудитом результаты, и совокупная формулировка «примерно на 40% дешевле на типичных рабочих нагрузках» — это характеристика Anthropic среднего значения по выбранным ею рабочим нагрузкам. Честный вариант для вашего собственного планирования: считайте, что 20%-ное снижение заявленной цены реально и его можно закладывать в расчёты, а дополнительные 20% рассматривайте как гипотезу, которую можно проверить за полдня, запустив одну и ту же задачу на обеих моделях и подсчитав токены.

Одно структурное замечание о том, почему снижение стоимости кэша даёт непропорционально большой эффект. Агент, который при каждом ходе повторно отправляет длинный системный промпт и дерево файлов, платит по тарифам чтения из кэша за бо́льшую часть своего ввода, а не по тарифам нового ввода. Снижение этой ставки с $0,50 до $0,20 за миллион токенов меняет экономику длительных сессий гораздо сильнее, чем ставка, указанная в заголовке, — и именно поэтому рабочая нагрузка, которая была едва рентабельна на Opus 5, может стать явно рентабельной на Opus 5.5 без каких-либо изменений в ваших промптах.

Четыре критических изменения в виде контрольного списка для миграции

Opus 5.5 — это новая модель, а не переименованная Opus 5, и в примечаниях Anthropic по миграции перечислены четыре изменения, которые сломают код, уже работающий в продакшене:

• Режим мышления нельзя отключить. Любой код, который отключал мышление, вызовет ошибку или изменит поведение, а глубина теперь управляется только через параметр effort.

• Принудительное использование инструмента возвращает ошибку. tool_choice, принудительно задающий конкретный инструмент, не поддерживается.

• Блоки мышления привязаны к модели, которая их создала, и к диалогу, поэтому их нельзя воспроизвести в других моделях так, как это предполагают некоторые пайплайны.

• Более ранний computer_20251124 инструмент использования компьютера не поддерживается в Claude API или в Google Cloud.

Есть пятое изменение, которое ничего не ломает и потому опаснее. Текст между вызовами инструментов теперь возвращается внутри блоков размышления, текст которых пуст при настройке отображения по умолчанию. Если ваше приложение передаёт этот текст пользователям как обновления о ходе работы, оно замолкает между вызовами инструментов, пока вы не зададите значение отображения, возвращающее этот текст. Все тесты проходят; интерфейс просто перестаёт комментировать происходящее.

Первые три также применимы к Claude Fable 5.1, поэтому команда, уже перешедшая на эту модель, выполнила часть этой работы. Команда, всё ещё использующая Opus 5, — нет.

Когда Opus 5 всё ещё остаётся правильным выбором

Обновление не происходит автоматически, и есть четыре реальные причины остаться:

• Предсказуемость затрат. Opus 5 — модель, которую вы уже охарактеризовали. Если ваша модель бюджета построена на её потреблении токенов, переход к модели, которая при том же указанном уровне усилий размышляет в другом объёме, делает эту модель недействительной, пока вы не проведёте повторные измерения.

• Совместимость. Если какая-либо часть вашего стека зависит от отключения thinking, принудительного выбора инструмента или более старого инструмента computer-use, то миграция — это работа с кодом, а не замена строк.

• Маршрутизация защитных механизмов. Opus 5.5 поставляется с защитными механизмами класса Fable 5.1, что означает, что большинство запросов по кибербезопасности перенаправляются в Claude Opus 4.8, а работа в области биологии переключается на Claude Opus 5, если только ваша учётная запись не верифицирована. Если ваш продукт относится к одной из этих областей, «обновление» может означать, что ваши пользователи получают ответы от меньшей модели. В Opus 5 такой маршрутизации нет.

• Долговечность. Opus 5 не собирается никуда исчезать в ближайшее время — Anthropic указывает, что прекращение поддержки произойдёт не раньше 24 июля 2027 года, то есть через десять месяцев.

Для всех остальных арифметика проста: больше возможностей, ниже цена, меньше токенов и контрольный список миграции, с которым один инженер справится за день.

Запускать оба во время переключения

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

Неловкая часть любой миграции флагманской модели — это середина: вы хотите Opus 5.5 на новом трафике, не ставя продакшн-путь в зависимость от модели, которую вы не охарактеризовали при своих собственных настройках усилий, и хотите, чтобы Opus 5 продолжал обслуживать запросы, пока вы это выясняете. Это задача маршрутизации, а не переплатформирования, и стоит точно понимать, что где находится. Claude Opus 5 сегодня доступен на OrcaRouter по собственной прайс-листовой цене Anthropic с наценкой 0% — цена провайдера по прайс-листу передаётся напрямую, поэтому изменение тарифа вендора вступает в силу на нашей стороне в тот же день, а не после синхронизации. Claude Opus 5.5 пока не входит в число наших маршрутов; он доступен через собственный API Anthropic и основные облака. Когда он появится, он станет ещё одним маршрутом на том же ключе вместо второго контракта и второго SDK, что и позволяет направить процент трафика на новую модель, пока автоматическое переключение при сбое сохраняет остальной трафик на той, которую вы уже охарактеризовали. Составление вызова сразу через обе — черновик от одной и проверочный проход от другой — это одна строка на routing-DSL.

Скажите точно, что это вам даёт. Это не даёт вам независимого бенчмарка Opus 5.5; пока этого не даёт ничто, потому что единственные опубликованные прямые сравнения — собственные сравнения Anthropic, а независимые трекеры всё ещё определяются с конфигурациями усилий. Это даёт вам то единственное измерение, которое действительно предсказывает ваш счёт, на ваших промптах, при том уровне усилий, с которым вы будете выпускать.

Решающее правило

Если вы начинаете что-то новое, используйте Claude Opus 5.5 и начните со среднего уровня усилий, затем проверьте, справляется ли низкий уровень с вашей задачей — Anthropic сообщает, что низкий уровень по нескольким оценкам кода приближается к более высоким настройкам при значительно меньшей стоимости, а приведённые выше показатели FrontierCode позволяют предположить, что значение по умолчанию не оставляет много неиспользованного потенциала.

Если вы используете Claude Opus 5 в продакшене, триггером для миграции служит не таблица с бенчмарками. А то, сможете ли вы поглотить четыре изменения API и относится ли ваша нагрузка к кибербезопасности или биологии, где маршрутизация защитных механизмов незаметно передаст часть вашего трафика меньшей модели. Всё остальное в этом обновлении — это снижение цены, облачённое в одежды релиза модели, а от такого стоит не отказываться.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно