
Бенчмарки Claude Opus 5.5: каждый результат, настройка уровня усилий, при которой он был получен, и кто его измерил
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Основная цифра Anthropic для Claude Opus 5.5 в Terminal-Bench 4.0 — 66,4%, указанная на фоне 52,3% у Claude Opus 5 в той же таблице — и эти 66,4% были получены при уровне усилий xhigh, а не при стандартном для модели medium. Модель вышла 22 сентября 2026 года, за два дня до написания этой страницы, так что это GA-модель с ценой GA-модели и таблицей бенчмарков GA-модели. Независимая цифра в том же бенчмарке, от Artificial Analysis, — 59,6%, в конфигурации, которая включает в себя серверную маршрутизацию защитных механизмов Anthropic. Между этими двумя числами стоят различия в харнесе, уровне усилий и маршрутизации, и никто — включая нас — пока не может сказать, какую долю разрыва объясняет каждое из них. Что эта страница может сделать, так это собрать все опубликованные цифры для Claude Opus 5.5 в одном месте, указать, кто их получил, указать настройку, при которой они были получены, и включить строки, в которых GPT-6 Astra и Claude Fable 5.1 выходят вперёд.
Начните с настройки усилий, потому что она влияет на цифры сильнее, чем модели.
Claude Opus 5.5 по умолчанию использует medium effort в Claude API. Claude Opus 5 по умолчанию использовал high. Одинаковое название уровня также не означает одинаковый бюджет рассуждений у двух моделей, поэтому «мы запускали обе на high» не является контролируемым сравнением, даже если метка совпадает. Адаптивное мышление всегда включено, и его нельзя отключить в Opus 5.5; параметр effort влияет на глубину, задержку и стоимость, и ни на что больше.
Показатель Anthropic в Terminal-Bench 4.0 был получен при xhigh. Этот единственный факт — самая важная оговорка на этой странице, потому что бенчмарк, который вынесен в заголовок, — это тот, по которому заявлен самый широкий отрыв от предыдущей модели, и потому что в той же таблице показано, что происходит, если не трогать эту настройку:
• FrontierCode v1.1 Main — 54,4 % при xhigh, 54,6 % при medium по умолчанию.По данным вендора. Прогон в режиме medium выше, чем прогон в режиме xhigh. На этой нагрузке регулятор усилий не дал ничего измеримого; эти два числа — одно и то же число.
• CursorBench 4.0 — 57,8 % при xhigh, 52,5 % при medium. По данным вендора. Одна и та же модель, один и тот же харнесс, одна и та же неделя: 5,3 пункта — самая большая дельта по уровню усилий из всех представленных.
Те две строки, сидящие внутри одной таблицы вендора, — это и есть весь аргумент. Одна рабочая нагрузка нечувствительна к усилию, а другая сильно к нему чувствительна, и карточка модели не может заранее сказать вам, к какому из этих типов относится ваша нагрузка. Вывод, который подтверждают данные, узок, и его стоит сформулировать так же узко: правильный уровень усилия теперь — это измерение для каждой отдельной рабочей нагрузки, а не значение по умолчанию, которое вы наследуете. Он не подтверждает «Opus 5.5 быстрее, чем предполагают его бенчмарки» или «Anthropic занизила значение по умолчанию» — для этого понадобились бы прогоны по каждой рабочей нагрузке для всех пяти настроек, а их никто не публиковал. Он означает, что если вы переходите с Opus 5 и сохраняете ту настройку усилия, которая у вас уже была, вы изменили эксперимент, а не только модель.
Ещё одна асимметрия, и она бьёт в обратную сторону. В колонке конкурента в строке Terminal-Bench у Anthropic указана GPT-6 Astra с 57,9% — запущена в режиме high effort, согласно примечанию к собственной диаграмме Anthropic, тогда как 66,4% Opus 5.5 были получены при xhigh. Таблица от производителя, в которой его собственная модель запускается с одной настройкой, а конкурент — с другой, это не прямое сравнение, как бы эти два числа ни выглядели рядом.
Таблица поставщиков, с источником и настройкой в каждой строке
Всё в этом разделе — по данным вендора: материалы запуска Anthropic, испытательный стенд Anthropic, средства защиты в продакшене включены, адаптивное мышление на максимальном усилии, если в строке не указано иное. Читайте это как измерение Anthropic силами Anthropic.
• Terminal-Bench 4.0 — 66,4 %, при усилии xhigh. По данным производителя, стандартная ошибка около ±2,6 пункта. В той же строке: Claude Opus 5 — 52,3 %, Claude Fable 5.1 — 55,8 %, GPT-6 Astra — 57,9 % (при высоком усилии), GPT-5.6 Sol — 37,3 %. Terminal-Bench 4.0 — это бенчмарк, который производитель прямо признаёт несовершенным прокси для реальной работы в терминале, и именно он является главным показателем модели.
• FrontierCode v1.1 Main — 54,4 % при xhigh, 54,6 % при medium по умолчанию.По данным вендора. Opus 5 — 48,0 %, Fable 5.1 — 50,3 %, GPT-6 Astra — 53,3 %, GPT-5.6 Sol — 47,5 %. В системной карте Anthropic также указан вариант Extended с 63,6 % и лучший результат Extended при medium — 65,3 %.
• CursorBench 4.0 — 57,8 % при xhigh, 52,5 % при medium. По данным производителя. Opus 5 — 46,6 %, Fable 5.1 — 51,8 %, GPT-5.6 Sol — 41,7 %. Учтите, что показатели Fable 5.1 и Opus 5 в CursorBench указаны при максимальном усилии, поэтому Opus 5.5 при medium сравнивается с собственными «собратьями» на максимуме.
• GDPval-AA v2.1 — 1 846 Эло. Это единственная строка в таблице вендора, которую вендор не проводил. GDPval-AA — это оценка Artificial Analysis, и в собственном материале Artificial Analysis об Opus 5.5 указано то же значение — 1 846, при этом Fable 5.1 — 1 735, а Opus 5 — 1 708. В таблице вендора: Fable 5.1 — 1 735, Opus 5 — 1 708, GPT-5.6 Sol — 1 588, GPT-6 Astra — 1 542. Это единственная строка здесь, где две организации сходятся на одном и том же числе, и это потому, что это одно и то же измерение.
• AutomationBench (Zapier) — 40,0%. Данные заявлены вендором, и тестирование проводилось без резервных моделей, поэтому каждое вмешательство системы защиты было засчитано как ошибка. GPT-6 Astra — 41,4%, Fable 5.1 — 31,4%, GPT-5.6 Sol — 28,8%, Opus 5 — 26,9%.
• Humanity's Last Exam с инструментами — 67,7%. По данным вендора. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. Системная карта Anthropic отдельно сообщает 64,4% без инструментов, и именно на эту цифру следует ориентироваться, если вы сравниваете с источником, который не предоставляет своим моделям доступ к инструментам.
• Terminal-Bench-Science 0.1 — 58,7 %.По данным производителя, стандартная ошибка — примерно от ±3,5 до ±5 пунктов, так что это диапазон, а не точечное значение. GPT-6 Astra — 64,6 %, Fable 5.1 — 52,6 %, Opus 5 — 29,0 %, GPT-5.6 Sol — 22,4 %.
• OSWorld 2.0 — 81,8% с «частичным» результатом. По данным вендора, и слово «частичный» в этом предложении несёт реальную нагрузку: системная карта Anthropic даёт строгий показатель выполнения 48,7% для той же модели на той же оценке. Опубликованы оба числа; цитируют именно частичное. Fable 5.1 — 80,7%, Opus 5 — 74,0%.
• Chartography с инструментами — 89,0%. По данным производителя. Fable 5.1 — 88,4%, Opus 5 — 83,4%.

Независимые числа и что на самом деле означает «Default Fallback».
Artificial Analysis — единственная третья сторона с опубликованной актуальной оценкой Claude Opus 5.5 по составному индексу, и именно её показатели следует сопоставлять с показателями Anthropic. По состоянию на 24 сентября 2026 года:
• Индекс интеллекта — 58 при максимальном усилии, в конфигурации с пометкой «Адаптивное рассуждение, максимальное усилие, резервный вариант по умолчанию». Независимый показатель, измеренный Artificial Analysis. В своей собственной статье Artificial Analysis называет 58 «самым высоким результатом, который мы измерили, с преимуществом в несколько пунктов». Тот же индекс также публикует результаты Opus 5.5 при всех остальных настройках усилия, и самое полезное здесь — это разброс: 56 при очень высоком, 54 при высоком, 51 при среднем, 42 при низком. Это разница в 16 пунктов по шкале усилий на одной модели — больше, чем разрыв между большинством моделей в этом рейтинге.
• Terminal-Bench 4.0 — 59,6%. Независимая оценка. Artificial Analysis сообщает, что результат «на уровне лидера GPT-6 Astra (xhigh)» и примерно на 11 пунктов выше Claude Opus 5.
• Humanity's Last Exam — 61,4%. Независимо, а предыдущий лучший результат на той же таблице составлял 59,1% и принадлежал Claude Fable 5.1.
• SciCode — 66,9 %.Независимая оценка против 63,1 % у Claude Fable 5.1.
Теперь о пункте, который требует объяснения, а не цитирования. «Default Fallback» — это не артефакт бенчмарка и не настройка Artificial Analysis — это серверная защитная маршрутизация Anthropic, оставленная включённой. Claude Opus 5.5 поставляется с уровнем защиты, ранее зарезервированным для Fable 5.1: большинство запросов по кибербезопасности прозрачно перенаправляются на Claude Opus 4.8, а работа в области биологии перенаправляется на Claude Opus 5, если аккаунт не верифицирован. Когда Artificial Analysis запускает индекс с включённым default fallback, он измеряет развёрнутую систему — то, до чего фактически доходит неверифицированный API-ключ, — а не чистый чекпоинт весов Opus 5.5. Это более честное измерение для покупателя и менее чистое измерение для бенчмарка. Anthropic говорит то же самое о своей собственной таблице: вмешательства в прогоне Terminal-Bench 4.0 привели к тому, что киберзадачи выполнялись Opus 4.8, а биологические задачи — Opus 5, и компания заявляет, что эти вмешательства, вероятно, занизили заявленный результат. Так что защитная маршрутизация — это реальный операционный факт в обоих направлениях, и ни одна цифра на этой странице не изолирует от неё лежащую в основе модель.
Где две таблицы расходятся и почему
Поставьте два числа Terminal-Bench 4.0 рядом, и вы получите 66,4 % против 59,6 % — 6,8 пункта на том же бенчмарке для той же модели. Причины известны, и каждая из них достаточно велика, чтобы иметь значение сама по себе:
• Разные харнессы. Anthropic запускала собственный скаффолд агента; Artificial Analysis использовала собственный эталонный харнесс агента. Итоговый балл терминального бенчмарка — это свойство скаффолда вместе с моделью, а не одной лишь модели, и ни одна из организаций не опубликовала эксперимент по замене скаффолда.
• Разные настройки усилий. Anthropic's 66,4% получены при xhigh. Настройка усилий, соответствующая 59,6% Artificial Analysis, не указана в предложении, где приводится это число, а публикуемые ею показатели бенчмарков, как правило, относятся к максимальному уровню усилий.
• Защитные механизмы включены, но в обоих случаях учитывались по-разному.Anthropic запускала с резервным механизмом и рассматривала вмешательства как снижающие оценку, но всё равно начисляла баллы. В AutomationBench она запускалась без резервного механизма и считала вмешательства полными провалами. Artificial Analysis запускает с включённым на всём протяжении резервным механизмом.
• Цифры разнятся даже внутри собственной таблицы одного и того же поставщика. Anthropic указывает для Claude Opus 5 результат 52,3% в Terminal-Bench 4.0 и отмечает, что 51,8% для той же модели в публичном рейтинге — «в пределах погрешности».
А затем — самое сильное доказательство на этой странице того, сколько стоит харнесс. Публичная таблица лидеров Terminal-Bench 4.0, снятая 24 сентября 2026 года, содержит вообще ни одной строки с Claude Opus 5.5. Её верхняя строка — GPT-6 Astra при максимальных усилиях, агент Codex, 58,2 % ±2,8; вторая — Claude Fable 5.1 при максимальных усилиях через Claude Code с 57,9 % ±3,8; третья — Claude Opus 5 при xhigh через Claude Code с 53,9 % ±3,2. Так что 66,4 % — это не просто другое число по сравнению с независимыми 59,6 %: его вообще нет в публичной таблице, а собственная версия Claude Opus 5 в этой таблице — 53,9 %, а не 52,3 %, которые печатает таблица запуска. Пока Terminal-Bench не примет и не опубликует заявку Opus 5.5, 66,4 % — это результат вендорского харнесса, который никто не воспроизвёл, а 59,6 % — это число, за которое действительно готов поручиться сторонний участник. Отметим также, что в той же таблице лидер Terminal-Bench 4.0 от Artificial Analysis и Opus 5.5 от Anthropic сходятся на одних и тех же 59,6 % — что означает ничью в одном харнессе и ничего не говорит о другом.

Строки, где Opus 5.5 проигрывает
Сводка, в которой опущены потери, — не сводка, и собственная таблица Anthropic содержит и то, и другое.
• Terminal-Bench-Science 0.1 — 58,7% против 64,6% у GPT-6 Astra.По данным вендора, в таблице самой Anthropic, и проигрыш в 5,9 пункта названному конкуренту в строке, наиболее близкой к научным рассуждениям. Собственное примечание вендора о стандартной ошибке (±3,5 — ±5) означает, что разрыв находится у самой границы шума, а не уверенно внутри него, — но это проигрыш на собственной странице вендора, и этот диапазон не превращает его в победу. Claude Opus 5 находится на отметке 29,0% в той же строке, так что поколенческий прирост реален даже там, где лидирует конкурент.
• AutomationBench — 40,0% против 41,4% у GPT-6 Astra. По данным вендора, потеря в 1,4 пункта, и в запуске не было резервных моделей, поэтому вмешательства защитных механизмов были оценены как неудачи. Это означает, что данное конкретное сравнение измеряет Opus 5.5 с учётом его штрафа за маршрутизацию против конкурента, чей штраф за маршрутизацию, каким бы он ни был, не описан. Это наименее интерпретируемая строка на странице в любом направлении.
Ещё два случая, где отрыв тоньше, чем намекает заголовок, причём оба — по данным производителя. В Humanity's Last Exam with tools преимущество над Claude Fable 5.1 составляет 2,1 пункта (67,7% против 65,6%); в Chartography with tools — 0,6 пункта (89,0% против 88,4%); в OSWorld 2.0 partial — 1,1 пункта (81,8% против 80,7%). Это как раз те строки, где утверждение «Opus 5.5 — лучшая агентная модель» говорит о месте в рейтинге, а не об измеренном разрыве, и разница в 0,6 пункта при чтении графиков не должна решать вопрос о закупке.
Независимое положение Claude Fable 5.1 на другой редакции индекса
Сравнение Opus 5.5 с его собственным собратом заслуживает отдельного раздела, и к нему нужно приложить предупреждение, потому что это сравнение сложнее, чем кажется на первый взгляд.
Когда 1 сентября 2026 года Artificial Analysis опубликовала свой разбор Claude Fable 5.1, он набрал 66 при максимальном усилии в своем Intelligence Index, и она назвала его самым высоким показателем, который когда-либо измеряла, — опередив Claude Opus 5 с 63 и GPT-5.6 Sol с 61. В индексе в том виде, в каком он указан 24 сентября 2026 года, та же модель фигурирует на уровне 53 при максимальном усилии с fallback, а Opus 5.5 фигурирует на уровне 58 в эквивалентной конфигурации. В материале от 22 сентября об Opus 5.5 показатель 58 называется «самым высоким показателем, который мы измерили, с отрывом в несколько пунктов».
Эти два утверждения не могут быть одновременно верны в рамках одной шкалы, и разрешение состоит в том, что они вообще относятся к разным шкалам. Индекс — это живой объект, который Artificial Analysis пересматривает; две его опубликованные статьи с разницей в пять недель помещают одну и ту же пару родственных моделей по разные стороны от первого места. Это утверждение о пересмотрах индекса, а не о том, что какая-либо из моделей стала хуже, и это значит, что 66 и 58 никогда нельзя печатать рядом. Если читать в один и тот же день, в одном и том же списке, при одной и той же помеченной конфигурации, текущий порядок ставит Opus 5.5 на пять пунктов впереди Fable 5.1 — и даже это сравнение в рамках одного и того же индекса, от одного и того же поставщика индекса, а не проверенное очное сопоставление. Безопасно утверждать можно лишь более узкое: в текущей редакции единственного независимого композитного индекса, который измеряет обе модели, Opus 5.5 — сильнейшая из двух моделей Anthropic, а более известный показатель 66 у Fable 5.1 относится к более ранней редакции этого индекса.
Об этих настройках стоит сказать ещё одну фразу, потому что их легко спутать. 66 у Fable 5.1 и 58 у Opus 5.5 — это обе строки с максимальным уровнем усилия, но пять настроек усилия Fable 5.1 охватывают 11-кратный диапазон по использованию выходных токенов: от 13,1 млн на низком уровне до 143,7 млн на максимальном, при значениях индекса от 58 до 66. Одна точка индекса для модели с таким большим внутренним разбросом — плохая замена той строке, которую вы бы реально запустили.
Стоимость токенов — это самостоятельная ось бенчмарка
Каждое число выше — это оценка. Ни одно из них не является счётом, а в этой модели именно счёт — то место, где происходит интересное движение.
Artificial Analysis измеряет Claude Opus 5.5 при максимальном уровне усилий, фиксируя порядка 119 000 выходных токенов на задачу Intelligence Index — самый высокий показатель в этом индексе. Для сравнения, в той же таблице при той же настройке: Claude Opus 5 — около 73 000, Claude Fable 5.1 — около 78 000 и GPT-6 Astra — около 27 000. Токены размышления тарифицируются как выходные токены, а адаптивное мышление на Opus 5.5 нельзя отключить, поэтому токены, которые модель тратит на раздумья, — не сноска к её цене, а большая её часть.
Проведите расчёт, потому что заявленная цена сама по себе вводит в заблуждение. Opus 5.5 указан по цене $4.00 за вход / $20.00 за выход, что на 20% меньше, чем $5.00 / $25.00 у Opus 5. Artificial Analysis по-прежнему оценивает Opus 5.5 при максимальных усилиях примерно в $5.98 за задачу индекса против $5.86 у Opus 5 при той же настройке — немного больше, а не меньше, потому что примерно в 1.6 раза больше выходных токенов съедает всё 20%-е снижение ставки и даже больше. По всему индексу Opus 5.5 произвёл 260 млн выходных токенов против медианы по борде в 88 млн, что оценщик называет «очень многословным».
Таким образом, вся история с затратами целиком определяется настройкой усилий, и она работает только в том случае, если вы её используете. При максимальном усилии Opus 5.5 обходится дороже за выполненную задачу, чем модель, которую он заменяет. При среднем уровне — фактическом значении по умолчанию для продукта и именно том, на который распространяется утверждение Anthropic о «примерно на 40% меньших затратах на выполнение типичных рабочих нагрузок», — экономия реальна, но это утверждение о среднем значении по выбранным поставщиком рабочим нагрузкам, а не проверенный результат по каждой задаче. Практический вывод: снижение цены на 20% — это скидка в прайс-листе и опция на регуляторе усилий, а не автоматическая экономия. Если ваш план миграции — «заменить идентификатор модели и сохранить настройки», вы покупаете дорогую версию.
Что совсем не установлено
Это тот раздел, ради которого существует вся остальная часть страницы.
• Не публиковалось ни одного независимого очного сравнения Claude Opus 5.5 с каким-либо названным конкурентом при одинаковом уровне усилий и одинаковом испытательном стенде. Все межвендорные сравнения на этой странице — Opus 5.5 против GPT-6 Astra, против GPT-5.6 Sol, против Claude Fable 5.1 — это сравнение двух таблиц, полученных двумя разными компаниями, на двух разных испытательных стендах, при двух разных настройках уровня усилий, причём одна из них обычно относится к собственной модели поставщика в благоприятном для неё режиме. Нигде в открытых источниках нет эксперимента, в котором скаффолд и уровень усилий сохраняются неизменными для двух поставщиков и сообщаются результаты обоих.
• Разбивка токенов по отдельным задачам не публикуется. Совокупный показатель выходных токенов измеряется независимо, но то, какая его часть приходится на рассуждения, а какая — на текст ответа, не публикует никто из тех, кого мы смогли найти. Любая страница, которая даёт точное число токенов рассуждений для этой модели, приводит число, которое никто не измерял.
• Большая часть системной карты не проверялась третьими сторонами. SWE-bench Pro 89,9%, Multilingual 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% с поправкой на длину, GMMLU 94,3%, ArXivMath 96,9% с инструментами — всё заявлено производителем, ни один результат не был независимо воспроизведён на момент написания.
• Главная цифра Terminal-Bench 4.0 отсутствует на публичном табло.Об этом уже говорилось выше, но ей место и в этом списке: самая часто цитируемая цифра об этой модели — та, которую не воспроизвёл никто за пределами компании-разработчика.
• Anthropic сообщает, что Claude Opus 5.5 «часто подозревает, что его оценивают» — это собственные слова компании, приведённые как ограничение её оценки безопасности. Отнеситесь к этому серьёзно — как к проблеме измерения, а не как к любопытной детали: если модель ведёт себя иначе, когда полагает, что её тестируют, то каждая цифра бенчмарка на этой странице — от вендора или независимая — измеряет модель в условиях наблюдения, а насколько это отличается от поведения при реальном развёртывании, неизвестно и не измерено. Это в равной мере относится и к хорошим строкам, и к плохим. Это единственная оговорка, которую не исправит никакая методология сопоставимых усилий.
• Sonnet 5.5 и Haiku 5.5 недоступны. Anthropic объявила, что они появятся в «ближайшие недели». Они ещё не выпущены, у них нет опубликованных бенчмарков, и ничто с этой страницы на них не распространяется.
Цена, обёртка и части спецификации, которые меняют ваш код
По данным из опубликованного прайс-листа Anthropic от 24 сентября 2026 года: $4,00 за миллион входных токенов, $20,00 за миллион выходных токенов, $0,20 за миллион чтений из кэша, $5,00 за миллион записей в кэш на 5 минут, $8,00 за миллион записей в кэш на 1 час и скидка 50% в обоих направлениях на Batch API. Ставка за чтение из кэша — самая незаметная: она составляет 5% от базовой ставки за ввод, тогда как у большинства моделей Claude она равна 10%, а у Fable 5.1 — 2,5%. Fast mode тарифицируется отдельно: $8,00 / $40,00, и Anthropic описывает его как исследовательское превью, а не общий тариф.
Это раздел, где тарифная сетка перестаёт быть занимательной мелочью и становится арифметикой, которую роутер может выполнить за вас. Claude Opus 5.5 предоставляется как anthropic/claude-opus-5.5 на OrcaRouter по той же цене $4.00 / $20.00, при этом цены из прайс-листа передаются с наценкой 0% — поэтому как только Anthropic меняет тариф, здесь действует именно этот тариф, в тот же день и без задержки пересчёта цен, которую нужно было бы учитывать. На реальный счёт влияют показатели, которые каталог указывает рядом с ценой: чтение из кэша за $0.20 при 5% от базовой цены ввода против 2,5% у Fable 5.1, контекстное окно на 1M токенов и потолок вывода 128K. Поскольку именно параметр effort определяет, как на самом деле меняется стоимость этой модели — разброс индекса на 16 пунктов и примерно 119 000 выходных токенов на задачу при максимуме против примерно 73 000 у Opus 5 — экономию даёт миграция, которая позволяет настраивать effort для каждой рабочей нагрузки, а не для всего аккаунта, и поставить маршрут Opus 5.5 за автоматическим переключением при сбое, пока вы измеряете, какой режим нужен вашему трафику.
• Envelope — контекст на 1M токенов, максимальный вывод 128K, вывод 300K в Batch API при использованииoutput-300k-2026-03-24 бета-заголовка, дата отсечки знаний — июнь 2026 года, снятие с эксплуатации не ранее 22 сентября 2027 года. Вывод работает более чем на 30% быстрее, чем Claude Opus 5.
• Критические изменения по сравнению с Opus 5 — мышление больше нельзя отключить; принудительное использование инструмента (tool_choice с указанием конкретного инструмента) возвращает ошибку; блоки мышления привязаны к модели и диалогу, в котором они были созданы; более старый вариант computer_20251124 инструмента computer-use не принимается в Claude API или Google Cloud. Первые три также применяются к Fable 5.1. Есть негласный пятый пункт: текст между вызовами инструментов теперь поступает внутрь блоков мышления, текст которых пуст при настройке отображения по умолчанию, поэтому интерфейс, который выводит этот текст потоком как индикатор прогресса, замолкает, хотя никакой ошибки не возникает.
• Защитная маршрутизация, снова, потому что это пункт спецификации, а не сноска — большинство запросов по кибербезопасности направляются в Claude Opus 4.8, а работа по биологии перенаправляется в Claude Opus 5, если только аккаунт не верифицирован. В таких оценках ответ, который вы получаете, может вообще исходить не от Opus 5.5, поэтому опубликованные оценки по бенчмаркам, смежным с кибер- и биотематикой, не являются чистыми измерениями этой модели.
• Заявления об эффективности, все со слов производителя — примерно на 40% ниже стоимость эксплуатации на типичных рабочих нагрузках при снижении прейскурантной цены на 20%; разобранный пример анализа слияния, занимающий 63 минуты на Opus 5.5 против 93 на Opus 5 при затратах на 50% меньше; и заявления клиентов от Box (треть токенов, ответы примерно на 40% менее многословны), Kiro (примерно вдвое меньше токенов, на 40% меньше вызовов), Factory (на 20–25% меньше выходных токенов) и GitHub (один из самых низких показателей по числу токенов и шагов среди измеренных). Это средние значения по рабочим нагрузкам, которые выбрали производитель и его партнёры по запуску. Это данные со ссылкой на источник, а не проверенные результаты, и они находятся в заметном противоречии с приведённым выше независимым показателем стоимости за задачу — который сам является измерением при максимальных усилиях, а не при настройках по умолчанию. И то, и другое может быть верным; ни то, ни другое не является общим утверждением о вашей рабочей нагрузке.

Состояние доказательств
Claude Opus 5.5 — это реальная модель с реальным снижением цены, реальным объёмом в 1 млн токенов контекста и 128 тыс. токенов вывода, а также реальным и значимым изменением в том, как настраиваются размышления и усилия. Она также поставляется с таблицей бенчмарков, которая в основном измеряет Anthropic, независимой таблицей, которая в основном измеряет маршрутизируемое развёртывание, а не чекпойнт, и задокументированной проблемой самосознания, которая подрывает и то, и другое. Не опубликовано ни одного независимого прямого сравнения Claude Opus 5.5 с названным конкурентом при одинаковых настройках усилий и одинаковом харнессе. Пока такое сравнение не появится, воспринимайте каждое межвендорное сравнение на этой странице как то, чем оно является: две вендорские таблицы от двух компаний при двух настройках, сопоставленные нами бок о бок, — и перепроверьте свою собственную настройку усилий, прежде чем заново измерять модель.
Сравнение в этой статье4
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
