Титульная карточка с надписью «Claude Opus 5.5 возглавляет индекс кодирующих агентов с 66» и подзаголовком «Токены дешевле, счёт за задачу больше», а под ней три скруглённые карточки: «Индекс кодирующих агентов 66», «Стоимость за задачу $13.04, рост на 21%» и «Claude Opus 5: 60 при $10.79».
Guides & Insights

Claude Opus 5.5 возглавляет Coding Agent Index с результатом 66 — а счёт за выполнение задач растёт на 21%

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставщик снизилClaude Opus 5.5 цены на токены на 20% 22 сентября 2026 года. Два дня спустя Artificial Analysis опубликовала измерение для кодинг-агента, показывающее, что это снижение сделало со счётом агента: стоимость одной задачи выросла на 21%, до $13.04 против $10.79, которые тот же индекс насчитывает для Claude Opus 5. Оценка тоже выросла — 66 в Coding Agent Index, который Artificial Analysis называет самым высоким из измеренных ею: на шесть пунктов больше, чем у Claude Opus 5, и на четыре — чем у Claude Fable 5.1 в той же конфигурации. И то, и другое верно одновременно, а причина этой одновременности — это и есть вся суть данного рейтинга. Более дешёвый токен, которого модель расходует больше, — это не более дешёвая задача, а при максимальных усилиях рассуждения на длинных прогонах агента Claude Opus 5.5 расходует их намного больше.

Что на самом деле оценивает Coding Agent Index

Это не таблица лидеров моделей. Каждая строка в ней — это пара «харнесс — модель» — чекпойнт, запущенный внутри конкретного кодинг-агента, при конкретной настройке уровня усилий. Строка, которую все цитируют, — это Claude Opus 5.5 на уровне усилий max внутри Claude Code, то есть на том самом харнессе, под который Anthropic его создаёт и настраивает. 60 у Claude Opus 5 и 62 у Claude Fable 5.1 получены на том же харнессе и при той же настройке усилий — именно поэтому они и представляют собой честное сравнение; строка для любой из этих моделей в другом кодинг-агенте — это другое измерение, и здесь она не приводится так, будто это то же самое.

Индекс версионируется, и версия важнее, чем название бренда на нём. Публикуемая в настоящее время таблица под названием v1.5 усредняет три оценки, каждая взвешена одинаково, каждая представлена как pass@1, усреднённый по трём попыткам на задачу:

Terminal-Bench 4.0 — агентная работа в оболочке и командной строке: навигация по файловой системе, корректное использование инструментов, восстановление после промежуточного сбоя и завершение многошагового рабочего процесса.

DeepSWE v1.1 — задачи по разработке программного обеспечения, работа по редактированию репозитория.

SWE-Atlas-QnA — вопросы на понимание репозитория, где ответ находится путём чтения кодовой базы, а не её изменения.

Три оценки, одно число и столбец стоимости за задачу, напечатанный рядом с ним. Именно этот столбец стоимости делает данный индекс полезнее, чем один лишь балл, и он же делает главное число труднее для восприятия, чем кажется.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

Три компонента и откуда взялись шесть пунктов

Artificial Analysis опубликовала строки компонентов вместе с составным показателем, и они изменяются неравномерно:

Terminal-Bench 4.063,1% у Claude Opus 5.5 против 54,5% у Claude Opus 5, прирост на 8,6 пункта. Это самое крупное единичное улучшение в наборе.

DeepSWE v1.168,4% против 62,5%, рост на 5,9 пункта.

SWE-Atlas-QnA66,4% против 62,1%, рост на 4,3 пункта.

Усредните эти три показателя, и получится 66,0 — это и есть составной показатель. Интересен характер прироста: меньше всего модель улучшилась в чтении кодовой базы, а больше всего — в управлении оболочкой. Terminal-Bench — это бенчмарк, ближе всего стоящий к тому, что люди на самом деле подразумевают под «агентом для программирования»: длительный цикл, в котором модель выбирает команды, читает вывод и решает, что делать дальше, без человека в цикле между шагами. Скачок на 8,6 пункта здесь говорит о продолжительном использовании инструментов, а не о генерации кода.

Обратите внимание, что это означает относительно того, где ожидать улучшения. Если ваша рабочая нагрузка — «объяснить этот репозиторий», Claude Opus 5.5 — скромное улучшение по сравнению с Claude Opus 5 — четыре пункта. Если ваша рабочая нагрузка — «запускать до тех пор, пока набор тестов не пройдёт, исправляя то, что ломается», это самый большой скачок в таблице.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

Число, напечатанное рядом с рейтингом: $13.04 за задачу

Вот арифметика, из-за которой снижение цены выглядит иначе, чем было объявлено. Прейскурантная цена Anthropic для Claude Opus 5.5 составляет $4.00 за миллион входных токенов и $20.00 за миллион выходных, что ниже, чем $5.00 и $25.00 для Claude Opus 5, а чтение из кеша подешевело на 60% до $0.20 за миллион. Каждая из этих позиций дешевле. Оценка Artificial Analysis того, во сколько обходится задача при максимальных усилиях, всё равно выше:

Стоимость за задачу — $13.04 для Claude Opus 5.5 против $10.79 для Claude Opus 5, рост на 21% по тому же индексу, с тем же харнессом и той же настройкой усилий.

Всего токенов на задачу — примерно 15,6 млн против 11,4 млн, рост примерно на 37%.

Выходных токенов на задачу — примерно 333 000 против 137 000, более чем вдвое. Выход — дорогое направление, и именно эта строка изменилась сильнее всего.

Кэшированный ввод на задачу — примерно 14,6 млн против 10,9 млн, рост примерно на 34%. Сокращение чтения кэша на 60% здесь действительно работает; просто этого недостаточно, чтобы компенсировать задачу, которая читает на треть больше контекста.

Посчитайте по опубликованным тарифам — и картина вырисовывается. Возьмём только выходные токены: 333 000 токенов по $20.00 за миллион — это примерно $6.66 — примерно половина всей оценки в $13.04, и всё из-за одной удвоившейся статьи расходов. Строка чтения из кэша огромна по объёму и почти бесплатна по цене: 14,6 млн токенов по $0.20 за миллион — это меньше $3. Снижение на 20% реально, и снижение цены на кэш реально; при максимальных усилиях в агентном цикле их просто перевешивает модель, которая дольше думает и больше пишет.

Это напрямую влияет на то, как вы планируете бюджет. Если ваша команда выполняет 500 задач кодинг-агентов в день при максимальном уровне усилий, разница между $10.79 и $13.04 составляет около $1,125 в день — примерно $34,000 в месяц — при том же количестве задач. Именно это число стоит показать тому, кто утверждает смену модели, и это не то число, которое подразумевает снижение цены.

Почему $5.98 и $13.04 оба верны

Artificial Analysis опубликовала другую цифру стоимости за задачу для той же модели несколькими днями ранее, и если читать обе вместе без подписей, они выглядят как противоречие. Это не так — это две разные оценки, и разница поучительна.

В Intelligence Index, публикация от 22 сентября оценила стоимость задачи Claude Opus 5.5 в $5.98, примерно на уровне $5.86 у Claude Opus 5, несмотря на примерно 119 000 выходных токенов на задачу против 73 000 у Opus 5. Там снижение цены и дополнительные токены почти точно компенсируют друг друга. На Coding Agent Index, при максимальных усилиях, в Claude Code, та же модель стоит $13.04 против $10.79.

И то, и другое — честные измерения разных рабочих нагрузок. Оценка ответов на вопросы — это короткий обмен репликами; задача агента — это длинный цикл вызовов инструментов с растущим контекстом, и этот рост накапливается в направлении вывода, где цена самая высокая. Практический урок в том, что у вопроса «компенсирует ли снижение цены дополнительные токены?» нет единственного ответа — это зависит от длины задачи, и чем длиннее и более агентной является задача, тем хуже становится компенсация. Если вы рассчитываете бюджет исходя из бенчмарка с короткими ответами, вы недооцените счёт агента.

Три оговорки, которые должны быть в строке

66 — это показатель Claude Code, а не показатель чистой модели. В этом индексе модели намеренно сопоставляются с обвязками (harness) — исходя из того, что маршрутизация инструментов, логика повторных попыток и управление контекстом неотделимы от измеряемой производительности агента. Здесь это играет в пользу Anthropic, поскольку обвязка, в которой её оценивают, — её собственная. Artificial Analysis помечает раздел сравнения обвязок как «скоро появится»; пока его нет, никто не может сказать, какая часть шестибалльного отрыва обусловлена самим чекпойнтом, а какая — инфраструктурой вокруг него.

Собственный показатель Anthropic для Terminal-Bench 4.0 выше, чем у этого компонента, и был проведён Anthropic. В материале о запуске сообщается 66.4% при усилии xhigh; компонент Coding Agent Index составляет 63.1% при max, а отдельный независимый прогон Artificial Analysis измерил 59.6% в собственном стенде на той же версии бенчмарка. Три числа, три конфигурации, три источника. 63.1% в строке выше — это собственный компонент индекса, и его следует сравнивать только с другими числами в этом индексе; показатель вендора 66.4% заявлен вендором, не воспроизведён третьей стороной и относится к другой настройке усилия.

Ревизия индекса смещает позиции. В этом блоге в начале сентября приводились другие строки Coding Agent Index — на более ранней версии той же таблицы, и эти старые показатели несопоставимы с v1.5: сам набор для оценки изменился, когда Terminal-Bench 4.0 заменил предыдущую версию. Сторонние зеркала по-прежнему содержат устаревшие снимки с метками более старых версий. Если число для Claude Opus 5.5 в этом индексе взято не из текущей строки v1.5, не ставьте его рядом с числом для v1.5 и не вычисляйте разницу между ними.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

Что на самом деле развернуть

Рейтинг — это число, полученное при максимальном усилии, а максимальное усилие — это та настройка, с которой почти никто не должен выпускать продукт по умолчанию. У Claude Opus 5.5 есть пять уровней усилия — low, medium, high, xhigh и max, — и по умолчанию модель использует medium. Artificial Analysis не публиковала строки Coding Agent Index при более низких настройках, поэтому экономия затрат там не поддаётся количественной оценке по этому индексу; в Intelligence Index та же модель на medium набрала 51 — столько же, сколько Claude Opus 5 на max, — при $1.34 за задачу. Именно в этом направлении и кроется экономия, и это настройка, а не другая модель.

Реалистичный сценарий — это разделение: сохраняйте максимальное усилие для длинных автономных циклов, где прирост на 8,6 пункта по Terminal-Bench — это именно то, что вы покупаете, а рутинную работу выполняйте при меньшем усилии, где модель всё ещё заметно опережает то, на чём завершил работу Claude Opus 5. Поскольку усилие — это параметр запроса, а не вариант развёртывания, такое разделение представляет собой правило маршрутизации, и обе модели находятся в одном каталоге — у Anthropicпрейскурантные цены передаются с наценкой 0%, так что снижение цены поставщиком вступает в силу для anthropic/claude-opus-5.5 в тот же день, когда оно объявлено, и для A/B-сравнения этих двух моделей на ваших собственных задачах не требуется ни второго договора, ни изменений в коде. Если говорить конкретно о пути с максимальным усилием, где одна задача может оказаться длительным запуском без присмотра, именно автоматическое переключение при сбое не даёт зависшему провайдеру лишить вас всего цикла.

Что всё ещё не измерено?

Три вещи изменили бы эту картину, и ни одной из них пока не существует. Нет сравнения Claude Opus 5.5 с конкурирующим чекпоинтом при сопоставимых усилиях и одинаковом харнессе — все доступные межвендорные сравнения представляют собой две таблицы от вендоров, поставленные рядом. Нет опубликованного прогона Coding Agent Index при среднем или высоком уровне усилий, а именно там находилась бы большая часть продакшн-трафика. И вопрос об атрибуции харнесса — сколько из 66 приходится на модель, а сколько на Claude Code — был признан индексом, но отложен.

То, на что вы можете опереться сегодня, уже и полезнее, чем рейтинг. Claude Opus 5.5 действительно лучше справляется с длительной работой агента, управляемой через shell, чем Claude Opus 5 — это единственный компонент с крупным, устойчивым и независимо полученным выигрышем. Кроме того, при том режиме, где этот выигрыш был измерен, он обходится дороже на задачу — примерно на $2,25 за задачу, и снижение цены за токен эту цифру не покрывает. Развёртывайте его при максимальном уровне усилий там, где цикл длинный и цена сбоя высока; везде в остальных случаях оставляйте более дешёвый режим; и перепроверьте индекс, когда появятся строки с более низким усилием, потому что именно за такую конфигурацию большинство команд реально будет платить. Если вы переходите только ради снижения цены, вы покупаете не то — модель дешевле за токен и дороже за задачу, и только одно из этих двух чисел отражается в вашем счёте.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно