
Claude Opus 5.5 возглавляет Coding Agent Index с результатом 66 — а счёт за выполнение задач растёт на 21%
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 180 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Поставщик снизилClaude Opus 5.5 цены на токены на 20% 22 сентября 2026 года. Два дня спустя Artificial Analysis опубликовала измерение для кодинг-агента, показывающее, что это снижение сделало со счётом агента: стоимость одной задачи выросла на 21%, до $13.04 против $10.79, которые тот же индекс насчитывает для Claude Opus 5. Оценка тоже выросла — 66 в Coding Agent Index, который Artificial Analysis называет самым высоким из измеренных ею: на шесть пунктов больше, чем у Claude Opus 5, и на четыре — чем у Claude Fable 5.1 в той же конфигурации. И то, и другое верно одновременно, а причина этой одновременности — это и есть вся суть данного рейтинга. Более дешёвый токен, которого модель расходует больше, — это не более дешёвая задача, а при максимальных усилиях рассуждения на длинных прогонах агента Claude Opus 5.5 расходует их намного больше.
Что на самом деле оценивает Coding Agent Index
Это не таблица лидеров моделей. Каждая строка в ней — это пара «харнесс — модель» — чекпойнт, запущенный внутри конкретного кодинг-агента, при конкретной настройке уровня усилий. Строка, которую все цитируют, — это Claude Opus 5.5 на уровне усилий max внутри Claude Code, то есть на том самом харнессе, под который Anthropic его создаёт и настраивает. 60 у Claude Opus 5 и 62 у Claude Fable 5.1 получены на том же харнессе и при той же настройке усилий — именно поэтому они и представляют собой честное сравнение; строка для любой из этих моделей в другом кодинг-агенте — это другое измерение, и здесь она не приводится так, будто это то же самое.
Индекс версионируется, и версия важнее, чем название бренда на нём. Публикуемая в настоящее время таблица под названием v1.5 усредняет три оценки, каждая взвешена одинаково, каждая представлена как pass@1, усреднённый по трём попыткам на задачу:
• Terminal-Bench 4.0 — агентная работа в оболочке и командной строке: навигация по файловой системе, корректное использование инструментов, восстановление после промежуточного сбоя и завершение многошагового рабочего процесса.
• DeepSWE v1.1 — задачи по разработке программного обеспечения, работа по редактированию репозитория.
• SWE-Atlas-QnA — вопросы на понимание репозитория, где ответ находится путём чтения кодовой базы, а не её изменения.
Три оценки, одно число и столбец стоимости за задачу, напечатанный рядом с ним. Именно этот столбец стоимости делает данный индекс полезнее, чем один лишь балл, и он же делает главное число труднее для восприятия, чем кажется.

Три компонента и откуда взялись шесть пунктов
Artificial Analysis опубликовала строки компонентов вместе с составным показателем, и они изменяются неравномерно:
• Terminal-Bench 4.0 — 63,1% у Claude Opus 5.5 против 54,5% у Claude Opus 5, прирост на 8,6 пункта. Это самое крупное единичное улучшение в наборе.
• DeepSWE v1.1 — 68,4% против 62,5%, рост на 5,9 пункта.
• SWE-Atlas-QnA — 66,4% против 62,1%, рост на 4,3 пункта.
Усредните эти три показателя, и получится 66,0 — это и есть составной показатель. Интересен характер прироста: меньше всего модель улучшилась в чтении кодовой базы, а больше всего — в управлении оболочкой. Terminal-Bench — это бенчмарк, ближе всего стоящий к тому, что люди на самом деле подразумевают под «агентом для программирования»: длительный цикл, в котором модель выбирает команды, читает вывод и решает, что делать дальше, без человека в цикле между шагами. Скачок на 8,6 пункта здесь говорит о продолжительном использовании инструментов, а не о генерации кода.
Обратите внимание, что это означает относительно того, где ожидать улучшения. Если ваша рабочая нагрузка — «объяснить этот репозиторий», Claude Opus 5.5 — скромное улучшение по сравнению с Claude Opus 5 — четыре пункта. Если ваша рабочая нагрузка — «запускать до тех пор, пока набор тестов не пройдёт, исправляя то, что ломается», это самый большой скачок в таблице.

Число, напечатанное рядом с рейтингом: $13.04 за задачу
Вот арифметика, из-за которой снижение цены выглядит иначе, чем было объявлено. Прейскурантная цена Anthropic для Claude Opus 5.5 составляет $4.00 за миллион входных токенов и $20.00 за миллион выходных, что ниже, чем $5.00 и $25.00 для Claude Opus 5, а чтение из кеша подешевело на 60% до $0.20 за миллион. Каждая из этих позиций дешевле. Оценка Artificial Analysis того, во сколько обходится задача при максимальных усилиях, всё равно выше:
• Стоимость за задачу — $13.04 для Claude Opus 5.5 против $10.79 для Claude Opus 5, рост на 21% по тому же индексу, с тем же харнессом и той же настройкой усилий.
• Всего токенов на задачу — примерно 15,6 млн против 11,4 млн, рост примерно на 37%.
• Выходных токенов на задачу — примерно 333 000 против 137 000, более чем вдвое. Выход — дорогое направление, и именно эта строка изменилась сильнее всего.
• Кэшированный ввод на задачу — примерно 14,6 млн против 10,9 млн, рост примерно на 34%. Сокращение чтения кэша на 60% здесь действительно работает; просто этого недостаточно, чтобы компенсировать задачу, которая читает на треть больше контекста.
Посчитайте по опубликованным тарифам — и картина вырисовывается. Возьмём только выходные токены: 333 000 токенов по $20.00 за миллион — это примерно $6.66 — примерно половина всей оценки в $13.04, и всё из-за одной удвоившейся статьи расходов. Строка чтения из кэша огромна по объёму и почти бесплатна по цене: 14,6 млн токенов по $0.20 за миллион — это меньше $3. Снижение на 20% реально, и снижение цены на кэш реально; при максимальных усилиях в агентном цикле их просто перевешивает модель, которая дольше думает и больше пишет.
Это напрямую влияет на то, как вы планируете бюджет. Если ваша команда выполняет 500 задач кодинг-агентов в день при максимальном уровне усилий, разница между $10.79 и $13.04 составляет около $1,125 в день — примерно $34,000 в месяц — при том же количестве задач. Именно это число стоит показать тому, кто утверждает смену модели, и это не то число, которое подразумевает снижение цены.
Почему $5.98 и $13.04 оба верны
Artificial Analysis опубликовала другую цифру стоимости за задачу для той же модели несколькими днями ранее, и если читать обе вместе без подписей, они выглядят как противоречие. Это не так — это две разные оценки, и разница поучительна.
В Intelligence Index, публикация от 22 сентября оценила стоимость задачи Claude Opus 5.5 в $5.98, примерно на уровне $5.86 у Claude Opus 5, несмотря на примерно 119 000 выходных токенов на задачу против 73 000 у Opus 5. Там снижение цены и дополнительные токены почти точно компенсируют друг друга. На Coding Agent Index, при максимальных усилиях, в Claude Code, та же модель стоит $13.04 против $10.79.
И то, и другое — честные измерения разных рабочих нагрузок. Оценка ответов на вопросы — это короткий обмен репликами; задача агента — это длинный цикл вызовов инструментов с растущим контекстом, и этот рост накапливается в направлении вывода, где цена самая высокая. Практический урок в том, что у вопроса «компенсирует ли снижение цены дополнительные токены?» нет единственного ответа — это зависит от длины задачи, и чем длиннее и более агентной является задача, тем хуже становится компенсация. Если вы рассчитываете бюджет исходя из бенчмарка с короткими ответами, вы недооцените счёт агента.
Три оговорки, которые должны быть в строке
66 — это показатель Claude Code, а не показатель чистой модели. В этом индексе модели намеренно сопоставляются с обвязками (harness) — исходя из того, что маршрутизация инструментов, логика повторных попыток и управление контекстом неотделимы от измеряемой производительности агента. Здесь это играет в пользу Anthropic, поскольку обвязка, в которой её оценивают, — её собственная. Artificial Analysis помечает раздел сравнения обвязок как «скоро появится»; пока его нет, никто не может сказать, какая часть шестибалльного отрыва обусловлена самим чекпойнтом, а какая — инфраструктурой вокруг него.
Собственный показатель Anthropic для Terminal-Bench 4.0 выше, чем у этого компонента, и был проведён Anthropic. В материале о запуске сообщается 66.4% при усилии xhigh; компонент Coding Agent Index составляет 63.1% при max, а отдельный независимый прогон Artificial Analysis измерил 59.6% в собственном стенде на той же версии бенчмарка. Три числа, три конфигурации, три источника. 63.1% в строке выше — это собственный компонент индекса, и его следует сравнивать только с другими числами в этом индексе; показатель вендора 66.4% заявлен вендором, не воспроизведён третьей стороной и относится к другой настройке усилия.
Ревизия индекса смещает позиции. В этом блоге в начале сентября приводились другие строки Coding Agent Index — на более ранней версии той же таблицы, и эти старые показатели несопоставимы с v1.5: сам набор для оценки изменился, когда Terminal-Bench 4.0 заменил предыдущую версию. Сторонние зеркала по-прежнему содержат устаревшие снимки с метками более старых версий. Если число для Claude Opus 5.5 в этом индексе взято не из текущей строки v1.5, не ставьте его рядом с числом для v1.5 и не вычисляйте разницу между ними.

Что на самом деле развернуть
Рейтинг — это число, полученное при максимальном усилии, а максимальное усилие — это та настройка, с которой почти никто не должен выпускать продукт по умолчанию. У Claude Opus 5.5 есть пять уровней усилия — low, medium, high, xhigh и max, — и по умолчанию модель использует medium. Artificial Analysis не публиковала строки Coding Agent Index при более низких настройках, поэтому экономия затрат там не поддаётся количественной оценке по этому индексу; в Intelligence Index та же модель на medium набрала 51 — столько же, сколько Claude Opus 5 на max, — при $1.34 за задачу. Именно в этом направлении и кроется экономия, и это настройка, а не другая модель.
Реалистичный сценарий — это разделение: сохраняйте максимальное усилие для длинных автономных циклов, где прирост на 8,6 пункта по Terminal-Bench — это именно то, что вы покупаете, а рутинную работу выполняйте при меньшем усилии, где модель всё ещё заметно опережает то, на чём завершил работу Claude Opus 5. Поскольку усилие — это параметр запроса, а не вариант развёртывания, такое разделение представляет собой правило маршрутизации, и обе модели находятся в одном каталоге — у Anthropicпрейскурантные цены передаются с наценкой 0%, так что снижение цены поставщиком вступает в силу для anthropic/claude-opus-5.5 в тот же день, когда оно объявлено, и для A/B-сравнения этих двух моделей на ваших собственных задачах не требуется ни второго договора, ни изменений в коде. Если говорить конкретно о пути с максимальным усилием, где одна задача может оказаться длительным запуском без присмотра, именно автоматическое переключение при сбое не даёт зависшему провайдеру лишить вас всего цикла.
Что всё ещё не измерено?
Три вещи изменили бы эту картину, и ни одной из них пока не существует. Нет сравнения Claude Opus 5.5 с конкурирующим чекпоинтом при сопоставимых усилиях и одинаковом харнессе — все доступные межвендорные сравнения представляют собой две таблицы от вендоров, поставленные рядом. Нет опубликованного прогона Coding Agent Index при среднем или высоком уровне усилий, а именно там находилась бы большая часть продакшн-трафика. И вопрос об атрибуции харнесса — сколько из 66 приходится на модель, а сколько на Claude Code — был признан индексом, но отложен.
То, на что вы можете опереться сегодня, уже и полезнее, чем рейтинг. Claude Opus 5.5 действительно лучше справляется с длительной работой агента, управляемой через shell, чем Claude Opus 5 — это единственный компонент с крупным, устойчивым и независимо полученным выигрышем. Кроме того, при том режиме, где этот выигрыш был измерен, он обходится дороже на задачу — примерно на $2,25 за задачу, и снижение цены за токен эту цифру не покрывает. Развёртывайте его при максимальном уровне усилий там, где цикл длинный и цена сбоя высока; везде в остальных случаях оставляйте более дешёвый режим; и перепроверьте индекс, когда появятся строки с более низким усилием, потому что именно за такую конфигурацию большинство команд реально будет платить. Если вы переходите только ради снижения цены, вы покупаете не то — модель дешевле за токен и дороже за задачу, и только одно из этих двух чисел отражается в вашем счёте.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
