Сгенерированная титульная карточка для статьи об Epoch Capabilities Index с заголовком «Claude Opus 5.5 возглавляет Epoch Capabilities Index» над светло-голубой моноширинной строкой «167.35 против 166.51» и серой подстрокой «Входит в топ-2 по композитному показателю из 50+ бенчмарков», с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Claude Opus 5.5 возглавил Epoch Capabilities Index, опередив на 0,84 пункта

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Число — 0.84. Claude Opus 5.5 по состоянию на файл, прочитанный нами 2 октября 2026 года, занимает 167.35 в индексе Epoch Capabilities Index, тогда как GPT-6 Astra — 166.51: разрыв меньше одного пункта по шкале, где опубликованные 95%-е интервалы для этих двух моделей почти полностью перекрываются — 164.0–172.0 для Opus 5.5 против 163.14–171.05 для Astra. Под ними, Claude Sonnet 5.5 показал 165.2, а Claude Fable 5.1 — 164.82, так что четыре верхние позиции независимого композитного рейтинга из более чем пятидесяти бенчмарков разделяют 2.53 пункта, и три из них носят имя одного и того же вендора. Эта упорядоченность реальна в том смысле, что точечные оценки упорядочены. Она не реальна в том смысле, что преимущество в 0.84 пункта не выдерживает собственных планок погрешности, и всё, что стоит сказать об этой таблице лидеров, следует из одновременного удержания обоих этих фактов.

Что такое индекс и чем не является 0,84 пункта

Epoch Capabilities Index — это не табло результатов вендоров. Он создан Epoch AI, независимой исследовательской организацией, как композитный показатель, который сшивает воедино результаты более чем пятидесяти различных бенчмарков в единую шкалу общих способностей, выводя относительную сложность каждого бенчмарка из моделей, которые случайно оказываются сразу в нескольких из них. Методология изложена в статье, написанной совместно с исследователями из команды AGI Safety & Alignment компании Google DeepMind и финансируемой DeepMind, но Epoch прямо заявляет, что индекс — это её собственный продукт и что она обладает всеми правами на него — различие, которое стоит сохранять, когда источник финансирования и публикатор оценки — не одна и та же сторона. Код открыт.

Два свойства этой шкалы важнее, чем заголовок. Первое: ECI намеренно привязан к опорным точкам, а не абсолютен: исходные баллы масштабируются так, чтобы Claude 3.5 Sonnet оказался на отметке 130, а GPT-5 — на 150; это означает, что число в этом индексе имеет смысл только рядом с другим числом из того же файла и никогда само по себе. Второе: у этого индекса нет потолка. Нет 100, к которому можно приближаться, поэтому «верх индекса» — это утверждение о дате, а не о пределе, которого кто-либо достиг.

Вот почему честное прочтение 167.35 против 166.51 — это не «Claude Opus 5.5 — самая способная модель в мире». Оно более узкое и менее цитируемое: согласно моделированию Epoch имеющихся на 2 октября 2026 года данных, две модели неразличимы на вершине, и порядок между ними — это тай-брейк, а не измерение. Опубликованные интервалы говорят об этом прямо — 164.0–172.0 и 163.14–171.05 совпадают в подавляющей части своего диапазона. Любой, кто приводит 0.84 как вердикт, ссылается на артефакт округления.

Блок Anthropic и размер релиза

Более информативная особенность таблицы — не то, кто первый. Это третья и четвёртая строки. Claude Sonnet 5.5, выпущенный 28 сентября и набравший 165,2, располагается на 0,38 балла выше Claude Fable 5.1, выпущенного 1 сентября с результатом 164,82 — настолько близко, что на практике они занимают одну и ту же позицию, и настолько близко, что эта пара находится всего в 2,15 балла ниже верхушки таблицы. Sonnet — продукт среднего уровня в линейке Anthropic, а Fable — модель, которую компания исторически ориентировала на задачи общего рассуждения; то, что теперь обе они окаймляют фронтир снизу, и есть существенное изменение в этом обновлении, а не то, кто именно лидирует.

Собственный поколенческий шаг Anthropic тоже заметен. Claude Opus 5.5 — преемник Claude Opus 5, который Epoch оценивает в 162,94 балла с интервалом от 160,2 до 166,7. Это улучшение на 4,41 пункта примерно за два месяца — с релиза 24 июля до релиза 22 сентября, — более крупный сдвиг, чем 0,84 пункта, разделяющие сегодняшние первое и второе места. При таком прочтении интересная величина в этой таблице — это наклон внутри линии одного вендора, а не разрыв между двумя вендорами на вершине.

Где проходит граница открытых весов

Epoch разделяет модели по доступности, что делает границу открытых весов очевидной без необходимости гадать. Лучшая модель с открытыми весами — это Kimi K3 с 157.61, датированная 16 июля и помеченная как некоммерческая. За ней следуют DeepSeek V4 Pro 0813 с 155.38 и DeepSeek V4.1 Flash с 155.0, оба без ограничений, затем GLM-5.3-Flash с 151.94 и GLM-5.2 с 151.78. Ближайшая открытая модель к вершине, следовательно, отстаёт на 9.74 балла — разрыв в восемнадцать раз больше, чем между первым и вторым местом, и достаточно широкий, чтобы интервалы даже близко не соприкасались.

Эта асимметрия — единственный устойчивый вывод в таблице. Закрытый фронтир — это схватка в пределах трёх очков; расстояние от закрытого фронтира до лучших весов, доступных для скачивания, на порядок больше. Составной индекс, позволяющий сравнивать между поколениями бенчмарков, — именно тот инструмент, чтобы это заметить, потому что он может говорить одно и то же в июле и в сентябре, а не сообщать, что насыщающийся бенчмарк умолк.

Некоторые из соседних строк стоит закрепить для контекста, поскольку именно эти модели читатели фактически сопоставляют с Opus 5.5:

• Claude Sonnet 5 — 156.34, выпущен 30 июня, интервал 153.61–158.81

• Grok 4.6 — 156,61, выпущен 12 августа, интервал от 154,66 до 158,93

• Gemini 3.8 Flash — 156.93, выпущена 2 сентября, интервал от 154.64 до 160.42

• Muse Spark 1.3 — 156.86, выпущен 2 сентября, интервал от 154.73 до 159.56

• GPT-5.6 Sol — 161,8, выпущен 9 июля, интервал от 159,26 до 165,26

Позиция по индексу — это не законопроект

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

Здесь таблица лидеров перестаёт быть всей историей, потому что две модели на вершине стоят отнюдь не одинаково. В нашем собственном каталоге, где обе представлены по прейскурантной цене провайдера без наценки, Claude Opus 5.5 за $4.00/$20.00 при $0.20 за чтение из кэша, а GPT-6 Astra за $10.00/$50.00 при $1.00 за чтение из кэша — разница в 2,5 раза по обоим направлениям тарифной сетки. Astra также повышает цену после 272 000 токенов промпта, где ввод стоит $20.00, а вывод — $75.00; Opus 5.5 держит $4.00/$20.00 неизменно на всём своём окне в 1 млн токенов. Обе выдают 128 000 выходных токенов.

Посчитайте, во что фактически обходится рабочая нагрузка с длинным контекстом, — префикс на 180 000 токенов, отдаваемый из кэша, и 5 000 сгенерированных токенов. На Opus 5.5 это 180 000 токенов по $0,20 за миллион, или около 3,6 цента, плюс 5 000 по $20 за миллион, или 10 центов: примерно 13,6 цента. На GPT-6 Astra это 180 000 по $1,00, или 18 центов, плюс 5 000 по $50, или 25 центов: примерно 43 цента. Преимущество в 0,84 пункта и разрыв в стоимости в 3,2 раза — это не факты одного и того же рода, и решение о закупке, которое взвешивает только первый из них, взвесило меньшее число.

Fable 5.1 подводит к тому же выводу с другой стороны карточки того же вендора: при цене $10,00/$50,00 она стоит ровно столько же, сколько Astra, а её результат — 164,82 балла, то есть на 2,53 балла ниже Opus 5.5 за те же деньги. Индекс помещает три флагманские модели Anthropic в пределах 2,53 балла друг от друга, а тарифная сетка разводит их в 2,5 раза — и это гораздо лучше описывает выбор, стоящий перед покупателем, чем любой отдельный рейтинг.

Если вы собираетесь спорить о цифре, спорьте на своём трафике.

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

Причина, по которой этот индекс вообще стоит читать, в том, что его измеряет кто-то, кроме вендоров, — но структура самого композита задаёт условия спора. Калибровка Epoch, её оценки сложности и её подход к моделям, которые пропускают бенчмарки, находятся выше по цепочке от числа в таблице, и ничего из этого читатель не может восстановить по скриншоту. То же верно для главного бенчмарка любого вендора, поэтому полезный ход — не выбирать сторону между ними, а сравнивать их на трафике, который вы контролируете.

Обе эти модели доступны по одному API-ключу в OrcaRouter, который передаёт прейскурантную цену провайдера с наценкой 0%: Claude Opus 5.5 — $4.00/$20.00 при $0.20 за чтение из кэша, и GPT-6 Astra — $10.00/$50.00, при этом тариф для объёма выше 272K применяется точно так, как установлено провайдером. Отправка одного и того же набора промптов в обе модели — это изменение конфигурации, а не второй контракт, и там, где маршрутизируются обе, автоматическое переключение при сбое находится под этим, что важно для решения, находящегося так близко к уровню шума. Таблица лидеров может сказать, что две модели неразличимы. Только ваша собственная оценка может показать, какая из них неразличима на вашей работе.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

Что могло бы изменить этот показатель в следующем месяце

Файл Epoch — живой, и три вещи быстро изменят его прочтение. Первое — любая новая оценка фронтирной модели, попадающая в первую четвёрку, поскольку одно дополнительное наблюдение по бенчмарку сдвигает сводный показатель сильнее, когда группа настолько плотная, чем когда есть явный лидер. Второе — дрейф доверительных интервалов: у самых свежих записей они самые широкие, потому что их оценивали по наименьшему числу пересекающихся бенчмарков, так что релизы сентября — наиболее вероятные строки к сдвигу, а июльские — наименее. Третье — достижение бенчмарком насыщения, то есть именно тот сбой, пережить который и был создан индекс: когда компонент перестаёт различать, Epoch перевзвешивает композицию, вместо того чтобы позволить преимуществу модели исчезнуть вместе с тестом.

Пока что защитимое резюме — это узкое. Claude Opus 5.5 удерживает первое место в Epoch Capabilities Index с показателем 167,35 благодаря отрыву в 0,84 балла, который не подтверждается его собственным доверительным интервалом, Claude Sonnet 5.5 поднялся до отставания всего в 2,15 балла от лидера из среднего сегмента той же линейки, а сегмент открытых весов отстаёт от всех них более чем на девять баллов. Лидер — это подбрасывание монеты между двумя поставщиками. А разрыв в цене в четыре пункта между ними — не таков.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно