
Claude Opus 5.5 возглавил Epoch Capabilities Index, опередив на 0,84 пункта
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Число — 0.84. Claude Opus 5.5 по состоянию на файл, прочитанный нами 2 октября 2026 года, занимает 167.35 в индексе Epoch Capabilities Index, тогда как GPT-6 Astra — 166.51: разрыв меньше одного пункта по шкале, где опубликованные 95%-е интервалы для этих двух моделей почти полностью перекрываются — 164.0–172.0 для Opus 5.5 против 163.14–171.05 для Astra. Под ними, Claude Sonnet 5.5 показал 165.2, а Claude Fable 5.1 — 164.82, так что четыре верхние позиции независимого композитного рейтинга из более чем пятидесяти бенчмарков разделяют 2.53 пункта, и три из них носят имя одного и того же вендора. Эта упорядоченность реальна в том смысле, что точечные оценки упорядочены. Она не реальна в том смысле, что преимущество в 0.84 пункта не выдерживает собственных планок погрешности, и всё, что стоит сказать об этой таблице лидеров, следует из одновременного удержания обоих этих фактов.
Что такое индекс и чем не является 0,84 пункта
Epoch Capabilities Index — это не табло результатов вендоров. Он создан Epoch AI, независимой исследовательской организацией, как композитный показатель, который сшивает воедино результаты более чем пятидесяти различных бенчмарков в единую шкалу общих способностей, выводя относительную сложность каждого бенчмарка из моделей, которые случайно оказываются сразу в нескольких из них. Методология изложена в статье, написанной совместно с исследователями из команды AGI Safety & Alignment компании Google DeepMind и финансируемой DeepMind, но Epoch прямо заявляет, что индекс — это её собственный продукт и что она обладает всеми правами на него — различие, которое стоит сохранять, когда источник финансирования и публикатор оценки — не одна и та же сторона. Код открыт.
Два свойства этой шкалы важнее, чем заголовок. Первое: ECI намеренно привязан к опорным точкам, а не абсолютен: исходные баллы масштабируются так, чтобы Claude 3.5 Sonnet оказался на отметке 130, а GPT-5 — на 150; это означает, что число в этом индексе имеет смысл только рядом с другим числом из того же файла и никогда само по себе. Второе: у этого индекса нет потолка. Нет 100, к которому можно приближаться, поэтому «верх индекса» — это утверждение о дате, а не о пределе, которого кто-либо достиг.
Вот почему честное прочтение 167.35 против 166.51 — это не «Claude Opus 5.5 — самая способная модель в мире». Оно более узкое и менее цитируемое: согласно моделированию Epoch имеющихся на 2 октября 2026 года данных, две модели неразличимы на вершине, и порядок между ними — это тай-брейк, а не измерение. Опубликованные интервалы говорят об этом прямо — 164.0–172.0 и 163.14–171.05 совпадают в подавляющей части своего диапазона. Любой, кто приводит 0.84 как вердикт, ссылается на артефакт округления.
Блок Anthropic и размер релиза
Более информативная особенность таблицы — не то, кто первый. Это третья и четвёртая строки. Claude Sonnet 5.5, выпущенный 28 сентября и набравший 165,2, располагается на 0,38 балла выше Claude Fable 5.1, выпущенного 1 сентября с результатом 164,82 — настолько близко, что на практике они занимают одну и ту же позицию, и настолько близко, что эта пара находится всего в 2,15 балла ниже верхушки таблицы. Sonnet — продукт среднего уровня в линейке Anthropic, а Fable — модель, которую компания исторически ориентировала на задачи общего рассуждения; то, что теперь обе они окаймляют фронтир снизу, и есть существенное изменение в этом обновлении, а не то, кто именно лидирует.
Собственный поколенческий шаг Anthropic тоже заметен. Claude Opus 5.5 — преемник Claude Opus 5, который Epoch оценивает в 162,94 балла с интервалом от 160,2 до 166,7. Это улучшение на 4,41 пункта примерно за два месяца — с релиза 24 июля до релиза 22 сентября, — более крупный сдвиг, чем 0,84 пункта, разделяющие сегодняшние первое и второе места. При таком прочтении интересная величина в этой таблице — это наклон внутри линии одного вендора, а не разрыв между двумя вендорами на вершине.
Где проходит граница открытых весов
Epoch разделяет модели по доступности, что делает границу открытых весов очевидной без необходимости гадать. Лучшая модель с открытыми весами — это Kimi K3 с 157.61, датированная 16 июля и помеченная как некоммерческая. За ней следуют DeepSeek V4 Pro 0813 с 155.38 и DeepSeek V4.1 Flash с 155.0, оба без ограничений, затем GLM-5.3-Flash с 151.94 и GLM-5.2 с 151.78. Ближайшая открытая модель к вершине, следовательно, отстаёт на 9.74 балла — разрыв в восемнадцать раз больше, чем между первым и вторым местом, и достаточно широкий, чтобы интервалы даже близко не соприкасались.
Эта асимметрия — единственный устойчивый вывод в таблице. Закрытый фронтир — это схватка в пределах трёх очков; расстояние от закрытого фронтира до лучших весов, доступных для скачивания, на порядок больше. Составной индекс, позволяющий сравнивать между поколениями бенчмарков, — именно тот инструмент, чтобы это заметить, потому что он может говорить одно и то же в июле и в сентябре, а не сообщать, что насыщающийся бенчмарк умолк.
Некоторые из соседних строк стоит закрепить для контекста, поскольку именно эти модели читатели фактически сопоставляют с Opus 5.5:
• Claude Sonnet 5 — 156.34, выпущен 30 июня, интервал 153.61–158.81
• Grok 4.6 — 156,61, выпущен 12 августа, интервал от 154,66 до 158,93
• Gemini 3.8 Flash — 156.93, выпущена 2 сентября, интервал от 154.64 до 160.42
• Muse Spark 1.3 — 156.86, выпущен 2 сентября, интервал от 154.73 до 159.56
• GPT-5.6 Sol — 161,8, выпущен 9 июля, интервал от 159,26 до 165,26
Позиция по индексу — это не законопроект

Здесь таблица лидеров перестаёт быть всей историей, потому что две модели на вершине стоят отнюдь не одинаково. В нашем собственном каталоге, где обе представлены по прейскурантной цене провайдера без наценки, Claude Opus 5.5 за $4.00/$20.00 при $0.20 за чтение из кэша, а GPT-6 Astra за $10.00/$50.00 при $1.00 за чтение из кэша — разница в 2,5 раза по обоим направлениям тарифной сетки. Astra также повышает цену после 272 000 токенов промпта, где ввод стоит $20.00, а вывод — $75.00; Opus 5.5 держит $4.00/$20.00 неизменно на всём своём окне в 1 млн токенов. Обе выдают 128 000 выходных токенов.
Посчитайте, во что фактически обходится рабочая нагрузка с длинным контекстом, — префикс на 180 000 токенов, отдаваемый из кэша, и 5 000 сгенерированных токенов. На Opus 5.5 это 180 000 токенов по $0,20 за миллион, или около 3,6 цента, плюс 5 000 по $20 за миллион, или 10 центов: примерно 13,6 цента. На GPT-6 Astra это 180 000 по $1,00, или 18 центов, плюс 5 000 по $50, или 25 центов: примерно 43 цента. Преимущество в 0,84 пункта и разрыв в стоимости в 3,2 раза — это не факты одного и того же рода, и решение о закупке, которое взвешивает только первый из них, взвесило меньшее число.
Fable 5.1 подводит к тому же выводу с другой стороны карточки того же вендора: при цене $10,00/$50,00 она стоит ровно столько же, сколько Astra, а её результат — 164,82 балла, то есть на 2,53 балла ниже Opus 5.5 за те же деньги. Индекс помещает три флагманские модели Anthropic в пределах 2,53 балла друг от друга, а тарифная сетка разводит их в 2,5 раза — и это гораздо лучше описывает выбор, стоящий перед покупателем, чем любой отдельный рейтинг.
Если вы собираетесь спорить о цифре, спорьте на своём трафике.

Причина, по которой этот индекс вообще стоит читать, в том, что его измеряет кто-то, кроме вендоров, — но структура самого композита задаёт условия спора. Калибровка Epoch, её оценки сложности и её подход к моделям, которые пропускают бенчмарки, находятся выше по цепочке от числа в таблице, и ничего из этого читатель не может восстановить по скриншоту. То же верно для главного бенчмарка любого вендора, поэтому полезный ход — не выбирать сторону между ними, а сравнивать их на трафике, который вы контролируете.
Обе эти модели доступны по одному API-ключу в OrcaRouter, который передаёт прейскурантную цену провайдера с наценкой 0%: Claude Opus 5.5 — $4.00/$20.00 при $0.20 за чтение из кэша, и GPT-6 Astra — $10.00/$50.00, при этом тариф для объёма выше 272K применяется точно так, как установлено провайдером. Отправка одного и того же набора промптов в обе модели — это изменение конфигурации, а не второй контракт, и там, где маршрутизируются обе, автоматическое переключение при сбое находится под этим, что важно для решения, находящегося так близко к уровню шума. Таблица лидеров может сказать, что две модели неразличимы. Только ваша собственная оценка может показать, какая из них неразличима на вашей работе.

Что могло бы изменить этот показатель в следующем месяце
Файл Epoch — живой, и три вещи быстро изменят его прочтение. Первое — любая новая оценка фронтирной модели, попадающая в первую четвёрку, поскольку одно дополнительное наблюдение по бенчмарку сдвигает сводный показатель сильнее, когда группа настолько плотная, чем когда есть явный лидер. Второе — дрейф доверительных интервалов: у самых свежих записей они самые широкие, потому что их оценивали по наименьшему числу пересекающихся бенчмарков, так что релизы сентября — наиболее вероятные строки к сдвигу, а июльские — наименее. Третье — достижение бенчмарком насыщения, то есть именно тот сбой, пережить который и был создан индекс: когда компонент перестаёт различать, Epoch перевзвешивает композицию, вместо того чтобы позволить преимуществу модели исчезнуть вместе с тестом.
Пока что защитимое резюме — это узкое. Claude Opus 5.5 удерживает первое место в Epoch Capabilities Index с показателем 167,35 благодаря отрыву в 0,84 балла, который не подтверждается его собственным доверительным интервалом, Claude Sonnet 5.5 поднялся до отставания всего в 2,15 балла от лидера из среднего сегмента той же линейки, а сегмент открытых весов отстаёт от всех них более чем на девять баллов. Лидер — это подбрасывание монеты между двумя поставщиками. А разрыв в цене в четыре пункта между ними — не таков.
Сравнение в этой статье4
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
