
Claude Sonnet 5.5 на равных с Claude Fable 5.1 в Epoch Capabilities Index
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Ничья на вершине таблицы лидеров обычно — самое неинтересное, что на ней есть. Эта — исключение, потому что две модели, делящие первое место, стоят неодинаково. В файле Epoch Capabilities Index, обновлённом 1 октября 2026 года, Claude Sonnet 5.5 и Claude Fable 5.1 обе имеют показатель 165 — третья и четвёртая строки из 253 отслеживаемых моделей — на два пункта отставая от Claude Opus 5.5 и GPT-6 Astra, которые сами делят 167, и на два пункта опережая Claude Opus 5 с его 163. Claude Sonnet 5.5 вышел 28 сентября 2026 года по цене $2 за миллион входных токенов и $10 за миллион выходных. Claude Fable 5.1 вышел 1 сентября по цене $10 и $50. Одно число говорит, что эти две модели взаимозаменяемы по общей способности. Пятикратная цена за выходные токены говорит, что это не так. Верно и то, и другое, а причина, по которой оба утверждения верны одновременно, — это та часть таблицы, которую никто не цитирует.
Что на самом деле представляет собой индекс и кто проводит измерения
ECI — это не рейтинг поставщиков. Он создан Epoch AI, независимой исследовательской организацией, как композит, объединяющий оценки более чем пятидесяти различных бенчмарков в единую шкалу общих способностей, при этом относительная сложность каждого бенчмарка выводится из моделей, которые появляются сразу в нескольких из них. Методология изложена в статье «A Rosetta Stone for AI Benchmarks», финансируемой Google DeepMind и написанной совместно с исследователями из её команды AGI Safety & Alignment, — но Epoch прямо заявляет, что индекс является её собственным продуктом и что она обладает всеми правами на него, а код подгонки открыт. Это различие имеет значение, когда финансирующая исследование сторона и публикующая оценку сторона не совпадают.
Два свойства этой шкалы определяют, как можно читать число на ней. Первое — ECI привязан к опорным значениям, а не абсолютен: сырые значения пересчитываются так, чтобы Claude 3.5 Sonnet оказывался на 130, а GPT-5 — на 150, а значит, цифра что-то означает только рядом с другой цифрой из того же файла. Второе — верхнего предела нет. Нет 100, к которому можно было бы приближаться, поэтому «верх индекса» — это утверждение о дате, а не о пределе, которого кто-либо достиг.
Третье свойство — это то, что превращает ничью в историю. Интервалы, публикуемые рядом с каждым результатом, — 90%-ные бутстрэп-интервалы, построенные путём пятисоткратного ресэмплинга собственных наблюдаемых результатов каждой модели на бенчмарках, — одинаковы для двух моделей при значении 165: от 162 до 169 для Claude Sonnet 5.5 и от 162 до 169 для Claude Fable 5.1. А вот количества, которые их породили, — нет. Значение 165 у Claude Sonnet 5.5 подогнано по 11 оценкам на бенчмарках. У Claude Fable 5.1 — по 20.
Почему один и тот же интервал не означает одни и те же доказательства
ECI требует минимум четырёх оценок на бенчмарках, прежде чем модель вообще получит балл, так что оба показателя с запасом преодолевают этот порог. Но интервал говорит о том, насколько разбросаны собственные результаты модели, а не о том, сколько их, — и именно поэтому две модели могут показать одинаковый диапазон вокруг одной и той же точечной оценки, хотя одна из них опирается примерно на вдвое меньше данных. Считайте обе 165 одинаково надёжными — и вы прочитаете интервал как поправку на размер выборки, которой он не является.
Асимметрия имеет практическое значение для сроков. Epoch переобучает всю модель совместно по всем данным всякий раз, когда поступают новые оценки, поэтому показатель модели может измениться, даже если в самой модели ничего не поменялось. У модели с 11 наблюдениями больше пространства для изменения, чем у модели с 20, из-за чего Claude Sonnet 5.5 из этой пары вероятнее сдвинется в следующей ревизии — в любую сторону.
Собственная формулировка Epoch относительно текущего результата уже, чем заголовки, которые она породила. В резюме организации об обновлении сначала говорится, что Claude Opus 5.5 занимает верхнюю строчку с 167 баллами, незначительно опережая GPT-6 Astra, а во втором предложении отмечается, что Claude Sonnet 5.5 «примерно сравнялся» с Claude Fable 5.1 с показателем 165. «Примерно сравнялся» — ключевая фраза, и опубликованные интервалы — причина, по которой именно она верна.
Где два профиля на самом деле расходятся

Уровень по композитному показателю не означает уровень по отдельным частям. Epoch публикует панель по каждому бенчмарку на странице каждой модели, и шесть бенчмарков присутствуют как на странице Claude Sonnet 5.5, так и на странице Claude Fable 5.1 — что делает их единственными шестью, для которых сопоставимое сравнение доступно непосредственно из самого индекса.
• Головоломки в детективной игре — Claude Sonnet 5.5 65% против Claude Fable 5.1 58%
• Уровни 1–3 FrontierMath (v2) — Claude Sonnet 5.5 89% против Claude Fable 5.1 90%
• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80% против Claude Fable 5.1 88%
• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% против Claude Fable 5.1 100%
• Бенчмарк по сборке мебели — Claude Sonnet 5.5 75% против Claude Fable 5.1 70%
• SimpleQA Verified — Claude Sonnet 5.5 47% против Claude Fable 5.1 71%
Сдвиг на четыре пункта в ту или иную сторону на таком плотном композите, и лежащая в основе картина далека от симметрии. Claude Sonnet 5.5 впереди там, где работа игровая и мультимодальная — решение головоломок, физическая сборка — и на одном уровне в соревновательной математике. Claude Sonnet 5.1 опережает на 8 пунктов на высшем уровне FrontierMath и на 24 пункта на SimpleQA Verified, экзамене на знание мира, где результат 47% {{1}}превосходит{{/1}} результат 71% {{2}}в общей панели{{/2}}. Покупатель, выбирающий между этими двумя моделями, выбирает между двумя прочтениями одной и той же способности; он выбирает между более дешёвой моделью, которая сильнее в одних задачах, и более дорогой, которая сильнее в других, — при этом индекс общего назначения {{3}}отказывается{{/3}} их разделять.
Индекс Epoch также прямо указывает: лидерство по отдельному бенчмарку не обязательно должно отражаться в сводном показателе. Бенчмарки не взвешиваются по точности, и модель, специализирующаяся на чём-то одном, может набрать меньше, чем соперник иного профиля, даже лидируя в отдельных тестах — в его документации об этом сказано прямо. Это не недостаток, который пытаются оправдать; именно для этого и нужен сводный показатель по пятидесяти с лишним тестам.
Два независимых прибора указывают в противоположных направлениях

Существует второе независимое измерение, и оно не согласуется с первым в том, какая из этих двух моделей впереди. В индексе интеллекта Artificial Analysis показатели, которые приводит наш собственный каталог для этих двух моделей, составляют 56 для Claude Sonnet 5.5 и 53.4 для Claude Fable 5.1; они взяты из одной и той же версии этого индекса и потому основаны на одной и той же выборке оценённых моделей. Разница в три пункта в пользу более дешёвой модели — тогда как Epoch считает их идентичными.
Ни одно из этих двух прочтений не ошибочно, и использовать их нужно так: обращать внимание на то, в чём они расходятся. Эти два индекса охватывают разные наборы бенчмарков и по-разному их взвешивают; композит Epoch построен так, чтобы выдерживать насыщение бенчмарков, тогда как индекс Artificial Analysis — это просто агрегат другого набора. Когда пара моделей настолько близка, выбор инструмента значит больше, чем измеряемый разрыв. Читателю, который хочет выбрать большее из двух соседних чисел, следует смотреть на панель общих отдельных бенчмарков выше, а не на любой из сводных показателей, потому что это единственное место, где две модели сравниваются друг с другом на одном и том же тесте.
Есть ещё один фрагмент контекста, которого не несёт составной показатель, а Epoch несёт: дата выпуска. Claude Fable 5.1 сегодня занимает четвёртое место среди 253 отслеживаемых моделей. На момент собственного выпуска 1 сентября 2026 года она занимала первое место среди 247 моделей, отслеживаемых тогда. Её веса не изменились. Передовой рубеж просто ушёл вперёд неё на шесть позиций за месяц — такова форма всей таблицы, и поэтому ежемесячное значение индекса — это снимок, а не вердикт.
Чего стоит разница и где находится дешёвая сторона

Одинаковый уровень по общим возможностям и разница в 2,5 раза по входу и в 5 раз по выходу — это всё практическое содержание данного материала. Обе модели представлены в нашем собственном каталоге — anthropic/claude-sonnet-5.5 по цене $2.00 за миллион входных и $10.00 за миллион выходных токенов при $0.20 за чтение из кэша, а anthropic/claude-fable-5.1 — по $10.00 и $50.00 при $0.25 за чтение из кэша — и обе передаются по собственной прайсовой цене провайдера без добавления наценки, поэтому изменение тарифов поставщика отражается у нас в тот же день, когда оно происходит у них.
Повторяемость важнее заголовка. Возьмём рабочую нагрузку, которая отправляет префикс в 120 000 токенов из кэша и генерирует 8 000 токенов вывода, запускается раз в день в течение месяца. На Claude Sonnet 5.5 этот префикс стоит 120 000 токенов по $0,20 за миллион, примерно 2,4 цента, плюс 8 000 по $10 за миллион — 8 центов, итого примерно 10,4 цента за запуск, или около $3,12 за тридцать дней. На Claude Fable 5.1 тот же префикс — 120 000 по $0,25, 3 цента, плюс 8 000 по $50, 40 центов — примерно 43 цента за запуск, или $12,90 за месяц. Обе модели обслуживают одно и то же окно в 1 млн токенов с выводом до 128K, так что разница в тарифной карте, а не в верхней границе.
В противовес этому шесть общих бенчмарков показывают, в какую сторону дополнительные деньги что-то дают. Команда, чья работа похожа на FrontierMath Tier 4 или на открытое воспроизведение фактов, покупает реальный разрыв в 8–24 балла на этих тестах, платя вчетверо больше; команда, чья работа похожа на решение головоломок или мультимодальную сборку, покупает 5–7 баллов в другую сторону, платя меньшую сумму. На единой платформе это не два отдельных закупочных решения. Обе модели стоят за одним API-ключом среди более чем 200 моделей, так что сравнить их на собственном трафике — это изменение конфигурации, а не второй контракт, а там, где маршрутизируются обе, в основе лежит автоматическое переключение при сбое — что важно, когда два независимых инструмента расходятся во мнениях о том, какая из них впереди.
Что могло бы изменить это показание?
Три вещи могли бы это изменить, и только одна из них связана с той или иной моделью.
Первое — больше оценок по бенчмаркам: Claude Sonnet 5.5 вошёл в индекс четыре дня назад с 11 оценками за спиной; каждая дополнительная оценка сужает его интервал и может сдвинуть его точечную оценку, а совместная переподгонка означает, что это смещение не ограничивается новой строкой.
Второй — это появление ещё одной фронтирной модели. Четыре верхние строки укладываются в четыре пункта, причём внутри этого разброса есть две ничьи, так что один хорошо оценённый новичок попадает внутрь этого кластера, а не ниже него, — а опубликованные интервалы, которые перекрываются у всех четырёх, означают, что порядок между ними — это тай-брейк, а не измерение.
Третье — цена самих моделей, которую не отслеживает ни один индекс. Разрыв, на котором держится эта статья, — это разрыв в тарифной сетке: $2 и $10 против $10 и $50 сегодня. Изменение любой из этих сеток меняет решение, не меняя ни одной оценки возможностей.
Оправданное резюме — узкое. В сводном показателе Epoch AI, в файле, обновлённом 1 октября 2026 года, Claude Sonnet 5.5 и Claude Fable 5.1 — одно и то же число: 165, они делят третье место, при одинаковых опубликованных интервалах, опирающихся на разный объём доказательств. В отдельном инструменте Artificial Analysis те же две модели различаются на три пункта. В шести бенчмарках, где индекс сравнивает их напрямую, они обмениваются лидерством по доменам, а не идут вровень. А по тарифной сетке они вовсе не близки. Единственное, чего это прочтение не выдержит, — это фразы, которой его, скорее всего, процитируют: что модели эквивалентны.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
