Сгенерированная hero-карточка для сравнения GPT-6.1 Sol и Claude Opus 5.5 с заголовком «Настоящий разрыв, распределённый неравномерно», с двумя информационными карточками: «GPT-6.1 Sol: Intelligence Index 51,8, $0,72 за задачу индекса, recall в длинном контексте 83,0%» и «Claude Opus 5.5: Intelligence Index 57,6, $5,98 за задачу индекса, recall в длинном контексте 84,7%», с нижним колонтитулом «Показатели по данным Artificial Analysis, Intelligence Index v4.3.2, обе модели представлены на графике при их максимальной настройке усилий» и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

GPT-6.1 Sol против Claude Opus 5.5: реальный разрыв, распределённый неравномерно

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Разрыв в 5,8 пункта между Claude Opus 5.5 и GPT-6.1 Sol в Индексе интеллекта Artificial Analysis — самый большой среди всех пар в этом наборе, и, в отличие от большинства из них, он не закроется изменением настроек. Claude Opus 5.5, выпущенная 22 сентября 2026 года с ценой $4,00 за миллион входных и $20,00 за миллион выходных токенов, набирает 57,6. GPT-6.1 Sol, выпущенная 29 сентября 2026 года по цене $2,00 и $10,00, набирает 51,8. Claude Opus 5.5 — модель с более высоким результатом, причём её отрыв больше того, что отделяет большинство передовых моделей друг от друга, и чтобы его достичь, каждая задача обходится в 8,3 раза дороже — $5,98 против $0,72. Пока что дорогая модель просто побеждает, а это наименее интересная версия такого сравнения. Читать его стоит ради того, что эти 5,8 пункта распределены по набору неравномерно: по единственной оси, которая определяет большую часть работы с длинными документами и в длительных сессиях, две модели отличаются друг от друга менее чем на два пункта.

Обе модели — флагманы в одной и той же рыночной нише: контекстные окна класса 1M, предельный объём вывода 128K, ввод текста, изображений и файлов, расширенное мышление с одной стороны и пятиуровневая шкала усилий с другой. Claude Opus 5.5 приходит на смену Claude Opus 5 и позиционируется для требовательных рассуждений, программирования и длительной агентной работы; GPT-6.1 Sol находится на одну ступень ниже GPT-6 Astra и позиционируется для агентного программирования, использования компьютера и профессиональной работы с большим объёмом документов. Они нацелены на одни и те же задачи. Измерения говорят, что они не одинаково хороши во всех них.

Где на самом деле находятся 5,8 балла

Композитный индекс скрывает свои компоненты. Извлеките отдельные оценки — и разрыв перестанет выглядеть как разрыв и начнёт выглядеть как профиль.

• Humanity's Last Exam — Claude Opus 5.5 61,4% против GPT-6.1 Sol 52,9%, разрыв в 8,5 пункта по абстрактному рассуждению

• SciCode — Claude Opus 5.5 66,9% против GPT-6.1 Sol 54,2%, разрыв в 12,7 пункта на коде исследовательского уровня

• Воспроизведение в длинном контексте — Claude Opus 5.5 84,7% против GPT-6.1 Sol 83,0%, разрыв в 1,7 пункта при извлечении фактов из длинного ввода

• Terminal-Bench 4.0 — Claude Opus 5.5: 59,6 % против результата Sol, не опубликованного в той же ревизии

• Контекстное окно — GPT-6.1 Sol 1 050 000 токенов против Claude Opus 5.5 1 000 000 токенов, при этом у обоих ограничение вывода в 128 000 токенов.

• Стоимость одной задачи индексации — Claude Opus 5.5 $5.98 против GPT-6.1 Sol $0.72

Распределение — это и есть главное. Там, где задача — абстрактные рассуждения — сложный экзаменационный вопрос, задача по программированию исследовательского уровня, для которой нет готового ответа, который можно скопировать, — Claude Opus 5.5 уверенно впереди, и разрыв в 12,7 балла по SciCode — это не шум. Там, где задача — найти нужный фрагмент в очень длинном входном тексте и использовать его, две модели фактически на одном уровне, и GPT-6.1 Sol удерживает эту позицию, имея на 50 000 токенов больше ёмкости. Большая доля продакшен-работы с LLM — это второй тип: генерация ответов с дополнением из поиска, проверка контрактов и документации, анализ логов и расшифровок, ревью кода в большом репозитории. Эта работа измеряется третьим пунктом, а не первыми двумя, и на этом пункте премиум даёт 1,7 балла.

Честное чтение строк индекса

Две оговорки должны стоять рядом с этими цифрами, а не внизу страницы.

Конфигурации различаются. Artificial Analysis отображает Claude Opus 5.5 в конфигурации «Max, Default Fallback», а GPT-6.1 Sol — при максимальном усилии. Обе представляют собой самые сильные настройки, под которыми публикуется каждая модель, что делает сравнение справедливым, но это сравнение двух потолков, а не двух стандартных конфигураций по умолчанию. Собственные значения по умолчанию Claude Opus 5.5 в размещённом API могут отличаться от того запуска, что показан на графике, а стандартный уровень усилия GPT-6.1 Sol — средний.

Строка Terminal-Bench намеренно оставлена пустой с одной стороны. Показатель Claude Opus 5.5 в 59,6% взят из редакции Artificial Analysis, в которой он был опубликован; эквивалентный показатель GPT-6.1 Sol недоступен в соответствующей редакции. Цитирование числа из другого запуска того же бенчмарка было бы ложным сравнением, и честный поступок — оставить ячейку пустой, а не заполнять её чем-то приблизительно верным.

Многословность здесь действует в том же направлении, что и в случае с более дешёвыми собратьями: Claude Opus 5.5 выдаёт 260 млн выходных токенов в индексном наборе против 67 млн у GPT-6.1 Sol — разница в 3,9× при ставке, которая уже вдвое выше. Отсюда и берётся соотношение 8,3× на задачу, когда тарифная сетка показывает 2× на входе и 2× на выходе. Надбавка составляет не 8,3× потому, что модель стоит 8,3×, — она составляет 8,3× потому, что стоит 2× и размышляет в 3,9 раза дольше.

Аргументы в пользу того, чтобы это оплатить

Если ваша работа похожа на первые два пункта, расчёт прост, и он в пользу Claude Opus 5.5. Разрыв в 12,7 балла на научном коде исследовательского уровня или 8,5 балла на сложных абстрактных рассуждениях — это разница между агентом, который закрывает тикет без присмотра, и тем, которому нужен человек на каждом третьем шаге. Агентное программирование над большой кодовой базой — это та нагрузка, которую оба вендора называют первой, и именно на ней разброс наибольший. Платить $5,98 вместо $0,72 за задачу, чтобы избежать неудачного запуска, который стоит инженеру двадцать минут, — это не пограничный случай.

Есть второй аргумент, который вообще не о баллах. Claude Opus 5.5 существует пятнадцать дней и уже накопил корпус сторонних оценок, отзывов и опыта развёртывания, которого нет у модели возрастом восемь дней. Для пути в продакшн зрелость окружающих знаний стоит чего-то, чего индекс не оценивает.

Аргументы против — и число, которое решает всё

Контраргумент — это строка про длинный контекст. Если доминирующая форма вашего трафика — «большой вход, короткий ответ» — а для очень многих команд это так, — то ось, по которой с вас берут плату, — не та ось, которую вы потребляете. В задаче на воспроизведение информации из длинного контекста две модели различаются на 1,7 балла при соотношении цен 8,3×, причём более дешёвая модель имеет большее окно. Это тот случай, когда надбавка реальна, измерима и тратится на возможность, которую рабочая нагрузка никогда не задействует.

Решающее число, следовательно, — не индекс. Это доля ваших задач, которые похожи на SciCode, а не на воспроизведение. Команды, которые могут ответить на этот вопрос, используя свои собственные логи, должны ответить на него по своим собственным логам; набор бенчмарков — это прокси для смеси задач, и именно эта смесь является переменной.

Оба на одной клавише — именно это и делает вопрос разрешимым.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 доступен в OrcaRouter по своей цене $4.00 / $20.00, чтение из кэша — $0.20. GPT-6.1 Sol доступен в OrcaRouter за $2.00 / $10.00, с повышением до $4.00 / $15.00 при превышении 272 000 токенов промпта, чтение из кэша — $0.10. Оба по прейскурантной цене провайдера, ничего сверху, на одном ключе и одном счёте.

Это важно для данной пары моделей больше, чем обычно, потому что эти две модели — не взаимозаменяемые варианты, а решение о маршрутизации. Отправляйте работу с длинными документами и большими объёмами в GPT-6.1 Sol, оставляйте сложные рассуждения и модификацию кода на Claude Opus 5.5, и обе доступны через одну и ту же конечную точку с одними и теми же учётными данными. Если какой-либо маршрут деградирует, автоматическое переключение при сбое переносит вызов, а не приводит к ошибке, и поскольку маршрутизация декларативна, её можно задавать для класса задач, а не для каждого приложения. Проверить такое разделение — это изменение конфигурации, а не миграция.

Последнее, о чём стоит сказать, — это срок актуальности этого сравнения. Обе модели появились всего лишь дни или недели назад. У GPT-6.1 Sol опубликована одна независимая конфигурация; у Claude Opus 5.5 — одна. Один прогон на модель — это лишь снимок, и интересный режим отказа состоит не в том, что одно из этих чисел неверно, а в том, что конфигурация со средним уровнем усилий или второй оценщик перерисовывает профиль. До тех пор защитимая интерпретация — та, которую дают отдельные компоненты: решающий разрыв в сложных рассуждениях и исследовательском коде, небольшой — в работе с длинным контекстом, и счёт в 8,3×, который должен быть оправдан той частью вашей рабочей нагрузки, что напоминает первый случай.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно