
GPT-6.1 Sol против Claude Opus 5.5: реальный разрыв, распределённый неравномерно
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Разрыв в 5,8 пункта между Claude Opus 5.5 и GPT-6.1 Sol в Индексе интеллекта Artificial Analysis — самый большой среди всех пар в этом наборе, и, в отличие от большинства из них, он не закроется изменением настроек. Claude Opus 5.5, выпущенная 22 сентября 2026 года с ценой $4,00 за миллион входных и $20,00 за миллион выходных токенов, набирает 57,6. GPT-6.1 Sol, выпущенная 29 сентября 2026 года по цене $2,00 и $10,00, набирает 51,8. Claude Opus 5.5 — модель с более высоким результатом, причём её отрыв больше того, что отделяет большинство передовых моделей друг от друга, и чтобы его достичь, каждая задача обходится в 8,3 раза дороже — $5,98 против $0,72. Пока что дорогая модель просто побеждает, а это наименее интересная версия такого сравнения. Читать его стоит ради того, что эти 5,8 пункта распределены по набору неравномерно: по единственной оси, которая определяет большую часть работы с длинными документами и в длительных сессиях, две модели отличаются друг от друга менее чем на два пункта.
Обе модели — флагманы в одной и той же рыночной нише: контекстные окна класса 1M, предельный объём вывода 128K, ввод текста, изображений и файлов, расширенное мышление с одной стороны и пятиуровневая шкала усилий с другой. Claude Opus 5.5 приходит на смену Claude Opus 5 и позиционируется для требовательных рассуждений, программирования и длительной агентной работы; GPT-6.1 Sol находится на одну ступень ниже GPT-6 Astra и позиционируется для агентного программирования, использования компьютера и профессиональной работы с большим объёмом документов. Они нацелены на одни и те же задачи. Измерения говорят, что они не одинаково хороши во всех них.
Где на самом деле находятся 5,8 балла
Композитный индекс скрывает свои компоненты. Извлеките отдельные оценки — и разрыв перестанет выглядеть как разрыв и начнёт выглядеть как профиль.
• Humanity's Last Exam — Claude Opus 5.5 61,4% против GPT-6.1 Sol 52,9%, разрыв в 8,5 пункта по абстрактному рассуждению
• SciCode — Claude Opus 5.5 66,9% против GPT-6.1 Sol 54,2%, разрыв в 12,7 пункта на коде исследовательского уровня
• Воспроизведение в длинном контексте — Claude Opus 5.5 84,7% против GPT-6.1 Sol 83,0%, разрыв в 1,7 пункта при извлечении фактов из длинного ввода
• Terminal-Bench 4.0 — Claude Opus 5.5: 59,6 % против результата Sol, не опубликованного в той же ревизии
• Контекстное окно — GPT-6.1 Sol 1 050 000 токенов против Claude Opus 5.5 1 000 000 токенов, при этом у обоих ограничение вывода в 128 000 токенов.
• Стоимость одной задачи индексации — Claude Opus 5.5 $5.98 против GPT-6.1 Sol $0.72
Распределение — это и есть главное. Там, где задача — абстрактные рассуждения — сложный экзаменационный вопрос, задача по программированию исследовательского уровня, для которой нет готового ответа, который можно скопировать, — Claude Opus 5.5 уверенно впереди, и разрыв в 12,7 балла по SciCode — это не шум. Там, где задача — найти нужный фрагмент в очень длинном входном тексте и использовать его, две модели фактически на одном уровне, и GPT-6.1 Sol удерживает эту позицию, имея на 50 000 токенов больше ёмкости. Большая доля продакшен-работы с LLM — это второй тип: генерация ответов с дополнением из поиска, проверка контрактов и документации, анализ логов и расшифровок, ревью кода в большом репозитории. Эта работа измеряется третьим пунктом, а не первыми двумя, и на этом пункте премиум даёт 1,7 балла.
Честное чтение строк индекса
Две оговорки должны стоять рядом с этими цифрами, а не внизу страницы.
Конфигурации различаются. Artificial Analysis отображает Claude Opus 5.5 в конфигурации «Max, Default Fallback», а GPT-6.1 Sol — при максимальном усилии. Обе представляют собой самые сильные настройки, под которыми публикуется каждая модель, что делает сравнение справедливым, но это сравнение двух потолков, а не двух стандартных конфигураций по умолчанию. Собственные значения по умолчанию Claude Opus 5.5 в размещённом API могут отличаться от того запуска, что показан на графике, а стандартный уровень усилия GPT-6.1 Sol — средний.
Строка Terminal-Bench намеренно оставлена пустой с одной стороны. Показатель Claude Opus 5.5 в 59,6% взят из редакции Artificial Analysis, в которой он был опубликован; эквивалентный показатель GPT-6.1 Sol недоступен в соответствующей редакции. Цитирование числа из другого запуска того же бенчмарка было бы ложным сравнением, и честный поступок — оставить ячейку пустой, а не заполнять её чем-то приблизительно верным.
Многословность здесь действует в том же направлении, что и в случае с более дешёвыми собратьями: Claude Opus 5.5 выдаёт 260 млн выходных токенов в индексном наборе против 67 млн у GPT-6.1 Sol — разница в 3,9× при ставке, которая уже вдвое выше. Отсюда и берётся соотношение 8,3× на задачу, когда тарифная сетка показывает 2× на входе и 2× на выходе. Надбавка составляет не 8,3× потому, что модель стоит 8,3×, — она составляет 8,3× потому, что стоит 2× и размышляет в 3,9 раза дольше.
Аргументы в пользу того, чтобы это оплатить
Если ваша работа похожа на первые два пункта, расчёт прост, и он в пользу Claude Opus 5.5. Разрыв в 12,7 балла на научном коде исследовательского уровня или 8,5 балла на сложных абстрактных рассуждениях — это разница между агентом, который закрывает тикет без присмотра, и тем, которому нужен человек на каждом третьем шаге. Агентное программирование над большой кодовой базой — это та нагрузка, которую оба вендора называют первой, и именно на ней разброс наибольший. Платить $5,98 вместо $0,72 за задачу, чтобы избежать неудачного запуска, который стоит инженеру двадцать минут, — это не пограничный случай.
Есть второй аргумент, который вообще не о баллах. Claude Opus 5.5 существует пятнадцать дней и уже накопил корпус сторонних оценок, отзывов и опыта развёртывания, которого нет у модели возрастом восемь дней. Для пути в продакшн зрелость окружающих знаний стоит чего-то, чего индекс не оценивает.
Аргументы против — и число, которое решает всё
Контраргумент — это строка про длинный контекст. Если доминирующая форма вашего трафика — «большой вход, короткий ответ» — а для очень многих команд это так, — то ось, по которой с вас берут плату, — не та ось, которую вы потребляете. В задаче на воспроизведение информации из длинного контекста две модели различаются на 1,7 балла при соотношении цен 8,3×, причём более дешёвая модель имеет большее окно. Это тот случай, когда надбавка реальна, измерима и тратится на возможность, которую рабочая нагрузка никогда не задействует.
Решающее число, следовательно, — не индекс. Это доля ваших задач, которые похожи на SciCode, а не на воспроизведение. Команды, которые могут ответить на этот вопрос, используя свои собственные логи, должны ответить на него по своим собственным логам; набор бенчмарков — это прокси для смеси задач, и именно эта смесь является переменной.
Оба на одной клавише — именно это и делает вопрос разрешимым.


Claude Opus 5.5 доступен в OrcaRouter по своей цене $4.00 / $20.00, чтение из кэша — $0.20. GPT-6.1 Sol доступен в OrcaRouter за $2.00 / $10.00, с повышением до $4.00 / $15.00 при превышении 272 000 токенов промпта, чтение из кэша — $0.10. Оба по прейскурантной цене провайдера, ничего сверху, на одном ключе и одном счёте.
Это важно для данной пары моделей больше, чем обычно, потому что эти две модели — не взаимозаменяемые варианты, а решение о маршрутизации. Отправляйте работу с длинными документами и большими объёмами в GPT-6.1 Sol, оставляйте сложные рассуждения и модификацию кода на Claude Opus 5.5, и обе доступны через одну и ту же конечную точку с одними и теми же учётными данными. Если какой-либо маршрут деградирует, автоматическое переключение при сбое переносит вызов, а не приводит к ошибке, и поскольку маршрутизация декларативна, её можно задавать для класса задач, а не для каждого приложения. Проверить такое разделение — это изменение конфигурации, а не миграция.
Последнее, о чём стоит сказать, — это срок актуальности этого сравнения. Обе модели появились всего лишь дни или недели назад. У GPT-6.1 Sol опубликована одна независимая конфигурация; у Claude Opus 5.5 — одна. Один прогон на модель — это лишь снимок, и интересный режим отказа состоит не в том, что одно из этих чисел неверно, а в том, что конфигурация со средним уровнем усилий или второй оценщик перерисовывает профиль. До тех пор защитимая интерпретация — та, которую дают отдельные компоненты: решающий разрыв в сложных рассуждениях и исследовательском коде, небольшой — в работе с длинным контекстом, и счёт в 8,3×, который должен быть оправдан той частью вашей рабочей нагрузки, что напоминает первый случай.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
