Титульная карточка hero для Claude Opus 5.5 vs GPT-5.6 Sol с заголовком «Две таблицы запусков, которые почти не пересекаются», с бейджами $4.00 vs $5.00, 66.4% vs 37.3% и «отсечка: июн vs фев», а в правом нижнем углу — логотип OrcaRouter.
Guides & Insights

Claude Opus 5.5 против GPT-5.6 Sol: две таблицы запусков, которые почти не пересекаются

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Claude Opus 5.5 и GPT-5.6 Sol рядом на этой неделе — и первое, что вы заметите, это не победитель. А то, что два вендора опубликовали таблицы бенчмарков, которые почти не пересекаются ни по одной строке. В материалах к запуску Claude Opus 5.5, вышедшего 22 сентября 2026 года, он опережает GPT-5.6 Sol на 29 пунктов в Terminal-Bench 4.0. В материалах к запуску Sol, находящегося в общем доступе с 9 июля 2026 года, во главу угла вместо этого поставлены Terminal-Bench 2.1, где Sol Ultra набрал 91,9%, и Artificial Analysis Coding Agent Index, где он занял первое место с показателем 80. Обе таблицы настоящие. И обе были получены тем вендором, который в них побеждает. Полезный вопрос не в том, какая модель лучше в абстракции, — а в том, какой бенчмарк, запущенный в чьей обвязке, вообще что-то говорит о вашей рабочей нагрузке. Это куда более сложный вопрос, чем хотел бы, чтобы вы его задали, любой из постов о запуске, и именно вокруг него построено это сравнение.

Две модели бок о бок

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• Поставщик — Anthropic против OpenAI

• Выпущено — Claude Opus 5.5 22 сентября 2026 года против GPT-5.6 Sol 9 июля 2026 года

• Цена за миллион токенов — $4.00 за входные / $20.00 за выходные против $5.00 за входные / $30.00 за выходные

• Чтение из кэша — $0.20 за миллион на Opus 5.5; тариф кэша Sol устанавливается для каждой платформы отдельно и не публикуется в виде единого сопоставимого показателя

• Контекстное окно — 1M токенов у обоих

• Макс. объём вывода — 128K токенов на обоих, при этом 300K — в Batch API Anthropic, за бета-заголовком

• Дата отсечения знаний — июнь 2026 для Opus 5.5 против 16 февраля 2026 для Sol

• Управление рассуждениями — адаптивное мышление всегда включено, по умолчанию средний уровень усилий, шкала работает от низкого до максимального в сравнении с настройкой максимальных усилий рассуждения, плюс режим Ultra, который координирует параллельных субагентов

• Состав линейки — Opus 5.5 — первый представитель семейства 5.5, при этом Sonnet 5.5 и Haiku 5.5 обещаны в ближайшие недели, тогда как Sol — флагман трехуровневого семейства вместе с Terra и Luna

Две из этих строк выполняют больше работы, чем остальные. Разрыв в дате отсечки знаний составляет четыре месяца — это важно, если ваши промпты затрагивают что-либо, что произошло этой весной. А Opus 5.5 теперь обходит Sol и по цене ввода, и по цене вывода — разворот по сравнению с тем, что было три месяца назад, когда Sol был более дешёвым способом получить вывод фронтирного уровня, а Claude Opus 5 стоил $5/$25.

Единственные строки, где действительно присутствуют обе модели

Опубликована ровно одна таблица, содержащая обе модели, и она принадлежит Anthropic. Каждая цифра в ней — по данным самого производителя, полученным от компании, продающей одну из этих двух моделей:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% против GPT-5.6 Sol 37,3%

• Terminal-Bench-Science 0.1 — 58,7% против 22,4%

• FrontierCode v1.1 (Main) — 54.4% против 47.5%

• CursorBench 4.0 — 57,8% против 41,7%

• AutomationBench — 40,0% против 28,8%

• GDPval-AA v2.1 — 1846 Elo против 1588

Это чистая победа, и отрывы в двух строках Terminal-Bench достаточно велики, чтобы заслуживать тщательного изучения, а не безоговорочного принятия. Собственная сноска Anthropic отчасти выполняет эту работу за вас: прогон Opus 5.5 на Terminal-Bench использовал уровень усилий xhigh, а не стандартный, и при стандартном среднем уровне усилий преимущество FrontierCode сокращается до 54,6% против 47,5% — разрыв в семь пунктов вместо заголовочных цифр. Anthropic также сопровождает всю таблицу общей оговоркой: на этом уровне возможностей разрывы в бенчмарках — «менее надёжный ориентир для различий в реальном мире», а её внутренний разрыв с Claude Fable 5.1 меньше, чем предполагают оценки. Фраза, где вендор сам принижает собственную таблицу, — самое заслуживающее доверия утверждение в ней.

Обратите также внимание на то, чего в этой таблице нет: бенчмарков, где побеждает модель OpenAI. Таблица вендора, содержащая только выгодные строки, — это не доказательство безоговорочной победы; это доказательство отбора строк.

Что говорят собственные цифры OpenAI

Материалы запуска Sol рассказывают другую историю — на других бенчмарках, на другом тестовом стенде. Сообщалось на его июльском запуске:

• Terminal-Bench 2.1 — 91,9% для Sol Ultra и 88,8% для стандартного Sol, против 88,0% у Claude Mythos 5 и 84,3% у Claude Fable 5

• Индекс кодирующих агентов Artificial Analysis — 80, на тот момент описываемый как передовой результат, на 2,8 балла превосходящий Claude Fable 5

• Agents' Last Exam, длительные профессиональные рабочие процессы — 53,6, что, по данным OpenAI, на 13,1 балла опережает Claude Fable 5

• BrowseComp — 92,2 %; OSWorld 2.0 — 62,6 %; SWE-Bench Pro — 64,6 %

Ни одна из этих строк не включает Claude Opus 5.5, потому что в июле его не существовало. Таблица Sol была создана, чтобы побить Fable 5 и Mythos 5, и она это делает. А вот превосходит ли она Opus 5.5 — на это просто не отвечают материалы ни одного из вендоров: две таблицы были собраны с разницей в два месяца и против разных соперников.

Строка SWE-Bench Pro заслуживает отдельного упоминания, потому что это единственное место в презентационных материалах OpenAI, где её модель проигрывает: 64,6% у Sol против 80% у Claude Fable 5. OpenAI ответила, поставив под сомнение валидность бенчмарка и оценив, что примерно 30% его задач сломаны. Возможно, так и есть. Это также полезное напоминание, что «этот бенчмарк некорректен» — утверждение, которое делают обе лаборатории, и всегда в отношении бенчмарка, где они проигрывают.

Проблема обвязки, которую не решает ни одна таблица

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Причина, по которой две таблицы не согласуются, не в том, что один вендор лжёт. А в том, что бенчмарки агентного кодинга измеряют модель вместе со скаффолдом, а скаффолды различаются. Terminal-Bench 4.0 и Terminal-Bench 2.1 — это разные редакции одной и той же идеи, запускаемые разными людьми, с разными бюджетами на инструменты и разными правилами повторных попыток. Показатели Opus 5.5 от Anthropic были получены в харнессе Anthropic; показатели Sol от OpenAI — в инструментарии в стиле Codex. Поместите любую из моделей в харнесс другой — и оценки изменятся.

Независимые данные, там где они есть, описывают более близкую гонку, чем любая из двух таблиц. Один сторонний бенчмарк агентов от августа 2026 года, проведённый на нескольких моделях на реальных прикладных задачах, назвал GPT-5.6 Sol лучшим сочетанием точности, стоимости и скорости — около $0,52 и пяти минут на запуск, — тогда как Claude Opus 5, а не 5.5, оказался самым точным в 92% запусков. Отдельный рейтинг, охватывающий корпоративные задачи по коду, поставил Claude Opus 5 на первое место с 96,4%, а GPT-5.6 Sol — на третье с 86,5%, снова сравнивая Sol с предыдущим Opus, а не с новым. Ни то, ни другое не является очным сравнением с Opus 5.5, и ни то, ни другое ничего не решает. Но они показывают, что когда сравнение проводит кто-то, кроме вендора, разрывы становятся небольшими.

Практический вывод: перестаньте читать таблицы как рейтинг и начните читать их как список гипотез. Если ваша работа — это долгосрочная автоматизация терминала, разрыв Anthropic в Terminal-Bench — это гипотеза, которую стоит проверить на собственных задачах. Если это многоэтапное профессиональное исследование, результат Sol's Agents' Last Exam — такая же гипотеза. Ни одна из этих цифр не переносится на вашу нагрузку без прогона.

Стоимость за завершённую задачу — единственная стоимость, которая имеет значение.

В тарифной сетке Claude Opus 5.5 теперь дешевле в обоих направлениях: $4.00 против $5.00 на входе, $20.00 против $30.00 на выходе, а ставка $0.20 за чтение из кэша на 60% ниже той, что брал Claude Opus 5. Для агента, который заново отправляет длинный системный промпт на каждом ходе, эта строка с кэшем — основная статья расходов и причина, по которой долгоиграющая сессия может стать существенно дешевле без каких-либо изменений промпта.

Но цена за токен никогда не определяла счёт агента. Аргумент OpenAI в пользу Sol на запуске опирался на эффективность использования токенов, а не на заявленную цену: сообщалось об улучшении эффективности использования токенов при программировании на 54%, при этом выходные токены и затраченное время составили менее половины от показателей Claude Fable 5 при стоимости примерно на треть ниже. Anthropic приводит зеркальный аргумент для Opus 5.5: примерно на 40% ниже стоимость эксплуатации на типичных рабочих нагрузках, чем у Claude Opus 5, при тарифной сетке, которая снизилась лишь на 20%, а заявления клиентов от Box, Kiro, Factory и GitHub указывают на значительное сокращение токенов или шагов. Оба утверждения указывают в одном направлении — побеждает модель, которая завершает работу за меньшее число ходов, — и ни одно из них не подтверждено независимым аудитом.

Там, где существуют независимые расчёты стоимости на задачу, они сейчас в пользу Sol: один анализ, опубликованный в сентябре, оценил GPT-5.6 Sol в 1,56 доллара за решённую задачу на SWE-bench Verified при 96,2% успеха против Claude Opus 4.8 с 88,6%. Это Sol, измеренный в сравнении с более старой моделью Anthropic, а не с Opus 5.5, так что это отправная точка, а не приговор, — но это напоминание о том, что модель, которая решает задачу с первой попытки, обходится дешевле, чем более дешёвая модель, которой нужно три прохода. Единственное измерение, которое окончательно решит этот вопрос для вас, — это ваша собственная задача, запущенная обоими способами, с количеством токенов перед глазами.

Это скорее проблема маршрутизации, чем закупок, и стоит точно понимать, какая её сторона уже решаема. GPT-5.6 Sol уже сегодня доступен на OrcaRouter по собственной прайс-листовой цене OpenAI с наценкой 0% — цена провайдера по прайс-листу передаётся напрямую, так что изменение тарифа поставщика вступает в силу у нас в тот же день, а не после синхронизации. Claude Opus 5.5 пока не входит в число наших маршрутов; он доступен через собственный API Anthropic и основные облака. Как только он появится, один и тот же ключ будет обслуживать оба, и именно это превращает эксперимент в правило маршрутизации, а не во второй контракт и второй SDK: направляйте нагрузку на ту модель, которой отдают предпочтение ваши собственные цифры, оставляйте автоматическое переключение при отказе нацеленным на другую, и пусть строка routing-DSL решает для каждого запроса, а не для каждого квартала. Снижение цены с любой стороны — это изменение конфигурации, а не миграция.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

Там, где эти двое действительно различаются

Если убрать бенчмарки, останутся четыре различия, и все они поддаются проверке:

• Дата отсечки знаний. Июнь 2026 года для Opus 5.5 против 16 февраля 2026 года для Sol. Четыре месяца — это реальный разрыв для всего, что касается недавних библиотек, недавних событий или недавно изменённых API, и ни один бенчмарк этого не отражает.

• Маршрутизация защитных механизмов. Opus 5.5 поставляется с защитными механизмами класса Fable 5.1: большинство запросов по кибербезопасности перенаправляются в Claude Opus 4.8, а работа по биологии переключается на Claude Opus 5, если только аккаунт не верифицирован. Если ваш продукт относится к любой из этих областей, часть вашего трафика обслуживается меньшей моделью. У Sol нет аналогичной документированной маршрутизации, хотя OpenAI и отмечает собственные оценки безопасности, связанные с кибербезопасностью.

• Оркестрация. Sol поставляет режим Ultra, который координирует несколько параллельных субагентов — по умолчанию четыре — и настройку максимального уровня усилий при рассуждении. У Opus 5.5 нет ни того, ни другого как платформенной функции; его рычаг — это параметр effort, а мультимодельная композиция — это то, что вы создаёте или маршрутизируете сами, а не то, что вендор вручает вам готовым.

• Экономика семейства. Sol — один из трёх уровней, ниже него находятся Terra и Luna, при этом в обновлении от 30 июля цена Luna была снижена на 80 %, а Terra — на 20 %. Более дешёвые собратья от Anthropic, Sonnet 5.5 и Haiku 5.5, анонсированы, но ещё не выпущены. Если ваша нагрузка смешанная, OpenAI сегодня предлагает более дешёвые ступени.

Выбирая между ними

Выбирайте Claude Opus 5.5, если ваша работа — это длительное агентное программирование или интеллектуальная работа, если цена за токен имеет значение, если ваши промпты затрагивают что-либо за последние четыре месяца, или если контекст на 1 млн токенов по $0,20 за миллион кэшированных токенов — это то, что делает вашу архитектуру доступной по цене. Начните со среднего уровня усилий, а не с унаследованной высокой настройки, и проверьте, насколько хорошо низкий уровень справляется.

Выбирайте GPT-5.6 Sol, если вам нужен встроенный вендором режим оркестрации, если вам нужен более дешёвый уровень ниже флагманского уже сегодня, а не через несколько недель, или если ваша рабочая нагрузка относится к тем, для которых лучше всего подходят собственные данные запуска Sol — долгосрочные профессиональные рабочие процессы и использование компьютера, где он показал свои самые сильные результаты.

Если вы уже работаете на Claude Opus 5, учтите: Opus 5.5 — это не замена один в один. Мышление больше нельзя отключить, принудительный вызов инструментов возвращает ошибку, блоки мышления привязаны к модели и диалогу, а более старыйcomputer_20251124 инструмент computer-use не принимается в Claude API и Google Cloud. Первые три пункта также относятся к Claude Fable 5.1. Переход на Sol — это совсем другая интеграция.

Что действительно позволило бы разрешить это сравнение, — это единственный независимый прогон обеих моделей при сопоставимых усилиях, в сопоставимой среде, на одном и том же наборе задач. По состоянию на эту неделю никто такого не опубликовал. Пока кто-то этого не сделает, честная позиция — та, которую поддерживают доказательства: таблица Anthropic отдаёт предпочтение Opus 5.5 и была создана самой Anthropic; таблица OpenAI отдаёт предпочтение Sol и была создана самой OpenAI; существующие независимые результаты сравнивают Sol с предыдущей версией Opus и описывают гораздо более близкое соперничество; а две строки, которые определят ваш счёт, — токены на завершённую задачу и объём чтения из кэша, — это те две строки, которые не публикует ни один из поставщиков.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно