Титульная карточка hero с надписью «Claude Opus 5.5 против GPT-6 Astra» и подзаголовком «Дегустация, обогнавшая бенчмарки», надзаголовок «Сравнение фронтирных флагманов — сентябрь 2026», три бейджа со словами «Вкус: ни на одной оси бенчмарков», «Исследовательские нагрузки: Astra держит позиции» и «Цена: $4.00 / $20.00 против $10.00 / $50.00 за 1 млн», строка нижнего колонтитула «Таблицы запусков вендоров и независимые прогоны расходятся в оценке размера отрыва», а в правом нижнем углу — логотип OrcaRouter.
Guides & Insights

Claude Opus 5.5 против GPT-6 Astra: дегустационный тест, обогнавший бенчмарки

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Кто-то попросил Claude Opus 5.5 сделать короткое видео о том, как конкурирующая лаборатория решает уравнения Навье — Стокса, опубликовал результат, а затем написал фразу, из-за которой это сравнение стоит проводить: модель «очень приятная», у неё «отличный вкус», и это первый Claude со времён Opus 4.7, который им действительно хочется активно использовать, — но они всё ещё оставляют GPT-6 Astra и GPT-5.6 Sol в качестве своих основных рабочих моделей, потому что их работа требует много исследований. Это три утверждения в одном посте, и они тянут в разные стороны. Модель может быть самой приятной в работе и всё равно не быть той, на которую вы направляете продакшен-трафик. Интересный вопрос не в том, какая модель лучше. А в том, какой из этих двух вердиктов выдерживает проверку цифрами, а какой на поверку оказывается заявлением о вкусе.

Это отчёт одного практикующего специалиста, а не прогон бенчмарка — воспринимайте его как сигнал о том, как модель ощущается в творческой и открытой работе, а не как доказательство её возможностей. Все числовые данные ниже сопровождаются указанием, кто их получил.

Что может и чего не может сказать вам дегустация

Здесь важен артефакт. Создание видео о математическом результате — это не задача по программированию с воротами «прошло/не прошло». Нет этапа компиляции, нет набора тестов, нет стенда Terminal-Bench, который оценивал бы, хороша ли получившаяся вещь. Модель должна была выбрать угол зрения, решить, что показать, сохранить связность и остановиться. Когда практик говорит, что у модели «отличный вкус», он описывает именно это: суждение об охвате и расстановке акцентов, которое проявляется в работе, где спецификация намеренно расплывчата.

Это реальная способность, и именно её наборы бенчмарков измеряют хуже всего. Именно поэтому один и тот же человек может хвалить модель и не переходить на неё. Вкус — это то, что нужно, когда вы исследуете. Но не то, что нужно, когда у вас 200 000 строк кода для аудита и счёт, который надо обосновать.

Собственная презентация запуска Anthropic указывает на ту же способность, но в прозе, а не в видео: Claude Opus 5.5 подается как модель, которая пишет менее «Claudish» — меньше пустых вступлений, меньше уклончивости, больше готовности сразу излагать суть. Независимая оценка удобочитаемости подтверждает направление этого утверждения, даже если расходится в оценке его масштаба. Производитель также сообщает, что внутренний тест на проверку фактов прошел 16 из 18 попыток, тогда как и Claude Fable 5.1, и Claude Opus 5 показали ноль из 18; это число принадлежит самой Anthropic, не воспроизведено и должно читаться как заявление, а не как результат.

Два табло, одно расхождение, которое имеет значение.

A two-column scoreboard titled "Claude Opus 5.5 vs GPT-6 Astra - the scoreboard". The Claude Opus 5.5 column reads: Released Sep 22 2026, Price per 1M $4.00 / $20.00, Terminal-Bench 4.0 66.4% vendor and 59.6% independent, Terminal-Bench-Science 0.1 58.7%, GDPval-AA v2.1 1,846 Elo, Tokens per problem about 119,000. The GPT-6 Astra column reads: Released Sep 3 2026, Price per 1M $10.00 / $50.00, Terminal-Bench 4.0 57.9%, Terminal-Bench-Science 0.1 64.6%, GDPval-AA v2.1 1,542 Elo, Tokens per problem about 27,000. A footer reads "Opus 5.5 figures per Anthropic unless noted; Astra and independent figures per Artificial Analysis."

На опубликованных сырых бенчмарках Claude Opus 5.5, как правило, опережает GPT-6 Astra. Проблема в том, что два наиболее часто цитируемых источника расходятся в оценке величины этого преимущества.

В таблице запуска Anthropic Claude Opus 5.5 указан на уровне 66,4% в Terminal-Bench 4.0, тогда как GPT-6 Astra — 57,9%, а Claude Fable 5.1 — 55,8%. Это заявленное вендором преимущество в 8,5 пункта в агентном кодинге — тот самый отрыв, который закрывает спор в маркетинговой презентации. Artificial Analysis, используя собственный тестовый стенд, измерила Claude Opus 5.5 на уровне 59,6% в том же бенчмарке: на одном уровне с GPT-6 Astra при xhigh effort и примерно на 11 пунктов выше Claude Opus 5. В обоих случаях преимущество реально. А его размер — нет.

То, где две модели меняются местами, полезнее, чем то, где они этого не делают:

• Terminal-Bench 4.0 (агентное программирование) — Claude Opus 5.5 66,4% по собственной таблице Anthropic, 59,6% по данным Artificial Analysis; GPT-6 Astra 57,9%.

• Humanity's Last Exam, с инструментами — Claude Opus 5.5: 67,7% по данным разработчика, независимо измерено — 61,4%; GPT-6 Astra — 57,2%.

• GDPval-AA v2.1 (работа со знаниями в реальных условиях по 44 профессиям) — Claude Opus 5.5 — 1 846 Elo; GPT-6 Astra — 1 542 Elo. Оба показателя взяты из независимого рейтинга Artificial Analysis, а не от вендора.

• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% против Claude Opus 5.5 58,7%. Это чистая победа Astra, и это агентный бенчмарк с научным уклоном.

• AutomationBench — GPT-6 Astra 41,4% против Claude Opus 5,5 40,0%. Разрыв небольшой, но снова Astra.

• FrontierCode v1.1 — Claude Opus 5.5 54,4% против GPT-6 Astra 53,3%. Разница в один пункт.

Читайте этот список так, как его прочитал бы практик. Нагрузки, требующие интенсивных исследований, — те, в которых есть научная или литературная составляющая, те, что выполняют долгий цикл с использованием инструментов и требуют, чтобы модель сохраняла устойчивость, — именно там GPT-6 Astra удерживает позиции. Таблицы лидеров по интеллектуальной работе и программированию, где Claude Opus 5.5 с большим отрывом уходит вперёд, — это то, на что вы указали бы, если бы ваша работа состояла в выпуске программного обеспечения. Оба человека в этом разговоре правильно читают свой собственный бенчмарк. Они просто читают разные бенчмарки.

Настройка усилия выполняет больше работы, чем сама модель.

Есть вторая, менее лестная причина, по которой ключевые показатели маржи выглядят слабыми. Сравнения поставщиков выполняются не при одинаковых настройках.

Опубликованные показатели Claude Opus 5.5 получены при конфигурации со сверхвысоким (xhigh) уровнем усилий на рассуждение, тогда как GPT-6 Astra — при high. Независимые прогоны Artificial Analysis выполнялись с обеими моделями на xhigh, и разрыв в кодинге исчезает — преимущество вендора в 8,5 пункта превращается в ничью. Это не обвинение в недобросовестности; так бывает, когда вендор выбирает конфигурацию, в которой его модель выглядит лучше всего, а независимая лаборатория выбирает конфигурацию, соответствующую конкуренту. Прежде чем переносить рабочую нагрузку, опираясь на таблицу бенчмарков, проверьте, при каком уровне усилий проводился тест, потому что ответ часто — «лестный».

Счёт за токены рассказывает ту же историю под другим углом. В собственных материалах Anthropic к запуску указано, что Claude Opus 5.5 расходует порядка 119 000 токенов на задачу, из которых примерно 84 000 уходят на размышления, тогда как GPT-6 Astra решает сопоставимые задачи примерно за 27 000 токенов. Токены размышлений тарифицируются как выходные токены. Модель, которая использует в четыре раза больше токенов при цене выходных токенов в пять раз ниже, почти не даёт выигрыша — и это ещё до учёта того факта, что более дешёвая модель часто оказывается той, которую вы в любом случае были бы готовы запустить с более высоким уровнем усилий.

Ещё одна оговорка касается конкретно Claude Opus 5.5: маршрутизация защитных механизмов Anthropic может направлять некоторые запросы, смежные с кибер- и биотематикой, по более ограничительному пути, что занижает опубликованные оценки по этим тестам относительно того, что выдала бы лежащая в основе модель. Если ваша работа затрагивает эти области, разрыв между бенчмарком и вашим опытом будет реальным, и он будет смещён в сторону излишнего оптимизма бенчмарка.

Сколько стоит настоящая задача на каждом

Screenshot of Anthropic's Claude Platform release notes page, with "September 22, 2026" selected in the sidebar. The entry announces the launch of Claude Opus 5.5 (claude-opus-5-5) with a 1M token context window by default, 128k max output tokens and always-on adaptive thinking, at $4 / $20 USD per MTok against Claude Opus 5 at $5 / $25, and notes that thinking cannot be disabled, that depth is controlled through the effort parameter, and that Fast mode is available as a research preview.

Claude Opus 5.5 — более дешёвая модель в тарифной сетке, и это даже не близко:

• Claude Opus 5.5 — 4,00 $ за миллион входных токенов, 20,00 $ за миллион выходных токенов, 0,20 $ за миллион кэшированных входных токенов, 5,00 $ за миллион операций записи в кэш. Контекст — 1 млн токенов, максимальный вывод — 128 тыс. токенов.

• GPT-6 Astra — $10.00 за миллион входных токенов, $50.00 за миллион выходных токенов, $1.00 за миллион кэшированных входных токенов, $12.50 за миллион операций записи в кэш. При превышении 272 000 входных токенов в одном запросе весь запрос пересчитывается по цене $20.00 за входные токены и $100.00 за выходные токены; пакетный тариф — $5.00/$25.00.

Итак, Claude Opus 5.5 в 2,5 раза дешевле на входе и в 2,5 раза дешевле на выходе, а кэшированный ввод обходится в пять раз дешевле. Если ваши задачи сопоставимы по количеству токенов, это и есть всё решение, а вопрос вкуса — лишь украшение.

Предостережение о расходе токенов выше — именно оно мешает всё свести к такой простоте, а пересмотр тарифов для длинного контекста у GPT-6 Astra — вторая ловушка. Если превысить 272 000 входных токенов в одном запросе, весь запрос — не только превышение — переходит на тариф для длинного контекста. Исследовательская нагрузка, которая запихивает большой корпус в один вызов, — это ровно та конфигурация, которая это запускает. Пакетный режим за полцены — законный способ обойти это, но он находится в медленной очереди.

Честный итог таков: картина затрат переворачивается в зависимости от того, что вы делаете. Для задачи, где обе модели используют сопоставимое количество токенов, Claude Opus 5.5 с большим отрывом выигрывает по цене. Для длинного агентного исследовательского цикла, где количество токенов расходится так, как показывают собственные материалы запуска Anthropic, эти два варианта сближаются — а это куда менее впечатляющий заголовок, чем сокращение затрат на 40%, и ближе к тому, о чём сообщал практик.

Почему пользователь, активно занимающийся исследованиями, не переключился

Сложите всё воедино — и фраза «всё ещё предпочитаю Astra» перестаёт быть противоречием фразе «отличный вкус». Это то же самое наблюдение, только с другого места.

Задачи, которые назвал пользователь, — длительные, с открытым концом, с использованием инструментов и дорогие за один запуск. На них GPT-6 Astra удерживает лидерство в научных и автоматизационных рейтингах, использует лишь долю токенов мышления и — по независимым измерениям — идёт вровень в программировании, когда обе модели работают с одинаковым усилием. Преимущества Claude Opus 5.5 сосредоточены в работе, где можно увидеть результат и оценить его: проза, дизайнерские решения, определение рамок неоднозначного брифа, решение о том, что именно должно показывать видео о Навье — Стоксе. Это вкус, а вкус — именно та часть, которая не отображается на оси бенчмарка.

Если вы надеялись на вердикт, что побеждает одна модель, доказательства этого не подтверждают. Защитимая версия более узкая: Claude Opus 5.5 — лучшая модель для работы, где узким местом является суждение, GPT-6 Astra — лучшая модель для работы, где узким местом являются продолжительные усилия в длинном контексте, а разрыв в цене между ними почти исчезает на втором типе работы. Это решение о маршрутизации, а не о переходе.

Запуск обоих без миграции

Screenshot of the OrcaRouter models catalogue filtered by the query "astra", showing one result card: OpenAI GPT-6 Astra, model id openai/gpt-6-astra, described as OpenAI's flagship model for demanding long-horizon end-to-end work, with a 1M context window and a per-1M-token base rate of $10.00 input, $50.00 output, $1.00 cache read and $12.50 cache write.

Это тот момент, когда две модели перестают быть выбором «или/или». GPT-6 Astra сегодня доступна на OrcaRouter по собственной прейскурантной цене OpenAI — $10.00 за вход, $50.00 за выход, $1.00 за чтение из кэша, $12.50 за запись в кэш — с 0% наценки, прейскурантная цена провайдера передаётся напрямую. Это означает, что изменение тарифа вендора появляется у нас в тот же день, а не когда перепродавец синхронизируется.

Claude Opus 5.5 доступен через собственный API Anthropic и несколько сторонних платформ; мы не указываем его как то, что предоставляем сами, и вам стоит скептически относиться к тем, кто утверждает обратное, пока модель не распространилась. Что вы можете сделать уже сегодня — это поставить обе модели за одним ключом и одной формой эндпоинта, и маршрутизировать по рабочей нагрузке, а не по предпочтениям: отправлять открытый запрос, требующий суждения, в Claude Opus 5.5, а длинный исследовательский цикл — в GPT-6 Astra, не поддерживая при этом два контракта или две клиентские интеграции.

Именно автоматическое переключение при сбое делает это безопасным для тестирования. Новая модель — это ещё не производственный путь, а маршрутизация через одну конечную точку означает, что инцидент у провайдера или ограничение частоты запросов переместит запрос, а не приведёт к его сбою. Если вы хотите выяснить, реален ли разрыв во вкусе на ваших собственных задачах, это дешёвый способ узнать — запустите её рядом с тем, что у вас уже есть, а не вместо этого, и пусть решает ваш собственный набор тестов, а не таблицы запуска.

Вопрос, на который не могут ответить бенчмарки

Есть две вещи, за которыми стоит следить, и ни одна из них не является очередным показателем бенчмарка.

Первое — разрешится ли асимметрия настроек усилий. Сейчас вендорная таблица при xhigh против конкурента при high даёт преимущество в 8,5 пункта, которое независимое тестирование при сопоставленных настройках превращает в ничью. По мере того как независимые лаборатории публикуют прогоны с сопоставленными настройками в рейтингах по науке и автоматизации, где GPT-6 Astra сейчас лидирует, эта картина может сдвинуться в любую сторону — и она будет меняться под влиянием доказательств, а не чьих-либо формулировок.

Второй — вопрос эффективности токенов. Если накладные расходы Claude Opus 5.5 на размышления снизятся в точечном релизе, его преимущество в 2,5 раза по тарифной сетке перестанет нивелироваться, и ценовой аргумент победит безоговорочно. Если этого не произойдёт, то практик, который сохранил GPT-6 Astra в качестве основного инструмента, не отстаёт от новостного цикла. Они правильно оценили собственную рабочую нагрузку, а таблица запуска просто её не измеряла.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно