
Claude Opus 5.5 vs GPT-6 Astra: разрыв в $6 и вторая цена, которую Astra взимает сверх 272K
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
В этом месяце два производителя опубликовали таблицы бенчмарков для своих флагманских моделей, и в каждой таблице побеждала собственная модель, причём ни в одной из них нет ни одной строки, где две модели сравнивались бы напрямую. Claude Opus 5.5, выпущенная 22 сентября 2026 года по цене $4 за миллион входных токенов, и GPT-6 Astra, выпущенная 3 сентября 2026 года по цене $10 за миллион входных токенов, имеют между собой ровно два пересекающихся бенчмарка — и они разделили их: Opus 5.5 взяла работу, смежную с AutomationBench, в таблице Anthropic, а Astra взяла её в таблице OpenAI, при этом Astra явно впереди по научному рассуждению в обеих. Вот что может сказать вам материал производителей. Независимая картина менее двусмысленна и указывает в другую сторону, а ценовая картина ещё более перекошена, чем любая из них.
Что опубликовала каждая сторона
Таблица Anthropic для Opus 5.5 использует собственный тестовый стенд и собственные настройки уровня усилий, а там, где в ней указана Astra, цифры принадлежат Anthropic, а не получены повторным прогоном. Считайте весь набор данных заявленным производителем:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % против GPT-6 Astra 57,9 % (Anthropic отмечает, что в запуске Opus использовался режим xhigh effort)
• FrontierCode v1.1 — Claude Opus 5.5 54,4 % против GPT-6 Astra 53,3 %
• GDPval-AA v2.1, интеллектуальная работа — Claude Opus 5.5 1 846 Elo против GPT-6 Astra 1 542
• AutomationBench — Claude Opus 5.5 40,0 % против GPT-6 Astra 41,4 % (Astra впереди)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7 % против GPT-6 Astra 64,6 % (Astra впереди)
• Humanity's Last Exam, с инструментами — Claude Opus 5.5 67,7% против GPT-6 Astra 57,2%
Сторону OpenAI сложнее сопоставить, потому что OpenAI опубликовала Astra в сравнении с собственным предшественником, а не с флагманом Anthropic, и выбранные ею бенчмарки — использование компьютера, фронтенд-инжиниринг, общие знания — в основном вообще не фигурируют в таблице Anthropic. Это не нечестность, это обычное поведение при запуске, и именно поэтому сравнение, построенное на двух таблицах от производителей, — это сравнение двух выборок, а не двух моделей. Единственное, в чём обе таблицы сходятся, — это то, что Astra сильна в агентной науке и использовании компьютера, и что две модели достаточно близки в программировании, так что выбор инструмента оценки может изменить результат.
Независимый замер, который не выбрал ни один из вендоров

Artificial Analysis запускает каждую модель в одной опубликованной конфигурации, поэтому его показатели — единственные здесь, которые были получены одним и тем же оценщиком в одних и тех же условиях:
• Индекс интеллекта — Claude Opus 5.5 58, занимает 1-е место из 210, против GPT-6 Astra 53, занимающего 6-е место
• Метка конфигурации — Claude Opus 5.5 «Адаптивное рассуждение, максимальное усилие, резервный вариант по умолчанию», GPT-6 Astra «max»
• Скорость вывода — GPT-6 Astra 52,5 токенов/с, на нижней границе своего ценового сегмента по сравнению с Claude Opus 5.5, который ещё не опубликован
• Время до первого токена — GPT-6 Astra: 352,15 с против медианы по таблице 3,83 с; Claude Opus 5.5 ещё не опубликован
• Цена — Claude Opus 5.5 $4.00 за вход / $20.00 за выход за миллион токенов против GPT-6 Astra $10.00 / $50.00
• Контекст и вывод — GPT-6 Astra: контекст 1M и максимальный вывод 128K против Claude Opus 5.5: 1M и 128K
Пятипунктовый разрыв в индексе сам по себе не является решающим, и не следует читать его как таковой — обе модели попадают в один и тот же диапазон возможностей, а именно это в данном квартале и означает «frontier». Что строки Astra действительно показывают, так это то, что премиальная цена не покупает лидерство по возможностям в единственной таблице, где присутствуют обе модели. Строка задержки — это честное осложнение: 352 секунды до первого токена — самый высокий показатель в этой группе с большим отрывом, хотя он измерен при максимальном уровне усилий, а рассуждающая модель, которая думает, прежде чем выдать результат, всегда будет выглядеть медленной по этой метрике. Показатель 52,5 токенов/с более универсален, и для модели стоимостью $10/$50 он находится скорее на низкой стороне.
Вторая цена Astra, выше 272 000 токенов

Тарифная сетка — это то место, где эти двое перестают быть сопоставимыми вообще, потому что ценообразование Astra имеет ступенчатый характер. Стандартные тарифы: $10.00 за вход, $1.00 за кэшированный вход, $12.50 за запись в кэш и $50.00 за выход за миллион токенов. Однако если вы пересекаете порог в 272 000 входных токенов, весь запрос пересчитывается — не только превышение, а весь вызов — по удвоенным тарифам на вход и кэш и полуторному тарифу на выход. В результате работа с длинным контекстом обходится примерно в $20 за вход и $75 за выход за миллион токенов.
Claude Opus 5.5 так не делает. Anthropic выставляет счёт $4,00 и $20,00 при полном окне в 1 млн токенов по стандартному тарифу и прямо заявляет, что запрос на 900 тыс. токенов тарифицируется по той же ставке за токен, что и запрос на 9 тыс. токенов. Так что заявленное соотношение между этими двумя — Astra стоит в 2,5 раза дороже Opus 5.5 в обоих направлениях — это не то соотношение, которое применимо к рабочим нагрузкам, для которых обе модели фактически продаются. Для долгосрочного агента, несущего большой рабочий контекст, сравнение выглядит как $20/$75 против $4/$20, а это разница в пять раз на входе и почти в четыре на выходе. Пакетное ценообразование не исправляет это, а усугубляет: Opus 5.5 снижается вдвое до $2,00/$10,00, тогда как гибкий тариф Astra уменьшается вдвое до $5,00/$25,00 от базы, которая в случае длинного контекста уже в пять раз выше.
Это самая значимая для принятия решения асимметрия в этом противостоянии, и она незаметна ни в одной таблице запуска ни у одной из компаний, потому что оба поставщика указывают заявленную ставку. Если ваши промпты укладываются менее чем в 272K токенов, не обращайте на это внимания. Если вы создаёте агента, который читает репозиторий или набор документов, закладывайте цену $20/$75, прежде чем что-либо сравнивать.
Доступ — часть спецификации
Astra — первая модель OpenAI, пересёкшая порог критических возможностей в области кибербезопасности в рамках собственной системы Preparedness Framework компании, и её выпуск отражает эту классификацию, а не пропускную способность. Доступ сначала открыли ограниченному кругу организаций; для корпоративного доступа администратор должен включить его, прежде чем пользователи его увидят; а выпускаемая модель наотрез отказывается от некоторых категорий задач. Claude Opus 5.5 выходит с версией той же проблемы с другой стороны: он поставляется с уровнем защитных мер, который Anthropic ранее зарезервировала для Claude Fable 5.1, а значит, большинство запросов по кибербезопасности перенаправляются в Claude Opus 4.8, а работа в области биологии переключается на Claude Opus 5, если только аккаунт не верифицирован.
Оба поведения проявляются в одном и том же месте — в вашей оценке. Artificial Analysis помечает конфигурацию Opus 5.5 как «Default Fallback» именно потому, что запросы могут попасть на другую модель, а не на ту, которую вы указали, и на промптах по безопасности или наукам о жизни это происходит регулярно. Если ваша рабочая нагрузка относится к этим областям, строка модели в вашем запросе не гарантирует, какая модель ответила, и в ваши показатели качества будет входить меньшая модель на неизвестной доле вызовов. Ни один из поставщиков это не скрывает — оба документируют это, — но и ни один из них не упоминает об этом в своих заголовках.
Выбирая между ними
Вопрос, который на самом деле ставит это противостояние, — оправдывает ли рабочая нагрузка с длинным контекстом ступенчатое ценообразование Astra, и для большинства команд ответ будет «нет»: Opus 5.5 дешевле по каждой позиции ниже 272K, значительно дешевле выше этого порога, набирает больше баллов в единственном независимом рейтинге и достигает 1M токенов контекста без доплаты. Позиция Astra более узкая, но реальная — научные рассуждения, использование компьютера и инструментарий экосистемы OpenAI, — и если ваши оценки ставят её впереди по этим пунктам, надбавка — это статья расходов, а не ошибка.
Практическая сторона этого вопроса проявляется в том, как вы сталкиваете две модели друг с другом, ведь для честного сравнения обе модели должны работать на одном и том же ключе и оплачиваться по одному и тому же счёту. Обе маршрутизируются через OrcaRouter по прайсовой цене провайдера с наценкой 0% — Claude Opus 5.5 по цене Anthropic $4.00/$20.00 и GPT-6 Astra по $10.00/$50.00, — а значит, решение о 272K можно проверить на собственном трафике, а не обсуждать на основе двух пресс-релизов. Закрепить Astra за классами задач, где она выигрывает, и позволить автоматическому переключению при сбое обслуживать всё остальное — это правило маршрутизации, и запрос, пересекающий отметку 272K, можно направить по более дешёвому пути без изменения кода, потому что правило живёт в роутере, а не в вашем приложении.

Что изменило бы ответ?
Всё решило бы одно: контролируемое прямое сравнение при сопоставимых усилиях на общих бенчмарках. Ни один из вендоров не опубликовал такого сравнения и не имеет стимула это делать, так что независимый индекс остаётся единственным доступным сравнением в одинаковых условиях — и этот индекс ставит Opus 5.5 на пять пунктов и пять позиций выше Astra при цене за токены менее половины от цены Astra. Контраргумент, за которым стоит следить, состоит в том, что обе модели оценивались при максимальном уровне усилий, тогда как Opus 5.5 поставляется с настройкой по умолчанию medium; если преимущество Astra в долгосрочной научной работе сохранится при прогоне с сопоставимыми усилиями, аргумент в пользу премии становится сильнее, а не слабее. Пока кто-нибудь не проведёт такое сравнение, защитимая позиция такова: Astra — специалист по цене универсала, а Opus 5.5 — универсал, который, как оказалось, набирает больше баллов.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
