
Claude Opus 5.5 против Grok 4.6: одна модель читает, другая действует
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Claude Opus 5.5 и Grok 4.6 — это два самых дешёвых способа купить модель фронтирного класса, способную удержать полмиллиона токенов контекста, и это не один и тот же продукт. По одному измерению Grok 4.6 отстоит от абсолютного потолка всего на три пункта: 94,9 на GPQA Diamond — наборе научных вопросов уровня выпускника, где флагман Anthropic находится в том же диапазоне. По следующему измерению он отстаёт на тридцать восемь пунктов. На Terminal-Bench 4.0, агентном терминальном бенчмарке, который требует от модели выполнить реальную работу в командной оболочке, Artificial Analysis оценила Grok 4.6 в 21,21%, а Claude Opus 5.5 — в 59,60%. Это не опечатка ни в ту, ни в другую сторону, и вся суть этого сопоставления в том, чтобы объяснить, почему оба числа верны одновременно.
Два релиза, одна ценовая категория, с разницей в четыре месяца
SpaceXAI выпустила Grok 4.6 12 августа 2026 года как текущий флагман линейки Grok, по цене $2,00 за миллион входных токенов и $6,00 за выходные, с контекстным окном 500 000 токенов и поддержкой ввода текста, изображений и файлов. Anthropic выпустила Claude Opus 5.5 22 сентября 2026 года, примерно шестью неделями позже, по цене $4,00/$20,00 с контекстным окном 1 000 000 токенов и 128 000 выходных токенов. Обе поддерживают настраиваемые усилия рассуждения, вызов инструментов и структурированные выходные данные; обе предоставляют чат-интерфейс, совместимый с OpenAI, а также собственный формат своего поставщика.
Итак, наивное прочтение — это чистая сделка: Grok 4.6 стоит вдвое дешевле на входе и примерно втрое — на выходе, а Claude Opus 5.5 отвечает с вдвое большим контекстным окном. Эта сделка реальна, и в работе с длинными документами она может быть единственным, что имеет значение. Но интересное расхождение не в этом, потому что обе модели были измерены на одном и том же независимом стенде и не оказались в одном и том же месте на осях, важных для агентной работы.
Что в каталоге указано по осям, по которым измерялись оба
Каталог OrcaRouter для каждой строки содержит сведения о происхождении бенчмарка — каждая цифра указывает, от какого оценщика она получена, — поэтому приведённые ниже пары относятся к одному источнику для обеих моделей, Artificial Analysis, а не к числу от вендора с одной стороны и третьей стороны с другой:
• GPQA Diamond — Claude Opus 5.5 не представлен на этой оси в нашем каталоге; Grok 4.6 набирает 94,9%
• Humanity's Last Exam — 61,4% у Claude Opus 5.5 против 42,9% у Grok 4.6
• SciCode — 66,9% против 56,5%
• Воспроизведение в длинном контексте — 84,7 % против 80,3 %
• Terminal-Bench 4.0 — 59,60 % против 21,21 %
• AA Intelligence Index — 57,6 против 44,3
Строка GPQA на стороне Anthropic намеренно оставлена пустой, а не заполнена из вендорской презентации. Показатель Grok 4.6 в 94,9 там — самое сильное число в его карточке, и оно подлинное — независимое измерение, а не заявление SpaceXAI — и говорит о модели кое-что реальное: когда задача представляет собой хорошо сформулированный вопрос с одним обоснованным ответом, Grok 4.6 показывает результат на переднем крае. Сопоставьте это с 21,21% в Terminal-Bench 4.0 — и картина становится понятной. Дать правильный ответ о науке и выполнить пятишаговую задачу в оболочке с реальной файловой системой — это разные компетенции, и Grok 4.6 гораздо дальше продвинулся в первой, чем во второй.
Одна оговорка по этому сопоставлению, прежде чем использовать его как вердикт: показатели Artificial Analysis для двух моделей были зафиксированы в разные даты оценки, причём у Grok 4.6 они относятся к более старому набору. Сравнение идёт между моделью, оценённой в августе, и моделью, оценённой в сентябре, на тестовом стенде, который сам за это время пересматривался. Направление разрыва согласуется по пяти отдельным осям — именно поэтому мы считаем это сигналом, — но точные значения в баллах следует читать как сравнение август-против-сентября, а не как сравнение в один и тот же день.
Индекс, созданный кем-то, кто тоже не продаёт.
Есть второй независимый показатель, и он согласуется с направлением, но при этом гораздо меньше склонен проводить тонкие различия. Epoch Capabilities Index, построенный Epoch AI как композит из более чем пятидесяти бенчмарков и перемасштабированный так, что Claude 3.5 Sonnet находится на отметке 130, а GPT-5 — на 150, помещает Claude Opus 5.5 на 167,35 в файле, который мы прочитали 2 октября 2026 года. Grok 4.6 находится на 156,61 по результатам оценки от 12 августа. Это разрыв в 10,74 пункта по шкале, где, как наблюдалось, примерно пять пунктов соответствовали удвоению показателя временного горизонта METR на момент запуска индекса — широкий и с большим запасом выходящий за пределы опубликованных интервалов двух моделей: от 164,0 до 172,0 и от 154,66 до 158,93, которые вообще не пересекаются.
Стоит отметить, чего этот индекс не решает. Он ставит Claude Sonnet 5.5 на 165,2, а Claude Fable 5.1 — на 164,82, обе выше Grok 4.6, и обе дешевле за миллион выходных токенов, чем тариф второго уровня у Grok 4.6. У любого, кто выбирает исключительно по соотношению возможностей и цены, есть третий и четвёртый вариант в семействе того же вендора, а сопоставление в этой статье — о другом: о том, в чём каждая из двух моделей особенно хороша.
Тарифные карты, и строка, которая появляется только на одной из них

В тарифной сетке Grok 4.6 есть ступень, которой нет у Claude Opus 5.5: запросы свыше 200 000 токенов промпта тарифицируются по двойному базовому тарифу, поэтому вход дорожает с $2.00 до $4.00, а выход — с $6.00 до $12.00, при этом чтение из кэша — с $0.50 до $1.00. Claude Opus 5.5 берёт $4.00/$20.00 при фиксированной цене чтения из кэша $0.20 на всём окне в 1 000 000 токенов. Эта инверсия — практическое следствие покупки длинного контекста у любой из двух моделей, и она переворачивает сравнение ценников, как только рабочая нагрузка действительно растёт:
• Цена при 30 000 входных токенов — Claude Opus 5.5 — дорогой вариант: примерно 28 центов за 30 000 входных и 8 000 выходных токенов против примерно 11 центов у Grok 4.6
• Цена при 250 000 входных токенов — порядок меняется на обратный, потому что Grok 4.6 перешёл на свой удвоенный тариф, а Claude Opus 5.5 — нет
• Чтения из кэша — $0.20 за миллион у Claude Opus 5.5 против $0.50 у Grok 4.6 с повышением до $1.00 при превышении порога.
• Максимальный объём вывода — 128 000 токенов для Claude Opus 5.5; предельный объём вывода Grok 4.6 не указан в записи каталога
Grok 4.6 также несёт одно упущение, о котором стоит сказать прямо, а не оставлять на потом, чтобы его обнаружили позже. В его карточке вообще не указан показатель максимального вывода — это поле не измерено, а не равно нулю — поэтому рабочая нагрузка, зависящая от очень длинных одиночных ответов, не имеет опубликованного числа, на которое можно было бы ориентироваться при планировании с этой стороны сравнения.
Столбец производительности, который не следует читать
В нашем каталоге также есть панель производительности обслуживания для каждой модели, и на Grok 4.6 это самый вводящий в заблуждение элемент на странице. На карточке указано: задержка p50 составляет 10 000 миллисекунд, а частота ошибок — 97,58% за семидневное окно, при этом за этот период было обслужено 26 184 токена. Эти поля описывают не медленную модель. Они описывают модель, которую почти не вызывали: при таком уровне трафика выборка слишком мала, чтобы распределение задержек что-либо значило, а частота ошибок отражает несколько попыток, а не качество обслуживания. Если считать этот блок доказательством того, что Grok 4.6 работает медленно, это означало бы принимать артефакт измерения за измерение.
Панель Claude Opus 5.5, напротив, имеет за собой генеральную совокупность — p50 в диапазоне 4,4 секунды на семидневном окне с ежедневными выборками и 156 миллионов токенов, обслуженных за тот же период. Даже это следует понимать как то, чем оно является: наш собственный трафик в песочнице, который представляет собой выборку наших пользователей, а не свойство модели.
Что именно маршрутизировать и как определить это самостоятельно в своей работе
Разделение, которое описывают эти числа, достаточно стабильно, чтобы на него опираться. Claude Opus 5.5 — выбор для агентных и долгосрочных задач: разрыв в Terminal-Bench 4.0 — 59,60% против 21,21% — это наибольшее расхождение по любой оси, по которой измерялись обе модели, и именно эта ось предсказывает, можно ли поручить модели задачу, а не вопрос. Он также является выбором, когда промпт действительно длинный, потому что тарифная сетка не меняется ступенчато, а окно вдвое больше. Grok 4.6 — выбор для массовой работы в формате вопросов: оценка 94,9% в GPQA Diamond при $2,00/$6,00 в пределах первых 200 000 токенов — очень выгодное предложение для рабочих нагрузок поиска и ответов, которые никогда не вырастают до удвоенного тарифа.
Обе доступны на OrcaRouter по прайсовой цене провайдера с наценкой 0% — Claude Opus 5.5 за $4.00/$20.00 при $0.20 за чтение из кэша, Grok 4.6 за $2.00/$6.00, причём тариф для контекста свыше 200K применяется ровно так, как его задаёт SpaceXAI — за одним ключом, так что описанное выше разделение можно проверить на собственном наборе промптов, а не спорить о нём. Там, где маршрутизируются обе, автоматическое переключение при сбое работает в основе, и это стоит иметь, когда именно более дешёвая модель держит агентный путь.
Вердикт, который заслуживает эта пара: Grok 4.6 — лучший читатель, а Claude Opus 5.5 — лучший работник. 94,9 на GPQA Diamond и 21,21 на Terminal-Bench — это одна и та же модель, измеренная дважды, и понимание того, на какое из этих двух чисел похожа ваша рабочая нагрузка, — это и есть всё решение.


Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
