
Grok 4.6 против Claude Opus 5: те же 61, две разные экономики
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Artificial Analysis прогоняет каждую передовую модель через одни и те же девять тестов и публикует счет. В его Intelligence Index Grok 4.6 и Claude Opus 5 набирают одно и то же число — 61, что делает это редким случаем очного сравнения, когда сводный показатель не может подсказать, какую модель использовать. Подсказать же это может менее известный показатель из того же источника: в наборе AA-Briefcase для интеллектуальной работы Grok 4.6 выполнил задачу, затратив примерно 53 хода и около полумиллиарда входных токенов, тогда как Claude Opus 5 при максимальном усилии затратил на ту же работу примерно 103 хода и два миллиарда токенов. Это четырехкратный разрыв в потреблении токенов между двумя моделями с одинаковым главным показателем, и он становится заметен только тогда, когда перестаешь сравнивать карточки моделей и начинаешь сравнивать счета.
Обе модели — актуальные флагманские релизы, так что это чистое сравнение, а не сопоставление разных поколений. Grok 4.6 был выпущен SpaceXAI 12 августа 2026 года как доработка фундамента Grok 4.5 — той же смеси экспертов с 1,5 триллиона параметров, переобученной с более длительными прогонами обучения с учителем и обучения с подкреплением, нацеленными на долго работающих агентов. Claude Opus 5 был выпущен Anthropic 24 июля 2026 года как флагман с фиксированной датой выпуска, адаптивным мышлением, контекстным окном в 1 миллион токенов и вводом изображений и файлов. Они занимают одну и ту же позицию в независимом рейтинге и противоположные позиции в прайс-листе: $2 / $6 за миллион токенов у Grok 4.6 против $5 / $25 у Claude Opus 5. Самая интересная задача — понять, какая половина этого предложения определяет ваш выбор для продакшена.
Число 61, скрывающее четырехкратный разрыв в эффективности
Индекс интеллекта — это комбинация из девяти оценок, что является одновременно его сильной стороной и его слепым пятном. Одно число, усредняющее баллы за рассуждение, математику, кодирование и профессиональную работу со знаниями, скрывает, как модель приходит к этому результату — а эти две приходят к нему противоположно. Собственный набор задач Artificial Analysis в стиле «портфеля» для профессиональной работы со знаниями — это самое ясное окно в это: он измеряет реальные долгосрочные задачи и зафиксировал Grok 4.6 на примерно 53 шагах и 0,5 млрд входных токенов на задачу против Claude Opus 5 Max на примерно 103 шагах и 2 млрд входных токенов. С точки зрения экономики на задачу это разница между моделью, которая выполняет исследовательско-производственную работу за четверть токенов, и той, которая сжигает их.
Причина — это дизайнерское решение, а не баг. Grok 4.6 обучали специально для того, чтобы он проверял свою работу по ходу и останавливался, когда подзадача действительно завершена — xAI описывает длинные траектории выполнения задач с самопроверкой как цель обучения. Claude Opus 5 обучали на глубину рассуждений и широту знаний, и его поведение по умолчанию — думать усерднее и обращаться к дополнительным данным чаще, чем строго необходимо. Обе — «модели рассуждений»; они распределяют усилия по-разному, и это распределение и есть спецификация, важная для агентных рабочих нагрузок.

Разрыв наиболее важен для агентов, которые вызывают модель в цикле — исследовательских агентов, код-агентов, выполняющих десятки итераций, конвейеров обработки документов, работающих с пакетами за ночь. Каждая итерация тарифицируется, и каждый входной токен — это контекст, который необходимо отправлять заново при следующем вызове. Модель, которая укладывается в 53 итерации при 0,5 млрд токенов, не просто дешевле за токен; она дешевле за задачу примерно на порядок, чем модель, которой требуется 103 итерации при 2 млрд токенов, ещё до умножения на цену по прайс-листу.
Технический паспорт, обе стороны
Где они различаются на бумаге, каждый на одной строке:
• Intelligence Index — Grok 4.6 набирает 61 балл, занимая 6-е место из 184; Claude Opus 5 набирает 61 балл и находится в верхней части рейтинга. Ничья, по данным Artificial Analysis.
• Цена по прайс-листу за 1 млн токенов — Grok 4.6: $2 за вход / $6 за выход (удваивается до $4 / $12 для запросов с объёмом входных токенов от 200K); Claude Opus 5: $5 за вход / $25 за выход, с 50% скидкой при пакетной обработке до $2.50 / $12.50.
• Контекстное окно — 500K токенов у Grok 4.6 против 1 000 000 у Claude Opus 5, единственное самое явное преимущество по характеристикам, которым обладает любая из моделей.
• Максимальный вывод — Claude Opus 5 позволяет выводить до 128K токенов (300K через пакетный API); потолок вывода у Grok 4.6 ниже — в диапазоне типичного длинного ответа.
• Входы — оба принимают текст и изображения; Claude Opus 5 также принимает файлы, а мультимодальный ввод Anthropic более непосредственно проникает в документы.
• GDPVal-AA v2 (интеллектуальный труд) — Grok 4.6 с 1,753 Elo против Claude Opus 5 с 1,852 Elo. Opus 5 завоёвывает корону качества интеллектуального труда по показателю, где эффективность кейса была на стороне Grok. [Artificial Analysis]
• CursorBench v3.2 — 69,9% у Grok 4.6 против 70,0% у Claude Opus 5, фактически вровень на бенчмарке для агентов кодирования, на котором измерялись оба. [Artificial Analysis]
• Управление рассуждением — Claude Opus 5 предоставляет регулятор усилий от низкого до максимального и адаптивное мышление, включенное по умолчанию; Grok 4.6 предоставляет усилие рассуждения, но настроен на значение по умолчанию, которое благоприятствует длинным траекториям агента.
Смысл сравнения этих моделей бок о бок в том, что ни одна из них не доминирует. Claude Opus 5 — лучший универсал на бумаге: больше контекста, выше потолок вывода, поддержка файлов, более высокое качество интеллектуальной работы. Grok 4.6 — лучшее соотношение цены и качества и более эффективный агент. Остаётся лишь один вопрос: какое из этих описаний соответствует работе, которая есть у вас на самом деле.

Где Claude Opus 5 оправдывает свою премиальную цену
Заявленные Anthropic цифры — предоставленные вендором, не подтверждённые независимо — дают Claude Opus 5 результат 96,0% в SWE-bench Verified и 79,2% в SWE-bench Pro, а также 70,6% в OSWorld для сценариев компьютерного использования. По широкому композитному показателю его 61 совпадает с Grok 4.6, а по GDPVal-AA он заметно впереди. На практике это означает модель, которая уверенно держится на протяжении всего рабочего дня специалиста: составление текстов, анализ, рассуждение над длинными документами, задачи с изображениями и текстом, а также программирование — всё в одном месте, с запасом в миллион токенов.
Контекстное окно — честная причина выбрать именно её. {{1}}Лимит в 500K токенов велик, но это не целая кодовая база плюс исследовательский корпус плюс промежуточные результаты длительной сессии агента.{{/1}} {{2}}Команды, выполняющие глубокий однопроходный анализ очень больших корпусов — полного репозитория, годовой финансовой отчётности, длинной стопки PDF — уткнутся в потолок Grok 4.6 и никогда не достигнут предела Claude Opus 5.{{/2}} {{3}}Для таких задач дополнительный контекст — не роскошь; это разница между тем, чтобы задача уместилась целиком, и необходимостью оркестрировать обход лимита.{{/3}}
Где Grok 4.6 — более выгодная покупка
Переверните те же факты — и Grok 4.6 окажется более выгодной покупкой для агентных пайплайнов, причём с большим отрывом. Он на 2.5× дешевле по входным и на 4.2× дешевле по выходным токенам по сравнению с прейскурантной ценой Opus 5, а эффективность использования токенов на задачу усиливает этот эффект: данные AA-Briefcase говорят о примерно в 4× меньшем расходе токенов и в 2× меньшем числе шагов для достижения того же результата интеллектуальной работы. Умножьте 4× на 2.5× — и задача, которая по экономике Opus 5 стоит $1.00, обойдётся примерно в $0.10 по экономике Grok 4.6 — до того, как батч-скидки на стороне Opus сократят часть разрыва.
Что касается именно агентного программирования, результат Grok 4.6 в DeepSWE 1.1 улучшился с 54% до 65,9% при переходе с версии 4.5 на 4.6, а его показатель CursorBench находится в пределах половины балла от Opus 5, при этом система самостоятельно проверяет свою работу по ходу процесса. Для команды, выполняющей тысячи агентных вызовов в день, где каждый вызов — это многошаговый цикл, экономика каждой задачи и более короткие траектории — это разница между жизнеспособным продуктом и выгоранием бюджета. Именно этот аргумент приводит xAI, и независимые данные об эффективности подтверждают это направление.
Решение о маршрутизации
Это тот случай, когда роутер оправдывает своё существование, потому что правильный ответ — «оба, с разделением, определяемым формой рабочей нагрузки». Grok 4.6 и Claude Opus 5 оба доступны на OrcaRouter по прейскуранту каждого вендора — $2 / $6 для grok/grok-4.6, $5 / $25 для anthropic/claude-opus-5 — с нулевой наценкой, так что число в вашей модели затрат — это то число, которое будет выставлено в счёте. Техническая часть, которая делает разделение практичным: один API-ключ для обеих моделей, автоматическое переключение при деградации конечной точки одного провайдера в середине длительного агентного запуска, и маршрутизирующий DSL, который может отправлять короткие высокочастотные обращения к Grok 4.6 и эскалировать долгосрочную работу, требующую большого контекста, на Claude Opus 5 в рамках одного вызова. Вам не нужен второй контракт для двухуровневой архитектуры, и вы можете перенастраивать разделение по мере поступления реальных данных о трафике, а не гадать по карточкам моделей.

Честное прочтение
Ничья по составному индексу реальна, и это ловушка. Модели с одинаковым баллом не взаимозаменяемы — они различаются именно там, где балл слеп. Claude Opus 5 — более безопасный выбор по умолчанию для широкой, контекстно-нагруженной интеллектуальной работы с документами и изображениями, где окно в 1 млн токенов и глубокие рассуждения важнее, чем стоимость. Grok 4.6 — лучший выбор по умолчанию для высокообъёмных агентных циклов, где эффективность токенов на задачу и преимущество в цене в 2,5 раза складываются в разницу в счетах на порядок. Если ваша нагрузка относится к первому типу, платите за Opus 5 и перестаньте беспокоиться о цене. Если ко второму — паритет «61 на бумаге» — лучшая причина, которая у вас когда-либо будет, чтобы сначала протестировать Grok 4.6: бенчмарк говорит, что они равны, а счёт — что это не так.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
