
Grok 4.6 vs Claude Opus 5: Mesmo 61, Duas Economias Diferentes
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Artificial Analysis executa todos os modelos de fronteira pelas mesmas nove avaliações e publica a fatura. No seu Intelligence Index, Grok 4.6 e Claude Opus 5 empatam no mesmo número — 61 — o que torna este um confronto raro em que o composto não pode dizer qual usar. O que pode é um dado menos famoso da mesma fonte: na suíte de trabalho de conhecimento AA-Briefcase, o Grok 4.6 concluiu uma tarefa em aproximadamente 53 turnos e cerca de meio bilhão de tokens de entrada, enquanto o Claude Opus 5 com esforço máximo precisou de cerca de 103 turnos e dois bilhões de tokens para o mesmo trabalho. Essa é uma diferença de quatro para um no consumo de tokens entre dois modelos cuja pontuação principal é idêntica, e ela só aparece quando você para de comparar fichas técnicas e começa a comparar faturas.
Ambos os modelos são lançamentos atuais de carro-chefe, o que mantém esta uma comparação limpa, em vez de uma incompatibilidade de gerações. O Grok 4.6 foi lançado em 12 de agosto de 2026 pela SpaceXAI como um refinamento da base do Grok 4.5 — a mesma base de mistura de especialistas com 1,5 trilhão de parâmetros, retreinada com execuções mais longas de supervisão e aprendizado por reforço voltadas para agentes de longa duração. O Claude Opus 5 foi lançado em 24 de julho de 2026 pela Anthropic como um carro-chefe com data fixa, com pensamento adaptativo, janela de contexto de 1 milhão de tokens e entrada de imagens e arquivos. Eles estão no mesmo ponto no placar independente e em pontos opostos na tabela de preços: US$ 2 / US$ 6 por milhão de tokens para o Grok 4.6 contra US$ 5 / US$ 25 para o Claude Opus 5. O trabalho interessante é descobrir qual metade dessa frase decide sua escolha de produção.
O 61 que esconde uma lacuna de eficiência de quatro para um
O Intelligence Index é um composto de nove avaliações, o que é sua força e seu ponto cego. Um único número que calcula a média das pontuações de raciocínio, matemática, programação e trabalho do conhecimento esconde como um modelo chega lá — e estes dois chegam lá de forma oposta. A suíte profissional de trabalho do conhecimento estilo briefcase da própria Artificial Analysis é a janela mais clara para isso: ela mede tarefas reais de longo horizonte e registrou o Grok 4.6 com cerca de 53 turnos e 0,5B tokens de entrada por tarefa, contra o Claude Opus 5 Max com aproximadamente 103 turnos e 2B tokens de entrada. Em termos de economia por tarefa, essa é a diferença entre um modelo que conclui um trabalho de pesquisa e produção com um quarto dos tokens e outro que os consome.
A causa é uma escolha de design, não um bug. O Grok 4.6 foi treinado especificamente para verificar o próprio trabalho à medida que avança e para parar quando uma subtarefa está genuinamente concluída — a xAI descreve longas trajetórias de tarefas com autoteste como objetivo de treinamento. O Claude Opus 5 é treinado para profundidade de raciocínio e amplitude de conhecimento, e seu comportamento padrão é pensar mais e consultar mais do que o estritamente necessário. Ambos são "modelos de raciocínio"; alocam esforço de maneira diferente, e a alocação é a especificação que importa para as cargas de trabalho de agentes.

A diferença é mais importante para agentes que chamam um modelo em loop — agentes de pesquisa, agentes de código que executam dezenas de turnos, pipelines de documentos que processam lotes durante a noite. Cada turno é cobrado, e cada token de entrada é contexto que deve ser reenviado na próxima chamada. Um modelo que termina em 53 turnos com 0,5B tokens não é apenas mais barato por token; é mais barato por tarefa em aproximadamente uma ordem de magnitude do que um que leva 103 turnos com 2B tokens, antes mesmo de multiplicar pelo preço de tabela.
A ficha técnica, ambos os lados.
Onde diferem no papel, em uma linha cada:
• Índice de Inteligência — Grok 4.6 pontua 61, classificado em #6 de 184; Claude Opus 5 pontua 61, classificado junto no topo da tabela. Um empate, segundo a Artificial Analysis.
• Preço de tabela por 1M tokens — Grok 4.6 a $2 de entrada / $6 de saída (dobrando para $4 / $12 para prompts de 200 mil tokens de entrada ou mais); Claude Opus 5 a $5 de entrada / $25 de saída, com um desconto de 50% por lote, reduzindo para $2.50 / $12.50.
• Janela de contexto — 500K tokens para o Grok 4.6 contra 1.000.000 para o Claude Opus 5, a vantagem de especificação mais clara que qualquer um dos modelos possui.
• Saída máxima — Claude Opus 5 permite até 128K tokens de saída (300K via API de lote); o teto de saída do Grok 4.6 é menor, na faixa de uma resposta longa típica.
• Entradas — ambas aceitam texto e imagem; o Claude Opus 5 também aceita arquivos, e a versão da Anthropic de entrada multimodal adentra os documentos de maneira mais direta.
• GDPVal-AA v2 (trabalho de conhecimento) — Grok 4.6 a 1.753 Elo contra Claude Opus 5 a 1.852 Elo. O Opus 5 leva a coroa de qualidade em trabalho de conhecimento na métrica em que a eficiência do briefcase favoreceu o Grok. [Artificial Analysis]
• CursorBench v3.2 — 69,9% para o Grok 4.6 versus 70,0% para o Claude Opus 5, praticamente empatados no benchmark de agentes de codificação em que ambos foram medidos. [Artificial Analysis]
• Controle de raciocínioo Claude Opus 5 expõe um seletor de esforço que vai do nível baixo ao máximo, com pensamento adaptativo ativado por padrão; o Grok 4.6 expõe o esforço de raciocínio, mas é ajustado para um padrão que favorece trajetórias longas de agente.
O ponto de colocá-los lado a lado é que nenhum modelo domina. O Claude Opus 5 é o melhor generalista no papel: mais contexto, teto de saída maior, entrada de arquivos e maior qualidade em trabalho de conhecimento. O Grok 4.6 é o melhor custo-benefício e o agente mais eficiente. A única pergunta que resta é qual desses descreve o trabalho que você realmente tem.

Onde o Claude Opus 5 justifica seu preço premium
Os números do lançamento da Anthropic — relatados pela própria empresa, não reproduzidos de forma independente — colocam o Claude Opus 5 em 96,0% no SWE-bench Verified e 79,2% no SWE-bench Pro, com uma pontuação de 70,6% no OSWorld para uso de computador. No composto amplo, seus 61 pontos empatam com o Grok 4.6, e no GDPVal-AA ele está mensuravelmente à frente. Na prática, isso se traduz em um modelo que se sustenta ao longo de todo o dia de um profissional do conhecimento: redação, análise, raciocínio em documentos longos, tarefas de imagem e texto, e codificação — tudo em um só lugar, com um milhão de tokens de folga.
{{1}}A janela de contexto é a razão honesta para recorrer a ela. Um limite de 500 mil tokens é grande, mas não é uma base de código inteira mais um corpus de pesquisa mais os resultados intermediários de uma longa sessão de agente.{{/1}} {{2}}Equipes que fazem análise profunda de passagem única sobre corpora muito grandes — um repositório completo, um ano de documentos financeiros, uma longa pilha de PDFs — vão esbarrar no teto do Grok 4.6 e nunca alcançar o do Claude Opus 5.{{/2}} {{3}}Para essas cargas de trabalho, o contexto extra não é um luxo; é a diferença entre o trabalho caber e orquestrar em torno do limite.{{/3}}
Onde Grok 4.6 é a melhor compra
Inverta os mesmos fatos e o Grok 4.6 é a melhor compra para pipelines de agentes, e não por uma pequena margem. Ele é 2,5× mais barato na entrada e 4,2× mais barato na saída em relação ao preço de tabela do Opus 5, e sua eficiência de tokens por tarefa potencializa isso: os números do AA-Briefcase sugerem cerca de 4× menos tokens e 2× menos turnos para o mesmo resultado de trabalho de conhecimento. Multiplique 4× por 2,5× e uma tarefa que custa US$ 1,00 na economia do Opus 5 custa na ordem de US$ 0,10 na do Grok 4.6 — antes que os descontos por lote do lado do Opus reduzam parte da diferença.
Especificamente em codificação agêntica, o resultado DeepSWE 1.1 do Grok 4.6 melhorou de 54% para 65,9% entre 4.5 e 4.6, e sua pontuação CursorBench fica a meio ponto da do Opus 5, enquanto verifica seu próprio trabalho ao longo do processo. Para uma equipe que executa milhares de chamadas agênticas por dia, em que cada chamada é um loop de múltiplas etapas, a economia por tarefa e as trajetórias mais curtas são a diferença entre um produto viável e uma taxa de queima de caixa. Esse é o argumento que a xAI apresenta, e os dados independentes de eficiência corroboram essa direção.
A decisão de roteamento
Este é o confronto onde um roteador mostra seu valor, porque a resposta certa é "ambos, com a divisão definida pelo formato da carga de trabalho." Grok 4.6 e Claude Opus 5 estão ambos disponíveis no OrcaRouter pelo preço de tabela de cada fornecedor — $2 / $6 para grok/grok-4.6, $5 / $25 para anthropic/claude-opus-5 — com margem de 0%, então o número no seu modelo de custo é o número que é cobrado. O encanamento que torna a divisão prática: uma chave de API para ambos os modelos, failover automático se o endpoint de um fornecedor degradar no meio de uma execução longa de agente, e um DSL de roteamento que pode enviar turnos curtos e de alto volume para o Grok 4.6 e escalar o trabalho de longo horizonte e faminto por contexto para o Claude Opus 5 em uma única chamada. Você não precisa de um segundo contrato para executar uma arquitetura de dois níveis, e pode reajustar a divisão conforme dados reais de tráfego chegarem, em vez de adivinhar com base nas fichas técnicas dos modelos.

A leitura honesta
O empate no índice composto é real e é uma armadilha. Modelos com a mesma pontuação não são intercambiáveis; eles se diferenciam precisamente onde a pontuação é cega. Claude Opus 5 é o padrão mais seguro para trabalho de conhecimento amplo, com muito contexto e baseado em documentos e imagens, onde uma janela de 1 milhão de tokens e raciocínio profundo importam mais do que o custo. Grok 4.6 é o padrão melhor para loops de agente de alto volume, onde a eficiência de tokens por tarefa e uma vantagem de preço de 2,5× se acumulam em uma diferença de fatura de ordem de magnitude. Se a sua carga de trabalho for a primeira, pague pelo Opus 5 e pare de se preocupar com o preço. Se for a segunda, a paridade de 61 no papel é a melhor razão que você já terá para testar o Grok 4.6 primeiro — o benchmark diz que eles são iguais, e a fatura diz que não são.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
