
Claude Opus 5.5 vs Grok 4.6: Um Modelo Lê, o Outro Age
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Claude Opus 5.5 e Grok 4.6 são as duas formas mais baratas de comprar um modelo de classe frontier que suporta meio milhão de tokens de contexto — e não são o mesmo produto. Em uma medição, o Grok 4.6 fica três pontos abaixo do teto absoluto: 94,9 no GPQA Diamond, um conjunto de perguntas de ciência de nível de pós-graduação em que o carro-chefe da Anthropic está na mesma faixa. Na medição seguinte, fica trinta e oito pontos atrás. No Terminal-Bench 4.0, o benchmark agêntico de terminal que pede a um modelo que conclua trabalho real em um shell, a Artificial Analysis pontuou o Grok 4.6 com 21,21% e o Claude Opus 5.5 com 59,60%. Isso não é um erro de impressão em nenhuma das direções, e toda a forma desse pareamento consiste em explicar por que ambos os números são verdadeiros ao mesmo tempo.
Dois lançamentos, uma faixa de preço, quatro meses de diferença
A SpaceXAI lançou o Grok 4.6 em 12 de agosto de 2026 como o atual carro-chefe da linha Grok, a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 de saída, com uma janela de contexto de 500.000 tokens e uma superfície de entrada de texto, imagem e arquivo. A Anthropic lançou o Claude Opus 5.5 em 22 de setembro de 2026, cerca de seis semanas depois, a US$ 4,00/US$ 20,00, com uma janela de contexto de 1.000.000 de tokens e 128.000 tokens de saída. Ambos suportam esforço de raciocínio configurável, chamada de ferramentas e saídas estruturadas; ambos oferecem uma interface de chat compatível com OpenAI, bem como o formato próprio de seu fornecedor.
Então, a leitura ingênua é uma troca limpa: o Grok 4.6 custa metade do preço na entrada e cerca de um terço na saída, e o Claude Opus 5.5 responde com o dobro da janela de contexto. Essa troca é real, e em trabalhos com documentos longos pode ser a única coisa que importa. Também não é aí que está a divergência interessante, porque os dois modelos foram medidos no mesmo harness independente e não chegaram ao mesmo lugar nos eixos que importam para o trabalho agêntico.
O que o catálogo diz sobre os eixos nos quais ambos foram medidos
O catálogo da OrcaRouter traz a proveniência dos benchmarks em cada linha — cada número indica o avaliador de onde veio —, de modo que os pares abaixo vêm todos de uma única fonte para ambos os modelos, a Artificial Analysis, em vez de um número do fornecedor de um lado e de um terceiro do outro:
• GPQA Diamond — Claude Opus 5.5 não está listado neste eixo no nosso catálogo; o Grok 4.6 obtém 94,9%
• Humanity's Last Exam — 61,4% para Claude Opus 5.5 contra 42,9% para Grok 4.6
• SciCode — 66,9% contra 56,5%
• Recall de Contexto Longo — 84,7% contra 80,3%
• Terminal-Bench 4.0 — 59,60% contra 21,21%
• AA Intelligence Index — 57,6 contra 44,3
A linha GPQA é deliberadamente deixada em branco do lado da Anthropic, em vez de ser preenchida a partir de uma apresentação de fornecedor. O 94,9 do Grok 4.6 ali é o número mais forte em sua ficha e é genuíno — uma medição independente, não uma alegação da SpaceXAI — e diz algo real sobre o modelo: quando a tarefa é uma pergunta bem formulada com uma única resposta defensável, o Grok 4.6 atua na fronteira. Leia isso ao lado dos 21,21% do Terminal-Bench 4.0 e a forma se torna legível. Produzir uma resposta correta sobre ciência e executar uma tarefa de cinco etapas em um shell contra um sistema de arquivos real são competências diferentes, e o Grok 4.6 está muito mais avançado na primeira do que na segunda.
Uma ressalva sobre esse pareamento antes que ele seja usado como veredito: os números da Artificial Analysis dos dois modelos foram registrados em datas de avaliação diferentes, e os do Grok 4.6 são o conjunto mais antigo. A comparação é entre um modelo avaliado em agosto e outro avaliado em setembro, num harness que, ele próprio, foi revisado ao longo desse período. A direção da diferença é consistente em cinco eixos distintos, e é por isso que a tratamos como sinal, mas os valores exatos de pontuação devem ser lidos como uma comparação entre agosto e setembro, não como uma comparação do mesmo dia.
Um índice criado por alguém que também não está vendendo
Há uma segunda medida independente, e ela concorda quanto à direção, embora esteja muito menos disposta a fazer distinções finas. O Epoch Capabilities Index, construído pela Epoch AI como um compósito de mais de cinquenta benchmarks e reescalado de modo que Claude 3.5 Sonnet fique em 130 e GPT-5 em 150, coloca Claude Opus 5.5 em 167,35 no arquivo que lemos em 2 de outubro de 2026. Grok 4.6 está em 156,61, de uma avaliação de 12 de agosto. Isso é uma diferença de 10,74 pontos numa escala em que aproximadamente cinco pontos foram observados como correspondendo a uma duplicação da medida de horizonte temporal do METR no lançamento do índice — ampla, e confortavelmente fora dos intervalos publicados dos dois modelos, de 164,0 a 172,0 e de 154,66 a 158,93, que não se sobrepõem de modo algum.
Vale a pena observar o que este índice não resolve. Ele coloca Claude Sonnet 5.5 em 165,2 e Claude Fable 5.1 em 164,82, ambos acima do Grok 4.6, e ambos são mais baratos por milhão de tokens de saída do que a tarifa de segundo nível do Grok 4.6. Quem escolher apenas com base em capacidade por dólar tem uma terceira e uma quarta opção na mesma família de fornecedores, e a dupla deste artigo é sobre outra coisa: no que cada um dos dois modelos é bom.
As tabelas de tarifas, e a linha que só aparece em uma delas.

O cartão de tarifas do Grok 4.6 tem um degrau que o do Claude Opus 5.5 não tem: solicitações acima de 200.000 tokens de prompt são cobradas pelo dobro da tarifa base, então a entrada passa de $2,00 para $4,00 e a saída de $6,00 para $12,00, com a leitura de cache passando de $0,50 para $1,00. O Claude Opus 5.5 cobra $4,00/$20,00 com leituras de cache de $0,20 fixas ao longo de toda a janela de 1.000.000 de tokens. Essa inversão é a consequência prática de comprar contexto longo de qualquer um dos modelos, e ela inverte a comparação de preço de tabela quando uma carga de trabalho realmente cresce:
• Preço para 30.000 tokens de entrada — Claude Opus 5.5 é o mais caro, a cerca de 28 centavos para 30.000 de entrada e 8.000 de saída, contra cerca de 11 centavos do Grok 4.6
• Preço em 250.000 tokens de entrada — a ordem se inverte, porque o Grok 4.6 passou para seu patamar duplicado, enquanto o Claude Opus 5.5 não.
• Leituras de cache — US$ 0,20 por milhão para Claude Opus 5.5 contra US$ 0,50, subindo para US$ 1,00 acima do patamar, para Grok 4.6
• Saída máxima — 128.000 tokens para o Claude Opus 5.5; o limite de saída do Grok 4.6 não está publicado no registro do catálogo
Grok 4.6 também carrega uma lacuna que vale a pena declarar claramente, em vez de deixá-la para ser descoberta mais tarde. Seu registro não lista nenhum valor máximo de saída — o campo não foi medido, não é zero —, de modo que uma carga de trabalho que dependa de respostas individuais muito longas não tem nenhum número publicado para planejar desse lado da comparação.
A coluna de desempenho que não deve ser lida
O nosso catálogo também inclui um painel de desempenho de serviço por modelo e, no Grok 4.6, é a coisa mais enganosa da página. O cartão apresenta uma latência p50 de 10.000 milissegundos e uma taxa de erro de 97,58% numa janela de sete dias, com 26.184 tokens servidos nesse período. Esses campos não descrevem um modelo lento. Descrevem um modelo que quase não foi chamado: nesse nível de tráfego, a amostra é demasiado pequena para que uma distribuição de latência signifique alguma coisa, e a taxa de erro reflete um punhado de tentativas, e não uma qualidade de serviço. Tratar esse bloco como evidência de que o Grok 4.6 é lento seria ler um artefacto de medição como uma medição.
O painel do Claude Opus 5.5, em contrapartida, tem uma população por trás dele — um p50 na faixa dos 4,4 segundos ao longo de uma janela de sete dias com amostras diárias, e 156 milhões de tokens servidos no mesmo período. Até isso deve ser lido pelo que é: o tráfego do nosso próprio playground, que é uma amostra dos nossos usuários, e não uma propriedade do modelo.
Qual deles rotear, e como descobrir no seu próprio trabalho
A divisão que os números descrevem é estável o suficiente para agir com base nela. Claude Opus 5.5 é a escolha para trabalho agêntico e de longo horizonte — a diferença no Terminal-Bench 4.0, de 59,60% contra 21,21%, é a maior separação em qualquer eixo no qual ambos os modelos foram medidos, e é o eixo que prevê se um modelo pode receber uma tarefa em vez de uma pergunta. Também é a escolha quando o prompt é genuinamente longo, porque a tabela de preços não muda de faixa e a janela é duas vezes maior. Grok 4.6 é a escolha para trabalho em formato de pergunta em volume: uma pontuação de 94,9% no GPQA Diamond a $2,00/$6,00 dentro dos primeiros 200.000 tokens é um excelente negócio para cargas de trabalho de recuperação e resposta que nunca chegam à faixa com preço dobrado.
Ambos estão no OrcaRouter pelo preço de tabela do provedor, com 0% de markup — Claude Opus 5.5 a $4.00/$20.00 com leituras de cache a $0.20, Grok 4.6 a $2.00/$6.00 com o nível acima de 200K aplicado exatamente como a SpaceXAI o define — atrás de uma única chave, para que a divisão acima possa ser testada no seu próprio conjunto de prompts em vez de ser motivo de discussão. Onde ambos estão roteados, o failover automático fica por baixo, o que vale a pena ter quando o modelo mais barato é o que sustenta o caminho agêntico.
O veredito que esta dupla conquista: Grok 4.6 é o melhor leitor e Claude Opus 5.5 é o melhor executor. O 94,9 no GPQA Diamond e o 21,21 no Terminal-Bench são o mesmo modelo medido duas vezes, e saber com qual desses dois números sua carga de trabalho se parece é a decisão inteira.


Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
