Cartão de título de destaque gerado para Claude Opus 5.5 vs Grok 4.6, dividido por um divisor vertical: 'Claude Opus 5.5' com '$4.00 / $20.00' à esquerda, 'Grok 4.6' com '$2.00 / $6.00' à direita, e o slogan 'UM MODELO LÊ, O OUTRO AGE' na parte inferior, com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Claude Opus 5.5 vs Grok 4.6: Um Modelo Lê, o Outro Age

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Opus 5.5 e Grok 4.6 são as duas formas mais baratas de comprar um modelo de classe frontier que suporta meio milhão de tokens de contexto — e não são o mesmo produto. Em uma medição, o Grok 4.6 fica três pontos abaixo do teto absoluto: 94,9 no GPQA Diamond, um conjunto de perguntas de ciência de nível de pós-graduação em que o carro-chefe da Anthropic está na mesma faixa. Na medição seguinte, fica trinta e oito pontos atrás. No Terminal-Bench 4.0, o benchmark agêntico de terminal que pede a um modelo que conclua trabalho real em um shell, a Artificial Analysis pontuou o Grok 4.6 com 21,21% e o Claude Opus 5.5 com 59,60%. Isso não é um erro de impressão em nenhuma das direções, e toda a forma desse pareamento consiste em explicar por que ambos os números são verdadeiros ao mesmo tempo.

Dois lançamentos, uma faixa de preço, quatro meses de diferença

A SpaceXAI lançou o Grok 4.6 em 12 de agosto de 2026 como o atual carro-chefe da linha Grok, a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 de saída, com uma janela de contexto de 500.000 tokens e uma superfície de entrada de texto, imagem e arquivo. A Anthropic lançou o Claude Opus 5.5 em 22 de setembro de 2026, cerca de seis semanas depois, a US$ 4,00/US$ 20,00, com uma janela de contexto de 1.000.000 de tokens e 128.000 tokens de saída. Ambos suportam esforço de raciocínio configurável, chamada de ferramentas e saídas estruturadas; ambos oferecem uma interface de chat compatível com OpenAI, bem como o formato próprio de seu fornecedor.

Então, a leitura ingênua é uma troca limpa: o Grok 4.6 custa metade do preço na entrada e cerca de um terço na saída, e o Claude Opus 5.5 responde com o dobro da janela de contexto. Essa troca é real, e em trabalhos com documentos longos pode ser a única coisa que importa. Também não é aí que está a divergência interessante, porque os dois modelos foram medidos no mesmo harness independente e não chegaram ao mesmo lugar nos eixos que importam para o trabalho agêntico.

O que o catálogo diz sobre os eixos nos quais ambos foram medidos

O catálogo da OrcaRouter traz a proveniência dos benchmarks em cada linha — cada número indica o avaliador de onde veio —, de modo que os pares abaixo vêm todos de uma única fonte para ambos os modelos, a Artificial Analysis, em vez de um número do fornecedor de um lado e de um terceiro do outro:

• GPQA Diamond — Claude Opus 5.5 não está listado neste eixo no nosso catálogo; o Grok 4.6 obtém 94,9%

• Humanity's Last Exam — 61,4% para Claude Opus 5.5 contra 42,9% para Grok 4.6

• SciCode — 66,9% contra 56,5%

• Recall de Contexto Longo — 84,7% contra 80,3%

• Terminal-Bench 4.0 — 59,60% contra 21,21%

• AA Intelligence Index — 57,6 contra 44,3

A linha GPQA é deliberadamente deixada em branco do lado da Anthropic, em vez de ser preenchida a partir de uma apresentação de fornecedor. O 94,9 do Grok 4.6 ali é o número mais forte em sua ficha e é genuíno — uma medição independente, não uma alegação da SpaceXAI — e diz algo real sobre o modelo: quando a tarefa é uma pergunta bem formulada com uma única resposta defensável, o Grok 4.6 atua na fronteira. Leia isso ao lado dos 21,21% do Terminal-Bench 4.0 e a forma se torna legível. Produzir uma resposta correta sobre ciência e executar uma tarefa de cinco etapas em um shell contra um sistema de arquivos real são competências diferentes, e o Grok 4.6 está muito mais avançado na primeira do que na segunda.

Uma ressalva sobre esse pareamento antes que ele seja usado como veredito: os números da Artificial Analysis dos dois modelos foram registrados em datas de avaliação diferentes, e os do Grok 4.6 são o conjunto mais antigo. A comparação é entre um modelo avaliado em agosto e outro avaliado em setembro, num harness que, ele próprio, foi revisado ao longo desse período. A direção da diferença é consistente em cinco eixos distintos, e é por isso que a tratamos como sinal, mas os valores exatos de pontuação devem ser lidos como uma comparação entre agosto e setembro, não como uma comparação do mesmo dia.

Um índice criado por alguém que também não está vendendo

Há uma segunda medida independente, e ela concorda quanto à direção, embora esteja muito menos disposta a fazer distinções finas. O Epoch Capabilities Index, construído pela Epoch AI como um compósito de mais de cinquenta benchmarks e reescalado de modo que Claude 3.5 Sonnet fique em 130 e GPT-5 em 150, coloca Claude Opus 5.5 em 167,35 no arquivo que lemos em 2 de outubro de 2026. Grok 4.6 está em 156,61, de uma avaliação de 12 de agosto. Isso é uma diferença de 10,74 pontos numa escala em que aproximadamente cinco pontos foram observados como correspondendo a uma duplicação da medida de horizonte temporal do METR no lançamento do índice — ampla, e confortavelmente fora dos intervalos publicados dos dois modelos, de 164,0 a 172,0 e de 154,66 a 158,93, que não se sobrepõem de modo algum.

Vale a pena observar o que este índice não resolve. Ele coloca Claude Sonnet 5.5 em 165,2 e Claude Fable 5.1 em 164,82, ambos acima do Grok 4.6, e ambos são mais baratos por milhão de tokens de saída do que a tarifa de segundo nível do Grok 4.6. Quem escolher apenas com base em capacidade por dólar tem uma terceira e uma quarta opção na mesma família de fornecedores, e a dupla deste artigo é sobre outra coisa: no que cada um dos dois modelos é bom.

As tabelas de tarifas, e a linha que só aparece em uma delas.

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

O cartão de tarifas do Grok 4.6 tem um degrau que o do Claude Opus 5.5 não tem: solicitações acima de 200.000 tokens de prompt são cobradas pelo dobro da tarifa base, então a entrada passa de $2,00 para $4,00 e a saída de $6,00 para $12,00, com a leitura de cache passando de $0,50 para $1,00. O Claude Opus 5.5 cobra $4,00/$20,00 com leituras de cache de $0,20 fixas ao longo de toda a janela de 1.000.000 de tokens. Essa inversão é a consequência prática de comprar contexto longo de qualquer um dos modelos, e ela inverte a comparação de preço de tabela quando uma carga de trabalho realmente cresce:

• Preço para 30.000 tokens de entrada — Claude Opus 5.5 é o mais caro, a cerca de 28 centavos para 30.000 de entrada e 8.000 de saída, contra cerca de 11 centavos do Grok 4.6

• Preço em 250.000 tokens de entrada — a ordem se inverte, porque o Grok 4.6 passou para seu patamar duplicado, enquanto o Claude Opus 5.5 não.

• Leituras de cache — US$ 0,20 por milhão para Claude Opus 5.5 contra US$ 0,50, subindo para US$ 1,00 acima do patamar, para Grok 4.6

• Saída máxima — 128.000 tokens para o Claude Opus 5.5; o limite de saída do Grok 4.6 não está publicado no registro do catálogo

Grok 4.6 também carrega uma lacuna que vale a pena declarar claramente, em vez de deixá-la para ser descoberta mais tarde. Seu registro não lista nenhum valor máximo de saída — o campo não foi medido, não é zero —, de modo que uma carga de trabalho que dependa de respostas individuais muito longas não tem nenhum número publicado para planejar desse lado da comparação.

A coluna de desempenho que não deve ser lida

O nosso catálogo também inclui um painel de desempenho de serviço por modelo e, no Grok 4.6, é a coisa mais enganosa da página. O cartão apresenta uma latência p50 de 10.000 milissegundos e uma taxa de erro de 97,58% numa janela de sete dias, com 26.184 tokens servidos nesse período. Esses campos não descrevem um modelo lento. Descrevem um modelo que quase não foi chamado: nesse nível de tráfego, a amostra é demasiado pequena para que uma distribuição de latência signifique alguma coisa, e a taxa de erro reflete um punhado de tentativas, e não uma qualidade de serviço. Tratar esse bloco como evidência de que o Grok 4.6 é lento seria ler um artefacto de medição como uma medição.

O painel do Claude Opus 5.5, em contrapartida, tem uma população por trás dele — um p50 na faixa dos 4,4 segundos ao longo de uma janela de sete dias com amostras diárias, e 156 milhões de tokens servidos no mesmo período. Até isso deve ser lido pelo que é: o tráfego do nosso próprio playground, que é uma amostra dos nossos usuários, e não uma propriedade do modelo.

Qual deles rotear, e como descobrir no seu próprio trabalho

A divisão que os números descrevem é estável o suficiente para agir com base nela. Claude Opus 5.5 é a escolha para trabalho agêntico e de longo horizonte — a diferença no Terminal-Bench 4.0, de 59,60% contra 21,21%, é a maior separação em qualquer eixo no qual ambos os modelos foram medidos, e é o eixo que prevê se um modelo pode receber uma tarefa em vez de uma pergunta. Também é a escolha quando o prompt é genuinamente longo, porque a tabela de preços não muda de faixa e a janela é duas vezes maior. Grok 4.6 é a escolha para trabalho em formato de pergunta em volume: uma pontuação de 94,9% no GPQA Diamond a $2,00/$6,00 dentro dos primeiros 200.000 tokens é um excelente negócio para cargas de trabalho de recuperação e resposta que nunca chegam à faixa com preço dobrado.

Ambos estão no OrcaRouter pelo preço de tabela do provedor, com 0% de markup — Claude Opus 5.5 a $4.00/$20.00 com leituras de cache a $0.20, Grok 4.6 a $2.00/$6.00 com o nível acima de 200K aplicado exatamente como a SpaceXAI o define — atrás de uma única chave, para que a divisão acima possa ser testada no seu próprio conjunto de prompts em vez de ser motivo de discussão. Onde ambos estão roteados, o failover automático fica por baixo, o que vale a pena ter quando o modelo mais barato é o que sustenta o caminho agêntico.

O veredito que esta dupla conquista: Grok 4.6 é o melhor leitor e Claude Opus 5.5 é o melhor executor. O 94,9 no GPQA Diamond e o 21,21 no Terminal-Bench são o mesmo modelo medido duas vezes, e saber com qual desses dois números sua carga de trabalho se parece é a decisão inteira.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente