Cartão de título com “Grok 4.7 vs Claude Opus 5” e o subtítulo “A diferença de preço é real; a paridade não é”, e três cartões: AA Index v4.3.2 46 vs 51, Preço por 1M $2/$6 vs $5/$25, e Terminal-Bench 4.0 26 vs 49.
Guides & Insights

Grok 4.7 vs Claude Opus 5: A diferença de preço é real, a paridade não.

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Você pode chamar o Grok 4.7 por US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída. Você pode chamar o Claude Opus 5 por US$ 5,00 e US$ 25,00. Isso é uma diferença de 4,2x na saída — o tipo de lacuna que geralmente decide uma comparação antes mesmo que os benchmarks sejam abertos. Ela não decide esta. Na versão do Artificial Analysis Intelligence Index contra a qual ambos os modelos são atualmente avaliados — v4.3.2, a revisão publicada em 19 de setembro de 2026 — o Claude Opus 5 está em 51 e o Grok 4.7, lançado pelo fornecedor em 21 de setembro de 2026, está em 46. Cinco pontos não é uma goleada, mas a forma dos cinco pontos é: o Opus 5 vence oito das dez avaliações nesse índice. O argumento do modelo mais barato é o preço, o contexto é equivalente, e o único lugar onde a vantagem de preço do Grok 4.7 deveria importar mais é exatamente onde ela desaparece.

Dois carros-chefe, duas tabelas de preços muito diferentes

O Claude Opus 5 está no mercado desde 24 de julho de 2026 e é o carro-chefe da linha Opus da Anthropic, ficando abaixo do Claude Fable 5.1 no próprio portfólio da empresa. Ele traz uma janela de contexto de 1M de tokens com preço fixo — a Anthropic afirma claramente que uma requisição de 900k tokens é cobrada à mesma tarifa por token que uma de 9k tokens, sem nenhum prêmio por contexto longo — e uma saída máxima de 128K, extensível a 300K na API Message Batches. O raciocínio é adaptativo e ativado por padrão, com uma escada de esforço que vai de low, medium, high, xhigh e max, com padrão em high. Os pesos são fechados.

O Grok 4.7 foi lançado há um dia. Tem uma janela de contexto de 500k tokens, recebe texto e imagens e devolve texto, e tem um seletor próprio de esforço de raciocínio. O seu preço de tabela é de US$ 2,00 para entrada e US$ 6,00 para saída por milhão de tokens abaixo de 200k tokens de prompt, passando para US$ 4,00 e US$ 12,00 nesse limiar ou acima dele; as leituras em cache são US$ 0,50 e US$ 1,00 nas mesmas duas faixas. A xAI também lista uma variante mais rápida que corre a cerca do dobro da velocidade de saída por cerca do dobro do preço, embora essa configuração tenha sido lançada sem uma medição de velocidade publicada associada. Os pesos também são fechados aqui, o que remove a válvula de escape de "executá-lo por conta própria" de ambos os lados desta comparação.

O conselho independente não está próximo, e não é lisonjeiro.

Ambos os modelos são avaliados no índice v4.3.2 da Artificial Analysis, que incorpora dez avaliações abrangendo agentes, programação, conhecimento geral e raciocínio científico. Colocar as duas colunas lado a lado faz com que a diferença de cinco pontos no título pareça generosa para o modelo mais barato — uma única diferença de cinco pontos num compósito pode esconder muita coisa, e aqui esconde uma quase varredura.

Inteligência composta — Grok 4.7 (xhigh): 46 no Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (raciocínio adaptativo, esforço máximo): 51 na mesma revisão.

Raciocínio difícil — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Uma diferença de doze pontos e de onze pontos, respetivamente, ambas a favor do Opus 5.

Terminais agênticos — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Esta é a maior diferença isolada do quadro, e está no benchmark mais próximo do trabalho autónomo real.

Automação do local de trabalho — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. A única vitória clara do Grok 4.7, e uma vitória de verdade — nove pontos na avaliação que mede se um agente conclui um fluxo de trabalho sem acionar uma salvaguarda.

Conhecimento e honestidade — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Ambos os modelos alucinam; o Opus 5 faz isso menos nessa medida.

Contexto longo — Grok 4.7: AA-LCR v1.1 77%, janela de 500 mil tokens. Claude Opus 5: 79%, janela de 1 milhão de tokens.

Custo para executar o índice — Grok 4.7: 240M tokens de saída ao longo da avaliação, sinalizado pela Artificial Analysis como incomumente prolixo. Claude Opus 5: 140M. Grok 4.7 gasta 1,7x os tokens para alcançar uma pontuação mais baixa.

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Onde a vantagem de preço do Grok 4.7 vai morrer

Aqui está a aritmética que a tabela de preços esconde. Considere uma solicitação agêntica realista: 30 mil tokens de entrada, 8 mil de saída. O Grok 4.7 cobra US$ 0,06 de entrada e US$ 0,048 de saída — cerca de onze centavos. O Claude Opus 5 cobra US$ 0,15 de entrada e US$ 0,20 de saída — cerca de trinta e cinco centavos. Isso é um 3x genuíno e, nesse porte, o Grok 4.7 é a escolha óbvia apenas pelo custo.

Agora pegue o pedido em torno do qual o próprio marketing do Grok 4.7 é construído: uma sessão agêntica de contexto longo. Ultrapasse 200 mil tokens no prompt e as tarifas do Grok 4.7 dobram para US$ 4,00 de entrada e US$ 12,00 de saída. O Claude Opus 5 não se move — sua janela de 1M cobra US$ 5,00 e US$ 25,00 fixos. Com 250 mil de entrada e 8 mil de saída, o Grok 4.7 custa US$ 1,00 de entrada e US$ 0,096 de saída, cerca de US$ 1,10. O Opus 5 custa US$ 1,25 de entrada e US$ 0,20 de saída, cerca de US$ 1,45. A diferença caiu de 3x para cerca de 1,3x. Vá mais longe — 400 mil, 500 mil, o topo da janela do Grok 4.7 — e a tarifa fixa do Opus 5 continua se aproximando, enquanto sua janela continua indo até um milhão de tokens. O Grok 4.7 é o modelo barato em prompts curtos e quase equivalente em preço nos longos, o que inverte a intuição que a página de preços foi projetada para criar.

Duas ressalvas mantêm isso honesto. Primeiro, a camada de contexto longo é uma estrutura de preço de tabela documentada na própria documentação de modelo da xAI, não uma medição — as contas reais dependem de cache, e a taxa de leitura em cache de $0.50 do Grok 4.7 é genuinamente barata. Segundo, a Artificial Analysis ainda não publicou uma medição de velocidade para o Grok 4.7, então a metade "é mais rápido" do argumento barato e rápido está atualmente não verificada. O que é medido é o Opus 5 a 59 tokens por segundo com um tempo até o primeiro token de 49 segundos — lento, caro e à frente em quase todos os eixos de qualidade.

O que você realmente encaminharia

Esta é uma comparação em que a resposta honesta varia conforme a carga de trabalho, e um roteador é a forma mais barata de agir com base nisso. O Claude Opus 5 está disponível no OrcaRouter, listado em sua própria página de modelo com o preço do provedor repassado com 0% de margem — portanto, os US$ 5,00 e US$ 25,00 do Opus 5 em nosso catálogo são o preço de tabela da Anthropic, não uma cópia com margem adicionada, e se a Anthropic alterá-lo, o número muda na mesma chave no mesmo dia. O Grok 4.7 não está no catálogo do OrcaRouter até o momento desta redação; para chamá-lo hoje, você passa pela própria API da xAI e pelas plataformas de terceiros que o oferecem. Vale a pena conhecer essa assimetria antes de arquitetar em torno dela.

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

O padrão de roteamento que resulta dos números é direto. Envie trabalho de contexto longo, intensivo em raciocínio e de agente de terminal para o Opus 5 — ele vence o Terminal-Bench 4.0 por 23 pontos e oferece o dobro da janela com preço fixo, que é exatamente o perfil de uma tarefa difícil e longa. Envie tarefas de automação e de fluxo de trabalho de alto volume para o Grok 4.7: ele vence o AutomationBench-AA por nove pontos e custa um terço do valor em prompts curtos. Como ambos são acessados por um único endpoint quando estão no catálogo, essa divisão é uma regra de roteamento, e não um segundo contrato com fornecedor, e o failover automático significa que um limite de taxa em um caminho se torna um evento de roteamento em vez de uma indisponibilidade. Quando uma carga de trabalho realmente precisa de ambos — uma primeira passagem barata e uma passagem de verificação cara —, a DSL de roteamento os compõe em uma única chamada, e não duas integrações.

O veredito

Se você está escolhendo com base em evidências, o Claude Opus 5 vence este confronto, e não é por pouco: oito de dez avaliações, as duas diferenças mais amplas, o dobro de contexto a preço fixo, e um orçamento de tokens bem abaixo de dois terços do tamanho para uma pontuação mais alta. A pontuação composta de cinco pontos subestima o quão amplamente ele lidera. O caso do Grok 4.7 é mais estreito do que sua tabela de preços sugere, mas não está vazio — ele é genuinamente mais barato nos tamanhos de prompt que a maioria das aplicações realmente usa, é o melhor modelo de automação, e tem apenas um dia de vida, com uma suíte de benchmarks do fornecedor ainda sendo reproduzida de forma independente. Compre-o para automação sensível a custos, acompanhe seus números de velocidade quando a Artificial Analysis publicá-los, e trate o nível de preço para contexto longo como aquilo que decide se o modelo barato continua barato.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente