
Grok 4.7 vs Grok 4.6: Mesmo preço de US$ 2/US$ 6, um modelo diferente por baixo
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 1009 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
A SpaceXAI lançou o Grok 4.7 em 21 de setembro de 2026, e a primeira coisa que vale a pena notar é o que não mudou: o preço. O Grok 4.7 custa US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, exatamente o que o Grok 4.6 custa desde que foi lançado em 12 de agosto de 2026. Mesma tabela de tarifas, mesma janela de contexto de 500.000 tokens, mesma entrada de texto e imagem — e, ainda assim, os dois modelos não estão próximos nas avaliações que importam para o trabalho agêntico. Nos próprios números publicados pela SpaceXAI, o Grok 4.7 quase dobra o Grok 4.6 no Terminal-Bench 4.0, 38,0% contra 20,3%. Esse é o quadro geral desta comparação: uma troca geracional pelo mesmo preço em que quase todo o ganho recai em um único lugar, e as partes do Grok 4.6 que incomodavam as equipes de produção ainda estão lá.
O que realmente mudou entre os dois modelos
A própria descrição da SpaceXAI sobre o lançamento é restrita, e vale mais citar a forma dela do que os adjetivos. O Grok 4.7 é construído sobre um modelo base maior que o Grok 4.6, e recebeu uma execução de aprendizado por reforço mais longa, voltada para tarefas que "podem levar horas para serem concluídas". A empresa afirma que essa execução aprimorou três coisas: a autoverificação, o tratamento de contextos longos e o comportamento dentro do ambiente do Grok Bot. Não há nenhuma alegação sobre uma nova arquitetura, uma nova modalidade ou uma pilha de serviço diferente.
Esse enquadramento importa porque prevê onde os ganhos do benchmark aparecem, e eles aparecem exatamente ali. Uma passagem mais longa de RL sobre tarefas difíceis de várias horas afeta o trabalho em terminal e repositório muito mais do que afeta um quiz de conhecimentos. Se você esperava que o Grok 4.7 fosse um modelo mais amplo que o Grok 4.6, as notas de lançamento dizem o contrário — é o mesmo formato de modelo, treinado mais a fundo no extremo difícil do trabalho agêntico.
A história dos parâmetros é a única parte disso que não é uma divulgação do fornecedor. Musk disse no início de setembro que o Grok 4.7 tem cerca de 2,1 trilhões de parâmetros, contra 1,5 trilhão do Grok 4.6, um aumento de 40%, e esse número tem sido repetido em todo lugar desde então. Ele nunca apareceu em uma ficha de especificações da SpaceXAI. Trate isso como uma alegação amplamente repassada sobre o modelo base, não como uma especificação confirmada — e observe que contagens de parâmetros dizem muito pouco sobre custo de serving ou capacidade quando a arquitetura é esparsa, como é a da linha Grok.
A lacuna do benchmark, com o rótulo de origem anexado
Todos os números desta seção vêm do material de lançamento da SpaceXAI. Nada disso foi reproduzido de forma independente no momento em que este texto foi escrito, e a forma honesta de lê-lo é como um conjunto de afirmações que por acaso é incomumente específico — o que o torna verificável mais tarde, mas não o torna verificado agora.
• Terminal-Bench 4.0 — Grok 4.7 38,0% (informado pelo fornecedor) vs Grok 4.6 20,3%. O maior delta do lançamento, e o que corresponde à afirmação de "RL mais longo em tarefas mais difíceis".
• CursorBench 4.0 — Grok 4.7 46,3% (relatado pelo fornecedor) vs Grok 4.6 40,4%. Um ganho real, mas modesto — menos de seis pontos, em um benchmark mais próximo do trabalho cotidiano de um editor do que de sessões autônomas de terminal.
• DeepSWE v1.1 — Grok 4.7 71,0% com esforço de raciocínio alto (relatado pelo fornecedor) vs. Grok 4.6 65,2%. Mais uma vez, uma melhoria sólida, mas sem nada de espetacular.
• EEBench — Grok 4.7 64,0% (informado pelo fornecedor). Nenhum número do Grok 4.6 foi publicado junto com ele, então este não diz nada sobre a atualização.
• AA-Briefcase v1.1 — Grok 4.7 com 1.657 Elo (informado pelo fornecedor), na avaliação de trabalho de conhecimento profissional.
Leia a lista como um conjunto e o padrão é consistente: o Grok 4.7 é significativamente melhor quando a tarefa é longa e agêntica, e marginalmente melhor quando a tarefa é curta. O salto no Terminal-Bench é aproximadamente uma duplicação; os ganhos em trabalho de edição são percentuais de um dígito. Se sua carga de trabalho tem formato de autocompletar, você está pagando os mesmos $2/$6 por uma pequena melhoria. Se sua carga de trabalho é "rodar por duas horas e voltar", o lançamento é direcionado diretamente a você.
O que diz a medição independente até agora
Existe um número independente, e vale a pena declará-lo com cuidado porque é fácil interpretá-lo mal. A Artificial Analysis atribui ao Grok 4.7 uma pontuação de 46 no seu Intelligence Index, versão v4.3.2, classificando-o na 16.ª posição entre 655 modelos no ranking. O Grok 4.6 fica em 44 na mesma escala. Uma diferença de dois pontos em um índice composto não é a duplicação que o Terminal-Bench mostra, e essa discrepância é informativa, e não contraditória: o índice combina raciocínio, conhecimento, matemática e programação, então um grande ganho em um único recorte agêntico acaba diluído por tudo o que o modelo não alterou.
Dois outros detalhes da mesma página são mais úteis do que a pontuação principal. Primeiro, o Grok 4.7 gerou 240 milhões de tokens de saída ao executar o índice, contra uma mediana de 92 milhões — é um raciocinador prolixo e, a uma taxa de saída de US$ 6 por milhão, essa prolixidade é um item de custo. Segundo, a pontuação composta do índice o coloca entre os modelos mais fortes da sua faixa de preço, que é a comparação que de fato importa para um comprador. A Artificial Analysis não publicou um preço preenchido para o Grok 4.7 na página do modelo, portanto não retire o valor de custo por tarefa de lá; use os US$ 2/US$ 6 do fornecedor.

O penhasco de preços que nenhum dos dois modelos corrigiu
Aqui está a parte da tabela de preços do Grok 4.6 que as equipes de produção aprenderam a odiar, e o Grok 4.7 não mudou isso. Abaixo de 200.000 tokens de entrada, a tarifa é de $2 de entrada e $6 de saída. Acima disso, toda a requisição é reprecificada para $4 de entrada e $12 de saída. Não os tokens excedentes — a requisição inteira. Uma chamada de 210.000 tokens custa o dobro de uma chamada de 199.000 tokens, por 11.000 tokens extras.
Com uma janela de contexto de 500.000 tokens em ambos os modelos, é fácil cair nesse precipício. Execuções de agente com contexto longo e prompts de repositório inteiro são exatamente as cargas de trabalho para as quais o Grok 4.7 foi ajustado, o que significa que o melhor caso de uso do modelo é também o mais propenso a disparar a duplicação. Se você está migrando trabalho para o Grok 4.7 porque ele lida melhor com sessões agênticas longas, reserve orçamento para o reajuste de preço antes de migrar, não depois.
Há também um nível de velocidade a considerar. A SpaceXAI oferece uma variante rápida do Grok 4.7 que dobra a velocidade de saída e dobra o preço de tabela. É uma troca legítima para programação interativa, e ruim para trabalho em lote — a mesma tarefa, com a mesma qualidade, custa o dobro por uma economia de tempo de relógio que ninguém está acompanhando.
Migrando do Grok 4.6 sem uma reescrita
A boa notícia prática é que se trata de uma troca de modelo, não de uma migração de plataforma. Ambos os modelos recebem texto e imagens e retornam texto, ambos usam os mesmos níveis de esforço de raciocínio, de low a xhigh, e o formato da requisição é o que a SpaceXAI vem atendendo desde o Grok 4.5. Código que chama o Grok 4.6 com um parâmetro de esforço não precisa ser reestruturado para chamar o Grok 4.7.
Onde a troca não sai de graça é na avaliação. Os ganhos do Grok 4.7 estão concentrados em execuções agênticas longas, então uma suíte de testes montada com prompts curtos de turno único não vai lhe mostrar quase nada — você verá a melhoria do tamanho do CursorBench e concluirá que a atualização não valeu o esforço, quando a justificativa para ela está em tarefas que sua suíte nunca exercita. A medição que realmente resolveria isso é a conclusão de tarefas em trabalho com múltiplas etapas: patches aceitos, regressões introduzidas, chamadas de ferramentas por tarefa concluída e com que frequência uma execução precisa de resgate humano. Esses são os eixos para os quais os próprios números do fornecedor apontam, e são os que nenhum benchmark publicado cobre para sua base de código.
A verbosidade é a segunda coisa a medir. Um modelo que emite 240 milhões de tokens em um índice padrão vai emitir mais tokens na sua carga de trabalho do que seu antecessor emitiu, e, a US$ 6 por milhão de tokens de saída, isso pode silenciosamente anular o valor de uma atualização pelo mesmo preço. Acompanhe os tokens de saída por tarefa concluída durante uma semana antes de se comprometer.

Qual chamar
A decisão é genuinamente simples, o que é incomum para uma comparação de modelos. O Grok 4.6 continua sendo a escolha correta para tráfego de turnos curtos e sensível a custos: chat, classificação, sumarização e assistência de código em escala de editor, nas quais os ganhos do Grok 4.7 são pequenos e sua verbosidade é um imposto. O Grok 4.7 é a escolha correta para a carga de trabalho para a qual foi criado — codificação agêntica de horizonte longo e trabalho de terminal, em que uma tarefa roda por horas e a autoverificação é a diferença entre um trabalho concluído e um trabalho travado.
Executar ambos não é um meio-termo aqui, é a resposta certa, e é barato de fazer. O Grok 4.6 está no catálogo do OrcaRouter ao preço de tabela da SpaceXAI com 0% de margem repassada diretamente, então a tabela de preços de $2/$6 acima é o que você paga — e, como repassamos o preço de tabela do provedor em vez de aplicar margem sobre ele, qualquer mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia em que acontece. Uma única chave de API cobre o Grok 4.6 e mais de 200 outros modelos, então mover tráfego entre eles conforme a tarefa é uma mudança de configuração, e não um segundo contrato. Se você quiser testar o Grok 4.7 em um caminho de produção antes de confiar nele, o padrão mais seguro é manter o fallback no Grok 4.6 — um modelo que você pode rotear hoje — e deixar o failover automático entre provedores trazer a requisição de volta quando o novo modelo apresentar problemas.

O que assistir em seguida
Duas coisas resolverão essa comparação, e nenhuma delas aconteceu ainda. A primeira é uma reprodução independente do número do Terminal-Bench 4.0 — 38% é um salto grande o suficiente para que alguém o repita, e, se ele se mantiver, o argumento a favor do Grok 4.7 em pipelines agênticos é forte por mérito, e não por marketing. A segunda é o restante do roteiro do Grok: a SpaceXAI definiu publicamente a sequência de Grok 4.8, Grok 4.9 e Grok 5 para depois deste lançamento, e a própria vida do Grok 4.6 foi de cerca de cinco semanas. Apostar no Grok 4.7 como uma premissa de plataforma de longo prazo repetiria o erro que as equipes cometeram com o Grok 4.5.
Por enquanto, a atualização pelo mesmo preço é real e a direção é clara. O número a ter em mente é que, com $2/$6, você comprou um modelo que aproximadamente dobra em trabalho de terminal de longo horizonte e mal se move em qualquer outro lugar — e isso é uma afirmação específica, útil e verificável, e não um salto geracional.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
