
Grok 4.7 obtém 46 no Índice de Inteligência da Artificial Analysis e coloca a SpaceXAI entre as quatro primeiras
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Grok 4.7 obtém 46 no Índice de Inteligência da Artificial Analysis e coloca a SpaceXAI entre as quatro primeiras
O Grok 4.7 foi lançado. A SpaceXAI o lançou na segunda-feira, 21 de setembro de 2026 — pelo mesmo $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída do Grok 4.6, com a mesma janela de contexto de 500.000 tokens, uma data de corte de conhecimento mais recente e um novo nível máximo de raciocínio. Ele está disponível no Cursor e no Grok Build, pela API do próprio fornecedor e por ambientes de codificação de terceiros, roteadores de modelos e plataformas de nuvem. O Grok 4.5, de 8 de julho, permanece abaixo dele como a opção mais barata, e os modelos que ele ainda precisa superar continuam os mesmos: Claude Fable 5.1, Claude Opus 5 e GPT-5.6 Sol estão todos acima dele no Intelligence Index v4.3.2 da Artificial Analysis, onde a primeira pontuação independente do Grok 4.7 — 46 — fica dois pontos acima do Grok 4.6 e sete abaixo do Claude Fable 5.1. No mesmo ranking AA-Briefcase do mesmo avaliador para trabalho de conhecimento de longo horizonte, ele fica em quarto lugar, atrás de três entradas Claude e à frente do Claude Opus 5 com esforço xhigh, a aproximadamente metade do custo por tarefa do Claude Opus 5 — o primeiro resultado independente neste lançamento que se lê como uma vitória de custo-benefício, e não como uma lacuna. Onze dias depois, o quadro se ampliou nas bordas, e não no meio: desde 1º de outubro, ele vem sendo disponibilizado dentro dos próprios aplicativos web e móveis do Grok, onde o seletor de modo agora o lista em suas duas opções mais difíceis, e está listado no OrcaRouter pelo próprio $2/$6 da SpaceXAI.
Esse é o lançamento. Os números mais úteis chegaram no mesmo dia, do único avaliador nesta história que não é o fornecedor: Artificial Analysis publicou sua primeira avaliação independente do Grok 4.7, e é um resultado em três partes — um 46 no Intelligence Index, que está apenas dois pontos à frente do Grok 4.6, um 56 no Coding Agent Index, que está nove pontos à frente dele, e um Elo de 1.657 no AA-Briefcase, que está 111 pontos à frente. Esses três números apontam em direções diferentes, e a disparidade entre eles é a coisa mais interessante deste lançamento. O que vem a seguir é a especificação do produto lançado, a própria tabela de benchmarks do fornecedor, com o rótulo que cada linha precisa, e então as pontuações independentes lidas corretamente — incluindo o que elas dizem sobre a ressalva de prontidão que a SpaceXAI nunca abordou.
O que a SpaceXAI lançou em 21 de setembro
Comece pela especificação, porque ela está incomumente próxima à do seu antecessor. O Grok 4.7 tem preço idêntico ao do Grok 4.6 — US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída abaixo de 200.000 tokens de entrada, subindo para US$ 4 de entrada e US$ 12 de saída quando uma solicitação ultrapassa esse limite, a mesma estrutura que o Grok 4.6 introduziu. A janela de contexto é de 500.000 tokens. A data de corte de conhecimento é maio de 2026, três meses após 1º de fevereiro de 2026 do Grok 4.6. O esforço de raciocínio abrange quatro níveis — baixo, médio, alto e xhigh — e os números publicados são citados em xhigh. Uma variante rápida funciona com o dobro da velocidade de saída pelo dobro do preço.
No fundo, a xAI descreve três mudanças, e não uma nova arquitetura. O modelo base é maior do que o do Grok 4.6. O treinamento de aprendizado por reforço foi mais longo e teve peso maior em tarefas que levam muitas horas para serem concluídas. E o modelo foi treinado para verificar o próprio trabalho e reter melhor contextos longos, incluindo compreensão nativa do Grok Bot harness. O próprio resumo de uma linha da empresa é "duas vezes mais rápido, pela metade do preço de modelos comparáveis" — uma alegação de posicionamento sobre rivais, e não uma medição, e vale a pena lê-la como tal.
A disponibilidade era ampla já no primeiro dia e se ampliou duas vezes desde então. No lançamento: Cursor e Grok Build, a própria API do fornecedor, ferramentas de codificação de terceiros, roteadores de modelos e plataformas de nuvem; a própria página do Grok Build da SpaceXAI agora diz claramente para "começar a construir com o Grok 4.7". Em 28 de setembro, a Amazon Web Services o adicionou ao Amazon Bedrock com a mesma janela de contexto de 500.000 tokens e os mesmos quatro níveis de esforço de raciocínio, servido por meio de perfis de inferência entre Regiões, de modo que o modelo agora é acessível pelo catálogo do próprio hiperescalador e não apenas pela API do fornecedor. Depois, em 1º de outubro, ele começou a ser disponibilizado dentro dos aplicativos web e móveis voltados ao consumidor do Grok e, dois dias depois, ainda é onde se encontra. Esse último é incomumente discreto: a SpaceXAI anunciou a etapa equivalente para o Grok 4.5 com um post de blog intitulado "Trazendo o Grok 4.5 para iOS, Android, Web e X", e não publicou nada para o Grok 4.7, então a mudança é visível no produto, e não anunciada. Ela é feita no lado do servidor, e não enviada como parte do aplicativo, o que as listagens dos aplicativos confirmam: tanto a listagem do Grok para iOS quanto a do Android mudaram em 1º de outubro — a build da App Store é a 1.4.47, lançada naquele dia, e sua nota de versão menciona apenas "Melhorias no Chat, Voz e Imagine", enquanto a listagem na Play foi atualizada no mesmo dia. A mudança é enviada pelo backend, e não incorporada a um binário. Como a implementação está sendo noticiada, e não documentada, o escopo preciso é mais difícil de estabelecer do que no caso da listagem no Bedrock, que tem um post datado da AWS por trás, e a cobertura já se desviou: as contas que acompanham isso agora descrevem o Grok 4.7 como o modelo base em todos os modos — Fast, Expert, Build e Heavy — uma lista que não corresponde ao que o grok.com de fato oferece. Leia isso como a cobertura dos próprios rastreadores, e não como uma descrição do fornecedor. Parceiros selecionados de cibersegurança recebem acesso somente por convite às capacidades de red-team do modelo.
Uma correção ao registro que esta matéria manteve. A contagem de parâmetros que circulou por dois meses — cerca de 2,1 trilhões, aproximadamente 40% acima do 1,5 trilhão do Grok 4.6 — ainda não está em nenhuma folha de especificações. A xAI não publicou uma contagem de parâmetros para o Grok 4.7, e a Artificial Analysis lista o tamanho do modelo como não divulgado. O número sempre foi uma alegação de um fundador, e o lançamento não o converteu em uma especificação.
A tabela de benchmark é da própria xAI — eis o que não é
Todo número na lista abaixo vem do anúncio do fornecedor, e nada disso foi reproduzido de forma independente. Leia com essa ressalva em mente: estes são os números da xAI nas avaliações escolhidas pela própria xAI, publicados no dia do lançamento, e a primeira semana de qualquer lançamento é quando os benchmarks de fornecedores são menos confiáveis. As colunas de comparação também são do próprio fornecedor — Grok 4.6 (high), GPT-5.6 Sol (max) e Claude Fable 5.1 (max), cada um executado no nível de esforço escolhido pelo fornecedor.
• CursorBench 4.0 — Grok 4.7 46,3%, Grok 4.6 40,4%, GPT-5.6 Sol 41,7%, Claude Fable 5.1 51,8%. Reportado pelo fornecedor.
• DeepSWE v1.1 — Grok 4.7 71,0% em esforço alto, Grok 4.6 65,2%, GPT-5.6 Sol 72,7%, Claude Fable 5.1 70,0%. Relatado pelo fornecedor.
• Terminal-Bench 4.0 — Grok 4.7 37,6%, Grok 4.6 20,3%, GPT-5.6 Sol 37,3%, Claude Fable 5.1 57,9%. Informado pelo fornecedor e revisado: a linha do Grok 4.7 trazia 38,0% na tabela do dia de lançamento e traz 37,6% na página do fornecedor hoje.
• EEBench — Grok 4.7 64,0%, Grok 4.6 53,0%, GPT-5.6 Sol 39,4%, Claude Fable 5.1 56,4%. Informado pelo fabricante.
• Harvey Legal Agent — Grok 4.7 19,6%, Grok 4.6 15,8%, GPT-5.6 Sol 2,5%, Claude Fable 5.1 6,7%. Relatado pelo fornecedor.
• HealthBench Professional — Grok 4.7 56,7%, Grok 4.6 48,5%, GPT-5.6 Sol 60,5%, Claude Fable 5.1 62,1%. Dados informados pelo fornecedor.
• AA Briefcase v1.1 — Grok 4.7 1.657, Grok 4.6 1.546, GPT-5.6 Sol 1.487, Claude Fable 5.1 1.678. Esta é a única linha da tabela que já não é exclusiva do fornecedor: o próprio painel AA-Briefcase da Artificial Analysis publica os mesmos 1.657 para o Grok 4.7 com esforço xhigh e 1.546 para o Grok 4.6 com esforço alto. As colunas de comparação continuam sendo a escolha de modelos e níveis de esforço do fornecedor.
• GDPval Elo — Grok 4.7 1.695, Grok 4.6 1.605, GPT-6 Astra 1.542, Claude Fable 5.1 1.735. Relatado pelo fornecedor.
A leitura honesta desse conjunto não é "Grok 4.7 vence". Ele supera o Grok 4.6 em todos os oito, que é o mínimo que um sucessor lhe deve. Contra o campo, é um quadro misto: à frente do GPT-5.6 Sol no CursorBench, Terminal-Bench e EEBench, atrás dele no DeepSWE; atrás do Claude Fable 5.1 no CursorBench, Terminal-Bench, HealthBench e em ambas as medidas no estilo Elo, à frente dele no EEBench e na avaliação do agente jurídico Harvey. Também ilustra o quanto de um resultado de benchmark é o nível de esforço — os 71,0% do DeepSWE são um número de alto esforço dentro de uma tabela em que os demais valores são citados em xhigh.
A segurança é o único ponto em que as afirmações do fornecedor são invulgarmente específicas. A xAI diz que o Grok 4.7 foi construído sobre uma pilha de salvaguardas totalmente nova e afirma que é o modelo mais forte que a empresa já testou no que respeita a recusas e resistência a jailbreak. No benchmark de biossegurança da LatchBio, reporta 62,4%; no HackerBench v0.3, reporta deixar passar 3,3% dos prompts de duplo uso de risco, bloqueando raramente trabalho de segurança legítimo. São avaliações reportadas pelo fornecedor sobre o seu próprio lançamento, e nenhum terceiro as reproduziu.
Os primeiros números neste texto que não são do fornecedor são os três que a Artificial Analysis publicou em 21 de setembro, e eles discordam entre si de uma forma informativa. No Intelligence Index, o Grok 4.7 marca 46 com esforço xhigh na escala v4.3.2 — 16º nesse ranking — contra 44 do Grok 4.6. Esse ganho de dois pontos é o que a Artificial Analysis diz ser suficiente para levar a SpaceXAI aos quatro principais laboratórios do índice. Leia a posição com precisão: é uma afirmação sobre o melhor modelo de um laboratório, não sobre este, e o próprio modelo ainda está quatro pontos abaixo dos 50 do Claude Fable 5 e sete abaixo dos 53 compartilhados por Claude Fable 5.1 e GPT-6 Astra. Um ganho de dois pontos também está dentro da faixa que aparece entre níveis de esforço do mesmo modelo, o que é um lembrete de que um sucessor pontuar acima de seu antecessor não é o mesmo que um sucessor mudar o que é possível. Uma observação adicional sobre como ler o número: a versão da escala importa, porque a Artificial Analysis reformulou seu índice, e os valores 61/62/63 que aparecem na maior parte da cobertura de julho e agosto pertencem à escala descontinuada anterior a setembro de 2026 — eles não podem ser comparados com estes.
O Coding Agent Index é o segundo número, e é ele que mudou. Rodando no próprio harness Grok Build da SpaceXAI com esforço xhigh, o Grok 4.7 pontua 56 contra 47 do Grok 4.6 — nove pontos, não dois —, o que o coloca em quarto entre os modelos avaliados em seus harnesses nativos, atrás de Claude Fable 5.1, GPT-6 Astra e Claude Opus 5, e à frente de GPT-5.6 Sol. O índice é um composto de pesos iguais de DeepSWE v1.1, Terminal-Bench 4.0 e SWE-Atlas-QnA em 303 tarefas, e todos os três componentes melhoraram: DeepSWE de 65% para 73%, Terminal-Bench de 18% para 33%, SWE-Atlas-QnA de 58% para 63%. Esta é a primeira evidência independente de que a correção que a xAI descreveu — aprendizado por reforço mais longo e ponderado para tarefas de várias horas — surtiu efeito, e é o número que uma equipe escolhendo um agente de programação deveria ponderar com mais peso, porque é medido no harness com que o modelo realmente é distribuído, e não na própria tabela do fornecedor.
A ressalva está no que custam os nove pontos. A própria execução da Artificial Analysis gerou 240 milhões de tokens de saída no Intelligence Index, contra uma mediana de 94 milhões entre os modelos que ela acompanha — mais que o dobro — e estimou o custo de avaliar uma tarefa do Index em US$ 3,74. A US$ 6 por milhão de tokens de saída, a verbosidade é o item de custo que decide se um loop agêntico é acessível, portanto um ganho de nove pontos comprado com mais que o dobro da saída mediana é uma troca real, e não uma atualização gratuita. A mesma medição também significa que as pontuações de destaque não devem ser lidas como um único veredicto: em uma base por token, a vantagem do Grok 4.7 sobre o Grok 4.6 é menor do que o delta do índice sugere e, nas avaliações de conhecimento geral que compõem o Intelligence Index, ele é praticamente o mesmo modelo com uma conta substancialmente mais alta. O resultado do AA-Briefcase na próxima seção é a exceção a isso, e é uma exceção grande.

O segundo quadro independente: AA-Briefcase, e o que metade do custo por tarefa compra
A Artificial Analysis publicou um terceiro número para o Grok 4.7 no mesmo dia, e é o que diz respeito ao trabalho de conhecimento, e não ao código. No AA-Briefcase — o seu próprio quadro para trabalho de conhecimento agêntico de horizonte longo, construído a partir de quatro cenários de projeto com várias semanas e 91 entregáveis avaliados — o Grok 4.7 com esforço xhigh obtém 1.657 Elo, quarto lugar no quadro e atrás apenas de modelos da Anthropic: Claude Fable 5.1 com esforço máximo (1.678), Claude Opus 5 com esforço máximo (1.673) e Claude Fable 5.1 com xhigh (1.669). Está 16 Elo atrás do Claude Opus 5 com esforço máximo e, com xhigh, 8 Elo à frente do Claude Opus 5 com xhigh (1.649). Leia a colocação com precisão: "atrás apenas de modelos da Anthropic" é o enquadramento que a própria Artificial Analysis usou, e é exato — mas quarto não é segundo, e as três linhas acima dele são todas do mesmo fornecedor.
O ganho em relação à geração anterior é o maior movimento único do lançamento. Em comparação com o Grok 4.6 em high effort (1.546), o Grok 4.7 em xhigh ganha 111 Elo no AA-Briefcase — mais de cinquenta vezes o ganho de dois pontos no Intelligence Index. A Artificial Analysis atribui isso quase inteiramente à qualidade analítica: 1.994 Elo lá contra 1.690 para o Grok 4.6, enquanto a qualidade de apresentação cai ligeiramente, 1.499 contra 1.519. Essa é uma assinatura legível: o modelo raciocina melhor sobre a análise e formata o entregável um pouco pior. A mesma direção aparece nos números que a Artificial Analysis citou para o AA-Briefcase-Lite, o cenário público de due diligence que ela lançou no Hugging Face — qualidade analítica subiu de 1.698 para 1.994, apresentação caiu de 1.531 para 1.499. Duas ressalvas sobre essa comparação. O AA-Briefcase-Lite é explicitamente demonstrativo: a própria página de metodologia da Artificial Analysis diz que o quinto cenário público "não conta para os resultados oficiais do AA-Briefcase". E os números de qualidade citados para ele correspondem às linhas xhigh publicadas no quadro principal, então trate o parágrafo do Lite como uma ilustração da direção do movimento, e não como um placar separado.
A linha de custo é onde este resultado muda uma decisão. A medida de custo por tarefa do AA-Briefcase é o custo total de executar a submissão completa dividido por suas 91 tarefas; dividir os totais publicados pela Artificial Analysis dá aproximadamente US$ 9,30 por tarefa para o Grok 4.7 em xhigh, contra aproximadamente US$ 17,79 para o Claude Opus 5 em esforço máximo — cerca da metade, para uma diferença de 16 pontos de Elo. O próprio resumo do resultado feito pela Artificial Analysis é que o Grok 4.7 fica "logo atrás do Opus 5, a ~50% do seu Custo por Tarefa". É o mesmo trade-off que o restante deste texto descreve, chegando à mesma resposta por um caminho diferente: o Grok 4.7 não supera a fronteira, e sim a subcota em preço. Duas ressalvas, ambas honestas. A conta de tokens é real — no AA-Briefcase-Lite, a Artificial Analysis estimou o custo de API para produzir os decks de exemplo em cerca de US$ 8 para o Grok 4.7 em xhigh, contra cerca de US$ 4,40 para o Grok 4.6 em xhigh, de modo que o sucessor custa aproximadamente 80% mais que o modelo que substitui no mesmo trabalho. E os números por tarefa são calculados a partir do uso de tokens com preços de tabela e uma taxa representativa de acertos de cache, então eles variam conforme o seu cache: são um modelo de conta, não a sua conta.
Onde o Grok 4.7 se posiciona em relação ao Grok 4.6 e à concorrência
• Preço por 1M de tokens — Grok 4.7 $2 entrada / $6 saída abaixo de 200K de entrada, $4/$12 acima disso; Grok 4.6 idêntico.
• Janela de contexto — 500.000 tokens para ambos.
• Data de corte de conhecimento — maio de 2026 para o Grok 4.7 versus 1º de fevereiro de 2026 para o Grok 4.6.
• Esforço de raciocínio — baixo / médio / alto / xhigh para o Grok 4.7 versus os níveis publicados do Grok 4.6.
• Pontuação independente — 46 em esforço xhigh versus 44, no Índice de Inteligência v4.3.2 da Artificial Analysis. O suficiente, segundo a Artificial Analysis, para colocar a SpaceXAI entre os quatro principais laboratórios do índice.
• Pontuação independente de codificação — 56 versus 47 no Artificial Analysis Coding Agent Index, cada modelo em seu harness nativo. Quarto entre os modelos de harness nativo, à frente do GPT-5.6 Sol.
• Pontuação independente de trabalho de conhecimento — 1.657 Elo com esforço xhigh versus 1.546 do Grok 4.6 em high, no quadro AA-Briefcase da Artificial Analysis. Quarto lugar no geral, atrás de três entradas da Anthropic e à frente do Claude Opus 5 em xhigh.
• Custo por tarefa AA-Briefcase — cerca de US$ 9,30 contra cerca de US$ 17,79 para o Claude Opus 5 com esforço máximo, no mesmo placar. Aproximadamente metade da conta por tarefa para uma diferença de 16 Elo.
• Tokens de saída por execução do Index — 240 milhões versus uma mediana de 94 milhões entre os modelos que a Artificial Analysis monitora. A melhoria não é gratuita.
• Avaliação de codificação de fornecedor — CursorBench 4.0 46,3% versus 40,4%.
• Velocidade de serviço — uma variante rápida com o dobro da velocidade de saída por o dobro do preço, em comparação com o serviço padrão do Grok 4.6.
• Segurança — uma nova pilha de salvaguardas, com 62,4% relatados no benchmark de biossegurança da LatchBio; o Grok 4.6 foi lançado sem essa afirmação.
E a concorrência, no mesmo placar: Claude Fable 5.1 com 53, Claude Opus 5 com 51, GPT-5.6 Sol com 47, Kimi K3 com 44. A própria previsão de Musk — de que o Grok 4.7 “deveria estar mais ou menos em pé de igualdade com o Opus 5.0, não com o 5.1” — agora tem um número por baixo dela, e o número caiu onde ele disse que cairia: abaixo da fronteira, não acima. A diferença medida para o Claude Fable 5.1 é de sete pontos; a diferença de preço corre no sentido oposto, com o Claude Fable 5.1 listado a $10/$50 por milhão de tokens contra $2/$6 do Grok 4.7 — cinco vezes o preço de entrada e mais de oito vezes o preço de saída. Essa é a troca real que se pede a uma equipe, e é uma troca de preço-desempenho, e não uma vitória de capacidade. O AA-Briefcase é o único quadro neste artigo em que a ordenação muda: ali o Grok 4.7 em xhigh fica à frente do Claude Opus 5 em xhigh, 1.657 a 1.649, embora ainda atrás do Opus 5 em esforço máximo, com 1.673, e atrás do Claude Fable 5.1, com 1.678. Também vale a pena colocar as três pontuações independentes lado a lado antes de traçar a linha, porque elas não apontam no mesmo sentido: sete pontos atrás em inteligência geral, à frente do GPT-5.6 Sol no índice de agente de programação, 111 Elo de vantagem sobre o seu antecessor em trabalho de conhecimento, e a pagar pelos ganhos em tokens de saída. Qual desses fatos decide a sua escolha depende de a carga de trabalho ser um agente de programação, um entregável de conhecimento ou um prompt de chat, e essa é uma divisão mais útil do que uma única classificação.
O que os vazamentos acertaram, e a única coisa que não resolveram
Os artefatos que esta reportagem acompanhou até setembro eram reais, e o lançamento os transforma em um teste do valor que essa classe de evidência tem. Eis o registro.
• O pull request do catálogo acertou o preço. A submissão de 21 de setembro que adicionava o Grok 4.7 aos catálogos Zen e Go de um cliente de agente de código aberto — aberta às 05:36 UTC, fechada automaticamente por um bot de conformidade às 07:46 UTC devido à ausência de uma seção do modelo de pull request, nunca mesclada — listava o modelo pelas tarifas publicadas do Grok 4.6. No fim, estava exatamente certo: $2/$6, sem alteração. Mas o mecanismo importa mais do que o resultado. O contribuidor copiou as tarifas do modelo acima, e a cópia acabou sendo a suposição correta. Isso é sorte, não autoridade, e as alegações de capacidade do mesmo pull request também não traziam informação alguma. Uma proposta pode estar certa e mesmo assim não ser evidência.
• O rastro de provisionamento era genuíno e não era o lançamento. A linha grok-4.7 na página de cota de modelos do Google Cloud Console, relatada por rastreadores da comunidade em 16–17 de setembro, e o slug de build datado grok-4-7-0907 que surgiu em um erro de configuração do Grok Bot apontavam ambos para um modelo sendo preparado. Nenhum dos dois tinha uma data atribuída por ninguém, e nenhum dos dois era o anúncio. O que eles estabelecem é que infraestrutura de terceiros estava sendo preparada — o que, em retrospecto, era exato e ainda assim não era um cronograma.
• A contagem de parâmetros nunca foi confirmada. Cerca de 2,1 trilhões, aproximadamente 40% acima do Grok 4.6, repetido por Musk em 2 de setembro — e ainda ausente de toda ficha técnica no lançamento. Este é o caso mais claro em toda a saga de um número que circulou amplamente o suficiente para ser tratado como fato, sem nunca ter tido uma fonte do fabricante.

O cartão acima registra o estado de pré-lançamento no momento em que este artigo o verificou pela última vez: nenhum ID de modelo, nenhuma data de lançamento, nenhum benchmark publicado. Todas as linhas nele foram desde então superadas pelo anúncio de 21 de setembro, e ele é mantido aqui porque a lacuna entre esse cartão e o modelo lançado é a verdadeira história das últimas seis semanas — um lançamento de fronteira que não produziu nenhuma especificação confirmada até o dia em que foi lançado.
• A ressalva sobre a prontidão é a questão em aberto, e agora ela tem evidências parciais. Musk disse em meados de setembro que o Grok 4.7 "encerra prematuramente" tarefas de alta dificuldade e que sua verificação de respostas "não é estrita o suficiente", o que ele atribuiu a uma penalidade de aprendizado por reforço para respostas longas definida alta demais, com a ressalva de "possivelmente". O anúncio de lançamento não aborda isso. A correção declarada pela xAI é indireta: aprendizado por reforço mais longo, ponderado para tarefas de várias horas, e melhor autoverificação é exatamente a mudança que você faria para lidar com o encerramento prematuro. O resultado do Coding Agent Index é o primeiro sinal externo de que isso surtiu efeito — 56 contra 47 do Grok 4.6, com o Terminal-Bench 4.0 quase dobrando de 18% para 33%, que é precisamente a ponta de horizonte longo e muitos passos do intervalo. Não é uma resposta definitiva, porque as mesmas pontuações de harness também são as que compram seus ganhos com muito mais tokens de saída. Se o modelo ainda abandona tarefas longas e difíceis é algo testável por qualquer pessoa com acesso à API, e continua sendo a primeira coisa que vale a pena testar.
• O corpus da SpaceX ainda não foi verificado. O suplemento de treinamento relatado — telemetria da Starlink, registros de pressão da câmara de combustão do Raptor, telemetria de reentrada da Starship, threads internas do Slack, tickets do Jira, repositórios do GitHub e registros de ERP — é relato da comunidade sobre o que Musk disse, não uma divulgação da empresa. O anúncio de lançamento descreve um modelo base maior e uma execução de aprendizado por reforço mais longa, e não diz nada sobre o corpus. Se estiver incluído, nenhuma ficha de especificações vai confirmar isso; a única evidência será se o modelo é capaz de fazer, em trabalho de engenharia real, algo que seus pares não conseguem.
A linha do tempo que errou quatro vezes, e o que o mercado acertou
O Grok 4.7 foi prometido, em público, em cinco cronogramas distintos, e os quatro primeiros expiraram. Em 24–25 de julho, Musk disse cerca de quatro semanas, o que implicava 22 de agosto. Em 12 de agosto, ele revisou para "3 a 4 semanas", o que implicava 2–9 de setembro. Em 2 de setembro, ele estreitou para cerca de dez dias, apontando para 12 de setembro. Em 11 de setembro, o dia em que esse prazo se esgotou, ele disse "mais alguns dias". O quinto não era uma janela de tempo de modo algum — uma linha grok-4.7 numa página de cotas do Google Cloud — e foi o que chegou mais perto de estar correto: o modelo foi lançado em 21 de setembro, pouco depois da última data com que alguém havia se comprometido, e sem uma data atrelada ao artefato que o antecedeu.
Os mercados de previsão acertaram o calendário e erraram o modelo. O contrato "SpaceXAI lança o Grok 4.7 antes de 18 de setembro?" da Kalshi parou de ser negociado às 03:59 UTC de 18 de setembro, tendo mudado de mãos pela última vez a 65¢, com 1.785 contratos negociados e 1.211 em aberto. Todos os contratos liquidados nos dois principais mercados — as janelas de 14, 21, 28 e 31 de agosto e de 4, 8 e 11 de setembro da Kalshi, e os contratos de 12 e 14 de setembro da Polymarket — resolveram-se como "Não". O contrato "próximo modelo Grok (4.7 ou superior) lançado até 18 de setembro?" da Polymarket estava em 64% em 15 de setembro, após oscilar entre 42% e 88,5% ao longo de onze dias. O mercado estava certo ao desconsiderar os picos impulsionados por tweets, e certo de que a janela de 18 de setembro fecharia vazia. Ele estava três dias adiantado em relação ao modelo, que é a única coisa que um contrato com data não consegue precificar.
Vale a pena manter as contagens de visualizações como uma nota de calibração. A contagem regressiva de Musk em 2 de setembro, "sai em 10 dias", atraiu 10,29 milhões de visualizações e estava errada. Seu recuo de 11 de setembro atraiu 2,05 milhões e também estava errado. Suas postagens de roadmap de 13–14 de setembro atraíram cerca de 1,99 milhão e foram as mais próximas de acertar — ele descreveu o Grok 4.8, um modelo de aproximadamente 2,5 trilhões de parâmetros treinado em uma stack C++ do zero, como "uma melhoria perceptível" em relação ao Grok 4.7. O alcance acompanhou a confiança, não a precisão, durante todo o processo.
Dois dos itens do roadmap agora são questões em aberto, e não previsões. O Grok 4.8 não tem ID de modelo, nem preço, nem janela de contexto, nem entrada em benchmark em lugar nenhum. E a interpretação de que o Grok 4.7 teria sido discretamente “renomeado” para Grok 4.8 — a leitura de um veículo sobre Musk ter nomeado o 4.8 enquanto o 4.7 estava atrasado — foi resolvida no sentido oposto: o 4.7 foi lançado como 4.7, na posição 46 do Index, contra 44 do Grok 4.6, o que é o incremento de um sucessor, e não um relançamento.
O que isso significa para as equipes que chamam o Grok hoje
O quadro prático mudou em 21 de setembro, e mudou da forma menos dramática possível: um novo ID de modelo com o mesmo preço, a mesma janela de contexto, um ganho de dois pontos no Index, um ganho de nove pontos no agente de programação e um ganho de 111 pontos em trabalho de conhecimento. Duas mudanças desde então importam mais do que parecem. Os aplicativos Grok agora entregam o modelo a usuários comuns, e não apenas a desenvolvedores, e o catálogo deste lado agora o lista — juntas, essas mudanças transformam a camada de roteamento descrita no final deste texto de um plano em um padrão. Se o seu modelo de custos foi construído com o Grok 4.6 a US$ 2/US$ 6, o preço por token ainda está correto para o Grok 4.7 — mas a contagem de tokens não está. A própria execução da Artificial Analysis consumiu 240 milhões de tokens de saída no Intelligence Index, contra uma mediana de 94 milhões entre os modelos que ela acompanha, então a mesma solicitação pode custar bem mais que o dobro, mesmo com a tabela de tarifas idêntica, que é o tipo de mudança que nunca aparece numa tabela de preços. Calcule o preço de um loop agêntico real com base nos tokens de saída, não na tarifa por milhão, antes de concluir que este lançamento é gratuito. Se o seu motivo para mudar é a fronteira de preço-desempenho que o fornecedor está alegando, a evidência mais forte para isso agora é o AA-Briefcase, e não a tabela do fornecedor: quarto lugar nesse quadro, a cerca de metade do custo por tarefa do Claude Opus 5, em contraste com uma diferença de sete pontos no Intelligence Index em relação ao Claude Fable 5.1 e uma diferença de preço que, na direção oposta, é de cinco vezes na entrada e de mais de oito vezes na saída. E se a sua carga de trabalho for especificamente um agente de programação, o argumento é mais forte do que o Index sugere: 56 no Coding Agent Index no harness Grok Build, à frente do GPT-5.6 Sol, é uma liga diferente de 46 em inteligência geral. Qual dessas coisas importa mais depende inteiramente da sua carga de trabalho, e ninguém fora da SpaceXAI executou o Grok 4.7 na sua.
No catálogo da OrcaRouter a linha Grok agora inclui o Grok 4.7 ao lado do Grok 4.6, Grok 4.5 e Grok 4.3, cobrados ao preço de tabela do provedor com 0% de margem — US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída, leituras de entrada em cache a US$ 0,50, e o mesmo salto para US$ 4 na entrada e US$ 12 na saída assim que uma requisição ultrapassa 200.000 tokens de entrada, cobrado pela SpaceXAI. É isso que repassar a tabela de preços sem alterações proporciona: o preço por token no seu modelo de custos é o preço por token na sua fatura, e todos os modelos da família respondem a uma única chave, de modo que migrar uma carga de trabalho do Grok 4.6 para o Grok 4.7 é uma mudança de string, e não um segundo contrato. Essa página traz a janela de contexto de 500.000 tokens e a mesma superfície compatível com a OpenAI — Chat Completions e Responses — que uma integração com o Grok 4.6 já utiliza.

Essa camada de encaminhamento é também a forma de baixo risco de avaliar um modelo cujos números independentes surgiram no mesmo dia que os do fornecedor. A lista de benchmarks acima continua a ser a do próprio fornecedor — as suas avaliações escolhidas, os seus níveis de esforço escolhidos, as suas colunas de comparação escolhidas — e nada disso foi reproduzido. O que mudou é que as três pontuações da Artificial Analysis não são do fornecedor, por isso a questão passou de "algo disto é real?" para "com qual destes resultados se parece a minha carga de trabalho": o 46 que diz inteligência geral de meio da tabela, o 56 que diz quarto entre agentes de programação com harness nativo, ou o 1.657 que diz quarto em trabalho de conhecimento a metade do custo por tarefa da fronteira. E o número que decide a economia não é um benchmark, mas sim os tokens de saída que uma execução consome, que só o seu próprio tráfego pode avaliar — 240 milhões por execução do Index na medição da Artificial Analysis contra uma mediana de 94 milhões, e cerca de $8 contra $4,40 por conjunto de decks de exemplo no seu cenário público AA-Briefcase-Lite. O failover automático permite-lhe apontar tráfego real para o novo modelo e recorrer a um fornecedor que ainda responde se a fatura de tokens ou o comportamento de abandono prematuro se revelar pior do que o anunciado — que é a diferença entre testar um modelo não comprovado e apostar um pipeline nele.
Como saber primeiro (a verificação que funcionou)
Esta seção costumava ser uma lista de sinais a observar durante a espera. A espera acabou, então aqui está a mesma lista pontuada em relação ao que realmente aconteceu.
• A lista de modelos foi a confirmação, e ela se moveu. Durante seis semanas, o conselho neste artigo era observar a lista de modelos do fornecedor em vez dos tweets, porque no momento em que o Grok 4.7 fosse real, a lista ganharia um ID de modelo com preços e uma janela de contexto anexada. Foi isso que aconteceu: grok-4.7 agora aparece com uma janela de contexto de 500K, preços de $2/$6 abaixo de 200K de entrada e $4/$12 acima disso, um corte de conhecimento de maio de 2026 e quatro níveis de esforço. Cada janela de Musk, cada argumento de cadência e cada data de mercado falharam em mover essa lista; o lançamento a moveu.
• Catálogos de terceiros precedem o anúncio, e são propostas, não implantações. O pull request do catálogo de 21 de setembro foi a versão mais clara disso até agora, e seu fechamento é instrutivo: um contribuidor se preparou para um modelo, um bot fechou a alteração por causa de uma seção de template ausente duas horas depois, e o modelo foi lançado dois dias depois disso. Leia essa classe de artefato como intenção com um carimbo de data e hora. Ela está genuinamente a montante do anúncio, e não é disponibilidade.
• Acompanhe o catálogo de modelos da OrcaRouter. Agora ele mudou. Durante todo o mês de setembro, a orientação neste artigo era que uma página do modelo grok-4.7 em orcarouter.ai seria o sinal de "você pode chamá-lo hoje por meio de nós", porque um modelo só é listado depois que um provedor o integra. O catálogo agora inclui o Grok 4.7 à tarifa do fornecedor, sem markup, então a verificação que o leitor foi instruído a fazer tem uma resposta: ele é roteável por meio de uma única API hoje.
• Para visibilidade do lado do consumidor, o app Grok agora colocou o Grok 4.7 diante de usuários que nunca abrirão um console de API. Em nova leitura em 2 de outubro, os dados do seletor que o grok.com serve a um visitante desconectado ainda nomeiam o modelo em duas de suas quatro entradas — Expert exibe "Pensa muito · Grok 4.7" e Heavy exibe "Equipe de Especialistas · Grok 4.7" — enquanto Fast, que é o modo no qual o app abre por padrão, é descrito apenas como "Respostas rápidas", e Auto como a opção que escolhe entre Fast e Expert. As quatro entradas são Auto, Fast, Expert e Heavy. Build não é uma delas: o Grok Build é um produto de terminal separado, em sua própria página, e é dessa página que a atribuição de Build do modelo realmente vem — ela orienta os visitantes a "instalar agora e começar a construir com o Grok 4.7". Portanto, a alegação que circulou em 1º de outubro e foi repetida em 2 de outubro — de que o Grok 4.7 agora é o modelo base em "Fast, Expert, Build e Heavy" — lista um modo que o app não oferece e omite aquele em que ele abre, e é a leitura dos rastreadores, não a do fornecedor, porque a SpaceXAI não publicou absolutamente nada sobre este lançamento. O passo equivalente do Grok 4.5 ganhou um post de blog próprio; este tem um produto que mudou silenciosamente por baixo de uma página de notícias que não mudou.
O estado da situação
O Grok 4.7 foi lançado em 21 de setembro de 2026, a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, com uma janela de contexto de 500.000 tokens e corte de conhecimento em maio de 2026. O que mudou nos onze dias desde então é o mapa de disponibilidade, e não o modelo: o Amazon Bedrock o adicionou em 28 de setembro, ele começou a ser distribuído nos próprios aplicativos web e móveis do Grok em 1º de outubro e ainda estava sendo distribuído por lá em 2 de outubro, e agora está listado no OrcaRouter à própria tarifa da SpaceXAI, sem markup. Suas pontuações independentes chegaram no mesmo dia do lançamento e ainda divergem: 46 com esforço xhigh no Intelligence Index v4.3.2 da Artificial Analysis, dois pontos acima do Grok 4.6 e o suficiente para colocar a SpaceXAI entre os quatro principais laboratórios do índice; 56 no Coding Agent Index, no harness Grok Build, nove pontos acima do Grok 4.6 e quarto lugar entre modelos de harness nativo, à frente do GPT-5.6 Sol; e 1.657 Elo no AA-Briefcase, 111 pontos acima do Grok 4.6 e quarto lugar na tabela, atrás de três entradas da Anthropic, a aproximadamente metade do custo por tarefa do Claude Opus 5. Todos os benchmarks na tabela de lançamento do fornecedor são do próprio fornecedor e não foram reproduzidos, com uma exceção: o próprio quadro AA-Briefcase da Artificial Analysis publica os mesmos 1.657, e o fornecedor desde então revisou sua própria linha do Terminal-Bench de 38,0% para 37,6%. Os ganhos em codificação e trabalho de conhecimento são reais e custam tokens de saída — 240 milhões por execução do Index contra uma mediana de 94 milhões, e cerca de US$ 8 contra US$ 4,40 por conjunto de decks de exemplo no cenário público de due diligence da AA —, e é esse o número que decide se este lançamento é barato. O número de ~2,1 trilhões de parâmetros que circulou por dois meses ainda não tem fonte do fornecedor, e a ressalva sobre abandono prematuro nunca foi abordada diretamente, embora o salto do Terminal-Bench de 18% para 33% no harness Grok Build seja a primeira evidência externa de que a correção funcionou. Ambos os sinais que este artigo disse aos leitores para observar se concretizaram: a lista de modelos do fornecedor ganhou grok-4.7 com um preço e uma janela de contexto anexados, e o catálogo daqui o lista à mesma tarifa. Então o movimento vencedor é mais simples do que era em setembro — Grok 4.6 a US$ 2/US$ 6 era a resposta, e Grok 4.7 a US$ 2/US$ 6 é a mesma resposta com um ID de modelo mais novo, pontuações melhores em codificação e trabalho de conhecimento, uma conta de tokens muito maior e um aplicativo de consumidor que o menciona em seus dois modos mais difíceis.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
