Cartão de título com o texto “Grok 4.7 vs. Gemini 3.1 Pro” e o subtítulo “O ranking mudou; o modelo, não”, e três cartões: AA Index v4.3.2 46 vs. 30, Preço padrão por 1M $2/$6 vs. $2/$12, e Status GA vs. prévia.
Guides & Insights

Grok 4.7 vs Gemini 3.1 Pro: A tabela de classificação mudou, o modelo não

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 19 de fevereiro de 2026, Artificial Analysis publicou um artigo com o título "Gemini 3.1 Pro Preview: o novo líder em IA." Ele liderou seis de dez avaliações e ficou quatro pontos à frente do Claude Opus 4.6. Consulte hoje a página desse mesmo modelo e o número é 30, classificado em 69.º lugar entre 200. O fornecedor não mudou nada. O que mudou foi a régua: Artificial Analysis revisou seu Intelligence Index para v4.3.2 em 19 de setembro de 2026, recalculando a pontuação de todos os modelos do catálogo com base em um conjunto de avaliações diferente, e um líder de fevereiro virou um participante de meio de tabela em setembro, enquanto o próprio modelo permaneceu intocado em preview. Esse é o pano de fundo para uma comparação com o Grok 4.7 — lançado pelo fornecedor em 21 de setembro de 2026 — e é a razão pela qual este confronto é menos sobre qual modelo é mais inteligente do que sobre em qual destes dois você ainda pode confiar que será a mesma coisa no próximo mês.

O que cada um destes realmente é

Gemini 3.1 Pro é o modelo mais recente da linha Pro do Google e nunca chegou à disponibilidade geral. Ele foi lançado como gemini-3.1-pro-preview em 19 de fevereiro de 2026, e a tabela de descontinuação do Google ainda o lista com "nenhuma data de encerramento anunciada" — uma prévia que agora está em prévia há sete meses, enquanto o Google lançou uma escada de modelos Flash abaixo dela: 3.5 Flash em maio, 3.6 em julho, 3.7 em agosto, 3.8 em setembro. Não há nenhum modelo Pro GA mais novo que o Gemini 3 Pro. Ele tem uma janela de entrada de 1.048.576 tokens e um teto de saída de 65.536 tokens, aceita texto, imagens, vídeo, áudio e PDF na entrada com texto na saída, e expõe um controle de nível de pensamento em baixo, médio e alto, sem parâmetro de orçamento e sem configuração mínima. Os pesos são fechados.

O Grok 4.7 foi lançado há um dia e também é de pesos fechados. Ele tem uma janela de contexto de 500 mil tokens — metade da do Gemini — e aceita texto e imagens como entrada, portanto não consegue ingerir vídeo nem áudio de forma alguma, que é a diferença de capacidade mais acentuada nesta comparação. Ele está listado a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída abaixo de 200 mil tokens de prompt, passando para US$ 4,00 e US$ 12,00 acima desse limite, com leituras em cache a US$ 0,50 e US$ 1,00; a xAI também lista uma variante mais rápida com aproximadamente o dobro da velocidade de saída e o dobro do preço. Nenhum valor máximo de saída é publicado para ele na documentação consultada aqui.

O governante se moveu. Essa é a história.

Ambos os modelos estão atualmente pontuados no Artificial Analysis Intelligence Index v4.3.2, que substituiu o Terminal-Bench 2.1 pelo Terminal-Bench 4.0 e o tau3-Banking pelo AutomationBench-AA, e reancorou a escala Elo do GDPval-AA. O número de cada modelo mudou quando ele foi lançado. O do Gemini 3.1 Pro mudou mais do que a maioria, porque seus pontos fortes de fevereiro estavam concentrados em avaliações que o novo índice ou retirou ou reponderou. Lendo as duas colunas lado a lado hoje:

Composto — Grok 4.7 (xhigh): 46 no Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 na mesma revisão, classificado em #69 de 200.

Contexto longo — Grok 4.7: janela de 500k, AA-LCR v1.1 77%. Gemini 3.1 Pro: janela de 1M — o dobro do tamanho — e um teto de saída de 65K que é cerca de metade do que uma sessão agêntica de contexto longo normalmente precisa.

Modalidade de entrada — Grok 4.7: texto e imagem. Gemini 3.1 Pro: texto, imagem, vídeo, áudio e PDF. Não é perto, e não é uma lacuna de benchmark — é uma lacuna de capacidade.

Velocidade — Grok 4.7: ainda sem medição publicada. Gemini 3.1 Pro: 124,4 tokens de saída por segundo, classificado em #39 de 200, com 63,62 segundos até o primeiro token pelo Google AI Studio.

Preço, nível padrão — Grok 4.7: $2,00 de entrada / $6,00 de saída por 1M. Gemini 3.1 Pro: $2,00 de entrada / $12,00 de saída. Entrada idêntica, o dobro de saída.

Preço, nível de contexto longo — Grok 4.7: dobra para $4,00 / $12,00 em 200 mil tokens de prompt. Gemini 3.1 Pro: passa para $4,00 / $18,00 no mesmo limite de 200 mil. Mesma entrada, 50% mais saída.

Maturidade — Grok 4.7: um dia de vida, benchmarks do fornecedor em grande parte não reproduzidos. Gemini 3.1 Pro: sete meses no mercado, mas ainda uma build de pré-visualização sem compromisso de GA e sem data de desligamento.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

O problema da pré-visualização agora é real

Uma prévia de sete meses seria uma excentricidade, e não um risco, se nada tivesse dado errado com ela. Algo deu. A partir de 18 de setembro de 2026, usuários começaram a relatar que o Gemini 3.1 Pro havia desaparecido do seletor de modelos do AI Studio e, até o momento em que escrevo, não houve resposta de funcionários do Google, nem aviso de descontinuação, nem causa declarada — um incidente de disponibilidade não resolvido, e não uma aposentadoria confirmada. Compare isso com o histórico de anúncios: o Google disse no I/O em maio de 2026 que o Gemini 3.5 Pro estava "sendo lançado no próximo mês", e reportagens da imprensa no final de agosto disseram que esse modelo havia sido descartado porque candidatos internos "não eram suficientemente melhores que a série Flash". A própria página Pro do Google ainda anuncia "3.5 Pro em breve", o que é a contradição em uma única tela. Qualquer que seja a resolução, a leitura prática é que o Gemini 3.1 Pro é um endpoint de prévia sem data de GA, sem sucessor nomeado e com um ponto de interrogação atual sobre disponibilidade.

O risco do Grok 4.7 é a imagem espelhada e menor em espécie. Ele tem um dia de idade, então seus números são escassos — a Artificial Analysis não publicou nenhuma medição de velocidade ou latência, e a própria suíte de benchmarks da xAI para ele não foi reproduzida de forma independente. O que não está em questão é que o modelo está disponível de forma geral, com preço definido, documentado e com identidade estável. Um modelo cuja identidade é estável e cujos números não são comprovados é muito mais fácil de se construir em cima do que um modelo cujos números são publicados e cuja disponibilidade não é.

Quanto custa a divisão, na prática

Suponha que você esteja escolhendo para um pipeline de documentos. Com 100 mil tokens de entrada e 8 mil de saída, o Grok 4.7 custa US$ 0,20 na entrada e US$ 0,048 na saída — cerca de um quarto. O Gemini 3.1 Pro custa US$ 0,20 na entrada e US$ 0,096 na saída — cerca de trinta centavos. Os dois estão dentro de vinte por cento um do outro, e se seus documentos forem digitalizações, PDFs, áudio ou vídeo, o Gemini é o único dos dois que é sequer capaz de lê-los. Isso não é um argumento de benchmark; encerra a comparação para essa carga de trabalho.

Agora suponha que você esteja escolhendo para um agente de contexto longo. Com entrada de 300k e saída de 8k, o Grok 4.7 custa US$ 1,20 de entrada e US$ 0,096 de saída, cerca de US$ 1,30. O Gemini 3.1 Pro custa US$ 1,20 de entrada e US$ 0,144 de saída, cerca de US$ 1,35. Praticamente idênticos — e aqui a janela de 1M do Gemini e o teto de saída de 65K se tornam a restrição que decide a questão, porque um limite de 65K é onde execuções agênticas longas desmoronam. Nenhum dos modelos é a opção barata neste confronto, e nenhum é caro pelos padrões de modelos de fronteira.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Roteando em torno de um alvo móvel

O OrcaRouter disponibiliza o Gemini 3.1 Pro, listado em sua própria página de modelo pelas tarifas do provedor — US$ 2,00 de entrada e US$ 12,00 de saída, com a janela de 1M e saída máxima de 65k — porque repassamos o preço de tabela do provedor com 0% de margem. Isso não é uma frase de marketing em um caso como este: o Google tem uma build de pré-visualização com duração sem preço definido cuja disponibilidade oscilou em setembro, e o que um roteador faz de útil é manter a integração estável enquanto o que está por trás dela muda. O failover automático significa que um endpoint de pré-visualização que para de responder se torna um evento de roteamento em vez de uma indisponibilidade, e a DSL de roteamento permite compor um modelo multimodal com um somente texto em uma única chamada — que é exatamente o formato que este par sugere, com o Gemini lendo o vídeo e o Grok fazendo o raciocínio sobre sua transcrição. O Grok 4.7 não está no catálogo do OrcaRouter até o momento desta redação; chamá-lo hoje significa passar pela própria API da xAI e pelas plataformas de terceiros que o oferecem.

O padrão que vale a pena construir: mantenha o Gemini 3.1 Pro para tudo que precisa ingerir vídeo, áudio ou PDF, e trate seu status de prévia como um risco operacional a ser contornado, e não como um motivo para evitá-lo. Coloque o Grok 4.7 no trabalho de texto e imagem em que se aplicam seu preço de saída mais baixo e sua pontuação composta mais alta, e em que o modelo que você integra hoje é o modelo que você ainda estará chamando daqui a seis meses. A única coisa a não fazer é ler o ranking de sexagésimo nono lugar como um veredito sobre o modelo — é um veredito sobre uma revisão de benchmark, e a mesma revisão que rebaixou o Gemini 3.1 Pro também rebaixou dezenas de modelos que o Google nunca tocou.

A chamada

No índice atual, o Grok 4.7 lidera o Gemini 3.1 Pro por dezesseis pontos e, no preço de saída, custa metade no nível padrão e um terço a menos no nível de contexto longo. Se sua carga de trabalho for texto e imagens, isso basta para decidir. Se sua carga de trabalho for vídeo, áudio ou documentos digitalizados, o Gemini 3.1 Pro é o único candidato entre os dois, e a comparação termina aí — você está comprando uma capacidade, não uma pontuação. A ressalva que deve acompanhar ambos diz respeito a proveniência, e não a desempenho: um é uma prévia de sete meses, sem data de disponibilidade geral e com um incidente de disponibilidade em setembro no histórico; o outro tem um dia de existência, com um número de manchete e nenhuma reprodução independente de qualquer outra coisa. Nenhum dos dois é uma escolha consolidada. Vale mais a pena rotear ambos do que se comprometer com um deles.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente