Cartão de título com o texto “Grok 4.7 vs DeepSeek V4 Pro”, com o subtítulo “Um é novo; o outro está sendo trocado debaixo de você”, e três cartões: AA Index v4.3.2 46 vs 36, Preço fora de pico por 1M $2/$6 vs $0.66/$1.98, e Contexto 500k vs 1M.
Guides & Insights

Grok 4.7 vs DeepSeek V4 Pro: Um é novo, o outro está sendo trocado sem você perceber

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Uma nota publicada em 10 de setembro de 2026 muda o objeto desta comparação. “Estamos desativando gradualmente o V4-Pro”, diz ela, e, a partir das 04:00 UTC de 14 de setembro de 2026, toda requisição para a string de modelo deepseek-v4-pro é roteada para o DeepSeek-V4.1-Flash com tarifas do V4.1-Flash — uma situação que, segundo o texto, continua “até o V4.1-Pro ser lançado”. A string de modelo ainda responde. O modelo por trás dela não é o que você avaliou em benchmark. Isso faz de um confronto direto contra o Grok 4.7 — lançado pelo fornecedor em 21 de setembro de 2026, um dia antes de este texto ser escrito — uma comparação com data de validade em um dos lados. Nos números que existem, o Grok 4.7 é o modelo mais forte, e o DeepSeek V4 Pro é o mais barato. Na questão que de fato decide uma integração, apenas um deles ainda é aquilo que diz ser.

O que cada modelo é, antes das pontuações

O DeepSeek V4 Pro atingiu a disponibilidade geral em 13 de agosto de 2026 como o checkpoint DeepSeek-V4-Pro-0813, após uma prévia em 24 de abril. Ele tem pesos abertos sob a licença MIT — a licença permite uso comercial, modificação e redistribuição sem limite de receita ou exceção regional — com 1,7 trilhão de parâmetros totais na ficha do modelo GA, uma janela de contexto de 1M de tokens e uma saída máxima de 384K, o maior teto de saída desta comparação. Ele é somente texto: a própria página de preços da DeepSeek afirma que visão não é compatível com o v4-pro, o que é uma limitação real para quem o alimenta com capturas de tela ou PDFs. Ele expõe um ajuste de esforço de raciocínio nos níveis baixo, alto e máximo, e é limitado a 500 requisições simultâneas por conta, com expansão disponível mediante solicitação.

O Grok 4.7 é de pesos fechados e foi lançado há um dia. Ele tem uma janela de contexto de 500 mil tokens — metade da janela de contexto do DeepSeek —, aceita texto e imagens como entrada e opera seu próprio controle de esforço. Seu preço de tabela é de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída abaixo de 200 mil tokens de prompt, dobrando para US$ 4,00 e US$ 12,00 no limiar ou acima dele, com leituras em cache a US$ 0,50 e US$ 1,00. A xAI também lista uma variante mais rápida com aproximadamente o dobro da velocidade de saída e o dobro do preço. Nenhum dos fornecedores publica um número máximo de saída para o Grok 4.7 na documentação consultada aqui, portanto trate essa dimensão como desconhecida, em vez de igual.

No índice compartilhado, a diferença é desequilibrada em uma única direção

Ambos os modelos são avaliados no Artificial Analysis Intelligence Index v4.3.2, a revisão publicada em 19 de setembro de 2026. A coluna do Grok 4.7 é medida com esforço xhigh; a do DeepSeek é o checkpoint 0813 com esforço máximo. Ao lê-los em conjunto, a lacuna do composto subestima o quão diferentes são as características desses dois modelos.

Composto — Grok 4.7: 46 no Artificial Analysis Intelligence Index v4.3.2. DeepSeek V4 Pro 0813: 36 na mesma revisão.

Agentes de terminal — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. Quase o dobro, na avaliação mais próxima do trabalho autônomo de software.

Automação — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. Ambos credíveis; a Grok lidera por nove.

Conhecimento e alucinação — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. Este é o outlier da tabela, e não é um artefato de arredondamento — o índice avalia tanto o que um modelo sabe quanto a frequência com que inventa uma resposta quando não sabe.

Contexto longo — Grok 4.7: AA-LCR v1.1 77%, janela de 500k. DeepSeek V4 Pro: 80%, janela de 1M. A única vitória clara da DeepSeek, e é o eixo para o qual sua janela de 1M foi construída.

Raciocínio difícil — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. Um empate no benchmark de física e uma vantagem de dois pontos para o Grok no HLE.

Verbosidade — Grok 4.7: 240M tokens de saída para executar o índice, sinalizado como incomumente verboso. DeepSeek V4 Pro: 163M. Ambos são tagarelas; o Grok é mais tagarela.

OrcaRouter model page for DeepSeek V4 Pro showing the deepseek/deepseek-v4-pro identifier, a 1M-token context window, 384K maximum output, text-only input, off-peak list rates of $0.66 per 1M input and $1.98 per 1M output, and 3818.2M tokens of traffic over seven days.

O preço não se resume a um número, é um cronograma

O preço do DeepSeek é o aspecto mais agressivo dele e o menos estável de se citar. A tarifa de tabela do deepseek-v4-pro é de US$ 0,66 por milhão de tokens de entrada em caso de falha de cache e US$ 1,98 por milhão de tokens de saída — em horários fora de pico. Durante os horários de pico, esses valores dobram para US$ 1,32 e US$ 3,96. O horário de pico, segundo a própria documentação da DeepSeek, é das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta-feira, excluindo feriados públicos chineses; todo o resto, incluindo fins de semana inteiros, fica fora de pico, exatamente pela metade do preço. As leituras de entrada em cache são o verdadeiro destaque: US$ 0,022 fora de pico e US$ 0,044 no pico, trinta vezes mais baratas do que uma falha de cache, o que torna uma carga de trabalho do DeepSeek bem cacheada drasticamente mais barata do que sua tabela de tarifas sugere.

Em contrapartida, os US$ 2,00 e US$ 6,00 do Grok 4.7 parecem caros — cerca de 3x a entrada fora de pico do DeepSeek e 3x a saída fora de pico. A comparação se estreita de formas que vale a pena conhecer. O preço do Grok 4.7 é fixo dentro da sua faixa, em vez de depender do horário, então um pico de produção às 09:00 UTC custa o mesmo que um lote de domingo à noite; o do DeepSeek não. E acima de 200k tokens de prompt, o Grok 4.7 dobra, ponto em que passa a ser quatro a seis vezes a tarifa fora de pico do DeepSeek, em vez de três. A forma clara de dizer: o DeepSeek V4 Pro é o modelo mais barato em todos os eixos, e o tamanho do desconto depende de quando você executa e de quão bem você faz cache.

O que 14 de setembro mudou

Esta é a parte que torna o argumento de preço mais difícil de sustentar. A partir de 14 de setembro de 2026, a DeepSeek encaminha solicitações de deepseek-v4-pro para o DeepSeek-V4.1-Flash e as cobra às tarifas do Flash — que são ainda mais baixas. O changelog da DeepSeek e sua página de preços contam uma história um pouco diferente da que o post de notícias de 10 de setembro conta: a tabela de preços ainda lista deepseek-v4-pro como uma linha ativa, com suas próprias tarifas e sem tag de descontinuação, e a entrada no changelog diz que o serviço de API para o V4 Pro continua após 14 de setembro, com cobrança inalterada. O que não está em disputa é a direção da trajetória. O V4.1-Pro está confirmado em desenvolvimento, sem data anunciada, e o V4.1-Flash — lançado em 10 de setembro — é o que o próprio anúncio da DeepSeek diz superar o V4 Pro em "desempenho, custo, velocidade e tempo total de execução", uma alegação do fornecedor que não foi reproduzida de forma independente nessa amplitude.

Portanto, a questão prática não é “Grok 4.7 ou DeepSeek V4 Pro”, mas “Grok 4.7 ou qualquer modelo DeepSeek para o qual essa string apontar no próximo trimestre”. Se você fez benchmark do V4 Pro em agosto e dimensionou seu orçamento de contexto em torno de uma janela de 1M com teto de saída de 384K, o modelo que você chamar em novembro pode não ser aquele que você mediu — e os limites de contexto e de saída do sucessor não são aqueles para os quais você projetou. O Grok 4.7 tem o perfil de risco oposto: um modelo com um dia de idade, cujos números são reportados pelo fornecedor e em grande parte não reproduzidos, mas cuja identidade não está em questão.

Two-column scoreboard titled “Grok 4.7 vs DeepSeek V4 Pro - the scoreboard”: AA Index 46 vs 36, Terminal-Bench 4.0 26 vs 14, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $0.66/$1.98 off-peak, and open weights “no” vs “MIT”.

Onde um router se encaixa e onde não

O OrcaRouter disponibiliza o DeepSeek V4 Pro, e a página do modelo o lista à tarifa do próprio provedor — US$ 0,66 de entrada e US$ 1,98 de saída, com uma janela de contexto de 1M e saída máxima de 384k — porque repassamos os preços de tabela do provedor com 0% de markup. Isso importa mais do que o habitual com um fornecedor cujas tarifas mudam em um cronograma de pico/fora de pico e cujo anúncio de 10 de setembro veio acompanhado de uma redução de preço: uma mudança de preço do DeepSeek entra em vigor na mesma chave no mesmo dia, sem atraso de reprecificação e sem um segundo contrato. Quando um fornecedor redireciona uma string de modelo do lado dele, a mudança chega pelo mesmo endpoint, em vez de exigir uma reintegração do seu lado, e o failover automático impede que um limite de taxa ou um evento de capacidade do lado do provedor se transforme em uma indisponibilidade — útil quando um lado da sua pilha está limitado a 500 solicitações simultâneas. O Grok 4.7 não está no catálogo do OrcaRouter até o momento em que isto foi escrito; chamá-lo significa passar pela própria API da xAI e pelas plataformas de terceiros que o oferecem.

A divisão que isto sugere é pouco glamorosa, mas defensável: mantenha o DeepSeek V4 Pro nas cargas de trabalho em que o preço por acerto de cache e a janela de 1M estão a fazer o trabalho, e fixe as suas expectativas no V4.1-Flash em vez de no checkpoint de agosto. Coloque o Grok 4.7 nas tarefas em que o modelo tem de saber o que não sabe — um índice AA-Omniscience de 1 é um sinal claro da disposição de um modelo para responder com confiança e erradamente, e nenhuma vantagem de preço sobrevive a um consumidor a jusante que confie numa resposta fabricada.

A chamada

Grok 4.7 é o melhor modelo aqui e não é por pouco: uma vantagem composta de dez pontos, o dobro da pontuação no Terminal-Bench, uma vantagem em automação e uma lacuna de honestidade de conhecimento ampla o suficiente para ser uma diferença de categoria. O DeepSeek V4 Pro é cerca de 3x mais barato fora de pico e tem o dobro da janela de contexto, o que é uma razão real e defensável para mantê-lo — mas você não está comprando o modelo que avaliou, está comprando uma string de modelo que a DeepSeek já anunciou que vai reapontar, a tarifas que mudam a cada hora, sob uma licença e um conjunto de pesos que fazem da auto-hospedagem uma terceira opção genuína. Se a carga de trabalho for de contexto longo, alto volume e cacheável, a economia do DeepSeek é difícil de bater e você deve projetar para o sucessor em vez do checkpoint. Se for qualquer coisa em que estar errado seja caro, pague os 3x e fique com o modelo que admite incerteza.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente