Cartão de título principal para a comparação 'Grok 4.6 vs DeepSeek V4 Pro', com subtítulo 'Uma guerra de preços de fronteira, travada com 24 horas de diferença', e um selo 'Comparação · Agosto de 2026'.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Uma Guerra de Preços de Fronteira, Travada com 24 Horas de Diferença

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos de ponta foram lançados com menos de 24 horas de diferença, e a distância entre suas tabelas de preços é a maior que esta geração já produziu. O Grok 4.6 chegou em 12 de agosto de 2026 a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. O DeepSeek V4 Pro — o lançamento formal de produção do carro-chefe da D​eepSeek, versão DeepSeek-V4-Pro-0813 — veio em 13 de agosto de 2026 a ¥3 por milhão de tokens de entrada com cache miss e ¥6 por milhão de tokens de saída, o que equivale a aproximadamente US$ 0,42 e US$ 0,85. Mesma categoria, mesmas ambições de agente, uma ordem de grandeza de diferença no preço. Não se trata de uma comparação entre duas especificações; é uma comparação entre duas estratégias para o que um modelo em formato de agente deveria custar, e ambas foram lançadas nesta semana.

Esta peça coloca as duas tabelas de preços lado a lado, lê as alegações de benchmark de cada fornecedor com o nome do fornecedor à mostra, e calcula quanto a diferença realmente custa numa carga de trabalho real — porque no papel esses modelos são mais próximos em capacidade do que em filosofia, e a diferença no preço por tarefa é onde a decisão está.

O timing é o ponto.

O fato de ambos os modelos terem chegado na mesma janela de 48 horas não é um acidente de calendário. O Grok 4.6 é a reformulação agêntica da SpaceXAI de sua fundação de 1,5T — uma atualização pós-treinamento com forte ênfase em aprendizado por reforço em codificação, trabalho de kernel e CAD, precificada como o combustível para os produtos Cursor e Grok Bot que a empresa possui. O DeepSeek V4 Pro é a formalização de uma prévia que redefiniu silenciosamente o que "agêntico" significava por uma fração do preço, agora aprimorado para a economia de agentes: as notas de versão do DeepSeek para o build 0813 trazem como destaque capacidades de agente significativamente melhoradas, adicionam suporte para a API Responses e integração com Codex, e mantêm os modos de pensamento (padrão) e não-pensamento, saída JSON, chamadas de ferramentas e o formato da API Anthropic. Duas empresas muito diferentes concluíram simultaneamente que o mercado que importa no final de 2026 são os agentes — e precificaram suas entradas para carteiras muito diferentes.

As duas listas de preços, lado a lado.

Grok 4.6 — $2,00 / $6,00 / $0,50 (entrada em cache) por milhão de tokens, contexto de 500K, um patamar de $4 / $12 / $1 acima de aproximadamente 200K tokens de entrada, e uma variante mais rápida com o dobro da taxa base.

DeepSeek V4 Pro — ¥3,00 (≈$0,42) por milhão de tokens de entrada sem cache, ¥0,025 (≈$0,0035) por entrada em cache, ¥6,00 (≈$0,85) por saída, com uma janela de contexto de 1 milhão de tokens e até 384 mil tokens de saída. Seu irmão mais barato, o V4 Flash, custa ¥1 / ¥2.

Até mesmo contra o Grok 4.6 — já a API frontier mais barata de sua geração — o DeepSeek V4 Pro é cerca de cinco vezes mais barato no input com cache-miss e sete vezes mais barato na saída, e traz uma janela de contexto 2x maior e uma saída máxima muito maior para a mesma faixa de preço. Os dois não estão competindo em preço; a DeepSeek estabeleceu unilateralmente um novo piso e o Grok agora é a opção premium na mesma frase. Esse enquadramento importa, porque o enquadramento anterior — "Grok 4.6 é o modelo frontier barato" — foi verdadeiro por exatamente um dia.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

O que o DeepSeek V4 Pro realmente melhorou

Os números de lançamento da DeepSeek são os mais dramáticos porque são medidos em relação à sua própria prévia, e o salto da prévia para o lançamento é enorme. Nas próprias avaliações do fornecedor:

DeepSWE — 62,7% na versão final, acima dos 12,8% na prévia — uma pontuação de longo horizonte em engenharia de software que o fornecedor coloca entre os 58,0% do Opus 4.8 e os 70,0% do Claude Fable 5.

Cybergym — 83,3%, subindo de 52,7%, superando por pouco os 83,1% de Fable 5 e vencendo os 78,3% de Opus 4.8.

Terminal Bench 2.1 — 87,9%, a um ponto dos 88,0% do Fable 5 e à frente dos 85,0% do Opus 4.8.

AutomationBench (público) — 31,8%, acima dos 12,8%, superando tanto o Fable 5 (29,1%) quanto o Opus 4.8 (27,2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack e DSBench-Hard — 74,1%, 61,5%, 71,1% e 67,2% respectivamente, agrupados na faixa do Opus 4.8 / Fable 5 ou perto dela.

{{1}}Cada um desses resultados é relatado pela própria DeepSeek em sua própria suíte de avaliação. A direção é inconfundível — a prévia não estava pronta para loops de agentes em produção e a versão final afirma estar —, mas o rótulo honesto é que nenhum laboratório independente pontuou o DeepSeek V4 Pro ainda, e os modelos com os quais ele é comparado não são nomeados por uma entidade externa.{{/1}}

O que o Grok 4.6 responde

O contador do Grok 4.6 é diferente em espécie: é o único dos dois com um placar independente. A Artificial Analysis mediu 61 no seu Índice de Inteligência — empatado com o GPT-5.6 Sol, à frente do Kimi K3 (60) — antes mesmo de o DeepSeek V4 Pro ser lançado. Sua tabela de fornecedores afirma uma liderança de 65,9% no DeepSWE v1.1 e 69,9% no CursorBench v3.2, com um ponto fraco abertamente admitido de 26% no Terminal-Bench v3.0. Esses números são reportados pela xAI, nenhum reproduzido de forma independente até 13 de agosto.

As incompatibilidades de versão importam quando você tenta comparar os dois diretamente. Os 87,9 da D​eepSeek são no Terminal Bench 2.1; os 26% do Grok são na versão 3.0, mais difícil — exames diferentes, então "D​eepSeek arrasa com Grok em terminais" não é uma afirmação honesta, e "Grok lidera no DeepSWE" também não é, sem notar que os dois fornecedores usaram versões de avaliação diferentes e nenhum dos números é de terceiros. O que é comparável é a dimensão independente: o Grok 4.6 tem um scorecard verificado, o DeepSeek V4 Pro ainda não tem nenhum, e para uma decisão de produção, essa assimetria é por si só informação.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

O custo total de uma longa execução de agente.

Considere uma tarefa realista de agente — ler e raciocinar sobre 500 mil tokens de contexto, escrever 100 mil tokens de saída, o que é uma refatoração de médio porte ou um pipeline de documentos longo, dentro das janelas de ambos os modelos:

Grok 4.6 — 0,5M de entrada a $2 = $1,00, mais 0,1M de saída a $6 = $0,60. Total: $1,60.

DeepSeek V4 Pro — 0,5M de entrada com cache-miss a ¥3 = ¥1,50, mais 0,1M de saída a ¥6 = ¥0,60. Total: ¥2,10, cerca de $0,29.

Isso é uma diferença de 5.5x na mesma tarefa nominal, antes de qualquer vantagem de cache — e a janela de 1M do D​eepSeek, além da saída máxima de 384K, também significa que o trabalho cabe em uma única passada, enquanto a janela de 500K do Grok 4.6 pode forçar duas. A ressalva que impede que isso seja uma resposta de uma linha é o custo de raciocínio e o risco: o modo de pensamento do D​eepSeek está ativado por padrão, então toda solicitação paga por um rastro de raciocínio completo, mesmo quando você não quer um, e a confiança nos benchmarks do próprio fornecedor não foi testada por ninguém independente. Barato por token com raciocínio sempre ativo ainda é barato por tarefa a essas taxas, mas "barato" e "verificado" são afirmações diferentes, e apenas um desses modelos carrega a segunda.

Quem deve escolher qual

A decisão é menos "qual é melhor" do que "qual perfil de risco se adequa à carga de trabalho":

Alto volume, limitado por custo e disposto a aceitar números não verificados — o DeepSeek V4 Pro é a aposta de preço mínimo. O contexto de 1M e a saída de 384K fazem dele o candidato mais forte para contexto longo e processamento em lote, e a taxa de entrada em cache de ¥0,025 torna pipelines com muita recuperação quase gratuitos. Faça suas próprias avaliações, porque ninguém independente fez.

Profundidade agentiva com um scorecard independente, em um ecossistema compatível com OpenAI — o 61 do Grok 4.6 é verificado, sua direção em benchmarks de codificação e agentes é consistente, e a fraqueza terminal é conhecida de antemão. O tempo de 42 segundos para o primeiro token é o preço que você paga pela qualidade verificada.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Tráfego misto — este é o caso de roteamento, e não de escolha. No OrcaRouter, ambos os modelos ficam atrás de uma única chave com preço de repasse da lista de provedores — então os ¥3/¥6 da DeepSeek permanecem ¥3/¥6 na fatura, e os $2/$6 da Grok 4.6 permanecem $2/$6, sem acréscimo sobre nenhum dos dois. Uma regra de roteamento pode enviar o trabalho de contexto longo e limitado por custo para o DeepSeek V4 Pro e o trabalho agêntico verificado para o Grok 4.6, dividir o tráfego por solicitação até que sua própria avaliação defina a divisão, e contar com o failover automático se o comportamento da primeira semana de qualquer um dos fornecedores contradisser os números de lançamento. Para um par de modelos lançados há um dia, em extremos opostos de uma guerra de preços, a capacidade de comparar ambos em sua própria carga de trabalho — e inverter a divisão sem alterar o código — não é uma conveniência. É a única forma defensável de adotar qualquer um deles.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube