
Gemini 3.7 Flash vs Grok 4.6: Guerra de Preços da Google vs Agente de Autoverificação da SpaceXAI
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0166Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
Três semanas depois de o Gemini 3.6 Flash ter fracassado em grande parte, a Google reduziu o preço pela metade e lançou o Gemini 3.7 Flash — um movimento que a maior parte da cobertura leu como um tiro direto no Grok 4.6, o carro-chefe otimizado para agentes que a SpaceXAI havia lançado no dia anterior a US$ 2 e US$ 6. O timing é a história: dois modelos quase de fronteira, com um dia de diferença, ambos voltados para o mesmo comprador — uma equipe que quer codificação com agentes sem pagar preços de fronteira — e precificados com filosofias opostas. A Google está comprando a resposta com uma promoção de cinco meses. A SpaceXAI está vendendo confiança por tarefa a um preço de tabela fixo.
Grok 4.6, lançado em 12 de agosto de 2026, é o refinamento da SpaceXAI de sua fundação Grok 4.5 de 1,5 trilhão de parâmetros, construído para agentes de longa duração que verificam a conclusão de suas próprias subtarefas, com janela de contexto de 500K, entrada de texto e imagem, e uma taxa de $2/$6 que dobra em tokens de entrada acima de 200K. Gemini 3.7 Flash, lançado em 13 de agosto de 2026, é o refinamento algorítmico do Google do Gemini 3.6 Flash — contexto de 1M, entrada multimodal incluindo vídeo e áudio, e uma taxa promocional de $0,75/$3,75 que dobra para $1,50/$7,50 em 1º de janeiro de 2027. No índice independente Artificial Analysis Intelligence Index, Grok 4.6 está em 61, um passo claro acima das leituras iniciais de cerca de 56 para o Gemini 3.7 Flash.
A guerra de preços, uma linha por dimensão
• Preço por 1M de entrada — Gemini 3.7 Flash $0,75 (introdutório) vs Grok 4.6 $2,00. A Google subcotiza em mais de 60%.
• Preço por 1M de saída — Gemini 3.7 Flash $3.75 (introdução) vs Grok 4.6 $6.00.
• Após 1 de janeiro de 2027 — Gemini dobra para $1,50/$7,50 vs Grok permanece em $2/$6.
• Janela de contexto — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Cobrança por entrada longa — A Gemini cobra valor fixo em toda a sua janela; a Grok dobra para $4/$12 em entradas de 200 mil ou mais.
• Tokens de pensamento — a Gemini os cobra como saída; o custo do Grok é capturado em uma medição independente de ~$0,84 por tarefa.
O resumo em uma linha: Gemini 3.7 Flash é mais barato em todas as linhas da tabela de preços hoje, e a maior parte dessa vantagem desaparece em 1º de janeiro. Grok 4.6 tem o mesmo preço em agosto que terá em março.

Para onde foi o dinheiro do Gemini 3.7 Flash
Os próprios números do {{1}}Google{{/1}} reportam grandes saltos do Gemini 3.7 Flash sobre o 3.6 Flash: 65,3% no DeepSWE v1.1 (subindo de 49,0%), 43,6% no FrontierCode 1.1 Main (subindo de 34,4%), 85,8% no Terminal-bench 2.1 (subindo de 78,0%) e um Elo de 1588 no WebDev Arena (subindo de 1538). São números relatados pelo fornecedor, não reproduzidos — o tipo de métrica que mede uma trajetória, não um veredito entre fornecedores. Mas a trajetória é o ponto: as correções chegaram três semanas após um lançamento que os avaliadores haviam amplamente descartado, o que mostra que o {{2}}Google{{/2}} trata a camada Flash como o campo de batalha, não como o carro-chefe.
A outra coisa que a promoção do Google faz é comprimir a janela de compra. A $0,75/$3,75 o modelo é barato o suficiente para testar em volume; a $1,50/$7,50 ainda é competitivo, mas não é mais uma arma de guerra de preços. Qualquer equipe de produção que o adotar na janela de lançamento deve reavaliar sua economia em dezembro, não presumindo que o número se moverá junto com eles.
Para onde foi o dinheiro do Grok 4.6
A proposta do Grok 4.6 é diferente: não tokens mais baratos, mas menos tokens desperdiçados. Ele foi treinado para se autoverificar — para checar se uma subtarefa foi realmente concluída antes de seguir em frente — e a medição independente comprova o efeito: a Artificial Analysis estima seu custo em cerca de US$ 0,84 por tarefa, com GDPVal-AA v2 de 1.753 e um Índice de Inteligência de 61. Esses são números de terceiros, e são o número mais forte neste confronto, porque capturam o que o preço por token não mostra: um modelo que precisa de menos etapas para concluir um trabalho é mais barato por trabalho concluído, mesmo com um preço de token mais alto.
O trade-off é onde o modelo mais barato tem espaço. O contexto de 500K do Grok 4.6 é metade do 1M do Gemini 3.7 Flash, e sua taxa de $2/$6 dobra acima de 200K de entrada — portanto, cargas de trabalho de contexto longo e alta entrada são exatamente onde o preço de tabela do Grok 4.6 deixa de ser competitivo com a taxa promocional do Gemini.
A economia por tarefa
Com o preço introdutório, a taxa combinada do Gemini 3.7 Flash com uma divisão de entrada/saída de 80/20 é de aproximadamente US$ 1,35 por milhão de tokens; o preço anunciado do Grok 4.6 com a mesma divisão é de US$ 2,80 por milhão, antes da penalidade por entradas longas. No papel, o modelo da Google parece ser de longe o vencedor em volume. A complicação é que os tokens de raciocínio do Gemini são cobrados como saída, suas alegações de benchmark têm uma semana, e sua eficiência por tarefa ainda não foi medida de forma independente — enquanto a do Grok 4.6 já foi. Tokens baratos mais turnos desperdiçados podem custar mais do que tokens caros que terminam, e este é um confronto em que um lado tem dados sobre essa questão e o outro não.
Apostando no novo modelo sem apostar no pipeline.
O Grok 4.6 está no OrcaRouter pelo preço de tabela de US$ 2/US$ 6 da SpaceXAI, com margem de 0%, incluindo a etapa de 2x acima de 200K, que a página do modelo puxa ao vivo da camada de roteamento. O Gemini 3.7 Flash tem um dia de lançado e está na API própria do Google; seu antecessor, o Gemini 3.6 Flash, está no OrcaRouter pelo preço de tabela do Google.


Se a pergunta que esta comparação realmente está fazendo é "devo apostar meu pipeline de agentes no novo modelo barato", a camada de roteamento é a proteção: uma regra de failover que executa o agente no Grok 4.6 hoje e muda para o Gemini 3.7 Flash no dia em que for lançado, ou um painel de fusão em que ambos respondem e um juiz reconcilia as respostas — o tipo de configuração para o qual o DSL de roteamento existe, e uma que não exige escolher um lado antes que as evidências estejam disponíveis.
A leitura honesta
Se você quer o token mais barato hoje e confia no prazo de três semanas, o Gemini 3.7 Flash é a aposta agressiva — a guerra de preços é real, os ganhos de benchmark são divulgados e a janela de introdução é um desconto genuíno. Se você quer um modelo cuja eficiência de agente é medida de forma independente, cujo preço não muda em janeiro e cujo loop de autoverificação é projetado para trabalhos de longa duração, o Grok 4.6 é a escolha conservadora, e os dados AA dão a ele uma vantagem no custo por tarefa concluída. Um lado é uma promoção com contagem regressiva; o outro é um preço com histórico comprovado. Ambos são defensáveis — é isso que faz desta uma comparação real, e não uma formalidade.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
