Um cartão de título para a comparação entre Gemini 3.7 Flash e DeepSeek V4 Flash, mostrando dois relâmpagos: uma caixa trancada rotulada Gemini 3.7 Flash com uma etiqueta de $0,75 / $3,75, e uma caixa aberta com uma seta de download rotulada DeepSeek V4 Flash com uma etiqueta de $0,14 / $0,28.
Guides & Insights

Gemini 3.7 Flash vs DeepSeek V4 Flash: Dois modelos "Flash", respostas opostas à mesma pergunta

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Os dois modelos de 2026 com os nomes mais confusos são ambos chamados Flash, e não poderiam responder à mesma pergunta de maneira mais diferente. O Gemini 3.7 Flash, lançado em 13 de agosto de 2026, é o cavalo de batalha fechado do Go​ogle: cerca de 340 tokens de saída por segundo, um Índice de Inteligência de 56 e um preço promocional de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. O DeepSeek V4 Flash é a metade de pesos abertos da família V4 do Deep​Seek, lançado em abril e atualizado no final de julho: licenciado sob MIT, baixável e com preço de US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída na própria API do Deep​Seek — cerca de um quinto do preço promocional de entrada do Go​ogle e um décimo terço do preço de saída. Ambos são modelos "flash", criados para serem rápidos e baratos para trabalhos de alto volume. A palavra é onde a semelhança termina.

A pergunta que eles respondem de forma diferente é a definidora desta geração: você aluga inteligência ou é dono dela? O DeepSeek V4 Flash é um modelo de mistura de especialistas com 284 bilhões de parâmetros, aproximadamente 13B ativos por token, janela de contexto de 1M de tokens e teto de saída de 384K, lançado sob licença MIT — os pesos são um download de ~160GB, e a atualização de 31 de julho (V4-Flash-0731) adicionou capacidades de agente substancialmente mais fortes. O Gemini 3.7 Flash é um modelo proprietário construído sobre o Gemini 3.6 Flash, com contexto de 1M, limite de saída de 64K, entrada multimodal e nenhum caminho para auto-hospedagem. Um desses modelos pode ser isolado de redes externas, ajustado finamente e executado no seu próprio hardware. O outro roda apenas onde o Go​ogle roda.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

Os dois Flashes, lado a lado

Ambos os modelos visam o mesmo comprador — cargas de trabalho de produção de alto volume que não podem pagar por um modelo carro-chefe por token — mas chegam lá por arquiteturas opostas. A atenção híbrida do DeepSeek V4 Flash (esparsa comprimida mais atenção altamente comprimida) é o que torna seu contexto de 1M econômico o suficiente para ser vendido a esses preços; é o modelo para o qual a Deep​Seek aponta os endpoints legados `deepseek-chat` e `deepseek-reasoner`, aposentado em julho. O Gemini 3.7 Flash é o refinamento algorítmico da Go​ogle de sua própria linha Flash, e sua vantagem é a taxa de processamento: medições independentes o colocam em aproximadamente 340 tokens/s contra os aproximadamente 113 do DeepSeek V4 Flash, e ele atinge isso enquanto aceita entrada de áudio e vídeo que o DeepSeek V4 Flash não aceita.

Intelligence Index — 56 para o Gemini 3.7 Flash contra 50 para o DeepSeek V4 Flash, segundo a Artificial Analysis.

Velocidade de saída — ~340 tokens/s versus ~113 tokens/s, ambos segundo a Artificial Analysis.

Janela de contexto — 1M de tokens para ambos; DeepSeek V4 Flash gera até 384K, contra os 64K do Gemini 3.7 Flash.

Preço de entrada — $0.75 (promocional, até 2026) contra $0.14 na própria API da Deep​Seek.

Preço de saída — $3.75 (promocional) versus $0.28.

Pesos — proprietários versus licenciados sob MIT e para download.

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

O que seis pontos de índice realmente compram

A diferença de seis pontos no Índice é significativa, mas não abissal, e se concentra principalmente em áreas para as quais o DeepSeek V4 Flash não foi otimizado. Os números relatados de codificação agêntica do Gemini 3.7 Flash (65,3 no DeepSWE v1.1, 43,6 no FrontierCode 1.1 Main, relatados pelo fornecedor) estão bem à frente, e seu Elo de desenvolvimento web (1588, também relatado pelo fornecedor) reflete melhorias reais na geração de UI. Os próprios números relatados do DeepSeek V4 Flash — 79,0 no SWE-bench Verified, 91,6 no LiveCodeBench, uma pontuação de 95,0 no τ²-Bench corroborada por rastreadores independentes — se sustentam bem em codificação limitada e uso de ferramentas, e sua recuperação de contexto de 1M (78,7 no MRCR, 60,5 no CorpusQA) é competitiva com qualquer coisa em sua faixa de preço. O padrão: o Gemini 3.7 Flash lidera em profundidade agêntica e trabalho web; o DeepSeek V4 Flash troca isso por economia bruta de tokens e um teto de contexto longo que nenhum cavalo de batalha fechado iguala.

Pesos abertos mudam a aquisição, não apenas o preço.

A licença MIT é a parte desta comparação que nenhuma tabela de benchmark captura. O DeepSeek V4 Flash pode ser baixado e executado no seu próprio hardware, ajustado com seus próprios dados e usado em ambientes onde chamadas de API não são permitidas — e a licença não tem restrições baseadas em escala, então nada no seu crescimento altera os termos. O custo prático é operacional: servir um modelo MoE de 284B na velocidade que uma equipe de produção deseja exige um inventário real de GPUs, e para a maioria das equipes a escolha honesta é a API hospedada. É aí que a diferença de preço faz seu verdadeiro trabalho: mesmo o caminho hospedado, a US$ 0,14 / US$ 0,28, é barato o suficiente para ser o padrão para a cauda longa do tráfego. O Gemini 3.7 Flash não oferece nenhuma das opções de propriedade — o que você compra é um serviço multimodal, rápido e gerenciado de forma confiável, com um preço promocional e um precipício em janeiro.

A conta de volume

Execute no mesmo dia em ambos: 20 milhões de tokens de entrada e 4 milhões de tokens de saída. Na própria API do Deep​Seek V4 Flash, isso custa $2.80 + $1.12, cerca de $3.92. No Gemini 3.7 Flash com a taxa promocional, isso dá $15 + $15, cerca de $30 — uma diferença de 7.6x mesmo enquanto o Go​ogle está aplicando seu desconto. Após 1º de janeiro de 2027, quando o Gemini 3.7 Flash voltar a $1.50 / $7.50, o mesmo dia custa cerca de $58, quinze vezes o valor do Deep​Seek. A vantagem de velocidade compensa parcialmente isso em cargas de trabalho interativas — tokens mais rápidos significam menos solicitações concorrentes —, mas para trabalhos em lote e em segundo plano, o modelo aberto vence a conta sem contestação. Os dois modelos nem sequer estão mirando a mesma curva de custo, e é exatamente esse o ponto.

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

Quem deve construir sobre o quê

Escolha o DeepSeek V4 Flash quando o custo por token for o fator limitante, quando você quiser saídas longas de até 384K, quando precisar da opção de auto-hospedagem ou implantação em ambiente isolado (air-gapped), ou quando estiver construindo algo cujas margens não sobreviverão a tokens com preço de flagship. Escolha o Gemini 3.7 Flash quando precisar de velocidade em um loop interativo, entrada multimodal, a confiabilidade gerenciada do Go​ogle ou os resultados mais fortes de codificação agêntica que o Go​ogle reporta — e quando você estiver confortável com o fato de que o preço promocional é temporário. Eles não são rivais da mesma forma que dois flagships são rivais; são duas estratégias de aquisição diferentes usando o mesmo nome. A camada de roteamento é onde as estratégias se encontram: o DeepSeek V4 Flash está no ar no OrcaRouter ao preço de tabela do Deep​Seek com margem de 0%, e o padrão de failover se encaixa naturalmente nessa combinação — uma regra que direciona a maior parte do tráfego para o V4 Flash e escala o subconjunto difícil para um modelo fechado mais forte, com o Gemini 3.7 Flash acessível pela própria API Gemini do Go​ogle na outra perna do mesmo roteador.

A leitura honesta

Se você pode fazer self-host ou é puramente movido a custos, o DeepSeek V4 Flash é o melhor modelo para desenvolver, e a licença torna essa uma decisão que você nunca precisa revisitar. Se você precisa da velocidade de serviço do Google, entrada multimodal ou a alegada vantagem em codificação agêntica, o Gemini 3.7 Flash é o melhor serviço enquanto durar a promoção — com a duplicação do preço em janeiro já no calendário. Dois modelos, um nome, e o mercado poderá ver qual filosofia o tráfego do próximo ano elege.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente