
Gemini 3.7 Flash vs DeepSeek V4 Flash: Dois modelos "Flash", respostas opostas à mesma pergunta
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Os dois modelos de 2026 com os nomes mais confusos são ambos chamados Flash, e não poderiam responder à mesma pergunta de maneira mais diferente. O Gemini 3.7 Flash, lançado em 13 de agosto de 2026, é o cavalo de batalha fechado do Google: cerca de 340 tokens de saída por segundo, um Índice de Inteligência de 56 e um preço promocional de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. O DeepSeek V4 Flash é a metade de pesos abertos da família V4 do DeepSeek, lançado em abril e atualizado no final de julho: licenciado sob MIT, baixável e com preço de US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída na própria API do DeepSeek — cerca de um quinto do preço promocional de entrada do Google e um décimo terço do preço de saída. Ambos são modelos "flash", criados para serem rápidos e baratos para trabalhos de alto volume. A palavra é onde a semelhança termina.
A pergunta que eles respondem de forma diferente é a definidora desta geração: você aluga inteligência ou é dono dela? O DeepSeek V4 Flash é um modelo de mistura de especialistas com 284 bilhões de parâmetros, aproximadamente 13B ativos por token, janela de contexto de 1M de tokens e teto de saída de 384K, lançado sob licença MIT — os pesos são um download de ~160GB, e a atualização de 31 de julho (V4-Flash-0731) adicionou capacidades de agente substancialmente mais fortes. O Gemini 3.7 Flash é um modelo proprietário construído sobre o Gemini 3.6 Flash, com contexto de 1M, limite de saída de 64K, entrada multimodal e nenhum caminho para auto-hospedagem. Um desses modelos pode ser isolado de redes externas, ajustado finamente e executado no seu próprio hardware. O outro roda apenas onde o Google roda.

Os dois Flashes, lado a lado
Ambos os modelos visam o mesmo comprador — cargas de trabalho de produção de alto volume que não podem pagar por um modelo carro-chefe por token — mas chegam lá por arquiteturas opostas. A atenção híbrida do DeepSeek V4 Flash (esparsa comprimida mais atenção altamente comprimida) é o que torna seu contexto de 1M econômico o suficiente para ser vendido a esses preços; é o modelo para o qual a DeepSeek aponta os endpoints legados `deepseek-chat` e `deepseek-reasoner`, aposentado em julho. O Gemini 3.7 Flash é o refinamento algorítmico da Google de sua própria linha Flash, e sua vantagem é a taxa de processamento: medições independentes o colocam em aproximadamente 340 tokens/s contra os aproximadamente 113 do DeepSeek V4 Flash, e ele atinge isso enquanto aceita entrada de áudio e vídeo que o DeepSeek V4 Flash não aceita.
• Intelligence Index — 56 para o Gemini 3.7 Flash contra 50 para o DeepSeek V4 Flash, segundo a Artificial Analysis.
• Velocidade de saída — ~340 tokens/s versus ~113 tokens/s, ambos segundo a Artificial Analysis.
• Janela de contexto — 1M de tokens para ambos; DeepSeek V4 Flash gera até 384K, contra os 64K do Gemini 3.7 Flash.
• Preço de entrada — $0.75 (promocional, até 2026) contra $0.14 na própria API da DeepSeek.
• Preço de saída — $3.75 (promocional) versus $0.28.
• Pesos — proprietários versus licenciados sob MIT e para download.

O que seis pontos de índice realmente compram
A diferença de seis pontos no Índice é significativa, mas não abissal, e se concentra principalmente em áreas para as quais o DeepSeek V4 Flash não foi otimizado. Os números relatados de codificação agêntica do Gemini 3.7 Flash (65,3 no DeepSWE v1.1, 43,6 no FrontierCode 1.1 Main, relatados pelo fornecedor) estão bem à frente, e seu Elo de desenvolvimento web (1588, também relatado pelo fornecedor) reflete melhorias reais na geração de UI. Os próprios números relatados do DeepSeek V4 Flash — 79,0 no SWE-bench Verified, 91,6 no LiveCodeBench, uma pontuação de 95,0 no τ²-Bench corroborada por rastreadores independentes — se sustentam bem em codificação limitada e uso de ferramentas, e sua recuperação de contexto de 1M (78,7 no MRCR, 60,5 no CorpusQA) é competitiva com qualquer coisa em sua faixa de preço. O padrão: o Gemini 3.7 Flash lidera em profundidade agêntica e trabalho web; o DeepSeek V4 Flash troca isso por economia bruta de tokens e um teto de contexto longo que nenhum cavalo de batalha fechado iguala.
Pesos abertos mudam a aquisição, não apenas o preço.
A licença MIT é a parte desta comparação que nenhuma tabela de benchmark captura. O DeepSeek V4 Flash pode ser baixado e executado no seu próprio hardware, ajustado com seus próprios dados e usado em ambientes onde chamadas de API não são permitidas — e a licença não tem restrições baseadas em escala, então nada no seu crescimento altera os termos. O custo prático é operacional: servir um modelo MoE de 284B na velocidade que uma equipe de produção deseja exige um inventário real de GPUs, e para a maioria das equipes a escolha honesta é a API hospedada. É aí que a diferença de preço faz seu verdadeiro trabalho: mesmo o caminho hospedado, a US$ 0,14 / US$ 0,28, é barato o suficiente para ser o padrão para a cauda longa do tráfego. O Gemini 3.7 Flash não oferece nenhuma das opções de propriedade — o que você compra é um serviço multimodal, rápido e gerenciado de forma confiável, com um preço promocional e um precipício em janeiro.
A conta de volume
Execute no mesmo dia em ambos: 20 milhões de tokens de entrada e 4 milhões de tokens de saída. Na própria API do DeepSeek V4 Flash, isso custa $2.80 + $1.12, cerca de $3.92. No Gemini 3.7 Flash com a taxa promocional, isso dá $15 + $15, cerca de $30 — uma diferença de 7.6x mesmo enquanto o Google está aplicando seu desconto. Após 1º de janeiro de 2027, quando o Gemini 3.7 Flash voltar a $1.50 / $7.50, o mesmo dia custa cerca de $58, quinze vezes o valor do DeepSeek. A vantagem de velocidade compensa parcialmente isso em cargas de trabalho interativas — tokens mais rápidos significam menos solicitações concorrentes —, mas para trabalhos em lote e em segundo plano, o modelo aberto vence a conta sem contestação. Os dois modelos nem sequer estão mirando a mesma curva de custo, e é exatamente esse o ponto.

Quem deve construir sobre o quê
Escolha o DeepSeek V4 Flash quando o custo por token for o fator limitante, quando você quiser saídas longas de até 384K, quando precisar da opção de auto-hospedagem ou implantação em ambiente isolado (air-gapped), ou quando estiver construindo algo cujas margens não sobreviverão a tokens com preço de flagship. Escolha o Gemini 3.7 Flash quando precisar de velocidade em um loop interativo, entrada multimodal, a confiabilidade gerenciada do Google ou os resultados mais fortes de codificação agêntica que o Google reporta — e quando você estiver confortável com o fato de que o preço promocional é temporário. Eles não são rivais da mesma forma que dois flagships são rivais; são duas estratégias de aquisição diferentes usando o mesmo nome. A camada de roteamento é onde as estratégias se encontram: o DeepSeek V4 Flash está no ar no OrcaRouter ao preço de tabela do DeepSeek com margem de 0%, e o padrão de failover se encaixa naturalmente nessa combinação — uma regra que direciona a maior parte do tráfego para o V4 Flash e escala o subconjunto difícil para um modelo fechado mais forte, com o Gemini 3.7 Flash acessível pela própria API Gemini do Google na outra perna do mesmo roteador.
A leitura honesta
Se você pode fazer self-host ou é puramente movido a custos, o DeepSeek V4 Flash é o melhor modelo para desenvolver, e a licença torna essa uma decisão que você nunca precisa revisitar. Se você precisa da velocidade de serviço do Google, entrada multimodal ou a alegada vantagem em codificação agêntica, o Gemini 3.7 Flash é o melhor serviço enquanto durar a promoção — com a duplicação do preço em janeiro já no calendário. Dois modelos, um nome, e o mercado poderá ver qual filosofia o tráfego do próximo ano elege.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
