Cartão de título principal: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — um destes ainda é uma prévia
Guides & Insights

DeepSeek V4.1 Flash vs Gemini 3.1 Pro: Um destes ainda é uma prévia

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais útil a saber sobre DeepSeek V4.1 Flashcontra Gemini 3.1 Pro não está impressa em nenhuma das fichas técnicas. O DeepSeek V4.1 Flash é um modelo de disponibilidade geral, lançado em 10 de setembro de 2026, com pesos licenciados sob MIT que você pode baixar. O Gemini 3.1 Pro está em prévia desde 19 de fevereiro de 2026 e, cerca de sete meses depois, ainda é servido sob um nome de build de prévia. Essa assimetria não decide qual modelo é melhor, mas decide que tipo de compromisso você assume ao construir sobre um deles, e é o enquadramento para tudo o que vem abaixo.

Ambos têm um milhão de tokens de contexto. Ambos aceitam imagens. As diferenças que realmente os separam são a curva de preços acima de 200.000 tokens de entrada, as modalidades de entrada, o teto de saída e o fato de que um desses dois é um arquivo que você pode possuir e o outro é uma API.

Onde os dois realmente estão

• Preço por 1M de tokens, até 200K de contexto — DeepSeek V4.1 Flash $0,15 entrada / $0,60 saída vs Gemini 3.1 Pro $2,00 entrada / $12,00 saída. Isso representa 13 vezes o preço de entrada e 20 vezes o preço de saída.

• Preço por 1M de tokens, acima de 200K de contexto — V4.1 Flash inalterado em US$ 0,15 / US$ 0,60 vs. Gemini 3.1 Pro US$ 4,00 de entrada / US$ 18,00 de saída. O múltiplo de entrada aumenta para 27× exatamente no ponto em que o trabalho com contexto longo acontece.

• Entrada em cache — V4.1 Flash $0,003 por 1M fora do horário de pico vs Gemini 3.1 Pro $0,40 por 1M. Duas ordens de magnitude, no item de linha que decide se um contexto de releitura é acessível.

• Janela de contexto — 1M tokens vs 1M tokens. Empate.

• Saída máxima — V4.1 Flash 384K tokens vs Gemini 3.1 Pro 65K tokens. Seis vezes o teto.

• Modalidades de entrada — o V4.1 Flash aceita texto e imagens, enquanto o Gemini 3.1 Pro aceita texto, imagens, áudio, vídeo e upload de arquivos.

• Pesos — V4.1 Flash MIT, baixável vs Gemini 3.1 Pro fechado, apenas API.

• Estado de lançamento — V4.1 Flash em disponibilidade geral desde 10 de setembro de 2026 vs. Gemini 3.1 Pro em pré-visualização desde 19 de fevereiro de 2026.

• Latência observada até o primeiro token — V4.1 Flash 2,63 s no p50 e 9,05 s no p95 vs. Gemini 3.1 Pro 10,00 s no p50 e 10,00 s no p95, na telemetria de 7 dias da própria OrcaRouter. A espera mediana do modelo caro está no teto da telemetria, e sua cauda não se move dele.

Leia a lista sem os preços e o formato é familiar de toda comparação entre pesos abertos e modelos de fronteira: o modelo baixável vence no teto de saída, empata no contexto e está à frente na latência observada. O modelo fechado vence em modalidades e, nessas, vence de forma absoluta. Nada aqui explica, por si só, um múltiplo de 13× na entrada.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

O penhasco dos 200K é a história dos preços

A tarifa anunciada do Gemini 3.1 Pro não é uma tarifa única. Prompts de até 200.000 tokens de entrada são cobrados a $2,00 na entrada e $12,00 na saída por milhão; um prompt que ultrapassa esse limite é cobrado a $4,00 e $18,00. O DeepSeek V4.1 Flash não tem faixas — cobra $0,15 e $0,60, seja a solicitação de 2.000 tokens ou 900.000, com a única ressalva de que a DeepSeek dobra sua tarifa durante os horários de pico e opera inteiramente fora de pico nos fins de semana.

Esse limite de nível fica no pior lugar possível para o trabalho com contexto longo, porque o trabalho com contexto longo é, por definição, o trabalho que atravessa essa fronteira. Uma comparação prática torna isso concreto. Considere um pipeline que faz 20.000 chamadas por mês, cada uma com média de 250.000 tokens de entrada e 4.000 tokens de saída — um trabalho de análise de documentos em arquivos grandes.

• DeepSeek V4.1 Flash com tarifas fora de pico: 20.000 × 250.000 resulta em 5.000M tokens de entrada a US$ 0,15 por milhão, ou US$ 750,00. A saída é 20.000 × 4.000, o que dá 80M tokens a US$ 0,60 por milhão, ou US$ 48,00. Total: US$ 798,00.

• Gemini 3.1 Pro no seu nível acima de 200K: os mesmos 5.000M tokens de entrada a $4,00 por milhão totalizam $20.000,00, e 80M tokens de saída a $18,00 por milhão totalizam $1.440,00. Total: $21.440,00.

Isso é uma diferença de 27× no gasto mensal com tráfego idêntico, e não é o múltiplo que você teria imaginado a partir dos números de manchete. O múltiplo de manchete é 13×. O múltiplo que você realmente paga por trabalho de contexto longo é 27×, porque a fronteira de nível está exatamente onde seus prompts se encontram.

O que o rótulo de pré-visualização realmente lhe custa

Uma compilação de pré-visualização é uma compilação de pré-visualização em todo o setor: ela não traz nenhuma garantia de estabilidade publicada. O fornecedor não se comprometeu a manter o endpoint naquele comportamento, naquele preço ou naquele nome. Isso não é uma crítica ao Gemini 3.1 Pro — é o que o rótulo significa, e é por isso que o sufixo de pré-visualização sobreviveu sete meses em vez de ser uma formalidade de duas semanas.

Para um protótipo, isto não é nada. Para um caminho de produção, é um risco específico e quantificável: está a apostar que a build para a qual fez afinações se mantém inalterada. O contraste com o outro lado desta comparação é estrutural, e não retórico. O DeepSeek V4.1 Flash está em GA, e os seus pesos têm licença MIT e são descarregáveis, o que significa que, mesmo que a API hospedada alterasse os seus termos amanhã, o próprio modelo continuaria nas suas mãos. Um modelo fechado de pré-visualização não lhe dá nem o compromisso de GA nem a válvula de escape. Se a sua carga de trabalho puder ser executada em qualquer um dos dois, essa diferença vale mais do que um ponto de benchmark.

Onde o Gemini 3.1 Pro é o melhor instrumento

A lacuna de modalidade não é um erro de arredondamento, e é a única dimensão nesta lista em que o modelo barato não pode ser substituído a nenhum preço. O Gemini 3.1 Pro aceita áudio e vídeo como entrada de primeira classe, além de uploads de arquivos. O DeepSeek V4.1 Flash aceita texto e imagens. Se o seu pipeline ingere uma gravação de chamada, uma captura de tela ou uma análise em vídeo, o DeepSeek V4.1 Flash não é uma opção mais barata — não é uma opção. O múltiplo de 13× é irrelevante para uma tarefa que um modelo consegue fazer e o outro não.

Há um segundo caso, mais discreto. O Gemini 3.1 Pro está disponível publicamente, de alguma forma, desde fevereiro, e é o modelo com o histórico de produção mais longo — mais pessoas esbarraram em seus limites, e seu comportamento em tráfego real está melhor documentado do que o de um lançamento de doze dias. Para trabalho interativo com grande volume de saída, em que uma espera mediana de dez segundos é aceitável porque a tarefa roda em segundo plano, esse histórico é o argumento, e é um argumento real. Não é um argumento de latência: na telemetria acima, o modelo mais barato é o mais rápido dos dois tanto na mediana quanto na cauda.

E há a questão de saber o que o rótulo de pré-visualização significa para esse histórico. Sete meses de disponibilidade sob o nome de uma build de pré-visualização é mais do que a maioria dos modelos consegue, e são também sete meses sem qualquer compromisso de GA. O DeepSeek V4.1 Flash tem doze dias de idade no momento em que escrevo, e o seu registo independente é escasso: a única avaliação recente de terceiros em que surge, o quadro de codificação agêntica Agents on Rails publicado a 21 de setembro de 2026, colocou-o em 17% em esforço máximo, a meio da tabela. Doze dias não é tempo suficiente para a reputação de um modelo significar alguma coisa, em qualquer direção — que é a razão honesta pela qual um comprador pode preferir aqui o modelo mais antigo, e isso não tem nada a ver com velocidade.

Roteamento com base no comprimento do contexto, porque essa é a decisão real.

A decisão que esta comparação implica não é "escolher um único". É uma regra com duas cláusulas: trabalho de contexto longo e alto volume vai para o DeepSeek V4.1 Flash, e qualquer coisa com áudio ou vídeo vai para o Gemini 3.1 Pro. A parte incômoda é que essa regra é fácil de enunciar e chata de implementar, porque as duas cláusulas geralmente ficam em fornecedores diferentes, com chaves diferentes, SDKs diferentes e limites de taxa diferentes.

Ambos os modelos estão acessíveis a partir de uma única chave OrcaRouter, o que transforma a regra numa regra de encaminhamento em vez de código com ramificações na sua aplicação — pode basear a decisão diretamente no comprimento do contexto do pedido, que é a dimensão que na verdade determina a diferença de custo aqui. O OrcaRouter repassa o preço de tabela dos fornecedores com 0% de margem, pelo que as tarifas escalonadas acima são as da própria Google e o calendário de picos da DeepSeek é o da própria DeepSeek, com uma alteração de preço do fornecedor a entrar em vigor do nosso lado no mesmo dia. E, como um dos lados deste emparelhamento é uma versão de pré-visualização, vale a pena colocar a recuperação automática de falhas por trás dele: se a versão for alterada sem aviso, o pedido vai para o outro modelo em vez de ir para uma página de erro.

Esse último ponto é a versão prática de tudo o que foi dito acima. O múltiplo de 27× no trabalho com contexto longo é o motivo para rotear em vez de escolher, e o rótulo de pré-visualização em um dos dois modelos é o motivo para haver um lugar para onde a solicitação possa ir quando a build mudar.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

O que assistir

• Se o Gemini 3.1 Pro sai da pré-visualização. Um lançamento GA removeria a ressalva de estabilidade e mudaria a forma desta comparação mais do que qualquer mudança de preço.

• Se o escalão acima de 200 mil muda. O limite do escalão tem mais peso na aritmética de custos do que a taxa anunciada.

• Se o DeepSeek V4.1 Flash acumula um histórico independente. Um modelo com pesos sob licença MIT, um teto de saída de 384K e um contexto de 1M a US$ 0,15 por milhão de tokens de entrada é um pacote incomum; se a capacidade está de fato presente é uma questão que nenhum benchmark público respondeu até agora.

Até que o primeiro desses chegue, o resumo preciso é este: o DeepSeek V4.1 Flash é cerca de treze vezes mais barato na entrada e vinte e sete vezes mais barato na entrada de contexto longo do que o Gemini 3.1 Pro, é o único dos dois que você pode baixar e é o único dos dois com um compromisso de disponibilidade geral (GA) por trás. O Gemini 3.1 Pro é o modelo com o histórico de produção mais longo e é o único dos dois que consegue ler áudio e vídeo. Roteie de acordo.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart