
DeepSeek V4.1 Flash vs Gemini 3.1 Pro: Um destes ainda é uma prévia
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A coisa mais útil a saber sobre DeepSeek V4.1 Flashcontra Gemini 3.1 Pro não está impressa em nenhuma das fichas técnicas. O DeepSeek V4.1 Flash é um modelo de disponibilidade geral, lançado em 10 de setembro de 2026, com pesos licenciados sob MIT que você pode baixar. O Gemini 3.1 Pro está em prévia desde 19 de fevereiro de 2026 e, cerca de sete meses depois, ainda é servido sob um nome de build de prévia. Essa assimetria não decide qual modelo é melhor, mas decide que tipo de compromisso você assume ao construir sobre um deles, e é o enquadramento para tudo o que vem abaixo.
Ambos têm um milhão de tokens de contexto. Ambos aceitam imagens. As diferenças que realmente os separam são a curva de preços acima de 200.000 tokens de entrada, as modalidades de entrada, o teto de saída e o fato de que um desses dois é um arquivo que você pode possuir e o outro é uma API.
Onde os dois realmente estão
• Preço por 1M de tokens, até 200K de contexto — DeepSeek V4.1 Flash $0,15 entrada / $0,60 saída vs Gemini 3.1 Pro $2,00 entrada / $12,00 saída. Isso representa 13 vezes o preço de entrada e 20 vezes o preço de saída.
• Preço por 1M de tokens, acima de 200K de contexto — V4.1 Flash inalterado em US$ 0,15 / US$ 0,60 vs. Gemini 3.1 Pro US$ 4,00 de entrada / US$ 18,00 de saída. O múltiplo de entrada aumenta para 27× exatamente no ponto em que o trabalho com contexto longo acontece.
• Entrada em cache — V4.1 Flash $0,003 por 1M fora do horário de pico vs Gemini 3.1 Pro $0,40 por 1M. Duas ordens de magnitude, no item de linha que decide se um contexto de releitura é acessível.
• Janela de contexto — 1M tokens vs 1M tokens. Empate.
• Saída máxima — V4.1 Flash 384K tokens vs Gemini 3.1 Pro 65K tokens. Seis vezes o teto.
• Modalidades de entrada — o V4.1 Flash aceita texto e imagens, enquanto o Gemini 3.1 Pro aceita texto, imagens, áudio, vídeo e upload de arquivos.
• Pesos — V4.1 Flash MIT, baixável vs Gemini 3.1 Pro fechado, apenas API.
• Estado de lançamento — V4.1 Flash em disponibilidade geral desde 10 de setembro de 2026 vs. Gemini 3.1 Pro em pré-visualização desde 19 de fevereiro de 2026.
• Latência observada até o primeiro token — V4.1 Flash 2,63 s no p50 e 9,05 s no p95 vs. Gemini 3.1 Pro 10,00 s no p50 e 10,00 s no p95, na telemetria de 7 dias da própria OrcaRouter. A espera mediana do modelo caro está no teto da telemetria, e sua cauda não se move dele.
Leia a lista sem os preços e o formato é familiar de toda comparação entre pesos abertos e modelos de fronteira: o modelo baixável vence no teto de saída, empata no contexto e está à frente na latência observada. O modelo fechado vence em modalidades e, nessas, vence de forma absoluta. Nada aqui explica, por si só, um múltiplo de 13× na entrada.

O penhasco dos 200K é a história dos preços
A tarifa anunciada do Gemini 3.1 Pro não é uma tarifa única. Prompts de até 200.000 tokens de entrada são cobrados a $2,00 na entrada e $12,00 na saída por milhão; um prompt que ultrapassa esse limite é cobrado a $4,00 e $18,00. O DeepSeek V4.1 Flash não tem faixas — cobra $0,15 e $0,60, seja a solicitação de 2.000 tokens ou 900.000, com a única ressalva de que a DeepSeek dobra sua tarifa durante os horários de pico e opera inteiramente fora de pico nos fins de semana.
Esse limite de nível fica no pior lugar possível para o trabalho com contexto longo, porque o trabalho com contexto longo é, por definição, o trabalho que atravessa essa fronteira. Uma comparação prática torna isso concreto. Considere um pipeline que faz 20.000 chamadas por mês, cada uma com média de 250.000 tokens de entrada e 4.000 tokens de saída — um trabalho de análise de documentos em arquivos grandes.
• DeepSeek V4.1 Flash com tarifas fora de pico: 20.000 × 250.000 resulta em 5.000M tokens de entrada a US$ 0,15 por milhão, ou US$ 750,00. A saída é 20.000 × 4.000, o que dá 80M tokens a US$ 0,60 por milhão, ou US$ 48,00. Total: US$ 798,00.
• Gemini 3.1 Pro no seu nível acima de 200K: os mesmos 5.000M tokens de entrada a $4,00 por milhão totalizam $20.000,00, e 80M tokens de saída a $18,00 por milhão totalizam $1.440,00. Total: $21.440,00.
Isso é uma diferença de 27× no gasto mensal com tráfego idêntico, e não é o múltiplo que você teria imaginado a partir dos números de manchete. O múltiplo de manchete é 13×. O múltiplo que você realmente paga por trabalho de contexto longo é 27×, porque a fronteira de nível está exatamente onde seus prompts se encontram.
O que o rótulo de pré-visualização realmente lhe custa
Uma compilação de pré-visualização é uma compilação de pré-visualização em todo o setor: ela não traz nenhuma garantia de estabilidade publicada. O fornecedor não se comprometeu a manter o endpoint naquele comportamento, naquele preço ou naquele nome. Isso não é uma crítica ao Gemini 3.1 Pro — é o que o rótulo significa, e é por isso que o sufixo de pré-visualização sobreviveu sete meses em vez de ser uma formalidade de duas semanas.
Para um protótipo, isto não é nada. Para um caminho de produção, é um risco específico e quantificável: está a apostar que a build para a qual fez afinações se mantém inalterada. O contraste com o outro lado desta comparação é estrutural, e não retórico. O DeepSeek V4.1 Flash está em GA, e os seus pesos têm licença MIT e são descarregáveis, o que significa que, mesmo que a API hospedada alterasse os seus termos amanhã, o próprio modelo continuaria nas suas mãos. Um modelo fechado de pré-visualização não lhe dá nem o compromisso de GA nem a válvula de escape. Se a sua carga de trabalho puder ser executada em qualquer um dos dois, essa diferença vale mais do que um ponto de benchmark.
Onde o Gemini 3.1 Pro é o melhor instrumento
A lacuna de modalidade não é um erro de arredondamento, e é a única dimensão nesta lista em que o modelo barato não pode ser substituído a nenhum preço. O Gemini 3.1 Pro aceita áudio e vídeo como entrada de primeira classe, além de uploads de arquivos. O DeepSeek V4.1 Flash aceita texto e imagens. Se o seu pipeline ingere uma gravação de chamada, uma captura de tela ou uma análise em vídeo, o DeepSeek V4.1 Flash não é uma opção mais barata — não é uma opção. O múltiplo de 13× é irrelevante para uma tarefa que um modelo consegue fazer e o outro não.
Há um segundo caso, mais discreto. O Gemini 3.1 Pro está disponível publicamente, de alguma forma, desde fevereiro, e é o modelo com o histórico de produção mais longo — mais pessoas esbarraram em seus limites, e seu comportamento em tráfego real está melhor documentado do que o de um lançamento de doze dias. Para trabalho interativo com grande volume de saída, em que uma espera mediana de dez segundos é aceitável porque a tarefa roda em segundo plano, esse histórico é o argumento, e é um argumento real. Não é um argumento de latência: na telemetria acima, o modelo mais barato é o mais rápido dos dois tanto na mediana quanto na cauda.
E há a questão de saber o que o rótulo de pré-visualização significa para esse histórico. Sete meses de disponibilidade sob o nome de uma build de pré-visualização é mais do que a maioria dos modelos consegue, e são também sete meses sem qualquer compromisso de GA. O DeepSeek V4.1 Flash tem doze dias de idade no momento em que escrevo, e o seu registo independente é escasso: a única avaliação recente de terceiros em que surge, o quadro de codificação agêntica Agents on Rails publicado a 21 de setembro de 2026, colocou-o em 17% em esforço máximo, a meio da tabela. Doze dias não é tempo suficiente para a reputação de um modelo significar alguma coisa, em qualquer direção — que é a razão honesta pela qual um comprador pode preferir aqui o modelo mais antigo, e isso não tem nada a ver com velocidade.
Roteamento com base no comprimento do contexto, porque essa é a decisão real.
A decisão que esta comparação implica não é "escolher um único". É uma regra com duas cláusulas: trabalho de contexto longo e alto volume vai para o DeepSeek V4.1 Flash, e qualquer coisa com áudio ou vídeo vai para o Gemini 3.1 Pro. A parte incômoda é que essa regra é fácil de enunciar e chata de implementar, porque as duas cláusulas geralmente ficam em fornecedores diferentes, com chaves diferentes, SDKs diferentes e limites de taxa diferentes.
Ambos os modelos estão acessíveis a partir de uma única chave OrcaRouter, o que transforma a regra numa regra de encaminhamento em vez de código com ramificações na sua aplicação — pode basear a decisão diretamente no comprimento do contexto do pedido, que é a dimensão que na verdade determina a diferença de custo aqui. O OrcaRouter repassa o preço de tabela dos fornecedores com 0% de margem, pelo que as tarifas escalonadas acima são as da própria Google e o calendário de picos da DeepSeek é o da própria DeepSeek, com uma alteração de preço do fornecedor a entrar em vigor do nosso lado no mesmo dia. E, como um dos lados deste emparelhamento é uma versão de pré-visualização, vale a pena colocar a recuperação automática de falhas por trás dele: se a versão for alterada sem aviso, o pedido vai para o outro modelo em vez de ir para uma página de erro.
Esse último ponto é a versão prática de tudo o que foi dito acima. O múltiplo de 27× no trabalho com contexto longo é o motivo para rotear em vez de escolher, e o rótulo de pré-visualização em um dos dois modelos é o motivo para haver um lugar para onde a solicitação possa ir quando a build mudar.

O que assistir
• Se o Gemini 3.1 Pro sai da pré-visualização. Um lançamento GA removeria a ressalva de estabilidade e mudaria a forma desta comparação mais do que qualquer mudança de preço.
• Se o escalão acima de 200 mil muda. O limite do escalão tem mais peso na aritmética de custos do que a taxa anunciada.
• Se o DeepSeek V4.1 Flash acumula um histórico independente. Um modelo com pesos sob licença MIT, um teto de saída de 384K e um contexto de 1M a US$ 0,15 por milhão de tokens de entrada é um pacote incomum; se a capacidade está de fato presente é uma questão que nenhum benchmark público respondeu até agora.
Até que o primeiro desses chegue, o resumo preciso é este: o DeepSeek V4.1 Flash é cerca de treze vezes mais barato na entrada e vinte e sete vezes mais barato na entrada de contexto longo do que o Gemini 3.1 Pro, é o único dos dois que você pode baixar e é o único dos dois com um compromisso de disponibilidade geral (GA) por trás. O Gemini 3.1 Pro é o modelo com o histórico de produção mais longo e é o único dos dois que consegue ler áudio e vídeo. Roteie de acordo.

