Uma comparação direta entre DeepSeek V4 Flash (deepseek) e DeepSeek V4 Flash (Free) (deepseek) no OrcaRouter — preços, janela de contexto, latência, throughput e qualidade de benchmark, lado a lado, para você escolher o modelo certo para sua carga de trabalho.
Conclusão
Para cargas de trabalho sensíveis à latência, DeepSeek V4 Flash (Free) retorna o primeiro token mais cedo.
Comece grátis · os dois modelos numa chave · cobrado ao custo do provedor, sem markup de tokens
Tanto DeepSeek V4 Flash quanto DeepSeek V4 Flash (Free) estão disponíveis pelo mesmo endpoint do OrcaRouter ao custo do provedor e sem qualquer acréscimo sobre os tokens, então alternar entre eles é uma mudança de uma linha e os números abaixo são o que você realmente paga.
Esta comparação puxa preços ao vivo, a context window publicada e as próprias medições de latency e throughput do OrcaRouter, para que você possa ponderar custo contra desempenho para a sua carga de trabalho específica em vez de confiar no benchmark de vitrine de um fornecedor. A escolha certa quase sempre depende do formato do seu tráfego — comprimento dos prompts, quanto texto você gera, quão sensíveis à latency são seus usuários e quão difícil é o raciocínio — por isso as seções abaixo destrincham a decisão uma dimensão de cada vez e terminam com uma recomendação concreta. Sempre que faltar uma métrica para um dos dois modelos, essa linha é omitida em vez de adivinhada, de modo que toda afirmação aqui é respaldada por um número real.
Visão geral
| Métrica | DeepSeek V4 Flash | DeepSeek V4 Flash (Free) | Conclusão |
|---|---|---|---|
| Entrada $/M | $0.15 | — | — |
| Saída $/M | $0.29 | — | — |
| Contexto | 1M | 1M | DeepSeek V4 Flash e DeepSeek V4 Flash (Free) compartilham a mesma janela de contexto. |
| Latência p50 | 430 ms | 387 ms | DeepSeek V4 Flash (Free) responde 10% mais rápido que DeepSeek V4 Flash na mediana. |
| Throughput | 117 tok/s | 18 tok/s | DeepSeek V4 Flash transmite tokens 537% mais rápido que DeepSeek V4 Flash (Free). |
| Qualidade | 7.0 | — | — |
Para cargas de trabalho sensíveis à latência, DeepSeek V4 Flash (Free) retorna o primeiro token mais cedo.
Os dois modelos, uma chave de API. Comece por qualquer um e alterne mudando uma string.
Obter uma chave de APINão precisa de escolher um. Ambos os modelos são expostos pelo mesmo endpoint compatível com OpenAI no OrcaRouter, cobrados à tarifa do fornecedor a montante e sem markup de tokens. Alternar entre eles é mudar o nome do modelo — sem segunda conta, sem segundo SDK, sem credenciais separadas.
É isso que torna o compromisso acima gerível em produção: envie a maior parte do tráfego para o modelo que vence na dimensão que lhe interessa, reserve o outro para os pedidos que precisam dele e mude a divisão sempre que os seus números mudarem.
# Uma chave, um endpoint, os dois modelos.
curl https://api.orcarouter.ai/v1/chat/completions \
-H "Authorization: Bearer $ORCAROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek/deepseek-v4-flash",
"messages": [{"role":"user","content":"..."}]
}'
# Mude de modelo alterando uma string.
# "model": "deepseek/deepseek-v4-flash-free"Um ou ambos desses modelos não expõem aqui um preço por token (pode ser um modelo de nível gratuito, cobrado por chamada ou ainda sem preço), então trate as colunas de custo como
indicativas e confirme a taxa ao vivo na página própria de cada modelo antes de orçar com base nela.
DeepSeek V4 Flash aceita até 1M tokens de contexto e DeepSeek V4 Flash (Free) aceita 1M. A context window limita quanto material de origem — documentos, código, conversa anterior — você pode enviar em uma única requisição.
Uma janela maior permite dispensar o fatiamento e o encanamento de recuperação para entradas longas, mas você ainda paga a taxa de tokens de entrada por tudo o que envia, então uma janela maior é uma capacidade, não um desconto. Ajuste a janela à maior requisição individual que sua carga de trabalho produz de forma realista, não ao maior número da página. Tenha também em mente que a qualidade pode degradar-se perto do fim de um contexto muito longo em qualquer modelo, então uma janela grande é melhor tratada como margem para entradas longas ocasionais e não como uma licença para encher cada requisição até o limite.
Ambas as tarifas são o preço bruto do fornecedor — o OrcaRouter não acrescenta markup, por isso a poupança que calcula é a poupança que fica.
Comece grátisLatency e throughput decidem como o modelo se sente em produção. A latency de resposta mediana (p50) é quanto uma requisição típica espera antes do primeiro token; o throughput (tokens por segundo) define a que velocidade a resposta é transmitida depois de iniciada.
Para chat interativo e loops de agent, uma latency p50 baixa importa mais porque o usuário está esperando o primeiro token; para geração em lote e saída de formato longo, o throughput domina o tempo total porque a resposta é longa. Os gráficos de tendência de 7 dias acima mostram se a latency de cada modelo é estável ou está derivando, algo que um único número de destaque esconde — um modelo com ótima média mas cauda ruidosa ainda pode não cumprir um SLA p95 rígido. Se o seu produto tem um orçamento de latency, leia tanto a mediana quanto o formato da curva, e lembre-se de que a latency de ponta a ponta também inclui o seu salto de rede e qualquer recuperação ou chamada de ferramenta que você faça em torno do modelo.
Nos últimos 7 dias, DeepSeek V4 Flash (Free) mantém a menor latência de resposta mediana.
Pontuações de benchmark aproximam a capacidade, mas não substituem testes com seus próprios prompts.
Os índices compostos mostrados aqui agregam várias avaliações públicas, e o percentil marca onde cada modelo se posiciona frente a todos os modelos comparáveis do catálogo — um sinal útil de pré-seleção, não uma garantia para a sua tarefa. Um modelo que lidera num índice de inteligência geral pode ficar para trás no seu domínio (código, extração, multilíngue, raciocínio de contexto longo), então use os benchmarks para estreitar o campo e depois rode ambos os modelos numa fatia representativa do seu tráfego. Preste atenção ao índice específico que corresponde ao seu caso de uso em vez do número principal: um produto com muito código deve pesar o índice de código, um assistente de pesquisa o índice de raciocínio. Os benchmarks também envelhecem à medida que os modelos são atualizados, então trate-os como uma hipótese inicial que você confirma com o seu próprio conjunto de avaliação.
Ambos os modelos têm uma pontuação Elo comunitária comparável (cerca de 1285) nos torneios de confronto direto, portanto nenhum tem vantagem clara nos testes de preferência às cegas.
Se o custo é a restrição decisiva, comece com o modelo mais barato no seu mix real entrada-saída e só suba de nível se a qualidade não atender.
Se a prioridade é a capacidade de resposta — chat voltado ao usuário, agents, qualquer caso em que alguém esteja esperando — dê mais peso à latency p50 e ao throughput do que a uma pequena diferença de preço. Se você está forçando o raciocínio, o código ou o trabalho de contexto longo mais exigentes, deixe o vencedor em benchmark e context window liderar e aceite a taxa mais alta onde ela se paga. Como ambos os modelos ficam atrás da mesma API, a jogada de baixo risco é rotear uma fração do tráfego real para cada um e comparar custo, latency e qualidade das respostas nos seus próprios prompts antes de se comprometer. Um padrão comum é escalonar (tier): envie o grosso das requisições fáceis e de alto volume para o modelo mais barato ou mais rápido e reserve o modelo mais forte para as requisições que realmente precisam dele, o que captura a maior parte do ganho de qualidade por uma fração do custo. Seja qual for a sua escolha, mantenha a troca reversível — você pode devolver o tráfego assim que os números ou seus requisitos mudarem.
Ou não escolha — encaminhe pedido a pedido entre os dois, com uma chave e um endpoint.
Obter os doisIdeal para
Uma chave. Os dois modelos. Mais de 40 fornecedores.
Cobrado ao custo do fornecedor, sem markup de tokens. Comece grátis, mude de modelo com uma string e mantenha a decisão reversível.