DeepSeek V4 Flash 0731 é a versão oficial com pós-treinamento refeito do eficiente modelo de mistura de especialistas V4 Flash da DeepSeek — 284B de parâmetros totais / 13B de parâmetros ativos, idêntico em arquitetura e tamanho ao lançamento do V4 Flash de abril, com o pós-treinamento refeito do zero. Ele atende a uma janela de contexto de 1M de tokens com até 384K tokens de saída, suporta modos de raciocínio e não raciocínio (raciocínio ativado por padrão), além de saída JSON e chamadas de ferramentas, e fala nativamente a API Responses com uma adaptação direcionada para agentes de codificação estilo Codex. A revisão 0731 é um grande avanço em capacidade de agentes, superando até mesmo o DeepSeek V4 Pro Preview nos benchmarks de agentes publicados pela DeepSeek — 82.7 no Terminal Bench 2.1, 76.7 no Cybergym, 70.3 no Toolathlon Verified, 54.4 no DeepSWE e 54.2 no NL2Repo. Na API de primeira parte da DeepSeek, esta revisão é o que o ID de modelo deepseek-v4-flash serve atualmente; o identificador datado lista a mesma revisão para chamadores que a referenciam por data. É uma escolha forte para agentes de codificação, cargas de trabalho de terminal e uso de ferramentas, e pipelines agênticos de alto volume com custo de nível flash.
DeepSeek V4 Flash 0731 é um modelo de linguagem somente de texto do provedor deepseek, disponível através da OrcaRouter no ID de modelo deepseek/deepseek-v4-flash-0731. Suas principais especificações…
A entrada é limitada a texto. A janela de contexto é de 1.048.576 tokens, e a saída máxima é de 384.000 tokens por resposta. Esse é um espaço de trabalho grande: você pode ler cerca de um milhão de tokens de conteúdo antes de gerar, e pode solicitar até 384.000 tokens de saída em uma única chamada. A ficha do modelo lista esses como dois limites separados; ela não informa um limite combinado para uma solicitação que use ambos os valores próximos do máximo. Na prática, para permanecer dentro dos limites, conte seus tokens antes do envio e defina max_tokens abaixo do limite de saída. A restrição de somente texto também significa que você deve converter PDFs, planilhas e outros documentos em texto simples primeiro. A tokenização não está especificada nos fatos disponíveis, então teste conteúdo representativo para ver quão grandes seus prompts ficam. Se sua solicitação exceder 1.048.576 tokens de entrada, a chamada de API falhará; o mesmo se aplica a saídas acima de 384.000 tokens.
Dadas as especificações listadas, o modelo é mais adequado para tarefas que combinam entradas de texto longas, saídas de texto longas e raciocínio agêntico orientado a terminal. A pontuação de 82.7 no Terminal Bench 2.1 é evidência de robustez na conclusão de tarefas de linha de comando, onde um modelo lê a saída do shell e decide o próximo comando. O contexto de 1,048,576 tokens suporta análise de repositório inteiro, revisão de código multi-arquivo, documentos legais ou técnicos extensos e históricos de chat extensos. A saída de 384,000 tokens suporta a geração de documentos estruturados longos, conjuntos de dados sintéticos ou análises passo a passo em uma única passagem. O preço por token de $0.15 para entrada e $0.29 para saída por milhão de tokens torna o processamento de texto em alto volume financeiramente previsível. O modelo é menos adequado quando você precisa de compreensão de imagens, transcrição de áudio ou latência muito baixa, nenhuma das quais é coberta pelos fatos fornecidos. Se a sua tarefa se enquadra no perfil somente texto, contexto amplo e saída ampla, este é um candidato razoável para avaliar por meio do OrcaRouter.
O modelo não pode aceitar entradas não textuais; não há modalidade de visão, áudio ou vídeo em sua entrada no catálogo. Ele também não possui garantias publicadas de latência ou streaming nos fatos disponíveis. Você deve escolher um modelo mais barato quando sua carga de trabalho não precisar dos grandes limites de contexto ou de saída. Por exemplo, uma troca curta de mensagens de chatbot que use alguns milhares de tokens ainda seria cobrada pela mesma taxa por token, mas poderia ser melhor atendida por um modelo com contexto menor e preço mais baixo por milhão de tokens. Os fatos disponíveis não listam preços para alternativas, então compare as taxas por 1M de tokens no catálogo do OrcaRouter. Se sua tarefa for classificação simples ou sumarização de passagens curtas, um modelo mais barato pode ser suficiente. Se sua tarefa precisar do contexto completo de 1M ou da saída de 384K, ou se beneficiar da força do Terminal Bench 2.1 em trabalhos de linha de comando, então o preço deste modelo é a base relevante para avaliação.
Todos os dados de entrada têm de ser texto. PDFs, imagens, folhas de cálculo e ficheiros de áudio têm de ser convertidos para texto simples ou transcritos antes de poderem ser enviados. Esse é um passo de pré-processamento necessário, mas também simplifica o formato do pedido: campos de conteúdo padrão no estilo OpenAI contendo strings são tudo o que precisa. O contexto de 1.048.576 tokens significa que pode passar longos corpos de texto convertido num único pedido; a saída de 384.000 tokens significa que pode receber texto muito longo de volta. A contagem de tokens é a principal preocupação operacional, uma vez que a fatura total depende dos tokens de entrada e de saída. O OrcaRouter reporta a utilização na resposta compatível com OpenAI, permitindo-lhe monitorizar ambos os números. Se estiver a trabalhar com linguagens ou código que tokenizem de forma ineficiente, o seu contexto efetivo diminuirá porque a contagem de tokens, e não de caracteres, é o limite vinculativo. Não são fornecidos detalhes do tokenizador, por isso execute um teste rápido com o seu próprio conteúdo para conhecer os comprimentos típicos dos tokens.
O Terminal Bench 2.1 avalia a capacidade de um modelo de trabalhar em um ambiente de terminal: entender a saída de comandos, navegar por diretórios, executar comandos e concluir tarefas realistas de administração de sistemas ou engenharia de software por meio de um shell. A pontuação principal do DeepSeek V4 Flash 0731 é 82,7, em uma escala em que valores mais altos são melhores. Este é o único resultado de benchmark fornecido nos fatos disponíveis. A pontuação é um sinal útil se você planeja construir loops de agente que emitem comandos de shell, já que o benchmark foi projetado para testar exatamente esse tipo de capacidade. Não é uma medida de conhecimento geral, escrita criativa, matemática ou competência multilíngue. Não há linhas de base de comparação nem outros números de benchmark fornecidos; portanto, o 82,7 deve ser interpretado no contexto: forte evidência para tarefas relacionadas a terminal e nenhuma evidência a favor ou contra para outros domínios. As pontuações de benchmark dependem da distribuição exata das tarefas; portanto, suas próprias tarefas de terminal podem apresentar pontuações diferentes; valide com sua própria avaliação antes do uso em produção.
Os fatos disponíveis para o DeepSeek V4 Flash 0731 não incluem tokens por segundo, tempo até o primeiro token, latência p95 ou throughput. O nome Flash sugere uma variante mais leve, mas os fatos fornecidos não quantificam a velocidade. O que os fatos incluem é uma grande janela de contexto de 1.048.576 tokens e um grande limite de saída de 384.000 tokens. Entradas e saídas mais longas consomem inerentemente mais computação, portanto, a latência em solicitações de contexto completo provavelmente será maior do que em prompts curtos, mesmo para um modelo rápido. O preço de US$ 0,15/US$ 0,29 por milhão de tokens descreve o custo, não a velocidade. Para tomar uma decisão informada, execute seu próprio teste de carga na API do OrcaRouter com prompts representativos do tamanho que você pretende usar e compare o tempo até o primeiro token e a duração total com outros modelos do catálogo. Não extrapole a latência a partir da pontuação do benchmark, que não mede o tempo de resposta.
As principais limitações são visíveis a partir dos fatos listados. Ele é somente texto, portanto qualquer entrada multimodal está fora do escopo. A evidência de benchmark é limitada a uma pontuação, 82,7 no Terminal Bench 2.1, que cobre a conclusão de tarefas baseadas em terminal, não raciocínio geral ou conhecimento. Nenhuma métrica de latência, disponibilidade ou taxa de erro foi publicada, portanto o desempenho sob carga é desconhecido. Os limites de contexto e de saída são grandes, mas finitos: 1.048.576 tokens de entrada e 384.000 tokens de saída por solicitação. Solicitações que excederem esses limites não terão sucesso. Não há desconto documentado de cache de prompt nos fatos fornecidos, portanto prefixos repetidos são cobrados como tokens de entrada comuns. O preço é baixo por token, mas os custos absolutos crescem linearmente com o tamanho do contexto. Se a sua aplicação precisar de visão, baixa latência ou throughput muito alto, este modelo pode não ser o ideal; verifique esses requisitos separadamente antes de se comprometer.
Os custos são calculados por token, com uma taxa para entrada e outra para saída. Tokens de entrada custam US$ 0,15 por 1.000.000 de tokens; tokens de saída custam US$ 0,29 por 1.000.000 de tokens. O OrcaRouter cobra essas tarifas pelo valor do provedor, sem markup, o que significa que nenhuma porcentagem adicional da plataforma é acrescentada sobre a taxa da deepseek. O custo de uma única solicitação é de aproximadamente: tokens de entrada × US$ 0,15 ÷ 1.000.000, mais tokens de saída × US$ 0,29 ÷ 1.000.000. Por exemplo, uma entrada completa de 1.048.576 tokens custa cerca de US$ 0,1573, e uma saída de comprimento máximo de 384.000 tokens custa cerca de US$ 0,1114, se ambos os limites fossem usados em transações separadas. Os fatos disponíveis não mencionam preço com desconto para entrada em cache; portanto, considere que cada token de entrada é cobrado pela taxa padrão. Como a precificação é linear, a estimativa do custo por lote é direta quando você sabe o tamanho médio do prompt e o comprimento da saída.
A principal troca é entre tamanho do contexto e preço. A US$ 0,15 por 1M de tokens de entrada, um prompt que usa o contexto completo de 1.048.576 tokens custa cerca de US$ 0,157 apenas em taxas de entrada. Se a sua tarefa precisa apenas de alguns milhares de tokens de contexto, você está pagando por capacidade não utilizada, no sentido de que um modelo com contexto menor e preço por token mais baixo pode ser mais barato, dependendo das tarifas dele. A taxa de saída de US$ 0,29 por 1M significa que saídas longas não são especialmente caras individualmente, mas uma carga de trabalho que gera gigabytes de texto acumulará custos. Não há desconto por lote, reserva ou desconto por cache listados nos fatos fornecidos. A cobrança sem margem de lucro da OrcaRouter significa que o preço que você vê é o preço do provedor; sua fatura final é simplesmente uma função dos tokens enviados e recebidos. Para trabalhos em lote de grande escala, estime o total de tokens de entrada e saída, multiplique pelas duas taxas e compare com as alternativas no catálogo.
A OrcaRouter cobra explicitamente o DeepSeek V4 Flash 0731 pela taxa do provedor, sem qualquer margem de lucro. Os US$ 0,15 por 1M de tokens de entrada e US$ 0,29 por 1M de tokens de saída são as taxas do provedor, não uma versão com margem. Os fatos fornecidos não descrevem cache de prompt para este modelo. Nenhum nível de preço para entrada em cache é listado, e não há declaração de que a OrcaRouter armazena prompts em cache automaticamente em seu nome. Se o provedor subjacente oferecer cache, os termos não fazem parte do que foi fornecido para esta entrada de catálogo, portanto, você deve consultar a documentação atual da OrcaRouter antes de presumir um desconto. A resposta da API, por seguir o formato de chat completions da OpenAI, inclui informações de uso que permitem verificar os tokens de entrada e saída cobrados. Para fins de auditoria, registre o objeto de uso de cada resposta e compare-o com suas contagens de tokens esperadas. Qualquer controle de custo deve vir de suas próprias escolhas de prompt e parâmetros.
Envie solicitações padrão de conclusão de chat para a API compatível com OpenAI da OrcaRouter. A URL base é https://api.orcarouter.ai/v1, e o ID do modelo é deepseek/deepseek-v4-flash-0731. Defina o campo model para essa string exata e coloque sua chave de API da OrcaRouter no cabeçalho Authorization como um token bearer. Monte um array messages com conteúdo de texto; o modelo não aceitará conteúdo de imagem ou áudio. A resposta é formatada como uma conclusão de chat da OpenAI e inclui a mensagem gerada e um objeto usage. Como o ID do modelo inclui um prefixo de provedor, mantenha-o exatamente como mostrado. Os fatos disponíveis não exigem cabeçalhos não padrão nem configurações especiais de transporte. Você pode usar os SDKs da OpenAI, curl ou qualquer cliente HTTP que fale JSON. Comece com uma solicitação pequena, verifique se o usage retornado corresponde às contagens esperadas de tokens de entrada e saída e depois aumente a escala.
Como o endpoint é compatível com OpenAI, os parâmetros típicos de chat completion estão disponíveis: model, messages, temperature, top_p, max_tokens ou max_completion_tokens, stop, stream e opções semelhantes suportadas pelo SDK que você usa. Os fatos disponíveis não enumeram quais parâmetros o OrcaRouter honra para este modelo específico, então você deve testar qualquer coisa além de model e messages. Os limites cruciais são os do próprio modelo: 1.048.576 tokens de entrada e 384.000 tokens de saída. Mantenha max_tokens abaixo do teto de saída para evitar solicitações com falha. Para chamada de ferramentas ou funções, os fatos não declaram suporte; teste uma definição mínima de ferramenta antes de construir um agente. Para controle do formato de saída, não há menção a modo JSON ou garantias de saída estruturada; valide o texto gerado por conta própria se precisar de estrutura confiável. O streaming é comumente suportado em endpoints compatíveis com OpenAI, mas os fatos não o confirmam para este modelo, então consulte a referência da API do OrcaRouter.
A migração é, em grande parte, configuração: altere a URL base para https://api.orcarouter.ai/v1, troque a chave de API pela sua chave OrcaRouter e substitua o nome do modelo por deepseek/deepseek-v4-flash-0731. O código que já constrói mensagens, processa respostas de chat completion e lê dados de uso continuará funcionando, desde que siga a convenção da OpenAI. Duas diferenças exigem atenção. Primeiro, este modelo é somente texto, então remova quaisquer campos image_url ou audio das suas requisições. Segundo, os limites de contexto e de saída são muito grandes; ajuste sua configuração de max_tokens para respeitar o teto de saída de 384.000 tokens e esteja preparado para respostas ocasionalmente longas. Se o seu código inclui tentativas de repetição (retries) para erros 429 ou 5xx, mantenha-as; os fatos não mudam as expectativas de tratamento de erros. Execute um smoke test com um prompt pequeno, confirme se a cobrança aparece em $0.15/$0.29 por milhão de tokens e, em seguida, migre o tráfego gradualmente.
A URL base da API do OrcaRouter é https://api.orcarouter.ai/v1. Todas as solicitações para esse endpoint devem usar HTTPS. A autenticação é feita por chave de API, enviada como um token bearer padrão no cabeçalho Authorization. Os fatos disponíveis não listam métodos de autenticação alternativos. O ID do modelo é deepseek/deepseek-v4-flash-0731, que inclui o nome do provedor e o sufixo do snapshot 0731; passe-o exatamente como escrito. Na maioria dos SDKs compatíveis com OpenAI, você configura um cliente com base_url e api_key e define o nome do modelo em cada chamada. A resposta incluirá contagens de tokens relevantes para cobrança no objeto usage. Os fatos não informam limites de taxa, comportamento de nova tentativa ou orientações de timeout; portanto, consulte a documentação do OrcaRouter para esses detalhes operacionais. Armazene sua chave de API com segurança; a chave determina o acesso a todas as contas de modelo no seu projeto OrcaRouter. Se você usar um proxy ou gateway, aponte-o para a URL base do OrcaRouter e preserve o ID completo do modelo.
Os fatos fornecidos cobrem apenas este instantâneo específico, portanto não é possível fazer uma comparação numérica linha por linha com outras entradas do DeepSeek com base no que foi apresentado. O que sabemos sobre o DeepSeek V4 Flash 0731 é seu contexto de 1.048.576 tokens, limite de saída de 384.000 tokens, entrada somente de texto, preço de US$ 0,15/US$ 0,29 por 1 milhão de tokens e pontuação de 82,7 no Terminal Bench 2.1. Outros modelos DeepSeek no catálogo do OrcaRouter podem diferir em qualquer um desses eixos. Ao decidir, compare as especificações que importam: quantos tokens seus prompts realmente usam, quantos tokens suas saídas exigem, se você precisa de entrada multimodal e o preço por 1 milhão de tokens do candidato. O rótulo Flash sugere uma variante mais enxuta em relação a outros lançamentos do DeepSeek, mas o único indicador objetivo de desempenho nos fatos é a pontuação do Terminal Bench. Use as páginas de listagem do catálogo do OrcaRouter para ver as especificações lado a lado e os preços atuais antes de selecionar.
Com 1,048,576 tokens de contexto, este modelo está no nível de contexto longo. Um modelo com contexto menor pode ter um limite de algumas centenas de milhares de tokens ou menos, forçando você a dividir documentos, incorporar trechos ou usar recuperação. A vantagem deste modelo é que você pode colocar um corpus muito grande em um único prompt e deixar o modelo processar tudo isso em uma única passada. A desvantagem é o custo por solicitação: cada token de entrada é cobrado, então um contexto enorme multiplica o gasto de entrada. Os fatos não listam nenhum modelo com janela de contexto ainda maior, então as únicas afirmações seguras são sobre os limites do próprio modelo. Ao escolher, estime os tamanhos reais dos seus prompts. Se suas tarefas normalmente usam menos de 100 mil tokens, o contexto completo pode ser irrelevante e um modelo mais barato e menor pode ser preferível. Se você excede regularmente os limites comuns de contexto, a janela de 1 milhão de tokens deste modelo é o recurso decisivo.
Escolha o DeepSeek V4 Flash 0731 quando a tarefa for somente texto e você puder explorar suas especificações. O contexto de 1.048.576 tokens justifica a seleção quando você precisa ler um repositório inteiro, um conjunto de documentos ou uma transcrição longa em uma única passada. O limite de saída de 384.000 tokens justifica a seleção quando você precisa de respostas geradas muito longas sem múltiplas idas e voltas. A pontuação de 82,7 no Terminal Bench 2.1 justifica a seleção para automação de terminal e fluxos de trabalho de CLI agênticos. O preço de $0.15/$0.29 por 1 milhão de tokens justifica a seleção para processamento de texto em lote de alto volume, onde o custo por token domina. Não o escolha quando precisar de imagens ou áudio, quando suas necessidades de contexto forem pequenas e existir um modelo mais barato, ou quando não puder aceitar características de latência desconhecidas. Os fatos disponíveis não oferecem garantias de latência, portanto equipes sensíveis a desempenho devem fazer benchmark com prompts reais primeiro. Em todos os casos, confirme o ID do modelo e o faturamento no OrcaRouter antes de escalar.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Entrada / 1M tokens | $0.147 |
| Saída / 1M tokens | $0.295 |
| Leitura de cache / 1M | $0.020 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/deepseek/deepseek-v4-flash-0731Abrir @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731