DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NovoDestaque
VisãoFerramentasJSONRaciocínio
por DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash é o menor modelo da nova família de arquitetura da DeepSeek, lançado em 10 de setembro de 2026, com compreensão visual multimodal nativa — o sucessor de produção tanto do V4 Flash quanto do experimento V4 Flash Vision. A nova arquitetura visa um teto de capacidade mais alto, inferência mais rápida e maior throughput, e a DeepSeek relata que o V4.1 Flash supera abrangentemente o V4 Pro em desempenho, custo, velocidade e tempo total de tarefa. Ele aceita texto e imagens com saída de texto, atende a uma janela de contexto de 1M de tokens com até 384K tokens de saída, e suporta modos de pensamento (padrão, com esforço selecionável baixo / alto / máximo) e não-pensamento nas APIs Chat Completions, Responses e compatível com Anthropic, além de saída JSON, chamadas de ferramentas e prefix completion de chat; FIM funciona apenas no modo não-pensamento. Os pesos do modelo são abertos no Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Benchmarks oficiais no lançamento: 90,6 no Terminal-Bench 2.1, 74,2 no DeepSWE v1.1, 65,4 no NL2Repo-Bench, 90,9 no GPQA Diamond, 63,9 no HLE com ferramentas, e fortes resultados de agente com visão nativa (89,6 BabyVision, 78,9 Chartography com ferramentas). Os preços foram reduzidos junto com o lançamento: US$ 0,15/M de entrada (cache miss), US$ 0,60/M de saída e US$ 0,003/M em cache hits nas tarifas fora de pico, dobrando durante os horários de pico da semana (01:00-04:00 e 06:00-10:00 UTC); todos os outros horários, incluindo fins de semana, são fora de pico.

ctx1M tokens
Saída máx.384K
Entradatext + image
Saídatext
p50 TTFT410 ms
ENTRADA$0.15/ 1M tokens
SAÍDA$0.60/ 1M tokens
p50 TTFT410 ms7 d
p95 TTFT1.57 s7 d
TRÁFEGO280.6Mtokens / 7 d

O DeepSeek V4.1 Flash é um modelo DeepSeek disponível por meio do OrcaRouter, o gateway de API compatível com a OpenAI. Ele aceita entrada de texto e imagem, possui uma janela de contexto de…

O que é o DeepSeek V4.1 Flash?

Para quem o DeepSeek V4.1 Flash foi criado?

Por que a janela de contexto de 1,048,576 tokens importa?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Preços

Preços
Entrada / 1M tokens · Fora de pico$0.150
Saída / 1M tokens · Fora de pico$0.600
Leitura de cache / 1M · Fora de pico$0.0030
Horário de pico01:00–04:00, 06:00–10:00 ×2 (UTC)
Entrada / 1M tokens · ×2$0.300
Saída / 1M tokens · ×2$1.20
Leitura de cache / 1M · ×2$0.0060
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $2.85 · Com cache de prompt $2.34

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.000302

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
410 ms
Velocidade de saída
215 tok/s
p95 TTFT
1.57 s
Taxa de erro
0.07%

Benchmarks públicos

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Fonte: api-docs.deepseek.com

Atividade da comunidade

Do que os desenvolvedores estão falando esta semana

Hacker News13 menções · 7 d13 a mais que na semana anterior

Comparativo

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Entrada $/M$0.15$0.73$0.24$0.24
Saída $/M$0.60$2.18$0.73$0.73
Contexto1.0M1.0M1.0M1.0M
Qualidade8/108/107/107/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Quanto custa o DeepSeek V4.1 Flash no OrcaRouter?
OrcaRouter cobra pelo DeepSeek V4.1 Flash US$ 0,15 por 1 milhão de tokens de entrada e US$ 0,60 por 1 milhão de tokens de saída, repassados à tarifa do provedor sem nenhuma margem. Não há cobrança separada descrita para a janela de contexto em si: 1.048.576 tokens é um limite, não uma taxa. Os tokens de entrada incluem texto, imagens e o histórico de conversa que você envia; os tokens de saída cobrem tudo o que for gerado, até 384.000 tokens.
Qual é o tamanho da janela de contexto e da saída máxima?
O DeepSeek V4.1 Flash tem uma janela de contexto de 1.048.576 tokens e uma saída máxima de 384.000 tokens. A janela de entrada permite enviar documentos completos, transcrições ou snapshots de repositório em uma única chamada, enquanto o teto de saída suporta artefatos longos de passagem única, como especificações, planos de migração ou diffs estendidos.
Em que o DeepSeek V4.1 Flash é melhor?
Ele foi criado para trabalhos com entradas longas e saídas longas: análise de documentos inteiros, compreensão de código de grandes repositórios, revisão multimodal de texto e imagens e fluxos de trabalho que exigem respostas geradas substanciais em vez de respostas curtas. Sua pontuação de 90,9 no GPQA Diamond também indica sólido raciocínio científico e técnico de nível de pós-graduação. A entrada aceita texto e imagens; a saída é apenas texto.
Como ele se compara a modelos de fronteira maiores?
Os modelos de fronteira podem liderar nos benchmarks de raciocínio mais difíceis e normalmente cobram mais por token, enquanto o DeepSeek V4.1 Flash oferece uma janela de contexto de 1.048.576 tokens e um teto de saída de 384.000 tokens a US$ 0,15 por 1M de tokens de entrada e US$ 0,60 por 1M de tokens de saída. Para trabalhos de contexto longo e alto volume, costuma ser a escolha prática; para as etapas individuais de raciocínio mais difíceis, encaminhar essas chamadas para um modelo mais caro no OrcaRouter é um padrão razoável.
Como os dados são tratados quando eu chamo este modelo?
O OrcaRouter roteia requisições para a API do DeepSeek e cobra a tarifa do provedor sem qualquer markup. Os termos de retenção, uso para treinamento e afins são regidos pelas políticas do provedor, e não por um acordo separado descrito aqui; portanto, confirme os termos atuais do provedor antes de enviar material sensível. Oculte identificadores de que você não precisa e mantenha os prompts no mínimo exigido pela tarefa; um contexto menor também reduz o custo de entrada para US$ 0,15 por 1 milhão de tokens.
Como faço para chamá-lo por meio de uma API compatível com a OpenAI?
Defina o URL base do seu cliente como https://api.orcarouter.ai/v1 e use o id de modelo deepseek/deepseek-v4.1-flash com a sua chave de API do OrcaRouter. Os pedidos e as respostas seguem o esquema de chat completions da OpenAI, pelo que os SDKs existentes, os handlers de streaming e a análise de chamadas de ferramentas funcionam sem alterações. A migração consiste normalmente em alterar o URL base e a string do modelo, além de voltar a executar o seu conjunto de avaliação.
O DeepSeek V4.1 Flash pode aceitar imagens?
Sim. A entrada de imagem é suportada por meio do array de conteúdo multimodal padrão, com partes de texto e imagem na mesma mensagem do usuário. Os tokens de imagem contam como entrada e são cobrados a $0.15 por 1M de tokens de entrada no OrcaRouter. A saída permanece somente texto, então o modelo descreve ou extrai das imagens em vez de gerá-las.
Um 90,9 no GPQA Diamond é suficiente para confiar nele para minha tarefa?
É um sinal útil, não uma garantia. O GPQA Diamond mede raciocínio científico de nível de pós-graduação sob um formato fixo de prompt, o que é relevante para perguntas e respostas técnicas, mas diz pouco sobre recall de contexto longo, tom ou precisão de extração nos seus dados. Monte um pequeno conjunto de avaliação a partir de entradas reais, execute-o contra o DeepSeek V4.1 Flash e quaisquer ids de modelos alternativos no OrcaRouter, e compare custo e qualidade antes de rotear tráfego de produção.

Incorporar este selo

DeepSeek: DeepSeek V4.1 Flash$0.15/M in410ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash no OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Ficha do modelo como dados

GET /api/public/models/deepseek/deepseek-v4.1-flashAbrir
Legível por máquina:/llms.txt/llms-full.txt