
Benchmarks do DeepSeek V4.1 Flash: O que 74,2 prova e o que não prova
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O DeepSeek V4.1 Flash marcou 74,2 no DeepSWE v1.1, um décimo de ponto acima do GPT-6 Astra, meio ponto acima do Gemini 3.8 Flash e do Claude Opus 5, e o número tem sido citado a semana toda como uma troca de guarda. Vale a pena ser preciso sobre o que ele de fato é. O modelo em si não é novo — o DeepSeek V4.1 Flash ficou disponível para o público em 2026-09-10, há seis dias —, então nada aqui é um lançamento. O que chegou dentro dessa janela é a camada de medição: as primeiras entradas independentes de índice, o primeiro resultado independente de arena, suporte de serving no day 0 em três stacks e a decisão de um fornecedor de aposentar seu próprio carro-chefe em favor deste. Esta página é um resumo do que foi realmente medido, com a fonte indicada para cada número, e uma declaração clara do que ninguém estabeleceu ainda.
O número DeepSWE, e os quatro modelos dentro de meio ponto dele
DeepSWE v1.1 é um benchmark de engenharia de software de longo horizonte da Datacurve — 113 tarefas originais em 91 repositórios de código aberto e cinco linguagens de programação, criado em torno de alterações em vários arquivos e da correção comportamental. No model card da própria DeepSeek, a tabela divulgada pelo fornecedor apresenta: DeepSeek V4.1 Flash 74,2, Claude Opus 5 74,0, GPT-5.6 Sol 73,0, Kimi K3 67,5, GLM-5.3 66,9, DeepSeek V4-Pro-0813 62,7, DeepSeek V4-Flash 54,4.
O ranking independente para o mesmo benchmark não reproduz essa ordenação, e as diferenças importam mais do que a manchete. O ranking Pass@1 do DeepSWE v1.1 da Datacurve coloca o Muse Spark 1.3 (FAIR) em primeiro lugar, com 75,40, à frente do DeepSeek V4.1 Flash, com 74,20. Logo atrás: GPT-6 Astra, com 74,12 (extra alto) e 74,10 (máx.), Gemini 3.8 Flash, com 73,83 (alto), Claude Opus 5, com 73,65 (máx.).
Então, o 74,2 é uma entrada real em um placar de terceiros real, e está em segundo, não em primeiro. A afirmação que circulou no dia do lançamento — de que este é o estado da arte no DeepSWE — não resiste ao contato com o placar que carrega a pontuação. Muse Spark 1.3 está 1,2 pontos à frente.
Agora, a parte que costuma ser ignorada. Quatro modelos de ponta ficam dentro de 0,55 ponto uns dos outros neste benchmark: 74,20, 74,12, 73,83, 73,65. É uma faixa mais estreita que o ruído de medição. A variação publicada entre execuções no DeepSWE é da ordem de 1,4 a 3,2 pontos — três a seis vezes o tamanho de toda a dispersão do top quatro. Uma vantagem de 0,2 ponto sobre o GPT-6 Astra não é um achado; é a aparência de um empate quando você o imprime com duas casas decimais.
A sensibilidade ao scaffold é a segunda razão para relativizar o número, e aqui a própria documentação do fornecedor apresenta as evidências. A DeepSeek relata o DeepSWE em oito scaffolds nos mesmos materiais de lançamento. O 74,2 foi alcançado no mini-SWE. O mesmo modelo obteve 72,6 no DSH Minimal, 70,5 no DSH Standard, 69,8 no Claude Code, 67,6 no DSH PTC, 66,2 no Pi, 65,6 no Codex e 65,5 no OpenCode. Isso é uma variação de 8,7 pontos em um único modelo e um único benchmark, causada puramente pelo harness que o envolve. Qualquer pessoa que compare um número da DeepSeek produzido no mini-SWE com o número de um rival produzido em um loop de agente diferente está comparando scaffolds, não modelos.
Onde o índice independente realmente o posiciona
A Artificial Analysis executa uma suíte fixa com configurações de esforço declaradas, o que torna o seu Intelligence Index a verificação externa mais limpa disponível. Na página do modelo DeepSeek V4.1 Flash, no esforço máximo de raciocínio, o índice marca 40 — classificado em #6 entre 113 modelos nessa classe, contra uma mediana da classe de 18. Os rivais de código fechado ficam acima dele: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. O antigo carro-chefe da própria DeepSeek, V4-Pro-0813, fica abaixo, com 36.
Leia os dois placares lado a lado e a divergência é estrutural, não um erro. No benchmark escolhido pela DeepSeek, com o scaffold certo, o modelo empata com a fronteira. Numa suíte externa fixa com média entre raciocínio, programação, matemática e trabalho agêntico, ele fica onze pontos atrás do Claude Opus 5 e um ponto atrás do Gemini 3.8 Flash. As duas coisas podem ser verdade. Uma tabela de fornecedor é um argumento; um índice é uma média.
A página de índice também traz dois números que importam para uma decisão de roteamento e raramente aparecem nas manchetes. O DeepSeek V4.1 Flash opera a 214,4 tokens de saída por segundo no esforço máximo — rápido. Ele também gerou 250M tokens de saída ao completar o Intelligence Index, contra uma mediana de 140M, o que a Artificial Analysis sinaliza como marcadamente verboso. A verbosidade não é um problema de qualidade; é uma conta. Um modelo que pensa em 79% mais tokens do que seus pares devolve parte de sua vantagem de preço em cada chamada longa de raciocínio.

ProgramBench: uma pontuação de modelo único e uma pontuação multiagente não são a mesma medição
Este é o número com maior probabilidade de ser mal lido, por isso vale a pena separá-lo cuidadosamente.
• Modelo único, configuração padrão — O DeepSeek V4.1 Flash pontua 20,3 no ProgramBench (Almost@1), de acordo com a própria ficha técnica do modelo da DeepSeek. Isso está abaixo do GPT-5.6 Sol, com 23,0, e muito abaixo do Claude Opus 5, com 37,0, e apenas um pouco acima do GLM-5.3, com 19,0, e do Kimi K3, com 17,5. Divulgado pelo fornecedor, e não favorece o modelo.
• Configuração de equipe multiagente — relatório técnico da DeepSeek, DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression, descreve uma receita preliminar de Agent Swarm RL na qual um agente líder coordena colegas de equipe em um quadro de tarefas compartilhado. Em um subconjunto de alta confiança do ProgramBench com 172 tarefas — tarefas nas quais a solução de referência passa com 95% ou mais — a configuração multiagente sobe de 13,59% em um prazo de uma hora para um pico de 30,04% em oito horas, enquanto a linha de base de agente único passa de 12,79% para 20,39%.
Os 30,04% são a fonte da alegação de "30%", e não se trata de uma pontuação de modelo único. Trata-se de uma equipe de agentes com oito horas, medida em um subconjunto filtrado, na própria avaliação preliminar do fornecedor. A comparação que isso sugere — "bem acima do Sol sozinho, quase 2x o Kimi K3" — é aritmeticamente justa em relação aos 23,0 do Sol e aos 17,5 do K3, e também é uma comparação entre uma configuração multiagente e baselines de modelo único em um conjunto de tarefas diferente. O mesmo relatório mostra o efeito no FrontierSWE v2: o multiagente alcançando 32,90% em vinte horas contra 28,20% de agente único. A diferença é real, ela diminui conforme o prazo se estende, e o custo em tokens para obtê-la não é pequeno — um relato prático informa mais de 10x os tokens e tempos de execução se aproximando de quatro horas.
A contagem de parâmetros não está definida, portanto trate toda comparação de tamanho como provisória
As notas de lançamento da DeepSeek descrevem um "MoE de 552B parâmetros". Esse é o número do fornecedor, e é o que a maior parte da cobertura repete. Ele também não é o artefato completo.
A própria ficha do modelo da DeepSeek documenta um segundo componente ao lado do backbone transformer: "memória condicional Engram (196B de parâmetros, acessada de forma esparsa por meio de busca baseada em tokens)". Somando os dois, chega-se a 748B. Essa é a aritmética por trás da leitura da comunidade que circulou no r/LocalLLaMA poucas horas após o lançamento, e o próprio índice safetensors da ficha do modelo lista 763B de parâmetros entre seus tipos de tensor. O valor de aproximadamente 510 GB em FP8 vem da mesma linhagem de análise: o que você realmente baixa e mantém na memória.
A reconciliação é que esses números contam coisas diferentes. 552B é a espinha dorsal computacional — os parâmetros pelos quais um token passa. 196B é uma tabela de consulta acessada em camadas específicas que retorna informações armazenadas, em vez de computá-las. 8B e 16B, os números de ativação citados pela DeepSeek, são as fatias por token ativas durante o prefill e o decode, respectivamente. Todos os quatro números descrevem o mesmo modelo.
Nada disso torna a comparação segura. Toda afirmação do tipo “este modelo iguala um modelo de fronteira com uma fração do tamanho” apoia-se em uma manchete de fornecedor que exclui um quinto do artefato. Até que alguém publique uma contabilização reproduzível de parâmetros, argumentos baseados em tamanho devem trazer a ressalva embutida.
ARC-AGI: nenhum resultado para este modelo
Não há pontuação de ARC-AGI-2 nem de ARC-AGI-1 para o DeepSeek V4.1 Flash. A página de resultados verificados do ARC Prize não contém nenhuma entrada para este checkpoint, e a própria tabela de benchmarks da DeepSeek não tem nenhuma linha de ARC. O único resultado da DeepSeek verificado pelo ARC Prize é do checkpoint mais antigo V4 Flash 0731 — 61,4% no ARC-AGI-2 semiprivado com esforço máximo de raciocínio e 89,0% no ARC-AGI-1, a US$ 0,04 e US$ 0,02 por tarefa, respectivamente. Esses são os números do predecessor em um modelo diferente, e citá-los como resultados do V4.1 Flash seria incorreto. Se o ARC-AGI importa para sua avaliação, este modelo está atualmente sem pontuação.
O que mais aterrissou dentro da janela
Três coisas mudaram para um leitor que está decidindo se deve experimentar este modelo, e nenhuma delas é o próprio lançamento do modelo.
• Resultado independente da arena. A OpenDesign Arena submeteu treze modelos às mesmas tarefas de design — aplicativos web, painéis, telas móveis, páginas de destino. O DeepSeek V4.1 Flash pontuou 81,2 de 100, contra 82,7 do GPT-6 Astra, a US$ 0,023 por design finalizado, contra US$ 1,61, e terminou em 5,3 minutos, contra 11,1. A taxa de entrega — resultados utilizáveis sem revisão — foi de 57,7%, contra os 60% da Astra. Esta é uma das primeiras medições genuinamente independentes do modelo, e mede especificamente a produção de design, não o raciocínio geral nem a programação.
• Suporte de serving Day-0 em três stacks. A vLLM publicou uma imagem Day-0 (2026-09-09) validada em hardware NVIDIA e AMD. A SGLang e a Miles publicaram suporte Day-0 de inferência e RL em 2026-09-10, incluindo um caminho de offload para host do Engram que aumentou a capacidade do cache KV em 36% em 4x GB300 e uma otimização de replay limitado que elevou o throughput de prefill em 1,56x em 8x H200. A Cambricon anunciou adaptação Day-0 no stack vLLM no mesmo dia. Para um modelo cujo argumento de venda é a compressão agressiva de cache KV — um quarto da pegada de HBM da geração anterior, um oitavo do seu SSD — ser executável em stacks padrão desde o primeiro dia é a diferença entre um resultado de laboratório e algo que você pode implantar.
• O fornecedor aposentou seu próprio carro-chefe.O DeepSeek está desativando gradualmente o V4-Pro. A partir das 04:00 UTC de 2026-09-14, qualquer requisição que nomeie “deepseek-v4-pro” é encaminhada para o V4.1 Flash e cobrada com as tarifas do Flash, continuando até que um V4.1 Pro seja lançado. O DeepSeek V4.1 Pro não foi lançado — é um modelo futuro, e o redirecionamento é uma solução provisória que evita que integrações fixadas quebrem. Também aposentados: “deepseek-v4-flash” e “deepseek-v4-flash-vision-exp”, ambos temporariamente encaminhados para o V4.1 Flash por compatibilidade. Se você tem um ID de modelo fixado em produção, esse redirecionamento é o único fato operacional nesta página que você não pode ignorar.
O que o preço faz à decisão
A precificação é o ponto em que este modelo deixa de ser uma história de benchmark. Segundo as próprias tarifas publicadas da DeepSeek, em vigor a partir de 04:00 UTC de 2026-09-10, com horários de pico definidos como 01:00–04:00 e 06:00–10:00 UTC em dias úteis, e todo o restante como fora de pico.
• Fora de pico, por milhão de tokens — $0.003 acerto de cache, $0.15 falha de cache, $0.60 de saída.
• Pico, por milhão de tokens — $0,006 por acerto de cache, $0,30 por falha de cache, $1,20 de saída.
• Entrada em cache, comparada a um modelo fechado de fronteira — três décimos de centavo por milhão contra cerca de cinquenta centavos. Para um agente em loop sobre o mesmo repositório, esse nível carrega a maior parte dos tokens.
• Medido no nosso próprio catálogo — $0,15 de entrada e $0,60 de saída por milhão, 784 ms de tempo mediano até o primeiro token, 211 tokens por segundo nos últimos sete dias.
A Artificial Analysis lista o mesmo modelo a US$ 0,30 de entrada e US$ 1,20 de saída, com 98% de desconto de cache e um valor combinado de US$ 0,18 por milhão — esse é o nível de pico, e os dois números são o mesmo preço em horários diferentes do dia. Vale a pena internalizar essa distinção antes de comparar fornecedores: um modelo com dois níveis de preço por horário não pode ser comparado com base em uma única tarifa anunciada.
É também por isso que o preço de repasse importa mais do que o habitual aqui. OrcaRouter encaminha o DeepSeek V4.1 Flash juntamente com o resto do seu catálogo a 0% de margem — preço de tabela do fornecedor, inalterado, pelo que os escalões de pico e fora de pico da DeepSeek chegam do nosso lado exatamente como a DeepSeek os publica, e uma alteração de preço do fornecedor entra em vigor no mesmo dia. Num modelo cuja tarifa duplica durante quatro horas todas as manhãs de dias úteis, uma plataforma que nivela os escalões está a esconder o único número de que precisavas.


O que ninguém estabeleceu
A lacuna nesta história não é um benchmark ausente. É que não existe nenhum confronto direto credível entre o DeepSeek V4.1 Flash e seus rivais nomeados em um harness compartilhado, executado por alguém sem interesse no resultado. Todo número nesta página é uma de três coisas: relatado pelo fornecedor, produzido por terceiros em uma configuração diferente, ou uma média em uma suíte fixa que não foi projetada para isolar esse confronto. Não há nenhuma execução em que o DeepSeek V4.1 Flash e o GPT-6 Astra tenham sido avaliados nas mesmas tarefas, com o mesmo scaffold, a mesma configuração de esforço, publicada com variância.
Três coisas específicas mudariam o cenário, e nenhuma delas existe hoje.
• Uma comparação DeepSWE controlada por scaffold. A diferença de 8,7 pontos entre os próprios scaffolds da DeepSeek é maior do que qualquer lacuna entre os quatro modelos principais do leaderboard. Enquanto a fronteira não for medida em um único harness, a ordenação no topo dessa tabela não é significativa.
• Uma reprodução independente do resultado da equipe de agentes do ProgramBench. Os 30,04% vêm do relatório técnico do fornecedor sobre um subconjunto filtrado de 172 tarefas, numa configuração preliminar, com um custo de tokens que não foi caracterizado para orçamentos de produção.
• ARC-AGI. Não existe absolutamente nenhuma pontuação para este checkpoint.
A consequência prática é uma afirmação mais restrita do que as manchetes sugerem. O DeepSeek V4.1 Flash está mensuravelmente dentro da margem de ruído em relação à fronteira em um benchmark de programação de longo horizonte, é genuinamente competitivo em tarefas independentes de design a cerca de 1,4% do custo e está cerca de dez pontos atrás em um índice agregado. Isso basta para justificar executá-lo em sua própria carga de trabalho e deixar sua avaliação decidir a questão. Não basta para justificar reescrever uma tabela de roteamento de produção com base em 0,2 ponto — e o fato de que ambas as afirmações são verdadeiras é o achado por inteiro.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
