Um cartão de destaque gerado, intitulado MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash, com o subtítulo "A mesma janela de 1M de tokens, duas abordagens de venda bem diferentes". Um cartão à esquerda diz "MiniMax M3.1 Flash Preview: contexto de 1M, preço não publicado, somente Token Plan, o raciocínio não pode ser desativado"; um cartão à direita diz "DeepSeek V4 Flash: contexto de 1M, US$ 0,15/US$ 0,60 fora do horário de pico, somente texto, substituído pelo V4.1 Flash". Um rodapé diz "Números da MiniMax conforme platform.minimax.io; números da DeepSeek conforme a tabela de preços publicada pela DeepSeek".
Engineering & Research

MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash: duas entradas baratas para contexto de 1M, um enorme asterisco

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Se você está procurando uma janela de contexto de um milhão de tokens a um preço baixo por token, MiniMax-M3.1-Flash-Preview e DeepSeek V4 Flash são os dois nomes que não param de aparecer — e eles não são realmente o mesmo tipo de produto. DeepSeek V4 Flash é um modelo descontinuado cujo identificador ainda responde, vivendo dentro de uma tabela de preços de fornecedor que você pode ler até o centavo. MiniMax-M3.1-Flash-Preview é uma prévia ao vivo sem nenhum preço publicado. A comparação abaixo, portanto, é em parte uma comparação de especificações e em parte uma demonstração de quão diferentemente esses dois fornecedores estão escolhendo vender a mesma faixa.

Vale a pena enunciar ambos os lados com precisão, porque os números que o decidem estão dispersos por uma página de preços de fornecedor, uma árvore de documentação de fornecedor e o nosso próprio catálogo, e uma das afirmações mais repetidas sobre o DeepSeek V4 Flash — o seu preço — é uma que a DeepSeek já substituiu.

Em que as duas fichas técnicas realmente coincidem

As especificações principais são tão próximas que não chegam a ser o fator decisivo, com uma exceção que ninguém divulga.

• Janela de contexto — 1.000.000 de tokens para MiniMax-M3.1-Flash-Preview contra 1.048.576 para DeepSeek V4 Flash: nominalmente idênticas, uma diferença de 48.576 tokens
• Saída máxima — não publicada para MiniMax-M3.1-Flash-Preview; 384.000 tokens para DeepSeek V4 Flash, o que é incomum nesse preço e é o número que deve decidir muitas compras
• Modalidades de entrada — texto, imagem e vídeo para MiniMax-M3.1-Flash-Preview; apenas texto para DeepSeek V4 Flash
• Raciocínio — um esforço numa escala que vai de baixo a máximo, raciocínio permanentemente ativado, para MiniMax-M3.1-Flash-Preview; raciocínio ou modo sem raciocínio no DeepSeek V4 Flash, com o modo sem raciocínio como uma opção real
• Suporte a protocolos — endpoints compatíveis com Anthropic, compatíveis com OpenAI e OpenAI Responses para MiniMax-M3.1-Flash-Preview; os mesmos três, além de preenchimento de prefixo de chat no DeepSeek V4 Flash
• Pesos — nenhum para MiniMax-M3.1-Flash-Preview; os pesos do DeepSeek V Flash foram publicados, embora o modelo em si tenha sido superado
• Preço — não publicado para MiniMax-M3.1-Flash-Preview; publicado e baixo para DeepSeek V4 Flash

Leia essa lista duas vezes, porque o teto de saída é o silencioso. Um milhão de tokens de contexto com 384.000 tokens de saída é uma janela de geração em passada única genuinamente longa. Um milhão de tokens de contexto com um teto de saída não divulgado é uma promessa sobre leitura, não sobre escrita. Se sua carga de trabalho é "ler um repositório, emitir um plano de migração", o segundo número é o que determina se a tarefa cabe em uma única chamada.

Em que cada um é medido

Esta é a parte menos confortável da comparação, e é curta.

O DeepSeek V4 Flash tem um recorde de benchmark, e este é independente. A Artificial Analysis atribui-lhe 34,3 no Intelligence Index — 42.º de 145 modelos nesse índice —, com 69,1 no Coding Index e 90,8% no GPQA Diamond. A pontuação de 95,0 no τ²-Bench com que a entrada do nosso próprio catálogo abre é o mesmo número que o material de lançamento da DeepSeek trazia, portanto é um número de fornecedor em meio a números independentes, e não um número auditado. O seu recall de contexto longo é de 79,7% e o seu valor no terminal-bench é de 78,7% no harness v2.1. Essas são medições reais e comparáveis de um modelo conhecido.

O MiniMax-M3.1-Flash-Preview não tem nenhuma. A MiniMax não publicou nenhuma tabela de avaliação com o lançamento, e nenhum terceiro tem uma também — o modelo não aparece no índice da Artificial Analysis de forma alguma. Isso não é uma lacuna da nossa pesquisa; é o estado atual do registro público, e significa que toda alegação de qualidade sobre o modelo mais novo é, neste momento, um adjetivo de fornecedor. Qualquer pessoa que lhe entregue hoje uma tabela de benchmark do MiniMax-M3.1-Flash-Preview está ou citando o MiniMax-M3 mais antigo, ou inventando.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Coding score: none published', 'Context window: 1M', 'Max output: not published', 'Weights: none', 'Price: not published'. The right column, DeepSeek V4 Flash, reads 'AA Intelligence: 34.3', 'Coding score: 69.1', 'Context window: 1,048,576', 'Max output: 384,000', 'Weights: published', 'Price: $0.15 / $0.60 off-peak'. A footer reads 'MiniMax figures per platform.minimax.io documentation, 27 September 2026; DeepSeek figures per DeepSeek's published rate card and Artificial Analysis. The MiniMax column is empty because nothing has been published, not because a result is pending.'

O DeepSeek V4 Flash não é vendido pelo preço que você lembra.

Aqui está a armadilha. O valor amplamente citado para o DeepSeek V4 Flash — US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída — era a tabela que o modelo trazia antes de 10 de setembro de 2026. Nessa data, a DeepSeek lançou o DeepSeek-V4.1-Flash, descontinuou tanto o V4 Flash quanto o experimento V4-Flash-Vision-Exp e reduziu os preços. O deepseek-v4-flash ainda funciona como identificador, mas a documentação da DeepSeek afirma que ele é temporariamente encaminhado para o V4.1 Flash e cobrado pelo preço do Flash. Em outras palavras, você ainda pode digitar o nome do modelo antigo; você não está chamando o modelo antigo.

Então, o cartão real para comparar é o atual, por 1M de tokens — e fora de pico é a metade mais barata dele:

• Entrada com cache miss — US$ 0,15 fora de pico, US$ 0,30 em horário de pico
• Entrada com cache hit — US$ 0,003 fora de pico, US$ 0,006 em horário de pico
• Saída — US$ 0,60 fora de pico, US$ 1,20 em horário de pico
• Períodos de pico — 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira, excluindo feriados públicos chineses; todo o restante, incluindo finais de semana completos, fica fora de pico

Em contrapartida, o MiniMax-M3.1-Flash-Preview não tem nenhum tipo de tarifa por token. O seu custo é o que custar o seu assento no Token Plan — $22, $55 ou $132 por mês para Plus, Max e Ultra — consumido através de um pool de cota compartilhada ao preço de tabela de pagamento conforme o uso de cada modelo, com o fornecedor reservando-se o direito de alterar a composição desse pool. Para um orçamento mensal fixo com volume previsível, isso pode ser um excelente valor. Para um projeto que precisa atribuir custo por chamada, é opacidade disfarçada de assinatura.

O motivo de isso importar mais do que o normal no lado da DeepSeek é o multiplicador de pico. Uma equipe na Europa ou na Ásia cumprindo seu dia de trabalho está dentro de uma janela de pico para uma parcela significativa de seu tráfego e paga o dobro pelo privilégio, o que transforma uma taxa de entrada anunciada de $0,15 em $0,30 exatamente nas horas em que a maioria dos produtos está ocupada. Faça o orçamento com base na coluna de pico, a menos que seu tráfego realmente rode à noite em UTC.

Quando o MiniMax M3.1 Flash Preview é a escolha errada

Três casos, e os dois primeiros são fáceis de passar despercebidos porque são documentados em vez de subtraídos.

O teto de saída é desconhecido. Se a sua tarefa termina numa geração longa — uma especificação completa, uma reescrita de transcrição, um relatório anotado — você está escolhendo um orçamento de saída que não consegue ver. O DeepSeek V4 Flash publica 384.000. Essa assimetria favorece o modelo mais antigo para qualquer coisa que escreva muito.

O raciocínio não pode ser desativado. Envie thinking: {"type": "disabled"} para o MiniMax-M3.1-Flash-Preview e você recebe um HTTP 400: o modelo exige raciocínio adaptativo. No DeepSeek V4 Flash, o modo sem raciocínio existe e é uma opção suportada. Para classificação de alta taxa de transferência, roteamento ou extração estruturada curta, um modelo que sempre raciocina primeiro está pagando latência e tokens que você não pediu — e a única alavanca que você tem é reduzir effort para low, não remover o raciocínio.

Não é invocável no regime de pagamento conforme o uso. A documentação do fornecedor é inequívoca de que o MiniMax-M3.1-Flash-Preview está disponível apenas por meio do Token Plan e do MiniMax Code no momento, e a Chave de Assinatura não é intercambiável com uma chave de API de pagamento conforme o uso. Se você já possui uma licença, é uma alteração de uma linha. Se não possui, avaliar este modelo significa comprar uma assinatura.

Onde o número da DeepSeek é a escolha errada

A imagem espelhada é que o DeepSeek V4 Flash é somente texto e já foi superado. Ele nunca aceitou imagens — esse trabalho exigia a compilação experimental separada, que agora foi descontinuada junto com ele — e o identificador do modelo agora serve pesos diferentes do que o nome sugere. Um pipeline fixado em deepseek-v4-flash para reprodutibilidade está contando com um redirecionamento que a DeepSeek descreve como temporário.

O MiniMax-M3.1-Flash-Preview processa texto, imagem e vídeo nativamente, e é o atual modelo de texto mais avançado do fornecedor. Entrada de vídeo com um preço de modelo Flash não é comum nessa faixa.

Ambas as ressalvas apontam na mesma direção para quem executa tráfego de produção: o identificador na fatura e o modelo que respondeu não têm garantia de serem a mesma coisa indefinidamente, e é numa camada de roteamento que isso é tratado, em vez de descoberto.

A generated infographic titled 'The two Flash brackets, side by side' listing six paired rows: 'Sales motion — subscription seat vs per-token rate card', 'Effective input rate — Token Plan quota vs $0.15 off-peak / $0.30 peak', 'Peak surcharge — not applicable vs doubles 01:00-04:00 and 06:00-10:00 UTC', 'Cost attribution — pooled quota vs metered per call', 'Failure mode — no published output ceiling vs identifier now serves a successor', and 'Best fit — fixed-budget teams vs metered pipelines'. A footer reads 'Both models carry a 1M-token context window; neither figure is a quality claim.'

Como decidir isso em uma tarde

Comece pelo final da tarefa em vez do começo.

Se o trabalho é geração de texto longo — qualquer coisa que termine escrevendo dezenas de milhares de tokens — o DeepSeek V4 Flash é o único dos dois que publica um teto grande o suficiente para prometê-lo, e sua tabela de preços é pequena o bastante para que o multiplicador de pico seja suportável. Modele o custo no pico, não fora de pico, e trate o identificador descontinuado como uma migração que você ainda não fez, e não como um contrato estável.

Se o trabalho é ler e raciocinar sobre entrada multimodal com um orçamento mensal fixo — gravações de tela, documentos digitalizados, revisão de vídeo —, o MiniMax-M3.1-Flash-Preview é a configuração mais capaz, e dentro de uma licença do Token Plan é a maneira mais barata de obter entrada de vídeo nesse comprimento de contexto. Aceite que você está comprando um modelo não medido e limite o raio de impacto: mantenha a carga de trabalho que importa em algo com uma tabela de preços publicada, e deixe o preview cuidar da metade exploratória.

Se ambas as descrições se encaixam no seu pipeline, isso é um problema de roteamento e não de seleção de modelo, e é exatamente para esse caso que existimos. DeepSeek V4 Flash no OrcaRouterfica na tarifa do provedor com 0% de markup — sua entrada no catálogo mostra US$ 0,22 por milhão de tokens de entrada e US$ 0,66 por milhão de saída, que é a coluna de pico do cartão Flash atual, repassados diretamente — ao lado de MiniMax-M3 e MiniMax M2.7 na mesma faixa de preço e na mesma chave. Um único endpoint alcança mais de 200 modelos com failover automático por trás, de modo que uma carga de trabalho pode transitar entre faixas de preço sem uma segunda integração. O MiniMax-M3.1-Flash-Preview não está no nosso catálogo; para alcançá-lo é preciso o Token Plan do fornecedor e seu produto de codificação.

A versão em uma linha: DeepSeek V4 Flash é a opção conhecida, com o teto de saída publicado, a tabela de preços legível e um sucessor que, discretamente, atende pelo nome; MiniMax-M3.1-Flash-Preview é o mais recente, multimodal e não mensurado, que custa uma assinatura para experimentar. Nenhum desses é motivo para escolher o outro — são apenas os fatos que você não conseguiria obter de uma comparação de preço por token que cita uma tabela que a DeepSeek aposentou em setembro.

A headless Chromium screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash, showing the model title 'DeepSeek: DeepSeek V4 Flash', a pricing row reading 0.22 US dollars per million input tokens and 0.66 per million output tokens, a context window of 1,048,576 tokens, and a maximum output of 384,000 tokens, captured 28 September 2026.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente