
MiniMax M3.1 Flash Preview vs. MiniMax M3: Quando o modelo mais novo é o mais arriscado
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 468 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 192 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
A documentação do próprio fornecedor agora lista o MiniMax-M3.1-Flash-Preview acima do MiniMax-M3, e essa ordenação tem um grande efeito persuasivo. Ele é o modelo de texto mais recente da linha, traz a mesma janela de contexto de um milhão de tokens e acrescenta um controle de profundidade de raciocínio que o modelo mais antigo não tem. O que a tabela não mostra é que o modelo mais antigo é o único dos dois que você pode baixar, precificar por token, comparar em benchmark com qualquer coisa ou chamar sem assinatura — e que o mais novo removeu uma opção que o MiniMax-M3 oferecia.
Não se trata de uma história sobre um modelo que foi superado. Trata-se de uma história sobre um fornecedor que divide a própria linha entre um modelo de trabalho com uso medido e uma prévia restrita por assinatura, e os dois não são intercambiáveis em nenhuma direção. Eis o que cada um deles realmente é.
As duas fichas técnicas, lado a lado
Comece com o que as próprias páginas do fornecedor declaram para ambos, porque a forma da diferença aparece aqui, e não em uma tabela de benchmark.
• Anunciado — MiniMax-M3 em 1 de junho de 2026 com uma nota de arquitetura, uma ficha de benchmark e uma tabela de preços; MiniMax-M3.1-Flash-Preview em 27 de setembro de 2026 com uma entrada de documentação e uma publicação na conta de agente da MiniMax • Janela de contexto — 1 000 000 tokens para ambos, segundo as próprias tabelas de modelos da MiniMax • Saída máxima — 512 000 tokens para o MiniMax-M3 na nossa entrada de catálogo, um valor que a própria MiniMax não publica; não publicado em lado nenhum para o MiniMax-M3.1-Flash-Preview • Modalidades de entrada — texto, imagem e vídeo à entrada, texto à saída, para ambos • Controlo do pensamento — um parâmetro de pensamento que o MiniMax-M3 pode receber ordem para ignorar e que pode ser separado num campo reasoning_details através de reasoning_split; no MiniMax-M3.1-Flash-Preview o pensamento é obrigatório e reasoning_split não pode ser desativado • Profundidade de pensamento — não disponível no MiniMax-M3; uma escala effort de low, medium, high, xhigh e max, com predefinição max, no MiniMax-M3.1-Flash-Preview • Velocidade de saída publicada — cerca de 100+ tokens por segundo para o MiniMax-M3, segundo a própria tabela de modelos da MiniMax; nada publicado para o MiniMax-M3.1-Flash-Preview • Pesos — o MiniMax-M3 tem pesos abertos, com um repositório público; o MiniMax-M3.1-Flash-Preview não tem nenhum • Preços — 0,30 $ por milhão de tokens de entrada e 1,20 $ por milhão de tokens de saída para o MiniMax-M3 à tarifa do fornecedor; não existe tarifa por token para o MiniMax-M3.1-Flash-Preview • Acesso — MiniMax-M3 em pay-as-you-go e no Token Plan, e encaminhável através de plataformas de terceiros; MiniMax-M3.1-Flash-Preview apenas no Token Plan e no MiniMax Code
Duas linhas ali pertencem a uma categoria diferente das demais. A velocidade de saída publicada é um número do fornecedor apenas para o modelo mais antigo, então o modelo mais novo está sendo vendido como o rápido sem um valor associado. E o controle de pensamento seguiu na direção oposta à do marketing: o modelo mais novo oferece um controle mais refinado sobre o quanto ele pensa, ao mesmo tempo que remove sua capacidade de impedi-lo de pensar por completo.
A mudança que a MiniMax removeu
Este é o detalhe com maior probabilidade de causar problemas, e está documentado, em vez de oculto. Com o MiniMax-M3, enviar thinking: {"type": "disabled"} no endpoint compatível com OpenAI ignora o raciocínio e retorna uma resposta direta; no endpoint compatível com Anthropic, o raciocínio fica desativado por padrão e pode ser ativado com adaptive. No MiniMax-M3.1-Flash-Preview, a solicitação idêntica retorna HTTP 400 com a mensagem exige raciocínio adaptativo. Não há forma suportada de obter uma resposta sem raciocínio.
Na prática, isso significa que uma carga de trabalho que usava o MiniMax-M3 como um classificador ou roteador barato e rápido — prompt curto de entrada, resposta estruturada curta de saída, sem cadeia de pensamento — não tem um caminho de atualização direto para o modelo mais novo. Você pode reduzir esforço para baixo, e as orientações da MiniMax deixam explícito que reduzir o esforço é a forma pretendida de diminuir a latência de pensamento e os tokens, em vez de desativar o pensamento. Mas os tokens e a latência não vão a zero, e para um trabalho de extração de alto volume que grava quatro campos por chamada, "sempre pensa primeiro" tem um formato de custo diferente de "pensa quando solicitado".

O que é realmente medido em cada um
Um lado desta comparação tem números e o outro tem uma coluna em branco, e vale a pena ser preciso sobre a quem pertencem quais números.
O histórico independente do MiniMax-M3 é real: a Artificial Analysis coloca-o em 29,2 no Intelligence Index — 60.º de 145 — com 58,6 no Coding Index, 59,18 no seu índice Math, 92,9% no GPQA Diamond na mesma família de índices, 83% de recuperação de contexto longo e 82,9% no IFBench. Essas são avaliações de terceiros de um modelo que qualquer pessoa pode baixar e executar novamente. Os próprios números de lançamento da MiniMax para o M3 — BrowseComp em 83,5%, SWE-Bench Pro em 59,0%, Terminal-Bench 2.1 em 66,0%, MCP Atlas em 74,2%, OSWorld-Verified em 70% — são dados do fornecedor e não os vimos reproduzidos.
O MiniMax-M3.1-Flash-Preview não tem nenhum dos dois. A MiniMax não publicou nenhuma tabela de benchmarks, e o modelo não tem entrada no índice da Artificial Analysis, portanto não há pontuação independente, nem índice de programação, nem métrica de recall em contexto longo e nem medição de alucinação. Toda caracterização dele em circulação — "rápido", "confiável", "feito para o desenvolvimento cotidiano" — é o próprio adjetivo do fornecedor, vindo do post de lançamento. Vale a pena afirmar essa ausência de forma clara, porque ela corta para os dois lados: nada foi demonstrado como pior, e nada foi demonstrado como melhor.
Essa assimetria é o que decide tudo. Você pode avaliar o MiniMax-M3 hoje à tarde baixando-o ou chamando-o, e pode comparar essa avaliação com um placar público. Com o MiniMax-M3.1-Flash-Preview, você só pode usá-lo e formar uma opinião privada.
Onde o modelo mais novo realmente vence
Seria fácil ler o texto acima como um argumento para ignorar o novo modelo, mas essa também não é a conclusão correta. Há três coisas que são reais e específicas a ele.
A escada de esforço é um recurso genuíno, não um toggle. Cinco níveis — baixo até máximo — permitem que um único modelo atenda a uma renomeação de rotina e a uma refatoração de todo o repositório com custos de computação diferentes, e está documentado que é eficaz apenas no MiniMax-M3.1-Flash-Preview. No MiniMax-M3, sua escolha é binária. Se o seu problema é não conseguir prever a latência por tarefa, uma profundidade ajustável é exatamente o controle que você queria.
É o modelo atualmente no topo da tabela do fornecedor, o que significa que herda tudo o que a linhagem da série M aprendeu desde junho, e a MiniMax afirma explicitamente que é o modelo mais recente para raciocínio agêntico, uso de ferramentas, programação e tarefas de contexto longo. O mecanismo de uso de ferramentas com pensamento intercalado introduzido pelo M3 mantém-se, incluindo o requisito de acrescentar a resposta completa — blocos de pensamento e tudo — de volta ao histórico de mensagens.
E ele aceita vídeo, a um preço de nível Flash, dentro de uma assinatura. O MiniMax-M3 também, a um preço por token. Se você já paga por uma licença do Token Plan e sua única barreira para usar entrada de vídeo era o custo marginal por chamada, o M3.1-Flash-Preview remove essa barreira.
Onde o modelo mais antigo ainda é o mais indicado
Três casos, todos eles sobre previsibilidade em vez de qualidade.
Quando você precisa modelar custo. O MiniMax-M3 tem uma tabela de preços: US$ 0,30 por milhão de tokens de entrada, US$ 1,20 por milhão de saída, e uma taxa de leitura de cache de US$ 0,06 por milhão em nosso catálogo. Você pode estimar a fatura mensal de uma carga de trabalho até o centavo antes de executá-la. O MiniMax-M3.1-Flash-Preview não tem taxa por token em nenhuma página da MiniMax, então seu custo é a sua assinatura dividida por quanto você a usa — adequado para um orçamento fixo, inútil para economia unitária.
Quando você precisa que o modelo seja o modelo. O MiniMax-M3 é de pesos abertos: você pode baixá-lo, executá-lo no seu próprio hardware e saber que o artefato que responde às suas chamadas daqui a seis meses é o mesmo que responde hoje. O MiniMax-M3.1-Flash-Preview não tem checkpoint, e acesso de nível de prévia significa que a pilha de serviço, a composição de cota e a disponibilidade estão todas sob controle do fornecedor e explicitamente sujeitas a mudanças.
Quando você precisa de uma resposta sem raciocínio. Como acima — esta é a única regressão de capacidade na comparação, e é a que surpreende as pessoas, porque um modelo mais novo que não consegue fazer algo que o mais antigo conseguia não é um caso que alguém planeje.

Chamando ambos de um só lugar
A questão complicada aqui é que os dois modelos são adquiridos de formas diferentes — um por medição, outro por assinatura — e o instinto natural é escolher um lado. A atitude mais útil é fazer o roteamento entre eles conforme o formato da tarefa, o que só funciona se o lado medido estiver acessível a partir do mesmo lugar que todo o resto.
MiniMax-M3 no OrcaRouter carrega o preço de tabela da MiniMax com 0% de margem adicionada, então os US$ 0,30 e US$ 1,20 na tabela de preços são o que uma chamada custa, sem margem da plataforma por cima. Ele fica no mesmo endpoint compatível com OpenAI que o MiniMax M2.7 — o mesmo valor de US$ 0,30/US$ 1,20 em uma janela de 200.000 tokens, também de pesos abertos — e assim como mais de 200 outros modelos, atrás de uma única chave de API, com failover automático entre provedores quando um endpoint fica instável. Em comparação com nossa própria telemetria, que é um tipo diferente de número em relação ao de um fornecedor: nos últimos sete dias, o M3 respondeu a cerca de 238 tokens de saída por segundo, com um p50 de aproximadamente 4,1 segundos até o primeiro token, com uma taxa de erro perto de 0,15%, medidos no playground do OrcaRouter. Se você quiser manter o MiniMax-M3 como a metade confiável de um pipeline e tratar o MiniMax-M3.1-Flash-Preview como a metade experimental, a metade confiável é uma linha de configuração em vez de um segundo relacionamento com fornecedor. O próprio MiniMax-M3.1-Flash-Preview não está em nosso catálogo; a rota até ele é o Token Plan e o produto de codificação do próprio fornecedor.
O que mudaria este artigo é específico e fácil de acompanhar. Uma tabela de preços publicada para o MiniMax-M3.1-Flash-Preview eliminaria o principal motivo para preferir o M3 em termos econômicos. Um conjunto de pontuações independentes substituiria a coluna em branco por algo comparável. Um checkpoint disponível para download removeria a objeção de reprodutibilidade. Até que pelo menos um desses chegue, o MiniMax-M3 continua sendo o modelo deste par que você pode responsabilizar — e o mais novo continua sendo a prévia mais rápida, mais bem controlada e não medida que a MiniMax decidiu cobrar por mês em vez de por token.

