Um cartão hero gerado intitulado MiniMax M3.1 Flash Preview, com o subtítulo «Já disponível no Token Plan, 27 de setembro de 2026». Três chips indicam «contexto de 1M tokens», «texto + imagem + vídeo na entrada» e «apenas no Token Plan — sem pagamento conforme o uso». Um cartão à esquerda indica «Confirmado pelo fornecedor: mesma Subscription Key que M3 e M2.7, thinking ativado por predefinição, effort de low a max»; um cartão à direita indica «Não publicado: preço por token, ficha do modelo, benchmarks, pesos, medição independente». O logotipo OrcaRouter encontra-se no canto inferior direito.
Guides & Insights

MiniMax M3.1 Flash Preview já está disponível no Token Plan: o que sua assinatura realmente desbloqueia

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O MiniMax-M3.1-Flash-Preview entrou em operação em 27 de setembro de 2026, e a forma como isso aconteceu é a história. Ele não é um modelo de pagamento conforme o uso. O fornecedor colocou seu mais novo modelo de texto atrás da mesma Token Plan Subscription Key que já cobre o MiniMax-M3, o MiniMax M2.7 e a variante M2.7-highspeed, então, se você tem uma assinatura, não há nova chave para gerar nem segundo contrato para assinar. O que também não existe, até hoje, é um preço por token, uma ficha do modelo, um benchmark publicado ou qualquer forma de desativar o modo de pensamento do modelo.

Essa combinação — acesso sem atrito combinada com uma economia totalmente não divulgada — é incomum o suficiente para valer a pena destrinchar antes que alguém conecte um pipeline de produção a ela. O restante deste texto é o que a própria documentação do fornecedor realmente diz, o que ela conspicuamente não diz, e a única linha de código que lhe dirá em menos de um minuto se este modelo se encaixa no seu modo de trabalhar.

O que é que chegou de facto a 27 de setembro

A documentação para desenvolvedores da MiniMax agora traz uma nota permanente, repetida em todas as páginas de modelos de texto: O MiniMax-M3.1-Flash-Preview está disponível, por enquanto, apenas por meio do Token Plan e do MiniMax Code. O modelo aparece primeiro na própria tabela de modelos do fornecedor, acima do MiniMax-M3, descrito como um modelo de codificação multimodal de ponta, com uma janela de contexto de 1M e profundidade de pensamento ajustável.

• Janela de contexto — 1.000.000 tokens, o mesmo teto que o MiniMax-M3 suporta
• Modalidades de entrada — texto, imagem e vídeo, retornando texto
• Profundidade de raciocínio — uma configuração effort que aceita low, medium, high, xhigh e max, com padrão max quando omitido
• Suporte a protocolos — o mesmo id de modelo funciona no endpoint compatível com Anthropic da MiniMax, no endpoint compatível com OpenAI e no OpenAI Responses
• Disponibilidade — somente Token Plan e MiniMax Code; não no pay-as-you-go
• Preço — nenhuma tarifa por token publicada em qualquer lugar
• Pesos — nenhum; os dois repositórios públicos mais recentes da organização MiniMaxAI continuam sendo MiniMax-Music3 e MiniMax-H3
• Benchmarks independentes — nenhum; o modelo não tem entrada no índice de modelos da Artificial Analysis

A empresa o anunciou no mesmo dia em sua conta MiniMaxAgent, enquadrando-o para o desenvolvimento cotidiano, e não para trabalho de ponta: rápido e confiável, de correções rápidas de bugs à implementação completa de funcionalidades. Esse é o escopo de um nível Flash, não de um modelo carro-chefe. Coberturas de agências de notícias de terceiros da PANews e da KuCoin o descreveram nos mesmos termos e observaram que desenvolvedores já tinham avistado o modelo no seletor do MiniMax Code antes de a empresa confirmá-lo.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the standing note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, above the vendor's language-model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', ahead of MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Qual chave você usa importa mais do que o normal

Esta é a parte que pega as pessoas de surpresa. O MiniMax opera dois tipos separados de credenciais, e o M3.1-Flash-Preview só responde a um deles. A Token Plan Subscription Key vem de Billing > Token Plan e cobre o uso da assinatura e os Créditos comprados. A API Key de pay-as-you-go cobre os modelos por token. A documentação do fornecedor é explícita ao afirmar que as duas não são intercambiáveis e que uma Subscription Key pode existir antes que qualquer recurso pago seja associado a ela — caso em que é uma chave válida sem nada por trás.

Portanto, o teste prático não é “tenho uma chave de API da MiniMax?”, mas sim “tenho uma vaga no Token Plan?”. As vagas existentes estão cobertas. A documentação observa que uma Subscription Key se torna utilizável quando uma vaga ou acesso a Credits é atribuído, e que o excedente de Credits é consumido automaticamente assim que a cota da assinatura se esgota.

Há também uma inconsistência na documentação que vale a pena conhecer, porque vai confundir qualquer pessoa que leia primeiro a página de preços. A nota de rodapé de cobertura da página de preços do Token Plan ainda lista a linha elegível como M3, M2.7, imagem e fala, com H3 excluído — ela não foi atualizada para nomear M3.1-Flash-Preview. As páginas dos modelos dizem o contrário: que M3.1-Flash-Preview está disponível no Token Plan e em nada mais. Ambas as páginas são páginas de fornecedor ativas hoje. Só a chave na sua mão resolve isso.

O 400 que lhe diz que tipo de modelo é este

Cada modelo da série M da MiniMax pensa antes de responder, mas o M3.1-Flash-Preview é o primeiro que se recusa a parar. Envie thinking: {"type": "disabled"} ou reasoning_effort: "none" e a API retorna HTTP 400 com a mensagem:

O modelo "MiniMax-M3.1-Flash-Preview" requer pensamento adaptativo; thinking.type="disabled" (incluindo reasoning.effort=none) não é permitido (2013)

A orientação do próprio fornecedor é reduzir esforço em vez de tentar desativar o pensamento, e a escala é a alavanca de latência: uma edição de rotina em low e uma alteração em todo o repositório em xhigh são o mesmo modelo fazendo trocas diferentes. Dois outros detalhes são específicos deste modelo. O parâmetro reasoning_effort está documentado como eficaz apenas para MiniMax-M3.1-Flash-Preview — ele não é um controle geral da série M. E o reasoning_split switch de saída, que separa o pensamento em um campo reasoning_content, não pode atualmente ser definido como false neste modelo.

Onde o texto de pensamento aparece depende do protocolo: o endpoint compatível com a Anthropic o retorna como um thinking bloco de conteúdo, o endpoint compatível com a OpenAI o retorna em reasoning_content, e o endpoint Responses o retorna como um item de saída de raciocínio. Se você estava extraindo <think> tags da saída do MiniMax-M3, esse trabalho não é mais necessário no modelo mais recente — e, para conversas com uso intercalado de ferramentas, a resposta completa, incluindo o bloco de pensamento, precisa ser anexada de volta ao histórico de mensagens, ou a cadeia de raciocínio se quebra.

A promoção em andamento neste momento

O MiniMax Code está a realizar uma promoção de check-in de 28 de setembro a 7 de outubro em UTC+8, duplicando os créditos gratuitos atribuídos pelos inícios de sessão diários e abrindo-a a novos e atuais utilizadores. Os créditos atribuídos aplicam-se a todos os modelos suportados, sendo M3.1-Flash-Preview e os modelos de vídeo H3 indicados como exemplos. Separadamente, a empresa afirmou que as quotas do Token Plan foram repostas para todos os utilizadores no lançamento e que estão previstas novas reposições durante o evento, com a elegibilidade apresentada na aplicação.

Trate esses dois como declarações do fornecedor repassadas pela cobertura de lançamento — são termos promocionais com datas associadas, não comportamento do produto, e a mesma cobertura observa que o anúncio não especificou a contagem de créditos por check-in nem as regras precisas para dias perdidos. A economia em regime estável é mais fácil de declarar: o Token Plan está listado a US$ 22 por mês para o Plus, US$ 55 para o Max e US$ 132 para o Ultra, com janelas de cota móveis de 5 horas e semanais, dimensionadas pelo fornecedor em cerca de três a quatro, quatro a cinco e seis a sete agentes simultâneos, respectivamente. Os Créditos Comprados operam a 1.000 créditos por dólar e são deduzidos ao preço de tabela de uso sob demanda de cada modelo.

As quatro coisas que este modelo ainda não tem

Nenhum dos itens a seguir é uma crítica ao modelo; cada um é uma brecha que uma equipe precisa contornar no planejamento, e todos os quatro são verificáveis hoje.

• Sem preço. Não existe qualquer tarifa por token para o M3.1-Flash-Preview em nenhuma página da MiniMax, pelo que não pode ser comparado com os US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída do M3, nem com qualquer outra coisa, em termos de custo por token.
• Sem benchmarks. A MiniMax não publicou qualquer tabela de avaliação com este lançamento. Nem mais ninguém: o modelo está ausente do índice da Artificial Analysis, pelo que a sua coluna está genuinamente vazia, e não apenas precoce.
• Sem pesos. O MiniMax-M3 foi lançado com pesos abertos; o M3.1-Flash-Preview não tem repositório nem checkpoint disponível para download.
• Sem medições independentes. Não há dados de velocidade de saída, latência ou taxa de erro de terceiros, nem dos nossos próprios dados de telemetria de encaminhamento, porque o modelo não está no nosso catálogo.

Em contraste com o lançamento do M3 em junho de 2026, que chegou com uma nota de arquitetura, uma ficha técnica e uma tabela de preços logo no primeiro dia, este é um lançamento deliberadamente discreto. A leitura provável — e é uma leitura, não um plano declarado — é que a MiniMax quer uso real dentro do seu próprio produto antes de decidir quanto custa o modelo e se vai abri-lo.

A generated two-column infographic titled 'What the vendor confirms, and what it has not published', for MiniMax M3.1 Flash Preview. The left column, headlined 'Confirmed on day one', lists 'Listed first in MiniMax's own model table, above MiniMax-M3', '1,000,000-token context window', 'Text, image and video input returning text', 'An effort ladder from low to max, defaulting to max', 'Reachable over Anthropic-, OpenAI- and Responses-compatible endpoints', and 'Covered by the existing Token Plan Subscription Key'. The right column, headlined 'Still unpublished', lists 'Per-token price, anywhere on MiniMax's pages', 'A model card or evaluation table', 'Public weights or a downloadable checkpoint', 'Any entry on Artificial Analysis's model index', and 'Output-speed and latency figures from any third party'. A footer reads 'Per platform.minimax.io documentation and the launch announcement, 27 September 2026.'

O que a nota de prévia vazada acertou

Quatro dias antes do lançamento, circulou um documento de pré-visualização transcrito num repositório público de parceiros, descrevendo um MiniMax M3.1 com atenção esparsa, quantização de atenção Q8KV4, especialistas roteados NVFP4, uma cabeça de decodificação especulativa DSpark e um novo campo reasoning_effort que assumia valores de max até low. Na altura, noticiamos como não verificado, porque era: não existiam pesos, cartão de modelo, página de preços nem id de modelo da API.

Uma dessas cinco afirmações está agora confirmada pela própria documentação do fornecedor, e trata-se do reasoning_effort — incluindo a escala de máximo a mínimo, que corresponde exatamente aos valores da versão disponibilizada. As outras quatro permanecem não confirmadas. A descrição publicada pela MiniMax do M3.1-Flash-Preview diz apenas que se trata de um modelo de codificação multimodal de fronteira com uma janela de contexto de 1M e profundidade de raciocínio ajustável; não descreve o esquema de atenção, a quantização nem a cabeça de decodificação. Qualquer pessoa que repita as afirmações sobre atenção esparsa e NVFP4 como especificação consolidada reproduz a transcrição de um terceiro, que é exatamente o que o lançamento não confirmou.

Se você quiser experimentar sem apostar um pipeline nisso

A parte incômoda de uma prévia apenas do Token-Plan é que a forma natural de avaliar um novo modelo — chamá-lo a partir da sua stack existente e medir — é justamente a única coisa que você não consegue fazer de forma limpa. Não há tarifa por token para se basear, nem perfil de latência publicado, nem estratégia de failover dentro do próprio produto do fornecedor se a prévia oscilar.

É para esta situação que uma camada de encaminhamento foi criada. Tudo o que pode chamar hoje está por trás de um endpoint compatível com a OpenAI e uma chave de API, e os modelos adjacentes a este já lá estão: MiniMax-M3 à tarifa do fornecedor de US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de saída, MiniMax M2.7 com o mesmo preço de tabela, uma janela de 200.000 tokens e pesos abertos, e os níveis DeepSeek e Qwen Flash na mesma faixa de preço. Os preços do nosso lado são o preço de tabela do fornecedor repassado com 0% de margem, por isso, quando um fornecedor baixa uma tarifa, ela chega aqui no mesmo dia, em vez de num ciclo de renegociação. A comutação automática em caso de falha significa que uma dependência de nível de pré-visualização pode ficar ao lado de um caminho de produção, e não por baixo dele, e quando a MiniMax publicar uma tabela de preços e um endpoint para o MiniMax-M3.1-Flash-Preview, a questão passa a ser uma entrada na tabela de encaminhamento em vez de um projeto de migração. O próprio MiniMax-M3.1-Flash-Preview não está no nosso catálogo, e a forma de lá chegar hoje é o Token Plan do próprio fornecedor e o seu produto de programação.

O resumo honesto para uma equipe que lê isto no dia do lançamento: o modelo está no ar, gratuito na margem se você já paga por um assento do Token Plan, e completamente sem preço e sem medição em seus próprios termos. Experimente dentro do MiniMax Code, mantenha o pipeline do qual você depende em um modelo com tabela de preços e histórico comprovado, e fique atento às duas coisas que vão transformar isso de uma curiosidade em uma decisão — um preço publicado e as primeiras pontuações independentes.

A generated scorecard infographic titled 'The models you can call today, and what they cost'. Six rows read: 'MiniMax M3 — $0.30 in / $1.20 out per 1M tokens, 1,048,576-token context, open weights', 'MiniMax M2.7 — $0.30 in / $1.20 out per 1M tokens, 204,800-token context, open weights', 'DeepSeek V4 Flash — $0.22 in / $0.66 out per 1M tokens, 1,048,576-token context', 'DeepSeek V4.1 Flash — routed on the same key in the same price band', 'MiniMax M3.1 Flash Preview — no per-token rate published; Token Plan and MiniMax Code only', and 'One OrcaRouter API key reaches 200+ models with 0% markup on the provider's list price and automatic failover across providers'. A footer reads 'Catalogue figures per OrcaRouter's public model API, 28 September 2026; MiniMax M3.1 Flash Preview is not on the OrcaRouter catalogue.'