
O que é o MiniMax M3? O carro-chefe multimodal com contexto de 1M da MiniMax
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O MiniMax M3 é um modelo de linguagem multimodal nativo, de pesos abertos, do laboratório chinês por trás dos modelos de texto da série M, dos modelos de vídeo Hailuo e da série Music. O laboratório o anunciou em 1º de junho de 2026 e ele assumiu o primeiro lugar na lista de modelos da própria empresa, superando o MiniMax M2.7, trazendo uma janela de contexto de um milhão de tokens, entrada nativa de texto, imagem e vídeo, e uma arquitetura de atenção esparsa que o laboratório chama de MSA.
Quatorze artigos no arquivo deste blog mencionam o MiniMax M3. Até agora, nenhum deles era sobre ele. O modelo aparece como o oponente em comparação após comparação — o ponto de referência de pesos abertos com o qual um Gemini, Qwen, Grok ou GPT mais recente é medido — e não havia nenhuma página aqui em que um leitor pudesse entrar para descobrir o que o MiniMax M3 realmente é. Esta é essa página.
A ficha técnica
O MiniMax M3 é um modelo de mistura de especialistas (mixture-of-experts) com cerca de 428 bilhões de parâmetros totais e cerca de 23 bilhões ativados por token, de acordo com o model card que a MiniMax publica junto com os pesos. Ele é nativamente multimodal, em vez de ser apenas texto com visão adicionada posteriormente: o card descreve o treinamento em modalidades intercaladas desde o primeiro passo, e o modelo aceita entrada de texto, imagem e vídeo e retorna texto.
• Janela de contexto: 1.048.576 tokens, com nossa própria entrada de catálogo indicando um mínimo garantido de 512.000 tokens de contexto utilizável
• Saída máxima: 512.000 tokens em nossa página de catálogo; a MiniMax não publica um número de saída máxima em seu próprio material, então trate 512K como nosso número, não do fornecedor
• Modalidade: texto, imagem e vídeo na entrada; texto na saída
• Parâmetros: ~428B no total, ~23B ativos por token
• Controle de raciocínio: um parâmetro de pensamento com modos ativado, adaptativo e desativado
• Amostragem recomendada: temperatura 1.0, top_p 0.95
• Arquitetura: MiniMax Sparse Attention (MSA), o tema do artigo arXiv 2606.13392
• Formato do endpoint: chat completions compatíveis com OpenAI
A alegação arquitetural central diz respeito ao custo de atenção em contexto longo. A MiniMax afirma que a MSA entrega pré-preenchimento mais de 9x mais rápido e decodificação mais de 15x mais rápida do que o M2 em uma janela de um milhão de tokens, reduzindo o cálculo por token para cerca de um vigésimo do da geração anterior. Esses são números do fornecedor, e não os vimos reproduzidos de forma independente.
Onde o MiniMax M3 se encaixa na própria linha da MiniMax
Está no topo da linha de linguagem, mas vale a pena ser preciso sobre o que essa linha contém, porque a MiniMax mantém uma cauda mais longa de modelos ainda listados do que a maioria dos laboratórios. A própria documentação de modelos do fornecedor divide-os em dois.
• Modelos atuais: MiniMax M3, MiniMax M2.7, MiniMax M2.7-highspeed
• Modelos legados, ainda listados: MiniMax M2.5, MiniMax M2.5-highspeed, MiniMax M2.1, MiniMax M2.1-highspeed, MiniMax M2
• O MiniMax M2, o mais antigo deles, possui contexto de 200.000 tokens e saída máxima de 128.000 tokens, incluindo cadeia de raciocínio
• A MiniMax não publica limites de contexto ou de saída para M2.7 ou M2.1 no mesmo documento
A diferença geracional é real, mas não é enorme no único índice em que ambos os modelos aparecem. A Artificial Analysis atribui ao MiniMax M3 uma pontuação de 29 na revisão v4.3.2 do Intelligence Index, e ao MiniMax M2.7 uma pontuação de 23 na mesma revisão — 29 coloca o M3 na 16.ª posição entre 114 modelos na tabela dessa revisão, e 23 coloca o M2.7 na 36.ª posição. O M2.7 foi lançado em março de 2026. O salto é um passo, não uma geração, e vale a pena ler os dois números na mesma revisão: este índice foi recalibrado em 7 de setembro de 2026, e as pontuações anteriores a essa data não são comparáveis com as pontuações posteriores a ela.
Quanto custa
A MiniMax precifica o M3 por tamanho de solicitação em sua tabela de tarifas pague conforme o uso, e as tarifas publicadas têm um desconto permanente de 50% em relação a um preço de lista mais alto.
• Até 512K tokens de entrada: $0,30 por milhão de tokens de entrada, $1,20 por milhão de tokens de saída, $0,06 por milhão de leituras em cache — contra uma tabela de $0,60 / $2,40 / $0,12
• Acima de 512K tokens de entrada: $0,60 por milhão de entrada, $2,40 por milhão de saída, $0,12 por milhão de leituras em cache — contra uma tabela de $1,20 / $4,80 / $0,24
• Nível de serviço prioritário: 1,5x a tarifa padrão, ou seja, $0,45 / $1,80 / $0,09 no nível de solicitações pequenas, selecionado ao definir service_tier como "priority"
• Não publicado: a MiniMax não lista nenhum preço de gravação em cache para o M3, apenas um preço de leitura em cache
O OrcaRouter disponibiliza o MiniMax M3 pelos mesmos valores — US$ 0,30 de entrada, US$ 1,20 de saída — sem margem adicional sobre a tarifa do provedor. É um modelo em destaque no nosso catálogo, e o tráfego não é trivial: 153,7 milhões de tokens encaminhados nos últimos sete dias no momento da redação, com um p50 de tempo até o primeiro token de 4,26 segundos e um p95 de 10,00 segundos.

No que o MiniMax M3 é mensuravelmente bom
Comece pelos números que a MiniMax relata sobre si mesma, todos informados pelo fornecedor e nenhum dos quais vimos ser reproduzido por terceiros.
• SWE-Bench Pro: 59.0%
• Terminal-Bench 2.1: 66.0%
• SWE-fficiency: 34.8%
• MCP Atlas: 74.2%
• BrowseComp: 83.5, o número que o fornecedor destaca em busca agêntica
• Video-MME: 84.6 em 512 quadros, enquanto a API externa limita os quadros a 640
• KernelBench Hard: 28.8%
• OSWorld-Verified: 68.70% em 100 passos máximos, subindo para 70.06% em 200
O quadro independente concorda com a direção. O Artificial Analysis coloca o MiniMax M3 com um Intelligence Index de 29 na revisão v4.3.2, classificando-o em 16º de 114 modelos, a US$ 0,51 para executar o índice por modelo — 21º de 114 nessa medida de custo. A velocidade de saída é de 106,4 tokens por segundo contra uma mediana de 67,1, e o tempo até o primeiro token é de 1,25 segundo contra uma mediana de 2,33 segundos. Ambos são melhores do que o típico para a categoria, e o preço está bem abaixo dela.
A republicação por terceiros da mesma família de índices preenche as subpontuações: SWE-bench Verified com 80,5%, tau-squared-bench com 88,9%, AA-GPQA Diamond com 92,9%, AA-LCR com 83,0%, AA-IFBench com 82,9%, OmniDocBench 1.5 com 91,6% e USAMO 2026 com 85,7%. A compreensão de documentos e o seguimento de instruções parecem pontos fortes genuínos, e a pontuação de raciocínio de contexto longo corresponde à narrativa arquitetural.

No que ele é mensuravelmente ruim
As fraquezas honestas se concentram em dois lugares, e ambas são visíveis nos números publicados.
• A lacuna agêntica é a grande questão: na mesma republicação por terceiros, o MiniMax M3 marca 58,6 no AA Coding Index, mas apenas 30,8 no AA Agentic Index. Ele escreve código muito melhor do que conduz de forma autônoma uma tarefa longa de várias etapas.
• Conhecimento e alucinação: um AA-Omniscience Index de 1,4, acurácia de 16,7% e uma taxa de alucinação de 18,4%. Este é um modelo que responderá com confiança sobre coisas que não sabe.
• OSWorld 2.0: 4,6%
• CritPt: 3,7%, a pontuação publicada mais fraca que encontramos para o M3 em qualquer lugar
• ResearchClawBench: 19,8%
• Verbosidade: 120 milhões de tokens de saída para completar o Intelligence Index, posição 11 de 114 — é um modelo falador, e em prompts com uso intenso de raciocínio isso aparece na conta
• O piso composto: um agregador de terceiros o coloca em 55,28 de 100, posição 60 de 505, embora com cobertura parcial de 50 benchmarks de 481, então essa pontuação composta é um piso, e não um veredito
Várias coisas simplesmente não são medidas, e preferimos dizer isso a preencher a lacuna. Ninguém fora da MiniMax reproduziu a tabela de benchmark do fornecedor acima. Artificial Analysis não publica um valor do Coding Index nem do Agentic Index para o M3 por si só — o par 58,6 e 30,8 vem de um terceiro que republica a mesma família de índices. Artificial Analysis nomeia AA-Omniscience como componente do seu índice, mas não publica nenhuma pontuação numérica de Omniscience para o M3. MiniMax não publica nenhum valor de saída máxima, então o 512K na nossa própria página do modelo é nosso. E não há absolutamente nenhum preço de escrita em cache na tabela de preços do fornecedor.
Quem deve escolher o MiniMax M3 e quem deve escolher outra opção
Escolha o MiniMax M3 quando a tarefa for de contexto longo e multimodal ao mesmo tempo. Um milhão de tokens com entrada de vídeo, pesos abertos que você pode baixar e executar por conta própria, e um preço de entrada de US$ 0,30 por milhão de tokens é uma combinação que nada mais no campo de pesos abertos iguala com tanta clareza. Análise de documentos longos, compreensão de vídeo, leitura de código em escala de repositório e pipelines de extração de documentos são onde os pontos fortes medidos se encontram — 91,6% no OmniDocBench e 83,0% no AA-LCR são os números que defendem essa escolha.
Escolha outra opção em três casos. Se você não precisa da janela de contexto nem da entrada de visão, o MiniMax M2.7 custa os mesmos US$ 0,30/US$ 1,20, obtém 23 contra 29 do M3 na revisão atual do índice e é algo menor para operar — a vantagem do M3 não é gratuita, apenas tem o mesmo preço de etiqueta. Se a sua carga de trabalho for de agentes autônomos em vez de codificação, a lacuna em capacidades agênticas é o motivo para procurar outra opção, e a própria tabela comparativa da MiniMax aponta para o mesmo lugar: no PostTrainBench, o fornecedor relata 0,37 para o M3 contra 0,42 para o Opus 4.7 e 0,39 para o GPT-5.5, seu único benchmark publicado em que o M3 perde para ambos. E, se você precisa de uma licença sem amarras, leia o próximo parágrafo antes de se comprometer.
A licença é o detalhe que muitas coberturas omitem. O MiniMax M3 é distribuído sob a MiniMax Community License, não sob Apache ou MIT. O uso não comercial é gratuito. O uso comercial é permitido, mas você deve exibir de forma destacada "Built with MiniMax M3". Abaixo de US$ 20 milhões em receita anual, você apresenta uma notificação única; acima disso, é necessária autorização prévia por escrito da MiniMax, solicitada por e-mail com o assunto "M3 licensing - authorization request". A licença também traz um apêndice de usos proibidos. Se você está lançando um produto, isso é uma revisão jurídica, não uma formalidade.
O resumo prático
MiniMax M3 é o atual carro-chefe da linha de linguagem da MiniMax: um modelo de mistura de especialistas com ~428B parâmetros e ~23B ativos por token, contexto de um milhão de tokens, entrada nativa de vídeo e imagem, e atenção esparsa à qual o fornecedor atribui uma redução de 20x na computação por token em contexto total. Foi anunciado em 1º de junho de 2026, então é um modelo consolidado, não um novo — a pergunta interessante em setembro de 2026 não é se ele é bom, mas para qual metade da sua carga de trabalho ele é bom.
A resposta ponderada é que ele é forte em código e documentos, mediano em conhecimento e fraco em trabalho agêntico autónomo. É barato para o que faz, e é o raro modelo de pesos abertos em que a alegação de contexto longo sobrevive a uma análise independente. A licença é a parte que a maioria das equipas terá de negociar consigo mesma.
O MiniMax M3 é executado no OrcaRouter à tarifa do fornecedor sem qualquer margem, através do mesmo endpoint compatível com OpenAI que tudo o resto aqui: uma única chave API dá acesso a mais de 200 modelos, com failover automático se um endpoint falhar e uma DSL de routing quando quiser fixar ou combinar. Se quiser compará-lo com o resto do catálogo antes de avançar, a página do modelo tem o tarifário em tempo real, percentis de tempo até ao primeiro token e tráfego.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
