Uma cartela de título para Mistral Large 4 vs. MiniMax M3, construída em torno de uma diferença mensal de US$ 48 em 100 milhões de tokens, com o MiniMax M3 aceitando entrada de vídeo e saída de 512K, e o Mistral Large 4, uma prévia apenas de imagem.
Guides & Insights

Mistral Large 4 vs MiniMax M3: Quanto Custa Cinco Meses de Progresso

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O MiniMax M3 é o modelo mais barato desta classe, e tem sido desde 31 de maio de 2026. A US$ 0,30 por milhão de tokens de entrada, US$ 1,20 por milhão de saída e US$ 0,06 por milhão em cache, ele é cerca de metade mais barato que o Mistral Large 4 na entrada e duas vezes mais barato na saída — e, ao contrário do modelo mais novo, você pode comprá-lo hoje sem um rótulo de prévia associado. O Mistral Large 4, um modelo de pesos abertos de 1,05 trilhão de parâmetros em prévia pública desde 6 de outubro de 2026, custa US$ 0,68 e US$ 2,09 e promete os pesos até o final do mês. Dois carros-chefe de pesos abertos, com cinco meses de diferença, e os cinco meses são visíveis em exatamente um lugar: a pontuação independente de 29,2 do M3 no Intelligence Index contra uma pontuação do Mistral Large 4 que ainda não existe.

Essa é a forma honesta desta comparação, e é mais interessante do que uma tabela de preços sugere. O M3 foi construído em torno de uma aposta arquitetural específica — MiniMax Sparse Attention, sustentada ao longo de um milhão de tokens de contexto, com vídeo como entrada de primeira classe — e ganha no papel em duas categorias que o Mistral Large 4 não disputa: comprimento bruto de saída e vídeo nativo. Em todos os outros aspectos, o modelo mais novo é o que um comprador preferiria ter, a um preço que ainda é baixo o suficiente para que a diferença raramente decida a compra.

Duas arquiteturas, duas apostas

MiniMax M3 é o modelo fundacional de pesos abertos principal da MiniMax e o primeiro a combinar desempenho de ponta em programação e em agentes, uma janela de contexto de um milhão de tokens e multimodalidade nativa em um único lançamento. Ele aceita texto, imagens e vídeo e retorna texto, e é construído sobre o MiniMax Sparse Attention, uma arquitetura projetada para sustentar até 1.048.576 tokens de contexto com um piso garantido de 512K. O pipeline de pré-treinamento foi reconstruído para escalar além de 100 trilhões de tokens com dados multimodais desde a primeira etapa, em vez de adicionados posteriormente. Sua saída máxima é de 512.000 tokens.

O Mistral Large 4 faz uma aposta diferente. É um modelo granular de mistura de especialistas, com 49 mil milhões de parâmetros ativos num total de 1,05 biliões, e um codificador visual de 1,6 mil milhões de parâmetros, treinado de raiz em 3 800 GPUs NVIDIA Grace Blackwell, dentro dos próprios centros de dados europeus da Mistral, com dados que abrangem mais de 160 línguas. Aceita texto e imagens — sem vídeo — num contexto de cerca de um milhão de tokens, e a Mistral posiciona-o em torno da implementação soberana: infraestrutura europeia, pesos abertos e a capacidade de o executar de acordo com as suas próprias políticas, com a cibersegurança como caso de uso emblemático.

• Janela de contexto — MiniMax M3 1.048.576 tokens vs Mistral Large 4 cerca de 1.000.000

• Saída máxima — MiniMax M3 512.000 tokens vs Mistral Large 4 ainda não documentado

• Modalidade de entrada — MiniMax M3 texto, imagem e vídeo vs Mistral Large 4 texto e imagem

• Preço de entrada — MiniMax M3 $0,30 por 1M vs Mistral Large 4 $0,68 por 1M

• Preço de saída — MiniMax M3 US$ 1,20 por 1M vs Mistral Large 4 US$ 2,09 por 1M

• Entrada em cache — MiniMax M3 $0,06 por 1M vs Mistral Large 4 $0,07 por 1M

• Parâmetros — Mistral Large 4 1,05T no total / 49B ativos vs MiniMax M3 não divulgados

• Lançado — MiniMax M3 31 de maio de 2026 vs Mistral Large 4 6 de outubro de 2026, prévia

• Pesos — ambos com licença aberta, os da Mistral Large 4 prometidos até o final de outubro de 2026

A two-column scoreboard comparing Mistral Large 4 and MiniMax M3 on input and output price, Artificial Analysis Index, input modalities, maximum output and release date.

O placar não está apertado, e também não é justo.

No Artificial Analysis Intelligence Index v4.3.2, o MiniMax M3 obtém 29,2 pontos e ocupa a 62.ª posição entre 147 modelos. É um resultado de meio da tabela e não constitui uma crítica ao modelo — o Index foi revisto após o lançamento do M3 e inclui avaliações que não existiam quando a MiniMax estava a treinar. A sua subpontuação em programação conta uma história melhor: 58,6 no índice AA Coding, 46.º entre 138, e 65,2% no Terminal-Bench 2.1. Regista 92,9% no GPQA Diamond, 83% em recordação de contexto longo e 47,1% no SciCode.

O Mistral Large 4 não tem pontuação de Índice no mesmo quadro; a página está no ar sob o título "Mistral Large 4 Preview" e o número está ausente. O que a Mistral publica é que o ML4 lidera o DeepSeek V4 Pro 0813 e o Qwen3.8 Max no Coding Agent Index combinado, com 49,8%, e que no AutomationBench — 657 fluxos de trabalho empresariais em Gmail, Sheets, Slack e Salesforce — ele obtém 59,9%, à frente do Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro. A MiniMax não é nomeada em nenhuma das comparações, o que por si só é um sinal sobre qual modelo a Mistral considera o verdadeiro concorrente.

Então, a leitura justa é esta: o M3 é um modelo capaz, barato e bem documentado, com uma pontuação geral de meio de tabela e um perfil de programação respeitável, com cinco meses de existência. O ML4 é um modelo de pré-visualização com um teto declarado mais alto, nenhuma pontuação geral publicada e um conjunto de métricas agênticas que a Artificial Analysis avaliou em privado e publicará no Coding Agent Index quando esse harness for lançado. Se você precisa de um número hoje, o M3 fornece um. Se puder esperar algumas semanas, o ML4 também fornecerá um, e a Mistral está apostando que será mais alto.

Onde o M3 não tem concorrência alguma do ML4

Duas linhas nessa lista não são um trade-off, são uma ausência.

A entrada de vídeo vem em primeiro lugar. O M3 aceita vídeo nativamente, ao lado de texto e imagens. O Mistral Large 4 aceita texto e imagens e nada mais — a análise aprofundada da própria Mistral é sobre grounding em imagens de satélite de gigapixel e desenhos de engenharia, o que ainda é trabalho com imagens. Se o seu pipeline ingere gravações de tela, filmagens de vigilância ou documentação em vídeo, o ML4 não pode ser o modelo, independentemente do preço. Isso não é uma lacuna que a Mistral fechará com um reajuste de preço.

O comprimento da saída é o segundo. O M3 emite até 512.000 tokens em uma única resposta. A Mistral não publicou nenhum teto de saída para o ML4. Gerar um artefato estruturado longo em uma única passagem — um relatório completo, um grande script de migração, uma especificação completa — é a carga de trabalho onde um teto de 512K vale mais do que um ponto do Intelligence Index, e até que a Mistral documente o limite do ML4, o M3 é o único dos dois em torno do qual você pode planejar essa carga de trabalho.

Os números agênticos do M3 relatados pelo fornecedor reforçam o mesmo perfil. A MiniMax o coloca em 83,5 no BrowseComp para pesquisa autônoma na web, 70 no OSWorld-verified para uso de computador, 74,2 no MCP Atlas para uso de ferramentas, 76,7 nas rubricas GDPval e 59 no SWE Bench Pro. Esses valores vêm das próprias avaliações da MiniMax e não foram reproduzidos de forma independente, e destoam estranhamente de sua pontuação de 29,2 no Index — e é justamente por isso que a distinção entre fornecedor e independente importa. Um modelo pode liderar benchmarks escolhidos pelo fornecedor e ficar no meio da tabela numa média neutra de dez avaliações, e ambas as coisas podem ser verdadeiras.

Vale a pena o 2x?

A diferença de preço aqui é genuinamente pequena em termos absolutos, o que muda o cálculo em comparação com um descasamento diante de um modelo de ponta fechado. Considere um mês de cem milhões de tokens com uma proporção entrada/saída de 4:1: 80 milhões de tokens de entrada e 20 milhões de saída. O M3 cobra US$ 24 mais US$ 24, um total de US$ 48. O Mistral Large 4 cobra US$ 54,40 mais US$ 41,80, um total de US$ 96,20. O prêmio é de cerca de US$ 48 por mês — dinheiro de verdade em escala, mas o tipo de diferença que uma única falha evitada paga.

O cache estreita ainda mais a diferença, e apenas marginalmente a favor do M3: $0,06 contra $0,07 por milhão de tokens em cache é um erro de arredondamento neste nível de preço. Ambos são baratos o suficiente para que a decisão seja tomada com base em capacidade e adequação, e não na fatura, que é o oposto de como esta comparação parece à primeira vista.

O que o premium compra é extensão. O ML4 foi treinado cinco meses depois, com dados mais novos, em uma arquitetura de mistura de especialistas com um trilhão de parâmetros, 49 bilhões ativos, e a Mistral está executando aprendizado por reforço nele a uma taxa declarada de 33 bilhões de tokens por dia, com uma execução que ainda não saturou. O M3 está concluído; o ML4 está melhorando em uma cadência publicada. Quando um fornecedor diz que o modelo que você está comprando hoje é a versão mais fraca pela qual você algum dia pagará, e o adicional em relação ao incumbente é inferior a um dólar por milhão de tokens, o modelo mais novo geralmente é a melhor opção padrão. A exceção são as duas cargas de trabalho acima, em que o modelo mais antigo é o único que se encaixa.

Roteando em torno da lacuna

A screenshot of the OrcaRouter model page for MiniMax M3, showing the minimax/minimax-m3 route from MiniMax, its text, image and video input, and the $0.30 input and $1.20 output price per million tokens.

Este é um emparelhamento em que executar ambos não é uma proteção, mas a resposta propriamente dita, porque os dois modelos são fortes em áreas distintas. Vídeo de entrada, artefacto longo de saída, ou um ciclo de utilização de computador: M3. Análise de documentos e imagens, fluxos de trabalho agênticos, ou qualquer coisa que precise de correr em infraestrutura europeia sob as suas próprias políticas: ML4. Não há nenhuma regra de encaminhamento que torne um deles redundante.

Ambos ficam atrás de um endpoint compatível com OpenAI no OrcaRouter com 0% de markup e preços de tabela dos provedores repassados sem modificação, o que mantém honesta uma variação de preço de cinco meses — se a MiniMax reduzir a tarifa do M3 ou a Mistral encerrar a tarifa de pré-visualização, o número pelo qual sua rota é avaliada muda no mesmo dia. A DSL de roteamento é o que transforma as forças disjuntas em uma superfície de chamada única: uma regra que inspeciona a modalidade da requisição envia cargas úteis com vídeo para o M3 e todo o resto para o ML4, com a confiança de que as oscilações de disponibilidade de um modelo de pré-visualização são absorvidas por failover automático em vez de propagadas aos seus usuários. Onde uma única saída importa mais do que um único preço, a fusão de modelos pode executar ambos e deixar um painel escolher, o que é uma maneira razoável de comprar o teto alegado da Mistral enquanto mantém o comportamento documentado do M3 como piso.

A decision card headed When each one wins, matching MiniMax M3 to video input and 512K output at $0.30 and $1.20, and Mistral Large 4 to image and document work that runs in Europe.

Veredito

O MiniMax M3 é a resposta certa para duas cargas de trabalho e uma resposta defensável para uma terceira. Entrada de vídeo, geração em uma única passagem com centenas de milhares de tokens e agentes de uso de computador são o seu território, o seu preço é o mais baixo de qualquer modelo de ponta nesta classe, e as suas pontuações publicadas de meio da tabela significam que você sabe exatamente o que está recebendo. Cinco meses de idade não é velho para um modelo que não foi superado no seu próprio nicho.

Mistral Large 4 é a melhor opção padrão para todo o resto. Um mês de cem milhões de tokens custa cerca de $48 a mais, a contagem de parâmetros e a linhagem de treinamento europeia apontam para um teto mais alto, as alegações de segurança cibernética são específicas o suficiente para serem verificáveis, e os pesos abertos prometidos mais a implantação local atendem a requisitos que a história empresarial somente API do M3 não atende. O preço dessa aposta é que você está se comprometendo com um modelo cuja pontuação no Independent Intelligence Index ainda não foi publicada e cujo comportamento a Mistral diz que mudará substancialmente em poucas semanas.

As duas datas que resolvem isso: o fim de outubro de 2026, quando os pesos do ML4 ou são lançados, ou a promessa de pesos abertos começa a parecer frágil, e a publicação do Coding Agent Index, em que os 49,8% avaliados em privado da Mistral encontram a pontuação pública de codificação de 58,6 da M3 na mesma revisão. Até lá, o M3 é o modelo que você pode verificar, e o ML4 é o modelo em que você está apostando — e, com um prêmio mensal de US$ 48 sobre cem milhões de tokens, isso não é uma aposta grande.