Um cartão de título principal para MiniMax M3 vs Muse Spark 1.2, com o subtítulo 'Preço por token, contexto, taxa de transferência e onde os benchmarks divergem', mostrando dois cartões arredondados abstratos frente a frente, separados por um fino divisor vertical, com o cartão da esquerda em azul e o da direita em ciano, e o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

MiniMax M3 vs Muse Spark 1.2: Uma diferença de preço de 4x contra uma varredura de benchmarks

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MiniMax M3 custa US$ 0,30 por milhão de tokens de entrada no nosso catálogo. Muse Spark 1.2 custa US$ 1,25. Isso representa uma diferença de 4,2x na entrada e de 3,5x na saída, e é o fato mais útil sobre esse pareamento, porque, nas mesmas páginas do catálogo, o Muse Spark 1.2 supera o MiniMax M3 em todas as linhas de benchmark que os dois modelos compartilham. Um é a opção barata de pesos abertos, com 512K de contexto utilizável garantido pelo fornecedor e um teto de saída de 512K. O outro é um checkpoint de raciocínio da Meta que agora está uma geração atrás de sua própria família e ainda supera o MiniMax M3 em quase todos os lugares. O restante desta página trata de qual desses dois fatos realmente decide uma carga de trabalho — e a resposta não é a mesma para toda carga de trabalho.

O que cada um desses modelos realmente é

Ambos foram lançados este ano e nenhum dos dois é novo. Isso importa, porque uma página de comparação escrita como se qualquer um dos dois estivesse sendo lançado fica desatualizada em um mês.

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 é um lançamento da própria MiniMax, anunciado no blog do fornecedor em 2026-06-01 sob o título "MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model". O post começa de forma direta: "MiniMax M3 is officially released today". As três alegações da MiniMax sobre ele são que alcança desempenho de nível de fronteira em codificação e trabalho agêntico, que utiliza MSA (MiniMax Sparse Attention), uma nova arquitetura de atenção proposta pela empresa, e que é nativamente multimodal — aceita entrada de imagem e vídeo e, nas palavras da MiniMax, "can operate a desktop computer". A MiniMax acrescenta que essas três capacidades são o mínimo exigido para modelos de fronteira de código fechado, e que o M3 é "the first and only open-weight model to bring all three together". Nosso catálogo lista o modelo como disponível desde 2026-05-31, um dia antes da data do blog.

Muse Spark 1.2 é da Meta. Nosso catálogo o data de 2026-08-05. Não é um novo nível — é um checkpoint atualizado em relação ao Muse Spark 1.1, com desempenho ligeiramente superior, servido no mesmo nível Standard, com preço idêntico, o que o torna uma atualização substituta direta, e não um produto separado. Sua característica distintiva é a superfície de entrada: texto, imagens, vídeo, áudio e PDF. A saída é texto.

Um detalhe de contexto pertence aqui, em vez de ficar enterrado mais adiante. A Meta avançou a família Muse Spark para um checkpoint 1.3 em 2026-09-02, o que faz da 1.2 a geração anterior de sua própria linha. Isso aconteceu há três semanas, então não é novidade, e esta página não trata isso como notícia — mas qualquer pessoa que esteja escolhendo entre esses dois hoje deve saber que está comparando um modelo MiniMax atual com um modelo Meta superado.

Preço por milhão de tokens e quanto uma carga de trabalho realmente custa

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

As tarifas publicadas, retiradas da página de cada modelo em nosso próprio catálogo, que repassa o preço de tabela do fornecedor sem qualquer margem adicionada:

• Entrada — MiniMax M3 $0.30 por 1M de tokens vs Muse Spark 1.2 $1.25 por 1M de tokens

• Saída — MiniMax M3 $1.20 por 1M vs Muse Spark 1.2 $4.25 por 1M

• Leitura de cache — MiniMax M3 $0,060 por 1M vs Muse Spark 1.2 $0,150 por 1M

• Proporção — Muse Spark 1.2 é 4,2x na entrada, 3,5x na saída, 2,5x em leituras de cache

Essas proporções abstratas tornam-se concretas na calculadora de custos de cada página. Defina ambos como 10 milhões de tokens por mês, com 70% de tokens de entrada — um perfil razoável para uma tarefa de sumarização ou extração, e o padrão com que o estimador é fornecido — e o MiniMax M3 fica em $5,70 por mês. O Muse Spark 1.2 fica em $11,30 por mês. Ative a cache de prompts e a mesma carga de trabalho fica em cerca de $4,86 contra cerca de $9,63. A calculadora apresenta ambos como estimativas com base no preço de tabela, o que é a ressalva correta: as contagens reais de tokens dependem do tokenizer do fornecedor.

Para uma carga de trabalho barata, a diferença é dinheiro de café. O importante é a forma da curva, não o valor absoluto: uma carga de trabalho de cem milhões de tokens por mês, com forte peso de saída, passa da casa dos três para a dos quatro dígitos só do lado do Muse Spark. Se o custo é a restrição que o fez considerar esta combinação, esse é o número a modelar no seu próprio tráfego.

Como repassamos o preço de tabela do fornecedor diretamente, sem margem, um corte de preço do fornecedor aparece do nosso lado no mesmo dia em que é anunciado, e ambos esses modelos são encaminhados para cá — uma chave cobre os dois, então precificá-los um contra o outro não exige um segundo contrato nem uma alteração de código.

Janela de contexto, e o que realmente cabe nela

Esta é a seção em que os dois são mais parecidos em uma ficha técnica e menos parecidos em uso.

Janela de contexto — MiniMax M3 1.048.576 tokens vs Muse Spark 1.2 1.048.576 tokens

• Saída máxima — MiniMax M3 512.000 tokens vs Muse Spark 1.2 131.072 tokens

• Superfície de entrada — MiniMax M3 texto, imagem e vídeo vs Muse Spark 1.2 texto, imagem, vídeo, áudio e PDF

• Superfície de saída — ambos emitem apenas texto

• Parâmetros estruturados — o MiniMax M3 expõe tools e tool_choice; o Muse Spark 1.2 expõe reasoning_effort e structured_outputs

Ambas as janelas são de um milhão de tokens, então a pergunta "quem tem mais contexto" não tem vencedor. A linha de saída máxima é onde elas se diferenciam: uma resposta do MiniMax M3 pode chegar a 512.000 tokens, cerca de quatro vezes o teto de 131.072 do Muse Spark 1.2. Se o seu trabalho é geração de textos longos — uma reescrita de arquivo completo, um relatório longo, uma saída em escala de transcrição — essa diferença é estrutural, não incremental. Se o seu trabalho é respostas curtas sobre uma entrada longa, isso é irrelevante.

A linha da superfície de entrada corta no sentido oposto. O Muse Spark 1.2 aceita áudio e PDF diretamente; a superfície de entrada documentada do MiniMax M3 para em imagem e vídeo. Um pipeline que ingere gravações de chamadas ou documentos digitalizados tem uma quantidade diferente de pré-processamento a fazer em cada um desses dois.

Do lado da MiniMax, a alegação de contexto traz uma nota arquitetural que vale a pena rotular claramente como sendo do próprio fornecedor. A MiniMax atribui o comportamento de contexto longo do M3 à MSA (MiniMax Sparse Attention), que nosso catálogo descreve como suportando até 1M de tokens de contexto "com um mínimo garantido de 512K". O enquadramento de mínimo garantido é da MiniMax; não há medição independente disso à qual possamos apontar, então trate o piso de 512K como uma alegação do fornecedor, e não como um número testado.

Latência e vazão no nosso próprio gateway

Estes são os números sobre os quais podemos falar mais diretamente, porque são nossos próprios números. Eles abrangem os sete dias até 2026-09-23 e descrevem o tráfego no nosso gateway, não um benchmark de fornecedor.

• p50 tempo até o primeiro token — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s

• tempo p95 até o primeiro token — MiniMax M3 10,00 s vs Muse Spark 1.2 10,00 s

• Velocidade de saída — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s

• Taxa de erro — MiniMax M3 0,12% vs Muse Spark 1.2 0,15%

• Tráfego, últimos 7 dias — MiniMax M3 153,8 M tokens vs. Muse Spark 1.2 79,6 M tokens

Leia isto com honestidade e o quadro fica dividido. No tempo até o primeiro token, os dois estão próximos — 4,28 contra 4,82 segundos na mediana, e o p95 é idêntico até o centésimo, em 10,00 segundos, o que é um artefato de arredondamento de ambos estarem perto do mesmo teto, e não um empate real. Na velocidade de saída, eles não estão nem perto: o Muse Spark 1.2 transmite a cerca de 1,75x a taxa do MiniMax M3, o que muda como uma geração longa é sentida por um usuário que a acompanha, mesmo quando o custo total é maior. As taxas de erro estão dentro de um erro de arredondamento entre si, e ambas são baixas.

A linha de tráfego vale a pena ser lida como um sinal, e não como um placar: ao longo dos mesmos sete dias, o MiniMax M3 moveu cerca de duas vezes mais tokens do que o Muse Spark 1.2 no nosso gateway. Isso é o que o mercado está escolhendo, não o que os benchmarks dizem, e, nesta comparação, os dois discordam.

Encaminhar ambos por trás de um único endpoint também é a forma barata de descobrir qual deles sua carga de trabalho prefere, porque o failover significa que uma degradação do lado do provedor em qualquer um dos modelos recai sobre um caminho que funciona, em vez de virar um erro.

Chamada de ferramentas e trabalho agêntico de longo horizonte

É aqui que os dois estão mais distantes nos resultados medidos e onde as ressalvas mais importam.

• Terminal-Bench v2.1 — MiniMax M3 52,4 vs Muse Spark 1.2 80,1

• tau_banking (uso de ferramentas) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8

• MCP Atlas — MiniMax M3 74.2 (informado pelo fornecedor) vs Muse Spark 1.2 não medido

• BrowseComp — MiniMax M3 83,5 (informado pelo fornecedor) vs Muse Spark 1.2 não medido

• OSWorld-Verified — MiniMax M3 70,0 (informado pelo fornecedor) vs. Muse Spark 1.2 não medido

As duas primeiras linhas vêm do painel de benchmarks nas nossas próprias páginas de catálogo e são as únicas linhas agênticas que ambos os modelos preencheram. Elas não estão próximas: o Muse Spark 1.2 mais que dobra o MiniMax M3 em tau_banking e lidera o Terminal-Bench v2.1 por quase 28 pontos. Se a sua carga de trabalho for um agente de horizonte longo com uma superfície de ferramentas, essa é a maior lacuna isolada desta página.

As próximas três linhas são números da própria MiniMax, publicados no post de lançamento. Elas não são comparáveis às duas primeiras — harnesses diferentes, nenhuma auditoria independente —, mas são os únicos números publicados do MiniMax M3 nessas tarefas, então deixá-las de fora subestimaria o modelo. Leia-as como dados relatados pelo fornecedor e nada mais.

Uma divergência merece um parágrafo próprio, porque é o tipo de coisa que uma página de comparação geralmente ameniza. O post de lançamento da MiniMax mostra o Terminal-Bench 2.1 em 66,0 para o M3, dentro de uma imagem de gráfico sem tabela numérica que a acompanhe. A linha independente do Terminal-Bench v2.1 em nossa página de catálogo mostra 52,4 para o mesmo modelo. Os nomes das tarefas são próximos o suficiente para que os leitores se deparem com eles lado a lado, e os dois valores diferem em mais de 13 pontos. Não vamos declarar que um deles está errado: a explicação provável é uma estrutura de teste diferente ou uma configuração de execução diferente, e a afirmação honesta é que o número do próprio fornecedor e o número auditado discordam, sendo o do fornecedor o mais alto.

As listas de parâmetros contam uma história menor e mais prática. O MiniMax M3 expõe tools e tool_choice, então a seleção de ferramentas pode ser direcionada a partir da requisição. O Muse Spark 1.2 expõe reasoning_effort, então a profundidade do raciocínio pode ser direcionada em vez disso. Nenhum dos dois expõe o controle do outro. Se o problema de controle da sua aplicação é "fazer com que ela chame a função correta", isso aponta para um lado; se é "fazer com que ela pense mais nos casos difíceis", isso aponta para o outro.

Codificação

A programação é a principal alegação do MiniMax M3 e o ponto onde a lacuna medida é mais incômoda para ele.

• Índice de Codificação AA — MiniMax M3 38,7 vs Muse Spark 1.2 72,2

• SciCode — MiniMax M3 43,1 vs Muse Spark 1,2 57,4

• SWE-Bench Pro — MiniMax M3 59.0 (relatado pelo fornecedor) vs Muse Spark 1.2 não medido

• KernelBench Hard — MiniMax M3 28,8 (informado pelo fornecedor) vs Muse Spark 1.2 não medido

O posicionamento da MiniMax para o M3 prioriza a programação: a manchete de lançamento coloca o "Frontier Coding" à frente do contexto de um milhão de tokens e da multimodalidade. Seu próprio número divulgado de 59,0 no SWE-Bench Pro é um valor forte no harness do fornecedor. No entanto, nas linhas independentes do Coding Index e do SciCode que ambos os modelos preencheram, o Muse Spark 1.2 lidera por uma margem ampla, e a diferença de 33 pontos no Coding Index é a segunda maior desta página, atrás apenas de tau_banking.

Não há forma honesta de apresentar o MiniMax M3 como o melhor modelo de programação com as evidências disponíveis. O que se pode dizer é que os números de programação do próprio fornecedor são altos e os independentes não são, seguindo o mesmo padrão da divergência do Terminal-Bench acima. Quem basear a sua decisão em programação deve dar mais peso às linhas auditadas do que aos gráficos do anúncio de lançamento, e deve testar no seu próprio repositório, em vez de testar em qualquer um deles.

Onde eles são genuinamente próximos

Três linhas recusam-se a produzir um vencedor, e dizer isso é mais útil do que fabricar um.

• GPQA Diamond — MiniMax M3 89.9 vs Muse Spark 1.2 90.4, uma diferença de 0,5 ponto que é um empate para todos os efeitos práticos

• p95 tempo até o primeiro token — ambos 10,00 s nos últimos sete dias no nosso gateway

• Janela de contexto e modalidade de saída — idênticas em 1.048.576 tokens de entrada e saída somente de texto

Em raciocínio científico de nível de pós-graduação, os dois são efetivamente indistinguíveis, e essa é a única categoria de raciocínio em que o modelo muito mais barato do MiniMax M3 se equipara ao mais caro. Vale lembrar ao ler os índices agregados: a diferença entre esses modelos não é uniforme entre as capacidades; ela se concentra em trabalho agêntico e de programação, e é praticamente zero em múltipla escolha com forte carga de conhecimento.

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

Escolha o MiniMax M3 se, escolha o Muse Spark 1.2 se

Os dois fatos do parágrafo inicial resolvem-se de maneira diferente dependendo do que você está construindo, então aqui está a divisão sem rodeios.

• Escolha o MiniMax M3 se o custo por token for a restrição determinante, se você precisar de saídas de formato longo além de 131.072 tokens, se precisar de pesos abertos, se quiser entrada de vídeo sem um pipeline separado, ou se quiser trabalho de conhecimento com uso intenso de raciocínio por cerca de um quarto do preço de entrada — o GPQA Diamond está em empate técnico, e é nessa linha que o modelo barato justifica seu lugar.

• Escolha o Muse Spark 1.2 se a sua carga de trabalho for um agente de horizonte longo com ferramentas, se você precisar das pontuações de codificação auditadas mais altas, se quiser um ajuste explícito de reasoning_effort, se precisar ingerir áudio ou PDF diretamente, ou se precisar de saída em streaming rápida — 507 tok/s contra 289 tok/s é uma diferença visível, não apenas de benchmark.

• Se você ainda não sabe qual, a evidência decisiva não está nesta página. Coloque os dois modelos à prova com uma amostra do seu próprio tráfego e faça a medição; a calculadora de preços na página de cada modelo informará o lado do custo em um minuto, e os números de latência de sete dias acima são o mais próximo de uma prévia do lado do desempenho.

Ambos estão em uma única API sem markup sobre o preço de tabela do provedor, então o teste é uma mudança de model-id em vez de uma migração, e o failover automático significa que um dia ruim em qualquer um dos provedores degrada para uma resposta mais lenta em vez de uma indisponibilidade.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente