Cartão de destaque gerado, intitulado Claude Sonnet 5.5 vs MiniMax M3, com o subtítulo onde o modelo 15x mais barato empata, com três cartões de métricas: recall de contexto longo 82,7% vs 83,0%, Terminal-Bench 4.0 63,6% vs 2,0%, e custo por tarefa $7,60 vs $0,51, com um rodapé com o texto Todos os números conforme o Artificial Analysis v4.3.2; especificações do MiniMax M3 conforme a MiniMax.
Guides & Insights

Claude Sonnet 5.5 vs MiniMax M3: Onde o modelo 15× mais barato realmente empata

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há uma linha no quadro independente em que MiniMax M3 e Claude Sonnet 5.5 são o mesmo modelo, e não é aquela que qualquer um adivinharia. Na recuperação de contexto longo, MiniMax M3 pontua 83,0% e Claude Sonnet 5.5 pontua 82,7%. MiniMax M3 custa US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. Claude Sonnet 5.5 custa US$ 2,00 e US$ 10,00. Em todo o Intelligence Index, o custo medido do M3 é de US$ 0,51 por tarefa, contra US$ 7,60 para o Claude Sonnet 5.5 — quinze vezes mais barato, e na única avaliação que mede se um modelo ainda consegue encontrar algo em um documento muito longo, ele não está atrás de forma alguma.

Depois você abre as avaliações agênticas e o quadro se inverte de forma tão radical que deixa de ser uma comparação. No Terminal-Bench 4.0, que pede a um modelo para operar um shell e de fato concluir uma tarefa de software, o MiniMax M3 obtém 2,0% e o Claude Sonnet 5.5 obtém 63,6%. Uma diferença de trinta vezes no único benchmark que mais se aproxima do trabalho de produção não é uma questão de preço, e nenhuma economia por token sobrevive a ela. A pergunta útil que este confronto levanta não é “qual é melhor”, mas qual destes dois modos de falha sua carga de trabalho consegue absorver: o MiniMax M3 é o modelo de pesos abertos, de um milhão de tokens e com vídeo nativo que se equipara a um modelo de fronteira em recuperação e colapsa na execução, e o Claude Sonnet 5.5 é o modelo fechado lançado em 28 de setembro de 2026 para fazer o oposto.

O que cada um é, dito claramente

O MiniMax M3 é o modelo de fundação de pesos abertos carro-chefe do laboratório chinês, anunciado em 1º de junho de 2026 e disponível para download sob a licença comunitária da própria MiniMax. É uma mistura de especialistas com aproximadamente 428 bilhões de parâmetros totais e cerca de 23 bilhões ativos por token, e é nativamente multimodal no sentido forte: texto, imagem e vídeo entram e texto sai, com o pipeline multimodal reconstruído desde a primeira etapa de pré-treinamento, em vez de ser adicionado posteriormente. A janela é de 1.048.576 tokens — com um mínimo utilizável garantido de 512.000 em nossa própria entrada de catálogo — e a saída máxima é de 512.000 tokens, que é um número nosso e não do fornecedor, porque a MiniMax não publica um. A arquitetura é a MiniMax Sparse Attention, tema do arXiv 2606.13392, e a alegação do fornecedor para ela é de pré-preenchimento mais de 9× mais rápido e decodificação mais de 15× mais rápida do que a geração anterior em uma janela de um milhão de tokens. Esses são números do fornecedor e não os vimos reproduzidos de forma independente.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da A​nthropic, com um dia de vida no momento em que escrevo, e é fechado. A A​nthropic o descreve como a melhor combinação de velocidade e inteligência da linha, e as especificações são 1.000.000 de tokens de contexto, 128.000 tokens de saída síncrona com 300.000 na Message Batches API, entrada de texto, imagem e arquivo, raciocínio adaptativo com esforço selecionável, corte de conhecimento em junho de 2026 e retenção zero de dados disponível desde o lançamento. Seu preço não mudou em relação ao Claude Sonnet 5: US$ 2,00 de entrada, US$ 10,00 de saída, US$ 0,20 para leituras de cache, US$ 2,50 para gravações de cache. A A​nthropic diz que ele é 30% mais rápido e custa até 30% menos por tarefa do que o Claude Sonnet 5 — números do fornecedor, não reproduzidos, e que devem ser lidos como afirmações sobre contagens de tokens, e não sobre tarifas, já que as tarifas são idênticas.

A forma do benchmark é a história inteira

Ambos os modelos são medidos no mesmo índice, revisão v4.3.2, e os resultados por avaliação são o que torna este emparelhamento interessante em vez de desequilibrado.

• Recall de contexto longo — MiniMax M3 83,0% vs Claude Sonnet 5.5 82,7%, uma diferença de erro de arredondamento em um empate genuíno

• SciCode — MiniMax M3 47,1% vs Claude Sonnet 5.5 61,0%, uma diferença real, mas superável

• O Último Exame da Humanidade — MiniMax M3 39,0% vs Claude Sonnet 5.5 55,0%

• Terminal-Bench 4.0 — MiniMax M3 2,0% vs Claude Sonnet 5.5 63,6%, ponto em que a comparação deixa de ser útil

• Índice de Inteligência — MiniMax M3 29 vs Claude Sonnet 5.5 56

• Custo por tarefa do Index — MiniMax M3 US$ 0,51 vs Claude Sonnet 5.5 US$ 7,60

• Tokens de saída gerados em todo o Índice — MiniMax M3 120M vs Claude Sonnet 5.5 410M

• Velocidade de saída — MiniMax M3 115,3 tokens/seg vs Claude Sonnet 5.5 138,7 tokens/seg

Leia essas linhas em ordem e um modelo coerente emerge. O MiniMax M3 é competente em raciocínio estático e recuperação e fraco em execução sustentada. Seu resultado no Terminal-Bench não é uma deficiência modesta; uma pontuação de 2,0% significa que o modelo essencialmente não conclui as tarefas, e o mesmo padrão aparece em sua pontuação de benchmark de automação de 0,21 contra 0,71, e em uma pontuação de onisciência de 1,35 contra 32,3. Onde o MiniMax M3 se mantém firme é exatamente onde sua arquitetura alega uma vantagem: uma entrada genuinamente longa, lida e respondida. Isso é o MSA fazendo aquilo para o que a M​iniMax o vendeu.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

A linha de custo acrescenta um segundo ponto, menos óbvio. O MiniMax M3 não é apenas mais barato por token — 1/6,7 na entrada e 1/8,3 na saída — como também gasta menos tokens para chegar a uma resposta, cerca de 120 milhões contra 410 milhões no mesmo painel. Dois efeitos se multiplicam na diferença de quinze vezes por tarefa. Parte dessa diferença é eficiência genuína e parte é simplesmente o fato de o MiniMax M3 desistir mais cedo de tarefas nas quais está falhando; uma tarefa barata que retorna a resposta errada não é uma economia, e esta é a lição mais barata do artigo.

A dimensão que a tabela de preços não consegue mostrar

O MiniMax M3 tem uma propriedade que o Claude Sonnet 5.5 não tem e não pode adquirir: você pode ficar com os pesos. Isso importa para exatamente uma classe de comprador e, para esse comprador, pesa mais do que tudo o que foi dito acima. Se uma requisição não pode sair de uma jurisdição, não pode atravessar uma fronteira de rede, ou precisa rodar onde nenhuma API é acessível, um modelo sem pesos baixáveis não é opção a preço algum, e um modelo aberto de 428 bilhões de parâmetros é. A mesma propriedade é uma desvantagem na direção oposta: hospedar 428B parâmetros por conta própria com 23B ativos é uma decisão de capital, não uma chave de API, e as próprias alegações de atenção esparsa da MiniMax existem porque a alternativa com um milhão de tokens é infraestrutura cara demais.

Para todos os demais, a formulação honesta é que esta é uma linha de construir versus comprar com um preço no centro. {{1}}Claude Sonnet 5.5{{/1}} é o melhor modelo para {{2}}qualquer coisa que exija codificação ou raciocínio de verdade{{/2}}. {{3}}Mini Max M3{{/3}} é o melhor modelo para ler algo enorme e responder a uma pergunta sobre isso, e é drasticamente o melhor modelo para processar vídeo, o qual {{4}}Claude Sonnet 5.5{{/4}} não aceita de maneira alguma — sua superfície de entrada é {{5}}texto, imagens e arquivos{{/5}}.

Pesos do M3 abertos sob licença comunitária do M3 vs Claude 5.5 fechado

• Modalidade de entrada — MiniMax M3 texto, imagem e vídeo vs Claude Sonnet 5.5 texto, imagem e arquivo

• Saída máxima — MiniMax M3 512.000 tokens conforme nosso catálogo vs. Claude Sonnet 5.5 128.000 em modo síncrono, 300.000 em Batches

• Preço de cache — MiniMax M3 $0.06 por milhão de leitura vs Claude Sonnet 5.5 $0.20 de leitura e $2.50 de escrita

• Controle de esforço — pensamento do MiniMax M3 habilitado, adaptativo ou desabilitado vs. pensamento adaptativo do Claude Sonnet 5.5, em que desabilitar agora exige abetween_tools forma

• Retenção de dados — MiniMax M3 regido pela sua própria implantação se auto-hospedado vs Claude Sonnet 5.5, retenção zero de dados disponível pela Anthropic no lançamento

Executando ambos sem executar dois contratos

Misture um modelo chinês de pesos abertos e um modelo Anthropic fechado em um mesmo pipeline e o custo operacional normalmente não são os tokens; é o segundo contrato, a segunda chave, o segundo conjunto de limites de taxa e o segundo lugar onde uma falha pode acontecer. O OrcaRouter reduz tudo isso a um único endpoint compatível com a OpenAI que cobre mais de 200 modelos, com o preço de tabela do provedor repassado sem alteração — sem margem adicionada a nenhum dos lados —, failover automático entre provedores upstream e uma DSL de roteamento para compor vários modelos em uma única chamada. O MiniMax M3 é roteável aqui como minimax/minimax-m3 a $0.30 e $1.20 da MiniMax, com leituras de cache a $0.06, e é um dos modelos mais movimentados do catálogo em termos de tráfego, o que já é um sinal útil por si só: a camada de roteamento pode lhe dizer quanta carga real um modelo está carregando, não apenas como ele pontuou.

O Claude Sonnet 5.5 ainda não está no nosso catálogo, e este artigo não vai fingir o contrário. A via para o alcançar hoje é a própria API da Anthropic. O Claude Sonnet 5 é encaminhável aqui pelo mesmo preço de $2,00 e $10,00 e já o é desde 30 de junho, sendo o alvo natural de transição e o parceiro de failover enquanto o seu sucessor conta apenas um dia de vida.

Essa combinação — a troca de contexto longo e o caminho agêntico por trás de uma única credencial — é para isso que serve um roteador. O MiniMax M3 carrega 63,2 milhões de tokens de tráfego por semana através deste catálogo, contra 7,9 milhões do Claude Sonnet 5, então o modelo barato não é um substituto teórico aqui; ele já está carregando o volume. Rotear ambos a partir de uma única chave significa que a divisão é uma decisão de configuração pela qual você pode mover o tráfego, em vez de um segundo contrato que você precisa assinar antes de poder testar o lado mais barato.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

O que fazer com a gravata

Se a sua carga de trabalho for de perguntas e respostas em escala de documento — uma entrada muito longa, uma resposta factual curta, uma latência tolerável —, o empate em contexto longo é real, e a vantagem de custo de quinze vezes do MiniMax M3 também é real junto com ele. Essa é uma troca direta e que vale a pena testar esta semana.

Se a sua carga de trabalho for agêntica, a linha do Terminal-Bench resolve a questão antes de o preço entrar na conversa. Claude Sonnet 5.5, a US$ 7,60 por tarefa do Index, contra MiniMax M3, a US$ 0,51, é um prêmio de 15× por um modelo que obtém sessenta pontos a mais na avaliação mais parecida com o seu tráfego de produção, e a opção quinze vezes mais barata que falha na tarefa é a que sai cara. A medição a fazer nos seus próprios dados é tokens por tarefa concluída, não tokens por requisição, porque esse é o único número neste artigo diante do qual a vantagem de preço do MiniMax M3 não se sustenta por padrão.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente