
Claude Sonnet 5.5 vs MiniMax M3: Onde o modelo 15× mais barato realmente empata
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 931 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 192 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Há uma linha no quadro independente em que MiniMax M3 e Claude Sonnet 5.5 são o mesmo modelo, e não é aquela que qualquer um adivinharia. Na recuperação de contexto longo, MiniMax M3 pontua 83,0% e Claude Sonnet 5.5 pontua 82,7%. MiniMax M3 custa US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. Claude Sonnet 5.5 custa US$ 2,00 e US$ 10,00. Em todo o Intelligence Index, o custo medido do M3 é de US$ 0,51 por tarefa, contra US$ 7,60 para o Claude Sonnet 5.5 — quinze vezes mais barato, e na única avaliação que mede se um modelo ainda consegue encontrar algo em um documento muito longo, ele não está atrás de forma alguma.
Depois você abre as avaliações agênticas e o quadro se inverte de forma tão radical que deixa de ser uma comparação. No Terminal-Bench 4.0, que pede a um modelo para operar um shell e de fato concluir uma tarefa de software, o MiniMax M3 obtém 2,0% e o Claude Sonnet 5.5 obtém 63,6%. Uma diferença de trinta vezes no único benchmark que mais se aproxima do trabalho de produção não é uma questão de preço, e nenhuma economia por token sobrevive a ela. A pergunta útil que este confronto levanta não é “qual é melhor”, mas qual destes dois modos de falha sua carga de trabalho consegue absorver: o MiniMax M3 é o modelo de pesos abertos, de um milhão de tokens e com vídeo nativo que se equipara a um modelo de fronteira em recuperação e colapsa na execução, e o Claude Sonnet 5.5 é o modelo fechado lançado em 28 de setembro de 2026 para fazer o oposto.
O que cada um é, dito claramente
O MiniMax M3 é o modelo de fundação de pesos abertos carro-chefe do laboratório chinês, anunciado em 1º de junho de 2026 e disponível para download sob a licença comunitária da própria MiniMax. É uma mistura de especialistas com aproximadamente 428 bilhões de parâmetros totais e cerca de 23 bilhões ativos por token, e é nativamente multimodal no sentido forte: texto, imagem e vídeo entram e texto sai, com o pipeline multimodal reconstruído desde a primeira etapa de pré-treinamento, em vez de ser adicionado posteriormente. A janela é de 1.048.576 tokens — com um mínimo utilizável garantido de 512.000 em nossa própria entrada de catálogo — e a saída máxima é de 512.000 tokens, que é um número nosso e não do fornecedor, porque a MiniMax não publica um. A arquitetura é a MiniMax Sparse Attention, tema do arXiv 2606.13392, e a alegação do fornecedor para ela é de pré-preenchimento mais de 9× mais rápido e decodificação mais de 15× mais rápida do que a geração anterior em uma janela de um milhão de tokens. Esses são números do fornecedor e não os vimos reproduzidos de forma independente.

Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic, com um dia de vida no momento em que escrevo, e é fechado. A Anthropic o descreve como a melhor combinação de velocidade e inteligência da linha, e as especificações são 1.000.000 de tokens de contexto, 128.000 tokens de saída síncrona com 300.000 na Message Batches API, entrada de texto, imagem e arquivo, raciocínio adaptativo com esforço selecionável, corte de conhecimento em junho de 2026 e retenção zero de dados disponível desde o lançamento. Seu preço não mudou em relação ao Claude Sonnet 5: US$ 2,00 de entrada, US$ 10,00 de saída, US$ 0,20 para leituras de cache, US$ 2,50 para gravações de cache. A Anthropic diz que ele é 30% mais rápido e custa até 30% menos por tarefa do que o Claude Sonnet 5 — números do fornecedor, não reproduzidos, e que devem ser lidos como afirmações sobre contagens de tokens, e não sobre tarifas, já que as tarifas são idênticas.
A forma do benchmark é a história inteira
Ambos os modelos são medidos no mesmo índice, revisão v4.3.2, e os resultados por avaliação são o que torna este emparelhamento interessante em vez de desequilibrado.
• Recall de contexto longo — MiniMax M3 83,0% vs Claude Sonnet 5.5 82,7%, uma diferença de erro de arredondamento em um empate genuíno
• SciCode — MiniMax M3 47,1% vs Claude Sonnet 5.5 61,0%, uma diferença real, mas superável
• O Último Exame da Humanidade — MiniMax M3 39,0% vs Claude Sonnet 5.5 55,0%
• Terminal-Bench 4.0 — MiniMax M3 2,0% vs Claude Sonnet 5.5 63,6%, ponto em que a comparação deixa de ser útil
• Índice de Inteligência — MiniMax M3 29 vs Claude Sonnet 5.5 56
• Custo por tarefa do Index — MiniMax M3 US$ 0,51 vs Claude Sonnet 5.5 US$ 7,60
• Tokens de saída gerados em todo o Índice — MiniMax M3 120M vs Claude Sonnet 5.5 410M
• Velocidade de saída — MiniMax M3 115,3 tokens/seg vs Claude Sonnet 5.5 138,7 tokens/seg
Leia essas linhas em ordem e um modelo coerente emerge. O MiniMax M3 é competente em raciocínio estático e recuperação e fraco em execução sustentada. Seu resultado no Terminal-Bench não é uma deficiência modesta; uma pontuação de 2,0% significa que o modelo essencialmente não conclui as tarefas, e o mesmo padrão aparece em sua pontuação de benchmark de automação de 0,21 contra 0,71, e em uma pontuação de onisciência de 1,35 contra 32,3. Onde o MiniMax M3 se mantém firme é exatamente onde sua arquitetura alega uma vantagem: uma entrada genuinamente longa, lida e respondida. Isso é o MSA fazendo aquilo para o que a MiniMax o vendeu.

A linha de custo acrescenta um segundo ponto, menos óbvio. O MiniMax M3 não é apenas mais barato por token — 1/6,7 na entrada e 1/8,3 na saída — como também gasta menos tokens para chegar a uma resposta, cerca de 120 milhões contra 410 milhões no mesmo painel. Dois efeitos se multiplicam na diferença de quinze vezes por tarefa. Parte dessa diferença é eficiência genuína e parte é simplesmente o fato de o MiniMax M3 desistir mais cedo de tarefas nas quais está falhando; uma tarefa barata que retorna a resposta errada não é uma economia, e esta é a lição mais barata do artigo.
A dimensão que a tabela de preços não consegue mostrar
O MiniMax M3 tem uma propriedade que o Claude Sonnet 5.5 não tem e não pode adquirir: você pode ficar com os pesos. Isso importa para exatamente uma classe de comprador e, para esse comprador, pesa mais do que tudo o que foi dito acima. Se uma requisição não pode sair de uma jurisdição, não pode atravessar uma fronteira de rede, ou precisa rodar onde nenhuma API é acessível, um modelo sem pesos baixáveis não é opção a preço algum, e um modelo aberto de 428 bilhões de parâmetros é. A mesma propriedade é uma desvantagem na direção oposta: hospedar 428B parâmetros por conta própria com 23B ativos é uma decisão de capital, não uma chave de API, e as próprias alegações de atenção esparsa da MiniMax existem porque a alternativa com um milhão de tokens é infraestrutura cara demais.
Para todos os demais, a formulação honesta é que esta é uma linha de construir versus comprar com um preço no centro. {{1}}Claude Sonnet 5.5{{/1}} é o melhor modelo para {{2}}qualquer coisa que exija codificação ou raciocínio de verdade{{/2}}. {{3}}Mini Max M3{{/3}} é o melhor modelo para ler algo enorme e responder a uma pergunta sobre isso, e é drasticamente o melhor modelo para processar vídeo, o qual {{4}}Claude Sonnet 5.5{{/4}} não aceita de maneira alguma — sua superfície de entrada é {{5}}texto, imagens e arquivos{{/5}}.
Pesos do M3 abertos sob licença comunitária do M3 vs Claude 5.5 fechado
• Modalidade de entrada — MiniMax M3 texto, imagem e vídeo vs Claude Sonnet 5.5 texto, imagem e arquivo
• Saída máxima — MiniMax M3 512.000 tokens conforme nosso catálogo vs. Claude Sonnet 5.5 128.000 em modo síncrono, 300.000 em Batches
• Preço de cache — MiniMax M3 $0.06 por milhão de leitura vs Claude Sonnet 5.5 $0.20 de leitura e $2.50 de escrita
• Controle de esforço — pensamento do MiniMax M3 habilitado, adaptativo ou desabilitado vs. pensamento adaptativo do Claude Sonnet 5.5, em que desabilitar agora exige abetween_tools forma
• Retenção de dados — MiniMax M3 regido pela sua própria implantação se auto-hospedado vs Claude Sonnet 5.5, retenção zero de dados disponível pela Anthropic no lançamento
Executando ambos sem executar dois contratos
Misture um modelo chinês de pesos abertos e um modelo Anthropic fechado em um mesmo pipeline e o custo operacional normalmente não são os tokens; é o segundo contrato, a segunda chave, o segundo conjunto de limites de taxa e o segundo lugar onde uma falha pode acontecer. O OrcaRouter reduz tudo isso a um único endpoint compatível com a OpenAI que cobre mais de 200 modelos, com o preço de tabela do provedor repassado sem alteração — sem margem adicionada a nenhum dos lados —, failover automático entre provedores upstream e uma DSL de roteamento para compor vários modelos em uma única chamada. O MiniMax M3 é roteável aqui como minimax/minimax-m3 a $0.30 e $1.20 da MiniMax, com leituras de cache a $0.06, e é um dos modelos mais movimentados do catálogo em termos de tráfego, o que já é um sinal útil por si só: a camada de roteamento pode lhe dizer quanta carga real um modelo está carregando, não apenas como ele pontuou.
O Claude Sonnet 5.5 ainda não está no nosso catálogo, e este artigo não vai fingir o contrário. A via para o alcançar hoje é a própria API da Anthropic. O Claude Sonnet 5 é encaminhável aqui pelo mesmo preço de $2,00 e $10,00 e já o é desde 30 de junho, sendo o alvo natural de transição e o parceiro de failover enquanto o seu sucessor conta apenas um dia de vida.
Essa combinação — a troca de contexto longo e o caminho agêntico por trás de uma única credencial — é para isso que serve um roteador. O MiniMax M3 carrega 63,2 milhões de tokens de tráfego por semana através deste catálogo, contra 7,9 milhões do Claude Sonnet 5, então o modelo barato não é um substituto teórico aqui; ele já está carregando o volume. Rotear ambos a partir de uma única chave significa que a divisão é uma decisão de configuração pela qual você pode mover o tráfego, em vez de um segundo contrato que você precisa assinar antes de poder testar o lado mais barato.

O que fazer com a gravata
Se a sua carga de trabalho for de perguntas e respostas em escala de documento — uma entrada muito longa, uma resposta factual curta, uma latência tolerável —, o empate em contexto longo é real, e a vantagem de custo de quinze vezes do MiniMax M3 também é real junto com ele. Essa é uma troca direta e que vale a pena testar esta semana.
Se a sua carga de trabalho for agêntica, a linha do Terminal-Bench resolve a questão antes de o preço entrar na conversa. Claude Sonnet 5.5, a US$ 7,60 por tarefa do Index, contra MiniMax M3, a US$ 0,51, é um prêmio de 15× por um modelo que obtém sessenta pontos a mais na avaliação mais parecida com o seu tráfego de produção, e a opção quinze vezes mais barata que falha na tarefa é a que sai cara. A medição a fazer nos seus próprios dados é tokens por tarefa concluída, não tokens por requisição, porque esse é o único número neste artigo diante do qual a vantagem de preço do MiniMax M3 não se sustenta por padrão.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
