
Claude Haiku 5.5 vs. MiniMax M3.1 Flash Preview: um tem um preço, o outro tem um plano de tokens
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
MiniMax M3.1 Flash Preview não tem preço publicado por token. Não um preço alto, nem promocional — nenhum. Ele está disponível apenas por meio do Token Plan do fornecedor e de sua superfície Code, e a documentação para desenvolvedores diz isso com todas as letras. Claude Haiku 5.5, lançado em 7 de outubro de 2026, custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída até um prompt de 100.000 tokens. Portanto, a primeira coisa a dizer sobre esse confronto é que não se trata de uma comparação de preços, porque apenas um dos dois modelos tem preço. O que é, em vez disso, é uma comparação entre uma API com cobrança por uso e uma assinatura — e essa diferença decide mais sobre seus custos do que qualquer benchmark.
A segunda coisa a dizer é que o MiniMax M3.1 Flash Preview não tem ficha de modelo, nem benchmarks publicados, nem pesos e nem pontuação independente que consigamos encontrar. Ele surgiu em 27 de setembro de 2026 e é, pela própria designação do fornecedor, uma prévia acessível por meio de uma assinatura, e não de uma API. Isso não é uma crítica ao modelo; é uma descrição daquilo que você pode e não pode saber sobre ele. Tudo o que vem abaixo mantém essa linha visível.
O que cada um realmente é
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, lançado em 7 de outubro de 2026. Texto e imagem como entrada, texto como saída. Uma janela de contexto de 1M de tokens, saída máxima de 128.000 tokens (300.000 via um cabeçalho beta na Batch API), data de corte do treinamento em junho de 2026, descontinuação não antes de 7 de outubro de 2027. Esforço ajustável entre Low, Medium, High, Xhigh e Max, com Medium como padrão e pensamento adaptativo ativado por padrão. Cobrança por token, com leituras de cache a $0,01 por milhão e Batch pela metade do preço.
MiniMax M3.1 Flash Preview — MiniMax, disponível desde 27 de setembro de 2026. Uma janela de contexto de 1 milhão de tokens. Entrada de texto, imagem e vídeo, saída de texto. O raciocínio está sempre ativado, com um controle de esforço que vai de baixo a máximo. A API é compatível com Anthropic, com OpenAI e com OpenAI Responses, o que a torna praticamente uma substituição direta para qualquer um dos SDKs. O acesso é apenas pelo Token Plan e pelo MiniMax Code; não há opção de pagamento conforme o uso nem tarifa publicada.

• A comparação, dimensão por dimensão
• Preço — Claude Haiku 5.5 $0,10 por milhão de tokens de entrada e $0,50 de saída até 100K tokens, depois $0,50 e $2,50; MiniMax M3.1 Flash Preview não tem tarifa por token publicada, apenas uma assinatura do Token Plan.
• Janela de contexto — 1.000.000 de tokens cada. Esta é a única dimensão em que eles estão genuinamente no mesmo nível.
• Saída máxima — 128.000 tokens para Claude Haiku 5.5, com um caminho beta de 300.000 tokens no Batch; não publicado para MiniMax M3.1 Flash Preview.
• Modalidades de entrada — texto e imagem contra texto, imagem e vídeo. A entrada de vídeo é um verdadeiro diferencial e a MiniMax leva vantagem nisso.
• Controle de esforço — cinco posições, padrão Médio, no Claude Haiku 5.5; de baixo a máximo com o raciocínio sempre ativado no MiniMax M3.1 Flash Preview.
• Pontuação independente — Artificial Analysis Intelligence Index 43, configuração Max 43,40, segundo de 182 para Claude Haiku 5.5; nenhuma publicada para MiniMax M3.1 Flash Preview.
Custo por tarefa concluída — US$ 0,21 por tarefa do índice Artificial Analysis para Claude Haiku 5.5; não é possível calcular para MiniMax M3.1 Flash Preview sem uma pontuação e uma taxa.
• Velocidade de saída — 243,4 tokens por segundo para Claude Haiku 5.5; não reportado para MiniMax M3.1 Flash Preview.
• Pesos abertos — nenhum dos dois. Claude Haiku 5.5 é proprietário; a MiniMax não disponibilizou os pesos do M3.1 Flash Preview.
Por que uma assinatura é menos adequada do que parece
Há uma versão desta comparação em que o Token Plan é a melhor compra, e vale a pena fazer justiça a ela. Se você é uma pessoa que usa o MiniMax Code de forma interativa, uma assinatura limita seu custo a um valor mensal conhecido, independentemente de quanto você use, e o preço por token não tem um teto equivalente. Para um usuário intensivo, um plano de valor fixo quase sempre vence o medidor.
Essa lógica se inverte no momento em que a carga de trabalho é programática. Uma assinatura tem seu preço definido para o padrão de uso de um humano — em picos, interativo, autolimitado. Um agente, um job em lote ou um endpoint de produção não tem esse padrão: ele roda tanto quanto a fila exigir. Colocar esse tráfego em um plano com preço definido para uso interativo significa ou atingir um limite que você não consegue ver, ou pagar por uma licença quando o que você precisava era de throughput. E o problema de segunda ordem é pior: sem uma taxa publicada por token, não há como prever o custo conforme o volume cresce, não há como comparar com qualquer outro modelo em termos de preço, e não há como decidir se um modelo mais barato teria dado conta do recado. Um preço que você não consegue calcular é um orçamento que você não consegue defender.
O Claude Haiku 5.5 é o problema oposto da melhor maneira possível. A tarifa é publicada, os níveis são publicados, o desconto de cache é publicado, e a única armadilha é estrutural em vez de oculta: ultrapasse 100.000 tokens de prompt e ambas as tarifas serão multiplicadas por cinco. Esse é um penhasco que você pode contornar no projeto. Uma tarifa não publicada é uma névoa que você não pode contornar.
O empate de 1M de tokens, e por que ele não significa o que parece
Ambos os modelos anunciam uma {{1}}janela de contexto de 1M de tokens{{/1}}, e é essa a manchete com que ambos os fornecedores lideram. É também a dimensão em que o empate é mais enganoso, porque janelas de contexto não são a mesma coisa que contexto utilizável. {{2}}Claude Haiku 5.5{{/2}} publica uma saída máxima de 128.000 tokens junto com sua janela e cobra cinco vezes a tarifa base acima de 100.000 tokens de entrada — uma estrutura de preços que deixa claro que prompts longos são permitidos, mas não são o padrão pretendido. A MiniMax não publica saída máxima para o M3.1 Flash Preview nem qualquer preço para contexto longo, porque não publica preço algum.
O contexto longo é exatamente onde a diferença de custo entre as duas arquiteturas apareceria com mais clareza, e é exatamente o ponto em que uma delas não lhe dá número algum. Se sua carga de trabalho é genuinamente de contexto longo, essa ausência é o fato decisivo, não a cifra de 1M compartilhada.

Se o que você realmente quer é o MiniMax M3
O MiniMax M3.1 Flash Preview é uma prévia, restrita a um plano e sem pontuação. O MiniMax M3 não é nada disso. É o carro-chefe de pesos abertos que a MiniMax lançou em 31 de maio de 2026: uma janela de contexto de 1M de tokens, multimodalidade nativa que aceita texto, imagens e vídeo e retorna texto, construído sobre o MiniMax Sparse Attention, e com preço de US$ 0,30 por milhão de entrada e US$ 1,20 por milhão de saída. O Artificial Analysis o pontua com Intelligence Index 29, com um custo por tarefa de índice de US$ 0,51, 91,7 tokens por segundo de saída e um tempo de 2,16 segundos até o primeiro token, além de um desconto de cache de 80%. Ele está no catálogo do OrcaRouter hoje como minimax/minimax-m3.
O que torna concreto um ponto sobre essa comparação que uma ficha técnica esconde. O modelo MiniMax que você pode realmente comprar por token está uma geração atrás da prévia, pontua 29 no índice independente, contra 43 do Claude Haiku 5.5, custa cerca de o dobro por tarefa concluída — US$ 0,51 contra US$ 0,21 — e roda a cerca de um terço da velocidade de saída. A prévia pode muito bem superar tudo isso. Ninguém fora da MiniMax sabe, e não há como descobrir isso a partir de uma página de assinatura.

Chamando esses dois de um só lugar
O MiniMax M3.1 Flash Preview está disponível através do Token Plan da MiniMax e do MiniMax Code. O Claude Haiku 5.5 está disponível através da própria API da Anthropic e, a partir daí, onde quer que os modelos da Anthropic sejam revendidos. Nenhum dos dois está no catálogo da OrcaRouter — o que roteamos a partir deste emparelhamento é minimax/minimax-m3, ao lado de anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1, e não vamos dar a entender que disponibilizamos os dois modelos sobre os quais este artigo trata.
O que a camada de roteamento genuinamente oferece aqui é uma saída para o problema das duas formas de faturamento. minimax/minimax-m3 é medido por uso e está no nosso catálogo; o Claude Haiku 5.5 é medido por uso e está no da Anthropic. Ambos falam uma interface compatível com a OpenAI, então a comparação A/B entre eles é uma string de modelo, e não uma reescrita, e o OrcaRouter repassa o preço de tabela do provedor com 0% de margem, o que significa que uma mudança de preço da MiniMax chega à sua fatura no dia em que acontece. O modelo do Token Plan é a única peça que não pode ser normalizada dessa forma — uma assinatura não tem preço por token a repassar, que é o mesmo problema enunciado do lado do faturamento.
Como decidir sem uma pontuação
Se você precisar de entrada de vídeo, o MiniMax M3.1 Flash Preview é o único dos dois que a aceita, e, se sua carga de trabalho for interativa em vez de programática, o Token Plan é uma compra razoável. Se você precisar de um número que possa colocar em um orçamento, de uma pontuação que possa conferir e de uma janela cujo preço possa calcular, o Claude Haiku 5.5 é o único dos dois que oferece qualquer uma dessas coisas. E, se você quiser a família MiniMax em uma API com medição e com uma pontuação independente associada, a recomendação honesta é usar a geração que é de fato comprável por token, em vez de esperar por uma prévia cujos termos ainda não foram publicados.
Ambos falam uma interface compatível com a OpenAI, então o A/B entre eles é uma string de modelo em vez de uma reescrita, e o OrcaRouter repassa o preço de tabela do provedor com 0% de markup, o que significa que uma mudança de preço da MiniMax chega à sua fatura no dia em que acontece.
