Um card de título gerado para 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash', com os dois nomes de modelo de cada lado de um divisor e a legenda 'Mais barato por token, mais barato por tarefa e ainda não é a mesma decisão', sobre o rodapé 'Tabelas de preços publicadas pelo fornecedor; custos por tarefa segundo a Artificial Analysis.' O logotipo real da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash: Quando a tabela de preços e a fatura medida divergem

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tomando as duas tabelas de preços ao pé da letra, Claude Haiku 5.5 versus Xiaomi MiMo-V2.6-Flash parece uma goleada do modelo Xiaomi: US$ 0,14 e US$ 0,28 por milhão de tokens contra US$ 0,10 e US$ 0,50, uma vantagem de 1,8x na saída com uma tarifa fixa, em vez de uma que aumenta depois de 100.000 tokens. Mas basta olhar para o que as execuções independentes de tarefas realmente custaram e a ordem se inverte — o MiMo-V2.6-Flash chega a US$ 0,06231 para concluir uma tarefa que o Haiku conclui por US$ 0,2128, e ainda assim o Haiku pontua quinze por cento mais alto no mesmo placar e termina a tarefa em um terço do tempo de relógio. Nenhuma dessas quatro afirmações está errada; elas estão medindo coisas diferentes. Este artigo é sobre qual delas prevê sua fatura, e onde cada uma deixa de ser útil.

As duas tabelas de tarifas

Comece pelos números que cada fornecedor publica, porque são esses que são comparados e, na maior parte das vezes, não são os que importam:

• Preço — Claude Haiku 5.5 $0.10 / $0.50 por milhão abaixo de 100K tokens, $0.50 / $2.50 acima (lista da Anthropic); Xiaomi MiMo-V2.6-Flash $0.14 / $0.28 fixo (lista do fornecedor)

• Janela de contexto — 1.000.000 de tokens para o Claude Haiku 5.5, 1.000.000 para o MiMo-V2.6-Flash, ambos publicados pelos fabricantes

• Saída máxima — 128.000 tokens no Haiku (300.000 no Batch); não anunciado como um teto separado para o MiMo-V2.6-Flash

• Arquitetura — não divulgada para o Haiku; 309B de parâmetros totais com 15B ativos, Mixture-of-Experts, para o MiMo-V2.6-Flash (publicado pelo fornecedor)

Licença — fechada e somente via API para o Haiku; MIT para o MiMo-V2.6-Flash (publicada pelo fornecedor)

• Índice independente — 43,395 para Claude Haiku 5.5 contra 37,884 para MiMo-V2.6-Flash (Artificial Analysis)

Três dessas linhas decidem a maioria das compras reais e apontam em três direções diferentes. No preço de saída, o modelo Xiaomi é mais barato — US$ 0,28 contra US$ 0 em contexto curto. No preço de entrada, o Haiku é mais barato abaixo de 100.000 tokens e muito mais caro acima. Na janela de contexto, o modelo Xiaomi afirma ter o dobro de espaço. Apenas uma dessas três — a última — é de fato uma afirmação de capacidade, e o degrau de tarifa fixa do Haiku em 100.000 tokens significa que o preço tem uma emenda que um único par de números esconde.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, context window 1,000,000 tokens, weights closed and API-only, cost per task $0.2128, seconds per task 426. Right column Xiaomi MiMo-V2.6-Flash: input price (flat) $0.14 per million, output price (flat) $0.28 per million, context window 1,000,000 tokens, weights open under MIT, cost per task $0.0623, seconds per task 1,320. Footer reads 'Task costs and timings per Artificial Analysis; prices vendor-published.' The real OrcaRouter logo is composited bottom-right.

A conta medida

Tabelas de preços precificam tokens. Trabalho custa dinheiro. A Artificial Analysis submete ambos os modelos à mesma suíte de tarefas e publica quanto realmente custou concluir cada tarefa, uma quantidade diferente do preço por token e frequentemente um ranking diferente:

• Custo por tarefa — MiMo-V2.6-Flash $0.06231 vs Claude Haiku 5.5 $0.2128

• Tokens de saída por tarefa — MiMo-V2.6-Flash 77.792 vs Claude Haiku 5.5 162.164

• Tempo de relógio por tarefa — MiMo-V2.6-Flash 1.320,08 s vs Claude Haiku 5.5 426,26 s

• Índice de Inteligência — Claude Haiku 5.5 43.395 vs MiMo-V2.6-Flash 37.884

• Terminal-Bench Hard — Claude Haiku 5.5 0,329 vs. MiMo-V2.6-Flash 0,227

Todos os cinco números são da Artificial Analysis, extraídos das páginas de modelos do próprio painel no início de outubro de 2026, e são os números a usar quando uma decisão tem de resistir à verificação de alguém.

A diferença de custo por tarefa é maior do que a tabela de preços sugere, e o motivo é a segunda linha. Claude Haiku 5.5 gasta 162.164 tokens de saída para entregar uma tarefa que o MiMo-V2.6-Flash conclui em 77.792 — cerca de 2,1 vezes mais tokens, em grande parte porque raciocina longamente por padrão. Um modelo que é 1,8x mais barato por token de saída e emite menos da metade deles por tarefa não acaba 1,8x mais barato; acaba sendo quase uma ordem de magnitude mais barato nesta suíte específica. Essa é a coisa mais importante desta página, e nenhuma tabela de preços em lugar algum publica isso.

A linha de tempo de relógio segue o caminho oposto e vale a pena ser honesto sobre isso. O MiMo-V2.6-Flash levou 1.320 segundos por tarefa, contra os 426 do Haiku — três vezes mais tempo, apesar de uma velocidade de saída medida maior, de 56,69 tokens por segundo, porque o raciocínio do Haiku não é o gargalo nesta suíte da forma como a taxa bruta de tokens faria prever. Se uma carga de trabalho for limitada por latência, e não por custo, o modelo barato não é automaticamente o correto, e o placar independente é o único lugar onde qualquer um desses números existe.

A screenshot of the Artificial Analysis model page for MiMo-V2.6-Flash, marked 'Open weights model' and 'Released September 2026', showing its Intelligence Index rank of #8 of 117, a speed measured at 56.7 output tokens per second, and the comparison summary.

Onde os quinze pontos realmente ficam

43.395 contra 37.884 é uma diferença de quinze por cento no Intelligence Index, e é o argumento mais forte a favor do Haiku neste confronto. Se isso importa depende inteiramente da tarefa. No Terminal-Bench Hard, os dois estão em 0.0 e 0.227 — uma diferença relativa maior, e que fica no lado agêntico e de múltiplas etapas do quadro, onde uma diferença de quinze por cento no índice tende a se transformar em uma diferença muito maior na conclusão de tarefas. Nos sub-benchmarks de raciocínio geral e conhecimento, os dois estão mais próximos do que o índice principal sugere, e o MiMo-V2.6-Flash está à frente em vários deles.

A leitura prática: na base da curva de dificuldade, os dois modelos são intercambiáveis e a diferença de custo deve decidir. No topo — agentes de longo horizonte, bases de código, qualquer coisa em que uma tarefa malsucedida precise ser executada de novo —, os quinze pontos do Haiku são a diferença entre uma tarefa que termina e uma tarefa que custa o mesmo dinheiro duas vezes, e a vantagem de custo por tarefa do modelo barato pode se inverter de um jeito que a média do ranking não consegue mostrar. Este é o caso em que você tem de rodar sua própria avaliação em vez de ler o índice de outra pessoa, porque nenhuma média publicada resolve isso.

Quanto vale a licença MIT

O MiMo-V2.6-Flash é distribuído sob a licença MIT — a menos restritiva das licenças abertas, sem teto de uso comercial e sem cláusula share-alike. Essa é uma concessão mais forte do que a Licença Comunitária do Qwen e significa que os pesos MoE 309B/15B podem ser auto-hospedados, ajustados e redistribuídos por qualquer pessoa que queira. Para uma equipe cuja restrição é que a inferência aconteça em hardware próprio, ou cujo volume seja alto o bastante para que possuir GPUs compense mais do que alugar tokens, isto não é um detalhe secundário — é a única linha da comparação que importa, porque o Claude Haiku 5.5 não pode ser executado por você de forma alguma.

Isso também muda o perfil de falha. Um modelo fechado servido por um fornecedor e pelos parceiros de nuvem desse fornecedor fica indisponível quando eles ficam; um modelo licenciado sob MIT com vários hosts independentes pode ter failover entre eles, desde que algo esteja fazendo o failover. Nenhuma dessas coisas é motivo para escolher o MiMo-V2.6-Flash para uma equipe que quer uma API e nada mais. Ambas são decisivas para uma equipe que não quer.

Afirmações de fornecedores que vale a pena verificar por conta própria

A linha MiMo é da Xiaomi, e a Xiaomi divulga seus próprios números de velocidade e qualidade no material de lançamento. Esses são números do fabricante, não reproduzidos no momento da redação, e o painel independente atualmente mede o modelo abaixo de onde o enquadramento do fabricante o colocaria — 37,884 no índice, e 0,227 no Terminal-Bench Hard, contra 0,329 do Haiku. Isso não é uma acusação de nada; é a lacuna normal entre o harness próprio de um fabricante e o de terceiros, e é o motivo para rotular qual é qual sempre que um número for repetido.

A verificação que vale a pena fazer no seu próprio tráfego custa uma tarde e resolve a questão melhor do que qualquer índice. Execute as mesmas vinte tarefas nos dois modelos com os seus próprios prompts, registre os tokens de entrada, os tokens de saída e o tempo real por tarefa para cada um, e multiplique pelas tarifas acima. Os quatro números que decidem isso são todos coisas que você pode medir: tokens de entrada, tokens de saída, segundos e se a tarefa foi concluída com sucesso. O valor de custo por tarefa no painel independente é o retrato para um conjunto genérico; o seu será diferente, e a diferença entre os dois geralmente é a verbosidade, que é exatamente o que a tabela de tarifas esconde. Se o raciocínio por padrão do Haiku está lhe rendendo conclusões de tarefas que, de outra forma, você pagaria para tentar de novo, ele é barato a 3,4x o preço por tarefa. Se não for o caso, você está pagando por tokens que não mudaram a resposta.

Obtendo ambos por meio de um único endpoint

Nem o Claude Haiku 5.5 nem o Xiaomi MiMo-V2.6-Flash são servidos pelo OrcaRouter — para esses, a API do próprio fornecedor e várias plataformas de terceiros são onde obtê-los. O que nós executamos é o elenco ao redor: qwen/qwen3.8-flash a $0.15 e $0.47 por milhão e z-ai/glm-5.3-flash a $0.15 e $0.50, ambos pelo preço de tabela do fornecedor, na mesma chave e na mesma fatura que um catálogo de mais de 200 modelos com preços repassados e failover automático.

Isso importa para esta comparação de um modo específico: quando os dois modelos entre os quais você está escolhendo são aqueles que você não consegue rotear, o desempate geralmente é decidido executando-os lado a lado com tráfego real — o que significa mantê-los disponíveis ao lado dos modelos que você roteia, sem um segundo contrato ou um segundo SDK para nenhum deles. Coloque o candidato no caminho de produção com um modelo funcional atrás dele como fallback, deixe a requisição ir para o que a camada de roteamento escolher, e deixe seus próprios logs de tokens produzirem o número de custo por tarefa que as tabelas de preços se recusaram a fornecer. A suíte do conselho independente é um proxy; sua carga de trabalho é a medição.

A screenshot of the OrcaRouter models index, headed 'Models — 207 models' with the line '16 providers: one API key, one bill', a filter row for input modalities, context length, input price, status, series and supported parameters, and the first steps of the 'How to call any model' walkthrough.

A chamada

Se a carga de trabalho for de grande volume, com saída curta e tolerante a repetições ocasionais, o Xiaomi MiMo-V2.6-Flash é o modelo mais barato por uma margem maior do que a sua tabela de preços anuncia — $0,06231 por tarefa contra $0,2128 — e a licença MIT dá-lhe uma escotilha de saída que o Haiku não tem. Se a carga de trabalho for de longo horizonte e agêntica, os quinze pontos de índice do Claude Haiku 5.5 e a conclusão de tarefas três vezes mais rápida valem o múltiplo, e a diferença de custo estreita-se ou inverte-se quando as repetições são contabilizadas.

A única coisa que não se deve fazer é escolher apenas pela tabela de preços. Dois modelos aqui têm preços dentro de um fator de dois por token e acabam separados por uma ordem de magnitude por tarefa concluída, e apenas um desses números está na página que o fornecedor mostra a você.

um catálogo com mais de 200 modelos

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente