
MiMo-V2.6-Pro vs Claude Opus 5: 21x mais barato, cinco pontos de índice atrás
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 632 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Xiaomi MiMo-V2.6-Pro e Claude Opus 5 são os dois extremos de uma única troca, e a troca tem um preço. No Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (esforço máximo) pontua 51 e Xiaomi MiMo-V2.6-Pro pontua 46. Na tabela de preços, Claude Opus 5 custa US$ 5,00 por milhão de tokens de entrada e US$ 25,00 por milhão de saída; MiMo-V2.6-Pro custa US$ 0,43 e US$ 0,87. Faça a divisão e a resposta é 11,6x na entrada e 28,7x na saída — e 21x na tarifa combinada que a Artificial Analysis publica para cada um. Cinco pontos no índice custam vinte e uma vezes o dinheiro. Se isso é uma pechincha ou um desperdício depende inteiramente do que sua carga de trabalho faz com o quinto ponto, e a maioria das equipes nunca descobre isso antes de se comprometer.
Os dois modelos, ditos claramente.
Claude Opus 5 é o carro-chefe proprietário da Anthropic, lançado em 24 de julho de 2026, com uma janela de contexto de 1 milhão de tokens e número de parâmetros não divulgado. O Xiaomi MiMo-V2.6-Pro é um modelo esparso de mistura de especialistas com 1,02 trilhão de parâmetros totais e 42 bilhões ativados, com uma janela de contexto de 1 milhão de tokens, multimodalidade nativa em texto, imagem, vídeo e áudio, e pesos publicados sob licença MIT.
• Pesos — MiMo-V2.6-Pro com licença MIT e disponível para download; Claude Opus 5 proprietário, somente via API
• Parâmetros — MiMo-V2.6-Pro 1,02T no total / 42B ativos; Claude Opus 5 não divulgado
• Contexto — 1M tokens em ambos; o Claude Opus 5 limita a saída em 128K na API de Mensagens e 300K na API de Lotes
• Modalidade — MiMo-V2.6-Pro aceita texto, imagem, vídeo e áudio; a superfície de entrada publicada do Claude Opus 5 é texto e imagem
• Preço de tabela — MiMo-V2.6-Pro $0,43 / $0,87 por 1M de tokens; Claude Opus 5 $5,00 / $25,00
• Cache — o MiMo-V2.6-Pro anuncia um desconto de cache de 99%; o Claude Opus 5 lê o cache a US$ 0,50 por 1M, com gravações de US$ 6,25 em um TTL de 5 minutos
• Custo medido por tarefa do Intelligence Index — MiMo-V2.6-Pro $0.13; Claude Opus 5 $5.86
• Serviço — MiMo-V2.6-Pro 134,3 tokens de saída por segundo e 2,15 s até o primeiro token; Claude Opus 5 57,9 tokens por segundo
Esse último par é o que se perde. O modelo mais barato também é o mais rápido — por um fator de 2,3 na vazão de saída — porque é servido em hardware que a Xiaomi e seus parceiros controlam e pode processar em lotes de forma agressiva. O Claude Opus 5 no esforço máximo é um modelo de raciocínio que faz mais trabalho por token; a diferença de velocidade não é um defeito, é um produto diferente. Mas isso significa que a via barata não está pagando por seu desconto em latência. Está pagando por isso em cinco pontos de índice e na cauda das tarefas em que esse quinto ponto reside.

Onde os cinco pontos realmente estão
Uma diferença de cinco pontos num compósito de dez avaliações não está distribuída de forma uniforme, e o agregado esconde aquilo que importa. Ambos os modelos foram executados na mesma suíte v4.3.2, que inclui AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. As páginas publicadas não detalham as pontuações por avaliação para nenhum dos modelos, o que é uma limitação real em ambos os lados desta comparação e que vale a pena mencionar em vez de encobrir.
O que consta no registro é direcional. O Claude Opus 5, no esforço máximo, obteve 49,0% no Terminal-Bench 4.0 dentro da suíte v4.3, atrás do GPT-6 Astra, com 59,1%, e do Claude Fable 5.1, com 52,0%. No AutomationBench-AA, o Opus 5 concluiu todos os objetivos sem violação de salvaguarda em 28,3% dos fluxos de trabalho, contra 41,6% do GPT-6 Astra e 32,1% do Fable 5.1. Esses são números agênticos duros, e são exatamente as categorias em que uma lacuna composta de cinco pontos tem menos probabilidade de estar distribuída uniformemente — a própria entrada de índice do MiMo-V2.6-Pro não publica um recorte agêntico comparável.
Enquanto isso, os números de fornecedor que ambas as empresas publicam não são comparáveis entre si, e vale a pena ser direto sobre o porquê. O material de lançamento da Anthropic reporta SWE-bench Verified em 96,0% e SWE-bench Pro em 79,2%; um rastreador observa que o Opus 5 foi lançado sem uma entrada isolada no SWE-bench, e não há um número de SWE-bench Verified auditado independentemente para ele. O material da Xiaomi reporta o MiMo-V2.6-Pro passando de 58,4 para 72,57 no DeepSWE v1.1 ao longo de sua execução de RL, no harness próprio da Xiaomi com o mini-swe-agent na média de três, sem submissão ao placar público do DeepSWE. Dois harnesses de fornecedores, duas tarefas diferentes, nenhuma sobreposição. Colocar 96,0% ao lado de 72,57 e tirar uma conclusão seria inventar uma comparação que não existe.

A comparação de custos, feita como deve ser
A aritmética por token subestima a diferença, porque os dois modelos não consomem o mesmo número de tokens para concluir o mesmo trabalho. A Artificial Analysis mediu quanto cada um realmente custou para executar o Intelligence Index completo: US$ 0,13 para o MiMo-V2.6-Pro, US$ 5,86 para o Claude Opus 5. Isso é uma diferença de 45x em um conjunto de tarefas controlado e idêntico, e é o número único mais justo disponível porque ambos foram medidos da mesma forma.
Agora coloque um loop de produção plausível contra isso. Uma execução de agente de 30 etapas que lê 200.000 tokens de contexto por etapa e grava 2.000 tokens por etapa equivale a 6 milhões de tokens de entrada e 60.000 tokens de saída por execução. No Claude Opus 5 a preço de tabela, isso dá US$ 30,00 de entrada e US$ 1,50 de saída — US$ 31,50 por execução antes de qualquer cache. No MiMo-V2.6-Pro, são US$ 2,58 de entrada e US$ 0,05 de saída — US$ 2,63. Com os descontos de cache que ambos os fornecedores oferecem, o lado da entrada despenca em qualquer um dos modelos, e a proporção se desloca em vez de desaparecer: um desconto de cache de 99% em um modelo barato versus uma leitura de cache de US$ 0,50 em um modelo caro ainda deixa o modelo caro uma ordem de magnitude à frente em um loop com uso intensivo de contexto.
Que é todo o argumento a favor de uma via barata e contra uma substituição total. Se a sua carga de trabalho for um loop de agente de horizonte longo que relê o mesmo contexto centenas de vezes, a diferença de custo por execução não é um erro de arredondamento — é a diferença entre um recurso que você pode se dar ao luxo de executar por usuário e um que você não pode. É esse o argumento para colocar o MiMo-V2.6-Pro à frente da maior parte do seu tráfego. Não é um argumento para excluir o Claude Opus 5, porque as tarefas em que o quinto ponto do índice se paga são, por construção, as tarefas em que a falha de um modelo barato é cara.

Como é uma decisão de roteamento aqui
O Claude Opus 5 é acessível por meio de uma única chave OrcaRouter ao preço de tabela do provedor, com 0% de markup, como anthropic/claude-opus-5, com os modelos de fronteira com os quais você o compararia ao lado dele na mesma chave. Como repassamos o preço de tabela do provedor sem markup, uma mudança de preço do fornecedor de qualquer um dos lados entra em vigor do nosso lado no mesmo dia, em vez de esperar por uma nova cotação. A DSL de roteamento é onde está a parte interessante: você pode compor os dois modelos em uma única chamada em vez de escolher entre eles, enviar a maior parte de uma carga de trabalho para a via barata e rotear a cauda — as tarefas que falham em uma autoverificação, ou que correspondem a um predicado de complexidade — para a cara. O failover é a outra metade. O Claude Opus 5 tem ampla cobertura de provedores; o MiMo-V2.6-Pro foi listado por um único provedor de API quando a Artificial Analysis o capturou, o que é uma rota estreita para um modelo que você colocaria em um caminho de produção. Um roteador que consegue fazer fallback é o que torna a via barata segura de adotar.
Vale a pena afirmar claramente, porque é fácil supor o contrário: nós não hospedamos o MiMo-V2.6-Pro. Acessá-lo hoje significa usar a plataforma da própria Xiaomi ou um dos catálogos de terceiros que o listam. O argumento de roteamento aqui é sobre como você usa um modelo como esse ao lado dos que nós oferecemos, não uma alegação de que ele seja um dos nossos.
Qual escolher
Escolha Claude Opus 5 quando o custo de falha da tarefa excede o custo de tokens o suficiente para que cinco pontos de índice sejam um seguro barato — trabalho agêntico de horizonte longo com efeitos colaterais reais, uso de ferramentas em que uma chamada errada é pior do que uma lenta, qualquer coisa em que você já esteja pagando uma pessoa para verificar a saída. O valor de US$ 5,86 por tarefa de índice não é motivo para evitá-lo; é o preço do nível, e o nível existe por uma razão.
Escolha o MiMo-V2.6-Pro quando o volume for a restrição, quando a carga de trabalho for intensiva em contexto e repetitiva, quando você quiser os pesos na sua própria infraestrutura — a licença MIT permite implantação comercial, modificação e treinamento adicional — ou quando estiver construindo algo cuja economia unitária só funciona a um quinto de centavo por mil tokens. Seus 134,3 tokens por segundo o tornam viável para uso interativo de uma forma que a maioria dos modelos abertos com um trilhão de parâmetros não é.
Escolha os dois, se tiver um router, porque a resposta honesta a «qual é melhor» é que não estão a competir pelos mesmos pedidos. O modo de falha a evitar é o que custa mais: padronizar no modelo barato porque o rácio destacado é de 21x, descobrir ao terceiro mês que uma classe específica de pedidos precisa do caro e não ter forma de os encaminhar para lá. O segundo modo de falha é a imagem ao espelho — pagar tarifas do Opus 5 por um trabalho de sumarização que um modelo de índice 46 termina de forma idêntica. Nenhum dos dois é um problema de modelo. Ambos são problemas de configuração, e a configuração é a parte que pode mudar numa terça-feira à tarde.
