
Xiaomi MiMo-V2.6-Pro lidera o Índice de Pesos Abertos com 46 — e publica a conta do treinamento
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro agora é o modelo de pesos abertos mais bem classificado no Artificial Analysis Intelligence Index, com 46 na v4.3.2 — um ponto à frente do GLM-5.3 e dois à frente do Kimi K3, e vinte pontos acima dos 26 que seu antecessor MiMo-V2.5-Pro registrou na escala anterior do índice. Esse número foi produzido pela Artificial Analysis ao executar seu próprio harness, e não pela Xiaomi, e é o fato mais útil deste lançamento. O segundo fato mais útil é o preço impresso ao lado: US$ 0,43 por milhão de tokens de entrada, US$ 0,87 por milhão de saída, contra US$ 5,00 e US$ 25,00 do Claude Opus 5 — um modelo que está cinco pontos acima no índice. O terceiro é o que ninguém esperava que a Xiaomi entregasse: uma prestação de contas pública de quanto custou de fato a execução de aprendizado por reforço que produziu o MiMo-V2.6-Pro.
A pontuação é uma medição, não uma afirmação
Quase tudo o que é publicado sobre o lançamento de um modelo chinês chega como um número divulgado pelo fornecedor, e os leitores aprenderam a relativizá-lo. Este é diferente, e vale a pena ser preciso quanto à diferença, porque a cobertura do lançamento já a desfocou.
A Artificial Analysis avaliou o próprio MiMo-V2.6-Pro, no compósito v4.3.2 — dez avaliações cobrindo raciocínio, conhecimento, matemática e programação, incluindo AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. O 46 foi o que essa suíte retornou. A Artificial Analysis também registrou as características operacionais que determinam se um modelo é utilizável, e não apenas bom: 134,3 tokens de saída por segundo, 2,15 segundos até o primeiro token, um desconto de cache de 99% e um custo medido de US$ 0,13 por tarefa do Intelligence Index.
Dois desses merecem destaque. Os 134,3 tokens por segundo colocam o MiMo-V2.6-Pro na décima primeira posição entre 114 modelos em velocidade — para um modelo de mistura de especialistas com um trilhão de parâmetros, isso é um resultado de serviço, não apenas de treinamento. E os US$ 0,13 por tarefa é o número que sobrevive ao contato com um orçamento: é o que o índice realmente custou para rodar nesse modelo, medido da mesma forma em todos os modelos do quadro, o que o torna comparável de uma maneira que as taxas por token divulgadas em manchetes não são.

O que o índice abrange e não abrange
A coroa dos pesos abertos é real, mas mais estreita do que parece. Com 46, o MiMo-V2.6-Pro lidera a categoria de pesos abertos. Não lidera o índice. O topo da v4.3 é o Claude Fable 5.1 em esforço máximo com fallback padrão e o GPT-6 Astra em esforço máximo, ambos com 53, com o Claude Opus 5 com 51 e o Claude Fable 5 com 50. Portanto, o enquadramento honesto é uma diferença de cinco pontos em relação à fronteira num composto que recompensa a amplitude, e uma melhoria de vinte pontos em relação à geração anterior da própria Xiaomi.
• Líder em pesos abertos — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• Topo do mesmo índice — Claude Fable 5.1 (max, fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Velocidade — 134,3 tokens de saída/segundo, décimo primeiro de 114 modelos medidos; a mediana para a classe de tamanho é 77,9
• Tempo até o primeiro token — 2,15 segundos, contra uma mediana de 2,34 segundos
• Custo por tarefa do Intelligence Index — US$ 0,13, com toda a avaliação custando US$ 206,66 para ser executada
• Tarifa listada — $0,43 por milhão de tokens de entrada, $0,87 por milhão de saída, um desconto de cache de 99% e um valor combinado de $0,18 em uma proporção de 7:2:1 de acertos de cache/entrada/saída
Um número na página da Artificial Analysis é uma ressalva genuína, e não um motivo de orgulho: no momento em que este texto foi escrito, ele contabilizava um único provedor de API para o MiMo-V2.6-Pro. Esse é o gargalo prático desse modelo agora, e não é um problema de qualidade — é um problema de disponibilidade. Um modelo acessível por uma única rota não tem failover. Se essa rota sofrer degradação, sua aplicação sofrerá degradação junto, e o failover é exatamente o que um roteador existe para fornecer. A observação relevante para quem planeja em torno deste lançamento é que não hospedamos o MiMo-V2.6-Pro, e não vamos fingir o contrário; a rota para ele hoje é a própria plataforma da Xiaomi e o punhado de catálogos de terceiros que o listam.

Os dois números que não devem ser misturados
A Xiaomi também publicou números de benchmark próprios, e eles são um tipo de objeto diferente dos 46. O painel da empresa informa que o MiMo-V2.6-Pro passou de 58,4 para 72,57 no DeepSWE v1.1 ao longo de sua execução de aprendizado por reforço, avaliado com o mini-swe-agent na média de três execuções. Esse é o harness da Xiaomi, o avaliador da Xiaomi, a execução offline da Xiaomi. Ele não foi submetido ao leaderboard público do DeepSWE e não foi reproduzido por ninguém.
Leia os dois lado a lado e a tentação é tratar 72,57 como uma pontuação em pé de igualdade com os 74% que o quadro público do DeepSWE lista no nível superior. Eles não estão na mesma escala. O número da tabela de classificação é uma configuração submetida, Pass@1, com um intervalo de confiança publicado e um custo médio por tarefa; o número do fornecedor é uma avaliação interna sem nada disso associado. Nosso próprio artigo de 21 de setembro fez esse ponto quando os números ainda eram leituras de painel, e ele continua válido agora que os pesos foram divulgados. Um harness de fornecedor pode ser totalmente honesto e ainda assim não ser uma entrada na tabela de classificação, porque a entrada na tabela de classificação é uma alegação sobre uma configuração específica sob condições específicas que um terceiro pode executar novamente.
A mesma disciplina se aplica ao gasto com treinamento. A Xiaomi relata aproximadamente US$ 3.474.715 nas execuções Pro e Flash — US$ 2.620.670 para a Pro, US$ 854.044 para a Flash —, cada uma com mais de trinta etapas de aprendizado por reforço e cerca de 750.000 trajetórias, concluídas em menos de seis dias. Esses são os números de contabilização de computação da própria empresa. Eles são interessantes porque os laboratórios quase nunca os publicam, e não são um preço de API, nem um custo que você vai pagar, nem um número que qualquer terceiro tenha auditado.
O que a Xiaomi realmente lançou
O lançamento é um modelo esparso de mistura de especialistas com 1,02 trilhão de parâmetros totais, 42 bilhões ativados por token, uma janela de contexto de 1 milhão de tokens e multimodalidade nativa em texto, imagem, vídeo e áudio. O seu irmão Xiaomi MiMo-V2.6-Flash tem a mesma arquitetura em escala menor, 309 bilhões no total e 15 bilhões ativos. Os pesos publicados trazem uma tag de licença MIT, e o pacote de lançamento inclui um relatório técnico, instruções de implantação e — segundo a Xiaomi — os ambientes de treinamento de aprendizado por reforço e o código necessários para examinar e reproduzir o pós-treinamento.
Esse último item é a diferença substantiva entre este lançamento e um anúncio típico de API, e vale a pena separá-lo do marketing. Publicar o ambiente de RL é uma afirmação de que a configuração de treinamento pode ser examinada. Se os ambientes publicados são suficientes para reproduzir um 72,57 é uma questão separada, que será resolvida pelas pessoas que tentarem fazê-lo, não pelas notas de lançamento. As próprias notas de treinamento da Xiaomi descrevem uma execução que misturou tarefas de codificação, de agente geral, visuais e de cibersegurança em uma única passagem, com avaliadores que classificam trajetórias bem-sucedidas e redistribuem a recompensa para caminhos melhores — e elas também registram falhas: uma reinicialização da GPU por falta de memória, causada por desequilíbrio de carga entre especialistas, uma falha de rede entre o cluster de treinamento e a implantação dos avaliadores, e uma reinicialização do Flash depois que um erro de infraestrutura passou cerca de três horas sem ser detectado. Publicar as falhas junto com as conquistas é a parte que torna o restante da divulgação crível.
Quanto custa ligar e onde se situa a questão do roteamento
A US$ 0,43 e US$ 0,87 por milhão de tokens, o MiMo-V2.6-Pro tem preço de modelo de nível intermediário e desempenho em benchmarks de modelo de pesos abertos de fronteira. A Xiaomi manteve o preço padrão da geração anterior MiMo-V2.5, em vez de reajustar o novo checkpoint para cima, e é por isso que a tarifa parece baixa em relação ao número de parâmetros. Um desconto de cache de 99% significa que um loop de agente com uso intenso de cache lê seu contexto por praticamente nada, e é aí que a conta de um agente de horizonte longo realmente se acumula.
Existe uma versão deste trade que roteia de forma limpa e uma versão que não. A versão que sim: os modelos de fronteira com os quais você compararia o MiMo-V2.6-Pro — Claude Opus 5 a $5,00/$25,00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — são todos acessíveis por uma única chave do OrcaRouter ao preço de lista do provedor, com 0% de markup, então um corte de preço do fornecedor em qualquer um deles entra em vigor do nosso lado no mesmo dia, e uma regra de roteamento pode enviar uma requisição para um segundo modelo quando o primeiro estiver lento ou indisponível. Isso importa mais do que o habitual aqui, porque o modelo com a melhor pontuação em pesos abertos é também o que tem a rota mais estreita até ele. Combinar os dois — uma faixa barata de pesos abertos para trabalho em volume e uma faixa de fronteira para a cauda difícil — é uma decisão de roteamento, e é o tipo de decisão que deixa de ser uma aposta no momento em que ambas as faixas estão na mesma chave.
Mais um produto que é preciso distinguir, porque é fácil confundi-lo com o modelo: a Xiaomi também está oferecendo o MiMo-V2.6-Pro-UltraSpeed, um nível de serviço hospedado criado a partir do mesmo checkpoint. O material da própria Xiaomi afirma até vinte vezes a velocidade de saída do serviço Pro padrão com a mesma qualidade; listagens de catálogos de terceiros descrevem cerca de dez vezes. Esses são dois números diferentes descrevendo o mesmo nível, ninguém publicou distribuições de latência por requisição que reconciliem esses números, e o nível tem uma tarifa substancialmente mais alta. Nada no UltraSpeed muda o que os pesos podem fazer — ele muda a velocidade com que os servidores de outra pessoa os executarão.
O que mudaria esta imagem
Três coisas, em ordem de quanto importariam.
Uma segunda e uma terceira rota de serving. A contagem de fornecedor único no Artificial Analysis é a restrição de todo o resto. Mais rotas significam failover, significam competição de preços na camada de serving e significam que o modelo pode ser colocado em um caminho de produção em vez de um experimento.
Reprodução independente dos números do DeepSWE. O 46 já é independente; o 72,57 não é. Se execuções externas chegarem perto dele, o argumento a favor do modelo se fortalece consideravelmente. Se ficarem materialmente abaixo, o número da Artificial Analysis continua sendo o mais confiável e o número do fornecedor entra para a longa lista de alegações de lançamento que não sobreviveram ao contato.

Detalhamentos por avaliação. A pontuação composta é só isso: composta. Quais das dez avaliações o MiMo-V2.6-Pro vence e quais perde é a diferença entre um modelo que você implanta para codificação agêntica e um modelo que você implanta para perguntas e respostas com forte dependência de recuperação, e o índice sozinho não diz isso a você. Esse detalhe é o que deve ser observado a seguir, e é o que uma configuração de roteamento precisa antes de valer a pena ser registrada.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
