Cartão de destaque com o título 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash' e o subtítulo 'Uma diferença de preço de 3x, e o que não a explica', e dois painéis: um painel esquerdo com o título 'MiMo-V2.6-Pro' e os dizeres '$0.435 / $0.87 por 1M' e '42B parâmetros ativos', e um painel direito com o título 'MiMo-V2.6-Flash' e os dizeres '$0.14 / $0.28 por 1M' e '15B parâmetros ativos', sobre um rodapé com os dizeres 'Ambos com licença MIT · ambos com contexto de 1M · índice publicado apenas para o Pro'.
Guides & Insights

MiMo-V2.6-Pro vs MiMo-V2.6-Flash: Uma diferença de preço de 3x que dois benchmarks não explicam

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Nas próprias tabelas de avaliação da Xiaomi, o MiMo-V2.6-Flash supera o MiMo-V2.6-Pro. A linha é a CyberGym, e a margem é de 95,1 a 94,0. É uma linha entre quinze, e é o motivo para ler o resto desta comparação com atenção, em vez de assumir que o modelo topo de linha é sempre a resposta — porque o MiMo-V2.6-Flash custa cerca de um terço do que custa o MiMo-V2.6-Pro, e na maioria das linhas os dois ficam a poucos pontos de diferença um do outro.

Ambos os modelos foram publicados como repositórios no Hugging Face em 21 de setembro de 2026, sob a licença MIT, com dezoito segundos de diferença, como execuções de treinamento separadas, e não como degraus de uma mesma escada. O Xiaomi MiMo-V2.6-Pro é o nível de trilhão de parâmetros. O MiMo-V2.6-Flash é o nível de eficiência. A pergunta que esta página responde é qual deles pertence ao seu caminho de produção, e a resposta honesta depende de um número que não existe em nenhum dos dois lançamentos.

O que cada um é

• Parâmetros — Xiaomi MiMo-V2.6-Pro com 1,02 T no total e 42 B ativos por token, contra Xiaomi MiMo-V2.6-Flash com cerca de 309 B no total e 15 B ativos
• Arquitetura — ambos usam mistura esparsa de especialistas com entrada omnimodal nativa; o Flash está documentado com 48 camadas, 39 de janela deslizante e 9 de atenção completa, dimensão oculta 4096, 256 especialistas roteados com 8 ativos e nenhum especialista compartilhado, além de um transformer de visão de 681 M, um tokenizador de áudio de 308 M e um codificador de patches de áudio de 127 M
• Contexto — 1 M tokens em ambos, com até 128.000 tokens de saída em ambos
• Licença — MIT em ambos, pesos sem restrição em ambos
• Preço — US$ 0,435 de entrada e US$ 0,87 de saída por milhão de tokens para o Pro, contra US$ 0,14 e US$ 0,28 para o Flash: uma diferença de 3,1x nos dois lados do cartão
• Entrada com acerto de cache — US$ 0,0036 por milhão no Pro, US$ 0,0028 no Flash
• Gasto com treinamento — Xiaomi relata cerca de US$ 2,62 milhões para a execução de RL do Pro e US$ 854 mil para o Flash, cada uma concluída em menos de seis dias ao longo de 30 etapas de aprendizado por reforço e cerca de 750.000 trajetórias
• Pontuação de índice independente — 46 para Xiaomi MiMo-V2.6-Pro no Artificial Analysis Intelligence Index v4.3.2; nenhuma publicada para MiMo-V2.6-Flash

Essa última linha é a que deve ser levada em conta. Tudo acima dela, exceto a pontuação Pro, é informação fornecida pela Xiaomi.

Onde o triplo do preço não compra quase nada

A Tabela 3 da Xiaomi coloca os dois lado a lado nos harnesses em que a série foi treinada, e no trabalho agêntico de longo horizonte as margens são estreitas:

• DeepSWE v1.1 — Pro 71.9, Flash 67.9
• MiMo Code Bench — Pro 63.2, Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1, Flash 52.3
• Toolathlon-Verified — Pro 76.9, Flash 73.6
• Terminal Bench 2.1 — Pro 89.9, Flash 87.6
• OSWorld-Verified — Pro 82.0, Flash 80.8
• JobBench — Pro 62.0, Flash 61.2
• MiMo Visual Coding — Pro 72.3, Flash 71.5
• CyberGym — Pro 94.0, Flash 95.1
• MiMo Cyber Bench — Pro 80.2, Flash 77.2

Leia essa coluna de cima para baixo e a vantagem do topo de linha fica majoritariamente entre um e quatro pontos, com uma linha perdida por completo. Em um fluxo de trabalho em que a diferença entre 67,9 e 71,9 é a diferença entre uma tarefa ser concluída e uma tarefa falhar, três vezes o preço é barato. Em um fluxo de trabalho em que essa é a diferença entre duas respostas aceitáveis, não é. Tabelas de fornecedores com casas decimais como essas convidam a uma falsa precisão — ninguém fora da Xiaomi os executou, e uma diferença de dois pontos em um sistema de avaliação interna está bem dentro da faixa que um avaliador diferente ou uma política de tentativas diferente pode alterar.

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

Onde compra muito

Há um conjunto de linhas em que a diferença deixa de ser uma questão de arredondamento. Cada uma delas é trabalho de segurança:

• ExploitGym — Pro 17,8, Flash 6,0
• ExploitBench — Pro 47,9, Flash 25,3
• SEC Bench Pro — Pro 66,3, Flash 47,5
• Agents' Last Exam — Pro 31,6, Flash 27,6
• Terminal Bench 4.0 — Pro 34,9, Flash 28,8

No ExploitGym, o modelo principal é três vezes o modelo mais barato, o mesmo fator do preço, e no SEC Bench Pro é 1,4x. Esse padrão é o que se esperaria de um modelo com 42B parâmetros ativos contra um com 15B: uma tarefa que exige uma longa cadeia de raciocínio sem crédito parcial é o tipo de tarefa em que a capacidade extra aparece, e o CyberGym ficar do lado oposto é a exceção que prova que as duas execuções aprenderam coisas diferentes, e não a mesma coisa em tamanhos diferentes.

Portanto, a divisão corresponde a uma fronteira real de carga de trabalho, e não a uma fronteira de marketing. Trabalho de agente em grande volume com um critério de sucesso tolerante — recuperação, classificação, edições de rotina, chamadas que uma nova tentativa pode salvar — é território do Flash. Trabalho em que uma resposta errada sai cara e uma resposta parcial não vale nada — desenvolvimento de exploits, revisão de segurança, sessões de terminal com estado de várias etapas — é onde o nível Pro justifica o preço múltiplo.

O número que não existe

O MiMo-V2.6-Flash não tem uma página de modelo da Artificial Analysis. O seu irmão tem. Essa assimetria é a coisa mais importante nesta página, porque significa que o único valor medido de forma independente em toda a série MiMo-V2.6 é o 46 ao lado de Xiaomi MiMo-V2.6-Pro. Todos os números do Flash acima — incluindo a linha do CyberGym em que ele vence — vêm de um harness da Xiaomi, de um avaliador da Xiaomi e de uma execução offline da Xiaomi.

Há um argumento razoável de que isto é temporário: o modelo tem um dia de idade no momento em que escrevo e a avaliação por terceiros leva tempo. Há também um argumento razoável de que é estrutural, uma vez que o Flash é o nível de volume e os níveis de volume atraem menos atenção de benchmarking. De qualquer forma, a consequência prática hoje é que não é possível comparar o Flash com nada fora da sua própria família com a mesma confiança com que compara o Pro. Se está a escolher entre o Flash e um modelo que não seja da Xiaomi com base na relação preço-qualidade, está a comparar um valor de fornecedor com um valor medido por outra pessoa.

Ambos os cartões de modelo apresentam a mesma segunda ressalva. Nenhum dos repositórios é implantado por nenhum fornecedor de inferência — a Hugging Face afirma-o explicitamente em cada página, e a Artificial Analysis contou um único fornecedor de API para o Pro. Não alojamos nenhum dos checkpoints, pelo que nenhum dos dois é encaminhável através de nós. A rota para ambos é a própria plataforma da Xiaomi e os catálogos de terceiros que os disponibilizam.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

O preço que você paga em hardware, não em tokens.

O preço por token é apenas metade do que um checkpoint custa a você, e os dois diferem muito mais acentuadamente no disco do que na tabela de preços. O MiMo-V2.6-Flash publica 172,9 GB de pesos FP8 em 65 shards. O Xiaomi MiMo-V2.6-Pro carrega aproximadamente três vezes mais parâmetros, o que coloca seu download bruto na faixa de meio terabyte antes de qualquer quantização — e seu próprio repositório relata um tamanho de modelo Safetensors de 524B parâmetros, um número que não se concilia nem com o total de 1,02T nem com a contagem de 42B ativos.

Essa diferença muda a forma da decisão. O Flash, com 172,9 GB, é um modelo que uma equipe pequena pode auto-hospedar em capacidade alugada e tratar como commodity. O Pro, com cerca de três vezes esse valor, é uma decisão de cluster — a cobertura em torno do lançamento situou as duas execuções de treinamento em aproximadamente 4.000 e 8.000 GPUs equivalentes a H200, respectivamente. Se o seu motivo para olhar para pesos abertos é querer ter a opção de parar de pagar por token, os dois checkpoints oferecem essa opção em escalas de compromisso muito diferentes.

Escolhendo entre eles

A regra que sobrevive às ressalvas acima é escolher por classe de carga de trabalho, e não pela média de benchmark. Flash para qualquer coisa que você ficaria confortável em tentar de novo; Pro para qualquer coisa em que uma nova tentativa não o salva. Depois, meça, porque nenhum dos modelos tem uma pontuação independente nos benchmarks com os quais você realmente se importa.

Comparar dois checkpoints lado a lado é onde um roteador faz algo que um contrato por modelo não consegue. Colocar um nível barato na maior parte do seu tráfego e escalar apenas os casos difíceis para o nível caro é a mesma decisão que esta página, expressa como configuração em vez de reescrita — e é exatamente para essa composição que a camada de roteamento existe. Também importa para o próprio preço: repassamos o preço de tabela do provedor com 0% de margem, então, se a Xiaomi reduzir a tarifa em qualquer um dos checkpoints, o número do nosso lado muda no mesmo dia, e não na próxima renovação de contrato. Isso se aplica aos modelos que oferecemos. Para o par MiMo-V2.6 especificamente, hoje, você ainda está comprando diretamente da Xiaomi.

O que resolveria isso

Duas coisas transformariam isto de uma decisão subjetiva numa questão aritmética. Uma página do Artificial Analysis para o MiMo-V2.6-Flash colocaria ambos os checkpoints no mesmo eixo de custo por tarefa que atualmente situa o Pro em $0,133 por tarefa do Intelligence Index, e a comparação resolver-se-ia por si mesma. Uma replicação por terceiros do cluster de segurança — ExploitGym, ExploitBench, SEC Bench Pro — confirmaria se a diferença de 3x nessas linhas é uma propriedade do modelo ou uma propriedade do avaliador.

Até então, a posição defensável é que o Xiaomi MiMo-V2.6-Flash é a melhor compra para a maioria das equipes na maior parte do tempo, e que o Xiaomi MiMo-V2.6-Pro é a melhor compra para a estreita classe de trabalho em que a falha é o resultado caro. A única linha em que o Flash vence não anula isso — mas é um lembrete útil de que o prêmio do carro-chefe é uma afirmação sobre uma carga de trabalho, não sobre um modelo.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.