
MiMo-V2.6-Pro vs MiMo-V2.6-Flash: Uma diferença de preço de 3x que dois benchmarks não explicam
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Nas próprias tabelas de avaliação da Xiaomi, o MiMo-V2.6-Flash supera o MiMo-V2.6-Pro. A linha é a CyberGym, e a margem é de 95,1 a 94,0. É uma linha entre quinze, e é o motivo para ler o resto desta comparação com atenção, em vez de assumir que o modelo topo de linha é sempre a resposta — porque o MiMo-V2.6-Flash custa cerca de um terço do que custa o MiMo-V2.6-Pro, e na maioria das linhas os dois ficam a poucos pontos de diferença um do outro.
Ambos os modelos foram publicados como repositórios no Hugging Face em 21 de setembro de 2026, sob a licença MIT, com dezoito segundos de diferença, como execuções de treinamento separadas, e não como degraus de uma mesma escada. O Xiaomi MiMo-V2.6-Pro é o nível de trilhão de parâmetros. O MiMo-V2.6-Flash é o nível de eficiência. A pergunta que esta página responde é qual deles pertence ao seu caminho de produção, e a resposta honesta depende de um número que não existe em nenhum dos dois lançamentos.
O que cada um é
• Parâmetros — Xiaomi MiMo-V2.6-Pro com 1,02 T no total e 42 B ativos por token, contra Xiaomi MiMo-V2.6-Flash com cerca de 309 B no total e 15 B ativos
• Arquitetura — ambos usam mistura esparsa de especialistas com entrada omnimodal nativa; o Flash está documentado com 48 camadas, 39 de janela deslizante e 9 de atenção completa, dimensão oculta 4096, 256 especialistas roteados com 8 ativos e nenhum especialista compartilhado, além de um transformer de visão de 681 M, um tokenizador de áudio de 308 M e um codificador de patches de áudio de 127 M
• Contexto — 1 M tokens em ambos, com até 128.000 tokens de saída em ambos
• Licença — MIT em ambos, pesos sem restrição em ambos
• Preço — US$ 0,435 de entrada e US$ 0,87 de saída por milhão de tokens para o Pro, contra US$ 0,14 e US$ 0,28 para o Flash: uma diferença de 3,1x nos dois lados do cartão
• Entrada com acerto de cache — US$ 0,0036 por milhão no Pro, US$ 0,0028 no Flash
• Gasto com treinamento — Xiaomi relata cerca de US$ 2,62 milhões para a execução de RL do Pro e US$ 854 mil para o Flash, cada uma concluída em menos de seis dias ao longo de 30 etapas de aprendizado por reforço e cerca de 750.000 trajetórias
• Pontuação de índice independente — 46 para Xiaomi MiMo-V2.6-Pro no Artificial Analysis Intelligence Index v4.3.2; nenhuma publicada para MiMo-V2.6-Flash
Essa última linha é a que deve ser levada em conta. Tudo acima dela, exceto a pontuação Pro, é informação fornecida pela Xiaomi.
Onde o triplo do preço não compra quase nada
A Tabela 3 da Xiaomi coloca os dois lado a lado nos harnesses em que a série foi treinada, e no trabalho agêntico de longo horizonte as margens são estreitas:
• DeepSWE v1.1 — Pro 71.9, Flash 67.9
• MiMo Code Bench — Pro 63.2, Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1, Flash 52.3
• Toolathlon-Verified — Pro 76.9, Flash 73.6
• Terminal Bench 2.1 — Pro 89.9, Flash 87.6
• OSWorld-Verified — Pro 82.0, Flash 80.8
• JobBench — Pro 62.0, Flash 61.2
• MiMo Visual Coding — Pro 72.3, Flash 71.5
• CyberGym — Pro 94.0, Flash 95.1
• MiMo Cyber Bench — Pro 80.2, Flash 77.2
Leia essa coluna de cima para baixo e a vantagem do topo de linha fica majoritariamente entre um e quatro pontos, com uma linha perdida por completo. Em um fluxo de trabalho em que a diferença entre 67,9 e 71,9 é a diferença entre uma tarefa ser concluída e uma tarefa falhar, três vezes o preço é barato. Em um fluxo de trabalho em que essa é a diferença entre duas respostas aceitáveis, não é. Tabelas de fornecedores com casas decimais como essas convidam a uma falsa precisão — ninguém fora da Xiaomi os executou, e uma diferença de dois pontos em um sistema de avaliação interna está bem dentro da faixa que um avaliador diferente ou uma política de tentativas diferente pode alterar.

Onde compra muito
Há um conjunto de linhas em que a diferença deixa de ser uma questão de arredondamento. Cada uma delas é trabalho de segurança:
• ExploitGym — Pro 17,8, Flash 6,0
• ExploitBench — Pro 47,9, Flash 25,3
• SEC Bench Pro — Pro 66,3, Flash 47,5
• Agents' Last Exam — Pro 31,6, Flash 27,6
• Terminal Bench 4.0 — Pro 34,9, Flash 28,8
No ExploitGym, o modelo principal é três vezes o modelo mais barato, o mesmo fator do preço, e no SEC Bench Pro é 1,4x. Esse padrão é o que se esperaria de um modelo com 42B parâmetros ativos contra um com 15B: uma tarefa que exige uma longa cadeia de raciocínio sem crédito parcial é o tipo de tarefa em que a capacidade extra aparece, e o CyberGym ficar do lado oposto é a exceção que prova que as duas execuções aprenderam coisas diferentes, e não a mesma coisa em tamanhos diferentes.
Portanto, a divisão corresponde a uma fronteira real de carga de trabalho, e não a uma fronteira de marketing. Trabalho de agente em grande volume com um critério de sucesso tolerante — recuperação, classificação, edições de rotina, chamadas que uma nova tentativa pode salvar — é território do Flash. Trabalho em que uma resposta errada sai cara e uma resposta parcial não vale nada — desenvolvimento de exploits, revisão de segurança, sessões de terminal com estado de várias etapas — é onde o nível Pro justifica o preço múltiplo.
O número que não existe
O MiMo-V2.6-Flash não tem uma página de modelo da Artificial Analysis. O seu irmão tem. Essa assimetria é a coisa mais importante nesta página, porque significa que o único valor medido de forma independente em toda a série MiMo-V2.6 é o 46 ao lado de Xiaomi MiMo-V2.6-Pro. Todos os números do Flash acima — incluindo a linha do CyberGym em que ele vence — vêm de um harness da Xiaomi, de um avaliador da Xiaomi e de uma execução offline da Xiaomi.
Há um argumento razoável de que isto é temporário: o modelo tem um dia de idade no momento em que escrevo e a avaliação por terceiros leva tempo. Há também um argumento razoável de que é estrutural, uma vez que o Flash é o nível de volume e os níveis de volume atraem menos atenção de benchmarking. De qualquer forma, a consequência prática hoje é que não é possível comparar o Flash com nada fora da sua própria família com a mesma confiança com que compara o Pro. Se está a escolher entre o Flash e um modelo que não seja da Xiaomi com base na relação preço-qualidade, está a comparar um valor de fornecedor com um valor medido por outra pessoa.
Ambos os cartões de modelo apresentam a mesma segunda ressalva. Nenhum dos repositórios é implantado por nenhum fornecedor de inferência — a Hugging Face afirma-o explicitamente em cada página, e a Artificial Analysis contou um único fornecedor de API para o Pro. Não alojamos nenhum dos checkpoints, pelo que nenhum dos dois é encaminhável através de nós. A rota para ambos é a própria plataforma da Xiaomi e os catálogos de terceiros que os disponibilizam.

O preço que você paga em hardware, não em tokens.
O preço por token é apenas metade do que um checkpoint custa a você, e os dois diferem muito mais acentuadamente no disco do que na tabela de preços. O MiMo-V2.6-Flash publica 172,9 GB de pesos FP8 em 65 shards. O Xiaomi MiMo-V2.6-Pro carrega aproximadamente três vezes mais parâmetros, o que coloca seu download bruto na faixa de meio terabyte antes de qualquer quantização — e seu próprio repositório relata um tamanho de modelo Safetensors de 524B parâmetros, um número que não se concilia nem com o total de 1,02T nem com a contagem de 42B ativos.
Essa diferença muda a forma da decisão. O Flash, com 172,9 GB, é um modelo que uma equipe pequena pode auto-hospedar em capacidade alugada e tratar como commodity. O Pro, com cerca de três vezes esse valor, é uma decisão de cluster — a cobertura em torno do lançamento situou as duas execuções de treinamento em aproximadamente 4.000 e 8.000 GPUs equivalentes a H200, respectivamente. Se o seu motivo para olhar para pesos abertos é querer ter a opção de parar de pagar por token, os dois checkpoints oferecem essa opção em escalas de compromisso muito diferentes.
Escolhendo entre eles
A regra que sobrevive às ressalvas acima é escolher por classe de carga de trabalho, e não pela média de benchmark. Flash para qualquer coisa que você ficaria confortável em tentar de novo; Pro para qualquer coisa em que uma nova tentativa não o salva. Depois, meça, porque nenhum dos modelos tem uma pontuação independente nos benchmarks com os quais você realmente se importa.
Comparar dois checkpoints lado a lado é onde um roteador faz algo que um contrato por modelo não consegue. Colocar um nível barato na maior parte do seu tráfego e escalar apenas os casos difíceis para o nível caro é a mesma decisão que esta página, expressa como configuração em vez de reescrita — e é exatamente para essa composição que a camada de roteamento existe. Também importa para o próprio preço: repassamos o preço de tabela do provedor com 0% de margem, então, se a Xiaomi reduzir a tarifa em qualquer um dos checkpoints, o número do nosso lado muda no mesmo dia, e não na próxima renovação de contrato. Isso se aplica aos modelos que oferecemos. Para o par MiMo-V2.6 especificamente, hoje, você ainda está comprando diretamente da Xiaomi.
O que resolveria isso
Duas coisas transformariam isto de uma decisão subjetiva numa questão aritmética. Uma página do Artificial Analysis para o MiMo-V2.6-Flash colocaria ambos os checkpoints no mesmo eixo de custo por tarefa que atualmente situa o Pro em $0,133 por tarefa do Intelligence Index, e a comparação resolver-se-ia por si mesma. Uma replicação por terceiros do cluster de segurança — ExploitGym, ExploitBench, SEC Bench Pro — confirmaria se a diferença de 3x nessas linhas é uma propriedade do modelo ou uma propriedade do avaliador.
Até então, a posição defensável é que o Xiaomi MiMo-V2.6-Flash é a melhor compra para a maioria das equipes na maior parte do tempo, e que o Xiaomi MiMo-V2.6-Pro é a melhor compra para a estreita classe de trabalho em que a falha é o resultado caro. A única linha em que o Flash vence não anula isso — mas é um lembrete útil de que o prêmio do carro-chefe é uma afirmação sobre uma carga de trabalho, não sobre um modelo.

