Cartão principal do radar de modelos OrcaRouter com o título 'MiMo-V2.6-Flash vs MiMo-V2.6', subtítulo 'Uma série, dois checkpoints e um nome que faz dupla função', com um painel esquerdo para MiMo-V2.6-Flash indicando 309B no total / 15B ativos, 172,9 GB de pesos FP8 e checkpoint Efficiency, um painel direito para MiMo-V2.6-Pro indicando 1,02T no total / 42B ativos, 'o nome que as pessoas escrevem para o flagship' e a mesma licença MIT, e três selos abaixo indicando Publicado em 21 de setembro de 2026, alegação de contexto de 1M de tokens e Nenhum endpoint Xiaomi para chamar.
Guides & Insights

MiMo-V2.6-Flash vs MiMo-V2.6: Uma Série, Dois Checkpoints e um Nome que Desempenha Dupla Função

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pergunte a duas pessoas o que é o MiMo-V2.6 e você pode obter dois modelos diferentes. O lançamento da Xiaomi de setembro de 2026 é uma série com dois checkpoints publicados — MiMo-V2.6-Flash com 309 bilhões de parâmetros e MiMo-V2.6-Pro com 1,02 trilhão — e o nome puro MiMo-V2.6 é usado tanto para a família quanto, na maior parte da cobertura, para o nível mais alto da geração. Então uma página intitulada "MiMo-V2.6-Flash vs MiMo-V2.6" é, na verdade, o checkpoint de eficiência contra o nome que as pessoas escrevem quando querem dizer o carro-chefe. Ambos os checkpoints chegaram ao Hugging Face com dezoito segundos de diferença em 21 de setembro de 2026, ambos trazem a licença MIT, e ambos são, antes de tudo, downloads — não há endpoint da Xiaomi para chamar. Quase nada mais neles é igual.

Isso importa mais do que normalmente importaria uma discussão sobre nomenclatura, porque os dois não são uma escada de tamanhos que você pode subir depois. São execuções de treinamento separadas, com tabelas de benchmark separadas, pegadas de memória separadas e — como mostram os números divulgados — alguns pontos em que o menor vence de forma inequívoca.

Dois checkpoints, uma ata publicada

Os repositórios são XiaomiMiMo/MiMo-V2.6-Flash-RL, criado às 15:39:51 UTC, e XiaomiMiMo/MiMo-V2.6-Pro-RL, criado às 15:39:33 UTC. Nenhum deles tem acesso restrito. Ambos incluem um relatório técnico e um cartão de modelo, e ambos são descritos pela Xiaomi como o produto de uma única execução de aprendizagem por reforço mista que reuniu tarefas de programação, de agente geral, visuais e de cibersegurança em uma só passagem de treinamento, em vez de execuções separadas por domínio.

• Parâmetros — MiMo-V2.6-Flash: 309B no total, 15B ativados por token. MiMo-V2.6-Pro: 1,02T no total, 42B ativados. Ambos com mistura esparsa de especialistas.

• Backbone — Flash tem 48 camadas, 39 de janela deslizante e 9 de atenção completa, tamanho oculto 4096, 256 especialistas roteados com 8 ativados, uma janela deslizante de 128 tokens e nenhum especialista compartilhado. O Pro executa a mesma ideia de atenção híbrida em uma largura muito maior.

• Modalidade — ambos são omnimodais nativos, integrando texto, imagem, vídeo e áudio num único modelo, em vez de três pipelines montados à pressa. O Flash inclui um transformador de visão com 681M de parâmetros, um tokenizador de áudio com 308M e um codificador de patches de áudio com 127M.

• Contexto — 1M tokens, alegado para ambos, com a configuração respaldando um embedding de posição máxima de 1.048.576 tokens.

• Licença — MIT em ambos, sem limiar de receita, sem barreira de uso aceitável além do habitual, e sem cláusula de investigação. A implantação comercial, a modificação e a redistribuição são todas permitidas.

• Arquivos de pesos — Flash publica 172,9 GB de dados de pesos FP8 em 65 fragmentos. Pro tem aproximadamente três vezes o número de parâmetros, então seu download fica na faixa de meio terabyte antes de qualquer quantização que você mesmo aplique.

• Onde eles são disponibilizados — Hugging Face, a própria plataforma de API da Xiaomi, AI Studio, MiMo Code e o aplicativo de desktop MiMo. O card observa que nenhum dos checkpoints está atualmente implantado por um provedor terceirizado de inferência no próprio Hub.

A colisão que custa hardware às pessoas

A confusão nesta dupla não está realmente entre Flash e Pro. Está entre MiMo-V2.6-Flash e o modelo que veio antes dele.

O MiMo-V2-Flash foi lançado em dezembro de 2025, e o próprio post no blog da Xiaomi que o anunciou o descreve como um modelo de mistura de especialistas com 309 bilhões de parâmetros totais, 15 bilhões ativos, um esquema de atenção híbrido que intercala atenção de janela deslizante e atenção completa, e uma janela deslizante agressiva de 128 tokens. Leia isso em contraste com a lista de itens acima. O checkpoint de 2026 e o checkpoint de 2025 têm o mesmo formato geral, o mesmo tamanho de janela deslizante e o mesmo orçamento de ativação — nove meses de diferença, de execuções de treinamento diferentes, com capacidades diferentes e uma tabela de benchmarks diferente.

Portanto, uma pesquisa por "MiMo V2.6 Flash" vai alegremente lhe entregar páginas sobre o MiMo-V2-Flash, completas com um número de contexto de 256K e um preço de um décimo de dólar por milhão de tokens de entrada que pertence ao modelo mais antigo. Se você está dimensionando um nó, isso não é um erro cosmético. O checkpoint antigo e o novo são downloads diferentes, com receitas de serving diferentes, e o novo afirma ter quatro vezes o contexto.

Há uma segunda armadilha, mais silenciosa, na nomenclatura. Ambos os repositórios terminam em -RL, o que soa como um adaptador de aprendizado por reforço assentado sobre algum outro modelo base. Eles não são adaptadores. O sufixo marca a linhagem de pós-treinamento: estes são os checkpoints completos que saíram da execução de RL em streaming. O índice de pesos confirma isso — dezenas de milhares de tensores cobrindo todo o backbone, o codificador de visão, a pilha de áudio e o drafter especulativo.

O que a própria tabela do fornecedor diz

Cada número nesta seção vem das tabelas de avaliação da Xiaomi nos dois cartões de modelo. A Xiaomi executou os harnesses em seus próprios checkpoints. Nada disso foi reproduzido fora do laboratório, nada disso aparece em um placar público, e as colunas de comparação são execuções do próprio fornecedor dos mesmos harnesses contra modelos de outras empresas. Trate a classificação como informativa e as casas decimais como decoração.

• Agente de código — DeepSWE v1.1: Flash 67.9, Pro 71.9. Terminal Bench 2.1: Flash 87.6, Pro 89.9. ProgramBench: Flash 26.0. MiMo Code Bench: Flash 61.2.

• Agente geral — AutomationBench v1.0.6: Flash 52.3, Pro 53.1. Toolathlon-Verified: Flash 73.6, Pro 76.9. OSWorld-Verified: Flash 80.8, Pro 82.0. Agents' Last Exam: Flash 27.6. Terminal Bench 4.0: Flash 28.8.

Cibersegurança — a única coluna em que o modelo menor lidera. CyberGym: Flash 95,1 contra 94,0 do Pro. MiMo Cyber Bench: Flash 77,2. Depois, o piso desaba: ExploitGym 6,0, ExploitBench 25,3, SEC Bench Pro 47,5.

• Agente visual — MiMo VisualCoding: Flash 71,5, Pro 72,3.

Percorra esses itens e o resumo honesto é que o Pro está à frente quase em toda parte, por pequenas margens, e que as margens são pequenas o suficiente para estarem dentro do ruído de um harness executado por conta própria. No DeepSWE, os dois estão separados por quatro pontos em uma escala na qual o mesmo checkpoint variou dois pontos entre duas das próprias avaliações da Xiaomi.

Esse último ponto merece um parágrafo próprio, porque é a coisa mais útil em qualquer uma das fichas. O painel público de RL da Xiaomi, que transmitiu as duas execuções de treinamento até setembro, publicou o Flash em 65.68 no DeepSWE v1.1 usando um harness mini-swe-agent na média de três. A ficha final imprime 67.9 para os pesos disponibilizados. Enquanto isso, o número do painel do Pro era 72.57 e sua ficha imprime 71.9 — ele caiu. Dois checkpoints da mesma execução, avaliados duas vezes, e a diferença entre as duas avaliações é do mesmo tamanho que a diferença entre os dois modelos. Se você vem citando números do painel desde a semana passada, eles descrevem snapshots de treinamento, não os artefatos que você baixaria hoje.

Scoreboard card headed 'MiMo-V2.6-Flash vs MiMo-V2.6-Pro', with paired rows for parameters (309B total / 15B active against 1.02T total / 42B active), weights on disk (172.9 GB FP8 across 65 shards against about three times Flash), DeepSWE v1.1 (67.9 against 71.9, with the RL dashboard's earlier 65.68 and 72.57 noted), CyberGym (95.1 against 94.0), independent score (None published against an Artificial Analysis Index of 46 at 134.3 output tokens per second) and price, plus a sourcing footer stating that every benchmark is Xiaomi's own run except the Pro index score.

Nenhum dos dois está em um roteador.

Aqui está a parte que decide a maioria das avaliações reais. A Xiaomi não vende nenhum dos dois checkpoints: não há preço por token publicado para a geração MiMo-V2.6 no site dela, e nenhum identificador de modelo chamável que ela tenha anunciado para qualquer um dos dois. O que existe, em vez disso, é um download e — apenas para o Pro — um único provedor de API que a Artificial Analysis considera estar servindo-o a US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de saída. Isso é a listagem de um provedor, e não uma tabela de tarifas do fornecedor, e não há absolutamente nada comparável para o Flash. Os valores que circulam em páginas de catálogo de terceiros devem ser interpretados da mesma forma.

Portanto, a escolha entre Flash e Pro não é uma escolha entre dois endpoints com medidores diferentes. É uma escolha entre duas contas de GPU, e a menor corresponde a cerca de um terço da maior. Esse é todo o argumento comercial a favor do Flash, e ele é mais forte do que a tabela de benchmarks sugere, porque os dois modelos ficam a poucos pontos de diferença um do outro nas tarefas para as quais a maioria das pessoas está comprando.

O que resta é a conhecida divisão em três caminhos. Alugar a fronteira, ter um modelo pequeno próprio ou ter um modelo grande próprio. A coluna da fronteira é aquela com a qual a Xiaomi compara em suas próprias tabelas — Claude Opus 5, GPT-5.6 Sol e Claude Fable 5 ficam todos alguns pontos acima do Pro no DeepSWE na própria comparação do fornecedor, e todos os três podem ser chamados hoje por meio de uma única chave de API na OrcaRouter pelo preço de tabela do provedor, com 0% de markup repassado. Isso importa para a decisão específica diante de você: uma mudança de preço do fornecedor chega ao seu lado no mesmo dia, em vez de na próxima renovação de contrato, de modo que a aritmética de alugar versus ter próprio permanece honesta à medida que os preços hospedados mudam. O failover automático também significa que um modelo que você ainda está avaliando nunca precisa ficar sozinho em um caminho de produção enquanto você decide.

O que você não consegue fazer em nenhum roteador hoje — inclusive no nosso — é chamar o MiMo-V2.6-Flash ou o MiMo-V2.6-Pro. Não roteamos nenhum modelo Xiaomi, e a linha de disponibilidade no próprio card da Xiaomi aponta para os canais da própria Xiaomi: a plataforma de API MiMo, o AI Studio, o MiMo Code e o aplicativo para desktop.

Qual checkpoint, e quando

Escolha o MiMo-V2.6-Flash se você quiser a geração MiMo-V2.6 e o hardware for a restrição determinante. Você abre mão de cerca de quatro pontos no DeepSWE e de um ou dois pontos na maioria dos benchmarks de agentes em comparação com o modelo principal. Em troca, ganha um checkpoint que usa cerca de um terço da memória, que supera o Pro no CyberGym na própria tabela da Xiaomi e que compartilha a mesma licença, a mesma alegação de contexto de 1M de tokens e a mesma multimodalidade. Para uma equipe que faz trabalho de avaliação de cibersegurança, essa coluna do CyberGym não é um erro de arredondamento.

Escolha o MiMo-V2.6-Pro se a carga de trabalho for de programação ou de trabalho agêntico de horizonte longo e o nó já estiver pago. É o melhor modelo em quase todas as colunas, é o que a Artificial Analysis realmente mediu — um Índice de Inteligência de 46 na escala v4.3 recalibrada, primeiro entre os 114 modelos de sua classe de pesos abertos, 134,3 tokens de saída por segundo, e listado a $0,435 por milhão de tokens de entrada e $0,87 por milhão de saída — e uma medição independente vale mais do que uma tabela de fornecedor quando você está planejando produção.

Não aceite nenhum dos dois antes de ter lido os arquivos de configuração em vez dos resumos. O cartão do Flash descreve um rascunhador especulativo de cinco camadas que prevê sete tokens por passagem; o config.json no mesmo repositório define num_nextn_predict_layers como 3. O resumo do cartão não é o que o runtime lê. E o bloco Safetensors na página do repositório informa 159B de parâmetros para o Flash e 524B para o Pro, nenhum dos quais corresponde ao total ou à contagem de ativos em nenhum dos cartões de modelo. A Xiaomi não explicou a discrepância. Baseie-se antes no tamanho a partir dos dados de pesos publicados, porque esse é o número que você paga em VRAM independentemente de como os parâmetros são contados.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence and multimodal tags, the model card heading 'Scaling Reinforcement Learning Toward Self-Improvement', a Safetensors block reporting a 159B model size, and an inference-providers panel stating that the model is not deployed by any inference provider.

O que resolveria isso

Três coisas, em ordem aproximada de utilidade. Uma execução de terceiros nos mesmos harnesses — DeepSWE ou Terminal Bench, submetida em vez de autodeclarada — diria a você se a diferença de quatro pontos entre Flash e Pro é uma posição real ou uma configuração favorável. Uma lista de preços publicada transformaria toda a comparação de um projeto de hardware em um item de linha que você pode colocar ao lado da fronteira hospedada. E os ambientes de RL, que a Xiaomi disse que vai disponibilizar em código aberto, são o artefato que a maioria das equipes realmente desejaria, porque são o que você precisaria para reproduzir o ciclo nos seus próprios traços.

Até lá, a leitura prática é estreita. O MiMo-V2.6 são dois checkpoints, não um, e o nome isolado geralmente se refere ao mais caro. Se hoje você estiver escolhendo dentro da série, o padrão honesto é o Flash, a menos que uma coluna de benchmark com a qual você se importe especificamente diga o contrário — e, se você ainda não está pronto para comprar um nó, nenhum dos dois é a resposta certa ainda.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing an Intelligence Index of 46 on the updated scale, ranked first of 114, output speed of 134.3 tokens per second, a price of $0.435 per million input tokens and $0.87 per million output with a 99% cache discount and $0.13 cost per Intelligence Index task, a 1M-token context window, and 1.02T total with 42B active parameters under the MIT licence with weights on Hugging Face.