Um cartão de título principal com o texto 'Xiaomi MiMo-V2.6-Flash foi lançado' sobre o subtítulo '309B de pesos abertos, licença MIT, contexto de 1M de tokens – publicado em 21 de setembro de 2026', com quatro selos em formato de pílula: '309B no total / 15B ativos', '173 GB de pesos FP8', 'contexto de 1M de tokens' e 'Relatório técnico incluído'.
Guides & Insights

Xiaomi MiMo-V2.6-Flash chegou: um modelo aberto de 309B que você mesmo hospeda

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MiMo-V2.6-Flash deixou de ser um trabalho de treinamento em 21 de setembro de 2026 às 15:39 UTC, quando a equipe MiMo da Xiaomi publicou o checkpoint como XiaomiMiMo/MiMo-V2.6-Flash-RL no Hugging Face — sem restrições de acesso, com licença MIT, relatório técnico anexado, 65 shards de pesos no índice. XiaomiMiMo/MiMo-V2.6-Pro-RL veio dezoito segundos depois. Uma semana antes, ambos os modelos eram dois cards marcados como "interrompido" em um painel público de treinamento, e a frase amplamente repetida sobre eles era que não existiam pesos. Agora eles são arquivos que qualquer pessoa pode baixar e servir. Isso é uma mudança real no que você pode fazer com o modelo, o que é diferente de um anúncio sobre um modelo.

Comece pelo timestamp, porque o lançamento chegou sem a coreografia habitual do fornecedor. O próprio blog da Xiaomi, consultado em 22 de setembro, ainda mostra o lançamento do MiMo-V2-Flash de dezembro de 2025 como sua postagem mais recente. Não há ensaio de lançamento do V2.6, nem lista de preços publicada para a nova geração, nem identificador de modelo chamável que a Xiaomi tenha anunciado para qualquer um dos dois checkpoints. O que existe é um repositório, um relatório técnico, receitas de implantação e um conjunto de tabelas de benchmark executadas pelo fornecedor — além de um detalhezinho hostil no cartão do modelo que só importa para quem planeja de fato carregar a coisa.

As duas cartas que você pode segurar

Ambos os checkpoints são omnimodais nativos, com um contexto declarado de 1M de tokens, e ambos trazem a licença MIT — utilizáveis comercialmente, ajustáveis por fine-tuning, redistribuíveis, sem barreira de receita e sem cláusula de investigação. O cartão chama ao Flash o "checkpoint equilibrado em eficiência" da série e ao Pro o carro-chefe; a parte interessante é como os dois diferem quando se olha para as configurações em vez da frase de marketing.

• Número de parâmetros — MiMo-V2.6-Flash: 309B no total, com 15B ativados por token; MiMo-V2.6-Pro: 1,02T no total, com 42B ativados. Ambos são modelos esparsos de mistura de especialistas.

• Backbone — Flash tem 48 camadas (39 de janela deslizante, 9 de atenção global), tamanho oculto 4096, 256 especialistas roteados com 8 ativados, uma janela deslizante de 128 tokens, sem especialistas compartilhados. O primeiro bloco é atenção global com uma rede feed-forward densa; tudo o que vem depois se intercala.

• Codificadores — um MiMo ViT de 681M de parâmetros (28 camadas, 24 de janela deslizante mais 4 completas), um tokenizador de áudio de 308M e um codificador de patches de áudio de 127M, de modo que texto, imagem, vídeo e áudio entram todos no mesmo modelo, em vez de três pipelines improvisadamente acoplados.

• Decodificação especulativa — um modelo de rascunho de previsão multi-token com cinco camadas, no estilo DFlash, descrito no cartão como prevendo sete tokens à frente por passagem direta para verificação paralela.

• Armazenamento — o índice publicado relata 172,9 GB de dados de pesos em 65 fragmentos, em FP8 (e4m3) com um esquema de ativação dinâmico. Entenda isso como aproximadamente nove bytes por parâmetro: a Xiaomi entregou o modelo grande, não uma quantização dele em tamanho de laptop.

Três números que não coincidem

Vale a pena dizer isto claramente, porque os três afetam uma decisão de implantação, e não um argumento de benchmark, e nenhum deles é sinistro — parecem uma deriva de documentação entre o texto escrito, a página do repositório e os arquivos entregues.

O primeiro é o decodificador especulativo. O resumo do modelo diz que a cabeça MTP é um modelo de rascunho de cinco camadas que prevê sete tokens por passagem.config.json no mesmo repositório define num_nextn_predict_layers como 3. Os dois números não podem descrever o mesmo artefato, e é a config que o runtime vai ler. Se você está dimensionando a memória para decodificação especulativa, confie na config e verifique após o carregamento.

O segundo é mais subtil e não é sequer um erro, mas antes uma convenção de nomenclatura que soa a erro. O repositório chama-se MiMo-V2.6-Flash-RL, o que convida a assumir que é um adaptador de aprendizagem por reforço e não um modelo. É o modelo. O sufixo -RL assinala a linhagem de pós-treinamento — este checkpoint é o resultado da execução de RL mista que a Xiaomi transmitiu, não um LoRA assente sobre outra base qualquer. O índice de pesos confirma-o: dezenas de milhares de tensores que abrangem o backbone completo, o codificador de visão, a pilha de áudio e o drafter.

O terceiro é aquele com que você se depara primeiro se dimensionar o hardware a partir da página do repositório em vez do cartão. O bloco Safetensors nessa página informa 159B parâmetros. Isso não corresponde a nenhum dos dois números do cartão — nem aos 309B totais, nem aos 15B ativos — e é o número que um planejador de capacidade tem mais probabilidade de copiar, porque fica ao lado do botão de download. A Xiaomi não explicou a diferença e não podemos resolvê-la de fora; a leitura mais provável é uma convenção de contagem sobre tensores quantizados, e não um modelo diferente. A medida segura é dimensionar a partir dos dados de pesos publicados: 172,9 GB de FP8 distribuídos por 65 shards é um número que terá de ser pago em VRAM, independentemente de como os parâmetros são contados.

O que dizem os benchmarks, e quem os executou

Todos os números abaixo vêm das próprias tabelas de avaliação da Xiaomi no cartão do modelo. Nada disso foi reproduzido de forma independente, nada disso aparece em um leaderboard público, e as colunas de comparação são execuções do próprio fornecedor dos mesmos harnesses contra modelos de outras empresas. Trate a forma dos resultados como informativa e as casas decimais como decoração.

• Agente de código — DeepSWE v1.1: Flash 67,9, Pro 71,9, contra Claude Opus 5 a 74,0, GPT-5.6 Sol a 73,0 e Claude Fable 5 a 70,0. No Terminal Bench 2.1, o Flash chega a 87,6 contra os 89,1 do Opus 5 — uma diferença pequena o suficiente para que seja o harness, e não o modelo, quem talvez esteja decidindo isso.

• Agente geral — o AutomationBench v1.0.6 coloca o Flash em 52,3, acima tanto do GPT-5.6 Sol (45,8) quanto do Claude Opus 5 (50,3) na execução da Xiaomi. Toolathlon-Verified: Flash 73,6, Pro 76,9, Opus 5 80,6.

• Cibersegurança — a coluna mais desequilibrada da tabela. CyberGym: Flash 95,1, acima do seu próprio irmão maior, com 94,0, e com o MiMo-V2.5-Pro em 40,0. Depois, o chão desaparece: ExploitGym 6,0 para o Flash contra 22,1 do Opus 5, ExploitBench 25,3 contra 70,0, SEC Bench Pro 47,5 contra 79,1 do GPT-5.6 Sol.

• Agente visual — MiMo VisualCoding: Flash 71,5, Pro 72,3, Opus 5 70,0.

Vale a pena destacar um número, porque é o tipo de coisa que um post de lançamento costuma esconder. O painel de RL da Xiaomi publicou o Flash em 65.68 no DeepSWE v1.1 — e a ficha do modelo agora exibe 67.9 para o mesmo benchmark no checkpoint final. Essas não são a mesma medição. O número do painel estava rotulado como mini-swe-agent, avg@3, em um snapshot de treinamento; a tabela da ficha é a avaliação offline do fornecedor dos pesos lançados. A diferença de dois pontos é o ganho da última parte da execução mais tudo o que mudou na configuração de avaliação, e ninguém fora da Xiaomi consegue atualmente separar as duas. Se você vem citando 65.68 desde a semana passada, agora é um número obsoleto para um artefato diferente.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

Quanto custa realmente executá-lo

Pesos abertos são uma licença, não uma fatura, e é aqui que o lançamento fica menos comemorativo. A própria seção de implantação da ficha do modelo recomenda SGLang (paralelismo de tensores 16, paralelismo de dados 2, com o caminho especulativo multicamadas no estilo EAGLE ativado) ou uma receita do vLLM com paralelismo de tensores 8, e observa que o vLLM estável pode ficar atrás da arquitetura. Isso é um trabalho de serviço multinó para um modelo de 309B cujos pesos ocupam cerca de 173 GB antes de você adicionar o cache KV para um contexto de 1M de tokens. A amostragem recomendada é temperature 1.0, top_p 0.95.

Portanto, o enquadramento honesto de “open source” aqui é: a Xiaomi removeu a barreira da licença e deixou a barreira de hardware exatamente onde estava. Fazer fine-tuning do Flash com seus próprios traces agora é legal e possível; fazê-lo em qualquer coisa menor que um nó de GPU sério não é. Essa é uma oferta real e diferente de um endpoint hospedado, e é por isso que as duas formas de usar esta geração não competem — elas cobrem orçamentos diferentes.

Se você quer a capacidade sem o node, os modelos com os quais a Xiaomi compara nessa tabela são a alternativa prática: GPT-5.6 Sol, Claude Opus 5 e Claude Fable 5 podem todos ser chamados hoje, e eles são uma única chave de API ao preço de tabela do provedor, com 0% de markup repassado no OrcaRouter, então a decisão que você está de fato tomando é "comprar um node" versus "medir as chamadas". Se você quiser ver como a camada chamável se sai nas mesmas tarefas de codificação antes de se comprometer com qualquer um dos caminhos, o quadro de codificação é uma leitura mais rápida do que a tabela do fornecedor. O que você não pode fazer em nenhum roteador hoje é chamar o próprio MiMo-V2.6-Flash — não roteamos nenhum modelo Xiaomi, e a linha de disponibilidade no próprio card da Xiaomi aponta para os canais da própria Xiaomi: a plataforma MiMo API, o AI Studio, o MiMo Code e o aplicativo de desktop.

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

A questão de preços ainda está em aberto

A Xiaomi não publicou uma tarifa por token para o MiMo-V2.6-Flash. A cobertura do lançamento diz que a série manterá os preços de API do MiMo-V2.5, e isso é uma alegação da imprensa, e não uma tabela de preços do fornecedor — as tarifas publicadas da geração V2.5 no exterior ficavam em torno de um décimo de dólar por milhão de tokens de entrada, com a entrada em cache uma ordem de magnitude mais barata, mas nada no site da Xiaomi confirma que os novos checkpoints herdem esses valores. Até que apareça uma lista de preços, qualquer número que você veja para um endpoint do MiMo-V2.6 é inferência de alguém.

Ainda faltam duas outras coisas, e ambas estão na lista de tarefas da própria Xiaomi, e não na de mais ninguém. A declaração de Luo Fuli durante a transmissão ao vivo sobre RL foi de que os ambientes de treinamento e o código de RL seriam disponibilizados em código aberto, e o material de lançamento repete esse compromisso; os repositórios atualmente trazem pesos, um relatório técnico e instruções de implantação, não a stack de treinamento. E não há avaliação independente: nenhuma submissão a leaderboard, nenhuma reexecução por terceiros das colunas DeepSWE ou CyberGym. Essa é a lacuna que mais importa para quem está decidindo se um modelo de 309B com um orçamento ativo de 15B vale a pena ocupar um nó.

O que mudaria o cenário?

Três sinais merecem atenção, em ordem aproximada do quanto eles influenciariam uma decisão. Uma lista de preços publicada transforma isto de um projeto de auto-hospedagem num item de linha que você pode comparar com a fronteira dos serviços hospedados. Uma avaliação de terceiros nos mesmos harnesses — DeepSWE ou Terminal Bench, submetida em vez de autorrelatada — resolveria se o 67,9 é uma posição real ou uma configuração favorável. E os ambientes de RL, se forem lançados, seriam o artefato mais interessante para a maioria das equipes, porque são o que você precisaria para reproduzir o ciclo de autoaperfeiçoamento com seus próprios dados.

Até então, a leitura prática deste lançamento é estreita e clara. O MiMo-V2.6-Flash é um modelo de agente omnimodal legítimo, de pesos abertos e licenciado sob MIT, num tamanho que pressupõe um cluster — e é o primeiro checkpoint da geração MiMo-V2.6 que se pode ter nas mãos, o que é mais do que se podia dizer dele na semana passada.

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente