Card de título principal para o artigo "MiMo-V2.6: o que o artigo de RL mostra", com a linha superior "RELATÓRIO TÉCNICO" e o subtítulo "o relatório de RL misto da Xiaomi, lido pelo que ele verifica e pelo que não verifica". Quatro chips arredondados trazem "Roteador MoE congelado", "Custo do avaliador 12,7%", "DeepSWE 58,4 a 72,6" e "AA Index 46". Uma linha de rodapé traz "Números do DeepSWE reportados pelo fornecedor; AA Index 46 medido pela Artificial Analysis." O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

MiMo-V2.6: O que o artigo de RL da Xiaomi realmente mostra, e o que deixa sem verificar

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maioria dos artigos de modelos publicados este mês são artigos de arquitetura. O relatório técnico por trás do Xiaomi MiMo-V2.6-Pro e do Xiaomi MiMo-V2.6-Flash não é. Intitulado MiMo-V2.6: Escalando o aprendizado por reforço rumo ao autoaperfeiçoamento, submetido em 21 de setembro de 2026 e atribuído à LLM-Core Xiaomi, ele dedica quase nada de sua extensão ao backbone de mistura esparsa de especialistas e quase toda ela a uma única questão: o que acontece quando todo o orçamento de pós-treinamento vai para uma única execução de aprendizado por reforço misto. O relatório do DeepSeek-V4.1-Flash, em contrapartida, é um documento sobre memória — sua extensão vai para atenção esparsa comprimida, reuso de KV entre camadas e armazenamento FP4. Coloque os dois lado a lado e eles são argumentos sobre de onde vem a capacidade, e eles não concordam.

Vale a pena ler o relatório em seus próprios termos, mas vale a pena lê-lo com atenção, porque é um autorrelato do laboratório que conduziu a execução. Ele nomeia seus mecanismos, mostra suas ablações, publica suas falhas e, no mesmo fôlego, relata números que não podem ser verificados de fora. Separar essas duas coisas é a maior parte do trabalho. Este texto faz isso, e foi escrito em 23 de setembro de 2026 — dois dias depois de os checkpoints terem sido disponibilizados, enquanto o artigo é a coisa mais nova e menos corroborada sobre eles.

Por que a data no papel importa mais do que o habitual

Os checkpoints MiMo-V2.6-Pro e MiMo-V2.6-Flash, da Xiaomi, chegaram ao hub de modelos em 21 de setembro de 2026, com licença MIT e sem restrições de acesso. O relatório está datado do mesmo dia e alcançou o topo da lista de tendências no site de preprints onde foi publicado. Esse timing é o motivo de isto ser uma notícia, em vez de uma retrospectiva: o artigo não é uma explicação posterior de um modelo que todos já avaliaram em benchmarks. Ele está chegando junto com os pesos, antes que alguém fora da Xiaomi tenha publicado uma execução independente.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

Essa ordenação também é a principal fraqueza do artigo como evidência. Tudo que decorre dela — a curva do DeepSWE, os ganhos na taxa de aprovação, a defesa contra reward hacking — é uma alegação sobre um processo de treinamento que aconteceu uma vez, dentro de um laboratório, em um cluster, e que ninguém mais reproduziu. A thread que sinalizou o relatório trata isso como a parte interessante: este é um artigo de dados e experimentos, não um artigo de arquitetura, e experimentos são exatamente o tipo de resultado que ou se replica ou não.

Três eixos de escalabilidade, e apenas um deles é um problema de hardware.

A forma como o relatório enquadra a questão é que o poder computacional do aprendizado por reforço foi escalado ao longo de três eixos simultaneamente, e o terceiro é o que muda a maneira como você pensa sobre o método.

• Lote e taxa de transferência — 1.568 amostras por atualização, expandidas para dezesseis rollouts cada, então aproximadamente 25.000 trajetórias por passo, consumindo 2,7 a 3,7 bilhões de tokens por passo em comprimentos de contexto de até um milhão de tokens. A arquitetura de rollout é totalmente assíncrona, o que é justamente o que torna esse tamanho de lote viável.

• Ambientes — uma única execução mista abrangendo tarefas de código, de agente geral, visuais e cibernéticas, sob vários harnesses de agente ao mesmo tempo, em vez de execuções de RL separadas por domínio. A própria Xiaomi resume isso como "Você Só Faz RL Uma Vez". O argumento para a mistura é que ganhos em uma capacidade reforçam as outras; o risco é que um tipo de tarefa lento sofra inanição, o que, segundo o relatório, é tratado com agendamento adaptativo.

• Computação do avaliador — o eixo que não se refere a GPUs no sentido habitual. A aprovação/reprovação binária não consegue classificar duas soluções que ambas passam, então o próprio sinal de recompensa se torna aquilo que você escala. Um avaliador agêntico compara as dezesseis tentativas de uma tarefa em conjunto e produz um sinal graduado em vez de um bit.

É nesse terceiro eixo que a expressão "autoaperfeiçoamento" no título ganha seu lugar, e onde o relatório está mais exposto. Um modelo que avalia seus próprios rollouts é uma superfície de hacking de recompensa, e o relatório o trata como tal.

Os dois mecanismos que realmente vale a pena entender

Redistribuição de Vantagens por Grupo

Depois de cada etapa, a política produz dezesseis tentativas por tarefa e todas elas são colocadas em um espaço de trabalho compartilhado para que um modelo avaliador possa examiná-las em conjunto, em vez de uma de cada vez. Os patches aprovados são então pontuados em cinco eixos: se a abordagem é adequada ao problema, se a implementação é precisa sem fallbacks desnecessários, se a mudança é mínima, se edita algo fora do escopo e se corresponde ao estilo de código circundante. Os aprovados com classificação mais baixa recebem menos reforço positivo. Um patch confirmado como hack é redefinido para zero e tratado como falha.

A consequência é um sinal de treinamento que empurra na direção de soluções mais curtas e mais baratas, em vez de meramente corretas — o relatório enquadra isso como direcionar para menos tokens por tarefa. Essa é a parte a reter, porque os resultados principais mais adiante no artigo apontam na direção oposta.

Síntese de Recompensa por Grupo

A metade offline da mesma ideia. Em vez de derivar a qualidade puramente de um avaliador em tempo real, a equipe pré-calcula rubricas específicas de cada tarefa e multiplica a recompensa binária do teste pelas pontuações de qualidade e comportamento extraídas dessas rubricas. O relatório descreve isso como a construção das rubricas a partir de rollouts contrastantes — isto é, de casos em que o resultado diferiu, que é onde está a informação.

A avaliação não é gratuita. O relatório estima o custo do avaliador em cerca de 12,7% do custo total de aprendizado por reforço do MiMo-V2.6-Pro. Esse único número é a coisa mais útil no artigo para quem está considerando copiar o método, porque transforma “escale seus avaliadores” de uma ideia em um item de custo.

O roteador congelado é o resultado que a maioria das equipes copiará primeiro.

A secção de estabilidade do relatório contém uma constatação que se sustenta por si só, independente do MiMo-V2.6 e independente do desempenho do modelo.

Com roteadores de mistura de especialistas treináveis, a carga dos especialistas sofreu uma deriva acentuada ao longo de vinte passos. O coeficiente de variação entre especialistas subiu de 0,78 para 2,0. A carga de pico no especialista mais ocupado passou de seis vezes a média para dezesseis vezes. A parcela de especialistas frios — aqueles que recebem quase nenhum tráfego — passou de 0,5% para 22%. Restaurar os pesos do roteador aos seus valores iniciais no passo 20 recuperou o equilíbrio imediatamente.

A resposta da Xiaomi foi congelar o roteador MoE durante a execução. O raciocínio não é sutil: nessa escala de batch, a instabilidade de roteamento é um problema de dinâmica de treinamento que você pode simplesmente optar por não ter, e o roteador não é onde o aprendizado por reforço está fazendo seu trabalho. Se congelar custa algo em qualidade final não é respondido por uma ablação no material publicado, e é razoável querer isso.

O que a constatação não diz é nada sobre serving. O balanceamento de carga do roteador durante uma execução de treinamento e a utilização de especialistas sob tráfego de produção são questões diferentes, e o relatório aborda apenas a primeira.

Os números, com os respetivos rótulos anexados

Os resultados principais do relatório são limpos na forma e bagunçados nos detalhes, e a bagunça não é um escândalo — são três medições diferentes de três objetos diferentes que compartilham um nome.

• DeepSWE v1.1, em holdout — MiMo-V2.6-Pro subiu de 58,4 para 72,6 ao longo da execução; MiMo-V2.6-Flash, de 48,7 para 65,7. O benchmark é composto por 113 tarefas de engenharia de repositórios de horizonte longo, avaliadas por verificadores funcionais em cinco linguagens de programação, e a métrica é average@3 — a taxa média de aprovação dos verificadores em três tentativas amostradas, o que não é o mesmo que saber se qualquer uma das três tentativas foi bem-sucedida. Interpretar avg@3 como pass@3 superestimará todos os números da página.

• O mesmo benchmark, medido em outro lugar — os model cards divulgados trazem 71,9 para o Pro e 67,9 para o Flash. O painel público de treinamento da Xiaomi trazia 72,57 e 65,68. Portanto, há três números publicados por modelo, dois deles da Xiaomi, e a direção da discrepância é diferente para cada irmão. Nenhum deles está errado; eles descrevem um instantâneo de painel, uma entrada de model card e uma linha de relatório, em momentos diferentes e possivelmente sob harnesses diferentes.

• Destilação — MiMo-V2.6-Distill-Qwen-9B, ajustado a partir do Qwen3.5-9B com demonstrações geradas pelo MiMo, elevou o SWE-bench Verified de 61,1 para 66,2. Este é o número mais transferível do artigo, porque um aluno de 9B é um tamanho que a maioria das equipes consegue de fato executar.

• Um mini-benchmark interno de cibersegurança — 31,3 a 47,0. Interno significa interno: as tarefas não são publicadas, portanto o delta não pode ser reproduzido nem mesmo em princípio.

• O Índice de Inteligência da Artificial Analysis — 46 para o MiMo-V2.6-Pro. Este é diferente em natureza. Ele foi produzido pela Artificial Analysis executando seu próprio harness contra o checkpoint lançado, e não pela Xiaomi, o que o torna o único número de destaque nesta divulgação que um leitor pode tratar como medido, em vez de relatado. É também o número com o qual comparar o GLM-5.3, o Kimi K3 e a fronteira fechada, e fica cinco pontos abaixo do Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

O relatório é honesto sobre os limites de sua própria tabela, e esta é a frase que vale a pena citar de volta para quem não é: as comparações misturam benchmarks públicos e internos e não isolam a contribuição do aprendizado por reforço em relação à arquitetura ou ao pré-treinamento. Um modelo que é melhor depois do RL não é prova de que o RL seja o motivo.

Há uma segunda ressalva, e é ela que contraria o enquadramento. Os ganhos relatados geralmente acompanham o aumento do uso de tokens. O relatório apresenta isso como melhoria sustentada de capacidade, e não como eficiência, e faz bem. Mas o GAR foi projetado explicitamente para direcionar para caminhos mais curtos e menos tokens por tarefa, e o resultado agregado não mostra a carga de trabalho ficando mais barata. A capacidade aumentou; o custo por tarefa não caiu. Se você lê "autoaperfeiçoamento" como "o modelo vai precisar de menos dinheiro meu no próximo trimestre", o artigo não sustenta essa leitura.

O que o relatório deixa por verificar

Em 23 de setembro de 2026, nenhum terceiro publicou uma reprodução independente das colunas DeepSWE, Terminal Bench ou CyberGym. A distinção que importa é entre o ponto do índice e todo o resto: 46 é uma medição feita por outra pessoa, e 72,6 é uma alegação sobre uma execução de treinamento que ninguém consegue reexecutar, porque a execução custou, segundo relatos, US$ 2,6 milhões para o Pro e US$ 0,9 milhão para o Flash e não vai acontecer duas vezes.

O que a Xiaomi de fato publicou, e que a maioria dos laboratórios não publica, são as dinâmicas de treinamento, o framework de aprendizado por reforço e os ambientes de tarefas — mais de 7.000 ambientes graduados em engenharia de software, reprodução de vulnerabilidades, trabalho intelectual e web design. Esse é o artefato com a maior vida útil. Os pesos dizem o que a execução produziu; os ambientes dizem como executar o experimento por conta própria, que é a única maneira de qualquer alegação sobre RL algum dia ser resolvida.

A defesa contra reward hacking merece uma ressalva específica. Ela é descrita como multicamadas — concepção de recompensas, avaliação adversarial, detecção de anomalias e verificação cruzada entre verificadores — e é descrita inteiramente pela parte que ficaria embaraçada com uma falha dela. Uma defesa contra um modelo que engana um avaliador baseado em modelo não é o tipo de coisa que um autorrelato consegue encerrar. O mecanismo é nomeado e o modo de falha é reconhecido, o que é mais do que a maioria dos artigos faz, e ainda é uma questão em aberto.

O que você pode realmente fazer com isso hoje

Ambos os checkpoints são baixáveis, sem restrições, sob uma licença MIT: Xiaomi MiMo-V2.6-Pro-RL e Xiaomi MiMo-V2.6-Flash-RL, omnimodais, contexto de um milhão de tokens, com o índice do Flash reportando 172,9 GB de dados de pesos em 65 shards em FP8. A Xiaomi não publicou uma tabela de preços por token para a geração V2.6, então a escolha hoje é entre auto-hospedagem e um modelo hospedado pelo qual você já paga.

Essa comparação é onde reside o valor real do artigo, e é pouco lisonjeira para o artigo de uma forma útil. A alegação em teste não é "o MiMo-V2.6-Pro é bom" — os 46 respondem a isso. É "o aprendizado por reforço em tarefas agênticas mistas produz raciocínio que se transfere para minha carga de trabalho?", e a única maneira honesta de responder a isso é executar os dois e comparar, o que é um problema de roteamento antes de ser um problema de pesquisa. O DeepSeek-V4.1-Flash está a uma chave de API de distância, a $0.15 e $0.60 por milhão de tokens, Qwen3.8-Flash e GLM-5.3-Flash ficam na mesma chave, e se você quiser colocar um checkpoint MiMo auto-hospedado atrás do mesmo endpoint por uma semana e ver se a curva DeepSWE aparece nas suas próprias avaliações, isso é uma mudança de configuração, não uma migração. A OrcaRouter não hospeda os modelos da Xiaomi, e nada aqui deve ser interpretado como alegar o contrário — mas os modelos com os quais você os compararia estão todos acessíveis através de uma única chave de API da OrcaRouter pelo preço de tabela do provedor, com 0% de markup repassado, com failover automático se um checkpoint que você estiver testando se revelar instável sob carga.

O caso do modelo não comprovado é exatamente aquele para o qual o failover foi criado. Um checkpoint publicado há dois dias, com uma avaliação conduzida pelo fornecedor e nenhuma reexecução independente, é exatamente o que você quer testar sem colocar um caminho de produção por trás dele.

Quem deve ler o artigo

Se você faz pós-treinamento, leia isso pelo achado sobre o roteador e pelo valor do custo do avaliador. Ambos são portáveis, ambos são baratos de testar, e nenhum dos dois depende de acreditar em qualquer coisa sobre a tabela de benchmarks do MiMo-V2.6. O resultado do roteador congelado, em particular, é o tipo de coisa que custa uma tarde para tentar e economiza uma execução.

Se você está escolhendo um modelo, leia o ponto do índice e ignore o resto. A Artificial Analysis mediu 46 no artefato lançado; esse é o único número neste lançamento que não veio do fornecedor, e coloca o MiMo-V2.6-Pro no topo do campo de pesos abertos e cinco pontos atrás do Claude Opus 5. Todo o resto no relatório descreve como a Xiaomi chegou lá, e como a Xiaomi chegou lá não é algo que você possa comprar.

E se você estiver lendo a cobertura, e não o artigo, o que se deve observar é a palavra "autoaperfeiçoamento". Os próprios resultados do relatório mostram a capacidade aumentando junto com o uso de tokens, o que é um achado real e repetível sobre escalar o aprendizado por reforço. Não é uma alegação de que o modelo ficou mais barato de executar, e os artigos que se seguem a este são os que vão dizer se ele eventualmente ficará.