
Xiaomi MiMo-V2.6-Pro: uma pontuação DeepSWE de 72,57, uma execução que parou e ainda sem data de lançamento
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro encerrou sua execução de aprendizado por reforço transmitida publicamente em 20 de setembro, com uma pontuação no DeepSWE v1.1 de 72,57 exibida no painel da própria Xiaomi — 1,4 pontos abaixo dos 74% que GPT-6 Astra, Gemini 3.8 Flash e Claude Opus 5 compartilham no topo da mesma tabela de classificação. O Xiaomi MiMo-V2.6-Flash, o modelo menor treinado em paralelo, parou em 19 de setembro com 65,68. As duas execuções terminaram no passo 30, e a conta combinada que a Xiaomi publicou junto com elas indicava US$ 3.474.715 quando capturamos a página esta manhã.
Essa é toda a boa notícia, e ela é genuinamente boa. O resto da história é uma lacuna entre um número e um produto. Nem o Xiaomi MiMo-V2.6-Pro nem o Xiaomi MiMo-V2.6-Flash têm data de lançamento, ficha de modelo, identificador de API, preço publicado ou um conjunto de pesos para download. Não há endpoint para chamar. O que existe é um painel de treinamento que qualquer pessoa pode acompanhar, um número de benchmark produzido pelo próprio harness da Xiaomi e uma comunidade que passou seis dias lendo uma página de telemetria como as pessoas costumavam ler folhas de chá.
Então, esta é uma peça do tipo “o que sabemos até agora”, e a versão honesta dela separa três coisas que a cobertura da última semana vem misturando discretamente: o que a Xiaomi tornou público, o que um único observador relatou sobre isso, e o que qualquer uma dessas coisas significa para alguém que está escolhendo um modelo de programação hoje.
O que a Xiaomi realmente colocou online
Em 16 de setembro, a equipe MiMo, liderada por Luo Fuli, abriu uma página ao vivo no domínio da própria Xiaomi mostrando em tempo real o pós-treinamento de dois modelos não lançados: número de passos, curvas de recompensa, throughput de tokens, número de sandboxes, avisos de falha de GPU e um contador de custos que sobe enquanto você assiste. A forma como a Xiaomi apresenta isso, segundo a cobertura, é que passou cerca de seis meses trabalhando em uma única questão — até que ponto o aprendizado por reforço pode ser escalado — e decidiu realizar esse experimento em público, em vez de anunciar um resultado.
O dashboard é incomumente franco para um artefato de fornecedor. Ele lista suas próprias falhas em um feed de avisos: um reinício do Pro na etapa 17 causado por uma falha de falta de memória da GPU devido a desequilíbrio de carga entre especialistas, que a equipe diz ter corrigido ajustando sua estratégia de paralelismo de treinamento; uma falha de conectividade de rede entre o cluster de treinamento do Pro e a implantação de avaliação que forçou um reinício e a decisão de descartar o conjunto de dados de cibersegurança da próxima execução do Pro após "padrões ruins nos logs de rollout"; um reinício do Flash a partir da etapa 15 depois que uma classe de erro de infraestrutura passou despercebida por cerca de três horas; e um reinício do Pro devido a uma falha de VRAM em um único nó. Ele também observa que tarefas consideradas "relativamente fáceis para o modelo pro atual" foram filtradas — uma admissão que a maioria dos relatórios pós-treinamento deixa de fora.

Os dois cartões de execução são a parte que importa para quem acompanha o tempo. Ambos os modelos estão rotulados como stopped: MiMo-V2.6-Pro após 5 dias e 7 horas de tempo real, MiMo-V2.6-Flash após 3 dias e 11 horas, cada um no passo 30, em 20 de setembro e 19 de setembro, respectivamente. O Pro consumiu 75 bilhões de tokens e 753 mil amostras por seus US$ 2,62 milhões; o Flash consumiu 81,4 bilhões de tokens por US$ 854 mil. Cada passo sorteia um lote de 1.568 prompts com 16 rollouts por prompt — 25.088 trajetórias por passo, tudo executado de forma totalmente assíncrona.
Vale dizer com clareza: a Xiaomi não disse se "stopped" significa que a execução terminou, foi pausada ou atingiu um checkpoint. Um cartão parado não é um aviso de conclusão, e ninguém fora da equipe sabe qual dos casos é.
O que está confirmado e o que não está
O 72.57 não é um rumor. Está impresso no painel da Xiaomi, num gráfico rotulado DeepSWE v1.1, mini-swe-agent, avg@3, ao lado da curva laranja da execução Pro. O 65.68 do modelo Flash está no mesmo gráfico. O número também aparece — como 62.24 e, mais tarde, 65.97 — em instantâneos anteriores do mesmo painel, e é isso que dá forma à curva: uma subida constante ao longo de 30 passos, e não uma única avaliação sortuda.
O que é apenas reportado é o ponto de partida. A alegação que circula no X em 21 de setembro, da conta @nrehiew_, é que o modelo Pro passou "de 58,41 para 72,57" no DeepSWE e que as execuções foram concluídas. O endpoint corresponde exatamente ao dashboard do fornecedor. A linha de base de 58,41 é a leitura dessa conta de onde a curva começa — o ponto Pro mais à esquerda do gráfico fica na casa dos 50 altos — e a Xiaomi não publicou nenhum número da etapa 1. A alegação de conclusão é igualmente uma interpretação de dois cards marcados como interrompidos, o que é uma leitura razoável e não uma declaração da Xiaomi. Trate a melhoria de 14 pontos como direcionalmente sólida e numericamente aproximada.

Há mais uma distinção que a cobertura deixou de fora, e é ela que decide quanto vale o número. Os painéis de benchmark do dashboard são avaliações da própria Xiaomi: a empresa executou o harness nos próprios checkpoints e publicou os resultados. O harness é o mesmo usado pelo ranking público — mini-swe-agent, DeepSWE v1.1 —, o que torna o número mais comparável do que seria com um benchmark caseiro de um fornecedor. Mas uma avaliação feita por conta própria não é uma entrada no ranking, e 72,57 não aparece no quadro da Datacurve, porque ninguém o submeteu.
O teto de 74% é mais apertado do que a manchete sugere.
O que coloca a comparação em foco. O leaderboard DeepSWE v1.1 da Datacurve, atualizado pela última vez em 3 de setembro de 2026, lista 113 tarefas em 91 repositórios em cinco linguagens, e suas três principais configurações estão empatadas em 74% de Pass@1: GPT-6 Astra com esforço de raciocínio xhigh, Gemini 3.8 Flash em high e Claude Opus 5 em max. Os números que acompanham essas pontuações são os interessantes.
• Confiança — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. No mesmo quadro, GPT-5.6 Sol fica em 73% ±3 e GLM-5.3 e Kimi K3 em 69%. Os intervalos se sobrepõem bem além da segunda casa decimal.
• Custo por tarefa — Gemini 3.8 Flash tem média de US$ 2,36, GPT-6 Astra US$ 6,52, Claude Opus 5 US$ 11,84. O próprio gráfico do ranking aponta o Gemini 3.8 Flash como a configuração mais eficiente do quadro, e a diferença entre esses três é de cerca de cinco para um para uma taxa de aprovação que o benchmark não consegue distinguir.
• Etapas — O Gemini 3.8 Flash precisou, em média, de 166 etapas de agente por tarefa, o Claude Opus 5, 99, e o GPT-6 Astra, 29. A pontuação empatada esconde três estilos de trabalho muito diferentes, e o barato é o que mais trabalha.

Então, quando o 72,57 relatado é descrito como "aproximando-se do topo do ranking", a versão precisa é mais restrita e menos dramática. Ele está a cerca de um ponto e meio de um empate triplo cujos integrantes não podem ser separados entre si pelas próprias barras de erro do benchmark. É um resultado forte para um modelo ainda em pós-treinamento, produzido pelo fabricante, e não pelos mantenedores do benchmark, em um placar ao qual o modelo não foi submetido. A última atualização do placar é anterior por completo à rodada da Xiaomi, e é por isso que nada do MiMo aparece nele ainda.
Por que a Xiaomi está treinando em público
A transparência não é incidental. O último lançamento de pesos abertos da Xiaomi foi o Xiaomi MiMo-V2.5 e o Xiaomi MiMo-V2.5-Pro no final de abril, ambos sob a licença MIT — utilizáveis comercialmente, ajustáveis e redistribuíveis. O MiMo-V2.5-Pro é um modelo de mistura de especialistas (mixture-of-experts) de 1,02 trilhão de parâmetros, com 42B de parâmetros ativos, uma arquitetura de atenção híbrida e uma janela de contexto de 1M de tokens, e seu material de lançamento deixou explícitas as alegações agênticas: um compilador escrito do zero em Rust ao longo de centenas de chamadas de ferramentas, um aplicativo de desktop de oito mil linhas construído ao longo de onze horas de trabalho de agente.
Transmitir ao vivo o pós-treinamento da próxima geração é um tipo diferente de afirmação. Um laboratório que publica suas curvas de recompensa, suas contagens de sandbox e suas falhas de GPU em tempo real está pedindo para ser julgado pelo processo, e não por um deck de lançamento, e está sinalizando um cronograma. Luo Fuli disse que os detalhes técnicos do trabalho de RL serão abertos em código aberto peça por peça nas próximas semanas. Isso é o mais próximo de um cronograma que alguém ofereceu: metodologia primeiro, modelo depois.
Isso também se encaixa em um padrão que a Xiaomi já usou antes, no qual um modelo aparece em público sob outro nome antes de a empresa reivindicá-lo. Os hábitos da empresa são treinar em silêncio, testar abertamente e depois lançar com os pesos.
O que você pode executar hoje
Nada na família MiMo-V2.6. Se você quer um modelo Xiaomi MiMo agora, a geração V2.5 é o que existe — pesos abertos pelos canais da própria Xiaomi e várias plataformas de terceiros, com cards e preços publicados. Não há API do MiMo-V2.6, nem identificador de modelo, nem lista de preços, e qualquer página que cite um identificador ou uma tarifa por token do MiMo-V2.6 está preenchendo um espaço em branco que a Xiaomi deixou vazio. As strings `mimo-v2.6-pro` e `mimo-v2.6-flash` no dashboard são nomes de jobs de treinamento, não endpoints publicados.
A outra consequência prática é o que fazer nesse meio-tempo. Se o motivo pelo qual o MiMo-V2.6-Pro é interessante para você é que ele pode ser uma forma mais barata de alcançar desempenho de codificação de nível de fronteira, as configurações com as quais ele está sendo medido já podem ser chamadas, e o ranking diz que a opção barata é competitiva: o Gemini 3.8 Flash empata na maior taxa de aprovação, a US$ 2,36 por tarefa, e é sinalizado como a configuração mais eficiente do ranking. Gemini 3.8 Flash, Claude Opus 5 e GPT-6 Astra são todos acessíveis por meio de uma única chave de API do OrcaRouter ao preço de tabela do provedor, com 0% de markup repassado — portanto, uma mudança de preço de um fornecedor entra em vigor do nosso lado no mesmo dia, e não no próximo ciclo de faturamento — com failover configurado por modelo, em vez de por fornecedor. E quando um laboratório abre um modelo como este, roteá-lo por trás da mesma chave é a forma de baixo compromisso de avaliá-lo: você pode colocá-lo diante de tráfego real sem apostar um caminho de produção em um checkpoint que ninguém caracterizou.
O que realmente mudaria esta história?
Quatro sinais, aproximadamente na ordem de quanto eles resolveriam:
• Pesos no Hugging Face sob uma licença declarada, que foi como a geração V2.5 chegou e a evidência mais forte de que a execução de RL produziu um modelo lançável, em vez de um experimento que chegou ao fim.
• Um cartão de modelo com contagem de parâmetros, comprimento de contexto e arquitetura — nenhum dos números da V2.6 é público, e o painel não os mostra. Presumir que o V2.6-Pro herda o formato 1,02T/42B do V2.5-Pro seria um palpite.
• Um identificador de API e uma tabela de preços, que é o momento em que o número do DeepSWE se torna uma decisão de compra em vez de um esporte de espectador.
• Uma submissão ao quadro DeepSWE da Datacurve, que colocaria o MiMo-V2.6-Pro na mesma tabela e sob as mesmas barras de erro que os modelos com os quais ele está sendo comparado. Uma avaliação executada pelo fornecedor e uma submissão a um leaderboard não são a mesma alegação, e a diferença entre elas é exatamente uma linha dessa tabela.
Até lá, o resumo honesto é que a Xiaomi mostrou o processo de pós-treinamento mais transparente já publicado por qualquer grande laboratório, em dois modelos que ainda não lançou, com um número de benchmark autorreportado que fica perto — mas não faz parte — do topo da tabela. O detalhamento da metodologia está prometido para as próximas semanas. A data de lançamento não está prometida de forma alguma.
