
MiMo-V2.6-Pro vs GLM-5.2: Duas MoEs de pesos abertos, e o benchmark que você não deve subtrair
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A versão mais preguiçosa dessa comparação coloca o 72,57 do Xiaomi MiMo-V2.6-Pro ao lado do 46,2 do GLM-5.2, chama isso de uma vitória de 26 pontos e publica. Está errada por um motivo que não tem nada a ver com qual modelo é melhor: esses dois números não são a mesma medição. O 72,57 da Xiaomi é a média de três execuções no próprio harness dela com mini-swe-agent e nunca foi enviado a um placar público; o 46,2 é um valor de Pass@1 de um harness totalmente diferente. A comparação honesta entre Xiaomi MiMo-V2.6-Pro e GLM-5.2 é outra, numa régua contra a qual ambos de fato foram avaliados — e, nessa régua, a diferença é real, mas é de doze pontos, não de vinte e seis.
No Índice de Inteligência v4.3.2 da Artificial Analysis, consultado em 22 de setembro de 2026, o Xiaomi MiMo-V2.6-Pro obtém 46 pontos. O GLM-5.2 obtém 34. Ambos são modelos de pesos abertos do tipo mistura de especialistas, provenientes de laboratórios chineses, ambos operam com uma janela de contexto de 1M de tokens e ambos têm um preço suficientemente baixo para que a escolha entre eles se baseie na capacidade e na disponibilização do serviço, e não no orçamento. É aí que termina a semelhança, porque o GLM-5.2 foi substituído pelo seu próprio criador, e a página em que esta comparação é apresentada contém um aviso de descontinuação.
O que cada modelo é e em que estado se encontra
O GLM-5.2 é o carro-chefe da Z.ai, lançado em 16 de junho de 2026. É um transformer de mistura de especialistas (mixture-of-experts) com aproximadamente 753 bilhões de parâmetros totais e cerca de 40 bilhões ativos por token, e foi relatado que foi treinado inteiramente em aceleradores Huawei Ascend, em vez de hardware Nvidia. É distribuído com pesos abertos sob a licença MIT, com quantizações FP8 e INT4, suporta 1M de tokens de contexto com até 131.072 tokens de saída, e custa US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de saída na própria API da Z.ai, com entrada em cache a US$ 0,26 e uma taxa combinada de US$ 0,90. A Artificial Analysis mediu 72,6 tokens de saída por segundo e 5,98 segundos até o primeiro token, com um custo de US$ 1.559,05 para executar o índice completo.
O Xiaomi MiMo-V2.6-Pro foi disponibilizado em geral em 22 de setembro de 2026, com seus repositórios de checkpoints de aprendizado por reforço surgindo no dia anterior. É um modelo esparso de mistura de especialistas com 1,02 trilhão de parâmetros totais e 42 bilhões ativados por token — um total maior que o do GLM-5.2 e uma contagem de ativos quase idêntica — com uma janela de contexto de 1M de tokens, multimodalidade nativa em texto, imagem, vídeo e áudio, e pesos licenciados sob MIT. A Xiaomi manteve o preço da geração anterior em vez de reajustá-lo para cima, de modo que ele é listado a US$ 0,43 e US$ 0,87 por milhão de tokens, com 99% de desconto de cache e um valor combinado de US$ 0,18.
• Pesos — ambos licenciados sob MIT e disponíveis para download; esta é a única categoria em que os dois são genuinamente iguais
• Parâmetros ativos — MiMo-V2.6-Pro 42B por token; GLM-5.2 cerca de 40B. Quase idênticos, o que torna a diferença de pontuação um resultado do treinamento e não da escala
• Parâmetros totais — MiMo-V2.6-Pro 1,02T; GLM-5.2 aproximadamente 753B
• Pontuação do índice — MiMo-V2.6-Pro 46; GLM-5.2 34, ambos no Artificial Analysis v4.3.2
• Preço de tabela — MiMo-V2.6-Pro $0,43 / $0,87 por 1M; GLM-5.2 $1,40 / $4,40, combinado $0,18 contra $0,90
• Custo para executar o índice — MiMo-V2.6-Pro $206,66; GLM-5.2 $1.559,05
• Velocidade — MiMo-V2.6-Pro 134,3 tokens de saída por segundo; GLM-5.2 72,6
• Tempo até o primeiro token — MiMo-V2.6-Pro 2,15 segundos; GLM-5.2 5,98 segundos
• Status — MiMo-V2.6-Pro atual e GA; GLM-5.2 obsoleto no Artificial Analysis, que agora o avalia apenas na carga de trabalho de entrada padrão de 10k

O aviso de descontinuação é a manchete
A Z.ai lançou, desde então, o GLM-5.3, e a página do Artificial Analysis para o GLM-5.2 diz isso diretamente, marcando o modelo como obsoleto e limitando o trabalho contínuo de benchmark a uma única carga de trabalho padrão. Isso muda a finalidade desta página. Se você está escolhendo um novo modelo hoje, o confronto que realmente importa é MiMo-V2.6-Pro contra GLM-5.3, não GLM-5.2 — e, no mesmo índice v4.3.2, o GLM-5.3 em esforço máximo pontua 45 contra 46 do MiMo-V2.6-Pro. Um ponto. Essa é uma disputa de verdade, e é um artigo completamente diferente.
A comparação com o GLM-5.2 ainda vale a pena, por um motivo específico: é a ilustração mais barata possível de quão rápido a fronteira dos modelos de pesos abertos avançou entre junho e setembro de 2026. Doze pontos no índice em cerca de catorze semanas, com a contagem de parâmetros ativos essencialmente inalterada. O que quer que tenha produzido esse ganho, não foi escala.
Em que o GLM-5.2 era bom, e se ainda é
O material de lançamento do GLM-5.2 liderou em codificação e trabalho agêntico de longa duração, e esses números ainda se sustentam como uma descrição do modelo: SWE-bench Pro em 62,1 contra 58,4 para o GLM-5.1, Terminal-Bench 2.1 em 81,0 contra 63,5, e FrontierSWE em 74,4 contra 30,5. Do lado do conhecimento e da matemática, ele reportou GPQA-Diamond em 91,2, AIME 2026 em 99,2 e Humanity's Last Exam em 40,5. Ele liderou todos os modelos em um benchmark de codificação agêntica de longo horizonte na época e ficou em segundo lugar em um ranking público de desenvolvimento web. Esses são números relatados pelo fornecedor em seus próprios harnesses, e a ressalva habitual se aplica a cada um deles.
Os próprios números publicados pela Xiaomi para o MiMo-V2.6-Pro não são comparáveis a eles, e vale a pena ser preciso sobre o porquê, em vez de apenas fazer alusão vaga a isso. A Xiaomi relata que o modelo passou de 58,4 para 72,57 no DeepSWE v1.1 ao longo de sua execução de aprendizado por reforço, avaliado com mini-swe-agent com média de três, com seu próprio avaliador, com a execução documentada como 30 etapas e aproximadamente 750.000 trajetórias concluídas em menos de seis dias, a um gasto publicado de cerca de US$ 2,62 milhões para o modelo Pro. Nada disso é uma entrada em um ranking. Uma entrada em um ranking é uma afirmação sobre uma configuração específica sob condições declaradas que um terceiro pode reexecutar, e a da Xiaomi não é uma. Um rastreador separado lista o GLM-5.2 com 46,2 no DeepSWE — Pass@1, uma métrica diferente na mesma família de tarefas — e colocar 72,57 ao lado de 46,2 para produzir uma margem de 26 pontos é fazer aritmética entre duas escalas diferentes. Isso não deveria ser feito, e é o erro mais comum em circulação sobre este par.

Decidir entre eles, e o roteamento que o torna barato
Se ambos forem pesos abertos sob a mesma licença, os fatores decisivos são o que consegue executar e onde o pode invocar. O GLM-5.2 está no OrcaRouter como z-ai/glm-5.2 — um endpoint compatível com a OpenAI, com o preço de tabela do fornecedor repassado com 0% de margem, pelo que uma alteração de preço da Z.ai fica ativa do nosso lado no mesmo dia. O Xiaomi MiMo-V2.6-Pro não está no OrcaRouter; nenhum modelo Xiaomi está, e aceder-lhe implica a plataforma própria da Xiaomi ou um dos catálogos de terceiros que o disponibilizam. Preferimos afirmá-lo em vez de deixar que uma página de modelo sugira o contrário.
A consequência útil é que você pode manter os incumbentes em uma única chave e avaliar o recém-chegado em comparação com eles sem um segundo contrato. Se o MiMo-V2.6-Pro vencer nos seus prompts, você aprendeu isso de forma barata. Se não vencer — e a diferença de doze pontos no índice é pequena, ao passo que a diferença de preço por token é grande, de modo que o resultado depende mesmo da sua carga de trabalho — você não perdeu nada além do teste. Rotear os dois por trás de um único endpoint com failover automático também responde à objeção prática a um modelo lançado esta semana: uma única rota de serviço é um ponto único de falha, e uma via de fallback é o que torna seguro colocar um novo modelo na frente de tráfego real.

A resposta curta
Se você está no GLM-5.2 hoje e ele está funcionando, a questão da atualização não é o MiMo-V2.6-Pro — é o GLM-5.3, na mesma linhagem, com uma diferença de um ponto para o modelo da Xiaomi e nenhum custo de migração. Se você está escolhendo um caminho do zero e quer pesos abertos com a melhor pontuação medida entre os três, o 46 do MiMo-V2.6-Pro é o número, e seus 134,3 tokens por segundo e US$ 0,13 por tarefa de índice são as razões pelas quais não é uma vitória apertada. Se você quer o mais seguro dos três, o GLM-5.2 é a resposta errada por um motivo que não tem nada a ver com o quão bom ele era em junho: é o único dos três que o próprio fornecedor deixou de desenvolver.
O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com OpenAI pelo preço de tabela do provedor, com 0% de markup, então uma mudança de preço do fornecedor entra em vigor no mesmo dia.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
