Um cartão de título para a comparação entre MiMo-V2.6-Pro e Qwen3.8-Max, mostrando dois cartões de especificações frente a frente: Xiaomi MiMo-V2.6-Pro com 46 no Intelligence Index v4.3.2, 42B de parâmetros ativos por token, 134,3 tokens/segundo e $0,18 por 1M combinado, contra Qwen3.8-Max com 45 no Index, 95B ativos por token, 39,2 tokens/segundo e $1,18.
Guides & Insights

MiMo-V2.6-Pro vs Qwen3.8-Max: Um Ponto no Índice, Seis Vezes o Preço

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Qwen3.8-Max é um modelo de 2,4 trilhões de parâmetros que ativa 95 bilhões deles por token e roda em um único provedor. O Xiaomi MiMo-V2.6-Pro é um modelo de 1,02 trilhão de parâmetros que ativa 42 bilhões por token, pontua um ponto a mais no mesmo índice independente e tem um custo de chamada cerca de um sexto menor. Esses fatos convivem de forma incômoda, e a forma como você os resolve é o que define a escolha entre os dois. A versão resumida: no Artificial Analysis Intelligence Index v4.3.2, o Xiaomi MiMo-V2.6-Pro pontua 46 e o Qwen3.8-Max pontua 45 — um empate dentro do ruído —, enquanto a tabela de preços mostra US$ 0,43 e US$ 0,87 por milhão de tokens contra US$ 2,00 e US$ 6,00.

O que cada modelo realmente é

Qwen3.8-Max é o carro-chefe da Alibaba, com disponibilidade geral desde 3 de agosto de 2026, e era o maior modelo que a linha Qwen já havia lançado quando chegou ao mercado. É uma mistura esparsa de especialistas construída sobre a arquitetura Qwen 3.5, com 2,4 trilhões de parâmetros totais e cerca de 95 bilhões ativos por token, uma janela de contexto de 1 milhão de tokens, até 131.000 tokens de saída, e entrada multimodal em texto, imagem e vídeo. A Alibaba reduziu a tarifa internacional para US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída, com entrada em cache a US$ 0,25, e apresentou isso como cerca de 40% do preço de entrada do Claude Opus 5. Uma atualização pontual, Qwen3.8-Max-0902, veio em 2 de setembro de 2026 e é o que a Artificial Analysis atualmente avalia em 45.

O Xiaomi MiMo-V2.6-Pro alcançou disponibilidade geral em 22 de setembro de 2026, três dias antes de esta comparação ser escrita, com seus repositórios de checkpoints de aprendizado por reforço surgindo no dia anterior. Ele é um mixture-of-experts esparso com 1,02 trilhão de parâmetros totais e 42 bilhões ativos por token, com a mesma janela de contexto de 1 milhão de tokens, multimodalidade nativa em texto, imagem, vídeo e áudio, e pesos publicados sob a licença MIT. A Xiaomi manteve o preço da geração anterior em vez de reajustar o novo checkpoint para cima, e é por isso que ele está listado a US$ 0,43 e US$ 0,87, com 99% de desconto de cache e um valor combinado de US$ 0,18.

• Computação ativa por token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, menos da metade

• Parâmetros totais — Qwen3.8-Max 2,4T; Xiaomi MiMo-V2.6-Pro 1,02T

• Pontuação do índice — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, ambos no Artificial Analysis v4.3.2

• Velocidade de saída — Xiaomi MiMo-V2.6-Pro 134,3 tokens/segundo; Qwen3.8-Max 39,2, em comparação com uma mediana da categoria de 72,5

• Tempo até o primeiro token — Xiaomi MiMo-V2.6-Pro 2,15 segundos; Qwen3.8-Max 2,93

• Preço de tabela — Xiaomi MiMo-V2.6-Pro $0.43 / $0.87 por 1M; Qwen3.8-Max $2.00 / $6.00

• Tarifa combinada — Xiaomi MiMo-V2.6-Pro US$ 0,18 por 1M na proporção 7:2:1 de acerto de cache/entrada/saída; Qwen3.8-Max US$ 1,18

• Pesos — Xiaomi MiMo-V2.6-Pro licenciado sob MIT e disponível para download; Qwen3.8-Max foi disponibilizado como um endpoint proprietário, com uma versão open-weight apenas de texto que deixa de fora o contexto de 1M e a entrada visual

• Alcance — um provedor de API contado para cada um no Artificial Analysis

O placar está empatado. A velocidade, não.

Um ponto num composto de dez avaliações não é uma diferença que justifique qualquer ação, e o sinal mais útil é o que está por trás disso. O modelo com menos da metade dos parâmetros ativos por token obteve pontuação marginalmente mais alta e gerou saída a uma velocidade três vezes e meia maior — 134,3 tokens por segundo contra 39,2, sendo que a mediana para modelos de raciocínio comparáveis é 72,5. O Qwen3.8-Max é o mais lento dos modelos da classe de fronteira medidos naquela página, e isso é uma consequência de design de ativar 95 bilhões de parâmetros por token, e não um acidente de serving.

A latência conta a história oposta à que a contagem de parâmetros sugere. O Qwen3.8-Max atinge seu primeiro token em 2,93 segundos, contra 2,15 do Xiaomi, e a diferença é muito menor que a de throughput — o Qwen3.8-Max é lento depois que começa a escrever, não lento para começar. Numa interface de chat em que a resposta é curta, essa diferença quase não aparece. Já num loop de agente que gera dezenas de milhares de tokens de saída, o throughput é todo o tempo de relógio, e uma diferença de 3,4× se acumula a cada turno da execução.

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and Qwen3.8-Max covering Intelligence Index v4.3.2 (46 vs 45), active parameters (42B vs 95B per token), output speed (134.3 vs 39.2 tokens/second), time to first token (2.15s vs 2.93s), blended rate ($0.18 vs $1.18 per 1M) and weight availability (MIT, full multimodal vs a text-only release without the 1M context).

Onde as tabelas dos fornecedores divergem, e por que isso não é uma contradição

A Alibaba publicou uma tabela abrangente para o Qwen3.8-Max e ela é genuinamente forte: Terminal-Bench 2.1 em 86,6, SWE-bench Pro em 67,7, PaperBench em 93,0, GPQA Diamond em 92,6, IFBench em 82,8, OSWorld-Verified em 86,1 e Humanity's Last Exam em 43,6. Esses são números executados pelo fornecedor nas próprias estruturas de avaliação da Alibaba e alguns deles nos próprios benchmarks da Alibaba, então são alegações e não medições — mas são alegações sobre benchmarks amplamente utilizados, o que os torna mais comparáveis entre laboratórios do que o resultado de uma estrutura de avaliação personalizada.

O número principal da Xiaomi é 72,57 no DeepSWE v1.1, acima de uma linha de base de 58,4, medido com o mini-swe-agent na média de três no próprio avaliador da Xiaomi, em uma execução de aprendizado por reforço que a Xiaomi documentou como trinta etapas e aproximadamente 750.000 trajetórias, com um gasto publicado de cerca de US$ 2,62 milhões. Ele não foi submetido ao leaderboard público do DeepSWE e nenhum terceiro o reproduziu. Colocar 72,57 contra os 67,7 do SWE-bench Pro da Qwen e declarar uma vitória de cinco pontos da Xiaomi seria ler através de dois benchmarks diferentes, dois harnesses diferentes e duas convenções de pontuação diferentes. Existe exatamente uma régua contra a qual ambos os modelos foram executados por alguém que não seja seu criador, e ela diz 46 a 45.

Dois dos números mais relevantes do Qwen3.8-Max não são pontuações de modo algum. A Alibaba anunciou que os pesos seriam disponibilizados em código aberto junto com o Qwen3.8-27B, e o checkpoint que foi lançado é somente texto e não carrega o contexto completo de 1M tokens nem a entrada de visão que o endpoint Max em serviço possui. Então, “Qwen3.8-Max tem pesos abertos” e “Qwen3.8-Max é um endpoint multimodal com contexto de 1M” são ambas afirmações verdadeiras sobre artefatos diferentes, e um plano de implantação baseado na primeira enquanto se espera a segunda não sobreviverá ao contato. A versão pontual 0902, enquanto isso, levou o modelo ao topo de uma arena pública de desenvolvimento web sem mudança no número da versão — um lembrete de que o modelo que você avaliou em agosto não é necessariamente o modelo que atende às suas requisições em setembro.

Pesos abertos significa que você pode hospedar qualquer um dos dois por conta própria?

Para o Xiaomi MiMo-V2.6-Pro, em princípio sim: licença MIT, sem necessidade de acordo comercial. Na prática, um checkpoint de 1,02T de parâmetros com 42B ativos exige um cluster de serviço com vários nós, o que é uma ordem de compromisso diferente de chamar uma API. Publicar os pesos torna a auto-hospedagem legal, não barata.

Para o Qwen3.8-Max, a resposta é mais restrita do que a reputação sugere. O lançamento aberto é somente texto e sem a janela de contexto completa, então a auto-hospedagem dele fornece um modelo materialmente menor do que aquele em que o 45 foi medido. Se o que você quer é a configuração avaliada por benchmark, o endpoint servido é o produto, e o endpoint é proprietário.

Chamar qualquer um dos dois, e a aritmética que decide isso

Ambos os modelos são contabilizados em um único provedor de API pela Artificial Analysis, o que é incomum para dois modelos de ponta e faz do failover a questão prática, e não um mero detalhe. O Qwen3.8-Max está no OrcaRouter como qwen/qwen3.8-maxum endpoint compatível com OpenAI pelo preço de tabela da própria Alibaba, com 0% de markup, então os US$ 2,00 e US$ 6,00 acima são repassados sem alteração, e uma mudança de preço do lado da Alibaba entra em vigor do nosso lado no mesmo dia. Nossas próprias medições colocam o p50 do endpoint em cerca de 3,3 segundos, que é o número com o qual se planejar, e não o melhor caso teórico, e uma cadeia de fallback significa que uma requisição travada é repetida em outro upstream antes que a resposta comece. O Xiaomi MiMo-V2.6-Pro não está no OrcaRouter; nenhum modelo Xiaomi está, e a rota até ele hoje é a própria plataforma da Xiaomi e os catálogos de terceiros que o listam.

A aritmética de custos é onde este confronto é de fato decidido, e não é a aritmética que as taxas anunciadas sugerem. Com uma proporção de 7:2:1 de acertos de cache/entrada/saída, as taxas combinadas são de US$ 0,18 e US$ 1,18 por milhão — uma diferença de 6,6×, mais ampla que as diferenças de 4,6× na entrada e 6,9× na saída, porque o desconto de cache de 99% da Xiaomi é mais profundo que os 88% da Alibaba. A Artificial Analysis também registra um custo de US$ 0,13 por tarefa do Intelligence Index para o Xiaomi MiMo-V2.6-Pro, medido de forma idêntica em todos os modelos do ranking. Execute a mesma carga de trabalho nos dois e o modelo mais barato é o que obteve a pontuação mais alta, o que é uma coisa incomum de se poder escrever e a razão pela qual esta comparação não é uma formalidade.

The OrcaRouter model page for qwen/qwen3.8-max, showing the model's vendor, capability tags, context window and the per-million-token input and output rates passed through from Alibaba's list price.

Quem deve mudar, e quem não deve

Se você está usando o Qwen3.8-Max hoje e ele funciona, não há um caso urgente para migrar. A diferença de índice é um ponto, o comportamento de visão e de contexto longo está comprovado na sua carga de trabalho, e a Alibaba ainda está desenvolvendo a linha — a atualização 0902 mostra isso. O argumento para migrar é o throughput e o custo combinado, e ele só é forte se o seu tráfego for intensivo em saída ou de longo horizonte: agentes, geração de código, qualquer coisa que escreva muito mais do que lê.

Se você está começando do zero, a ordenação é difícil de contestar com base nas evidências publicadas. O modelo da Xiaomi é mais rápido, mais barato em todos os eixos, licenciado sob MIT e ligeiramente à frente no único composto executado de forma independente que cobre ambos. Os contrapesos são reais e específicos: três dias de histórico em produção, uma única rota de serving e nenhuma entrada pública em benchmark para inspecionar. Essa combinação defende avaliá-lo em uma faixa ao lado de um incumbente em vez de substituir um — que é justamente para o que serve uma configuração de roteamento, e por isso o movimento útil é colocar o candidato e o incumbente atrás de uma única chave, em vez de escolher um vencedor a partir de um placar.

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

O que mudaria esta resposta

Três coisas. Um segundo e um terceiro provedor para o Xiaomi MiMo-V2.6-Pro removeriam a única objeção estrutural a ele e transformariam a diferença de preço em uma decisão concreta, em vez de uma mera tentação. Uma execução independente da configuração do DeepSWE confirmaria os 72,57 ou os descartaria, e qualquer um dos desfechos vale mais do que o próprio número. E detalhamentos por avaliação no v4.3.2 mostrariam qual das dez avaliações cada modelo vence — o composto é um composto, e um modelo que lidera em codificação agêntica e outro que lidera em respostas a perguntas com uso intensivo de recuperação podem registrar a mesma pontuação de índice, embora sejam inadequados para as tarefas um do outro.