Cartão principal do radar de modelos do OrcaRouter com o título 'MiMo-V2.6-Flash vs Qwen 3.8', com o subtítulo 'Um download contra um medidor, e apenas um dos lados tem pontuação de terceiros', com um painel esquerdo para o MiMo-V2.6-Flash indicando 309B no total / 15B ativos, licença MIT, sem restrições e Sem pontuação independente, um painel direito para o Qwen3.8-Max indicando 2,4T no total / 95B ativos, $2,00 de entrada / $6,00 de saída por 1M e AA Index 45, escala atual, e três selos abaixo indicando Flash: publicado em 21 de setembro de 2026, Qwen: com medição desde 3 de agosto de 2026 e Roteável: apenas Qwen3.8-Max.
Guides & Insights

MiMo-V2.6-Flash vs Qwen3.8-Max: Um download contra um medidor, e apenas um deles tem uma pontuação

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um número decide como esta comparação costuma ser escrita, e não é um benchmark. Qwen3.8-Max é um modelo hospedado que a Artificial Analysis mede continuamente, então ele apresenta um Índice de Inteligência atual de 45 na escala recalibrada v4.3, uma velocidade de saída de 39,2 tokens por segundo, e um preço de tabela de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída. MiMo-V2.6-Flash, que a Xiaomi publicou como pesos para download em 21 de setembro de 2026, não tem nada disso: nenhuma tabela de preços de provedor, nenhum identificador de modelo que a Xiaomi tenha anunciado, e nenhuma página da Artificial Analysis. Tudo o que foi publicado sobre a capacidade do MiMo-V2.6-Flash vem das próprias tabelas de avaliação da Xiaomi em seu model card. Nem um único número foi recalculado por alguém que não trabalha para a Xiaomi.

Essa assimetria não é um ponto negativo contra o modelo. É um fato sobre que tipo de compra cada um é, e isso muda o que você pode realmente concluir de uma comparação direta. O restante deste texto trata das três coisas que você genuinamente pode comparar — o formato da afirmação, o custo de um token e a licença — além de um número que é real, medido de forma independente e não pertence a nenhum dos modelos na manchete.

Primeiro, qual Qwen 3.8, e qual MiMo

Ambos os nomes nessa manchete são famílias que fingem ser pontos de verificação, e as substituições não são inofensivas.

• Qwen3.8-Max — carro-chefe hospedado da Alibaba, revelado em 3 de agosto de 2026. Um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, contexto de 1M de tokens e entrada de texto, imagem e vídeo. Este é o modelo que o restante deste artigo trata como o oponente.

• Qwen3.8-Max (0902) — o snapshot datado de 2 de setembro do mesmo modelo, disponibilizado como uma entrada própria com os mesmos preços de US$ 2,00 e US$ 6,00 e um teto de saída de 131.072 tokens. A página atual do Artificial Analysis é referente a esta versão, o que importa quando você cita uma pontuação de índice.

• Qwen3.8-2.4T-A95B — o checkpoint de pesos abertos do mesmo núcleo, disponível para download desde 12 de agosto de 2026 sob a Qwen3.8-Max License. É somente texto, o pensamento está sempre ativado, e seu contexto nativo é de 262K em vez de um milhão. Não é o modelo da manchete.

• MiMo-V2.6-Flash — checkpoint esparso de mistura de especialistas da Xiaomi com 309B no total e 15B ativos, sem restrições de acesso no Hugging Face sob a licença MIT, nativamente omnimodal, com uma alegação de contexto de 1M de tokens. É a opção de eficiência de um lançamento de dois checkpoints cujo carro-chefe é o MiMo-V2.6-Pro, com 1,02T no total e 42B ativos.

• MiMo-V2-Flash — o modelo de dezembro de 2025. Mesmos 309B no total, mesmos 15B ativos, mesma janela deslizante de 128 tokens. Execução de treinamento diferente, tabela de benchmarks diferente e um contexto de 256K. Qualquer página que ranqueie "MiMo-V2-Flash" em comparação com um modelo Qwen está comparando a geração errada, e só a ficha técnica não vai lhe dizer isso.

A colisão do MiMo é a mais aguda das duas armadilhas, porque os números que identificam o modelo também são, por acaso, os números idênticos entre os checkpoints de 2025 e 2026. A colisão do Qwen é mais branda, mas tem um preço associado: os pesos abertos de 2,4T e a API hospedada são artefatos diferentes com termos diferentes, e uma comparação que os troque fará uma avaliação errada tanto da capacidade quanto da licença.

O índice foi reconstruído, e o número que a maioria das páginas ainda imprime desapareceu.

Eis o modo de falha a que deves estar atento antes de aparecer qualquer pontuação.

A Artificial Analysis recalibrou seu Intelligence Index para a v4.3 em 7 de setembro de 2026. As pontuações anteriores a essa data não são comparáveis às posteriores, e a página ao vivo do Qwen3.8-Max traz um selo Atualizado que marca um resultado reformulado. O número amplamente divulgado de 58 para o Qwen3.8-Max pertence à escala antiga. O atual Qwen3.8-Max (0902) registra 45, classificado em 19º lugar entre os 202 modelos que a Artificial Analysis coloca nessa classe.

Isto não é pedantismo. Um 58 ao lado de um 46 lê-se como uma diferença de doze pontos. Os mesmos dois modelos, na mesma escala atual, distam apenas um ponto — e o 46 nem sequer é o modelo de que este artigo trata:

• Qwen3.8-Max (0902), medido de forma independente — Intelligence Index 45 na v4.3. Velocidade de saída de 39,2 tokens por segundo, classificado em 151.º lugar entre 202, o que a própria página observa ser lento. Custo por tarefa do Intelligence Index: US$ 5,41. Tokens de saída gerados para completar o índice: 190M.

• MiMo-V2.6-Pro, medido de forma independente — Intelligence Index 46, classificado em primeiro lugar entre os 114 modelos da classe de pesos abertos. Velocidade de saída de 134,3 tokens por segundo. Custo por tarefa do Intelligence Index: US$ 0,13. Tokens de saída para concluir o índice: 140M.

• MiMo-V2.6-Flash, o verdadeiro assunto — não existe página do Artificial Analysis. Nada a citar.

Leia esses três em conjunto e o resumo honesto é desconfortável para ambos os fornecedores. O ponto de comparação que todos querem — Flash contra Qwen3.8-Max em uma escala neutra — não existe e não pode ser construído a partir das tabelas dos fornecedores, porque os dois fornecedores executaram harnesses diferentes em checkpoints diferentes em momentos diferentes e depois se compararam com modelos de outras empresas que eles também executaram. O que existe é uma diferença de um ponto entre o Qwen principal e, da Xiaomi, o maior checkpoint, a aproximadamente um quarenta avos do custo por tarefa de índice. Esse é o número real mais interessante nesta disputa, e é sobre um modelo que nenhum dos lados da manchete nomeia.

Scoreboard card headed 'MiMo-V2.6-Flash vs Qwen3.8-Max', with paired rows for parameters (309B total / 15B active against 2.4T total / 95B active), licence (MIT, ungated, no revenue trigger, against a hosted API whose open 2.4T sibling uses the Qwen3.8-Max License), price per 1M (no vendor rate card against $2.00 in and $6.00 out with an 88% cache discount), independent score (None published, no Artificial Analysis page, against AA Index 45 on the v4.3 scale, 19th of 202 in class), DeepSWE v1.1 (67.9 on Xiaomi's own harness against Not published) and routability (No - nowhere, including OrcaRouter, against Yes - on OrcaRouter, base tier and the 0902 snapshot).

O que as tabelas de fornecedores lhe dirão e não lhe dirão

Ambos os fornecedores publicam números. Não são o mesmo tipo de número, e alinhá-los coluna por coluna produz um gráfico, e não uma constatação — mas ainda vale a pena ler a forma das alegações, porque ela revela aquilo para que cada laboratório otimizou.

• Agente de código — Xiaomi reporta MiMo-V2.6-Flash em DeepSWE v1.1 67.9, Terminal Bench 2.1 87.6, ProgramBench 26.0 e MiMo Code Bench 61.2. Alibaba reporta Qwen3.8-Max em SWE-bench Pro 67.7 e Terminal-Bench 2.1 86.6. Os números do Terminal-Bench estão próximos o suficiente para que o harness, e não o modelo, esteja provavelmente determinando a ordem.

• Agente geral — A Xiaomi relata AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 e Agents' Last Exam 27,6 para o Flash. A Alibaba relata OSWorld-Verified 86,1, WideSearch 81,9 e Agent's Last Exam 52,4 para o Qwen3.8-Max. Nos dois benchmarks que ambos os laboratórios executaram, os números relatados do Qwen estão à frente — no próprio harness da Alibaba.

• Conhecimento e segurança — a Xiaomi executa CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) e SEC Bench Pro (47.5). A Alibaba executa GPQA Diamond (92.6), Humanity's Last Exam (43.6) e PaperBench (93.0). Quase nenhuma sobreposição, então quase nada para comparar.

A única coisa genuinamente útil que uma tabela de fornecedor pode mostrar é uma inconsistência interna, e a da Xiaomi tem uma. Seu painel público de RL, que transmitiu ao vivo a execução de treinamento ao longo de setembro, publicou o MiMo-V2.6-Flash com 65,68 no DeepSWE v1.1 usando um harness mini-swe-agent na média de três execuções. A ficha do modelo finalizada imprime 67,9 para os pesos lançados. Esses números descrevem, respectivamente, um snapshot de treinamento e um artefato lançado, e a diferença de dois pontos tem o mesmo tamanho da lacuna entre os dois checkpoints da Xiaomi. Se você vem citando o número do painel desde a semana passada, ele está desatualizado.

A conta, que é onde os dois modelos deixam de ser comparáveis.

Esta é a seção que decide os deploys, e não é nem de perto.

• Qwen3.8-Max é cobrado por uso. $2,00 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída na tabela de preços internacional da Alibaba, com um desconto de cache que a Artificial Analysis mede em 88% e um custo de $5,41 por tarefa do Intelligence Index. A documentação da Alibaba para a região da China lista CNY 12 e CNY 36 por milhão para o mesmo par. Você pode chamá-lo hoje à tarde e receber uma fatura.

• MiMo-V2.6-Flash é um download. A Xiaomi não publica nenhuma tarifa por token para a geração MiMo-V2.6 no seu próprio site e não anunciou nenhum identificador chamável para nenhum dos checkpoints, portanto não há nada para medir. O que existe, em vez disso, são 172,9 GB de dados de pesos FP8 em 65 shards, antes da KV cache para um contexto de 1M tokens, e uma secção de implementação que recomenda SGLang em tensor parallel 16 com um fator de paralelismo de dados de 2, ou uma receita vLLM em tensor parallel 8 — uma tarefa de serviço multi-nó.

• As listagens de terceiros não são uma tabela de preços. As páginas de catálogo apresentam valores para a série MiMo-V2.6, e a Artificial Analysis contabiliza um único fornecedor de API que disponibiliza o MiMo-V2.6-Pro a $0.435 e $0.87 por milhão. Isso é a listagem de um fornecedor para o checkpoint maior, não um preço da Xiaomi, e não existe para o Flash em absoluto.

Portanto, a aritmética é um item de linha medido em comparação com uma decisão de capital. Com algumas centenas de milhões de tokens por mês, o Qwen3.8-Max é uma conta que você consegue prever, e o Flash é um nó que você estaria comprando para servir um modelo que ninguém fora da Xiaomi mediu. Com bilhões de tokens por mês, o caminho aberto começa a ganhar em custo, e este é o ponto em que a licença deixa de ser uma nota de rodapé jurídica e passa a ser um insumo de compras.

As licenças não são a mesma permissão

A MIT é praticamente o mais permissivo que os pesos abertos oferecem. A Licença Qwen3.8-Max não é MIT, e a diferença tem consequências reais.

O MiMo-V2.6-Flash é distribuído sob a licença MIT, sem limite de receita, sem gatilho por número de usuários, sem acordo comercial separado e sem cláusula de pesquisa. Implantação comercial, modificação, redistribuição e treinamento adicional são todos permitidos, e o repositório não tem acesso restrito.

A Licença Qwen3.8-Max concede uso, modificação, distribuição, sublicenciamento, venda, implantação, hospedagem e ajuste fino, sob duas condições. Um produto ou serviço que exceda 100 milhões de usuários ativos mensais ou US$ 20 milhões em receita mensal deve exibir o nome do modelo com destaque em sua interface. E um negócio de model-as-a-service ou de assistente de trabalho com IA cuja receita agregada ultrapasse US$ 50 milhões em quaisquer doze meses consecutivos precisa de uma licença separada da Alibaba antes do uso comercial. O uso interno está excluído, desde que o modelo ou suas capacidades não sejam expostos a terceiros.

Para a maioria das equipes, nenhuma das duas condições é vinculativa. Para um negócio de plataforma que obtém sucesso, uma delas é — e ela se torna vinculativa exatamente no momento em que o modelo passou a ser essencial. Observe também que essas condições se aplicam aos pesos 2.4T para download, e não à API hospedada, à qual se aplicam, em vez disso, os termos do provedor. As duas vias têm obrigações diferentes, o que é mais um motivo para não comparar o checkpoint aberto com o hospedado como se fossem o mesmo produto.

Onde o OrcaRouter se encaixa, e onde não

O Qwen3.8-Max é roteável no OrcaRouter, tanto na entrada base quanto no snapshot datado 0902, por meio de uma única chave de API ao preço de lista do provedor, com 0% de markup repassado. Isso importa especificamente aqui por dois motivos. Primeiro, a build 0902 é uma entrada separada em vez de uma substituição silenciosa, então a DSL de roteamento pode fixar tráfego sensível à reprodutibilidade no snapshot datado enquanto todo o resto segue o nível base — sem uma segunda integração, sem alteração de código. Segundo, como o preço de lista é repassado em vez de receber markup, uma mudança na tabela de preços da Alibaba chega ao seu lado no mesmo dia, em vez de na próxima renovação de contrato, e é isso que mantém honesta a aritmética de medido versus nó acima conforme os preços mudam. Cargas de trabalho intensivas em cache também mantêm o desconto de cache do provedor, em vez de perder parte dele para a margem de um revendedor.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, marked FEATURED, giving the model id qwen/qwen3.8-max, a 1M-token context, text, image and video input with text output, an input price of $2.00 and output price of $6.00 per 1M tokens, a p50 time to first token of 3.33 seconds, and seven-day traffic of 30.8M tokens.

O MiMo-V2.6-Flash não é roteável em lugar nenhum, inclusive nos nossos. Não roteamos nenhum modelo Xiaomi, e a linha de disponibilidade no próprio card da Xiaomi aponta para os canais da própria Xiaomi: a plataforma de API do MiMo, o AI Studio, o MiMo Code e o aplicativo de desktop. Se você quiser este checkpoint, vai baixar 172,9 GB e encontrar um nó.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 on the updated v4.3 scale ranked 19th of 202, output speed of 39.2 tokens per second ranked 151st of 202, a price of $2.00 per million input tokens and $6.00 per million output with an 88% cache discount and a $5.41 cost per Intelligence Index task, 190M output tokens generated on the index, and a 984k-token context window.

Qual deles, e quando?

Escolha o Qwen3.8-Max se quiser capacidade sem hardware, se o seu volume for incerto ou se quiser a opção de um número independente antes de se comprometer. Aceite que 45 no índice atual é uma posição de meio da fronteira, e não uma posição de topo, que 39,2 tokens por segundo é lento o suficiente para importar dentro de um loop de agente, e que 190M tokens de saída para concluir o Intelligence Index é aproximadamente o dobro da mediana — a verbosidade custa dinheiro no lado do medidor com preço de saída.

Escolha o MiMo-V2.6-Flash se a restrição for a licença, o fluxo de dados ou uma fatura de longo prazo que você possa amortizar — e se você tiver o nó. Termos MIT sem barreira de receita são genuinamente uma permissão diferente de uma licença com limite de MAU e gatilho de participação na receita e, para uma empresa que espera ser grande, é esse o motivo de escolhê-lo. Orce para serviço em vários nós, dimensione a partir dos dados de pesos publicados em vez da página do repositório, e trate cada número no cartão da Xiaomi como declarado pelo fornecedor até que alguém fora do laboratório o reproduza.

E se você está optando hoje em vez do próximo trimestre, use primeiro a opção por medição. Um mês de Qwen3.8-Max mostra o que sua carga de trabalho realmente precisa. Um node mostra apenas o que você esperava que precisasse.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente