
MiMo-V2.6-Flash vs Qwen3.8-Max: Um download contra um medidor, e apenas um deles tem uma pontuação
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Um número decide como esta comparação costuma ser escrita, e não é um benchmark. Qwen3.8-Max é um modelo hospedado que a Artificial Analysis mede continuamente, então ele apresenta um Índice de Inteligência atual de 45 na escala recalibrada v4.3, uma velocidade de saída de 39,2 tokens por segundo, e um preço de tabela de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída. MiMo-V2.6-Flash, que a Xiaomi publicou como pesos para download em 21 de setembro de 2026, não tem nada disso: nenhuma tabela de preços de provedor, nenhum identificador de modelo que a Xiaomi tenha anunciado, e nenhuma página da Artificial Analysis. Tudo o que foi publicado sobre a capacidade do MiMo-V2.6-Flash vem das próprias tabelas de avaliação da Xiaomi em seu model card. Nem um único número foi recalculado por alguém que não trabalha para a Xiaomi.
Essa assimetria não é um ponto negativo contra o modelo. É um fato sobre que tipo de compra cada um é, e isso muda o que você pode realmente concluir de uma comparação direta. O restante deste texto trata das três coisas que você genuinamente pode comparar — o formato da afirmação, o custo de um token e a licença — além de um número que é real, medido de forma independente e não pertence a nenhum dos modelos na manchete.
Primeiro, qual Qwen 3.8, e qual MiMo
Ambos os nomes nessa manchete são famílias que fingem ser pontos de verificação, e as substituições não são inofensivas.
• Qwen3.8-Max — carro-chefe hospedado da Alibaba, revelado em 3 de agosto de 2026. Um modelo esparso de mistura de especialistas com 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, contexto de 1M de tokens e entrada de texto, imagem e vídeo. Este é o modelo que o restante deste artigo trata como o oponente.
• Qwen3.8-Max (0902) — o snapshot datado de 2 de setembro do mesmo modelo, disponibilizado como uma entrada própria com os mesmos preços de US$ 2,00 e US$ 6,00 e um teto de saída de 131.072 tokens. A página atual do Artificial Analysis é referente a esta versão, o que importa quando você cita uma pontuação de índice.
• Qwen3.8-2.4T-A95B — o checkpoint de pesos abertos do mesmo núcleo, disponível para download desde 12 de agosto de 2026 sob a Qwen3.8-Max License. É somente texto, o pensamento está sempre ativado, e seu contexto nativo é de 262K em vez de um milhão. Não é o modelo da manchete.
• MiMo-V2.6-Flash — checkpoint esparso de mistura de especialistas da Xiaomi com 309B no total e 15B ativos, sem restrições de acesso no Hugging Face sob a licença MIT, nativamente omnimodal, com uma alegação de contexto de 1M de tokens. É a opção de eficiência de um lançamento de dois checkpoints cujo carro-chefe é o MiMo-V2.6-Pro, com 1,02T no total e 42B ativos.
• MiMo-V2-Flash — o modelo de dezembro de 2025. Mesmos 309B no total, mesmos 15B ativos, mesma janela deslizante de 128 tokens. Execução de treinamento diferente, tabela de benchmarks diferente e um contexto de 256K. Qualquer página que ranqueie "MiMo-V2-Flash" em comparação com um modelo Qwen está comparando a geração errada, e só a ficha técnica não vai lhe dizer isso.
A colisão do MiMo é a mais aguda das duas armadilhas, porque os números que identificam o modelo também são, por acaso, os números idênticos entre os checkpoints de 2025 e 2026. A colisão do Qwen é mais branda, mas tem um preço associado: os pesos abertos de 2,4T e a API hospedada são artefatos diferentes com termos diferentes, e uma comparação que os troque fará uma avaliação errada tanto da capacidade quanto da licença.
O índice foi reconstruído, e o número que a maioria das páginas ainda imprime desapareceu.
Eis o modo de falha a que deves estar atento antes de aparecer qualquer pontuação.
A Artificial Analysis recalibrou seu Intelligence Index para a v4.3 em 7 de setembro de 2026. As pontuações anteriores a essa data não são comparáveis às posteriores, e a página ao vivo do Qwen3.8-Max traz um selo Atualizado que marca um resultado reformulado. O número amplamente divulgado de 58 para o Qwen3.8-Max pertence à escala antiga. O atual Qwen3.8-Max (0902) registra 45, classificado em 19º lugar entre os 202 modelos que a Artificial Analysis coloca nessa classe.
Isto não é pedantismo. Um 58 ao lado de um 46 lê-se como uma diferença de doze pontos. Os mesmos dois modelos, na mesma escala atual, distam apenas um ponto — e o 46 nem sequer é o modelo de que este artigo trata:
• Qwen3.8-Max (0902), medido de forma independente — Intelligence Index 45 na v4.3. Velocidade de saída de 39,2 tokens por segundo, classificado em 151.º lugar entre 202, o que a própria página observa ser lento. Custo por tarefa do Intelligence Index: US$ 5,41. Tokens de saída gerados para completar o índice: 190M.
• MiMo-V2.6-Pro, medido de forma independente — Intelligence Index 46, classificado em primeiro lugar entre os 114 modelos da classe de pesos abertos. Velocidade de saída de 134,3 tokens por segundo. Custo por tarefa do Intelligence Index: US$ 0,13. Tokens de saída para concluir o índice: 140M.
• MiMo-V2.6-Flash, o verdadeiro assunto — não existe página do Artificial Analysis. Nada a citar.
Leia esses três em conjunto e o resumo honesto é desconfortável para ambos os fornecedores. O ponto de comparação que todos querem — Flash contra Qwen3.8-Max em uma escala neutra — não existe e não pode ser construído a partir das tabelas dos fornecedores, porque os dois fornecedores executaram harnesses diferentes em checkpoints diferentes em momentos diferentes e depois se compararam com modelos de outras empresas que eles também executaram. O que existe é uma diferença de um ponto entre o Qwen principal e, da Xiaomi, o maior checkpoint, a aproximadamente um quarenta avos do custo por tarefa de índice. Esse é o número real mais interessante nesta disputa, e é sobre um modelo que nenhum dos lados da manchete nomeia.

O que as tabelas de fornecedores lhe dirão e não lhe dirão
Ambos os fornecedores publicam números. Não são o mesmo tipo de número, e alinhá-los coluna por coluna produz um gráfico, e não uma constatação — mas ainda vale a pena ler a forma das alegações, porque ela revela aquilo para que cada laboratório otimizou.
• Agente de código — Xiaomi reporta MiMo-V2.6-Flash em DeepSWE v1.1 67.9, Terminal Bench 2.1 87.6, ProgramBench 26.0 e MiMo Code Bench 61.2. Alibaba reporta Qwen3.8-Max em SWE-bench Pro 67.7 e Terminal-Bench 2.1 86.6. Os números do Terminal-Bench estão próximos o suficiente para que o harness, e não o modelo, esteja provavelmente determinando a ordem.
• Agente geral — A Xiaomi relata AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 e Agents' Last Exam 27,6 para o Flash. A Alibaba relata OSWorld-Verified 86,1, WideSearch 81,9 e Agent's Last Exam 52,4 para o Qwen3.8-Max. Nos dois benchmarks que ambos os laboratórios executaram, os números relatados do Qwen estão à frente — no próprio harness da Alibaba.
• Conhecimento e segurança — a Xiaomi executa CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) e SEC Bench Pro (47.5). A Alibaba executa GPQA Diamond (92.6), Humanity's Last Exam (43.6) e PaperBench (93.0). Quase nenhuma sobreposição, então quase nada para comparar.
A única coisa genuinamente útil que uma tabela de fornecedor pode mostrar é uma inconsistência interna, e a da Xiaomi tem uma. Seu painel público de RL, que transmitiu ao vivo a execução de treinamento ao longo de setembro, publicou o MiMo-V2.6-Flash com 65,68 no DeepSWE v1.1 usando um harness mini-swe-agent na média de três execuções. A ficha do modelo finalizada imprime 67,9 para os pesos lançados. Esses números descrevem, respectivamente, um snapshot de treinamento e um artefato lançado, e a diferença de dois pontos tem o mesmo tamanho da lacuna entre os dois checkpoints da Xiaomi. Se você vem citando o número do painel desde a semana passada, ele está desatualizado.
A conta, que é onde os dois modelos deixam de ser comparáveis.
Esta é a seção que decide os deploys, e não é nem de perto.
• Qwen3.8-Max é cobrado por uso. $2,00 por milhão de tokens de entrada e $6,00 por milhão de tokens de saída na tabela de preços internacional da Alibaba, com um desconto de cache que a Artificial Analysis mede em 88% e um custo de $5,41 por tarefa do Intelligence Index. A documentação da Alibaba para a região da China lista CNY 12 e CNY 36 por milhão para o mesmo par. Você pode chamá-lo hoje à tarde e receber uma fatura.
• MiMo-V2.6-Flash é um download. A Xiaomi não publica nenhuma tarifa por token para a geração MiMo-V2.6 no seu próprio site e não anunciou nenhum identificador chamável para nenhum dos checkpoints, portanto não há nada para medir. O que existe, em vez disso, são 172,9 GB de dados de pesos FP8 em 65 shards, antes da KV cache para um contexto de 1M tokens, e uma secção de implementação que recomenda SGLang em tensor parallel 16 com um fator de paralelismo de dados de 2, ou uma receita vLLM em tensor parallel 8 — uma tarefa de serviço multi-nó.
• As listagens de terceiros não são uma tabela de preços. As páginas de catálogo apresentam valores para a série MiMo-V2.6, e a Artificial Analysis contabiliza um único fornecedor de API que disponibiliza o MiMo-V2.6-Pro a $0.435 e $0.87 por milhão. Isso é a listagem de um fornecedor para o checkpoint maior, não um preço da Xiaomi, e não existe para o Flash em absoluto.
Portanto, a aritmética é um item de linha medido em comparação com uma decisão de capital. Com algumas centenas de milhões de tokens por mês, o Qwen3.8-Max é uma conta que você consegue prever, e o Flash é um nó que você estaria comprando para servir um modelo que ninguém fora da Xiaomi mediu. Com bilhões de tokens por mês, o caminho aberto começa a ganhar em custo, e este é o ponto em que a licença deixa de ser uma nota de rodapé jurídica e passa a ser um insumo de compras.
As licenças não são a mesma permissão
A MIT é praticamente o mais permissivo que os pesos abertos oferecem. A Licença Qwen3.8-Max não é MIT, e a diferença tem consequências reais.
O MiMo-V2.6-Flash é distribuído sob a licença MIT, sem limite de receita, sem gatilho por número de usuários, sem acordo comercial separado e sem cláusula de pesquisa. Implantação comercial, modificação, redistribuição e treinamento adicional são todos permitidos, e o repositório não tem acesso restrito.
A Licença Qwen3.8-Max concede uso, modificação, distribuição, sublicenciamento, venda, implantação, hospedagem e ajuste fino, sob duas condições. Um produto ou serviço que exceda 100 milhões de usuários ativos mensais ou US$ 20 milhões em receita mensal deve exibir o nome do modelo com destaque em sua interface. E um negócio de model-as-a-service ou de assistente de trabalho com IA cuja receita agregada ultrapasse US$ 50 milhões em quaisquer doze meses consecutivos precisa de uma licença separada da Alibaba antes do uso comercial. O uso interno está excluído, desde que o modelo ou suas capacidades não sejam expostos a terceiros.
Para a maioria das equipes, nenhuma das duas condições é vinculativa. Para um negócio de plataforma que obtém sucesso, uma delas é — e ela se torna vinculativa exatamente no momento em que o modelo passou a ser essencial. Observe também que essas condições se aplicam aos pesos 2.4T para download, e não à API hospedada, à qual se aplicam, em vez disso, os termos do provedor. As duas vias têm obrigações diferentes, o que é mais um motivo para não comparar o checkpoint aberto com o hospedado como se fossem o mesmo produto.
Onde o OrcaRouter se encaixa, e onde não
O Qwen3.8-Max é roteável no OrcaRouter, tanto na entrada base quanto no snapshot datado 0902, por meio de uma única chave de API ao preço de lista do provedor, com 0% de markup repassado. Isso importa especificamente aqui por dois motivos. Primeiro, a build 0902 é uma entrada separada em vez de uma substituição silenciosa, então a DSL de roteamento pode fixar tráfego sensível à reprodutibilidade no snapshot datado enquanto todo o resto segue o nível base — sem uma segunda integração, sem alteração de código. Segundo, como o preço de lista é repassado em vez de receber markup, uma mudança na tabela de preços da Alibaba chega ao seu lado no mesmo dia, em vez de na próxima renovação de contrato, e é isso que mantém honesta a aritmética de medido versus nó acima conforme os preços mudam. Cargas de trabalho intensivas em cache também mantêm o desconto de cache do provedor, em vez de perder parte dele para a margem de um revendedor.

O MiMo-V2.6-Flash não é roteável em lugar nenhum, inclusive nos nossos. Não roteamos nenhum modelo Xiaomi, e a linha de disponibilidade no próprio card da Xiaomi aponta para os canais da própria Xiaomi: a plataforma de API do MiMo, o AI Studio, o MiMo Code e o aplicativo de desktop. Se você quiser este checkpoint, vai baixar 172,9 GB e encontrar um nó.

Qual deles, e quando?
Escolha o Qwen3.8-Max se quiser capacidade sem hardware, se o seu volume for incerto ou se quiser a opção de um número independente antes de se comprometer. Aceite que 45 no índice atual é uma posição de meio da fronteira, e não uma posição de topo, que 39,2 tokens por segundo é lento o suficiente para importar dentro de um loop de agente, e que 190M tokens de saída para concluir o Intelligence Index é aproximadamente o dobro da mediana — a verbosidade custa dinheiro no lado do medidor com preço de saída.
Escolha o MiMo-V2.6-Flash se a restrição for a licença, o fluxo de dados ou uma fatura de longo prazo que você possa amortizar — e se você tiver o nó. Termos MIT sem barreira de receita são genuinamente uma permissão diferente de uma licença com limite de MAU e gatilho de participação na receita e, para uma empresa que espera ser grande, é esse o motivo de escolhê-lo. Orce para serviço em vários nós, dimensione a partir dos dados de pesos publicados em vez da página do repositório, e trate cada número no cartão da Xiaomi como declarado pelo fornecedor até que alguém fora do laboratório o reproduza.
E se você está optando hoje em vez do próximo trimestre, use primeiro a opção por medição. Um mês de Qwen3.8-Max mostra o que sua carga de trabalho realmente precisa. Um node mostra apenas o que você esperava que precisasse.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
