Cartão de título de destaque para o artigo "MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro", encabeçado pelo antetítulo "OrcaRouter · radar de modelos — níveis de serviço", com o subtítulo "Um checkpoint de 1T, duas formas de comprá-lo: $0.435/$0.87 por milhão de tokens, ou $4.35/$8.70 por uma velocidade alegadamente dez vezes maior." Abaixo dele, dois cartões: à esquerda, "Standard tier", com o texto "134,3 tokens de saída/seg medidos pela Artificial Analysis; contexto de 1M; pesos MIT no Hugging Face"; à direita, "UltraSpeed tier", com o texto "$4.35 de entrada / $8.70 de saída por 1M; mesmo checkpoint, mesma alegação de qualidade; somente hospedado". Quatro chips trazem "AA Index: 46", "Total params: 1.0T", "Active params: 42B" e "DeepSWE: 72.57 relatado pelo fornecedor". O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: Um Checkpoint, Dez Vezes o Preço

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Xiaomi MiMo-V2.6-Pro-UltraSpeed e Xiaomi MiMo-V2.6-Pro não são dois modelos. São um único modelo vendido de duas maneiras. Ambos são servidos a partir do mesmo checkpoint MiMo-V2.6 de um trilhão de parâmetros que a Xiaomi publicou em setembro de 2026 — o nível Pro da série Xiaomi MiMo-V2.6, cujo irmão menor é o Xiaomi MiMo-V2.6-Flash. A diferença entre as duas ofertas Pro está inteiramente em quão rápido os tokens saem e quanto você paga por eles. O nível padrão cobra US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída. O nível UltraSpeed cobra US$ 4,35 e US$ 8,70. Isso é uma relação limpa de dez para um nos dois lados do medidor, e compra uma alegação de aproximadamente dez vezes a velocidade de saída — uma alegação que a Xiaomi faz sobre sua própria pilha de serving, e para a qual nenhum benchmark independente publicou um número até agora.

Então, a pergunta interessante não é qual modelo é melhor. É se um múltiplo de dez vezes é o preço justo para dez vezes a velocidade, e isso acaba tendo um precedente que vale a pena ler antes de você comprometer um caminho de produção com ele.

O nível rápido é uma decisão de serving, não uma decisão de modelo

O próprio enquadramento da Xiaomi para a linha UltraSpeed é que ela corresponde ao modelo padrão em qualidade e difere apenas na taxa de transferência. Isso importa mais do que parece, porque remove o motivo usual para hesitar em relação a um novo nível. Você não está apostando na personalidade de um checkpoint diferente, em seu comportamento de recusa ou em suas peculiaridades de formatação. Você está apostando que os mesmos pesos, executados por meio de uma configuração de serving mais agressiva, se comportarão da mesma forma em seus prompts. Se isso se mantiver, alternar entre os dois níveis é uma mudança de configuração, não uma migração.

O que está dentro dessa configuração de serving não foi documentado para esta geração. O nível UltraSpeed anterior, construído com base no checkpoint MiMo-V2.5-Pro em junho de 2026, foi descrito pela Xiaomi como usando quantização FP4 apenas nas camadas de especialistas, um esquema de decodificação especulativa paralela por blocos chamado DFlash e um runtime chamado TileRT, e rodava em um único nó com oito GPUs. A Xiaomi não publicou o detalhe equivalente para o nível V2.6. Trate a stack anterior como contexto para como a velocidade é obtida, não como uma descrição do que está em execução agora.

A linha em que ele se insere é curta. Ao lado dos dois níveis Pro, há o MiMo-V2.6-Flash, o irmão menor com 309 bilhões de parâmetros totais e 15 bilhões ativos. O Pro é o carro-chefe de mistura esparsa de especialistas: a Artificial Analysis o lista com 1,0 trilhão de parâmetros totais, com 42 bilhões ativos por token, uma janela de contexto de 1 milhão de tokens e uma licença MIT com pesos no Hugging Face. Esses são os números a reter, porque toda a comparação se baseia neles.

O que é realmente verificado, e o que não é

A two-column scoreboard titled 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro — the scoreboard'. The left column, badged VENDOR-REPORTED, is headed 'MiMo-V2.6-Pro-UltraSpeed' and reads: Output speed — about 10x the standard tier, Xiaomi's claim; Price in — $4.35 per 1M tokens; Price out — $8.70 per 1M tokens; Context — 1M tokens; Weights — hosted only, none published; Independent speed test — none published. The right column, badged INDEPENDENTLY MEASURED, is headed 'MiMo-V2.6-Pro' and reads: Output speed — 134.3 tokens/sec per Artificial Analysis; Price in — $0.435 per 1M tokens; Price out — $0.87 per 1M tokens; Context — 1M tokens; Weights — MIT, on Hugging Face; Independent speed test — Artificial Analysis, 114-model class. A footer reads 'UltraSpeed figures are Xiaomi's own serving claims with no independent verification. MiMo-V2.6-Pro figures per Artificial Analysis, read 2026-09-22.' The OrcaRouter logo is composited in the bottom-right corner.

A assimetria entre as duas colunas acima é a coisa mais importante deste artigo. Quase tudo o que é mensurável sobre este par foi medido nolento. lado

Artificial Analysis avaliou o MiMo-V2.6-Pro e publica um Intelligence Index de 46 para ele — a pontuação mais alta na classe de 114 modelos em que agrupa o modelo. Ele mede 134,3 tokens de saída por segundo através da API da Xiaomi, contra uma mediana da classe de 77,9, e um tempo até o primeiro chunk de 2,15 segundos contra uma mediana de 2,34. Ele lista o custo por tarefa do Intelligence Index em $0,13, um desconto de cache de 99% sobre o preço de entrada, e verbosidade de saída em 140 milhões de tokens. Esses são números independentes em uma configuração nomeada, e são a única âncora de throughput absoluta que esta comparação possui.

Para a UltraSpeed, a lista verificada é bem mais curta:

• Velocidade de saída — cerca de dez vezes o nível padrão, conforme afirmado pela Xiaomi e repetido pelas plataformas que o listam. Nenhum terceiro publicou uma medição de tokens por segundo para este nível específico.

• Preço — US$ 4,35 por milhão de tokens de entrada e US$ 8,70 por milhão de tokens de saída, um múltiplo de dez vezes em relação ao nível padrão em ambos. Nenhum nível de cache é listado junto a essas duas tarifas.

• Qualidade — "corresponde ao original", mais uma vez uma declaração do fornecedor. Nenhuma avaliação independente do endpoint UltraSpeed foi publicada, então a alegação de que a qualidade não mudou permanece não testada, em vez de refutada.

• Contexto e modalidade — 1.048.576 tokens e entrada nativa de texto, imagem, vídeo e áudio, herdada do checkpoint base.

Há também um benchmark de fornecedor que vale a pena nomear precisamente pela forma como circulou. O painel público de aprendizado por reforço da Xiaomi, que transmitiu as execuções de pós-treinamento do V2.6 em setembro de 2026, relata pontuações do DeepSWE v1.1 de 72,57 para a execução Pro e 65,68 para o Flash. Elas vêm da própria avaliação offline da Xiaomi, usando um harness mini-swe-agent com média de três execuções, nunca foram enviadas ao leaderboard público e não foram reproduzidas fora do laboratório. Se você viu 72,57 citado como uma pontuação de leaderboard, esse é um número de fornecedor vestindo as roupas de um leaderboard.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 22, 2026, headed 'MiMo-V2.6-Pro Intelligence, Performance & Price Analysis' with the labels 'Open weights model' and 'Released September 2026'. The metric strip reads Intelligence #1/114, Speed #11/114, Cost #12/114 and Verbosity #18/114. The cost panel reads $0.435 in and $0.87 out per million tokens, a 99% cache discount, and $0.13 per Intelligence Index task; the speed panel reads 134.3 output tokens per second, ranked eleventh of 114 against a median of 77.9, with a first-chunk time of 2.15 seconds; verbosity reads 140M output tokens. The comparison summary states the model scores 46 on the Artificial Analysis Intelligence Index against a class median of 18, is notably fast at 134 tokens per second against a median of 78, is somewhat verbose, supports text, image, speech and video input and outputs text, and has a 1M-token context window. Technical specifications list reasoning enabled, input modalities text and image, output text, a 1M context window, 1.0T total parameters, 42B active parameters, an MIT licence, and model weights on Hugging Face.

O precedente: da última vez, a Xiaomi cobrou três vezes, não dez

Este não é o primeiro patamar de velocidade da Xiaomi, e o anterior é a comparação mais útil de toda a história — porque o multiplicador mudou.

O MiMo-V2.5-Pro-UltraSpeed chegou em junho de 2026, construído sobre o checkpoint V2.5-Pro, e seu preço foi cerca de três vezes a taxa de saída do modelo padrão. O discurso da Xiaomi na época era o mesmo que ela faz agora: cerca de dez vezes a velocidade de saída. A cobertura da época relatava uma taxa de transferência sustentada em torno de 1.000 tokens por segundo, com picos próximos de 1.200, em um único nó de oito GPUs, embora a própria página do modelo listasse uma faixa mais ampla, de 500 a 1.000 — e nada disso foi verificado de forma independente. O acesso era restrito por um formulário de inscrição, em vez de cadastro aberto.

Coloque os dois lado a lado e a mudança é a história. O múltiplo de velocidade permaneceu em cerca de dez. O múltiplo de preço passou de três para dez. Isso é um negócio muito diferente para o mesmo tipo de atualização, e a Xiaomi não publicou uma explicação para a mudança. Pode refletir um serviço genuinamente mais caro — um checkpoint maior, uma configuração de decodificação mais agressiva ou uma capacidade mais restrita no lançamento. Pode refletir preços de janela de lançamento em um nível que está disponível há apenas um dia. O que ainda falta é uma justificativa pública que você possa verificar.

Uma diferença prática vale a pena destacar para quem usou o nível V2.5: aquele era um teste com acesso restrito. O nível V2.6 está listado como disponível de forma geral através da própria API da Xiaomi e de várias plataformas de terceiros, pelas tarifas publicadas, sem etapa de candidatura. Independentemente do que mais mudou, a fricção para experimentá-lo diminuiu.

O que custa dez vezes em uma carga de trabalho real

As porcentagens escondem a forma disto, então aqui está a aritmética de uma execução concreta de agente — uma que lê 20 milhões de tokens de entrada e emite 2 milhões de tokens de saída ao longo de sua vida útil. Essa é uma carga de trabalho agêntica pesada, mas não exótica, do tipo em que um modelo itera sobre chamadas de ferramentas e relê seu próprio contexto.

• Nível padrão, entrada — 20M tokens a $0.435 por milhão: $8.70.

• Nível padrão, saída — 2M tokens a $0,87 por milhão: $1,74.

• Nível padrão, total — $10.44 por execução.

• Nível UltraSpeed, entrada — 20 milhões de tokens a US$ 4,35 por milhão: US$ 87,00.

• Nível UltraSpeed, saída — 2M tokens a $8,70 por milhão: $17,40.

• Nível UltraSpeed, total — $104,40 por execução.

A diferença é de $93,96, e é exatamente dez vezes a fatura, e não dez vezes uma linha dela, porque ambas as tarifas escalam juntas. Agora, o outro lado do balanço. À taxa de 134,3 tokens de saída por segundo que a Artificial Analysis mede para o nível padrão, gerar 2 milhões de tokens de saída leva um pouco mais de quatro horas de tempo puro de geração. A uma taxa dez vezes maior, leva cerca de vinte e cinco minutos. Então, os $94 extras recuperam algo em torno de três horas e meia de tempo real nesta execução — cerca de $27 por cada hora economizada, se você quiser colocar dessa forma.

Se essa troca vale a pena depende inteiramente de quanto o tempo de relógio vale para você, e há uma complicação que contraria uma leitura ingênua. O preço de entrada do nível padrão tem um desconto de cache de 99% na página da Artificial Analysis, o que significa que a metade da conta referente à entrada pode despencar para quase nada em cargas de trabalho que releem o mesmo contexto. A listagem do UltraSpeed mostra as duas tarifas principais e nenhum nível de cache. Se sua carga de trabalho for pesada em cache, o múltiplo efetivo não é dez — é muito pior, porque você perde o desconto no lado em que estava pagando quase nada. Se sua carga de trabalho for pesada em saída e leve em cache, dez vezes fica perto do número real. Meça sua própria composição antes de confiar em qualquer um dos números.

A assimetria dos pesos abertos

Há uma diferença estrutural entre os dois níveis que não tem nada a ver com preço ou velocidade, e pode ser mais importante do que qualquer um dos dois.

MiMo-V2.6-Pro é disponibilizado sob uma licença MIT, com pesos publicados no Hugging Face. Isso permite implementação comercial, modificação e treino adicional, e significa que o modelo padrão tem um piso de preço que nenhum fornecedor consegue eliminar: se a tarifa do serviço hospedado deixar de fazer sentido, você pode servir o checkpoint por conta própria. Você não vai igualar o throughput da Xiaomi no seu próprio hardware, e vai pagar pelas GPUs, mas a opção existe e limita o que o plano hospedado pode cobrar.

O UltraSpeed não tem esse piso. Não existem pesos do UltraSpeed, porque o nível é a pilha de serviço, e não o modelo — o checkpoint é o mesmo que já é público, e o que você está alugando é a capacidade da Xiaomi de executá-lo com rapidez. Isso é uma coisa legítima de se vender, e tem o mesmo formato de todos os outros níveis de velocidade do mercado. Isso significa que a tarifa dez vezes maior não tem nenhum freio competitivo além de outros provedores que executam os mesmos pesos abertos, e nenhuma válvula de escape de auto-hospedagem se o preço mudar novamente.

Screenshot of Xiaomi's MiMo homepage captured September 22, 2026, headed 'HELLO, I'M MiMo'. Two product cards are visible: 'Xiaomi MiMo-V2.6-Series', subtitled 'Frontier intelligence, all the modalities, built in public', and 'Xiaomi MiMo-V2.5-TTS Series'. Below them a 'Build with MiMo' section lists two numbered routes, '01 Web Demo' and '02 API Access', with the lines 'Interact with MiMo directly through the web' and 'Developer portal for quick integration of MiMo capabilities'.

Leia isso à luz do panorama de disponibilidade. O checkpoint padrão está acessível pelos canais próprios da Xiaomi e por várias plataformas de terceiros, e também está disponível para download. O nível UltraSpeed está acessível pela API própria da Xiaomi e por várias plataformas de terceiros, e essa é a única forma de obtê-lo. Para quem está avaliando uma dependência de longa duração, essa diferença de opcionalidade merece ser ponderada juntamente com a tarifa por token.

Quem deve levar qual

A decisão se divide nitidamente conforme quanto do seu custo são tokens de saída e quanto do seu orçamento de latência é geração, em vez de enfileiramento.

• Use o UltraSpeed quando a carga de trabalho for intensiva em saída, leve em cache e interativa — geração de textos longos, loops de agentes em que o modelo escreve muito raciocínio entre chamadas de ferramentas, ou qualquer situação em que um humano esteja esperando do outro lado da solicitação.

• Escolha o nível padrão quando a carga de trabalho for intensiva em cache, tolerante a processamento em lote ou sensível a custos na margem — classificação em massa, respostas aumentadas por recuperação sobre um corpus fixo, execuções de avaliação durante a noite, qualquer cenário em que quatro horas de geração sejam aceitáveis porque ninguém está acompanhando.

• Escolha o plano padrão quando quiser a opção de auto-hospedar. Se sua postura de conformidade exige pesos que você possa manter, o UltraSpeed não está disponível para você a nenhum preço.

• Não aceite nenhum dos dois antes de medir. A alegação das dez vezes é o número que sustenta tudo aqui e, no momento, é declarada pelo fornecedor. Uma única tarde executando seus próprios prompts nos dois níveis lhe diz mais do que qualquer uma das cifras publicadas, porque o único número de throughput que alguém verificou de forma independente pertence ao lado lento da comparação.

Quanto a esse último ponto, a mecânica de testar um nível de serviço é a mesma de testar um modelo, e é aí que uma camada de roteamento justifica o seu lugar. O OrcaRouter disponibiliza mais de 200 modelos por trás de uma única chave de API, ao preço de tabela do provedor, com 0% de margem repassada, então uma mudança de preço do fornecedor chega até você no mesmo dia, e não só na próxima renovação de contrato. O failover automático significa que um nível que você ainda está avaliando nunca fica sozinho em um caminho de produção, e a DSL de roteamento permite enviar uma classe de requisições para o endpoint rápido e todo o resto para o padrão, sem manter duas integrações. Nada disso exige especificamente os modelos da Xiaomi — o ponto é que decisões no nível de camada como esta são baratas de reverter quando as camadas ficam atrás de uma única chave.

O que resolveria isso

O estado honesto da questão MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro é que metade dela é medida e metade é afirmada. O nível padrão tem um Intelligence Index independente, um valor de throughput independente e pesos abertos publicados. O nível rápido tem um preço, uma janela de contexto e uma promessa do fornecedor de que é o mesmo modelo a correr mais rápido.

Três coisas fechariam a lacuna. Uma medição independente de throughput no endpoint UltraSpeed — a Artificial Analysis mediu a camada padrão através da API da Xiaomi, então o mesmo tratamento é possível e simplesmente ainda não aconteceu. Uma política de cache para a camada rápida, já que a ausência de uma é o que transforma uma fatura dez vezes maior em algo pior em cargas de trabalho com muito cache. E qualquer detalhe publicado sobre a pilha de serviço do V2.6, da forma como a Xiaomi documentou especialistas FP4, DFlash e TileRT para a geração V2.5.

Até lá, o preço dez vezes maior é real e a velocidade dez vezes maior é uma promessa. Se a sua carga de trabalho for intensiva em saída e houver alguém esperando, vale a pena testar essa promessa com os seus próprios prompts — e vale a pena testá-la por trás de uma camada que lhe permita voltar atrás na mesma tarde, caso não se confirme.