
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: Um Checkpoint, Dez Vezes o Preço
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed e Xiaomi MiMo-V2.6-Pro não são dois modelos. São um único modelo vendido de duas maneiras. Ambos são servidos a partir do mesmo checkpoint MiMo-V2.6 de um trilhão de parâmetros que a Xiaomi publicou em setembro de 2026 — o nível Pro da série Xiaomi MiMo-V2.6, cujo irmão menor é o Xiaomi MiMo-V2.6-Flash. A diferença entre as duas ofertas Pro está inteiramente em quão rápido os tokens saem e quanto você paga por eles. O nível padrão cobra US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída. O nível UltraSpeed cobra US$ 4,35 e US$ 8,70. Isso é uma relação limpa de dez para um nos dois lados do medidor, e compra uma alegação de aproximadamente dez vezes a velocidade de saída — uma alegação que a Xiaomi faz sobre sua própria pilha de serving, e para a qual nenhum benchmark independente publicou um número até agora.
Então, a pergunta interessante não é qual modelo é melhor. É se um múltiplo de dez vezes é o preço justo para dez vezes a velocidade, e isso acaba tendo um precedente que vale a pena ler antes de você comprometer um caminho de produção com ele.
O nível rápido é uma decisão de serving, não uma decisão de modelo
O próprio enquadramento da Xiaomi para a linha UltraSpeed é que ela corresponde ao modelo padrão em qualidade e difere apenas na taxa de transferência. Isso importa mais do que parece, porque remove o motivo usual para hesitar em relação a um novo nível. Você não está apostando na personalidade de um checkpoint diferente, em seu comportamento de recusa ou em suas peculiaridades de formatação. Você está apostando que os mesmos pesos, executados por meio de uma configuração de serving mais agressiva, se comportarão da mesma forma em seus prompts. Se isso se mantiver, alternar entre os dois níveis é uma mudança de configuração, não uma migração.
O que está dentro dessa configuração de serving não foi documentado para esta geração. O nível UltraSpeed anterior, construído com base no checkpoint MiMo-V2.5-Pro em junho de 2026, foi descrito pela Xiaomi como usando quantização FP4 apenas nas camadas de especialistas, um esquema de decodificação especulativa paralela por blocos chamado DFlash e um runtime chamado TileRT, e rodava em um único nó com oito GPUs. A Xiaomi não publicou o detalhe equivalente para o nível V2.6. Trate a stack anterior como contexto para como a velocidade é obtida, não como uma descrição do que está em execução agora.
A linha em que ele se insere é curta. Ao lado dos dois níveis Pro, há o MiMo-V2.6-Flash, o irmão menor com 309 bilhões de parâmetros totais e 15 bilhões ativos. O Pro é o carro-chefe de mistura esparsa de especialistas: a Artificial Analysis o lista com 1,0 trilhão de parâmetros totais, com 42 bilhões ativos por token, uma janela de contexto de 1 milhão de tokens e uma licença MIT com pesos no Hugging Face. Esses são os números a reter, porque toda a comparação se baseia neles.
O que é realmente verificado, e o que não é

A assimetria entre as duas colunas acima é a coisa mais importante deste artigo. Quase tudo o que é mensurável sobre este par foi medido nolento. lado
Artificial Analysis avaliou o MiMo-V2.6-Pro e publica um Intelligence Index de 46 para ele — a pontuação mais alta na classe de 114 modelos em que agrupa o modelo. Ele mede 134,3 tokens de saída por segundo através da API da Xiaomi, contra uma mediana da classe de 77,9, e um tempo até o primeiro chunk de 2,15 segundos contra uma mediana de 2,34. Ele lista o custo por tarefa do Intelligence Index em $0,13, um desconto de cache de 99% sobre o preço de entrada, e verbosidade de saída em 140 milhões de tokens. Esses são números independentes em uma configuração nomeada, e são a única âncora de throughput absoluta que esta comparação possui.
Para a UltraSpeed, a lista verificada é bem mais curta:
• Velocidade de saída — cerca de dez vezes o nível padrão, conforme afirmado pela Xiaomi e repetido pelas plataformas que o listam. Nenhum terceiro publicou uma medição de tokens por segundo para este nível específico.
• Preço — US$ 4,35 por milhão de tokens de entrada e US$ 8,70 por milhão de tokens de saída, um múltiplo de dez vezes em relação ao nível padrão em ambos. Nenhum nível de cache é listado junto a essas duas tarifas.
• Qualidade — "corresponde ao original", mais uma vez uma declaração do fornecedor. Nenhuma avaliação independente do endpoint UltraSpeed foi publicada, então a alegação de que a qualidade não mudou permanece não testada, em vez de refutada.
• Contexto e modalidade — 1.048.576 tokens e entrada nativa de texto, imagem, vídeo e áudio, herdada do checkpoint base.
Há também um benchmark de fornecedor que vale a pena nomear precisamente pela forma como circulou. O painel público de aprendizado por reforço da Xiaomi, que transmitiu as execuções de pós-treinamento do V2.6 em setembro de 2026, relata pontuações do DeepSWE v1.1 de 72,57 para a execução Pro e 65,68 para o Flash. Elas vêm da própria avaliação offline da Xiaomi, usando um harness mini-swe-agent com média de três execuções, nunca foram enviadas ao leaderboard público e não foram reproduzidas fora do laboratório. Se você viu 72,57 citado como uma pontuação de leaderboard, esse é um número de fornecedor vestindo as roupas de um leaderboard.

O precedente: da última vez, a Xiaomi cobrou três vezes, não dez
Este não é o primeiro patamar de velocidade da Xiaomi, e o anterior é a comparação mais útil de toda a história — porque o multiplicador mudou.
O MiMo-V2.5-Pro-UltraSpeed chegou em junho de 2026, construído sobre o checkpoint V2.5-Pro, e seu preço foi cerca de três vezes a taxa de saída do modelo padrão. O discurso da Xiaomi na época era o mesmo que ela faz agora: cerca de dez vezes a velocidade de saída. A cobertura da época relatava uma taxa de transferência sustentada em torno de 1.000 tokens por segundo, com picos próximos de 1.200, em um único nó de oito GPUs, embora a própria página do modelo listasse uma faixa mais ampla, de 500 a 1.000 — e nada disso foi verificado de forma independente. O acesso era restrito por um formulário de inscrição, em vez de cadastro aberto.
Coloque os dois lado a lado e a mudança é a história. O múltiplo de velocidade permaneceu em cerca de dez. O múltiplo de preço passou de três para dez. Isso é um negócio muito diferente para o mesmo tipo de atualização, e a Xiaomi não publicou uma explicação para a mudança. Pode refletir um serviço genuinamente mais caro — um checkpoint maior, uma configuração de decodificação mais agressiva ou uma capacidade mais restrita no lançamento. Pode refletir preços de janela de lançamento em um nível que está disponível há apenas um dia. O que ainda falta é uma justificativa pública que você possa verificar.
Uma diferença prática vale a pena destacar para quem usou o nível V2.5: aquele era um teste com acesso restrito. O nível V2.6 está listado como disponível de forma geral através da própria API da Xiaomi e de várias plataformas de terceiros, pelas tarifas publicadas, sem etapa de candidatura. Independentemente do que mais mudou, a fricção para experimentá-lo diminuiu.
O que custa dez vezes em uma carga de trabalho real
As porcentagens escondem a forma disto, então aqui está a aritmética de uma execução concreta de agente — uma que lê 20 milhões de tokens de entrada e emite 2 milhões de tokens de saída ao longo de sua vida útil. Essa é uma carga de trabalho agêntica pesada, mas não exótica, do tipo em que um modelo itera sobre chamadas de ferramentas e relê seu próprio contexto.
• Nível padrão, entrada — 20M tokens a $0.435 por milhão: $8.70.
• Nível padrão, saída — 2M tokens a $0,87 por milhão: $1,74.
• Nível padrão, total — $10.44 por execução.
• Nível UltraSpeed, entrada — 20 milhões de tokens a US$ 4,35 por milhão: US$ 87,00.
• Nível UltraSpeed, saída — 2M tokens a $8,70 por milhão: $17,40.
• Nível UltraSpeed, total — $104,40 por execução.
A diferença é de $93,96, e é exatamente dez vezes a fatura, e não dez vezes uma linha dela, porque ambas as tarifas escalam juntas. Agora, o outro lado do balanço. À taxa de 134,3 tokens de saída por segundo que a Artificial Analysis mede para o nível padrão, gerar 2 milhões de tokens de saída leva um pouco mais de quatro horas de tempo puro de geração. A uma taxa dez vezes maior, leva cerca de vinte e cinco minutos. Então, os $94 extras recuperam algo em torno de três horas e meia de tempo real nesta execução — cerca de $27 por cada hora economizada, se você quiser colocar dessa forma.
Se essa troca vale a pena depende inteiramente de quanto o tempo de relógio vale para você, e há uma complicação que contraria uma leitura ingênua. O preço de entrada do nível padrão tem um desconto de cache de 99% na página da Artificial Analysis, o que significa que a metade da conta referente à entrada pode despencar para quase nada em cargas de trabalho que releem o mesmo contexto. A listagem do UltraSpeed mostra as duas tarifas principais e nenhum nível de cache. Se sua carga de trabalho for pesada em cache, o múltiplo efetivo não é dez — é muito pior, porque você perde o desconto no lado em que estava pagando quase nada. Se sua carga de trabalho for pesada em saída e leve em cache, dez vezes fica perto do número real. Meça sua própria composição antes de confiar em qualquer um dos números.
A assimetria dos pesos abertos
Há uma diferença estrutural entre os dois níveis que não tem nada a ver com preço ou velocidade, e pode ser mais importante do que qualquer um dos dois.
MiMo-V2.6-Pro é disponibilizado sob uma licença MIT, com pesos publicados no Hugging Face. Isso permite implementação comercial, modificação e treino adicional, e significa que o modelo padrão tem um piso de preço que nenhum fornecedor consegue eliminar: se a tarifa do serviço hospedado deixar de fazer sentido, você pode servir o checkpoint por conta própria. Você não vai igualar o throughput da Xiaomi no seu próprio hardware, e vai pagar pelas GPUs, mas a opção existe e limita o que o plano hospedado pode cobrar.
O UltraSpeed não tem esse piso. Não existem pesos do UltraSpeed, porque o nível é a pilha de serviço, e não o modelo — o checkpoint é o mesmo que já é público, e o que você está alugando é a capacidade da Xiaomi de executá-lo com rapidez. Isso é uma coisa legítima de se vender, e tem o mesmo formato de todos os outros níveis de velocidade do mercado. Isso significa que a tarifa dez vezes maior não tem nenhum freio competitivo além de outros provedores que executam os mesmos pesos abertos, e nenhuma válvula de escape de auto-hospedagem se o preço mudar novamente.

Leia isso à luz do panorama de disponibilidade. O checkpoint padrão está acessível pelos canais próprios da Xiaomi e por várias plataformas de terceiros, e também está disponível para download. O nível UltraSpeed está acessível pela API própria da Xiaomi e por várias plataformas de terceiros, e essa é a única forma de obtê-lo. Para quem está avaliando uma dependência de longa duração, essa diferença de opcionalidade merece ser ponderada juntamente com a tarifa por token.
Quem deve levar qual
A decisão se divide nitidamente conforme quanto do seu custo são tokens de saída e quanto do seu orçamento de latência é geração, em vez de enfileiramento.
• Use o UltraSpeed quando a carga de trabalho for intensiva em saída, leve em cache e interativa — geração de textos longos, loops de agentes em que o modelo escreve muito raciocínio entre chamadas de ferramentas, ou qualquer situação em que um humano esteja esperando do outro lado da solicitação.
• Escolha o nível padrão quando a carga de trabalho for intensiva em cache, tolerante a processamento em lote ou sensível a custos na margem — classificação em massa, respostas aumentadas por recuperação sobre um corpus fixo, execuções de avaliação durante a noite, qualquer cenário em que quatro horas de geração sejam aceitáveis porque ninguém está acompanhando.
• Escolha o plano padrão quando quiser a opção de auto-hospedar. Se sua postura de conformidade exige pesos que você possa manter, o UltraSpeed não está disponível para você a nenhum preço.
• Não aceite nenhum dos dois antes de medir. A alegação das dez vezes é o número que sustenta tudo aqui e, no momento, é declarada pelo fornecedor. Uma única tarde executando seus próprios prompts nos dois níveis lhe diz mais do que qualquer uma das cifras publicadas, porque o único número de throughput que alguém verificou de forma independente pertence ao lado lento da comparação.
Quanto a esse último ponto, a mecânica de testar um nível de serviço é a mesma de testar um modelo, e é aí que uma camada de roteamento justifica o seu lugar. O OrcaRouter disponibiliza mais de 200 modelos por trás de uma única chave de API, ao preço de tabela do provedor, com 0% de margem repassada, então uma mudança de preço do fornecedor chega até você no mesmo dia, e não só na próxima renovação de contrato. O failover automático significa que um nível que você ainda está avaliando nunca fica sozinho em um caminho de produção, e a DSL de roteamento permite enviar uma classe de requisições para o endpoint rápido e todo o resto para o padrão, sem manter duas integrações. Nada disso exige especificamente os modelos da Xiaomi — o ponto é que decisões no nível de camada como esta são baratas de reverter quando as camadas ficam atrás de uma única chave.
O que resolveria isso
O estado honesto da questão MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro é que metade dela é medida e metade é afirmada. O nível padrão tem um Intelligence Index independente, um valor de throughput independente e pesos abertos publicados. O nível rápido tem um preço, uma janela de contexto e uma promessa do fornecedor de que é o mesmo modelo a correr mais rápido.
Três coisas fechariam a lacuna. Uma medição independente de throughput no endpoint UltraSpeed — a Artificial Analysis mediu a camada padrão através da API da Xiaomi, então o mesmo tratamento é possível e simplesmente ainda não aconteceu. Uma política de cache para a camada rápida, já que a ausência de uma é o que transforma uma fatura dez vezes maior em algo pior em cargas de trabalho com muito cache. E qualquer detalhe publicado sobre a pilha de serviço do V2.6, da forma como a Xiaomi documentou especialistas FP4, DFlash e TileRT para a geração V2.5.
Até lá, o preço dez vezes maior é real e a velocidade dez vezes maior é uma promessa. Se a sua carga de trabalho for intensiva em saída e houver alguém esperando, vale a pena testar essa promessa com os seus próprios prompts — e vale a pena testá-la por trás de uma camada que lhe permita voltar atrás na mesma tarde, caso não se confirme.
