
GPT-6.1 Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: Duas faixas rápidas, uma diz quanto custou
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
As duas maneiras mais rápidas de comprar um modelo de fronteira foram colocadas à venda com dezesseis dias de diferença, e apenas uma delas informava como a velocidade era produzida. GPT-6.1 Ultrafast — o nível de serviço acima de GPT-6.1 Sol, que a OpenAI lançou em 29 de setembro de 2026 e que recebeu esse nível em 8 de outubro de 2026 — é um carro-chefe fechado que você acessa por meio de uma API, com preço seis vezes o Standard e sem nenhuma descrição publicada do que acontece entre os pesos e sua solicitação. Xiaomi MiMo v2.6 Pro Ultraspeed, lançado em 22 de setembro de 2026, é um nível de velocidade sobre MiMo-V2.6-Pro, um checkpoint licenciado sob MIT cujo ambiente de aprendizado por reforço a Xiaomi também publicou. Ambos vendem latência por um múltiplo. Só o múltiplo da Xiaomi se baseia em algo que um cliente pode inspecionar, e essa diferença pesa mais na decisão do que qualquer uma das alegações de velocidade.
O preço das duas faixas é a parte fácil e é abordado abaixo. A parte difícil é que um nível de velocidade é uma promessa sobre o serviço prestado, e os dois fornecedores fizeram essa promessa em níveis muito diferentes de divulgação — um pegou emprestado seu número de destaque de um modelo irmão, o outro enviou a receita de treinamento junto com a lista de preços. Se você está prestes a comprometer uma carga de trabalho de produção com uma faixa rápida, a lacuna de divulgação é o risco que você está de fato assumindo.
Os preços, com ambos os lados na mesma linha
Ambos os níveis são vendidos como um múltiplo de uma lane padrão, e os múltiplos são suficientemente próximos para que o preço não seja o que os diferencia.
• Faixa padrão — GPT-6.1 Sol a $2,00 de entrada / $10,00 de saída por milhão de tokens, contra MiMo-V2.6-Pro a $0,44 / $0,87.
• Via rápida — GPT-6.1 Ultrafast a $12.00 / $60.00, contra MiMo-V2.6-Pro-UltraSpeed a $4.35 / $8.70.
• O múltiplo — exatamente 6x em todas as linhas para o nível da OpenAI, aproximadamente 9,9x na entrada e exatamente 10x na saída para o da Xiaomi.
• Entrada em cache — o GPT-6.1 Sol está listado a US$ 0,10 por milhão no Standard e a US$ 0,60 no Ultrafast; a tabela de preços da MiMo que conseguimos consultar não publica uma linha separada de entrada em cache para nenhuma das duas vias.
• Contexto longo — o GPT-6.1 Sol reprecifica toda a solicitação a 2x as tarifas de entrada e de cache e 1,5x a de saída acima de 272.000 tokens de entrada, colocando o Ultrafast em $24.00 / $1.20 / $30.00 / $90.00. O MiMo-V2.6-Pro tem uma janela de contexto de 1M de tokens, sem um degrau publicado equivalente.
• Diferença absoluta — as duas faixas rápidas estão separadas por 2,8x na entrada e 6,9x na saída, o que é a lacuna entre um modelo fechado de fronteira e um de pesos abertos surgindo dentro do escalão de velocidade, em vez de na tarifa padrão.
Resumo de uma linha desse bloco: a Xiaomi cobra um múltiplo maior em um modelo muito mais barato, e a OpenAI cobra um múltiplo menor em um modelo muito mais caro. Nos tokens de saída, você paga US$ 60,00 por milhão pela via da OpenAI e US$ 8,70 pela da Xiaomi. Nenhum dos fornecedores está oferecendo desconto pela velocidade; ambos estão precificando-a como um produto separado, o que é o primeiro sinal de que, nos dois casos, a via padrão continua sendo a opção padrão e a via rápida é uma exceção que você justifica por carga de trabalho.
O que cada fornecedor lhe dirá sobre a velocidade
É aqui que as duas implantações deixam de ser simétricas, e esta é a coisa mais útil da página.
O número publicado pela OpenAI para o Ultrafast é que o GPT-6 Astra Ultrafast gera tokens até 8x mais rápido do que o GPT-6 Astra no modo Padrão no Codex. Essa é uma medição de um modelo diferente, em um cliente diferente, formulada como um teto. A documentação que cobre o Ultrafast para o GPT-6.1 Sol diz que o nível reduz o tempo entre os tokens de saída gerados e aponta para uma tabela de preços; ela não atribui número algum ao nível Sol. Portanto, o número de destaque associado a este lançamento é emprestado do modelo irmão que está no Ultrafast desde 29 de setembro, e nenhuma parte independente publicou uma medição de tokens por segundo para qualquer um dos dois. É bem possível que se sustente — mesma pilha de serviço, mesmo mecanismo —, mas é um teto do fornecedor que a própria OpenAI não mediu para este modelo.
A divulgação da Xiaomi é de natureza diferente, e a diferença não está em ser mais precisa. O próprio material da empresa afirma que o UltraSpeed atinge até 20 vezes a velocidade de saída do serviço Pro padrão com a mesma qualidade. Listagens de catálogos de terceiros que descrevem o mesmo modelo no mesmo dia indicam cerca de 10 vezes. Ambos os números estão em circulação, não são o mesmo número, e ninguém publicou uma medição que os concilie. Uma leitura honesta disto: "até 20x" é um teto do fornecedor sob condições que a Xiaomi não especificou, "cerca de 10x" é o que um catálogo se dispôs a afirmar como típico, e o multiplicador real situa-se algures numa faixa ampla até que alguém publique distribuições de latência por pedido a um nível de concorrência declarado.
Então, a Xiaomi fornece dois números inconciliáveis, e a OpenAI fornece um número que pertence a um modelo diferente. Nenhum dos dois é um fato com o qual você possa planejar seu orçamento, e a consequência prática é a mesma para ambos: meça o nível com seus próprios prompts antes de comprometer um caminho de produção com ele.
A assimetria que realmente importa: o que os dígitos extras compram
Deixando de lado as alegações de velocidade, as duas faixas estão ligadas a tipos de produto muito diferentes, e é aqui que a escolha deixa de ser uma comparação de preços.
MiMo-V2.6-Pro é uma arquitetura esparsa de mistura de especialistas que a Xiaomi descreveu publicamente: 1,02 trilhão de parâmetros totais com 42 bilhões ativados por token, uma janela de contexto de 1M de tokens, multimodalidade nativa em texto, imagem, vídeo e áudio, e uma etiqueta de licença MIT nos checkpoints disponibilizados. O pacote de lançamento inclui um relatório técnico e notas de implantação, e a Xiaomi diz que está disponibilizando como código aberto o ambiente de treinamento de aprendizado por reforço e o respectivo código, para que o pós-treinamento possa ser examinado e reproduzido. A execução de RL também está documentada — 30 etapas e cerca de 750.000 trajetórias por modelo, em menos de seis dias, com um gasto combinado divulgado de cerca de US$ 3.474.715 nas execuções do Pro e do Flash. No DeepSWE v1.1, no harness próprio da Xiaomi com mini-swe-agent em avg@3, a empresa relata que o MiMo-V2.6-Flash passou de 48,8 para 65,68 e o MiMo-V2.6-Pro, de 58,4 para 72,57 ao longo dessa execução. Esses valores são informados pelo fornecedor e não foram reproduzidos; a distinção entre "o harness da Xiaomi diz 72,57" e "72,57 é a pontuação" é a diferença entre uma alegação e um fato.
GPT-6.1 Sol não publica nada disso. Não há contagem de parâmetros, nota de arquitetura, valor de gasto com treinamento, checkpoint nem licença para ler — há um model card, uma janela de contexto, um corte de conhecimento de 30 de abril de 2026 e uma API. Essa é a configuração normal para um laboratório de fronteira, e não é uma crítica. Mas isso tem uma consequência para uma decisão de compra que a cobertura de lançamento costuma deixar de lado: com a via de pesos abertos, um nível rápido decepcionante é recuperável. Se o UltraSpeed não valer 10x o seu tráfego, o mesmo checkpoint pode ser baixado e você pode servi-lo por conta própria ou por meio de outro provedor, o que limita seu risco de perda ao custo da migração. Com a via fechada, um nível rápido decepcionante é uma fatura e um orçamento de limite de taxa que você ajusta de volta para baixo; você não pode contornar isso executando os pesos, porque não há pesos para executar.
Um alerta sobre essa tag do MIT, porque ela acaba sendo simplificada na cobertura de lançamento. A licença se aplica aos checkpoints que a Xiaomi publicou. O UltraSpeed é um serviço hospedado, e serviços hospedados são regidos por termos de serviço, e não por uma licença de pesos. Ter o direito de executar o checkpoint no seu próprio hardware e ter o direito de revender o serviço acelerado que outra pessoa oferece dele são dois direitos diferentes, e apenas o primeiro vem do arquivo de licença.


Duas armadilhas de nomenclatura antes de você copiar qualquer um dos identificadores
Nenhum dos nomes no título desta página é um checkpoint, e a documentação de ambos os fornecedores torna o erro fácil de repetir.
• GPT-6.1 Ultrafast — não é um modelo. O identificador na requisição permanece o mesmo do modelo padrão; o nível é definido por um campo da requisição, e o resultado é o mesmo checkpoint agendado de forma diferente.
• MiMo v2.6 Pro Ultraspeed — também não é um conjunto distinto de pesos. É o checkpoint MiMo-V2.6-Pro servido num caminho mais rápido e com preço próprio como item de linha.
• O que isso significa para benchmarking — se você comparar as duas vias de qualquer um dos modelos em prompts idênticos, o resultado esperado são as mesmas respostas em taxas diferentes. Conteúdo divergente na mesma entrada é um defeito a ser reportado, não uma capacidade que você comprou.
• O que isso significa para a verificação da licença — para a Xiaomi, leia o cartão do modelo. Para a OpenAI, não há nada para ler, porque os pesos não são distribuídos.
Há também uma assimetria mais suave que aparece na forma como cada nível é vendido. O GPT-6.1 Sol oferece suporte a residência de dados nos EUA e na UE e a processamento global, no âmbito do Ultrafast, de modo que uma carga de trabalho fixada a um residente tem uma resposta documentada. A tabela de preços do MiMo que conseguimos ler não informa residência alguma — a Xiaomi está vendendo um modelo e um caminho de serviço, não uma postura de conformidade. Para um comprador regulamentado, essa única linha pode decidir a comparação antes de o preço ser considerado.
Onde cada via é realmente chamável
Ambas as vias rápidas estão acessíveis por meio da API do próprio fornecedor, e ambas aparecem em plataformas de terceiros. Nenhuma delas está no OrcaRouter, e vale a pena dizer isso claramente, em vez de deixar que uma página de comparação sugira o contrário.
O que está no OrcaRouter é o canal padrão do modelo OpenAI: openai/gpt-6.1-sol aos preços de tabela da própria OpenAI de $2,00 por milhão de tokens de entrada e $10,00 por milhão de tokens de saída, com 0% de markup e o preço do provedor repassado diretamente, então um reajuste de preço do fornecedor chega ao nosso lado no mesmo dia. Ultrafast é uma flag de nível de serviço cobrada na sua própria conta OpenAI, e nenhum modelo Xiaomi é hospedado aqui. O que uma única chave compra é o canal padrão junto com mais de 200 outros modelos atrás de um único endpoint compatível com OpenAI, com failover automático entre provedores — que é a postura útil quando a carga de trabalho que você está protegendo é a que notaria um teto de limite de taxa às três da manhã.

Qual faixa testar, em ordem
Se a sua carga de trabalho for interativa e o tempo de geração pesar no relógio de uma pessoa, ambos os níveis valem a pena testar e o fator decisivo não será o preço — será a data de validade da sua confiança. A via de pesos abertos permite-lhe verificar e depois sair; a via fechada pede-lhe que verifique com o único fornecedor que o consegue servir e que fique. Essa assimetria é real, mas também não é gratuita: MiMo-V2.6-Pro-UltraSpeed é um serviço alojado, pelo que a saída é uma migração e não uma alteração de configuração, e o checkpoint para o qual migraria pode não corresponder às otimizações de serving desse nível.
Se sua carga de trabalho for em lote ou agendada, ambas — a 6x e a 10x — são a compra errada, e a decisão honesta é executá-la na lane padrão e gastar a diferença em avaliação.
O que mudaria esta página: uma medição independente da velocidade de saída de qualquer um dos níveis a um nível de concorrência declarado, uma declaração de residência publicada pela Xiaomi, ou um número de limite de taxa da OpenAI para o nível Sol com que um comprador possa planear, em vez de o solicitar. Enquanto isso não existir, a comparação é uma lista de preços contra uma lista de preços, com um dos dois fornecedores a ter publicado consideravelmente mais sobre o objeto que está a ser precificado.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
