
GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: Mesma Manobra, Duas Ofertas Diferentes
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois laboratórios realizaram a mesma manobra na mesma quinzena, e a parte interessante é que o fizeram com pressupostos opostos sobre aquilo que um cliente está a comprar. O GPT-6 Astra Ultrafast é o produto de topo do fornecedor, vendido através do nível de serviço Ultrafast — o modelo lançado a 3 de setembro de 2026, o nível amplamente disponível desde 29 de setembro de 2026, e mencionado na publicação da NVIDIA de 1 de outubro como a correr em GPUs Blackwell. O Xiaomi MiMo v2.6 Pro Ultraspeed é a versão da Xiaomi, lançada a 22 de setembro de 2026: o mesmo checkpoint de 1,02 biliões de parâmetros que o MiMo-V2.6-Pro, servido mais rapidamente, a cerca de dez vezes a tarifa padrão.
Um deles é a maneira mais rápida de chamar um modelo de fronteira. O outro é a camada rápida mais barata que existe. Eles não são concorrentes no sentido comum — você teria de escrever uma aplicação muito estranha para escolher entre um carro-chefe fechado de US$ 300 por milhão de tokens e um modelo de pesos abertos de US$ 8,70 por milhão de tokens. O que torna este par digno de uma página é que ambos são camadas de velocidade, e não modelos, então compará-los isola a única questão que uma camada de velocidade coloca: exatamente pelo que você está pagando esse múltiplo?
Ambos os níveis vendem a mesma não-coisa
Nenhum dos dois nomes é um ponto de verificação. Essa é a parte que a cobertura de lançamento tende a desfocar, então vale a pena ser mecânico quanto a isso.
• O que o nome indica — GPT-6 Astra Ultrafast é o GPT-6 Astra com o campo de requisição service_tier: "ultrafast" definido; o id do modelo na requisição ainda é gpt-6-astra. O Xiaomi MiMo v2.6 Pro Ultraspeed é o checkpoint MiMo-V2.6-Pro servido em um caminho mais rápido, com preço como item de linha próprio.
• O que muda — processamento em lote, decodificação especulativa, alocação de hardware, limites de concorrência, tratamento de conexões. Tudo entre os pesos e sua requisição HTTP, e nada dentro dos pesos.
• O que não muda — as respostas. O mesmo checkpoint, com as mesmas configurações, deve produzir o mesmo conteúdo a uma taxa diferente. Se duas faixas do mesmo modelo divergirem com a mesma entrada, isso é um defeito a ser reportado, não uma capacidade que você comprou.
• Por que isso importa para esta comparação — porque nenhum dos níveis reivindica uma melhoria de benchmark em relação à sua própria faixa padrão, toda a decisão de compra se resume ao preço por token contra os segundos economizados. O que significa que os dois acordos são decididos pela aritmética, não pela avaliação.
Há, porém, uma assimetria no enquadramento, e ela não está nos níveis. O UltraSpeed da Xiaomi assenta sobre um modelo com licença aberta — os pesos do MiMo-V2.6 carregam uma licença MIT, de acordo com os próprios model cards da Xiaomi, e a família foi lançada com seu ambiente de treinamento por RL. O Ultrafast da OpenAI assenta sobre um modelo de ponta fechado que você só pode acessar por meio de uma API. Pagar um múltiplo de velocidade por pesos abertos é uma decisão reversível; você sempre pode servir o checkpoint por conta própria. Pagar isso por um modelo de ponta fechado não é.

Os dois múltiplos de preço, e o que eles compram
É aqui que o par deixa de ser simétrico, e os números são incomumente limpos dos dois lados, porque cada fornecedor precificou um múltiplo, e não um valor absoluto.
• GPT-6 Astra Ultrafast — US$ 60,00 por milhão de tokens de entrada, US$ 6,00 de entrada em cache, US$ 75,00 de gravação de cache e US$ 300,00 de saída, em comparação com os US$ 10,00 e US$ 50,00 do nível padrão. Uniformemente 6,00x em todas as colunas, subindo para US$ 120,00 e US$ 450,00 acima de 272.000 tokens de entrada. O nível padrão já está disponível em nosso catálogo pelo preço de tabela da OpenAI, que é a forma mais barata de alcançar o carro-chefe.
• Xiaomi MiMo v2.6 Pro Ultraspeed — $4,35 de entrada e $8,70 de saída por milhão de tokens, contra a faixa Pro padrão a $0,44 e $0,87. Isso é aproximadamente 9,9x na entrada e exatamente 10x na saída.
• As alegações de velocidade associadas a esses fatores multiplicadores — tanto a OpenAI quanto a NVIDIA limitam o Astra Ultrafast a "até 8x" mais rápido na geração de tokens do que o modo padrão Astra. O próprio material da Xiaomi afirma até 20x de velocidade de saída em relação ao serviço Pro padrão; listagens de catálogos de terceiros que descrevem o mesmo modelo no mesmo dia indicam cerca de 10x. Nenhuma medição que concilie esses dois números foi publicada.
• A razão entre múltiplo e velocidade — o preço 6x da OpenAI compra um teto declarado de 8x, então o nível está precificado abaixo de seu próprio melhor cenário. Dependendo de em qual número você acredita, o preço 10x da Xiaomi compra um teto declarado de 10x a 20x, então, no teto do fornecedor, a troca é favorável e, no valor mais baixo, é um empate absoluto.
Essa é a única diferença mais relevante para a decisão entre as duas, e é menor do que os preços anunciados sugerem. Por unidade de latência removida, segundo as próprias afirmações dos fornecedores, o Astra Ultrafast é o melhor dos dois acordos. Por token de trabalho, o Xiaomi UltraSpeed é cerca de quatorze vezes mais barato na entrada e trinta e quatro vezes mais barato na saída em relação às tarifas do Ultrafast, e entre duas e seis vezes mais barato que a faixa padrão da Astra — mas é um modelo diferente, e consideravelmente menos capaz, que é a troca que você está de fato fazendo. Os próprios cartões de modelo da Xiaomi para a família publicam fatos de arquitetura e treinamento, em vez de uma pontuação agregada independente, e nenhuma leitura do índice no qual o carro-chefe da OpenAI é medido foi publicada para ele.

O que os dois fornecedores escolheram divulgar
Os níveis de velocidade são mais um teste de transparência do que um teste de desempenho, porque aquilo de que você precisaria para verificar a alegação — uma distribuição de latência em uma concorrência declarada — está inteiramente nas mãos do fornecedor.
A publicação da NVIDIA de 1º de outubro é a declaração pública mais específica por trás do nível Astra, e o que ela contribui é atribuição, não medição: GPUs Blackwell, disponibilidade na API da OpenAI e para usuários elegíveis do ChatGPT Work e do Codex, e dois engenheiros da OpenAI descrevendo o loop. Philippe Tillet, líder de inferência da OpenAI, diz que o Astra pode "transformar esse conhecimento em kernels de alto desempenho que tornam o hardware da NVIDIA atraente"; Uday Ruddarraju, diretor de tecnologia de computação da OpenAI, diz que "usamos nossos modelos internos para otimizar a inferência em GPUs NVIDIA". Nenhuma das frases traz um valor de throughput para o nível. O 8x se sustenta por si só, sem qualificação além de "até".
A divulgação da Xiaomi seguiu a direção oposta — ela publicou a economia do treinamento, incluindo o ambiente e o código de aprendizado por reforço, e seus cartões de modelo trazem fatos de arquitetura, e não fatos de serving. O próprio nível UltraSpeed veio com uma alegação de 20x e nenhuma curva de latência publicada. O que significa que, na questão que um nível de velocidade existe para responder, ambos os fornecedores são igualmente pouco úteis, e o empate aí é a constatação honesta.
Escolhendo, se você realmente tiver que
Os dois níveis não se sobrepõem muito, pelo que a decisão não é tanto escolher um vencedor, mas sim reconhecer qual das duas compras é a sua.
Escolha o Astra Ultrafast se o trabalho for agêntico e a escolha do modelo já estiver feita. Um job de 40.000 tokens de saída passa de US$ 2,00 para US$ 12,00, e o nível é a única forma de obter qualidade de modelo de fronteira a uma velocidade maior. A própria documentação da OpenAI é explícita quanto à precondição operacional: recomenda WebSockets "especialmente para aplicações agênticas que fazem muitas chamadas de ferramentas em rápida sucessão", alertando que "sem uma conexão persistente, a sobrecarga de rede pode reduzir os ganhos de latência". Ative o nível e deixe o HTTP por requisição por baixo dele, e você terá pago 6x por uma fração do ganho de velocidade. Também vale a pena saber antes de integrá-lo: o nível oferece suporte apenas a residência de dados nos EUA e processamento global, sem endpoints de processamento regionais na UE ou em outras regiões fora dos EUA, e foi lançado com limites de taxa iniciais baixos, mesmo para contas que, de outra forma, se qualificariam para mais.
Escolha o MiMo v2.6 Pro Ultraspeed se o modelo for um insumo básico para um pipeline que você mesmo poderia hospedar. A licença MIT significa que a via Pro padrão não é seu único recurso — a auto-hospedagem é. A $4,35 e $8,70, é barato o suficiente para que um nível mais rápido valha a pena ser habilitado especulativamente em vez de justificado por tarefa, e seu contexto de 1M tokens corresponde ao do carro-chefe. Entenda, no entanto, o que você está comprando: uma taxa aproximadamente dez vezes maior por um modelo que fica atrás da fronteira, o que é a troca correta para extração de alto volume e a errada para qualquer coisa em que a qualidade da resposta condicione o fluxo de trabalho.
Nenhum dos níveis rápidos está no OrcaRouter, e vale a pena dizer isso em vez de insinuar. O que está no OrcaRouter é openai/gpt-6-astra — o carro-chefe do nível padrão, a $10,00 e $50,00 por milhão de tokens, com o degrau de contexto longo a $20,00 e $75,00, um contexto de 1.050.000 tokens e saída máxima de 128.000 tokens, através de um endpoint compatível com OpenAI. Nenhum modelo Xiaomi é hospedado aqui, então o MiMo-V2.6-Pro e sua via UltraSpeed são acessíveis apenas pela API da própria Xiaomi e por várias plataformas de terceiros. O uso prático de um endpoint com mais de 200 modelos nesta comparação não é o acesso aos níveis rápidos. É que, quando você quer saber se a via cara está justificando o seu múltiplo, você pode enviar o mesmo prompt para um modelo mais barato com a mesma credencial e a mesma chave, na requisição seguinte, e descobrir. Esse é o experimento mais barato disponível e é o que responde à pergunta — porque nenhum fornecedor publicou a curva de latência que permitiria responder sem medir.

A leitura honesta
Ambos os fornecedores enviaram uma tabela de preços de latência nas últimas três semanas, e nenhum dos dois enviou uma medição. Essa simetria é a história, e tem uma consequência prática: os únicos números com os quais você pode agir hoje são os preços, e eles são incomumente informativos porque ambos os lados precificaram um múltiplo redondo em vez de um número sob medida.
O nível rápido da OpenAI custa seis vezes a sua própria tarifa padrão e alega um teto de oito. O da Xiaomi custa dez vezes a sua própria tarifa padrão e alega um teto entre dez e vinte, dependendo de qual número você acredita. Lidos como aritmética sobre os próprios números dos fornecedores, os dois quase se equivalem: o nível da OpenAI compra um teto alegado que vale 1,33 unidades de velocidade por unidade de preço; o da Xiaomi compra entre 1,0 e 2,0 pelo mesmo cálculo — e a razão pela qual ambos podem ser defensáveis é que os dois níveis estão vendendo para compradores diferentes, que nunca considerarão seriamente a opção um do outro. Os preços também são a única parte de qualquer um dos negócios que é auditável hoje, já que uma tabela de preços é um fato publicado e uma alegação de latência não é.
