Um cartão de título gerado com a manchete 'GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed', o subtítulo 'Mesma manobra, dois negócios diferentes', e dois cartões que dizem 'Múltiplo de preço: 6x vs 10x' e 'Alegamento de velocidade: 8x vs 20x', com um rodapé que diz 'Valores reportados pelos fornecedores, setembro-outubro de 2026'.
Guides & Insights

GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: Mesma Manobra, Duas Ofertas Diferentes

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois laboratórios realizaram a mesma manobra na mesma quinzena, e a parte interessante é que o fizeram com pressupostos opostos sobre aquilo que um cliente está a comprar. O GPT-6 Astra Ultrafast é o produto de topo do fornecedor, vendido através do nível de serviço Ultrafast — o modelo lançado a 3 de setembro de 2026, o nível amplamente disponível desde 29 de setembro de 2026, e mencionado na publicação da NVIDIA de 1 de outubro como a correr em GPUs Blackwell. O Xiaomi MiMo v2.6 Pro Ultraspeed é a versão da Xiaomi, lançada a 22 de setembro de 2026: o mesmo checkpoint de 1,02 biliões de parâmetros que o MiMo-V2.6-Pro, servido mais rapidamente, a cerca de dez vezes a tarifa padrão.

Um deles é a maneira mais rápida de chamar um modelo de fronteira. O outro é a camada rápida mais barata que existe. Eles não são concorrentes no sentido comum — você teria de escrever uma aplicação muito estranha para escolher entre um carro-chefe fechado de US$ 300 por milhão de tokens e um modelo de pesos abertos de US$ 8,70 por milhão de tokens. O que torna este par digno de uma página é que ambos são camadas de velocidade, e não modelos, então compará-los isola a única questão que uma camada de velocidade coloca: exatamente pelo que você está pagando esse múltiplo?

Ambos os níveis vendem a mesma não-coisa

Nenhum dos dois nomes é um ponto de verificação. Essa é a parte que a cobertura de lançamento tende a desfocar, então vale a pena ser mecânico quanto a isso.

• O que o nome indica — GPT-6 Astra Ultrafast é o GPT-6 Astra com o campo de requisição service_tier: "ultrafast" definido; o id do modelo na requisição ainda é gpt-6-astra. O Xiaomi MiMo v2.6 Pro Ultraspeed é o checkpoint MiMo-V2.6-Pro servido em um caminho mais rápido, com preço como item de linha próprio.

• O que muda — processamento em lote, decodificação especulativa, alocação de hardware, limites de concorrência, tratamento de conexões. Tudo entre os pesos e sua requisição HTTP, e nada dentro dos pesos.

• O que não muda — as respostas. O mesmo checkpoint, com as mesmas configurações, deve produzir o mesmo conteúdo a uma taxa diferente. Se duas faixas do mesmo modelo divergirem com a mesma entrada, isso é um defeito a ser reportado, não uma capacidade que você comprou.

• Por que isso importa para esta comparação — porque nenhum dos níveis reivindica uma melhoria de benchmark em relação à sua própria faixa padrão, toda a decisão de compra se resume ao preço por token contra os segundos economizados. O que significa que os dois acordos são decididos pela aritmética, não pela avaliação.

Há, porém, uma assimetria no enquadramento, e ela não está nos níveis. O UltraSpeed da Xiaomi assenta sobre um modelo com licença aberta — os pesos do MiMo-V2.6 carregam uma licença MIT, de acordo com os próprios model cards da Xiaomi, e a família foi lançada com seu ambiente de treinamento por RL. O Ultrafast da OpenAI assenta sobre um modelo de ponta fechado que você só pode acessar por meio de uma API. Pagar um múltiplo de velocidade por pesos abertos é uma decisão reversível; você sempre pode servir o checkpoint por conta própria. Pagar isso por um modelo de ponta fechado não é.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

Os dois múltiplos de preço, e o que eles compram

É aqui que o par deixa de ser simétrico, e os números são incomumente limpos dos dois lados, porque cada fornecedor precificou um múltiplo, e não um valor absoluto.

• GPT-6 Astra Ultrafast — US$ 60,00 por milhão de tokens de entrada, US$ 6,00 de entrada em cache, US$ 75,00 de gravação de cache e US$ 300,00 de saída, em comparação com os US$ 10,00 e US$ 50,00 do nível padrão. Uniformemente 6,00x em todas as colunas, subindo para US$ 120,00 e US$ 450,00 acima de 272.000 tokens de entrada. O nível padrão já está disponível em nosso catálogo pelo preço de tabela da OpenAI, que é a forma mais barata de alcançar o carro-chefe.

• Xiaomi MiMo v2.6 Pro Ultraspeed — $4,35 de entrada e $8,70 de saída por milhão de tokens, contra a faixa Pro padrão a $0,44 e $0,87. Isso é aproximadamente 9,9x na entrada e exatamente 10x na saída.

• As alegações de velocidade associadas a esses fatores multiplicadores — tanto a OpenAI quanto a NVIDIA limitam o Astra Ultrafast a "até 8x" mais rápido na geração de tokens do que o modo padrão Astra. O próprio material da Xiaomi afirma até 20x de velocidade de saída em relação ao serviço Pro padrão; listagens de catálogos de terceiros que descrevem o mesmo modelo no mesmo dia indicam cerca de 10x. Nenhuma medição que concilie esses dois números foi publicada.

• A razão entre múltiplo e velocidade — o preço 6x da OpenAI compra um teto declarado de 8x, então o nível está precificado abaixo de seu próprio melhor cenário. Dependendo de em qual número você acredita, o preço 10x da Xiaomi compra um teto declarado de 10x a 20x, então, no teto do fornecedor, a troca é favorável e, no valor mais baixo, é um empate absoluto.

Essa é a única diferença mais relevante para a decisão entre as duas, e é menor do que os preços anunciados sugerem. Por unidade de latência removida, segundo as próprias afirmações dos fornecedores, o Astra Ultrafast é o melhor dos dois acordos. Por token de trabalho, o Xiaomi UltraSpeed é cerca de quatorze vezes mais barato na entrada e trinta e quatro vezes mais barato na saída em relação às tarifas do Ultrafast, e entre duas e seis vezes mais barato que a faixa padrão da Astra — mas é um modelo diferente, e consideravelmente menos capaz, que é a troca que você está de fato fazendo. Os próprios cartões de modelo da Xiaomi para a família publicam fatos de arquitetura e treinamento, em vez de uma pontuação agregada independente, e nenhuma leitura do índice no qual o carro-chefe da OpenAI é medido foi publicada para ele.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

O que os dois fornecedores escolheram divulgar

Os níveis de velocidade são mais um teste de transparência do que um teste de desempenho, porque aquilo de que você precisaria para verificar a alegação — uma distribuição de latência em uma concorrência declarada — está inteiramente nas mãos do fornecedor.

A publicação da NVIDIA de 1º de outubro é a declaração pública mais específica por trás do nível Astra, e o que ela contribui é atribuição, não medição: GPUs Blackwell, disponibilidade na API da OpenAI e para usuários elegíveis do ChatGPT Work e do Codex, e dois engenheiros da OpenAI descrevendo o loop. Philippe Tillet, líder de inferência da OpenAI, diz que o Astra pode "transformar esse conhecimento em kernels de alto desempenho que tornam o hardware da NVIDIA atraente"; Uday Ruddarraju, diretor de tecnologia de computação da OpenAI, diz que "usamos nossos modelos internos para otimizar a inferência em GPUs NVIDIA". Nenhuma das frases traz um valor de throughput para o nível. O 8x se sustenta por si só, sem qualificação além de "até".

A divulgação da Xiaomi seguiu a direção oposta — ela publicou a economia do treinamento, incluindo o ambiente e o código de aprendizado por reforço, e seus cartões de modelo trazem fatos de arquitetura, e não fatos de serving. O próprio nível UltraSpeed veio com uma alegação de 20x e nenhuma curva de latência publicada. O que significa que, na questão que um nível de velocidade existe para responder, ambos os fornecedores são igualmente pouco úteis, e o empate aí é a constatação honesta.

Escolhendo, se você realmente tiver que

Os dois níveis não se sobrepõem muito, pelo que a decisão não é tanto escolher um vencedor, mas sim reconhecer qual das duas compras é a sua.

Escolha o Astra Ultrafast se o trabalho for agêntico e a escolha do modelo já estiver feita. Um job de 40.000 tokens de saída passa de US$ 2,00 para US$ 12,00, e o nível é a única forma de obter qualidade de modelo de fronteira a uma velocidade maior. A própria documentação da OpenAI é explícita quanto à precondição operacional: recomenda WebSockets "especialmente para aplicações agênticas que fazem muitas chamadas de ferramentas em rápida sucessão", alertando que "sem uma conexão persistente, a sobrecarga de rede pode reduzir os ganhos de latência". Ative o nível e deixe o HTTP por requisição por baixo dele, e você terá pago 6x por uma fração do ganho de velocidade. Também vale a pena saber antes de integrá-lo: o nível oferece suporte apenas a residência de dados nos EUA e processamento global, sem endpoints de processamento regionais na UE ou em outras regiões fora dos EUA, e foi lançado com limites de taxa iniciais baixos, mesmo para contas que, de outra forma, se qualificariam para mais.

Escolha o MiMo v2.6 Pro Ultraspeed se o modelo for um insumo básico para um pipeline que você mesmo poderia hospedar. A licença MIT significa que a via Pro padrão não é seu único recurso — a auto-hospedagem é. A $4,35 e $8,70, é barato o suficiente para que um nível mais rápido valha a pena ser habilitado especulativamente em vez de justificado por tarefa, e seu contexto de 1M tokens corresponde ao do carro-chefe. Entenda, no entanto, o que você está comprando: uma taxa aproximadamente dez vezes maior por um modelo que fica atrás da fronteira, o que é a troca correta para extração de alto volume e a errada para qualquer coisa em que a qualidade da resposta condicione o fluxo de trabalho.

Nenhum dos níveis rápidos está no OrcaRouter, e vale a pena dizer isso em vez de insinuar. O que está no OrcaRouter é openai/gpt-6-astra — o carro-chefe do nível padrão, a $10,00 e $50,00 por milhão de tokens, com o degrau de contexto longo a $20,00 e $75,00, um contexto de 1.050.000 tokens e saída máxima de 128.000 tokens, através de um endpoint compatível com OpenAI. Nenhum modelo Xiaomi é hospedado aqui, então o MiMo-V2.6-Pro e sua via UltraSpeed são acessíveis apenas pela API da própria Xiaomi e por várias plataformas de terceiros. O uso prático de um endpoint com mais de 200 modelos nesta comparação não é o acesso aos níveis rápidos. É que, quando você quer saber se a via cara está justificando o seu múltiplo, você pode enviar o mesmo prompt para um modelo mais barato com a mesma credencial e a mesma chave, na requisição seguinte, e descobrir. Esse é o experimento mais barato disponível e é o que responde à pergunta — porque nenhum fornecedor publicou a curva de latência que permitiria responder sem medir.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

A leitura honesta

Ambos os fornecedores enviaram uma tabela de preços de latência nas últimas três semanas, e nenhum dos dois enviou uma medição. Essa simetria é a história, e tem uma consequência prática: os únicos números com os quais você pode agir hoje são os preços, e eles são incomumente informativos porque ambos os lados precificaram um múltiplo redondo em vez de um número sob medida.

O nível rápido da OpenAI custa seis vezes a sua própria tarifa padrão e alega um teto de oito. O da Xiaomi custa dez vezes a sua própria tarifa padrão e alega um teto entre dez e vinte, dependendo de qual número você acredita. Lidos como aritmética sobre os próprios números dos fornecedores, os dois quase se equivalem: o nível da OpenAI compra um teto alegado que vale 1,33 unidades de velocidade por unidade de preço; o da Xiaomi compra entre 1,0 e 2,0 pelo mesmo cálculo — e a razão pela qual ambos podem ser defensáveis é que os dois níveis estão vendendo para compradores diferentes, que nunca considerarão seriamente a opção um do outro. Os preços também são a única parte de qualquer um dos negócios que é auditável hoje, já que uma tabela de preços é um fato publicado e uma alegação de latência não é.