
GPT-5.6 Sol Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: Dois Níveis de Velocidade, Um Preço Ausente
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Dois fornecedores lançaram a mesma ideia de produto com três semanas de diferença, e a diferença entre eles é a melhor forma de ver o que cada um está realmente vendendo. O lado da Xiaomi chegou em 22 de setembro de 2026: Xiaomi MiMo v2.6 Pro Ultraspeed é o mesmo checkpoint de 1,02 trilhão de parâmetros que o MiMo-V2.6-Pro, servido mais rápido, a $4,35 por milhão de tokens de entrada e $8,70 por milhão de saída, contra $0,44 e $0,87 da via Pro padrão. O GPT-5.6 Sol Ultrafast do fornecedor é a mesma manobra aplicada ao GPT-5.6 Sol: pesos idênticos, até 750 tokens de saída por segundo, até 14× o nível padrão, rodando em hardware de escala de wafer da Cerebras — e nenhum preço publicado, seis semanas após o modo ter sido anunciado em 13 de agosto.
Coloque os dois lado a lado e a anomalia é imediata. A Xiaomi publicou uma tabela de preços antes de publicar a maioria dos benchmarks. A OpenAI publicou os benchmarks, o parceiro de hardware e os nomes dos clientes — e ainda não publicou um número com o qual você possa fazer orçamento. Um desses níveis pode ser comprado hoje. O outro é um valor em um esquema de API. Compará-los, portanto, tem menos a ver com qual é mais rápido e mais a ver com quanto vale um nível de velocidade quando um fornecedor informou o preço e o outro não.
O que cada um realmente é
Nenhum dos dois é um novo modelo. Essa é a premissa compartilhada, e vale a pena afirmá-la sem rodeios, porque ambos os lançamentos atraíram uma cobertura que tratou uma mudança de serving como um lançamento de capacidade.
O MiMo v2.6 Pro Ultraspeed é uma configuração de serving do carro-chefe da Xiaomi: o mesmo checkpoint de mistura esparsa de especialistas com 1,02 trilhão de parâmetros e 42B ativados por token, o mesmo contexto de 1M tokens, a mesma multimodalidade nativa em texto, imagem, vídeo e áudio, os mesmos pesos licenciados sob MIT nos repositórios públicos. O próprio material da Xiaomi afirma até 20 vezes a velocidade de saída do serviço Pro padrão com a mesma qualidade; listagens de catálogos de terceiros que descrevem o mesmo modelo no mesmo dia dizem cerca de 10 vezes. Ninguém publicou uma medição que concilie as duas.
GPT-5.6 Sol Ultrafast é uma configuração de serviço do carro-chefe da OpenAI: mesmo checkpoint, mesmo comportamento de raciocínio, mesma janela de contexto de 1.050.000 tokens, mesma saída máxima de 128K, mesmas respostas. A aceleração vem do hardware, e não do escalonamento — os pesos do modelo ficam em SRAM no próprio chip, no silício de escala de wafer da Cerebras, em vez de serem transportados entre a memória da GPU e o processamento — e é o primeiro produto da parceria de computação OpenAI–Cerebras de janeiro de 2026, noticiada em cerca de US$ 10 bilhões ao longo de três anos.
Portanto, o eixo honesto de comparação não é a inteligência. É o que o fornecedor escolheu mudar, quanto cobrou pela mudança e quanto da mudança permitiu que você verificasse.

As tabelas de tarifas, incluindo a em branco.
• MiMo v2.6 Pro Ultraspeed — $4,35 de entrada / $8,70 de saída por milhão de tokens, publicado pela Xiaomi.
• MiMo-V2.6-Pro standard — $0.44 / $0.87, publicado pelos catálogos comerciais da Xiaomi. Aproximadamente 9,9× na entrada e exatamente 10× na saída.
• GPT-5.6 Sol Ultrafast — nenhuma tabela de preços publicada até 27 de setembro de 2026. A página de preços da OpenAI ainda traz quatro abas — Standard, Batch, Flex, Fast — e o nível não está entre elas.
• GPT-5.6 Sol padrão — US$ 4,00 / US$ 20,00 por milhão, a tarifa promocional atual da OpenAI, com entrada em cache a US$ 0,40 e um escalão de contexto longo para US$ 8,00 / US$ 30,00 após aproximadamente 272K tokens de entrada.
• O único premium comparável que a OpenAI já precificou — Fast mode, a US$ 8,00 / US$ 40,00, exatamente o dobro da tarifa padrão para até cerca de 2,5× a velocidade de saída.
É justamente essa última linha que faz com que o espaço em branco importe. O nível de velocidade da Xiaomi custa dez vezes o da faixa padrão e alega de dez a vinte vezes a velocidade, o que é, no mínimo, internamente coerente como troca: você paga proporcionalmente mais por uma espera proporcionalmente menor, e a aposta é que o tempo de relógio é o produto. O nível de velocidade da OpenAI representa uma demanda maior por silício mais escasso do que o Fast mode, então, independentemente do que venha a custar, o precedente indica um prêmio, e não um desconto. Mas “o precedente indica um prêmio” não é um número, e, enquanto não existir um, o nível não pode ser comparado ao UltraSpeed em termos de preço de modo algum — apenas pelo fato de que a Xiaomi estava disposta a dizer seu número e a OpenAI não.
De onde vieram os números
Os dois níveis têm problemas probatórios opostos, e vale a pena nomear ambos em vez de dividir a diferença.
A alegação de velocidade da Xiaomi é vaga quanto à magnitude, mas está ancorada a um preço publicado. O 20× é um teto do fornecedor sob condições que a Xiaomi não especificou, o 10× é o que uma listagem de catálogo estava disposta a afirmar como típico, e o multiplicador real está em alguma faixa ampla que ninguém mediu publicamente em um nível de concorrência declarado. Em contrapartida, o preço é exato, os pesos são disponibilizados para download sob a licença MIT, e o relatório técnico e o ambiente de treinamento de aprendizado por reforço são públicos — você pode inspecionar o que a Xiaomi fez, você simplesmente ainda não pode verificar quão rápido ele roda.
A alegação de velocidade da OpenAI é específica em magnitude, mas não está ancorada em nada comprável. Até 750 tokens de saída por segundo, até 14× o padrão, declarado sem rodeios. Também é um número de taxa de transferência de tokens de saída, não um multiplicador fixo de ponta a ponta: o processamento de entrada e o raciocínio do próprio modelo não se comprimem nessa proporção, e é por isso que a empresa o classifica como máximo. Os benchmarks de apoio são relatados pelo fornecedor e, em um caso, entre fornecedores — uma execução de 2.500 perguntas do Humanity's Last Exam, relatada como concluída em 11 horas e 11 minutos, contra 78 horas e 27 minutos do Claude Fable 5, com precisão comparável. A cobertura independente do lançamento citou uma comparação mais estreita, de aproximadamente 11×, da velocidade de geração na mesma execução, enquanto os próprios números da Cerebras implicam cerca de 7× para o tempo total de teste. Três partes, três frações de uma mesma carga de trabalho, nenhuma reprodução por terceiros de qualquer uma delas. A Cerebras relata separadamente 5,6× de ponta a ponta no GDP-Val sem perda mensurável de qualidade, também não reproduzido.
Ambos os conjuntos de números são declarados pelos fornecedores. A diferença é que a imprecisão da Xiaomi diz respeito à velocidade, e a da OpenAI diz respeito ao custo; e, para quem está a elaborar um orçamento, o custo é o mais difícil de adivinhar.

O que aconteceu esta semana, e por que isso não fecha a lacuna
A razão pela qual esta comparação tem sequer um gancho noticioso é um commit, e não um anúncio. O valor ultrafast está presente no esquema público openai-openapi da OpenAI desde 13 de agosto de 2026 — o mesmo dia em que o modo foi anunciado —, com a descrição que o limita ao gpt-5.6-sol e o classifica como de acesso controlado. O commit que avançou esta semana é posterior e menor: em 25 de setembro de 2026, fe4f7a1 adicionou ultrafast a mais duas enumerações, o parâmetro service-tier ao nível do pedido e o campo de política service-tier do agente. Antes desse commit, essas duas listas continham auto, default, flex, priority, fast. Depois dele, existe uma entrada descrita como "Uses the ultrafast service tier."ultrafast às service_tier enumerações na sua openai-openapi especificação pública — o campo que o esquema descreve como "o nível de serviço usado para pedidos ao modelo", e o campo de política associado aos agentes. Antes da alteração, essa lista continha default, flex, priority, fast. Depois dela, existe uma entrada descrita como "Usa o nível de serviço ultrafast."
A distinção importa para qualquer pessoa que leia a cobertura. Este não é o nível que está sendo criado; é o nível que está sendo conectado ao campo com o qual um agente é configurado, o que significa que um cliente pode, eventualmente, ser escrito para ele sem nenhum novo endpoint. Uma reportagem do dia seguinte descreve um seletor Fast / Standard / Ultrafast chegando ao Responses API Playground, com acesso mais amplo esperado após a conferência DevDay da OpenAI. Não vimos o seletor e a OpenAI não publicou uma nota de lançamento, então essa parte é de fonte única. O que é verificável são as entradas de esquema adicionadas e a ausência contínua de uma tabela de preços seis semanas após o anúncio.
Enquanto isso, o nível da Xiaomi está disponível para compra há cinco dias e continua sendo o único dos dois que você pode colocar em uma fatura. Sua própria questão em aberto é diferente: se um prêmio de 10× se sustenta, ou se ele se comporta como a maioria dos preços de lançamento de um novo nível premium e migra para a faixa padrão quando a cobertura de lançamento termina. O Standard Pro a US$ 0,44 / US$ 0,87 é a âncora, e um nível que abre a dez vezes sua âncora raramente termina lá.
Escolher entre eles, dado que você provavelmente não consegue
O fato prático e incômodo é que, para a maioria dos leitores, trata-se de uma comparação entre um nível que você não pode comprar e outro que provavelmente não deveria comprar pelo preço de tabela. O GPT-5.6 Sol Ultrafast é uma prévia com lista de espera para clientes selecionados, ampliada conforme a capacidade cresce, sem data de disponibilidade geral e sem preço; o MiMo v2.6 Pro Ultraspeed está disponível, é caro e foi feito para um tipo específico de comprador.
O teste de carga de trabalho é o mesmo para ambos, e ele tem a ver com o formato do seu grafo de requisições, não com o tamanho do seu prompt. Uma única geração longa ganha muito menos do que o multiplicador anunciado, porque o processamento de entrada e o raciocínio não são acelerados na mesma proporção. Um loop de agente de quarenta etapas por trás de uma única ação visível ao usuário ganha algo muito mais próximo do número total, porque cada ida e volta é latência que uma pessoa fica esperando. Se o seu tráfego se parece com o segundo formato, os dois níveis são voltados para você; se ele se parece com o primeiro, a faixa padrão em qualquer um dos modelos sempre foi a escolha correta, e a faixa padrão do MiMo-V2.6-Pro a $0.44 / $0.87 é uma das maneiras mais baratas de chamar um modelo da classe de um trilhão de parâmetros em qualquer lugar.
O que nenhum dos dois níveis altera é que você está comprando latência, não qualidade. Se você comparar o UltraSpeed ou o Ultrafast com sua própria via padrão em prompts idênticos e obtiver respostas diferentes, isso é um achado que vale a pena reportar, não um recurso — nada na descrição de nenhum dos fornecedores afirma que os pesos mudaram.
É também o caso em que um roteador justifica o seu lugar, e especificamente para o nível que você não consegue obter. O GPT-5.6 Sol está disponível no OrcaRouter como openai/gpt-5.6-sol à tarifa do próprio provedor, com zero de markup sobre os tokens através do endpoint compatível com a OpenAI em api.orcarouter.ai/v1, então a via padrão para a qual você recorreria está a uma simples mudança de URL base de distância, e a mesma chave dá acesso a mais de 200 modelos. Isso importa porque a resposta honesta para "devo usar o Ultrafast" hoje é "você não pode, então decida o que vai carregar o tráfego interativo enquanto isso" — e a forma de comprar latência sem lista de espera é rotear as chamadas interativas para o modelo do catálogo que supere o seu padrão de qualidade com o menor tempo de relógio de parede, e deixar o trabalho noturno na via mais barata que passar. Quando o nível abrir, é esse o interruptor que você aciona. Registre claramente o que não hospedamos: nenhum modelo da Xiaomi está no OrcaRouter, então o MiMo v2.6 Pro Ultraspeed vem da própria API da Xiaomi e de várias plataformas de terceiros, e esta página não é uma rota para ele.

O que resolveria isso
Três medições, nenhuma das quais existe ainda. Uma tabela de preços Ultrafast publicada faria com que esta fosse a comparação que merece ser, em vez de uma comparação com uma lacuna. Uma distribuição de latência independente a um nível de simultaneidade declarado revelaria se o multiplicador real da Xiaomi fica mais perto de 10× ou de 20×, e se se mantém sob carga em vez de numa demonstração de fluxo único. E uma reprodução independente do conjunto de benchmarks de qualquer um dos fornecedores retiraria ambos os conjuntos de números da coluna das alegações.
Até lá, a interpretação defensável é restrita. A Xiaomi lançou um nível de velocidade com preço e velocidade vaga; a OpenAI lançou um nível de velocidade com velocidade específica e sem preço; ambos são o mesmo modelo que aquilo contra o que têm o preço definido, e nenhum dos dois foi medido de forma independente. Se você precisa da latência agora e a carga de trabalho é interativa, o UltraSpeed é real, comprável e tem preço exatamente para o comprador que ele quer. Se você precisa dela agora e a carga de trabalho não é, as faixas padrão em ambos os modelos são mais baratas, comprovadas e disponíveis hoje — e o nível sobre o qual todos estão discutindo ainda estará lá quando alguém publicar um número.
