
GPT-6 Astra Ultrafast vs GPT-6 Astra: Mesmo checkpoint, seis vezes a taxa
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 208 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Esta é a rara comparação em que os dois lados são a mesma coisa. GPT-6 Astra Ultrafast não é um modelo; é um nível de serviço aplicado ao GPT-6 Astra, o carro-chefe da empresa lançado em 3 de setembro de 2026, e a documentação da empresa declara o mecanismo sem rodeios: você define model como gpt-6-astra e adiciona service_tier: "ultrafast". Não há ID de modelo separado, nem checkpoint separado, nem janela de contexto separada. Portanto, uma página intitulada GPT-6 Astra Ultrafast vs GPT-6 Astra não pode ser um argumento de benchmark, porque não há um segundo conjunto de pesos para comparar — e fingir o contrário seria a maneira mais fácil de escrever um artigo enganoso esta semana.
O que há para comparar é mais restrito e mais útil do que uma tabela de especificações: uma tabela de tarifas contra outra, uma postura de disponibilidade contra outra, e uma diferença de tempo real cuja magnitude a OpenAI declara como "até 8x". Como o Ultrafast for GPT-6 Astra se tornou disponível em geral em 29 de setembro de 2026, ambos os lados desta comparação finalmente têm preços associados, o que não era verdade em agosto, quando o nível era apenas de pré-visualização. Isso significa que a pergunta mudou de forma. Já não é "este nível é real", mas sim "a uma tarifa seis vezes maior, o que precisa ser verdade sobre minha carga de trabalho para que a via rápida seja a compra correta".
As colunas que diferem, e a que não difere.
Colocando as duas faixas lado a lado, quase todas as linhas são idênticas por construção. As linhas que não são idênticas são o único conteúdo que este artigo tem.
• O checkpoint — idêntico. O GPT-6 Astra Ultrafast executa os pesos do GPT-6 Astra padrão. O mesmo comportamento de amostragem, o mesmo comportamento de raciocínio, a mesma resposta ao mesmo prompt com a mesma definição de esforço.
• Contexto, saída e entradas — idênticos. Uma janela de entrada de 1.050.000 tokens e um teto de saída de 128.000 tokens em ambos os lados, entrada de texto, imagem e arquivo, saída de texto, e um corte de conhecimento em 30 de abril de 2026 independentemente do nível.
• Controle de raciocínio — idêntico. O esforço opera em low, medium, high, xhigh e max nos dois lados. O nível altera a velocidade com que os tokens chegam, não o quão intensamente o modelo pensa, então uma requisição Ultrafast com esforço xhigh ainda é uma requisição com esforço xhigh.
• Tabela de preços — diferente, e é toda a decisão. O Standard cobra $10.00 pela entrada, $1.00 pela entrada em cache, $12.50 pelas gravações em cache e $50.00 pela saída por 1M de tokens até 272,000 tokens de entrada; o Ultrafast cobra $60.00 / $6.00 / $75.00 / $300.00. Acima de 272K, o pedido inteiro é reprecificado para $20.00 / $2.00 / $25.00 / $75.00 no Standard e $120.00 / $12.00 / $150.00 / $450.00 no Ultrafast. Seis, em todas as quatro linhas, nas faixas de contexto.
• Acesso — diferente. O Standard é a via padrão, que pode ser chamada por qualquer pessoa com uma chave de API. O Ultrafast estava em lista de espera e agora está disponível para todos os usuários de API, mas inicialmente com limites de taxa baixos: a OpenAI documenta 500.000 tokens por minuto nos níveis 1 a 3 da API, 1.000.000 no nível 4 e 5.000.000 no nível 5.
• Geografia — diferente em apenas uma direção, porque a restrição está vinculada ao nível. O Ultrafast suporta apenas residência de dados nos EUA e processamento global, e não oferece suporte a endpoints de processamento regionais da UE ou de outras regiões fora dos EUA; a faixa padrão não tem restrição equivalente.
• Taxa de transferência — diferente, e declarada como um teto em vez de uma promessa. A documentação do Ultrafast da OpenAI descreve o nível como oferecendo "até 8x mais velocidade que o modo Standard".
• Benchmarks — não é uma linha. Não há nada para colocar nela. Onde uma página de comparação entre dois modelos traria uma tabela de índices, esta traz os mesmos números dos dois lados, o que é justamente o ponto, e não uma lacuna nos dados.

O crossover, funcionou corretamente
Como o multiplicador é um 6x fixo, a decisão se reduz a uma única desigualdade, e vale a pena escrevê-la por extenso em vez de fazer rodeios. Ultrafast é a compra certa quando o valor de terminar mais cedo supera seis vezes a conta de tokens. Todo o resto é comentário.
Considere um caso concreto: uma passagem agêntica que ingere um contexto de repositório de 100.000 tokens e produz um patch de 5.000 tokens, com o conteúdo do repositório armazenado em cache entre tentativas. No serviço padrão, a leitura em cache é cobrada a US$ 0,10, a entrada nova a US$ 0,10 e a saída a US$ 0,25 — US$ 0,45 por tentativa. No Ultrafast, a mesma tentativa é cobrada a US$ 0,60, US$ 0,60 e US$ 1,50 — US$ 2,70. A diferença é de US$ 2,25 por tentativa. Se a velocidade não fizer nada além de fazer cada tentativa terminar mais rápido e o número de tentativas não mudar, você pagou US$ 2,25 por tentativa por latência, e a única justificativa é o valor do tempo de espera.
Agora deixe a velocidade fazer o trabalho. Se a via mais rápida significa que a primeira passagem do modelo dá certo com mais frequência porque não está lutando contra um tempo de ida e volta lento, e o número de passagens cai de três para um, o padrão custa US$ 1,35 pela tarefa, contra os US$ 2,70 do Ultrafast. Ainda mais caro — mas apenas 2x, não 6x, e agora a questão é se dois dólares valem a diferença entre um ciclo interativo e uma sequência deles.
Essa é a aritmética que as equipes ignoram, e a tentação de ignorá-la corre nos dois sentidos. Um 6x fixo em cada linha faz o nível parecer uniformemente caro, o que é errado quando ele elimina turnos. E a manchete "até 8x" faz com que pareça uniformemente barato, o que é errado quando não o faz. O número que decide isso é turnos faturados por tarefa concluída, medidos nos seus próprios rastreamentos, multiplicados pela tarifa. Se essa proporção não estiver se aproximando de seis, o Ultrafast é uma compra de latência e deve ser aprovado como tal, com um humano nomeado do outro lado da espera.
O que "até 8x" cobre e não cobre
A alegação de velocidade publicada é um teto de vazão de saída, e confundir vazão com latência é o erro mais comum cometido em relação a esse nível.
O throughput é a quantidade de tokens por segundo quando a geração está em execução. A latência é o tempo entre enviar uma solicitação e receber a resposta. O Ultrafast melhora o primeiro. A própria documentação da OpenAI aponta o segundo como um problema separado, recomendando fortemente WebSockets para o Ultrafast justamente porque a sobrecarga de rede por solicitação pode corroer os ganhos de latência — um aviso que seria desnecessário se o nível tornasse as idas e voltas gratuitas. Mais dois componentes do tempo total ficam totalmente fora do nível: o tempo que sua própria orquestração gasta entre chamadas e o tempo que uma chamada de ferramenta leva nos servidores de outra pessoa. Para uma única geração longa, o throughput é a maior parte da história. Para um loop de agente com vinte etapas, ele é uma fração dela, e essa fração é exatamente o motivo pelo qual a aritmética de contagem de turnos acima importa mais do que a manchete de 8x.

Para calibração, veja o nível abaixo. O modo Fast, renomeado de Priority processing em 30 de julho de 2026, tem preço de 2x o padrão e é documentado como até 2,5x mais rápido. O Ultrafast tem preço de 6x o padrão e é documentado como até 8x mais rápido. Portanto, o passo de Fast para Ultrafast é 3x o dinheiro por cerca de 3,2x a velocidade — uma troca quase linear. O prêmio sobre o padrão não é superlinear; é simplesmente grande, e está disponível apenas nesta única família de modelos. A tabela de preços do Ultrafast da OpenAI tem uma única linha, e é o gpt-6-astra, o que significa que o nível é uma capacidade do atual carro-chefe, e não uma escolha geral de nível de serviço em toda a linha.
Duas cargas de trabalho, um modelo
A forma mais limpa de conduzir essa comparação é parar de perguntar se o Ultrafast é melhor e começar a perguntar qual das duas formas a sua requisição assume.
O primeiro perfil é uma pessoa à espera. Triagem de incidentes enquanto uma indisponibilidade se desenrola, uma escalada de suporte com um cliente ao telefone, um analista a iterar numa única sessão — estas são cargas de trabalho em que a resposta chegar em vinte segundos em vez de dois minutos muda o que a pessoa pode fazer a seguir, e em que a fatura total de tokens é pequena porque o número de turnos é pequeno. Uma taxa de 6x num punhado de turnos é um erro de arredondamento comparado ao custo da pessoa que está ali sentada. É aqui que o nível está obviamente correto, e é o perfil que o próprio material de pré-visualização da OpenAI descreveu.
A segunda forma é uma máquina em uma programação. Uma reindexação noturna, uma passagem de classificação em massa, um relatório que precisa estar pronto pela manhã, um preenchimento retroativo. Nenhum deles consegue perceber latência. Todos eles são dominados pela contagem de tokens. E todos eles têm uma opção melhor na mesma tabela de preços: Batch and Flex, com preço de 50% do padrão, ou US$ 5,00 de entrada e US$ 25,00 de saída por milhão para o GPT-6 Astra até 272K. Pagar 6x para fazer um trabalho terminar mais cedo que ninguém está acompanhando, quando existe uma faixa pela metade do preço, é o erro mais caro disponível nesta tabela.
A terceira forma é a ambígua, e é a que a maioria das equipes de engenharia realmente tem: o loop agêntico. É aí que a aritmética do cruzamento decide, em vez de uma regra de bolso, e onde a medição é barata o suficiente para que não haja desculpa para adivinhar — instrumente a contagem de turnos por tarefa concluída nas duas faixas, multiplique pela taxa e compare os totais. As respostas do GPT-6 Astra são as mesmas dos dois lados, então qualquer diferença no número de turnos é uma diferença no tempo que o modelo levou, não no que ele produziu, o que faz deste um experimento limpo, e não confundido.
Comprando a faixa padrão
Vale a pena separar duas coisas que a expressão "Ultrafast pricing" tende a obscurecer: o preço do nível e o preço do modelo. O GPT-6 Astra padrão é um modelo roteável e, no OrcaRouter, está ativo como openai/gpt-6-astra à tarifa do próprio provedor — US$ 10,00 de entrada, US$ 1,00 de entrada em cache e US$ 50,00 de saída por milhão de tokens, com o passo documentado de contexto longo para US$ 20,00 / US$ 2,00 / US$ 75,00 acima de 272.000 tokens de entrada. Ele é servido com 0% de markup, o que significa que o preço de tabela do provedor passa sem modificação e uma mudança de tarifa do fornecedor chega à sua fatura no mesmo dia, em vez de só na próxima renovação de contrato, e a mesma chave dá acesso a mais de 200 outros modelos, de modo que uma avaliação que começa com o Astra pode se estender a um concorrente sem uma segunda integração.
O próprio nível Ultrafast não é algo que nós roteamos, e a razão é estrutural, não comercial: ele não é um modelo. É um sinalizador de nível de serviço com acesso controlado que a OpenAI aplica ao seu próprio ID de modelo e cobra à sua conta, habilitado por requisição pelo chamador. Assim, a separação é clara — se você ativar o Ultrafast, ele fica na sua integração direta com a OpenAI, e o tráfego de nível padrão que você executa ao lado dele é exatamente o tipo de coisa para a qual serve um gateway de passagem. Enunciar essa fronteira com precisão é mais útil do que um parágrafo que dê a entender que a via rápida está disponível por nosso intermédio.

A linha inferior, que é mais curta que a página
GPT-6 Astra Ultrafast e GPT-6 Astra são um único modelo com duas tabelas de preços. O nível muda quando você obtém a resposta, não o que ela é — os mesmos pesos, a mesma janela de 1.050.000 tokens, o mesmo teto de saída de 128.000 tokens, os mesmos controles de esforço e o mesmo corte de conhecimento, com até 8x a taxa de transferência de saída por exatamente 6x o preço em cada linha, sujeito a limites de taxa iniciais baixos e uma restrição de residência apenas nos EUA que a via padrão não possui. Compre-o onde uma pessoa está esperando ou onde a velocidade comprovadamente elimina turnos cobrados; pule-o onde o trabalho roda em um cronograma e Batch ou Flex está disponível pela metade da tarifa padrão; e meça a contagem de turnos em vez de presumi-la. A única coisa que esta comparação não pode lhe dizer é qual modelo é melhor, porque sempre houve apenas um modelo nela.
