Um cartão de título gerado para o nível Ultrafast com a manchete 'GPT-6 Astra Ultrafast', o subtítulo 'Seis vezes a taxa, em todas as linhas' e dois selos com os dizeres 'com preço e disponibilidade geral' e 'a via rápida não é um segundo modelo'.
Guides & Insights

GPT-6 Astra Ultrafast a 6x: O que a Tabela de Preços Publicada Realmente Custa para Você

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O GPT-6 Astra Ultrafast deixou de ser uma lista de espera em 29 de setembro de 2026. Agora é um nível de serviço adquirível com um preço publicado, e esse preço é exatamente seis vezes o padrão em cada linha. O modelo por baixo — GPT-6 Astra, o carro-chefe da empresa, lançado em 3 de setembro de 2026 — permanece inalterado; o que mudou no DevDay é que a via rápida sobre ele se tornou disponível em geral, e a documentação da API da empresa agora afirma claramente que o Ultrafast "está amplamente disponível para o GPT-6 Astra, com acesso de pré-visualização para o GPT-5.6 Sol." Pela primeira vez, você pode colocar este nível em uma linha de orçamento, e o número a colocar lá é $60,00 por milhão de tokens de entrada e $300,00 por milhão de tokens de saída, lidos na própria página de preços da empresa em 30 de setembro de 2026.

Isso torna esta uma pergunta diferente daquela que a cobertura de lançamento respondeu. O fato interessante desta semana não é que o nível exista — o preview foi anunciado em 13 de agosto de 2026 e noticiado à exaustão. O fato interessante é que um nível que não tinha preço agora tem um, e a aritmética que decorre disso é pouco lisonjeira de uma forma específica e quantificável. Seis vezes não é um prêmio que você absorve com um encolher de ombros; é um prêmio que você precisa recuperar em menos rodadas, e se você consegue é uma propriedade da sua carga de trabalho, e não do modelo.

As múltiplas retenções em cada linha, e essa é a primeira coisa a entender.

Lendo a página de preços da OpenAI em 30 de setembro de 2026, a coluna Ultrafast do GPT-6 Astra é um valor fixo de 6x em relação à coluna Standard, em vez de um acréscimo em algumas linhas e não em outras. Isso é importante, porque significa que você não consegue contornar isso otimizando, ao alterar o formato das suas solicitações.

• GPT-6 Astra, serviço Standard, solicitações de até 272.000 tokens de entrada — $10,00 de entrada, $1,00 de entrada em cache, $12,50 de gravação em cache, $50,00 de saída, por 1 milhão de tokens.

• GPT-6 Astra Ultrafast, mesmo limiar — $60,00 de entrada, $6,00 de entrada em cache, $75,00 de gravações em cache, $300,00 de saída, por 1 milhão de tokens. Exatamente 6x nas quatro linhas.

• Acima de 272.000 tokens de entrada, a solicitação inteira é reprecificada — Standard passa para $20,00 / $2,00 / $25,00 / $75,00, Ultrafast para $120,00 / $12,00 / $150,00 / $450,00. Continua 6x. A regra de contexto longo que a OpenAI documenta para o GPT-6 Astra é 2x nas taxas de entrada e de cache com 1,5x na saída sobre a solicitação inteira assim que se ultrapassa o limite, e aplica-se de forma idêntica aos dois níveis.

• Os outros níveis no mesmo cartão — Batch e Flex são 50% do Standard, e o modo Fast é 2x o Standard. Assim, a escada de multiplicadores para este modelo vai de 0,5x, 1x, 2x, 6x, sem nenhum degrau entre os dois últimos.

Não existe um equivalente Ultrafast do Batch. Batch e Flex são descontos que você compra com um agendamento mais flexível na via padrão; não existe uma versão lenta e barata da via rápida. Se você quer a velocidade, você paga o 6x em cada token que envia e em cada token que recebe de volta, e não há combinação de entrada em cache e entrada nova que melhore a proporção.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

O que uma chamada realmente custa

A abstração torna-se mais fácil de raciocinar com duas solicitações concretas. Ambas usam as tarifas por milhão publicadas pela OpenAI; a aritmética é nossa.

Uma chamada única com 20.000 tokens de entrada e uma resposta de 2.000 tokens custa US$ 0,30 no Standard — 20.000 tokens a US$ 10 por milhão dá US$ 0,20, mais 2.000 a US$ 50 por milhão dá US$ 0,10. A mesma chamada no Ultrafast custa US$ 1,80. Exatamente seis vezes, como anunciado.

Agora, o caso que de fato descreve um loop de agente: uma conversa de 200.000 tokens em que 190.000 tokens são um prefixo em cache e apenas 10.000 são novos, gerando um passo de 1.000 tokens. O Standard cobra US$ 0,19 pela leitura em cache, US$ 0,10 pela entrada nova e US$ 0,05 pela saída — US$ 0,34 por passo. O Ultrafast cobra US$ 1,14, US$ 0,60 e US$ 0,30 — US$ 2,04 por passo. Novamente 6x, mas veja o que a composição fez: o cache é a alavanca de custo mais eficaz neste modelo e ainda é exatamente 6x mais barato na faixa standard, então um agente com cache pesado não ganha nada proporcionalmente com o nível rápido, e isso também não ameniza o prêmio.

A consequência é a parte que vale a pena internalizar. Como o múltiplo é fixo, o ponto de equilíbrio não tem nada a ver com a sua mistura de tokens. Ele depende inteiramente do número de turnos. O Ultrafast se paga em uma carga de trabalho somente quando executá-lo reduz o número de turnos cobrados em aproximadamente um fator de seis — seja colapsando um loop de retentativas em uma única passagem, seja substituindo uma sequência de chamadas curtas de esclarecimento por uma sessão interativa mais rápida. Se a sua carga de trabalho emite o mesmo número de turnos de antes, apenas mais cedo, você está comprando latência a exatamente 6x e nada mais.

Limites de taxa e geografia são os tetos não anunciados

Duas restrições ficam fora do preço e são fáceis de passar despercebidas quando se lê uma tabela de tarifas.

O primeiro é a taxa de transferência. O Ultrafast para GPT-6 Astra está disponível para todos os usuários da API, mas inicialmente com limites de taxa baixos: a OpenAI documenta 500.000 tokens por minuto para os níveis 1 a 3, 1.000.000 para o nível 4 e 5.000.000 para o nível 5. Para um nível vendido com base na velocidade, isso é um teto real — um contexto de agente de 200.000 tokens a meio milhão de tokens por minuto é duas requisições e meia por minuto em um nível baixo. A própria orientação da OpenAI aponta para o mesmo problema pelo outro lado, recomendando fortemente WebSockets justamente porque a sobrecarga de rede por requisição pode consumir a latência pela qual o nível está pagando.

O segundo ponto é a residência de dados. A Ultrafast oferece suporte apenas à residência de dados nos EUA e ao processamento global. Ela não oferece suporte a endpoints de processamento regionais da UE ou de outras regiões fora dos EUA. Se a sua implantação depende de um endpoint de residência na UE para o GPT-6 Astra, este nível não está disponível para você a nenhum preço, e isso é um limite rígido, e não uma escolha de configuração. Observe também que os endpoints de residência têm um acréscimo de 10% para modelos lançados em ou após 5 de março de 2026, como é o caso do GPT-6 Astra.

A manchete de velocidade caiu de 14x para 8x

Vale a pena afirmar isso com cuidado, porque o número que circula na maioria das coberturas está desatualizado. A página de documentação do Ultrafast da OpenAI, conforme publicada hoje, traz a frase "nosso nível de serviço de API mais rápido, com velocidades até 8x mais rápidas que o modo Standard". O anúncio de prévia de 13 de agosto de 2026 para o GPT-5.6 Sol prometia "até 14x mais rápido que o processamento Standard" e até 750 tokens de saída por segundo em hardware Cerebras.

Essas não são a mesma afirmação, e a diferença não é tanto uma retratação quanto uma mudança de assunto. O número de 14x foi medido no GPT-5.6 Sol numa pré-visualização limitada; o número de 8x é o que a OpenAI publica para o nível atual, com o GPT-6 Astra como seu modelo amplamente disponível. Quem fizer orçamentos com base em 14x no Astra está orçamentando com base num número que a OpenAI não publicou para o Astra. A leitura honesta é que ambos os números são tetos relatados pelo fornecedor para a vazão de saída, que nenhum deles é uma garantia de latência para sua carga de trabalho, e que o tempo de ponta a ponta ainda inclui processamento de entrada, chamadas de ferramentas e sua própria orquestração. Trate 8x como o número de planejamento e trate qualquer coisa melhor como um bônus que você verifica no seu próprio tráfego, em vez de presumir.

O que fazer com isto na segunda-feira?

A regra de decisão que resulta da aritmética é mais restrita do que o marketing sugere, e vale a pena registrá-la antes que alguém proponha habilitar o Ultrafast em todo um parque.

Ative-o onde a carga de trabalho é limitada por latência e interativa, e onde um humano está esperando. Triagem de incidentes, um escalonamento de suporte ao vivo, um loop de pesquisa onde um analista está iterando dentro de uma sessão — esses são os casos em que o valor da resposta que chega agora em vez de em quatro minutos não é proporcional ao preço do token, e onde uma fatura 6x em um pequeno número de turnos é trivialmente menor que o custo da pessoa esperando. Os próprios exemplos da OpenAI no anúncio de prévia eram exatamente dessa forma: ler logs enquanto uma interrupção se desenrola, transformar um loop de pesquisa noturno em uma sessão de trabalho.

Deixe-o desativado quando a carga de trabalho for limitada por throughput ou tiver formato de lote. Uma reindexação noturna, uma passagem de classificação em massa, um relatório agendado, um backfill — nenhuma delas se importa com latência de tempo decorrido, todas são dominadas pela contagem de tokens, e todas têm uma opção de 0,5x bem ali na mesma tabela de preços em Batch e Flex. Pagar 12x o preço do lote para terminar mais rápido é a forma mais clara de desperdiçar dinheiro nesta tabela.

O meio incômodo é o loop de codificação agêntica, e é aí que a aritmética da contagem de turnos decide. Se a velocidade realmente elimina novas tentativas — se a primeira passagem do modelo numa alteração de vários arquivos acerta com mais frequência porque não está lutando contra um timeout — então o Ultrafast pode ser mais barato por tarefa concluída, apesar de ser 6x por token. Essa é uma afirmação mensurável sobre seus próprios traces, não uma afirmação geral, e a medição é barata: conte os turnos cobrados por tarefa concluída em ambos os níveis e multiplique pela tarifa. Se a proporção não estiver perto de seis, o nível rápido é uma compra de latência e deve ser justificado como tal.

O nível tem preço definido; as rotas ao seu redor não são a mesma questão

Uma observação prática sobre como lidar com isso. O GPT-6 Astra no serviço padrão já está disponível no OrcaRouter como openai/gpt-6-astra à tarifa do próprio provedor — US$ 10,00 de entrada e US$ 50,00 de saída por milhão de tokens, com a faixa de contexto longo de 272K a US$ 20,00 / US$ 75,00 — servido com 0% de markup, o que significa que o preço de tabela do provedor é repassado e qualquer mudança de preço do fornecedor chega à sua fatura no mesmo dia em que chega à tabela de preços da OpenAI, em vez de só na sua próxima renovação de contrato. A mesma chave dá acesso a mais de 200 modelos, de modo que o nível padrão pode ficar atrás do mesmo cliente que o nível barato ou o modelo de um concorrente, sem uma segunda integração.

O que não fazemos é atender o nível Ultrafast. É um flag de nível de serviço em uma conta OpenAI, e não um modelo roteável separadamente — você define service_tier: "ultrafast" em uma solicitação para gpt-6-astra — e ele é cobrado pela OpenAI à sua própria conta pelas tarifas acima. Se você habilitá-lo, ele fica na sua integração direta com a OpenAI, e o OrcaRouter é o lugar certo para o tráfego de nível padrão que você roteia ao lado dele. Dizer isso claramente é mais útil do que insinuar uma capacidade que não temos.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

A regra de decisão, em um parágrafo

Seis vezes é o preço de um nível, não o preço de um modelo: os pesos, a janela de contexto de 1.050.000 tokens, o teto de saída de 128.000 tokens e as respostas são todos idênticos ao GPT-6 Astra padrão. O que você está comprando é uma taxa de transferência de saída até 8x mais rápida, numa tabela de preços que é 6x em todas as linhas, sujeita a limites de taxa iniciais baixos e a uma restrição de residência nos EUA que exclui totalmente a UE. Essa troca é obviamente correta para um humano à espera de uma resposta, obviamente errada para uma tarefa em lote agendada que tem uma via a metade do preço disponível, e genuinamente indefinida para ciclos agênticos, onde a resposta depende de saber se a velocidade elimina turnos. Meça a contagem de turnos nos seus próprios traces antes de se comprometer, e encaminhe o resto ao preço de tabela.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente