
GPT-6 Astra Ultrafast a 6x: O que a Tabela de Preços Publicada Realmente Custa para Você
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 210 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O GPT-6 Astra Ultrafast deixou de ser uma lista de espera em 29 de setembro de 2026. Agora é um nível de serviço adquirível com um preço publicado, e esse preço é exatamente seis vezes o padrão em cada linha. O modelo por baixo — GPT-6 Astra, o carro-chefe da empresa, lançado em 3 de setembro de 2026 — permanece inalterado; o que mudou no DevDay é que a via rápida sobre ele se tornou disponível em geral, e a documentação da API da empresa agora afirma claramente que o Ultrafast "está amplamente disponível para o GPT-6 Astra, com acesso de pré-visualização para o GPT-5.6 Sol." Pela primeira vez, você pode colocar este nível em uma linha de orçamento, e o número a colocar lá é $60,00 por milhão de tokens de entrada e $300,00 por milhão de tokens de saída, lidos na própria página de preços da empresa em 30 de setembro de 2026.
Isso torna esta uma pergunta diferente daquela que a cobertura de lançamento respondeu. O fato interessante desta semana não é que o nível exista — o preview foi anunciado em 13 de agosto de 2026 e noticiado à exaustão. O fato interessante é que um nível que não tinha preço agora tem um, e a aritmética que decorre disso é pouco lisonjeira de uma forma específica e quantificável. Seis vezes não é um prêmio que você absorve com um encolher de ombros; é um prêmio que você precisa recuperar em menos rodadas, e se você consegue é uma propriedade da sua carga de trabalho, e não do modelo.
As múltiplas retenções em cada linha, e essa é a primeira coisa a entender.
Lendo a página de preços da OpenAI em 30 de setembro de 2026, a coluna Ultrafast do GPT-6 Astra é um valor fixo de 6x em relação à coluna Standard, em vez de um acréscimo em algumas linhas e não em outras. Isso é importante, porque significa que você não consegue contornar isso otimizando, ao alterar o formato das suas solicitações.
• GPT-6 Astra, serviço Standard, solicitações de até 272.000 tokens de entrada — $10,00 de entrada, $1,00 de entrada em cache, $12,50 de gravação em cache, $50,00 de saída, por 1 milhão de tokens.
• GPT-6 Astra Ultrafast, mesmo limiar — $60,00 de entrada, $6,00 de entrada em cache, $75,00 de gravações em cache, $300,00 de saída, por 1 milhão de tokens. Exatamente 6x nas quatro linhas.
• Acima de 272.000 tokens de entrada, a solicitação inteira é reprecificada — Standard passa para $20,00 / $2,00 / $25,00 / $75,00, Ultrafast para $120,00 / $12,00 / $150,00 / $450,00. Continua 6x. A regra de contexto longo que a OpenAI documenta para o GPT-6 Astra é 2x nas taxas de entrada e de cache com 1,5x na saída sobre a solicitação inteira assim que se ultrapassa o limite, e aplica-se de forma idêntica aos dois níveis.
• Os outros níveis no mesmo cartão — Batch e Flex são 50% do Standard, e o modo Fast é 2x o Standard. Assim, a escada de multiplicadores para este modelo vai de 0,5x, 1x, 2x, 6x, sem nenhum degrau entre os dois últimos.
Não existe um equivalente Ultrafast do Batch. Batch e Flex são descontos que você compra com um agendamento mais flexível na via padrão; não existe uma versão lenta e barata da via rápida. Se você quer a velocidade, você paga o 6x em cada token que envia e em cada token que recebe de volta, e não há combinação de entrada em cache e entrada nova que melhore a proporção.

O que uma chamada realmente custa
A abstração torna-se mais fácil de raciocinar com duas solicitações concretas. Ambas usam as tarifas por milhão publicadas pela OpenAI; a aritmética é nossa.
Uma chamada única com 20.000 tokens de entrada e uma resposta de 2.000 tokens custa US$ 0,30 no Standard — 20.000 tokens a US$ 10 por milhão dá US$ 0,20, mais 2.000 a US$ 50 por milhão dá US$ 0,10. A mesma chamada no Ultrafast custa US$ 1,80. Exatamente seis vezes, como anunciado.
Agora, o caso que de fato descreve um loop de agente: uma conversa de 200.000 tokens em que 190.000 tokens são um prefixo em cache e apenas 10.000 são novos, gerando um passo de 1.000 tokens. O Standard cobra US$ 0,19 pela leitura em cache, US$ 0,10 pela entrada nova e US$ 0,05 pela saída — US$ 0,34 por passo. O Ultrafast cobra US$ 1,14, US$ 0,60 e US$ 0,30 — US$ 2,04 por passo. Novamente 6x, mas veja o que a composição fez: o cache é a alavanca de custo mais eficaz neste modelo e ainda é exatamente 6x mais barato na faixa standard, então um agente com cache pesado não ganha nada proporcionalmente com o nível rápido, e isso também não ameniza o prêmio.
A consequência é a parte que vale a pena internalizar. Como o múltiplo é fixo, o ponto de equilíbrio não tem nada a ver com a sua mistura de tokens. Ele depende inteiramente do número de turnos. O Ultrafast se paga em uma carga de trabalho somente quando executá-lo reduz o número de turnos cobrados em aproximadamente um fator de seis — seja colapsando um loop de retentativas em uma única passagem, seja substituindo uma sequência de chamadas curtas de esclarecimento por uma sessão interativa mais rápida. Se a sua carga de trabalho emite o mesmo número de turnos de antes, apenas mais cedo, você está comprando latência a exatamente 6x e nada mais.
Limites de taxa e geografia são os tetos não anunciados
Duas restrições ficam fora do preço e são fáceis de passar despercebidas quando se lê uma tabela de tarifas.
O primeiro é a taxa de transferência. O Ultrafast para GPT-6 Astra está disponível para todos os usuários da API, mas inicialmente com limites de taxa baixos: a OpenAI documenta 500.000 tokens por minuto para os níveis 1 a 3, 1.000.000 para o nível 4 e 5.000.000 para o nível 5. Para um nível vendido com base na velocidade, isso é um teto real — um contexto de agente de 200.000 tokens a meio milhão de tokens por minuto é duas requisições e meia por minuto em um nível baixo. A própria orientação da OpenAI aponta para o mesmo problema pelo outro lado, recomendando fortemente WebSockets justamente porque a sobrecarga de rede por requisição pode consumir a latência pela qual o nível está pagando.
O segundo ponto é a residência de dados. A Ultrafast oferece suporte apenas à residência de dados nos EUA e ao processamento global. Ela não oferece suporte a endpoints de processamento regionais da UE ou de outras regiões fora dos EUA. Se a sua implantação depende de um endpoint de residência na UE para o GPT-6 Astra, este nível não está disponível para você a nenhum preço, e isso é um limite rígido, e não uma escolha de configuração. Observe também que os endpoints de residência têm um acréscimo de 10% para modelos lançados em ou após 5 de março de 2026, como é o caso do GPT-6 Astra.
A manchete de velocidade caiu de 14x para 8x
Vale a pena afirmar isso com cuidado, porque o número que circula na maioria das coberturas está desatualizado. A página de documentação do Ultrafast da OpenAI, conforme publicada hoje, traz a frase "nosso nível de serviço de API mais rápido, com velocidades até 8x mais rápidas que o modo Standard". O anúncio de prévia de 13 de agosto de 2026 para o GPT-5.6 Sol prometia "até 14x mais rápido que o processamento Standard" e até 750 tokens de saída por segundo em hardware Cerebras.
Essas não são a mesma afirmação, e a diferença não é tanto uma retratação quanto uma mudança de assunto. O número de 14x foi medido no GPT-5.6 Sol numa pré-visualização limitada; o número de 8x é o que a OpenAI publica para o nível atual, com o GPT-6 Astra como seu modelo amplamente disponível. Quem fizer orçamentos com base em 14x no Astra está orçamentando com base num número que a OpenAI não publicou para o Astra. A leitura honesta é que ambos os números são tetos relatados pelo fornecedor para a vazão de saída, que nenhum deles é uma garantia de latência para sua carga de trabalho, e que o tempo de ponta a ponta ainda inclui processamento de entrada, chamadas de ferramentas e sua própria orquestração. Trate 8x como o número de planejamento e trate qualquer coisa melhor como um bônus que você verifica no seu próprio tráfego, em vez de presumir.
O que fazer com isto na segunda-feira?
A regra de decisão que resulta da aritmética é mais restrita do que o marketing sugere, e vale a pena registrá-la antes que alguém proponha habilitar o Ultrafast em todo um parque.
Ative-o onde a carga de trabalho é limitada por latência e interativa, e onde um humano está esperando. Triagem de incidentes, um escalonamento de suporte ao vivo, um loop de pesquisa onde um analista está iterando dentro de uma sessão — esses são os casos em que o valor da resposta que chega agora em vez de em quatro minutos não é proporcional ao preço do token, e onde uma fatura 6x em um pequeno número de turnos é trivialmente menor que o custo da pessoa esperando. Os próprios exemplos da OpenAI no anúncio de prévia eram exatamente dessa forma: ler logs enquanto uma interrupção se desenrola, transformar um loop de pesquisa noturno em uma sessão de trabalho.
Deixe-o desativado quando a carga de trabalho for limitada por throughput ou tiver formato de lote. Uma reindexação noturna, uma passagem de classificação em massa, um relatório agendado, um backfill — nenhuma delas se importa com latência de tempo decorrido, todas são dominadas pela contagem de tokens, e todas têm uma opção de 0,5x bem ali na mesma tabela de preços em Batch e Flex. Pagar 12x o preço do lote para terminar mais rápido é a forma mais clara de desperdiçar dinheiro nesta tabela.
O meio incômodo é o loop de codificação agêntica, e é aí que a aritmética da contagem de turnos decide. Se a velocidade realmente elimina novas tentativas — se a primeira passagem do modelo numa alteração de vários arquivos acerta com mais frequência porque não está lutando contra um timeout — então o Ultrafast pode ser mais barato por tarefa concluída, apesar de ser 6x por token. Essa é uma afirmação mensurável sobre seus próprios traces, não uma afirmação geral, e a medição é barata: conte os turnos cobrados por tarefa concluída em ambos os níveis e multiplique pela tarifa. Se a proporção não estiver perto de seis, o nível rápido é uma compra de latência e deve ser justificado como tal.
O nível tem preço definido; as rotas ao seu redor não são a mesma questão
Uma observação prática sobre como lidar com isso. O GPT-6 Astra no serviço padrão já está disponível no OrcaRouter como openai/gpt-6-astra à tarifa do próprio provedor — US$ 10,00 de entrada e US$ 50,00 de saída por milhão de tokens, com a faixa de contexto longo de 272K a US$ 20,00 / US$ 75,00 — servido com 0% de markup, o que significa que o preço de tabela do provedor é repassado e qualquer mudança de preço do fornecedor chega à sua fatura no mesmo dia em que chega à tabela de preços da OpenAI, em vez de só na sua próxima renovação de contrato. A mesma chave dá acesso a mais de 200 modelos, de modo que o nível padrão pode ficar atrás do mesmo cliente que o nível barato ou o modelo de um concorrente, sem uma segunda integração.
O que não fazemos é atender o nível Ultrafast. É um flag de nível de serviço em uma conta OpenAI, e não um modelo roteável separadamente — você define service_tier: "ultrafast" em uma solicitação para gpt-6-astra — e ele é cobrado pela OpenAI à sua própria conta pelas tarifas acima. Se você habilitá-lo, ele fica na sua integração direta com a OpenAI, e o OrcaRouter é o lugar certo para o tráfego de nível padrão que você roteia ao lado dele. Dizer isso claramente é mais útil do que insinuar uma capacidade que não temos.

A regra de decisão, em um parágrafo
Seis vezes é o preço de um nível, não o preço de um modelo: os pesos, a janela de contexto de 1.050.000 tokens, o teto de saída de 128.000 tokens e as respostas são todos idênticos ao GPT-6 Astra padrão. O que você está comprando é uma taxa de transferência de saída até 8x mais rápida, numa tabela de preços que é 6x em todas as linhas, sujeita a limites de taxa iniciais baixos e a uma restrição de residência nos EUA que exclui totalmente a UE. Essa troca é obviamente correta para um humano à espera de uma resposta, obviamente errada para uma tarefa em lote agendada que tem uma via a metade do preço disponível, e genuinamente indefinida para ciclos agênticos, onde a resposta depende de saber se a velocidade elimina turnos. Meça a contagem de turnos nos seus próprios traces antes de se comprometer, e encaminhe o resto ao preço de tabela.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
