Um cartão de título gerado com o título 'GPT-6 Astra Ultrafast Executa no Blackwell', o subtítulo 'NVIDIA nomeia o hardware por trás do 8x', e três cartões com os dizeres 'Hardware: Blackwell GPUs', 'Múltiplo de preço: 6,00x a taxa padrão' e 'Velocidade declarada: até 8x', com um rodapé com os dizeres 'Publicação da NVIDIA, 1 de outubro de 2026 - números reportados pelo fornecedor'.
Guides & Insights

GPT-6 Astra Ultrafast roda em Blackwell: NVIDIA nomeia o hardware por trás do 8x

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 1º de outubro de 2026, a NVIDIA publicou um post de Dion Harris intitulado "Como as GPUs NVIDIA ajudam a acelerar o GPT-6 Astra Ultrafast da OpenAI", e a frase no centro dele é a primeira vez que qualquer uma das duas empresas disse em que o nível é executado: "GPT-6 Astra Ultrafast, executado em GPUs NVIDIA Blackwell, já está disponível na API da OpenAI e para usuários elegíveis do ChatGPT Work e do Codex." Essa é a notícia, e ela é mais restrita do que a manchete sugere. O GPT-6 Astra, o modelo, foi lançado em 3 de setembro de 2026. O nível de serviço Ultrafast sobre ele passou a estar amplamente disponível em 29 de setembro de 2026. A alegação de velocidade — geração de tokens até 8x mais rápida do que no modo padrão do Astra — já tinha dois dias quando a NVIDIA a repetiu.

O que levanta a questão que o post realmente responde: não "quão rápido é", mas "de quem é o silício".

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Três coisas que a publicação realmente acrescentou

Se retirarmos a repetição, a publicação de 1º de outubro contribui com três fatos.

• O hardware — Blackwell. A própria documentação Ultrafast da OpenAI, publicada em 30 de setembro, descreve a velocidade do nível, sua configuração e seus limites de taxa, e não menciona GPU alguma. Portanto, a atribuição ao silício tem uma única fonte: o fornecedor de hardware. Isso não a torna falsa; torna-a uma alegação de um fornecedor sobre seu próprio equipamento, e digna de ser rotulada como tal.

• Dois engenheiros nomeados — Philippe Tillet, líder de inferência da OpenAI, e Uday Ruddarraju, diretor de tecnologia de computação da OpenAI, ambos citados nominalmente sobre de onde veio a aceleração.

• O público — "usuários elegíveis do ChatGPT Work e do Codex", o que é mais amplo do que o enquadramento exclusivo de API com que o nível foi lançado. A própria documentação da OpenAI ainda afirma que o Ultrafast para o GPT-6 Astra está "disponível para todos os usuários de API com limites de taxa baixos", e essa ressalva sobre os limites baixos não foi retirada oficialmente.

As duas citações, e por que elas são a parte interessante

A contribuição de Tillet é um loop, e não um benchmark. O investimento da NVIDIA em ferramentas e documentação, diz ele, "nos permitiu tornar nossos modelos excepcionalmente bons em programação", e a Astra pode então "transformar esse conhecimento em kernels de alto desempenho que tornam o hardware da NVIDIA atraente". Ruddarraju é mais direto sobre a direção do trabalho: "Usamos nossos modelos internos para otimizar em GPUs da NVIDIA."

Lidos em conjunto, isso é uma afirmação sobre implantação, e não sobre capacidade: os modelos de fronteira da OpenAI são agora bons o suficiente em escrever kernels de GPU para que a OpenAI os use para otimizar sua própria pilha de serving. Também é consistente com a única seção do artigo da NVIDIA que não tem nada a ver com a semana de lançamento — um título que diz "Melhorar Continuamente o Desempenho", argumentando que a inferência implantada fica mais rápida com o tempo porque a OpenAI continua apontando seus próprios modelos para o software da NVIDIA no qual ela é executada.

Nada disto é uma medição. São dois engenheiros a descrever um processo, publicado pela empresa que vendeu as GPUs. A leitura honesta é que o processo é plausível, fácil de acreditar e não falsificável de fora — o que também é verdade para todo número de velocidade nesta história.

Blackwell aqui, Cerebras lá

A coisa mais útil que este post faz é expor uma divisão que ninguém explicou. Em 13 de agosto de 2026, a OpenAI apresentou uma prévia de um nível rápido sobre um modelo diferente — o GPT-5.6 Sol rodando "até 14×" mais rápido — e nomeou a Cerebras como a parceira por trás disso, descrevendo hardware em escala de wafer que gera até 750 tokens de saída por segundo. Sete semanas depois, o nível rápido sobre o Astra roda no Blackwell, e o número é 8x.

Dois níveis rápidos, duas respostas de hardware, uma delas um parceiro especializado e a outra o maior fornecedor da própria empresa. Nenhum dos fornecedores publicou uma comparação entre os dois caminhos de serviço, e nenhum avaliador independente mediu qualquer um deles. Observe também o que o post da NVIDIA faz com o segundo nome: "Rubin" aparece uma única vez, dentro da citação de Tillet sobre modelos que escrevem kernels para "GPUs Blackwell e Rubin". É uma afirmação sobre o que os modelos da OpenAI conseguem programar, não uma afirmação de que algo já esteja servindo no Rubin hoje.

O número que a NVIDIA não divulgou

Há um número nesta história que nenhuma das empresas colocou ao lado do 8x, e é ele que decide se uma equipe ativa o nível. A tabela de preços Ultrafast publicada pela OpenAI lista gpt-6-astra a US$ 60,00 por milhão de tokens de entrada, US$ 6,00 de entrada em cache, US$ 75,00 de gravação em cache e US$ 300,00 de saída. O mesmo modelo no nível padrão custa US$ 10,00 e US$ 50,00, com entrada em cache a US$ 1,00 e gravação em cache a US$ 12,50. Cada coluna é exatamente seis vezes o preço padrão.

• O multiplicador — 6,00x na entrada, na saída, na entrada em cache e na gravação em cache. Não "até". Seis.

• O teto — 8x, o número que ambos os fornecedores citam com o "até" anexado e sem condições declaradas.

• O que isso significa — o múltiplo de preço fica abaixo do melhor cenário declarado do próprio nível. No teto, a troca é favorável; em qualquer valor abaixo de 6x no seu tráfego, você está pagando mais por unidade de tempo economizado do que o marketing sugere. É por isso que o único teste significativo deste nível é uma medição nas suas próprias requisições.

• O escalão de contexto longo — acima de 272.000 tokens de entrada, as tarifas do Ultrafast passam a $120,00 de entrada e $450,00 de saída, seis vezes as próprias tarifas escalonadas do nível padrão.

• As letras miúdas operacionais — A OpenAI documenta uma escala de tokens por minuto do Ultrafast de 500.000 para os níveis de utilização 1 a 3, 1.000.000 para o nível 4 e 5.000.000 para o nível 5; o Ultrafast suporta apenas residência de dados nos EUA e processamento global, sem qualquer endpoint de processamento regional na UE ou noutras regiões fora dos EUA; e a documentação recomenda WebSockets para o Ultrafast "especialmente para aplicações agênticas que fazem muitas chamadas de ferramentas em rápida sucessão", alertando que "sem uma ligação persistente, a sobrecarga da rede pode reduzir os ganhos de latência".

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Esse último ponto é o que exige ação. Uma equipe que habilita o nível e deixa o HTTP por requisição por baixo dele pagou seis vezes a tarifa para devolver parte do ganho de velocidade ao estabelecimento de conexão — uma forma documentada e evitável de desperdiçar o dinheiro.

Como isso se parece a partir de um único endpoint

O GPT-6 Astra está no OrcaRouter como openai/gpt-6-astra: uma janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída, entradas de texto, imagem e arquivos, e o preço de tabela da OpenAI repassado diretamente a $10,00 de entrada e $50,00 de saída por milhão de tokens, passando a $20,00 e $75,00 acima de 272.000 tokens de entrada. O benchmark de destaque do seu catálogo é 96,1 no GPQA Diamond.

O nível Ultrafast não está no OrcaRouter, e não pode estar: é um atributo de acesso controlado de uma conta OpenAI, e não um id de modelo, e é por isso que openai/gpt-6-astra-ultrafast retorna modelo não encontrado. Se você ativar o nível, ele fica na sua integração direta com a OpenAI. O que um endpoint com mais de 200 modelos com 0% de markup oferece a você nessa situação não é a via rápida — é o controle. Como o preço de tabela do provedor é repassado em vez de receber markup, uma mudança de tarifa da OpenAI chega do nosso lado no mesmo dia em que chega do lado deles, e como a via padrão do Astra já está lá, o experimento que resolve essa decisão é uma linha de configuração: o mesmo prompt, o nível padrão e um modelo mais barato ao lado dele, na mesma chave. É a coisa mais próxima de um benchmark de latência que a maioria das equipes vai executar, e não custa nada para configurar.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

O que ainda não foi medido

Três coisas são verificáveis hoje. O nível existe, está na tabela de preços exatamente a seis vezes a tarifa padrão e, a partir de 1º de outubro, é publicamente atribuído às GPUs NVIDIA Blackwell.

Uma coisa não é: o multiplicador no seu tráfego. Nenhum fornecedor publicou uma distribuição de latência para o tier num nível de concorrência declarado, e nenhum terceiro reproduziu o 8x. Também não há benchmark comparando Astra no Ultrafast com Astra no padrão, e não deveria haver um favorável — é o mesmo checkpoint num caminho mais rápido, então configurações idênticas deveriam produzir respostas idênticas em velocidades diferentes. Se suas duas faixas divergirem nos mesmos prompts, você tem um relatório de bug, não uma funcionalidade.

Então, o resumo útil de 1º de outubro é menor do que o anúncio dá a entender. É o mesmo nível pelo mesmo preço, com o mesmo teto de velocidade não verificado, agora vestindo um rótulo de hardware. Esse rótulo importa — ele informa em qual linha de aceleradores a OpenAI está escalando isso, e informa que a história do nível rápido passou de um parceiro especializado para o maior fornecedor de GPUs do setor em menos de dois meses. Só não informa nada sobre o seu próprio orçamento de latência, e nenhum post vai informar.