
GPT-6 Astra Ultrafast roda em Blackwell: NVIDIA nomeia o hardware por trás do 8x
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Em 1º de outubro de 2026, a NVIDIA publicou um post de Dion Harris intitulado "Como as GPUs NVIDIA ajudam a acelerar o GPT-6 Astra Ultrafast da OpenAI", e a frase no centro dele é a primeira vez que qualquer uma das duas empresas disse em que o nível é executado: "GPT-6 Astra Ultrafast, executado em GPUs NVIDIA Blackwell, já está disponível na API da OpenAI e para usuários elegíveis do ChatGPT Work e do Codex." Essa é a notícia, e ela é mais restrita do que a manchete sugere. O GPT-6 Astra, o modelo, foi lançado em 3 de setembro de 2026. O nível de serviço Ultrafast sobre ele passou a estar amplamente disponível em 29 de setembro de 2026. A alegação de velocidade — geração de tokens até 8x mais rápida do que no modo padrão do Astra — já tinha dois dias quando a NVIDIA a repetiu.
O que levanta a questão que o post realmente responde: não "quão rápido é", mas "de quem é o silício".

Três coisas que a publicação realmente acrescentou
Se retirarmos a repetição, a publicação de 1º de outubro contribui com três fatos.
• O hardware — Blackwell. A própria documentação Ultrafast da OpenAI, publicada em 30 de setembro, descreve a velocidade do nível, sua configuração e seus limites de taxa, e não menciona GPU alguma. Portanto, a atribuição ao silício tem uma única fonte: o fornecedor de hardware. Isso não a torna falsa; torna-a uma alegação de um fornecedor sobre seu próprio equipamento, e digna de ser rotulada como tal.
• Dois engenheiros nomeados — Philippe Tillet, líder de inferência da OpenAI, e Uday Ruddarraju, diretor de tecnologia de computação da OpenAI, ambos citados nominalmente sobre de onde veio a aceleração.
• O público — "usuários elegíveis do ChatGPT Work e do Codex", o que é mais amplo do que o enquadramento exclusivo de API com que o nível foi lançado. A própria documentação da OpenAI ainda afirma que o Ultrafast para o GPT-6 Astra está "disponível para todos os usuários de API com limites de taxa baixos", e essa ressalva sobre os limites baixos não foi retirada oficialmente.
As duas citações, e por que elas são a parte interessante
A contribuição de Tillet é um loop, e não um benchmark. O investimento da NVIDIA em ferramentas e documentação, diz ele, "nos permitiu tornar nossos modelos excepcionalmente bons em programação", e a Astra pode então "transformar esse conhecimento em kernels de alto desempenho que tornam o hardware da NVIDIA atraente". Ruddarraju é mais direto sobre a direção do trabalho: "Usamos nossos modelos internos para otimizar em GPUs da NVIDIA."
Lidos em conjunto, isso é uma afirmação sobre implantação, e não sobre capacidade: os modelos de fronteira da OpenAI são agora bons o suficiente em escrever kernels de GPU para que a OpenAI os use para otimizar sua própria pilha de serving. Também é consistente com a única seção do artigo da NVIDIA que não tem nada a ver com a semana de lançamento — um título que diz "Melhorar Continuamente o Desempenho", argumentando que a inferência implantada fica mais rápida com o tempo porque a OpenAI continua apontando seus próprios modelos para o software da NVIDIA no qual ela é executada.
Nada disto é uma medição. São dois engenheiros a descrever um processo, publicado pela empresa que vendeu as GPUs. A leitura honesta é que o processo é plausível, fácil de acreditar e não falsificável de fora — o que também é verdade para todo número de velocidade nesta história.
Blackwell aqui, Cerebras lá
A coisa mais útil que este post faz é expor uma divisão que ninguém explicou. Em 13 de agosto de 2026, a OpenAI apresentou uma prévia de um nível rápido sobre um modelo diferente — o GPT-5.6 Sol rodando "até 14×" mais rápido — e nomeou a Cerebras como a parceira por trás disso, descrevendo hardware em escala de wafer que gera até 750 tokens de saída por segundo. Sete semanas depois, o nível rápido sobre o Astra roda no Blackwell, e o número é 8x.
Dois níveis rápidos, duas respostas de hardware, uma delas um parceiro especializado e a outra o maior fornecedor da própria empresa. Nenhum dos fornecedores publicou uma comparação entre os dois caminhos de serviço, e nenhum avaliador independente mediu qualquer um deles. Observe também o que o post da NVIDIA faz com o segundo nome: "Rubin" aparece uma única vez, dentro da citação de Tillet sobre modelos que escrevem kernels para "GPUs Blackwell e Rubin". É uma afirmação sobre o que os modelos da OpenAI conseguem programar, não uma afirmação de que algo já esteja servindo no Rubin hoje.
O número que a NVIDIA não divulgou
Há um número nesta história que nenhuma das empresas colocou ao lado do 8x, e é ele que decide se uma equipe ativa o nível. A tabela de preços Ultrafast publicada pela OpenAI lista gpt-6-astra a US$ 60,00 por milhão de tokens de entrada, US$ 6,00 de entrada em cache, US$ 75,00 de gravação em cache e US$ 300,00 de saída. O mesmo modelo no nível padrão custa US$ 10,00 e US$ 50,00, com entrada em cache a US$ 1,00 e gravação em cache a US$ 12,50. Cada coluna é exatamente seis vezes o preço padrão.
• O multiplicador — 6,00x na entrada, na saída, na entrada em cache e na gravação em cache. Não "até". Seis.
• O teto — 8x, o número que ambos os fornecedores citam com o "até" anexado e sem condições declaradas.
• O que isso significa — o múltiplo de preço fica abaixo do melhor cenário declarado do próprio nível. No teto, a troca é favorável; em qualquer valor abaixo de 6x no seu tráfego, você está pagando mais por unidade de tempo economizado do que o marketing sugere. É por isso que o único teste significativo deste nível é uma medição nas suas próprias requisições.
• O escalão de contexto longo — acima de 272.000 tokens de entrada, as tarifas do Ultrafast passam a $120,00 de entrada e $450,00 de saída, seis vezes as próprias tarifas escalonadas do nível padrão.
• As letras miúdas operacionais — A OpenAI documenta uma escala de tokens por minuto do Ultrafast de 500.000 para os níveis de utilização 1 a 3, 1.000.000 para o nível 4 e 5.000.000 para o nível 5; o Ultrafast suporta apenas residência de dados nos EUA e processamento global, sem qualquer endpoint de processamento regional na UE ou noutras regiões fora dos EUA; e a documentação recomenda WebSockets para o Ultrafast "especialmente para aplicações agênticas que fazem muitas chamadas de ferramentas em rápida sucessão", alertando que "sem uma ligação persistente, a sobrecarga da rede pode reduzir os ganhos de latência".

Esse último ponto é o que exige ação. Uma equipe que habilita o nível e deixa o HTTP por requisição por baixo dele pagou seis vezes a tarifa para devolver parte do ganho de velocidade ao estabelecimento de conexão — uma forma documentada e evitável de desperdiçar o dinheiro.
Como isso se parece a partir de um único endpoint
O GPT-6 Astra está no OrcaRouter como openai/gpt-6-astra: uma janela de contexto de 1.050.000 tokens, até 128.000 tokens de saída, entradas de texto, imagem e arquivos, e o preço de tabela da OpenAI repassado diretamente a $10,00 de entrada e $50,00 de saída por milhão de tokens, passando a $20,00 e $75,00 acima de 272.000 tokens de entrada. O benchmark de destaque do seu catálogo é 96,1 no GPQA Diamond.
O nível Ultrafast não está no OrcaRouter, e não pode estar: é um atributo de acesso controlado de uma conta OpenAI, e não um id de modelo, e é por isso que openai/gpt-6-astra-ultrafast retorna modelo não encontrado. Se você ativar o nível, ele fica na sua integração direta com a OpenAI. O que um endpoint com mais de 200 modelos com 0% de markup oferece a você nessa situação não é a via rápida — é o controle. Como o preço de tabela do provedor é repassado em vez de receber markup, uma mudança de tarifa da OpenAI chega do nosso lado no mesmo dia em que chega do lado deles, e como a via padrão do Astra já está lá, o experimento que resolve essa decisão é uma linha de configuração: o mesmo prompt, o nível padrão e um modelo mais barato ao lado dele, na mesma chave. É a coisa mais próxima de um benchmark de latência que a maioria das equipes vai executar, e não custa nada para configurar.

O que ainda não foi medido
Três coisas são verificáveis hoje. O nível existe, está na tabela de preços exatamente a seis vezes a tarifa padrão e, a partir de 1º de outubro, é publicamente atribuído às GPUs NVIDIA Blackwell.
Uma coisa não é: o multiplicador no seu tráfego. Nenhum fornecedor publicou uma distribuição de latência para o tier num nível de concorrência declarado, e nenhum terceiro reproduziu o 8x. Também não há benchmark comparando Astra no Ultrafast com Astra no padrão, e não deveria haver um favorável — é o mesmo checkpoint num caminho mais rápido, então configurações idênticas deveriam produzir respostas idênticas em velocidades diferentes. Se suas duas faixas divergirem nos mesmos prompts, você tem um relatório de bug, não uma funcionalidade.
Então, o resumo útil de 1º de outubro é menor do que o anúncio dá a entender. É o mesmo nível pelo mesmo preço, com o mesmo teto de velocidade não verificado, agora vestindo um rótulo de hardware. Esse rótulo importa — ele informa em qual linha de aceleradores a OpenAI está escalando isso, e informa que a história do nível rápido passou de um parceiro especializado para o maior fornecedor de GPUs do setor em menos de dois meses. Só não informa nada sobre o seu próprio orçamento de latência, e nenhum post vai informar.
