
API do GPT-6 Astra: O ID do Modelo, o Endpoint e Quanto Custa Realmente uma Tarefa de Longo Horizonte
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures OpenAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.
A razão pela qual um modelo de treze dias merece uma página esta semana é que as rotas para ele mudaram depois que o lançamento aconteceu, e a rota da API agora é a comum. Quando a OpenAI lançou o Astra em 3 de setembro, descreveu uma implantação gradual em vez de uma disponibilidade; em 8 de setembro, estava dizendo que o modelo havia sido totalmente implantado para usuários Plus, Pro, Business e Enterprise no Codex e no ChatGPT Work, e na semana de 14 de setembro, a AWS o estava listando no Bedrock e o Microsoft Foundry o estava oferecendo em disponibilidade geral. Para um chamador de API, essa sequência importa menos do que parece — o endpoint esteve ativo e documentado o tempo todo —, mas significa que as perguntas de aquisição em torno dele agora têm respostas que não tinham no dia do lançamento. Tudo abaixo foi lido na própria documentação do modelo da OpenAI, na página de preços e na página de controles de dados em 16 de setembro de 2026, e qualquer coisa que venha de outro lugar diz isso na frase que a contém.
O ID do modelo, e a pergunta sobre o snapshot respondida honestamente.
A string a passar é gpt-6-astra — em minúsculas, com hífen, sem prefixo de fornecedor. Esse é o único id que a OpenAI documenta para este modelo.
Se você está procurando um snapshot datado para fixar, não há nenhum para encontrar, e não vamos inventar um sufixo de aparência plausível. Não existe nenhuma forma datada -2026-09-03 no estilo, nem nenhum alias -latest do lado do fornecedor. Durante a pesquisa, vimos um alias móvel no formato ~openai/gpt-astra-latest numa listagem de roteador; isso é uma construção de gateway criada sobre o id do fornecedor, não algo que a OpenAI publica, e não deveria entrar na sua configuração como se fosse.
A consequência prática é pequena, mas vale a pena mencionar. Você pode recuperar o objeto do modelo para confirmar com o que está falando:
curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"
Fixe o id simples num valor de configuração em vez de o digitar em uma dúzia de pontos de chamada. Se a OpenAI mais tarde adicionar snapshots com data, o id simples torna-se o alvo móvel e o seu valor fixado começa a mudar por baixo de si — ter um único lugar para editar é a diferença entre uma alteração de dois minutos e uma tarde inteira a fazer grep.
O endpoint: URL base, compatibilidade e uma requisição que é executada
The base URL is https://api.openai.com/v1. Per OpenAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.
Quanto à compatibilidade: esta é a própria API first-party da OpenAI, que é o formato de transmissão contra o qual todos os SDKs e clientes compatíveis com a OpenAI foram escritos. Qualquer coisa que fale esse formato se comunicará com gpt-6-astra sem um shim — você altera a string do modelo e, se estiver migrando de um modelo OpenAI mais antigo, os nomes dos parâmetros abaixo. Novos trabalhos devem usar a API Responses: é a superfície na qual a OpenAI documenta o controle de raciocínio deste modelo, é onde vivem as ferramentas integradas, e o suporte do Chat Completions aos modelos mais recentes tem sido historicamente o menos profundo dos dois.
Uma chamada de streaming mínima, com reasoning effort definido:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-6-astra", "input": "Liste os arquivos que você alteraria para migrar este serviço da API de autenticação legada.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'
E a mesma coisa em Python, que é onde a maioria dos leitores realmente vai estar:
from openai import OpenAI
client = OpenAI()
stream = client.responses.create(model="gpt-6-astra", input="Liste os arquivos que você alteraria para migrar este serviço da API de autenticação legada.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)
for event in stream:
if event.type == "response.output_text.delta": print(event.delta, end="")
Três coisas sobre esse pedido são específicas deste modelo, em vez de copiadas de um guia de início rápido genérico.
• O esforço de raciocínio é um ajuste de custo, não apenas um ajuste de qualidade. A página do modelo da OpenAI lista os valores suportados como low, medium, high, xhigh e max. Observe onde essa lista começa: não há none nem minimal para o GPT-6 Astra, então o piso subiu. Os tokens de raciocínio são cobrados como tokens de saída a US$ 50,00 por milhão, o que significa que mudar o esforço de high para max é uma decisão com um preço atrelado, não uma melhoria de qualidade gratuita.
• O streaming é suportado, e é a maneira honesta de executar turnos longos. Uma única solicitação nesse modelo pode emitir até 128.000 tokens de saída. Esperar que isso chegue em um único corpo de resposta, sem visibilidade sobre se está progredindo, é o que faz você acabar chutando os timeouts.
• O cache de prompt é explícito aqui. A API Responses documenta um prompt_cache_breakpoint em conteúdo de texto, imagem e arquivo, com um modo definido como explicit, marcando "o fim exato de um prefixo de prompt reutilizável" e herdando seu TTL do prompt_cache_options.ttl da requisição. Em um modelo cuja taxa de entrada em cache é um décimo da taxa sem cache, onde você posiciona esse limite é a linha de maior alavancagem na sua requisição.

O que uma janela de 1.050.000 tokens realmente significa
Os números documentados são uma janela de contexto de 1.050.000 tokens, uma entrada máxima de 922.000 tokens, uma saída máxima de 128.000 tokens e uma data de corte de conhecimento em 30 de abril de 2026.
Comece pela aritmética que as pessoas não percebem: 922.000 mais 128.000 é igual a 1.050.000. A janela é compartilhada entre o que você envia e o que o modelo pode retornar, e o teto de saída é reservado a partir dela. Você não pode enviar 1.050.000 tokens de entrada; o teto prático para uma única requisição é 922.000, e menos do que isso se você quiser espaço para uma resposta de verdade.
O que um milhão de tokens compra nas unidades em que você realmente trabalha? As conversões de token para texto são aproximadas, e estas são nossas, não da OpenAI, mas estão na ordem de grandeza certa: a cerca de quatro caracteres por token, 1.050.000 tokens estão na ordem de 750.000 palavras, ou algo como cem mil linhas de código. Isso é um repositório de porte médio, inteiro, com espaço de sobra para a saída de ferramentas que um agente gera enquanto trabalha. O caso de horizonte longo para o qual o modelo é vendido é exatamente este: um agente que leu um arquivo há uma hora e ainda consegue ver o que ele dizia, em vez de um que compactou a manhã em um parágrafo de resumo.
Depois vem a parte que pertence a uma página de preços e não a uma página de especificações. A documentação do modelo da OpenAI afirma que prompts com mais de 272.000 tokens de entrada são cobrados a 2x as tarifas de entrada e de cache e 1,5x na saída para a requisição inteira. A página de preços apresenta isso como uma segunda linha: contexto longo no GPT-6 Astra custa US$ 20,00 de entrada, US$ 2,00 de entrada em cache e US$ 75,00 de saída. Portanto, os três quartos superiores dessa janela são uma faixa de preço, não apenas folga. Uma execução cuja transcrição fica acima de 272.000 tokens paga o dobro por cada token de entrada — incluindo os armazenados em cache — pela requisição inteira, e essa é a maior variação isolada na economia deste modelo. Isso é detalhado na íntegra abaixo.
Mais um mecanismo que vale a pena conhecer, porque é o próprio reconhecimento do fornecedor de que uma janela não é a resposta inteira. Para o Codex, a OpenAI descreve uma abordagem experimental de contexto que será lançada com o Astra, na qual as notas persistem entre janelas de contexto em vez de compactação repetida em um único resumo, com as janelas anteriores permanecendo pesquisáveis, para que requisitos e resultados de testes de mensagens anteriores e de saídas de ferramentas continuem localizáveis. A OpenAI a chama de experimental, diz que ela está habilitada no config.toml do Codex e afirma que se tornará o padrão para o Astra. Se você estiver construindo o equivalente por conta própria na API, é esse o formato a copiar: notas duráveis e histórico recuperável, em vez de um único prompt heroico.
E o limite do próprio número: uma janela grande é uma capacidade, não uma garantia de atenção em toda a sua extensão. Os números de horizonte longo relatados pelo fornecedor são um guia melhor para o comportamento do que a contagem de tokens — a OpenAI relata OSWorld 2.0 em 72,6% a aproximadamente 40 minutos por tarefa, e Terminal-Bench 4.0 em 57,9% contra 37,3% para o GPT-5.6 Sol. Esses são números da própria OpenAI, não reproduzidos por nós, e o quadro independente é próximo, mas não idêntico: a Artificial Analysis mediu o Astra em 59,1% no Terminal-Bench v4.0 contra 52,0% para o Claude Fable 5.1 e 39,9% para o GPT-5.6 Sol. Ambos concordam que a diferença de horizonte longo em relação à geração anterior é real; nenhum dos dois substitui executar a sua própria tarefa.
Modalidades de entrada, e a questão do arquivo deixada honestamente em aberto
A página do modelo da OpenAI lista as modalidades de entrada de texto e imagem, com saída de texto. Sem áudio, sem vídeo, sem geração de imagem neste modelo.
A entrada de imagem entra como uma parte de conteúdo dentro de uma mensagem de usuário. O tipo da parte é input_image, e a imagem é fornecida como uma URL totalmente qualificada ou uma URL de dados base64 em image_url, ou como um file_id da Files API. Há um detail opcional de auto, low, high ou original, com padrão auto. A estrutura é:
O que mudou nesta captura de tela?
A documentação de visão da OpenAI lista PNG, JPEG, WEBP e GIF não animado como aceitos, até 512 MB de payload total por requisição e até 1.500 imagens por requisição, com imagens acima de 30.000 patches sendo rejeitadas em vez de redimensionadas para baixo. Esses são os limites gerais de visão da plataforma, e não específicos da Astra, e as imagens são cobradas como tokens como qualquer outra entrada.
Agora, a pergunta com que os leitores realmente chegam, e a resposta honesta. É possível enviar arquivos ou PDFs? Não conseguimos confirmar a entrada de documentos para este modelo na documentação da OpenAI, e não vamos insinuar que isso funciona. A API Responses de fato define uma parte de conteúdo input_file, então a tubulação existe na API de modo geral; mas a página da OpenAI para o GPT-6 Astra lista texto e imagem como suas modalidades de entrada e não lista arquivo, e não encontramos nenhuma declaração da OpenAI que documente entrada de PDF para este endpoint. Uma listagem de roteador para o mesmo modelo mostra arquivo ao lado de texto e imagem — trate isso como informação reportada pelo roteador, que é o que um roteador registra sobre uma rota, e não o que o fornecedor garante. Se a ingestão de documentos for essencial para sua carga de trabalho, teste-a no endpoint real antes de construir em cima disso, e tenha um fallback de OCR para texto pronto. Essa é a diferença entre uma tarde de testes e uma reescrita.
A linha de preços completa, e uma execução de horizonte longo precificada.
Todos os números desta seção foram lidos na própria página de preços da OpenAI em 16 de setembro de 2026, e todos são por milhão de tokens no nível Standard, salvo indicação em contrário na linha.
• Contexto curto, até 272K de entrada — $10.00 de entrada, $1.00 de entrada em cache, $12.50 de gravação em cache, $50.00 de saída.
• Contexto longo, acima de 272K de entrada — $20.00 de entrada, $2.00 de entrada em cache, $25.00 de gravação em cache, $75.00 de saída, aplicados à solicitação completa.
• Batch e Flex — metade do Standard: $5.00 / $0.50 / $6.25 / $25.00 contexto curto, $10.00 / $1.00 / $12.50 / $37.50 contexto longo.
• Modo rápido — o dobro do Standard: $20,00 / $2,00 / $25,00 / $100,00 contexto curto, $40,00 / $4,00 / $50,00 / $150,00 contexto longo. A OpenAI observa que o Modo rápido não está disponível para o GPT-6 Astra com residência de dados na UE.
• Residência de dados — os endpoints que a utilizam têm um acréscimo de 10% para modelos lançados em ou após 5 de março de 2026. O GPT-6 Astra se qualifica, portanto uma implantação com residência de dados fica 10% acima de todos os números acima.
A linha a internalizar é a tarifa de entrada em cache. US$ 1,00 contra US$ 10,00 é um desconto de 90% na parte do prompt que você envia novamente — e, numa carga de trabalho de agente, isso é quase o prompt inteiro. As gravações em cache são cobradas a US$ 12,50, ou 1,25x a tarifa de entrada sem cache, então o ponto de equilíbrio é simples: 100.000 tokens enviados sem cache duas vezes custam US$ 2,00, enquanto gravar esse prefixo uma vez e lê-lo de volta uma vez custa US$ 1,35. O cache compensa a partir da segunda reutilização em diante, e um agente que trabalha a mesma transcrição durante cem turnos reutiliza-a cem vezes.
O que nos leva à aritmética que realmente decide se este modelo é acessível, porque a tarifa anunciada não é o número que aparece na fatura. Aqui está uma execução modelada — nossa, baseada nas tarifas publicadas da OpenAI, não uma fatura medida — para o tipo de tarefa para o qual o modelo é vendido: um agente de programação autônomo trabalhando em uma migração em escala de repositório ao longo de algumas horas, 120 chamadas ao modelo, uma transcrição de trabalho que tem uma média de cerca de 500.000 tokens de entrada por chamada à medida que se acumula, 80% dessa entrada servida a partir do cache, e 400.000 tokens de saída ao longo da execução, incluindo raciocínio.
Com tarifas Standard de contexto curto:
• Entrada não cacheada — 12M tokens × US$ 10,00 = US$ 120,00
• Entrada em cache — 48M tokens × $1,00 = $48,00
• Saída — 0,4M tokens × $50,00 = $20,00
• Total ≈ $188,00 pela execução
A mesma execução na faixa de contexto longo, que é o que uma transcrição que fica acima de 272.000 tokens por chamada realmente recebe:
• Entrada sem cache — 12M tokens × $20,00 = $240,00
• Entrada em cache — 48M tokens × $2,00 = $96,00
• Saída — 0,4M tokens × $75,00 = $30,00
• Total ≈ $366,00 pela execução
Duas conclusões decorrem disso, e nenhuma delas é visível a partir da tarifa anunciada. Primeira, onde fica o seu transcript vale tanto quanto o modelo que você escolhe — a tarefa idêntica praticamente dobra de custo dependendo de ela cruzar ou não o limiar de 272K, o que torna a disciplina de contexto (recuperar os 100K certos em vez de carregar 600K) uma técnica de controle de custos neste modelo, e não apenas de desempenho. Segunda, o cache vale mais do que o desconto sugere: sem nenhum acerto de cache, o primeiro cenário carrega $600,00 de entrada em vez de $168,00, e a execução custa cerca de $620 em vez de $188. Ative o cache antes de aumentar o esforço de raciocínio.
Para a linha de base, a mesma combinação de tokens no GPT-5.6 Sol às tarifas que a página de preços da OpenAI mostrava em 16 de setembro — US$ 4,00 de entrada, US$ 0,40 de entrada em cache, US$ 20,00 de saída em contexto curto — chega a aproximadamente US$ 75,20, e na linha de contexto longo do Sol (US$ 8,00 / US$ 0,80 / US$ 30,00) aproximadamente US$ 146,40. Isso faz com que esta execução fique em cerca de 2,5x em qualquer uma das faixas. Duas ressalvas sobre esse múltiplo, porque ele já causou confusão em outros lugares: o valor do Sol é uma tarifa promocional — a OpenAI diz que a promoção está disponível pelo menos até 21 de novembro de 2026 — enquanto o da Astra é o preço de tabela, então o múltiplo mede as duas tabelas de tarifas de hoje, e não um fato estável sobre os modelos, e diminui se a promoção expirar. E o antigo "2,5x" que circula para a Astra às vezes é calculado com base na tabela do Sol antes da promoção, de US$ 5,00/US$ 30,00, o que dá 2x na entrada e cerca de 1,67x na saída. Especifique a qual tarifa do Sol você se refere, ou o número não vale nada.
Mais uma linha: o nível Batch reduz tudo isso pela metade, levando a primeira execução a cerca de US$ 94. Se você pode usá-lo depende da próxima seção.

Retenção Zero de Dados e o desconto que se autodesqualifica
A OpenAI afirma que o Zero Data Retention está disponível para clientes elegíveis da API em endpoints suportados, sujeito a aprovação — e ambas as metades dessa frase têm peso real. Não é uma opção de autoatendimento: a elegibilidade está sujeita à aprovação prévia da OpenAI e à aceitação de requisitos adicionais, e o processo começa por falar com a equipa de vendas. Após aprovação, é configurado ao nível da organização ou do projeto em Definições → Organização → Controlos de dados, no separador Retenção de dados, onde um projeto pode herdar a predefinição da organização, definir ZDR explicitamente, selecionar Modified Abuse Monitoring ou desativar ambos.
O que muda na prática: o ZDR exclui o conteúdo do cliente dos logs de monitorização de abuso, substituindo a retenção padrão de até 30 dias, e o parâmetro store em /v1/responses e /v1/chat/completions é tratado como false mesmo que uma requisição tente defini-lo como true.
O detalhe que mais importa em uma página sobre custo: /v1/batches não está na lista de endpoints elegíveis para ZDR. A página de controles de dados da OpenAI o lista como inelegível, com o estado da aplicação retido até ser excluído. Assim, no GPT-6 Astra, o desconto de 50% do nível Batch e a Retenção Zero de Dados são mutuamente exclusivos — uma carga de trabalho sujeita a conformidade que precisa de ZDR deve prever a tarifa Standard, não a tarifa de batch, e o valor de US$ 94 acima não está disponível para ela.
Mais três ressalvas, ditas sem rodeios porque uma página que exalta demais o ZDR é pior do que uma que o omite. O ZDR não é absoluto: no âmbito do "Eyes Off", a OpenAI reserva-se o direito de tornar modelos inelegíveis para o ZDR para clientes específicos, com aviso prévio por escrito, e, no âmbito do "Safety Retention", o conteúdo pode ser retido e revisado por humanos quando os classificadores sinalizarem risco grave. Entradas de imagem e arquivo sinalizadas por possível CSAM são retidas para revisão manual mesmo sob o ZDR. E o ZDR termina na fronteira da OpenAI — se o seu agente chama um servidor MCP remoto ou a API de outro fornecedor, esse tráfego é regido pela política de retenção dessa parte, não por esta. Separadamente, a residência de dados é um controle diferente do ZDR, exige aprovação própria e um aditivo de Modified Retention fora dos Estados Unidos, e acarreta o acréscimo de 10% mencionado acima. Se você está contando com o cache sob o ZDR, leia a página de controles de dados da OpenAI para saber o que o cache retém; não vamos imprimir um número de retenção para ele que nós mesmos não conseguimos ler lá.
Limites de taxa conforme documentado, e o que morde primeiro
A página de modelos da OpenAI publica estes limites por nível para o GPT-6 Astra — solicitações e tokens por minuto e, em seguida, o limite da fila de batch:
• Nível 1 — 500 RPM, 500.000 TPM, fila de lotes 1.500.000
• Nível 2 — 5.000 RPM, 1.000.000 TPM, fila de lote 3.000.000
• Nível 3 — 5.000 RPM, 2.000.000 TPM, fila de lotes 100.000.000
• Nível 4 — 10.000 RPM, 4.000.000 TPM, fila de lotes 200.000.000
• Nível 5 — 15,000 RPM, 40,000,000 TPM, fila de lotes 15,000,000,000
Dois limites que vamos nomear como não documentados em vez de preencher: não há limite publicado para o nível gratuito, porque o GPT-6 Astra não está no nível gratuito; e não encontramos nenhum teto publicado acima do Nível 5 nem uma tabela de limites separada para o modo Fast. Se um fornecedor não publicou um limite, trate a ausência como não resolvida — não presuma que seja ilimitado.
O número que impacta primeiro uma carga de trabalho de agente é o TPM de 500.000 do Nível 1. Uma única chamada nesse modelo pode carregar uma transcrição de 500.000 tokens, o que significa uma única solicitação pode consumir um minuto inteiro do seu orçamento de tokens no nível de entrada. Uma janela de contexto de um milhão de tokens não é muito útil para um agente que ocupa a mesma transcrição ao longo de 120 turnos se o nível não conseguir enviar os tokens. Dimensione o nível com base no volume de tokens do exemplo prático acima, e não na contagem de solicitações — e observe que o avanço de nível depende dos gastos e do histórico da conta, por isso vale a pena estabelecê-lo antes de um prazo, e não durante ele.
Azure e AWS Bedrock, uma linha cada
• Microsoft Azure — O GPT-6 Astra pode ser implantado no Microsoft Foundry com o mesmo id gpt-6-astra, com cobertura do Foundry que data a disponibilidade geral para o início de setembro de 2026 e relata implantações no Global Standard e na US Data Zone, sem EU Data Zone no lançamento, e tarifas iguais ou próximas às da lista da OpenAI, com uma linha de contexto longo. Lemos isso na cobertura do Foundry, e não na página do catálogo da própria Microsoft, que não conseguimos acessar hoje — verifique a lista de implantação atual, o conjunto de regiões e a tarifa na documentação da própria Microsoft antes de planejar uma implantação nele.
• AWS Bedrock — listado como openai.gpt-6-astra, disponível através das APIs do Bedrock suportadas e confirmado no resumo semanal da AWS datado de 15 de setembro de 2026, com o próprio perímetro de governação do Bedrock (isolamento do endpoint VPC, encriptação KMS, Guardrails) e a declaração da AWS de que os dados de inferência não são utilizados para o treino de modelos. A inferência na região e a inferência geográfica entre regiões no Bedrock é, segundo relatos, faturada 10% acima das tarifas base; esse valor é de segunda mão na nossa leitura, por isso consulte a própria página de preços da AWS.
Nenhuma das rotas altera o modelo. Ambas mudam a aquisição, o que, para um leitor corporativo, é exatamente o ponto central: uma implantação do Foundry ou do Bedrock pode ficar dentro de um compromisso de nuvem já existente, herdar seu IAM, logging e limite de rede, e cair em uma fatura que o financeiro já aprovou — frequentemente a diferença entre um piloto e algo que de fato entra em produção. A troca é que você fica com o ciclo de vida do modelo da nuvem e com o preço da nuvem, e ambas as nuvens são relatadas com valores iguais ou acima da tabela da OpenAI, e não abaixo dela.
Onde um roteador se encaixa, incluindo as partes que argumentam contra ele
O GPT-6 Astra está no catálogo do OrcaRouter como openai/gpt-6-astra, e o OrcaRouter repassa o preço de tabela do provedor com 0% de markup — o preço do fornecedor é o nosso preço, e uma alteração de preço do fornecedor entra na sua fatura no mesmo dia, em vez de na renovação. Para um modelo nesse preço, isso não é uma alegação de erro de arredondamento: a aritmética acima é a mesma aritmética que você pagaria diretamente.

A justificativa honesta para o roteamento aqui não é o preço, é a reversibilidade. O Astra custa aproximadamente 2,5x o modelo abaixo dele e seu custo varia conforme um limiar que sua arquitetura controla, então a maioria das equipes quer testá-lo em uma fração de tráfego real antes de comprometer um caminho de produção. Com uma única chave, você pode colocá-lo atrás do mesmo endpoint dos modelos que já executa, enviar parte do tráfego para ele e fazer failover automaticamente para algo mais barato quando ele não estiver valendo a diferença — uma mudança de configuração em vez de uma migração, com uma API cobrindo mais de 200 modelos, uma DSL de roteamento que compõe vários modelos em uma única chamada e fusão de modelos quando você quiser um painel respondendo em conjunto.
As partes que argumentam contra isso, ditas sem rodeios. Um roteador é um salto a mais no caminho da requisição e uma parte a mais no fluxo de dados — e, neste modelo, isso não é hipotético, porque o ZDR é aprovado por organização na OpenAI e uma requisição roteada não é automaticamente coberta pela sua aprovação de ZDR. Se você estiver enviando dados regulamentados, confirme os termos de dados da rota antes de enviá-los, e esteja preparado para ligar diretamente para o fornecedor por causa dessa carga de trabalho. O roteamento também adiciona um componente que pode falhar ou adicionar latência, e torna a troca de modelos tão fácil que é possível mudar o que responde aos seus usuários sem revisar isso. Nada disso supera o argumento de teste e reversibilidade para a maioria das equipes; tudo isso vale a pena saber antes de você decidir que o roteador é gratuito. Colocamos as plataformas de roteamento umas contra as outras em um artigo separado, em vez de repetir a comparação aqui.
Três perguntas que não são respostas de uma única oração
Posso fazer fine-tuning do GPT-6 Astra, ou usá-lo com a Assistants API? Não, em ambos os casos, e isto é um limite de design, e não uma configuração que você deixou passar. A página de modelos da OpenAI lista Chat Completions, Responses e Batch como os endpoints suportados e lista explicitamente Fine-tuning e Assistants como não suportados, e não há uma linha do GPT-6 Astra na tabela de preços de fine-tuning da OpenAI. Se a sua arquitetura depende de um modelo de ponta com fine-tuning, o Astra tem de ser usado por prompts, o que desloca o custo do treinamento para os tokens de entrada — e, a US$ 10,00 por milhão em um prompt de sistema grande, isso é um item orçamentário real, e não uma nota de rodapé.
O modelo vai recusar trabalho de segurança para o qual tenho autorização?Às vezes, sim, e vale a pena sabê-lo antes de começar a construir. O GPT-6 Astra é o primeiro modelo da OpenAI a atingir o limiar de capacidade Crítica de cibersegurança ao abrigo do Preparedness Framework da empresa e, tal como é disponibilizado, recusa tarefas cibernéticas avançadas, como escrever exploits de prova de conceito. A OpenAI diz que planeia alargar o acesso com salvaguardas menos restritivas através do seu programa Daybreak. Para quem defende, isto manifesta-se como uma recusa que não é um limite de taxa nem um erro — conte com ela no tratamento de erros em vez de insistir com novas tentativas.
Preciso de aprovação especial para chamar este modelo?Não para o endpoint padrão — não há lista de espera nem etapa de aprovação para chamar o gpt-6-astra, apenas uma conta com faturamento. Para o que você pode precisar de aprovação é tudo ao redor dele: Zero Data Retention, que é liberada mediante solicitação; residência de dados fora dos Estados Unidos, que exige um aditivo próprio; e um aumento de nível, se você pretende movimentar volumes de tokens em escala de agente por uma conta Tier 1. O modelo é a parte fácil da contratação.
O que observar, e quem deve agir agora
Se você está construindo sobre este modelo, as quatro coisas que vale a pena monitorar são todas do lado do fornecedor e todas datadas. Se a OpenAI publica um snapshot datado para gpt-6-astra — o que transformaria o id puro em um alvo móvel e tornaria a fixação de versão relevante. Se o limite de 272.000 tokens se altera, porque essa única linha vale mais para a sua fatura do que qualquer benchmark na página. Se as tarifas da Bedrock e da Foundry convergem para a tabela de preços da OpenAI ou permanecem acima dela, já que isso decide a rota de aquisição tanto quanto o próprio modelo. E se o programa Daybreak altera o que o endpoint vai recusar, o que, para equipes de segurança, é a diferença entre uma ferramenta utilizável e uma demo.
Quanto a quem deve agir, a divisão é clara. Se já está a pagar pelo GPT-5.6 Sol a tarifas promocionais para trabalho com agentes de horizonte longo, o fator de 2,5x é real e a questão é restrita: será que a taxa de conclusão de tarefas na sua própria carga de trabalho supera a diferença de preço? Teste-o numa fração de tráfego real e descubra — o exemplo prático acima indica-lhe quanto custa essa fração antes de começar. Se o seu trabalho é conversa de contexto curto ou classificação de alto volume, este não é o seu modelo; o novo preço para contexto longo e a tarifa de saída de 50,00 dólares tornam-no uma forma dispendiosa de fazer algo que o GPT-5.6 Luna faz por uma fração do preço. E se for uma empresa com um requisito de conformidade, comece primeiro a conversa sobre ZDR, porque é isso que condiciona o desconto de Batch, o acréscimo de residência e a sua escolha de rota — e nada disso é uma decisão que possa tomar no dia em que precisa dela.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
