Um card de título com o texto "GPT-6 Astra no Codex" e o subtítulo "Notas entre janelas, níveis de esforço e a fatura real", a linha "Modelo lançado em 3 de setembro de 2026 - página de referência verificada em 16 de setembro de 2026", e três cards rotulados para config.toml, Notas + histórico pesquisável e Custo por sessão.
Guides & Insights

GPT-6 Astra no Codex: Notas entre Janelas, Níveis de Esforço e a Conta Real

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-6 Astra é um modelo de 2026-09-03, e esta página não é cobertura de lançamento — é a referência para apontar seu agente de programação para ele agora que está amplamente disponível. O motivo pelo qual um desenvolvedor faria a troca é um mecanismo específico, e vale a pena entendê-lo antes de gastar qualquer coisa com ele: em vez de compactar uma sessão longa em um único resumo com perdas toda vez que a janela se enche, o Codex com GPT-6 Astra mantém notas entre janelas de contexto e deixa janelas de contexto anteriores pesquisáveis, de modo que um requisito que você declarou quarenta turnos atrás e a saída de teste que falhou dez turnos atrás ainda podem ser recuperados, em vez de serem resumidos e descartados. A OpenAI chama o recurso de experimental, o habilita com uma linha no seu config.toml do Codex e diz que ele se tornará o padrão para o Astra. Tudo abaixo — a configuração exata, os níveis de esforço, os resultados medidos e uma fatura de sessão detalhada que nomeia a linha de entrada em cache — foi lido das próprias páginas da OpenAI em 2026-09-16, e todo número de terceiros está identificado como tal.

Duas coisas aconteceram esta semana que mudam a aritmética da adoção dele. Em 2026-09-12, o líder do Codex da OpenAI publicou um post-mortem confirmando que o próprio experimento de gerenciamento de contexto tinha um bug — ele causava paradas prematuras e respostas a mensagens desatualizadas, e foi desativado para os cerca de 4.000–5.000 usuários que o usavam — e a OpenAI emitiu uma redefinição completa de uso para usuários do Codex e do Astra à meia-noite de 09-12 para 09-13. Na mesma semana, os workspaces empresariais que tinham o Astra desativado por padrão no lançamento passaram a ser administráveis sob sua própria tabela de preços. Então, a posição honesta é: o mecanismo vale a pena ser adotado, a build ainda está mudando sob seus pés, e você deve testá-lo em um branch em vez de correr contra um prazo.

O que há de realmente novo no Codex com GPT-6 Astra?

Peça a qualquer agente de programação para trabalhar por seis horas e você esbarra no mesmo obstáculo. A janela de contexto fica cheia, o harness resume a transcrição em um único bloco denso para abrir espaço, e o resumo tem perdas exatamente da forma que machuca — o motivo pelo qual uma correção anterior falhou, o formato exato de um teste que está falhando, uma restrição que o usuário mencionou de passagem no terceiro turno. O detalhe recuperado, não o detalhe resumido, é o que você realmente queria.

A integração do Astra com o Codex muda a forma disso. A documentação do Codex da OpenAI afirma isso claramente: "O Astra mantém notas entre janelas de contexto e consegue pesquisar mensagens anteriores e resultados de ferramentas da mesma tarefa." As notas são duráveis e graváveis; o histórico por trás delas permanece legível, de modo que uma janela anterior ainda pode ser pesquisada em busca da evidência original mesmo depois que a nota sobre ela foi escrita. Requisitos e resultados de testes de mensagens anteriores e da saída de ferramentas permanecem localizáveis.

OpenAI é explícito ao afirmar que este não é um trabalho concluído. Sua referência de configuração descreve a flag como "Habilitar gerenciamento de contexto experimental (desativado por padrão)" e diz que o recurso "usa notas e histórico pesquisável para preservar detalhes acumulados". A documentação também afirma que ele "não está disponível com login Business, Enterprise ou com chave de API no lançamento". Isso também não é contexto infinito — o modelo ainda raciocina dentro de uma janela finita, e cada releitura de uma nota anterior consome o orçamento de entrada daquele turno. A janela é de 1.050.000 tokens, com um máximo de 922.000 tokens de entrada, de acordo com a documentação do modelo da OpenAI; o mecanismo de notas fica em cima disso, não o substitui.

A configuração, exatamente como a Ope​nAI a documenta

A definição é filha da tabela [features] no seu arquivo config.toml do Codex — o arquivo fica em ~/.codex/, a menos que você tenha substituído CODEX_HOME. O caminho de chave documentado é features.context_management.experimental_mode, um booleano, e o valor é true:

[features.context_management]
experimental_mode = true

Se você já tem uma tabela [features] no arquivo, adicione a chave relativa dentro dela em vez de declarar a tabela duas vezes:

[features]
context_management.experimental_mode = true

Use um formato ou o outro. Relatos da comunidade sobre a flag informam que declarar o caminho com pontos na raiz e depois abrir uma tabela [features] mais adiante no mesmo arquivo pode falhar ao ser interpretado como uma tabela redeclarada, o que é uma regra do TOML e não da Ope​nAI — mas isso causa problemas, então escolha um formato e mantenha-o. Depois de editar, inicie uma nova tarefa: a configuração não se aplica retroativamente a uma sessão já em execução.

A metade referente ao modelo do mesmo arquivo não tem nada de notável, e a referência da Ope​nAI documenta essas chaves diretamente — model é "Modelo a usar", model_provider tem como padrão openai:

modelo = "gpt-6-astra"
provedor_de_modelo = "openai"
esforço_de_raciocínio_do_modelo = "alto"

Uma ressalva ao ler versões da documentação. A referência de configuração do Co​dex lista model_reasoning_effort como aceitando minimal, low, medium, high e xhigh, observando que xhigh depende do modelo — enquanto a página de modelo da API da Ope​nAI para gpt-6-astra documenta reasoning.effort como low, medium, high, xhigh e max. O controle deslizante do cliente e a API não descrevem o mesmo conjunto, então defina effort explicitamente e confirme o que o seu cliente aceitou em vez de presumir.

Selecionar o modelo — e a regra de acesso que apanha as pessoas de surpresa

A documentação do modelo Codex da OpenAI fornece diretamente a forma de CLI: codex -m gpt-6-astra. Em uma sessão interativa, /model troca o modelo e ajusta o esforço de raciocínio; em uma execução única, codex exec -m gpt-6-astra "Review the current changes" funciona da mesma forma. No aplicativo para desktop e na extensão de IDE, o controle de modelo fica abaixo do compositor.

A regra de acesso é onde as pessoas erram, e vale a pena ler duas vezes, porque as duas funcionalidades têm critérios de acesso diferentes:

• O modelo — disponível no ChatGPT Work, Codex e na API, e também disponibilizado no Microsoft Azure e na AWS Bedrock. A página de lançamento da OpenAI diz que o Astra estava "sendo lançado hoje para um conjunto limitado de organizações e, nos próximos dias, ficará disponível para todos os usuários do ChatGPT Plus, Pro, Business e Enterprise".

• O gerenciamento experimental de contexto — mais restrito. A documentação da OpenAI afirma que "Requer login no ChatGPT nos planos Plus, Pro ou Pro Lite" e que "não está disponível com login Business, Enterprise ou por chave de API no lançamento".

É essa segunda linha que você precisa internalizar. Você pode chamar o gpt-6-astra com uma chave de API e pode pagar por ele em um plano Business — mas o recurso de notas entre janelas não estará lá. Se o mecanismo de notas é o motivo pelo qual você está mudando, você precisa de um login do ChatGPT Plus, Pro ou Pro Lite no cliente Co​dex, não de uma chave de API. A Ope​nAI apresenta isso como disponibilidade dependendo de "a distribuição gradual, seu método de login e seu cliente", que é a versão educada da mesma coisa.

A screenshot of OpenAI's official Codex models documentation showing the model and reasoning control beneath the composer set to '5.6 Sol Extra High', a note that Ultra mode uses subagents, and a Recommended models row of three cards - Astra described as the most capable model for complex work across code, apps and research with advanced reasoning and computer use, 5.6 Sol for complex coding and cybersecurity, and 5.6 Terra as the balanced lower-cost model. A GPT-5.5 retirement notice dated October 14, 2026 appears above.

Duas ressalvas adicionais, rotuladas como reportadas e não documentadas pelo fornecedor. A cobertura do lançamento afirma que é necessária a versão 0.153.0 ou superior do Codex CLI para o Astra; não conseguimos confirmar esse piso de versão nas próprias páginas da OpenAI. E a documentação do Codex descreve predefinições do seletor de modelos — Astra Light, Astra Medium, Astra Extra High — oferecidas a contas Pro, Business (US$ 100) e Enterprise elegíveis, ao lado do controle deslizante de raciocínio. Essas são posições do seletor, não produtos separados: a OpenAI documenta um único id de modelo, gpt-6-astra, com um único conjunto de especificações e um único preço, e não publica nenhuma especificação ou tarifa separada para qualquer configuração "Astra Pro" ou "Astra Medium". Considere não verificado qualquer número citado para um nível nomeado do Astra.

Se você quer testar o modelo antes de comprometer um caminho de produção com ele, roteá-lo por um único endpoint ao lado do seu modelo atual é a forma barata de descobrir — O GPT-6 Astra está no catálogo do OrcaRouter, então uma execução de comparação custa apenas uma string de modelo, em vez de um segundo contrato e um segundo SDK.

Esforço de raciocínio: cinco níveis, e quanto custa cada um

A documentação da API da Ope​nAI para o gpt-6-astra lista cinco níveis de esforço — low, medium, high, xhigh e max — e a orientação do Co​dex é direta sobre como usá-los: "Use o menor esforço de raciocínio que produza o resultado de que você precisa" e comece pelo padrão, aumentando-o quando uma tarefa exigir um planejamento mais profundo.

A razão pela qual ignorar esse conselho é caro neste modelo especificamente é onde os tokens de raciocínio entram na fatura. Tokens de raciocínio são tokens de saída, e a saída no Astra custa US$ 50,00 por milhão — dez vezes a taxa de entrada e cinquenta vezes a taxa de entrada em cache. Portanto, o trade-off não é abstrato:

• Cada 1.000 tokens de raciocínio adicionais por turno custa US$ 0,05 à taxa de saída.

• Ao longo de uma sessão de 150 turnos, manter 1.000 tokens de raciocínio adicionais por turno custa cerca de US$ 7,50; manter 5.000 adicionais custa cerca de US$ 37,50.

• Na sessão de exemplo abaixo, a saída já é a maior linha individual, a US$ 0,200 por turno, contra US$ 0,090 de leituras de cache — o crescimento de raciocínio é o termo que move o total mais rapidamente.

O que a OpenAI não publica é uma tabela por nível de esforço: não há um dado do fornecedor sobre quantos tokens de raciocínio xhigh ou max são emitidos em uma tarefa de programação em relação a medium, e nenhum benchmark do fornecedor detalhado por nível de esforço. Qualquer pessoa que lhe cite uma proporção exata de "max custa 2x" está citando a própria medição, não a da OpenAI. O método honesto é executar uma tarefa representativa em dois níveis de esforço e ler o bloco de uso na resposta — esse número, multiplicado por US$ 50 por milhão, é o seu verdadeiro custo extra de esforço.

Os resultados medidos, cada um com a sua própria fonte

Trabalho de codificação e terminal, todos relatados pelo fornecedor OpenAI, salvo indicação em contrário. Terminal-Bench 4.0: GPT-6 Astra com 57,9%, contra 37,3% do GPT-5.6 Sol e 55,8% do Claude Fable 5.1 — com a OpenAI estimando um custo de API por tarefa aproximadamente 9% menor em comparação com o GPT-5.6 Sol e 63% menor em comparação com o Claude Fable 5.1. O DeepSWE v1.1 da Datacurve coloca o Astra em 74,1% no próprio benchmark da Datacurve, um número que a Datacurve descreve como um novo recorde e que algumas coberturas arredondam para 74%. No conjunto agêntico mais amplo, a OpenAI relata OSWorld 2.0 em 72,6% a aproximadamente 40 minutos por tarefa — cerca de 47% menos tempo por tarefa do que o GPT-5.6 Sol — ao lado de FrontierMath Tier 4 em 98%, ARC-AGI-3 em 99,9% e ExploitBench em 100%, todos descritos pela OpenAI como níveis saturados ou efetivamente saturados. Esses são os números do fornecedor; não os reproduzimos, e o escrutínio independente do número do ARC-AGI-3 pela ARC Prize constatou que ele foi medido sob um ambiente especial de adaptador de provedor e que cai em condições padrão.

A parte que não é um número de fornecedor é aquela com que um fluxo de trabalho de revisão de código deveria se preocupar mais. A CodeRabbit publicou sua própria avaliação do Astra em 2026-09-04, e o resultado é mais restrito do que a manchete. Em pull requests entre arquivos — as revisões difíceis que exigem conectar uma alteração às consequências em outras partes do código —, o Astra detectou cerca de 20% mais bugs do que o GPT-5.6 Sol, com cobertura de bugs acionáveis de 57,1% contra 47,6%. Nas revisões gerais, o ganho praticamente desaparece: 61,3% contra 59,0%, cerca de 4% mais. A CodeRabbit caracteriza ambos como "resultados iniciais e direcionais" que não estabelecem um ranking, e observa que seu método não isola a causa da melhoria. A página de lançamento da OpenAI caracteriza o mesmo trabalho como "mais que o dobro em pull requests entre arquivos"; o próprio relatório da CodeRabbit apresenta os 20% e as porcentagens de cobertura acima. Leia as porcentagens, não o resumo.

A single-column scoreboard titled 'GPT-6 Astra in Codex - the scoreboard' with six rows: Terminal-Bench 4.0 at 57.9%, DeepSWE v1.1 at 74.1%, Mind2Web at 1.9x faster, context window of 1,050,000 tokens, cached input at $1.00 per 1M, and output at $50.00 per 1M. A footer reads 'OpenAI-reported except DeepSWE v1.1 (Datacurve); pricing per OpenAI, read September 16, 2026.'

Essa assimetria é o número mais útil desta página para decidir como implantar o modelo, e ela aponta na mesma direção que o preço: o ganho está concentrado no raciocínio entre arquivos, então é aí que você deve investir o modelo.

O que o uso de computador no Codex muda para o seu fluxo de trabalho

Ope​nAI afirma que o harness atualizado do Co​dex torna o GPT-6 Astra 1,9x mais rápido na conclusão de tarefas no Mind2Web do que a experiência atual do GPT-5.6 Sol. O Mind2Web é automação de tarefas web, então interprete isso assim: o trabalho de agente que precisa interagir com um navegador ou uma GUI é concluído de forma substancialmente mais rápida, e o mesmo harness atualizado é o que você está executando quando usa o Co​dex, em qualquer situação. O dado complementar é o resultado do OSWorld 2.0 acima — 72,6% em aproximadamente 40 minutos por tarefa, cerca de 47% menos tempo por tarefa do que o Sol.

Para um desenvolvedor, a consequência prática é uma mudança naquilo que vale a pena delegar. Fluxos de trabalho que antes eram lentos demais para automatizar de ponta a ponta — operar um console de staging sem API, reproduzir um bug por meio de uma UI, percorrer um formulário de várias etapas para gerar uma fixture — passam a ficar dentro do intervalo em que uma execução de agente é mais barata do que fazer isso à mão. Isso também aumenta o valor dos controles do lado empresarial que a OpenAI lançou em conjunto: ChatGPT Work e Codex adicionam políticas de confirmação, ou seja, aprovação antes de ações com consequências, e revisão automatizada de chamadas de ferramentas inseguras ou não autorizadas. Se você está deixando um agente navegar por uma interface real com cliques, essa camada de revisão é o que separa uma execução ruim de uma tarde ruim — e é por isso que o acesso empresarial estar desativado por padrão, com um administrador o habilitando conforme a tabela de preços aplicável, é um recurso de governança e não um obstáculo.

Precificando o fluxo de trabalho, não o token

Aqui está o preço, com nome e data. Na página de preços da OpenAI, consultada em 2026-09-16, o gpt-6-astra padrão é US$ 10,00 por milhão de tokens de entrada, US$ 1,00 por milhão de tokens de entrada em cache, US$ 12,50 por milhão de gravações em cache e US$ 50,00 por milhão de tokens de saída. Batch e Flex rodam com metade dessas tarifas; o modo Fast dobra esses valores. A linha de entrada em cache é a que decide sua conta em um loop agêntico, porque um agente de programação reenvia um contexto grande e majoritariamente inalterado a cada turno, e a entrada em cache custa um décimo da entrada nova.

Dois limites importam antes da aritmética. A documentação do modelo da OpenAI afirma que prompts acima de 272.000 tokens de entrada são cobrados a 2x as tarifas de entrada e de cache e 1,5x a saída para a solicitação completa — não apenas o excedente — e a página de preços traz a linha de contexto longo a US$ 20,00 de entrada, US$ 2,00 de entrada em cache e US$ 75,00 de saída. E cada token de raciocínio é cobrado à taxa de saída, como abordado acima.

Considere uma refatoração noturna realista: 150 turnos de modelo, uma média de 100.000 tokens de entrada por turno, dos quais 90.000 são leitura de cache e 10.000 são novos, e 4.000 tokens de saída por turno, incluindo raciocínio. Abaixo do limite de 272K, às tarifas padrão:

• Entrada em cache — 90.000 tokens × $1,00 por milhão = $0,090 por turno

• Entrada nova — 10.000 tokens × $10,00 por milhão = $0,100 por turno

Saída — 4.000 tokens × US$ 50,00 por milhão = US$ 0,200 por turno

• Total — $0.390 por turno, então 150 turnos custam cerca de $58.50 para a sessão

Agora faça a mesma sessão ultrapassar o limite. Com 300.000 tokens de entrada por turno — 270.000 em cache, 30.000 novos — toda a solicitação é reprecificada, então a entrada em cache dobra para $2,00, a entrada nova dobra para $20,00 e a saída vai para $75,00:

• Entrada em cache — 270.000 × US$ 2,00 por milhão = US$ 0,540 por turno

• Entrada nova — 30.000 × $20,00 por milhão = $0,600 por turno

• Saída — 4.000 × $75,00 por milhão = $0,300 por turno

• Total — $1.44 por turno, ou cerca de $216,00 para 150 turnos

Mesmo formato de tarefa, aproximadamente 3,7x a fatura, e toda a diferença está em de que lado dos 272.000 tokens a sua transcrição se encontra. Esse é o argumento a favor do mecanismo de notas em uma frase: se notas duráveis e um histórico pesquisável permitem que você mantenha um contexto de trabalho mais enxuto em vez de arrastar a transcrição inteira para frente, o recurso se paga em tokens de entrada antes mesmo de ajudar com a qualidade. É também o argumento para não deixar uma execução não assistida aumentar uma transcrição sem limite.

A screenshot of the OrcaRouter model page for GPT-6 Astra showing the catalog id openai/gpt-6-astra, 1M tokens of context and 128K max output, text, image and file input with text output, reasoning, coding and agentic use cases, $10.00 per 1M input and $50.00 per 1M output, the /v1/chat/completions and /v1/responses endpoints, and an OpenAI-compatible code sample pointed at api.orcarouter.ai/v1.

Para efeito de escala, a mesma sessão de 150 turnos no mesmo perfil de tokens nos níveis mais baratos: o GPT-5.6 Terra, com seus preços publicados de US$ 2,00 de entrada / US$ 0,20 em cache / US$ 12,00 de saída, chega a cerca de US$ 12,90, e o GPT-5.6 Luna, a US$ 0,20 / US$ 0,02 / US$ 1,20, chega a aproximadamente US$ 1,29. Isso é apenas aritmética sobre as tarifas publicadas da OpenAI, não uma afirmação de que concluiriam a mesma tarefa — que é justamente o ponto das próximas duas seções.

Se você está comparando tudo isso entre provedores, vale saber que a OrcaRouter repassa o preço de tabela do provedor com 0% de margem, então uma mudança de preço do fornecedor passa a valer no endpoint roteado no mesmo dia, e não na próxima fatura.

Os modos de falha a serem contornados no projeto

Astra é um modelo de horizonte longo com um design de contexto longo, e ambas as metades dessa descrição são onde os problemas residem. Estas são descobertas da comunidade e postmortems de fornecedores, não nossas medições.

• O experimento de gestão de contexto teve um bug esta semana. O postmortem da Ope​nAI de 2026-09-12 confirma que o experimento opcional "causou paradas precoces e respostas a mensagens obsoletas", afetando cerca de 4.000 a 5.000 usuários, e foi desativado. O mesmo postmortem aponta outras duas causas das reclamações de qualidade da semana do lançamento: habilidades escritas para modelos anteriores disparando de forma indevida e impedindo a Astra de verificar o próprio trabalho, e motores de serviço mal configurados degradando uma cauda do tráfego. Um reset de uso veio em seguida, à meia-noite de 09-12 para 09-13.

• Pensar demais e proliferação de testes. Um tópico amplamente compartilhado no r/codex descreve a Astra respondendo a um pequeno pedido de funcionalidade construindo primeiro camadas de verificação, testes de fumaça e conferências de hash, executando-os em várias ordens, e relatando o medidor de uso quase esgotado bem antes de a funcionalidade existir. Os relatos são testemunhos individuais, e não medições controladas, e queixas semelhantes circularam sobre outros modelos de fronteira no mês anterior — portanto, encare isso como um padrão real a ser levado em conta no planejamento, não como uma taxa com que você possa contar.

• Execuções que não terminam. Armin Ronacher, o criador do Flask, descreveu ter deixado o Astra numa execução sem supervisão por 35 horas, ao fim das quais ele havia produzido aproximadamente 75.000 linhas líquidas em 79 commits, cerca de 1.400 mensagens de agente para agente e em torno de US$ 1.200 em taxas de API — cerca de US$ 15,50 por commit — com, na avaliação dele, nada de valor entregue. Os relatos sobre a contagem de tokens variam, então encare esse número com reservas. Ele enquadrou a condição de parada ausente tanto como um problema de harness quanto de modelo, o que é a leitura acionável: defina a conclusão antes de começar.

• A falha oposta também existe. Relatos da comunidade descrevem a Astra parando antes de concluir uma tarefa e esperando por um comando para continuar, o que é a mesma causa raiz vista do outro lado — uma noção subespecificada de concluído. Definir explicitamente “concluído” é a linha de maior valor no seu prompt de tarefa.

• Sessões longas podem se tornar irrecuperáveis. Problemas no Open Codex relatam um catch-22 em que a janela de contexto se enche, a compactação automática é disparada, a própria tarefa de compactação fica sem contexto e a thread não pode ser recuperada — e, separadamente, que as rotas nativas de notas e histórico retornam 404 no Pro com Astra em algumas configurações, enquanto a troca de janelas pode descartar o estado da tarefa. Ambos são relatos abertos, e não declarações do fornecedor, mas defendem manter as execuções com checkpoints no git em vez de confiar que a sessão sobreviverá.

• Notas desatualizadas são uma propriedade do design, não um bug. Nada garante que uma nota reflita o estado atual de um arquivo que ela descreve, e a busca é correspondência literal de substrings, não semântica. Armazene o caminho de origem junto com a nota, reverifique a cada alteração e trate as notas de uma execução sem supervisão como evidências a verificar, e não como verdades em que se confiar.

• Os limites de uso são a queixa atual. Relatórios da semana de 2026-09-14 incluem limites até quatro vezes mais restritos do que na semana de lançamento e uma reclamação não resolvida de que o esforço xhigh consome menos da cota do que o medium — o que, se se confirmar, significa que esforço e cota não variam juntos. A Ope​nAI não publicou limites numéricos por plano para o Astra.

Quando um modelo mais barato é a escolha certa

Os resultados medidos acima tomam a decisão de roteamento por você. A vantagem da Astra concentra-se em trabalhos que atravessam arquivos ou horas: revisão entre arquivos, tarefas agênticas de longo horizonte, fluxos de uso do computador. Em edições comuns de um único arquivo, refatorações mecânicas, estruturação de testes e formatação, o delta geral de revisão de ~4% em relação ao GPT-5.6 Sol não justifica aproximadamente 2,5x o preço atual por token — e a própria conclusão da CodeRabbit aponta na mesma direção, recomendando roteamento inteligente de tarefas em vez de substituição total. Reserve o modelo caro para as tarefas em que sua vantagem aparece e encaminhe o restante para opções mais baratas.

Concretamente, uma divisão que funciona: GPT-6 Astra para alterações entre arquivos, bases de código desconhecidas, execuções de agente com várias horas e qualquer coisa que envolva um navegador; GPT-5.6 Terra para edições delimitadas, boilerplate e geração de testes; GPT-5.6 Luna para classificação, extração e passagens mecânicas de alto volume. Na aritmética de sessão acima, a diferença entre rodar tudo no Astra e rodar um terço disso no Astra é a diferença entre aproximadamente $58,50 e aproximadamente $28 para os mesmos 150 turnos.

Acertar essa divisão é exatamente para isso que serve uma camada de roteamento. O OrcaRouter coloca mais de 200 modelos por trás de uma única API, então a divisão acima é uma mudança de configuração, e não três integrações — e o failover automático significa que um recurso experimental passando por uma semana ruim, como aconteceu com este, degrada sua execução em vez de encerrá-la. Para um modelo cujo mecanismo de contexto a própria OpenAI ainda classifica como experimental e chegou a desativar brevemente, ter um segundo caminho configurado não é paranoia; é a quantidade correta de cautela.

O que observar a partir daqui

Quatro coisas mudariam esta página, e todas as quatro estão em aberto. Se o experimento de gerenciamento de contexto volta a ser ativado e de que forma — a OpenAI diz que ele se tornará o padrão para o Astra, o que significa que a linha de configuração acima eventualmente deixa de ser algo que você define. Se os relatórios de 404 de notas e histórico no Pro forem encerrados, já que essa é a diferença entre o mecanismo funcionar como documentado e funcionar em algumas rotas. Se a OpenAI publica quaisquer dados de tokens ou custo por esforço, que é o número que falta em toda decisão de esforço hoje. E se os limites de uso que ficaram mais rígidos ao longo da semana de lançamento forem relaxados depois que a demanda que pausou novas assinaturas do Pro de US$ 200 em 10/09/2026 for absorvida.

Até então, o manual é curto. Fixe o modelo com codex -m gpt-6-astra, ative o experimento somente se você tiver um login Plus, Pro ou Pro Lite no cliente, defina o esforço explicitamente em vez de confiar no rótulo de um controle deslizante, mantenha seu contexto de trabalho abaixo de 272.000 tokens porque é aí que a conta dobra, defina o que significa concluído antes de se afastar e encaminhe o trabalho fácil para algum lugar mais barato. O modelo é de 2026-09-03 e não vai a lugar nenhum; as ferramentas ao redor dele é que ainda estão se acomodando.

As perguntas que surgem

Vale a pena ativar o recurso de notas entre janelas para tarefas de tamanho comum?Em geral, não. Ele existe para resolver perdas nas fronteiras da janela de contexto; portanto, em uma tarefa que cabe em uma única janela, ele adiciona peças móveis — incluindo um caminho de código experimental que foi desativado por causa de um bug em 2026-09-12 — sem eliminar nenhuma dor. Ative-o para trabalhos de longo prazo e deixe-o desligado para uma edição de escopo definido.

A janela de 1.050.000 tokens pode substituir a recuperação na minha configuração? Não por questões de custo. Recarregar um contexto grande a cada turno é cobrado a cada turno, e acima de 272.000 tokens de entrada a solicitação inteira passa a custar US$ 20,00 de entrada e US$ 75,00 de saída. Uma etapa de recuperação que mantém o contexto de trabalho menor costuma ser o design mais barato, e é por isso que o mecanismo de notas é interessante: é a recuperação integrada à estrutura de execução.

O que acontece com as notas quando uma tarefa termina? A documentação da Ope​nAI limita o mecanismo à mesma tarefa, e relatos da comunidade descrevem as notas como armazenadas em associação a essa tarefa, em vez de serem transferidas automaticamente. Não presuma que uma nova tarefa herde as notas da anterior; tudo o que precisa sobreviver deve ficar no seu repositório, não na memória do agente.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente