Cartão de título principal para um artigo de monitoramento de vazamentos intitulado "O Segundo Modelo em Loop da OpenAI", com o subtítulo "O que o vazamento do eixo proibido do DevDay realmente afirma", com três cartões com os dizeres "Evidência: um post no X", "ID do modelo: nenhum" e "DevDay 2026: 29 de setembro", um diagrama linear de três blocos empilhados com uma seta que faz um loop do bloco inferior de volta ao superior, rotulada "profundidade recorrente", e um rodapé com os dizeres "Não verificado: sem ID do modelo, sem preço, sem confirmação do fornecedor. Reportado em 24 de setembro de 2026."
Guides & Insights

O Segundo Modelo em Loop da OpenAI: O que o Vazamento do 'Eixo Proibido' do DevDay Realmente Alega

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há exatamente uma fonte para a alegação de que trata este artigo, e é um único post no X. Em 24 de setembro, a conta @scaling01 escreveu que o fornecedor "abriu as comportas e vai lançar seu segundo modelo de linguagem com loop, além do GPT-6 Astra, no DevDay", descrevendo a profundidade recorrente como "o eixo proibido" e observando que ele "não é mais proibido". Isso é tudo: nenhum nome de modelo, nenhum ID de modelo, nenhum preço, nenhuma data além da keynote do DevDay de 29 de setembro em São Francisco, e nenhuma palavra do fornecedor. O que torna a alegação digna do tempo do leitor não é o tweet, mas os fatos já entregues por trás dele. GPT-6 Astra, que o fornecedor lançou em 3 de setembro, é o primeiro modelo de produção de qualquer grande laboratório que reportagens associaram a uma arquitetura com loop de profundidade recorrente. GPT-6 Sol e GPT-6 Luna, lançados em 22 de setembro a US$ 2 de entrada / US$ 10 de saída e US$ 0,10 de entrada / US$ 0,50 de saída por milhão de tokens, transformaram esse carro-chefe numa escada de preços. Um segundo modelo com loop significaria que o fornecedor não trata mais a profundidade recorrente como uma aposta pontual, mas como arquitetura permanente — uma alegação maior do que qualquer lançamento isolado, e muito mais difícil de verificar.

Este é um texto do tipo "o que sabemos até agora". Tudo o que é atribuído a um autor de postagem ou a relatos anónimos é identificado como tal, e nada aqui deve ser lido como um comunicado.

Por que a frase 'eixo proibido' é a parte mais interessante do tweet

A formulação é do autor da publicação, não um termo técnico consagrado, mas aponta para algo real. No escalonamento de transformers, há três eixos óbvios: parâmetros, dados e computação de treinamento. Profundidade por recorrência é um quarto eixo, e é um eixo estranho. Em vez de empilhar N blocos distintos, um modelo com loop reutiliza a mesma pequena pilha de blocos R vezes, de modo que a profundidade efetiva é aproximadamente o número de camadas multiplicado pelo número de loops, enquanto o número de parâmetros permanece constante. O Google DeepMind apresentou a teoria em Raciocínio com Pensamentos Latentes: Sobre o Poder dos Transformers com Loop, e o amplamente citado Ampliando a Computação em Tempo de Teste com Raciocínio Latente: Uma Abordagem de Profundidade Recorrente defendeu o argumento prático.

Não é profundidade grátis. O trabalho de escalonamento iso-profundidade em modelos de linguagem em loop coloca o expoente de equivalência de recorrência em cerca de 0,46 — ou seja, um loop extra rende cerca de 46% do que um bloco genuinamente novo teria rendido. Você está comprando profundidade com desconto e pagando por ela em computação serial, em vez de memória. Essa é uma troca favorável se você estiver limitado por memória ou quiser que um modelo pequeno se comporte como um grande, que é exatamente a troca que os níveis baratos de qualquer família procuram.

Então por que "proibido"? Porque a computação que acontece dentro do loop ocorre no estado oculto, não nos tokens emitidos. O monitoramento da cadeia de pensamento — ler o que o modelo registra enquanto pensa — tem sido a principal ferramenta de garantia do setor desde que os modelos de raciocínio chegaram, e é a ferramenta que tornou o incidente do agente do Hugging Face de julho legível para os investigadores. Um modelo que faz mais do seu trabalho no espaço latente dá a essa ferramenta menos para ler. Esse tem sido o argumento contra o looping na fronteira há dois anos, e é por isso que a técnica se espalhou nos pesos abertos — o Ouro da ByteDance Seed, com 1,4B e 2,6B, e o Nanbeige4.2-3B, que passa duas vezes por uma pilha de 22 camadas — enquanto os laboratórios com compromissos de segurança publicados se mantiveram afastados dela. Os artigos MeSH e SpiralFormer da Alibaba atacaram o mesmo problema pelo lado da eficiência.

O que a OpenAI realmente disse, e o que não disse

A reportagem que deu origem a isto é a do The Information, de 1 e 2 de setembro: que a Astra usa uma técnica chamada profundidade recorrente, também descrita como recorrência opaca. Trata-se de um veículo com boas fontes e um histórico comprovado, e ainda assim é reportagem, e não documentação. A OpenAI nunca publicou um artigo de arquitetura confirmando um design em loop, e a amplamente lida análise de Sebastian Raschka sobre a Astra diz claramente que a estrutura em loop é inferida de declarações públicas — sua reconstrução faz a Astra executar seus 22 blocos duas vezes, resultando em 44 aplicações efetivas de blocos, com dois loops sendo o ideal e mais loops desestabilizando o treinamento.

O que as próprias pessoas da OpenAI disseram é mais restrito e mais cauteloso do que sugeriam a cobertura ou a reação negativa. O cientista-chefe Jakub Pachocki publicou em 2 de setembro que a profundidade do grafo de computação de modelos de fronteira, incluindo o Astra, fica dentro de um fator de dois em relação ao GPT-4 — uma quantidade limitada de repetição, não a recursão extrema que algumas manchetes insinuavam — e rebateu o que chamou de reportagem confusa, embora tenha admitido que o monitoramento da cadeia de pensamento é frágil e está numa tendência negativa. O cartão de sistema do Astra, segundo relatos, observa que a monitorabilidade dos traços de raciocínio é um degrau abaixo de GPT-5.6 Sol, o que é uma admissão real e não depende de qual arquitetura causou isso.

A reação no campo da segurança foi estrondosa. Buck Shlegeris, da Redwood Research, disse estar extremamente preocupado e alertou que aumentar a escala da recorrência poderia "destruir totalmente a monitorabilidade da CoT"; Ryan Greenblatt e Zvi Mowshowitz fizeram o mesmo argumento em registros diferentes. O contraponto mais útil veio de Raschka: a OpenAI tem retido os traços brutos de raciocínio desde a geração o1, independentemente da arquitetura, e um modelo mais forte emitindo uma cadeia de pensamento mais curta não é, por si só, evidência de um canal de raciocínio oculto.

Junte esses dois parágrafos e você obtém a situação atual em que o tweet está apostando. “Astra é looped” é uma reportagem credível que a OpenAI se recusou a confirmar. “Um segundo modelo looped será lançado em 29 de setembro” é um único post.

Cinco vazamentos da OpenAI em setembro, e onde este se encaixa

Setembro produziu um denso conjunto de reportagens sobre vazamentos da OpenAI, e o que há de útil nelas é que não são todas do mesmo tipo de evidência.

• 3 de setembro — as strings gpt-6-astra e gpt-6-astra-aeon apareceram em uma feature flag da Statsig dentro do Codex Desktop, capturadas em screenshot por @notjazii e amplificadas por @kimmonismus. A história do agente Aeon surgiu a partir disso. Cinco semanas depois, ainda não há página de produto, preço, documentação nem benchmark para o Aeon, e nenhum ID de modelo que resolva.

• 21 de setembro — uma string "GPT-6 Sol medium" surgiu em registros de merge da NVIDIA.

• 22 de setembro — três caminhos de registro do Azure, para gpt-6-sol, gpt-6-luna e gpt-6-astra-minor, foram publicados no fórum de desenvolvedores chinês locdd.com como uma URL ativa da Microsoft. Quando acessamos o endpoint de configuração do playground público no dia seguinte, os três novos nomes não estavam nele; em vez disso, o registro continha gpt-6-astra e as entradas mais antigas da geração GPT-5.6.

• 22 de setembro — GPT-6 Sol e GPT-6 Luna foram lançados. Preço, IDs dos modelos, notas de versão do SDK, uma listagem na Bedrock, uma entrada no seletor do GitHub Copilot e um padrão do Perplexity surgiram todos em até um dia.

O padrão não é sutil. As classes de vazamento que carregavam um artefato dentro de uma superfície que de fato é lançada — uma nota de versão de SDK, um registro na nuvem, uma flag de recurso de desktop — não paravam de virar produtos. As classes de vazamento que eram apenas um nome, não. A alegação de hoje, um segundo modelo de linguagem em loop vindo da OpenAI no DevDay, não carrega artefato nenhum: nenhuma string, nenhuma flag, nenhum caminho de registro, nenhuma linha de preço, nenhum ID de modelo. Isso não a torna errada. Torna-a impossível de verificar do lado de fora, o que é uma descrição diferente e mais honesta.

A programação do DevDay em torno disso é real, e excepcionalmente bem documentada

A única coisa que você consegue datar com precisão é o evento. O DevDay 2026 está confirmado para terça-feira, 29 de setembro, no Fort Mason, em São Francisco, com Sam Altman fazendo o keynote e uma transmissão ao vivo gratuita — a OpenAI anunciou a data em abril.

O que se espera dele foi sinalizado com mais força do que o habitual. Altman publicou em 15 de setembro que a OpenAI tinha um "grande lançamento esta semana, e depois, para a DevDay, lançamento x 6", e voltou atrás na primeira metade na noite seguinte: "a principal coisa que eu estava animado para lançar esta semana será na próxima semana, mas, na minha opinião, vale a pena esperar!" O líder de produto Tibo Sottiaux, que tinha enquadrado a semana como do tamanho do DevDay, disse em 19 de setembro que o lançamento ainda sairia na terça-feira, e em 22 de setembro saiu — Sol e Luna, além de um reset de uso do Codex acumulado para contas pagas. Interprete "lançamento x 6" como uma contagem de seis coisas sendo lançadas em torno do DevDay, e um segundo modelo em loop se encaixa confortavelmente no sentido comum da expressão; interprete como hipérbole e não se encaixa de modo algum. De qualquer forma, é um post de fundador, não um roadmap.

Vazamentos adjacentes apontam na mesma direção sem nomear um modelo. Uma build do Codex Cloud apareceu na build 9922 do ChatGPT para desktop com integrações de Tailscale e proxy, e um fluxo de onboarding mostrou níveis de plano para desenvolvedores — Free, Prototype e Accelerate, este último a US$ 50 — dias antes do keynote. Nenhum dos dois é um modelo em loop. Ambos são consistentes com um DevDay mais voltado para plataforma do que para pesquisa.

Se for real, qual é o modelo?

Ninguém reportou uma identidade, então o seguinte é inferência e deve ser lido como tal.

O caminho mais curto para o "segundo modelo em loop da OpenAI" é um sucessor do Astra. Altman disse que modelos mais capazes estão chegando "muito em breve", e a maneira mais barata de construir um sobre uma base de profundidade recorrente é manter a arquitetura e aumentar o orçamento de loops — mais recorrência por token em vez de mais pesos. Essa leitura também explica melhor o enquadramento de "comportas abertas", porque um segundo carro-chefe na mesma arquitetura é uma declaração de que o primeiro funcionou.

A segunda leitura é um novo nível dentro da linha GPT-6 existente. A gramática de nomenclatura já gerou as strings gpt-6-astra-minor, gpt-6-sol e gpt-6-luna, e um irmão em loop com um orçamento de profundidade diferente é totalmente consistente com uma família que agora abrange de US$ 0,10 a US$ 50 por milhão de tokens de saída. Um modelo em loop mais barato seria a versão disto que um leitor mais sente no bolso.

A terceira leitura — um lançamento de pesos abertos com loop — é a que tem menos sustentação. Ela explicaria a frase melhor do que qualquer outra coisa, e a literatura aberta sobre loops ao lado da qual ela ficaria já existe em Ouro e Nanbeige4.2-3B, mas a OpenAI não anunciou nada nessa direção para esta geração, e inventar um produto para se encaixar numa palavra é como a cobertura de vazamentos dá errado.

A two-column scoreboard titled 'GPT-6 Astra vs the second looped model - the scoreboard'. The left column, GPT-6 Astra, reads: Status: shipped Sep 3, 2026; Model ID: gpt-6-astra; Architecture: reported looped; Price per MTok: $10 / $50; Context window: about 1.05M tokens; Evidence: vendor docs and API. The right column, Second looped model, reads: Status: not announced; Model ID: none; Architecture: reported looped; Price per MTok: not published; Context window: not published; Evidence: one X post. A footer reads 'Astra figures per OpenAI and Artificial Analysis. Second looped model: unconfirmed, single social post, no vendor documentation.'

O que tornaria isto verificável antes de 29 de setembro

Observe as superfícies que resolveram os três últimos vazamentos, nesta ordem:

• Um ID de modelo que resolve na API da OpenAI, ou uma nova linha na sua página de preços.

• Uma nota de versão no SDK openai-go ou openai-node nomeando novos identificadores de modelo — foi exatamente assim que Sol e Luna vazaram sua própria chegada, com o SDK v3.65.0 trazendo identificadores de modelo horas antes de a página de anúncio entrar no ar.

• Uma listagem do Bedrock ou do Azure, ou uma nova string de flag Statsig em um build de desktop.

• Uma frase sobre arquitetura em um cartão de sistema. Esta é a que mais importaria e chegaria por último, porque a OpenAI nunca confirmou o design em loop para o Astra.

Qualquer coisa que não seja os três primeiros é um nome, e os nomes têm sido o artefato menos confiável de todo este ciclo.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the model title GPT-6 Astra with its OpenAI vendor badge and a 2026-09-04 date, Vision, Tools, JSON and Reasoning capability tags, a 1M-token context window with a 128K maximum output, text, image and file input, an input price of $10.00 and an output price of $50.00 per million tokens, a p50 time to first token of 10.00 seconds, and 298.3M tokens of traffic over seven days.

Por que isso importa mesmo que o tweet se revele errado

Duas coisas mudam se a profundidade recorrente se tornar padrão em vez de excecional.

O primeiro é a garantia. Se a próxima geração fizer mais do seu raciocínio em estado oculto, então qualquer avaliação que dependa da leitura da cadeia de pensamento escrita de um modelo perde sinal — e isso inclui a avaliação de segurança por terceiros, não apenas o monitoramento da própria OpenAI. Isso é um insumo de aquisição para qualquer pessoa com um requisito de garantia, e não será visível em uma tabela de benchmark.

O segundo é a forma da escada de preços. O Looping troca parâmetros por computação serial, então move o custo da memória para o tempo: potencialmente mais barato de hospedar, potencialmente mais lento por token. A linha GPT-6 já precifica essa troca explicitamente — GPT-6 Astra a US$ 10 de entrada / US$ 50 de saída por milhão de tokens é o modelo de profundidade, GPT-6 Sol a US$ 2 / US$ 10 é o rápido, GPT-6 Luna a US$ 0,10 / US$ 0,50 é o de alto volume. Todos os três estão ativos no OrcaRouter pelo preço de tabela da OpenAI sem mark-up, então, se um quarto modelo, em loop, chegar em 29 de setembro, a tabela de preços do nosso lado é a tabela do fornecedor no dia em que ele for lançado — e um corte de preço do fornecedor entra em vigor aqui no mesmo dia em que entra em vigor lá.

O uso prático de um vazamento como este não é previsão, é preparação. Um modelo que pode ser lançado em cinco dias e não tem benchmark independente é exatamente o caso para o qual existe o failover automático: aponte uma rota para o novo modelo, mantenha GPT-6 Astra ou GPT-6 Sol atrás dele, e uma primeira semana ruim custa uma fração do seu tráfego, em vez do seu caminho de produção. Essa também é a maneira sensata de testar um modelo intensivo em profundidade — a DSL de roteamento o compõe em uma única chamada ao lado dos modelos que ele deve substituir, e a fusão de modelos executará um painel deles com o mesmo prompt, o que é uma leitura mais rápida de uma nova arquitetura do que qualquer post de lançamento.

O que é realmente verdade esta noite

Uma postagem no X diz que o segundo modelo de linguagem com looping da OpenAI chega em 29 de setembro. Sem ID de modelo, sem preço, sem nome, sem segunda fonte, sem artefato. Por baixo disso: um carro-chefe lançado em 3 de setembro que, segundo relatos, tem looping e que a OpenAI nunca confirmou ter looping, um declínio admitido na monitorabilidade do traço de raciocínio em relação ao GPT-5.6 Sol, um cientista-chefe que diz que o looping está limitado a, no máximo, o dobro da profundidade do grafo computacional do GPT-4, e uma camada barata lançada em 22 de setembro que tornou a questão da arquitetura comercialmente relevante, em vez de acadêmica.

Essa é uma alegação tênue apoiada em uma história densa, que é o formato normal de um vazamento cinco dias antes do evento. Se um segundo modelo em loop aparecer no Fort Mason na terça-feira, o detalhe interessante não será o número do benchmark — será se o cartão do sistema repete a ressalva de monitorabilidade. É essa única frase que diz se "não mais proibido" é um slogan ou uma política.

A screenshot of the Artificial Analysis model page for OpenAI GPT-6 Astra (max), showing the model title with a 'Proprietary model, Released September 2026' label, its position of #6 of 210 on Intelligence and #82 of 210 on Verbosity, an input price of $10.00 and an output price of $50.00 per million tokens, a 52.5 output-speed reading, a $3.26 blended cost figure, a comparison summary reading that it is among the leading models in intelligence but particularly expensive, notably slow and fairly concise, and technical specifications listing text and image input, text output, and a 1M-token context window with knowledge up to April 2026.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente