
El segundo modelo en bucle de OpenAI: qué afirma realmente la filtración de 'Forbidden Axis' de DevDay
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Solo hay una fuente para la afirmación sobre la que trata este artículo, y es una sola publicación en X. El 24 de septiembre, la cuenta @scaling01 escribió que el proveedor «abrió las compuertas y lanzará su segundo modelo de lenguaje con bucles además de GPT-6 Astra en el DevDay», describiendo la profundidad recurrente como «el eje prohibido» y señalando que ya «no está prohibido». Eso es todo: ni nombre de modelo, ni ID de modelo, ni precio, ni fecha más allá del discurso principal del DevDay del 29 de septiembre en San Francisco, y ninguna declaración del proveedor. Lo que hace que la afirmación merezca el tiempo del lector no es el tuit, sino los hechos ya lanzados que la sustentan. GPT-6 Astra, que el proveedor lanzó el 3 de septiembre, es el primer modelo de producción de cualquier laboratorio importante que la cobertura periodística ha vinculado con una arquitectura de profundidad recurrente con bucles. GPT-6 Sol y GPT-6 Luna, lanzados el 22 de septiembre a $2 de entrada / $10 de salida y $0.10 de entrada / $0.50 de salida por millón de tokens, convirtieron a ese buque insignia en una escalera de precios. Un segundo modelo con bucles significaría que el proveedor ya no trata la profundidad recurrente como una apuesta puntual, sino como arquitectura permanente —una afirmación más grande que cualquier lanzamiento individual, y mucho más difícil de verificar.
Esto es un texto de lo que sabemos hasta ahora. Todo lo atribuido a un usuario que publica o a un reporte anónimo está etiquetado como tal, y nada de esto debe interpretarse como un comunicado oficial.
Por qué la frase «eje prohibido» es la parte más interesante del tuit
La redacción es del propio autor de la publicación, no es un término técnico, pero señala algo real. En el escalado de transformers hay tres ejes obvios: parámetros, datos y cómputo de entrenamiento. La profundidad por recurrencia es un cuarto eje, y es extraño. En lugar de apilar N bloques distintos, un modelo en bucle reutiliza la misma pila pequeña de bloques R veces, por lo que la profundidad efectiva es aproximadamente el número de capas multiplicado por el número de bucles, mientras que el número de parámetros se mantiene constante. Google DeepMind expuso la teoría en Razonamiento con pensamientos latentes: sobre el poder de los transformers en bucle, y el ampliamente citado Escalando el cómputo en tiempo de prueba con razonamiento latente: un enfoque de profundidad recurrente presentó el caso práctico.
No es profundidad gratis. El trabajo de escalado iso-profundidad sobre modelos de lenguaje con bucles sitúa el exponente de equivalencia de recurrencia en aproximadamente 0,46, lo que significa que un bucle adicional te proporciona alrededor del 46% de lo que habría proporcionado un bloque genuinamente nuevo. Estás comprando profundidad con descuento y pagando por ella en cómputo secuencial en lugar de memoria. Ese es un intercambio favorable si estás limitado por memoria o quieres que un modelo pequeño se comporte como uno grande, que es exactamente el intercambio que buscan las gamas económicas de cualquier familia.
Entonces, ¿por qué «prohibido»? Porque el cómputo que tiene lugar dentro del bucle se produce en el estado oculto, no en los tokens emitidos. La monitorización de la cadena de pensamiento —leer lo que el modelo escribe mientras piensa— ha sido la principal herramienta de garantía de la industria desde que llegaron los modelos de razonamiento, y es la herramienta que hizo que el incidente del agente de Hugging Face de julio fuera siquiera legible para los investigadores. Un modelo que realiza más de su trabajo en el espacio latente le da menos que leer a esa herramienta. Ese ha sido el argumento contra el bucle en la frontera durante dos años, y es la razón por la que la técnica se extendió en pesos abiertos: el modelo de ByteDance Seed, Ouro, con 1.4B y 2.6B, y Nanbeige4.2-3B, que recorre dos veces una pila de 22 capas — mientras los laboratorios con compromisos de seguridad publicados se mantuvieron alejados de ella. Los artículos de MeSH y SpiralFormer de Alibaba abordaron el mismo problema desde el lado de la eficiencia.
Lo que OpenAI realmente ha dicho, y lo que no
El reportaje que dio origen a esto es The Information, del 1 y 2 de septiembre: que Astra utiliza una técnica llamada profundidad recurrente, también descrita como recurrencia opaca. Es un medio bien documentado y con una trayectoria real, y sigue siendo un reportaje, no documentación. OpenAI nunca ha publicado un artículo de arquitectura que confirme un diseño en bucle, y el análisis ampliamente leído de Sebastian Raschka sobre Astra dice claramente que la estructura en bucle se infiere de declaraciones públicas: su reconstrucción hace que Astra ejecute sus 22 bloques dos veces, para 44 aplicaciones efectivas de bloques, con dos bucles como óptimo y más bucles desestabilizando el entrenamiento.
Lo que ha dicho la propia gente de OpenAI es más limitado y más prudente de lo que sugerían tanto la cobertura como las reacciones en contra. El científico jefe Jakub Pachocki publicó el 2 de septiembre que la profundidad del grafo de cómputo de los modelos de frontera, incluido Astra, se sitúa dentro de un factor de dos respecto a GPT-4 —una cantidad acotada de bucles, no la recursión extrema que insinuaban algunos titulares— y rebatió lo que calificó de información confusa, aunque admitió que la monitorización de la cadena de pensamiento es frágil y tiende en una dirección negativa. Según se informa, la ficha del sistema Astra señala que la monitorizabilidad de los rastros de razonamiento es un paso atrás respecto a GPT-5.6 Sol, lo cual constituye una admisión real y no depende de qué arquitectura lo causara.
La reacción en el ámbito de la seguridad fue estruendosa. Buck Shlegeris, de Redwood Research, dijo que estaba extremadamente preocupado y advirtió que aumentar la escala de la recurrencia podría «destruir por completo la monitorizabilidad de la CoT»; Ryan Greenblatt y Zvi Mowshowitz presentaron el mismo argumento en distintos registros. El contraargumento más útil vino de Raschka: OpenAI ha retenido las trazas de razonamiento sin procesar desde la generación o1, independientemente de la arquitectura, y que un modelo más fuerte emita una cadena de pensamiento más corta no es por sí mismo evidencia de un canal de razonamiento oculto.
Junta esos dos párrafos y obtendrás el estado de la cuestión por el que apuesta el tuit. «Astra está en bucle» es un reporte creíble que OpenAI ha declinado confirmar. «Un segundo modelo en bucle se lanza el 29 de septiembre» es una sola publicación.
Cinco filtraciones de OpenAI en septiembre, y dónde encaja esta
Septiembre produjo un denso cúmulo de historias sobre filtraciones de OpenAI, y lo útil de ellas es que no todas pertenecen a la misma clase de evidencia.
• 3 de septiembre — las cadenas gpt-6-astra y gpt-6-astra-aeon aparecieron en un indicador de función de Statsig dentro de Codex Desktop, capturado en pantalla por @notjazii y amplificado por @kimmonismus. La historia del agente Aeon surgió de ahí. Cinco semanas después, todavía no hay página de producto, ni precio, ni documentación, ni benchmark para Aeon, y ningún ID de modelo que se resuelva.
• 21 de septiembre — una cadena «GPT-6 Sol medium» apareció en registros de fusiones de NVIDIA.
• 22 de septiembre — tres rutas del registro de Azure, para gpt-6-sol, gpt-6-luna y gpt-6-astra-minor, se publicaron desde el foro de desarrolladores chino locdd.com como una URL activa de Microsoft. Cuando consultamos el endpoint público de configuración del playground al día siguiente, los tres nombres nuevos no estaban en él; el registro contenía gpt-6-astra y las entradas de la generación anterior GPT-5.6 en su lugar.
• 22 de septiembre — Se lanzaron GPT-6 Sol y GPT-6 Luna. El precio, los ID de los modelos, las notas de lanzamiento del SDK, una ficha en Bedrock, una entrada en el selector de GitHub Copilot y una opción predeterminada en Perplexity se sucedieron en el plazo de un día.
El patrón no es sutil. Las clases de filtraciones que llevaban un artefacto dentro de una superficie que realmente se lanza —una nota de versión de SDK, un registro en la nube, una bandera de funcionalidad de escritorio— seguían convirtiéndose en productos. Las clases de filtraciones que solo eran un nombre, no. La afirmación de hoy, un segundo modelo de lenguaje en bucle de OpenAI en DevDay, no lleva ningún artefacto en absoluto: ninguna cadena, ninguna bandera, ninguna ruta de registro, ninguna fila de precio, ningún ID de modelo. Eso no la hace incorrecta. La hace imposible de verificar desde fuera, lo cual es una descripción distinta y más honesta.
La programación de DevDay en torno a esto es real y está inusualmente bien documentada.
Lo único que se puede fechar con precisión es el evento. DevDay 2026 está confirmado para el martes 29 de septiembre en Fort Mason, en San Francisco, con Sam Altman como orador principal y una transmisión en vivo gratuita — OpenAI anunció la fecha en abril.
Lo que se espera de ello se ha dejado entrever con más fuerza de lo habitual. Altman publicó el 15 de septiembre que OpenAI tenía un «gran lanzamiento esta semana, y luego para DevDay lanzamiento x 6», y se retractó de la primera mitad la noche siguiente: «lo principal que me entusiasmaba lanzar esta semana será la próxima en su lugar, pero en mi opinión vale la pena la espera». El líder de producto Tibo Sottiaux, que había enmarcado la semana como del tamaño de DevDay, dijo el 19 de septiembre que el lanzamiento seguía previsto para el martes, y el 22 de septiembre llegó: Sol y Luna, además de un restablecimiento acumulado del uso de Codex para cuentas de pago. Si se interpreta «lanzamiento x 6» como un recuento de seis cosas que se lanzan alrededor de DevDay, un segundo modelo en bucle encaja cómodamente en el sentido ordinario de la frase; si se interpreta como hipérbole, no encaja en absoluto. En cualquier caso, es una publicación de un fundador, no una hoja de ruta.
Las filtraciones adyacentes apuntan en la misma dirección sin nombrar un modelo. Una build de Codex Cloud apareció en la build 9922 de ChatGPT para escritorio con integraciones de Tailscale y proxy, y un flujo de onboarding mostró niveles de plan para desarrolladores —Free, Prototype y Accelerate, este último a $50— días antes del keynote. Ninguna de las dos cosas es un modelo en bucle. Ambas son coherentes con un DevDay más centrado en la plataforma que en la investigación.
Si es real, ¿qué modelo es?
Nadie ha reportado una identidad, por lo que lo siguiente es una inferencia y debe leerse como tal.
El camino más corto hacia el «segundo modelo con bucles de OpenAI» es un sucesor de Astra. Altman ha dicho que llegarán modelos más capaces «muy pronto», y la forma más barata de construir uno sobre una base de profundidad recurrente es conservar la arquitectura y aumentar el presupuesto de bucles: más recurrencia por token en lugar de más pesos. Esa lectura también explica mejor el marco de las «compuertas abiertas», porque un segundo buque insignia sobre la misma arquitectura es una declaración de que el primero funcionó.
La segunda lectura es un nuevo nivel dentro de la línea GPT-6 existente. La gramática de nombres ya ha arrojado las cadenas gpt-6-astra-minor, gpt-6-sol y gpt-6-luna, y un modelo hermano en bucle con un presupuesto de profundidad distinto es totalmente coherente con una familia que ahora abarca desde $0.10 hasta $50 por millón de tokens de salida. Un modelo en bucle más barato sería la versión de esto que más le toca el bolsillo a un lector.
La tercera interpretación —un lanzamiento de pesos abiertos con bucles— es la menos respaldada. Explicaría la frase mejor que ninguna otra, y la literatura abierta sobre bucles junto a la que se situaría ya existe en Ouro y Nanbeige4.2-3B, pero OpenAI no ha anunciado nada en esa dirección para esta generación, e inventar un producto para que encaje con una palabra es la forma en que la cobertura de filtraciones sale mal.

¿Qué haría que esto fuera comprobable antes del 29 de septiembre?
Vigila las superficies que resolvieron las últimas tres fugas, en este orden:
• Un ID de modelo que se resuelva en la API de OpenAI, o una nueva fila en su página de precios.
• Una nota de versión en el SDK openai-go u openai-node que nombra nuevos identificadores de modelo: así es exactamente como Sol y Luna filtraron su propia llegada, con el SDK v3.65.0 distribuyendo identificadores de modelo horas antes de que se publicara la página del anuncio.
• Una lista de Bedrock o Azure, o una nueva cadena de flag de Statsig en una compilación de escritorio.
• Una frase sobre la arquitectura en una ficha de sistema. Esta sería la que más importaría y llegaría al final, porque OpenAI nunca ha confirmado el diseño en bucle de Astra.
Todo lo que no esté entre los tres primeros es un nombre, y los nombres han sido el artefacto menos fiable de todo este ciclo.

Por qué importa incluso si el tuit resulta ser falso
Dos cosas cambian si la profundidad recurrente pasa a ser lo habitual en lugar de lo excepcional.
El primero es la garantía. Si la próxima generación hace más de su razonamiento en estado oculto, entonces cualquier evaluación que dependa de leer la cadena de pensamiento escrita de un modelo pierde señal — y eso incluye la evaluación de seguridad por terceros, no solo la propia monitorización de OpenAI. Es un dato relevante para la adquisición para cualquiera que tenga un requisito de garantía, y no será visible en una tabla de benchmarks.
El segundo es la forma de la escalera de precios. El bucle intercambia parámetros por cómputo serial, así que traslada el costo de la memoria al tiempo: potencialmente más barato de alojar, potencialmente más lento por token. La línea GPT-6 ya le pone precio explícito a esa disyuntiva: GPT-6 Astra, a $10 de entrada / $50 de salida por millón de tokens, es el modelo de profundidad, GPT-6 Sol a $2 / $10 es el rápido, GPT-6 Luna a $0.10 / $0.50 es el de alto volumen. Los tres están disponibles en OrcaRouter al precio de lista de OpenAI sin recargo, así que si un cuarto modelo, en bucle, llega el 29 de septiembre, nuestra lista de tarifas es la lista de tarifas del proveedor el día en que se lanza, y un recorte de precios del proveedor está vigente aquí el mismo día en que lo está allí.
El uso práctico de una filtración como esta no es la predicción, sino la preparación. Un modelo que podría lanzarse en cinco días y no tiene un benchmark independiente es precisamente el caso para el que existe el failover automático: dirige una ruta al nuevo modelo, mantén GPT-6 Astra o GPT-6 Sol detrás de él, y una mala primera semana te cuesta una fracción de tu tráfico en lugar de tu ruta de producción. Esa es también la forma sensata de probar un modelo con gran profundidad: el DSL de enrutamiento lo compone en una sola llamada junto a los modelos que pretende reemplazar, y la fusión de modelos ejecutará un panel de ellos contra el mismo prompt, lo que ofrece una lectura más rápida de una nueva arquitectura que cualquier publicación de lanzamiento.
¿Qué es realmente cierto esta noche?
Una publicación en X afirma que el segundo modelo de lenguaje con bucles de OpenAI llega el 29 de septiembre. Sin ID de modelo, sin precio, sin nombre, sin segunda fuente, sin artefacto. Debajo: un modelo insignia lanzado el 3 de septiembre del que los informes dicen que tiene bucles y que OpenAI nunca ha confirmado que los tenga, una disminución admitida de la monitorizabilidad de las trazas de razonamiento respecto a GPT-5.6 Sol, un científico jefe que dice que el bucle está acotado a no más del doble de la profundidad del grafo computacional de GPT-4, y un nivel económico lanzado el 22 de septiembre que hizo que la cuestión de la arquitectura fuera comercialmente relevante más que académica.
Esa es una afirmación endeble que se sostiene sobre un relato macizo, que es la forma habitual de una filtración cinco días antes del evento. Si el martes aparece un segundo modelo en bucle en Fort Mason, el detalle interesante no será la cifra del benchmark — será si la ficha del sistema repite la salvedad sobre la monitorizabilidad. Esa sola frase es la que te dice si "ya no está prohibido" es un eslogan o una política.

Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
