Una tarjeta de título que dice «GPT-6 Astra en Codex» con el subtítulo «Notas entre ventanas, niveles de esfuerzo y la factura real», la línea «Modelo publicado el 3 de septiembre de 2026 - página de referencia verificada el 16 de septiembre de 2026», y tres tarjetas etiquetadas para config.toml, Notas más historial con búsqueda, y Coste por sesión.
Guides & Insights

GPT-6 Astra en Codex: notas entre ventanas, niveles de esfuerzo y la factura real

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-6 Astra es un modelo del 2026-09-03, y esta página no es cobertura de lanzamiento — es la referencia para apuntar tu agente de programación hacia él ahora que está ampliamente disponible. La razón por la que un desarrollador cambiaría es una mecánica específica, y vale la pena entenderla antes de gastar algo en ello: en lugar de compactar una sesión larga en un único resumen con pérdida cada vez que la ventana se llena, Co​dex con GPT-6 Astra mantiene notas a través de las ventanas de contexto y deja las ventanas de contexto anteriores como consultables, de modo que un requisito que declaraste hace cuarenta turnos y la salida de prueba que falló hace diez turnos siguen siendo recuperables en lugar de ser resumidos y descartados. Ope​nAI llama a la función experimental, la habilita con una línea en tu Co​dex config.toml, y dice que se convertirá en la opción predeterminada para Astra. Todo lo que aparece a continuación — la configuración exacta, los niveles de esfuerzo, los resultados medidos y una factura de sesión detallada que nombra la línea de entrada en caché — se leyó de las propias páginas de Ope​nAI el 2026-09-16, y cada cifra de terceros está etiquetada como tal.

Esta semana ocurrieron dos cosas que cambian los cálculos a la hora de adoptarlo. El 12 de septiembre de 2026, el responsable de Codex en OpenAI publicó un análisis post mortem en el que confirmaba que el propio experimento de gestión de contexto tenía un fallo —provocaba paradas prematuras y respuestas a mensajes obsoletos, y se desactivó para los aproximadamente 4.000–5.000 usuarios que lo usaban—, y OpenAI aplicó un restablecimiento completo del uso para los usuarios de Codex y Astra a medianoche del 12 al 13 de septiembre. Esa misma semana, los espacios de trabajo empresariales que tenían Astra desactivado de forma predeterminada en el lanzamiento pasaron a ser administrables bajo su propia tarifa. Así que la postura honesta es: vale la pena adoptar el mecanismo, la versión sigue cambiando bajo tus pies, y deberías probarlo en una rama en lugar de con una fecha límite.

¿Qué hay realmente de nuevo en Co​dex con GPT-6 Astra?

Pídele a cualquier agente de programación que trabaje durante seis horas y te topas con el mismo muro. La ventana de contexto se llena, el arnés resume la transcripción en un único bloque denso para hacer espacio, y el resumen pierde información exactamente de la manera que duele: la razón por la que falló una corrección anterior, la forma exacta de una prueba fallida, una restricción que el usuario mencionó de pasada en el tercer turno. El detalle recuperado, no el detalle resumido, es lo que realmente querías.

La integración de Astra con Co​dex cambia la forma de eso. La documentación de Co​dex de Ope​nAI lo afirma sin rodeos: "Astra guarda notas entre ventanas de contexto y puede buscar mensajes anteriores y resultados de herramientas de la misma tarea". Las notas son duraderas y se pueden escribir; el historial detrás de ellas permanece legible, así que todavía se puede buscar en una ventana anterior la evidencia original incluso después de que se haya escrito la nota sobre ella. Los requisitos y los resultados de pruebas de mensajes anteriores y de la salida de herramientas siguen siendo localizables.

OpenAI deja claro que este no es un trabajo terminado. Su referencia de configuración describe el indicador como "Habilitar la gestión experimental del contexto (desactivado de forma predeterminada)" y afirma que la función "utiliza notas e historial consultable para preservar los detalles acumulados". La documentación también indica que "no está disponible con inicio de sesión de Business, Enterprise o con clave de API en el lanzamiento". Tampoco se trata de contexto infinito: el modelo sigue razonando dentro de una ventana finita, y cada relectura de una nota anterior consume el presupuesto de entrada de ese turno. La ventana es de 1.050.000 tokens con un máximo de 922.000 tokens de entrada, según la documentación del modelo de OpenAI; el mecanismo de notas se superpone a eso, no lo reemplaza.

La configuración, exactamente tal como la documenta Ope​nAI

La configuración es hija de la tabla [features] en tu Co​dex config.toml — el archivo vive en ~/.codex/ a menos que hayas sobrescrito CODEX_HOME. La ruta de clave documentada es features.context_management.experimental_mode, un booleano, y el valor es true:

[features.context_management]
experimental_mode = true

Si ya tiene una tabla [features] en el archivo, agregue la clave correspondiente dentro de ella en lugar de declarar la tabla dos veces:

[features]
context_management.experimental_mode = true

Usa una forma o la otra. Los reportes de la comunidad sobre el flag indican que declarar la ruta con puntos en la raíz y luego abrir una tabla [features] más adelante en el mismo archivo puede fallar al analizarse como una tabla redeclarada, lo cual es una regla de TOML, no de OpenAI — pero suele dar problemas, así que elige una forma y quédate con ella. Después de editar, inicia una nueva tarea: la configuración no se aplica retroactivamente a una sesión que ya está en ejecución.

La mitad correspondiente al modelo del mismo archivo no tiene nada destacable, y la referencia de OpenAI documenta estas claves directamente: model es "Modelo a usar", model_provider tiene openai como valor predeterminado:

model = "gpt-6-astra"
model_provider = "openai"
model_reasoning_effort = "high"

Una advertencia sobre la lectura de versiones de la documentación. La referencia de configuración de Co​dex enumera model_reasoning_effort como que acepta minimal, low, medium, high y xhigh, y señala que xhigh depende del modelo — mientras que la página del modelo de la API de Ope​nAI para gpt-6-astra documenta reasoning.effort como low, medium, high, xhigh y max. El control deslizante del cliente y la API no describen el mismo conjunto, así que establece effort de forma explícita y confirma qué aceptó tu cliente en lugar de suponerlo.

Seleccionar el modelo — y la regla de acceso que pilla a la gente

La documentación del modelo Codex de OpenAI proporciona directamente la forma de CLI: codex -m gpt-6-astra. En una sesión interactiva, /model cambia el modelo y ajusta el esfuerzo de razonamiento; en una ejecución única, codex exec -m gpt-6-astra "Review the current changes" funciona de la misma manera. En la aplicación de escritorio y la extensión de IDE, el control del modelo se encuentra debajo del compositor.

La regla de acceso es donde la gente se equivoca, y vale la pena leerla dos veces porque las dos funciones tienen puertas diferentes:

• El modelo —disponible en ChatGPT Work, Co​dex y la API, y también servido en Microsoft Azure y AWS Bedrock. La página de lanzamiento de Ope​nAI afirma que Astra se estaba "implementando hoy para un conjunto limitado de organizaciones y que en los próximos días estará disponible para todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise".

• La gestión experimental del contexto — más limitada. La documentación de Ope​nAI indica que “Requiere iniciar sesión en ChatGPT con Plus, Pro o Pro Lite” y que “no está disponible con inicio de sesión mediante Business, Enterprise o clave de API en el lanzamiento”.

Esa segunda línea es la que hay que interiorizar. Puedes llamar a gpt-6-astra con una clave de API, y puedes pagarlo con un plan Business, pero la función de notas entre ventanas no estará ahí. Si el mecanismo de notas es la razón por la que te cambias, necesitas iniciar sesión en el cliente de Co​dex con una cuenta de ChatGPT Plus, Pro o Pro Lite, no una clave de API. Ope​nAI lo plantea como que la disponibilidad depende de «el despliegue, tu método de inicio de sesión y tu cliente», que es la versión educada de lo mismo.

A screenshot of OpenAI's official Codex models documentation showing the model and reasoning control beneath the composer set to '5.6 Sol Extra High', a note that Ultra mode uses subagents, and a Recommended models row of three cards - Astra described as the most capable model for complex work across code, apps and research with advanced reasoning and computer use, 5.6 Sol for complex coding and cybersecurity, and 5.6 Terra as the balanced lower-cost model. A GPT-5.5 retirement notice dated October 14, 2026 appears above.

Dos salvedades adicionales, etiquetadas como reportadas y no como documentadas por el proveedor. La cobertura del despliegue afirma que se requiere la versión 0.153.0 o posterior de Codex CLI para Astra; no pudimos confirmar esa versión mínima en las propias páginas de OpenAI. Y la documentación de Codex describe preajustes del selector de modelos —Astra Light, Astra Medium, Astra Extra High—, ofrecidos a las cuentas elegibles Pro, Business ($100) y Enterprise junto con el control deslizante de razonamiento. Esas son posiciones del selector, no productos separados: OpenAI documenta un único id de modelo, gpt-6-astra, con un único conjunto de especificaciones y un único precio, y no publica ninguna especificación ni tarifa separada para configuración alguna de “Astra Pro” o “Astra Medium”. Considera sin verificar cualquier cifra que se cite para un nivel de Astra con nombre.

Si quieres probar el modelo antes de comprometer con él una ruta de producción, enrutarlo a través de un único endpoint junto a tu modelo actual es la forma más económica de averiguarlo: GPT-6 Astra está en el catálogo de OrcaRouter, así que una ejecución comparativa te cuesta una cadena de modelo en lugar de un segundo contrato y un segundo SDK.

Esfuerzo de razonamiento: cinco niveles y cuánto cuesta cada uno

La documentación de la API de Ope​nAI para gpt-6-astra enumera cinco niveles de esfuerzo —low, medium, high, xhigh y max— y la guía de Co​dex es directa sobre cómo usarlos: "Usa el nivel de esfuerzo de razonamiento más bajo que produzca el resultado que necesitas", y empieza con el predeterminado, aumentándolo cuando una tarea necesite una planificación más profunda.

La razón por la que ese consejo es caro de ignorar en este modelo en concreto es dónde se contabilizan los tokens de razonamiento en la factura. Los tokens de razonamiento son tokens de salida, y la salida en Astra es de $50.00 por millón — diez veces la tarifa de entrada y cincuenta veces la tarifa de entrada en caché. Así que la disyuntiva no es abstracta:

• Cada 1,000 tokens de razonamiento adicionales por turno cuestan $0.05 a la tarifa de salida.

• A lo largo de una sesión de 150 turnos, mantener 1.000 tokens de razonamiento adicionales por turno cuesta alrededor de $7,50; mantener 5.000 adicionales cuesta alrededor de $37,50.

• En la sesión de ejemplo que se muestra a continuación, la salida ya es la línea individual más grande, con $0.200 por turno frente a $0.090 de lecturas de caché — el crecimiento del razonamiento es el término que mueve el total más rápido.

Lo que Ope​nAI no publica es una tabla por nivel de esfuerzo: no hay ninguna cifra del proveedor sobre cuántos tokens de razonamiento emite xhigh o max en una tarea de programación en relación con medium, ni un benchmark del proveedor desglosado por esfuerzo. Cualquiera que te dé una proporción precisa de "max cuesta 2x" está citando su propia medición, no la de Ope​nAI. El método honesto es ejecutar una tarea representativa con dos niveles de esfuerzo y leer el bloque de uso en la respuesta — ese número, multiplicado por $50 por millón, es tu verdadero sobrecoste por nivel de esfuerzo.

Los resultados medidos, cada uno con su propia fuente

Trabajo de programación y de terminal, todo reportado por el proveedor Ope​nAI salvo que se indique lo contrario. Terminal-Bench 4.0: GPT-6 Astra con 57,9 % frente a 37,3 % de GPT-5.6 Sol y 55,8 % de Claude Fable 5.1, y Ope​nAI estima un costo de API por tarea aproximadamente 9 % menor frente a GPT-5.6 Sol y 63 % menor frente a Claude Fable 5.1. DeepSWE v1.1 de Datacurve sitúa a Astra en 74,1 % en el benchmark propio de Datacurve, una cifra que Datacurve describe como un nuevo récord y que algunos medios redondean a 74 %. En el conjunto agéntico más amplio, Ope​nAI reporta OSWorld 2.0 con 72,6 % en aproximadamente 40 minutos por tarea —alrededor de 47 % menos de tiempo por tarea que GPT-5.6 Sol—, junto con FrontierMath Tier 4 con 98 %, ARC-AGI-3 con 99,9 % y ExploitBench con 100 %, todos descritos por Ope​nAI como niveles saturados o efectivamente saturados. Esos son los números del proveedor; no los hemos reproducido, y el escrutinio independiente de la cifra de ARC-AGI-3 por parte de ARC Prize encontró que se midió en un entorno especial de adaptador de proveedor y que cae en condiciones estándar.

El dato que no es una cifra de proveedor es el que más debería importarle a un flujo de trabajo de revisión de código. CodeRabbit publicó su propia evaluación de Astra el 4 de septiembre de 2026, y el resultado es más acotado que el titular. En las solicitudes de extracción entre archivos —las revisiones difíciles que requieren conectar un cambio con consecuencias en otras partes de la base de código—, Astra detectó alrededor de un 20% más de errores que GPT-5.6 Sol, con una cobertura de errores accionables del 57,1% frente al 47,6%. En las revisiones generales, la ganancia se desvanece en gran medida: 61,3% frente a 59,0%, aproximadamente un 4% más. CodeRabbit caracteriza ambos como "resultados tempranos y direccionales" que no establecen una clasificación, y señala que su método no aísla la causa de la mejora. La página de lanzamiento de Ope​nAI caracteriza el mismo trabajo como "más del doble en solicitudes de extracción entre archivos"; el propio informe de CodeRabbit da el 20% y los porcentajes de cobertura anteriores. Lee los porcentajes, no el resumen.

A single-column scoreboard titled 'GPT-6 Astra in Codex - the scoreboard' with six rows: Terminal-Bench 4.0 at 57.9%, DeepSWE v1.1 at 74.1%, Mind2Web at 1.9x faster, context window of 1,050,000 tokens, cached input at $1.00 per 1M, and output at $50.00 per 1M. A footer reads 'OpenAI-reported except DeepSWE v1.1 (Datacurve); pricing per OpenAI, read September 16, 2026.'

Esa asimetría es el número más útil de esta página para decidir cómo desplegar el modelo, y apunta en la misma dirección que el precio: la ganancia se concentra en el razonamiento entre archivos, así que ahí es donde gastas el modelo.

Qué cambia el uso de computadora en Codex para tu flujo de trabajo

Ope​nAI dice que el arnés actualizado de Co​dex hace que GPT-6 Astra sea 1,9 veces más rápido al completar tareas en Mind2Web que la experiencia actual con GPT-5.6 Sol. Mind2Web es automatización de tareas web, así que interprétalo así: el trabajo de agentes que tiene que interactuar con un navegador o una GUI se completa sustancialmente más rápido, y ese mismo arnés actualizado es el que estás ejecutando siempre que usas Co​dex. La cifra complementaria es el resultado de OSWorld 2.0 que aparece arriba: 72,6 % con unos 40 minutos por tarea, aproximadamente un 47 % menos de tiempo por tarea que Sol.

Para un desarrollador, la consecuencia práctica es un cambio en qué merece la pena delegar. Los flujos de trabajo que antes eran demasiado lentos para automatizarlos de principio a fin —manejar una consola de staging sin API, reproducir un error a través de una interfaz de usuario, recorrer un formulario de varios pasos para generar un fixture— entran dentro del rango en el que una ejecución de un agente resulta más barata que hacerlo a mano. También eleva el valor de los controles del lado empresarial que OpenAI lanzó junto con ellos: ChatGPT Work y Codex añaden políticas de confirmación, es decir, aprobación antes de acciones con consecuencias, y revisión automatizada de llamadas a herramientas inseguras o no autorizadas. Si dejas que un agente haga clic por una interfaz real, esa capa de revisión es lo que separa una mala ejecución de una mala tarde, y por eso el que el acceso empresarial esté desactivado de forma predeterminada, con un administrador que lo habilita según la tarifa aplicable, sea una característica de gobernanza y no un obstáculo.

Cobrar por el flujo de trabajo, no por el token

Aquí está el precio, con nombre y fecha. Según la página de precios de OpenAI, consultada el 2026-09-16, gpt-6-astra standard cuesta $10.00 por millón de tokens de entrada, $1.00 por millón de tokens de entrada en caché, $12.50 por millón de escrituras en caché y $50.00 por millón de tokens de salida. Batch y Flex funcionan a la mitad de esas tarifas; el modo Fast las duplica. Esa línea de entrada en caché es la que decide tu factura en un bucle agéntico, porque un agente de programación reenvía un contexto grande y mayormente sin cambios en cada turno, y la entrada en caché cuesta una décima parte de la entrada nueva.

Antes de hacer los cálculos, hay dos umbrales que importan. La documentación del modelo de OpenAI indica que los prompts que superan los 272.000 tokens de entrada se facturan al doble de las tarifas de entrada y de caché, y a 1,5 veces la de salida por la solicitud completa —no solo el exceso—, y la página de precios incluye la fila de contexto largo con $20.00 por entrada, $2.00 por entrada en caché y $75.00 por salida. Y cada token de razonamiento se factura a la tarifa de salida, como se ha explicado antes.

Tomemos una refactorización nocturna realista: 150 turnos del modelo, un promedio de 100,000 tokens de entrada por turno, de los cuales 90,000 son una lectura de caché y 10,000 son nuevos, y 4,000 tokens de salida por turno, incluido el razonamiento. Por debajo del umbral de 272K, a tarifas estándar:

• Entrada en caché — 90.000 tokens × $1,00 por millón = $0,090 por turno

• Entrada nueva — 10,000 tokens × $10.00 por millón = $0.100 por turno

• Salida — 4.000 tokens × $50,00 por millón = $0,200 por turno

• Total — $0.390 por turno, así que 150 turnos son unos $58.50 por la sesión

Ahora mueve la misma sesión por encima del umbral. Con 300.000 tokens de entrada por turno —270.000 en caché, 30.000 nuevos—, toda la solicitud cambia de precio, así que la entrada en caché se duplica a $2.00, la entrada nueva se duplica a $20.00 y la salida pasa a $75.00:

• Entrada en caché — 270.000 × $2,00 por millón = $0,540 por turno

Entrada nueva — 30.000 × $20,00 por millón = $0,600 por turno

• Salida — 4.000 × $75,00 por millón = $0,300 por turno

• Total — $1.44 por turno, o aproximadamente $216.00 por 150 turnos

La misma forma de tarea, una factura aproximadamente 3,7 veces mayor, y toda la diferencia está en de qué lado de los 272.000 tokens se sitúa tu transcripción. Ese es, en una línea, el argumento a favor del mecanismo de notas: si las notas duraderas y un historial consultable te permiten mantener un contexto de trabajo más ligero en lugar de arrastrar toda la transcripción hacia adelante, la función se amortiza en tokens de entrada antes de que llegue a ayudar con la calidad. También es el argumento para no dejar que una ejecución desatendida haga crecer una transcripción sin un límite máximo.

A screenshot of the OrcaRouter model page for GPT-6 Astra showing the catalog id openai/gpt-6-astra, 1M tokens of context and 128K max output, text, image and file input with text output, reasoning, coding and agentic use cases, $10.00 per 1M input and $50.00 per 1M output, the /v1/chat/completions and /v1/responses endpoints, and an OpenAI-compatible code sample pointed at api.orcarouter.ai/v1.

Como referencia, esa misma sesión de 150 turnos con el mismo perfil de tokens en los niveles más económicos: GPT-5.6 Terra, con sus tarifas publicadas de $2,00 de entrada / $0,20 en caché / $12,00 de salida, sale por unos $12,90, y GPT-5.6 Luna, a $0,20 / $0,02 / $1,20, sale por unos $1,29. Son operaciones aritméticas sobre las tarifas publicadas de Ope​nAI, no la afirmación de que completarían la misma tarea, que es precisamente de lo que tratan las dos secciones siguientes.

Si estás comparando todo esto entre proveedores, vale la pena saber que OrcaRouter traspasa el precio de lista del proveedor con un 0 % de margen, por lo que un cambio de precio del proveedor se refleja en el endpoint enrutado el mismo día, en lugar de en la siguiente factura.

Los modos de fallo que hay que tener en cuenta al diseñar

Astra es un modelo de horizonte largo sobre un diseño de contexto largo, y ambas mitades de esa descripción son donde residen los problemas. Estos son hallazgos de la comunidad y análisis post mortem de proveedores, no nuestras mediciones.

• El experimento de gestión de contexto tuvo un error esta semana. El análisis posterior de OpenAI del 12/09/2026 confirma que el experimento opcional «provocó paradas prematuras y respuestas a mensajes obsoletos», afectando a entre 4.000 y 5.000 usuarios aproximadamente, y fue desactivado. Ese mismo análisis posterior señala otras dos causas de las quejas de calidad de la semana del lanzamiento: habilidades escritas para modelos anteriores que fallaban e impedían que Astra comprobara su propio trabajo, y motores de servicio mal configurados que degradaban una cola del tráfico. A continuación, a medianoche del 12 al 13 de septiembre, se produjo un restablecimiento del uso.

• Pensar demasiado y proliferación de pruebas. Un hilo muy compartido en r/codex describe que Astra, ante una pequeña solicitud de función, primero construyó capas de verificación, pruebas de humo y comprobaciones de hash, las ejecutó en varios órdenes y reportó el medidor de uso casi agotado mucho antes de que la función existiera. Los informes son relatos individuales, no mediciones controladas, y quejas similares circularon sobre otros modelos de vanguardia el mes anterior, así que trátalo como un patrón real con el que hay que delimitar el alcance, no como una tasa con la que puedas planificar.

• Ejecuciones que no terminan. Armin Ronacher, el creador de Flask, describió haber dejado Astra en una ejecución no supervisada durante 35 horas, al cabo de las cuales había producido aproximadamente 75.000 líneas netas en 79 commits, alrededor de 1.400 mensajes de agente a agente y unos $1.200 en tarifas de API —aproximadamente $15,50 por commit— con, según su evaluación, nada de valor entregado. Los informes sobre el recuento de tokens varían, así que toma esa cifra con cautela. Enmarcó la condición de parada faltante como un problema tanto del arnés como del modelo, lo cual es la lectura práctica: define la finalización antes de empezar.

• También existe el fallo opuesto. Los informes de la comunidad describen que Astra se queda corta antes de terminar una tarea y espera una indicación para continuar, que es la misma causa raíz vista desde el otro lado: una noción de «terminado» insuficientemente especificada. Definir explícitamente «terminado» es la línea de mayor valor en el prompt de tu tarea.

• Las sesiones largas pueden volverse irrecuperables. Los problemas abiertos de Co​dex reportan un círculo vicioso en el que la ventana de contexto se llena, se activa la compactación automática, la propia tarea de compactación se queda sin contexto y el hilo no se puede recuperar — y, por separado, que las rutas nativas de notas e historial devuelven 404 en Pro con Astra en algunas configuraciones, mientras que cambiar de ventana puede descartar el estado de la tarea. Ambos son informes abiertos en lugar de declaraciones del proveedor, pero abogan por mantener las ejecuciones con puntos de control en git en lugar de confiar en que la sesión sobreviva.

• Las notas obsoletas son una propiedad del diseño, no un error. Nada garantiza que una nota refleje el estado actual de un archivo que describe, y la búsqueda es una coincidencia literal de subcadenas en lugar de semántica. Guarda la ruta de origen con la nota, vuelve a verificar cuando cambie y trata las notas de una ejecución sin supervisión como evidencia que hay que comprobar, no como una verdad en la que confiar.

• Los límites de uso son la queja actual. Los informes de la semana del 2026-09-14 incluyen límites hasta cuatro veces más estrictos que la semana del lanzamiento y una queja sin resolver de que el esfuerzo xhigh consume menos de la cuota que el medium — lo que, de ser cierto, significa que el esfuerzo y la cuota no se mueven juntos. OpenAI no ha publicado límites numéricos por plan para Astra.

Cuándo un modelo más económico es la decisión correcta

Los resultados medidos anteriores toman por ti la decisión de enrutamiento. La ventaja de Astra se concentra en el trabajo que abarca varios archivos o varias horas: revisión entre archivos, tareas agénticas de horizonte largo, flujos de uso de computadora. En ediciones ordinarias de un solo archivo, refactorizaciones mecánicas, andamiaje de pruebas y formateo, el delta general de revisión de ~4% frente a GPT-5.6 Sol no justifica aproximadamente 2,5 veces el precio actual por token — y la propia conclusión de CodeRabbit apunta en la misma dirección, recomendando enrutamiento inteligente de tareas en lugar de un reemplazo total. Reserva el modelo costoso para las tareas donde su ventaja se manifiesta, y enruta el resto a niveles inferiores.

Concretamente, una división que funciona: GPT-6 Astra para cambios entre archivos, bases de código desconocidas, ejecuciones de agentes de varias horas y cualquier cosa que toque un navegador; GPT-5.6 Terra para ediciones acotadas, código repetitivo y generación de pruebas; GPT-5.6 Luna para clasificación, extracción y pasadas mecánicas de gran volumen. Con la aritmética de sesión anterior, la diferencia entre ejecutarlo todo en Astra y ejecutar un tercio en Astra es la diferencia entre aproximadamente $58.50 y aproximadamente $28 para los mismos 150 turnos.

Acertar con esa división es exactamente para lo que sirve una capa de enrutamiento. OrcaRouter pone más de 200 modelos detrás de una sola API, así que la división anterior es un cambio de configuración y no tres integraciones — y la conmutación por error automática hace que una función experimental que pasa una mala racha, como le ocurrió a esta, degrade tu ejecución en lugar de terminarla. Para un modelo cuyo mecanismo de contexto Ope​nAI todavía etiqueta como experimental y desactivó brevemente, tener una segunda ruta configurada no es paranoia; es la cantidad correcta de cautela.

Qué observar a partir de ahora

Cuatro cosas cambiarían esta página, y las cuatro están abiertas. Si el experimento de gestión de contexto se vuelve a activar y de qué forma —Ope​nAI dice que se convertirá en el predeterminado para Astra, lo que significa que la línea de configuración de arriba con el tiempo deja de ser algo que tú estableces—. Si se cierran los reportes de 404 de notas e historial en Pro, ya que esa es la diferencia entre que el mecanismo funcione como se documenta y que funcione en algunas rutas. Si Ope​nAI publica datos de tokens o costos por esfuerzo, que es el número que falta en cada decisión de esfuerzo hoy. Y si los límites de uso que se endurecieron durante la semana de lanzamiento se relajan una vez que se absorba la demanda que pausó las nuevas suscripciones Pro de $200 el 10 de septiembre de 2026.

Mientras tanto, el manual es breve. Fija el modelo con codex -m gpt-6-astra, activa el experimento solo si tienes un inicio de sesión Plus, Pro o Pro Lite en el cliente, establece el esfuerzo de forma explícita en lugar de confiar en la etiqueta de un control deslizante, mantén tu contexto de trabajo por debajo de 272.000 tokens porque ahí es donde se duplica la factura, define qué significa "terminado" antes de marcharte y dirige el trabajo fácil a algún lugar más barato. El modelo es del 2026-09-03 y no va a desaparecer; lo que aún se está asentando son las herramientas que lo rodean.

Las preguntas que surgen

¿Vale la pena habilitar la función de notas entre ventanas para tareas de tamaño normal?En general, no. Existe para resolver la pérdida de información entre los límites de la ventana de contexto, así que en una tarea que cabe en una sola ventana añade piezas móviles —incluida una ruta de código experimental que se deshabilitó por un error el 2026-09-12— sin eliminar ninguna molestia. Actívala para trabajos de largo horizonte y déjala desactivada para una edición acotada.

¿Puede la ventana de 1,050,000 tokens reemplazar la recuperación en mi configuración? No por cuestiones de costo. Leer un contexto grande de vuelta en cada turno se factura en cada turno, y por encima de 272,000 tokens de entrada toda la solicitud pasa a costar $20.00 de entrada y $75.00 de salida. Un paso de recuperación que mantiene más pequeño el contexto de trabajo suele ser el diseño más económico, y por eso el mecanismo de notas es interesante: es recuperación integrada en el arnés.

¿Qué ocurre con las notas cuando finaliza una tarea? La documentación de Ope​nAI limita el mecanismo a la misma tarea, y los textos de la comunidad describen que las notas se almacenan asociadas a esa tarea en lugar de transferirse automáticamente. No asumas que una tarea nueva hereda las notas de la anterior; todo lo que deba perdurar pertenece a tu repositorio, no a la memoria del agente.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario