
OpenAI Astra: Todo lo que sabemos sobre el modelo que no es GPT-6
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 200 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
Lo que puedes descargar hoy no es un modelo. Son diez archivos de código Lean. El 1 de agosto de 2026, OpenAI publicó una publicación de investigación sobre matemáticas, y enterrado en ella estaba la primera confirmación del nombre de su próximo sistema de frontera: Astra. No hay tarjeta de modelo, ni página de precios, ni endpoint de API, ni fecha. El buque insignia actual al que realmente puedes llamar sigue siendo GPT-5.6 Sol, a 5 dólares por millón de tokens de entrada y 30 dólares por millón de tokens de salida, exactamente como ha sido desde el 9 de julio.
Si buscaste GPT-6, esta es la versión corta: OpenAI nunca ha anunciado un modelo con ese nombre y, a día de hoy, no ha decidido si Astra se lanzará como GPT-6, como una versión puntual de GPT-5 tipo GPT-5.7, o como un cuarto nivel junto a Sol, Terra y Luna. Esa ambigüedad de nomenclatura no es timidez ante la prensa. Es una pregunta interna candente, reportada por The Information el 31 de julio y sin resolver desde entonces.
Lo que sigue separa tres cosas que la mayor parte de la cobertura de esta historia mezcla: lo que la propia OpenAI declaró, lo que añade el periodismo creíble y lo que circula sin ninguna fuente adjunta. Las pruebas son artefactos reales que puedes compilar. La cifra de 10 billones de parámetros es un número que alguien escribió en internet. Esas merecen un peso muy distinto.
Lo que OpenAI realmente dijo — y la lista mucho más larga de lo que no dijo
El anuncio no llegó como un lanzamiento de producto. Llegó como un artículo. La publicación de OpenAI describió resultados producidos por «una versión interna de Astra, nuestro próximo modelo principal», en problemas que, según su planteamiento, no habían visto progreso en el resultado principal durante al menos una década. Astra fue presentado como un sistema diseñado para trabajos de larga duración: múltiples agentes coordinándose en diferentes partes de un gran problema durante períodos prolongados, en lugar de responder en una sola pasada.
Eso está cerca de la descripción técnica oficial completa. Frente a ello, la lista de ausencias es sorprendente:
• Confirmado por OpenAI — el nombre Astra; que es el "próximo modelo principal"; que una versión interna produjo diez resultados; la intención de diseño multiagente y de horizonte largo; un manuscrito de 249 páginas; certificados de Lean 4 en un repositorio público; una estimación de costo de tokens citada a tasas de GPT-5.6 Sol.
• No indicado por OpenAI — fecha de lanzamiento; precio; ventana de contexto; número de parámetros; cualquier puntuación de referencia; la tarjeta del modelo; si llega a ChatGPT o solo a la API; cuántos agentes se ejecutaron, durante cuánto tiempo, en qué hardware; los avisos; la tasa de éxito; el nombre final del producto.
La información creíble completa un poco el panorama. The Information informó que Sam Altman demostró Astra a los responsables políticos en Washington a finales de julio — una sesión informativa que, según ese reportaje, incluyó a los senadores Raphael Warnock, Bernie Moreno y Mark Warner, con el secretario del Tesoro Scott Bessent y el secretario de Comercio Howard Lutnick también presentes. Se describe que la familia de modelos ya está en fase de pruebas, y que "Astra" en sí sigue siendo una etiqueta provisional.
Nadie fuera de OpenAI ha ejecutado este modelo en nada. Cada afirmación de capacidad en circulación se remonta o bien a las diez pruebas publicadas o bien a una demo que el público no vio.
Las diez demostraciones: inusualmente verificables, y aún sin resolver.

Aquí es donde el anuncio es genuinamente más sólido que una caída típica de benchmarks, y vale la pena ser precisos sobre por qué. OpenAI no publicó una puntuación y pidió que se le creyera. Publicó artefactos verificables por máquina bajo Apache 2.0 en el repositorio openai/ten-proofs — un archivo Lean por resultado, fijado a Lean 4.32.0 con una dependencia de mathlib, junto con un directorio ComparatorChallenges para verificación independiente. El repositorio se publicó como un único commit el 1 de agosto y desde entonces ha acumulado varios cientos de estrellas y decenas de forks.
Los diez resultados, tal como los nombra el repositorio, abarcan un espectro inusualmente amplio de campos:
• Teoría de grupos — la construcción de un grupo no sófico, que responde negativamente a una pregunta abierta desde 1999. La soficidad es una propiedad que satisfacen casi todos los grupos con los que trabajan los matemáticos; si todo grupo contable discreto debe satisfacerla había permanecido durante 27 años.
• Álgebras de operadores — un contraejemplo en relación con la conjetura de rigidez de Connes, planteada por el medallista Fields Alain Connes en 1980.
• Geometría de alta dimensión — una mejora del método de empaquetamiento de esferas, reportada como la primera de su tipo desde 1978 — además de una forma precisa de la desigualdad de volumen de Ehrhart.
• Teoría de la codificación — nuevas cotas para códigos binarios y esféricos.
• Complejidad — una cota inferior de circuito aritmético para el permanente, y un resultado exponencial de repetición paralela para juegos entrelazados.
• Criptografía de retículos — dureza polinómica fija para el problema del vector más cercano.
• Combinatoria extremal — la escala de crecimiento de los números de Ramsey de triángulos multicolores, y contraejemplos en teoría extremal de grafos, incluyendo trabajo sobre varios problemas de Erdős catalogados.
Las reacciones de los matemáticos fueron de interés más que desdeñosas. Thomas Bloom, quien mantiene la base de datos de problemas de Erdős, calificó los resultados como una gran noticia y los valoró por encima del contraejemplo de la conjetura de distancia unitaria de mayo. Noam Brown, de OpenAI, ofreció una útil desinflada desde dentro: «Lamentablemente, no hay Problemas del Milenio (todavía)».
Lo que un certificado de Lean resuelve, y lo que deja abierto
Una demostración en Lean que comprueba tipos es válida por construcción. No tienes que confiar en la metodología de evaluación de OpenAI, en su elección de líneas base ni en su interpretación de sus propios resultados: puedes compilar los archivos. Para una industria donde «obtuvimos un 94,1 %» es la unidad estándar de evidencia, eso supone una mejora significativa en falsabilidad.
También es más limitado de lo que implican los titulares, en cuatro aspectos específicos. Lean comprueba que la prueba de una declaración formal es sólida. No comprueba que la declaración formal sea el teorema que afirma el texto. No comprueba que las definiciones codificadas coincidan con lo que el campo significa con esas palabras. No comprueba las reducciones informales que conectan los extremos formales con el resultado principal. Y no dice nada sobre la novedad — si un resultado es nuevo o ya se conocía con otro nombre.
Las cuatro son cuestiones de juicio humano y, hasta el anuncio, ninguna había pasado por una revisión de pares. El manuscrito reconoce consultas con especialistas; los agradecimientos no son un respaldo de cada afirmación. Una compilación parcial publicada del repositorio compiló 8.820 de 9.007 trabajos, lo que se parece a una gran formalización real a mitad de verificación, no a una auditoría terminada. El estado honesto hoy es diez afirmaciones de investigación serias y formalmente codificadas, no diez entradas asentadas en el canon matemático.
Hay un segundo límite, más silencioso: el proceso de descubrimiento no es reproducible por nadie fuera de OpenAI. Las pruebas son públicas; el sistema de búsqueda, las indicaciones, los puntos de control y el entorno de ejecución no lo son. Puedes verificar el destino. No puedes volver a recorrer el viaje.
La cifra de $2,000, y por qué compra menos de lo que parece

La cifra que más lejos llegó fue el costo. OpenAI situó el gasto en tokens de las diez soluciones en unos $2,000, valorados a las tarifas de GPT-5.6 Sol — unos $200 por problema abierto de hace una década, según la lectura más común de su redacción. Parte de la cobertura interpretó la misma frase como menos de $2,000 porproblema, una diferencia de diez veces; la publicación de OpenAI es lo bastante escueta como para que ambas lecturas llegaran a la prensa, y no hemos visto que la empresa la aclare.
Toma la lectura total y haz los cálculos. Sol factura $5 por millón de tokens de entrada y $30 por millón de salida, y los tokens de razonamiento se facturan como salida. Si el gasto fuera enteramente de salida, $2,000 compran como máximo unos 67 millones de tokens de salida — aproximadamente 6.7 millones por problema. Eso es mucho razonamiento, y no es una cantidad absurda de razonamiento. Es el tipo de presupuesto que un grupo de investigación bien financiado ya podría gastar en una sola pregunta difícil.
Tres advertencias importan más que el titular:
• Es un precio contrafáctico, no un precio. Astra no está publicada ni tiene precio. Los $2.000 describen lo que esos tokens costarían según las tarifas de otro modelo. Un sistema de vanguardia construido para ejecuciones multiagente de varias horas no tiene ninguna razón obvia para tener un precio como el de Sol, y todas las razones para tener un precio superior al de Sol.
• Solo cuenta las victorias. No se publicó ninguna tasa de éxito. No sabemos a cuántos problemas se enfrentó Astra y no logró resolver, ni cuánto costaron esos intentos. Un costo por éxito publicado sin una tasa de éxito no es un costo por resultado, y la diferencia podría ser de un orden de magnitud en cualquier dirección.
• Los tokens son la parte barata. Los humanos plantearon los problemas, prepararon los manuscritos y llevaron a cabo la formalización. Ese trabajo no está incluido en los $2,000.
La parte de esto que puedes cotizar hoy es la línea base. Como OrcaRouter transmite el precio de lista del proveedor directamente con un margen del 0%, GPT-5.6 Sol cuesta lo mismo, $5/$30, en nuestra API que en la de OpenAI — así que si quieres comprobar los cálculos con tu propia carga de trabajo, la tarifa del anuncio es la tarifa que realmente pagarías. Lo que nadie puede cotizar todavía es Astra en sí, y cualquier proveedor que te diga lo contrario está adivinando.
La fecha de lanzamiento está controlada por un reloj de 30 días, no por una filtración.

La mayor parte de la cobertura sobre "cuándo llegará GPT-6" es aritmética de rumores. Hay una restricción más concreta a plena vista que apenas se ha vinculado con la pregunta.
Una orden ejecutiva firmada el 2 de junio de 2026 instruyó a las agencias federales a poner en marcha un proceso de revisión voluntario bajo el cual los desarrolladores de modelos frontera someten sus modelos a revisión gubernamental hasta 30 días antes de su publicación pública. El marco estaba previsto que entrara formalmente en vigor el 1 de agosto, el mismo día en que se publicó la entrada sobre Astra. Según los informes, se espera que Astra sea el primer modelo en pasar por este proceso.
"Voluntary" está haciendo un trabajo considerable en esa frase. En la práctica, la administración ya ha influido antes en el momento de los lanzamientos, y el propio comportamiento reciente de OpenAI parece un ensayo: GPT-5.6 se limitó a unas veinte organizaciones verificadas desde el 26 de junio antes de que el acceso general llegara el 9 de julio — un despliegue escalonado de unas dos semanas.
Combina esos dos datos y obtienes un piso aproximado, no una predicción. Si Astra pasa por una revisión previa al lanzamiento de 30 días y luego repite el patrón de GPT-5.6, la disponibilidad general llega aproximadamente seis semanas después de la presentación. Y la fecha de presentación es precisamente lo que no sabemos. Por eso las fechas seguras de agosto deben descontarse: el paso de control es un proceso con una duración publicada, y el reloj no ha empezado a correr de forma visible.
Los mercados de predicción se han movido exactamente en esa dirección. Leído el 5 de agosto de 2026, la escalera de Polymarket "GPT-6 released by" se situaba en el 1% para el 7 de agosto, 3% para el 14 de agosto, 13% para el 21 de agosto, 25% para el 31 de agosto, 68% para el 30 de septiembre y 89% para el 31 de diciembre, con un volumen cercano al millón de dólares. Trátese como una estimación agregada de la multitud, no como una fuente — pero nótese que la multitud ha desplazado su peso al Q4.
También ayuda recordar el historial. Cada afirmación de «GPT-6 se lanza la próxima semana» de los últimos doce meses ha sido errónea. Una filtración no verificada señaló el 14 de abril de 2026 como día de lanzamiento; lo que realmente se publicó, nueve días después, fue GPT-5.5.
Los rumores, evaluados
Ordenado por cuánto peso carga realmente cada uno:
• Nombre sin decidir (GPT-6 / GPT-5.7 / una clase separada). Atribuido a The Information. La afirmación más fiable ajena a OpenAI en esta historia, y la que debería reajustar las expectativas — un sistema anunciado a través de un artículo de matemáticas bien podría no presentarse como un salto generacional en absoluto.
• Se avistaron los nombres en clave "Zinc" y "Magnesium" en Design Arena. Avistamiento de la comunidad, entradas supuestamente deshabilitadas, sin confirmar por OpenAI. Léase como: bien podría llegar una versión puntual de GPT-5.x antes de Astra, lo que no satisfaría las expectativas de GPT-6 de nadie mientras acapara el ciclo de noticias.
• Aproximadamente 2× GPT-5.6 Sol en escala; precio cercano al rango de GPT-5.6. Rumor en circulación. El filtrador detrás de ello reconoció no haber probado el modelo. Suena plausible y carece por completo de fundamento.
• Una ventana de contexto de 1,5 millones de tokens. Aparece en resúmenes de filtraciones sin fuente nombrada. Cabe señalar que Sol ya incluye 1.050.000 tokens, por lo que esto sería un incremento, no un salto, lo cual es motivo para desconfiar de que sea una "filtración" de titular.
• Aproximadamente 10 billones de parámetros. Sin atribución en ningún lugar que pudiéramos rastrear. El número más repetido y menos respaldado de toda la historia.
• Memoria y personalización como la dirección definitoria. Basado en los propios comentarios públicos de Altman de una entrevista de agosto de 2025 — real, pero de hace un año y sobre la dirección post-GPT-5 en general, no sobre Astra específicamente.
Qué hacer realmente entre ahora y cuando se lance.
La movida incorrecta es rediseñar la arquitectura para un modelo que no tiene ficha. La movida correcta es identificar cuáles de tus problemas cambiaría un sistema multiagente de horizonte largo, porque esas son las partes de tu stack que hoy están subdesarrolladas, sin importar lo que OpenAI lance.
Tres de ellos valen la pena construirse contra GPT-5.6 Sol ahora mismo:
• Límites de costo por tarea, no por llamada. Si un solo trabajo puede ejecutarse durante horas y gastar seis o siete millones de tokens de salida, los límites por solicitud dejan de protegerte. Necesitas un presupuesto que herede toda la tarea, y un tope duro.
• Checkpointing y reanudabilidad. Una llamada de una sola vez o devuelve un resultado o falla. Una ejecución de agente de varias horas de duración que muere en el minuto 90 sin haber escrito nada persistente es una categoría de fallo costoso que la mayoría de los codebases nunca han tenido que manejar.
• Evaluación en la que confías para problemas sin respuesta de referencia. Las diez demostraciones son interesantes en parte porque Lean proporciona un oráculo. Casi nada en producción lo hace. Si no puedes distinguir una buena ejecución de seis horas de una que parece plausible pero es mala, más cómputo no te ayudará.
En cuanto a la cuestión del cambio: Astra no está disponible en OrcaRouter porque no está disponible en ningún sitio. Lo que podemos decir es que el problema de la rotación de versiones está en gran parte resuelto por nuestra parte. Una clave alcanza más de 200 modelos, así que tanto si esto se lanza como GPT-6, GPT-5.7 o un cuarto nivel de GPT-5.6, adoptarlo es un cambio de cadena de modelo en lugar de una migración — ni segundo contrato, ni nuevo SDK. Y para un modelo de frontera no probado en particular, el failover automático es la diferencia entre evaluarlo en una carga de trabajo real y apostar una ruta de producción por un sistema que nadie fuera del laboratorio ha sometido a pruebas de estrés. Diriges una porción del tráfico hacia él, mantienes Sol por debajo como respaldo, y lo descubres.
Preguntas que valen la pena responder
¿Es Astra lo mismo que GPT-6?
No necesariamente, y esa es la incógnita más trascendental de esta historia. OpenAI ha confirmado a Astra como su próximo gran modelo, pero aún no ha decidido su nombre de lanzamiento; los informes sitúan a GPT-6, GPT-5.7 y una clase separada junto a Sol, Terra y Luna, todos sobre la mesa. Es totalmente posible que un modelo llamado GPT-6 nunca aparezca, y que el salto de capacidades que la gente esperaba llegue bajo un nombre que nadie estaba siguiendo.
¿Puedo acceder a Astra de alguna forma hoy?
No — ni en ChatGPT, ni a través de la API, ni mediante ningún router o revendedor. Lo que existe públicamente es el artículo, los recorridos de razonamiento y el repositorio de Lean. Si un servicio afirma ofrecer acceso a Astra, o está revendiendo otra cosa o está mintiendo. Lo único realmente útil que puedes hacer con el lanzamiento ahora mismo es compilar las pruebas tú mismo.
¿Astra realmente resolvió problemas que los matemáticos humanos no pudieron resolver?
Produjo pruebas verificadas formalmente de enunciados que llevaban abiertos al menos una década, lo cual es un resultado real e inusual — y la verificación está un paso por encima de la norma del sector. Pero "verificado con Lean" no es "revisado por pares", y la cuestión de si cada enunciado formal captura el problema principal es exactamente la parte que Lean no puede responder. Los especialistas que han leído los manuscritos se han mostrado positivos; ninguno ha pasado por revisión por pares. La evaluación debería consolidarse en los próximos meses, en cualquier dirección.
¿La cifra de $2,000 significa que la investigación de frontera ahora es barata?
Significa que las ejecuciones de tokens ganadoras fueron baratas, a los precios de otro modelo, excluyendo los fallos y excluyendo a los humanos. Cada una de esas tres exclusiones podría ser grande. La lectura honesta es que el costo marginal de una búsqueda automatizada de demostraciones exitosa ha caído lo suficiente como para resultar interesante, no que diez problemas abiertos cuesten ahora el precio de una laptop.
¿Qué resolvería esto realmente?
Tres cosas concretas, ninguna de las cuales es un rumor, y todas verificables cuando sucedan.
Una tarjeta de modelo y una página de precios. Ese es el momento en que Astra deja de ser un artefacto de investigación y se convierte en algo contra lo que puedes planificar — y el momento en que la cuestión del nombre se resuelve por sí sola.
Una reconstrucción independiente del repositorio Lean por parte de especialistas que auditan las definiciones y las reducciones informales, no solo la verificación de tipos. El directorio ComparatorChallenges sugiere que OpenAI espera esto. Si las declaraciones formales resisten ese escrutinio, los resultados son mucho más difíciles de descartar; si aparece una discrepancia incluso en uno de los diez, cada afirmación del conjunto se vuelve a leer.
Prueba de que el reloj de revisión federal ha comenzado. En una ventana de prelanzamiento de 30 días, esa presentación es la señal más temprana y fiable de una fecha de lanzamiento — considerablemente más informativa que la siguiente captura de pantalla de una entrada deshabilitada en una tabla de clasificación de arena.
Hasta entonces, la afirmación precisa es limitada y vale la pena conservarla: el próximo buque insignia de OpenAI tiene un nombre, diez pruebas verificables por máquina, una demostración en Washington y nada más. Cualquiera que te ofrezca una fecha está adivinando, y cualquiera que te ofrezca un número de parámetros lo está inventando.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
