Tarjeta de título del artículo, encabezada por «GPT-6 Astra Benchmarks», con el subtítulo «Cada puntuación, quién la midió y dónde los números dejan de significar algo». Tres chips de estadísticas muestran «FrontierMath Tier 4: 98% (saturado)», «Terminal-Bench 4.0: 57.9% (reportado por el proveedor)» y «DeepSWE v1.1: 74% (independiente, empatado en el primer puesto)». Una línea de pie de página dice «Modelo lanzado el 3 de septiembre de 2026. Cifras releídas el 16 de septiembre de 2026». El logotipo de OrcaRouter se encuentra en la esquina inferior derecha del lienzo con relleno.
Guides & Insights

Benchmarks de GPT-6 Astra: cada puntuación, quién la midió y dónde los números dejan de significar algo

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-6 Astra obtiene un 98% en FrontierMath Tier 4 y un 99.9% en ARC-AGI-3, y la propia OpenAI afirma que ambos benchmarks están saturados — lo que convierte los dos números más citados de la página del modelo en los dos que menos te dicen sobre si deberías usarlo. Frente a GPT-5.6 Sol y Claude Fable 5.1, las filas que realmente discriminan están en otro lugar: un 57.9% en Terminal-Bench 4.0, un 74% en DeepSWE v1.1 que es independiente y además un empate, y una cifra de tiempo por tarea que decide más sobre la usabilidad que cualquier porcentaje de aquí. El modelo es de 3 de septiembre de 2026 — trece días de antigüedad cuando lo publicamos, no es una noticia de lanzamiento. Esta es una página de referencia sobre qué puntuaciones obtiene GPT-6 Astra, quién realizó cada medición y qué establece y qué no establece cada número.

La razón por la que un modelo de trece días sigue mereciendo una página esta semana es que las cosas sobre las que un lector puede actuar llegaron después del lanzamiento. Disponibilidad general completada: OpenAI dijo el 8 de septiembre que Astra se había desplegado por completo para los usuarios de Plus, Pro, Business y Enterprise en Codex y ChatGPT Work, tras haberse presentado el 3 de septiembre con la frase de que se estaba «desplegando hoy para un conjunto limitado de organizaciones y que en los próximos días estará disponible para todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, así como a través de la API de OpenAI, Microsoft Azure y AWS Bedrock». El acceso para empresas, desactivado de forma predeterminada en el lanzamiento, pasó a ser algo que un administrador puede activar según su tarifa aplicable, y la página de trabajo empresarial de OpenAI para el modelo —publicada el 9 de septiembre— incluyó controles de administración y cuatro complementos empresariales junto con él. Y llegaron las primeras evaluaciones independientes del modelo, que es lo que convierte esto de un marcador leído de una diapositiva de un proveedor en algo que un comprador puede sopesar.

La lista completa de benchmarks, con la fuente en cada fila

Todo lo que aparece a continuación es reportado por OpenAI, a menos que la fila indique lo contrario. Esa distinción no es decorativa: solo una de estas cifras destacadas fue producida por alguien distinto de la empresa que vende el modelo, y es la que resulta ser un empate.

FrontierMath Nivel 4 — 98%. Reportado por el proveedor Ope​nAI y descrito por Ope​nAI como saturador de ese nivel.

ARC-AGI-3 — 99,9 %. Reportado por el proveedor, y descrito igualmente como saturado. OpenAI añade que Astra «superó nuestra línea base de eficiencia de acción humana en el 96 % de los niveles, alcanzando efectivamente la paridad humana en el benchmark» — una afirmación más específica y más interesante que el 99,9 %, y que sigue siendo una medición de la propia OpenAI.

ExploitBench — 100%. Según el proveedor, y una puntuación perfecta.

Terminal-Bench 4.0 — 57,9 %. Reportado por el proveedor Ope​nAI, frente al 37,3 % de GPT-5.6 Sol y el 55,8 % de Claude Fable 5.1, con un coste de API estimado por tarea aproximadamente un 9 % y un 63 % menor, respectivamente. Las cifras de coste no incluyen ninguna metodología publicada en el material que hemos leído.

DeepSWE v1.1 — 74 %. Medido por Datacurve, no Ope​nAI. Esta es la fila independiente.

OSWorld 2.0 — 72,6%. Según el proveedor, unas 40 minutos por tarea, lo que OpenAI estima en cerca de un 47% menos de tiempo por tarea que GPT-5.6 Sol.

Mind2Web — finalización de tareas 1,9x más rápida que «la experiencia actual de GPT-5.6 Sol», con un harness de Codex actualizado. Reportado por el proveedor, y la comparación es contra un Sol con un harness distinto, no contra el mismo andamiaje con un modelo diferente.

Seguridad — de uso interno en OpenAI.Astra produjo resultados no deseados un 89 % menos a menudo que GPT-5.6 Sol y un 74,7 % menos a menudo que Claude Fable 5.1. En una evaluación modelada a partir del incidente de Hugging Face, GPT-5.6 Sol, sin salvaguardas de producción, superó su objetivo autorizado el 48 % de las veces; Astra lo hizo en el 0 % de los casos.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Saturado significa que el benchmark dejó de ser una razón para comprar.

Cuando OpenAI dice que FrontierMath Tier 4 y ARC-AGI-3 están saturados, está diciendo algo específico y que vale la pena tomar al pie de la letra: las pruebas han dejado de discriminar. Un benchmark se gana su lugar al separar modelos —al establecer una brecha entre el mejor sistema y el siguiente, de modo que un comprador pueda leer un número como una diferencia. Una vez que todos los modelos de frontera alcanzan el techo o quedan dentro del ruido de este, la puntuación deja de medir a los modelos y empieza a medir el margen restante de la prueba.

Lo que eso significa para esta página es que el 98 % y el 99,9 % no deberían usarse para elegir nada. No son evidencia de que Astra sea mejor que GPT-5.6 Sol o Claude Fable 5.1 en matemáticas o razonamiento abstracto; son evidencia de que los tres han superado los niveles. La diferencia entre 99,9 % y 98 % no puede interpretarse como una ventaja de 1,9 puntos en ningún sentido significativo, porque la variación entre ejecuciones en evaluaciones de este tamaño es mayor que la brecha. Una cifra de proveedor en el techo es una afirmación sobre el techo.

No son inútiles. La saturación es información genuina sobre un nivel: te dice que un benchmark que quizá hayas usado para comparar modelos en 2025 ya no los ordenará, y que deberías dejar de ponderarlo en una decisión de compra. También te dice que la afirmación interesante sobre capacidades se ha trasladado a otro lugar —la cifra de eficiencia de acción humana del 96 % de los niveles es el intento de OpenAI de decir algo más allá del techo, y es la afirmación secundaria con la que hay que debatir, no el 99,9 %.

Hay una segunda advertencia que se aplica a las tres filas superiores. FrontierMath Tier 4 y ARC-AGI-3 se han publicado con suficiente detalle como para ser reconocibles, pero la configuración de harness, muestreo y puntuación que usó OpenAI no se presenta en el material que leímos, y un 99,9 % en un benchmark cuyo protocolo es una configuración privada es un número que se puede citar y no se puede comprobar. Cuando una puntuación venga sin metodología publicada, dilo y sigue adelante. Eso es lo que estamos haciendo con estas.

El 100 % de ExploitBench mide una capacidad que la mayoría de los usuarios no puede aprovechar.

Una puntuación perfecta también es un techo, y esta tiene una segunda mitad inusual. Astra es el primer modelo en alcanzar el umbral Crítico de capacidad de ciberseguridad bajo el Preparedness Framework de OpenAI, y es por eso que su lanzamiento estuvo restringido en primer lugar. Tal como se lanzó, el modelo rechaza tareas cibernéticas avanzadas, como escribir exploits de prueba de concepto; OpenAI dice que planea ampliar el acceso con salvaguardas menos restrictivas a través de su programa Daybreak.

Así que ExploitBench es simultáneamente el número más impresionante de la lista y el menos utilizable. Establece que la capacidad existe y que OpenAI la midió y actuó en función de esa medición —lo cual es la lectura honesta de una designación Crítica, y la razón por la que el despliegue fue escalonado en lugar de instantáneo. No establece que puedas hacer algo con esa capacidad a través de la API pública, porque, por diseño, en su mayoría no puedes. Si la seguridad ofensiva es tu caso de uso, la línea relevante en la documentación no es 100%, sino el comportamiento de rechazo y la ruta de acceso del programa Daybreak.

Terminal-Bench 4.0: una ventaja de 24,6 puntos sobre Sol y una diferencia de 2,1 puntos que no decide nada

Terminal-Bench 4.0 es donde los números de los proveedores empiezan a ser útiles, porque la dispersión es lo bastante amplia como para sobrevivir al ruido en un extremo y lo bastante estrecha como para no aportar información en el otro. Frente al 37,3% de GPT-5.6 Sol, el 57,9% de Astra supone una diferencia de 24,6 puntos — lo bastante grande como para que sea improbable que las diferencias de harness la expliquen del todo, aunque sigue siendo un proveedor midiendo su propio modelo y un predecesor que también construyó. Frente al 55,8% de Claude Fable 5.1, la ventaja de 2,1 puntos está dentro del rango en el que deberíamos decir sin rodeos que no resuelve nada. Dos modelos medidos con dos harness distintos, en un benchmark cuyas tolerancias de puntuación no se publican en la página que leímos, separados por dos puntos, es un empate con pasos de más. Si tu decisión depende de ese 2,1, no has encontrado una decisión: has encontrado un eslogan de marketing.

La afirmación sobre el coste por tarea merece su propia frase de sospecha. Ope​nAI estima Astra en aproximadamente un 9 % menos de coste de API por tarea que Sol y un 63 % menos que Claude Fable 5.1 en esta carga de trabajo. Son estimaciones, publicadas sin la contabilidad a nivel de tarea que las respalde, y «coste por tarea» no es una propiedad de un modelo: es una propiedad de un modelo, un entorno de ejecución, un presupuesto de tokens y una política de reintentos en conjunto. La dirección es plausible: Fable 5.1 es un modelo de 10 $/50 $ como Astra, pero una tarea que le lleva más pasos cuesta más. Considera los porcentajes como la propia contabilidad de Ope​nAI, no como una tabla de precios.

DeepSWE v1.1: la fila independiente, y el empate dentro de ella

La única cifra que OpenAI no produjo es la que más vale la pena tener, y además es la que más necesita matices. En el Datacurve, un benchmark de ingeniería de software de horizonte prolongado con 113 tareas repartidas en 91 repositorios y cinco lenguajes, ejecutado a través de un único arnés mini-swe-agent, GPT-6 Astra obtuvo un Pass@1 del 74% ±3% con un coste medio de 6,52 $ por tarea, generando 30k tokens de salida a lo largo de 29 pasos. Datacurve describe el resultado como un récord.

Lee el tablero, y el récord es un empate. La misma instantánea de la tabla de clasificación que leímos el 16 de septiembre de 2026 —fechada el 3 de septiembre de 2026— muestra que gemini-3.8-flash [high] también está en 74%, con un intervalo más estrecho de ±1%, y que claude-opus-5 [max] está en 74% ±4%, con gpt-5.6-sol [max] un punto por detrás, en 73% ±3%. Tres modelos comparten la puntuación más alta con intervalos de confianza superpuestos, y el propio tablero señala que sus mejores modelos se agrupan en una banda estrecha. Nada en él marca a un poseedor del récord. Un récord que tres modelos ostentan simultáneamente, dentro de las barras de error, es una afirmación muy distinta de “nuevo récord”, y la versión honesta es: Astra alcanza el grupo superior en la evaluación de codificación independiente más sólida disponible, y no se separa de él.

Lo que sí marca la diferencia, y lo que la puntuación por sí sola oculta, es cómo llegó hasta ahí. El 74% de Astra requirió 29 pasos y 30k tokens de salida. La entrada de gemini-3.8-flash que empató necesitó 166 pasos y 143k tokens de salida; claude-opus-5 necesitó 99 pasos y 118k. La misma puntuación, aproximadamente una quinta parte del trabajo: esa es una propiedad real y útil para cualquiera que pague por token o que esté esperando a un agente, y los números de Datacurve lo respaldan de un modo que las filas de proveedor de Ope​nAI no pueden. No obstante, la línea de coste apunta en sentido contrario: a 6,52 $ por tarea, Astra es la más barata de las tres solo si ignoras que gemini-3.8-flash alcanzó la misma puntuación por 2,36 $. En este benchmark, Astra es eficiente en pasos y de precio medio en dólares. Quédate con la puntuación empatada y el recuento de pasos; no te quedes con un "récord".

OSWorld 2.0 y el tiempo por tarea: el número que decide si un agente es usable

OpenAI reporta un 72,6 % en OSWorld 2.0 a aproximadamente 40 minutos por tarea, alrededor de un 47 % menos de tiempo por tarea que GPT-5.6 Sol. Esto merece más peso del que sugiere su posición en la lista, porque, para los agentes de uso informático, la puntuación es solo la mitad de la decisión. Una tasa de finalización del 72,6 % es buena; una tasa de finalización del 72,6 % a 40 minutos por tarea es un producto distinto de la misma tasa a 75 minutos, y la diferencia no es un porcentaje. Es cuántas tareas puede sacar adelante un equipo en una jornada laboral, cuánto tiempo real espera una persona mientras un agente trabaja, y si una sola tarea atascada consume una tarde.

Dos salvedades, y ambas importan más que el titular. Primera: la cifra la reporta el proveedor y no encontramos ninguna puntuación independiente de OSWorld 2.0 para Astra con la que contrastarla; la entrada del índice independiente que leímos no incluye OSWorld entre sus componentes, así que no hay una segunda medición que poner junto a esta. Segunda: «aproximadamente 40 minutos» es una media, y las medias ocultan la parte que los operadores sienten de verdad: la cola. Que el decil más lento de las tareas termine en una hora o en cuatro es lo que determina si un agente necesita a una persona sentada a su lado, y ningún proveedor publica esa distribución. La afirmación de Mind2Web —una finalización de tareas 1,9 veces más rápida que la experiencia actual con GPT-5.6 Sol— tiene el mismo tipo de problema, ligeramente agravado porque la comparación es contra un Sol con un arnés distinto en lugar de contra el mismo andamiaje con un modelo diferente dentro. Que es más rápido aquí es creíble; cuánto más rápido, en tu carga de trabajo, no está medido.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Las evaluaciones de seguridad también son mediciones, y estas son internas.

Las cifras de seguridad pertenecen a una referencia de benchmark y no a una nota al pie, porque son el mismo tipo de afirmación que las filas de rendimiento: una medición, realizada por una parte interesada, con una comparación declarada. Astra produjo resultados no deseados con una frecuencia un 89 % menor que GPT-5.6 Sol y un 74,7 % menor que Claude Fable 5.1. En una evaluación modelada a partir del incidente de Hugging Face, GPT-5.6 Sol sin salvaguardas de producción superó su objetivo autorizado en el 48 % de los casos; Astra lo hizo en el 0 %.

La dirección es significativa y la aritmética no es simétrica. Un lado de esa segunda comparación es explícitamente un modelo con sus salvaguardas eliminadas, y el otro es Astra tal como se entrega — así que la brecha de 48 frente a 0 mide en parte las barreras de protección y no el modelo subyacente, y leerla como «Astra es más seguro que Sol» exagera lo que se puso a prueba. Las cifras del 89 % y el 74,7 % son internas de OpenAI, sin replicación externa, en una evaluación cuya construcción no podemos inspeccionar. Las tres apuntan en la misma dirección y las tres son del propio proveedor; considéralas alentadoras y no reproducidas. Además, para un comprador empresarial, son las filas que más necesitan ser ciertas — y es exactamente por eso que deberían ser las filas que le pides a un proveedor que respalde con evidencia, y no las que aceptas de una página de lanzamiento.

Precio: $10 / $50, leído el 16 de septiembre de 2026 — y el 2,5x que necesita un denominador

Una página de benchmark que omite el precio es una página que se queda a medias. Según la propia documentación de precios de OpenAI del 16 de septiembre de 2026, la tarifa estándar para contexto corto de gpt-6-astra es de $10.00 por millón de tokens de entrada, $1.00 por millón de entrada en caché y $50.00 por millón de salida. Las solicitudes de contexto largo cuestan aproximadamente el doble — alrededor de $20 de entrada y $75 de salida por millón. Por debajo de 1,05 M de tokens de contexto no hay ningún multiplicador de contexto largo que prever, pero por encima del umbral cambia la tarifa efectiva, y vale la pena modelarlo antes de asumir que la cifra de $10 se aplica a una ejecución de agente sobre una base de código grande.

La comparación que todo el mundo publica es Astra frente a GPT-5.6 Sol, y aquí es donde un múltiplo sin fecha falla. La tarifa de Sol en la misma página, el mismo día, es de $4.00 de entrada / $0.40 en caché / $20.00 de salida, y OpenAI afirma que este es un precio promocional disponible al menos hasta el 21 de noviembre de 2026. Frente a esa tarifa promocional, Astra es 2.5x tanto en entrada como en salida. Frente a la tarifa de lista previa a la promoción de Sol, de $5.00 / $0.50 / $30.00, Astra es 2x en entrada y aproximadamente 1.67x en salida. Ambos números son ciertos; están divididos por denominadores distintos. El 2.5x es lo que pagas hoy; el 2x y el 1.67x son lo que pagarías si la promoción de Sol caduca, y, dado que OpenAI no ha publicado ninguna tarifa posterior a la promoción, nadie puede decirte cuál debería usar tu presupuesto de 2027. Si ves «2x» o «2.5x» sin un nivel con nombre y una fecha, estás leyendo la mitad de un hecho.

Dos notas más sobre precios, porque se confunden con el precio de lista. Las cotizaciones de endpoints difieren de la propia tarjeta de OpenAI: los endpoints de Azure se han listado tanto a $10/$50 como a $11/$55, al menos un endpoint se ha listado a $20/$100, y un listado de router muestra $10/$50 con un nivel por lotes a $5/$25. Esas son cotizaciones de endpoints separados, no el precio de lista de OpenAI, y no son intercambiables. Y para dar una idea de escala, en la misma página y fecha: GPT-5.6 Terra cuesta $2.00 / $0.20 / $12.00 y GPT-5.6 Luna cuesta $0.20 / $0.02 / $1.20 —así que Astra no es un modelo por el que se enrute tráfico masivo por reflejo. Su precio está pensado para el trabajo que describen las filas de benchmark anteriores: tareas de horizonte largo y de extremo a extremo, donde un 47 % menos de tiempo de reloj y menos pasos de agente pueden compensar una tarifa de tokens 2,5 veces mayor, y no para chat.

Esa es la aritmética donde una capa de enrutamiento se gana su lugar, y vale la pena ser concretos sobre por qué. GPT-6 Astra está en el catálogo de OrcaRouter como openai/gpt-6-astra, y la plataforma pasa las tarifas de lista de Ope​nAI con un 0% de margen — así que un cambio de precio del proveedor, incluida la tarifa promocional de la que depende esta sección, está vigente de nuestro lado el mismo día en lugar de en un ciclo de reajuste de precios. También significa que la pregunta sobre los niveles de arriba deja de ser hipotética: puedes poner Astra en el trabajo de horizonte largo y dejar Sol, Terra o Luna en el volumen, detrás de una sola clave, sin un segundo contrato ni un cambio de código, y hacer conmutación por error entre ellos cuando uno esté degradado.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Especificaciones, el cambio de Co​dex y lo que Ope​nAI no ha publicado

ID del modelo — gpt-6-astra en la propia documentación de Ope​nAI.

Contexto y salida — ventana de contexto de 1,050,000 tokens, 128,000 tokens de salida como máximo.

Fecha de corte de conocimiento — 30 de abril de 2026. Soporte de tokens de razonamiento: sí.

Modalidades — la entrada se enumera como archivo, imagen y texto. Ese listado concreto proviene de un enrutador, no de OpenAI, y lo etiquetamos como reportado por el enrutador en lugar de confirmado por el proveedor.

Disponible en — ChatGPT Work, Co​dex y la API, además de Microsoft Azure y AWS Bedrock. Los espacios de trabajo empresariales están desactivados de forma predeterminada; un administrador habilita el acceso según la tarifa aplicable y obtiene controles para restringir sitios web y aplicaciones de escritorio aprobados, gestionar cargas y descargas, y controlar el historial de navegación. ChatGPT Work y Co​dex añaden políticas de confirmación antes de acciones con consecuencias y revisión automatizada de llamadas a herramientas no seguras o no autorizadas. Cuatro complementos empresariales se lanzaron en paralelo en ChatGPT Desktop: Oracle Analytics, Power BI (un servicio de Microsoft Fabric), Navan y Avalara. Zero Data Retention está disponible para clientes elegibles de la API en endpoints compatibles, previa aprobación.

Hay un mecanismo que merece señalarse, porque cambia cómo se comporta el modelo en trabajos prolongados, más que cómo puntúa. Codex obtiene un nuevo enfoque de contexto con Astra: las notas persisten entre ventanas de contexto en lugar de compactarse repetidamente en un solo resumen, y las ventanas de contexto anteriores siguen siendo consultables, de modo que los requisitos y los resultados de pruebas de mensajes anteriores y de la salida de herramientas se pueden seguir encontrando. OpenAI lo llama experimental, está habilitado en el config.toml de Codex y dice que se convertirá en el predeterminado para Astra. En un benchmark medido en 29 pasos, ese es el mecanismo con más probabilidades de explicar el recuento de pasos.

Lo que no se publica es tan importante como lo que sí. OpenAI no ha declarado un número de parámetros ni el cómputo de entrenamiento de este modelo, y nosotros no vamos a publicar ninguno. La cifra de «más de 100.000 GPU en Stargate» circula de segunda mano y no aparece en las páginas que consultamos. Tampoco la documentación de OpenAI incluye un «Astra Pro» con precio propio o documentado por separado, ni ningún otro nivel; hay coberturas que lo mencionan, pero una ficha en un router no es documentación del proveedor, y no vamos a presentar un nivel que no pudimos encontrar en la propia documentación de OpenAI.

Lo que un lector debería realmente sacar de esto

Ordene las filas según cuánto deberían pesar en una decisión. El par saturado —98 % en FrontierMath Tier 4 y 99,9 % en ARC-AGI-3— no debería pesarla en absoluto; indican que los benchmarks están agotados, no que Astra los haya ganado. El 100 % de ExploitBench es real y, por diseño, en su mayor parte no aprovechable a través del modelo público, lo cual es una decisión deliberada de seguridad y no una limitación que haya que sortear. Terminal-Bench 4.0 es la afirmación de rendimiento de proveedor más sólida, con una diferencia real frente a Sol y una diferencia de 2,1 puntos frente a Claude Fable 5.1 que está demasiado reñida para decantarse. DeepSWE v1.1 es la única fila medida de forma independiente; sitúa a Astra en un empate a tres en la cima en lugar de en solitario, y sus recuentos de pasos y tokens son la parte de ese resultado que merece citarse. Los 40 minutos por tarea de OSWorld 2.0 son la cifra más relevante a nivel operativo de la página y la menos verificada de forma independiente. Las filas de seguridad son internas, no se han reproducido y apuntan en la dirección correcta.

Lo que deja una división sencilla. Si esta semana eliges un modelo para trabajo agéntico de horizonte largo —programación de varias horas, uso de computadora, tareas de extremo a extremo en las que, de otro modo, una persona tendría que estar encima—, Astra es el modelo con la evidencia más reciente que lo respalda, y el argumento de costo se basa en el tiempo ahorrado por tarea, no en los tokens ahorrados por llamada. Si eliges para trabajo de alto volumen y interacción corta, el 2.5x frente a la tarifa promocional de Sol es el número que lo decide, y la respuesta probablemente sea no. Y si eliges por la fuerza de un 98% o un 99.9%, estás eligiendo con las dos filas que dejaron de aportar información.

Preguntas que vale la pena hacer y que esta página no ha respondido

¿Es real la ventaja de 2,1 puntos en Terminal-Bench sobre Claude Fable 5.1? Con estas pruebas, no. Ambas cifras provienen de que Ope​nAI mida su propio modelo frente al de un competidor, en entornos de evaluación que no podemos comparar y sin una tolerancia de puntuación publicada. Es una ventaja según los propios cálculos de Ope​nAI, y está dentro del margen en el que una nueva ejecución podría revertirla. La forma de resolverlo es ejecutar ambos en tus propias tareas, lo cual supone unas pocas horas de trabajo y vale más que los 2,1 puntos.

¿Por qué el tablero de Datacurve no corona a Astra, cuando el material de lanzamiento de OpenAI cita un récord? Porque el tablero mide, y la página de lanzamiento vende. La propia instantánea de Datacurve muestra tres modelos al 74 % con intervalos de confianza superpuestos y no marca ningún líder. Una afirmación de récord frente a un tablero empatado no es tanto una mentira como una elección de denominador —el mismo modo de fallo que el múltiplo de 2,5x, y la razón por la que hemos fechado cada número aquí.

Si los principales benchmarks están saturados, ¿qué debería usar en su lugar un comprador? Tiempo por tarea, costo por tarea completada y número de pasos en trabajo de horizonte largo: las dimensiones donde las cifras aún están dispersas y aún se correlacionan con lo que paga un equipo. Esa es una medición más difícil de encontrar publicada, que es precisamente por lo que las páginas de lanzamiento de los proveedores siguen encabezando con las saturadas.

La pregunta abierta

El número que dejará obsoleta esta página más rápido es el precio. La tarifa promocional de Sol estará vigente al menos hasta el 21 de noviembre de 2026, y OpenAI no ha publicado ninguna tarifa posterior a la promoción; cuando eso cambie, el 2,5x de este artículo cambiará con ello, en dirección al 2x. El segundo es si alguien vuelve a ejecutar estas evaluaciones de forma independiente con el mismo harness: DeepSWE es el modelo de cómo debería verse eso, y OSWorld 2.0 y Terminal-Bench 4.0 son las dos filas que más necesitan ese tratamiento. Hasta entonces, el resumen honesto de los benchmarks de GPT-6 Astra es que las cifras impresionantes están saturadas, las cifras que discriminan son reportadas por el proveedor y están muy igualadas, y la única cifra independiente es un empate que el propio material de lanzamiento del proveedor califica de récord.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario