
Claude Opus 5.5 vs. GPT-6 Astra: la brecha de $6, y el segundo precio que Astra cobra por encima de 272K
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Dos proveedores publicaron este mes tablas de benchmarks de sus modelos insignia, y cada una muestra a su propio modelo ganando, y ninguna de las dos tablas contiene una sola fila en la que ambos modelos se hayan enfrentado entre sí. Claude Opus 5.5, lanzado el 22 de septiembre de 2026 a 4 dólares por millón de tokens de entrada, y GPT-6 Astra, lanzado el 3 de septiembre de 2026 a 10 dólares por millón de tokens de entrada, tienen entre ambos exactamente dos benchmarks que se solapan —y se los reparten: Opus 5.5 se lleva el trabajo adyacente a AutomationBench en la tabla de Anthropic y Astra se lo lleva en la de OpenAI, y Astra claramente va por delante en razonamiento científico en ambas. Eso es lo que el material de los proveedores puede decirte. El panorama independiente es menos ambiguo y apunta en la dirección contraria, y el panorama de precios está más desequilibrado que cualquiera de los dos.
Lo que publicó cada lado
La tabla de Anthropic para Opus 5.5 utiliza su propio harness y su propia configuración de esfuerzo, y donde incluye a Astra, las cifras son de Anthropic, no de una nueva ejecución. Trata todo el conjunto como datos reportados por el proveedor:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % frente a GPT-6 Astra 57,9 % (Anthropic señala que la ejecución de Opus utilizó el nivel de esfuerzo xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4 % frente a GPT-6 Astra 53,3 %
• GDPval-AA v2.1, trabajo de conocimiento — Claude Opus 5.5 1.846 Elo frente a GPT-6 Astra 1.542
• AutomationBench — Claude Opus 5.5 40.0% vs GPT-6 Astra 41.4% (Astra por delante)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra va por delante)
• Humanity's Last Exam, con herramientas — Claude Opus 5.5 67,7 % vs GPT-6 Astra 57,2 %
El lado de OpenAI de la comparación es más difícil de alinear, porque OpenAI publicó Astra contra su propio predecesor en lugar de contra el buque insignia de Anthropic, y los benchmarks que eligió —uso de computadora, ingeniería de front-end, conocimiento general— en su mayoría no aparecen en absoluto en la tabla de Anthropic. Eso no es deshonestidad, es el comportamiento normal de un lanzamiento, y es exactamente por lo que una comparación construida a partir de dos tablas de proveedores es una comparación de dos selecciones y no de dos modelos. Lo único en lo que ambas tablas coinciden es en que Astra es fuerte en ciencia agéntica y uso de computadora, y en que los dos modelos están lo bastante cerca en programación como para que la elección del arnés pueda cambiar el resultado.
La lectura independiente, que ningún proveedor eligió

Artificial Analysis ejecuta cada modelo en una configuración publicada, por lo que sus cifras son las únicas aquí que fueron producidas por el mismo evaluador bajo las mismas condiciones:
• Índice de Inteligencia — Claude Opus 5.5 58, clasificado #1 de 210 vs GPT-6 Astra 53, clasificado #6
• Etiqueta de configuración — Claude Opus 5.5 "razonamiento adaptativo, esfuerzo máximo, respaldo predeterminado", GPT-6 Astra "max"
• Velocidad de salida — GPT-6 Astra 52,5 tokens/seg, en el extremo inferior de su franja de precio frente a Claude Opus 5.5, que aún no se ha publicado
• Tiempo hasta el primer token — GPT-6 Astra 352,15 s frente a una mediana del tablero de 3,83 s; Claude Opus 5.5 aún no publicado
• Precio — Claude Opus 5.5 $4.00 de entrada / $20.00 de salida por millón vs GPT-6 Astra $10.00 / $50.00
• Contexto y salida — GPT-6 Astra con contexto de 1M y salida máxima de 128K frente a Claude Opus 5.5 con 1M y 128K
Una brecha de cinco puntos en el índice no es decisiva por sí sola, y no debería interpretarse como tal — ambos modelos se sitúan en la misma banda de capacidad, que es lo que significa "frontier" este trimestre. Lo que sí establecen las filas de Astra es que la prima no está comprando un liderazgo en capacidad en el único tablero en el que aparecen ambos modelos. La fila de latencia es la complicación honesta: 352 segundos hasta el primer token es el más alto de este grupo por un margen amplio, aunque se mide a esfuerzo máximo y un modelo de razonamiento que piensa antes de emitir siempre parecerá lento según esta métrica. La cifra de 52,5 tokens/seg es la más portable, y está en el lado bajo para un modelo a $10/$50.
El segundo precio de Astra, por encima de 272.000 tokens

La tabla de tarifas es donde estos dos dejan de ser comparables por completo, porque el precio de Astra tiene un escalón. Las tarifas estándar son $10.00 de entrada, $1.00 de entrada en caché, $12.50 de escritura en caché y $50.00 de salida por millón de tokens. Sin embargo, si se superan los 272,000 tokens de entrada, toda la solicitud se vuelve a tarifar —no el exceso, sino toda la llamada— a 2x las tarifas de entrada y caché y 1.5x la salida. Eso deja el trabajo de contexto largo en aproximadamente $20 de entrada y $75 de salida por millón de tokens.
Claude Opus 5.5 no hace esto. Anthropic cobra $4.00 y $20.00 con la ventana completa de 1M tokens a precio estándar, y afirma explícitamente que una solicitud de 900K tokens se factura a la misma tarifa por token que una de 9K tokens. Por lo tanto, la relación destacada entre estos dos —Astra cuesta 2,5 veces lo que Opus 5.5 en ambas direcciones— no es la relación que se aplica a las cargas de trabajo para las que ambos modelos se venden realmente. En un agente de horizonte largo que lleva un gran contexto de trabajo, la comparación es $20/$75 frente a $4/$20, lo que supone un factor de cinco en la entrada y casi cuatro en la salida. El precio por lotes lo agrava en lugar de solucionarlo: Opus 5.5 se reduce a la mitad, a $2.00/$10.00, mientras que el nivel flex de Astra se reduce a la mitad, a $5.00/$25.00, sobre una base que ya es cinco veces mayor en el caso de contexto largo.
Esta es la asimetría más relevante para la decisión en el enfrentamiento, y es invisible en toda tabla de lanzamiento de cualquiera de las dos compañías, porque ambos proveedores citan la tarifa principal. Si tus prompts están por debajo de 272K tokens, ignórala. Si estás construyendo un agente que lee un repositorio o un conjunto de documentos, asígnale un precio de $20/$75 antes de comparar nada.
El acceso es parte de la especificación
Astra es el primer modelo de OpenAI en cruzar el umbral Critical de capacidad de ciberseguridad conforme al propio Preparedness Framework de la compañía, y el despliegue refleja esa clasificación en lugar de la capacidad. El acceso se abrió primero a un conjunto limitado de organizaciones, el acceso empresarial requiere que un administrador lo active antes de que los usuarios lo vean, y el modelo distribuido rechaza de plano algunas categorías de trabajo. Claude Opus 5.5 llega con una versión del mismo problema desde la dirección opuesta: se distribuye con el nivel de salvaguarda que Anthropic reservaba antes para Claude Fable 5.1, lo que significa que la mayoría de las solicitudes de ciberseguridad se redirigen a Claude Opus 4.8 y el trabajo de biología recurre a Claude Opus 5 a menos que la cuenta esté verificada.
Ambos comportamientos aparecen en el mismo lugar, que es tu evaluación. Artificial Analysis etiqueta la configuración de Opus 5.5 como «Default Fallback» precisamente porque las solicitudes pueden acabar en un modelo distinto del que nombraste, y en prompts de seguridad o ciencias de la vida eso ocurre de manera rutinaria. Si tu carga de trabajo pertenece a esos dominios, la cadena de modelo de tu solicitud no es una garantía sobre el modelo que respondió, y tus cifras de calidad incluirán un modelo más pequeño en una fracción desconocida de las llamadas. Ninguno de los dos proveedores lo oculta —ambos lo documentan—, pero tampoco lo menciona ningún titular.
Elegir entre ellos
La decisión que realmente plantea esta comparación es si una carga de trabajo de contexto largo justifica el precio por tramos de Astra, y para la mayoría de los equipos la respuesta será no: Opus 5.5 es más barato en cada nivel por debajo de 272K, drásticamente más barato por encima de esa cifra, obtiene mejor puntuación en el único ranking independiente y alcanza 1M de tokens de contexto sin recargo. El caso de Astra es más limitado y real —razonamiento científico, uso de computadoras y las herramientas del ecosistema de OpenAI—, y si tus evaluaciones lo sitúan por delante en esos aspectos, el sobrecoste es una partida más, no un error.
Donde eso se vuelve práctico es en cómo los pones a competir entre sí, porque una comparación justa exige tener ambos modelos con la misma clave y la misma factura. Ambos se pueden enrutar a través de OrcaRouter al precio de lista del proveedor con un 0 % de recargo —Claude Opus 5.5 a $4.00/$20.00 de Anthropic y GPT-6 Astra a $10.00/$50.00—, lo que significa que la decisión de los 272K se puede probar con tu propio tráfico en lugar de discutirla a partir de dos comunicados de prensa. Fijar Astra a las clases de tareas en las que gana y dejar que la conmutación por error automática se encargue del resto es una regla de enrutamiento, y una solicitud que cruza la línea de los 272K se puede enviar por una ruta más barata sin cambiar el código, porque la regla vive en el enrutador y no en tu aplicación.

¿Qué cambiaría la respuesta?
Una cosa lo haría: una comparación directa controlada con el mismo esfuerzo en benchmarks compartidos. Ninguno de los proveedores ha publicado una y ninguno tiene incentivos para hacerlo, lo que deja al índice independiente como la única comparación disponible en igualdad de condiciones — y ese índice sitúa a Opus 5.5 cinco puntos y cinco puestos por encima de Astra a menos de la mitad del precio por token. El contraargumento que merece atención es que ambos modelos se puntuaron con el esfuerzo máximo, mientras que Opus 5.5 se distribuye con el valor predeterminado en medio; si la ventaja de Astra en trabajo científico de horizonte largo sobrevive a una ejecución con el mismo esfuerzo, el argumento a favor del sobreprecio se vuelve más fuerte, no más débil. Hasta que alguien la ejecute, la postura defendible es que Astra es un especialista con precio de generalista, y que Opus 5.5 es el generalista que da la casualidad de que puntúa más alto.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
