
Claude Opus 5.5 vs GPT-6 Astra: una prueba de sabor que dejó atrás los benchmarks
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Alguien le pidió a Claude Opus 5.5 que hiciera un video corto sobre un laboratorio rival que resuelve Navier-Stokes, publicó el resultado y luego escribió la frase que hace que valga la pena hacer esta comparación: el modelo es "muy agradable", tiene "excelente gusto", y es el primer Claude desde Opus 4.7 que realmente quiere ejecutar intensivamente — pero todavía mantiene GPT-6 Astra y GPT-5.6 Sol como sus principales motores, porque su trabajo es intensivo en investigación. Eso son tres afirmaciones en una sola publicación, y tiran en direcciones distintas. Un modelo puede ser lo más agradable con lo que trabajar y aun así no ser aquel al que enrutas el tráfico de producción. La pregunta interesante no es qué modelo es mejor. Es cuál de esos dos veredictos sobrevive al contacto con los números, y cuál resulta ser una afirmación sobre gustos.
La publicación es el informe de un profesional, no una ejecución de benchmark; trátala como una señal sobre cómo se siente el modelo en el trabajo creativo y abierto, no como evidencia sobre su capacidad. Todo lo numérico que aparece a continuación está etiquetado con quién lo produjo.
Lo que una prueba de sabor puede y no puede decirte.
El artefacto importa aquí. Hacer un vídeo sobre un resultado matemático no es una tarea de programación con una puerta de aprobado o suspenso. No hay paso de compilación, ni suite de pruebas, ni arnés de Terminal-Bench que puntúe si la cosa sirve o no. El modelo tenía que elegir un enfoque, decidir qué mostrar, mantenerlo coherente y parar. Cuando alguien del oficio dice que un modelo tiene "gran gusto", eso es lo que está describiendo: criterio sobre el alcance y el énfasis que se manifiesta en trabajos donde la especificación es deliberadamente vaga.
Esa es una capacidad real, y es la que las suites de benchmarks miden peor. También es la razón por la que una misma persona puede elogiar un modelo y no cambiarse a él. El gusto es lo que quieres cuando estás explorando. No es lo que quieres cuando tienes 200.000 líneas de código que auditar y una factura que justificar.
El propio encuadre de lanzamiento de Anthropic apunta a la misma facultad, en prosa en lugar de en vídeo: se presenta a Claude Opus 5.5 como alguien que escribe menos «Claudish» —menos preámbulos vacíos, menos matices evasivos, más disposición a poner el punto principal primero—. Las puntuaciones independientes de legibilidad respaldan la dirección de esa afirmación, incluso allí donde discrepan sobre su magnitud. El proveedor también informa de que una prueba interna de verificación de datos superó 16 de 18 intentos, frente a cero de 18 tanto en Claude Fable 5.1 como en Claude Opus 5; esa cifra es de la propia Anthropic, no ha sido reproducida, y debería leerse como una afirmación y no como un resultado.
Dos marcadores, una discrepancia que importa

En los benchmarks publicados sin procesar, Claude Opus 5.5 supera a GPT-6 Astra la mayoría de las veces. El problema es que las dos fuentes más citadas no coinciden en cuánto.
La tabla de lanzamiento de Anthropic sitúa a Claude Opus 5.5 en 66,4 % en Terminal-Bench 4.0, con GPT-6 Astra en 57,9 % y Claude Fable 5.1 en 55,8 %. Es una ventaja de 8,5 puntos reportada por el proveedor en codificación agéntica: el tipo de margen que zanja una discusión en una presentación de marketing. Artificial Analysis, ejecutando su propio harness, midió a Claude Opus 5.5 en 59,6 % en el mismo benchmark: a la par de GPT-6 Astra con esfuerzo xhigh, y unos 11 puntos por encima de Claude Opus 5. La ventaja es real en ambas lecturas. La magnitud, no.
Donde los dos modelos intercambian posiciones es más útil que donde no lo hacen:
• Terminal-Bench 4.0 (codificación agéntica) — Claude Opus 5.5 66,4 % según la propia tabla de Anthropic, 59,6 % según Artificial Analysis; GPT-6 Astra 57,9 %.
• Humanity's Last Exam, con herramientas — Claude Opus 5.5 67,7 % reportado por el proveedor, medido de forma independiente en 61,4 %; GPT-6 Astra 57,2 %.
• GDPval-AA v2.1 (trabajo de conocimiento del mundo real en 44 ocupaciones) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Ambas cifras proceden del panel independiente de Artificial Analysis, no del proveedor.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6 % vs. Claude Opus 5.5 58,7 %. Esta es una victoria clara de Astra, y es el benchmark agéntico de temática científica.
• AutomationBench — GPT-6 Astra 41,4 % frente a Claude Opus 5.5 40,0 %. Ajustado, pero Astra otra vez.
• FrontierCode v1.1 — Claude Opus 5.5 54,4 % vs GPT-6 Astra 53,3 %. Dentro de un punto.
Lee esa lista tal como lo haría un profesional. Las cargas de trabajo intensivas en investigación — las que tienen un componente científico o literario, las que ejecutan un bucle largo de uso de herramientas y necesitan que el modelo no pierda pie — son exactamente donde GPT-6 Astra se mantiene firme. Los tableros de trabajo del conocimiento y de programación donde Claude Opus 5.5 arrasa son los que señalarías si tu trabajo fuera lanzar software. Ambas personas en esta conversación están leyendo correctamente su propio benchmark. Simplemente están leyendo benchmarks diferentes.
El ajuste de esfuerzo está haciendo más trabajo que el modelo.
Hay una segunda razón, menos halagüeña, por la que los márgenes principales son débiles. Las comparaciones de proveedores no se ejecutan con la misma configuración.
Las cifras publicadas de Claude Opus 5.5 provienen de una configuración de esfuerzo de razonamiento extra-alto (xhigh), frente a GPT-6 Astra en high. Las ejecuciones independientes de Artificial Analysis sitúan ambos modelos en xhigh y la brecha en programación desaparece: la ventaja del proveedor de 8,5 puntos se convierte en un empate. Eso no es una acusación de mala conducta; es lo que ocurre cuando un proveedor elige la configuración que mejor muestra su modelo y un laboratorio independiente elige la configuración que coincide con la competencia. Antes de mover una carga de trabajo basándote en una tabla de benchmarks, comprueba con qué ajuste de esfuerzo se ejecutó, porque la respuesta con frecuencia es «la que favorece».
La factura de tokens cuenta la misma historia desde otro ángulo. El propio material de lanzamiento de Anthropic indica que Claude Opus 5.5 gasta del orden de 119.000 tokens por problema, de los cuales aproximadamente 84.000 se destinan al pensamiento, mientras que GPT-6 Astra resuelve problemas comparables en aproximadamente 27.000 tokens. Los tokens de pensamiento se facturan como tokens de salida. Un modelo que usa cuatro veces más tokens a una quinta parte del precio de salida casi sale a la par, y eso es antes de tener en cuenta que el modelo más barato suele ser el que uno habría estado dispuesto a ejecutar con una configuración de mayor esfuerzo de todos modos.
Una advertencia adicional se aplica específicamente al lado de Claude Opus 5.5: el enrutamiento de salvaguardas de Anthropic puede enviar algunas solicitudes cercanas a los ámbitos ciber y bio por una ruta más restrictiva, lo que hace bajar las puntuaciones publicadas en esas evaluaciones en relación con lo que produciría el modelo subyacente. Si tu trabajo toca esos dominios, la brecha entre el benchmark y tu experiencia será real, y estará en la dirección de que el benchmark sea optimista.
Lo que cuesta una tarea real en cada uno

Claude Opus 5.5 es el modelo más barato de la lista de precios, y no por poco:
• Claude Opus 5.5 — $4.00 por millón de tokens de entrada, $20.00 por millón de tokens de salida, $0.20 por millón de tokens de entrada en caché, $5.00 por millón de escrituras en caché. Contexto de 1M de tokens, salida máxima de 128k.
• GPT-6 Astra — 10,00 $ por millón de entrada, 50,00 $ por millón de salida, 1,00 $ por millón de entrada en caché, 12,50 $ por millón de escrituras en caché. A partir de 272.000 tokens de entrada en una sola solicitud, se recalcula el precio de toda la solicitud a 20,00 $ de entrada y 100,00 $ de salida; el nivel por lotes es de 5,00 $/25,00 $.
Así que Claude Opus 5.5 es 2,5 veces más barato en entrada y 2,5 veces más barato en salida, y la entrada en caché es cinco veces más barata. Si tus tareas son similares en tokens, esa es toda la decisión y la cuestión del gusto es decoración.
La advertencia sobre el uso de tokens anterior es lo que impide que sea así de simple, y el reajuste de precios del contexto largo de GPT-6 Astra es la otra trampa. Si superas los 272.000 tokens de entrada en una sola solicitud, toda la solicitud —no solo el exceso— pasa a la tarifa de contexto largo. Una carga de trabajo de investigación que mete un corpus grande en una sola llamada es exactamente la forma que lo activa. El procesamiento por lotes a mitad de precio es la vía de escape legítima, y está en la cola más lenta.
El resumen honesto es que el panorama de costos se invierte según lo que estés haciendo. Para una tarea en la que ambos modelos usan una cantidad comparable de tokens, Claude Opus 5.5 gana en precio por un amplio margen. Para un bucle de investigación agéntica largo en el que los recuentos de tokens divergen tal como muestran los propios materiales de lanzamiento de Anthropic, los dos convergen — lo cual es un titular mucho menos emocionante que una reducción de costos del 40 %, y más cercano a lo que estaba reportando el profesional.
Por qué el usuario que investiga mucho no cambió
Junta las piezas y la frase «sigo prefiriendo Astra» deja de ser una contradicción de la frase «gran sabor». Es la misma observación desde otro asiento.
Las cargas de trabajo que mencionó el usuario son largas, abiertas, hacen uso de herramientas y resultan costosas por ejecución. En esas, GPT-6 Astra domina las tablas de ciencia y automatización, usa una fracción de los tokens de razonamiento y —según una medición independiente— queda a la par en programación cuando ambos modelos se ejecutan con el mismo esfuerzo. Las ventajas de Claude Opus 5.5 se concentran en el trabajo donde se puede ver el resultado y juzgarlo: la prosa, las decisiones de diseño, acotar el alcance de un encargo ambiguo, decidir qué debería mostrar en realidad un vídeo sobre Navier-Stokes. Eso es criterio, y el criterio es justamente la parte que no aparece en un eje de benchmark.
Si esperabas un veredicto en el que un modelo gana, las pruebas no lo respaldan. La versión defendible es más limitada: Claude Opus 5.5 es el mejor modelo para el trabajo en el que el juicio es el cuello de botella, GPT-6 Astra es el mejor modelo para el trabajo en el que el esfuerzo sostenido en contextos largos es el cuello de botella, y la diferencia de precio entre ambos se reduce a casi nada en el segundo tipo de trabajo. Eso es una decisión de enrutamiento, no una conversión.
Ejecutar ambos sin una migración

Esta es la parte en la que los dos modelos dejan de ser uno u otro. GPT-6 Astra ya está disponible hoy en OrcaRouter al precio de lista de la propia OpenAI — $10,00 de entrada, $50,00 de salida, $1,00 de lectura en caché, $12,50 de escritura en caché — con 0% de recargo, el precio de lista del proveedor se traslada directamente. Eso significa que un cambio de tarifas del proveedor llega a nuestro lado el mismo día, en lugar de cuando lo sincronice un revendedor.
Claude Opus 5.5 es accesible a través de la propia API de Anthropic y varias plataformas de terceros; no lo estamos listando como algo que ofrecemos, y deberías ser escéptico de cualquiera que afirme lo contrario antes de que el modelo se haya propagado. Lo que puedes hacer hoy es poner ambos modelos detrás de una sola clave y una sola forma de endpoint, y enrutar por carga de trabajo en lugar de por preferencia: envía la solicitud abierta y con alto componente de juicio a Claude Opus 5.5 y el bucle largo de investigación a GPT-6 Astra sin mantener dos contratos o dos integraciones de cliente.
La conmutación automática por error es lo que hace que sea seguro probarlo. Un modelo nuevo aún no es una ruta de producción, y enrutar a través de un único endpoint significa que un incidente del proveedor o un límite de velocidad redirige la solicitud en lugar de hacerla fallar. Si quieres averiguar si la brecha de gusto es real en tu propio trabajo, esa es la forma barata de averiguarlo: ejecútalo junto a lo que ya tienes en lugar de reemplazarlo, y deja que tu propio conjunto de pruebas decida en lugar de las tablas de lanzamiento.
La pregunta que los benchmarks no pueden responder
Hay dos cosas que vale la pena observar, y ninguna de las dos es otro punto de referencia.
Lo primero es si se resuelve la asimetría en la configuración de esfuerzo. Ahora mismo, una tabla de un proveedor en xhigh frente a un competidor en high produce una ventaja de 8,5 puntos que las pruebas independientes con configuraciones equivalentes convierten en un empate. A medida que los laboratorios independientes publiquen ejecuciones con configuraciones equivalentes en los tableros de ciencia y automatización donde GPT-6 Astra lidera actualmente, ese panorama puede moverse en cualquier dirección — y se moverá según la evidencia, no según el encuadre de nadie.
La segunda es la cuestión de la eficiencia de tokens. Si la sobrecarga de razonamiento de Claude Opus 5.5 se reduce en una actualización puntual, su ventaja de tarifa de 2,5x deja de verse compensada y el argumento del precio se impone por completo. Si no lo hace, entonces el profesional que mantuvo GPT-6 Astra como su motor principal no va por detrás del ciclo de noticias. Interpretó correctamente su propia carga de trabajo, y la tabla de lanzamiento simplemente no lo estaba midiendo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
