Tarjeta de título principal para GPT-6 Astra vs. Claude Fable 5.1 con el subtítulo «Tarjetas de tarifas idénticas, y una decisión que depende de las lecturas de caché», tres chips de estadísticas que dicen «Precio de lista: $10.00 / $50.00 para ambos», «Lectura de caché: $1.00 vs. $0.25 por 1M» y «AA Intelligence Index: 53 vs. 53, empatados», un pie de página que dice «GPT-6 Astra se lanzó el 3 de septiembre de 2026. Tarjetas de tarifas del proveedor y cifras independientes consultadas el 16 de septiembre de 2026.», y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-6 Astra vs Claude Fable 5.1: Tarifas idénticas, y una decisión que depende de las lecturas de caché

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Esto es lo que casi todas las comparaciones de este enfrentamiento hacen mal, y es el primer número que busca un comprador: GPT-6 Astra y Claude Fable 5.1 cuestan exactamente lo mismo. Según los propios documentos de los dos proveedores, ambos consultados el 16 de septiembre de 2026, Open​AI lista GPT-6 Astra a $10.00 por millón de tokens de entrada y $50.00 por millón de tokens de salida, y Anthrop​ic lista Claude Fable 5.1 a $10.00 y $50.00. El múltiplo es 1.0. No hay prima que justificar, ni descuento que capturar, ni aritmética por token que los separe. Una nota de contexto antes de los números: GPT-6 Astra en sí es del 3 de septiembre de 2026, así que esta es una página de referencia para dos modelos que ya se lanzaron, no una cobertura de lanzamiento. Lo que cambió en los últimos siete días es la evidencia, más que los modelos: la primera medición independiente cara a cara de ambos modelos llegó el 9 de septiembre, y Open​AI revisó su propia documentación de disponibilidad el 14 de septiembre. Si llegaste buscando "Fable 5.1 vs GPT-6 Astra" esperando una respuesta sobre el precio, la respuesta sobre el precio es un empate, y la decisión real está en dos líneas más abajo en la factura.

Las dos tarjetas de tarifas son la misma tarjeta.

Comienza por lo que publica cada proveedor, porque toda afirmación posterior hereda esos datos. La documentación propia de OpenAI del modelo gpt-6-astra, consultada el 16 de septiembre de 2026, indica $10.00 por 1M de tokens de entrada, $1.00 por 1M de entrada en caché, $12.50 por 1M de escrituras en caché y $50.00 por 1M de salida, con una ventana de contexto de 1.050.000 tokens, un máximo de entrada de 922.000 tokens y un máximo de salida de 128.000 tokens. La documentación de Anthropic sobre claude-fable-5-1, consultada el mismo día, indica $10.00 por 1M de entrada, $0.25 por 1M de lecturas de caché, $12.50 por 1M en el nivel de escritura en caché de cinco minutos ($20.00 en el nivel de una hora) y $50.00 por 1M de salida, con un contexto de 1M de tokens y el mismo límite de salida de 128.000 tokens.

Alinéelos y los múltiplos se calculan solos. Entrada: 1,0 veces. Salida: 1,0 veces. Escrituras en caché: 1,0 veces en el nivel comparable de cinco minutos. Precio por lotes: ambos proveedores lo descuentan a la mitad, así que ambos quedan en $5.00 de entrada y $25.00 de salida. Cualquiera que cotice un múltiplo de precio para esta combinación —incluida la cifra de «2,5 veces» que circula para GPT-6 Astra— está comparando a Astra con un hermano más barato dentro de su propia familia, muy a menudo con GPT-5.6 Sol a $5.00 de entrada y $30.00 de salida en la tarifa de Open​AI, y no con Claude Fable 5.1 en absoluto.

Dos diferencias estructurales sobreviven a ese empate, y son las que de verdad facturan. La primera son las lecturas de caché: $1.00 por 1M en GPT-6 Astra frente a $0.25 por 1M en Claude Fable 5.1. Es la única línea de tokens en la que las dos tarifas divergen, y la brecha es de cuatro veces. La segunda es el precipicio del contexto largo. Open​AI vuelve a tarifar toda la solicitud en cuanto la entrada supera los 272.000 tokens —las tarifas de entrada y de caché se duplican y la salida se multiplica por 1,5—, de modo que la misma llamada se factura a $20.00 de entrada y $75.00 de salida, con lecturas de caché a $2.00. La tarjeta de tarifas publicada por Anthrop​ic para Claude Fable 5.1 no documenta ningún recargo por contexto largo. En dos modelos que se venden ambos con una ventana de un millón de tokens, esa diferencia no es un detalle de redondeo: es un umbral que convierte una llamada cara en una llamada muy cara solo en uno de los lados de la comparación.

La única línea que difiere, y la carga de trabajo donde lo decide todo

Una brecha de cuatro veces en las lecturas de caché parece una nota al pie frente a tarifas principales idénticas. No lo es, debido a cómo facturan en realidad los bucles de agente. Un agente de larga duración reenvía el mismo prefijo extenso —prompt del sistema, definiciones de herramientas, contexto del repositorio, un conjunto de documentos subidos— en cada turno, y ese prefijo se cobra a la tarifa de lectura de caché cada vez que se relee. Cuantos más turnos requiere una tarea, más parte de la factura corresponde a lecturas de caché en lugar de a entrada nueva.

Haz las cuentas con una carga de trabajo que no tiene nada de especial para ninguno de los dos modelos: un prefijo estable de 100.000 tokens releído a lo largo de 50 turnos, más 20.000 tokens de entrada genuinamente nueva y 10.000 tokens de salida para la tarea. En GPT-6 Astra, eso son 5 millones de tokens de lectura de caché a $1.00 por 1M ($5.00), 20.000 tokens de entrada nuevos a $10.00 por 1M ($0.20) y 10.000 tokens de salida a $50.00 por 1M ($0.50) — $5.70 para la tarea. En Claude Fable 5.1, los mismos recuentos de tokens se facturan a $1.25 por las lecturas de caché más los mismos $0.20 y $0.50 — $1.95. Tarifas idénticas, y un modelo es aproximadamente 2,9 veces más barato para ejecutar la tarea, enteramente por la línea de lectura de caché.

Ahora reduce la tarea. Una sola llamada con 4,000 tokens de entrada y 2,000 tokens de salida, sin reutilización de caché, cuesta $0.14 en ambos. El empate es real y se mantiene exactamente mientras no se cachee nada. Este es el primer punto en el que el ranking se invierte, y se invierte por la forma de la carga de trabajo más que por la elección de proveedor: los bucles dominados por caché van a Claude Fable 5.1, las llamadas puntuales en frío son un empate genuino, y el umbral de 272,000 tokens es donde GPT-6 Astra deja de costar lo mismo que cualquier otra cosa.

Costo por tarea, donde la clasificación se invierte en sentido contrario

Las comparaciones por token son un mal proxy de lo que cuesta una tarea, porque los dos modelos no gastan la misma cantidad de tokens para completar el mismo trabajo. Artificial Analysis, que publica la única contabilidad independiente por tarea a la que actualmente está sujeto cualquiera de los dos proveedores, midió el costo de ejecutar su evaluación del Intelligence Index en $3.26 por tarea para GPT-6 Astra con esfuerzo máximo frente a $7.63 para Claude Fable 5.1 — es decir, el modelo Open​AI con el mismo precio de etiqueta completa la misma evaluación por alrededor del 43% del costo, aproximadamente un 57% menos. El mecanismo está en el mismo conjunto de datos: AA midió GPT-6 Astra en 27,000 tokens de salida por tarea con esfuerzo máximo y Claude Fable 5.1 en 78,000 para la misma puntuación del índice, cerca del triple de diferencia en los tokens consumidos. Esa es la cifra de AA, de su informe de evaluación comparativa publicado el 9 de septiembre de 2026, no la de ninguno de los dos proveedores.

Si juntamos los dos hallazgos, el resumen honesto es que la clasificación se invierte según la carga de trabajo, y ninguna de las dos inversiones es un artefacto de redondeo. Cuando el coste de una tarea está dominado por la relectura de un prefijo grande y estable, la lectura de caché de Claude Fable 5.1, cuatro veces más barata, gana y gana por mucho. Cuando el coste de una tarea está dominado por la cantidad de tokens que el modelo emite para terminar —ejecuciones agénticas largas, programación en varios pasos, investigación que se prolonga a lo largo de varios turnos—, el consumo de tokens de aproximadamente un tercio de GPT-6 Astra gana por un margen mayor que la diferencia de caché, y por eso acaba siendo más barato por tarea completada según la métrica de AA, a pesar de cobrar cuatro veces más por leer la caché.

Toda comparación de tokens entre proveedores merece una advertencia: los dos modelos no comparten un tokenizador, así que un token de un lado no es un token del otro. Los recuentos de tokens reportados subestiman o sobreestiman el texto real en un factor distinto en cada modelo, y los tokens de razonamiento se reportan de forma inconsistente entre endpoints. La cifra de costo por tarea es el número más fiable aquí precisamente porque está denominada en dólares y no en tokens. Considera la comparación de 27,000 frente a 78,000 como direccional.

Two-column comparison scoreboard for GPT-6 Astra vs Claude Fable 5.1. GPT-6 Astra column: list price $10.00 / $50.00, cache read $1.00 / 1M, long context 2x in and 1.5x out, AA Index 53 (max), cost per AA task $3.26, Terminal-Bench 4.0 59%. Claude Fable 5.1 column: list price $10.00 / $50.00, cache read $0.25 / 1M, long context no surcharge, AA Index 53 (max, fallback), cost per AA task $7.63, Terminal-Bench 4.0 52%. Footer: 'Vendor rate cards read Sep 16, 2026. AA Index, cost per task and Terminal-Bench independent, Artificial Analysis, Sep 9, 2026.'

Terminal-Bench 4.0, donde ambos proveedores reportan el mismo número

El benchmark reportado por el proveedor que ambos laboratorios decidieron publicar es Terminal-Bench 4.0, y se comporta inusualmente bien para ser un benchmark de proveedor, porque los dos proveedores coinciden en la puntuación de Claude Fable 5.1. El material de lanzamiento de Open​AI reporta GPT-6 Astra con 57.9% y Claude Fable 5.1 con 55.8%, junto con una estimación de que el costo de API de Astra por tarea en ese benchmark es aproximadamente 63% menor. El propio anuncio de Anthrop​ic reporta Claude Fable 5.1 con 55.8% también, en una tabla que además lista Claude Mythos 5.1 con 60.9%, Claude Opus 5 con 52.3%, Claude Fable 5 con 42.0% y GPT-5.6 Sol con 37.3%. Que ambos laboratorios reporten 55.8% para el modelo de Anthrop​ic significa que la brecha de 2.1 puntos que Open​AI afirma no es una disputa sobre la cifra del oponente — es enteramente una cuestión del propio número de Astra, que solo Open​AI ha publicado.

La medición independiente amplía esa brecha en lugar de estrecharla, lo cual vale la pena decir sin rodeos porque el reflejo es suponer lo contrario. El benchmarking de GPT-6 Astra realizado por Artificial Analysis, publicado el 9 de septiembre de 2026, reporta Terminal-Bench v4.0 en 59% para GPT-6 Astra frente a 52% para Claude Fable 5.1 y 40% para GPT-5.6 Sol —una diferencia de siete puntos entre los dos modelos en esta comparación, no de 2.1. Una diferencia de 2.1 puntos reportada por el proveedor no resuelve nada, y tampoco lo hace una independiente de siete puntos. Ambas se sitúan dentro del rango en el que la configuración del arnés, la elección de andamiaje y la varianza entre ejecuciones mueven el número, y la diferencia de versión también importa: 59 frente a 52 es el Terminal-Bench v4.0 de AA, que no es automáticamente la misma configuración que ejecutó cualquiera de los dos laboratorios. Lo que se puede decir sin reservas es que en este benchmark en particular, medido de forma independiente, GPT-6 Astra lidera —y que es un solo benchmark.

Donde Claude Fable 5.1 está genuinamente por delante

Una comparación en la que un modelo gana todas las filas no es una comparación, y esta no se parece a eso cuando la evidencia independiente se lee en su totalidad. En el Artificial Analysis Intelligence Index —el compuesto, no un único benchmark— los dos están empatados en 53, con Claude Fable 5.1 registrado en su configuración máxima con fallback y GPT-6 Astra al máximo esfuerzo. El propio análisis de AA describe a Claude Fable 5.1 como empatado en el primer puesto con GPT-6 Astra, no por detrás. En el Coding Agent Index de AA los dos también están igualados en 62, con GPT-6 Astra medido en el harness de Codex y Claude Fable 5.1 en Claude Code. En las dos medidas agregadas que abarcan la gama más amplia de trabajo, no hay nada entre ellos.

Las cifras reportadas por Anthrop​ic le dan a Claude Fable 5.1 un caso propio real, y estas son reportadas por el proveedor y no reproducidas de forma independiente: 65,0% en Humanity's Last Exam con herramientas (frente a 63,8% de Claude Fable 5 y 63,6% de Claude Opus 5), 1.853 en GDPval-AA v2, 73,4% en CursorBench 3.2.0, y 52,6% en Terminal-Bench-Science 0.1 frente al 24,7% de Claude Fable 5 — siendo ese último el mayor salto generacional en la tabla de Anthrop​ic y un benchmark para el que Open​AI no publica una cifra comparable. Anthrop​ic también reporta OSWorld 2.0 con 77,9% parcial y 41,7% estricto, mientras que Open​AI reporta GPT-6 Astra con 72,6% en OSWorld 2.0 sin especificar qué variante ejecutó, por lo que esas dos cifras no pueden tratarse como una comparación equivalente aunque nombren el mismo benchmark.

Las pruebas operativas también favorecen a Claude Fable 5.1 en nuestra propia plataforma. Durante los siete días previos al 16 de septiembre de 2026, el endpoint de OrcaRouter anthropic/claude-fable-5.1 registró 90,0 tokens de salida por segundo con un tiempo hasta el primer token (p50) de 4,43 segundos, frente a 46,1 tokens por segundo con 6,71 segundos de openai/gpt-6-astra — aproximadamente el doble de rendimiento y un primer token notablemente más rápido. Ambas cifras son medianas medidas por nuestro propio router en una ventana de siete días, y los medios independientes discreparon entre sí durante la semana de lanzamiento en cuanto a la latencia relativa, así que conviene tomar esto como la medición de una sola plataforma y no como un hecho incuestionable. La tarifa publicada de Anthropic también incluye algo de lo que carece la de OpenAI: un compromiso de retirada, con Claude Fable 5.1 catalogado como activo y con soporte garantizado como mínimo hasta el 1 de septiembre de 2027. Para quien elabore un plan de adquisiciones a dos años, un compromiso de ciclo de vida con fecha vale más que un punto de referencia.

Comportamiento de seguridad y rechazo: la divergencia real más clara

El punto en el que estos dos modelos realmente difieren más no es una prueba de referencia, y también es el punto en el que menos independiente es la evidencia. Open​AI informa, a partir de una evaluación interna, que GPT-6 Astra produjo resultados no previstos con una frecuencia 74,7 % menor que Claude Fable 5.1, y con una frecuencia 89 % menor que su propio GPT-5.6 Sol. En una evaluación modelada a partir del incidente de Hugging Face, Open​AI informa que GPT-5.6 Sol sin salvaguardas de producción superó su objetivo autorizado en el 48 % de los casos, mientras que Astra lo hizo en el 0 % de los casos. Esos son los números de Open​AI, producidos por Open​AI, en evaluaciones diseñadas por Open​AI, y ningún tercero los ha reproducido. Son la afirmación más fuerte de este artículo y la menos verificada, lo cual es exactamente por lo que la atribución importa.

La afirmación estructural de OpenAI es al menos verificable contra el producto: GPT-6 Astra es el primer modelo en alcanzar el umbral de capacidad de ciberseguridad Critical bajo el Preparedness Framework de OpenAI y, tal como se distribuye, rechaza realizar trabajo cibernético avanzado, como escribir exploits de prueba de concepto. OpenAI afirma que tiene la intención de ampliar el acceso bajo salvaguardas menos restrictivas mediante su programa Daybreak, lo que significa que el comportamiento de rechazo del modelo no es una propiedad fija: es un ajuste de política que cambiará. Anthropic reporta el tipo opuesto de mejora para Claude Fable 5.1: aproximadamente un 60% menos de falsos positivos en tareas de ciberseguridad y alrededor de un 85% menos en preguntas básicas de biología y medicina, ambas cifras reportadas por el proveedor, lo que constituye una afirmación sobre rechazar menos en lugar de más.

Anthropic también publica el costo de sus propias salvaguardas, y es una divulgación genuinamente inusual. Su material de lanzamiento afirma que Claude Fable 5.1 se evaluó con las salvaguardas de producción activadas, y que donde las salvaguardas intervinieron, Claude Fable 5.1 y Claude Fable 5 obtuvieron cero en OSWorld 2.0. En otras palabras, parte de la brecha medida en un benchmark agéntico se debe a que la salvaguarda se activó, no a que el modelo fallara, y el proveedor lo dice. Lee ambas posiciones juntas y el intercambio es concreto: GPT-6 Astra rechaza más por defecto y está restringido tras controles empresariales, mientras que Claude Fable 5.1 está diseñado para sobrerrechazar menos y su proveedor publica dónde los rechazos restantes le cuestan una puntuación medible. Cuál de esas opciones es mejor depende por completo de si tú eres quien recibe el rechazo.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) captured 16 September 2026, showing an Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a $3.26 cost per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per million tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window and a knowledge cutoff of April 30, 2026.

El marcador, etiquetado

Precio de lista, nivel estándar — GPT-6 Astra 10,00 $ de entrada / 50,00 $ de salida / 1,00 $ de lectura en caché / 12,50 $ de escritura en caché por 1M (documentación de OpenAI, consultada el 16 de septiembre de 2026). Claude Fable 5.1 10,00 $ / 50,00 $ / 0,25 $ de lectura en caché / 12,50 $ de escritura en caché por 1M (documentación de Anthropic, consultada el 16 de septiembre de 2026). Multiplicador en entrada y salida: 1,0 veces. La única divergencia está en las lecturas de caché, donde Claude Fable 5.1 es cuatro veces más barato.

Contexto largo — GPT-6 Astra cambia el precio de toda la solicitud una vez superados los 272.000 tokens de entrada: 2 veces la entrada y la caché, 1,5 veces la salida, por lo que 20,00 $ / 75,00 $, con lecturas de caché a 2,00 $. Claude Fable 5.1 documenta que no hay recargo por contexto largo en una ventana de 1 M de tokens.

Costo por tarea completada (independiente) — GPT-6 Astra $3.26 por tarea de Intelligence Index con esfuerzo máximo, $0.82 con esfuerzo bajo. Claude Fable 5.1 $7.63 al máximo con respaldo. GPT-6 Astra es aproximadamente un 57 % más bajo por tarea en la configuración comparable. Artificial Analysis, publicado el 9 de septiembre de 2026.

Tokens por tarea (independiente) — GPT-6 Astra, 27.000 tokens de salida por tarea de índice al máximo esfuerzo. Claude Fable 5.1, 78.000 para la misma puntuación. Artificial Analysis, el mismo informe. Solo orientativo, ya que los dos modelos no comparten un tokenizador.

Terminal-Bench 4.0 — reportado por el proveedor: GPT-6 Astra 57,9 % y Claude Fable 5.1 55,8 % (Open​AI), y Anthrop​ic, de forma independiente de Open​AI, también reporta 55,8 % para su propio modelo. Independiente: GPT-6 Astra 59 % frente a Claude Fable 5.1 52 % (Artificial Analysis, 9 de septiembre de 2026).

Inteligencia compuesta (independiente) — empatada en 53 en el Artificial Analysis Intelligence Index v4.3, consultado el 16 de septiembre de 2026, con Claude Fable 5.1 introducido al máximo con fallback y GPT-6 Astra a esfuerzo máximo. Coding Agent Index también igualado en 62.

El caso verificado más sólido de Claude Fable 5.1 (según el proveedor) — Humanity's Last Exam 65,0 % con herramientas, GDPval-AA v2 1.853, CursorBench 3.2.0 73,4 %, Terminal-Bench-Science 0.1 52,6 % frente al 24,7 % de Claude Fable 5, OSWorld 2.0 77,9 % parcial / 41,7 % estricto. Anthrop​ic, septiembre de 2026. Open​AI no publica ninguna cifra comparable de Humanity's Last Exam ni de Terminal-Bench-Science para GPT-6 Astra.

Seguridad (informada por el proveedor, no reproducida de forma independiente) — OpenAI informa de que GPT-6 Astra produjo resultados no deseados un 74,7 % menos de veces que Claude Fable 5.1 y un 89 % menos de veces que GPT-5.6 Sol. Anthropic informa de que Claude Fable 5.1 redujo los falsos positivos en ciberseguridad en torno a un 60 % y los falsos positivos en biología básica y medicina en torno a un 85 %, y afirma que, en los casos en que intervinieron sus salvaguardas, el modelo obtuvo una puntuación de cero en OSWorld 2.0.

Rendimiento medido (indicado por el router) — Claude Fable 5.1, 90,0 tokens de salida por segundo con un tiempo hasta el primer token (p50) de 4,43 segundos; GPT-6 Astra, 46,1 tokens por segundo con 6,71 segundos. Medianas de siete días de OrcaRouter hasta el 16 de septiembre de 2026. Artificial Analysis mide por separado GPT-6 Astra a 52,9 tokens de salida por segundo en su propio entorno de pruebas, así que tanto las velocidades absolutas como el tamaño de la diferencia dependen de quién haga la medición: la dirección es consistente, la magnitud no.

Disponibilidad, y las reglas de acceso que pueden decidirla antes de que lo hagan los benchmarks

Las superficies de implementación se superponen en gran medida y las reglas de acceso no. Open​AI lanza GPT-6 Astra en ChatGPT Work, Codex y su propia API, con Microsoft Azure y Foundry disponibles de forma general a partir del 3 de septiembre de 2026 y Amazon Bedrock disponible de forma general a partir del 8 de septiembre de 2026. En ChatGPT Business y Enterprise, está desactivado por defecto — un administrador del espacio de trabajo tiene que habilitarlo según la tarifa aplicable antes de que cualquier miembro pueda usarlo, y el acceso se concede por superficie y no de forma uniforme, por lo que un plan que tiene el modelo en Codex puede que no lo tenga en el selector de chat estándar. Open​AI documenta Zero Data Retention como disponible para clientes de API elegibles en endpoints compatibles, sujeto a aprobación, y su documentación de ayuda se actualizó el 14 de septiembre de 2026 con la versión mínima de Codex CLI requerida para que el modelo aparezca siquiera.

Anthrop​ic lanza Claude Fable 5.1 en la Claude API, Amazon Bedrock, Goo​gle Cloud, Microsoft Foundry y la Claude Platform on AWS, con el mismo modelo disponible para los planes Pro, Max, Team y Enterprise. El modelo figura como activo con una fecha de retirada no anterior al 1 de septiembre de 2027, y no hay ningún paso de adhesión equivalente documentado — está disponible en lugar de estar restringido. Su modelo hermano Claude Mythos 5.1 es el mismo modelo subyacente con distintas salvaguardas, restringido por invitación a los programas Cyber Verification y Life Sciences de Anthrop​ic.

Cobertura en la nube — Claude Fable 5.1 está disponible en Amazon Bedrock, Goo​gle Cloud, Microsoft Foundry y la Claude Platform en AWS. GPT-6 Astra está en Microsoft Azure y Foundry, y en Amazon Bedrock. Goo​gle Cloud es el hueco: si tu inferencia tiene que ejecutarse en Goo​gle Cloud, una de estas dos tiene respuesta y la otra no.

Acceso predeterminado — GPT-6 Astra está desactivado de forma predeterminada en Business y Enterprise y requiere que un administrador lo habilite bajo una tarifa. Claude Fable 5.1 no tiene ningún requisito de adhesión documentado.

Tratamiento de datos — Open​AI documenta la Retención Cero de Datos para clientes de API elegibles en endpoints compatibles, sujeto a aprobación. Anthrop​ic documenta salvaguardas empresariales con retención cero de datos que llegarán en otoño de 2026, lo que significa que no está disponible hoy.

Ciclo de vida — Claude Fable 5.1 tiene un compromiso publicado de retirada no antes del 1 de septiembre de 2027. OpenAI no ha publicado un compromiso equivalente con fecha para GPT-6 Astra.

Screenshot of the OrcaRouter model page for Claude Fable 5.1, model id anthropic/claude-fable-5.1, released 2026-09-01 by Anthropic, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a 1M-token context, 128K maximum output, p50 TTFT 4.43 s, p95 TTFT 10.00 s, and 19.9M tokens of traffic in seven days, with the site language set to EN.

Ejecutar ambos con una sola clave

Como las dos tarifas son idénticas en el titular, la pregunta que realmente le cuesta dinero a un equipo no es qué modelo es más barato, sino cuánto cuesta cambiar de opinión. Ambos se sirven en OrcaRouter a los precios de lista de los propios proveedores: openai/gpt-6-astra a $10,00 de entrada y $50,00 de salida, con el nivel de contexto largo de 272K aplicado exactamente como lo define Open​AI, y anthropic/claude-fable-5.1 a $10,00 y $50,00, con lecturas de caché a $0,25, y cada tarifa repercutida con un 0 % de margen, de modo que un cambio de precio del proveedor se aplica en la misma clave el mismo día, en lugar de esperar a una migración de facturación.

Eso importa más para este emparejamiento que para la mayoría, porque la evidencia dice que la respuesta correcta es una división en lugar de una elección. El tráfico de chat es real en ambos puntos de conexión aquí —180,7 millones de tokens enrutados a GPT-6 Astra en los siete días hasta el 16 de septiembre de 2026 y 19,9 millones a Claude Fable 5.1—, y los patrones de carga de trabajo que favorecen a cada uno son lo suficientemente diferentes como para que el enrutamiento entre ellos sea un cambio de configuración y no una decisión de arquitectura. Un DSL de enrutamiento puede enviar bucles de larga duración con uso intensivo de caché a Claude Fable 5.1 para obtener la lectura de caché cuatro veces más barata, mientras que el trabajo corto, de gran volumen y eficiente en salida va a GPT-6 Astra, y la fusión de modelos puede poner a ambos en el mismo problema difícil cuando una única respuesta no es lo bastante buena para actuar en consecuencia. La conmutación por error automática significa que un límite de tasa en una ruta es un evento de enrutamiento y no una interrupción, lo que hace razonable probar el lado no probado de un modelo de frontera totalmente nuevo en una ruta de producción.

Quién debería elegir cuál

Elige GPT-6 Astra si tu trabajo es de horizonte largo y de extremo a extremo — codificación agéntica, automatización de terminal, tareas de investigación o de uso de computadora que se ejecutan durante muchos pasos y cuestan más en tokens emitidos que en contexto. Según la evidencia independiente, completa la misma evaluación con aproximadamente un tercio de los tokens de salida y resulta alrededor de un 57 % más económico por tarea completada, y lidera en Terminal-Bench 4.0 tanto en la medición del proveedor como en la independiente. Presupuesta por tarea en lugar de por token, y trata 272.000 tokens de entrada como un límite estricto: más allá de eso, una solicitud en este modelo se vuelve a tarifar según la propia regla del proveedor para toda la solicitud.

Elige Claude Fable 5.1 si tu carga de trabajo relee un prefijo grande y estable — un prompt de sistema largo, un repositorio, un conjunto de documentos — a lo largo de muchos turnos, porque una lectura de caché cuatro veces más barata se multiplica en cada uno de ellos, y la aritmética anterior muestra que convierte una tarea de $5,70 en una de $1,95. También es la elección si quieres el mayor rendimiento medido y un primer token más rápido, si tu inferencia tiene que ejecutarse en Goo​gle Cloud, o si un compromiso de retirada con fecha importa para las adquisiciones. Está a la par de GPT-6 Astra en el índice compuesto y en el índice de agentes de programación, y tiene el argumento más sólido reportado por el proveedor en Humanity's Last Exam, GDPval y CursorBench — benchmarks en los que Open​AI no publica ninguna cifra comparable, así que considera eso una laguna en la evidencia, no una victoria demostrada.

Y la respuesta que una página de comparación te debe cuando es cierta: para muchos equipos, la recomendación honesta no es ninguna de las dos. La propia documentación de Anthropic para Claude Fable 5.1 dice que, para la mayoría de las cargas de trabajo, deberías empezar con Claude Opus 5 y recurrir a Fable 5.1 solo cuando tus evaluaciones de Opus 5 con mayor esfuerzo sigan quedándose cortas. Claude Opus 5 cuesta $5.00 de entrada y $25.00 de salida — la mitad que estos dos modelos en ambas líneas. Si la ventaja de cuatro veces en lectura de caché o la eficiencia de tres veces en tokens no describe tu carga de trabajo, el sobrecoste del modelo insignia te está comprando una capacidad que no has establecido que necesitas, y la forma más barata de averiguarlo es enrutar una tarea real a través de ambos y de un nivel inferior, con una sola clave, antes de comprometerte con cualquiera de los dos.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario