Una tarjeta de título generada para Claude Opus 5.5 vs Claude Fable 5.1, con el subtítulo «El modelo más barato ganó el índice independiente», con el logotipo real de OrcaRouter compuesto en la esquina inferior derecha y una línea de pie de página que dice «Índice según Artificial Analysis con esfuerzo máximo; precios según Anthropic».
Guides & Insights

Claude Opus 5.5 vs Claude Fable 5.1: El modelo más barato ganó el índice independiente

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Anthropic ahora vende dos modelos en lo más alto de su catálogo, y el que cuesta dos veces y media más no es el que está en lo más alto de la tabla. Claude Opus 5.5, lanzado el 22 de septiembre de 2026 a 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida, obtiene 58 en el Artificial Analysis Intelligence Index. Claude Fable 5.1, que ocupa la posición insignia desde el 1 de septiembre a 10 dólares de entrada y 50 de salida, obtiene 53. Ambas cifras provienen del mismo evaluador, ambas se midieron en la misma familia de configuraciones, y la diferencia va en sentido contrario al de las etiquetas de precio. Ese es el hecho del que tiene que partir esta comparación, porque casi todos los artículos de lanzamiento de la última semana presentan el Opus 5.5 como la versión con descuento del Fable 5.1: un modelo más barato que "iguala" al caro en la mayoría de las tareas. El dato independiente dice que el modelo con descuento va por delante.

Que eso deba cambiar lo que despliegas es una cuestión distinta, y la respuesta depende menos de la diferencia de cinco puntos que de dos ajustes que nadie pone en un titular: a qué nivel de esfuerzo recurre por defecto cada modelo, y cuál de los dos se puede hacer rápido.

Los números independientes, y lo único que comparten

A two-column scoreboard comparing Claude Opus 5.5 and Claude Fable 5.1 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #4), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), context window (1M tokens on both), default effort (medium against high), knowledge cutoff (Jun 2026 on both) and fast mode (supported at $8.00 / $40.00 against not supported). The footer reads 'Index figures per Artificial Analysis at max effort; prices, effort defaults and fast-mode support per Anthropic.'

Artificial Analysis publica una configuración por modelo y, para ambos, se etiqueta como «Razonamiento adaptativo, esfuerzo máximo, fallback predeterminado». La misma etiqueta, el mismo evaluador, la misma ejecución —lo que convierte esto en el cara a cara más limpio que haya tenido cualquiera de los dos modelos:

• Índice de Inteligencia — Claude Opus 5.5 58, en el puesto n.º 1 de 210 frente a Claude Fable 5.1 53, en el puesto n.º 4

• Velocidad de salida — Claude Fable 5.1 65,8 tokens/seg, por debajo de la mediana de 71,0 de la tabla, frente a Claude Opus 5.5, aún no publicado en la tabla

• Tiempo hasta el primer token — Claude Fable 5.1: 274,43 s frente a una mediana del tablero de 3,83 s; Claude Opus 5.5 aún no publicado

• Verbosidad en el índice — Claude Opus 5.5 generó 260 M de tokens de salida, frente a una mediana de 88 M en general

• Precio — Claude Opus 5.5 $4.00 / $20.00 por millón frente a Claude Fable 5.1 $10.00 / $50.00

Dos de esas filas requieren una lectura, más que una cita. La primera es la etiqueta «Max Effort»: la puntuación de ninguno de los modelos refleja la configuración predeterminada con la que se entrega, y esas dos configuraciones predeterminadas no son iguales; más sobre eso, abajo. La segunda es la fila de verbosidad, que va en contra de cómo se ha vendido Opus 5.5. El relato de eficiencia de Anthropic es que el modelo llega a la misma respuesta con menos tokens, y el material de lanzamiento cita a socios que reportan entre un tercio y la mitad menos de tokens de salida. En el Index, medido en vez de citado, Opus 5.5 emitió 260 M de tokens frente a una mediana del ranking de 88 M, aproximadamente tres veces más verboso que el modelo típico con el que se lo compara. Ambas cosas pueden ser ciertas: puede usar menos tokens que Claude Opus 5 y aun así ser un modelo verboso en términos absolutos. Pero si hiciste tu presupuesto a partir de la frase de «menos tokens» y no de tu propia factura, la medición independiente es la que conviene revisar.

Lo que compran los 6 $ extra por millón

A screenshot of Anthropic's Claude Platform Docs page for Claude Opus 5.5 showing its 'How it compares' table: Claude Fable 5.1 and Claude Opus 5.5 both at 1M context and 128K max output with a Jun 2026 cutoff, Fable 5.1 at $10 / $50 with high default effort and slower latency against Opus 5.5 at $4 / $20 with medium default effort and moderate latency, with Claude Sonnet 5 at $2 / $10 and a Jan 2026 cutoff and Claude Haiku 4.5 below them. The Opus 5.5 pricing panel underneath lists $4 input, $20 output, $5 and $8 cache writes, $0.20 cache read and a 50% batch discount.

Si eliminas los benchmarks, la diferencia se reduce a una tabla de tarifas. Todo lo que hay aquí procede de la página de precios publicada por Anthropic, verificable hoy:

• Entrada — $4.00 por millón en Opus 5.5 frente a $10.00 en Fable 5.1

• Salida — $20.00 por millón frente a $50.00

• Lectura de caché — $0.20 por millón en Opus 5.5 frente a $0.25 en Fable 5.1

• Multiplicador de caché — Opus 5.5 cobra los aciertos de caché a 0,05x la entrada base; Fable 5.1 los cobra a 0,025x, un mejor multiplicador sobre una base más alta

• Escritura en caché — $5 por millón para una ventana de 5 minutos y $8 por una hora en Opus 5.5, frente a $12.50 y $20 en Fable 5.1

• API por lotes — Opus 5.5 se reduce a la mitad: $2.00 / $10.00; Fable 5.1 se reduce a la mitad: $5.00 / $25.00

• Modo rápido — Opus 5.5 lo admite a $8.00 / $40.00 por hasta aproximadamente 2,5 veces la velocidad de salida; Fable 5.1 no admite el modo rápido en absoluto

La línea de caché es la que hay que mirar dos veces, porque los dos modelos invierten el patrón habitual. Fable 5.1 tiene el multiplicador más agresivo —2,5 % del input base frente al 5 % de Opus 5.5—, pero como su base es de 10 $ en lugar de 4 $, su lectura de caché sigue siendo la más cara de las dos en dólares absolutos. No hay ninguna configuración en la que el modelo premium salga ganando con un token de contexto en caché. Y el multiplicador no es algo que se pueda trasladar: un bucle de agente ajustado al comportamiento de caché de Fable 5.1 pagará proporcionalmente más por cada acierto de caché en Opus 5.5, aunque pague menos por cada token nuevo.

El modo rápido es la asimetría más marcada. La documentación de Anthropic incluye el modo rápido para Claude Opus 5.5, Claude Opus 5 y Claude Opus 4.8; Fable 5.1 no aparece en esa lista. Así que el modelo más barato tiene una palanca de latencia que el caro simplemente no tiene, a $8/$40, lo que sigue estando por debajo de la tarifa estándar de salida de $10/$50 de Fable 5.1. Si su carga de trabajo es lo bastante interactiva como para que un primer token lento sea un problema de producto, tenga en cuenta que el tiempo hasta el primer token medido de Fable 5.1 es de 274 segundos. Ese número es un artefacto del razonamiento de esfuerzo máximo, no un defecto, pero es el número que registró un evaluador.

Los valores predeterminados no son los mismos, y esa es la trampa.

La propia documentación de modelos de Anthropic pone los dos modelos uno al lado del otro, y la fila que decide la mayoría de las comparaciones reales no es el precio. Es el nivel de esfuerzo predeterminado: medium para Claude Opus 5.5, high para Claude Fable 5.1. Ambos ejecutan un pensamiento adaptativo que no se puede desactivar; la profundidad se controla únicamente mediante el parámetro de esfuerzo, en una escala que va de low, medium, high, xhigh a max.

Esto explica por qué la frase de lanzamiento «Opus 5.5 iguala a Fable 5.1 en la mayor parte del trabajo» y las tablas de benchmarks que aparecen debajo parecen contradecirse. Las filas de comparación directa de Anthropic para Opus 5.5 con frecuencia llevan la etiqueta de una configuración de esfuerzo más alta que la predeterminada; la cifra de Terminal-Bench 4.0 de 66,4 % frente al 55,8 % de Fable 5.1 se ejecutó con esfuerzo xhigh, no con medio. Mientras tanto, los propios números de Fable 5.1 se obtuvieron con su valor predeterminado más alto. Dos modelos comparados con configuraciones de esfuerzo diferentes no se están comparando en absoluto, y Anthropic lo mismo en su propio material de lanzamiento cuando advierte que los márgenes de los benchmarks a este nivel de capacidad son una guía menos fiable para la diferencia en el mundo real de lo que las puntuaciones dan a entender.

En la práctica, eso convierte la decisión en un ejercicio de ajuste en lugar de una selección. Si pasas de Fable 5.1 a Opus 5.5 y trasladas tu effort sin cambios, habrás alterado en silencio cuánto piensa el modelo, y todas las cifras de calidad y coste que produzcas después quedarán confundidas. La recomendación de Anthropic es probar varios niveles de effort en lugar de portar los ajustes del modelo anterior. Hacerlo es barato y casi nadie lo hace, porque implica ejecutar tus propias evaluaciones dos veces.

El único lugar donde la combinación se justifica

El patrón que justifica conservar ambos es el bucle del asesor: Opus 5.5 haciendo el trabajo y Fable 5.1 consultado para las decisiones difíciles. Anthropic lo midió, y sí añade precisión —a mayor coste y mayor latencia, que es el intercambio que cabría esperar al poner el modelo más lento en el bucle. Lo que ha cambiado es la aritmética que hay detrás. Cuando la brecha de capacidad era mayor, pagar $10/$50 para supervisar a un trabajador de $5/$25 valía obviamente la pena. Ahora que el trabajador supera en puntuación al asesor en el índice independiente, la contribución del asesor se reduce a las tareas específicas en las que sus propias evaluaciones superan a Opus 5.5, y esas son las tareas que tienes que identificar tú mismo. El bucle sigue teniendo sentido para un subconjunto difícil; deja de tenerlo como configuración general.

Ambos están a una tecla de distancia

El detalle de la migración que sorprende a los equipos aquí no es la superficie de la API — es que estos son los modelos del mismo proveedor con diferentes escalas de esfuerzo, diferentes multiplicadores de caché y diferentes ajustes predeterminados, y compararlos con honestidad implica ejecutar ambos con tus propios prompts en una configuración equivalente. Claude Opus 5.5 está en OrcaRouter al propio precio de Anthropic de $4.00 / $20.00, y Claude Fable 5.1 está en OrcaRouter a $10.00 / $50.00 — el precio de lista del proveedor se traslada con un 0 % de margen, así que ambas cifras cambian el día que Anthropic las cambie y ninguna conlleva un segundo contrato ni un segundo SDK.

A screenshot of OrcaRouter's own model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited to Anthropic, showing $10.00 input and $50.00 output per 1M tokens and a PERFORMANCE panel with 65.8 output tokens per second, a 274.43s time to first token, 88M output tokens over 7 days and a 0.00% error rate.

Eso es lo que hace que la división sea práctica y no teórica. Enviar la mayor parte de tu tráfico a Opus 5.5 y fijar una regla de enrutamiento que escale los casos genuinamente difíciles a Fable 5.1 es una configuración en un único endpoint, no dos integraciones; y componer una llamada para que un modelo redacte mientras el otro verifica es una línea del DSL de enrutamiento en lugar de un pipeline que tengas que construir y mantener. Si la ruta de escalado resulta equivocada para tu carga de trabajo, el failover automático hace que la solicitud acabe en un modelo que ya has caracterizado en lugar de fallar por completo.

¿Qué lo resolvería?

El estado honesto de esta comparación es que Anthropic ha publicado una tabla en la que el modelo más barato gana en la mayoría de las filas, Artificial Analysis ha publicado otra en la que gana de forma contundente, y ambas se ejecutaron con ajustes de esfuerzo que usted no usa en producción. Ninguna es una comparación directa controlada con los valores predeterminados igualados, y ningún tercero ha realizado una. La brecha que sobrevive a todo eso —que Claude Opus 5.5 es sustancialmente más barato en cada línea de la lista de precios, admite un modo rápido que Fable 5.1 no tiene, y no va por detrás en la única puntuación independiente que ambos modelos tienen— es lo bastante grande como para que la carga de la prueba haya cambiado de lado. Si usted usa Fable 5.1 de forma predeterminada, la pregunta ya no es si Opus 5.5 es suficientemente bueno; es qué tareas específicas de su carga de trabajo fallan con un esfuerzo medio, porque esas son las únicas por las que está pagando la prima.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario