Tarjeta de título principal de Claude Opus 5.5 que dice «cada puntuación, el ajuste de esfuerzo del que proviene y quién la midió», con dos chips de estadísticas: 66,4 % en Terminal-Bench 4.0 con esfuerzo xhigh, reportado por el proveedor, y 59,6 % en el mismo benchmark, de forma independiente.
Guides & Insights

Benchmarks de Claude Opus 5.5: cada puntuación, el ajuste de esfuerzo del que provino y quién la midió

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El número titular de Ant​hropic para Claude Opus 5.5 en Terminal-Bench 4.0 es 66.4%, consignado frente a 52.3% de Claude Opus 5 en la misma tabla, y ese 66.4% se produjo con un esfuerzo xhigh, no con el valor predeterminado del modelo, medium. El modelo se lanzó el 22 de septiembre de 2026, dos días antes de que se escribiera esta página, por lo que es un modelo GA con el precio de un modelo GA y la tabla de benchmarks de un modelo GA. La cifra independiente en el mismo benchmark, de Artificial Analysis, es 59.6%, en una configuración que lleva incorporado el enrutamiento de salvaguardas del lado del servidor de Ant​hropic. Entre esas dos cifras median una diferencia de harness, una diferencia de esfuerzo y una diferencia de enrutamiento, y nadie —incluidos nosotros— puede decir todavía cuánto de la brecha explica cada una. Lo que esta página sí puede hacer es reunir en un solo lugar todas las cifras publicadas de Claude Opus 5.5, indicar quién las produjo, indicar la configuración con la que se produjeron e incluir las filas en las que GPT-6 Astra y Claude Fable 5.1 quedan por delante.

Empieza por el ajuste de esfuerzo, porque mueve más los números que los propios modelos.

Claude Opus 5.5 usa por defecto medium como nivel de esfuerzo en la Claude API. Claude Opus 5 usaba por defecto high. Además, un mismo nivel con el mismo nombre tampoco implica el mismo presupuesto de razonamiento en los dos modelos, así que «ejecutamos ambos en high» no es una comparación controlada aunque la etiqueta coincida. El razonamiento adaptativo está siempre activado y no se puede desactivar en Opus 5.5; el parámetro effort ajusta la profundidad, la latencia y el coste, y nada más.

La cifra de Terminal-Bench 4.0 de Anthropic se ejecutó con xhigh. Ese único dato es la salvedad más importante de esta página, porque el benchmark que encabeza es el que tiene el margen más amplio reportado frente al modelo anterior, y porque la misma tabla muestra qué ocurre cuando se deja el ajuste tal cual:

FrontierCode v1.1 Main — 54,4 % en xhigh, 54,6 % en medium predeterminado.Reportado por el proveedor. La ejecución en medium es más alta que la ejecución en xhigh. En esta carga de trabajo, el control de esfuerzo no aportó nada medible; los dos números son el mismo número.

CursorBench 4.0 — 57,8 % con xhigh, 52,5 % con medium. Reportado por el proveedor. Mismo modelo, mismo harness, misma semana: 5,3 puntos, el mayor delta de esfuerzo sobre la mesa.

Esas dos filas dentro de una única tabla de proveedor son todo el argumento. Una carga de trabajo es insensible al esfuerzo y la otra es fuertemente sensible al esfuerzo, y la tarjeta del modelo no puede decirte de antemano cuál de los dos tipos es la tuya. La conclusión que respaldan los datos es limitada y merece enunciarse de forma limitada: el nivel de esfuerzo adecuado es ahora una medición por carga de trabajo, no un valor predeterminado que se hereda. No respalda «Opus 5.5 es más rápido de lo que sugieren sus benchmarks» ni «Anthropic saboteó el valor predeterminado»; para eso harían falta barridos por carga de trabajo en los cinco ajustes, y nadie los ha publicado. Sí significa que, si migras desde Opus 5 y conservas el ajuste de esfuerzo que ya tenías, has cambiado el experimento, no solo el modelo.

Una asimetría más, y esta corta en la dirección opuesta. La columna del competidor en la fila de Terminal-Bench de Anthropic es GPT-6 Astra con 57.9% — ejecutado con esfuerzo high, según la propia nota del gráfico de Anthropic, mientras que el 66.4% de Opus 5.5 se ejecutó con xhigh. Una tabla de proveedor que ejecuta su propio modelo con una configuración y a un rival con otra no es una comparación cara a cara, sin importar cómo se vean los dos números uno al lado del otro.

La tabla de proveedores, con el origen y la configuración en cada fila.

Todo en esta sección es reportado por el proveedor: material de lanzamiento de Anthropic, arnés de Anthropic, salvaguardas de producción activadas, pensamiento adaptativo con esfuerzo máximo a menos que la fila indique lo contrario. Léelo como Anthropic midiéndose a sí misma.

Terminal-Bench 4.0 — 66,4 %, con esfuerzo xhigh. Reportado por el proveedor, error estándar de aproximadamente ±2,6 puntos. En la misma fila: Claude Opus 5 52,3 %, Claude Fable 5.1 55,8 %, GPT-6 Astra 57,9 % (con esfuerzo alto), GPT-5.6 Sol 37,3 %. Terminal-Bench 4.0 es explícitamente un benchmark que el proveedor reconoce que es un proxy imperfecto para el trabajo real en terminal, y es el resultado destacado del modelo.

FrontierCode v1.1 Main — 54,4 % en xhigh, 54,6 % en default medium. Reportado por el proveedor. Opus 5 48,0 %, Fable 5.1 50,3 %, GPT-6 Astra 53,3 %, GPT-5.6 Sol 47,5 %. La tarjeta de sistema de Anthropic también incluye la variante Extended con 63,6 % y una mejor cifra de Extended en medium de 65,3 %.

CursorBench 4.0 — 57,8 % en xhigh, 52,5 % en medium. Reportado por el proveedor. Opus 5: 46,6 %, Fable 5.1: 51,8 %, GPT-5.6 Sol: 41,7 %. Ten en cuenta que las filas de CursorBench de Fable 5.1 y Opus 5 están con esfuerzo máximo, así que Opus 5.5 en medium se compara con sus propios hermanos al máximo.

GDPval-AA v2.1 — 1.846 Elo. Esta es la única fila de la tabla del proveedor que el proveedor no ejecutó. GDPval-AA es una evaluación de Artificial Analysis, y el propio informe de Artificial Analysis sobre Opus 5.5 indica el mismo 1.846, con Fable 5.1 en 1.735 y Opus 5 en 1.708. En la tabla del proveedor: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. Es la única fila aquí en la que dos organizaciones coinciden en el mismo número, y eso se debe a que es la misma medición.

AutomationBench (Zapier) — 40,0 %. Reportado por el proveedor y ejecutado sin modelos de reserva, por lo que cada intervención de salvaguarda se calificó como un fallo. GPT-6 Astra 41,4 %, Fable 5.1 31,4 %, GPT-5.6 Sol 28,8 %, Opus 5 26,9 %.

Humanity's Last Exam, con herramientas — 67,7 %. Notificado por el proveedor. Fable 5.1 65,6 %, Opus 5 63,6 %, GPT-6 Astra 57,2 %. La tarjeta de sistema de Anthropic informa por separado 64,4 % sin herramientas, que es la cifra a la que hay que recurrir si se compara con una fuente que no otorga acceso a herramientas a sus modelos.

Terminal-Bench-Science 0.1 — 58,7 %. Reportado por el proveedor, error estándar de aproximadamente ±3,5 a ±5 puntos, por lo que se trata de una banda y no de un punto. GPT-6 Astra 64,6 %, Fable 5.1 52,6 %, Opus 5 29,0 %, GPT-5.6 Sol 22,4 %.

OSWorld 2.0 — 81.8% parcial. Reportado por el proveedor, y "parcial" está haciendo un trabajo real en esa frase: la tarjeta del sistema de Anthropic da una tasa de finalización estricta de 48.7% para el mismo modelo en la misma evaluación. Ambos están publicados; el número parcial es el que se cita. Fable 5.1 80.7%, Opus 5 74.0%.

Chartography, con herramientas: 89,0 %. Según el proveedor. Fable 5.1 88,4 %, Opus 5 83,4 %.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

Los números independientes, y qué significa realmente "Default Fallback"

Artificial Analysis es la única tercera parte con una evaluación publicada y actual de Claude Opus 5.5 en un índice compuesto, y sus cifras son las que hay que poner junto a las de Anthropic. Según lo leído el 24 de septiembre de 2026:

Intelligence Index — 58 con el máximo esfuerzo, en una configuración etiquetada como "Adaptive Reasoning, Max Effort, Default Fallback". Independiente, medida por Artificial Analysis. Su propio artículo califica el 58 como "la puntuación más alta que hemos medido, por varios puntos". El mismo índice también publica Opus 5.5 en todos los demás niveles de esfuerzo, y la dispersión es la parte útil: 56 en xhigh, 54 en high, 51 en medium, 42 en low. Eso es una variación de 16 puntos a lo largo del dial de esfuerzo en un solo modelo, mayor que la diferencia entre la mayoría de los modelos de esa tabla.

Terminal-Bench 4.0 — 59,6 %. Independiente. Artificial Analysis lo reporta como "a la par del líder GPT-6 Astra (xhigh)" y unos 11 puntos por encima de Claude Opus 5.

Humanity's Last Exam — 61,4 %.De forma independiente, y el mejor resultado anterior en la misma tabla era del 59,1 %, en manos de Claude Fable 5.1.

SciCode — 66,9 %. Independiente, frente al 63,1 % de Claude Fable 5.1.

Ahora, la cláusula que necesita explicarse en lugar de citarse. "Default Fallback" no es un artefacto de benchmark ni una configuración de Artificial Analysis — es el enrutamiento de salvaguarda del lado del servidor de Anthropic, dejado activado. Claude Opus 5.5 viene con el nivel de salvaguarda previamente reservado para Fable 5.1: la mayoría de las solicitudes de ciberseguridad se redirigen de forma transparente a Claude Opus 4.8, y el trabajo de biología recurre a Claude Opus 5 a menos que la cuenta esté verificada. Cuando Artificial Analysis ejecuta el índice con el fallback predeterminado habilitado, está midiendo el sistema desplegado — aquello a lo que realmente llega una clave de API no verificada — en lugar de un checkpoint limpio de los pesos de Opus 5.5. Esa es la medición más honesta para un comprador, y es la medición menos limpia para un benchmark. Anthropic dice otro tanto sobre su propia tabla: las intervenciones en la ejecución de Terminal-Bench 4.0 hicieron que Opus 4.8 completara las tareas de ciberseguridad y que Opus 5 completara las tareas de biología, y la empresa afirma que es probable que esas intervenciones redujeran la puntuación reportada. Así que el enrutamiento de salvaguarda es un hecho operativo real en ambas direcciones, y ninguna cifra de esta página aísla el modelo subyacente de él.

Dónde discrepan las dos tablas, y por qué

Si pones los dos números de Terminal-Bench 4.0 en paralelo, obtienes 66,4 % frente a 59,6 % — 6,8 puntos, en el mismo benchmark, para el mismo modelo. Las razones se conocen, y cada una es lo suficientemente grande como para tener importancia por sí sola:

Distintos harnesses. Anthropic ejecutó su propio andamiaje de agente; Artificial Analysis ejecutó su propio harness de agente de referencia. Una puntuación en un benchmark de terminal es una propiedad del andamiaje más el modelo, no del modelo por sí solo, y ninguna de las dos organizaciones ha publicado un experimento de intercambio de andamiaje.

Distintos ajustes de esfuerzo. El 66,4 % de Anthropic está en xhigh. El ajuste de esfuerzo asociado al 59,6 % de Artificial Analysis no se indica en la frase que contiene la cifra, y sus cifras de referencia reportadas son, por lo general, las de máximo esfuerzo.

Salvaguardias activadas, en ambos casos, contabilizadas de forma diferente. Anthropic ejecutó con respaldo y trató las intervenciones como reductoras de la puntuación, pero aun así las puntuó. En AutomationBench ejecutó sin respaldo y contó las intervenciones como fallos totales. Artificial Analysis ejecuta con el respaldo habilitado en todo momento.

Los números se mueven incluso dentro de la propia tabla de un mismo proveedor. Anthropic publica Claude Opus 5 con un 52,3% en Terminal-Bench 4.0 y señala que el 51,8% que el tablero público otorga al mismo modelo está "dentro del margen de ruido".

Y luego la prueba más contundente de esta página sobre cuánto vale un harness. La tabla de clasificación pública de Terminal-Bench 4.0, capturada el 24 de septiembre de 2026, no tiene ninguna fila de Claude Opus 5.5 en absoluto. Su entrada principal es GPT-6 Astra en esfuerzo máximo, agente Codex, 58,2 % ±2,8; el segundo es Claude Fable 5.1 en esfuerzo máximo mediante Claude Code con 57,9 % ±3,8; el tercero es Claude Opus 5 en xhigh mediante Claude Code con 53,9 % ±3,2. Así que el 66,4 % no es simplemente un número distinto del 59,6 % independiente — no está en la tabla pública, y la propia versión de Claude Opus 5 de la tabla es 53,9 %, no el 52,3 % que imprime la tabla de lanzamiento. Hasta que Terminal-Bench acepte y publique un envío de Opus 5.5, el 66,4 % es un resultado de harness de proveedor que nadie ha reproducido, y el 59,6 % es el número que un tercero respaldará realmente. Nótese también que en esa misma tabla, el líder de Terminal-Bench 4.0 de Artificial Analysis y el Opus 5.5 de Anthropic coinciden en el mismo 59,6 % — lo cual es un empate en un harness y no dice nada sobre el otro.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Las filas donde Opus 5.5 pierde

Un resumen que omite las pérdidas no es un resumen, y la propia tabla de Anthropic contiene ambas.

Terminal-Bench-Science 0.1 — 58,7 % frente al 64,6 % de GPT-6 Astra.Reportado por el proveedor, en la tabla de Anthropic, y una pérdida de 5,9 puntos frente a un competidor con nombre en la fila más cercana al razonamiento científico. La propia nota de error estándar del proveedor (±3,5 a ±5) significa que la brecha está cerca del borde del ruido en lugar de cómodamente dentro de él — pero es una pérdida en la propia página del proveedor, y la banda no la convierte en una victoria. Claude Opus 5 se sitúa en el 29,0 % en la misma fila, así que la ganancia generacional es real incluso donde el competidor lidera.

AutomationBench — 40,0 % frente al 41,4 % de GPT-6 Astra.Reportado por el proveedor, una pérdida de 1,4 puntos, y la ejecución no contaba con modelos de respaldo, por lo que las intervenciones de salvaguarda se puntuaron como fallos. Eso significa que esta comparación en particular mide a Opus 5.5 con su penalización de enrutamiento incluida frente a un competidor cuya penalización de enrutamiento, sea cual sea, no se describe. Es la fila menos interpretable de la página en cualquier dirección.

Otros dos puntos en los que la ventaja es más estrecha de lo que sugiere el titular, ambos reportados por el proveedor. En Humanity's Last Exam con herramientas el margen sobre Claude Fable 5.1 es de 2,1 puntos (67,7 % frente a 65,6 %); en Chartography con herramientas es de 0,6 puntos (89,0 % frente a 88,4 %); en OSWorld 2.0 parcial es de 1,1 puntos (81,8 % frente a 80,7 %). Esas son las filas en las que «Opus 5.5 es el mejor modelo agéntico» es una afirmación sobre el ranking más que sobre una brecha medida, y una diferencia de 0,6 puntos en lectura de gráficos no debería decidir una adquisición.

La posición independiente de Claude Fable 5.1, en una revisión de índice diferente

Poner el Opus 5.5 frente a su propio hermano requiere su propia sección, y necesita llevar una advertencia, porque la comparación es más difícil de lo que parece.

Cuando Artificial Analysis publicó su análisis de Claude Fable 5.1 el 1 de septiembre de 2026, obtuvo 66 con esfuerzo máximo en su Índice de Inteligencia y lo calificó como la puntuación más alta que había medido —por delante de Claude Opus 5, con 63, y de GPT-5.6 Sol, con 61. En el índice tal como aparece el 24 de septiembre de 2026, el mismo modelo figura con 53 con esfuerzo máximo con fallback, y Opus 5.5 figura con 58 en la configuración equivalente. El análisis del 22 de septiembre sobre Opus 5.5 califica 58 como "la puntuación más alta que hemos medido, por varios puntos".

Esas dos afirmaciones no pueden ser ambas verdaderas en una misma escala, y la resolución es que no están en una misma escala. El índice es un objeto vivo que Artificial Analysis revisa; dos de sus artículos publicados, con cinco semanas de diferencia, colocan al mismo par de modelos hermanos en lados opuestos del primer puesto. Eso es una afirmación sobre las revisiones del índice, no sobre que ninguno de los modelos haya retrocedido, y significa que el 66 y el 58 nunca deben imprimirse uno al lado del otro. Si se leen el mismo día, en el mismo listado, con la misma configuración etiquetada, el orden actual sitúa a Opus 5.5 cinco puntos por delante de Fable 5.1 — e incluso eso es una comparación del mismo índice y del mismo proveedor de índice, no un cara a cara auditado. Lo que es seguro decir es más limitado: en la revisión actual del único compuesto independiente que mide a ambos, Opus 5.5 es el más fuerte de los dos modelos de Anthropic, y el 66 más conocido de Fable 5.1 pertenece a una revisión anterior de ese índice.

Los ajustes merecen una frase más porque es fácil confundirlos. El 66 de Fable 5.1 y el 58 de Opus 5.5 son ambos filas de esfuerzo máximo, pero los cinco ajustes de esfuerzo de Fable 5.1 abarcan un rango de 11x en uso de tokens de salida, desde 13,1 M en bajo hasta 143,7 M en máximo, con puntuaciones de índice de 58 a 66. Un único punto de índice para un modelo con tanta dispersión interna es un sustituto pobre de la fila que realmente ejecutarías.

El costo de tokens es un eje de benchmark en sí mismo

Cada número de arriba es una puntuación. Ninguno de ellos es una factura, y en este modelo la factura es donde está el movimiento interesante.

Artificial Analysis mide Claude Opus 5.5 con esfuerzo máximo usando del orden de 119.000 tokens de salida por tarea del Intelligence Index — la cifra más alta de su índice. A modo de comparación, en el mismo ranking y con la misma configuración: Claude Opus 5, unos 73.000, Claude Fable 5.1, unos 78.000, y GPT-6 Astra, unos 27.000. Los tokens de pensamiento se facturan como tokens de salida, y el pensamiento adaptativo no se puede desactivar en Opus 5.5, así que los tokens que un modelo dedica a deliberar no son una nota al pie de su precio: son la mayor parte de él.

Haz los cálculos, porque el precio de etiqueta es engañoso por sí solo. Opus 5.5 tiene un precio de lista de $4.00 de entrada / $20.00 de salida, un recorte del 20% respecto a los $5.00 / $25.00 de Opus 5. Artificial Analysis todavía mide que Opus 5.5, a esfuerzo máximo, cuesta alrededor de $5.98 por tarea de índice frente a $5.86 para Opus 5 en la misma configuración — ligeramente más, no menos, porque aproximadamente 1,6 veces los tokens de salida se come todo el recorte de tarifa del 20% y algo más. En todo el índice, Opus 5.5 produjo 260M tokens de salida frente a una mediana del ranking de 88M, que el evaluador califica como "muy verboso".

El relato de costes, por lo tanto, reside por completo en la configuración de esfuerzo, y solo funciona si la usas. Con esfuerzo máximo, Opus 5.5 es un modelo más caro por tarea completada que el modelo al que reemplaza. Con esfuerzo medio —el valor predeterminado real del producto, y el ámbito al que se limita la afirmación de Anthropic de "aproximadamente un 40 % menos de coste de ejecución en cargas de trabajo típicas"—, el ahorro es real, pero es una afirmación sobre un promedio entre cargas de trabajo seleccionadas por el proveedor, no un resultado auditado por tarea. La lectura práctica: la reducción de precio del 20 % es un descuento sobre la tarifa y una opción en el control de esfuerzo, no un ahorro automático. Si tu plan de migración es "cambiar el id del modelo y mantener la configuración", estás comprando la versión cara.

Lo que no está establecido en absoluto

Esta es la sección para la que existe el resto de la página.

No se ha publicado ningún enfrentamiento directo independiente, con el mismo esfuerzo y el mismo arnés, entre Claude Opus 5.5 y ningún rival con nombre. Todas las comparaciones entre proveedores de esta página —Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1— son una comparación de dos tablas producidas por dos empresas distintas, con dos arneses distintos y con dos ajustes de esfuerzo distintos, uno de los cuales suele ser el propio modelo del proveedor en un ajuste favorable. No existe ningún experimento en el registro público que mantenga constantes el andamiaje y el esfuerzo entre dos proveedores y presente ambos.

El desglose de tokens por problema no está publicado. La cifra agregada de tokens de salida se mide de forma independiente, pero cuánto de ella corresponde a razonamiento frente a texto de respuesta no lo publica nadie que hayamos podido encontrar. Cualquier página que te dé un número preciso de tokens de razonamiento para este modelo te está dando un número que nadie midió.

La mayor parte de la ficha del sistema no ha sido evaluada por terceros. SWE-bench Pro 89,9%, Multilingual 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% ajustado por longitud, GMMLU 94,3%, ArXivMath 96,9% con herramientas — todos reportados por el proveedor, ninguno reproducido de forma independiente en el momento de redactar este texto.

La cifra más destacada de Terminal-Bench 4.0 no aparece en el tablero público. Ya se ha comentado más arriba, y también merece figurar en esta lista: el dato más citado sobre este modelo es uno que nadie fuera del proveedor ha ejecutado.

Anthropic informa que Claude Opus 5.5 "a menudo sospecha que está siendo evaluado" —palabras de la propia empresa, ofrecidas como una limitación de su evaluación de seguridad. Tómese esto en serio como un problema de medición y no como una curiosidad: si el modelo se comporta de manera diferente cuando cree que se lo está evaluando, entonces cada número de benchmark en esta página, ya sea de proveedor o independiente, es una medición del modelo bajo observación, y el grado en que eso difiere del comportamiento en producción es desconocido y no cuantificado. Se aplica por igual a las filas buenas y a las malas. Es la única salvedad que ninguna cantidad de metodología de esfuerzo equiparado corrige.

Sonnet 5.5 y Haiku 5.5 no están disponibles. Anthropic los ha anunciado para "las próximas semanas". Aún no se han lanzado, no tienen benchmarks publicados y nada de lo que figura en esta página es aplicable a ellos.

Precio, envoltura y las partes de la especificación que cambian tu código

Leído de la tabla de tarifas publicada por Anthropic el 24 de septiembre de 2026: $4.00 por millón de tokens de entrada, $20.00 por millón de salida, $0.20 por millón de lectura de caché, $5.00 por millón de escritura de caché de 5 minutos, $8.00 por millón de escritura de caché de 1 hora, y 50% de descuento en ambos sentidos en la Batch API. La tarifa de lectura de caché es la discreta: es el 5% de la entrada base, mientras que la mayoría de los modelos Claude se sitúan en el 10% y Fable 5.1 se sitúa en el 2.5%. El Fast mode tiene un precio aparte de $8.00 / $40.00 y Anthropic lo describe como una vista previa de investigación, no como un nivel general.

Esta es la sección donde una tarifa deja de ser un dato curioso y se convierte en la aritmética que un router puede hacer por ti. Claude Opus 5.5 se ofrece como anthropic/claude-opus-5.5 en OrcaRouter al mismo $4.00 / $20.00, con los precios de lista transferidos con un 0% de margen — así que en el momento en que Anthropic mueva una tarifa, esa será la tarifa aquí, el mismo día y sin ningún desfase de reajuste de precios que modelar. Las piezas que deciden la factura real son las que el catálogo incluye junto al precio: la lectura de caché de $0.20 al 5% de la entrada base frente al 2.5% de Fable 5.1, la ventana de contexto de 1M de tokens y el límite de salida de 128K. Dado que el parámetro de esfuerzo es donde realmente se mueve el costo de este modelo — una oscilación de 16 puntos en el índice y aproximadamente 119,000 tokens de salida por tarea al máximo frente a unos 73,000 para Opus 5 —, la migración que ahorra dinero es la que te permite ajustar el esfuerzo por carga de trabajo en lugar de por cuenta, y poner la ruta de Opus 5.5 detrás de un failover automático mientras mides qué configuración quiere tu tráfico.

Envelope — contexto de 1M de tokens, salida máxima de 128K, salida de 300K en la API de Batch con el encabezado beta output-300k-2026-03-24, fecha de corte de conocimiento: junio de 2026, retiro no antes del 22 de septiembre de 2027. La salida es más de un 30 % más rápida que Claude Opus 5.

Cambios importantes respecto a Opus 5 — el pensamiento ya no se puede desactivar; el uso forzado de herramientas (un tool_choice que designa una herramienta específica) devuelve un error; los bloques de pensamiento están vinculados al modelo y a la conversación que los generó; la herramienta de uso de computadora más antigua computer_20251124 ya no se acepta en la API de Claude ni en Google Cloud. Los tres primeros también se aplican a Fable 5.1. Hay un quinto silencioso: el texto entre llamadas a herramientas ahora llega dentro de bloques de pensamiento cuyo texto está vacío con la configuración de visualización predeterminada, por lo que una interfaz de usuario que transmite ese texto como indicador de progreso se queda en silencio sin que se produzca ningún error.

Enrutamiento de salvaguardas, de nuevo, porque es un elemento de la especificación y no una nota al pie — la mayoría de las solicitudes de ciberseguridad van a Claude Opus 4.8 y el trabajo de biología recurre a Claude Opus 5 a menos que la cuenta esté verificada. En esas evaluaciones, la respuesta que recibes puede que no provenga de Opus 5.5 en absoluto, por lo que las puntuaciones publicadas en los benchmarks relacionados con ciber y bio no son mediciones limpias de este modelo.

Afirmaciones de eficiencia, todas reportadas por el proveedor — aproximadamente un 40 % menos de costo de ejecución en cargas de trabajo típicas frente a un recorte del 20 % en el precio de lista; un ejemplo práctico de análisis de fusiones que tarda 63 minutos en Opus 5.5 frente a 93 en Opus 5 con un 50 % menos de costo; y declaraciones de clientes de Box (un tercio de los tokens, respuestas aproximadamente un 40 % menos verbosas), Kiro (aproximadamente la mitad de los tokens, 40 % menos llamadas), Factory (20–25 % menos tokens de salida) y GitHub (entre la menor cantidad de tokens y pasos que ha medido). Estos son promedios entre las cargas de trabajo que seleccionaron el proveedor y sus socios de lanzamiento. Son atribuciones, no resultados auditados, y están en visible tensión con la cifra independiente de costo por tarea anterior, que es en sí misma una medición con el máximo esfuerzo en lugar de con la configuración predeterminada. Ambas pueden ser ciertas; ninguna es una afirmación general sobre tu carga de trabajo.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

El estado de la evidencia

Claude Opus 5.5 es un modelo real con un recorte de tarifas real, una envolvente real de 1M de tokens de contexto y 128K de salida, y un cambio real y de gran trascendencia en cómo se configuran el pensamiento y el esfuerzo. También llega con una tabla de benchmarks que mide sobre todo a Anthropic, una tabla independiente que mide sobre todo un despliegue enrutado en lugar de un checkpoint, y un problema documentado de autoconocimiento que socava ambas. No se ha publicado ninguna comparación cara a cara independiente, con esfuerzo equiparado y arnés equiparado, de Claude Opus 5.5 contra un rival nombrado. Hasta que se publique una, lee cada comparación entre proveedores de esta página por lo que es: dos tablas de proveedores de dos empresas en dos configuraciones, dispuestas una al lado de la otra por nosotros, y vuelve a medir tu propia configuración de esfuerzo antes de volver a medir el modelo.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario