Tarjeta de título principal para Claude Opus 5.5 vs Claude Opus 5, con el encabezado «Los niveles de esfuerzo no significan lo mismo», con insignias que indican medio vs alto predeterminado, $4.00 vs $5.00 y $0.20 vs $0.50 en caché, y el logotipo de OrcaRouter en la esquina inferior derecha.
Engineering & Research

Claude Opus 5.5 vs Claude Opus 5: los niveles de esfuerzo no significan lo mismo

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo primero que hay que saber antes de comparar Claude Opus 5.5 con Claude Opus 5 es que los dos modelos no comparten una escala de esfuerzo, y casi todas las comparaciones cara a cara que leerás esta semana pasan eso por alto. Opus 5 usa por defecto un esfuerzo alto. Opus 5.5 usa por defecto medio, y con el mismo nivel nominal piensa más en cada turno que lo que pensaba su predecesor. Así que «Opus 5.5 con la configuración predeterminada frente a Opus 5 con la configuración predeterminada» no es un experimento controlado: es una comparación entre dos cantidades distintas de pensamiento. El propio proveedor lo dice en su guía de migración: prueba varios niveles de esfuerzo y no reutilices la configuración de Opus 5, porque los niveles con el mismo nombre no se corresponden con el mismo presupuesto de pensamiento. Una vez que controlas eso, la brecha entre los dos modelos se estrecha en algunos puntos, se amplía en otros, y la decisión de actualizar depende de algo distinto de la capacidad bruta: el coste por tarea terminada, y cuatro cambios en la API que romperán el código que hoy funciona con Opus 5.

¿Qué difiere realmente, especificación por especificación?

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

Los dos modelos están más cerca sobre el papel de lo que sugieren los números de versión:

• Precio — Claude Opus 5.5 a $4,00 de entrada / $20,00 de salida por millón de tokens frente a Claude Opus 5 a $5,00 / $25,00

• Lectura de caché — $0.20 por millón frente a $0.50 por millón, un recorte del 60 % en el concepto que domina las ejecuciones de agentes

• Escritura en caché — $5 por millón para la ventana de 5 minutos y $8 para la ventana de 1 hora en 5.5, frente a $6.25 en Opus 5

• Contexto y salida — 1M de tokens de contexto y 128K de salida en ambos; ambos alcanzan 300K de salida en la API de Batch detrás de la output-300k-2026-03-24cabecera beta

• Esfuerzo predeterminado — medio en Opus 5.5 vs alto en Opus 5

• Thinking — adaptativo y siempre activo en ambos, pero en Opus 5.5 ya no se puede desactivar en absoluto

• Fecha de corte del conocimiento — junio de 2026 vs mayo de 2026

Latencia — Anthropic califica a Opus 5.5 de «moderada» frente a la línea actual, y afirma que genera resultados más de un 30 % más rápido que Opus 5

• Retiro — no antes del 22 de septiembre de 2027 para Opus 5.5, y no antes del 24 de julio de 2027 para Opus 5

Fíjate en lo que noes diferente: la ventana de contexto, el techo de salida, el descuento por lotes y el modelo de razonamiento adaptativo siempre activo. Opus 5.5 no es un modelo de mayor contexto ni de salida más larga. Es uno más barato, más rápido y más eficiente en tokens dentro de la misma envolvente.

Benchmarks, y el asterisco del esfuerzo en cada uno de ellos

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Estas cifras provienen del material de lanzamiento de Anthropic —reportadas por el proveedor, ejecutadas con sus propios modelos— y el ajuste de esfuerzo importa más aquí que el nombre del modelo:

• Terminal-Bench 4.0 — 66,4 % frente a 52,3 %, con la ejecución de Opus 5.5 en esfuerzo xhigh en lugar del predeterminado

• FrontierCode v1.1 (Main) — 54,4 % frente a 48,0 %, y 54,6 % para Opus 5.5 con el esfuerzo medio predeterminado

• CursorBench 4.0 — 57,8 % frente a 46,6 %, y 52,5 % en nivel medio

• GDPval-AA v2.1 — 1846 Elo frente a 1708

• AutomationBench — 40,0% vs 26,9%

• Humanity's Last Exam, con herramientas — 67,7 % vs 63,6 %

• Terminal-Bench-Science 0.1 — 58.7% vs 29.0%, la mayor diferencia del conjunto

• OSWorld 2.0 — 81,8 % parcial vs 74,0 %

• Cartografía, con herramientas — 89,0 % vs 83,4 %

El resultado de FrontierCode es el que hay que estudiar. Opus 5.5 obtiene 54,4 % en xhigh y 54,6 % en medium —estadísticamente el mismo número, con una fracción del presupuesto de pensamiento. Cualquier mejora que Anthropic haya hecho, en ese benchmark no proviene de pensar más. CursorBench va en la dirección opuesta: 57,8 % en xhigh frente a 52,5 % en medium, una diferencia de cinco puntos que indica que el esfuerzo todavía se traduce en precisión real en algunas tareas. La lección no es "usar medium" o "usar xhigh"; es que el nivel de esfuerzo correcto ahora es una medición por carga de trabajo, y la vieja costumbre de dejar Opus 5 en su valor predeterminado alto ya no te dice nada sobre el nuevo modelo.

Anthropic añade una advertencia que vale la pena repetir: en este nivel de capacidad, los márgenes de los benchmarks son «una guía menos fiable de las diferencias del mundo real», y la empresa dice que su brecha interna con Claude Fable 5.1 es más estrecha de lo que implican las puntuaciones publicadas. Eso es un proveedor diciéndote que no sobreinterpretes su propia tabla.

El costo por tarea completada es la comparación que lo decide.

El precio por token es la unidad incorrecta para un agente, y esta comparación es donde eso se nota. El propio ejemplo práctico de Anthropic: un análisis de fusión que le llevó 63 minutos a Opus 5.5 y costó un 50% menos que la misma tarea en Opus 5, que tomó 93 minutos. La tabla de tarifas explica parte de eso —una reducción del 20% en entrada y salida, del 60% en lecturas de caché—, pero no todo. El resto se debe a que el modelo usa menos tokens y menos turnos para llegar al mismo lugar. Las citas de clientes publicadas con el lanzamiento apuntan en la misma dirección: Box reporta un tercio de los tokens y respuestas alrededor de un 40% menos verbosas, Kiro aproximadamente la mitad de los tokens con un 40% menos de llamadas, Factory 20–25% menos de tokens de salida, y GitHub se encuentra entre los que menos tokens y pasos ha medido.

Esos son testimonios de clientes publicados por el proveedor, no resultados auditados, y el dato agregado «alrededor de un 40 % más barato en cargas de trabajo típicas» es la caracterización de Anthropic de un promedio entre las cargas de trabajo que seleccionó. La versión honesta para tu propia planificación: da por sentado que el recorte del 20 % del precio de lista es real y confiable, y trata el 20 % adicional como una hipótesis que puedes probar en una tarde ejecutando la misma tarea en ambos modelos y contando tokens.

Una nota estructural sobre por qué la reducción del costo de caché rinde más de lo que parece. Un agente que reenvía un prompt de sistema largo y un árbol de archivos en cada turno paga tarifas de lectura de caché sobre la mayor parte de su entrada, no tarifas de entrada nueva. Bajar eso de $0.50 a $0.20 por millón cambia la economía de las sesiones prolongadas mucho más que la tarifa titular, y es la razón por la que una carga de trabajo marginalmente viable en Opus 5 puede volverse claramente viable en Opus 5.5 sin ningún cambio en tus prompts.

Los cuatro cambios disruptivos, a modo de lista de verificación de migración

Opus 5.5 es un modelo nuevo, no un Opus 5 renombrado, y las notas de migración de Anthropic enumeran cuatro cambios que romperán el código que ya se ejecuta en producción:

• El pensamiento no se puede desactivar. Cualquier ruta de código que desactivara el pensamiento dará un error o cambiará el comportamiento, y ahora la profundidad solo se controla mediante el parámetro effort.

• El uso forzado de herramientas devuelve un error. Un tool_choice que fuerza una herramienta con nombre no es compatible.

• Los bloques de pensamiento están vinculados al modelo que los produjo y a la conversación, por lo que no se pueden reproducir entre modelos de la forma en que algunas canalizaciones asumen.

• La herramienta anterior de uso de computadora computer_20251124 no se acepta en la API de Claude ni en Google Cloud.

Hay un quinto cambio que no hace fallar nada y, por lo tanto, es más peligroso. El texto entre llamadas a herramientas ahora se devuelve dentro de bloques de pensamiento cuyo texto está vacío con la configuración de visualización predeterminada. Si tu aplicación transmite ese texto a los usuarios como actualizaciones de progreso, se queda en silencio entre llamadas a herramientas hasta que establezcas un valor de visualización que devuelva el texto. Todas las pruebas pasan; la interfaz simplemente deja de narrar.

Los tres primeros también se aplican a Claude Fable 5.1, así que un equipo que ya ha migrado a ese modelo ha hecho parte de este trabajo. Un equipo que sigue en Opus 5, no.

Cuándo Opus 5 sigue siendo la elección correcta

La actualización no es automática, y hay cuatro razones de peso para quedarse:

• Previsibilidad de costes. Opus 5 es un modelo que ya has caracterizado. Si tu presupuesto se basa en su consumo de tokens, pasarte a un modelo que piensa una cantidad distinta con el mismo nivel de esfuerzo nominal invalida el modelo hasta que vuelvas a medirlo.

• Compatibilidad. Si alguna parte de tu stack depende de deshabilitar el pensamiento, de forzar una herramienta o de la herramienta anterior de computer-use, la migración es trabajo de código, no un simple intercambio de cadenas.

• Enrutamiento de salvaguardas. Opus 5.5 viene con salvaguardas de la clase de Fable 5.1, lo que significa que la mayoría de las solicitudes de ciberseguridad se redirigen a Claude Opus 4.8 y el trabajo de biología recae en Claude Opus 5 a menos que tu cuenta esté verificada. Si tu producto pertenece a cualquiera de esos dos ámbitos, «actualizar» puede significar que tus usuarios reciban respuestas de un modelo más pequeño. Opus 5 no tiene ese enrutamiento.

• Longevidad. Opus 5 no se va a ir a ninguna parte pronto — Anthropic indica que su retirada no será antes del 24 de julio de 2027, lo que supone diez meses a partir de ahora.

Para todos los demás, la aritmética es sencilla: más capacidad, menor precio, menos tokens y una lista de verificación de migración que un solo ingeniero puede completar en un día.

Ejecutando ambos durante el cambio

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

La parte incómoda de cualquier migración de un modelo insignia es la etapa intermedia: quieres Opus 5.5 en el tráfico nuevo sin apostar la ruta de producción a un modelo que no has caracterizado con tus propios ajustes de esfuerzo, y quieres mantener Opus 5 en servicio mientras lo averigüas. Eso es un problema de enrutamiento más que de replataformización, y vale la pena ser precisos sobre qué va dónde. Claude Opus 5 está en OrcaRouter hoy al precio de lista de Anthropic con 0 % de margen: el precio de lista del proveedor se transfiere directamente, así que un cambio de tarifa del proveedor se aplica en nuestro lado el mismo día y no después de una sincronización. Claude Opus 5.5 aún no es una de nuestras rutas; está disponible a través de la propia API de Anthropic y de las principales nubes. Cuando llegue, se convierte en una ruta más con la misma clave en lugar de un segundo contrato y un segundo SDK, lo que te permite poner un porcentaje del tráfico en el nuevo modelo mientras la conmutación por error automática mantiene el resto en el que ya has caracterizado. Componer una llamada entre ambos —un borrador de uno y una pasada de verificación del otro— es una línea de DSL de enrutamiento.

Sé preciso sobre lo que eso te aporta. No te da un benchmark independiente de Opus 5.5; nada lo hace todavía, porque las únicas comparativas directas publicadas son las de la propia Anthropic y los rastreadores independientes aún están definiendo las configuraciones de esfuerzo. Lo que te da es la única medición que realmente predice tu factura, con tus prompts, al nivel de esfuerzo que vas a desplegar.

La regla de decisión

Si vas a empezar algo nuevo, usa Claude Opus 5.5 y comienza con un nivelmedio de esfuerzo, luego mide sibajo se sostiene en tu tarea — Anthropic informa que el nivel bajo se acerca a sus ajustes más altos en varias evaluaciones de código a un costo mucho menor, y las cifras de FrontierCode anteriores sugieren que el valor predeterminado no está dejando mucho sobre la mesa.

Si ejecutas Claude Opus 5 en producción, el detonante para migrar no es la tabla de benchmarks. Es si puedes absorber cuatro cambios en la API y si tu carga de trabajo se sitúa en ciberseguridad o biología, donde el enrutamiento de las salvaguardas cederá silenciosamente parte de tu tráfico a un modelo más pequeño. Todo lo demás de esta actualización es una rebaja de precio disfrazada de lanzamiento de modelo, y esas conviene aprovecharlas.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario