
Claude Sonnet 5.5 vs Claude Opus 5: más barato en cada línea y por delante en el índice
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Claude Opus 5 se lanzó el 24 de julio de 2026 a $5.00 por millón de tokens de entrada y $25.00 por millón de tokens de salida. Claude Sonnet 5.5 alcanzó disponibilidad general el 28 de septiembre de 2026 a $2.00 y $10.00. Eso es un recorte del 60 % en entrada y un recorte del 60 % en salida para un modelo dos generaciones más nuevo —y, en el harness que Artificial Analysis ejecuta en ambos, un modelo que se sitúa en 56 en Intelligence Index v4.3 frente al 51 de Claude Opus 5. Esta es la rara comparación en la que el modelo más nuevo y más barato también es el que obtiene la puntuación más alta en un índice de terceros, y en la que el argumento restante a favor del titular no es el puesto en el benchmark, sino un tipo específico de trabajo. Ambos modelos admiten 1M de tokens de contexto, ambos emiten hasta 128K tokens, ambos leen texto, imágenes y archivos, y ambos configuran el razonamiento mediante un parámetro de esfuerzo en lugar de un presupuesto de tokens de pensamiento. Dado que las interfaces son las mismas, elegir entre ellos es puramente una cuestión de cuánto cuesta una tarea terminada y qué tareas fallan.
Dos versiones, una interfaz
Empieza por lo poco que cambia, porque es más que en la mayoría de los saltos generacionales.
• Ventana de contexto — 1.000.000 tokens en ambos
• Salida máxima — 128.000 tokens en ambos
• Modalidad de entrada: texto, imagen y archivo en ambos; sin audio ni video en ninguno de los dos
• Razonamiento — pensamiento adaptativo con esfuerzo configurable en ambos, de modo que la profundidad sea un parámetro de la solicitud en lugar de una cadena de modelo aparte
• Capacidades — visión, herramientas, JSON y razonamiento en ambos, según las entradas del catálogo de OrcaRouter para anthropic/claude-opus-5 y la línea Sonnet
La consecuencia práctica es que un prompt escrito para Claude Opus 5 no necesita reescribirse para ejecutarse en Claude Sonnet 5.5, y un bucle de agente ajustado en torno a un límite de salida de 128K no necesita un nuevo nivel. La migración es un cambio de cadena de modelo más una revisión de qué ajuste de esfuerzo tenías fijado —nada más. Para los equipos que vivieron las transiciones multimodales y multiparamétricas de los últimos dos años, eso es el titular, no el benchmark.
Lo único que sí cambia es el precio, y cambia en cada línea en lugar de solo en las dos de la diapositiva de marketing.
• Entrada — 2,00 $ por millón frente a 5,00 $, una reducción del 60 %
• Salida — $10.00 por millón frente a $25.00, un recorte del 60%
• Lectura de caché — $0.20 por millón frente a $0.50, un recorte del 60%
• Escritura en caché — $2.50 por millón frente a $10.00 para la ventana de cinco minutos, un recorte del 75%
Si ejecutas un agente que vuelve a leer un prefijo largo en cada turno, la línea de lectura de caché es la que paga la migración. A $0.20 frente a $0.50, cada token en caché en una sesión larga queda en el 40% de su costo anterior, y las lecturas de caché son la mayor parte del recuento de tokens en la mayoría de los bucles agénticos. El ahorro se acumula de una forma que el titular por token no captura.
De dónde vienen los cinco puntos
Artificial Analysis otorga a Claude Sonnet 5.5 una puntuación de 56 y a Claude Opus 5 una de 51 en Intelligence Index v4.3, ambas medidas bajo la configuración "Adaptive Reasoning, Max Effort". Cinco puntos no son un error de redondeo en esa escala —para ponerlo en contexto, el mismo evaluador sitúa a Sonnet 5 en 38 y a Gemini 3.1 Pro Preview en 30, así que la diferencia entre Claude Opus 5 y Claude Sonnet 5.5 es un tercio de la diferencia entre Claude Opus 5 y la generación anterior de Sonnet.
Las propias cifras de lanzamiento de Anthropic para Claude Sonnet 5.5 apuntan en la misma dirección con un instrumento diferente. La compañía reporta 70,6 % en Terminal-Bench 4.0 — la misma prueba en la que Claude Opus 5 está documentado con 89,1 % en una tabla anterior de Anthropic, una cifra que usó una revisión diferente del arnés y que no debería restarse de la más nueva. Esa es la advertencia sobre las fuentes más importante de este artículo: Terminal-Bench pasó a la versión 4.0 a mediados de 2026, el índice que lo contenía se revisó a la v4.3 para coincidir, y las comparaciones entre versiones de ese benchmark no son aritméticas. Cuando un número tenga una versión asociada, cita la versión.
Lo que puede compararse de forma limpia es la propia progresión del proveedor en el lado de Sonnet —del 10,3 % en Terminal-Bench 4.0 para Sonnet 5 al 70,6 % para Sonnet 5.5—, y la lectura del índice de terceros, en la que ambas cifras proceden del mismo entorno de pruebas el mismo día. Con esa evidencia, el sucesor ha superado de verdad al buque insignia de julio en razonamiento general, lo cual es una afirmación más contundente que la que hace cualquier diapositiva del proveedor.
La trampa de la longitud de salida
Aquí es donde la aritmética deja de ser benévola con el modelo más nuevo.
Artificial Analysis informa que evaluar Claude Sonnet 5.5 en su suite de índices cuesta $7,60 por tarea. Claude Opus 5 cuesta $5,86 por tarea en la misma suite. El modelo más nuevo, con un 60 % de descuento en cada línea de la lista de precios, es aproximadamente un 30 % más caro para completar una tarea con él. La razón está en el mismo informe: Sonnet 5.5 emitió 410 millones de tokens en toda la suite frente a una mediana de 88 millones entre los modelos monitoreados, lo que el evaluador califica de «muy verboso». Claude Opus 5 emitió 140 millones en la misma suite.
Haz la división y el mecanismo es simple. Sonnet 5.5 produce aproximadamente el triple de tokens de salida que Claude Opus 5 en el mismo trabajo, a un 40 % del precio de salida. Tres por 0,4 es 1,2: una penalización del 20 % antes de los efectos de caché, que está en el entorno del resultado de $7.60 frente a $5.86. El precio por token no es incorrecto; simplemente no es la cifra que rige la factura.
Esto no convierte al modelo más nuevo en la peor compra. Hace que la decisión dependa de algo que la mayoría de las comparaciones omite: si tu carga de trabajo te permite acotar la salida. Un trabajo de resumen con una instrucción de longitud, un pipeline de extracción estructurada que produce JSON, un clasificador que devuelve una etiqueta — en todos esos casos la verbosidad nunca entra en juego, y el recorte del 60 % en la tarifa es dinero real. Un agente abierto al que se le pide "arreglar el repositorio" sin disciplina de salida le da a Sonnet 5.5 tres veces más cuerda.
Ajustes de esfuerzo y la migración para la que nadie presupuesta
Ambos modelos exponen la profundidad de razonamiento mediante un parámetro de esfuerzo con varios niveles, y ambos incluyen un valor predeterminado en lugar de un valor fijo — alto en la Plataforma Claude, medio dentro de las aplicaciones Claude. La tentación en una migración es dejar la configuración donde estaba en el modelo antiguo y dar el trabajo por terminado.
Eso es un error por una razón medible. La propia nota al pie de Anthropic para Claude Sonnet 5.5 indica que la configuración de esfuerzo Max obtiene una puntuación inferior a Xhigh en FrontierCode, lo que significa que el esfuerzo no es un dial monotónico y que el ajuste más alto no es una mejora gratuita. Configura el esfuerzo midiendo tu tarea, no eligiendo la opción más costosa disponible.
También hay una diferencia de comportamiento marcada del lado de Sonnet que conviene conocer antes de un despliegue. Anthropic afirma que Claude Sonnet 5.5 es el primer Sonnet que se lanza con salvaguardas y mecanismos de respaldo cibernéticos equivalentes a los de sus modelos de máximo nivel, por lo que las solicitudes de seguridad de mayor riesgo recurren de forma visible al Sonnet anterior en lugar de ser atendidas por el modelo que nombraste. Si tu carga de trabajo se encuentra en ese dominio, tus registros mostrarán un modelo que no solicitaste. Claude Opus 5 es anterior a ese acuerdo en la línea Sonnet, aunque la misma clase de enrutamiento existe en todo el producto de Anthropic para trabajos de biología y ciberseguridad en los niveles insignia.
En OrcaRouter, hoy ambos endpoints están activos — anthropic/claude-opus-5 y anthropic/claude-sonnet-5 se encuentran en el mismo catálogo que todo lo demás, con el precio de lista del proveedor y un 0 % de recargo — y se podrá acceder a Claude Sonnet 5.5 con esa misma credencial en cuanto se incluya en la lista. Mientras tanto, la capacidad relevante es la conmutación automática por fallo: si a un nivel de Anthropic se le aplica un límite de velocidad o devuelve errores, la solicitud se puede redirigir al otro sin cambiar el código, lo que es la cobertura más económica posible contra equivocarse en esta comparación.
La decisión, enunciada como regla
Si tu trabajo está acotado —controlas la forma de la salida, los prompts están estructurados y el número de tokens por tarea es predecible—, pásate a Claude Sonnet 5.5 y aprovecha la reducción del 60%. El índice está de acuerdo, la tabla de tarifas está de acuerdo y no queda ningún argumento de capacidad del otro lado.
Si tu trabajo es abierto y agéntico, haz el experimento antes de creer cualquiera de las dos listas de precios. Mide los tokens por tarea completada en tu propio tráfico durante una semana con cada modelo; el resultado de terceros de 7,60 $ frente a 5,86 $ es una advertencia concreta de que la tarifa más barata puede generar la factura más alta. Claude Opus 5 sigue siendo la opción predeterminada más segura para el trabajo autónomo de horizonte largo hasta que tengas ese número.
El veredicto honesto: esta es la primera generación de Sonnet en la que el argumento del modelo insignia se apoya en la forma de la tarea y no en la capacidad bruta, y quien todavía toma la decisión basándose únicamente en el nombre del modelo ahora mismo está dejando un 60 % sobre la mesa o pagando un 30 % más por cada tarea terminada, dependiendo solo de hacia qué lado se incline su conjetura.



Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
