
Claude Sonnet 5.5 vs Claude Opus 5.5: los benchmarks convergen, la factura no
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Claude Sonnet 5.5 alcanzó su disponibilidad general el 28 de septiembre de 2026 a 2,00 $ por millón de tokens de entrada y 10,00 $ por millón de tokens de salida. Claude Opus 5.5, el buque insignia de Anthropic, se lanzó seis días antes, el 22 de septiembre, a 4,00 $ y 20,00 $ — exactamente el doble en ambas líneas. La lectura obvia es que Opus 5.5 es el techo y Sonnet 5.5 es el compromiso que uno acepta cuando el presupuesto es real. La propia tabla de lanzamiento de Anthropic no respalda esa lectura. Según las cifras que la compañía publicó, Claude Sonnet 5.5 registra 1844 frente a los 1846 de Opus 5.5 en GDPval-AA v2.1, 1811 frente a 1822 en AA-Briefcase v1.1, y 70,6 % frente a 66,4 % en Terminal-Bench 4.0 — gana el único benchmark que mide el trabajo realmente realizado dentro de una terminal. Dos líneas por debajo de esas cifras, el propio pie de figura de Anthropic afirma que Opus 5.5 «sigue siendo claramente más fuerte en trabajos complejos y de final abierto». Ambas afirmaciones son ciertas, y dilucidar cómo sostenerlas a la vez es buena parte de aquello para lo que sirve esta comparación.
Lo que dice la tabla de lanzamiento, y lo que se niega a decir
El patrón en el bloque de benchmarks de Anthropic es el de un modelo que ha cerrado la mayor parte de la brecha, en lugar de uno que ha tomado la delantera. GDPval-AA v2.1, un conjunto de tareas con ponderación económica, es un empate a dos puntos. AA-Briefcase v1.1, una evaluación de documentos y entregables, es un empate a once puntos. CursorBench 4.0 va en la dirección opuesta: 55,5 % para Sonnet 5.5 frente a 57,8 % para Opus 5.5. OSWorld 2.1 se sitúa en 80,1 % frente a 81,8 %, y Humanity's Last Exam en 64,5 % con herramientas frente a 67,7 %. Solo Terminal-Bench 4.0 rompe el patrón, y lo rompe con fuerza: 70,6 % frente a 66,4 %, una ventaja de cuatro puntos de Sonnet en trabajo agéntico de línea de comandos.
Lea las etiquetas de fila en lugar de los números y aparecerá algo distinto. Varias de esas entradas de Opus 5.5 llevan una anotación de esfuerzo —66,4 % en Xhigh— y una nota al pie indica que la configuración Max obtiene resultados peores que Xhigh en FrontierCode, no mejores. Un mayor esfuerzo no es monotónico. Un equipo consciente del presupuesto que asume que el «esfuerzo máximo» es una mejora gratuita está comprando tokens para obtener una peor respuesta en al menos una de las propias pruebas de Anthropic. Y en FrontierCode 1.1, esa misma nota al pie sitúa a Sonnet 5.5 en un 46,2 % en la configuración Max frente al 54,4 % de Opus 5.5, que es la cifra más clara de dónde el buque insignia sigue desmarcándose: trabajo de código de horizonte largo bajo una definición de tarea que recompensa la persistencia.
Hay una salvedad más que conviene decir con claridad en lugar de enterrarla. Anthropic señala que las ejecuciones de GDPval-AA y AA-Briefcase que publica se realizaron en un despliegue previo al lanzamiento que arrastraba un error de salidas estructuradas. Eso afecta a ambos modelos en la misma tabla, así que la comparación no queda invalidada, pero sí significa que las cifras absolutas deben tratarse como una instantánea y no como un resultado definitivo. Las tablas de benchmarks de los proveedores son artefactos de marketing con un apéndice de metodología, y esta viene con su apéndice adjunto.
Dónde se sitúa la medición independiente
Artificial Analysis puntúa ambos modelos bajo un único arnés, en la misma configuración que etiqueta como "Adaptive Reasoning, Max Effort, Default Fallback", en Intelligence Index v4.3. Claude Opus 5.5 se sitúa en 58. Claude Sonnet 5.5 se sitúa en 56. Es una diferencia de dos puntos en una escala en la que el mismo evaluador sitúa a Opus 5 en 51, a Sonnet 5 en 38, a DeepSeek V4 Pro en 36 y a Gemini 3.1 Pro Preview en 30. Que un nuevo Sonnet llegue dos puntos por debajo del buque insignia y cinco puntos por encima de la generación anterior de Opus es la afirmación sustantiva de este lanzamiento, y es una afirmación de terceros en lugar de una del proveedor.
Luego, la misma página invierte la economía de esto. Artificial Analysis informa de que una ejecución de evaluación de Sonnet 5.5 cuesta 7,60 $ por tarea, frente a 5,98 $ para Opus 5.5, aunque Sonnet 5.5 cuesta la mitad por token. La causa está justo ahí, en la página: Sonnet 5.5 generó 410 millones de tokens en todo el conjunto de índices, frente a una mediana de 88 millones para los modelos que rastrea —«muy verboso», en palabras del evaluador—. Opus 5.5 generó 260 millones en el mismo conjunto. A 10 $ por millón de tokens de salida frente a 20 $, el factor de verbosidad de aproximadamente 1,6 sigue haciendo que Sonnet 5.5 pague alrededor de un 27 % más por tarea completada.
Esta es la parte de la comparación que una tabla de precios por token no puede mostrarte, y es la razón por la que ambas cifras coexisten sin contradicción. Por token, Sonnet 5.5 cuesta la mitad. Por tarea terminada, en una suite de evaluación con prompts abiertos y sin disciplina en la longitud de salida, puede ser más caro. Cuál de esas describe tu carga de trabajo es la decisión real.
Niveles de esfuerzo, límites de salida y la forma de la integración
Para un comprador, las propiedades mecánicamente importantes son casi idénticas entre estos dos modelos.
• Contexto — 1,000,000 de tokens en ambos, del mismo proveedor, así que los supuestos de ingeniería de prompts se trasladan sin cambios
• Salida máxima: 128,000 tokens en ambos; la generación masiva no es un diferenciador aquí
• Modalidad — entrada de texto, imagen y archivos en ambos; ninguno acepta audio ni video
• Control de razonamiento — pensamiento adaptativo en ambos, con la profundidad establecida por un parámetro de esfuerzo en lugar de un presupuesto de tokens de pensamiento. En la Claude Platform, el valor predeterminado es alto; dentro de las aplicaciones Claude, es medio.
• Escritura en caché — $5.00 por millón para Claude Opus 5.5 frente a $2.50 para Claude Sonnet 5.5, la única línea en la que el modelo más barato también es el más barato de alimentar con un prefijo reconstruido
• Lectura de caché — $0.20 por millón en ambos, un empate exacto en la línea que domina las ejecuciones largas de agentes
Dado que las superficies coinciden, la migración entre ellas es un cambio de cadena de modelo y una nueva medición del esfuerzo, no un proyecto de integración. Eso es inusual entre proveedores y es la razón por la que este emparejamiento en particular vale la pena comparar siquiera: los dos candidatos difieren en precio y en profundidad, no en la API que hay que escribir.
Una diferencia operativa merece una línea propia. Anthropic afirma que Claude Sonnet 5.5 es el primer Sonnet que se lanza con salvaguardas cibernéticas y mecanismos de respaldo al mismo nivel que sus modelos de gama más alta, lo que significa que las solicitudes de ciberseguridad de mayor riesgo se enrutan de forma visible al Sonnet anterior en lugar de ser respondidas por el modelo que usted nombró. Si su carga de trabajo toca ese dominio, la cadena del modelo no es garantía de qué modelo respondió, en ninguno de los dos niveles. Anthropic también señala que si ejecuta Sonnet con el pensamiento desactivado, debe cambiar a un comportamiento entre herramientas, lo que constituye un cambio de código y no una marca de configuración. Ninguna de las dos es razón para evitar el modelo; ambas son razones para saberlo antes de publicar.
En OrcaRouter, Claude Opus 5.5 es enrutable hoy con la misma credencial que cualquier otro modelo del catálogo, al precio de lista del proveedor con un 0 % de margen, con conmutación por error automática disponible por debajo. Claude Sonnet 5.5 aún no es una ruta en nuestra plataforma — el modelo tiene un día de vida y, hasta que esté listado, lo honesto es decir que se accedería a él a través de la propia API de Anthropic. Cualquiera que actualmente ejecute Opus 5.5 a través de nosotros puede calcular el precio del cambio el día que llegue sin cambiar nada más de su integración.
Cuál poner dónde
La división que se desprende de las cifras: Claude Sonnet 5.5 para trabajo de agentes vinculado al terminal, donde es el más fuerte de los dos según la propia cifra de Terminal-Bench 4.0 de Anthropic y cuesta la mitad; Claude Sonnet 5.5 para cualquier cosa orientada al throughput, ya que la diferencia de coste solo se reduce cuando la tarea obliga a generar salidas largas; Claude Opus 5.5 para trabajo tipo FrontierCode, refactorizaciones de horizonte largo en grandes bases de código y cualquier carga de trabajo en la que el margen del 54,4 % al 46,2 % refleje la forma de tu problema real en lugar de una fila de la tabla de clasificación.
Si tus tareas son de final abierto y no puedes predecir la longitud de la salida, considera que el precio por token es directamente la cifra equivocada. Mide los tokens por tarea completada en tu propio tráfico durante una semana antes de decidirte por una opción u otra; la cifra de artificial-analysis de $7.60 frente a $5.98 es una advertencia de que el modelo barato puede perder en la métrica por la que realmente pagas.
El veredicto honesto: esto ya no es una disyuntiva entre capacidad y coste. Es una cuestión de si tu trabajo está acotado. Para tareas acotadas, de alto volumen e impulsadas por herramientas, el modelo más barato también es el mejor según la evidencia disponible, y el insignia no vale el doble. Para el trabajo abierto y de largo horizonte, la propia frase de Anthropic —que Opus 5.5 sigue siendo claramente más fuerte— es la que hay que creer, y ninguna convergencia de benchmarks lo cambia todavía.



