Una tarjeta de título para Claude Sonnet 5.5 titulada «mismo precio, menos trabajo», con el subtítulo «$2 / $10 por millón de tokens, sin cambios desde Sonnet 5» y tres tarjetas de estadísticas que muestran 56 (AA Intelligence Index), #3 / 216 (puesto en ese índice) y $7.60 (coste por tarea con esfuerzo máximo).
Guides & Insights

Claude Sonnet 5.5: la afirmación sobre el 30 % de costos y los seis cambios que rompen el código de Sonnet 5

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Claude Sonnet 5.5 se lanzó el 28 de septiembre de 2026 exactamente a las mismas tarifas que Claude Sonnet 5 — 2 $ por millón de tokens de entrada, 10 $ por millón de tokens de salida, 0,20 $ por millón de lecturas en caché — mientras que el anuncio de Anthropic encabeza con "se ejecuta un 30 %+ más rápido y cuesta hasta un 30 % menos para la mayoría del trabajo". Ambas afirmaciones son ciertas, y la distancia entre ellas es toda la historia. El ahorro no está en la tarifa, porque la tarifa no se movió. Proviene de ejecutar el modelo con un ajuste de esfuerzo inferior al que necesitaba su predecesor, lo que significa que la cifra del 30 % es una afirmación sobre un punto de operación que uno tiene que elegir, no un precio que se hereda. La medición independiente hace que la bifurcación sea nítida: en Artificial Analysis, Claude Sonnet 5.5 con el esfuerzo máximo cuesta 7,60 $ por tarea en el Intelligence Index frente a 5,09 $ para Claude Sonnet 5 con el máximo — aproximadamente un 49 % más, no un 30 % menos. Eso no contradice la cifra de Anthropic. Es el otro extremo de la misma curva, y es donde aterrizarán por defecto la mayoría de las migraciones si nadie vuelve a ejecutar su barrido de esfuerzo.

Dos afirmaciones disfrazadas de un mismo número

La publicación de Anthropic presenta la afirmación sobre el coste por tarea en tres lugares, y en cada caso se apoya en el esfuerzo. La versión más contundente: en Terminal-Bench 4.0, con esfuerzo medio —el valor predeterminado en las aplicaciones de Claude—, Sonnet 5.5 «supera con creces la mejor puntuación de Sonnet 5 por menos de una décima parte del coste por tarea». En AA-Briefcase v1.1, con esfuerzo medio, supera la mejor puntuación de Sonnet 5 por aproximadamente un noveno del coste. En CursorBench 4.0, con esfuerzo bajo, supera la mejor puntuación de Sonnet 5 por menos de una décima parte.

Léelos como un conjunto y el mecanismo es evidente. De Sonnet 5.5, el suelo se sitúa por encima del techo de Sonnet 5 en varias evaluaciones. No obtienes el 30 % pagando menos por token; lo obtienes al no necesitar ya el ajuste costoso. Anthropic lo dice en la documentación de migración, una página más allá de la sección de marketing: "Los niveles de esfuerzo se han recalibrado. Un nivel de esfuerzo no produce la misma cantidad de pensamiento que en Claude Sonnet 5. Vuelve a ejecutar tu barrido de esfuerzo en lugar de trasladar un ajuste."

Esa frase es la línea más importante a nivel operativo que Anthropic publicó esta semana, y es la que no apareció en la mayoría de la cobertura del lanzamiento.

Lo que Anthropic publicó — reportado por el proveedor, no reproducido

Todo en esta sección es una medición propia de Anthropic, procedente del anuncio y la tarjeta de sistema de Sonnet 5.5. Es una afirmación del proveedor, no un resultado independiente, y el rastro de notas al pie importa tanto como las cifras destacadas.

• Terminal-Bench 4.0 (codificación agéntica): Sonnet 5.5 70,6 % frente a Sonnet 5 10,3 %. Es un salto de siete veces en la fila más citada, y es la cifra con la que abrieron la mayoría de las coberturas.

• FrontierCode 1.1 (Principal) — Sonnet 5.5 52,1 % en Xhigh y 46,2 % en Max; Sonnet 5 42,4 %; Claude Opus 5.5 54,4 %; GPT-6 Sol 49,3 %. Obsérvese la inversión: Sonnet 5.5 obtiene una puntuación más baja en Max que en Xhigh.

• CursorBench 4.0 — 55,5 % para Sonnet 5.5 frente a 34,1 % para Sonnet 5 y 57,8 % para Opus 5.5. CursorBench 4.0 no publica datos de GPT-6 Sol.

• GDPval-AA v2.1 (trabajo de conocimiento) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 en los mismos cuatro modelos.

• Humanity's Last Exam (con herramientas) — 64,5 % / 54,9 % / 67,7 %.

• OSWorld 2.1 (uso de ordenador, crédito parcial) — 80,1 % / 57,0 % / 81,8 %.

• Chartography (reconocimiento visual de gráficos, sin herramientas) — 61,6 % / 15,6 % / 64,4 % / 53,6 %.

Tres notas al pie merecen viajar con esas filas en lugar de figurar debajo de ellas. Primero, la cifra de 66.4% de Opus 5.5 en Terminal-Bench 4.0 se reporta con esfuerzo Xhigh, la configuración de mayor puntuación de Opus 5.5. Segundo, se explica la inversión de FrontierCode Max: en Max, Sonnet 5.5 ejecutaba con más frecuencia la habilidad de revisión de código de Claude Code, que divide la revisión entre muchos subagentes, y en dos casos eso produjo un timeout o ediciones más allá del alcance de la tarea — FrontierCode penaliza los cambios fuera de alcance incluso cuando son buenos. Tercero, y lo menos cómodo para el proveedor, Artificial Analysis ejecutó GDPval-AA y AA-Briefcase en una implementación preliminar de Sonnet 5.5 que, según Anthropic, tenía un error que degradaba las respuestas a solicitudes de salida estructurada. Anthropic espera que el efecto sea pequeño y que subestime a Sonnet 5.5, y afirma que el error está corregido. También señala que OpenAI corrigió recientemente un error de comprensión de imágenes en GPT-6 Sol, por lo que las cifras de GPT-6 Sol en esas filas podrían aún no reflejar el modelo actual.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

Lo que dice la ejecución independiente sobre el mismo modelo

Artificial Analysis tiene a Sonnet 5.5 medido, y su página indica la configuración exacta: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". En la misma revisión del índice, 216 modelos en la clase:

• Claude Sonnet 5.5 — Índice de inteligencia 56, clasificado en el n.º 3 de 216. Coste de 7,60 $ por tarea del índice. Generó 410 M de tokens durante el índice, frente a una mediana de 88 M.

• Claude Sonnet 5 — Índice 38, clasificado en el puesto n.º 58 de 216, en su propia página etiquetada «(Razonamiento adaptativo, esfuerzo máximo)». 5,09 $ de coste por tarea. 370 M de tokens de salida.

• Claude Opus 5.5 — Índice 58, clasificado n.º 1 de 216. $5.98 por tarea. 95,3 tokens de salida por segundo.

• GPT-6 Sol — Índice 48, clasificado en el puesto #20 de 216, a $2/$10 de precio de lista. $1.06 por tarea, 89.8 tokens de salida por segundo.

La brecha del Intelligence Index —56 frente a 38, dieciocho puntos— es la confirmación independiente más sólida de este artículo, y es la cifra que un lector debería llevarse de verdad. La cifra de coste es la que necesita una salvedad, y merece la pena enunciarla con exactitud: ambos puntos son configuraciones de máximo esfuerzo, y el máximo esfuerzo en un modelo que razona durante más tiempo es una postura deliberadamente cara. Sonnet 5.5 quemó 410M de tokens en la ejecución del índice en la que Sonnet 5 quemó 370M, y ambos están muy por encima de la mediana de 88M. Un modelo que piensa durante más tiempo en el ajuste superior cuesta más en el ajuste superior. Lo que la cifra refuta no es "más barato por tarea", sino cualquier lectura de ella como una propiedad del modelo en lugar del ajuste.

Artificial Analysis aún no tiene una cifra de velocidad de salida para Sonnet 5.5 — su A para tokens de salida por segundo, frente a 78,7 para Sonnet 4.5 y 95,3 para 5.5. Así que el «30%+ más rápido» de la afirmación de Anthropic solo está reportado por el proveedor en este momento. Trátalo como orientativo hasta que un tercero lo mida.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

De dónde vienen realmente los ahorros y cómo conseguirlos

Si aceptas el mecanismo, las instrucciones de migración se escriben solas, y Anthropic las ha publicado:

• Empieza en high de forma predeterminada, no en lo que sea que indicara tu configuración de Sonnet 5. La recomendación de Anthropic es high, a menos que tu carga de trabajo sea agéntica o sensible a la latencia.

• Programación agéntica y uso de herramientas en varios pasos: empiece en medio para tareas bien especificadas y suba a alto para las más difíciles o más largas.

• Chat y otros trabajos sensibles a la latencia: empieza en medio o bajo. Esta es la banda donde viven las afirmaciones de "la décima parte del coste".

Existe una explicación coherente de por qué funciona el ajuste más bajo, y no es marketing. Los primeros evaluadores de Anthropic informaron que Sonnet 5.5 agrupa las llamadas a herramientas más que Sonnet 5, lo que produce menos pasos por tarea. La nota de CodeRabbit en el anuncio es inusualmente específica para una cita de lanzamiento: la "tendencia de Sonnet 5 a recurrir a la búsqueda web con demasiada frecuencia y su elevado uso de tokens han desaparecido en este nuevo modelo". Sonnet 5.5 también conservó el mismo tokenizador que Sonnet 5, por lo que un texto idéntico cuesta los mismos tokens: la reducción se debe a menos turnos y menos llamadas redundantes, no a un vocabulario más barato. Eso también significa que los recuentos de tokens de tus registros siguen siendo comparables tras la actualización, lo que hace que la medición antes y después sea sencilla.

Los seis cambios que rompen o alteran el código de Sonnet 5

Esta es la parte de la versión que consume tiempo de ingeniería, y es donde la guía de migración vale más que el gráfico de benchmarks. Cinco de los seis devuelven errores explícitos; el sexto falla en silencio.

• thinking: {"type": "disabled"} ahora devuelve un 400. El reemplazo es thinking: {"type": "between_tools"}, que desactiva el pensamiento inicial y es el ajuste de pensamiento más bajo de este modelo. Funciona con esfuerzo bajo, medio y alto, no necesita encabezado beta y está disponible en todas las plataformas que sirven Sonnet 5.5. Con esfuerzo xhigh o max, between_tools en sí devuelve un 400 — usa pensamiento adaptativo (omite el campo o envía {"type": "adaptive"}) si necesitas esos niveles. Con between_tools tampoco puedes cambiar el esfuerzo a mitad de conversación.

• No se admite el uso forzado de herramientas. tool_choice establecido en {"type": "any"} o {"type": "tool", "name": "..."} devuelve un 400 con el mensaje "tool_choice: type 'tool' and 'any' are not supported for this model." La misma comprobación se aplica al endpoint de recuento de tokens. La alternativa documentada para la entrada válida según el esquema es tool_choice: {"type": "auto"} más strict: true en la herramienta, o mover el esquema a salidas estructuradas.

• Los bloques de pensamiento están vinculados al modelo y a la conversación. Sonnet 5.5 lee bloques de pensamiento de Sonnet 5, Opus 4.8, Haiku 4.5 y anteriores — no de Opus 5, Opus 5.5 ni de ningún modelo Fable o Mythos. Ningún otro modelo lee los bloques de Sonnet 5.5. Mueve una conversación de Sonnet 5 a 5.5 y el razonamiento se conserva; muévela de Sonnet 5.5 a cualquier otro modelo y los turnos posteriores se ejecutan sin él. Por separado, la API ahora comprueba si ha cambiado el prompt del sistema, la lista de herramientas o algún mensaje anterior desde que se produjo un bloque de pensamiento, y en las cuentas creadas a partir del 31 de agosto de 2026 devuelve un 400 cuando así ocurre. Mantén las conversaciones en modo de solo anexar, o envía el encabezado beta thinking-binding-controls-2026-08-01 con prefix_mismatch_behavior: "drop_block".

• computer_20251124 se rechaza en la API de Claude y en Google Cloud. El uso de computadora allí requiere el conjunto de herramientas computer_toolset_20260801. Amazon Bedrock todavía acepta la herramienta anterior: una divergencia entre plataformas que vale la pena señalar si ejecutas el mismo agente en ambas.

• Algunas combinaciones de asesor han desaparecido. Un ejecutor Sonnet 5.5 acepta Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 o Sonnet 5.5 como asesor. Los asesores Opus 4.8, Opus 4.7 y Sonnet 5, que funcionan con un ejecutor Sonnet 5, devuelven un 400 con un ejecutor Sonnet 5.5. Todos los asesores que Sonnet 5.5 acepta devuelven el consejo cifrado, por lo que tu cliente no puede leer el texto del consejo.

• El texto entre llamadas a herramientas ahora llega dentro de bloques de pensamiento, y con el valor de visualización predeterminado, "omitted", está vacío. Este es el silencioso. Las notas de más de una o dos frases entre llamadas a herramientas vuelven como bloques de pensamiento de actualización de progreso en lugar de como texto. Una aplicación que transmite esa narración a sus usuarios se queda en silencio entre llamadas a herramientas, sin ningún error y sin nada en los registros. La solución es configurar thinking.display para que el texto se devuelva, o cambiar a between_tools, en cuyo caso el texto vuelve como texto normal.

Dos cosas más que toca una migración, y ninguna de las dos es un error. Monitorización de rechazos: Sonnet 5.5 devuelve stop_reason: "refusal" con un objeto stop_details que nombra una de cinco áreas de política — cyber, bio, frontier_llm, reasoning_extraction, general_harms — y el fallback del lado del servidor de Anthropic reintentará los rechazos de cyber y frontier_llm en Sonnet 5, pero no los otros tres. Y la postura de seguridad cambió de verdad: Sonnet 5.5 es el primer modelo Sonnet que se lanza con salvaguardas y fallbacks de ciberseguridad como la clase Opus, lo que significa que las solicitudes de ciberseguridad de mayor riesgo recurren visiblemente a Sonnet 5, y el primer Sonnet con clasificadores contra la extracción de razonamiento. Si la propuesta de valor de tu producto es una herramienta de seguridad, pon a prueba ese límite antes de lanzar el cambio de modelo.

Precios, y qué hay realmente en nuestra ruta hoy

La tarifa no cambia respecto a Sonnet 5 y su estructura publicada completa es lo bastante breve como para enunciarla sin rodeos:

• Entrada — $2.00 por millón de tokens. Salida — $10.00 por millón de tokens. Ambos idénticos a Sonnet 5, confirmado en la página del modelo Sonnet 5.5 de Anthropic.

• Lectura de caché — $0,20 por millón, un 90 % de descuento sobre la entrada; Escritura en caché de 5 minutos $2,50 por millón; Escritura en caché de 1 hora $4,00 por millón. El prompt mínimo que se puede almacenar en caché es de 512 tokens en Sonnet 5.5, frente a los 1.024 de Sonnet 5.

• Batch — 50 % de descuento en ambas direcciones, es decir, $1.00 / $5.00 por millón. En la API de Message Batches, la salida puede alcanzar los 300K tokens con el encabezado beta output-300k-2026-03-24.

• Frente a Opus 5.5 — Sonnet 5.5 cuesta exactamente la mitad: $2/$10 frente a $4/$20, con las escrituras de caché a la mitad y las lecturas de caché idénticas a $0.20. Esa es la migración que compensa, y Anthropic lo dice sin rodeos: los dos modelos se complementan mejor cuando Sonnet trabaja con un esfuerzo menor, y Opus «sigue siendo claramente más fuerte en trabajos complejos y abiertos que exigen un criterio sostenido».

• Contexto y salida — Contexto de 1M de tokens, salida máxima de 128K, pensamiento adaptativo activado por defecto, esfuerzo predeterminado alto, corte de conocimiento confiable junio de 2026, retención de datos cero disponible, retirada no antes del 28 de septiembre de 2027.

Una nota de disponibilidad que preferimos declarar en lugar de dar por sentada: Claude Sonnet 5.5 no figura en nuestro catálogo de modelos a fecha del 29 de septiembre de 2026. Su predecesor, anthropic/claude-sonnet-5, y su hermano mayor, anthropic/claude-opus-5.5, sí figuran, y sus tarifas por nuestra parte son las del propio proveedor — 2,00 $ de entrada, 10,00 $ de salida, 0,20 $ de lectura de caché y 2,50 $ de escritura de caché para Sonnet 5, sin ningún recargo añadido, de modo que un cambio de precio del proveedor se aplica aquí el mismo día en que se produce y no en el siguiente ciclo de facturación. Esa última propiedad es la que hace que una lectura de la tarifa sea útil y no meramente decorativa.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

Qué puedes hacer con esto hoy

La secuencia honesta para un equipo que ya ejecuta Claude Sonnet 5 en producción consta de tres pasos, y ninguno de ellos es «cambiar la cadena del modelo y mirar el gráfico».

Primero, vuelve a ejecutar el barrido de esfuerzo. Si arrastraste un ajuste alto o máximo desde Sonnet 5 porque eso era lo que exigía tu listón de calidad, ahora estás pagando por razonamiento que ya no necesitas comprar. Las cifras independientes de coste por tarea dicen que el extremo superior de la escala se volvió más caro, no menos, y las propias afirmaciones de coste del proveedor describen todas la parte media de esta. Segundo, corrige las dos rutas de error antes del despliegue —pensamiento desactivado y uso forzado de herramientas— porque ambas fallan de forma ruidosa e inmediata, lo cual es la buena noticia. Tercero, vigila la ruta de narración, porque falla en silencio.

Si el modelo aún no está en la ruta que usas, la forma de bajo riesgo de evaluarlo es ejecutarlo en paralelo, no en su lugar: mantén Sonnet 5 fijado como fallback en la misma clave, de modo que un rechazo, un timeout o una evaluación deficiente envíen la solicitud al modelo en el que ya confías, y la conmutación automática por error cierre el ciclo sin una segunda integración. Ese es todo el argumento para evaluar un modelo no probado detrás de un único endpoint en lugar de delante de tus usuarios, y aquí se aplica por partida doble, porque las categorías de rechazo de Sonnet 5.5 son nuevas y su calibración de esfuerzo explícitamente no es la misma que la de su predecesor. Cuando estés listo para cambiar el predeterminado, el catálogo en una sola clave llega a más de 200 modelos, lo que convierte la comparación en un cambio de configuración en lugar de un segundo contrato.

Qué ver

Tres cosas resolverán las preguntas abiertas de este artículo, y ninguna de ellas ha ocurrido todavía.

La primera es una medición independiente de la velocidad de salida. Anthropic afirma que es más de un 30 % más rápido que Sonnet 5; Artificial Analysis no ha publicado una cifra para Sonnet 5.5, y la afirmación tiene un peso real en el argumento de costes, ya que un modelo más rápido termina la misma tarea en menos tiempo real y, a menudo, con menos tokens. Claude Haiku 5.5 es el segundo — Anthropic dice que llegará «en las próximas semanas» y se situará por debajo de Sonnet 5.5, lo que cambia el cálculo para el segmento de chat de alto volumen, donde los niveles de esfuerzo medio y bajo ya hacen que Sonnet 5.5 sea competitivo. El tercero es la pasada de corrección: Artificial Analysis ejecutó GDPval-AA y AA-Briefcase en una versión preliminar con un error de salida estructurada, Anthropic espera que esas puntuaciones subestimen el modelo, y ninguna de las dos cifras se ha vuelto a ejecutar. Si suben, la brecha en trabajo de conocimiento frente a Opus 5.5 se estrecha aún más y el argumento de «la mitad del precio» cobra más fuerza.

Hasta entonces, el resumen defendible es más acotado que el anuncio y más útil que el gráfico de benchmarks. Claude Sonnet 5.5 representa una ganancia de inteligencia de dieciocho puntos sobre Sonnet 5 en el índice independiente, con las mismas tarifas publicadas, con un ahorro real y medible disponible para cualquiera que descienda en la escala de esfuerzo — y una penalización real y medible para cualquiera que no lo haga.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario