Una tarjeta de título que dice «Claude Opus 5.5 lidera el Coding Agent Index con 66», con el subtítulo «Tokens más baratos, una factura por tarea más alta» y tres tarjetas redondeadas debajo: Coding Agent Index 66, Costo por tarea $13.04, un 21 % más, y Claude Opus 5: 60 a $10.79.
Guides & Insights

Claude Opus 5.5 lidera el Coding Agent Index con 66 — y la factura de tareas sube un 21%

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El proveedor aplicó a Claude Opus 5.5 un recorte del 20% en los precios de los tokens el 22 de septiembre de 2026. Dos días después, Artificial Analysis publicó la medición del agente de programación que muestra qué le hizo el recorte a la factura de un agente: el costo por tarea subió un 21%, hasta $13.04, desde los $10.79 que el mismo índice cobra por Claude Opus 5. La puntuación también subió — 66 en el Coding Agent Index, que Artificial Analysis describe como el más alto que ha medido, seis puntos por encima de Claude Opus 5 y cuatro por encima de Claude Fable 5.1 en la misma configuración. Ambas cosas son ciertas a la vez, y la razón por la que son ciertas a la vez es toda la historia de esta clasificación. Un token más barato del que un modelo gasta más no es una tarea más barata, y con el máximo esfuerzo de razonamiento en ejecuciones largas de agentes, Claude Opus 5.5 gasta muchos más.

Lo que realmente puntúa el Coding Agent Index

Esto no es una tabla de clasificación de modelos. Cada fila que aparece en ella es un par de harness y modelo — un checkpoint ejecutándose dentro de un agente de programación específico, con una configuración de esfuerzo concreta. La fila que todo el mundo cita es Claude Opus 5.5 con esfuerzo max dentro de Claude Code, que es el harness contra el que Anthropic construye y ajusta. El 60 de Claude Opus 5 y el 62 de Claude Fable 5.1 provienen del mismo harness y de la misma configuración de esfuerzo, que es lo que los convierte en las comparaciones honestas; una fila de cualquiera de los dos modelos en un agente de programación diferente es una medición distinta y no se imprime aquí como si fuera la misma.

El índice está versionado, y la versión importa más que el nombre de marca que figura en él. La tabla publicada actualmente como v1.5 promedia tres evaluaciones, cada una ponderada por igual, cada una reportada como pass@1 promediado sobre tres intentos por tarea:

Terminal-Bench 4.0 — trabajo agéntico en shell y línea de comandos: navegar por un sistema de archivos, usar las herramientas correctamente, recuperarse de un fallo intermedio y completar un flujo de trabajo de varios pasos.

DeepSWE v1.1 — tareas de ingeniería de software, el trabajo de edición de repositorios.

SWE-Atlas-QnA — preguntas de comprensión de repositorios, en las que la respuesta se encuentra leyendo una base de código en lugar de modificarla.

Tres evaluaciones, un número y una columna de coste por tarea impresa junto a él. Esa columna de coste es la razón por la que este índice es más útil que una puntuación por sí sola, y también es la razón por la que la cifra principal es más difícil de leer de lo que parece.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

Los tres componentes, y de dónde vinieron los seis puntos

Artificial Analysis publicó las filas de componentes junto con el compuesto, y no se mueven de manera uniforme:

Terminal-Bench 4.063,1 % para Claude Opus 5.5 frente a 54,5 % para Claude Opus 5, una mejora de 8,6 puntos. Esta es la mayor mejora individual del conjunto.

DeepSWE v1.168,4 % frente a 62,5 %, un aumento de 5,9 puntos.

SWE-Atlas-QnA66,4 % frente a 62,1 %, un aumento de 4,3 puntos.

Si promedias esos tres, obtienes 66.0, que es el compuesto. La forma de la mejora es lo interesante: el modelo mejoró menos al leer una base de código y más al manejar un shell. Terminal-Bench es la evaluación más cercana a lo que la gente entiende realmente por "agente de programación": un bucle de larga duración en el que el modelo elige comandos, lee la salida y decide qué hacer a continuación, sin ningún humano en el bucle entre pasos. Un salto de 8.6 puntos allí es una declaración sobre el uso sostenido de herramientas, no sobre la generación de código.

Fíjate en lo que eso implica acerca de dónde esperar la mejora. Si tu carga de trabajo es "explicar este repositorio", Claude Opus 5.5 es una mejora modesta con respecto a Claude Opus 5 — cuatro puntos. Si tu carga de trabajo es "ejecutar hasta que pase la suite de pruebas, corrigiendo lo que se rompa", es el mayor salto de la tabla.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

El número impreso junto a la clasificación: $13.04 por tarea

Aquí está la aritmética que hace que el recorte de precio parezca distinto de como se anunció. El precio de lista de Anthropic para Claude Opus 5.5 es $4.00 por millón de tokens de entrada y $20.00 por millón de tokens de salida, frente a $5.00 y $25.00 para Claude Opus 5, con las lecturas de caché reducidas un 60 % hasta $0.20 por millón. Todas esas líneas son más baratas. La estimación de Artificial Analysis de lo que cuesta una tarea con esfuerzo máximo es más alta de todos modos:

Coste por tarea — $13.04 para Claude Opus 5.5 frente a $10.79 para Claude Opus 5, un aumento del 21 % en el mismo índice, el mismo harness, la misma configuración de esfuerzo.

Tokens totales por tarea — aproximadamente 15,6 M frente a 11,4 M, lo que supone un aumento de alrededor del 37 %.

Tokens de salida por tarea — aproximadamente 333.000 frente a 137.000, más del doble. La salida es la dirección costosa, y es la línea que más se movió.

Entrada en caché por tarea — aproximadamente 14,6 M frente a 10,9 M, un aumento de alrededor del 34 %. La reducción del 60 % en la lectura de caché sí que está haciendo un trabajo real aquí; simplemente no basta para compensar una tarea que lee un tercio más de contexto.

Haz la suma con las tarifas publicadas y la forma se desprende. Toma solo los tokens de salida: 333.000 tokens a $20,00 por millón son aproximadamente $6,66 — aproximadamente la mitad de la estimación completa de $13,04, proveniente de una única partida que se duplicó. La línea de lectura de caché es enorme en volumen y casi gratuita en precio: 14,6 millones de tokens a $0,20 por millón son menos de $3. El recorte del 20 % es real y el recorte de caché es real; con el máximo esfuerzo en un bucle de agente, simplemente se ven superados por un modelo que piensa más y escribe más.

Eso tiene una consecuencia directa en cómo elaboras tu presupuesto. Si tu equipo ejecuta 500 tareas de agentes de programación al día con el máximo esfuerzo, la diferencia entre $10.79 y $13.04 es de aproximadamente $1,125 al día — alrededor de $34,000 al mes — para la misma cantidad de tareas. Ese es el número que hay que poner delante de quien apruebe el cambio de modelo, y no es el número que implica la rebaja de precio.

Por qué $5.98 y $13.04 son ambos verdaderos

Artificial Analysis publicó otra cifra de coste por tarea para el mismo modelo días antes, y leer ambas juntas sin las etiquetas hace que parezcan una contradicción. No lo son: son dos evaluaciones distintas, y la diferencia es reveladora.

En el Intelligence Index, el análisis del 22 de septiembre situó el coste por tarea de Claude Opus 5.5 en $5.98, aproximadamente al mismo nivel que los $5.86 de Claude Opus 5, a pesar de unos 119.000 tokens de salida por tarea frente a los 73.000 de Opus 5. Ahí, la reducción de precio y los tokens adicionales se anulan casi exactamente. En el Coding Agent Index, con el esfuerzo máximo, en Claude Code, el mismo modelo cuesta $13.04 frente a $10.79.

Ambas son mediciones honestas de cargas de trabajo diferentes. Una evaluación de preguntas y respuestas es un intercambio breve; una tarea de agente es un bucle largo de llamadas a herramientas con un contexto creciente, y el crecimiento se acumula en la dirección de salida, donde el precio es más alto. La lección práctica es que «¿el recorte de precio compensa los tokens adicionales?» no tiene una única respuesta —depende de la duración de la tarea, y cuanto más larga y más agéntica sea la tarea, peor se vuelve la compensación. Si haces tu presupuesto a partir de un benchmark de respuestas cortas, subestimarás la factura de un agente.

Tres salvedades que van en la fila

El 66 es una cifra de Claude Code, no una cifra de un modelo por sí solo. El índice empareja modelos con arneses deliberadamente, bajo el argumento de que el enrutamiento de herramientas, la lógica de reintentos y la gestión del contexto son inseparables del rendimiento medido de un agente. Eso juega a favor de Anthropic aquí, porque el arnés con el que se le evalúa es el suyo propio. Artificial Analysis señala que una vista de comparación de arneses llegará pronto; hasta que exista, nadie puede decir cuánto de la ventaja de seis puntos corresponde al punto de control y cuánto al andamiaje que lo rodea.

La propia cifra de Terminal-Bench 4.0 de Anthropic es superior a la de este componente, y fue ejecutada por Anthropic. El material de lanzamiento reporta 66,4 % con xhigh de esfuerzo; el componente del Coding Agent Index es de 63,1 % en max, y la ejecución independiente y separada de Artificial Analysis midió 59,6 % en su propio harness sobre la misma versión del benchmark. Tres números, tres configuraciones, tres productores. El 63,1 % de la fila anterior es el componente propio del índice y solo debería compararse con los otros números de ese índice; el 66,4 % del proveedor está reportado por el proveedor, no ha sido reproducido por un tercero y pertenece a una configuración de esfuerzo diferente.

La revisión del índice se mueve. Este blog reportó distintas filas del Coding Agent Index a principios de septiembre, en una versión anterior del mismo tablero, y esas cifras más antiguas no son comparables con la v1.5 — el propio conjunto de evaluación cambió cuando Terminal-Bench 4.0 reemplazó a la versión anterior. Los espejos de terceros todavía contienen instantáneas obsoletas con etiquetas de versiones anteriores. Si un número de Claude Opus 5.5 en este índice no proviene de la fila actual de la v1.5, no lo coloque junto a un número de la v1.5, y no calcule una diferencia entre ambos.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

Qué desplegar realmente

La clasificación es una cifra de esfuerzo máximo, y el esfuerzo máximo es la configuración que casi nadie debería lanzar por defecto. Claude Opus 5.5 tiene cinco ajustes de esfuerzo —bajo, medio, alto, xhigh y max—, y el modelo usa medio de forma predeterminada. Artificial Analysis no ha publicado filas del Coding Agent Index con los ajustes más bajos, por lo que el ahorro de costes ahí no está cuantificado en este índice; en el Intelligence Index, el mismo modelo en medio obtuvo 51 —igualando el max de Claude Opus 5— con un coste de $1.34 por tarea. Ahí es donde están los ahorros, y es un ajuste, no un modelo distinto.

El patrón realista es una división: reservar el esfuerzo máximo para los bucles autónomos largos, donde la ganancia de 8,6 puntos en Terminal-Bench es lo que estás comprando, y ejecutar el trabajo rutinario con un esfuerzo menor, donde el modelo sigue muy por delante de donde terminó Claude Opus 5. Como el esfuerzo es un parámetro de la solicitud y no un despliegue, esa división es una regla de enrutamiento, y ambos modelos están en el mismo catálogo — el de Anthropic, con precios de lista traspasados con 0% de margen, así que una rebaja de precios del proveedor se aplica en anthropic/claude-opus-5.5 el mismo día en que se anuncia, y no hay un segundo contrato ni un cambio de código implicado en hacer una prueba A/B entre los dos con tus propias tareas. Para la ruta de esfuerzo máximo en concreto, donde una sola tarea puede ser una ejecución larga sin supervisión, la conmutación automática por error es lo que evita que un proveedor estancado te cueste todo el bucle.

¿Qué queda aún sin medir?

Tres cosas cambiarían esta situación y ninguna de ellas existe todavía. No hay ninguna comparación de Claude Opus 5.5 con un checkpoint rival en la que se igualen el esfuerzo y el harness —todas las comparaciones entre proveedores disponibles son dos tablas de proveedores dispuestas una al lado de la otra—. No hay ninguna ejecución publicada del Coding Agent Index con esfuerzo medio o alto, que es donde se situaría la mayor parte del tráfico de producción. Y la cuestión de la atribución del harness —cuánto de un 66 corresponde al modelo y cuánto a Claude Code— ha sido reconocida por el índice y aplazada.

Lo que puedes aprovechar hoy es más concreto y más útil que una clasificación. Claude Opus 5.5 es genuinamente mejor en el trabajo sostenido de agentes impulsados por shell que Claude Opus 5; ese es el único componente con una mejora grande, consistente y producida de forma independiente. Además, cuesta más por tarea en la configuración donde se midió esa mejora, unos 2,25 $ por tarea, y la reducción del precio por token no llega a esa cifra. Despliégalo con el máximo esfuerzo donde el bucle sea largo y el coste del fallo sea alto; mantén la configuración más barata en todo lo demás; y vuelve a consultar el índice cuando aparezcan las filas de menor esfuerzo, porque esa es la configuración que la mayoría de los equipos realmente pagará. Si cambias solo por la reducción de precio, estás comprando lo que no es: el modelo es más barato por token y más caro por tarea, y solo uno de esos dos números aparece en tu factura.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario