Tarjeta de título generada para un artículo sobre el Epoch Capabilities Index, con el titular «Claude Opus 5.5 encabeza el Epoch Capabilities Index» sobre una línea monoespaciada azul claro que dice «167.35 vs 166.51» y un subtítulo gris que dice «Los dos primeros en una combinación de más de 50 benchmarks», con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Claude Opus 5.5 encabeza el Epoch Capabilities Index por 0,84 puntos

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El número es 0,84. Claude Opus 5.5 se sitúa en 167,35 en el Epoch Capabilities Index según el archivo que leímos el 2 de octubre de 2026, con GPT-6 Astra en 166,51 — una diferencia de menos de un punto en una escala donde los intervalos del 95 % publicados para los dos modelos se solapan casi por completo, de 164,0 a 172,0 para Opus 5.5 frente a 163,14 a 171,05 para Astra. Por debajo de ellos, Claude Sonnet 5.5 registró 165,2 y Claude Fable 5.1 164,82, de modo que las cuatro primeras entradas de un compuesto independiente de más de cincuenta benchmarks están separadas por 2,53 puntos y tres de ellas llevan el nombre del mismo proveedor. El orden es real en el sentido de que las estimaciones puntuales están ordenadas. No es real en el sentido de que una ventaja de 0,84 puntos sobreviva a sus propias barras de error, y todo lo que merece decirse sobre esta clasificación se deriva de sostener ambos hechos a la vez.

Qué es el índice y qué no es 0,84 de un punto

El Epoch Capabilities Index no es un marcador de proveedores. Está construido por Epoch AI, una organización de investigación independiente, como un compuesto que combina puntuaciones de más de cincuenta benchmarks distintos en una única escala de capacidad general, e infiere la dificultad relativa de cada benchmark a partir de los modelos que casualmente aparecen en varios de ellos a la vez. La metodología se expone en un artículo escrito con investigadores del equipo AGI Safety & Alignment de Google DeepMind y financiado por DeepMind, pero Epoch afirma claramente que el índice es su propio producto y que posee todos los derechos sobre él, una distinción que conviene mantener cuando la fuente de financiación y el publicador de una puntuación no son la misma parte. El código es público.

Dos propiedades de la escala importan más que el titular. La primera es que el ECI está anclado deliberadamente en lugar de ser absoluto: las puntuaciones brutas se reescalan de modo que Claude 3.5 Sonnet quede en 130 y GPT-5 en 150, lo que significa que un número de este índice solo tiene sentido junto a otro número del mismo archivo, nunca por sí solo. La segunda es que el índice no tiene techo. No hay un 100 al que acercarse, así que «lo más alto del índice» es una afirmación sobre una fecha, no sobre un límite que alguien haya alcanzado.

Por eso, la lectura honesta de 167,35 frente a 166,51 no es «Claude Opus 5.5 es el modelo más capaz del mundo». Es más estrecha y menos citable: según el modelado que hace Epoch de la evidencia disponible el 2 de octubre de 2026, los dos modelos son indistinguibles en la cima, y el orden entre ellos es un desempate más que una medición. Los intervalos publicados lo dicen directamente: 164,0 a 172,0 y 163,14 a 171,05 comparten la gran mayoría de su rango. Cualquiera que cite el 0,84 como veredicto está citando un artefacto de redondeo.

El bloque de Anthropic, y el tamaño de un lanzamiento

El dato más revelador de la tabla no es quién está primero. Son la tercera y la cuarta fila. Claude Sonnet 5.5, lanzado el 28 de septiembre y con una puntuación de 165.2, queda 0.38 puntos por encima de Claude Fable 5.1, lanzado el 1 de septiembre con 164.82 — lo suficientemente cerca como para que los dos ocupen la misma posición en la práctica, y lo suficientemente cerca como para que el par se sitúe solo 2.15 puntos por debajo de lo más alto de la tabla. Sonnet es el producto de gama media en la línea de Anthropic y Fable es el modelo que la compañía ha señalado históricamente para el trabajo de razonamiento general; que ambos ahora flanqueen la frontera desde justo debajo es el cambio sustancial en esta renovación, más que la identidad del líder.

El propio salto generacional de Anthropic también es visible. Claude Opus 5.5 es el sucesor de Claude Opus 5, al que Epoch puntúa con 162,94, con un intervalo de 160,2 a 166,7. Eso supone una mejora de 4,41 puntos en aproximadamente dos meses, desde un lanzamiento el 24 de julio hasta otro el 22 de septiembre — un avance mayor que los 0,84 puntos que separan el primer y el segundo puesto actuales. Leída así, la cantidad interesante en esta tabla es la pendiente dentro de la línea de un solo proveedor, no la diferencia entre dos proveedores en la cima.

Dónde pasa la línea de los pesos abiertos

Epoch separa los modelos por accesibilidad, lo que hace legible la frontera de los pesos abiertos sin tener que adivinar. La mejor entrada de pesos abiertos es Kimi K3 con 157.61, fechada el 16 de julio y etiquetada como no comercial. Detrás de ella se sitúan DeepSeek V4 Pro 0813 con 155.38 y DeepSeek V4.1 Flash con 155.0, ambos sin restricciones, luego GLM-5.3-Flash con 151.94 y GLM-5.2 con 151.78. El modelo abierto más cercano a la cima está, por lo tanto, a 9.74 puntos de distancia — una brecha dieciocho veces mayor que la existente entre el primer y el segundo puesto, y lo bastante amplia como para que los intervalos no lleguen ni de cerca a tocarse.

Esa asimetría es el único hallazgo duradero de la tabla. La frontera cerrada es un apiñamiento dentro de tres puntos; la distancia de la frontera cerrada a los mejores pesos descargables es un orden de magnitud mayor. Un índice compuesto que permite comparar entre generaciones de benchmarks es exactamente la herramienta para notar eso, porque puede decir lo mismo en julio y en septiembre en lugar de informar que un benchmark que se satura ha enmudecido.

Algunas de las filas cercanas merecen fijarse para dar contexto, ya que son los modelos con los que los lectores realmente comparan Opus 5.5:

• Claude Sonnet 5 — 156.34, lanzado el 30 de junio, intervalo de 153.61 a 158.81

• Grok 4.6 — 156.61, lanzado el 12 de agosto, intervalo de 154.66 a 158.93

• Gemini 3.8 Flash — 156.93, lanzado el 2 de septiembre, intervalo de 154.64 a 160.42

• Muse Spark 1.3 — 156,86, publicado el 2 de septiembre, intervalo de 154,73 a 159,56

• GPT-5.6 Sol — 161.8, lanzado el 9 de julio, intervalo de 159.26 a 165.26

Una posición en un índice no es una factura

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

Aquí la tabla de clasificación deja de ser toda la historia, porque los dos modelos de la cima no cuestan ni de lejos lo mismo. En nuestro propio catálogo, que incluye ambos al precio de lista del proveedor sin margen añadido, Claude Opus 5.5 a $4.00/$20.00 con lecturas de caché a $0.20 y GPT-6 Astra a $10.00/$50.00 con lecturas de caché a $1.00 están separados por un factor de 2,5 en ambas direcciones de la tarifa. Además, Astra sube de tramo por encima de los 272.000 tokens de prompt, donde la entrada pasa a $20.00 y la salida a $75.00; Opus 5.5 mantiene $4.00/$20.00 sin cambios en toda su ventana completa de 1 M de tokens. Ambos ofrecen 128.000 tokens de salida.

Haz los cálculos que realmente implica una carga de trabajo de contexto largo: un prefijo de 180.000 tokens servido desde caché, 5.000 tokens generados. En Opus 5.5, eso son 180.000 tokens a $0,20 por millón, o alrededor de 3,6 centavos, más 5.000 a $20 por millón, o 10 centavos: aproximadamente 13,6 centavos. En GPT-6 Astra, son 180.000 a $1,00, o 18 centavos, más 5.000 a $50, o 25 centavos: aproximadamente 43 centavos. Una ventaja de 0,84 puntos y una brecha de costos de 3,2 veces no son el mismo tipo de hecho, y una decisión de compra que solo sopesa la primera ha sopesado el número más pequeño.

Fable 5.1 ilustra el argumento desde el otro lado de la tarjeta del mismo proveedor: a $10.00/$50.00 tiene exactamente el mismo precio que Astra, y obtiene 164.82 — 2.53 puntos por debajo de Opus 5.5 por el mismo dinero. El índice sitúa las tres entradas de frontera de Anthropic a menos de 2.53 puntos entre sí y su tarjeta de tarifas las separa 2.5 veces, lo que describe mucho mejor la elección que tiene delante un comprador que cualquier clasificación única.

Si vas a discutir sobre un número, discute sobre tu propio tráfico.

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

La razón por la que este índice tiene algún valor para el lector es que lo mide alguien distinto de los proveedores, pero la estructura del propio compuesto establece los términos del debate. La calibración de Epoch, sus estimaciones de dificultad y su tratamiento de los modelos que se saltan los benchmarks están aguas arriba del número de la tabla, y ninguno de ellos es algo que un lector pueda reconstruir a partir de una captura de pantalla. Lo mismo ocurre con el benchmark principal de cada proveedor, por lo que el movimiento útil no es tomar partido entre ellos, sino compararlos con tráfico que tú controlas.

Ambos modelos son accesibles desde una sola clave de API en OrcaRouter, que repercute el precio de lista del proveedor con un 0 % de margen: Claude Opus 5.5 a $4.00/$20.00 con lecturas de caché a $0.20 y GPT-6 Astra a $10.00/$50.00 con su nivel superior a 272 K aplicado exactamente como lo establece el proveedor. Enviar el mismo conjunto de prompts a ambos es un cambio de configuración y no un segundo contrato, y allí donde ambos estén enrutados, la conmutación automática por error queda por debajo, lo que importa para una decisión tan cerca del umbral de ruido. La tabla de clasificación puede decirte que los dos modelos son indistinguibles. Solo tu propia evaluación puede decirte cuál es indistinguible en tu trabajo.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

¿Qué movería este número el próximo mes?

El archivo de Epoch es un documento vivo, y tres cosas cambiarían la lectura con rapidez. La primera es cualquier nueva evaluación de un modelo de frontera que quede dentro de los cuatro primeros, ya que una sola observación de benchmark adicional mueve más un compuesto cuando el grupo está así de apretado que cuando hay un líder claro. La segunda es la deriva de los intervalos de confianza: las entradas más recientes son las que tienen los intervalos más amplios, porque se han evaluado con el menor número de benchmarks superpuestos, así que los lanzamientos de septiembre son las filas más propensas a moverse y los de julio, las menos. La tercera es que un benchmark alcance la saturación, que es el fallo específico que el índice fue diseñado para resistir: cuando un componente deja de discriminar, Epoch repondera la composición en lugar de dejar que la ventaja de un modelo se desvanezca con la prueba.

Por ahora, el resumen defendible es el más limitado. Claude Opus 5.5 ocupa el primer puesto en el Epoch Capabilities Index con 167,35, gracias a un margen de 0,84 puntos que su propio intervalo de confianza no respalda; Claude Sonnet 5.5 ha ascendido hasta situarse a 2,15 puntos del liderato desde la gama media de la misma línea, y el campo de pesos abiertos está más de nueve puntos por detrás de todos ellos. El líder es un cara o cruz entre dos proveedores. La diferencia de cuatro puntos en el precio entre ellos no lo es.

Comparados en este artículo4

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario