Una tarjeta de título generada que lleva por encabezado 'nivel en 165', con el subtítulo 'Epoch Capabilities Index, archivo del 1 de octubre de 2026', tres tarjetas de estadísticas que indican 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) y 11 vs 20 (evaluaciones de benchmark detrás de cada cifra), y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Claude Sonnet 5.5 empata con Claude Fable 5.1 en el Epoch Capabilities Index

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Un empate en la cima de una tabla de clasificación suele ser lo menos interesante de ella. Este es la excepción, porque los dos modelos que empatan en la cima no cuestan el mismo dinero. En el archivo del Epoch Capabilities Index actualizado el 1 de octubre de 2026, Claude Sonnet 5.5 y Claude Fable 5.1 marcan ambos 165 —filas tres y cuatro de 253 modelos registrados—, dos puntos por detrás de Claude Opus 5.5 y GPT-6 Astra, que a su vez empatan en 167, y dos puntos por delante de Claude Opus 5 con 163. Claude Sonnet 5.5 se lanzó el 28 de septiembre de 2026 a 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. Claude Fable 5.1 se lanzó el 1 de septiembre a 10 y 50 dólares. Un solo número dice que los dos son intercambiables en capacidad general. Un precio de salida cinco veces mayor dice que no lo son. Ambas cosas se sostienen, y la razón por la que se sostienen juntas es la parte de la tabla que nadie cita.

Qué es realmente el índice y quién lo mide

The ECI is not a vendor scoreboard. It is built by Epoch AI, an independent research organisation, as a composite that stitches scores from more than fifty distinct benchmarks into one general-capability scale, inferring each benchmark's relative difficulty from the models that happen to appear on several of them at once. The methodology is set out in a paper, “A Rosetta Stone for AI Benchmarks”, funded by Go​ogle DeepMind and written with researchers from its AGI Safety & Alignment team — but Epoch states plainly that the index is its own product and that it holds full rights over it, and the fitting code is public. That distinction matters when the funder of the research and the publisher of the score are not the same party.

Dos propiedades de la escala deciden cómo puede leerse un número en ella. La primera es que ECI está anclado en lugar de ser absoluto: los valores brutos se reescalan de modo que Claude 3.5 Sonnet queda en 130 y GPT-5 en 150, lo que significa que una cifra solo significa algo junto a otra cifra del mismo archivo. La segunda es que no hay techo. No hay un 100 al que acercarse, así que «lo más alto del índice» es una afirmación sobre una fecha y no sobre un límite que alguien haya alcanzado.

La tercera propiedad es la que convierte un empate en una historia. Los intervalos publicados junto a cada puntuación —intervalos bootstrap del 90 %, construidos remuestreando quinientas veces los propios resultados de benchmark observados de cada modelo— son idénticos para los dos modelos en 165: de 162 a 169 para Claude Sonnet 5.5 y de 162 a 169 para Claude Fable 5.1. Los recuentos que los produjeron no lo son. El 165 de Claude Sonnet 5.5 se ajusta a partir de 11 evaluaciones de benchmark. El de Claude Fable 5.1 se ajusta a partir de 20.

Por qué el mismo intervalo no significa la misma evidencia

El ECI necesita un mínimo de cuatro evaluaciones de referencia antes de que un modelo sea puntuado en absoluto, así que ambas cifras superan el umbral mínimo con holgura. Pero el intervalo es una afirmación sobre cuánto se dispersan los propios resultados de un modelo, no sobre cuántos hay —por eso dos modelos pueden mostrar la misma banda en torno a la misma estimación puntual mientras uno de ellos se apoya en aproximadamente la mitad de la evidencia. Si tratas los dos 165 como igualmente firmes, habrás leído el intervalo como una corrección por tamaño de muestra que no es.

La asimetría tiene una consecuencia práctica en cuanto a los tiempos. Epoch reajusta todo el modelo de forma conjunta con todos los datos cada vez que llegan nuevas evaluaciones, por lo que la cifra de un modelo puede moverse sin que cambie nada en ese modelo. El modelo que tiene 11 observaciones tiene más margen de movimiento que el que tiene 20, lo que hace que Claude Sonnet 5.5 sea el más probable de los dos en cambiar en la próxima revisión, en cualquiera de las dos direcciones.

El propio encuadre de Epoch sobre la lectura actual es más limitado que los titulares que generó. El resumen que hace la organización de la actualización abre con Claude Opus 5.5 ocupando el primer puesto con 167, por delante de GPT-6 Astra por un margen estrecho, y dedica la segunda frase al hecho de que Claude Sonnet 5.5 ha «igualado aproximadamente» a Claude Fable 5.1 con 165. «Aproximadamente igualado» es la frase clave, y los intervalos publicados son la razón de que sea la correcta.

Donde realmente divergen los dos perfiles

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Estar al mismo nivel en el compuesto no significa estar al mismo nivel en las partes. Epoch publica un panel por benchmark en cada página de modelo, y seis benchmarks aparecen tanto en la página de Claude Sonnet 5.5 como en la de Claude Fable 5.1, lo que los convierte en los únicos seis para los que hay una comparación en igualdad de condiciones disponible desde el propio índice.

• Rompecabezas de juegos de misterio — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%

• FrontierMath Niveles 1–3 (v2) — Claude Sonnet 5.5 89% vs. Claude Fable 5.1 90%

• FrontierMath Nivel 4 (v2) — Claude Sonnet 5.5 80% vs Claude Fable 5.1 88%

• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% vs. Claude Fable 5.1 100%

• Referencia de montaje de muebles — Claude Sonnet 5.5 75% vs Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% frente a Claude Fable 5.1 71%

Cuatro puntos de margen en cualquier dirección sobre un índice compuesto tan reñido, y la división subyacente no es ni de lejos simétrica. Claude Sonnet 5.5 va por delante donde el trabajo es de tipo juego y multimodal —resolución de puzles, ensamblaje físico— y está igualado en matemáticas de competición. Claude Fable 5.1 va por delante por 8 puntos en el nivel más difícil de FrontierMath y por 24 puntos en SimpleQA Verified, el conjunto de conocimiento del mundo donde una puntuación del 47% frente al 71% es la mayor brecha individual en el panel compartido. Un comprador que elige entre estos dos modelos no está eligiendo entre dos lecturas de la misma capacidad; está eligiendo entre un modelo más barato que es más fuerte en algunos trabajos y uno más caro que es más fuerte en otros trabajos, con un índice de capacidad general que se niega a separarlos.

El índice de Epoch también dice explícitamente que un liderazgo en un benchmark concreto no tiene por qué reflejarse en el compuesto. Los benchmarks no se ponderan por precisión, y un modelo que se especializa puede obtener una puntuación inferior a la de un rival con una configuración distinta incluso mientras lidera pruebas individuales; su documentación lo dice directamente. Eso no es un defecto que se esté excusando; es precisamente para lo que sirve un compuesto de cincuenta y tantas pruebas.

Los dos instrumentos independientes apuntan en direcciones opuestas.

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

Circula una segunda medición independiente, y no coincide con la primera sobre cuál de estos dos modelos va por delante. En el Artificial Analysis Intelligence Index, las cifras que nuestro propio catálogo recoge para los dos modelos son 56 para Claude Sonnet 5.5 y 53.4 para Claude Fable 5.1, extraídas de la misma revisión de ese índice y, por tanto, correspondientes a la misma muestra de modelos evaluados. Tres puntos de diferencia, a favor del modelo más barato, mientras que Epoch los lee como idénticos.

Ninguna de las dos lecturas es errónea, y la forma de utilizarlas es fijarse en aquello en lo que discrepan. Los dos índices abarcan conjuntos de referencia distintos y les asignan pesos diferentes; el compuesto de Epoch está diseñado para sobrevivir a la saturación de los benchmarks, mientras que el índice de Artificial Analysis es un agregado directo de un conjunto diferente. Cuando un par de modelos están tan igualados, la elección del instrumento importa más que la diferencia que se mide. Un lector que quiera saber cuál de dos cifras adyacentes es la más alta debería mirar el panel de benchmarks individuales compartidos que aparece arriba, en lugar de cualquiera de los dos titulares, porque ese es el único lugar donde los dos modelos se comparan entre sí en la misma prueba.

Hay una pieza más de contexto que el compuesto no incluye, y Epoch sí: la fecha de lanzamiento. Claude Fable 5.1 ocupa el cuarto puesto de los 253 modelos seguidos hoy. En el momento de su propio lanzamiento, el 1 de septiembre de 2026, ocupaba el primer puesto de los 247 modelos que se seguían entonces. Sus pesos no han cambiado. La frontera simplemente lo superó seis puestos en un mes, que es la forma de toda la tabla y la razón por la que una lectura mensual del índice es una instantánea y no un veredicto.

Lo que cuesta la diferencia, y dónde está el lado barato.

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Que estén a la par en capacidad general y separados por un factor de 2,5 en la entrada y de 5 en la salida es todo el contenido práctico de esta lectura. Ambos modelos se ofrecen en nuestro propio catálogo — anthropic/claude-sonnet-5.5a $2,00 por millón de tokens de entrada y $10,00 por millón de salida, con lecturas de caché a $0,20, y anthropic/claude-fable-5.1 a $10,00 y $50,00 con lecturas de caché a $0,25 — y ambos se repercuten al precio de lista del propio proveedor sin ningún margen añadido, de modo que cualquier cambio de tarifa del proveedor llega a nuestro lado el mismo día que llega al suyo.

La recurrencia importa más que el titular. Tomemos una carga de trabajo que envía un prefijo de 120.000 tokens desde la caché y genera 8.000 tokens de salida, ejecutada una vez al día durante un mes. En Claude Sonnet 5.5, ese prefijo cuesta 120.000 tokens a $0,20 por millón, unos 2,4 centavos, más 8.000 a $10 por millón, 8 centavos — aproximadamente 10,4 centavos por ejecución, o unos $3,12 en treinta días. En Claude Fable 5.1, el mismo prefijo es 120.000 a $0,25, 3 centavos, más 8.000 a $50, 40 centavos — unos 43 centavos por ejecución, o $12,90 a lo largo del mes. Ambos modelos ofrecen la misma ventana de 1M de tokens con hasta 128K de salida, así que la diferencia está en la tarjeta, no en el techo.

Frente a eso, los seis benchmarks compartidos indican en qué dirección el dinero extra compra algo. Un equipo cuyo trabajo se parece a FrontierMath Tier 4 o a la recuperación factual abierta está comprando una diferencia real de 8 a 24 puntos en esas pruebas al pagar cuatro veces más; un equipo cuyo trabajo se parece a la resolución de acertijos o al ensamblaje multimodal está comprando de 5 a 7 puntos en la dirección contraria mientras paga la cifra menor. En una sola plataforma, estas no son dos decisiones de adquisición. Ambos modelos están detrás de una única clave de API entre más de 200 modelos, así que compararlos con tu propio tráfico es un cambio de configuración y no un segundo contrato, y donde ambos están enrutados, por debajo opera la conmutación automática por error, lo cual importa cuando dos instrumentos independientes no coinciden sobre cuál va por delante.

¿Qué movería esta lectura?

Tres cosas lo cambiarían, y solo una de ellas involucra a cualquiera de los dos modelos.

El primero son más evaluaciones de benchmark. Claude Sonnet 5.5 entró en el índice hace cuatro días con 11 a sus espaldas; cada evaluación adicional estrecha su intervalo y puede desplazar su estimación puntual, y un reajuste conjunto implica que el movimiento no se limita a la nueva fila.

El segundo es la llegada de otro modelo de frontera. Las cuatro primeras filas abarcan cuatro puntos, con dos empates dentro de ese intervalo, así que un único recién llegado bien evaluado cae dentro del grupo en lugar de por debajo de él — y los intervalos publicados, que se solapan entre los cuatro, hacen que el orden entre ellos sea un desempate más que una medición.

El tercero es el precio de los propios modelos, que ningún índice rastrea. La brecha en la que se centra este artículo es una brecha de tarifas: $2 y $10 frente a $10 y $50 hoy. Un cambio en cualquiera de las dos tarjetas de tarifas mueve la decisión sin mover una sola puntuación de capacidad.

El resumen defendible es el más acotado. En el compuesto de Epoch AI, en un archivo actualizado el 1 de octubre de 2026, Claude Sonnet 5.5 y Claude Fable 5.1 tienen el mismo número — 165, empatados en tercer lugar, con intervalos publicados idénticos que se sustentan en cantidades diferentes de evidencia. En el instrumento separado de Artificial Analysis, los mismos dos modelos se llevan tres puntos. En los seis benchmarks donde el índice los compara directamente, intercambian el liderazgo por dominio en lugar de estar igualados. Y en la tabla de tarifas no están ni cerca. Lo único que esta lectura no respaldará es la frase por la que es más probable que se la cite: que los modelos son equivalentes.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario