Une carte de titre générée intitulée « niveau à 165 », avec le sous-titre « Epoch Capabilities Index, fichier du 1er octobre 2026 », trois cartes de statistiques affichant 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) et 11 vs 20 (évaluations de benchmark derrière chaque chiffre), et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Claude Sonnet 5.5 à égalité avec Claude Fable 5.1 sur l'Epoch Capabilities Index

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Une égalité en tête d'un classement est généralement l'élément le moins intéressant de ce classement. Celle-ci fait exception, car les deux modèles à égalité en tête ne coûtent pas le même prix. Dans le fichier de l'Epoch Capabilities Index mis à jour le 1er octobre 2026, Claude Sonnet 5.5 et Claude Fable 5.1 affichent tous deux 165 — lignes trois et quatre sur 253 modèles suivis — à deux points derrière Claude Opus 5.5 et GPT-6 Astra, eux-mêmes à égalité à 167, et à deux points devant Claude Opus 5 à 163. Claude Sonnet 5.5 est sorti le 28 septembre 2026 à 2 $ par million de jetons d'entrée et 10 $ par million de jetons de sortie. Claude Fable 5.1 est sorti le 1er septembre à 10 $ et 50 $. Un seul chiffre dit que les deux sont interchangeables en capacités générales. Un prix de sortie cinq fois plus élevé dit qu'ils ne le sont pas. Les deux tiennent bon, et la raison pour laquelle ils tiennent bon ensemble est la partie du tableau que personne ne cite.

Ce qu'est réellement l'indice, et qui effectue la mesure

L'ECI n'est pas un tableau de scores de fournisseurs. Il est construit par Epoch AI, une organisation de recherche indépendante, sous la forme d'un composite qui assemble les scores de plus de cinquante benchmarks distincts en une seule échelle de capacité générale, en déduisant la difficulté relative de chaque benchmark à partir des modèles qui se trouvent apparaître sur plusieurs d'entre eux à la fois. La méthodologie est exposée dans un article, « A Rosetta Stone for AI Benchmarks », financé par Google DeepMind et rédigé avec des chercheurs de son équipe AGI Safety & Alignment — mais Epoch déclare clairement que l'indice est son propre produit et qu'il en détient tous les droits, et le code d'ajustement est public. Cette distinction compte lorsque le financeur de la recherche et le diffuseur du score ne sont pas la même entité.

Deux propriétés de l’échelle déterminent la manière dont un nombre peut y être lu. La première est que l’ECI est ancré plutôt qu’absolu : les valeurs brutes sont remises à l’échelle afin que Claude 3.5 Sonnet se situe à 130 et GPT-5 à 150, ce qui signifie qu’un chiffre n’a de sens qu’à côté d’un autre chiffre provenant du même fichier. La seconde est qu’il n’y a pas de plafond. Il n’y a pas de 100 à approcher, donc « sommet de l’indice » est une affirmation sur une date plutôt que sur une limite que quiconque aurait atteinte.

La troisième propriété est celle qui transforme une égalité en histoire. Les intervalles publiés à côté de chaque score — des intervalles bootstrap à 90 %, construits en rééchantillonnant cinq cents fois les résultats de benchmark observés de chaque modèle — sont identiques pour les deux modèles à 165 : 162 à 169 pour Claude Sonnet 5.5 et 162 à 169 pour Claude Fable 5.1. Les effectifs qui les ont produits ne le sont pas. Le 165 de Claude Sonnet 5.5 est estimé à partir de 11 évaluations de benchmark. Celui de Claude Fable 5.1 est estimé à partir de 20.

Pourquoi le même intervalle ne signifie pas la même preuve

L'ECI nécessite un minimum de quatre évaluations de référence avant qu'un modèle ne soit du tout évalué, de sorte que les deux chiffres dépassent confortablement le seuil. Mais l'intervalle est une indication de la dispersion des résultats d'un modèle, et non de leur nombre — c'est pourquoi deux modèles peuvent afficher la même bande autour de la même estimation ponctuelle alors que l'un d'eux repose sur environ la moitié des preuves. Considérez les deux 165 comme également solides et vous avez interprété l'intervalle comme une correction de taille d'échantillon qu'il n'est pas.

L’asymétrie a une conséquence pratique pour le calendrier. Epoch reconstruit l’ensemble du modèle conjointement sur toutes les données chaque fois que de nouvelles évaluations arrivent, de sorte que le chiffre d’un modèle peut évoluer sans que rien ne change pour ce modèle. Le modèle disposant de 11 observations a plus de latitude pour évoluer que celui qui en compte 20, ce qui fait de Claude Sonnet 5.5 le plus susceptible des deux à changer lors de la prochaine révision — dans un sens comme dans l’autre.

La présentation que fait Epoch de la lecture actuelle est plus étroite que les gros titres qu'elle a suscités. Le résumé de la mise à jour par l'organisation commence par Claude Opus 5.5 qui s'empare de la première place avec 167, juste devant GPT-6 Astra, et consacre sa deuxième phrase au fait que Claude Sonnet 5.5 a « pratiquement égalé » Claude Fable 5.1 à 165. « Pratiquement égalé » est l'expression qui compte, et les intervalles publiés sont la raison pour laquelle c'est la bonne.

Là où les deux profils divergent réellement

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Le niveau du composite ne signifie pas le niveau des parties. Epoch publie un panneau par benchmark sur la page de chaque modèle, et six benchmarks figurent à la fois sur la page Claude Sonnet 5.5 et sur la page Claude Fable 5.1 — ce qui en fait les seuls six pour lesquels une comparaison à périmètre égal est disponible à partir de l’index lui-même.

• Énigmes de jeu de mystère — Claude Sonnet 5.5 65 % vs Claude Fable 5.1 58 %

• FrontierMath Niveaux 1–3 (v2) — Claude Sonnet 5.5 89 % vs Claude Fable 5.1 90 %

• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80 % contre Claude Fable 5.1 88 %

• AIME blanc OTIS 2024–2025 — Claude Sonnet 5.5 100 % vs Claude Fable 5.1 100 %

• Benchmark d'assemblage de meubles — Claude Sonnet 5.5 75 % vs Claude Fable 5.1 70 %

• SimpleQA Verified — Claude Sonnet 5.5 47 % contre Claude Fable 5.1 71 %

Quatre points de variation dans un sens ou dans l’autre sur un composite aussi serré, et la répartition sous-jacente est loin d’être symétrique. Claude Sonnet 5.5 est en tête là où le travail ressemble à un jeu et est multimodal — résolution de puzzles, assemblage physique — et à égalité en mathématiques de compétition. Claude Fable 5.1 est en avance de 8 points sur le niveau le plus difficile de FrontierMath et de 24 points sur SimpleQA Verified, l’ensemble de connaissances mondiales où un score de 47 % contre 71 % constitue le plus grand écart unique du panel partagé. Un acheteur qui choisit entre ces deux modèles ne choisit pas entre deux lectures d’une même capacité ; il choisit entre un modèle moins cher, plus performant sur certains travaux, et un modèle plus cher, plus performant sur d’autres, avec un indice de capacité générale qui refuse de les départager.

L'indice d'Epoch dit aussi explicitement qu'une avance sur un benchmark individuel n'a pas forcément à apparaître dans le composite. Les benchmarks ne sont pas pondérés en fonction de la précision, et un modèle spécialisé peut obtenir un score inférieur à celui d'un rival au profil différent, même s'il domine des tests individuels — sa documentation le dit directement. Ce n'est pas un défaut que l'on excuse ; c'est précisément la raison d'être d'un composite portant sur une cinquantaine de tests.

Les deux instruments indépendants pointent en sens opposés.

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

Il existe une seconde mesure indépendante en circulation, et elle ne s’accorde pas avec la première quant à savoir lequel de ces deux modèles est en tête. Dans l’Artificial Analysis Intelligence Index, les chiffres que notre propre catalogue indique pour les deux modèles sont 56 pour Claude Sonnet 5.5 et 53,4 pour Claude Fable 5.1, tirés de la même révision de cet indice et portant donc le même échantillon de modèles évalués. Trois points d’écart, en faveur du modèle le moins cher — alors qu’Epoch les considère comme identiques.

Aucune des deux lectures n'est fausse, et la façon de les utiliser consiste à remarquer ce sur quoi elles ne sont pas d'accord. Les deux indices couvrent des ensembles de benchmarks différents et les pondèrent différemment ; le composite Epoch est conçu pour résister à la saturation des benchmarks, tandis que l'indice Artificial Analysis est un simple agrégat d'un panier différent. Quand deux modèles sont aussi proches, le choix de l'instrument vaut plus que l'écart mesuré. Un lecteur qui veut le plus fort de deux chiffres adjacents devrait regarder le panneau des benchmarks individuels partagés ci-dessus plutôt que l'un ou l'autre des titres, car c'est le seul endroit où les deux modèles sont comparés l'un à l'autre sur le même test.

Il manque encore un élément de contexte que le composite ne porte pas, et qu’Epoch porte : la date de publication. Claude Fable 5.1 se classe aujourd’hui quatrième sur 253 modèles suivis. Au moment de sa propre sortie, le 1er septembre 2026, il se classait premier sur les 247 modèles alors suivis. Ses poids n’ont pas changé. La frontière l’a simplement dépassé de six places en l’espace d’un mois — ce qui donne sa forme à tout le tableau, et explique pourquoi une lecture mensuelle de l’indice est un instantané plutôt qu’un verdict.

Ce que coûte la différence, et où se situe le côté le moins cher

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Un niveau équivalent en capacités générales, un écart de 2,5 fois en entrée et de 5 fois en sortie : voilà tout le contenu pratique de cette lecture. Les deux modèles figurent dans notre propre catalogue — anthropic/claude-sonnet-5.5 à 2,00 $ par million en entrée et 10,00 $ par million en sortie, avec des lectures de cache à 0,20 $, et anthropic/claude-fable-5.1 à 10,00 $ et 50,00 $ avec des lectures de cache à 0,25 $ — et les deux sont répercutés au prix catalogue du fournisseur, sans marge ajoutée, de sorte qu'un changement de tarif du fournisseur arrive chez nous le jour même où il arrive chez eux.

La récurrence importe plus que le chiffre marquant. Prenez une charge de travail qui envoie un préfixe de 120 000 tokens depuis le cache et génère 8 000 tokens de sortie, exécutée une fois par jour pendant un mois. Sur Claude Sonnet 5.5, ce préfixe coûte 120 000 tokens à 0,20 $ par million, soit environ 2,4 cents, plus 8 000 à 10 $ par million, 8 cents — environ 10,4 cents par exécution, soit environ 3,12 $ sur trente jours. Sur Claude Fable 5.1, le même préfixe revient à 120 000 à 0,25 $, soit 3 cents, plus 8 000 à 50 $, 40 cents — environ 43 cents par exécution, soit 12,90 $ sur le mois. Les deux modèles offrent la même fenêtre de 1 M de tokens avec jusqu'à 128 K de sortie, donc la différence tient à la grille tarifaire, pas au plafond.

Face à cela, les six benchmarks partagés indiquent dans quel sens l'argent supplémentaire achète quelque chose. Une équipe dont le travail ressemble à FrontierMath Tier 4 ou à du rappel factuel ouvert achète un écart réel de 8 à 24 points sur ces tests en payant quatre fois plus ; une équipe dont le travail ressemble à de la résolution d'énigmes ou à de l'assemblage multimodal achète 5 à 7 points dans l'autre sens tout en payant le montant le plus faible. Sur une seule plateforme, il ne s'agit pas de deux décisions d'approvisionnement. Les deux modèles se trouvent derrière une clé API parmi plus de 200 modèles, donc les comparer sur votre propre trafic relève d'un changement de configuration plutôt que d'un second contrat, et là où les deux sont routés, un basculement automatique se trouve en dessous — ce qui compte quand deux instruments indépendants ne sont pas d'accord sur lequel est en tête.

Qu'est-ce qui ferait bouger cette lecture ?

Trois choses le changeraient, et une seule d’entre elles implique l’un ou l’autre modèle.

Le premier point, ce sont davantage d’évaluations de benchmark. Claude Sonnet 5.5 est entré dans l’index il y a quatre jours avec 11 évaluations derrière lui ; chaque évaluation supplémentaire réduit son intervalle et peut déplacer son estimation ponctuelle, et un réajustement conjoint signifie que ce déplacement ne se limite pas à la nouvelle ligne.

Le second est l'arrivée d'un autre modèle de frontière. Les quatre premières lignes s'étendent sur quatre points, avec deux égalités à l'intérieur de cet intervalle, si bien qu'un seul nouveau venu bien évalué se place à l'intérieur du groupe plutôt qu'en dessous — et les intervalles publiés, qui se chevauchent pour les quatre, signifient que l'ordre entre eux relève d'un départage plutôt que d'une mesure.

Le troisième est le prix des modèles eux-mêmes, qu’aucun indice ne suit. L’écart sur lequel repose cet article est un écart de grille tarifaire : 2 $ et 10 $ contre 10 $ et 50 $ aujourd’hui. Une modification de l’une ou l’autre grille tarifaire fait basculer la décision sans changer un seul score de capacité.

Le résumé défendable est le plus restreint. Dans le composite d'Epoch AI, dans un fichier mis à jour le 1er octobre 2026, Claude Sonnet 5.5 et Claude Fable 5.1 affichent le même nombre — 165 —, à égalité à la troisième place, avec des intervalles publiés identiques reposant sur des quantités de preuves différentes. Sur l'instrument distinct d'Artificial Analysis, les deux mêmes modèles sont séparés de trois points. Sur les six benchmarks où l'indice les compare directement, ils alternent la tête selon le domaine plutôt que d'être à égalité. Et sur la grille tarifaire, ils ne sont pas proches du tout. La seule chose que cette lecture ne peut pas étayer est la phrase pour laquelle elle est le plus susceptible d'être citée : que les modèles sont équivalents.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement