Carte de titre générée pour un article sur l'Epoch Capabilities Index, avec le titre « Claude Opus 5.5 en tête de l'Epoch Capabilities Index » au-dessus d'une ligne monospace bleu clair indiquant « 167.35 vs 166.51 » et d'un sous-titre gris indiquant « Deux premiers sur un composite de plus de 50 benchmarks », avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Claude Opus 5.5 arrive en tête de l'Epoch Capabilities Index avec 0,84 point d'avance

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le nombre est 0,84. Claude Opus 5.5se situe à 167,35 sur l'Epoch Capabilities Index, à la date du fichier que nous avons lu le 2 octobre 2026, avec GPT-6 Astraà 166,51 — soit un écart de moins d'un point sur une échelle où les intervalles de confiance à 95 % publiés pour les deux modèles se recouvrent presque entièrement, de 164,0 à 172,0 pour Opus 5.5 contre 163,14 à 171,05 pour Astra. En dessous d'eux, Claude Sonnet 5.5a affiché 165,2 et Claude Fable 5.1164,82, de sorte que les quatre premières entrées d'un composite indépendant de plus de cinquante benchmarks sont séparées par 2,53 points et que trois d'entre elles portent le nom du même fournisseur. Ce classement est réel en ce sens que les estimations ponctuelles sont ordonnées. Il ne l'est pas en ce sens qu'une avance de 0,84 point survive à ses propres barres d'erreur, et tout ce qui vaut la peine d'être dit au sujet de ce classement découle du fait de tenir ces deux constats à la fois.

Ce qu’est l’indice, et ce que 0,84 point n’est pas

The Epoch Capabilities Index n'est pas un classement des fournisseurs. Il est construit par Epoch AI, une organisation de recherche indépendante, sous la forme d'un composite qui assemble les scores de plus de cinquante benchmarks distincts en une seule échelle de capacités générales, en déduisant la difficulté relative de chaque benchmark à partir des modèles qui se trouvent apparaître sur plusieurs d'entre eux à la fois. La méthodologie est exposée dans un article rédigé avec des chercheurs de l'équipe AGI Safety & Alignment de Google DeepMind et financé par DeepMind, mais Epoch déclare clairement que l'indice est son propre produit et qu'elle en détient tous les droits — une distinction qu'il convient de garder lorsque la source de financement et l'entité qui publie un score ne sont pas les mêmes. Le code est public.

Deux propriétés de l’échelle importent plus que le titre. La première est que l’ECI est délibérément ancré plutôt qu’absolu : les scores bruts sont remis à l’échelle pour que Claude 3.5 Sonnet se situe à 130 et GPT-5 à 150, ce qui signifie qu’un nombre sur cet indice n’a de sens qu’à côté d’un autre nombre issu du même fichier, jamais isolément. La seconde est que l’indice n’a pas de plafond. Il n’y a pas de 100 à approcher, donc « sommet de l’indice » est une affirmation sur une date, pas sur une limite que quiconque aurait atteinte.

C'est pourquoi la lecture honnête de 167,35 contre 166,51 n'est pas « Claude Opus 5.5 est le modèle le plus capable du monde ». Elle est plus étroite et moins citable : selon la modélisation d'Epoch des données disponibles au 2 octobre 2026, les deux modèles sont indiscernables au sommet, et leur classement relatif relève d'un départage plutôt que d'une mesure. Les intervalles publiés le disent directement — 164,0 à 172,0 et 163,14 à 171,05 partagent la grande majorité de leur étendue. Quiconque cite le 0,84 comme un verdict cite un artefact d'arrondi.

Le bloc Anthropic, et la taille d'une version

L'élément le plus instructif du tableau n'est pas qui est premier. Ce sont les troisième et quatrième lignes. Claude Sonnet 5.5, publié le 28 septembre et obtenant un score de 165,2, se place 0,38 point au-dessus de Claude Fable 5.1, publié le 1er septembre avec 164,82 — assez proches pour que les deux occupent en pratique la même position, et assez proches pour que le duo ne se situe qu'à 2,15 points du sommet du classement. Sonnet est le produit de milieu de gamme de la gamme d'Anthropic et Fable est le modèle que l'entreprise a historiquement orienté vers les travaux de raisonnement général ; que tous deux encadrent désormais la frontière par le bas constitue le changement substantiel de cette actualisation, davantage que l'identité du leader.

Le propre saut générationnel d'Anthropic est lui aussi visible. Claude Opus 5.5 succède à Claude Opus 5, qu'Epoch évalue à 162,94, avec un intervalle de 160,2 à 166,7. Soit une amélioration de 4,41 points en environ deux mois, d'une sortie le 24 juillet à une sortie le 22 septembre — un mouvement plus ample que les 0,84 point qui séparent les première et deuxième places actuelles. Lu ainsi, la quantité intéressante dans ce tableau est la pente à l'intérieur de la courbe d'un même fournisseur, et non l'écart entre deux fournisseurs au sommet.

Où se situe la frontière des poids ouverts

Epoch classe les modèles selon leur accessibilité, ce qui rend la frontière des poids ouverts lisible sans avoir à deviner. La meilleure entrée en poids ouverts est Kimi K3 à 157,61, datée du 16 juillet et étiquetée non commerciale. Derrière elle se trouvent DeepSeek V4 Pro 0813 à 155,38 et DeepSeek V4.1 Flash à 155,0, tous deux sans restriction, puis GLM-5.3-Flash à 151,94 et GLM-5.2 à 151,78. Le modèle ouvert le plus proche du sommet accuse donc un retard de 9,74 points — un écart dix-huit fois plus large que celui entre la première et la deuxième place, et suffisamment large pour que les intervalles soient loin de se toucher.

Cette asymétrie est la seule conclusion durable du tableau. La frontière fermée est une mêlée dans un intervalle de trois points ; la distance entre la frontière fermée et les meilleurs poids téléchargeables est d'un ordre de grandeur plus grande. Un indice composite qui permet de comparer entre générations de benchmarks est exactement l'outil pour remarquer cela, parce qu'il peut dire la même chose en juillet et en septembre au lieu de signaler qu'un benchmark saturant s'est tu.

Certaines des lignes voisines méritent d'être épinglées pour le contexte, car ce sont les modèles que les lecteurs comparent réellement à Opus 5.5 :

• Claude Sonnet 5 — 156,34, sorti le 30 juin, intervalle de 153,61 à 158,81

• Grok 4.6 — 156,61, publié le 12 août, intervalle de 154,66 à 158,93

• Gemini 3.8 Flash — 156,93, sorti le 2 septembre, intervalle de 154,64 à 160,42

• Muse Spark 1.3 — 156,86, publié le 2 septembre, intervalle de 154,73 à 159,56

• GPT-5.6 Sol — 161,8, sorti le 9 juillet, intervalle de 159,26 à 165,26

Une position d'indice n'est pas une facture

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

Ici, le classement ne raconte plus toute l'histoire, car les deux modèles en tête ne coûtent absolument pas la même chose. Dans notre propre catalogue, qui propose les deux au prix catalogue du fournisseur, sans marge, Claude Opus 5.5 à 4,00 $/20,00 $ avec des lectures de cache à 0,20 $ et GPT-6 Astra à 10,00 $/50,00 $ avec des lectures de cache à 1,00 $ sont séparés d'un facteur 2,5 dans les deux sens de la grille tarifaire. Astra passe aussi à un palier supérieur au-delà de 272 000 tokens de prompt, où l'entrée passe à 20,00 $ et la sortie à 75,00 $ ; Opus 5.5 maintient un tarif constant de 4,00 $/20,00 $ sur toute sa fenêtre de 1 M de tokens. Les deux prennent en charge 128 000 tokens de sortie.

Faites le calcul qu’entraîne réellement une charge de travail à contexte long — un préfixe de 180 000 tokens servi depuis le cache, 5 000 tokens générés. Sur Opus 5.5, cela fait 180 000 tokens à 0,20 $ par million, soit environ 3,6 cents, plus 5 000 à 20 $ par million, soit 10 cents : environ 13,6 cents. Sur GPT-6 Astra, cela fait 180 000 à 1,00 $, soit 18 cents, plus 5 000 à 50 $, soit 25 cents : environ 43 cents. Un avantage de 0,84 point et un écart de coût de 3,2 fois ne sont pas des faits de même nature, et une décision d’approvisionnement qui ne pèse que le premier a pesé le plus petit nombre.

Fable 5.1 illustre le même argument par l'autre versant de la grille tarifaire du même fournisseur : à 10,00 $/50,00 $, son prix est exactement celui d'Astra, et il obtient un score de 164,82 — soit 2,53 points de moins qu'Opus 5.5 pour le même montant. L'indice place les trois entrées frontières d'Anthropic à 2,53 points les unes des autres, tandis que sa grille tarifaire les sépare d'un facteur 2,5, ce qui décrit bien mieux le choix qui s'offre à un acheteur que ne le ferait n'importe quel classement pris isolément.

Si vous comptez débattre d’un chiffre, faites-le sur votre propre trafic.

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

Si cet indice vaut la peine d’être lu, c’est parce qu’il est mesuré par quelqu’un d’autre que les fournisseurs — mais la structure même de l’indice composite fixe les termes du débat. La calibration d’Epoch, ses estimations de difficulté et sa gestion des modèles qui font l’impasse sur des benchmarks se situent tous en amont du chiffre figurant dans le tableau, et aucun de ces éléments ne peut être reconstitué par un lecteur à partir d’une capture d’écran. Il en va de même pour le benchmark phare de chaque fournisseur, et c’est pourquoi la démarche utile n’est pas de prendre parti entre eux, mais de les comparer sur du trafic que vous contrôlez.

Ces deux modèles sont accessibles à partir d'une seule clé API sur OrcaRouter, qui répercute le prix catalogue des fournisseurs avec 0 % de marge : Claude Opus 5.5 à 4,00 $/20,00 $ avec lectures de cache à 0,20 $ et GPT-6 Astra à 10,00 $/50,00 $, son palier au-delà de 272 K étant appliqué exactement comme le fournisseur le définit. Envoyer le même jeu d'invites aux deux relève d'un changement de configuration plutôt que d'un second contrat, et là où les deux sont routés, le basculement automatique se trouve en dessous, ce qui compte pour une décision aussi proche du plancher de bruit. Le classement peut vous dire que les deux modèles sont indiscernables. Seule votre propre évaluation peut vous dire lequel est indiscernable sur votre travail.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

Qu'est-ce qui ferait bouger ce chiffre le mois prochain ?

Le fichier d'Epoch est un document vivant, et trois choses en changeraient rapidement la lecture. La première est toute nouvelle évaluation d'un modèle de frontière qui se classe dans le top quatre, car une seule observation supplémentaire sur un benchmark fait davantage bouger un composite lorsque le groupe est aussi resserré que lorsqu'il existe un leader clair. La deuxième est la dérive des intervalles de confiance : les entrées les plus récentes portent les plus larges, parce qu'elles ont été évaluées sur le plus petit nombre de benchmarks communs, si bien que les versions de septembre sont les lignes les plus susceptibles de bouger et celles de juillet, les moins. La troisième est un benchmark qui atteint la saturation, soit précisément la défaillance que l'indice a été conçu pour surmonter : lorsqu'une composante cesse de discriminer, Epoch repondère la composition plutôt que de laisser l'avantage d'un modèle s'évaporer avec le test.

Pour l'instant, le résumé défendable est le plus étroit. Claude Opus 5.5 occupe la première place de l'Epoch Capabilities Index avec 167,35, grâce à une marge de 0,84 point que son propre intervalle de confiance ne soutient pas ; Claude Sonnet 5.5 est remonté à moins de 2,15 points de la tête depuis le milieu de gamme de la même lignée, et le camp des poids ouverts est à plus de neuf points derrière eux tous. Le leadership se joue à pile ou face entre deux fournisseurs. L'écart de prix de quatre points entre eux, non.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement