
Claude Opus 5.5 domine l'indice Coding Agent avec un score de 66 — et la facture des tâches grimpe de 21 %
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 180 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Le fournisseur a réduit les prix des jetons de Claude Opus 5.5 de 20 % le 22 septembre 2026. Deux jours plus tard, Artificial Analysis a publié la mesure de l'agent de codage qui montre l'effet de cette baisse sur la facture d'un agent : le coût par tâche a augmenté de 21 %, pour atteindre 13,04 $, contre les 10,79 $ que le même indice facture pour Claude Opus 5. Le score a lui aussi augmenté — 66 sur le Coding Agent Index, qu'Artificial Analysis décrit comme le plus élevé qu'il ait mesuré, six points devant Claude Opus 5 et quatre devant Claude Fable 5.1 dans la même configuration. Ces deux faits sont vrais en même temps, et la raison pour laquelle ils le sont en même temps, c'est toute l'histoire de ce classement. Un jeton moins cher qu'un modèle consomme davantage n'est pas une tâche moins chère, et à effort de raisonnement maximal sur de longues exécutions d'agent, Claude Opus 5.5 en consomme beaucoup plus.
Ce que le Coding Agent Index évalue réellement
Ceci n'est pas un classement de modèles. Chaque ligne de celui-ci est une paire harnais-modèle — un checkpoint exécuté dans un agent de codage spécifique, avec un réglage d'effort spécifique. La ligne que tout le monde cite est Claude Opus 5.5 à effort max dans Claude Code, qui est le harnais contre lequel Anthropic développe et ajuste. Le 60 de Claude Opus 5 et le 62 de Claude Fable 5.1 proviennent du même harnais et du même réglage d'effort, ce qui en fait les comparaisons honnêtes ; une ligne pour l'un ou l'autre modèle dans un agent de codage différent est une mesure différente et n'est pas imprimée ici comme s'il s'agissait de la même.
L'indice est versionné, et la version importe plus que le nom de marque qui y figure. Le classement actuellement publié sous v1.5 calcule la moyenne de trois évaluations, chacune pondérée à parts égales, chacune rapportée comme pass@1 moyenné sur trois tentatives par tâche :
• Terminal-Bench 4.0 — travail agentique en shell et en ligne de commande : naviguer dans un système de fichiers, utiliser correctement les outils, se remettre d'un échec intermédiaire et mener à bien un flux de travail en plusieurs étapes.
• DeepSWE v1.1 — tâches d'ingénierie logicielle, le travail d'édition de dépôt.
• SWE-Atlas-QnA — questions de compréhension de dépôt, où la réponse se trouve en lisant une base de code plutôt qu'en la modifiant.
Trois évaluations, un seul chiffre, et une colonne de coût par tâche imprimée juste à côté. C'est cette colonne de coût qui rend cet indice plus utile qu'un score isolé, et c'est aussi pourquoi le chiffre phare est plus difficile à lire qu'il n'y paraît.

Les trois composants, et d’où provenaient les six points
Artificial Analysis a publié les lignes de composants aux côtés du composite, et celles-ci n’évoluent pas de manière uniforme :
• Terminal-Bench 4.0 — 63,1 % pour Claude Opus 5.5 contre 54,5 % pour Claude Opus 5, soit un gain de 8,6 points. C'est la plus grande amélioration individuelle de l'ensemble.
• DeepSWE v1.1 — 68.4% contre 62.5%, en hausse de 5.9 points.
• SWE-Atlas-QnA — 66.4% contre 62.1%, en hausse de 4,3 points.
Faites la moyenne de ces trois et vous obtenez 66,0, qui correspond au score composite. Ce qui est intéressant, c’est la forme du gain : le modèle a le moins progressé dans la lecture d’une base de code et le plus progressé dans le pilotage d’un shell. Terminal-Bench est l’évaluation la plus proche de ce que les gens entendent réellement par « agent de codage » — une boucle de longue durée dans laquelle le modèle choisit des commandes, lit la sortie et décide quoi faire ensuite, sans intervention humaine dans la boucle entre les étapes. Un bond de 8,6 points à ce niveau témoigne d’une utilisation soutenue des outils, et non de la génération de code.
Notez ce que cela implique quant à l'endroit où l'amélioration est à prévoir. Si votre charge de travail est « expliquer ce dépôt », Claude Opus 5.5 est une amélioration modeste par rapport à Claude Opus 5 — quatre points. Si votre charge de travail est « exécuter jusqu'à ce que la suite de tests passe, en corrigeant ce qui casse », il s'agit du plus grand bond du tableau.

Le nombre imprimé à côté du classement : 13,04 $ par tâche
Voici l’arithmétique qui fait apparaître la baisse de prix différemment de la façon dont elle a été annoncée. Le prix catalogue d’Anthropic pour Claude Opus 5.5 est de 4,00 $ par million de tokens d’entrée et 20,00 $ par million de tokens de sortie, contre 5,00 $ et 25,00 $ pour Claude Opus 5, avec les lectures de cache en baisse de 60 % à 0,20 $ par million. Chacune de ces lignes est moins chère. L’estimation d’Artificial Analysis du coût d’une tâche à effort maximal est de toute façon plus élevée :
• Coût par tâche — 13,04 $ pour Claude Opus 5.5 contre 10,79 $ pour Claude Opus 5, soit une hausse de 21 % sur le même indice, avec le même harnais et le même réglage d'effort.
• Total de jetons par tâche — environ 15,6 M contre 11,4 M, en hausse d'environ 37 %.
• Jetons de sortie par tâche — environ 333 000 contre 137 000, soit plus du double. La sortie est la direction coûteuse, et c'est la ligne qui a le plus évolué.
• Entrée mise en cache par tâche — environ 14.6M contre 10.9M, en hausse d'environ 34%. La réduction de 60% des lectures de cache fait vraiment le travail ici ; elle ne suffit simplement pas à compenser une tâche qui lit un tiers de contexte en plus.
Faites le calcul avec les tarifs publiés et la répartition apparaît d'elle-même. Prenez uniquement les tokens de sortie : 333 000 tokens à 20,00 $ par million, cela fait environ 6,66 $ — soit environ la moitié de l'estimation totale de 13,04 $, pour une seule ligne qui a doublé. La ligne de lecture du cache est énorme en volume et presque gratuite en prix : 14,6 M de tokens à 0,20 $ par million, soit moins de 3 $. La réduction de 20 % est réelle et celle du cache est réelle ; à effort maximal dans une boucle d'agent, elles sont tout simplement contrebalancées par un modèle qui réfléchit plus longtemps et écrit davantage.
Cela a une conséquence directe sur la façon dont vous établissez votre budget. Si votre équipe exécute 500 tâches d'agent de codage par jour à effort maximal, la différence entre 10,79 $ et 13,04 $ est d'environ 1 125 $ par jour — environ 34 000 $ par mois — pour le même nombre de tâches. C'est le chiffre à mettre sous les yeux de la personne qui approuve le changement de modèle, et ce n'est pas le chiffre que laisse entendre la baisse de prix.
Pourquoi 5,98 $ et 13,04 $ sont tous les deux vrais
Artificial Analysis a publié, quelques jours plus tôt, un chiffre de coût par tâche différent pour le même modèle, et lire les deux ensemble sans les étiquettes les fait paraître comme une contradiction. Ce n'est pas le cas — ce sont deux évaluations différentes, et la différence est instructive.
Sur l'Intelligence Index, le compte rendu du 22 septembre a évalué le coût par tâche de Claude Opus 5.5 à 5,98 $, à peu près au même niveau que les 5,86 $ de Claude Opus 5, malgré environ 119 000 jetons de sortie par tâche contre 73 000 pour Opus 5. Là, la baisse de prix et les jetons supplémentaires s'annulent presque exactement. Sur le Coding Agent Index, à effort maximal, dans Claude Code, le même modèle coûte 13,04 $ contre 10,79 $.
Les deux sont des mesures honnêtes de charges de travail différentes. Une évaluation de questions-réponses est un bref échange ; une tâche d’agent est une longue boucle d’appels d’outils avec un contexte croissant, et cette croissance s’accumule dans la direction de la sortie, où le prix est le plus élevé. La leçon pratique est que « la réduction de prix compense-t-elle les tokens supplémentaires ? » n’a pas de réponse unique — cela dépend de la longueur de la tâche, et plus la tâche est longue et agentique, plus la compensation se dégrade. Si vous établissez votre budget à partir d’un benchmark de réponses courtes, vous sous-estimerez la facture d’un agent.
Trois mises en garde qui ont leur place sur la ligne
Le 66 est un score de Claude Code, pas celui d'un modèle brut. L'indice associe délibérément les modèles à des harnais, en partant du principe que le routage des outils, la logique de réessai et la gestion du contexte sont indissociables des performances mesurées d'un agent. Cela joue ici en faveur d'Anthropic, car le harnais dans lequel il est évalué est le sien. Artificial Analysis annonce pour bientôt une vue de comparaison des harnais ; tant qu'elle n'existe pas, personne ne peut dire quelle part des six points d'avance revient au checkpoint et quelle part revient à l'échafaudage qui l'entoure.
Le chiffre Terminal-Bench 4.0 propre à Anthropic est supérieur à celui de cette composante, et il a été obtenu par Anthropic. Le document de lancement rapporte 66,4 % à un effort xhigh ; la composante de l'indice Coding Agent est de 63,1 % au maximum, et le test indépendant distinct d'Artificial Analysis a mesuré 59,6 % dans son propre harnais sur la même version du benchmark. Trois chiffres, trois configurations, trois producteurs. Le 63,1 % de la ligne ci-dessus correspond à la composante propre à l'indice et ne doit être comparé qu'aux autres chiffres de cet indice ; le 66,4 % du fournisseur est déclaré par le fournisseur, non reproduit par un tiers, et relève d'un réglage d'effort différent.
La révision de l'indice évolue. Ce blog a rapporté différentes lignes du Coding Agent Index début septembre, sur une version antérieure du même tableau, et ces chiffres plus anciens ne sont pas comparables à la v1.5 — l'ensemble d'évaluation lui-même a changé lorsque Terminal-Bench 4.0 a remplacé la version précédente. Les miroirs tiers véhiculent encore des instantanés obsolètes avec des étiquettes de version plus anciennes. Si un chiffre pour Claude Opus 5.5 sur cet indice ne provient pas de la ligne v1.5 actuelle, ne le placez pas à côté d'un chiffre v1.5, et ne calculez pas d'écart entre les deux.

Ce qu’il faut réellement déployer
Ce classement est un chiffre obtenu à effort maximal, et l'effort maximal est le réglage que presque personne ne devrait utiliser par défaut. Claude Opus 5.5 propose cinq réglages d'effort — low, medium, high, xhigh et max — et le modèle est par défaut en medium. Artificial Analysis n'a pas publié de lignes du Coding Agent Index pour les réglages inférieurs, si bien que l'économie de coût correspondante n'est pas quantifiée dans cet indice ; sur l'Intelligence Index, le même modèle en medium a obtenu 51 — soit l'équivalent du max de Claude Opus 5 — à 1,34 $ par tâche. C'est dans cette direction que se trouvent les économies, et il s'agit d'un réglage, pas d'un modèle différent.
Le schéma réaliste est une répartition : réservez l'effort maximal aux longues boucles autonomes, là où le gain de 8,6 points sur Terminal-Bench est précisément ce que vous achetez, et exécutez le travail de routine à un effort moindre, là où le modèle reste nettement en avance sur le niveau auquel Claude Opus 5 s'est arrêté. Comme l'effort est un paramètre de requête plutôt qu'un déploiement, cette répartition est une règle de routage, et les deux modèles figurent dans le même catalogue —les prix catalogue d'Anthropic répercutés avec 0 % de marge, de sorte qu'une baisse de prix du fournisseur est effective sur anthropic/claude-opus-5.5 le jour même de son annonce, et aucun second contrat ni modification de code n'entre en jeu pour comparer les deux en A/B sur vos propres tâches. Pour le chemin à effort maximal en particulier, où une seule tâche peut être une longue exécution sans surveillance, le basculement automatique est ce qui empêche un fournisseur bloqué de vous coûter toute la boucle.
Qu’est-ce qui n’est toujours pas mesuré ?
Trois choses changeraient cette situation, et aucune n’existe encore. Il n’existe aucune comparaison à effort égal et à harnais égal de Claude Opus 5.5 face à un checkpoint rival — toutes les comparaisons entre fournisseurs disponibles se résument à deux tableaux de fournisseurs placés côte à côte. Il n’existe aucune exécution publiée du Coding Agent Index à effort moyen ou élevé, là où se situerait l’essentiel du trafic de production. Et la question de l’attribution au harnais — quelle part d’un 66 revient au modèle et quelle part revient à Claude Code — a été reconnue par l’index et reportée.
Ce sur quoi vous pouvez agir aujourd’hui est plus restreint et plus utile qu’un classement. Claude Opus 5.5 est véritablement meilleur pour le travail d’agent soutenu piloté par shell que Claude Opus 5 — c’est la seule composante à présenter un gain important, constant et obtenu de manière indépendante. Il coûte aussi plus cher par tâche au réglage où ce gain a été mesuré, d’environ 2,25 $ par tâche, et la réduction du prix par token n’atteint pas ce chiffre. Déployez-le à l’effort maximal là où la boucle est longue et le coût d’échec élevé ; conservez le réglage moins cher partout ailleurs ; et revérifiez l’indice lorsque les lignes à effort inférieur apparaîtront, car c’est la configuration que la plupart des équipes paieront réellement. Si vous changez uniquement pour la réduction de prix, vous achetez la mauvaise chose — le modèle est moins cher par token et plus cher par tâche, et un seul de ces deux chiffres apparaît sur votre facture.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
