
Claude Opus 5.5 vs Claude Fable 5.1 : le modèle le moins cher a remporté l'indice indépendant
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Anthropic vend désormais deux modèles au sommet de sa gamme, et celui qui coûte deux fois et demie plus cher n'est pas celui qui trône en tête du tableau. Claude Opus 5.5, sorti le 22 septembre 2026 à 4 $ par million de tokens en entrée et 20 $ par million de tokens en sortie, obtient un score de 58 sur l'Artificial Analysis Intelligence Index. Claude Fable 5.1, qui détient la position phare depuis le 1er septembre à 10 $ en entrée et 50 $ en sortie, obtient 53. Les deux chiffres proviennent du même évaluateur, tous deux ont été mesurés dans la même famille de configurations, et l'écart va dans le sens inverse des étiquettes de prix. C'est le fait dont cette comparaison doit partir, car presque tous les articles de lancement de la semaine dernière présentent Opus 5.5 comme la version au rabais de Fable 5.1 — un modèle moins cher qui « égale » le modèle coûteux sur la plupart des tâches. Le chiffre indépendant dit que le modèle au rabais est devant.
Que cela doive changer ce que vous déployez est une autre question, et la réponse dépend moins de l’écart de cinq points que de deux réglages que personne ne met dans un titre : le niveau d’effort par défaut de chaque modèle, et lequel peut être rendu rapide.
Les nombres indépendants, et l'unique chose qu'ils ont en commun

Artificial Analysis publie une configuration par modèle et, pour ces deux-ci, elle est intitulée « Raisonnement adaptatif, effort maximal, repli par défaut ». Même intitulé, même évaluateur, même exécution — ce qui en fait la comparaison directe la plus limpide que l’un ou l’autre de ces modèles ait connue :
• Indice d'intelligence — Claude Opus 5.5 58, classé n°1 sur 210 vs Claude Fable 5.1 53, classé n°4
• Vitesse de sortie — Claude Fable 5.1 : 65,8 tokens/sec, en dessous de la médiane du classement de 71,0, contre Claude Opus 5.5, pas encore publié au classement
• Temps jusqu'au premier token — Claude Fable 5.1 274,43 s contre une médiane du classement de 3,83 s ; Claude Opus 5.5 pas encore publié
• Verbosité sur l'Index — Claude Opus 5.5 a généré 260 M de jetons de sortie, contre une médiane de 88 M toutes catégories confondues
• Prix — Claude Opus 5.5 4,00 $ / 20,00 $ par million contre Claude Fable 5.1 10,00 $ / 50,00 $
Deux de ces lignes demandent à être lues plutôt que citées. La première est le libellé « Max Effort » : le score d'aucun des deux modèles ne reflète sa configuration par défaut livrée, et les deux réglages par défaut ne sont pas identiques — nous y reviendrons plus bas. La seconde est la ligne sur la verbosité, qui va à l'encontre de la façon dont Opus 5.5 a été vendu. Le discours d'Anthropic sur l'efficacité est que le modèle parvient à la même réponse avec moins de tokens, et les documents de lancement citent des partenaires qui rapportent un tiers à une moitié de tokens de sortie en moins. Dans l'Index, mesuré plutôt que cité, Opus 5.5 a émis 260 M de tokens contre une médiane du classement de 88 M — environ trois fois plus bavard que le modèle type auquel il est comparé. Les deux choses peuvent être vraies : il peut utiliser moins de tokens que Claude Opus 5 tout en restant un modèle verbeux en termes absolus. Mais si vous avez établi votre budget à partir de la promesse de « moins de tokens » et non de votre propre facture, c'est la mesure indépendante qu'il faut vérifier.
Ce que permettent d’acheter les 6 $ supplémentaires par million

Retirez les benchmarks, et la différence se résume à une grille tarifaire. Tout ce qui figure ici provient de la page de tarification publiée par Anthropic, vérifiable aujourd’hui :
• Entrée — 4,00 $ par million sur Opus 5.5 contre 10,00 $ sur Fable 5.1
• Sortie — 20,00 $ par million contre 50,00 $
• Lecture du cache — 0,20 $ par million sur Opus 5.5 contre 0,25 $ sur Fable 5.1
• Multiplicateur de cache — Opus 5.5 facture les lectures de cache à 0,05x l'entrée de base ; Fable 5.1 les facture à 0,025x, soit un meilleur multiplicateur sur une base plus élevée
• Écriture dans le cache — 5 $ par million pour une fenêtre de 5 minutes et 8 $ pour une heure sur Opus 5.5, contre 12,50 $ et 20 $ sur Fable 5.1
• Batch API — Opus 5.5 voit ses tarifs divisés par deux, à 2,00 $ / 10,00 $ ; Fable 5.1 voit ses tarifs divisés par deux, à 5,00 $ / 25,00 $
• Mode rapide — Opus 5.5 le prend en charge à 8,00 $ / 40,00 $ pour une vitesse de sortie jusqu'à environ 2,5 fois supérieure ; Fable 5.1 ne prend pas du tout en charge le mode rapide
La ligne de cache est celle qu'il faut regarder à deux fois, car les deux modèles inversent le schéma habituel. Fable 5.1 a le multiplicateur le plus agressif — 2,5 % de l'entrée de base contre 5 % pour Opus 5.5 —, mais comme sa base est de 10 $ plutôt que de 4 $, sa lecture de cache reste la plus chère des deux en dollars absolus. Il n'existe aucune configuration dans laquelle le modèle premium l'emporte sur un token de contexte mis en cache. Et le multiplicateur n'est pas transposable : une boucle d'agent réglée sur le comportement de mise en cache de Fable 5.1 paiera proportionnellement plus par accès au cache sur Opus 5.5, même si elle paie moins par token frais.
Le mode rapide est l'asymétrie la plus marquée. La documentation d'Anthropic répertorie le mode rapide pour Claude Opus 5.5, Claude Opus 5 et Claude Opus 4.8 — Fable 5.1 est absent de cette liste. Le modèle le moins cher dispose donc d'un levier de latence que le modèle le plus cher n'a tout simplement pas, à 8 $/40 $, ce qui reste en dessous du tarif de sortie standard de 10 $/50 $ de Fable 5.1. Si votre charge de travail est suffisamment interactive pour qu'un premier token lent constitue un problème produit, notez que le temps jusqu'au premier token mesuré de Fable 5.1 est de 274 secondes. Ce chiffre est un artefact du raisonnement à effort maximal, non un défaut, mais c'est le chiffre qu'un évaluateur a enregistré.
Les valeurs par défaut ne sont pas les mêmes, et c'est le piège
La propre documentation des modèles d'Anthropic place les deux modèles côte à côte, et la ligne qui détermine la plupart des comparaisons réelles n'est pas le prix. C'est le niveau d'effort par défaut : medium pour Claude Opus 5.5, high pour Claude Fable 5.1. Les deux exécutent une réflexion adaptative qui ne peut pas être désactivée ; la profondeur n'est contrôlée que par le paramètre d'effort, sur une échelle qui va de low, medium, high, xhigh à max.
C'est pourquoi le slogan de lancement « Opus 5.5 égale Fable 5.1 sur la plupart des tâches » et les tableaux de benchmarks qui l'accompagnent semblent se contredire. Les lignes de comparaison directe d'Anthropic pour Opus 5.5 sont souvent étiquetées avec un réglage d'effort supérieur à celui par défaut — le chiffre de 66,4 % à Terminal-Bench 4.0 contre 55,8 % pour Fable 5.1 a été obtenu avec un effort xhigh, et non medium. De son côté, les propres chiffres de Fable 5.1 ont été produits à son réglage par défaut plus élevé. Deux modèles comparés avec des réglages d'effort différents ne sont pas vraiment comparés, et Anthropic le reconnaît dans ses propres documents de lancement lorsqu'elle avertit que les écarts de benchmarks à ce niveau de capacité sont un indicateur moins fiable de la différence réelle que ne le suggèrent les scores.
Concrètement, cela transforme la décision en un exercice de réglage plutôt qu'en une sélection. Si vous passez de Fable 5.1 à Opus 5.5 et conservez votre réglage effort tel quel, vous avez modifié sans que cela se voie la quantité de réflexion que fournit le modèle, et tous les chiffres de qualité et de coût que vous produisez ensuite sont faussés. La recommandation d'Anthropic est de tester plusieurs niveaux d'effort plutôt que de reprendre les réglages de l'ancien modèle. C'est peu coûteux à faire et presque personne ne le fait, parce que cela implique d'exécuter ses propres évaluations deux fois.
Le seul endroit où cette association vaut vraiment la peine
Le schéma qui justifie de conserver les deux est la boucle avec conseiller : Opus 5.5 qui fait le travail, Fable 5.1 consulté sur les décisions difficiles. Anthropic l'a mesuré, et cela apporte effectivement de la précision — à un coût plus élevé et avec une latence plus élevée, ce qui est le compromis auquel on peut s'attendre quand on place le modèle le plus lent dans la boucle. Ce qui a changé, c'est l'arithmétique derrière tout cela. Quand l'écart de capacités était plus large, payer 10 $/50 $ pour superviser un travailleur à 5 $/25 $ valait manifestement le coup. Maintenant que le travailleur obtient un meilleur score que le conseiller sur l'indice indépendant, la contribution du conseiller se réduit aux tâches spécifiques où ses propres évaluations surpassent Opus 5.5, et ce sont des tâches que vous devez identifier vous-même. La boucle garde du sens pour un sous-ensemble difficile ; elle cesse d'en avoir comme configuration par défaut.
Les deux sont à une touche.
Le détail de migration qui prend les équipes au dépourvu ici n'est pas la surface d'API — c'est qu'il s'agit des modèles du même fournisseur, avec des échelles d'effort différentes, des multiplicateurs de cache différents et des paramètres par défaut différents, et les comparer honnêtement suppose d'exécuter les deux sur vos propres prompts à configuration identique. Claude Opus 5.5 est sur OrcaRouter au tarif d'Anthropic de 4,00 $ / 20,00 $, et Claude Fable 5.1 est sur OrcaRouter à 10,00 $ / 50,00 $ — prix catalogue du fournisseur répercuté avec 0 % de marge, donc les deux chiffres changent le jour où Anthropic les modifie, et aucun des deux n'implique un second contrat ni un second SDK.

C’est ce qui rend la séparation pratique plutôt que théorique. Envoyer l’essentiel de votre trafic vers Opus 5.5 et épingler une règle de routage qui fait remonter les cas véritablement difficiles vers Fable 5.1 est une configuration sur un seul point de terminaison, et non deux intégrations — et composer un appel pour qu’un modèle rédige pendant que l’autre vérifie est une ligne de routing-DSL plutôt qu’un pipeline que vous devez construire et maintenir. Si le chemin d’escalade s’avère inadapté à votre charge de travail, la bascule automatique fait en sorte que la requête atterrisse sur un modèle que vous avez déjà caractérisé au lieu d’échouer purement et simplement.
Qu'est-ce qui réglerait ça ?
L'état honnête de cette comparaison, c'est qu'Anthropic a publié un tableau où le modèle le moins cher l'emporte sur la plupart des lignes, Artificial Analysis en a publié un autre où il gagne purement et simplement, et les deux ont été exécutés avec des réglages d'effort que vous ne déployez pas. Aucun des deux n'est une comparaison directe contrôlée à paramètres par défaut identiques, et aucun tiers n'en a réalisé. L'écart qui subsiste malgré tout cela — à savoir que Claude Opus 5.5 est nettement moins cher sur chaque ligne de la grille tarifaire, prend en charge un mode rapide que Fable 5.1 n'a pas, et n'est pas en retard sur le seul score indépendant dont l'un ou l'autre modèle dispose — est suffisamment important pour que la charge de la preuve se soit déplacée. Si vous êtes sur Fable 5.1 par défaut, la question n'est plus de savoir si Opus 5.5 est suffisamment bon ; c'est de savoir quelles tâches précises de votre charge de travail échouent au niveau d'effort medium, car ce sont les seules pour lesquelles vous payez le supplément.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
