
Claude Opus 5.5 vs GPT-5.6 Sol : deux tableaux de lancement qui se chevauchent à peine
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Mettez Claude Opus 5.5 et GPT-5.6 Sol côte à côte cette semaine et la première chose que vous remarquez n'est pas un gagnant. C'est que les deux fournisseurs ont publié des tableaux de benchmarks qui n'ont presque aucune ligne en commun. La documentation de lancement de Claude Opus 5.5, publiée le 22 septembre 2026, le place 29 points devant GPT-5.6 Sol sur Terminal-Bench 4.0. La documentation de lancement de Sol, en disponibilité générale depuis le 9 juillet 2026, met plutôt en avant Terminal-Bench 2.1, où Sol Ultra a obtenu 91,9 %, et l'Artificial Analysis Coding Agent Index, où il a pris la première place avec 80. Les deux tableaux sont réels. Les deux ont été réalisés par le fournisseur qui les remporte. La question utile n'est pas de savoir quel modèle est meilleur dans l'abstrait — c'est de savoir quel benchmark, exécuté sous le harnais de qui, vous dit quoi que ce soit sur votre charge de travail. C'est une question plus difficile que ce que l'un ou l'autre des articles de lancement veut que vous posiez, et c'est celle autour de laquelle cette comparaison est construite.
Les deux modèles, côte à côte

• Fournisseur — Anthropic vs OpenAI
• Sortie — Claude Opus 5.5 le 22 septembre 2026 vs GPT-5.6 Sol le 9 juillet 2026
• Prix par million de tokens — 4,00 $ en entrée / 20,00 $ en sortie contre 5,00 $ en entrée / 30,00 $ en sortie
• Lecture du cache — 0,20 $ par million sur Opus 5.5 ; le tarif de cache de Sol est défini par plateforme et n'est pas publié sous la forme d'un chiffre unique comparable
• Fenêtre de contexte — 1 M de tokens sur les deux
• Sortie maximale — 128K tokens sur les deux, avec 300K sur l’API Batch d’Anthropic derrière un en-tête bêta
• Date limite des connaissances — juin 2026 pour Opus 5.5 contre le 16 février 2026 pour Sol
• Contrôle du raisonnement — réflexion adaptative toujours activée, par défaut un effort moyen, l'échelle va du niveau faible au niveau maximal par rapport à un réglage d'effort de raisonnement maximal, plus un mode Ultra qui coordonne des sous-agents parallèles
• Gamme — Opus 5.5 est le premier d’une famille 5.5, avec Sonnet 5.5 et Haiku 5.5 promis dans les semaines à venir, tandis que Sol est le fleuron d’une famille à trois niveaux aux côtés de Terra et Luna
Deux de ces lignes font plus de travail que les autres. L'écart de date de coupure des connaissances est de quatre mois, ce qui compte si vos prompts portent sur quoi que ce soit qui s'est produit ce printemps. Et Opus 5.5 est désormais moins cher que Sol, tant en entrée qu'en sortie — un revirement par rapport à il y a trois mois, où Sol était la voie la moins chère pour obtenir des sorties de niveau frontière et où Claude Opus 5 était à 5 $/25 $.
Les seules lignes où les deux modèles apparaissent réellement
Il existe exactement un tableau publié contenant les deux modèles, et c’est celui d’Anthropic. Chaque chiffre qu’il contient est déclaré par le fournisseur, produit par l’entreprise qui vend l’un des deux modèles :
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % vs GPT-5.6 Sol 37,3 %
• Terminal-Bench-Science 0.1 — 58,7 % vs 22,4 %
• FrontierCode v1.1 (Main) — 54,4 % vs 47,5 %
• CursorBench 4.0 — 57,8 % contre 41,7 %
• AutomationBench — 40,0 % vs 28,8 %
• GDPval-AA v2.1 — 1846 Elo contre 1588
C'est un grand chelem, et les écarts sur les deux lignes de Terminal-Bench sont assez larges pour mériter un examen critique plutôt qu'une acceptation. La note de bas de page d'Anthropic fait déjà une partie de ce travail à votre place : l'exécution d'Opus 5.5 sur Terminal-Bench a utilisé l'effort xhigh plutôt que celui par défaut, et avec l'effort medium par défaut, l'avantage de FrontierCode se réduit à 54,6 % contre 47,5 % — un écart de sept points au lieu des chiffres mis en avant. Anthropic assortit aussi l'ensemble du tableau d'une mise en garde générale, affirmant qu'à ce niveau de capacité, les écarts des benchmarks sont « un guide moins fiable pour les différences dans le monde réel » et que son écart interne avec Claude Fable 5.1 est plus étroit que ne le suggèrent les scores. Qu'un fournisseur relativise son propre tableau est la phrase la plus digne de confiance de tout le document.
Notez aussi ce qui manque dans ce tableau : tout benchmark où le modèle d’OpenAI l’emporte. Un tableau de fournisseur qui ne contient que des lignes favorables n’est pas la preuve d’un balayage ; c’est la preuve d’une sélection de lignes.
Ce que disent les propres chiffres d’OpenAI
Le matériel de lancement de Sol raconte une autre histoire, sur des benchmarks différents, avec un harnais différent. Rapporté lors de son lancement en juillet :
• Terminal-Bench 2.1 — 91,9 % pour Sol Ultra et 88,8 % pour Sol standard, contre Claude Mythos 5 à 88,0 % et Claude Fable 5 à 84,3 %
• Artificial Analysis Coding Agent Index — 80, décrit à l’époque comme un état de l’art 2,8 points au-dessus de Claude Fable 5
• Agents' Last Exam, flux de travail professionnels de longue durée — 53,6, qu'OpenAI a rapporté comme étant en avance de 13,1 points sur Claude Fable 5
• BrowseComp — 92,2 % ; OSWorld 2.0 — 62,6 % ; SWE-Bench Pro — 64,6 %
Aucune de ces lignes n’inclut Claude Opus 5.5, car il n’existait pas en juillet. Le tableau de Sol a été conçu pour battre Fable 5 et Mythos 5, et c’est ce qu’il fait. Savoir s’il bat Opus 5.5 n’est tout simplement pas traité par la documentation de l’un ou l’autre fournisseur — les deux tableaux ont été assemblés à deux mois d’écart, face à des adversaires différents.
La ligne SWE-Bench Pro mérite une mention particulière, car c'est le seul endroit où le matériel de lancement d'OpenAI montre son modèle en train de perdre : 64,6 % pour Sol contre 80 % pour Claude Fable 5. OpenAI a répondu en remettant en question la validité du benchmark, estimant qu'environ 30 % de ses tâches sont défectueuses. C'est peut-être bien vrai. C'est aussi un rappel utile que « ce benchmark est défectueux » est une affirmation que les deux laboratoires font, et toujours à propos du benchmark où ils perdent.
Le problème du harnais, qu'aucune table ne résout

La raison pour laquelle les deux tableaux ne concordent pas n'est pas qu'un fournisseur ment. C'est que les benchmarks de codage agentique mesurent un modèle plus un échafaudage, et que les échafaudages diffèrent. Terminal-Bench 4.0 et Terminal-Bench 2.1 sont deux révisions différentes de la même idée, exécutées par des personnes différentes, avec des budgets d'outils différents et des règles de réessai différentes. Les chiffres d'Opus 5.5 d'Anthropic ont été produits dans le harnais d'Anthropic ; ceux de Sol d'OpenAI dans un outillage de type Codex. Transposez l'un ou l'autre modèle dans le harnais de l'autre, et les scores changent.
Les données indépendantes, là où il en existe, décrivent une course plus serrée que l'un ou l'autre des tableaux. Un benchmark d'agents tiers datant d'août 2026, exécuté sur plusieurs modèles dans le cadre de véritables travaux d'application, a désigné GPT-5.6 Sol comme la meilleure combinaison de précision, de coût et de vitesse — environ 0,52 $ et cinq minutes par exécution — tandis que Claude Opus 5, et non 5.5, était le plus précis, à 92 % des exécutions. Un autre classement, portant sur des tâches de code en entreprise, a placé Claude Opus 5 en première position avec 96,4 %, et GPT-5.6 Sol en troisième avec 86,5 %, comparant là encore Sol à l'Opus précédent plutôt qu'au nouveau. Ni l'un ni l'autre n'est une confrontation directe avec Opus 5.5, et ni l'un ni l'autre ne tranche quoi que ce soit. Ils établissent toutefois que lorsque la comparaison est menée par quelqu'un d'autre que l'éditeur, les écarts se réduisent.
Le point pratique à retenir est de cesser de lire les tableaux comme un classement et de commencer à les lire comme une liste d’hypothèses. Si votre travail est de l’automatisation de terminal à long horizon, l’écart d’Anthropic sur Terminal-Bench est une hypothèse qui vaut la peine d’être testée sur vos propres tâches. S’il s’agit de recherche professionnelle en plusieurs étapes, le résultat de Sol à Agents' Last Exam relève du même type d’hypothèse. Aucun de ces chiffres ne se transfère à votre charge de travail sans une exécution.
Coût par tâche terminée, le seul coût qui compte
Sur la grille tarifaire, Claude Opus 5.5 est désormais moins cher dans les deux sens : 4,00 $ contre 5,00 $ en entrée, 20,00 $ contre 30,00 $ en sortie, et un tarif de lecture du cache de 0,20 $, soit 60 % de moins que ce que facturait Claude Opus 5. Pour un agent qui renvoie un long prompt système à chaque tour, cette ligne de cache constitue le coût dominant et la raison pour laquelle une session de longue durée peut devenir sensiblement moins chère sans aucune modification du prompt.
Le prix par token n'a pourtant jamais déterminé la facture d'un agent. L'argumentaire d'OpenAI en faveur de Sol lors de son lancement reposait sur l'efficacité des tokens plutôt que sur le prix affiché : il faisait état d'une amélioration de 54 % de l'efficacité des tokens de codage, avec des tokens de sortie et un temps écoulé inférieurs à la moitié de ceux de Claude Fable 5, pour un coût environ un tiers inférieur. Anthropic avance l'argument en miroir pour Opus 5.5 : un coût d'exécution environ 40 % inférieur sur des charges de travail typiques à celui de Claude Opus 5, sur une grille tarifaire qui n'a baissé que de 20 %, avec des témoignages clients de Box, Kiro, Factory et GitHub citant tous d'importantes réductions de tokens ou d'étapes. Les deux affirmations vont dans le même sens — le modèle qui termine en moins de tours gagne — et aucune des deux n'est auditée de manière indépendante.
Là où des calculs indépendants du coût par tâche existent, ils favorisent actuellement Sol : une analyse publiée en septembre estimait GPT-5.6 Sol à 1,56 $ par problème résolu sur SWE-bench Verified, avec un taux de réussite de 96,2 %, contre Claude Opus 4.8 à 88,6 %. Il s’agit de Sol mesuré face à un modèle Anthropic plus ancien, et non face à Opus 5.5 ; c’est donc un point de départ plutôt qu’un verdict — mais cela rappelle qu’un modèle qui résout le problème du premier coup est moins cher qu’un modèle moins cher qui nécessite trois passages. La seule mesure qui tranchera pour vous est votre propre tâche, exécutée des deux manières, avec les nombres de tokens sous les yeux.
C'est davantage un problème de routage qu'un problème d'achat, et il vaut la peine de préciser quel volet est déjà résoluble. GPT-5.6 Sol est dès aujourd'hui sur OrcaRouter au prix catalogue d'OpenAI lui-même, avec 0 % de marge — le prix catalogue du fournisseur est répercuté tel quel, de sorte qu'un changement de tarif d'un fournisseur est effectif de notre côté le jour même, plutôt qu'après une synchronisation. Claude Opus 5.5 ne fait pas encore partie de nos routes ; il est disponible via l'API d'Anthropic et les principaux clouds. Une fois qu'il sera disponible, la même clé servira les deux, ce qui transforme l'expérience en règle de routage plutôt qu'en un second contrat et un second SDK : envoyez la charge de travail au modèle que vos propres chiffres favorisent, gardez le basculement automatique pointé vers l'autre, et laissez une ligne de DSL de routage décider par requête plutôt que par trimestre. Une baisse de prix d'un côté ou de l'autre est un changement de configuration, pas une migration.

Là où les deux diffèrent véritablement
Écartez les benchmarks et quatre différences subsistent, toutes vérifiables :
• Date limite des connaissances. Juin 2026 pour Opus 5.5, contre le 16 février 2026 pour Sol. Quatre mois représentent un écart considérable pour tout ce qui touche à des bibliothèques récentes, à des événements récents ou à des API récemment modifiées, et aucun benchmark ne le mesure.
• Routage de protection. Opus 5.5 est livré avec des protections de classe Fable 5.1 : la plupart des requêtes de cybersécurité sont réacheminées vers Claude Opus 4.8 et les travaux de biologie basculent vers Claude Opus 5, sauf si le compte est vérifié. Si votre produit se situe dans l’un ou l’autre de ces domaines, une partie de votre trafic est traitée par un modèle plus petit. Sol ne dispose d’aucun routage documenté équivalent, bien qu’OpenAI mentionne ses propres évaluations de sécurité liées à la cybersécurité.
• Orchestration. Sol propose un mode Ultra qui coordonne plusieurs sous-agents parallèles, quatre par défaut, ainsi qu'un réglage d'effort de raisonnement maximal. Opus 5.5 ne dispose d'aucun des deux en tant que fonctionnalité de plateforme ; son levier est le paramètre d'effort, et la composition multi-modèles est quelque chose que vous construisez ou routez plutôt que ce que le fournisseur vous offre.
• Économie de la famille. Sol est l’un des trois paliers, avec Terra et Luna en dessous — et le prix de Luna a été réduit de 80 % et celui de Terra de 20 % dans une mise à jour du 30 juillet. Les modèles moins chers d’Anthropic, Sonnet 5.5 et Haiku 5.5, sont annoncés mais pas encore disponibles. Si votre charge de travail est mixte, OpenAI propose actuellement les échelons les moins chers.
Choisir entre eux
Choisissez Claude Opus 5.5 si votre travail relève du codage agentique ou du travail de connaissance de longue durée, si le prix par token compte, si vos prompts touchent à quoi que ce soit des quatre derniers mois, ou si un contexte de 1M de tokens à 0,20 $ par million mis en cache est ce qui rend votre architecture abordable. Commencez à medium effort, pas le réglage high hérité, et mesurez si low tient la route.
Choisissez GPT-5.6 Sol si vous voulez un mode d'orchestration empaqueté par le fournisseur, si vous avez besoin dès aujourd'hui d'un palier moins cher sous le modèle phare plutôt que dans quelques semaines, ou si votre charge de travail est du genre que les propres preuves de lancement de Sol couvrent le mieux — les flux de travail professionnels à long horizon et l'utilisation d'un ordinateur, où il a rapporté ses résultats les plus forts.
Si vous êtes déjà sur Claude Opus 5, sachez qu'Opus 5.5 n'est pas un remplacement direct : la réflexion ne peut plus être désactivée, l'utilisation forcée d'outils renvoie une erreur, les blocs de réflexion sont liés au modèle et à la conversation, et l'ancien outil d'utilisation de l'ordinateur computer_20251124 n'est pas accepté sur l'API Claude ni sur Google Cloud. Les trois premiers points s'appliquent également à Claude Fable 5.1. Passer à Sol relève d'une intégration entièrement différente.
Ce qui trancherait vraiment cette comparaison serait une seule exécution indépendante des deux modèles à effort identique, dans un harnais identique, sur le même ensemble de tâches. À ce jour, cette semaine, personne n’en a publié. Tant que personne ne le fait, la position honnête est celle que les preuves étayent : le tableau d’Anthropic favorise Opus 5.5 et a été produit par Anthropic ; le tableau d’OpenAI favorise Sol et a été produit par OpenAI ; les résultats indépendants qui existent comparent Sol à l’Opus précédent et décrivent une course bien plus serrée ; et les deux lignes qui décideront votre facture — les tokens par tâche terminée et le volume de lecture du cache — sont les deux lignes qu’aucun des deux fournisseurs ne publie.
Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
