
Claude Sonnet 5.5 vs GPT-6 Sol : le segment à 2 $ compte désormais deux fleurons
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 984 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Claude Sonnet 5.5 et GPT-6 Sol sont proposés au même prix — 2 $ par million de tokens en entrée, 10 $ par million de tokens en sortie — et ils sont sortis à six jours d'intervalle, fin septembre 2026. Cette coïncidence n'est pas ce qu'il y a d'intéressant. Ce qui est intéressant, c'est que lorsque Artificial Analysis a évalué les deux sur son Intelligence Index v4.3.2, le modèle Anthropic de milieu de gamme s'est classé devant le modèle qu'OpenAI vend comme son produit phare : 56 pour Claude Sonnet 5.5 contre 47 pour GPT-6 Sol. Sur la même révision, Claude Sonnet 5 — le modèle que remplace Sonnet 5.5 — obtient 38.
Donc il ne s'agit plus d'une comparaison entre une gamme bon marché et une gamme chère. Il s'agit d'une comparaison de deux modèles au même prix, issus de deux laboratoires, avec un écart de 18 points entre celui d'Anthropic et son propre prédécesseur, et un écart de neuf points en faveur d'Anthropic face à la sortie haut de gamme d'OpenAI. Tout ce qui suit est une tentative de déterminer lequel de ces écarts résiste au contact d'une charge de travail réelle, et lequel d'entre eux est un artefact de benchmark.
Ce qu'est réellement chaque modèle
Claude Sonnet 5.5 est le deuxième modèle de la génération 5.5 d'Anthropic, publié le 28 septembre 2026, cinq jours après le lancement de Claude Opus 5.5 qui l'avait promis. Il porte l'identifiant claude-sonnet-5-5 sur l'API Claude, Amazon Bedrock, Google Cloud et Microsoft Foundry, conserve la fenêtre de contexte de 1 M de tokens et le plafond de sortie de 128 K propres à cette gamme, et conserve exactement les tarifs de Claude Sonnet 5 : 2 $ en entrée, 10 $ en sortie, 0,20 $ par million pour les lectures de cache, 2,50 $ pour une écriture de cache de cinq minutes. Il est disponible avec une rétention nulle des données dès le premier jour, et l'engagement de retrait d'Anthropic court jusqu'au 28 septembre 2027.

GPT-6 Sol est le successeur du modèle au nom déroutant appelé GPT-5.6 Sol — celui qu'OrcaRouter liste encore comme accessible à 4 $ en entrée et 20 $ en sortie, et qu'Artificial Analysis a depuis marqué comme obsolète avec un renvoi vers GPT-6 Sol. Le nouveau modèle est sorti le 22 septembre 2026 à 2 $ / 10 $, avec une fenêtre de contexte de 1 050 000 tokens, un plafond de sortie de 128 K et un tarif par paliers : le tarif affiché de 2 $ / 10 $ s'applique jusqu'à 272 000 tokens d'entrée, et tout ce qui dépasse est facturé à 4 $ / 15 $.
Ce dernier détail est le premier endroit où le cadrage de la « tarification identique » se brise.
L'égalité de prix n'est vraie que pour les invites courtes.
Les deux grilles tarifaires indiquent 2 $ et 10 $, et presque toutes les comparaisons du jour du lancement se sont arrêtées là. Mettez les deux en regard sur les conditions qui déterminent une facture :
• Tarif principal — Claude Sonnet 5.5 2 $ / 10 $ vs GPT-6 Sol 2 $ / 10 $
• Tarif contexte long — Sonnet 5.5 facture la fenêtre complète de 1 M au tarif standard ; GPT-6 Sol double à 4 $ / 15 $ au-delà de 272 000 jetons d'entrée
• Fenêtre de contexte — 1 000 000 jetons vs 1 050 000 jetons
• Sortie maximale — 128 K tokens sur l’API synchrone pour les deux ; Sonnet 5.5 atteint 300 K sur l’API Message Batches derrière l’output-300k-2026-03-24en-tête
• Remise par lots — 50 % de réduction sur l'entrée et la sortie pour Sonnet 5.5 ; consultez les conditions actuelles d'OpenAI pour Sol plutôt que de présumer d'une parité
• Lectures du cache — 0,20 $ par million sur les deux
Un balayage de dépôt de 800 000 tokens coûte deux fois plus cher par token sur GPT-6 Sol que sur Claude Sonnet 5.5, et c’est précisément la charge de travail pour laquelle les deux modèles sont commercialisés. Si vos invites sont courtes, les grilles tarifaires sont vraiment à égalité et le prix ne devrait rien déterminer. Si elles sont longues, c’est déjà le cas.
Le tableau de bord d'Anthropic lui-même, à lire attentivement
Anthropic a publié une comparaison à quatre colonnes avec Claude Sonnet 5, Claude Opus 5.5 et GPT-6 Sol. Les chiffres rapportés par le fournisseur, qu’aucun tiers n’a encore reproduits :

• Terminal-Bench 4.0 — Sonnet 5.5 70,6 % contre Sonnet 5 10,3 %
• FrontierCode 1.1, Main — Sonnet 5.5 46,2 % à effort Max, Sonnet 5 42,4 %, Opus 5.5 54,4 %, GPT-6 Sol 49,3 %
• CursorBench 4.0 — Sonnet 5.5 55,5 % vs Sonnet 5 34,1 % vs Opus 5.5 57,8 %
• GDPval-AA v2.1 — Sonnet 5.5 1844 contre Sonnet 5 1449 contre Opus 5.5 1846 contre GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 contre Sonnet 5 1359 contre Opus 5.5 1822 contre GPT-6 Sol 1483
• Humanity's Last Exam, avec outils — Sonnet 5.5 64,5 % vs Sonnet 5 54,9 % vs Opus 5.5 67,7 %
• OSWorld 2.1, partiel — Sonnet 5.5 80,1 % vs Sonnet 5 57,0 % vs Opus 5.5 81,8 %
• Chartographie, sans outils — Sonnet 5.5 61,6 % vs Sonnet 5 15,6 % vs Opus 5.5 64,4 % vs GPT-6 Sol 53,6 %
Deux de ces lignes portent des notes de bas de page, et toutes deux comptent. Les chiffres GDPval-AA, AA-Briefcase et Chartography de GPT-6 Sol sont signalés par Anthropic comme ayant été mesurés après un correctif de compréhension d'image du côté d'OpenAI, et le chiffre FrontierCode de Sonnet 5.5 correspond à son résultat Max-effort, qu'Anthropic indique être inférieur à son propre résultat Xhigh sur la même évaluation. Un fournisseur qui se compare à un rival sur un benchmark qu'il exécute lui-même, avec des notes de bas de page qui qualifient les deux parties, ne constitue pas une preuve neutre. C'est la meilleure preuve disponible le jour du lancement, et ce n'est pas la même chose qu'une mesure.
Ce que disent les chiffres indépendants, et ce qu’ils ne disent pas
Artificial Analysis a publié une première exécution indépendante : Index 56 sur v4.3.2, un coût de 7,60 $ par tâche Index, et un chiffre de verbosité de 410 M de jetons de sortie contre une médiane de 88 M. Ce chiffre de verbosité mérite plus d’attention qu’il n’en reçoit. Cela signifie que le modèle a tendance à dépenser un très grand nombre de jetons en chemin vers une réponse, et c’est le mécanisme derrière la seule affirmation d’efficacité qui ne provient pas du propre tableau d’Anthropic.
Anthropic affirme que Claude Sonnet 5.5 génère des sorties 30 % plus vite que Claude Sonnet 5 et coûte « jusqu'à 30 % de moins par tâche » au même tarif par token. Ces deux affirmations prises ensemble décrivent un modèle qui fait le même travail en moins de tokens, pas une grille tarifaire moins chère. Savoir si cela tient est exactement à quoi sert une mesure de verbosité de 410 M de tokens, et une seule exécution indépendante ne suffit pas à trancher — mais elle suffit à dire que la phrase marketing et le nombre de tokens mesuré pointent dans des directions opposées, et que c'est celui qui est mesuré qui apparaît sur une facture.
Notez aussi ce que l'index indépendant ne contient pas encore. Aucune réplication publiée d'OSWorld, Terminal-Bench ou CursorBench n'existe de la part de qui que ce soit d'autre qu'Anthropic. Et le 56 est un composite : il ne dit rien sur laquelle des dix évaluations qu'il contient a creusé l'écart avec le 47 de Sol. Une avance composite de neuf points peut masquer une perte de quinze points sur la seule évaluation dont dépend votre charge de travail.
Là où ils divergent de façons qu’une grille tarifaire ne peut pas montrer.
Le prix et le score d'index sont les deux axes faciles. Ceux qui décident d'une migration sont les axes comportementaux, et sur ce point, les deux modèles sont loin d'être proches.

Claude Sonnet 5.5 active la réflexion adaptative par défaut avec high comme effort par défaut, et il supprime trois choses que la génération précédente autorisait : l'envoi de thinking: {"type": "disabled"} renvoie désormais une erreur 400 et doit être remplacé par between_tools ; l'utilisation forcée des outils — tool_choice défini sur "any" ou sur un outil nommé — renvoie purement et simplement une erreur 400 ; et l'ancien computer_20251124 outil computer-use est rejeté sur l'API Claude et Google Cloud au profit d'un ensemble d'outils. Les blocs de réflexion sont désormais aussi liés au modèle qui les a produits, de sorte qu'une conversation peut passer de Claude Sonnet 5 à Claude Sonnet 5.5 et conserver son raisonnement, mais ne peut plus en ressortir avec lui.
Si votre boucle d'agent définit tool_choice: "any" pour forcer un appel conforme au schéma, Claude Sonnet 5.5 rejettera la requête jusqu'à ce que vous passiez à auto avec l'utilisation stricte des outils ou les sorties structurées. C'est une véritable tâche de migration, et c'est le genre de chose qui transforme un simple échange d'ID de modèle en tout un après-midi.
Le coût d'un basculement vers GPT-6 Sol est différent par nature, car le modèle qu'il remplace est toujours au catalogue et est encore appelé. GPT-5.6 Sol n'est pas retiré ; il est déprécié chez Artificial Analysis, facturé au double du nouveau modèle, et reçoit toujours du trafic. Les propres mesures d'OrcaRouter montrent qu'il traite environ 95 millions de tokens par semaine, ce qui est un indicateur raisonnable du nombre d'intégrations qui n'ont pas encore migré. Passer à GPT-6 Sol est une décision tarifaire que vous pouvez prendre plus tard ; vous n'avez pas à la prendre maintenant.
Exécution de la comparaison sur une seule clé
Le problème pratique d'une comparaison entre deux fournisseurs, c'est qu'elle coûte généralement deux comptes, deux chemins SDK et deux ensembles de limites de débit avant d'apprendre quoi que ce soit. OrcaRouter existe pour éliminer cela : un point de terminaison compatible OpenAI, plus de 200 modèles, le prix catalogue du fournisseur répercuté sans marge, et un basculement automatique entre fournisseurs.
Les deux modèles qui comptent ici sont routables dessus dès aujourd'hui. GPT-6 Sol figure au catalogue à 2 $ / 10 $, avec le palier de contexte long intact, et Claude Sonnet 5 — le modèle sur lequel passe encore l'essentiel du trafic de l'API Claude, avec un débit mesuré de 150 jetons de sortie par seconde et un temps jusqu'au premier jeton (p50) d'environ cinq secondes — est présent sur la plateforme depuis le 30 juin, au tarif d'Anthropic lui-même de 2 $ / 10 $.
Claude Sonnet 5.5 lui-même n'est pas encore dans notre catalogue. C'est vrai, mais la voie honnête pour y accéder, c'est l'API du fournisseur et les trois clouds qu'Anthropic répertorie, et la façon honnête de l'évaluer consiste à la diriger vers une tranche de trafic que vous pouvez vous permettre de perdre. C'est à cela que sert la couche de routage : promouvoir un pourcentage, surveiller le taux d'échec, et garder le modèle précédent comme solution de repli plutôt que comme plan de retour arrière.
Lequel est mis en production ?
Choisissez en fonction de la forme de la charge de travail plutôt que d'un score composite.
Claude Sonnet 5.5 est le meilleur achat pour le travail sur de longs contextes, pour tout ce qui est déjà écrit pour la surface d’utilisation des outils et d’utilisation de l’ordinateur d’Anthropic, et pour les équipes dont les prompts dépassent régulièrement un quart de million de tokens — la fenêtre à tarif forfaitaire y vaut plus que n’importe quel delta d’indice. Acceptez que la migration s’accompagne d’une liste de contrôle : utilisation forcée des outils, le commutateur de réflexion, les appariements d’outils advisor et un changement d’outil d’utilisation de l’ordinateur.
GPT-6 Sol est le choix de continuité le plus sûr pour une stack de type OpenAI, et le plus économique si vos prompts sont courts et que vos intégrations sont déjà en place. Son avantage n’est pas la capacité — sur le composite, il est à la traîne — mais le fait que son prédécesseur soit toujours en service et que la migration n’ait pas d’échéance.
D'après les chiffres disponibles, Claude Sonnet 5 remporte la comparaison directe sur l'indice indépendant et sur l'économie des contextes longs, et ne perd sur rien que puisse encore détecter une mesure publiée, au-delà de la confiance que le tableau du fournisseur lui-même peut inspirer. C'est une affirmation plus étroite que celle avancée par les documents de lancement, et c'est celle sur laquelle il vaut la peine d'agir.
Ce qui changerait la réponse, c'est une deuxième exécution indépendante des évaluations agentiques, et un chiffre publié de tokens par tâche pour les deux modèles sur les mêmes tâches. Tant que les deux n'existent pas, l'indice composite est un avantage de neuf points pour le modèle le moins coûteux à exécuter, et un avantage composite de neuf points n'est pas la même chose qu'un avantage de neuf points sur votre charge de travail.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
