
GPT-6 vs Claude Opus 5 : les deux camps de ce duel ont déjà été remplacés
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La chose la plus utile à savoir à propos de GPT-6 face à Claude Opus 5, c'est que les deux camps de cette confrontation ont une génération de retard sur leur propre fournisseur. Claude Opus 5 est sorti le 24 juillet 2026 et a été remplacé par Claude Opus 5.5 le 22 septembre. GPT-6 Sol est sorti le 22 septembre et a été remplacé par GPT-6.1 Sol le 29 septembre. Si vous avez fait cette recherche pour choisir entre eux pour un nouveau travail, vous choisissez entre deux modèles que chaque fournisseur a déjà dépassés — et la version honnête de cet article porte sur les cas où l'ancienne paire reste le bon choix, pas sur qui gagne.
Ce que sont réellement les deux modèles
Claude Opus 5 était le modèle phare d'Anthropic : une fenêtre de contexte de 1 000 000 de tokens, 128 000 tokens de sortie maximale, en entrée du texte, des images et des fichiers, affiché à 5,00 $ par million de tokens d'entrée et 25,00 $ par million de tokens de sortie, avec un tarif de 0,50 $ pour l'entrée mise en cache et de 10,00 $ pour l'écriture de cache. Il s'agit d'un modèle unique doté d'un seul identifiant, anthropic/claude-opus-5.
GPT-6 Sol est le niveau intermédiaire d'une génération de trois modèles — GPT-6 Astra au-dessus et GPT-6 Luna en dessous — avec le même contexte de plus de 1 000 000 de tokens (le catalogue indique 1 050 000 pour le côté OpenAI, contre 1 000 000 pour Opus 5), le même plafond de sortie de 128 000 tokens et les mêmes entrées texte/image/fichier. Il est affiché à 2,00 $ / 10,00 $, avec un tarif d'entrée mise en cache de 0,20 $ et un tarif d'écriture de cache de 2,50 $. Sa grille tarifaire comporte une étape que celle d'Anthropic n'a pas : toute requête dépassant 272 000 tokens d'entrée voit l'ensemble de la requête retarifé à 4,00 $ / 15,00 $.
Cela représente un écart de prix par token de 2,5x en faveur de Sol sur le segment court, et l'écart se maintient aussi sur le cache — une remise de 90 % sur les entrées mises en cache chez Sol contre une remise de 98 % chez Opus 5, ce qui réduit l'écart à 0,20 $ contre 0,50 $ par million plutôt que de l'éliminer. Sur une charge de travail à contexte long, l'écart est divisé par deux plutôt que comblé.
• Entrée — GPT-6 Sol 2,00 $ par million contre Claude Opus 5 5,00 $
• Sortie — GPT-6 Sol 10,00 $ par million contre Claude Opus 5 25,00 $
• Entrée mise en cache — GPT-6 Sol 0,20 $ par million contre Claude Opus 5 0,50 $
• Écritures de cache — GPT-6 Sol 2,50 $ par million contre Claude Opus 5 10,00 $
• Au-delà de 272 K en entrée — GPT-6 Sol refacture toute la requête à 4,00 $ / 15,00 $ ; aucune étape équivalente sur la fiche Opus 5
• Contexte et sortie — 1 050 000 en entrée et 128 000 en sortie contre 1 000 000 en entrée et 128 000 en sortie
Le conseil indépendant, où l'écart est plus grand que le prix
Le prix favorise GPT-6 Sol d'un facteur 2,5. Le classement avantage Claude Opus 5 plus que ne le laisserait supposer l'écart de prix, ce qui est l'inverse du récit habituel du modèle bon marché.
• AA Intelligence Index — Claude Opus 5 50,8, classé 11e ; GPT-6 Sol 47,6, classé 14e
• AA Coding Index — Claude Opus 5 78,0, classé 2e dans ce classement ; GPT-6 Sol 60,0
• GPQA Diamond — Claude Opus 5 93,2
• Humanity's Last Exam — Claude Opus 5 54,9 contre GPT-6 Sol 47,9
• Terminal-Bench 2.1 — Claude Opus 5 89,1
• Terminal-Bench 4.0 — Claude Opus 5 49,0 contre GPT-6 Sol 43,9
• τ-bench bancaire — Claude Opus 5 42,1
• SciCode — Claude Opus 5 56,4 contre GPT-6 Sol 57,6
• Rappel de contexte long — Claude Opus 5 79,3 contre GPT-6 Sol 83,7
Deux lignes vont dans l'autre sens et méritent d'être nommées, car l'agrégat les masque. GPT-6 Sol bat Opus 5 sur le rappel à long contexte de 4,4 points et le devance légèrement sur SciCode de 1,2. La forme honnête n'est donc pas « Opus 5 est meilleur en tout » — mais qu'Opus 5 est nettement en avance sur les tableaux de codage et d'agentique (une avance de 24 points sur le Coding Index relève d'une autre catégorie de résultat), tandis que Sol détient la ligne de récupération sur une longue fenêtre et fait jeu égal sur l'une des deux mesures de code scientifique.
Une mise en garde méthodologique avant que l’un ou l’autre de ces chiffres ne soit cité ailleurs : Artificial Analysis ne garantit pas que deux pages de modèles soient générées à partir de la même révision d’indice le même jour, et il divise ses groupes de pairs — les modèles à poids ouverts sont classés par rapport à d’autres modèles à poids ouverts de la même catégorie de taille, les modèles propriétaires étant classés au sein d’une bande de prix propriétaire. Les deux modèles ici sont propriétaires, donc les deux chiffres proviennent du même côté de cette ligne, mais considérez les écarts inférieurs au point comme une indication de tendance plutôt que comme une mesure contrôlée. Chaque chiffre de fournisseur dans cet article correspond au fournisseur qui évalue son propre modèle par rapport à son propre prédécesseur et est étiqueté comme tel.
Ce que les deux remplacements ont changé
Claude Opus 5.5 est arrivé le 22 septembre à 4,00 $ / 20,00 $ — moins cher qu'Opus 5 sur les deux compteurs, avec un tarif d'entrée en cache de 0,20 $ qui correspond à celui de Sol — et obtient 39,8 sur le même Intelligence Index. Cela représente 6,8 points de plus qu'Opus 5 pour 20 % de moins. Tout argument en faveur du maintien d'Opus 5 dans une nouvelle build doit expliquer pourquoi cela vaut 6,8 points d'indice et 1,00 $/5,00 $ par million pour rester sur l'ancien checkpoint.
GPT-6.1 Sol est arrivé le 29 septembre au même tarif de 2,00 $ / 10,00 $ que GPT-6 Sol, avec un score de 51,8 sur l'indice contre 47,6 pour Sol, et un tarif d'entrée en cache de 0,10 $ qui divise par deux la lecture en cache. C'est le même prix, avec un meilleur score et une meilleure économie de cache. Le seul argument en faveur de GPT-6 Sol en particulier est le même que celui qui s'applique à Opus 5 : une suite de tests de non-régression qui a été étalonnée sur lui, où le changement de modèle invalide les comparaisons auxquelles vous faites déjà confiance.
Il y a une seconde raison, plus discrète, pour laquelle une équipe reste sur la paire plus ancienne, et elle n’a rien à voir avec les benchmarks. Ces deux checkpoints sont ceux qui ont derrière eux l’historique de production le plus long. Opus 5 est appelable depuis le 24 juillet et GPT-6 Sol depuis le 22 septembre, et les mesures de l’évaluateur indépendant sur les deux tournent depuis assez longtemps pour dessiner une tendance plutôt qu’un relevé isolé. Les sept derniers jours de trafic de Sol sur nos propres données de routage s’élèvent à environ 2,1 millions de tokens ; ceux d’Opus 5 à environ 23,0 millions. Il s’agit d’une fenêtre glissante, pas d’un total cumulé, et ces chiffres évoluent d’un relevé à l’autre — mais ils rappellent qu’Opus 5 continue de faire un vrai travail en production même après la sortie de son remplaçant.
Le profil de latence et de coût, c’est là que Sol justifie son utilité.
• Temps médian jusqu'au premier token — GPT-6 Sol 6 785 ms vs Claude Opus 5 4 652 ms
• Vitesse de sortie médiane — GPT-6 Sol 179,6 tokens/s vs Claude Opus 5 82,2 tokens/s
• Trafic sur sept jours observé de notre côté — GPT-6 Sol ~2,1 M tokens, Claude Opus 5 ~23,0 M tokens
Sol répond à son premier token en environ 2,1 secondes, mais diffuse ensuite à un débit plus de deux fois supérieur à celui d'Opus 5. Sur une génération longue — le type d'exécution où la sortie se compte en milliers de tokens plutôt qu'en dizaines —, c'est ce second chiffre qui domine, et un modèle bon marché qui termine plus tôt vaut plus que ne le laisse penser sa grille tarifaire. Sur un appel court et sensible à la latence, c'est le chiffre du premier token que l'utilisateur ressent.
Ces deux mesures de service proviennent de notre propre routage, sur une fenêtre glissante de sept jours, et elles varient d'une lecture à l'autre. Elles servent à comparer la forme des deux modèles, et non à être citées comme une attente de niveau de service.

Exécuter la paire pendant que la migration est en suspens
La raison pour laquelle cette comparaison vaut la peine d’être traitée, c’est qu’aucun des deux remplacements ne se décide d’un simple clic. Si vos évaluations ont été construites pour Claude Opus 5, passer à Opus 5.5 revient à réétablir une base de référence, pas à effectuer une mise à niveau ; il en va de même de GPT-6 Sol face à GPT-6.1 Sol. Ce qu’il est utile de faire dans cet intervalle, c’est d’exécuter les deux générations côte à côte sur votre propre trafic plutôt que de choisir à partir du tableau de quelqu’un d’autre.
Les quatre modèles figurent dans le même catalogue sur OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol et GPT-6.1 Sol, appelés via une seule API devant plus de 200 modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge, de sorte qu'une baisse de prix du fournisseur arrive ici le jour même plutôt qu'à votre prochain rapprochement — ce qui fait de la comparaison une question de routage plutôt qu'une question d'achat. Le DSL de routage vous permet de répartir selon la taille des requêtes ou selon une part : envoyer une fraction du trafic de production vers le nouveau checkpoint, la comparer à la référence sur vos propres évaluations, élargir la fraction lorsque les chiffres tiennent, et conserver le modèle plus ancien comme solution de repli tant que ce n'est pas le cas. Le basculement automatique entre fournisseurs couvre le cas où une route se dégrade en cours de migration, le mode de défaillance qui pousse les gens à abandonner une migration à mi-chemin.


Qui devrait choisir lequel, étant donné que les deux sont supplantés
Si vous démarrez quelque chose de nouveau : ni l’un ni l’autre. Claude Opus 5.5 est moins cher que Claude Opus 5 et obtient 6,8 points de plus, et GPT-6.1 Sol est au même prix que GPT-6 Sol avec un meilleur indice et une lecture en cache réduite de moitié. La seule raison de commencer avec l’ancienne paire est une dépendance stricte à un checkpoint que vous ne pouvez pas modifier.
Si vous en faites déjà tourner un : la décision concerne votre suite de régression, pas les classements. Claude Opus 5 reste le modèle de codage et agentique le plus performant des deux, et de loin, donc un pipeline de codage stable sur celui-ci devrait être comparé à Opus 5.5 plutôt que de migrer latéralement vers un palier GPT-6. Un pipeline à fort volume et sensible aux coûts sur GPT-6 Sol a la mise à niveau la plus simple — même prix, meilleur score, meilleur cache — et la seule raison honnête de retarder est que vous n’avez pas encore relancé vos évaluations.
Et si la réponse que vous vouliez était simplement de savoir lequel des deux l’emporte : Claude Opus 5, sur presque tous les classements, pour 2,5 fois le prix. L’argument de GPT-6 Sol n’a jamais été qu’il était meilleur. C’était qu’il était assez bon marché pour valoir la différence — et cet argument appartient désormais à GPT-6.1 Sol, au même prix avec un meilleur score.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
