
GPT-6.1 vs Claude Opus 5.5 : un écart bien réel, inégalement réparti
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 141 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 294 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
L'écart de cinq virgule huit points entre Claude Opus 5.5 et GPT-6.1 Sol sur l'Artificial Analysis Intelligence Index est le plus important de toutes les paires de cet ensemble, et contrairement à la plupart d'entre elles, il ne se comblera pas avec un changement de réglage. Claude Opus 5.5, sorti le 22 septembre 2026 et facturé 4,00 $ par million de tokens d'entrée et 20,00 $ par million de tokens de sortie, obtient 57,6. GPT-6.1 Sol, sorti le 29 septembre 2026 à 2,00 $ et 10,00 $, obtient 51,8. Claude Opus 5.5 est le modèle au score le plus élevé, avec une marge supérieure à celle qui sépare la plupart des modèles de pointe les uns des autres, et il coûte 8,3 fois plus cher par tâche pour y parvenir — 5,98 $ contre 0,72 $. Jusqu'ici, le modèle coûteux gagne tout simplement, ce qui est la version la moins intéressante de cette comparaison. Ce qui la rend digne d'intérêt, c'est que les 5,8 points ne sont pas répartis uniformément dans la suite : sur le seul axe qui détermine la plupart des travaux sur documents longs et sessions longues, les deux modèles se tiennent à moins de deux points l'un de l'autre.
Tous deux sont des modèles phares dans le même créneau de marché : des fenêtres de contexte de classe 1M, des plafonds de sortie de 128K, l'entrée de texte, d'images et de fichiers, le raisonnement étendu d'un côté et une échelle d'effort à cinq niveaux de l'autre. Claude Opus 5.5 succède à Claude Opus 5 et se positionne sur le raisonnement exigeant, le codage et le travail agentique sur un horizon long ; GPT-6.1 Sol se situe un cran en dessous de GPT-6 Astra et se positionne sur le codage agentique, l'usage de l'ordinateur et le travail professionnel à forte composante documentaire. Ils visent les mêmes tâches. Les mesures indiquent qu'ils ne sont pas également bons sur toutes.
Où vivent réellement les 5.8 points
Un indice composite masque ses composants. Récupérez les évaluations individuelles et l’écart cesse de ressembler à un écart pour commencer à ressembler à un profil.
• Humanity's Last Exam — Claude Opus 5.5 61,4 % contre GPT-6.1 Sol 52,9 %, un écart de 8,5 points en raisonnement abstrait
• SciCode — Claude Opus 5.5 66,9 % contre GPT-6.1 Sol 54,2 %, un écart de 12,7 points sur du code de niveau recherche
• Rappel en contexte long — Claude Opus 5.5 84,7 % contre GPT-6.1 Sol 83,0 %, soit un écart de 1,7 point pour la récupération de faits dans une entrée longue
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % face à un score de Sol non publié pour la même révision
• Fenêtre de contexte — GPT-6.1 Sol 1 050 000 tokens contre Claude Opus 5.5 1 000 000 tokens, avec un plafond de sortie de 128 000 tokens pour les deux
• Coût par tâche d'indexation — Claude Opus 5.5 5,98 $ vs GPT-6.1 Sol 0,72 $
La répartition est tout l’histoire. Lorsque la tâche consiste à raisonner dans l’abstrait — une question d’examen difficile, un problème de programmation de niveau recherche sans réponse existante à copier —, Claude Opus 5.5 est nettement en tête, et un écart de 12,7 points sur SciCode n’est pas du bruit. Lorsque la tâche consiste à trouver le bon passage dans une entrée très longue et à l’exploiter, les deux modèles sont pratiquement au même niveau, et GPT-6.1 Sol tient cette position avec 50 000 tokens de capacité en plus. Une large part du travail de production sur les LLM relève du second type : réponse augmentée par recherche documentaire, revue de contrats et de dépôts de documents, analyse de journaux et de transcriptions, revue de code sur un grand dépôt. Ce travail est mesuré par le troisième point, pas par les deux premiers, et sur ce point, le premium achète 1,7 point.
Lire honnêtement les lignes d’index
Deux mises en garde doivent figurer à côté de ces chiffres plutôt qu'en bas de la page.
Les configurations diffèrent. Artificial Analysis classe Claude Opus 5.5 dans une configuration « Max, Default Fallback » et GPT-6.1 Sol à effort maximal. Il s'agit dans les deux cas des paramètres les plus puissants sous lesquels chaque modèle est publié, ce qui rend la comparaison équitable, mais c'est une comparaison de deux plafonds plutôt que de deux réglages par défaut livrés. Les paramètres par défaut de Claude Opus 5.5 dans une API hébergée peuvent différer de l'exécution présentée dans le graphique, et l'effort par défaut de GPT-6.1 Sol est moyen.
La ligne Terminal-Bench est délibérément vide d’un côté. Le 59,6 % de Claude Opus 5.5 provient de la révision d’Artificial Analysis dans laquelle il a été publié ; le chiffre équivalent pour GPT-6.1 Sol n’est pas disponible à une révision correspondante. Citer un chiffre issu d’une autre exécution du même benchmark constituerait une comparaison fausse, et la démarche honnête consiste à laisser la cellule vide plutôt qu’à la remplir avec quelque chose d’à peu près exact.
La verbosité joue ici dans le même sens que face aux modèles frères moins chers : Claude Opus 5.5 émet 260 M de tokens de sortie sur la suite d'index, contre 67 M pour GPT-6.1 Sol, soit un écart de 3,9× à un tarif déjà deux fois plus élevé. C'est de là que vient un rapport de 8,3× par tâche alors que la grille tarifaire affiche 2× en entrée et 2× en sortie. Le surcoût n'est pas de 8,3× parce que le modèle coûte 8,3× — il est de 8,3× parce qu'il coûte 2× et réfléchit 3,9× plus longtemps.
Plaidoyer pour son paiement
Si votre travail ressemble aux deux premières puces, le calcul est simple et il favorise Claude Opus 5.5. Un écart de 12,7 points sur du code scientifique de niveau recherche, ou de 8,5 points sur du raisonnement abstrait difficile, fait la différence entre un agent qui ferme un ticket sans supervision et un agent qui a besoin d’un humain toutes les trois étapes. Le codage agentique sur une grande base de code est la charge de travail que les deux fournisseurs citent en premier, et c’est celle où l’écart est le plus large. Payer 5,98 $ au lieu de 0,72 $ par tâche pour éviter une exécution échouée qui coûte vingt minutes à un ingénieur n’est pas un dilemme.
Il existe un deuxième argument qui ne porte pas du tout sur les scores. Claude Opus 5.5 a quinze jours et a généré un corpus d’évaluations, d’analyses et d’expériences de déploiement de tiers qu’un modèle âgé de huit jours n’a pas. Pour une trajectoire de production, la maturité des connaissances environnantes vaut quelque chose que l’indice ne chiffre pas.
L'argument contre, et le chiffre qui tranche
Le contre-argument, c’est la ligne du contexte long. Si la forme dominante de votre trafic est « entrée volumineuse, réponse courte » — et pour un très grand nombre d’équipes, c’est le cas —, alors l’axe sur lequel vous êtes facturé n’est pas l’axe que vous consommez. Sur le rappel en contexte long, les deux modèles sont séparés de 1,7 point avec un rapport de prix de 8,3×, et le modèle le moins cher dispose de la fenêtre la plus grande. C’est le cas où le surcoût est réel, mesuré, et dépensé pour une capacité que la charge de travail n’exerce jamais.
Le chiffre décisif, donc, n’est pas l’indice. C’est la part de vos tâches qui ressemblent à SciCode plutôt qu’à du rappel. Les équipes qui peuvent répondre à cette question à partir de leurs propres journaux devraient y répondre à partir de leurs propres journaux ; une suite de benchmarks est un proxy pour un mélange de tâches, et le mélange est la variable.
Les deux sur une seule touche, ce qui rend la question résoluble.


Claude Opus 5.5 est disponible sur OrcaRouter à son propre tarif de 4,00 $ / 20,00 $, avec les lectures de cache à 0,20 $. GPT-6.1 Sol est disponible sur OrcaRouter à 2,00 $ / 10,00 $, passant à 4,00 $ / 15,00 $ au-delà de 272 000 tokens de prompt, avec les lectures de cache à 0,10 $. Les deux au prix catalogue du fournisseur, sans rien ajouté par-dessus, sur une seule clé et une seule facture.
Cela compte plus que d'habitude pour cette association, car les deux modèles ne sont pas des substituts — ils constituent une décision de routage. Envoyez le travail sur les documents longs et à gros volume à GPT-6.1 Sol, gardez le raisonnement difficile et la modification de code sur Claude Opus 5.5, et les deux sont derrière le même point de terminaison avec les mêmes identifiants. Si une route se dégrade, le basculement automatique redirige l'appel plutôt que de le faire échouer, et comme le routage est déclaratif, il peut être exprimé par classe de tâche plutôt que par application. Tester la répartition est un changement de configuration, pas une migration.
La dernière chose qu'il vaut la peine de dire concerne la durée de conservation de cette comparaison. Les deux modèles ont quelques jours ou quelques semaines. GPT-6.1 Sol a une configuration indépendante publiée ; Claude Opus 5.5 en a une. Une exécution unique par modèle n'est qu'un instantané, et le mode de défaillance intéressant n'est pas que l'un de ces chiffres soit faux — c'est qu'une configuration à effort moyen, ou un second évaluateur, redessine le profil. D'ici là, la lecture défendable est celle que donnent les composants : un écart décisif sur le raisonnement difficile et le code de recherche, un petit écart sur le travail à long contexte, et une facture de 8,3× qui doit être justifiée par la partie de votre charge de travail qui ressemble à ce premier cas de figure.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
