
Claude Opus 5.5 vs GPT-6 Astra : l'écart de 6 $, et le second prix qu'Astra facture au-delà de 272K
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Deux fournisseurs ont publié ce mois-ci des tableaux de référence pour leurs modèles phares, chacun montrant son propre modèle vainqueur, et aucun des deux tableaux ne contient une seule ligne où les deux modèles ont été comparés l'un à l'autre. Claude Opus 5.5, sorti le 22 septembre 2026 à 4 $ par million de jetons en entrée, et GPT-6 Astra, sorti le 3 septembre 2026 à 10 $ par million de jetons en entrée, n'ont entre eux exactement que deux benchmarks en commun — et ils se les partagent, Opus 5.5 l'emportant sur les tâches proches d'AutomationBench dans le tableau d'Anthropic et Astra l'emportant dans celui d'OpenAI, Astra étant clairement en tête sur le raisonnement scientifique dans les deux. Voilà ce que le matériel des fournisseurs peut vous dire. Le tableau indépendant est moins ambigu et pointe dans l'autre sens, et le tableau des tarifs est plus déséquilibré que l'un comme l'autre.
Ce que chaque camp a publié
Le tableau d’Anthropic pour Opus 5.5 utilise son propre harnais et ses propres réglages d’effort, et lorsqu’il liste Astra, les chiffres sont ceux d’Anthropic, et non ceux d’une nouvelle exécution. Considérez l’ensemble comme déclaré par le fournisseur :
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % contre GPT-6 Astra 57,9 % (Anthropic précise que l’exécution d’Opus a utilisé l’effort xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4 % contre GPT-6 Astra 53,3 %
• GDPval-AA v2.1, travail intellectuel — Claude Opus 5.5 1 846 Elo contre GPT-6 Astra 1 542
• AutomationBench — Claude Opus 5.5 40,0 % contre GPT-6 Astra 41,4 % (Astra en tête)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7 % contre GPT-6 Astra 64,6 % (Astra en tête)
• Humanity's Last Exam, avec outils — Claude Opus 5.5 67,7 % contre GPT-6 Astra 57,2 %
Le camp d'OpenAI est plus difficile à aligner, car OpenAI a publié les chiffres d'Astra face à son propre prédécesseur plutôt que face au modèle phare d'Anthropic, et les benchmarks qu'elle a choisis — usage de l'ordinateur, ingénierie front-end, culture générale — n'apparaissent pour la plupart pas du tout dans le tableau d'Anthropic. Ce n'est pas de la malhonnêteté, c'est un comportement de lancement normal, et c'est précisément pourquoi une comparaison construite à partir de deux tableaux de fournisseurs est une comparaison de deux sélections plutôt que de deux modèles. Le seul point sur lequel les deux tableaux s'accordent, c'est qu'Astra est solide en science agentique et en usage de l'ordinateur, et que les deux modèles sont suffisamment proches en codage pour que le choix du harnais puisse faire basculer le résultat.
La lecture indépendante, qu'aucun des deux fournisseurs n'a choisie

Artificial Analysis exécute chaque modèle selon une configuration publiée, donc ses chiffres sont les seuls ici à avoir été produits par le même évaluateur dans les mêmes conditions :
• Indice d'intelligence — Claude Opus 5.5 58, classé n°1 sur 210 vs GPT-6 Astra 53, classé n°6
• Libellé de configuration — Claude Opus 5.5 « Raisonnement adaptatif, effort maximal, repli par défaut », GPT-6 Astra « max »
• Vitesse de sortie — GPT-6 Astra 52,5 tokens/s, dans le bas de sa gamme de prix par rapport à Claude Opus 5.5, non encore publié
• Temps jusqu’au premier token — GPT-6 Astra 352,15 s contre une médiane du classement de 3,83 s ; Claude Opus 5.5 pas encore publié
• Prix — Claude Opus 5.5 4,00 $ en entrée / 20,00 $ en sortie par million contre GPT-6 Astra 10,00 $ / 50,00 $
• Contexte et sortie — GPT-6 Astra : contexte de 1 M et sortie max de 128 K vs Claude Opus 5.5 : 1 M et 128 K
Un écart d'indice de cinq points n'est pas décisif en soi, et il ne doit pas être interprété comme tel — les deux modèles se situent dans la même bande de capacités, ce que signifie « frontière » ce trimestre. Ce que les lignes Astra établissent, c'est que le premium n'achète pas une avance de capacités sur le seul tableau où les deux modèles apparaissent. La ligne de latence est la complication honnête : 352 secondes jusqu'au premier token est la valeur la plus élevée de ce groupe, et de loin, bien qu'elle soit mesurée à effort maximal et qu'un modèle de raisonnement qui réfléchit avant d'émettre paraîtra toujours lent selon cette métrique. Le chiffre de 52,5 tokens/s est le plus transposable, et il est plutôt bas pour un modèle à 10 $/50 $.
Le deuxième prix d'Astra, au-dessus de 272 000 jetons

La grille tarifaire est le point où ces deux offres cessent complètement d'être comparables, car la tarification d'Astra comporte un palier. Les tarifs standard sont de 10,00 $ en entrée, 1,00 $ pour l'entrée mise en cache, 12,50 $ pour l'écriture de cache et 50,00 $ en sortie par million de tokens. Toutefois, dès que vous dépassez 272 000 tokens d'entrée, toute la requête change de tarif — pas seulement l'excédent, l'appel entier — au double des tarifs d'entrée et de cache, et à 1,5 fois le tarif de sortie. Cela place le travail à long contexte à environ 20 $ en entrée et 75 $ en sortie par million de tokens.
Claude Opus 5.5 ne fait pas cela. Anthropic facture 4,00 $ et 20,00 $ avec la fenêtre complète de 1 M de tokens au tarif standard, et déclare explicitement qu'une requête de 900 K tokens est facturée au même tarif par token qu'une requête de 9 K tokens. Ainsi, le ratio mis en avant entre ces deux modèles — Astra coûtant 2,5 fois Opus 5.5 dans les deux sens — n'est pas le ratio qui s'applique aux charges de travail pour lesquelles les deux modèles sont réellement vendus. Sur un agent à long horizon portant un grand contexte de travail, la comparaison est de 20 $/75 $ contre 4 $/20 $, soit un facteur cinq en entrée et près de quatre en sortie. La tarification par lots aggrave la situation plutôt que de la corriger : Opus 5.5 passe de moitié à 2,00 $/10,00 $, tandis que le palier flex d'Astra passe de moitié à 5,00 $/25,00 $ sur une base déjà cinq fois plus élevée dans le cas d'un contexte long.
C'est l'asymétrie la plus déterminante pour la prise de décision dans cette confrontation, et elle est invisible dans tous les tableaux de lancement des deux entreprises, car les deux fournisseurs mettent en avant le tarif affiché. Si vos prompts font moins de 272K tokens, ignorez-la. Si vous construisez un agent qui lit un dépôt ou un ensemble de documents, tarifez-le à 20 $/75 $ avant de comparer quoi que ce soit.
L'accès fait partie de la spécification
Astra est le premier modèle d'OpenAI à franchir le seuil critique de capacité en cybersécurité selon le Preparedness Framework de l'entreprise, et le déploiement reflète cette classification plutôt que la capacité. L'accès a d'abord été ouvert à un ensemble limité d'organisations, l'accès entreprise exige qu'un administrateur l'active avant que les utilisateurs ne le voient, et le modèle livré refuse d'emblée certaines catégories de travail. Claude Opus 5.5 arrive avec une version du même problème dans l'autre sens : il est livré avec le niveau de protection qu'Anthropic réservait auparavant à Claude Fable 5.1, ce qui signifie que la plupart des demandes en cybersécurité sont redirigées vers Claude Opus 4.8 et que le travail en biologie revient à Claude Opus 5, sauf si le compte est vérifié.
Les deux comportements se manifestent au même endroit : votre évaluation. Artificial Analysis qualifie la configuration d'Opus 5.5 de « Default Fallback » précisément parce que les requêtes peuvent atterrir sur un modèle différent de celui que vous avez nommé, et sur les invites liées à la sécurité ou aux sciences de la vie, cela se produit couramment. Si votre charge de travail relève de ces domaines, la chaîne de modèle indiquée dans votre requête ne garantit rien quant au modèle qui a répondu, et vos chiffres de qualité incluront un modèle plus petit sur une fraction inconnue d'appels. Aucun des deux fournisseurs ne cache cela — les deux le documentent — mais aucun titre ne le mentionne non plus.
Choisir entre eux
La décision que cette confrontation pose en réalité est de savoir si une charge de travail à long contexte justifie la tarification par paliers d’Astra, et pour la plupart des équipes, la réponse sera non : Opus 5.5 est moins cher sur chaque ligne sous 272K, nettement moins cher au-dessus, obtient un meilleur score sur l’unique classement indépendant, et atteint 1M de jetons de contexte sans surcoût. Le cas d’Astra est plus restreint et bien réel — raisonnement scientifique, utilisation d’ordinateur et outillage de l’écosystème OpenAI — et si vos évaluations le placent en tête sur ces points, le surcoût est une ligne budgétaire plutôt qu’une erreur.
Là où cela devient concret, c'est dans la manière dont vous confrontez les deux modèles, car une comparaison équitable exige que les deux modèles utilisent la même clé et la même facture. Tous deux sont routables via OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge — Claude Opus 5.5 au tarif de 4,00 $/20,00 $ d'Anthropic et GPT-6 Astra à 10,00 $/50,00 $ — ce qui signifie que la décision des 272K peut être testée sur votre propre trafic plutôt que débattue à partir de deux communiqués de presse. Épingler Astra sur les classes de tâches où il gagne et laisser le basculement automatique prendre en charge le reste est une règle de routage, et une requête qui franchit la limite des 272K peut être envoyée vers un chemin moins coûteux sans modification du code, car la règle réside dans le routeur plutôt que dans votre application.

Qu’est-ce qui changerait la réponse ?
Une chose le ferait : un face-à-face contrôlé à effort égal sur des benchmarks communs. Aucun des deux fournisseurs n’en a publié, et ni l’un ni l’autre n’a intérêt à le faire, ce qui fait de l’indice indépendant la seule comparaison à conditions égales disponible — et cet indice place Opus 5.5 cinq points et cinq rangs au-dessus d’Astra, à moins de la moitié du prix par token. Le contre-argument qui mérite d’être suivi est que les deux modèles ont été évalués à effort maximal, alors qu’Opus 5.5 est livré avec un effort moyen par défaut ; si l’avantage d’Astra sur les travaux scientifiques à long horizon survit à une exécution à effort égal, l’argument en faveur du supplément de prix se renforce au lieu de s’affaiblir. Tant que personne ne réalise ce test, la position défendable est qu’Astra est un spécialiste vendu au prix d’un généraliste, et qu’Opus 5.5 est le généraliste qui se trouve obtenir un meilleur score.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
