
Claude Opus 5.5 vs GPT-6 Astra : un test gustatif qui a dépassé les benchmarks
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Quelqu'un a demandé à Claude Opus 5.5 de réaliser une courte vidéo sur un laboratoire rival qui résout les équations de Navier-Stokes, a publié le résultat, puis a écrit la phrase qui rend cette comparaison intéressante : le modèle est « très sympa », il a « un excellent goût », et c'est le premier Claude depuis Opus 4.7 qu'ils ont réellement envie d'utiliser intensivement — mais ils gardent tout de même GPT-6 Astra et GPT-5.6 Sol comme principaux moteurs, parce que leur travail est très orienté recherche. Cela fait trois affirmations en un seul post, et elles tirent dans des directions différentes. Un modèle peut être la chose la plus agréable avec laquelle travailler sans être celui vers lequel on achemine le trafic de production. La question intéressante n'est pas de savoir quel modèle est le meilleur. C'est de savoir laquelle de ces deux conclusions résiste au contact des chiffres, et laquelle s'avère être une affirmation sur le goût.
Ce billet est le rapport d’un praticien, pas une campagne de benchmark — considérez-le comme un signal sur la sensation que donne le modèle dans un travail créatif et ouvert, et non comme une preuve de ses capacités. Toutes les données chiffrées ci-dessous sont étiquetées avec l’indication de leur auteur.
Ce qu'un test de goût peut vous dire et ne peut pas vous dire
L’artefact compte ici. Faire une vidéo sur un résultat mathématique n’est pas une tâche de programmation avec un critère binaire de réussite ou d’échec. Il n’y a pas d’étape de compilation, pas de suite de tests, pas de harnais Terminal-Bench qui évalue si le résultat vaut quelque chose. Le modèle devait choisir un angle, décider quoi montrer, garder le tout cohérent et s’arrêter. Quand un praticien dit qu’un modèle a « un excellent goût », c’est ce qu’il décrit : un jugement sur l’étendue et l’accentuation qui se manifeste dans un travail où la spécification est délibérément vague.
C'est une véritable capacité, et c'est celle que les suites de benchmarks mesurent le moins bien. C'est aussi pourquoi la même personne peut louer un modèle sans passer à celui-ci. Le goût, c'est ce que vous voulez lorsque vous explorez. Ce n'est pas ce que vous voulez lorsque vous avez 200 000 lignes de code à auditer et une facture à justifier.
Le cadrage de lancement propre à Anthropic pointe vers la même faculté, en prose plutôt qu’en vidéo : Claude Opus 5.5 est présenté comme écrivant moins « Claudish » — moins de préambules, moins d’atténuations, une plus grande propension à énoncer d’abord l’idée principale. Des évaluations de lisibilité indépendantes étayent l’orientation de cette affirmation, même lorsqu’elles divergent sur l’ampleur. Le fournisseur rapporte également qu’un test interne de vérification des faits réussit 16 tentatives sur 18, contre zéro sur 18 pour Claude Fable 5.1 comme pour Claude Opus 5 ; ce chiffre est propre à Anthropic, non reproduit, et doit être lu comme une affirmation plutôt qu’un résultat.
Deux tableaux de scores, un désaccord qui compte

Sur les benchmarks bruts publiés, Claude Opus 5.5 devance GPT-6 Astra dans la majorité des cas. Le problème, c'est que les deux sources les plus citées ne s'accordent pas sur l'ampleur de l'écart.
Le tableau de lancement d’Anthropic place Claude Opus 5.5 à 66,4 % sur Terminal-Bench 4.0, avec GPT-6 Astra à 57,9 % et Claude Fable 5.1 à 55,8 %. C’est une avance de 8,5 points annoncée par le fournisseur en codage agentique — le genre de marge qui clôt un débat dans une présentation marketing. Artificial Analysis, qui exécute son propre harnais, a mesuré Claude Opus 5.5 à 59,6 % sur le même benchmark : à égalité avec GPT-6 Astra en effort xhigh, et environ 11 points au-dessus de Claude Opus 5. L’avance est réelle dans les deux lectures. Son ampleur, non.
Là où les deux modèles échangent leurs places est plus utile que là où ils ne le font pas :
• Terminal-Bench 4.0 (codage agentique) — Claude Opus 5.5 66,4 % selon le tableau d'Anthropic lui-même, 59,6 % selon Artificial Analysis ; GPT-6 Astra 57,9 %.
• Humanity's Last Exam, avec outils — Claude Opus 5.5 : 67,7 % selon le fournisseur, 61,4 % en mesure indépendante ; GPT-6 Astra : 57,2 %.
• GDPval-AA v2.1 (travail intellectuel réel dans 44 métiers) — Claude Opus 5.5 1 846 Elo ; GPT-6 Astra 1 542 Elo. Ces deux chiffres proviennent du classement indépendant d’Artificial Analysis, et non du fournisseur.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6 % contre Claude Opus 5.5 58,7 %. C'est une nette victoire d'Astra, et il s'agit du benchmark agentique à saveur scientifique.
• AutomationBench — GPT-6 Astra 41,4 % contre Claude Opus 5.5 40,0 %. Écart mince, mais Astra encore.
• FrontierCode v1.1 — Claude Opus 5.5 54,4 % vs GPT-6 Astra 53,3 %. À un point près.
Lisez cette liste comme le ferait le praticien. Les charges de travail à forte intensité de recherche — celles qui comportent une composante scientifique ou littéraire, celles qui exécutent une longue boucle d’utilisation d’outils et qui exigent que le modèle garde pied — sont exactement là où GPT-6 Astra tient bon. Les classements de travail intellectuel et de codage où Claude Opus 5.5 caracole en tête sont ceux que vous montreriez si votre métier était de livrer des logiciels. Les deux personnes de cette conversation lisent correctement leur propre benchmark. Elles ne font que lire des benchmarks différents.
Le réglage de l'effort fait plus de travail que le modèle
Il y a une seconde raison, moins flatteuse, à la faiblesse des marges affichées. Les comparaisons entre fournisseurs ne sont pas effectuées avec les mêmes paramètres.
Les chiffres publiés de Claude Opus 5.5 proviennent d'une configuration d'effort de raisonnement extra-élevé (xhigh), face à GPT-6 Astra en high. Les exécutions indépendantes d'Artificial Analysis placent les deux modèles en xhigh, et l'écart en codage disparaît — l'avance de 8,5 points annoncée par le fournisseur se transforme en égalité. Il ne s'agit pas d'une accusation de faute ; c'est ce qui se produit lorsqu'un fournisseur choisit la configuration qui met le mieux en valeur son modèle et qu'un laboratoire indépendant choisit la configuration qui correspond à celle de la concurrence. Avant de migrer une charge de travail sur la foi d'un tableau de benchmarks, vérifiez à quel réglage d'effort il a été exécuté, car la réponse est souvent « celui qui flatte ».
La facture de tokens raconte la même histoire sous un autre angle. Les propres supports de lancement d’Anthropic indiquent que Claude Opus 5.5 dépense de l’ordre de 119 000 tokens par problème, dont environ 84 000 consacrés à la réflexion, tandis que GPT-6 Astra résout des problèmes comparables en environ 27 000 tokens. Les tokens de réflexion sont facturés comme des tokens de sortie. Un modèle qui utilise quatre fois plus de tokens, à un cinquième du prix de sortie, revient à peu près au même — et c’est sans compter que le modèle le moins cher est souvent celui que vous auriez de toute façon été prêt à faire tourner avec un réglage d’effort plus élevé.
Une mise en garde supplémentaire concerne spécifiquement le côté Claude Opus 5.5 : le routage de sécurité d’Anthropic peut orienter certaines requêtes liées à la cybersécurité et à la biologie vers un chemin plus restrictif, ce qui fait baisser les scores publiés pour ces évaluations par rapport à ce que produirait le modèle sous-jacent. Si votre travail touche à ces domaines, l’écart entre le benchmark et votre expérience sera réel, et il ira dans le sens d’un benchmark optimiste.
Ce que coûte une tâche réelle sur chacun

Claude Opus 5.5 est le modèle le moins cher sur la grille tarifaire, et l'écart n'est pas mince :
• Claude Opus 5.5 — 4,00 $ par million de jetons d'entrée, 20,00 $ par million de jetons de sortie, 0,20 $ par million de jetons d'entrée mis en cache, 5,00 $ par million d'écritures dans le cache. Contexte de 1 M de jetons, sortie maximale de 128 k.
• GPT-6 Astra — 10,00 $ par million de jetons d’entrée, 50,00 $ par million de jetons de sortie, 1,00 $ par million de jetons d’entrée mis en cache, 12,50 $ par million d’écritures de cache. Au-delà de 272 000 jetons d’entrée dans une seule requête, l’ensemble de la requête est refacturé à 20,00 $ en entrée et 100,00 $ en sortie ; le palier par lots est de 5,00 $/25,00 $.
Donc Claude Opus 5.5 est 2,5 fois moins cher en entrée et 2,5 fois moins cher en sortie, avec l'entrée mise en cache cinq fois moins chère. Si vos tâches sont similaires en tokens, c'est toute la décision, et la question du goût n'est que décoration.
La mise en garde ci-dessus sur l’utilisation des jetons empêche que ce soit aussi simple, et la nouvelle tarification à contexte long de GPT-6 Astra est l’autre piège. Franchissez 272 000 jetons d’entrée dans une seule requête et la requête entière — pas seulement l’excédent — bascule vers le tarif du contexte long. Une charge de travail de recherche qui entasse un grand corpus dans un seul appel est exactement le profil qui le déclenche. Le traitement par lots à moitié prix est l’échappatoire légitime, et il se trouve dans la file d’attente plus lente.
Le résumé honnête, c'est que le tableau des coûts s'inverse selon ce que l'on fait. Pour une tâche où les deux modèles utilisent des nombres de tokens comparables, Claude Opus 5.5 l'emporte sur le prix avec une large marge. Pour une longue boucle de recherche agentique où les comptes de tokens divergent comme le montrent les propres supports de lancement d'Anthropic, les deux convergent — ce qui est un titre bien moins excitant qu'une réduction de coûts de 40 %, et plus proche de ce que rapportait le praticien.
Pourquoi l'utilisateur qui fait beaucoup de recherches n'a pas basculé
Recoupez les éléments, et la phrase « je préfère toujours Astra » cesse d’être en contradiction avec celle de « l’excellent goût ». C’est la même observation, depuis une autre place.
Les charges de travail nommées par l’utilisateur sont longues, ouvertes, recourent à des outils et coûtent cher par exécution. Sur celles-ci, GPT-6 Astra domine les classements en science et en automatisation, utilise une fraction des jetons de réflexion et — selon une mesure indépendante — se situe à égalité en programmation lorsque les deux modèles tournent au même niveau d’effort. Les avantages de Claude Opus 5.5 se concentrent dans le travail où l’on peut voir le résultat et le juger : la prose, les choix de conception, le cadrage d’un brief ambigu, le fait de décider ce qu’une vidéo sur Navier-Stokes devrait réellement montrer. C’est du goût, et le goût est exactement la partie qui n’apparaît pas sur un axe de benchmark.
Si vous espériez un verdict selon lequel un modèle l’emporte, les preuves ne le soutiennent pas. La version défendable est plus étroite : Claude Opus 5.5 est le meilleur modèle pour les travaux où le jugement est le goulot d’étranglement, GPT-6 Astra est le meilleur modèle pour les travaux où un effort soutenu en contexte long est le goulot d’étranglement, et l’écart de prix entre eux se réduit à presque rien sur le second type de travail. Il s’agit d’une décision de routage, pas d’une conversion.
Exécuter les deux sans migration

C'est ici que les deux modèles cessent d'être un choix exclusif. GPT-6 Astra est dès aujourd'hui sur OrcaRouter au prix catalogue d'OpenAI lui-même — 10,00 $ en entrée, 50,00 $ en sortie, 1,00 $ en lecture en cache, 12,50 $ en écriture en cache — avec 0 % de marge, le prix catalogue du fournisseur répercuté tel quel. Cela signifie qu'un changement de tarif du fournisseur arrive de notre côté le jour même, plutôt qu'au moment où un revendeur se synchronise.
Claude Opus 5.5 est accessible via l'API propre d'Anthropic et plusieurs plateformes tierces ; nous ne le répertorions pas comme quelque chose que nous servons, et vous devriez être sceptique face à quiconque affirme le contraire avant que le modèle ne se soit propagé. Ce que vous pouvez faire aujourd'hui, c'est placer les deux modèles derrière une seule clé et une seule forme de point de terminaison, et router en fonction de la charge de travail plutôt que selon les préférences : envoyez la requête ouverte, à forte composante de jugement, à Claude Opus 5.5 et la longue boucle de recherche à GPT-6 Astra, sans maintenir deux contrats ni deux intégrations client.
Le basculement automatique est ce qui rend ce test sans risque. Un nouveau modèle n'est pas encore un chemin de production, et le routage via un seul point de terminaison signifie qu'un incident chez le fournisseur ou une limite de débit déplace la requête plutôt que de la faire échouer. Si vous voulez savoir si l'écart de goût est réel sur votre propre travail, c'est la façon la moins coûteuse de le découvrir — exécutez-le à côté de ce que vous avez déjà plutôt qu'en le remplaçant, et laissez votre propre suite décider au lieu des tableaux de lancement.
La question à laquelle les benchmarks ne peuvent pas répondre
Deux choses méritent d’être observées, et aucune des deux n’est un autre point de référence.
Le premier point est de savoir si l’asymétrie des réglages d’effort se résout. À l’heure actuelle, un tableau de fournisseur en xhigh face à un concurrent en high produit une avance de 8,5 points qu’un test indépendant à réglages identiques transforme en égalité. À mesure que des laboratoires indépendants publient des exécutions à réglages appariés sur les classements science et automatisation où GPT-6 Astra est actuellement en tête, cette situation peut évoluer dans un sens comme dans l’autre — et elle évoluera en fonction des preuves plutôt que du cadrage de quiconque.
Le second est la question de l’efficacité des tokens. Si le surcoût de réflexion de Claude Opus 5.5 diminue dans une version mineure, son avantage tarifaire de 2,5x cesse d’être compensé et l’argument du prix l’emporte carrément. Dans le cas contraire, le praticien qui a conservé GPT-6 Astra comme moteur principal n’est pas en retard sur le cycle d’actualité. Il a correctement évalué sa propre charge de travail, et le tableau de lancement ne la mesurait tout simplement pas.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
