
GPT-6 Sol Pro vs Claude Opus 5 : L’échelle d’effort que personne ne met dans le tableau
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
GPT-6 Sol Pro et Claude Opus 5 sont constamment comparés l’un à l’autre, et presque toujours dans la mauvaise configuration. La comparaison qui circule oppose Claude Opus 5 à son effort de raisonnement maximal à GPT-6 Sol Pro à son effort de raisonnement maximal, ce qui produit un écart de trois points sur l’indice neutre et une différence de coût d’un facteur cinq. Placez les deux modèles dans la configuration que leurs propres fournisseurs proposent par défaut — et rappelez-vous que « Pro » dans le premier nom est une configuration de raisonnement, et non un modèle distinct — et l’écart de trois points disparaît entièrement. Ce qui reste, c’est la différence de coût, et c’est la seule partie de l’histoire qui survit au contact d’une facture de production.
Ce n’est pas un artifice de présentation. C’est la conséquence directe de deux échelles d’effort qui ne sont pas calibrées l’une par rapport à l’autre, publiées par deux fournisseurs qui se comparent aux anciens modèles de l’autre.
Ce que sont réellement les deux modèles, avant toute comparaison
GPT-6 Sol est le modèle de raisonnement de milieu de gamme d'OpenAI, en disponibilité générale depuis le 22 septembre 2026, à 2,00 $ par million de tokens d'entrée et 10,00 $ par million de tokens de sortie. Il n'existe aucun identifiant de modèle gpt-6-sol-pro dans la documentation destinée aux développeurs d'OpenAI — la page répertorie une seule entrée Sol, une fenêtre de contexte de 1 050 000 tokens, une entrée maximale de 922 000 tokens, un plafond de sortie de 128 000 tokens, une date limite de connaissances au 20 avril 2026 et une échelle d'effort de raisonnement comportant les niveaux none, low, medium, high, xhigh et max, medium étant la valeur par défaut. « Pro » est une valeur du mode de raisonnement, le même schéma d'alias que la génération GPT-5.6 a établi et dont celle-ci a hérité. Une entrée de catalogue tierce appelée GPT-5.6 Sol Pro existe bel et bien et affiche désormais 2,00 $ et 10,00 $ — les chiffres de GPT-6 Sol — ce qui est un artefact de nommage, et non un produit.
Claude Opus 5 est un véritable modèle d'Anthropic, facturé séparément, généralement disponible depuis le 24 juillet 2026 à 5,00 $ en entrée et 25,00 $ en sortie par million de tokens. Sa fenêtre de contexte est de 1 000 000 de tokens, son plafond de sortie synchrone est de 128 000, et sa propre échelle d'effort — output_config.effort — va de low, medium, high et xhigh à max, avec high comme valeur par défaut. La réflexion est adaptative et activée par défaut, une première pour la famille Opus.
Un fait de plus qui façonne tout ce qui suit, et qu'aucune page de comparaison existante ne mentionne : le propre tableau de cycle de vie d'Anthropic répertorie Claude Opus 5 comme Actif (hérité), avec une bannière de migration pointant vers Claude Opus 5.5, qui a atteint la disponibilité générale le 22 septembre 2026 à 4,00 $ et 20,00 $. Les graphiques de lancement d'OpenAI se comparent encore à Opus 5, et non à 5.5. Le modèle faisant l'objet de la comparaison est l'Opus de la génération précédente.
Les deux lignes de prix, ligne par ligne
Les deux sont des listes de fournisseurs — les chiffres publiés par OpenAI et Anthropic eux-mêmes, transmis sans modification par les plateformes qui les hébergent.
• Entrée — GPT-6 Sol 2,00 $ par million de tokens vs Claude Opus 5 5,00 $ par million de tokens
• Sortie — GPT-6 Sol 10,00 $ par million de tokens vs Claude Opus 5 25,00 $ par million de tokens
• Lecture du cache — GPT-6 Sol 0,20 $ par million de tokens contre Claude Opus 5 0,50 $ par million de tokens ; les deux représentent un taux forfaitaire de 10 % du tarif des entrées non mises en cache
• Écriture de cache — GPT-6 Sol à 2,50 $ par million de jetons pour un TTL unique, contre Claude Opus 5 à 6,25 $ pour un TTL de cinq minutes et 10,00 $ pour un TTL d’une heure ; le TTL plus long est une option qu’OpenAI ne propose pas, et c’est le palier que la plupart des tableaux comparatifs citent par erreur, car c’est celui qui figure sur les fiches du catalogue hébergé
• Gestion du contexte long — GPT-6 Sol refacture une requête qui dépasse son seuil d'entrée à un tarif plus élevé pour la totalité de la requête ; Claude Opus 5 n'applique aucun supplément pour contexte long, si bien qu'une requête de 900 000 tokens est facturée au même tarif par token qu'une requête de 9 000 tokens
• Traitement par lots — GPT-6 Sol dispose d’un endpoint batch avec une remise standard, contre l’API Message Batches de Claude Opus 5 à 50 % de réduction dans les deux sens, et la remise batch d’Anthropic se cumule avec la mise en cache des prompts
• Fenêtre de contexte — GPT-6 Sol 1 050 000 tokens vs Claude Opus 5 1 000 000 tokens
• Sortie maximale — 128 000 tokens pour les deux, Claude Opus 5 portant ce chiffre à 300 000 sur l'API Message Batches sous l'en-tête bêta output-300k-2026-03-24
La combinaison batch + cache est le point le moins abordé de cette liste et celui qui change le plus les calculs. Une remise batch de 50 % combinée à une lecture de cache à un dixième du tarif d'entrée constitue une offre différente d'une remise batch de 50 % seule, et pour les tâches de synthèse longues — où le plafond de sortie batch de 300 000 tokens d'Anthropic s'applique également — elle comble une partie significative d'un écart qui semble infranchissable au prix catalogue.

L’échelle de l’effort est la comparaison réelle.
Voici le chiffre qui devrait figurer dans chacun de ces articles. Sur Artificial Analysis, dont le harnais est le seul neutre à publier une échelle d’effort complète pour les deux modèles, Claude Opus 5 obtient un score de 51 à effort maximal et coûte 5,86 $ par tâche de l’indice. À son réglage élevé par défaut, il obtient 48 et coûte 3,61 $. GPT-6 Sol obtient 48 à effort maximal et coûte 1,06 $ — et 43 à effort élevé pour 0,37 $.
Lisez ces deux lignes ensemble. Claude Opus 5, lorsqu'il tourne au réglage d'effort qu'Anthropic livre par défaut, obtient exactement le même score d'indice que GPT-6 Sol tournant à plein régime. L'écart rapporté par la couverture du lancement — trois points — n'existe que si l'on compare chaque modèle au sommet de son propre curseur, et le sommet du curseur n'est pas le réglage auquel l'un ou l'autre modèle tourne par défaut. L'avantage d'Opus 5 à effort maximal est réel, et son obtention coûte environ cinq fois et demie plus cher par tâche terminée.
Deux mises en garde honnêtes méritent d'être rattachées à ces chiffres, et toutes deux sont absentes des pages qui les citent.
• La version de l’indice évolue. Le score d’Opus 5 a été publié sous les valeurs 61, 63, 54 et 51 au fil des révisions successives de l’indice Artificial Analysis depuis juillet. Aucune de ces valeurs n’est fausse ; chacune d’elles est erronée sans son libellé de version. Le 51 ci-dessus correspond au classement actuel, et il n’est pas comparable à un 61 cité dans un article du jour du lancement.
• Les échelles d’effort ne sont pas calibrées entre fournisseurs. Un « high » sur un modèle ne correspond pas à la même quantité de réflexion qu’un « high » sur l’autre. Des scores identiques à des réglages nominalement différents constituent une preuve quant au coût, et non une équivalence de capacité.
Là où le dossier indépendant est plus mince qu'il n'y paraît.
Claude Opus 5 a huit semaines de mesures tierces derrière lui et un ensemble de chiffres de lancement rapportés par le fournisseur, clairement étiquetés comme tels — Frontier-Bench v0.1 à 43,3 %, ARC-AGI-3 à 30,2 %, GDPval-AA v2 à 1 861 Elo. Chacun de ces chiffres a été mesuré par rapport à GPT-5.6 Sol ou Claude Fable 5, et non par rapport à GPT-6 Sol. Il n'existe nulle part de résultat de harnais partagé qui mette Opus 5 et GPT-6 Sol face à face sur les propres benchmarks d'Anthropic, et la fiche système d'Anthropic admet que le modèle n'est globalement pas plus capable que Claude Fable 5.
Le bilan indépendant comporte aussi une réserve en sens inverse. Dans l’évaluation AA-Omniscience d’Artificial Analysis, le taux d’hallucination d’Opus 5 est de 50 %, en hausse de quatorze points par rapport à Opus 4.8 — la cause documentée étant que les refus sont tombés d’environ 23 % à 7 %, de sorte que le modèle répond à davantage de questions et se trompe sur un plus grand nombre d’entre elles. Vals AI a par ailleurs indiqué qu’Opus 5 et Fable 5 ont utilisé Opus 4.8 comme solution de repli en cas de refus lors des exécutions de Terminal-Bench ; le fait de reclasser les neuf réussites concernées comme des échecs fait passer Opus 5 de 84,64 % à 81,27 %. Ce ne sont pas là des constats disqualifiants, mais un article qui soutient qu’Opus 5 est le choix le plus fiable doit les joindre.

Le bilan indépendant de GPT-6 Sol se réduit, cette semaine, à un seul chiffre : le score d’indice ci-dessus, mesuré à effort maximal, avec dix-huit mois de sorties de modèles derrière lui en tests cumulés par des tiers. Cette asymétrie — huit semaines d’examen minutieux contre un seul jour — est la raison honnête pour laquelle un acheteur pourrait encore payer la prime quintuple, et c’est une meilleure raison que le chiffre phare de trois points.
Là où une couche de routage modifie la décision
Claude Opus 5 figure au catalogue d'OrcaRouter à 5,00 $ en entrée, 25,00 $ en sortie, 0,50 $ pour une lecture de cache et 10,00 $ pour une écriture de cache par million de jetons, avec une fenêtre de 1 000 000 de jetons, un plafond de sortie de 128 000 jetons et les deux points de terminaison /v1/chat/completions et /v1/messages — tarification catalogue du fournisseur répercutée, sans marge ajoutée, donc un changement de tarif d'Anthropic est effectif chez nous le jour même où il l'est chez eux. Le chiffre d'écriture de cache de la fiche du modèle correspond au tarif pour un TTL d'une heure ; le palier de cinq minutes d'Anthropic est de 6,25 $, et citer l'un sans préciser lequel, c'est ce qui fait que les deux chiffres finissent par ressembler à une contradiction.
GPT-6 Sol ne fait pas partie de nos itinéraires, donc rien ici ne constitue une affirmation sur son prix via nous.

Ce qu'un point de terminaison unique apporte réellement dans cette confrontation, c'est la capacité de tenir les deux réponses à la fois. L'argument en faveur d'Opus 5 et l'argument en faveur de Sol dépendent tous deux de l'effort, et l'effort est un paramètre par requête, non un contrat. Une équipe qui route les deux modèles derrière une seule clé avec basculement automatique peut envoyer le travail qui exige le plafond d'effort maximal d'Opus 5 vers Opus 5 et le palier de volume vers Sol en effort moyen, sans une seconde intégration ni un second ensemble de limites de débit. Le DSL de routage intègre cette décision dans l'appel plutôt que dans un projet de migration — ce qui compte ici tout particulièrement, car la bonne réponse pour cette paire change avec la requête, et non avec le trimestre.
La règle de décision
• Travail en volume à un seuil de qualité connu — GPT-6 Sol avec un effort moyen ou élevé. Quarante points d’indice à 0,25 $ par tâche, c’est l’offre crédible la moins chère de ce tableau, et le curseur d’effort est un paramètre documenté, pas une supposition.
• Travail qui nécessite le haut de la gamme de capacités et peut se le permettre — Claude Opus 5 en xhigh ou max. Trois points d’indice au-dessus du plafond de Sol, entre 4,88 $ et 5,86 $ par tâche, et le seul des deux à avoir un plafond de sortie par lots de 300 000 tokens.
• Tâches par lots sur de grands corpus — Claude Opus 5, sur l'argument structurel plutôt que sur celui du coût par token. Aucun surcoût pour le contexte long, une remise sur les lots qui se cumule avec la mise en cache, et un TTL de cache d'une heure pour les préfixes qui dépassent une fenêtre de cinq minutes.
• Tout cas où une mauvaise réponse coûte cher — ni l’un ni l’autre, d’après les données actuelles. Le taux d’hallucination d’Opus 5 a grimpé de quatorze points lors de cette version, et le bilan tiers de Sol ne repose que sur un seul chiffre.
• Si la comparaison qui vous a été montrée était « Opus 5 max versus Sol max » — relancez-la à l’effort par défaut avant de décider. C’est là que la décision se prend réellement, et c’est l’unique configuration que la couverture existante ne vous montre jamais.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
