
GPT-6 Sol vs GPT-5.6 Sol : un point d'indice, moitié prix, et une régression que personne n'a annoncée
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 610 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 189 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Oui, effectuez la mise à niveau — mais lisez le deuxième paragraphe avant de le faire. GPT-6 Sol, sorti le 22 septembre 2026, obtient un score de 48 à l’Intelligence Index d’Artificial Analysis. GPT-5.6 Sol, sorti le 9 juillet 2026, obtient un score de 47. Un point. Le modèle qui l’a remplacé coûte moitié moins : 2,00 $ par million en entrée et 10,00 $ par million en sortie, contre 4,00 $ et 20,00 $. Sur les chiffres phares, c’est la décision de mise à niveau la plus facile de la gamme actuelle, et la baisse de prix est réelle, permanente, et la plus importante réduction unique que le fournisseur ait appliquée à un modèle phare.
La complication est que l’évaluation d’Artificial Analysis de GPT-6 Sol a elle-même révélé un mélange de gains et de régressions, plutôt qu’une progression nette. Il y a des régressions sur GDPval-AA v2.1. Il existe aussi un palier de retarification pour contexte long au-delà de 272 000 jetons d’entrée, qui fait environ doubler le tarif d’entrée et augmente de moitié celui de sortie — et 272K correspond exactement à la plage où GPT-5.6 Sol présente une force publiée. Une migration qui ressemble à une simple division par deux de votre facture peut, sur le trafic à contexte long, se rapprocher d’un jeu nul, assorti d’un compromis de capacité.
Ce que signifie réellement un gain d’un point de l’Index
Les deux modèles ont été mesurés sur la même carte, version 4.3.2, ce qui en fait la comparaison la plus propre de toute la série GPT-6 Sol — aucune différence de banc d’essai, aucune incohérence entre fournisseur et évaluation indépendante, un seul laboratoire mesurant deux modèles d’un même fournisseur.
• AA Intelligence Index — GPT-6 Sol 48, classé 18e sur 212 contre GPT-5.6 Sol 47, classé 19e sur 212
• Coût par tâche Index — GPT-6 Sol environ la moitié de GPT-5.6 Sol
• Vitesse de sortie — GPT-6 Sol 104,4 jetons/s vs GPT-5.6 Sol 72,6 jetons/s
• Temps jusqu'au premier token — GPT-6 Sol 107,18 s contre GPT-5.6 Sol, plus rapide, les deux par rapport à une médiane de 3,87 s du classement
• Prix d'entrée — GPT-6 Sol 2,00 $ par 1 M vs GPT-5.6 Sol 4,00 $ par 1 M
• Prix de sortie — GPT-6 Sol 10,00 $ par million vs GPT-5.6 Sol 20,00 $ par million
• Entrée mise en cache — GPT-6 Sol environ 90 % de réduction par rapport à GPT-5.6 Sol, 0,40 $ par million
• Tarif par lot — GPT-6 Sol non publié vs GPT-5.6 Sol 2,50 $ / 15,00 $
• Palier de contexte long — GPT-6 Sol applique un tarif différent au-delà de 272K d’entrée, tandis que GPT-5.6 Sol n’a pas de palier équivalent
• Fenêtre de contexte — GPT-6 Sol 872 K selon AA, 1,05 M annoncé contre environ 1,05 M à 1,1 M pour GPT-5.6 Sol
• Sortie maximale — 128K sur les deux
• Publié — GPT-6 Sol 2026-09-22 vs GPT-5.6 Sol 2026-07-09

Regardez les deux courbes de vitesse ensemble. GPT-6 Sol génère une sortie environ 44 % plus rapidement que son prédécesseur, mais il est beaucoup plus lent à produire un premier token — 107,18 secondes contre une médiane du classement de 3,87. GPT-5.6 Sol n’est pas non plus un modèle rapide selon les normes du classement, mais il n’est pas dans cette catégorie. Si vous avez migré vers GPT-5.6 Sol pour un produit interactif, GPT-6 Sol n’est pas un remplacement direct, et c’est une régression fonctionnelle indépendante de tout benchmark.
Une ligne est discrètement favorable : le tarif standard de GPT-6 Sol, à 2 $/10 $, est inférieur au tarif batch de GPT-5.6 Sol, à 2,50 $/15 $. Même le palier remisé de l’ancien modèle est plus cher que le prix catalogue du nouveau. C’est la preuve la plus solide que la baisse est structurelle et non promotionnelle.
La régression est la partie intéressante
Artificial Analysis a constaté que GPT-6 Sol réduit à peu près de moitié le coût par tâche, tout en produisant un mélange de gains et de régressions. GDPval-AA v2.1 est la régression expressément désignée. Par ailleurs, GPT-5.6 Luna d'OpenAI a lui aussi régressé sur le Coding Agent Index — ce qui suggère un schéma récurrent dans cette génération plutôt qu'un échec isolé sur un seul modèle.
Cela mérite d’être pris au sérieux précisément parce qu’il s’agit d’un constat indépendant. Les documents de lancement d’OpenAI sont construits autour du coût par tâche et des lignes de benchmark qu’il a sélectionnées ; Artificial Analysis n’a aucun produit à vendre et rapporte ce que son banc d’évaluation a produit. Un modèle moins cher et à peu près équivalent sur le composite, mais mesurablement moins bon sur des sous-tâches précises, n’est pas un modèle strictement meilleur. C’est un point différent de la frontière.
En pratique : si votre charge de travail a fortement la forme de GDPval-AA — du travail intellectuel à valeur économique, le type de tâche que ce benchmark a été conçu pour chiffrer — alors le gain composite d'un point ne vous couvre pas, et c'est la régression qui est le chiffre qui compte. Si votre charge de travail est générale, la réduction de moitié du coût par tâche est le chiffre qui compte, et le composite indique que vous n'avez rien sacrifié de mesurable.
Où GPT-5.6 Sol gagne encore
GPT-5.6 Sol dispose d'un résultat publié en matière de récupération en contexte long auquel GPT-6 Sol n'oppose rien d'équivalent : MRCR v2, 8-needle, 91,5 % dans la plage allant de 256K à 512K. Il s'agit d'un chiffre d'exactitude de récupération dans la bande où la grille tarifaire de GPT-6 Sol change.
Mettez les deux faits côte à côte. Au-delà de 272 000 jetons d'entrée, l'ensemble de la requête de GPT-6 Sol est refacturé à environ 4 $ en entrée et 15 $ en sortie. C'est à peu près l'ancien tarif de GPT-5.6 Sol en entrée et les trois quarts de celui-ci en sortie — ainsi, l'économie de 50 % pour laquelle vous avez migré tombe à environ 0 % en entrée et 25 % en sortie, exactement dans la plage de contexte où GPT-5.6 Sol présente un avantage documenté et où GPT-6 Sol n'a pas d'équivalent publié.
Les autres résultats publiés de GPT-5.6 Sol restent respectables et constituent la raison pour laquelle certaines équipes ne changeront pas :
• Dernier examen des agents — GPT-5.6 Sol 53.6
• Terminal-Bench 2.1 — GPT-5.6 Sol 88,8 / 88,0
• SWE-Bench Pro — GPT-5.6 Sol 64.6
• OSWorld 2.0 — GPT-5.6 Sol 62,6
• BrowseComp — GPT-5.6 Sol 90,4
• GDPval-AA v2 — GPT-5.6 Sol 1747,8 Elo
• HLE — GPT-5.6 Sol 49,5
• MRCR v2, 8-aiguille — GPT-5.6 Sol 91,5 % de 256K à 512K
Ces données sont rapportées par OpenAI. Notez que BrowseComp à 90,4 et le chiffre du MRCR sont les deux les plus difficiles à remplacer : les agents de recherche web et la récupération à long contexte sont des charges de travail où un modèle vieux de deux mois avec un chiffre publié est un pari plus sûr qu’un nouveau modèle sans mesure équivalente.
Ce que GPT-6 Sol apporte qui ne figure pas sur la grille tarifaire
L'essentiel, c'est le prix, mais trois autres choses ont changé.
Premièrement, le plafond de contexte. GPT-6 Sol est répertorié à 872 000 tokens par Artificial Analysis, contre une affirmation de 1,05 M ailleurs dans les documents d’OpenAI, avec 922 K d’entrée maximale. GPT-5.6 Sol se situe autour de 1,05 M à 1,1 M selon la source. Sur le papier, c’est un léger recul en termes de fenêtre utilisable — avec la réserve que c’est la limite de palier de 272 K, et non le plafond, qui régit le coût.
Deuxièmement, la disponibilité. GPT-6 Sol est disponible dans l'API et dans ChatGPT Work et Codex sur Plus, Pro, Business, Enterprise et Edu — et les administrateurs Enterprise doivent l'activer avant que les utilisateurs puissent le voir. Il n'est pas disponible dans ChatGPT Chat. GPT-5.6 Sol a fait l'objet d'un déploiement plus large. Si le chemin d'accès de votre équipe passe par un administrateur d'entreprise, la migration n'est pas qu'un simple changement de code.
Troisièmement, le déploiement d’un nouveau modèle phare signifie généralement que l’ancien devient l’option de repli moins chère plutôt que d’être retiré. GPT-5.6 Sol à 4 $/20 $ reste un excellent modèle avec 47 sur l’Index, et pour les travaux de récupération à long contexte, il dispose d’un chiffre publié que GPT-6 Sol n’a pas.
Une migration qui coûte moins qu'il n'y paraît
La raison pour laquelle cette mise à niveau en particulier est facile, c'est que les deux modèles viennent du même fournisseur, ont la même structure d'API et sont adjacents dans le classement — ce qui signifie que la migration consiste en un changement de chaîne de modèle plutôt qu'en une réarchitecture, et le chemin de repli est déjà dans votre code. GPT-5.6 Sol est disponible sur OrcaRouter au prix catalogue d'OpenAI, selon le modèle de répercussion qui rend un changement de prix d'OpenAI effectif de notre côté le jour même, plutôt qu'après qu'un revendeur a renégocié.
GPT-6 Sol ne figure pas dans notre catalogue au moment où nous écrivons ces lignes — il est accessible via l'API d'OpenAI. La forme honnête d'une migration est donc une route avec GPT-5.6 Sol derrière elle, sur la même clé : diriger le nouveau trafic vers GPT-6 Sol, garder le modèle précédent à une modification de configuration de distance, et laisser le basculement automatique couvrir la période où la disponibilité d'un nouveau fleuron n'est pas encore stabilisée. Pour un modèle vieux de deux jours, précédé d'une option d'activation Enterprise et assorti d'un palier de contexte long qui change l'économie au-delà de 272 K tokens, garder la génération précédente encore câblée n'est pas de la prudence — c'est la différence entre un mauvais après-midi et une mauvaise semaine.

La liste de contrôle de migration
Mesurez votre distribution réelle de contexte avant toute autre chose. Si le 95e percentile de vos requêtes se situe sous 272 000 jetons d'entrée, migrez — l'économie est un véritable 50 % des deux côtés de la facture, le coût par tâche est divisé par deux, et l'indice composite dit que vous n'avez rien sacrifié. Si une part significative du trafic se situe au-dessus de cette ligne, modélisez le palier avec soin : à environ 4 $/15 $, l'avantage sur les 4 $/20 $ de GPT-5.6 Sol est de 25 % en sortie et nul en entrée, et vous le payez par la perte d'un résultat documenté de récupération à long contexte.
Vérifiez si quelqu'un attend le premier token. 107 secondes représentent environ vingt-huit fois la médiane du tableau de bord et c'est le mode de défaillance qui apparaîtra en premier en production. Tout ce qui implique un humain à l'autre bout devrait rester sur GPT-5.6 Sol ou être routé ailleurs.
Vérifiez ensuite le chemin d'activation. Les forfaits Enterprise exigent qu'un administrateur active GPT-6 Sol, et celui-ci est totalement absent de ChatGPT Chat. Confirmez que vos utilisateurs peuvent réellement y accéder avant d'annoncer une migration en interne.
Enfin, surveillez GDPval-AA v2.1 sur vos propres évaluations pendant le premier mois. Le laboratoire indépendant y a trouvé une régression, et un gain composite d’un point ne vous dit pas si votre ensemble de tâches spécifique a progressé ou régressé. Lancez vos évaluations sur les deux modèles avant de basculer, pas après.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
