
GPT-6.1 Sol vs GPT-5.6 Sol : quatre points et demi d'indice, la moitié de la facture, deux régressions
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
OpenAI a publié GPT-6.1 Sol le 29 septembre 2026, onze semaines après GPT-5.6 Sol, sorti le 9 juillet 2026 comme fleuron de la génération précédente. Les deux sont toujours en vente, les deux peuvent toujours être appelés, et l'écart entre eux dans le classement neutre est de 4,8 points — 51,8 contre 47,0 sur l'Intelligence Index d'Artificial Analysis, tous deux mesurés à effort de raisonnement maximal sur la même suite de dix évaluations. La différence de prix est bien plus importante que la différence de score : 0,72 $ par tâche d'indice complétée contre 1,99 $, et 2,00 $/10,00 $ par million de jetons contre 4,00 $/20,00 $. C'est la version courte. La version longue, c'est que la mise à niveau n'est pas uniforme, et que deux des évaluations ont reculé.
Ce qu’est chaque modèle, et ce qui a remplacé quoi
GPT-5.6 Sol était le haut de la gamme 5.6 — un modèle fermé, uniquement disponible via API, avec une fenêtre de contexte de 1 050 000 tokens, un plafond de sortie de 128 000 tokens, une entrée texte, image et fichier, et une échelle de raisonnement allant de aucun à max. Il était décrit par OpenAI comme le niveau conçu pour les tâches les plus difficiles : des flux de travail agentiques à long horizon, de l'ingénierie logicielle multi-fichiers, du raisonnement profond, et son prix était en conséquence de 4,00 $ et 20,00 $ par million de tokens, avec une entrée mise en cache à 0,40 $ et des écritures de cache à 5,00 $. Au-delà de 272 000 tokens d'entrée, son tarif passait à 8,00 $ et 30,00 $, et il comportait un niveau Batch à 2,50 $ et 15,00 $.
GPT-6.1 Sol est le modèle de milieu de gamme de la génération suivante : en dessous de GPT-6 Astra, au-dessus de GPT-6 Luna, et désormais le modèle vers lequel OpenAI oriente les développeurs soucieux des coûts. Il conserve la fenêtre de 1 050 000 jetons et le plafond de sortie de 128 000 jetons, prolonge la date limite de connaissances du 20 avril au 30 avril 2026, et réduit l'échelle d'effort de six échelons à cinq — low, medium (par défaut), high, xhigh, max. La valeur none que GPT-5.6 Sol acceptait renvoie désormais une erreur, et les conseils de migration d'OpenAI précisent explicitement que la substitution est low, et non une mise à niveau silencieuse.
Cela mérite qu'on s'y attarde, car c'est le seul changement de la version qui coûte de l'argent plutôt que d'en économiser. Un pipeline qui avait recours à la valeur aucun pour obtenir un appel bon marché, rapide et sans raisonnement ne dispose plus de cette configuration, sur aucune des deux familles de modèles. L'échelon le moins cher sur GPT-6.1 Sol est un échelon de raisonnement, et les tokens de raisonnement sont facturés comme des tokens de sortie, que vous puissiez les voir ou non.
L'échelle, échelon par échelon
L'organisme indépendant publie un score et un coût d'exécution pour chaque réglage d'effort sur les deux modèles, ce qui transforme la comparaison directe en quelque chose de plus utile qu'une simple confrontation. Alignés sur des réglages équivalents :
• Échelle d’effort, GPT-6.1 Sol — max 51,8 à 0,72 $ par tâche d’index ; xhigh 51,0 à 0,39 $ ; high 50,2 à 0,32 $ ; medium (par défaut) 47,8 à 0,21 $ • Vitesse de sortie — 59,7 tokens par seconde pour GPT-6.1 Sol vs 87,8 pour GPT-5.6 Sol
• Temps jusqu’au premier chunk — 332 secondes pour GPT-6.1 Sol vs un chiffre plus rapide pour GPT-5.6 Sol, contre une médiane du classement proche de 4 secondes
• Tokens de sortie lors de l’exécution sur l’index — 67,2 millions pour GPT-6.1 Sol vs 90,0 millions pour GPT-5.6 Sol
• Prix d’entrée / de sortie — 2,00 $ / 10,00 $ vs 4,00 $ / 20,00 $
• Entrée mise en cache — 0,10 $ vs 0,40 $ ; écritures en cache 2,50 $ vs 5,00 $
• Tarif par lot — non publié pour GPT-6.1 Sol vs 2,50 $ / 15,00 $ pour GPT-5.6 Sol
• Palier de contexte long — au-dessus de 272 000 tokens d’entrée, GPT-6.1 Sol passe à 4,00 $ / 15,00 $ pour toute la requête vs 8,00 $ / 30,00 $ pour GPT-5.6 Sol
• Plancher d’effort — low vs none
Deux choses ressortent de cette liste. La première, c'est que la baisse de prix est structurelle et non promotionnelle : le tarif standard de 2,00 $ et 10,00 $ de GPT-6.1 Sol est inférieur au tarifpar lot de GPT-5.6 Sol, soit 2,50 $ et 15,00 $, si bien que même le palier remisé de l'ancien modèle est plus cher que le prix catalogue du nouveau. La seconde, c'est que la mise à niveau n'est pas linéaire en matière de latence. GPT-6.1 Sol génère sa sortie environ un tiers plus lentement et a mis 332 secondes à produire le premier fragment lors des tests de prompts longs du classement — du même ordre de grandeur que les 107 secondes de GPT-6 Sol, et environ quatre-vingts fois la médiane du classement. Si vous avez bâti un produit interactif sur GPT-5.6 Sol, il s'agit d'une régression fonctionnelle indépendante de tout benchmark, et le correctif est architectural, et non un paramètre.

Deux évaluations ont évolué dans le mauvais sens
Le gain composite est de 4,8 points. Les composantes ne sont pas uniformément positives, et les scores par évaluation du conseil le disent :
• SciCode — GPT-6.1 Sol 0,542 contre GPT-5.6 Sol 0,571. Une régression de 2,9 points en codage scientifique.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 contre GPT-5.6 Sol Elo 1611,3. Une régression de 36 points d'Elo sur un travail intellectuel à valeur économique.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 contre GPT-5.6 Sol 0,495. Un gain de 3,4 points.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 contre GPT-5.6 Sol 0,399. Un gain de 16 points, la plus importante variation individuelle de la comparaison.
• AA-Omniscience — GPT-6.1 Sol 41,5 contre GPT-5.6 Sol 22,0, ce qui concerne la fiabilité des connaissances et les hallucinations plutôt que le rappel brut.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — les cinq restants, qui complètent le composite et où le reste du gain de 4,8 points est obtenu.
Un modèle qui est véritablement meilleur pour le travail en terminal, nettement meilleur en fiabilité factuelle, et mesurablement moins bon en codage scientifique et sur l’Elo des tâches professionnelles n’est pas un modèle strictement meilleur. C’est un autre point sur la frontière, et il y a été placé délibérément : le positionnement de lancement d’OpenAI pour GPT-6.1 Sol est le coût par tâche accomplie à une qualité proche de celle des modèles phares, pas le score maximal. Si votre charge de travail est de type SciCode ou de type GDPval, le score composite n’est pas celui qui s’applique à vous, et la régression, elle, s’applique.
GPT-5.6 Sol a toujours le résultat publié en contexte long.
Le seul point où le modèle plus ancien affiche un chiffre que le plus récent n'a pas, c'est la précision de récupération dans la bande de contexte où la grille tarifaire de GPT-6.1 Sol change. GPT-5.6 Sol présente un résultat publié MRCR v2 à huit aiguilles de 91,5 % dans la plage de 256 000 à 512 000 tokens. GPT-6.1 Sol n'a pas d'équivalent publié et, au-delà de 272 000 tokens d'entrée, l'intégralité de sa requête est refacturée à 2× pour l'entrée et le cache, et à 1,5× pour la sortie.
Rapprochez ces deux faits : le segment où le profil économique du nouveau modèle est le plus faible est exactement celui où l'ancien modèle possède son seul atout documenté. Les économies ne disparaissent pas — 4,00 $ et 15,00 $ sur le palier re-tarifé, contre 8,00 $ et 30,00 $ sur le propre palier à contexte long de GPT-5.6 Sol, représentent encore une réduction de moitié —, mais l'argument du demi-prix vaut pour une charge de travail générale, et un pipeline de récupération à contexte long n'en fait pas partie. Si c'est votre charge de travail, GPT-5.6 Sol à 4,00 $ et 20,00 $ avec un taux publié de 91,5 % constitue un choix défendable pour rester.
Les autres résultats publiés de GPT-5.6 Sol restent intacts et sont la raison pour laquelle certaines équipes ne bougeront pas : BrowseComp 90,4 pour les agents de recherche web, Terminal-Bench 2.1 à 88,8 et 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 à 62,6. Ceux-ci sont rapportés par OpenAI, sur le harnais d'OpenAI, et ils ont été rapportés en juillet. Ce qui a changé depuis, c'est que le board évalue désormais les deux modèles sur une même suite avec un même ensemble de paramètres, et le modèle plus ancien perd sur le composite et sur le coût.
La migration elle-même est un changement de chaîne, à une exception près.
Même fournisseur, même surface d’API, voisins dans le classement, même fenêtre et même plafond de sortie — donc, pour la plupart des stacks, il s’agit d’un identifiant de modèle et d’un prix qui baisse de moitié. Les exceptions sont précises et méritent d’être nommées avant de basculer.
Si votre code définit reasoning.effort sur none ou minimal, il échouera au lieu de se dégrader, et low est le substitut documenté. Si votre trafic dépasse 272 000 jetons d'entrée, vérifiez le palier re-tarifé avant de modéliser les économies. Si votre produit dépend du temps jusqu'au premier jeton, mesurez avant de livrer, car le chiffre de 332 secondes du classement n'est pas une erreur d'arrondi. Et si vos évaluations contiennent une tranche de type SciCode ou de type GDPval, exécutez cette tranche sur les deux modèles plutôt que de vous fier au score composite.
Les deux modèles sont sur OrcaRouter aux tarifs catalogue propres à OpenAI — GPT-6.1 Sol à 2,00 $ et 10,00 $, avec entrée mise en cache à 0,10 $, GPT-5.6 Sol à 4,00 $ et 20,00 $, avec entrée mise en cache à 0,40 $ — selon un modèle de répercussion qui applique une modification tarifaire d'OpenAI de notre côté le jour même où elle intervient, plutôt qu'après qu'un revendeur a renégocié. Parce que la grille tarifaire est répercutée sans modification plutôt que majorée, l'arithmétique de cet article est celle que vous obtenez : le même modèle à 0,72 $ par tâche, la même réduction de moitié, aucune prime de plateforme ajoutée d'un côté ou de l'autre.

L'intérêt pratique de les avoir tous les deux derrière un même point de terminaison, c'est que la comparaison reste active. Dirigez le nouveau trafic vers GPT-6.1 Sol, gardez GPT-5.6 Sol à une modification de configuration près comme solution de repli et comme voie pour le contexte long, et laissez le basculement automatique couvrir la fenêtre pendant laquelle la disponibilité et l'activation d'Enterprise d'un fleuron vieux de deux mois sont encore en train de se stabiliser. Une migration qui divise la facture par deux et fait reculer deux sous-benchmarks n'est pas une décision à prendre une fois pour toutes ; c'est une décision à prendre par route, et une couche de routage est ce qui rend cela peu coûteux.

Où chacun a sa place
• Travail général de type agentique et en terminal — GPT-6.1 Sol. Seize points sur Terminal-Bench 4.0 et à moitié prix, il n’y a pas photo.
• Fiabilité factuelle, produits à réponses récupérées — GPT-6.1 Sol, sur un écart d’AA-Omniscience de près de vingt points.
• Codage scientifique — vérifiez d’abord vos propres évals. Le tableau montre une régression de 2,9 points, et le composite ne la fera pas apparaître.
• Travail intellectuel à forte valeur économique — même prudence. La régression Elo de GDPval-AA est de 36 points.
• Récupération en contexte long au-delà de 272 000 tokens — GPT-5.6 Sol, jusqu’à ce que GPT-6.1 Sol ait un chiffre publié dans cette plage.
• Surfaces interactives et sensibles à la latence — mesurez avant de migrer. Sortie plus rapide, premier token beaucoup plus lent.
• Appel le moins cher sans raisonnement — ni l’un ni l’autre. Cette configuration n’existe plus dans cette famille.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
