
Le premier score indépendant de GPT-6.1 Sol est tombé : 0,84 point derrière Astra, pour moins d’un quart du coût de la tâche
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 397 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- OrcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Chaque compte rendu de GPT-6.1 Sol publié dans les jours suivant la sortie d'OpenAI au DevDay du 29 septembre 2026 — y compris celui de ce blog — portait la même mise en garde : les chiffres de capacité étaient ceux du fournisseur et aucun tiers n'avait évalué le modèle. Cette mise en garde est désormais obsolète. Artificial Analysis a une ligne GPT-6.1 Sol dans son Intelligence Index, exécutée avec un effort de raisonnement maximal, et c'est le premier chiffre de la courte vie de ce modèle qui n'a pas été produit par OpenAI. Il affiche 51,8 contre 52,7 pour GPT-6 Astra et 47,5 pour GPT-6 Sol — un écart de moins d'un point avec le fleuron à 10 $/50 $, et un bond de 4,3 points par rapport au modèle que GPT-6.1 Sol remplace. Le chiffre qui rend la ligne intéressante est celui qui l'accompagne : le tableau indique le coût de la passe d'évaluation derrière chaque score, et la passe de l'Index de GPT-6.1 Sol a coûté 0,72 $ par tâche, contre 3,26 $ pour celle d'Astra. Quatre fois et demie plus d'argent pour 0,84 point, c'est toute la comparaison en une ligne, et c'est désormais une ligne mesurée plutôt qu'une présentation qu'en fait un fournisseur.
La ligne elle-même, et ce sur quoi elle a été exécutée

Artificial Analysis publie son Intelligence Index sous la forme d'un composite de dix évaluations, et la version en service le 30 septembre 2026 était la v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR v1.1. Les trois modèles OpenAI dont il est question dans cet article reposent sur cette même version, si bien que la comparaison ci-dessous se fait à périmètre réellement comparable, ce qu'un tableau de lancement propre à un fournisseur n'est jamais. Le classement enregistre également la date de sortie dont il dispose pour le modèle — 2026-09-29, la date du DevDay — et l'évalue dans la configuration max-effort, soit le réglage que la page nomme dans son propre titre.
• Intelligence Index — 51,8 pour GPT-6.1 Sol (max), 52,7 pour GPT-6 Astra (max), 47,5 pour GPT-6 Sol (max).
• Coût par tâche de l'indice — 0,72 $ pour GPT-6.1 Sol, 3,26 $ pour Astra, 1,05 $ pour GPT-6 Sol. Il s'agit du chiffre du classement lui-même pour ce qu'a coûté l'exécution d'une évaluation complète de l'indice, et non d'une grille tarifaire.
• Tokens de sortie dépensés lors de l'exécution — 67,2 millions pour GPT-6.1 Sol, 60,0 millions pour Astra, 76,8 millions pour GPT-6 Sol. Le commentaire d'AA qualifie 67 millions de « plutôt concis » face à une médiane du classement de 82 millions, ce qui constitue une seconde victoire, plus discrète, sur le modèle qu'il remplace.
• Vitesse de sortie — 66,8 tokens par seconde pour GPT-6.1 Sol, 57,0 pour Astra, 76,2 pour GPT-6 Sol.
• Prix tels qu'ils figurent dans le classement — 2,00 $ en entrée et 10,00 $ en sortie par million de tokens pour GPT-6.1 Sol, avec l'entrée mise en cache à 0,10 $ et les écritures de cache à 2,50 $. Ces quatre chiffres correspondent exactement à la page de tarification du fournisseur, ce qui est l'élément le moins spectaculaire et le plus utile de cette ligne : une liste indépendante des tarifs que nous avons déjà cités.
Une note de cadrage avant que les chiffres ne servent de munitions. L’indice d’AA compte dix évaluations, et les évaluations qu’OpenAI a mises en avant dans sa propre annonce — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — n’en font pas partie. AA exécute sa propre variante d’AutomationBench, qui n’est pas le même harnais que la version d’AutomationBench citée par le fournisseur. Le bilan indépendant ne confirme donc ni n’infirme les quatre affirmations phares de l’article de lancement ; il mesure un ensemble de tâches en grande partie différent, et il vaut mieux le lire comme un second avis sur la forme du modèle que comme un verdict sur ces phrases précises.
Astra l'emporte encore, de moins d'un point, pour quatre fois et demie le prix

Les deux modèles exposent une échelle d’effort, et le tableau des scores a désormais publié un score et un coût d’exécution pour chaque échelon des deux. Mises côte à côte, les échelles disent quelque chose que la seule comparaison phare ne peut pas dire : la meilleure configuration de GPT-6.1 Sol n’est pas en concurrence avec la meilleure d’Astra. Elle est en concurrence avec la deuxième meilleure d’Astra.
• GPT-6.1 Sol, max — 51,8, 0,72 $ par tâche d'indexation. GPT-6 Astra, max — 52,7, 3,26 $.
• GPT-6.1 Sol, xhigh — 51,0, 0,39 $. GPT-6 Astra, xhigh — 52,4, 2,31 $.
• GPT-6.1 Sol, high — 50,2, 0,32 $. GPT-6 Astra, high — 50,9, 1,73 $.
• GPT-6.1 Sol, medium — 47,8, 0,21 $. GPT-6 Astra, medium — 49,6, 1,54 $.
• GPT-6.1 Sol, low — 42,1, 0,13 $. GPT-6 Astra, low — 45,8, 0,82 $.
Astra mène à chaque échelon, ce qui est le résumé honnête de la confrontation et aussi ce qu'elle a de moins intéressant. La partie intéressante, c'est le taux de change. Si vous voulez la configuration Astra la moins chère qui bat le meilleur résultat de GPT-6.1 Sol, il s'agit d'Astra en xhigh : 52,4 contre 51,8, pour 2,31 $ contre 0,72 $. Cela fait 0,56 point d'indice pour 1,59 $ de plus par exécution d'évaluation — environ 3,2 fois le coût pour moins de 1 % du score. Allez dans l'autre sens et ramenez GPT-6.1 Sol à xhigh : vous abandonnez 0,8 point tandis que la facture tombe à 0,39 $, soit 5,9 fois moins cher que le xhigh d'Astra et un neuvième de l'exécution à effort maximal d'Astra.
Il existe une seconde lecture de la même échelle qui plaide contre l’achat d’Astra à effort maximal. Les quatre échelons inférieurs d’Astra sont tous moins chers que son max, et son xhigh est 0,29 point en dessous de son max — à peine plus d’un demi pour cent de score pour une réduction de 29 % du coût d’exécution. Toute conversation d’approvisionnement sur cette paire qui part de « Astra à max » et se termine par « Astra coûte 4,5 fois plus cher » omet de la comparaison les échelons moins chers d’Astra eux-mêmes.
Six évaluations vont à Astra, deux vont à GPT-6.1 Sol, deux à égalité
Le composite masque une fracture. Noté évaluation par évaluation à effort maximal, GPT-6.1 Sol n’est pas une Astra uniformément un peu moins bonne — il est meilleur sur deux choses et moins bon sur six.
• GDPval-AA — Elo 1575,1 pour GPT-6.1 Sol contre 1541,9 pour Astra, soit une avance de 33 points sur les tâches professionnelles. Il s'agit de la plus grande victoire indépendante unique pour le modèle le moins cher.
• AA-LCR v1.1, raisonnement sur contexte long — 0,830 contre 0,807. GPT-6.1 Sol mène.
• AA-Briefcase v1.1 — Elo 1564,2 contre 1568,9. Astra mène de 4,7.
• AutomationBench-AA — 0,649 contre 0,685. Astra mène de 3,6 points.
• Terminal-Bench 4.0 — 0,561 contre 0,591. Astra mène de 3,0 points.
• SciCode — 0,542 contre 0,565. Astra mène de 2,3 points.
• Humanity's Last Exam — 0,529 contre 0,547. Astra mène de 1,8 point.
• AA-Omniscience — 41,5 contre 43,4. Astra mène de 1,9 point.
• GDP.pdf et CritPt — égalités parfaites à 0,310 et 0,317 respectivement, sur les deux modèles.
Deux de ces lignes valent plus que leur position dans la liste. La marge GDPval-AA est le seul endroit où l’avantage du modèle le moins cher est suffisamment important pour survivre à un changement de harnais, et elle tombe exactement sur la charge de travail que revendique la ligne de positionnement du fournisseur — un travail professionnel, fortement axé sur les documents. Et les deux égalités parfaites concernent les évaluations aux écarts les plus étroits, ce qui rappelle qu’un écart composite de 0,84 point est assemblé à partir de lignes qui, individuellement, vont d’une victoire de 33 points à une défaite de 3,6 points.
Par rapport au modèle qu’il remplace, le gain est réel mais pas uniforme.
La comparaison qui compte pour quiconque exploite déjà GPT-6 Sol sur un chemin de production est celle que 6.1 Sol établit face à son propre prédécesseur, et le bilan indépendant est plus tranchant à ce sujet que ne l’était la publication du fournisseur. Huit évaluations sur dix s’améliorent. Deux régressent.
• SciCode — GPT-6.1 Sol obtient 0,542 là où GPT-6 Sol obtenait 0,576. Le modèle le plus récent est moins performant en code scientifique, de 3,5 points.
• AA-LCR v1.1 — 0,830 pour 6.1 Sol contre 0,837 pour GPT-6 Sol. Un écart infime, mais dans la mauvaise direction, sur l'évaluation de contexte long.
• AA-Omniscience — 41,5 contre 27,1. C'est la plus grande évolution de la ligne : un bond de 14,4 points sur l'évaluation des connaissances, et une exactitude sur cet ensemble qui passe de 0,545 à 0,621.
• Taux d'hallucination sur le même ensemble — 0,543 pour GPT-6.1 Sol, en baisse par rapport à 0,601 pour GPT-6 Sol, et toujours au-dessus des 0,513 de GPT-6 Astra. AA-Omniscience divise son score entre « bonnes réponses » et « erreurs confiantes », et c'est dans cette répartition que la mise à jour 6.1 mérite sa place : c'est un modèle nettement moins malhonnête que Sol, et il reste le plus malhonnête des trois.
• Terminal-Bench 4.0 — 0,561 contre 0,439, un gain de 12,2 points. AA-Briefcase — 1 482,8 à 1 564,2 Elo. GDP.pdf — 0,248 à 0,310.
L'interprétation est qu'il s'agissait davantage d'une mise à jour des connaissances et de l'outillage que d'une mise à jour du raisonnement. Les évaluations qui ont le plus évolué sont celles qui récompensent le fait de connaître les choses et de ne pas les inventer ; celle qui a reculé est étroite et technique. Quiconque est passé à 6.1 Sol pour l'économie de cache obtient le gain de connaissances en bonus et ne doit pas supposer qu'il s'étend à chaque harnais qu'il exécute.
Où le tableau le classe, et ce qui se trouve au-dessus

Dans le classement par défaut selon l’Intelligence Index, GPT-6 Astra à effort maximal occupe la 7e place et GPT-6.1 Sol à effort maximal occupe la 10e place, GPT-6 Sol à effort maximal étant 20e. Les neuf lignes au-dessus de GPT-6.1 Sol sont deux configurations d’Astra, trois configurations de Claude Opus 5.5, une configuration de Claude Sonnet 5.5 et deux configurations de Claude Fable 5.1 — ainsi, le modèle dont GPT-6.1 Sol est le plus proche est le modèle phare de sa propre famille, et le modèle qu’il a réellement déplacé dans cet ordre est son propre prédécesseur, treize places plus bas.
Si l'on baisse le réglage d'effort, le classement se resserre d'une manière qui compte pour la planification des coûts : GPT-6.1 Sol se classe 13e en xhigh, 15e en high, 19e en medium et 35e en low, tandis qu'Astra occupe la 14e place en high, la 16e en medium et la 26e en low. Autrement dit, GPT-6.1 Sol en xhigh devance Astra en high au classement, et GPT-6.1 Sol en medium devance Astra en low. Le réglage d'effort est un levier plus important ici que le choix du modèle, du moins entre ces deux-là.
Que faire du nombre, honnêtement
L’allégation du fournisseur que cette ligne testait était que GPT-6.1 Sol rivalise presque avec le modèle phare pour environ un cinquième du prix. La version indépendante de cette phrase est la suivante : il arrive à moins de 0,84 point d’indice du modèle phare, et l’évaluation à l’origine de son score a coûté 22 % de celle du modèle phare. C’est suffisamment proche de l’allégation pour que personne ne se sente induit en erreur, et c’est une affirmation plus forte que « non vérifié » dans tous les aspects qui comptent pour un acheteur.
Ce que cette ligne ne fait pas, c'est chiffrer votre charge de travail. Une exécution d'index est un mélange précis de tâches, et le chiffre qui détermine une facture réelle, c'est la grille tarifaire appliquée à votre propre profil de tokens — c'est pourquoi la ligne du cache reste celle à modéliser : les 0,10 $ d'entrée mise en cache de GPT-6.1 Sol contre les 1,00 $ d'Astra, c'est un écart de dix fois qu'aucun score d'index ne reflète. De notre côté, la même répercussion s'applique : OrcaRouter sert GPT-6 Astra, GPT-6 Sol et GPT-6 Luna aux tarifs catalogue d'OpenAI eux-mêmes, sans marge ajoutée, de sorte que le jour où le tarif d'un fournisseur évolue, notre tarif évolue avec lui plutôt que d'attendre un second contrat. GPT-6.1 Sol ne figure pas sur nos routes — le catalogue public renvoie « model not found » pour openai/gpt-6.1-sol aujourd'hui, et il n'y a aucune façon honnête de décrire un modèle que nous ne pouvons pas servir. Ce qu'une seule clé API vous achète réellement aujourd'hui, c'est la paire dont le benchmark débat vraiment — Astra pour le travail le plus difficile, Sol pour le volume — avec les tarifs catalogue des fournisseurs répercutés sans marge et un basculement automatique entre fournisseurs lorsque l'un d'eux renvoie une erreur.
Deux choses permettraient d’affiner encore cela. Un second harnais indépendant sur le même modèle nous dirait si l’avance de GDPval-AA est une propriété du modèle ou de cette évaluation, et il s’agit du point de données manquant le plus utile de la ligne. Et une mesure indépendante du palier de contexte long de 272 000 tokens aurait plus d’importance qu’un autre point composite, car c’est là que la tarification de cette famille cesse d’être bon marché.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
