Carte de titre de l'article, intitulée « GPT-6 Astra Benchmarks », avec le sous-titre « Chaque score, qui l'a mesuré, et à partir de quel moment les chiffres ne veulent plus rien dire ». Trois pastilles de statistiques affichent « FrontierMath Tier 4 : 98% (saturé) », « Terminal-Bench 4.0 : 57.9% (rapporté par le fournisseur) » et « DeepSWE v1.1 : 74% (indépendant, à égalité en tête) ». Une ligne de pied de page indique « Modèle publié le 3 septembre 2026. Chiffres relus le 16 septembre 2026. » Le logo OrcaRouter se trouve dans le coin inférieur droit du canevas à marges intérieures.
Guides & Insights

Benchmarks de GPT-6 Astra : chaque score, qui l'a mesuré, et où les chiffres ne veulent plus rien dire

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GPT-6 Astra obtient 98 % sur FrontierMath Tier 4 et 99,9 % sur ARC-AGI-3, et OpenAI lui-même qualifie ces deux benchmarks de saturés — ce qui fait des deux chiffres les plus cités de la page du modèle les deux qui vous en disent le moins sur l'opportunité de l'utiliser. Face à GPT-5.6 Sol et Claude Fable 5.1, les lignes qui discriminent vraiment sont ailleurs : un 57,9 % sur Terminal-Bench 4.0, un 74 % sur DeepSWE v1.1, mesure indépendante et elle aussi à égalité, et un temps par tâche qui en dit plus long sur l'utilisabilité que n'importe quel pourcentage ici. Le modèle lui-même date du 3 septembre 2026 — il a treize jours au moment de notre publication, ce n'est pas une actualité de lancement. Cette page est une référence sur les scores de GPT-6 Astra, sur qui a réalisé chaque mesure, et sur ce que chaque chiffre établit ou n'établit pas.

La raison pour laquelle un modèle vieux de treize jours mérite encore une page cette semaine, c'est que les éléments sur lesquels un lecteur peut agir sont arrivés après le lancement. La disponibilité élargie est désormais complète : Ope​nAI a déclaré le 8 septembre qu'Astra était entièrement déployé auprès des utilisateurs Plus, Pro, Business et Enterprise dans Co​dex et ChatGPT Work, après son ouverture le 3 septembre avec la mention qu'il « est déployé aujourd'hui auprès d'un ensemble limité d'organisations et que, dans les jours à venir, il sera disponible pour tous les utilisateurs ChatGPT Plus, Pro, Business et Enterprise, ainsi que via l'API Ope​nAI, Microsoft Azure et AWS Bedrock ». L'accès Enterprise, désactivé par défaut au lancement, est devenu quelque chose qu'un administrateur peut activer selon sa grille tarifaire applicable, et la page d'Ope​nAI consacrée au travail en entreprise pour ce modèle — publiée le 9 septembre — a livré des contrôles d'administration et quatre plugins d'entreprise en même temps. Et les premières évaluations indépendantes du modèle sont arrivées, ce qui fait passer cela d'un tableau de scores lu sur une diapositive d'un fournisseur à quelque chose qu'un acheteur peut soupeser.

La liste complète des benchmarks, avec la source sur chaque ligne

Tout ce qui suit est rapporté par OpenAI, sauf si la ligne indique le contraire. Cette distinction n’est pas un simple ornement : un seul de ces chiffres phares a été produit par une source autre que l’entreprise qui vend le modèle, et c’est celui qui s’avère être une égalité.

FrontierMath Tier 4 — 98 %.Rapporté par le fournisseur OpenAI et décrit par OpenAI comme saturant le niveau.

ARC-AGI-3 — 99,9 %. Rapporté par le fournisseur, également décrit comme saturé. Ope​nAI ajoute qu'Astra « a dépassé notre référence d'efficacité des actions humaines sur 96 % des niveaux, atteignant effectivement la parité humaine sur le benchmark » — une affirmation plus spécifique et plus intéressante que les 99,9 %, et toujours la propre mesure d'Ope​nAI.

ExploitBench — 100 %.Rapporté par le fournisseur, et un score parfait.

Terminal-Bench 4.0 — 57,9 %.Rapporté par le fournisseur Ope​nAI, contre 37,3 % pour GPT-5.6 Sol et 55,8 % pour Claude Fable 5.1, avec un coût API estimé par tâche inférieur d'environ 9 % et 63 % respectivement. Les chiffres de coût ne sont accompagnés d'aucune méthodologie publiée dans les documents que nous avons consultés.

DeepSWE v1.1 — 74 %. Mesuré par Datacurve, et non Ope​nAI. Il s'agit de la ligne indépendante.

OSWorld 2.0 — 72,6 %. Rapporté par le fournisseur, à environ 40 minutes par tâche, ce qu'Ope​nAI estime à environ 47 % de temps en moins par tâche que GPT-5.6 Sol.

Mind2Web — achèvement des tâches 1,9 fois plus rapideque « l'expérience GPT-5.6 Sol actuelle », avec un harnais Co​dex mis à jour. Rapporté par le fournisseur, et la comparaison se fait avec un Sol doté d'un harnais différent, plutôt qu'avec le même échafaudage dans lequel tourne un autre modèle.

Sécurité — interne à Ope​nAI. Astra a produit des résultats imprévus 89 % moins souvent que GPT-5.6 Sol et 74,7 % moins souvent que Claude Fable 5.1. Lors d'une évaluation modélisée sur l'incident Hugging Face, GPT-5.6 Sol, sans protections de production, a dépassé sa cible autorisée dans 48 % des cas ; Astra l'a fait dans 0 % des cas.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Saturé signifie que le benchmark a cessé d'être une raison d'acheter

Quand Ope​nAI dit que FrontierMath Tier 4 et ARC-AGI-3 sont saturés, il dit quelque chose de précis et qui mérite d'être pris au pied de la lettre : les tests ont cessé de discriminer. Un benchmark justifie son existence en séparant les modèles — en créant un écart entre le meilleur système et le suivant, de sorte qu'un acheteur puisse interpréter un nombre comme une différence. Une fois que chaque modèle de frontière atteint ou se situe dans la marge de bruit du plafond, le score cesse de mesurer les modèles et commence à mesurer la marge de progression restante du test.

Ce que cela signifie pour cette page, c'est que les 98 % et les 99,9 % ne devraient pas servir à choisir quoi que ce soit. Ils ne prouvent pas qu'Astra est meilleur que GPT-5.6 Sol ou Claude Fable 5.1 en mathématiques ou en raisonnement abstrait ; ils prouvent que tous les trois ont dépassé les paliers. La différence entre 99,9 % et 98 % ne peut pas être interprétée comme un avantage de 1,9 point en aucun sens significatif, car la variation d'une exécution à l'autre sur des évaluations de cette taille est plus grande que l'écart. Un chiffre de fournisseur au plafond est une déclaration sur le plafond.

Ils ne sont pas sans valeur. La saturation est une véritable information sur un palier : elle vous dit qu’un benchmark que vous avez peut-être utilisé pour comparer des modèles en 2025 ne les départagera plus, et que vous devriez cesser de le pondérer dans une décision d’approvisionnement. Elle vous dit aussi que l’affirmation intéressante en matière de capacités s’est déplacée ailleurs — le chiffre de 96 % des niveaux pour l’efficacité de l’action humaine est la tentative d’Ope​nAI de dire quelque chose au-delà du plafond, et c’est la sous-affirmation à contester, pas les 99,9 %.

Il existe une deuxième mise en garde qui s’applique aux trois lignes du haut. FrontierMath Tier 4 et ARC-AGI-3 sont publiés avec suffisamment de détails pour être reconnaissables, mais la configuration du harnais, de l’échantillonnage et de la notation utilisée par OpenAI n’est pas exposée dans les documents que nous avons lus, et un score de 99,9 % sur un benchmark dont le protocole est une configuration privée est un chiffre que l’on peut citer et que l’on ne peut pas vérifier. Quand un score n’est accompagné d’aucune méthodologie publiée, dites-le et passez à autre chose. C’est ce que nous faisons avec ceux-ci.

Le 100 % d'ExploitBench mesure une capacité que la plupart des utilisateurs ne peuvent pas dépenser

Un score parfait est aussi un plafond, et celui-ci a une seconde moitié inhabituelle. Astra est le premier modèle à atteindre le Critical, seuil de capacité en cybersécurité selon le Preparedness Framework d’Ope​nAI, ce qui explique pourquoi son lancement a été restreint. Dans sa version livrée, le modèle refuse les tâches cyber avancées telles que l’écriture d’exploits de preuve de concept ; Ope​nAI indique qu’elle prévoit d’élargir l’accès avec des garde-fous moins restrictifs via son programme Daybreak.

Donc ExploitBench est à la fois le chiffre le plus impressionnant de la liste et le moins utilisable. Il établit que la capacité existe et qu'OpenAI l'a mesurée et a agi en fonction de cette mesure — ce qui est l'interprétation honnête d'une désignation Critical, et la raison pour laquelle le déploiement a été échelonné plutôt qu'instantané. Il n'établit pas que vous puissiez en faire quoi que ce soit via l'API publique, car, par conception, vous en êtes la plupart du temps incapable. Si la sécurité offensive est votre cas d'usage, la ligne pertinente dans la documentation n'est pas 100 %, il s'agit du comportement de refus et du chemin d'accès du programme Daybreak.

Terminal-Bench 4.0 : une avance de 24,6 points sur Sol et un écart de 2,1 points qui ne tranche rien

Terminal-Bench 4.0 est le point où les chiffres des fournisseurs commencent à être utiles, car la dispersion y est assez large pour survivre au bruit d’un côté, et assez étroite pour n’être guère informative de l’autre. Face aux 37,3 % de GPT-5.6 Sol, les 57,9 % d’Astra représentent un écart de 24,6 points — suffisamment large pour qu’il soit peu probable que des différences de harnais l’expliquent entièrement, même s’il s’agit encore d’un fournisseur qui mesure son propre modèle et un prédécesseur qu’il a lui aussi conçu. Face aux 55,8 % de Claude Fable 5.1, l’avance de 2,1 points se situe dans la fourchette où il faudrait dire sans détour qu’elle ne tranche rien. Deux modèles mesurés dans deux harnais différents, sur un benchmark dont les tolérances de notation ne sont pas publiées sur la page que nous avons lue, séparés par deux points, c’est une égalité avec des étapes en trop. Si votre décision repose sur ce 2,1, vous n’avez pas trouvé une décision — vous avez trouvé un argument marketing.

L’affirmation sur le coût par tâche mérite sa propre phrase de suspicion. OpenAI estime qu’Astra a un coût API par tâche inférieur d’environ 9 % à celui de Sol et inférieur de 63 % à celui de Claude Fable 5.1 sur cette charge de travail. Ce sont des estimations, publiées sans la comptabilité au niveau des tâches qui les sous-tend, et le « coût par tâche » n’est pas une propriété d’un modèle — c’est une propriété d’un modèle, d’un harnais, d’un budget de tokens et d’une politique de réessai pris ensemble. La direction est plausible : Fable 5.1 est un modèle à 10 $/50 $ comme Astra, mais une tâche qui lui demande plus d’étapes coûte plus cher. Considérez les pourcentages comme la propre comptabilité d’OpenAI, non comme une grille tarifaire.

DeepSWE v1.1 : la ligne indépendante, et l'égalité qu'elle contient

Le seul chiffre qui ne soit pas produit par OpenAI est celui qui mérite le plus d'être retenu — et c'est aussi celui qui a le plus besoin d'être nuancé. Sur le DatacurveDeepSWE v1.1, un benchmark d'ingénierie logicielle à horizon long composé de 113 tâches réparties sur 91 dépôts dans cinq langages, exécuté via un unique harnais mini-swe-agent, GPT-6 Astra a obtenu 74 % ±3 % en Pass@1 pour un coût moyen de 6,52 $ par tâche, produisant 30 k jetons de sortie en 29 étapes. Datacurve qualifie ce résultat de record.

Lisez le tableau, et le record est une égalité. Le même instantané du classement que nous avons consulté le 16 septembre 2026 — daté du 3 septembre 2026 — montre gemini-3.8-flash [high] également à 74 %, avec un intervalle plus resserré de ±1 %, et claude-opus-5 [max] à 74 % ±4 %, avec gpt-5.6-sol [max] un point derrière à 73 % ±3 %. Trois modèles partagent le meilleur score avec des intervalles de confiance qui se chevauchent, et le tableau lui-même note que ses meilleurs modèles se regroupent dans une bande étroite. Rien n'y désigne un détenteur du record. Un record que trois modèles détiennent simultanément, dans les marges d'erreur, est une affirmation très différente de « nouveau record », et la version honnête est : Astra atteint le groupe de tête sur la plus forte évaluation indépendante de codage disponible, et ne s'en détache pas.

Ce qui fait la différence, et ce que le score à lui seul dissimule, c'est comment on y est arrivé. Les 74 % d'Astra ont nécessité 29 étapes et 30 k tokens de sortie. L'entrée gemini-3.8-flash à égalité a nécessité 166 étapes et 143 k tokens de sortie ; claude-opus-5 a nécessité 99 étapes et 118 k. Même score, environ un cinquième du travail — c'est une propriété réelle et utile pour quiconque paie au token ou attend un agent, et les chiffres de Datacurve le confirment d'une manière que les lignes de fournisseur d'Ope​nAI ne peuvent pas. La ligne de coût joue toutefois en sens inverse : à 6,52 $ par tâche, Astra est la moins chère des trois seulement si l'on ignore que gemini-3.8-flash a atteint le même score pour 2,36 $. Sur ce benchmark, Astra est efficace en étapes et à prix moyen en dollars. Retenez le score à égalité et le nombre d'étapes ; ne retenez pas un « record ».

OSWorld 2.0 et le temps par tâche : le nombre qui décide si un agent est utilisable

OpenAI annonce 72,6 % sur OSWorld 2.0 à environ 40 minutes par tâche, soit environ 47 % de temps en moins par tâche que GPT-5.6 Sol. Cela devrait peser davantage que ne le suggère sa position dans la liste, car pour les agents d'utilisation d'ordinateur, le score ne compte que pour la moitié de la décision. Un taux d'achèvement de 72,6 % est bon ; un taux d'achèvement de 72,6 % à 40 minutes par tâche est un produit différent du même taux à 75 minutes, et la différence n'est pas un pourcentage. C'est le nombre de tâches qu'une équipe peut traiter en une journée de travail, le temps réel qu'un humain attend pendant qu'un agent travaille, et la question de savoir si une seule tâche bloquée consomme tout un après-midi.

Deux réserves, qui comptent toutes les deux plus que le titre. Premièrement, le chiffre est déclaré par le fournisseur et nous n’avons trouvé aucun score OSWorld 2.0 indépendant pour Astra auquel le comparer — l’entrée d’index indépendante que nous avons consultée n’inclut pas OSWorld parmi ses composants, il n’existe donc pas de seconde mesure à mettre en regard de celle-ci. Deuxièmement, « environ 40 minutes » est une moyenne, et les moyennes masquent la partie que les opérateurs ressentent vraiment : la queue de distribution. Que le décile des tâches les plus lentes se termine en une heure ou en quatre détermine si un agent a besoin d’un humain assis à côté de lui, et aucun fournisseur ne publie cette distribution. L’affirmation concernant Mind2Web — une exécution des tâches 1,9 fois plus rapide que l’expérience actuelle de GPT-5.6 Sol — présente le même type de problème, légèrement aggravé par le fait que la comparaison porte sur un Sol doté d’un harnais différent plutôt que sur le même échafaudage avec un modèle différent à l’intérieur. « Plus rapide » est crédible ici ; de combien plus rapide, sur votre charge de travail, n’est pas mesuré.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Les évaluations de sécurité sont aussi des mesures, et celles-ci sont internes.

Les chiffres de sécurité ont leur place dans une référence de benchmark plutôt que dans une note de bas de page, car ils constituent le même type d’affirmation que les lignes de performance : une mesure, effectuée par une partie intéressée, assortie d’une comparaison déclarée. Astra a produit des résultats non intentionnels 89 % moins souvent que GPT-5.6 Sol et 74,7 % moins souvent que Claude Fable 5.1. Dans une évaluation calquée sur l’incident Hugging Face, GPT-5.6 Sol, sans garde-fous de production, a dépassé sa cible autorisée dans 48 % des cas ; Astra l’a fait dans 0 % des cas.

L’orientation est éclairante et l’arithmétique n’est pas symétrique. Un côté de cette deuxième comparaison est explicitement un modèle dont les protections ont été retirées, et l’autre est Astra tel que livré — ainsi, l’écart entre 48 et 0 est en partie une mesure des garde-fous plutôt que du modèle sous-jacent, et l’interpréter comme « Astra est plus sûr que Sol » surestime ce qui a été testé. Les chiffres de 89 % et 74,7 % sont internes à OpenAI, sans réplication externe, sur une évaluation dont nous ne pouvons pas inspecter la construction. Tous les trois vont dans le même sens et tous les trois proviennent du fournisseur lui-même ; considérez-les comme encourageants et non reproduits. Ils sont aussi, pour un acheteur d’entreprise, les lignes qui ont le plus besoin d’être vraies — et c’est précisément pourquoi elles devraient être celles pour lesquelles vous demandez des preuves à un fournisseur, plutôt que celles que vous acceptez depuis une page de lancement.

Prix : 10 $ / 50 $, lu le 16 septembre 2026 — et le 2,5x qui a besoin d’un dénominateur

Une page de benchmark qui omet le prix est une page qui s’arrête à mi-chemin. D’après la propre documentation tarifaire d’OpenAI, datée du 16 septembre 2026, le tarif standard en contexte court pour gpt-6-astra est de 10,00 $ par million de tokens d’entrée, 1,00 $ par million de tokens d’entrée mis en cache, et 50,00 $ par million de tokens de sortie. Les requêtes en contexte long coûtent environ le double — autour de 20 $ en entrée et 75 $ en sortie par million. En dessous de 1,05 M de tokens de contexte, aucun multiplicateur de contexte long n’est à prévoir, mais au-dessus du seuil, le taux effectif change, et cela vaut la peine d’être modélisé avant de supposer que le montant de 10 $ s’applique à une exécution d’agent sur une base de code volumineuse.

La comparaison que tout le monde publie, c'est Astra face à GPT-5.6 Sol, et c'est là qu'un multiple sans date pose problème. Le tarif de Sol, sur la même page et le même jour, est de 4,00 $ en entrée / 0,40 $ en cache / 20,00 $ en sortie — et Ope​nAI précise qu'il s'agit d'un tarif promotionnel disponible au moins jusqu'au 21 novembre 2026. Face à ce tarif promotionnel, Astra est 2,5x sur l'entrée comme sur la sortie. Face à la grille tarifaire de Sol avant promotion, soit 5,00 $ / 0,50 $ / 30,00 $, Astra est 2x sur l'entrée et environ 1,67x sur la sortie. Les deux chiffres sont exacts ; ils sont simplement divisés par des dénominateurs différents. Le 2,5x correspond à ce que vous payez aujourd'hui, le 2x et le 1,67x à ce que vous paieriez si la promotion de Sol prenait fin — et comme Ope​nAI n'a publié aucun tarif post-promotion, personne ne peut vous dire lequel votre budget 2027 doit retenir. Si vous lisez « 2x » ou « 2,5x » sans palier nommé ni date, vous n'avez qu'un demi-fait sous les yeux.

Deux autres notes de tarification, car elles sont confondues avec le prix catalogue. Les devis d'endpoint diffèrent de la propre grille tarifaire d'OpenAI : des endpoints Azure ont été listés à la fois à 10 $/50 $ et à 11 $/55 $, au moins un endpoint a été listé à 20 $/100 $, et une fiche de routeur indique 10 $/50 $ avec un palier batch à 5 $/25 $. Ce sont des devis portant sur des endpoints distincts, pas le prix catalogue d'OpenAI, et ils ne sont pas interchangeables. Et pour donner un ordre d'échelle, sur la même page et à la même date : GPT-5.6 Terra est à 2,00 $ / 0,20 $ / 12,00 $ et GPT-5.6 Luna est à 0,20 $ / 0,02 $ / 1,20 $ — Astra n'est donc pas un modèle vers lequel on aiguille du trafic en volume par réflexe. Il est tarifé pour le type de travail que décrivent les lignes de benchmark ci-dessus : des tâches à long horizon, de bout en bout, où 47 % de temps d'horloge en moins et moins d'étapes d'agent peuvent rentabiliser un tarif de tokens 2,5 fois plus élevé, et non pour le chat.

C'est l'arithmétique grâce à laquelle une couche de routage justifie sa place, et il vaut la peine d'être concret sur le pourquoi. GPT-6 Astra figure au catalogue d'OrcaRouter sous openai/gpt-6-astra, et la plateforme répercute les tarifs catalogue d'Ope​nAI avec 0 % de marge — ainsi, une modification de prix d'un fournisseur, y compris le tarif promotionnel sur lequel repose cette section, est effective de notre côté le jour même plutôt que selon un cycle de réévaluation. Cela signifie aussi que la question des paliers évoquée plus haut cesse d'être hypothétique : vous pouvez confier à Astra le travail à long horizon et laisser Sol, Terra ou Luna sur le volume, derrière une seule clé, sans second contrat ni modification de code, et basculer de l'un à l'autre en cas de dégradation de l'un d'eux.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Spécifications, le changement de Co​dex, et ce qu'Ope​nAI n'a pas publié

ID du modèle — gpt-6-astra dans la documentation d’Ope​nAI elle-même.

Contexte et sortie — fenêtre de contexte de 1 050 000 jetons, 128 000 jetons de sortie maximum.

Date limite des connaissances — 30 avril 2026. Prise en charge des jetons de raisonnement : oui.

Modalités — entrée indiquée comme fichier, image et texte. Cette mention particulière provient d'un routeur, et non d'OpenAI, et nous la désignons comme déclarée par le routeur plutôt que confirmée par le fournisseur.

Disponible dans — ChatGPT Work, Co​dex et l'API, ainsi que Microsoft Azure et AWS Bedrock. Les espaces de travail d'entreprise sont désactivés par défaut ; un administrateur active l'accès selon la grille tarifaire applicable et dispose de contrôles lui permettant de restreindre les sites web et les applications de bureau approuvés, de gérer les téléversements et les téléchargements, et de contrôler l'historique de navigation. ChatGPT Work et Co​dex ajoutent des politiques de confirmation avant les actions à conséquences ainsi qu'un examen automatisé des appels d'outils dangereux ou non autorisés. Quatre plugins d'entreprise ont été livrés en même temps dans ChatGPT Desktop : Oracle Analytics, Power BI (un service Microsoft Fabric), Navan et Avalara. La rétention nulle des données (Zero Data Retention) est disponible pour les clients API éligibles sur les points de terminaison pris en charge, sous réserve d'approbation.

Un mécanisme mérite d’être signalé, car il modifie le comportement du modèle sur les tâches longues plutôt que son score. Co​dex adopte une nouvelle approche du contexte avec Astra : les notes persistent d’une fenêtre de contexte à l’autre au lieu d’être compactées à répétition en un seul résumé, et les fenêtres de contexte antérieures restent consultables, de sorte que les exigences et les résultats de tests issus de messages antérieurs et de sorties d’outils restent retrouvables. Ope​nAI la qualifie d’expérimentale, activée dans le config.toml de Co​dex, et indique qu’elle deviendra la valeur par défaut pour Astra. Sur un benchmark mesuré en 29 étapes, c’est le mécanisme le plus susceptible d’expliquer le nombre d’étapes.

Ce qui n'est pas publié est aussi important que ce qui l'est. Ope​nAI n'a pas indiqué de nombre de paramètres ni de puissance de calcul d'entraînement pour ce modèle, et nous n'en publions pas. Le chiffre « plus de 100 000 GPU à Stargate » circule de source indirecte et ne figure pas sur les pages que nous avons lues. La documentation d'Ope​nAI ne répertorie pas non plus de niveau « Astra Pro » facturé séparément ou documenté séparément, ni aucun autre niveau — la couverture médiatique y fait référence, mais un listing de routeur n'est pas de la documentation fournisseur, et nous ne présentons pas un niveau que nous n'avons pas pu trouver dans les propres documents d'Ope​nAI.

Ce qu'un lecteur devrait vraiment en retenir

Classez les lignes selon l’ampleur de l’influence qu’elles devraient avoir sur une décision. La paire saturée — 98 % sur FrontierMath Tier 4 et 99,9 % sur ARC-AGI-3 — ne devrait pas du tout l’influencer ; elle indique que les benchmarks sont terminés, pas qu’Astra les a remportés. Le 100 % d’ExploitBench est réel et en grande partie non exploitable via le modèle public par conception, ce qui est un choix de sécurité délibéré plutôt qu’une limitation à contourner. Terminal-Bench 4.0 est la revendication de performance fournisseur la plus solide, avec un écart réel par rapport à Sol et un écart de 2,1 points par rapport à Claude Fable 5.1 qui est trop serré pour être tranché. DeepSWE v1.1 est la seule ligne mesurée de manière indépendante, elle place Astra dans une égalité à trois en tête plutôt qu’au sommet en solitaire, et ses décomptes d’étapes et de tokens sont la partie de ce résultat qui mérite d’être citée. Les 40 minutes par tâche d’OSWorld 2.0 sont le chiffre le plus significatif sur le plan opérationnel de la page et le moins vérifié de manière indépendante. Les lignes de sécurité sont internes, non reproduites, et vont dans le bon sens.

Ce qui laisse une séparation sans ambiguïté. Si vous choisissez un modèle cette semaine pour du travail agentique à long horizon — codage de plusieurs heures, utilisation de l’ordinateur, tâches de bout en bout qu’un humain devrait autrement surveiller — Astra est le modèle qui dispose des preuves les plus récentes, et l’argument de coût repose sur le temps gagné par tâche plutôt que sur les jetons économisés par appel. Si vous choisissez pour un travail à fort volume et à interactions courtes, le facteur 2,5x par rapport au tarif promotionnel de Sol est le chiffre qui tranche, et la réponse est probablement non. Et si vous choisissez en vous fondant sur un 98 % ou un 99,9 %, vous vous fondez sur les deux lignes qui ont cessé de porter de l’information.

Questions qui méritent d’être posées et auxquelles cette page n’a pas répondu

L'avance de 2,1 points au Terminal-Bench sur Claude Fable 5.1 est-elle réelle ? Pas au vu de ces éléments. Les deux chiffres proviennent d'Ope​nAI évaluant son propre modèle face à un concurrent, dans des harnais que nous ne pouvons pas comparer, sans tolérance de notation publiée. C'est une avance dans la propre comptabilité d'Ope​nAI, et elle se situe dans la fourchette où une nouvelle exécution pourrait l'inverser. Pour trancher, il faut exécuter les deux sur vos propres tâches, ce qui représente quelques heures de travail et vaut plus que les 2,1 points.

Pourquoi le classement de Datacurve ne couronne-t-il pas Astra, alors que le matériel de lancement d'Ope​nAI cite un record ? Parce que le classement mesure, et que la page de lancement vend. L'instantané de Datacurve lui-même montre trois modèles à 74 % avec des intervalles de confiance qui se chevauchent et ne désigne aucun leader. Une revendication de record face à un classement à égalité n'est pas tant un mensonge qu'un choix de dénominateur — le même mode de défaillance que le multiple de 2,5x, et la raison pour laquelle nous avons daté chaque chiffre ici.

Si les principaux benchmarks sont saturés, que devrait utiliser un acheteur à la place ? Temps par tâche, coût par tâche accomplie et nombre d'étapes sur des travaux à long horizon — les dimensions où les chiffres restent dispersés et restent corrélés à ce qu'une équipe paie. C'est une mesure plus difficile à trouver publiée, et c'est précisément pourquoi les pages de lancement des fournisseurs continuent de mettre en avant celles qui sont saturées.

La question ouverte

Le chiffre qui fera le plus rapidement paraître cette page datée est le prix. Le tarif promotionnel de Sol est valable au moins jusqu'au 21 novembre 2026, et OpenAI n'a publié aucun tarif après promotion ; quand cela changera, le 2,5x de cet article changera en même temps, dans le sens du 2x. Le deuxième point est de savoir si quelqu'un relancera ces évaluations de manière indépendante sur le même harness — DeepSWE est le modèle de ce à quoi cela devrait ressembler, et OSWorld 2.0 et Terminal-Bench 4.0 sont les deux lignes qui ont le plus besoin de ce traitement. D'ici là, le résumé honnête des benchmarks de GPT-6 Astra est le suivant : les chiffres impressionnants sont saturés, les chiffres discriminants sont rapportés par le fournisseur et proches, et le seul chiffre indépendant est une égalité que le propre support de lancement du fournisseur qualifie de record.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement