OpenAI Astra-1
Guides & Insights

OpenAI Astra : Tout ce que nous savons sur le modèle qui n'est pas GPT-6

Auteur

Jim Song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ce que vous pouvez télécharger aujourd'hui n'est pas un modèle. Ce sont dix fichiers de code Lean. Le 1er août 2026, OpenAI a publié un article de recherche sur les mathématiques, et, enfouie dans cet article, se trouvait la première confirmation du nom de son prochain système de pointe : Astra. Il n'y a pas de fiche de modèle, pas de page de tarification, pas d'endpoint API et pas de date. Le produit phare actuel que vous pouvez réellement appeler est toujours GPT-5.6 Sol, à 5 $ par million de jetons d'entrée et 30 $ par million de jetons de sortie, exactement comme depuis le 9 juillet.

Si vous avez cherché GPT-6, voici la version courte : OpenAI n'a jamais annoncé de modèle portant ce nom et, à ce jour, n'a pas décidé si Astra sera lancé en tant que GPT-6, en tant que version mineure de GPT-5 comme GPT-5.7, ou en tant que quatrième niveau aux côtés de Sol, Terra et Luna. Cette ambiguïté de nommage n'est pas une réticence face à la presse. C'est une question interne bien réelle, rapportée par The Information le 31 juillet et non résolue depuis.

Ce qui suit sépare trois choses que la plupart des couvertures de cette histoire confondent : ce qu'OpenAI a déclaré lui-même, ce qu'ajoutent des reportages crédibles, et ce qui circule sans source attachée. Les preuves sont de véritables artefacts que vous pouvez compiler. Le chiffre de 10 000 milliards de paramètres est un nombre que quelqu'un a tapé sur Internet. Ces éléments méritent des poids très différents.

Ce qu'OpenAI a réellement dit — et la liste, bien plus longue, de ce qu'il n'a pas dit

L'annonce n'est pas arrivée comme un lancement de produit. Elle est arrivée comme un article. Le post d'OpenAI décrivait des résultats produits par « une version interne d'Astra, notre prochain modèle majeur », sur des problèmes qui, selon son cadrage, n'avaient vu aucun progrès sur le résultat principal depuis au moins une décennie. Astra était caractérisé comme un système conçu pour un travail de longue durée : plusieurs agents se coordonnant sur différentes parties d'un grand problème sur de longues périodes plutôt que de répondre en une seule passe.

Cela est proche de l'ensemble de la description technique officielle. Face à cela, la liste des absences est frappante :

Confirmé par OpenAI — le nom Astra ; qu'il s'agit du « prochain modèle majeur » ; qu'une version interne a produit dix résultats ; l'intention de conception multi-agents à long horizon ; un manuscrit de 249 pages ; des certificats Lean 4 sur un dépôt public ; une estimation du coût des jetons citée aux taux de GPT-5.6 Sol.

Non précisé par OpenAI — date de sortie ; prix ; fenêtre de contexte ; nombre de paramètres ; éventuel score de benchmark ; carte du modèle ; s'il arrive sur ChatGPT ou uniquement sur l'API ; combien d'agents ont été exécutés, pendant combien de temps, sur quel matériel ; les prompts ; le taux de réussite ; le nom du produit final.

Un reportage crédible apporte quelques précisions.The Information a rapporté que Sam Altman a présenté Astra aux décideurs politiques à Washington fin juillet — une réunion d'information qui, selon ce reportage, comprenait les sénateurs Raphael Warnock, Bernie Moreno et Mark Warner, avec également la présence du secrétaire au Trésor Scott Bessent et du secrétaire au Commerce Howard Lutnick. La famille de modèles serait déjà en phase de test, « Astra » étant encore une étiquette provisoire.

Personne en dehors d'OpenAI n'a exécuté ce modèle sur quoi que ce soit. Toute affirmation de capacité en circulation provient soit des dix preuves publiées, soit d'une démonstration que le public n'a pas vue.

Les dix preuves : étonnamment vérifiables, et toujours pas résolues

OpenAI Astra-2

C'est là que l'annonce est véritablement plus solide qu'une publication de benchmark typique, et il vaut la peine d'être précis sur ce point. OpenAI n'a pas publié un score en demandant qu'on la croie sur parole. Elle a publié des artefacts vérifiables par machine sous licence Apache 2.0 dans le dépôt openai/ten-proofs — un fichier Lean par résultat, épinglé à Lean 4.32.0 avec une dépendance mathlib, accompagné d'un répertoire ComparatorChallenges pour une vérification indépendante. Le dépôt est arrivé comme un commit unique le 1er août et a depuis accumulé plusieurs centaines d'étoiles et des dizaines de forks.

Les dix résultats, tels que le référentiel les nomme, couvrent un éventail inhabituellement large de domaines :

Théorie des groupes — la construction d’un groupe non sofique, répondant par la négative à une question ouverte depuis 1999. La soficité est une propriété satisfaite par presque tous les groupes avec lesquels les mathématiciens travaillent ; la question de savoir si tout groupe discret dénombrable doit la satisfaire était restée ouverte pendant 27 ans.

Algèbres d'opérateurs — un contre-exemple portant sur la conjecture de rigidité de Connes, posée par le médaillé Fields Alain Connes en 1980.

Géométrie en haute dimension — une amélioration de la méthode d’empilement de sphères, rapportée comme la première du genre depuis 1978 — plus une forme fine de l’inégalité de volume d’Ehrhart.

Théorie des codes — nouvelles bornes pour les codes binaires et sphériques.

Complexité — une borne inférieure de circuit arithmétique pour le permanent, et un résultat exponentiel de répétition parallèle pour les jeux intriqués.

Cryptographie à base de treillis — difficulté polynomiale fixe pour le problème du vecteur le plus proche.

Combinatoire extrémale — l'échelle de croissance des nombres de Ramsey multicolores pour les triangles, et des contre-exemples en théorie extrémale des graphes, y compris des travaux sur plusieurs problèmes d'Erdős catalogués.

Les réactions des mathématiciens étaient intéressées plutôt que méprisantes. Thomas Bloom, qui tient la base de données des problèmes d'Erdős, a qualifié les résultats de grande nouvelle et les a classés au-dessus du contre-exemple de la conjecture de distance unité de mai. Noam Brown d'OpenAI a offert une utile déflation de l'intérieur : « Malheureusement, pas de problèmes du Prix du Millénaire (pour l'instant). »

Ce qu'un certificat Lean règle, et ce qu'il laisse ouvert

Une preuve Lean qui passe la vérification de types est valide par construction. Vous n'avez pas à faire confiance à la méthodologie d'évaluation d'OpenAI, à son choix de références, ni à son interprétation de ses propres résultats — vous pouvez compiler les fichiers. Pour une industrie où « nous avons obtenu 94,1 % » est l'unité de preuve standard, c'est une amélioration significative en matière de falsifiabilité.

Il est également plus étroit que ce que les gros titres laissent entendre, à quatre égards précis. Lean vérifie que la preuve d'un énoncé formel est valide. Il ne vérifie pas que l'énoncé formel est le théorème que le texte prétend. Il ne vérifie pas que les définitions encodées correspondent à ce que le domaine entend par ces mots. Il ne vérifie pas les réductions informelles qui relient les extrémités formelles au résultat annoncé. Et il ne dit rien sur la nouveauté — qu'un résultat soit nouveau ou déjà connu sous un autre nom.

Ces quatre questions relèvent toutes du jugement humain et, au moment de l'annonce, aucune n'avait été soumise à un examen par les pairs. Le manuscrit mentionne des consultations avec des spécialistes ; les remerciements ne constituent pas une approbation de chaque affirmation. Une compilation partielle publiée du dépôt a compilé 8 820 des 9 007 tâches, ce qui ressemble à une grande formalisation réelle en cours de vérification plutôt qu'à un audit achevé. Le statut honnête aujourd'hui est celui de dix affirmations de recherche sérieuses, formellement encodées — et non dix entrées établies dans le canon mathématique.

Il existe une deuxième limite, plus discrète : le processus de découverte n'est pas reproductible par quiconque en dehors d'OpenAI. Les preuves sont publiques ; le système de recherche, les invites, les points de contrôle et l'environnement d'exécution ne le sont pas. Vous pouvez vérifier la destination. Vous ne pouvez pas refaire le voyage.

Le chiffre de 2 000 $, et pourquoi il permet d'acheter moins que ce qu'il n'y paraît

OpenAI Astra-3

Le chiffre qui a le plus circulé était le coût. OpenAI a évalué la dépense en tokens des dix solutions à environ 2 000 $, sur la base des tarifs GPT-5.6 Sol — soit environ 200 $ par problème ouvert vieux de dix ans, selon la lecture la plus courante de sa formulation. Certains articles ont lu la même phrase comme indiquant moins de 2 000 $ par problème, soit une différence d'un facteur dix ; le billet d'OpenAI est assez laconique pour que les deux lectures aient survécu dans la presse, et nous n'avons pas vu l'entreprise dissiper l'ambiguïté.

Prenez la lecture totale et faites le calcul. Sol facture 5 $ par million de jetons d'entrée et 30 $ par million de jetons de sortie, les jetons de raisonnement étant facturés comme des sorties. Si la dépense était entièrement en sortie, 2 000 $ achètent au plus environ 67 millions de jetons de sortie — soit environ 6,7 millions par problème. C'est beaucoup de réflexion, et ce n'est pas une quantité absurde de réflexion. C'est le genre de budget qu'un groupe de recherche bien financé pourrait déjà dépenser pour une seule question difficile.

Trois réserves comptent plus que le titre :

C'est un prix contrefactuel, pas un prix. Astra n'est pas encore sorti et n'a pas de prix. Les 2 000 $ décrivent ce que ces jetons auraient comme coût aux tarifs d'un autre modèle. Un système de pointe conçu pour des exécutions multi-agents de plusieurs heures n'a aucune raison évidente d'être tarifé comme Sol, et toutes les raisons d'être tarifé au-dessus de Sol.

Il ne compte que les victoires. Aucun taux de réussite n'a été publié. Nous ne savons pas combien de problèmes ont été soumis à Astra sans qu'elle parvienne à les résoudre, ni ce que ces tentatives ont coûté. Un coût par succès publié sans taux de réussite n'est pas un coût par résultat, et la différence pourrait être d'un ordre de grandeur dans un sens comme dans l'autre.

Les jetons sont la partie la moins coûteuse. Ce sont les humains qui ont formulé les problèmes, préparé les manuscrits et mené la formalisation. Ce travail n'est pas inclus dans les 2 000 $.

La seule partie que vous pouvez chiffrer aujourd'hui, c'est la référence. Comme OrcaRouter transmet le prix catalogue du fournisseur directement, avec une marge de 0 %, GPT-5.6 Sol coûte les mêmes 5 $/30 $ sur notre API que sur celle d'OpenAI — donc si vous voulez vérifier le calcul sur votre propre charge de travail, le tarif annoncé est celui que vous paierez réellement. Ce que personne ne peut encore chiffrer, c'est Astra elle-même, et tout vendeur qui vous dit le contraire devine.

La date de sortie est conditionnée par un délai de 30 jours, et non par une fuite.

OpenAI Astra-4

La plupart des articles sur « quand sortira GPT-6 » relèvent de l'arithmétique des rumeurs. Il existe une contrainte plus concrète, bien visible, qui n'a pratiquement jamais été reliée à cette question.

Un décret présidentiel signé le 2 juin 2026 a chargé les agences fédérales de mettre en place un processus d'examen volontaire dans le cadre duquel les développeurs de pointe soumettent leurs modèles à un examen gouvernemental jusqu'à 30 jours avant leur publication publique. Ce cadre devait officiellement entrer en vigueur le 1er août — le même jour où l'article sur Astra a été publié. Selon les rapports, Astra devrait être le premier modèle à passer par ce processus.

« Volontaire » fait un certain travail dans cette phrase. En pratique, l’administration a déjà exercé une pression sur le calendrier de publication, et le comportement récent d’OpenAI ressemble à une répétition : GPT-5.6 a été réservé à environ vingt organisations vérifiées à partir du 26 juin avant que l’accès général n’arrive le 9 juillet — un déploiement progressif d’environ deux semaines.

Empilez ces deux faits et vous obtenez un plancher approximatif plutôt qu'une prédiction. Si Astra passe par une revue de pré-lancement de 30 jours puis répète le schéma de GPT-5.6, la disponibilité générale arrive environ six semaines après la soumission. Et la date de soumission est précisément ce que nous ignorons. C'est pourquoi les dates d'août avancées avec assurance doivent être écartées : l'étape de contrôle est un processus dont la durée est publiée, et le compte à rebours n'a pas visiblement commencé.

Les marchés de prédiction ont évolué exactement dans cette direction. Au 5 août 2026, l'échelle « GPT-6 released by » de Polymarket affichait 1 % pour le 7 août, 3 % pour le 14 août, 13 % pour le 21 août, 25 % pour le 31 août, 68 % pour le 30 septembre et 89 % pour le 31 décembre, sur près d'un million de dollars de volume. Considérez cela comme une estimation agrégée de la foule, et non comme une source — mais notez que la foule a déplacé son poids vers le quatrième trimestre.

Il est également utile de se souvenir du bilan. Chaque affirmation « GPT-6 sort la semaine prochaine » des douze derniers mois s'est avérée fausse. Une fuite non vérifiée fixait le 14 avril 2026 comme date de lancement ; ce qui est réellement sorti neuf jours plus tard, c'était GPT-5.5.

Les rumeurs, évaluées

Triés selon le poids que chacun porte réellement :

Nom non arrêté (GPT-6 / GPT-5.7 / une classe distincte). Provenant de The Information. L'affirmation la plus fiable non-OpenAI de cette histoire, et celle qui devrait recalibrer les attentes — un système annoncé par le biais d'un article de mathématiques pourrait fort bien ne pas du tout être présenté comme un saut générationnel.

Des noms de code « Zinc » et « Magnesium » repérés dans Design Arena.Observation de la communauté, soumissions apparemment désactivées, non confirmé par OpenAI. À lire comme : une version mineure de GPT-5.x pourrait bien arriver avant Astra, ce qui ne satisferait les attentes de personne en matière de GPT-6 tout en accaparant le cycle médiatique.

Environ 2× l'échelle de GPT-5.6 Sol ; tarification proche de la gamme GPT-5.6. Rumeur en circulation. La personne à l'origine de la fuite a reconnu ne pas avoir testé le modèle. Cela semble plausible et ne repose sur aucune preuve.

Une fenêtre de contexte de 1,5 million de jetons. Apparaît dans les récapitulatifs de fuites sans source nommée. Notons que Sol propose déjà 1 050 000 jetons, ce serait donc une augmentation, pas un bond — ce qui est une raison de se méfier de cette « fuite » à la une.

Environ 10 billions de paramètres. Aucune attribution où que nous ayons pu chercher. Le chiffre le plus répété et le moins étayé de toute l'histoire.

Mémoire et personnalisation comme direction déterminante. Fondé sur les remarques publiques d'Altman lors d'une interview d'août 2025 — réelles, mais datant d'un an et concernant la direction post-GPT-5 en général, pas Astra spécifiquement.

Ce qu'il faut réellement faire entre maintenant et le moment où il sera expédié.

La mauvaise décision est de réarchitecturer pour un modèle qui n'a pas de carte. La bonne décision est de repérer lesquels de vos problèmes un système multi-agents à long horizon modifierait, car ce sont les parties de votre stack qui sont aujourd'hui sous-dimensionnées, indépendamment de ce qu'OpenAI publie.

Trois d'entre eux valent la peine d'être construits contre GPT-5.6 Sol dès maintenant :

Coûts plafonnés par tâche, pas par appel. Si une tâche unique peut s’exécuter pendant des heures et dépenser six ou sept millions de jetons de sortie, les limites par requête ne vous protègent plus. Vous avez besoin d’un budget que toute la tâche hérite, et d’un arrêt net.

Points de contrôle et reprise. Un appel unique soit retourne, soit échoue. Une exécution d'agent de plusieurs heures qui meurt à la 90e minute sans rien avoir écrit de durable est une catégorie d'échec coûteux que la plupart des bases de code n'ont jamais eu à gérer.

Une évaluation à laquelle vous pouvez vous fier pour des problèmes sans réponse de référence. Les dix preuves sont intéressantes, en partie parce que Lean fournit un oracle. Presque rien en production ne le fait. Si vous ne pouvez pas distinguer une bonne exécution de six heures d’une mauvaise qui semble plausible, davantage de calcul ne vous aidera pas.

Sur la question du changement : Astra n'est pas disponible sur OrcaRouter, parce qu'elle n'est disponible nulle part. Ce que nous pouvons dire, c'est que le problème de la rotation des versions est en grande partie résolu de notre côté. Une seule clé donne accès à plus de 200 modèles ; que ce soit livré en tant que GPT-6, GPT-5.7 ou un quatrième palier de GPT-5.6, l'adopter est un changement de chaîne de modèle plutôt qu'une migration — pas de second contrat, pas de nouveau SDK. Et pour un modèle de pointe non éprouvé en particulier, le basculement automatique fait toute la différence entre l'évaluer dans une charge de travail réelle et miser une trajectoire de production sur un système que personne en dehors du laboratoire n'a mis à l'épreuve. Vous acheminez une partie du trafic vers lui, gardez Sol en dessous comme solution de repli, et vous verrez.

Des questions qui méritent une réponse.

Est-ce qu'Astra est la même chose que GPT-6 ?

Pas nécessairement, et c'est l'inconnue la plus lourde de conséquences de cette histoire. OpenAI a confirmé qu'Astra sera son prochain modèle majeur, mais n'a pas encore décidé de son nom de sortie ; les informations évoquent GPT-6, GPT-5.7 et une classe distincte, aux côtés de Sol, Terra et Luna, tous sur la table. Il est tout à fait possible qu'un modèle nommé GPT-6 ne voie jamais le jour, et que le bond de capacités tant attendu arrive sous un nom que personne ne suivait.

Puis-je accéder à Astra sous quelque forme que ce soit aujourd'hui ?

Non — ni dans ChatGPT, ni via l’API, ni via un routeur ou un revendeur. Ce qui existe publiquement, c’est l’article, les démonstrations pas à pas et le dépôt Lean. Si un service prétend offrir un accès à Astra, il revend autre chose ou il ment. La seule chose vraiment utile que vous puissiez faire avec cette publication pour l’instant, c’est compiler les preuves vous-même.

Est-ce qu'Astra a vraiment résolu des problèmes que les mathématiciens humains ne pouvaient pas résoudre ?

Il a produit des preuves formellement vérifiées d’énoncés restés ouverts pendant au moins une décennie, ce qui constitue un résultat réel et inhabituel — et la vérification est d’un niveau supérieur à la norme du secteur. Mais « vérifié par Lean » ne signifie pas « revu par les pairs », et la question centrale de savoir si chaque énoncé formel correspond bien au problème annoncé est précisément ce que Lean ne peut pas trancher. Les spécialistes qui ont lu les manuscrits se montrent positifs ; rien de tout cela n’a encore passé l’épreuve d’une relecture par les pairs. Attendez-vous à ce que l’évaluation se précise au fil des mois, dans un sens comme dans l’autre.

Le chiffre de 2 000 $ signifie-t-il que la recherche de pointe est désormais bon marché ?

Cela signifie que les exécutions de jetons gagnantes étaient bon marché, aux prix d'un autre modèle, en excluant les échecs et en excluant les humains. Chacune de ces trois exclusions pourrait être importante. La lecture honnête est que le coût marginal d'une recherche de preuve automatisée réussie a suffisamment baissé pour être intéressant, et non que dix problèmes ouverts coûtent désormais le prix d'un ordinateur portable.

Qu'est-ce qui réglerait réellement cela ?

Trois choses précises, dont aucune n'est une rumeur, et toutes vérifiables lorsqu'elles se produiront.

Une fiche modèle et une page de tarification. C'est le moment où Astra cesse d'être un artefact de recherche et devient quelque chose sur lequel vous pouvez bâtir vos plans — et le moment où la question du nom se résout d'elle-même.

Une reconstruction indépendante du dépôt Lean par des spécialistes qui auditent les définitions et les réductions informelles, pas seulement la vérification de typage. Le répertoire ComparatorChallenges suggère qu'OpenAI s'attend à cela. Si les énoncés formels résistent à cet examen, les résultats deviennent beaucoup plus difficiles à écarter ; si une divergence apparaît ne serait-ce que dans un seul des dix, chaque affirmation de l'ensemble est relue.

Preuve que le délai d'examen fédéral a commencé. Dans le cadre d'une fenêtre de pré-sortie de 30 jours, cette soumission constitue le signal fiable le plus précoce d'une date de sortie — considérablement plus informatif que la prochaine capture d'écran d'une entrée désactivée dans un classement d'arène.

D'ici là, {{1}}la déclaration exacte{{/1}} est restreinte et mérite d'être retenue : {{2}}le prochain fleuron d'OpenAI{{/2}} a un nom, dix preuves vérifiables par machine, une démo à Washington, et rien d'autre. {{3}}Quiconque vous avance une date devine, et quiconque vous avance un nombre de paramètres invente.{{/3}}

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube