
GPT-6 Luna vs GPT-6 Astra : cent fois le prix pour seize points d'indice
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 218 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le fournisseur a livré ces deux modèles au cours du même mois. GPT-6 Astra est sorti le 3 septembre 2026 à 10,00 $ par million de jetons d'entrée et 50,00 $ par million de jetons de sortie, positionné comme le système le plus performant de l'entreprise pour le travail professionnel à long terme. GPT-6 Luna a suivi le 22 septembre 2026 à 0,10 $ et 0,50 $ — un centième du prix d'entrée, un centième du prix de sortie — comme le niveau d'efficacité de la famille. Seize points d'indice les séparent sur le tableau indépendant qui mesure les deux. Seize points pour un prix cent fois supérieur, c'est toute la comparaison en une ligne, et ce n'est pas la partie intéressante.
Ce qui est intéressant, c’est que l’étiquette « centuple » se réduit à quelque chose de plus proche de quarante-six fois lorsqu’on tient compte de la manière dont chaque modèle se comporte réellement sur une tâche, et que l’écart restant ne relève pas du tout de l’intelligence générale. Il s’agit de l’usage de l’ordinateur, de l’autonomie sur un horizon long, et d’une classification de sécurité qui détermine si votre organisation est autorisée à faire appel au modèle, dès le départ. Ce dernier élément est celui qu’aucun tableau de benchmarks ne capture, et pour beaucoup d’équipes, il tranche la question avant même que le prix ne soit mentionné.
Deux niveaux d'une même famille, à dix-neuf jours d'écart
Astra est le modèle phare d'OpenAI, celui que l'entreprise décrit comme le plus intelligent et le plus aligné au monde. Il accepte des entrées texte, image et fichier, dispose d'une fenêtre de contexte de 1 050 000 jetons avec un plafond de sortie de 128 000 jetons, et intègre un raisonnement toujours actif, avec un effort configurable de faible à maximal. C'est le premier modèle d'OpenAI à franchir le seuil critique de capacité en cybersécurité défini par le Preparedness Framework de l'entreprise, et le déploiement a découlé de cette classification plutôt que de la capacité : d'abord des organisations limitées, l'accès entreprise désactivé par défaut et administrable à partir du 9 septembre, les paliers de garanties s'élargissant ensuite.
Luna est l'autre extrémité de la même famille. Texte et image en entrée, texte en sortie, la même fenêtre de contexte de 1 050 000 tokens et le même plafond de sortie de 128 000 tokens, ainsi qu'une échelle de raisonnement allant de none à low, medium, high, xhigh et max, avec medium par défaut. Aucune restriction d'accès, aucun commutateur d'entreprise, aucun niveau de sécurité à remplir. Elle est disponible en accès général pour toute personne disposant d'une clé API, et la description d'OpenAI est elle-même précise et honnête : le modèle le plus efficace pour les tâches ciblées à fort volume.
Les deux modèles partagent une fenêtre de contexte, un plafond de sortie, une famille de dates de coupure des connaissances et une clause tarifaire pour le contexte long. Ils ne partagent presque rien d’autre, et la raison en est qu’ils ont été conçus pour deux moitiés différentes d’une même tâche.
La grille tarifaire indique cent fois. Le coût de la tâche indique quarante-six.
Une ligne par dimension, les deux côtés sur chacune :
• Entrée par 1M — GPT-6 Luna 0,10 $ vs GPT-6 Astra 10,00 $
• Sortie par 1 M — GPT-6 Luna 0,50 $ vs GPT-6 Astra 50,00 $
• Entrée mise en cache — GPT-6 Luna 0,01 $ par million vs GPT-6 Astra 1,00 $ par million, toutes deux à 90 % de réduction sur leur propre tarif non mis en cache
• Coût par tâche d'indexation — GPT-6 Luna environ 0,07 $ contre GPT-6 Astra environ 3,26 $
• Coût d’exécution de l’index complet — GPT-6 Luna : 122,39 $ vs GPT-6 Astra : 5 324,10 $
• AA Intelligence Index — GPT-6 Luna 37 à effort maximal vs GPT-6 Astra 53 à effort maximal
• Jetons de sortie lors de l'exécution de l'index — GPT-6 Luna 150M vs GPT-6 Astra 60M, par rapport à une médiane du classement de 88M
• Vitesse de sortie — GPT-6 Luna 153,9 jetons/s contre GPT-6 Astra 51,4 jetons/s à xhigh
• Délai avant le premier token — GPT-6 Luna assez rapide pour se placer derrière une surface interactive, contre GPT-6 Astra à 208,73 s en xhigh
• Interrupteur de désactivation du raisonnement — GPT-6 Luna : de none à max, avec none comme option, contrairement à GPT-6 Astra toujours activé, pas de mode sans raisonnement
• Utilisation de l’ordinateur et autonomie — appels d’outils et boucles agentiques de GPT-6 Luna vs GPT-6 Astra conçu pour piloter un ordinateur de bout en bout
• Accès — GPT-6 Luna généralement disponible pour tout le monde vs GPT-6 Astra à accès restreint, entreprise désactivée par défaut, contrôles d’administration requis
• Sur OrcaRouter — GPT-6 Luna absent de notre catalogue vs GPT-6 Astra routable au prix catalogue d'OpenAI

Comparez la ligne du coût par tâche au ratio de la grille tarifaire, et l’écart se réduit de plus de moitié. Luna dépense 150 millions de tokens de sortie pour compléter l’index ; Astra en dépense 60 millions. Astra affiche une concision deux fois et demie supérieure, et sur un modèle facturé à la sortie, cela vaut énormément — c’est la raison pour laquelle un écart de grille tarifaire de cent fois devient un écart de coût par tâche de quarante-six fois, et la raison pour laquelle toute comparaison fondée sur les seuls prix affichés surestimera d’un facteur deux l’argument en faveur du niveau économique.
Les lignes de vitesse vont en sens inverse et ne sont pas proches. Luna génère trois fois plus de tokens par seconde qu'Astra et renvoie son premier token dans un délai qui permet à un utilisateur d'attendre. Le temps de 208,73 secondes d'Astra jusqu'au premier token à xhigh n'est pas un chiffre de latence ; c'est une affirmation sur la vocation du modèle. Rien de ce qu'une personne regarde ne peut tourner sur Astra avec ce réglage.
Ce que seize points permettent réellement d’obtenir
L’écart d’indice est réel, et la question utile est de savoir ce qu’il contient, car la réponse n’est pas « seize pour cent d’intelligence en plus ».
Les capacités publiées d'Astra se concentrent dans un domaine précis. OpenAI rapporte 72,6 % sur OSWorld 2.0 et 69 % sur AutomationBench-AA — deux mesures d'un modèle exploitant un logiciel comme le ferait une personne, sur de nombreuses étapes, sur une longue période. Du côté des connaissances, les chiffres sont 96,1 sur GPQA Diamond, 97,6 % sur FrontierMath Tier 4 et 57,2 % sur Humanity's Last Exam avec outils, et la récupération à long contexte est une force mise en avant : 100 % sur le propre benchmark eight-needle d'OpenAI entre 256K et 512K tokens, 96,3 % entre 512K et 1M. Ces chiffres sont rapportés par le fournisseur et non reproduits, et le harnais compte — le même modèle obtient 99,9 % sur ARC-AGI-3 avec l'adaptateur de fournisseur personnalisé d'OpenAI contre 62,7 % sur le harnais standard, ce qui est un écart qui en dit autant sur le harnais que sur le modèle.
Lus ensemble, ce n'est pas un avantage général. C'est un avantage concentré dans les tâches qui prennent beaucoup de temps, qui font appel à un ordinateur et qui ont un point de terminaison vérifiable. Le positionnement concurrentiel d'Astra n'est pas contre un autre chatbot ; il est contre une session de travail, et les modèles à côté desquels il est mesuré sur le tableau indépendant sont les autres modèles phares du même niveau — il égale Claude Fable 5.1 à 53 sur l'Intelligence Index pour environ 40 % du coût par tâche.
Le déficit de seize points de Luna n’est donc pas réparti uniformément. Sur une tâche courte, bien spécifiée et consommée par un programme, les deux modèles produiront souvent la même réponse exploitable et la différence sera invisible. Sur une tâche qui nécessite quarante actions séquentielles dans un navigateur avec un point de contrôle à la fin, le déficit est la différence entre terminer et ne pas terminer — et c’est la tâche pour laquelle Astra a été conçue et Luna non.
La barrière que personne n'intègre dans les prix
Astra est le premier modèle d’OpenAI à franchir le seuil critique de cybersécurité dans le cadre du Preparedness Framework de l’entreprise, et la conséquence pratique est qu’il est livré désactivé pour les comptes d’entreprise. Un administrateur doit l’activer, selon une grille tarifaire et un accord applicables, avant que les utilisateurs ne puissent le voir. L’accès a été ouvert à un ensemble limité d’organisations le 3 septembre, puis élargi à partir de là ; le dispositif d’administration est arrivé le 9 septembre.
Luna n’a rien de tout cela. Elle est accessible à toute personne disposant d’une clé API dès le premier jour, sans étape de qualification, sans bascule d’administration et sans palier de protection qui se dresse entre un développeur et un premier appel.
Pour une équipe dans un secteur réglementé, un contractant de la défense, ou partout où une revue de sécurité figure dans le processus d'achat, c'est là toute la décision. Un écart de prix d'un facteur cent est une ligne budgétaire ; une barrière d'accès est un projet. Et pour une équipe en dehors de ces contraintes, la barrière d'accès n'a aucune importance et Astra n'est qu'un modèle coûteux avec un délai jusqu'au premier jeton anormalement long.
Il convient d’ajouter que ce verrouillage relève d’une position réfléchie plutôt que d’une simple gêne. Un modèle qui utilise un ordinateur de façon autonome et qui excelle à trouver des vulnérabilités est un modèle qu’un laboratoire doit distribuer avec prudence, et la forme du déploiement découle de ce constat de capacité. Cela ne facilite pas son obtention, mais cela signifie que la contrainte a peu de chances d’être assouplie par un ticket d’assistance.
Même falaise, même famille, deux fois
Les deux modèles comportent la même clause de contexte long, qui est l'élément le plus coûteux à négliger sur l'une ou l'autre grille tarifaire. Les requêtes qui dépassent 272 000 jetons d'entrée sont facturées au double des tarifs d'entrée et de cache, et à 1,5 fois le tarif de sortie — pour toute la requête, et non seulement pour la portion au-dessus du seuil. Sur Astra, cela transforme un appel à 10,00 $/50,00 $ en 20,00 $/75,00 $. Sur Luna, cela transforme 0,10 $/0,50 $ en 0,20 $/0,75 $.
Parce que la clause est proportionnelle, elle ne modifie pas le rapport entre les deux modèles : elle les double tous les deux. Ce qu’elle change, c’est la taille absolue de l’erreur, et l’erreur est plus probable sur Astra, car les charges de travail pour lesquelles Astra existe sont celles qui portent un contexte de travail d’un million de tokens. Un seul appel Astra à contexte long coûte 75 $ par million de tokens de sortie ; diviser le même travail en deux appels de moins de 272 K le réduit de moitié sans modifier le prompt. Sur un modèle dont toute la proposition de valeur repose sur le travail à long horizon, ce calcul mérite d’être fait avant le premier appel en production, pas après.
La décision est une décision de routage
Ce qui rend ce duo inhabituel parmi les comparaisons de ce blog, c'est que les deux modèles appartiennent au même fournisseur, s'exécutent sur le même compte et sont accessibles via le même point de terminaison. Il n'y a pas de second contrat à signer ni de second SDK à apprendre. Le choix entre eux n'est pas du tout une décision d'achat — c'est une décision de routage, et c'est une décision que la plupart des équipes devraient prendre à chaque requête plutôt qu'une seule fois.
La forme de la répartition est assez claire. Luna pour les mille petits appels qu'un agent effectue sur le chemin d'une tâche : classification, extraction, sélection d'outils, résumé d'un résultat intermédiaire. Astra pour la tâche elle-même, une fois, à la fin, là où la réponse est le produit. C'est un pipeline à deux niveaux au sein d'une seule application, et l'écart de coût entre faire tourner l'ensemble sur Astra et faire tourner la boucle interne sur Luna est l'écart entre une économie unitaire viable et une économie unitaire non viable.
GPT-6 Astra est disponible sur OrcaRouter au prix catalogue d'OpenAI, dans le cadre d'une tarification en refacturation, ce qui signifie qu'une modification des tarifs d'OpenAI est effective de notre côté le jour même. GPT-6 Luna ne figure pas dans notre catalogue à l'heure où nous écrivons et est accessible via l'API propre à OpenAI ; une équipe qui souhaite disposer des deux utilise donc une seule clé pour GPT-6 Astra, en plus de ce qu'elle utilise déjà pour OpenAI. C'est également l'association où la fusion de modèles justifie sa place : un panel composé d'un modèle bon marché à haut débit et d'un modèle coûteux et méticuleux répondant ensemble, le membre bon marché assurant l'essentiel du travail et le membre coûteux arbitrant, est une configuration que la couche de routage peut exprimer sans que l'application sache que l'un ou l'autre de ces modèles existe.

Lequel, et quand
Prenez GPT-6 Luna, sauf si vous avez une raison précise de ne pas le faire. Il coûte un centième du prix sur la grille tarifaire et un quarante-sixième du prix par tâche accomplie, il est trois fois plus rapide, son premier token arrive dans un délai qu'un utilisateur peut attendre, et on peut lui demander d'arrêter complètement le raisonnement — c'est ce qui le rend utilisable comme classifieur. Définissez explicitement le paramètre effort, car la valeur par défaut est medium et le chiffre phare 37 correspond à un effort maximal. Gardez les appels longs sous 272 000 tokens d'entrée. Vérifiez la régression de deux points du Coding Agent Index par rapport à votre propre évaluation plutôt qu'à un graphique de fournisseur.
Prenez GPT-6 Astra lorsque la tâche est de longue haleine et que la réponse est le produit. L’utilisation de l’ordinateur sur de nombreuses étapes, l’analyse professionnelle avec un point de terminaison vérifiable, tout ce pour quoi seize points d’indice font la différence entre finir et s’arrêter discrètement. Acceptez le temps avant le premier token — 208 secondes en xhigh, ce n’est pas un délai que l’on peut imposer à un humain — et acceptez l’étape de validation des achats si votre organisation en a une. Ensuite, exécutez tout ce qui mène à cette tâche sur le palier économique, car c’est dans la boucle interne que passe l’argent.
L’erreur que cette comparaison invite à commettre est de la traiter comme un choix entre deux modèles. Il s’agit d’un choix quant à la place de chacun dans un pipeline, et la réponse est presque toujours : les deux.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
