
GPT-5.6 Luna : ce que la baisse de prix de 80 % d’OpenAI a réellement changé
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
GPT-5.6 Luna est 80 % moins cher que son prix de lancement depuis fin juillet, et OpenAI a commencé à y voir un argument plutôt qu'une remise. Le modèle — la déclinaison rapide et économique de la famille GPT-5.6 — est devenu disponible pour tous le 9 juillet 2026, à 1,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie. Il est facturé aujourd'hui à 0,20 $ et 1,20 $. Le 9 septembre, la directrice financière d'OpenAI, Sarah Friar, a déclaré à la conférence Communacopia de Goldman Sachs que cette baisse avait entraîné une multiplication par dix environ de l'utilisation, et que déployer Luna coûte moins cher que d'exécuter GLM 5.3 de Z.ai sur une couche cloud.
Cette dernière affirmation est celle d’OpenAI, formulée par un dirigeant lors d’une conférence d’investisseurs, et elle mérite le même traitement que n’importe quel autre chiffre de fournisseur : elle vaut la peine d’être rapportée, d’être vérifiée, mais pas d’être répétée comme un fait établi. Le prix, lui, est une autre affaire. Il est public, et il n’a pas reculé.
Qu'est-ce qui a réellement changé, et quand
Rien n'a changé en septembre concernant les capacités, la fenêtre de contexte ou la disponibilité de GPT-5.6 Luna. Ce qui a changé, c'est la façon dont OpenAI le commercialise, et derrière ce changement, il y a cinq dates.
• 26 juin 2026 — OpenAI a annoncé la famille GPT-5.6 (GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna) en aperçu limité pour un petit groupe de partenaires, après coordination avec des agences gouvernementales américaines.
• 9 juillet 2026 — disponibilité générale. Sol, Terra et Luna ont atteint l'API à 5 $/30 $, 2,50 $/15 $ et 1 $/6 $ par million de tokens en entrée/sortie, respectivement.
• Fin juillet 2026 — la baisse de 80 % sur Luna uniquement, à 0,20 $ en entrée et 1,20 $ en sortie. Les lectures d'entrée mises en cache bénéficient d'une remise d'environ 90 %. Au-delà du seuil de contexte long, le tarif double à peu près, pour atteindre environ 0,40 $/1,80 $.
• 6–7 août 2026 — Luna a remplacé GPT-5.5 Instant comme modèle par défaut pour ChatGPT Free et Go, avec des chats textuels illimités et un bouton « Think » pour un raisonnement plus poussé, prévu la semaine suivante. L'évaluation interne d'OpenAI a estimé que le taux de réponses de Luna contenant au moins une erreur factuelle était inférieur d'environ 62 % à celui de GPT-5.5 Instant sur les requêtes financières, médicales et juridiques — un chiffre rapporté par le fournisseur, et non indépendant.
• 9 septembre 2026 — les propos de Friar, qui rendent publics pour la première fois des chiffres sur l'effet de la réduction : une utilisation multipliée par 10 environ, des revenus d'entreprise en hausse de 32 % de juin à juillet contre une croissance annualisée globale de 20 %, et Codex à 25 millions d'utilisateurs.
Lues ensemble, ces dates décrivent la conversion en deux mois d’un palier bon marché en une stratégie de volume. Luna était depuis toujours le palier censé absorber le travail à fort volume et à faible complexité — classification, extraction, routage, premières ébauches. La réduction a rendu l’arithmétique derrière ce positionnement beaucoup plus difficile à contester.
Le chiffre qui compte plus que le prix du token

Les prix affichés sont là où la plupart des comparaisons s'arrêtent, et pour Luna, ils la flattent. À 0,20 $/1,20 $, elle est moins chère que Claude Haiku 4.5 d’Anthhropic — ce qu'elle a de plus proche d'un concurrent direct — d'environ 5x en entrée et 4x en sortie.
Artificial Analysis mesure quelque chose de moins pratique : le coût par tâche de l'Intelligence Index achevée, qui intègre le nombre de tokens qu'un modèle consomme réellement pour accomplir le même travail. Sur l'indice actuel, la configuration de raisonnement de GPT-5.6 Luna revient à 0,18 $ par tâche. Claude Haiku 4.5 dans sa configuration de raisonnement atteint 0,21 $.
C'est un écart d'environ 14 %, et non de 5x. La raison : la verbosité. Terminer ce jeu d'évaluation a pris à Luna environ 150 M de tokens en sortie, contre 78 M pour Haiku. Luna raisonne longuement, et les tokens de sortie sont facturés à six fois le tarif des tokens d'entrée.
L’analyse pratique se divise nettement. Pour les travaux à sortie courte et à grand volume — classification, étiquetage, extraction, routage des requêtes, premières ébauches —, la réduction de 80 % est réelle, importante et apparaît directement sur la facture. Pour les tâches où le modèle raisonne avant de répondre, une part substantielle de la remise est absorbée par des tokens de sortie supplémentaires. Les deux affirmations sont vraies en même temps, et la seconde est la partie que la couverture de la réduction a laissée de côté.
Il est également utile de savoir ce que l'indice dit sur les capacités, car les paliers ne sont pas proches. Artificial Analysis attribue actuellement à GPT-5.6 Luna un score de 38, quatrième sur 177 modèles de sa catégorie. La configuration de raisonnement de Claude Haiku 4.5 obtient 18, 138e sur 200. Deux mises en garde concernant ces chiffres. Premièrement, l'indice a été réévalué en septembre 2026, de sorte que les chiffres au moment du lancement — y compris les 51 et 52 qui circulent encore pour Luna — proviennent d'une échelle abandonnée. Deuxièmement, Artificial Analysis a adopté GPT-5.6 Luna comme unique évaluateur pour plusieurs de ses propres évaluations, ce qu'il convient de noter lorsqu'on lit ses scores.
Pourquoi OpenAI avance cet argument maintenant
Une réduction de 80 % annoncée fin juillet n’avait pas besoin qu’une directrice financière la remette en cause en septembre. Le fait qu’elle l’ait fait vous dit à quoi servait cette réduction.
Les modèles chinois à poids ouverts ont passé 2026 à peser exactement sur l’axe qu’occupe Luna : une qualité adéquate à un prix qui fait de la comptabilisation par jeton le facteur décisif. Casser les prix sur ce terrain-là dans un déploiement cloud est une affirmation plus difficile à tenir que de le faire sur les poids, et c’est précisément l’affirmation qu’a choisie OpenAI — en nommant GLM 5.3 explicitement plutôt qu’en évoquant vaguement les « modèles ouverts » en général.
Les chiffres enterprise que Friar y a associés pointent dans la même direction. Un chiffre d'affaires enterprise en hausse de 32 % d'un mois sur l'autre, contre 20 % au global, voilà à quoi ressemble une entreprise qui vend à des cycles d'approvisionnement, et les cycles d'approvisionnement sont précisément là où une ligne budgétaire se fait remettre en question. Elle a aussi confirmé qu'OpenAI expérimente une tarification fondée sur les résultats, liant les frais aux résultats commerciaux plutôt qu'à la consommation de tokens. C'est un aveu révélateur pour une entreprise dont tout le modèle de revenus repose sur le token : cela suggère que, dans le bas de gamme du marché, le chiffre par token devient un argument de vente plus faible que ce que le modèle parvient à accomplir.
Rien de tout cela ne rend la comparaison GLM vérifiée. L’affirmation de Friar repose sur une comparaison de déploiement cloud qu’OpenAI n’a pas publiée en détail, et « moins cher que d’exécuter X vous-même sur une couche cloud » dépend entièrement du cloud, de l’instance et de l’hypothèse d’utilisation que vous choisissez. Considérez-la comme une déclaration positionnée d’une partie intéressée, et vérifiez-la par rapport à votre propre charge de travail avant qu’elle ne change quoi que ce soit à ce que vous construisez.
Ce que cela change si vous routez déjà entre plusieurs modèles

Ici, trois choses comptent davantage que le prix affiché.
Les baisses de prix entrent en vigueur le jour même. OrcaRouter répercute le prix catalogue des fournisseurs avec 0 % de marge, donc quand un fournisseur modifie un tarif, le tarif de notre côté suit — sans ticket d'assistance, sans contrat à renégocier, sans seconde relation de facturation. C'est bien pour cela que la baisse de juillet mérite un article plutôt qu'une simple mention : pour quiconque appelle Luna via une seule API pour plus de 200 modèles, elle était en ligne le jour même.
L'alias est un piège. L'identifiant non suffixé gpt-5.6 pointe vers le palier phare Sol, et non vers Luna, donc toute intégration qui veut le modèle économique de Luna doit épingler gpt-5.6-luna explicitement. C'est documenté dans les guides pour développeurs de la famille, et c'est encore l'une des façons les plus courantes qu'une migration vers un « palier à bas coût » soit facturée discrètement aux tarifs du palier phare.
Les offres bon marché gèrent bien le basculement en cas de défaillance. À ce niveau de prix, un modèle effectue souvent un travail où un bref 503 coûte cher — des milliers d'appels de classification, et non une seule complétion importante. Router la même requête entre plusieurs fournisseurs de GPT-5.6 Luna avec basculement automatique, c'est la différence entre une file d'attente de nouvelles tentatives et une panne, et c'est la fonctionnalité qui permet d'intégrer sans risque une offre à bas coût dans un chemin de production.
Vous pouvez consulter le tarif actuel ainsi que les valeurs p50/p95 du temps jusqu'au premier token sur la page GPT-5.6 Luna on OrcaRouter — cela vaut le coup d'œil, car les pages tarifaires des fournisseurs accusent un retard sur les baisses de prix, et les outils de suivi tiers sont en retard sur les deux.
Que regarder ensuite
Trois éléments feraient passer cette histoire de tarification à une tout autre histoire.
Une réduction supplémentaire. La couverture financière en langue chinoise du début septembre présentait OpenAI comme se préparant à ajuster à nouveau ses tarifs pour répondre à la concurrence des modèles à poids ouverts. Cette information est prospective et non confirmée, mais elle est cohérente avec une entreprise qui a déjà accepté une réduction de 80 % sur son palier de volume et qui débat désormais publiquement du coût par déploiement.
La tarification fondée sur les résultats devient une réalité. Si OpenAI commence à vendre Luna en fonction du résultat métier plutôt que du token, la comparaison par token sur laquelle repose tout ce marché cesse d’être le tableau de bord pertinent — et chaque estimation du coût par tâche, y compris celles ci-dessus, doit être recalculée.
Un successeur compétent au même prix. GPT-6 Astra existe déjà au-dessus de la gamme GPT-5.6, et la position de Luna elle-même dépend du fait qu’OpenAI la laisse là où elle est. Dès qu’un nouveau palier de petite taille arrive à 0,20 $/1,20 $, la question intéressante cesse d’être de savoir si Luna est bon marché pour devenir de savoir si elle reste encore l’option la moins chère qui vaut la peine d’être routée.

Pour l'instant, la situation est inhabituellement simple. GPT-5.6 Luna est un modèle âgé de deux mois dont le prix, et non sa capacité, fait l'actualité — et le prix par token est la façon la plus flatteuse de le considérer, pas la plus précise.
