OpenAI réduit les prix de l’API GPT-5.6 : ce qui a changé, pourquoi et comment l’obtenir
Guides & Insights

OpenAI réduit les prix de l’API GPT-5.6 : ce qui a changé, pourquoi et comment l’obtenir

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 30 juillet 2026, OpenAI a réduit les prix API de ses deux modèles GPT-5.6 les moins chers — en abaissant fortement le tarif le plus abordable et en ajustant le tarif intermédiaire. Trois semaines plus tard, il s'est tourné vers son modèle phare : le 21 août 2026, OpenAI a annoncé que les prix API de GPT-5.6 Sol baissent de plus de 20 % au cours des trois prochains mois, alors que l'entreprise s'efforce de faire fonctionner le modèle plus efficacement. Cet article explique exactement ce qui a changé lors de ces deux séries de réductions, l'ingénierie qui les sous-tend, comment les nouveaux prix se comparent à ceux des concurrents, les coûts cachés à surveiller, comment réduire encore votre facture — et comment les prix réduits sont déjà disponibles sur OrcaRouter avec une marge de 0 %.

Chaque chiffre ci-dessous est accompagné de sa source. Les prix sont par million de jetons (entrée / sortie). Les tarifs de Luna et Terra reflètent la grille tarifaire d'OpenAI du 30 juillet 2026, telle que rapportée par des médias dont Unite.AI ; la réduction de Sol reflète l'annonce d'OpenAI du 21 août 2026, avec des prix par jeton tels que rapportés par des médias dont Runtimewire et Reuters. Les pages de modèle pass-through d'OrcaRouter affichent les mêmes chiffres ; les chiffres des concurrents sont attribués. Les prix changent — vérifiez avant de construire.

TL;DR. OpenAI a réduit le prix de GPT-5.6 Luna à 0,20 $ / 1,20 $ (au lieu de 1 $ / 6 $, soit ~80 % de remise) et celui de GPT-5.6 Terra à 2 $ / 12 $ (au lieu de 2,50 $ / 15 $, soit ~20 % de remise) le 30 juillet. Le 21 août, elle a étendu la remise à son modèle phare : les prix de l'API GPT-5.6 Sol baissent de plus de 20 % pour les trois prochains mois — passant à 4 $ / 20 $ par million de jetons, contre 5 $ / 30 $, selon OpenAI — tandis que les crédits Codex et ChatGPT Work basés sur les jetons en donnent plus pour le même prix, et que l'utilisation des abonnements reste inchangée. Deux gains d'efficacité ont financé la baisse de juillet : des noyaux GPU réécrits (coût de service réduit d'environ 20 %) et un modèle de proposition réinventé pour le décodage spéculatif (génération de jetons plus rapide de 15 % et plus). Si vous passez par un point de terminaison neutre, sans marge, comme OrcaRouter, les nouveaux tarifs sont déjà en vigueur — même prix, une API compatible OpenAI, avec tous les modèles concurrents à côté pour comparer et router entre eux.

Points clés

• GPT-5.6 Luna : désormais 0,20 $ / 1,20 $ par 1 M de jetons, contre 1 $ / 6 $ auparavant — soit une réduction d'environ 80 %.

• GPT-5.6 Terra : désormais 2 $ / 12 $, au lieu de 2,50 $ / 15 $ — soit une baisse d’environ 20 %.

• GPT-5.6 Sol (modèle phare) : désormais 4 $ / 20 $ pour les trois prochains mois, au lieu de 5 $ / 30 $ — une réduction de plus de 20 % annoncée le 21 août 2026.

• Les crédits basés sur les tokens de Codex & ChatGPT Work achètent plus : l'entrée Sol passe à 100 crédits et la sortie à 500 crédits par million de tokens (au lieu de 125 / 750).

• Abonnements inchangés : l'utilisation incluse pour Plus, Pro et Business, les limites hebdomadaires de cinq heures et les anciens taux de crédit ne sont pas affectés.

• Pourquoi : OpenAI a présenté les deux séries comme des dividendes d'efficacité — des kernels GPU de production réécrits (coût de service réduit d'environ 20 %) et une refonte du modèle draft de décodage spéculatif (gain d'efficacité de génération de jetons de 15 %+), selon le billet d'ingénierie d'OpenAI du 29 juillet.

• Comment l'obtenir : les réductions sont déjà reflétées sur OrcaRouter (marge de 0 %) — Luna à 0,20 $ / 1,20 $, Sol à 4 $ / 20 $ — via un endpoint compatible OpenAI.

Qu'est-ce qui a changé exactement ?

La famille GPT-5.6 d'OpenAI se décline en plusieurs niveaux : Luna (rapide, la moins chère), Terra (intermédiaire) et Sol (modèle phare). La baisse du 30 juillet a touché les deux niveaux les moins chers. Selon la grille tarifaire publiée, le prix de GPT-5.6 Luna est passé de 1 $ / 6 $ à 0,20 $ / 1,20 $ par million de jetons d'entrée/sortie — soit une réduction d'environ 80 % sur l'entrée comme sur la sortie — et celui de GPT-5.6 Terra est passé de 2,50 $ / 15 $ à 2 $ / 12 $, soit environ 20 %. GPT-5.6 Sol, le modèle phare conçu pour le raisonnement le plus difficile et le codage agentique, n'a pas été touché ce jour-là — mais le 21 août 2026, OpenAI a annoncé une réduction temporaire pour lui aussi : les prix de l'API baissent de plus de 20 % pour les trois prochains mois, passant à 4 $ par million de jetons d'entrée et 20 $ par million de jetons de sortie, avec l'entrée en cache ramenée de 0,50 $ à 0,40 $. La même annonce indiquait que les crédits que vous achetez vont plus loin dans Codex sur les formules basées sur les jetons, et que l'utilisation incluse dans votre abonnement reste la même.

Le tarif de base par token ne dit pas tout. La tarification de GPT-5.6 comporte également des paliers selon la longueur de l’entrée (les contextes très longs passent à un tarif plus élevé), une remise pour la mise en cache des invites (une entrée en cache coûte bien moins cher qu’une entrée fraîche), et une option par lots (traitements asynchrones à prix réduit). Ces trois éléments s’appliquent après la réduction, si bien que le prix effectif pour une charge de travail utilisant beaucoup le cache ou les lots peut être encore plus bas. Attention au palier des contextes longs dans l’autre sens : de très longues invites peuvent vous faire passer au palier supérieur.

Les deux optimisations derrière la coupure

{{1}}Ce n'était pas une manœuvre à perte — OpenAI l'a présenté comme un dividende d'efficacité.{{/1}} {{2}}Dans un article technique du 29 juillet 2026, des membres de l'équipe technique d'OpenAI ont décrit des optimisations portant sur l'inférence et l'environnement d'exécution des agents derrière Codex et ChatGPT Work.{{/2}} {{3}}Deux d'entre elles se démarquent.{{/3}} {{4}}Premièrement, la réécriture des noyaux GPU dans l'ensemble de l'infrastructure de production — Sol, qui s'exécute dans Codex, ayant servi à réécrire les propres noyaux de l'entreprise{{/4}} — ce qui, selon OpenAI, a réduit les coûts de service de bout en bout d'environ 20 %.{{/5}} {{6}}Deuxièmement, un modèle draft repensé pour le décodage spéculatif{{/6}} qui aurait amélioré l'efficacité de génération de jetons de plus de 15 %.{{/7}} {{8}}La réduction du coût de service, répercutée sur les clients sous forme de prix plus bas sur les paliers à fort volume, voilà le message{{/8}} {{9}}— et c'est un aperçu d'une boucle de rétroaction que toute l'industrie poursuit :{{/9}} {{10}}utiliser des modèles de pointe pour optimiser l'infrastructure même qui les sert.{{/10}}

La baisse de prix de Sol annoncée le 21 août reprend le même cadrage. Selon OpenAI, cette réduction — plus de 20 % pour les trois prochains mois — intervient alors que l'entreprise rend le modèle plus efficace à exécuter, et elle est explicitement temporaire plutôt qu'une réinitialisation permanente des prix.

Comparaison des nouveaux prix

Cette baisse vise directement la concurrence. Selon les informations d'Unite.AI, les nouveaux tarifs de Luna à 0,20 $ / 1,20 $ sous-cotent le Haiku 4.5 d'Anthropic d'environ 5x en entrée et d'environ 4x en sortie, et les nouveaux tarifs de Terra à 2 $ / 12 $ se situent sous la tarification standard de Claude Sonnet 5 (annoncée à 3 $ / 15 $, qui doit prendre effet après le 31 août 2026). Face aux modèles à poids ouverts, Luna se situe désormais près du plancher d'inférence à bas prix établi par la gamme V4 de DeepSeek et le GLM-5.2 de Zhipu (environ 1,20 $ / 4,10 $), les paliers d'Alibaba Qwen et de Google Gemini Flash se trouvant dans la même fourchette. La baisse temporaire de Sol à 4 $ / 20 $ maintient le modèle phare bien au-dessus de ses propres paliers de volume, mais réduit la prime — et la réduction d'un tiers sur les tokens de sortie est particulièrement importante pour les charges de travail d'agents à forte consommation de sortie. La couverture médiatique de cette décision note qu'elle intervient alors qu'OpenAI fait face à une concurrence croissante de la part d'Anthropic et des modèles d'IA chinois.

L'inférence devient de moins en moins chère.

Prenez du recul : cette baisse s'inscrit dans une tendance pluriannuelle. Le coût d'un niveau de capacité donné a fortement chuté, génération après génération, à mesure que les laboratoires tirent davantage de débit du même matériel. Les anciennes gammes d'OpenAI illustrent cette dérive à la baisse au fil du temps, et chaque percée en matière d'efficacité — meilleurs noyaux de calcul, décodage spéculatif, attention moins coûteuse — tend à se traduire par une baisse de prix en quelques mois. Pour les acheteurs, l'implication pratique est de concevoir leurs systèmes en prévision d'un monde où l'inférence devient moins chère selon un calendrier prévisible : ne vous engagez pas excessivement sur le prix d'un seul modèle et gardez des coûts de bascule faibles.

Le coût caché à surveiller : jetons de raisonnement

Les modèles GPT-5.6 sont des modèles de raisonnement, et cela influence les dépenses réelles. Lorsque le raisonnement est activé, le modèle émet des jetons de raisonnement internes qui sont facturés comme sortie — votre coût de sortie effectif peut donc être plus élevé que ce qu'une estimation naïve « mots dans la réponse » suggère, surtout sur des invites difficiles avec un effort de raisonnement élevé. La solution consiste à ajuster l'effort de raisonnement à la tâche (faible ou désactivé pour les appels simples), à plafonner la sortie lorsque c'est possible, et à mesurer l'utilisation réelle des jetons plutôt que de la supposer. Un tarif par jeton moins cher aide, mais contrôler le nombre de jetons que vous générez aide davantage.

Ce que cela signifie pour les développeurs

Si vous utilisez GPT-5.6 Luna ou Terra pour du travail à volume élevé — classification, extraction, routage, agents légers, chat — votre facture vient de baisser, dans certains cas de la majeure partie de sa valeur, sans qu'aucun changement de code ne soit nécessaire. Cela rend les paliers de volume encore plus attractifs pour les charges de travail sensibles aux coûts et réduit l'écart de prix face aux modèles ouverts bon marché. La tarification du produit phare a aussi changé, du moins pour l'instant : Sol à 4 $ / 20 $ pour les trois prochains mois réduit le coût des travaux à forte intensité de raisonnement et des tâches d'agents sur le palier supérieur, et les crédits Codex et ChatGPT Work basés sur les jetons vont plus loin. C'est toujours un choix premium pour les tâches les plus difficiles — simplement moins cher qu'avant. Le schéma gagnant reste le même : répartissez selon la difficulté — paliers bon marché (ou modèles ouverts bon marché) pour les 80 % faciles, le produit phare uniquement là où il justifie son coût.

Comment réduire encore votre facture

La baisse de prix est un socle sur lequel construire, pas la ligne d'arrivée. Les principaux leviers supplémentaires : la mise en cache du prompt (réutilisez un prompt système stable ou un long contexte et bénéficiez du tarif d'entrée en cache, bien inférieur) ; l'option batch (exécutez les tâches non urgentes de manière asynchrone à prix réduit) ; le routage par palier et par modèle (envoyez chaque requête au modèle le moins cher capable de la traiter, y compris les modèles ouverts) ; et le contrôle du raisonnement (ne payez pas pour un raisonnement approfondi sur des appels triviaux). Combinés, ces leviers réduisent régulièrement les factures réelles bien plus que n'importe quel changement de tarif isolé. Pour donner un repère concret : à 10 millions de tokens par mois avec une part d'entrée de 70 %, les nouveaux tarifs de Luna reviennent à environ 5 $ par mois (environ 4,37 $ avec la mise en cache) ; le même volume sur Sol coûte environ 125 $ par mois — l'argument le plus clair en faveur d'un routage selon la difficulté.

Comment capturer immédiatement les prix plus bas

Voici la partie qui fait le lien. OrcaRouter applique 0 % de majoration et transmet directement les tarifs des fournisseurs, de sorte que les baisses de prix d'OpenAI sont déjà en vigueur sur OrcaRouter : GPT-5.6 Luna affiche $0.20 / $1.20, Terra $2 / $12, et GPT-5.6 Sol $4 / $20 sur les pages des modèles dès maintenant — les mêmes tarifs que la grille tarifaire d'OpenAI, accessibles via un seul endpoint compatible OpenAI, aux côtés de 185+ autres modèles. Vous obtenez les baisses de prix sans migration, et vous pouvez comparer les prix de Sol, Luna et Terra avec DeepSeek, GLM, Qwen, Gemini et Claude au même endroit, puis acheminer chaque requête vers l'option la moins chère pour la tâche. Il existe aussi une offre gratuite et une page Offers pour réaliser des économies supplémentaires.

Les réductions sont déjà en vigueur sur OrcaRouter : GPT-5.6 Luna à 0,20 $ / 1,20 $ et GPT-5.6 Sol à 4 $ / 20 $ par 1M de jetons, transmises avec une marge de 0 %.

Trier par difficulté pour économiser encore plus

La facture la moins chère n'est pas un seul modèle — c'est le bon modèle pour chaque requête. Parce qu'OrcaRouter expose toute la gamme via un seul endpoint, vous pouvez envoyer des appels simples et à fort volume vers Luna ou un modèle ouvert bon marché, et réserver Sol ou un autre modèle phare pour les plus difficiles, en changeant la configuration plutôt qu'en réintégrant. Une baisse de prix sur Luna rend cette stratégie de routage par difficulté encore moins chère, et la remise temporaire sur Sol réduit aussi le coût des appels difficiles — sans que vous ayez à tout reconfigurer.

FAQ

De combien OpenAI a-t-il réduit les prix de GPT-5.6 ?

GPT-5.6 Luna est passée de 1 $ / 6 $ à 0,20 $ / 1,20 $ par million de jetons (environ 80 %), et GPT-5.6 Terra de 2,50 $ / 15 $ à 2 $ / 12 $ (environ 20 %). Le 21 août 2026, OpenAI a également réduit GPT-5.6 Sol de 5 $ / 30 $ à 4 $ / 20 $ pour les trois prochains mois.

Quand la réduction de prix est-elle entrée en vigueur ?

Les réductions Luna et Terra ont pris effet le 30 juillet 2026, publiées en direct sur la grille tarifaire. OpenAI a annoncé la réduction temporaire de Sol le 21 août 2026, pour les trois prochains mois.

Pourquoi OpenAI a-t-il baissé ses prix ?

OpenAI attribue la baisse de juillet à des optimisations d'inférence — des kernels GPU de production réécrits (environ 20 % de coût de service en moins) et un modèle de décodage spéculatif redessiné (efficacité de génération de jetons supérieure de 15 %) — selon un article d'ingénierie du 29 juillet 2026. Il a présenté la baisse de Sol de la même manière, comme une étape franchie alors que le modèle devient moins coûteux à exécuter, dans un marché de plus en plus concurrentiel.

Le produit phare (Sol) est-il devenu moins cher ?

Oui — temporairement. La réduction du 30 juillet avait laissé GPT-5.6 Sol à 5 $ / 30 $, mais le 21 août 2026, OpenAI a annoncé une baisse de prix de plus de 20 % pour les trois prochains mois, à 4 $ / 20 $ par million de jetons. Les crédits basés sur les jetons de Codex et ChatGPT Work permettent également d'en acheter davantage, tandis que l'utilisation par abonnement reste inchangée.

Comment les nouveaux prix se comparent-ils à ceux d'Anthropic et des modèles ouverts ?

Selon les rapports, Luna sous-cote désormais Haiku 4.5 d'Anthropic d'environ 5x en entrée / 4x en sortie, et Terra passe sous le tarif standard de Claude Sonnet 5 ($3 / $15). Luna se situe également près du plancher des modèles ouverts bon marché établi par DeepSeek et GLM-5.2.

Quel est le piège avec les jetons de raisonnement ?

GPT-5.6 sont des modèles de raisonnement ; les jetons de raisonnement internes sont facturés comme sortie, de sorte que le coût de sortie effectif peut dépasser une estimation naïve. Ajustez l’effort de raisonnement et plafonnez la sortie pour le contrôler.

Comment puis-je obtenir les nouveaux prix plus bas ?

Ils sont déjà en ligne sur l'API d'OpenAI et, avec une marge de 0 %, sur OrcaRouter — où GPT-5.6 Luna affiche $0.20 / $1.20 et GPT-5.6 Sol $4 / $20 — via un point d'accès compatible OpenAI, sans changement de code.

L'essentiel

La baisse du 30 juillet chez OpenAI a rendu GPT-5.6 Luna et Terra nettement moins chers pour les travaux à grand volume, et son annonce du 21 août prolonge cette dynamique jusqu’au produit phare : GPT-5.6 Sol passe à 4 $ / 20 $ pour les trois prochains mois, tandis que les crédits de tokens Codex achètent plus et que l’utilisation de l’abonnement reste inchangée. Ces deux vagues sont des dividendes d’efficacité — réécritures du noyau et gains de décodage spéculatif d’un côté, serveur moins coûteux à exécuter de l’autre — et une réponse claire à une véritable guerre des prix. Acheminez selon la difficulté, appuyez-vous sur la mise en cache et le traitement par lots, et contrôlez les jetons de raisonnement pour économiser au maximum. Et comme OrcaRouter transmet les tarifs des fournisseurs avec une marge de 0 %, les tarifs réduits y sont déjà actifs — Luna à 0,20 $ / 1,20 $, Sol à 4 $ / 20 $ — même prix, un point de terminaison compatible OpenAI, tout l’univers des modèles en un seul endroit. Profitez des baisses sans changer une ligne de code, et laissez chaque requête choisir le modèle le moins cher capable de faire le travail.