
OpenAI réduit les prix de l’API GPT-5.6 : ce qui a changé, pourquoi et comment l’obtenir
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 55 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 206 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleNOUVEAUGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleNOUVEAUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
Le 30 juillet 2026, OpenAI a baissé les prix API de ses deux modèles GPT-5.6 les moins chers — réduisant fortement le palier d'entrée et rognant le palier intermédiaire, tout en laissant son modèle phare intact. C'est une décision notable dans une guerre des prix qui s'intensifie, et elle a été immédiatement répercutée sur la grille tarifaire publiée. Cet article explique exactement ce qui a changé, l'ingénierie derrière cette décision, comment les nouveaux prix se comparent à ceux des concurrents, les coûts cachés à surveiller, comment réduire encore votre facture — et comment les prix réduits sont déjà en vigueur sur OrcaRouter avec une marge de 0 %.
Chaque chiffre ci-dessous est accompagné de sa source. Les prix sont indiqués par million de jetons (entrée / sortie) et reflètent la grille tarifaire d'OpenAI du 30 juillet 2026, telle que rapportée par des médias dont Unite.AI, ainsi que les pages de modèles en transparence d'OrcaRouter ; les chiffres des concurrents sont attribués. Les prix changent — vérifiez avant de construire.
TL;DR. OpenAI a réduit le prix de GPT-5.6 Luna à 0,20 $ / 1,20 $ (au lieu de 1 $ / 6 $, soit ~80 % de réduction) et celui de GPT-5.6 Terra à 2 $ / 12 $ (au lieu de 2,50 $ / 15 $, soit ~20 % de réduction), tandis que GPT-5.6 Sol reste à 5 $ / 30 $. Deux gains d'efficacité ont financé cette baisse : des kernels GPU réécrits (coût de service en baisse d'environ 20 %) et un modèle de draft redessiné pour le décodage spéculatif (génération de tokens 15 % plus rapide). La baisse place Luna sous le Haiku 4.5 d'Anthropic et la rapproche du plancher des modèles ouverts bon marché établi par DeepSeek et GLM. Si vous passez par un endpoint neutre, avec 0 % de marge, comme OrcaRouter, les nouveaux tarifs sont déjà actifs — même prix, une API compatible OpenAI, avec tous les modèles concurrents à côté pour comparer et router entre eux.
Points clés
• GPT-5.6 Luna : désormais 0,20 $ / 1,20 $ par 1 M de jetons, contre 1 $ / 6 $ auparavant — soit une réduction d'environ 80 %.
• GPT-5.6 Terra : désormais 2 $ / 12 $, au lieu de 2,50 $ / 15 $ — soit une baisse d’environ 20 %.
• GPT-5.6 Sol (produit phare) : inchangé à 5 $ / 30 $.
• Pourquoi : réécriture des kernels GPU de production (coût de service réduit d'environ 20 %) et refonte du modèle de draft pour le décodage spéculatif (efficacité de génération de tokens en hausse de plus de 15 %), selon le post d'ingénierie d'OpenAI du 29 juillet.
• Comment l'obtenir : la réduction est déjà reflétée sur OrcaRouter (marge de 0 %) — Luna à 0,20 $ / 1,20 $ — via un endpoint compatible OpenAI.
Qu'est-ce qui a changé exactement ?
La famille GPT-5.6 d'OpenAI fonctionne comme une échelle de paliers : Luna (rapide, la moins chère), Terra (intermédiaire) et Sol (le fleuron). La baisse du 30 juillet a touché les deux paliers les moins chers. Selon la grille tarifaire rapportée, GPT-5.6 Luna est passé de 1 $ / 6 $ à 0,20 $ / 1,20 $ par million de jetons en entrée/sortie — soit une réduction d'environ 80 % à la fois en entrée et en sortie — et GPT-5.6 Terra est passé de 2,50 $ / 15 $ à 2 $ / 12 $, soit environ 20 %. GPT-5.6 Sol, le fleuron conçu pour les raisonnements les plus difficiles et le codage agentique, est resté à 5 $ / 30 $. Les paliers de volume sont devenus considérablement moins chers ; le palier supérieur n'a pas bougé.
Le tarif de base par token ne dit pas tout. La tarification de GPT-5.6 comporte également des paliers selon la longueur de l’entrée (les contextes très longs passent à un tarif plus élevé), une remise pour la mise en cache des invites (une entrée en cache coûte bien moins cher qu’une entrée fraîche), et une option par lots (traitements asynchrones à prix réduit). Ces trois éléments s’appliquent après la réduction, si bien que le prix effectif pour une charge de travail utilisant beaucoup le cache ou les lots peut être encore plus bas. Attention au palier des contextes longs dans l’autre sens : de très longues invites peuvent vous faire passer au palier supérieur.

Les deux optimisations derrière la coupure
{{1}}Ce n'était pas une manœuvre à perte — OpenAI l'a présenté comme un dividende d'efficacité.{{/1}} {{2}}Dans un article technique du 29 juillet 2026, des membres de l'équipe technique d'OpenAI ont décrit des optimisations portant sur l'inférence et l'environnement d'exécution des agents derrière Codex et ChatGPT Work.{{/2}} {{3}}Deux d'entre elles se démarquent.{{/3}} {{4}}Premièrement, la réécriture des noyaux GPU dans l'ensemble de l'infrastructure de production — Sol, qui s'exécute dans Codex, ayant servi à réécrire les propres noyaux de l'entreprise{{/4}} — ce qui, selon OpenAI, a réduit les coûts de service de bout en bout d'environ 20 %.{{/5}} {{6}}Deuxièmement, un modèle draft repensé pour le décodage spéculatif{{/6}} qui aurait amélioré l'efficacité de génération de jetons de plus de 15 %.{{/7}} {{8}}La réduction du coût de service, répercutée sur les clients sous forme de prix plus bas sur les paliers à fort volume, voilà le message{{/8}} {{9}}— et c'est un aperçu d'une boucle de rétroaction que toute l'industrie poursuit :{{/9}} {{10}}utiliser des modèles de pointe pour optimiser l'infrastructure même qui les sert.{{/10}}
Comparaison des nouveaux prix
Cette baisse de prix vise directement la concurrence. Selon le rapport d'Unite.AI, le nouveau tarif de Luna à 0,20 $ / 1,20 $ sous-cote Haiku 4.5 d'Anthropic d'environ 5x en entrée et d'environ 4x en sortie, tandis que le nouveau tarif de Terra à 2 $ / 12 $ se situe sous le prix standard de Claude Sonnet 5 (annoncé à 3 $ / 15 $, en vigueur après le 31 août 2026). Côté modèles à poids ouverts, Luna se rapproche désormais du plancher d'inférence bon marché établi par la gamme V4 de DeepSeek et GLM-5.2 de Zhipu (environ 1,20 $ / 4,10 $), avec les gammes Qwen d'Alibaba et Gemini Flash de Google dans la même zone. En d'autres termes, OpenAI a déplacé ses paliers de volume vers le bas, là où vivent déjà les modèles capables les moins chers — réduisant ainsi la pénalité de prix liée au choix d'un modèle propriétaire plutôt qu'ouvert.
L'inférence devient de moins en moins chère.
Prenez du recul : cette baisse s'inscrit dans une tendance pluriannuelle. Le coût d'un niveau de capacité donné a fortement chuté, génération après génération, à mesure que les laboratoires tirent davantage de débit du même matériel. Les anciennes gammes d'OpenAI illustrent cette dérive à la baisse au fil du temps, et chaque percée en matière d'efficacité — meilleurs noyaux de calcul, décodage spéculatif, attention moins coûteuse — tend à se traduire par une baisse de prix en quelques mois. Pour les acheteurs, l'implication pratique est de concevoir leurs systèmes en prévision d'un monde où l'inférence devient moins chère selon un calendrier prévisible : ne vous engagez pas excessivement sur le prix d'un seul modèle et gardez des coûts de bascule faibles.
Le coût caché à surveiller : jetons de raisonnement
Les modèles GPT-5.6 sont des modèles de raisonnement, et cela influence les dépenses réelles. Lorsque le raisonnement est activé, le modèle émet des jetons de raisonnement internes qui sont facturés comme sortie — votre coût de sortie effectif peut donc être plus élevé que ce qu'une estimation naïve « mots dans la réponse » suggère, surtout sur des invites difficiles avec un effort de raisonnement élevé. La solution consiste à ajuster l'effort de raisonnement à la tâche (faible ou désactivé pour les appels simples), à plafonner la sortie lorsque c'est possible, et à mesurer l'utilisation réelle des jetons plutôt que de la supposer. Un tarif par jeton moins cher aide, mais contrôler le nombre de jetons que vous générez aide davantage.
Ce que cela signifie pour les développeurs
Si vous utilisez GPT-5.6 Luna ou Terra pour des travaux à grand volume — classification, extraction, routage, agents légers, chat — votre facture vient de baisser, dans certains cas de la majeure partie de sa valeur, sans nécessiter de modification de code. Cela rend les paliers de volume encore plus attractifs pour les charges de travail sensibles au coût et réduit l’écart de prix avec les modèles ouverts bon marché. La logique du modèle phare est inchangée : Sol à 5 $ / 30 $ reste un choix premium pour les tâches les plus difficiles. La stratégie gagnante consiste à router selon la difficulté — des paliers bon marché (ou des modèles ouverts bon marché) pour les 80 % faciles, le modèle phare uniquement là où il justifie son coût.
Comment réduire encore votre facture
La baisse de prix est un socle sur lequel construire, pas la ligne d'arrivée. Les principaux leviers supplémentaires : la mise en cache du prompt (réutilisez un prompt système stable ou un long contexte et bénéficiez du tarif d'entrée en cache, bien inférieur) ; l'option batch (exécutez les tâches non urgentes de manière asynchrone à prix réduit) ; le routage par palier et par modèle (envoyez chaque requête au modèle le moins cher capable de la traiter, y compris les modèles ouverts) ; et le contrôle du raisonnement (ne payez pas pour un raisonnement approfondi sur des appels triviaux). Combinés, ces leviers réduisent régulièrement les factures réelles bien plus que n'importe quel changement de tarif isolé. Pour donner un repère concret : à 10 millions de tokens par mois avec une part d'entrée de 70 %, les nouveaux tarifs de Luna reviennent à environ 5 $ par mois (environ 4,37 $ avec la mise en cache) ; le même volume sur Sol coûte environ 125 $ par mois — l'argument le plus clair en faveur d'un routage selon la difficulté.
Comment capturer immédiatement les prix plus bas
Voici la partie qui relie tout. a href="https://www.orcarouter.ai/">OrcaRouter/a> facture une marge de 0 % et transmet les tarifs des fournisseurs sans les modifier, de sorte que les tarifs d'OpenAI sont déjà en ligne sur OrcaRouter : GPT-5.6 Luna affiche $0.20 / $1.20 et Terra $2 / $12 sur les pages des modèles à l'instant même — les mêmes tarifs que ceux de la grille tarifaire d'OpenAI, accessibles via un point de terminaison unique compatible OpenAI aux côtés de 185+ autres modèles. Vous obtenez ces tarifs sans migration, et vous pouvez comparer les prix de Luna et Terra à ceux de DeepSeek, GLM, Qwen, Gemini et Claude en un seul endroit, puis acheminer chaque requête vers l'option la moins chère pour la tâche. Il existe aussi un niveau gratuit et une page Offres pour des économies supplémentaires.

La réduction est déjà en ligne sur OrcaRouter : GPT-5.6 Luna à 0,20 $ / 1,20 $ par 1M de tokens, répercutée avec une marge de 0 %.
Trier par difficulté pour économiser encore plus
La facture la moins chère n'est pas un seul modèle — c'est le bon modèle pour chaque requête. Comme OrcaRouter expose tout l'éventail via un seul endpoint, vous pouvez envoyer les appels simples et à fort volume à Luna ou à un modèle ouvert bon marché, et réserver Sol ou un autre modèle phare pour les plus difficiles, en changeant de configuration plutôt qu'en réintégrant. Une baisse de prix sur Luna rend cette stratégie de routage par difficulté encore moins coûteuse, sans que vous ayez à tout rebrancher.

FAQ
De combien OpenAI a-t-il réduit les prix de GPT-5.6 ?
GPT-5.6 Luna a chuté de 1 $ / 6 $ à 0,20 $ / 1,20 $ par million de jetons (environ 80 %), et GPT-5.6 Terra de 2,50 $ / 15 $ à 2 $ / 12 $ (environ 20 %). GPT-5.6 Sol est resté à 5 $ / 30 $.
Quand la réduction de prix est-elle entrée en vigueur ?
30 juillet 2026, consigné dans le journal des modifications de l'API OpenAI et actif sur la grille tarifaire publiée.
Pourquoi OpenAI a-t-il baissé ses prix ?
OpenAI l'attribue à des optimisations d'inférence — des noyaux GPU de production réécrits (environ 20 % de coût de service en moins) et un modèle de draft de décodage spéculatif repensé (efficacité de génération de jetons de 15 %+) — selon un article d'ingénierie du 29 juillet 2026.
Le produit phare (Sol) est-il devenu moins cher ?
Non. GPT-5.6 Sol reste à $5 / $30 par million de jetons. Seuls les deux niveaux les moins chers, Luna et Terra, ont été réduits.
Comment les nouveaux prix se comparent-ils à ceux d'Anthropic et des modèles ouverts ?
Selon les rapports, Luna sous-cote désormais Haiku 4.5 d'Anthropic d'environ 5x en entrée / 4x en sortie, et Terra passe sous le tarif standard de Claude Sonnet 5 ($3 / $15). Luna se situe également près du plancher des modèles ouverts bon marché établi par DeepSeek et GLM-5.2.
Quel est le piège avec les jetons de raisonnement ?
GPT-5.6 sont des modèles de raisonnement ; les jetons de raisonnement internes sont facturés comme sortie, de sorte que le coût de sortie effectif peut dépasser une estimation naïve. Ajustez l’effort de raisonnement et plafonnez la sortie pour le contrôler.
Comment puis-je obtenir les nouveaux prix plus bas ?
Ils sont déjà disponibles sur l'API d'OpenAI et, avec une marge de 0%, sur OrcaRouter — où GPT-5.6 Luna affiche $0.20 / $1.20 — via un endpoint compatible OpenAI, sans modification de code nécessaire.
En résumé
{{1}}La baisse du 30 juillet d'OpenAI rend GPT-5.6 Luna et Terra nettement moins chers pour les travaux à grand volume{{/1}} — {{2}}un dividende d'efficacité issu des réécritures du noyau et des gains de décodage spéculatif{{/2}}, et {{3}}une réponse claire à une véritable guerre des prix{{/3}} qui {{4}}mine désormais les paliers les moins chers d'Anthropic et approche le plancher des modèles ouverts{{/4}}. {{5}}Le modèle phare Sol est inchangé{{/5}}, donc {{6}}routez par difficulté, misez sur la mise en cache et le traitement par lots{{/6}}, et {{7}}contrôlez les jetons de raisonnement{{/7}} pour économiser au maximum. Et parce que {{8}}OrcaRouter transmet les tarifs des fournisseurs avec une marge de 0 %{{/8}}, {{9}}les tarifs réduits y sont déjà en vigueur{{/9}} — {{10}}même prix, un seul point de terminaison compatible OpenAI, toute la gamme des modèles au même endroit{{/10}}. {{11}}Profitez de la baisse sans changer une ligne de code{{/11}}, et {{12}}laissez chaque requête choisir le modèle le moins cher capable de faire le travail{{/12}}.
