
GPT-6 Sol et GPT-6 Luna : le jeton le moins cher n'est pas toujours la tâche la moins chère
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Le fournisseur a livré GPT-6 Sol et GPT-6 Luna le 22 septembre 2026, et partout, le titre qui domine, c'est le prix : Sol à 2,00 $ par million de jetons en entrée et 10,00 $ en sortie, Luna à 0,10 $ et 0,50 $, soit environ la moitié de ce que GPT-5.6 Sol et GPT-5.6 Luna facturent aux tarifs promotionnels actuels, et tous deux bien en dessous du modèle phare GPT-6 Astra à 10,00 $/50,00 $. L'annonce du fournisseur elle-même s'ouvre sur « nous avons aussi rendu la mise en cache et l'inférence plus efficaces ». Le problème, quand on lit cela comme une histoire de rabais, c'est que l'unité qui atterrit réellement sur votre facture n'est pas un jeton. C'est une tâche. Et les premières mesures indépendantes, publiées le jour même, montrent les deux nouveaux modèles dériver dans des directions opposées sur exactement cette unité — GPT-6 Luna, le moins cher des deux d'un facteur vingt en entrée, étant celui des deux qui s'en sort le moins bien face à son propre prédécesseur. L'un de ces modèles est une mise à niveau pure et simple et l'autre un véritable compromis, et l'annonce du fournisseur ne fait pas la distinction entre les deux.
Avant les chiffres, les règles de sourçage de cet article, car les deux ensembles de preuves ici méritent un poids très différent. Les prix, la fenêtre de contexte, les tarifs de cache et les dates de coupure des connaissances proviennent de la documentation API et des tableaux de tarification d'OpenAI, consultés le 23 septembre 2026, les lignes relatives aux niveaux de service et à l'écriture de cache étant corroborées par des outils tiers de suivi des coûts plutôt que reprises de la seule annonce. Les tableaux de benchmark d'OpenAI — AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam, et une évaluation interne de factualité — sont rapportés par le fournisseur et non reproduits, et chaque chiffre qui en est tiré ci-dessous est signalé comme tel. Les chiffres indépendants proviennent d'Artificial Analysis, qui a évalué les deux modèles sur son Intelligence Index et son Coding Agent Index le jour du lancement ; ce sont ceux auxquels se fier pour prendre une décision. Lorsqu'ils divergent, l'article le dit plutôt que d'en faire une moyenne.
Le lancement, en un paragraphe
Sol et Luna sont des membres de gamme intermédiaire et d'entrée de gamme de la famille GPT-6, entraînés avec les méthodes qui sous-tendent GPT-6 Astra et positionnés comme des moyens plus rapides et moins coûteux d'atteindre la majeure partie de ses capacités. Le cadrage d'OpenAI porte sur le coût par tâche plutôt que sur la capacité brute : il affirme que GPT-6 Sol commet environ deux fois moins d'erreurs que GPT-5.6 Sol sur son évaluation interne de factualité, et que GPT-6 Luna, à un effort de raisonnement plus élevé, atteint la factualité de GPT-5.6 Sol pour environ un centième du coût par tâche. Les deux acceptent du texte et des images en entrée et produisent du texte, les deux disposent d'une fenêtre de contexte de 1 050 000 tokens avec un plafond de sortie de 128 K — Artificial Analysis indique 872 k pour le même modèle, donc considérez le haut de cette fenêtre comme déclaré par le fournisseur — et les deux exposent un effort de raisonnement de none à max, un niveau que GPT-6 Astra ne propose pas, car Astra n'a pas de none. Les identifiants de modèle sont gpt-6-sol et gpt-6-luna. La disponibilité passe par l'API, par ChatGPT Work et Codex pour les comptes Plus, Pro, Business, Enterprise et Edu, et par Amazon Bedrock, qui a annoncé la disponibilité générale des deux le jour même. Les utilisateurs Free et Go obtiennent Luna dans l'application de bureau ; aucun des deux modèles n'est encore en mode Chat standard.
Ce que disent les quatre nombres indépendants, et pourquoi ils divergent
Commençons par GPT-6 Sol, car son histoire est simple. Artificial Analysis lui attribue 48 sur l'Intelligence Index, 18e sur 212 modèles mesurés, à 1,06 $ par tâche d'indice contre 1,99 $ pour GPT-5.6 Sol — environ la moitié du coût pour un score d'indice équivalent, et une amélioration du coût par tâche qui tient bon au lieu de s'évaporer. Son Coding Agent Index passe à 57 contre 55, Terminal-Bench 4.0 progressant de 37 % à 43 % et SWE-Atlas-QnA de 54 % à 58 %, à 2,99 $ par tâche sur la frontière de Pareto. Son taux d'hallucination chute de 92 % à 60 %, et son comportement d'abstention change entièrement de forme : il répond désormais à 83 % des questions là où la génération précédente répondait à 99 %, et en échange obtient un quart de réponses fausses en moins, la précision glissant de 59 % à 54 %. C'est un modèle à qui l'on a appris à se taire quand il ne sait pas, et l'AA-Omniscience Index passant de 22 à 27 est ce même fait énoncé sous forme de score.
Maintenant GPT-6 Luna, et l'histoire change. Artificial Analysis lui attribue un score de 37 sur l'Intelligence Index — le chiffre identique obtenu par GPT-5.6 Luna. Son coût par tâche d'indice passe de 0,18 $ à 0,07 $, soit environ 60 % de moins, et cette économie est réelle. Mais son Coding Agent Index baisse, de 43 à 41, avec SWE-Atlas-QnA qui chute de 49 % à 44 % et DeepSWE 1.1 qui chute de 66 % à 64 %. Son taux d'hallucination s'améliore, passant de 93 % à 77 %, et son comportement d'abstention ne bouge presque pas — précision de 44 % contre 43 %, AA-Omniscience de −10 à 1. Lus ensemble : la même intelligence mesurée, pour environ 40 % du coût de la tâche, avec un agent de codage moins bon et une qualité de réponse pratiquement inchangée.
Ce n’est pas une contradiction, et la raison compte. Un jeton moins cher ne vous apporte un gain moindre que si le modèle dépense plus de jetons pour accomplir le même travail — et les données indépendantes indiquent que ces modèles en dépensent plus, pas moins. La sortie par tâche d’indexation est passée de 29k à 31k jetons pour Sol et de 41k à 51k pour Luna. L’économie de 60 % de GPT-6 Luna provient entièrement de la baisse de prix, et non d’un fonctionnement plus économe. La dérive des jetons par tâche est suffisamment faible pour que l’arithmétique joue encore en votre faveur ici ; elle n’est pas assez faible pour être ignorée en tant que catégorie, car c’est le mécanisme par lequel une future baisse de prix peut être neutralisée par un modèle plus bavard. La communication d’OpenAI elle-même s’est tournée vers le coût par tâche pour la même raison.
Deux régressions se situent en dehors des deux indices phares et méritent d'être nommées, car aucune n'apparaît dans l'annonce d'OpenAI. Dans GDPval-AA v2.1, qui mesure les livrables du travail intellectuel, GPT-6 Sol perd environ 100 Elo face à son prédécesseur, et GPT-6 Luna environ 75. GPT-6 Luna perd également environ 45 Elo dans AA-Briefcase v1.1, où Sol reste stable — Artificial Analysis attribue cet écart à une présentation plus faible et à des critères d'évaluation manquants. Si votre usage du niveau économique consiste à faire de la synthèse, de l'extraction et de la classification en masse, rien de tout cela ne vous concerne. S'il consiste à rédiger quelque chose qu'une personne valide, si.

Le changement de mise en cache est la vraie nouvelle de l'API
Enfoui sous la grille tarifaire se cache un changement qui compte davantage pour une facture de production que la baisse mise en avant, et c’est la partie de l’annonce que le propre post d’OpenAI effleure d’une seule clause. Trois choses ont changé, et la troisième est celle qu’il faut lire deux fois.
Le premier est la remise elle-même : les lectures d'entrée mises en cache sont facturées à 10 % du tarif d'entrée, soit une remise de 90 %, la même condition que celle déjà appliquée par la famille plutôt qu'une nouvelle. L'entrée mise en cache de Sol est à 0,20 $ par million et celle de Luna à 0,01 $ ; les écritures de cache entraînent un supplément de 1,25x, soit 2,50 $ et 0,125 $ respectivement, avec une seule durée de vie de 30 minutes.
Le second est le contrôle. La mise en cache explicite via prompt_cache_options et prompt_cache_breakpoint — les paramètres qui vous permettent de déclarer où se termine un préfixe de prompt réutilisable plutôt que d'espérer que le fournisseur le devine — est disponible sur les deux modèles. Il ne s'agit pas d'une nouvelle surface d'API ; ce qui est nouveau, c'est que cela vaut la peine d'être utilisé, car les taux de succès par défaut ont augmenté.
Le troisième est celui qui change l'architecture. Modifier l'effort de raisonnement ou activer ou désactiver des outils n'invalide plus le préfixe mis en cache. Avant cela, une boucle d'agent qui augmentait l'effort pour une étape difficile puis le réduisait pour une étape facile payait le retraitement de tout son contexte à chaque ajustement, et il en allait de même pour celle qui ajoutait ou retirait un outil en cours de conversation. Cette taxe a désormais disparu sur ces deux modèles. OpenAI cite GitHub, qui a rapporté que ces changements ont réduit de plus de moitié la part des jetons de prompt nécessitant un traitement à neuf sur des milliards de requêtes. Considérez ce chiffre comme fourni par le fournisseur — il est crédible et il n'est pas audité de manière indépendante.
Faites le calcul sur une longue boucle d'agent et le classement des deux annonces s'inverse. Une boucle qui transporte une invite système de 30 000 jetons et un schéma d'outils sur 200 tours déplace 6 millions de jetons de contexte. Sans mise en cache, sur GPT-6 Sol, cela représente 12,00 $ d'entrée. Avec le préfixe mis en cache à 0,20 $ par million, cela fait 1,20 $ plus l'écriture ponctuelle — un ordre de grandeur, à partir d'un changement de paramètre, avant même que la baisse de tarif ne soit appliquée. La baisse de tarif, c'est ce que l'annonce a vendu. Le comportement du cache est ce qui fait réellement bouger le chiffre, et c'est la raison pour laquelle un tarif affiché de 2,00 $ se comporte comme quelque chose de bien moins cher sur les charges de travail pour lesquelles OpenAI destine ces modèles.
La grille tarifaire, y compris les parties que l’annonce omet.
Les tarifs affichés ne représentent pas toute la grille tarifaire, et trois niveaux changent la décision pour des charges de travail spécifiques.
• Base — GPT-6 Sol 2,00 $ en entrée / 10,00 $ en sortie ; GPT-6 Luna 0,10 $ en entrée / 0,50 $ en sortie, par million de tokens, pour les prompts jusqu'à 272K tokens d'entrée.
• Contexte long — au-delà de 272 K tokens d'entrée, la requête entière est facturée à 2x en entrée et 1,5x en sortie : 4,00 $/15,00 $ pour Sol et 0,20 $/0,75 $ pour Luna. C'est un effet de falaise, pas un taux marginal. Si vos prompts atteignent 300 K tokens, vous payez le double sur la requête entière, et non sur les 28 K au-delà du seuil, et diviser un document en deux appels sous le seuil est souvent moins cher que de l'envoyer une seule fois au-dessus du seuil.
• Niveaux de service — Flex divise la facture par deux (1,00 $/5,00 $ pour Sol, 0,05 $/0,25 $ pour Luna) en échange d'un traitement plus lent ; Priority la double. Les deux sont sélectionnés via le service_tier paramètre. C'est dans Flex que les tâches de type batch devraient résider, et c'est presque jamais le cas.
• Entrée mise en cache — 0,20 $ par million sur Sol et 0,01 $ sur Luna, soit une remise de 90 %, avec une durée de vie de 30 minutes et une majoration de 1,25x pour l'écriture en cache.
• Contexte et sortie — fenêtre de 1 050 000 jetons, sortie maximale de 128K, entrée texte et image, sortie texte, effort de raisonnement d'aucun à max avec moyen par défaut.
• Dates de coupure des connaissances — le 20 avril 2026 pour GPT-6 Sol et le 18 mai 2026 pour GPT-6 Luna, soit un mois d'écart au sein d'une même famille, ce qu'il vaut la peine de savoir avant de supposer que les deux modèles partagent la même vision du monde.
Ce que dit le tableau de benchmarks d’OpenAI, et ce qu’il ne dit pas
Les comparaisons publiées par OpenAI sont toutes des comparaisons de coût par tâche, toutes face à Anthropic et toutes menées par le fournisseur. Sur AutomationBench 1.0.6, une évaluation agentique à 47 outils, l’entreprise rapporte que GPT-6 Sol, en effort xhigh, obtient 33,2 % à 0,27 $ par tâche, contre Claude Opus 5 à 26,9 % et environ 11 fois le coût par tâche. Sur DeepSWE 1.1, elle rapporte que Sol, en effort max, obtient 68,8 % contre Claude Fable 5 à 69,9 % — une perte sur le score pour un coût par tâche environ 80 % inférieur — et Luna à 66,6 %. Sur OSWorld 2.0, Sol obtient 60,5 % en xhigh contre 60,3 % pour Opus 5, là encore à environ 80 % de moins par tâche. Sur Agents’ Last Exam, Sol atteint 56,4 %, ce qui, selon OpenAI, dépasse le meilleur résultat d’Opus 5 pour un coût par tâche 60 % inférieur.
Chacun de ces chiffres est déclaré par le fournisseur et non reproduit, et deux mises en garde méritent d'être gardées à l'esprit plutôt que classées. Premièrement, OpenAI a réalisé son évaluation comparative face à Claude Opus 5, et non face à Claude Opus 5.5, sorti quelques heures avant l'annonce ; aucune comparaison à harnais identique n'établit donc encore quel modèle offre réellement le coût le plus faible par tâche réussie. Deuxièmement, le coût par tâche n'est pas le coût par tâche correcte : un modèle qui répond 83 % du temps et s'abstient le reste du temps paraîtra bon marché par tâche sur un benchmark qui compte les abstentions comme des tâches. Les données indépendantes sur l'abstention citées plus haut sont ce qui vous permet de chiffrer cela honnêtement — le fait que GPT-6 Sol réponde à 83 % des questions là où l'ancien modèle répondait à 99 % est un compromis délibéré, et la question de savoir s'il est judicieux dépend entièrement de ce que vous coûte une mauvaise réponse.
OpenAI indique que GPT-6 Luna, avec un effort plus élevé, égale la factualité de GPT-5.6 Sol pour environ un centième du coût de la tâche. Il s'agit d'une comparaison de factualité, et non d'une comparaison de capacités, et l'indice indépendant Coding Agent Index classe GPT-6 Luna deux points en dessous de GPT-5.6 Luna, et encore moins GPT-5.6 Sol.

Que faire réellement de ceci
GPT-6 Sol est le plus simple. Un coût de tâche réduit de moitié à un score d'indice de niveau, un meilleur agent de codage, une forte baisse des hallucinations et un véritable changement de comportement d'abstention : tout cela constitue une mise à niveau que l'on peut planifier plutôt qu'un pari. Si vous utilisez GPT-5.6 Sol, il s'agit d'une migration, et la seule vraie question est de savoir lesquels de vos prompts dépendent de la propension de l'ancien modèle à répondre à tout.
GPT-6 Luna est celui à tester avant de changer. Ce n'est pas un GPT-5.6 Luna strictement meilleur ; c'est un modèle de forme différente — moins cher par tâche, plus prudent sur ce qu'il affirmera, et sensiblement moins bon en codage agentique. Pour la classification, l'extraction, le routage et le résumé à grande échelle, l'arbitrage revient presque à de l'argent gratuit. Pour tout ce qui alimente un agent de codage, ou produit un document qu'une personne valide, la régression de deux points sur Coding Agent et le repli sur GDPval sont la raison de garder GPT-5.6 Luna dans la chaîne jusqu'à ce que vous ayez fait passer vos propres tâches par les deux.
C'est aussi l'argument pour ne câbler en dur ni l'un ni l'autre. Les deux modèles sont aujourd'hui exclusifs à OpenAI, et les charges de travail que ces niveaux servent — routage, extraction, classification à bas coût — sont précisément celles où un second fournisseur derrière le même point de terminaison transforme une régression de modèle en non-événement. OrcaRouter répercute les prix catalogue des fournisseurs avec 0 % de marge, de sorte qu'un changement de tarif d'un fournisseur arrive de notre côté le jour même où il arrive du côté du fournisseur, et le DSL de routage vous permet de placer GPT-6 Luna derrière un modèle moins cher pour la part facile du trafic, tandis que la part plus difficile va à GPT-6 Sol — avec un basculement automatique si l'un ou l'autre chemin se dégrade. Vous n'avez pas besoin de choisir un gagnant le jour du lancement pour profiter du lancement.
La mise en garde honnête : GPT-6 Sol et GPT-6 Luna ne sont pas routables via OrcaRouter au 23 septembre 2026. Nous ne les hébergeons pas encore, et rien de ce qui précède ne doit être interprété comme une affirmation que nous le faisons. Ce que nous avons de notre côté aujourd’hui, c’est l’ensemble de comparaison — GPT-5.6 Sol à 4,00 $/20,00 $, GPT-5.6 Luna à 0,20 $/1,20 $, et GPT-6 Astra à 10,00 $/50,00 $ — soit exactement ce qu’il vous faut pour chiffrer la migration avant de vous engager.

Que regarder ensuite
Trois choses permettraient de trancher ce qu’a réellement été ce lancement. La première est de savoir si le tarif de 0,20 $/1,20 $ de GPT-5.6 Luna tient jusqu’à la fin du trimestre, car un prix permanent annoncé par un fournisseur a historiquement constitué le coup d’ouverture plutôt que le point final — et la sortie de Claude Opus 5.5 le même jour suggère que la pression à l’origine de cette baisse n’a pas disparu. La deuxième est de savoir si ce basculement vers l’abstention tient sur le terrain : GPT-6 Sol refusant de répondre à une question sur six est le genre de changement qui passe pour une amélioration en laboratoire et pour un produit défaillant dans un pipeline qui présupposait une réponse. La troisième est de savoir si le comportement du cache se vérifie sur votre trafic, ce qui est mesurable cette semaine et ne peut être tranché qu’en mesurant — la remise est suffisamment importante pour qu’une heure passée à instrumenter les taux de succès du cache sur vos prompts les plus longs vaille plus qu’un tableau de benchmarks supplémentaire.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
