
GPT-5.6 Luna Max : comment les développeurs l'utilisent réellement dans Codex — et où ça casse
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 221 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le 1er août, un fichier de configuration de quatre lignes a commencé à circuler sur X. Il crée un agent Codex appelé luna_worker, définit son modèle sur gpt-5.6-luna, règle son effort de raisonnement sur max, et lui confie la moitié ennuyeuse de votre travail pendant que GPT-5.6 Sol garde le plan. En quelques jours, la même recette avait été republiée en anglais, chinois, japonais, coréen, espagnol et arabe, et un plugin construit sur la même idée avait dépassé les 1 300 stars GitHub en quatre jours. C'est aussi, à peu près le jour où c'est devenu viral, la mauvaise façon de le brancher : l'auteur de ce plugin a retiré GPT-5.6 Luna de son propre projet en 48 heures, publiquement, parce qu'un de ses pairs lui a dit que ça ne fonctionnait pas comme sous-agent Codex — puis l'a remis deux jours plus tard, branché d'une manière complètement différente.
Toute cette séquence d’événements s’est déroulée en une semaine, et c’est la chose la plus utile que quiconque ait publiée à propos de ce modèle. Elle vous dit que le modèle du travailleur à bas coût est réel, que la façon évidente de le câbler est la mauvaise, et que la différence entre les deux constitue l’essentiel de la valeur. Tout ce qui concerne la technique dans cet article provient de praticiens publiant leurs propres résultats entre le 30 juillet et le 5 août 2026 — pas de la documentation de l’entreprise, qui décrit GPT-5.6 Luna comme un modèle pour « charges de travail sensibles aux coûts et à volume élevé » et ne dit rien de tout cela. Lorsqu’un chiffre est mesuré par un tiers indépendant, nous le disons ; lorsqu’il s’agit du journal de session d’un développeur, nous le disons aussi, y compris quand ils se contredisent. Et ils se contredisent, souvent.
Ce qu'est « Luna Max », et pourquoi la plupart des gens ne le voient jamais
Il n'existe pas de modèle appelé Luna Max. Il y a deux cadrans, et Luna Max est une combinaison de ceux-ci : le niveau le moins cher de la famille GPT-5.6, exécuté avec le réglage de raisonnement le plus profond. Le cadran de niveau choisit entre GPT-5.6 Sol, GPT-5.6 Terra et GPT-5.6 Luna. Le cadran d'effort a six positions — aucun, faible, moyen, élevé, très élevé et max — et il détermine la quantité de réflexion que le modèle effectue avant de répondre.
Presque personne ne combinait le niveau économique avec le réglage profond, pour une raison triviale : max est masqué par défaut. Dans l'application de bureau ChatGPT/Codex, il se trouve sous Paramètres → Configuration → Efforts de raisonnement disponibles, où la liste est livrée avec la première option décochée. Six développeurs distincts ont publié le même correctif en trois clics au cours de la première semaine d'août, ce qui est un bon indicateur du nombre de personnes qui avaient fait tourner Luna à sa profondeur par défaut et qui jugeaient le modèle sur cette base. Côté API, il n'y a aucun bouton à chercher : vous transmettez l'identifiant du modèle gpt-5.6-luna et définissez l'effort de raisonnement sur max dans le corps de la requête, et c'est tout le changement.
Une conséquence qu'il vaut la peine d'assimiler avant de lire un benchmark : quand Artificial Analysis publie un score d'intelligence pour ce modèle, la page s'intitule GPT-5.6 Luna (max). Le chiffre indépendant que tout le monde cite pour Luna est la configuration à effort maximal. Si vous utilisez la configuration par défaut et vous vous demandez pourquoi votre expérience ne correspond pas au classement, c'est pour cela.
Le curseur que personne n'explique : l'effort change le nombre de tokens, pas leur prix.
Augmenter l'effort de raisonnement ne vous fait pas passer à un palier de prix plus élevé. GPT-5.6 Luna coûte 0,20 $ par million de jetons d'entrée et 1,20 $ par million de jetons de sortie, quel que soit le réglage d'effort. Ce qui change, c'est le nombre de jetons que le modèle utilise pour arriver à une réponse — et au maximum, il en utilise beaucoup.
Artificial Analysis l'a mesuré au cours de son Intelligence Index, et ces chiffres constituent la confirmation indépendante la plus claire de ce dont les praticiens se plaignaient :
• Score — 51 sur l'Artificial Analysis Intelligence Index, contre une médiane de 17 pour les modèles qu'il évalue dans cette catégorie.
• Verbosité — 130M tokens de sortie générés lors de l’exécution de l’index, contre une médiane de 61M. Artificial Analysis qualifie le modèle de « très verbeux ».
• Vitesse brute — 182,5 jetons de sortie par seconde, 16ᵉ sur 163 modèles. Rapide par jeton.
• Temps jusqu'au premier token — environ 136 secondes à effort maximal, ce qui, selon Artificial Analysis, se situe dans la fourchette haute même pour des modèles de raisonnement dans cette gamme de prix.
• Dépense totale — 174,06 $ pour évaluer le modèle sur l'ensemble de l'index.
Lisez les troisième et quatrième lignes ensemble, car cette paire constitue toute l'expérience utilisateur. Luna, à son maximum, diffuse des tokens rapidement mais met plusieurs minutes à démarrer, puis produit environ deux fois plus de tokens qu'un modèle typique pour le même travail. C'est pourquoi la plainte la plus courante dans les rapports de terrain n'est pas « c'est faux », mais « c'est lent » — et pourquoi le prix peu élevé ne se traduit pas par une session proportionnellement peu coûteuse. Vous achetez un faible taux sur un nombre élevé de tokens.
Pour contraste : sur notre propre page de modèle pour GPT-5.6 Luna, le temps médian observé jusqu'au premier jeton sur sept jours de trafic réel est de 1,78 seconde, avec un 95e percentile de 9,26 secondes. Ce n'est pas une contradiction avec le chiffre de 136 secondes — il s'agit du même modèle mesuré sur un mélange de réglages d'effort, dont la plupart ne sont pas au maximum. La latence que vous obtenez est une propriété du réglage que vous choisissez, et non du point de terminaison que vous appelez.

Luna Max est-elle vraiment « Sol Medium au sixième du prix » ?
C'est l'affirmation qui a rendu cette tendance virale, et elle vient de Dan McAteer, qui l'a présentée comme Luna au raisonnement maximal se situant autour de GPT-5.6, Sol en mode moyen, ou Claude Opus 5 en mode moyen, pour environ un sixième du coût. Elle a été reprise par de nombreux comptes, parfois avec les réserves gommées, et il vaut la peine de séparer ce qui est mesuré de ce qui relève des vibes.
Le tableau de classement indépendant soutient avec force la moitié de l’affirmation relative au coût, et seulement partiellement celle relative aux capacités. En exécutant la même suite de benchmarks avec un effort maximal sur plusieurs niveaux, Artificial Analysis a enregistré Luna à l’indice 51 pour 174 $, Terra à 55 pour 1 403 $, Kimi K3 à 57 pour 2 437 $, et Sol à 59 pour 2 824 $. Luna concède huit points d’indice à Sol et coûte environ un seizième du montant nécessaire pour accomplir le même travail.

Le classement indépendant s'est affiné le 13 août, lorsque DeepSWE a publié la v1.1 — une révision de son benchmark d'ingénierie à long horizon qui conserve 113 tâches originales issues de 91 dépôts dans cinq langues, mais qui évalue désormais chaque correctif en exécutant le diff validé dans un conteneur isolé, ce qui est plus difficile à contourner. Sur le classement mis à jour, les trois niveaux de GPT-5.6 à effort maximal arrivent là où l'article de juillet les plaçait : Luna Max à 67,2 % de pass@1 et 0,61 $ par tâche, Terra Max autour de 70 %, Sol Max à 73 % pour 8,39 $ — six points de taux de réussite pour environ quatorze fois le coût.
La comparaison qui mérite qu'on y jette un second coup d'œil se situe sous Luna, pas au-dessus. Claude Sonnet 5 Max obtient 54 % sur les mêmes 113 tâches — soit environ treize points de moins que Luna Max — pour 26,40 $ par tâche, ce qui équivaut à environ 44 fois ce que Luna a payé pour la même résolution. Luna Max dépasse également Gemini 3.7 Flash (65 % pour la configuration à effort élevé sur le même classement) ; l'article de la communauté qui a signalé ce tour évalue l'écart avec Gemini 3.7 Flash Medium à environ 1,7 point. DeepSWE est le banc d'essai indépendant de Datacurve, et non une évaluation de l'entreprise — l'affirmation de l'entreprise selon laquelle la famille GPT-5.6 a établi des résultats de pointe sur Terminal-Bench 2.1 et DeepSWE reste une déclaration distincte, rapportée par le fournisseur.
Ensuite, il y a les preuves sur le terrain, qui sont véritablement partagées. Pawel Huryn a mené son propre benchmark de correction de bugs — 105 bugs introduits dans deux bases de code réelles, évaluation en aveugle, un tour par modèle — et a rapporté que Luna, à effort maximal, corrigeait 33 bugs pour 1,80 $, contre 24 pour 68 $ pour Claude Fable 5. Dans l'autre sens, Diego Haz a passé deux jours à mener des sessions appariées et a conclu contre le schéma : Luna coûtait en moyenne 1,20 $ par session, contre 29 $ pour Sol, mais il a dû refaire la plupart des sorties de Luna et n'a rien obtenu de commercialisable pour ses cas d'usage, ce qui fait de l'économie une illusion plutôt qu'une remise. Un autre développeur utilisant le même harnais a rapporté que Sol en médium produisait un résultat nettement meilleur que Luna en maximal en environ la moitié du temps. Une comparaison en langue chinoise sur une seule tâche de scène 3D a mis des chiffres sur cette tendance : Sol Medium a terminé en 21 m 30 s avec la note de qualité la plus élevée et le moins de jetons ; Luna Max a pris 40 m 55 s, a brûlé environ 130 000 jetons, a obtenu la note de qualité la plus basse et a utilisé la moitié de l'allocation d'abonnement hebdomadaire.
Le résumé honnête de la position de la communauté après une semaine : Luna Max n'est pas Sol Medium. C'est nettement moins cher que Sol Medium et c'est moins bon, et ce compromis ne vaut que si la tâche est spécifiée assez précisément pour que « moins bon » n'ait pas d'importance. C'est exactement à cela que servent les schémas de câblage ci-dessous.
Le modèle qui a survécu au contact : Sol planifie, Luna implémente, un nouveau Sol révise
Personne parmi ceux qui ont continué d'utiliser Luna Max ne l'utilise comme agent de codage polyvalent. La configuration qui fonctionne — celle sur laquelle les praticiens ont convergé dans chaque version — comporte quatre rôles :
• Orchestrateur — GPT-5.6 Sol à effort élevé, restant dans le thread principal. Il est responsable des exigences, de l'architecture, de la décomposition des tâches et de l'acceptation finale. Il n'écrit pas le code.
• Implémenteur de routine — GPT-5.6 Luna à effort maximal, sur un travail délimité et entièrement spécifié : refactorisations mécaniques, rédaction de tests, analyse de modules, passages de documentation, le genre de tâche où la destination est sans ambiguïté.
• Implémenteur avancé — GPT-5.6 Terra à effort maximal, pour les builds à contexte lourd où la dérive d'instructions de Luna devient coûteuse.
• Réviseur — une instance GPT-5.6 Sol fraîche et en lecture seule qui voit le diff final et rien d'autre. L'intérêt du « frais » est qu'un réviseur disposant du contexte de l'implémentation a tendance à approuver son propre raisonnement.
L'implémentation de référence est sol-advisor, un plugin Codex sous licence MIT par Dan McAteer qui a atteint environ 1 400 étoiles au cours de sa première semaine. Vous l'installez via la marketplace de plugins Codex en ajoutant le DannyMac180/sol-advisor en tant que dépôt, puis en ajoutant le sol-advisor plugin. Sa forme actuelle est instructive : la voie native désigne un implémenteur Terra/High suivi d'un nouveau relecteur Sol/High, tandis que Luna au maximum est une voie opt-in explicite qui s'exécute comme une tâche séparée visible par l'utilisateur, la session Sol principale révisant et acceptant directement son travail plutôt que de le router via le relecteur natif.
Si vous préférez ne rien installer, la version minimale largement copiée est une définition d'agent personnalisée dans ~/.codex/agents/luna-worker.toml comportant deux paramètres — model = "gpt-5.6-luna" et model_reasoning_effort = "max" — plus une description et des instructions qui le restreignent à un travail délégué avec des limites claires, lui interdisent de changer l'objectif global ou d'élargir son propre périmètre, et renvoient les décisions d'architecture et les exigences ambiguës à l'agent principal. Le conseil qui circule est de faire écrire ce fichier par Sol, de le valider par rapport à votre version installée de Codex, et de vous montrer le diff avant de l'accepter, ce qui est raisonnable, que vous fassiez confiance ou non à la recette.
Le piège des sous-agents, et la solution sur laquelle la communauté s'est accordée
C'est ici que la version virale de ce modèle et la version fonctionnelle se séparent.
Le système natif de sous-agents de Codex ne traite pas GPT-5.6 Luna comme un citoyen de première classe. McAteer s'est heurté à un blocage strict — Luna n'était pas autorisée comme sous-agent — et a contourné le problème en la déclarant comme agent personnalisé, puis a signalé publiquement le coût de ce contournement : un agent personnalisé ne partage pas le contexte avec l'agent principal comme le fait un sous-agent natif. Quelques jours plus tard, il a retiré la voie Luna de sol-advisor complètement, citant le constat d'un autre développeur axé sur Codex selon lequel Luna se comporte mal dans le rôle de sous-agent, avec la présomption qu'elle n'a pas été post-entraînée pour le protocole multi-agents v2. Diego Haz a décrit indépendamment le même mur de l'autre côté : Sol ne peut pas créer Luna comme sous-agent, Luna doit donc vivre dans un fil de premier niveau, ce qui rend la coordination compliquée.
La résolution, qui est maintenant la position majoritaire, est de cesser de la combattre :
• Donnez à Luna Max son propre fil d’exécution, et non un emplacement dans le graphe de sous-agents. Demandez à l’orchestrateur Sol de lancer une tâche Codex distincte au niveau supérieur sur Luna, de la surveiller et d’en récupérer le résultat. C’est ce que McAteer a réintégré à sol-advisor le 4 août, et ce sur quoi plusieurs autres étaient arrivés indépendamment.
• Acceptez l'isolation du contexte comme le prix à payer. Un fil séparé signifie un historique séparé. C'est la taxe que vous payez, et c'est aussi pourquoi le transfert ci-dessous compte plus ici que dans une configuration de sous-agent natif.
• Si vous devez absolument le forcer dans multi-agent v2, c'est le catalogue qui explique pourquoi il est filtré. Un développeur a attribué cette exclusion au catalogue de modèles standard qui marque Luna comme v1, et a signalé une solution de contournement : copiez ~/.codex/models_cache.json, définissez le multi_agent_version de Luna sur v2, pointez model_catalog_json vers votre copie, redémarrez Codex, puis faites en sorte que l'orchestrateur lance Luna au maximum avec un niveau de service rapide et désactivez le forking. Considérez ceci comme la bidouille non officielle d'une personne sur un fichier interne — c'est exactement le genre de chose qu'une mise à jour de Codex casse.
Le dossier de passation : cinq questions qui résolvent la réclamation la plus courante
L'échec le plus fréquemment signalé de Luna Max est qu'il ne suit pas les instructions de près, en particulier lorsqu'on lui donne un flux de travail spécifique ou une boucle d'itération à exécuter. Cette plainte émane de développeurs qui aiment le modèle et de développeurs qui l'ont abandonné. L'atténuation à laquelle les praticiens ne cessent de revenir n'est pas un meilleur prompt au sens du style d'écriture ; c'est un contrat plus strict. Avant que le fil Luna ne commence, répondez à cinq choses :
• Quelle tâche exacte cet agent doit-il accomplir ? Pas le domaine de travail — l'état final.
• Quels fichiers, documents ou systèmes sont dans le périmètre ? Énumérés, non implicites.
• Que ne doit-il pas modifier ? Les interfaces, migrations, configurations et contrats publics qui ne doivent pas être modifiés.
• Quelle preuve prouve l’achèvement ? Un test nommé, la sortie d’une commande spécifique, un diff qui ne modifie que les fichiers listés.
• Quelle décision manquante devrait l'arrêter ? Le déclencheur pour revenir plutôt que de deviner — c'est celui qui empêche un modèle bon marché trop zélé d'inventer une architecture.
C'est également là qu'il convient d'intégrer les recommandations de l'entreprise en matière de prompts, avec la reconnaissance qu'elles méritent : l'entreprise indique que dans ses évaluations internes d'agents de codage, des prompts système plus épurés ont amélioré les scores d'évaluation de 10 à 15 % tout en réduisant le nombre total de jetons de 41 à 66 % et les coûts de 33 à 67 %, et elle conseille d'auditer les prompts hérités de GPT-5.5 ou GPT-5.4 plutôt que de les migrer tels quels. Ce sont des chiffres annoncés par le fournisseur. Mais la direction correspond à ce que le secteur a constaté : décrivez précisément la destination et supprimez la narration de chaque pas. Notez la tension avec le paragraphe ci-dessus — la précision concernant le périmètre et les contraintes n'est pas la même chose que la verbosité, et le consensus de la communauté est que Luna Max a besoin de plus de la première et de moins de la seconde.
Modes de défaillance à anticiper
• Dérive des instructions. Corroborée par plusieurs développeurs : elle ignore des parties du brief initial, et c'est pire lorsque le brief est une procédure à suivre plutôt qu'un résultat à atteindre.
• Lenteur en temps réel. Signalée à plusieurs reprises, et cohérente avec le délai avant le premier token d'environ 136 secondes qu'Artificial Analysis a mesuré à effort maximal. Parfait pour un travail que vous pouvez laisser tourner ; pénible dans une boucle interactive.
• Consommation du contexte. Un développeur a rapporté que Luna Max consommait une fenêtre de fil Codex de 258k à une vitesse alarmante, et a suspecté que la consommation de quota augmente soudainement lorsque Codex commence à compacter près de la limite. La partie sur le compactage n'est que son impression, pas un résultat mesuré — mais le taux de consommation est la conséquence attendue de la verbosité qu'Artificial Analysis a mesurée indépendamment. Côté API, surveillez l'étape de long contexte : le barème de prix en transparence de ce modèle passe de $0.20/$1.20 à $0.40/$1.80 dès qu'une requête franchit environ 272k tokens. Ainsi, un fil qui ne cesse de croître coûte plus cher par token, et pas seulement plus cher au total.
• Tout ce qui est visuel. C'est la frontière la plus nette des rapports de terrain. Un praticien très lu, annulant son abonnement de codage Kimi K3 en faveur de Luna Max, l'a jugé aussi bon que ce qu'il abandonnait et bien moins cher — avec une exception explicite pour le frontend. Un autre a été plus direct : n'utilisez pas Luna pour exécuter du design, des graphiques, de la mise en page ou des diapositives ; la répartition planifier-avec-Sol-exécuter-avec-Luna est faite pour des tâches d'instruction étape par étape, pas pour des tâches esthétiques.
• Le catalogue des sous-agents. Couvert ci-dessus — si Luna n'est jamais sélectionnée en silence lors d'une exécution multi-agents, elle est filtrée, pas en échec.
• Fausse économie. Le seul mode de défaillance qui n’apparaît dans aucun benchmark : une session qui a coûté 1,20 $ au lieu de 29 $ et qui a produit un travail que vous avez réécrit à la main vous a coûté 1,20 $ plus votre après-midi.
Quand ne pas viser le max
Max n'est pas une mise à niveau gratuite, et la ligne directrice qui a tenu bon est une échelle plutôt qu'un paramètre :
• Transformations simples — un renommage de champ, une extraction mécanique, un passage de formatage. Effort faible ou moyen sur Luna. Conditionnez-le à la réussite d'un test nommé.
• Implémentation de routine — high ou xhigh. La valeur par défaut de la communauté pour un worker Luna est xhigh, et non max, précisément parce que max coûte du temps et des jetons sur des tâches qui n'ont jamais été difficiles.
• Limité mais vraiment difficile — c'est le véritable travail de max. Le paquet doit être à la fois difficile et strictement spécifié pour que le raisonnement supplémentaire se traduise par un meilleur résultat.
• Enquête ambiguë — changez le niveau, pas le cadran. Si le modèle se trompe plutôt que de sous-planifier, plus de réflexion sur un modèle moins cher ne corrigera pas le problème ; c'est une tâche Sol.
• Brief vague — corrigez le contrat, pas le modèle. Aucun réglage d'effort ne compense un critère d'acceptation non énoncé.
Une mise en garde propre aux abonnements, issue d'un guide tiers et facile à mal comprendre : les taux de crédits facturés par Codex pour chaque modèle n'ont pas les mêmes ratios que les prix catalogue de l'API ; vous ne pouvez donc pas reprendre un ratio de prix API et l'utiliser comme règle de routage pour les abonnements. Les quotas de messages sur cinq heures rapportés pour l'offre Plus illustrent ce point : environ 15 à 90 messages locaux sur Sol, 20 à 110 sur Terra, 50 à 280 sur Luna, avec des fourchettes aussi larges parce qu'un « message » n'est pas une unité de travail fixe. Si vos décisions de routage sont dictées par un plafond d'abonnement plutôt que par une facture, mesurez par rapport à ce plafond.
Au-delà de Codex : vers quoi d'autre les gens le pointent-ils ?
La combinaison raisonnement profond et peu coûteux s’avère utile en dehors des agents de codage, et voici les utilisations avec des preuves à l’appui :
• Agents navigateurs. Un développeur a exécuté une pile d'automatisation de navigateur sur GPT-5.6 Luna pour ouvrir les 15 meilleurs posts de Hacker News, lire chaque page liée et rédiger un rapport — coût total : 3 cents. Horizon long, enjeux faibles, tokens élevés : c'est exactement le profil pour lequel ce modèle est tarifé.
• Chaînes de compétences. Deux praticiens ont indépendamment signalé avoir piloté un pipeline à deux compétences — génération d'image vers un convertisseur image-vers-Three.js — à partir d'un seul objectif Luna Max pour obtenir un objet 3D low-poly interactif, chacun notant que cela avait à peine fait bouger leur compteur d'utilisation hebdomadaire. À lire en parallèle de l'avertissement « ne pas utiliser Luna pour le travail visuel » : Luna orchestrait des outils qui faisaient le travail visuel, sans juger elle-même l'esthétique.
• Garder une session active.Les entrées en cache sur ce modèle coûtent 0,02 $ par million de jetons, contre 0,20 $ pour une entrée fraîche — une remise de 90 % qu'Artificial Analysis indique sur son panneau de tarification — et la fenêtre de cache est d'environ 30 minutes. L'implication pratique sur laquelle plusieurs guides s'accordent indépendamment : une session de longue durée qui relit le même code source est nettement moins chère qu'une session fraîche pour chaque tâche.
• Arbitrage de quotas.L'affirmation la plus agressive de l'ensemble, et clairement présentée comme une affirmation : un développeur rapporte que, comme l'effort est presque gratuit alors que le multiplicateur de palier est élevé, exécuter un effort maximal sur le palier bon marché lui a permis de pousser 4,9 milliards de jetons sur trois semaines avec un forfait à 200 $ — six chiffres aux tarifs API — et qu'il garde les modèles Kimi K3, Grok et DeepSeek dans le même sélecteur derrière un routeur local, de sorte que l'atteinte de la limite d'un fournisseur n'arrête pas le travail. Personne n'a reproduit indépendamment le chiffre des jetons. Cependant, l'habitude de routage qui se cache derrière est la partie qui vaut la peine d'être copiée.
Exécuter le même split sans abonnement Codex
Tout ce qui précède est une histoire en forme d'abonnement : la raison pour laquelle les gens s'intéressent à Luna Max est qu'elle repousse un plafond hebdomadaire. Côté API, la même architecture est plus simple à construire et plus facile à appréhender, car vous payez une facture au lieu de gérer un quota — et la séparation orchestrateur/worker cesse d'être un plugin pour devenir un routage ordinaire.
GPT-5.6 Luna est disponible via OrcaRouter à 0,20 $ par million de tokens en entrée et 1,20 $ par million de tokens en sortie — le prix catalogue du fournisseur, répercuté avec une marge de 0 %, ce qui explique pourquoi la baisse du 30 juillet était effective de notre côté le jour même de l’annonce par l’entreprise plutôt qu’un cycle de facturation plus tard. Il est servi via une API compatible sur /v1/chat/completions et /v1/responses, donc le champ reasoning-effort est transmis dans le corps de la requête exactement comme en accès direct, et l’identifiant du modèle est openai/gpt-5.6-luna. GPT-5.6 Sol et GPT-5.6 Terra se trouvent derrière la même clé, et c’est ce qui compte pour ce schéma : un orchestrateur sur un niveau et un worker sur un autre, c’est deux identifiants de modèle dans une seule intégration, et non deux contrats fournisseurs. Le DSL de routage permet d’exprimer cette répartition en un seul appel plutôt que d’assembler des threads à la main, et le basculement automatique couvre le cas que les adeptes de l’arbitrage de quotas résolvent avec un routeur local — quand un fournisseur se dégrade, la requête atterrit ailleurs au lieu de s’arrêter.

Deux mises en garde honnêtes. Les rouages propres à Codex — le graphe des sous-agents, la place de marché des plugins, le catalogue des modèles, l'allocation hebdomadaire — appartiennent à l'entreprise, et rien de tout cela n'est inclus avec une clé API ; si le schéma que vous voulez est sol-advisor dans l'application Codex, vous voulez un abonnement Codex. Et les modes de défaillance ci-dessus sont des propriétés du modèle, et non du transport : le routage modifie le coût d'un appel et ce qui se passe quand un fournisseur tombe en panne, mais pas si Luna suit vos instructions.
Qui devrait copier ceci, et qui ne devrait pas
Si votre travail est à grand volume et mécaniquement spécifiable — refactorisations, échafaudage de tests, extraction, documentation, passes d’analyse sur un grand dépôt — activez max, mettez Luna dans son propre fil avec une passation en cinq questions, gardez une instance de Sol devant elle pour la planification et derrière pour la révision, et attendez-vous à dépenser un ordre de grandeur de moins. Les personnes qui rapportent les plus grands succès font toutes une version de cela, et les chiffres de coût indépendants appuient l’orientation même lorsqu’ils n’appuient pas le cadre « aussi bon que Sol ».
Si votre travail est exploratoire, esthétique, ou arrive comme un brief vague qui se précise au fur et à mesure, les rapports de terrain disent clairement que vous dépenserez deux fois les économies à refaire le résultat. Et si vous êtes interactif — assis là à le regarder — le démarrage à froid de deux minutes à pleine puissance vous dérangera plus que le prix ne vous plaise.
Ce qu'il faut surveiller : savoir si l'entreprise post-entraîne Luna pour le protocole v2 de sous-agent. Chaque partie maladroite du playbook actuel — le fil séparé, le contexte partagé perdu, le hack de catalogue, tout l'épisode de rétraction-et-recâblage — existe à cause de cette unique lacune. Comblez-la et la meilleure version de ce modèle devient plus simple de plusieurs étapes.
Des questions qui méritent une vraie réponse
L'effort de raisonnement maximal coûte-t-il plus par token que l'option par défaut ?
Non, et c'est le malentendu le plus courant à propos de ce réglage. GPT-5.6 Luna facture 0,20 $ en entrée et 1,20 $ en sortie par million de jetons, quel que soit l'effort. Ce que l'effort maximal change, c'est le nombre de jetons dépensés — le modèle planifie davantage, se vérifie et se corrige avant de répondre. Artificial Analysis a mesuré que ce modèle émettait 130 millions de jetons de sortie sur une suite de benchmarks où le modèle médian en émet 61 millions. Ainsi, une session en effort maximal coûte plus cher qu'une session en effort moyen pour la même tâche, uniquement par le volume, et elle met aussi plus de temps à produire son premier jeton. L'effort est un réglage du nombre de jetons portant une étiquette de qualité.
Est-ce que GPT-5.6 Luna peut déjà fonctionner comme sous-agent natif de Codex ?
En date du 5 août 2026, non — et la communauté a cessé d'essayer. Le chemin natif de sous-agent de Codex n'accepte pas Luna ; le contournement par agent personnalisé le fait fonctionner mais perd le contexte partagé avec l'agent principal ; et le développeur derrière le plugin le plus connu pour ce modèle a retiré Luna, puis l'a réajouté en tant que tâche de niveau supérieur lancée séparément et surveillée par l'orchestrateur. Si vous voyez une exécution multi-agents dans laquelle Luna n'est jamais sélectionnée, elle est probablement filtrée car le catalogue de modèles standard la marque comme v1 plutôt que v2, ce qu'un développeur a corrigé manuellement à ses propres risques. C'est l'élément de la liste le plus susceptible de changer avec une mise à jour de Codex, alors vérifiez-le par rapport à votre version installée plutôt que de faire confiance à une recette, y compris celle-ci.
Est-ce suffisant pour remplacer un abonnement de codage Claude ou Kimi K3 ?
Plusieurs développeurs ont publiquement résilié un abonnement à 200 $ par mois pour exactement cette raison. Le post qui a mis la question au grand jour venait d'un immunologiste qui code quotidiennement : il a résilié son abonnement de codage Kimi K3 non pas parce qu'il était mauvais, mais parce qu'il ne pouvait pas le justifier quand GPT-5.6 Luna était, selon son expérience, aussi bonne pour son travail et bien moins chère — le frontend excepté. Les chiffres de coût indépendants rendent l'argument difficile à écarter : sur la même suite de benchmarks, Kimi K3 en effort maximal a obtenu 57 pour 2 437 $, tandis que GPT-5.6 Luna en maximal a obtenu 51 pour 174 $. Mais lisez la dissidence avant d'annuler quoi que ce soit. Les développeurs qui ont mesuré des sessions appariées et ont obtenu un résultat négatif ne testaient pas un modèle différent ; ils testaient un type de tâche différent — ouvert, visuel, ou peu spécifié — et sur ce type de tâche, le modèle moins cher perdait assez nettement pour effacer l'économie. La réponse défendable est que Luna Max remplace une grande partie de votre codage-travail, pas nécessairement votre meilleur codage-modèle, et que les praticiens qui en tirent le plus sont ceux qui ont gardé un échelon de pointe pour planifier et vérifier.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
