Carte de titre principale pour GPT-6 Luna vs GPT-5.6 Luna, avec le badge « GA 22 Sep 2026 », le titre « GPT-6 Luna vs GPT-5.6 Luna », le sous-titre « Le même nom, moitié prix, un livrable moins bon », et trois cartes de statistiques indiquant « Entrée : 0,10 $ vs 0,20 $ par MTok », « Sortie : 0,50 $ vs 1,20 $ par MTok » et « Indice AA : 37,26 vs 37,32 », avec le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

GPT-6 Luna vs GPT-5.6 Luna : Le même nom, moitié prix, et un livrable moins bon

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles, un mot en commun, et un score indépendant pratiquement identique. GPT-6 Luna atteint 37,26 sur l’Artificial Analysis Intelligence Index ; GPT-5.6 Luna a atteint 37,32. Une différence de 0,07 point n’est pas une mesure, c’est du bruit, et c’est le fait le plus important de ce duo. Ce qui sépare les deux modèles n’est pas la capacité — c’est 0,0681 $ par tâche d’index accomplie contre 0,1783 $, et un ensemble de régressions sur le travail intellectuel que la baisse de prix ne mentionne pas.

Les dates comptent pour interpréter les chiffres. GPT-5.6 Luna est sorti le 9 juillet 2026 à 0,20 $ par million de jetons d’entrée et 1,20 $ par million de jetons de sortie. GPT-6 Luna est sorti le 22 septembre 2026 à 0,10 $ et 0,50 $ — soit exactement la moitié du tarif d’entrée et 58 % de réduction sur le tarif de sortie, ce qu’OpenAI a décrit comme permanent plutôt que promotionnel. Il s’agit d’une véritable baisse, et c’est aussi la plus petite moitié de l’histoire. La plus grande moitié, c’est que le modèle plus récent est un modèle différent, et non le même modèle au tarif revu.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Ce qu’une migration rapporte réellement, en chiffres

Si l’on aligne les deux sur les dimensions qui déterminent une migration, le profil est inégal. Certaines lignes s’améliorent, d’autres régressent, et une s’améliore considérablement.

• Prix — GPT-6 Luna : 0,10 $ en entrée / 0,50 $ en sortie par million de tokens, contre GPT-5.6 Luna : 0,20 $ / 1,20 $. Moitié moins cher en entrée, 58 % de réduction en sortie.

• Entrée mise en cache — 0,01 $ par million contre 0,02 $. La même remise de 90 % sur une base réduite de moitié, donc un préfixe répété coûte la moitié de ce qu’il coûtait en juillet.

• Coût par tâche terminée — 0,0681 $ contre 0,1783 $ sur la même suite. Une réduction de 62 %, plus importante que la baisse du prix des tokens, car la répartition des tâches n’est pas identique.

• Jetons de sortie par tâche — 50 537 contre 41 235. Le nouveau modèle est 23 % plus bavard par tâche terminée, et 78 % de sa sortie est du raisonnement qui n’apparaît jamais dans la réponse.

• Fenêtre de contexte — 1 050 000 jetons contre 1 000 000. Le même plafond pratique ; les deux limitent la sortie à 128 000 jetons.

• Abstention — un taux d’hallucination de 76,7 % sur AA-Omniscience contre 92,6 %. Il s’agit de la plus grande amélioration isolée de l’ensemble, et ce n’est pas un gain de connaissances : la précision passe de 42,7 % à 43,8 %, essentiellement stable. Le modèle plus récent refuse de répondre au lieu d’inventer, ce qui relève d’un changement de comportement plutôt que d’une capacité.

• Livrables de travail intellectuel — AA-Briefcase v1.1 chute de 1 345,38 Elo à 1 299,23, et GDPval-AA v2.1 chute de 1 443,14 à 1 367,09. Les deux en baisse, d’environ 46 et 76 points.

• Codage et travail à long horizon — Terminal-Bench 4.0 passe de 11,6 % à 12,6 % et SciCode de 53,6 % à 54,6 %, les deux lignes qui progressent ici. À l'inverse, l'indice Coding Agent Index chute de 43 à 41 et les évaluations agentiques de type SWE évoluent dans le même sens.

• AutomationBench-AA — 53,2 % contre 50,2 %. En hausse, et d’une ampleur supérieure à celle de toute autre mesure agentique de l’ensemble.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

La régression se trouve dans l'artefact, pas dans le raisonnement

Le schéma dans ces deux dernières lignes mérite d’être nommé, car il constitue toute la décision. Le nouveau modèle est meilleur pour les actions agentiques en une seule étape et moins bon pour remettre un document finalisé. Artificial Analysis attribue le recul des tâches de travail intellectuel à la qualité de la présentation et à des livrables qui ont sauté des éléments obligatoires de la grille d’évaluation, plutôt qu’à des défaillances factuelles ou de raisonnement — ce qui est précisément le type de régression qui passe un smoke test mais échoue lors d’une revue.

Croisez les deux faits, et la migration se scinde nettement selon ce qui consomme la sortie. Si votre pipeline lit une sortie structurée — du JSON, une classification, un champ extrait, une décision de routage —, la régression de présentation ne vous coûte rien, l'amélioration de l'abstention est un vrai gain, et la réduction de 62 % du coût des tâches s'applique pleinement. Si c'est une personne qui lit le livrable — un rapport, une note, un document destiné au client —, le modèle plus récent est mesurablement moins bon exactement sur ce pour quoi vous payez, et l'économie vous achète un relecteur.

Le taux d’abstention mérite le même traitement. Un modèle qui passe du fait d’inventer sur 93 % de ce qu’il ne sait pas à inventer sur 77 % est un objet matériellement différent pour un garde-fou, un filtre de conformité ou tout pipeline où une réponse fausse donnée avec assurance se propage. Cette amélioration est réelle, elle est mesurée indépendamment, et c’est l’argument le plus fort pour déplacer le travail vers le nouveau modèle, un argument qui ne dépend pas du tout du prix.

Qu'est-ce qui change dans votre code, et qu'est-ce qui ne change pas

Moins qu’une baisse de prix de cette ampleur ne le laisse supposer, ce qui est la bonne nouvelle. La fenêtre de contexte est de la même classe, la sortie maximale est identique à 128 000 tokens, et la clause de retarification pour contexte long de la famille reste inchangée : les requêtes dépassant 272 000 tokens d’entrée sont facturées à 2x les tarifs d’entrée et de cache et à 1,5x la sortie, pour la requête entière plutôt que pour la portion au-dessus du seuil. Une requête qui était coûteuse à 300 000 tokens sur GPT-5.6 Luna est coûteuse sur GPT-6 Luna aussi — moitié du tarif, même falaise, donc une charge de travail qui aurait dû être scindée en juillet devrait encore l’être maintenant.

L’échelle d’effort est l’endroit où le comportement change plutôt que le coût. GPT-6 Luna expose none, low, medium (la valeur par défaut), high, xhigh et max, et la valeur par défaut compte : un pipeline qui a été calibré sur l’effort par défaut d’un modèle n’est pas automatiquement calibré sur celui d’un autre. Les équipes qui ont fixé explicitement un réglage ne sont pas affectées. Les équipes qui ont pris la valeur par défaut exécutent une configuration différente de celle qu’elles avaient en juillet, et le symptôme visible sera le volume de tokens plutôt que la qualité.

Un piège mérite d’être rappelé, car il ne disparaît pas avec le nouveau modèle. Sur le point de terminaison Chat Completions, l’appel de fonctions ne fonctionne que lorsque l’effort de raisonnement est défini sur none ; tous les autres niveaux d’effort, ainsi que tous les outils intégrés, nécessitent l’API Responses. Une équipe qui migre une boucle d’appel d’outils en changeant la chaîne du modèle découvrira que ses outils sont silencieusement indisponibles au niveau d’effort medium par défaut, et la correction consiste à réécrire la surface d’appel plutôt qu’à modifier un paramètre.

Ce que vous pouvez acheminer aujourd'hui, et ce que vous ne pouvez pas

Voici la partie de la migration qui n'a rien à voir avec les benchmarks. GPT-5.6 Luna est disponible sur OrcaRouter à son prix catalogue — 0,20 $ par million de tokens en entrée, 1,20 $ par million en sortie, une fenêtre de contexte de 1 000 000 de tokens, une sortie maximale de 128 000 tokens, et un temps jusqu'au premier token (p50) de 1,60 seconde mesuré sur le trafic réel de notre propre page modèle. Nous répercutons la tarification catalogue du fournisseur sans marge, de sorte que le jour où OpenAI a modifié les prix de cette famille, le changement a été effectif de notre côté plutôt qu'au cycle de facturation suivant.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

GPT-6 Luna n’est pas routable via OrcaRouter à compter du 23 septembre 2026. Sa disponibilité se limite à l’API d’OpenAI et aux catalogues cloud qui proposent cette famille, et nous ne référençons pas un modèle que nous ne pouvons pas servir. La conséquence pratique est qu’une équipe qui planifie cette migration peut migrer la tarification dès aujourd’hui, mais ne peut pas migrer le routage dès aujourd’hui — les deux moitiés du changement interviennent à des dates différentes.

Ce que cela rend possible entre-temps, c’est l’arrangement que la plupart des équipes finiront de toute façon par vouloir. Gardez GPT-5.6 Luna sur les chemins où le livrable est le produit, exécutez GPT-6 Luna partout où la sortie est consommée par du code, et traitez la frontière comme un palier plutôt que comme une réécriture. Parce que les modèles auxquels vous pouvez accéder se trouvent derrière un point de terminaison unique, avec plus de 200 modèles sur la même clé et un basculement automatique entre fournisseurs, ajouter ou retirer un palier devient une entrée de configuration plutôt qu’une seconde intégration — et le chemin d’escalade cesse de dépendre de la disponibilité d’un quelconque modèle unique.

La décision de migration, énoncée simplement

Déplacez le travail là où la sortie est lue par une machine et où la condition de réussite est vérifiable. La classification, l'extraction, les décisions de routage, les appels de garde-fous, les passes de transformation en masse et les actions d'agent en une seule étape sont tous éligibles : le composite reste inchangé, le comportement d'abstention est nettement meilleur, et le coût de la tâche a baissé d'environ 62 %. Avec Batch à la moitié des tarifs standards et les entrées mises en cache à un dixième d'une base réduite de moitié, un pipeline qui était marginal en juillet peut désormais être simple.

Ne déplacez pas le travail pour lequel une personne valide l’artefact, et ne déplacez pas à l’aveugle les chemins des agents de codage. Une baisse de 46 points sur AA-Briefcase et une baisse de 76 points sur GDPval sont de petits chiffres qui pointent dans la même direction qu’une baisse de deux points du Coding Agent Index, et le mode de défaillance décrit par Artificial Analysis — éléments de rubrique ignorés, présentation affaiblie — est invisible à une vérification automatisée. Conservez le modèle précédent lorsque la finition est le livrable.

Et traitez l'égalité de 0,07 point dans l'indice comme le constat qu'elle représente. Ce n'est pas un modèle plus intelligent à un prix inférieur. C'est un modèle de forme différente à un prix inférieur, et la question à laquelle un plan de migration doit répondre est de savoir quelle forme votre charge de travail consomme — et non quel score est le plus élevé, car, sur le relevé indépendant, ces deux scores affichent le même nombre.