Carte de titre générée indiquant « GPT-6 vs GPT-6 Luna », avec une pastille indiquant « GPT-6 est un nom de famille, pas un identifiant de modèle » et une pastille indiquant « GPT-6 Luna : 0,10 $ en entrée / 0,50 $ en sortie, alimente ChatGPT Free et Go », et un pied de page indiquant « Modèles livrés le 22 sept. 2026 ; règle de palier selon l'annonce d'OpenAI elle-même. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

GPT-6 vs GPT-6 Luna : un centime le million de tokens, et le palier qui répond au forfait gratuit

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il existe une version de cette comparaison où la réponse tient en une ligne : vous ne pouvez pas appeler GPT-6, et vous pouvez appeler GPT-6 Luna pour dix cents par million de jetons d’entrée. Mais la version la plus utile est celle qui explique pourquoi Luna est désormais le modèle que la plupart des gens ont réellement utilisé — OpenAI l’a placé derrière les niveaux Free et Go de ChatGPT le 8 octobre 2026, ce qui en fait le niveau le moins cher de la génération et, en nombre d’utilisateurs, le plus fréquenté. Ce qui suit est l’échelle des niveaux expliquée une fois, puis ce que dix cents par million permettent réellement d’acheter.

La famille, et la place qu’y occupe Luna

OpenAI livre la génération GPT-6 sous la forme de trois identifiants de modèles publiés le 22 septembre 2026, sans qu'aucun openai/gpt-6 point de terminaison ne se cache derrière le nom de la famille :

• GPT-6 Astra — le modèle phare, 10,00 $ en entrée / 50,00 $ en sortie par million de tokens, inscrit sur la grille tarifaire d'OpenAI comme le sommet de la génération
• GPT-6 Sol — le palier intermédiaire, 2,00 $ / 10,00 $, et le modèle qu'OpenAI désigne pour le chat sur les paliers payants de ChatGPT
• GPT-6 Luna — le palier économique, 0,10 $ / 0,50 $, et le modèle qu'OpenAI désigne pour les paliers Free et Go

Cette dernière phrase est ce qu'il vaut la peine de bien cerner, car c'est elle qui explique pourquoi le trafic de Luna éclipse tout le reste de la famille. L'annonce d'OpenAI elle-même concernant le déploiement des 7 et 8 octobre indique que « GPT-6 dans ChatGPT est propulsé par GPT-6 Sol pour les offres Plus, Pro, Business et Enterprise, et par GPT-6 Luna pour les offres Free et Go. » Un modèle à 0,10 $ / 0,50 $ qui répond au forfait gratuit est un modèle qui traite plus de questions par jour que n'importe quelle offre premium, et c'est le même checkpoint que vous pouvez appeler via l'API. La surface grand public est un canal de distribution, pas un SKU distinct.

Une mise en garde qu'il faut répéter ici parce que ce blog a publié à ce sujet : la même annonce indique que Free et Go reçoivent GPT-6 Luna, alors que la page du centre d'aide d'OpenAI consacrée à GPT-6 dans ChatGPT décrivait Free et Go comme exécutant GPT-5.6 Luna le jour où elle a été consultée. Ce ne sont pas des déclarations compatibles au sujet du même palier, OpenAI n'a pas dit laquelle est à jour, et si votre travail dépend de quel modèle bon marché se trouve derrière le forfait gratuit, considérez l'entrée du centre d'aide comme la page la plus précise et revérifiez avant de développer en vous basant sur l'une ou l'autre.

Ce que dix cents par million permettent réellement d’acheter

Le chiffre phare est le moins intéressant de la carte de Luna. Voici la carte complète, ainsi que le palier juste en dessous :

• Contexte court, jusqu'à 272 000 tokens d'entrée — 0,10 $ par million en entrée, 0,50 $ par million en sortie
• Au-delà de 272 000 tokens d'entrée — 0,20 $ par million en entrée, 0,75 $ par million en sortie, appliqué à l'ensemble de la requête
• Entrée mise en cache — 0,01 $ par million au palier court, soit une remise de 90 % ; 0,02 $ au-delà du seuil
• Écritures de cache — 0,125 $ par million au palier court, 0,25 $ au-delà
• Contexte et sortie — 1 050 000 tokens en entrée, 128 000 tokens en sortie
• Modalités d'entrée — texte, image et fichier, la même entrée multimodale que Sol et Astra
• Raisonnement — un paramètre d'effort configurable, ainsi que les outils, la sortie JSON et l'échantillonnage avec graine

Deux choses s’ensuivent. La première, c’est que Luna n’est pas un modèle dépouillé. Il accepte les images et les fichiers, il expose la même interface d’appel d’outils et de sortie structurée que ses deux frères plus coûteux, et la seule chose qui le distingue de Sol sur la fiche technique est la profondeur plutôt que la capacité. La seconde, c’est le palier. Une invite dépassant 272 000 jetons d’entrée double le tarif d’entrée de Luna et augmente de moitié son tarif de sortie, sur l’ensemble de la requête et non uniquement sur le dépassement. C’est un palier modeste à ces tarifs — une requête de 300 000 jetons coûte environ six cents d’entrée au lieu de trois —, de sorte que la clause de contexte long qui domine la planification budgétaire pour Astra et compte pour Sol est ici presque sans importance.

Le chiffre qui déplace réellement de l’argent à grande échelle est celui de la lecture en cache. À un centime par million, une charge de travail qui renvoie le même contexte volumineux à chaque tour ne paie presque rien pour la partie répétée. Sur un pipeline d’extraction ou de classification à fort volume, avec un prompt système stable et un document stable, c’est la différence entre un modèle bon marché et un modèle quasi gratuit, et c’est précisément la raison pour laquelle le coût réel de Luna par réponse finalisée se situe bien en dessous de ce que suggère la grille tarifaire.

Ce que cela vous coûte en capacités

Luna est le palier le moins cher parce que c’est le moins performant, et le classement indépendant ne laisse aucune ambiguïté sur l’ampleur de l’écart. Relevez les données d’Artificial Analysis via la fiche catalogue OrcaRouter pour chaque modèle le 8 octobre 2026 :

• AA Intelligence Index — GPT-6 Sol 47,6, rang 14 ; GPT-6 Luna 38,1, rang 37
• Humanity's Last Exam — GPT-6 Sol 47,9 vs GPT-6 Luna 38,5
• SciCode — GPT-6 Sol 57,6 vs GPT-6 Luna 54,6
• Rappel en contexte long — GPT-6 Sol 83,7 vs GPT-6 Luna 83,3
• Terminal-Bench 4.0 — GPT-6 Sol 43,9 vs GPT-6 Luna 12,6
• Trafic sur sept jours — GPT-6 Luna environ 574 millions de jetons ; GPT-6 Sol environ 2,1 millions
• Temps médian avant le premier jeton — GPT-6 Luna 1 494 ms vs GPT-6 Sol 6 785 ms
• Vitesse de sortie médiane — GPT-6 Luna 132,9 jetons/s vs GPT-6 Sol 179,6 jetons/s

La forme de cet écart est plus instructive que l'écart global. Luna accuse 9,5 points d'indice de retard sur Sol, et la perte n'est pas répartie uniformément : le rappel en contexte long est une égalité à 0,4 point près, et SciCode — la compréhension de code plutôt que la production de code — ne les sépare que de 3 points. Ce qui s'effondre, c'est l'exécution agentique à plusieurs étapes : Terminal-Bench 4.0 à 12,6 contre 43,9 pour Sol. Un modèle capable de retrouver une information dans un document d'un million de tokens à peu près aussi bien que son grand frère, et de produire une réponse compétente en un seul passage, est un instrument différent d'un modèle capable de mener une boucle d'outils jusqu'à son terme.

Deux réserves. Les chiffres de l’indice proviennent d’Artificial Analysis, et non d’OpenAI, et cet évaluateur ne garantit pas que deux pages de modèle soient générées à partir de la même révision de l’indice le même jour — interprétez les différences inférieures à un point comme une indication de tendance, et non comme une précision. Et les chiffres de service sont nos propres mesures de routage sur une fenêtre glissante de sept jours ; ils varient d’une lecture à l’autre et sont utiles pour l’allure de la différence plutôt que comme un engagement de niveau de service.

Il y a un chiffre d'inférence sur lequel il vaut la peine de s'arrêter. Le temps médian jusqu'au premier token de Luna est de 1 494 ms contre 6 785 ms pour Sol — soit environ 4,5 fois plus rapide jusqu'au premier token — et son débit est nettement plus faible une fois le streaming lancé. Pour une interface de chat où l'utilisateur attend la première phrase, cette inversion est tout l'intérêt de cette offre, et c'est pourquoi le forfait gratuit peut sembler rapide alors qu'il exécute le modèle le moins cher de la famille.

I don't see any text to translate. Please send the message you'd like me to translate into French, and I'll preserve all markers exactly as instructed.

L'avantage de prix de Luna au sein de la génération s'est réduit depuis son lancement. GPT-6.1 Sol est arrivé le 29 septembre au tarif de Sol de 2,00 $ / 10,00 $ avec un indice de 51,8, et il a réduit le tarif des entrées mises en cache à 0,10 $ par million. Cela ne touche pas le tarif de Luna pour contexte court — dix cents à l'entrée et cinquante cents à la sortie restent vingt fois moins chers en entrée que n'importe quel Sol — mais cela signifie bien que le niveau au-dessus de Luna est devenu moins cher à exécuter sur le trafic mis en cache, ce qui est précisément la charge de travail où l'avantage de Luna était le plus large. L'écart reste important. Il n'est plus aussi important que les grilles tarifaires seules le laissent entendre.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GPT-6 Luna — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, Terminal-Bench 4.0 43.9, First token 6,785 ms, Cached input $0.20. The right column, GPT-6 Luna, reads Input $0.10, Output $0.50, AA Intelligence 38.1, Terminal-Bench 4.0 12.6, First token 1,494 ms, Cached input $0.01. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

Où se situe la limite entre les paliers en pratique

Répartissez le travail selon ce dont la tâche a besoin, et non selon le modèle qui obtient le meilleur score.

Luna est le bon choix pour le chat à gros volume, la classification, l'extraction, la modération et le résumé sur un long document — la ligne où il égale son grand frère sur la recherche documentaire est exactement celle qui détermine si un grand contexte est exploitable. Sa latence du premier token en fait le meilleur choix pour tout ce qui est interactif et qui ne sollicite pas lourdement le raisonnement. Et à un centime par million de tokens mis en cache, un pipeline à contexte stable est quasiment gratuit sur la partie répétée.

Sol, ou désormais GPT-6.1 Sol, est le bon choix dès que la tâche exige une boucle d’outils, un plan à long terme ou une chaîne d’étapes qui doit aller jusqu’au bout. L’écart Terminal-Bench — 43,9 contre 12,6 — est le signal le plus clair de cette comparaison, et il correspond au vrai mode de défaillance : un modèle bon marché qui répond bien à la première étape puis perd le fil. Le paramètre effort signifie que vous pouvez demander à Luna plus de raisonnement, mais l’effort augmente le nombre de tokens plutôt que le plafond ; il ne transforme pas un 12,6 en un 43,9.

Et Astra reste la réponse pour le travail que seul le modèle phare peut accomplir — ce qui, à 10,00 $ en entrée et 50,00 $ en sortie face aux dix cents de Luna, est une décision que vous devriez pouvoir justifier par appel plutôt que par équipe.

La version one-API de ce choix

Le côté délicat d'une famille à trois niveaux, c'est que la frontière entre les niveaux se déplace selon la fonctionnalité, et qu'elle se déplace selon la requête — une même application veut généralement Luna pour un point de terminaison et Sol pour le suivant. C'est un problème de routage plutôt qu'un problème d'approvisionnement. Les trois niveaux de GPT-6 figurent dans le même catalogue OrcaRouter, appelés via une seule API compatible OpenAI placée devant plus de 200 modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge : ainsi, une variation tarifaire du fournisseur sur n'importe quel niveau est appliquée ici le jour même, et non lors de votre prochain rapprochement. Le DSL de routage compose explicitement la répartition — par taille de requête, par point de terminaison ou par part — de sorte que le chemin de classification peut exécuter Luna tandis que le chemin agentique exécute Sol, et le basculement automatique entre fournisseurs couvre une route qui se dégrade, plutôt que de vous laisser le découvrir à la suite d'une exécution échouée.

Une chose que cela ne fait pas, c’est vous donner un Luna qui se comporte comme Sol. Les paliers existent parce que les modèles diffèrent, et les chiffres ci-dessus représentent l’ampleur de la différence. Ce qu’une clé unique et une règle de routage vous apportent, c’est la possibilité de placer chaque requête sur le palier qui lui convient vraiment, au lieu de tout mettre sur le plus cher par sécurité ou tout mettre sur le moins cher pour respecter le budget.

Screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1.05M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $0.10 per million input, $0.50 per million output, a 1.49 s median time to first token, a 5.06 s p95, and 574.0M tokens routed in seven days.

La réponse, par la seule question qui compte

Si la tâche consiste à récupérer puis à répondre sur un document volumineux, une conversation ou un traitement de texte en masse, GPT-6 Luna est le palier qui convient et la carte à dix cents n’est pas un compromis — la ligne de rappel à contexte long indique qu’il récupère aussi bien que le modèle qui coûte vingt fois plus cher. Si la tâche nécessite un agent multi-étapes pour être menée à bien, Luna n’est pas le bon palier et le choix honnête est GPT-6 Sol ou GPT-6.1 Sol, où le prix reste bas en termes absolus et les évaluations agentiques cessent de s’effondrer.

Ce qu’est « GPT-6 » en soi, encore une fois, n’est pas quelque chose que l’on puisse appeler. C’est un nom de famille qui couvre trois identifiants à trois niveaux de prix et trois plafonds de capacités différents, et Luna est celle du bas — la moins chère, la plus rapide jusqu’au premier token, celle qui répond au forfait gratuit, et celle dont le plafond se fait sentir dès qu’une tâche exige plus d’une seule réponse assurée.

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement