Un tableau de scores comparatif généré à deux colonnes intitulé « GPT-6.1 Sol vs GPT-6 Luna - le tableau de scores ». Colonne de gauche « GPT-6.1 Sol » : lignes indiquant « Indice d'intelligence : 51,8 », « Coût par tâche d'indice : 0,72 $ », « Prix pour 1 M : 2,00 $ / 10,00 $ », « Jetons de sortie sur l'exécution de l'indice : 67 M », « Terminal-Bench 4.0 : 56,1 % », « Plancher d'effort : faible ». Colonne de droite « GPT-6 Luna » : lignes indiquant « Indice d'intelligence : 38,1 », « Coût par tâche d'indice : 0,07 $ », « Prix pour 1 M : 0,10 $ / 0,50 $ », « Jetons de sortie sur l'exécution de l'indice : 144 M », « Terminal-Bench 4.0 : 12,6 % », « Plancher d'effort : aucun ». Un pied de page indique « Chiffres indépendants selon Artificial Analysis v4.3.2 à effort maximal ; prix catalogue des fournisseurs. »
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna : treize points d'indice, dix fois plus d'argent, et deux évaluations où cela ne tient pas

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Open​AI a publié GPT-6.1 Sol le 29 septembre 2026, une semaine après GPT-6 Luna, arrivé le 22 septembre dans le même cycle de keynote. Ils constituent les deux extrémités d'une même génération : Luna est le niveau économique, Sol est le niveau intermédiaire juste au-dessus, et GPT-6 Astra se situe au-dessus des deux. La différence de prix entre les deux est d'un ordre de grandeur — 0,10 $ et 0,50 $ par million de tokens contre 2,00 $ et 10,00 $, entrée mise en cache à 0,01 $ contre 0,10 $ — et l'écart de capacités sur le tableau indépendant est de 13,7 points d'Indice d'Intelligence, 51,8 contre 38,1 à effort de raisonnement maximal. Dix fois le prix pour treize points, c'est à peu près le pire taux de change de la gamme Open​AI actuelle. Ce qui rend la comparaison digne d'intérêt, c'est la question à quarante dollars qui s'ensuit : quels treize points ?

Les deux modèles, et la semaine entre eux

GPT-6 Luna est le petit modèle de la génération GPT-6 — celui qu'Open​AI décrit comme conçu pour les charges de travail à fort volume et sensibles à la latence : classification, extraction, routage, synthèse en masse, la boucle interne d'un agent. Il dispose d'une fenêtre de contexte de 1 050 000 jetons et d'un plafond de sortie de 128 000 jetons, accepte en entrée du texte, des images et des fichiers, et conserve l'échelle complète des six niveaux d'effort, y compris none, que le palier 6.1 a supprimé. La grille tarifaire est la raison de son existence : 0,10 $ en entrée et 0,50 $ en sortie par million de jetons, l'entrée mise en cache à 0,01 $ et les écritures de cache à 0,125 $, avec un palier de contexte long au-delà de 272 000 jetons d'entrée à 0,20 $, 0,75 $ et 0,02 $ en cache.

GPT-6.1 Sol est la mise à jour de milieu de gamme sortie une semaine plus tard. Même fenêtre, même plafond de sortie, mêmes modalités d'entrée, une date de coupure des connaissances au 30 avril 2026 par rapport à celle de Luna, et une échelle d'effort qui commence au niveau faible parce que aucun et minimal sont rejetés d'emblée. Il est facturé à 2,00 $ et 10,00 $ avec une entrée mise en cache à 0,10 $ — vingt fois le tarif d'entrée de Luna et vingt fois son tarif de sortie, avec une ligne de cache dix fois plus chère par accès.

Les deux sont en vente, les deux figurent dans ChatGPT Work et Codex ainsi que dans l’API, et les deux peuvent être appelés via la même clé de notre côté. Rien dans cette association n’impose de choisir.

Ce que treize points d'indice achètent réellement

Le composite est le chiffre le moins informatif de la comparaison, car il fait la moyenne de tâches qui se comportent très différemment. Noté évaluation par évaluation à l’effort de raisonnement maximal sur Artificial Analysis v4.3.2, le profil est une séparation plutôt qu’une pente :

• AA-LCR v1.1, raisonnement à long contexte — GPT-6 Luna 0,833 contre GPT-6.1 Sol 0,830. Luna est légèrement en tête.

• SciCode — GPT-6 Luna 0,546 contre GPT-6.1 Sol 0,542. De nouveau, pratiquement à égalité, et le modèle le moins cher passe nominalement devant.

• Terminal-Bench 4.0 — GPT-6 Luna 0,126 contre GPT-6.1 Sol 0,561. Un écart de 43 points ; les deux modèles évoluent dans des ligues différentes en matière de travail sur terminal.

• Humanity's Last Exam — GPT-6 Luna 0,385 contre GPT-6.1 Sol 0,529.

• AutomationBench-AA — GPT-6 Luna 0,532 vs GPT-6.1 Sol 0,649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 contre GPT-6.1 Sol Elo 1575,1, soit un écart Elo de 138 points dans le travail de connaissance professionnel.

• PIB.pdf — GPT-6 Luna 0.228 vs GPT-6.1 Sol 0.310.

• CritPt — GPT-6 Luna 0.194 contre GPT-6.1 Sol 0.317.

• AA-Omniscience — GPT-6 Luna 0,65 contre GPT-6.1 Sol 41,5. Sur une échelle où zéro signifie autant de bonnes réponses que de mauvaises, Luna se situe à la ligne de flottaison et Sol nettement au-dessus.

• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.

• Coût par tâche d'indexation, indépendant — GPT-6 Luna 0,068 $ contre GPT-6.1 Sol 0,72 $ ; un écart d'environ dix fois en faveur du modèle bon marché

• Jetons de sortie lors de l'exécution de l'indice — GPT-6 Luna 144 millions contre GPT-6.1 Sol 67 millions, par rapport à une médiane de catégorie de 100 millions pour Luna et d'environ 81 millions pour Sol

Deux évaluations sur dix sont à égalité en faveur du modèle bon marché. Huit reviennent au modèle coûteux, et dans six de ces huit, l'écart n'est pas marginal. C'est l'interprétation honnête des treize points : il ne s'agit pas d'un gradient de qualité uniforme, il s'agit de deux capacités — l'exécution agentique soutenue et la fiabilité factuelle — où Luna n'est tout simplement pas de la même classe de modèle, et d'un vaste milieu où la différence est réelle mais assez faible pour être invisible dans votre propre ensemble d'évaluation.

Le résultat d'AA-LCR mérite une réserve, car c'est le chiffre qui flatte le plus Luna. Le raisonnement à long contexte à 0,833 est un score solide et les deux modèles sont à moins d'un demi-point l'un de l'autre, mais le benchmark mesure la récupération et le raisonnement sur de longues entrées, pas la capacité à agir sur une longue session. L'écart sur Terminal-Bench 4.0 montre à quoi ressemble « agir sur une longue session » lorsqu'il est noté, et il est large de 43 points.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

L'arithmétique du coût par tâche, et où elle cesse d'être vraie

Artificial Analysis calcule le coût de chaque exécution de l’indice à partir de la consommation de tokens mesurée, de sorte que le chiffre de coût ne résulte pas d’une inférence à partir d’une grille tarifaire. L’exécution de GPT-6 Luna a coûté 0,068 $ par tâche ; celle de GPT-6.1 Sol a coûté 0,72 $. Le rapport est de 10,7×, ce qui est légèrement moins bon que le rapport de prix nominal de vingt pour un, uniquement parce que Luna a généré 144 millions de tokens de sortie lors de l’exécution, contre 67 millions pour Sol — le modèle bon marché est plus de deux fois plus bavard, et il entame son propre avantage. Malgré tout, la hiérarchie n’est pas serrée, et sur une charge de travail à réponses courtes, l’écart se creuserait : un volume de sortie moindre signifie que la pénalité de verbosité de Luna diminue tandis que son avantage de prix reste fixe.

Là où l'arithmétique cesse d'être vraie, c'est pour toute charge de travail à laquelle l'indice ne ressemble pas. Si votre tâche est une modification à l'échelle d'un dépôt qui exige vingt appels d'outils maintenus cohérents, un modèle à 0,07 $ qui échoue à la tâche vous coûte toute la boucle de reprise plus le temps d'horloge, et le modèle à 0,72 $ qui la termine en une seule fois revient moins cher. Le cadrage de lancement de GPT-6.1 Sol lui-même repose entièrement sur cette idée — le coût par tâche terminée — et c'est le bon cadre : la comparaison pertinente n'est pas le coût par token, c'est le coût attendu par résultat, et pour les tâches que Luna ne peut pas accomplir, cette espérance est sans limite.

Deux détails structurels précisent cette frontière. Premièrement, le palier de contexte long : les deux modèles appliquent un nouveau tarif au-delà de 272 000 jetons d'entrée, Luna à 0,20 $ et 0,75 $, et Sol à 4,00 $ et 15,00 $, de sorte que l'écart absolu se creuse à la frontière au lieu de se réduire, mais le tarif réévalué de Luna reste d'un ordre de grandeur inférieur au tarif standard de Sol. Deuxièmement, et c'est facile à manquer : l'échelle d'effort n'a pas la même forme. Luna accepte none ; Sol ne l'accepte pas. Une cascade qui achemine d'abord vers Sol et se replie sur Luna en cas d'erreur ou d'expiration du délai ne doit pas transposer tel quel le reasoning.effort de la requête, car une configuration légale sur un modèle renvoie une erreur sur l'autre. C'est une question de couche de routage, pas de qualité de modèle, et c'est exactement le genre de chose qu'un point de terminaison unique doté d'une règle de routage est censé absorber.

Faire tourner les deux, c'est une couverture, pas un pari.

Les deux modèles sont sur OrcaRouter aux prix catalogue propres à OpenAI, sans rien ajouté : GPT-6 Luna à 0,10 $ et 0,50 $, avec l’entrée mise en cache à 0,01 $, GPT-6.1 Sol à 2,00 $ et 10,00 $, avec l’entrée mise en cache à 0,10 $, et le palier de 272 000 tokens sur chacun répercuté exactement tel que le fournisseur l’indique. Parce que la plateforme répercute le prix catalogue du fournisseur plutôt que de le majorer, le rapport de vingt pour un dans cet article est le rapport que vous payez réellement, des deux côtés.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

La raison qui compte ici précisément, c'est que ce duo est une cascade qui ne demande qu'à être écrite. Un classifieur, un routeur, une tâche d'extraction en masse et un agent de codage à l'échelle d'un dépôt n'ont pas leur place sur le même modèle, et l'écart de prix est assez large pour que se tromper de sens soit coûteux — vingt fois trop cher par appel dans un sens, une tâche échouée dans l'autre. Une seule clé, deux modèles, et une règle qui envoie le trafic facile vers Luna et bascule vers Sol lorsque la classe de tâche change ou lorsque la sortie de Luna échoue à un contrôle : c'est un changement de configuration de notre côté, plutôt qu'un second contrat fournisseur. Le basculement automatique couvre le cas où l'un des deux est dégradé, ce qui, pour un modèle lancé il y a huit jours, reste une possibilité bien réelle.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

La décision, en une seule passe

•Classification, extraction, routage, synthèse en masse, boucles internes d'agents — GPT-6 Luna, et arrêtez de lire. À 0,10 $/0,50 $ avec une lecture en cache à un cent, treize points d'indice de capacité générale ne valent pas dix fois la facture pour un travail dont la réponse est courte et vérifiable.

• Codage à l'échelle du dépôt, agents de terminal, exécution multi-étapes — GPT-6.1 Sol. L'écart de 43 points sur Terminal-Bench 4.0 constitue tout l'argument ; c'est la capacité que le prix achète.

• Questions de travail intellectuel où une mauvaise réponse coûte cher — GPT-6.1 Sol, sur les écarts d'AA-Omniscience et de GDPval-AA. Le score de fiabilité factuelle de Luna est à la ligne de flottaison.

• Des entrées longues pour une réponse générée courte — GPT-6 Luna. Il raisonne sur un contexte long au même niveau qu'un modèle coûtant vingt fois plus cher, et sa pénalité de verbosité de 144 millions de jetons n'a jamais l'occasion de s'appliquer.

• Tout ce qui est déjà réglé sur none — restez sur Luna, ou prévoyez le changement. Cet échelon n'existe pas sur GPT-6.1 Sol.

• Surfaces sensibles à la latence — GPT-6 Luna, d'après les mesures du classement lui-même : 129,4 tokens de sortie par seconde et 100 secondes jusqu'au premier chunk, contre 59,7 et 332 pour Sol.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement