Carte de titre principale générée avec pour titre « GPT-6 Luna vs Grok 4.6 » et pour sous-titre « Vingt fois le prix, et une falaise à 200 000 tokens », un pied de page indiquant « Prix selon OpenAI et xAI ; chiffres d'index selon Artificial Analysis. », et le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

GPT-6 Luna vs Grok 4.6 : L’écart de prix est vingt fois plus élevé, et la fenêtre est la véritable différence

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez GPT-6 Luna et Grok 4.6 sur la même page, et la première comparaison s’écrit d’elle-même. Luna s’affiche à 0,10 $ par million de tokens d’entrée et 0,50 $ par million de tokens de sortie. Grok 4.6 s’affiche à 2,00 $ et 6,00 $ avec une lecture en cache à 0,50 $. Vingt fois plus cher en entrée, douze fois plus cher en sortie, et un tarif d’entrée en cache cinquante fois plus élevé sur le modèle du fournisseur. C’est le tarif affiché, et sur le tarif affiché, la réponse est loin d’être serrée.

La raison pour laquelle il vaut la peine d’écrire le reste de cet article, c’est que les deux modèles sont en désaccord sur quelque chose de plus structurel que le prix. Grok 4.6 dispose d’une fenêtre de contexte de 500 000 tokens et refacture l’ensemble de la requête dès que l’invite dépasse 200 000 tokens. GPT-6 Luna en propose 1 050 000 et change de tarif à 272 000. Ces deux seuils fonctionnent comme des falaises plutôt que comme des taux marginaux : franchissez-en un et c’est toute la requête qui est facturée au tarif supérieur, et non la seule partie qui dépasse la ligne. L’emplacement de ces deux falaises, et ce qui arrive à une charge de travail à contexte long du mauvais côté de chacune, pèse davantage dans cette comparaison que le chiffre phare de vingt fois.

Deux modèles, deux postures très différentes

Grok 4.6 est le modèle de xAI du 12 août 2026, et c'est une sortie frontière polyvalente : entrée texte, sortie texte, une fenêtre de 500 000 jetons, un coût publié par tâche de 1,86 $ sur le tableau indépendant en effort élevé, et une vitesse mesurée de 57,7 jetons de sortie par seconde. C'est le genre de modèle qu'une équipe adopte parce qu'il est bon dans beaucoup de domaines et que le fournisseur livre rapidement.

GPT-6 Luna adopte la posture opposée. OpenAI l'a lancé le 22 septembre 2026 en tant que palier de volume de la famille GPT-6, sous GPT-6 Sol à 2,00 $/10,00 $ et le modèle phare GPT-6 Astra à 10,00 $/50,00 $. Entrée texte et image, sortie texte, fenêtre de 1 050 000 tokens avec une entrée maximale de 922 000 tokens, un plafond de sortie de 128 000 tokens, et une échelle de raisonnement allant de none à max, en passant par low, medium, high et xhigh, medium étant la valeur par défaut. Ce n'est pas un modèle que l'on adopte pour son étendue. C'est un modèle que l'on place sous une charge de travail.

Donc, la formulation honnête n’est pas « laquelle de ces options est meilleure ». C’est « laquelle de ces options est tarifée pour la forme de travail que vous avez », et les deux formes sont véritablement différentes.

Les cartes, ligne par ligne

Une ligne par dimension, les deux côtés sur chacune :

• Entrée par 1M — GPT-6 Luna 0,10 $ vs Grok 4.6 2,00 $

• Sortie par 1 M — GPT-6 Luna 0,50 $ vs Grok 4.6 6,00 $

• Entrée mise en cache par 1M — GPT-6 Luna 0,01 $ vs Grok 4.6 0,50 $, un dixième de son propre tarif d’entrée contre un quart de celui de xAI

• Seuil de contexte long — GPT-6 Luna 272 000 tokens d'entrée vs Grok 4.6 200 000 tokens de prompt

• Tarifs pour contexte long — GPT-6 Luna refacture toute la requête à 0,20 $ en entrée, 0,75 $ en sortie, 0,02 $ en cache, vs Grok 4.6 refacture toute la requête à 4,00 $ en entrée, 12,00 $ en sortie, 1,00 $ en cache

• Fenêtre de contexte — GPT-6 Luna 1 050 000 tokens vs Grok 4.6 500 000 tokens

• Sortie maximale — GPT-6 Luna 128 000 tokens, contre Grok 4.6, dont le plafond n’est pas publié séparément sur la fiche

• Indice d'intelligence, indépendant — GPT-6 Luna 37 à effort maximal vs Grok 4.6 44 à effort élevé sur la révision v4.3.2 de l'indice

• Score avec effort par défaut — GPT-6 Luna 29 à son medium par défaut vs Grok 4.6 43 à medium, où le classement le mesure également

• Coût par tâche Index, indépendant — GPT-6 Luna environ 0,07 $ contre Grok 4.6 1,86 $ à effort élevé

• Jetons de sortie lors de l'exécution de l'index — GPT-6 Luna 150M contre Grok 4.6 94M, face à une médiane du classement de 88M

• Vitesse de sortie, indépendante — GPT-6 Luna 153,9 tokens/sec vs Grok 4.6 57,7 tokens/sec à haut

• Temps jusqu’au premier token, indépendant — Grok 4.6 38,63 s, de bout en bout 47,31 s ; GPT-6 Luna renvoie un premier token dans un délai qui permet à un utilisateur de patienter

• Capacité cyber, indépendante — Grok 4.6 obtient 57 à l’évaluation cyber du classement ; aucun chiffre comparable pour GPT-6 Luna n’est publié

• Sur OrcaRouter — GPT-6 Luna absent de notre catalogue vs Grok 4.6 routable au prix catalogue de xAI

Generated two-column scoreboard titled 'GPT-6 Luna vs Grok 4.6 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, Long-context threshold 272,000, Context 1,050,000, AA Index 37 at max effort, Cost per index task $0.07. Right column Grok 4.6 rows: Price in/out $2.00 / $6.00, Cached input $0.50, Long-context threshold 200,000, Context 500,000, AA Index 44 at high effort, Cost per index task $1.86. Footer: 'Prices per OpenAI and xAI; index figures per Artificial Analysis.'

200 000 contre 272 000, voilà tout l’argument.

Lisez les deux seuils à côté des deux fenêtres et la comparaison se réorganise d’elle-même.

Le point de rupture de Grok 4.6 se situe à 200 000 tokens dans une fenêtre de 500 000 tokens — à 40 % du parcours. Celui de GPT-6 Luna se situe à 272 000 dans 1 050 000 — à 26 % du parcours. Ainsi, non seulement le modèle le moins cher commence à réévaluer ses tarifs plus tard, mais il dispose de plus de deux fois plus de marge après le seuil avant d’épuiser complètement sa fenêtre.

Concrètement : une requête de 450 000 tokens tient dans les deux modèles. Sur GPT-6 Luna, elle est facturée au palier de contexte long, à 0,20 $ et 0,75 $. Sur Grok 4.6, elle est facturée à 4,00 $ et 12,00 $. C'est vingt fois plus sur l'entrée et seize fois plus sur la sortie pour le même prompt — et c'est une requête que Grok 4.6 peut servir, donc le choix est bien réel et non théorique.

Le cas inverse est celui qui prend les gens en défaut. Une requête de 190 000 tokens se situe sous les deux seuils et est facturée aux tarifs standards sur les deux : 0,10 $/0,50 $ contre 2,00 $/6,00 $, soit exactement un facteur vingt et un facteur douze. Une requête de 210 000 tokens se situe au-dessus du seuil de Grok 4.6 et en dessous de celui de GPT-6 Luna. Elle est facturée à 4,00 $/12,00 $ sur Grok 4.6 et à 0,10 $/0,50 $ sur Luna — un écart de quarante et de vingt-quatre fois, produit entièrement par une différence de 20 000 tokens dans la longueur du prompt, sans aucun changement apporté à l’un ou l’autre modèle.

Ce n'est pas une raison d'éviter Grok 4.6. C'est une raison de savoir où vos prompts atterrissent réellement, car une charge de travail qui fait en moyenne 180 000 tokens et atteint des pics à 220 000 paie deux grilles tarifaires différentes et ressemblera à une erreur de facturation le premier mois où cela se produit.

Ce que l'écart de prix achète au sein du conseil indépendant

Grok 4.6 obtient 44 sur l’Artificial Analysis Intelligence Index en mode effort élevé. GPT-6 Luna obtient 37 en mode effort maximal. Sept points d’écart, sur un indice composite où un seul point se situe dans le bruit d’une réexécution — et les deux modèles sont séparés par un rapport d’environ vingt-six fois sur le coût par tâche complétée, 1,86 $ contre environ 0,07 $.

Deux choses méritent d’être distinguées à propos de cette paire de nombres.

Le premier est le paramètre d’effort par défaut. Le 37 de GPT-6 Luna est une valeur d’effort maximal et son niveau par défaut est moyen, où il obtient 29. Le 44 de Grok 4.6 est une valeur d’effort élevé, et le classement le mesure aussi au niveau moyen, où il obtient 43. Ainsi, la comparaison à configuration égale avec les paramètres par défaut est de 29 contre 43 — quatorze points, pas sept, et c’est la version à quatorze points qu’une équipe qui déploie les deux et ne change rien connaîtra réellement. Grok 4.6 perd un point en passant d’élevé à moyen. GPT-6 Luna en perd huit. Le réglage de l’effort coûte bien plus cher au modèle bon marché qu’au modèle coûteux, et cette asymétrie est invisible dans les chiffres principaux de l’indice.

Le deuxième est la verbosité, et ici la direction est à l'opposé de ce que suggère le rapport de prix. GPT-6 Luna a généré 150 millions de tokens de sortie pour terminer l'index ; Grok 4.6 en a généré 94 millions. Le modèle qui coûte un douzième du prix par token de sortie a dépensé 60 % de tokens en plus pour obtenir un score inférieur. Sur une carte tarifée à la sortie, c'est la différence entre un écart de coût par tâche de vingt-six fois et un écart plus petit, et c'est la raison pour laquelle toute comparaison fondée sur les seuls prix affichés surestimerait l'argument en faveur de l'offre bon marché.

Grok 4.6 publie également un score de capacité cyber de 57 dans le même classement. Il n’existe pas de chiffre comparable pour GPT-6 Luna, donc cette dimension n’a qu’un seul côté — mais c’est le genre de ligne qui compte si votre charge de travail touche aux outils de sécurité, et son absence sur le modèle moins cher est une information plutôt qu’une lacune à combler par des suppositions.

Latence, où les deux ne sont pas proches et pas dans la même direction

Les chiffres de latence indépendants de Grok 4.6 sont de 38,63 secondes jusqu'au premier token et de 47,31 secondes de bout en bout en effort élevé. C'est le chiffre d'un modèle qui mène un raisonnement sérieux avant de parler, et il est incompatible avec une personne qui regarde un curseur. Notre propre fiche pour le modèle enregistre un temps jusqu'au premier token p50 de 6,71 secondes et un p95 de 10,00 secondes sur une fenêtre de sept jours, ce qui mesure un point différent de la réponse et n'est pas comparable au chiffre indépendant — les deux nombres ne sont pas en désaccord, ils répondent à des questions différentes.

GPT-6 Luna fonctionne à 153,9 tokens de sortie par seconde et renvoie son premier token assez vite pour se placer derrière une surface interactive. Son débit est presque trois fois supérieur à celui de Grok 4.6 en mode effort élevé. Pour un traitement par lots, cette différence n'est qu'un confort de temps d'horloge. Pour tout ce qui oblige un utilisateur à patienter, c'est la différence entre un produit et un prototype.

La combinaison est inhabituelle et mérite d’être nommée clairement : le modèle bon marché est le rapide, le modèle cher est le lent, et le modèle cher a sept points d’avance sur le composite à effort équivalent. C’est le profil d’un modèle conçu pour réfléchir intensément une fois, et d’un modèle conçu pour répondre rapidement un très grand nombre de fois. Si votre charge de travail correspond à un appel par tâche, la latence de Grok 4.6 est abordable. Si elle correspond à mille appels par tâche, elle ne l’est pas.

Ce que vous achetez réellement du côté de xAI

Grok 4.6 coûte environ vingt-six fois plus cher par tâche terminée que GPT-6 Luna et se situe sept points d’indice devant à effort égal. C’est un mauvais taux de change pour une charge de travail généraliste, et c’est un taux raisonnable pour une catégorie spécifique de travail.

Trois choses le justifient. Le score cyber de 57 est une capacité dont GPT-6 Luna ne publie pas l’équivalent. L’exécution d’index de 94 millions de tokens face aux 150 millions de Luna constitue un réel avantage de concision sur toute tâche où la sortie est consommée par une personne plutôt que par un parseur. Et le modèle est en production depuis le 12 août, soit six semaines de plus que l’existence même de GPT-6 Luna — ce qui n’est pas un benchmark, mais c’est un historique de résultats, et pour une équipe qui a déjà construit sa solution dessus, le coût de migration lié au départ fait partie du prix du départ.

En revanche, le cas de GPT-6 Luna ne tient pas principalement au tarif vingt fois inférieur. Il tient au seuil de 272 000 jetons à l’intérieur d’une fenêtre d’un million de jetons, à la possibilité de se voir ordonner d’arrêter complètement le raisonnement, à un tarif d’entrée mis en cache d’un centime par million, et à un débit qui le rend utilisable comme composant plutôt que comme point de terminaison. Ce sont là des propriétés structurelles du palier à bas coût, et aucun avantage d’indice de l’autre côté ne peut les remplacer.

Exécuter l'un d'eux, ou les deux

Grok 4.6 est disponible sur OrcaRouter au prix catalogue de xAI, dans le cadre d'une tarification en répercussion directe qui nous permet d'appliquer le jour même tout changement de tarif d'un fournisseur, plutôt que d'attendre qu'un revendeur renégocie. Le basculement automatique est précisément ce qui justifie sa place pour ce modèle : une fenêtre de 500 000 tokens avec une limite abrupte à 200 000 tokens représente une charge de travail où une requête tombe parfois du mauvais côté de la ligne, et une route qui bascule entre fournisseurs en amont sans déploiement vaut plus qu'une fraction de centime par token.

GPT-6 Luna ne figure pas dans notre catalogue à l'heure où nous écrivons ces lignes et est accessible via l'API propre d'OpenAI. Ainsi, une équipe qui veut les deux utilise une clé pour Grok 4.6 aux côtés de ce qu'elle utilise déjà pour OpenAI. Le DSL de routage est l'élément qui convient à cette association : une règle qui envoie les prompts dépassant un seuil de tokens au modèle dont ils franchissent le point de bascule, et tout ce qui se situe en dessous au modèle qui coûte un douzième du prix, peut s'exprimer sous forme de configuration plutôt que comme une branche dans votre application — ce qui compte lorsque les seuils sont aussi proches des tailles de prompts courantes que ces deux-là.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Lequel, et quand

Prenez GPT-6 Luna si votre charge de travail est à fort volume, consommée par des programmes et courte. Classification, extraction, routage, résumé en masse, la boucle interne d'un agent. À 0,10 $/0,50 $ avec une lecture en cache à un centime, face à un modèle qui coûte vingt-six fois plus cher par tâche accomplie pour sept points d'indice à effort égal, l'arithmétique n'est pas serrée. Définissez explicitement le paramètre d'effort — la valeur par défaut est moyenne et le 37 mis en avant est un chiffre à effort maximal — et gardez vos longs appels sous 272 000 tokens.

Prenez Grok 4.6 si vous avez besoin de la capacité cyber, si votre sortie est lue par une personne et que sa concision vaut la peine d'être payée, ou si vous avez une charge de travail de 300 000 à 500 000 tokens que GPT-6 Luna peut servir mais où vous préféreriez ne pas être la première équipe à découvrir comment il se comporte à cette longueur. Prévoyez explicitement la falaise des 200 000 tokens, et ne le mettez pas derrière une surface interactive à effort élevé — 38 secondes jusqu'au premier token n'est pas une mesure de latence, c'est une déclaration sur ce à quoi sert le modèle.

L’erreur que cette comparaison invite à commettre est de considérer le taux vingt fois plus élevé comme la décision. C’est la décision pour une forme de charge de travail. Pour l’autre, la décision se prend à 200 000 et 272 000 tokens, et le rapport de prix est un détail qu’on lit après coup.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the xAI vendor label, list pricing of $2.00 input and $6.00 output per 1M tokens, a 500,000-token context window, recorded latency statistics, an uptime chart, and the provider routing section.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement