Une carte de titre hero générée affichant « GPT-6 Luna vs GLM-5.3 », avec comme sous-titre « Huit points d'indice pour dix fois le coût par tâche, et les poids ne sont toujours pas publiés. », avec des pastilles indiquant Luna à 0,10 $/0,50 $ par 1M avec un indice de 37, GLM-5.3 à 1,40 $/4,40 $ par 1M avec un indice de 45, et un coût par tâche d'indice de 0,07 $ contre 0,68 $, avec le logo OrcaRouter en bas à droite.
Guides & Insights

GPT-6 Luna vs GLM-5.3 : le modèle à poids ouverts que vous ne pouvez toujours pas télécharger

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GLM-5.3 est le meilleur modèle. Il obtient 45 sur l'Artificial Analysis Intelligence Index à effort maximal, contre les 37 de GPT-6 Luna ; il égale Mythos 5 sur certaines évaluations de cybersécurité selon Z.ai, et c'est le modèle à poids ouverts de référence sur plusieurs des classements composites. C'est aussi, à l'heure actuelle, une API que l'on loue plutôt qu'un modèle que l'on possède : Z.ai a repoussé la publication des poids d'environ deux semaines pour des raisons de cybersécurité, et le téléchargement qui est censé être tout l'intérêt d'un modèle phare à poids ouverts n'est toujours pas disponible.

Ce retard est toute l’histoire de cette confrontation, et il change l’arithmétique d’une manière que les tableaux de prix ne prennent pas en compte. GPT-6 Luna est arrivé le 22 septembre 2026 à 0,10 $ par million de jetons en entrée et 0,50 $ par million en sortie, en disponibilité générale, sans conditions. GLM-5.3 est arrivé le 18 août 2026 à 1,40 $ et 4,40 $ — quatorze fois le tarif d’entrée de Luna et près de neuf fois son tarif de sortie — avec ses poids retenus. La comparaison n’oppose donc pas ouvert à fermé. C’est un modèle fermé que vous pouvez appeler dès aujourd’hui pour un dixième du coût, face à un modèle ouvert que vous ne pouvez appeler que dès aujourd’hui, facturé comme si vous achetiez ce que vous ne pouvez pas encore avoir.

Deux modèles, à un mois d’écart, deux accords très différents

GPT-6 Luna est le petit palier de la génération GPT-6 d'OpenAI, livré aux côtés de GPT-6 Sol à 2,00 $/10,00 $ et en dessous du modèle phare GPT-6 Astra à 10,00 $/50,00 $. Il dispose d'une fenêtre de contexte de 1 050 000 tokens, d'un plafond de sortie de 128 000 tokens, d'une entrée texte et image, et d'une échelle de raisonnement allant de none à low, medium, high, xhigh et max — medium étant la valeur par défaut. OpenAI le présente comme le modèle le plus efficace de la famille pour un travail ciblé et à fort volume, et la grille tarifaire le confirme : l'entrée mise en cache à 0,01 $ par million représente un dixième d'un tarif non mis en cache déjà bas.

GLM-5.3 est le fleuron actuel de Z.ai pour l'ingénierie logicielle complexe et le travail agentique à long horizon, sorti le 18 août 2026. Il fonctionne en entrée texte, sortie texte, dispose d'une fenêtre de contexte de 1 M de tokens avec un plafond de sortie de 128 000 tokens, et son raisonnement est toujours activé — il n'existe pas de mode sans raisonnement. Z.ai décrit une amélioration d'environ 50 % de l'expérience de codage par rapport à GLM-5.2 et le positionne pour le codage à l'échelle d'un dépôt et l'ingénierie autonome à plusieurs étapes. Les poids, lorsqu'ils seront disponibles, constitueront la fonctionnalité phare ; aujourd'hui, c'est l'API qui est en service.

Ce que disent réellement les deux grilles tarifaires

Une ligne par dimension, les deux côtés sur chacune :

• Entrée par million — GPT-6 Luna 0,10 $ vs GLM-5.3 1,40 $

• Sortie pour 1M — GPT-6 Luna 0,50 $ vs GLM-5.3 4,40 $

• Entrée mise en cache — GPT-6 Luna 0,01 $ par million contre GLM-5.3 0,26 $ par million, soit une réduction de 81 % sur son propre tarif d’entrée

• AA Intelligence Index — GPT-6 Luna 37 à effort maximal vs GLM-5.3 45 à effort maximal

• Score d’effort par défaut — GPT-6 Luna 29 à son réglage moyen par défaut vs le raisonnement toujours actif de GLM-5.3, mesuré au maximum

• Jetons de sortie lors de l'exécution de l'indice — GPT-6 Luna 150M vs GLM-5.3 210M, par rapport à une médiane du classement de 140M

• Coût d'exécution de l'index — GPT-6 Luna 122,39 $ vs GLM-5.3 2 503,48 $

• Coût par tâche d'indexation — GPT-6 Luna environ 0,07 $ contre GLM-5.3 environ 0,68 $

• Contexte et sortie — GPT-6 Luna 1 050 000 en entrée / 128 000 en sortie vs GLM-5.3 1M en entrée / 128 000 en sortie

• Clause de contexte long — GPT-6 Luna 2x entrée et cache, 1,5x sortie au-delà de 272K d’entrée, requête entière vs GLM-5.3, aucune clause équivalente sur la fiche publiée

• Interrupteur de désactivation du raisonnement — GPT-6 Luna : de « aucun » à « max », contrairement à GLM-5.3 toujours activé, sans mode sans raisonnement

• Poids — GPT-6 Luna fermé, API uniquement vs GLM-5.3 ouvert par engagement, sortie retardée

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

La taxe de verbosité est le nombre qui décide de cela.

L’écart de huit points sur l’indice est réel et l’écart de prix est plus important, et ni l’un ni l’autre n’est le chiffre qui compte le plus. Celui qui compte, c’est le nombre de tokens de sortie par tâche terminée, car c’est là qu’un avantage de capacité de huit points se rentabilise ou non.

L'exécution de l'indice d'Artificial Analysis est la comparaison contrôlée la plus propre dont on dispose : la même suite, le même harnais, exécutés sur les deux modèles. GLM-5.3 a généré 210 millions de tokens de sortie pour la terminer. GPT-6 Luna en a généré 150 millions. Face à une médiane du classement de 140 millions, les deux sont prolixes — GLM-5.3 de 50 % au-dessus de la médiane, GPT-6 Luna d'environ un dixième. Mais le sens de cet écart se cumule en défaveur du modèle de Z.ai sur le prix : il émet 40 % de tokens en plus et facture 8,8 fois plus pour chacun d'eux.

Si l’on met les deux ensemble, le coût par tâche d’index terminée ressort à environ 0,68 $ pour GLM-5.3, contre environ 0,07 $ pour GPT-6 Luna — un écart d’environ un facteur dix, plus large que le ratio brut de la grille tarifaire, parce que le modèle le plus cher est aussi le plus verbeux. Voilà la réalité honnête de cette association. GLM-5.3 vous achète huit points d’index pour dix fois l’argent par travail terminé, et savoir s’il s’agit d’un bon achat dépend entièrement de si votre charge de travail est de celles où huit points font la différence entre fonctionner et ne pas fonctionner.

Pour une grande partie du trafic de production, ce n'est pas le cas. Pour un agent de codage qui travaille sur un dépôt à la limite de ce que le modèle peut faire, c'est fréquemment le cas, et aucun avantage de prix, quelle que soit son importance, ne comble un écart de capacités sur une tâche qui échoue.

Pourquoi les poids ouverts changent la réponse, et pourquoi le délai la rétablit

L’argument standard en faveur d’un modèle phare à poids ouverts est que le prix par token est temporaire. On loue jusqu’à ce que son volume justifie l’achat, puis on télécharge le modèle et le coût marginal d’un token devient l’électricité. Selon cet argument, le tarif de 1,40 $/4,40 $ de GLM-5.3 n’est pas vraiment quatorze fois celui de 0,10 $ de GPT-6 Luna — c’est un prix de transition vers zéro, et le tarif moins élevé du modèle fermé est une location sans porte de sortie.

Cet argument est correct, et il est actuellement suspendu. Z.ai a retardé la publication des poids d’environ deux semaines à cause de constats de cybersécurité, ce qui signifie que la voie de sortie qui justifie le supplément n’existe pas encore. Tant que ce n’est pas le cas, GLM-5.3 est une API facturée à l’usage, à un coût par tâche dix fois supérieur à celui d’un modèle qui est quatre points d’indice derrière lui au classement général et un point derrière au classement du codage — et l’acheteur paie des tarifs de poids ouverts pour un accès à des poids fermés.

Il y a un point de second ordre qui mérite d’être nommé. Le retard n’est pas un scandale ; c’est un fournisseur qui prend au sérieux une découverte de capacité, et un modèle qui trouve bien les vulnérabilités est exactement le genre de modèle qu’un laboratoire devrait hésiter à publier sous forme de fichier téléchargeable. Mais cela signifie que la date de publication des poids est désormais la date la plus importante de cette comparaison, et elle n’est pas publiée. Une équipe qui choisit entre ces deux modèles sur un horizon de douze mois choisit entre un modèle dont les conditions peuvent changer le mois prochain et un modèle dont les conditions ne le peuvent pas — et un seul des deux a un prix qui en tient compte.

La surface de migration est réduite.

Les deux modèles exposent une interface de complétions de chat compatible OpenAI, disposent tous deux d’une fenêtre de contexte de classe 1 M et plafonnent tous deux la sortie à 128 000 tokens ; un portage de l’un à l’autre relève donc davantage d’un changement de configuration que d’une réécriture. Les différences qui poseront réellement problème sont comportementales plutôt que structurelles.

La clause de contexte long de GPT-6 Luna est la plus coûteuse : les requêtes dépassant 272 000 jetons d'entrée sont facturées au double des tarifs d'entrée et de cache, et à 1,5 fois le tarif de sortie, pour l'ensemble de la requête, si bien qu'un appel de 300 000 jetons coûte le double de ce que coûte le même travail réparti en deux. La fiche publiée de GLM-5.3 ne comporte aucune clause équivalente, ce qui, sur des requêtes uniques véritablement volumineuses, réduit considérablement l'écart de prix et peut même l'inverser sur une tâche à forte production de sortie.

La configuration du raisonnement joue en sens inverse. GLM-5.3 a le raisonnement toujours activé et ne vous donne aucun moyen de le désactiver, ce qui constitue une contrainte forte pour tout ce qui est sensible à la latence — un classificateur ou un routeur ne peut pas l'utiliser. GPT-6 Luna propose none, low, medium, high, xhigh et max, et la valeur par défaut est medium, où il obtient 29 plutôt que 37. Ce seul paramètre fait la différence entre un GPT-6 Luna à huit points d'indice derrière le modèle de Z.ai et à seize points derrière, et une équipe qui migre sans le définir explicitement utilise la seconde configuration tout en croyant avoir acheté la première.

GLM-5.3 est disponible sur OrcaRouter au prix catalogue de Z.ai, dans le cadre d'une tarification en pass-through qui répercute un changement de tarif du fournisseur de notre côté le jour même, plutôt que d'attendre qu'un revendeur renégocie — ce qui compte plus que d'ordinaire pour un modèle dont le chiffre phare devrait évoluer lorsque les poids seront disponibles. GPT-6 Luna ne figure pas dans notre catalogue à l'heure où nous écrivons et est accessible via l'API propre à OpenAI. Une équipe qui exploite les deux, ce qui est la configuration rationnelle ici étant donné à quel point les deux diffèrent aux extrémités, utilise une seule clé pour GLM-5.3 aux côtés de ce qu'elle utilise déjà pour OpenAI, et fait passer le trafic entre un classifieur à cinq cents et un agent de codage à l'échelle d'un dépôt en changeant un itinéraire plutôt qu'un déploiement.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

L'appel

Utilisez GPT-6 Luna pour tout ce qui est consommé par un programme et à fort volume. Classification, extraction, routage, résumé en masse, boucle interne d’un agent. À 0,10 $/0,50 $, avec l’entrée mise en cache à un cent et Batch à la moitié du tarif standard, il est d’un ordre de grandeur moins cher par tâche terminée que GLM-5.3, et l’écart de huit points à l’indice ne sera pas visible dans votre évaluation. Définissez explicitement le paramètre effort et gardez vos appels longs sous 272 000 tokens.

Choisissez GLM-5.3 lorsque la tâche est difficile et que la réponse compte plus que la facture. L’ingénierie logicielle à l’échelle d’un dépôt, le travail autonome en plusieurs étapes, tout ce où huit points d’indice font la différence entre une tâche qui aboutit et une tâche qui échoue. La verbosité est un vrai coût, et le coût de tâche multiplié par dix est réel, mais un modèle qui termine est moins cher qu’un modèle qu’il faut relancer.

Et surveillez les poids. Le jour où Z.ai publiera le téléchargement de GLM-5.3 est le jour où le fait central de cette comparaison change, et c'est la seule date de cette page qui ne figure pas encore au calendrier.

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement