Une carte hero générée pour une comparaison entre GPT-6.1 Sol et GLM-5.3, intitulée « Sept points d'indice, 2,8 fois le prix », avec des badges indiquant « GPT-6.1 Sol : 0,72 $ par tâche d'indice », « GLM-5.3 : 2,01 $ par tâche d'indice » et « Poids de GLM-5.3 : téléchargeables depuis le 25 août 2026 », un pied de page indiquant « Chiffres indépendants selon Artificial Analysis v4.3.2, effort maximal ; carte générée par IA », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

GPT-6.1 Sol vs GLM-5.3 : les poids ont été livrés, et la facture n'a pas bougé

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

OpenAI a publié GPT-6.1 Sol le 29 septembre 2026 lors de sa keynote DevDay, et Z.ai a publié GLM-5.3 six semaines plus tôt, le 18 août 2026, puis a retenu le checkpoint pendant une semaine. Cette rétention est terminée : zai-org/GLM-5.3 est sur Hugging Face depuis le 25 août, un checkpoint BF16/FP8 d'environ 753 milliards de paramètres dont environ 40 milliards sont actifs par token, et il a depuis dépassé 1,4 million de téléchargements. Ainsi, la question que la plupart des comparaisons posent depuis août — s'agit-il d'un modèle ouvert ou d'une location ? — a une réponse, et la réponse n'a pas changé l'arithmétique. Sur le tableau indépendant, GPT-6.1 Sol obtient 51,8 et coûte 0,72 $ par tâche d'index terminée ; GLM-5.3 obtient 44,8 et coûte 2,01 $. Vous pouvez désormais posséder le modèle le moins cher au token et payer néanmoins près de trois fois plus par travail terminé.

Ce qu'est réellement chaque modèle

GPT-6.1 Sol est le modèle GPT-6 de milieu de gamme d'OpenAI, un cran en dessous du fleuron GPT-6 Astra et au-dessus du modèle économique GPT-6 Luna. Il dispose d'une fenêtre de contexte de 1 050 000 jetons avec un plafond de sortie de 128 000 jetons et une date de coupure des connaissances au 30 avril 2026, et il accepte le texte, les images et les fichiers en entrée. Le raisonnement va de low à max avec une valeur par défaut de medium ; les valeurs none et minimal que GPT-6 Sol acceptait renvoient désormais une erreur, ce que les propres consignes de migration d'OpenAI abordent en demandant aux développeurs de remplacer par low. Il coûte 2,00 $ par million de jetons en entrée et 10,00 $ par million de jetons en sortie, avec l'entrée mise en cache à 0,10 $.

GLM-5.3 est le modèle phare actuel de Z.ai pour l'ingénierie logicielle et le travail d'agent à long horizon, construit sur la même base de mélange d'experts que GLM-5.2, les gains provenant du post-entraînement plutôt que d'une base a priori. Il fonctionne en entrée texte, sortie texte — aucune vision, à aucun prix — avec une fenêtre de 1 M de tokens, un plafond de sortie de 128 000 tokens et la réflexion activée en permanence. Il n'existe pas de mode sans raisonnement, ce qui constitue une contrainte forte pour un appel sensible à la latence. Z.ai l'affiche à 1,40 $ en entrée et 4,40 $ en sortie par million de tokens, avec l'entrée mise en cache à 0,26 $ ; notre propre catalogue le propose à 1,26 $ et 3,96 $ avec une lecture de cache à 0,234 $, c'est donc le chiffre de la fiche du fournisseur qu'il faut retenir pour argumenter.

La grille tarifaire, et la ligne qui l'inverse

Une ligne par dimension, les deux côtés sur chacune :

• Entrée — GPT-6.1 Sol 2,00 $ par 1M contre GLM-5.3 1,40 $ par 1M ; GLM est 30 % moins cher
• Sortie — GPT-6.1 Sol 10,00 $ par 1M contre GLM-5.3 4,40 $ par 1M ; GLM est 56 % moins cher
• Entrée mise en cache — GPT-6.1 Sol 0,10 $ par 1M contre GLM-5.3 0,26 $ par 1M ; l'ordre s'inverse, Sol est 2,6× moins cher
• Clause de contexte long — GPT-6.1 Sol refacture l'ensemble de la requête au-delà de 272 000 jetons d'entrée à 2× l'entrée et le cache, et 1,5× la sortie, contre GLM-5.3 sans clause équivalente sur la fiche publiée
• Contexte et sortie — 1 050 000 en entrée / 128 000 en sortie contre 1M en entrée / 128 000 en sortie ; une différence de 5 %, sans importance
• Modalité — texte, image et fichier en entrée, texte en sortie contre texte uniquement
• Plancher de raisonnement — GPT-6.1 Sol faible, moyen (par défaut), élevé, très élevé, max contre GLM-5.3 toujours actif, aucun plancher sur lequel redescendre
• Poids — fermés, API uniquement contre ouverts, téléchargeables, FP8
• Score indépendant, Artificial Analysis v4.3.2 à effort maximal — 51,8 contre 44,8
• Coût indépendant par tâche de l'indice — 0,72 $ contre 2,01 $
• Jetons de sortie pour l'exécution de l'indice — 67 millions contre 210 millions

img src="2.png" alt="Un tableau comparatif à deux colonnes généré, intitulé « GPT-6.1 Sol vs GLM-5.3 - le tableau des scores ». Colonne de gauche « GPT-6.1 Sol » : lignes indiquant « Indice d'intelligence : 51,8 », « Coût par tâche d'indice : 0,72 $ », « Prix d'entrée : 2,00 $ pour 1 M », « Prix de sortie : 10,00 $ pour 1 M », « Jetons de sortie lors de l'exécution de l'indice : 67 M », « Poids : fermés ». Colonne de droite « GLM-5.3 » : lignes indiquant « Indice d'intelligence : 44,8 », « Coût par tâche d'indice : 2,01 $ », « Prix d'entrée : 1,40 $ pour 1 M », « Prix de sortie : 4,40 $ pour 1 M », « Jetons de sortie lors de l'exécution de l'indice : 210 M », « Poids : ouverts sur Hugging Face ». Un pied de page indique « Chiffres indépendants selon Artificial Analysis v4.3.2 à effort maximal ; prix catalogue des fournisseurs. » Le logo OrcaRouter se trouve dans le coin inférieur droit." /> C'est dans cette dernière paire que se décide cette confrontation, et l'effet n'est pas subtil.

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

Le problème des 210 millions de tokens

Artificial Analysis applique la même suite de dix évaluations à chaque modèle du classement et publie le nombre de tokens derrière chaque score. GLM-5.3 a généré environ 210 millions de tokens de sortie pour achever l’exécution. GPT-6.1 Sol en a généré 67 millions. Rapportés à la classe de comparaison propre à chaque modèle dans le classement, les 210 millions de GLM-5.3 se situent au-dessus d’une médiane de classe d’environ 140 millions, tandis que les 67 millions de Sol se situent bien en dessous de la médiane d’environ 81 millions de la classe phare dans laquelle il est évalué. Comme la sortie est le poste coûteux de toute grille tarifaire, la remise affichée de 56 % de GLM-5.3 sur la ligne de sortie ne survit pas à la confrontation avec la mesure : il émet 3,1 fois plus de tokens à 0,44 fois le prix, et 3,1 × 0,44 = 1,37 — GLM-5.3 est le modèle le plus cher sur cette charge de travail malgré une grille tarifaire nettement moins chère.

Le chiffre de coût par tâche du classement lui-même confirme la direction et l'ordre de grandeur. 2,01 $ contre 0,72 $, c'est 2,8×, un écart plus large que ne le laisse supposer le seul ratio de tokens, car GLM-5.3 paie aussi davantage sur les lignes d'entrée et de cache par tâche. Il vaut la peine d'être précis sur ce que cela prouve et ne prouve pas : la passe de l'index correspond à dix évaluations fixes, et la verbosité sur celles-ci n'est pas la même que la verbosité sur votre trafic. Mais pour un acheteur, ce sont les tokens qui sont facturés, et la forme de la différence est la même sur tout ensemble de tâches où le modèle doit produire une réponse longue.

L’offset partiel correspond à la ligne d’entrée mise en cache. La lecture du cache de GLM-5.3 est de 0,26 $ contre une base de 1,40 $, et celle de GPT-6.1 Sol est de 0,10 $ contre une base de 2,00 $ — Sol l’emporte d’un facteur 2,6 sur un tarif qui domine toute charge de travail avec un préfixe stable. Si votre trafic est un grand corpus fixe avec une réponse d’un paragraphe, GLM-5.3 est clairement l’option la moins chère et vous devriez la choisir. Si votre trafic ressemble au trafic pour lequel ces deux modèles ont été conçus — boucles d’agents, modifications à l’échelle d’un dépôt, longues sorties générées — l’avantage de l’entrée mise en cache se réduit à du bruit face à un ratio de 3× sur les tokens.

Où arrivent les numéros de fournisseur

Les chiffres de lancement de Z.ai sont solides et, comme toujours, non reproduits. Terminal-Bench 2.1 à 88,2, DeepSWE v1.1 à 66,9, CyberGym à 84,5, ExploitBench à 54,4, AutomationBench à 48,2, GDPval-AA v2 à 1 769 Elo. Le seul chiffre qui mérite d’être lu deux fois est Terminal-Bench 3.0 à 28,3 — le benchmark successeur, et la correction du 88,2 obtenu sur l’ancien. Un modèle peut être excellent sur le benchmark ciblé par son post-entraînement et ordinaire sur la génération suivante du même benchmark.

Les chiffres de lancement d'OpenAI pour GPT-6.1 Sol sont entièrement articulés autour du coût par tâche accomplie plutôt que du score brut : DeepSWE v1.1 dépasse le meilleur score de GPT-6 Sol de 6,4 points de pourcentage avec un effort de raisonnement moindre, AutomationBench 1.0.6 à 2,2 points au-dessus de Claude Opus 5.5 à effort moyen, OSWorld 2.0 en hausse de sept points sur GPT-6 Sol à effort maximal, Terminal-Bench Science 0.1 faisant plus que doubler GPT-6 Sol pour moins de la moitié du coût par tâche. À noter qu'il s'agit des résultats obtenus avec le harnais d'OpenAI, avec les paramètres d'OpenAI, sur l'ensemble de benchmarks sélectionné par OpenAI, et qu'aucun d'entre eux n'a été reproduit de manière indépendante.

Le chevauchement entre les ensembles publiés des deux fournisseurs est mince, et la seule comparaison directe disponible porte sur le même benchmark : Z.ai rapporte 66,9 sur DeepSWE v1.1, OpenAI rapporte 68,8 pour GPT-6 Sol — le modèle que 6.1 remplace — et une amélioration de 6,4 points pour 6.1 Sol par rapport à son propre prédécesseur. Deux points d'écart sur la comparaison rapportée par les fournisseurs, et environ six d'écart sur le delta propre d'OpenAI. Cela s'approche d'une comparaison contrôlée, et cela dit ce que dit le comité indépendant : quasi-parité sur les capacités, large écart sur le coût pour finir le travail.

Une API, ou deux contrats

Les deux modèles sont sur OrcaRouter, ce qui est la particularité de cette association. GPT-6.1 Sol est arrivé dans le catalogue au prix catalogue d'Open​AI lui-même le jour de sa sortie — 2,00 $ et 10,00 $ par million de jetons, entrée mise en cache à 0,10 $, avec le palier de 272 000 jetons à 4,00 $ et 15,00 $ répercuté exactement comme le fournisseur l'affiche — et GLM-5.3 se trouve à ses côtés à 1,26 $ et 3,96 $, avec une lecture de cache à 0,234 $. Rien n'est ajouté à l'un ou l'autre : la plateforme répercute sans modification le prix catalogue du fournisseur, ce qui explique pourquoi une baisse de prix d'un fournisseur apparaît de notre côté le jour même plutôt qu'après qu'un revendeur a renégocié.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

Cela compte davantage pour cette paire précise que pour la plupart. La décision entre les deux n’est pas « laquelle est meilleure » — c’est un seuil sur votre propre longueur de sortie, et il évoluera dès que Z.ai affinera sa grille tarifaire ou qu’Open​AI modifiera la limite du palier 6.1. Garder les deux derrière une seule clé, avec un basculement automatique de l’une à l’autre et une règle de routage que vous modifiez dans la configuration plutôt que dans un déploiement, c’est ce qui vous permet de tester ce seuil sur du trafic réel au lieu d’en débattre. Si la ligne de cache de Sol l’emporte sur votre charge de travail, routez vers celle-ci ; si vos longueurs de réponse restent courtes et que la grille forfaitaire de GLM-5.3, sans falaise de contexte, l’emporte sur ce segment, routez plutôt vers celle-là — la même clé, pas de second contrat, pas de seconde facture.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Lequel, si vous devez choisir aujourd'hui

• Sorties générées longues, boucles agentiques, travail gourmand en sorties — GPT-6.1 Sol, et la marge est proche du triple une fois les comptages de tokens appliqués. C'est ici que la grille tarifaire ment et que la mesure ne ment pas.
• Préfixe stable, réponse courte — GLM-5.3. Ses tarifs d'entrée en cache et d'entrée sont véritablement meilleurs et la verbosité n'a jamais l'occasion de mordre.
• Toute requête au-dessus de 272 000 tokens d'entrée — GLM-5.3, parce que GPT-6.1 Sol re-tarifie toute la requête à ce seuil et la grille de GLM-5.3 n'a pas de palier équivalent.
• Tout ce qui a une image ou un document comme entrée visuelle — GPT-6.1 Sol. GLM-5.3 est uniquement textuel et ce n'est pas serré.
• Inférence à l'intérieur de votre propre périmètre, ou une couverture contre le changement des conditions d'un fournisseur — GLM-5.3, et maintenant le téléchargement existe plutôt que d'être promis. Prévoyez le budget pour le matériel : le checkpoint est un gros artefact FP8 et l'auto-hébergement est une décision d'investissement, pas une décision d'API.
• Appels sensibles à la latence — ni l'un ni l'autre sans précautions. GLM-5.3 n'a aucun moyen de désactiver le raisonnement ; GPT-6.1 Sol a un plancher à faible, et son propre temps jusqu'au premier token sur le tableau indépendant mesurait 332 secondes contre une médiane du tableau de 3,7.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement