Carte héros d'article affichant « GLM 5.5 ou GLM 5.3-Vision ? » avec le sous-titre « Un modèle anonyme correspondant à l'empreinte de Z.ai vient de faire surface » et le badge « LEAK — non vérifié », sur un dégradé blanc et bleu doux avec un motif subtil de réseau neuronal et un élément point d'interrogation.
Guides & Insights

GLM 5.5 ou GLM 5.3-Vision ? Un modèle anonyme correspondant à l'empreinte de Z.ai vient de faire surface

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Un modèle non identifié dont le profil de service — vitesse, temps avant le premier token, taux de succès du cache — correspond à la pile G​LM de Z.ai commence à attirer l'attention des analystes de capacité, et l'hypothèse de travail est qu'il pourrait s'appeler GLM 5.3-Vision ou GLM 5.5. Le 20 août, l'analyste de calcul et de capacité teortaxesTex a publié qu'un modèle anonyme qu'il suit « n'est clairement pas Dee​pSeek, du moins », qu'« il n'y a rien qui exclue G​LM jusqu'à présent », et que « la vitesse, le ttft, le taux de succès du cache correspondent également à G​LM ». Sa lecture : s'attendre à ce qu'il soit appelé GLM 5.3-Vision ou 5.5, avec un score d'environ 61 à l'Artificial Analysis Intelligence Index — un point au-dessus de là où se situe le GLM-5.3 commercialisé aujourd'hui. Rien n'est confirmé ici. Il n'y a pas de fiche de modèle, pas d'annonce de Z.ai, pas d'API, et cette page traite cette observation pour ce qu'elle est : un signal de fuite précoce et non reproduit, qui vaut la peine d'être suivi précisément parce que GLM-5.5 est le fleuron attendu de Z.ai depuis tout le mois et qu'il n'est pas apparu. Cinq jours après ce message, un deuxième point de données, cette fois entièrement vérifiable, est arrivé : le 25 août, vLLM — le moteur d'inférence derrière la plupart des services de modèles à grande échelle — a ouvert une pull request « Do-Not-Merge » permettant le support du noyau masked-MHA pour les dimensions de tête de G​LM-5. Il ne nomme aucune variante et ne prouve aucun lancement ; c'est un travail de base de la pile de service, le genre d'activité en arrière-plan qu'un nouveau modèle laisse derrière lui.

Ce que le signal dit réellement

La source est un post X unique de teortaxesTex, daté du 20 août — le même compte dont le signal de timing « environ une semaine » sur le lancement de GLM-5.3 s'est vérifié au jour près en août. Le cadrage est explicite quant au niveau de preuve : « preuves solides (non répliquées) ». L'analyste exclut Dee​pSeek, ne trouve rien qui contredise G​LM, et cite trois mesures au niveau du serving — débit, temps jusqu'au premier token et taux de hit du cache — comme correspondant à la stack de Z.ai. Puis les deux noms candidats, et un score projeté : « Actuellement, je m'attends à ce qu'il s'appelle GLM 5.3-Vision ou 5.5, et qu'il obtienne environ 61 sur AA. »

Prenez chaque élément séparément. Les affirmations d'identité (pas Dee​pSeek, correspond à G​LM) relèvent d'une inférence par empreinte digitale à partir de la façon dont le modèle est servi, et non d'une carte de modèle. Le score est une attente, pas une mesure. Les noms sont des suppositions. Ce qui fait que le signal vaut plus que le bruit, c'est qu'il va dans le même sens que tout ce que nous savons par ailleurs de la feuille de route de Z.ai ce mois-ci : GLM-5.3 est sorti uniquement en texte, la demande la plus forte de la communauté était la vision, et GLM-5.5 a été annoncé par plusieurs médias (via JPMorgan, Reuters, CGTN et une note de Goldman du 18 août) comme devant arriver « avant la fin du mois d'août » — nous voici à la fin du mois.

Pourquoi l'empreinte de service est importante

Le temps jusqu'au premier jeton et le taux de succès du cache sont des signatures au niveau de l'infrastructure. Ils sont déterminés par la manière dont un fournisseur construit sa pile d'inférence — l'ordonnanceur, la disposition du cache, la politique de regroupement par lots — et non par le nom du modèle qu'une requête appelle. Lorsqu'un analyste affirme que le TTFT et le taux de succès du cache d'un modèle anonyme correspondent à ceux de G​LM, il signifie que la pile de service sous-jacente se comporte comme celle de Z.ai, ce qui est ce qui se rapproche le plus d'une empreinte digitale sans avoir accès aux poids ou à une fiche de modèle. Ce n'est pas une preuve. Un autre fournisseur pourrait reproduire la même pile, ou Z.ai pourrait servir un modèle pour un partenaire. Mais c'est une affirmation spécifique et vérifiable, et la réserve « n'a pas été reproduit » vous indique que l'analyste ne la présente pas comme une conclusion définitive.

L'exclusion de Dee​pSeek compte aussi. DeepSeek V4 Pro est passé en disponibilité générale le 13 août et sa version Flash a été l'autre version chinoise open-weight à haute vélocité de ce mois-ci. Un modèle anonyme qui exclut Dee​pSeek mais pointe vers G​LM réduit le champ à la pipeline de Z.ai — et la pipeline de Z.ai a deux occupants plausibles, ce qui est exactement la fourche que le signal désigne.

Un second signal : la pile de service se construit pour l'attention GLM-5

Le 25 août, un deuxième point de données est tombé — celui-ci entièrement vérifiable. vLLM, le runtime d'inférence derrière la plupart des services de modèles à grande échelle, a reçu la pull request #53785, intitulée « [Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions. » Vérifiée contre le dépôt, elle active le chemin de préremplissage MHA masqué pour la géométrie d'attention G​LM-5 : 64 têtes, un rang KV de 512, une dimension de tête QK de 192+64, et une dimension de tête V de 256 — une disposition QK/V 256/256, selon la description de la PR. Elle dépend d'un changement de FlashAttention pour la prise en charge du masque en dimension de tête 256, épingle temporairement FlashAttention à un commit de fork (c'est à cela que sert le marqueur Do Not Merge), et ajoute des seuils de routage évalués pour le nouveau chemin : limites de préremplissage pur FlashMLA de 8K / 20K / 48K / 112K jetons à TP 1/2/4/8, et une limite arrondie de 64K pour FlashInfer à TP8. L'auteur note qu'aucune autre pull request ouverte ne couvrait la prise en charge du MHA masqué de G​LM-5.

Considérez-le pour ce que c'est : les fondations de la pile de serving, pas une annonce. Le PR ne nomme ni GLM 5.5 ni GLM 5.3-Vision — il dit « GLM-5 » — et activer un chemin de prefill MHA masqué pour les dimensions de têtes de G​LM-5 est un travail d'infrastructure sur une famille que l'écosystème vLLM fait déjà tourner via le chemin sparse-MLA (la propre lignée de GLM-5.3 y est servie aujourd'hui). Ce n'est pas non plus isolé : les PR connexes de ce mois-ci ont couvert les vérifications de dimensions MLA de FlashInfer pour GLM-5, un repli sparse-MLA Triton pour les modèles de la classe GLM-5, et le support de dimensions rapporté par FlashAttention. Deux détails le maintiennent sur le radar d'un traqueur de fuites. Premièrement, la géométrie qu'il cible — 64 têtes, rang KV 512, QK/V 256/256 — est distincte du 192/128 de Dee​pSeek, soit la même séparation « pas Dee​pSeek, correspond à G​LM » que dessine l'empreinte du modèle anonyme, désormais visible au niveau du noyau d'attention. Deuxièmement, le calendrier : le PR a été ouvert le 25 août, dans la même fenêtre d'août dans laquelle GLM-5.5 est attendu tout au long du mois. Rien de tout cela ne prouve que le modèle anonyme est un G​LM de prochaine génération — cela pourrait tout aussi bien être de l'ingénierie sur le modèle déjà publié — mais c'est le genre d'activité en arrière-plan que l'écosystème de serving fait en amont d'un modèle, et c'est vérifiable d'une manière qu'aucun post X ne l'est.

Deux noms, un seul fork : GLM 5.3-Vision vs GLM 5.5

Les deux identités candidates sont des produits véritablement différents, et la fuite ne permet pas de déterminer laquelle se trouve sur la carte.

• GLM 5.3-Vision serait une variante dotée de capacités visuelles du modèle sorti le 14 août. GLM-5.3 est exclusivement textuel — Artificial Analysis le répertorie comme texte entrant, texte sortant, sans support d'image — et cette lacune est la plainte la plus forte de la communauté. Lorsque Tang Jie de Z.ai a mené une campagne mondiale de retours, les commentaires étaient essentiellement unanimes en faveur de la vision, et Z.ai dispose déjà des éléments de base (le modèle multimodal GLM-5V-Turbo et l'encodeur CogVLM) qu'il n'a pas encore intégrés à la gamme phare. Une variante 5.3-Vision serait le moyen le plus rapide de combler cette lacune.

• GLM 5.5 est le vaisseau amiral lui-même. Les spécifications rapportées mais non confirmées indiquent une base de plus de mille milliards de paramètres (contre 743B pour GLM-5.3), un contexte de 1M de tokens conservé, des poids ouverts et un accent plus marqué sur les agents et le codage. Toutes les notes d'analystes de ce mois-ci considèrent la 5.5 comme la grande sortie — le véhicule qui, comme l'a laissé entendre le cofondateur de Z.ai, Tang Jie, comblera l'écart avec les modèles fermés de classe Fable. Elle est attendue au cours du mois d'août et n'a pas encore été livrée au moment où nous écrivons ces lignes.

La même empreinte ne peut pas vous dire lequel des deux c'est — un 5.3 optimisé pour la vision et un flagship récent pourraient tous deux reposer sur la même pile de service. Cette ambiguïté est l'état honnête du signal, et les deux noms dans le post de l'analyste la reflètent plutôt que de la résoudre.

`img src="2.png" alt="Un tableau comparatif à deux colonnes intitulé 'GLM 5.5 vs GLM-5.3 — le tableau de score'. Colonne de gauche : GLM 5.5 (divulgué) : 'AA Index ~61 (projeté, non vérifié)', 'Statut : non publié', 'Taille : >1T paramètres (selon les rumeurs)', 'Vision : attendue', 'Contexte : 1M (attendu)', 'Prix : à déterminer'. Colonne de droite : GLM-5.3 (publié) : 'AA Index 60', 'Statut : API en ligne le 19 août', 'Taille : 743B MoE / 40B actifs', 'Vision : texte uniquement', 'Contexte : 1M', 'Prix : 1,40 $ / 4,40 $'. Le pied de page indique 'Les chiffres de GLM 5.5 sont des projections non vérifiées ; GLM-5.3 selon Artificial Analysis.'" />`

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

Ce que signifierait un ~61 sur l'indice d'intelligence AA

Le score projeté est l'élément le plus tranchant de la fuite. L'Artificial Analysis Intelligence Index (v4.1.1) place actuellement GLM-5.3 à 60 — à égalité avec Kimi K3 pour le meilleur score open-weights, et 7 points d'avance sur les 53 de GLM-5.2. Un point au-dessus, à 61, ce serait le territoire de GPT-5.6 Sol, avec Claude Fable 5 à 62 et Claude Opus 5 à 63. En clair : un modèle de la famille G​LM à 61 serait le score open-weights le plus élevé de l'indice, seul au-dessus de Kimi K3 et GLM-5.3, et en pratique à la limite des modèles fermés de pointe.

Il vaut la peine de souligner ce que 61 n'est pas. C'est l'attente de teortaxesTex quant à ce qu'une évaluation indépendante renverra, pas un score publié par Artificial Analysis et pas un chiffre de fournisseur. Une projection peut se tromper dans les deux sens — une variante vision pourrait perdre un point ou deux sur l'indice fortement textuel, et un flagship >1T pourrait atterrir plus haut ou plus bas selon la façon dont son post-entraînement se comporte. La valeur du nombre réside dans la revendication qu'il encode : quel que soit ce modèle anonyme, il est censé battre l'actuel leader des poids ouverts plutôt que de simplement l'égaler.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

Ce qui est confirmé, et ce qui ne l'est pas

Gardez le registre propre, car un article sur une fuite se joue entièrement là-dessus.

• Confirmé : GLM-5.3 est réel, sorti le 14 août, API en ligne les 18/19 août, score de 60 à l'indice d'intelligence AA (mesuré indépendamment par Artificial Analysis), tarif de 1,40 $ / 4,40 $ par million de jetons, entrée texte uniquement, avec des poids ouverts confirmés pour le vendredi 28 août. Ces faits ne dépendent pas de la fuite.

Confirmé : GLM-5.5 n'est toujours pas publié. Au moment où j'écris ces lignes, il n'y a ni fiche modèle, ni tarification, ni disponibilité ; la fenêtre d'août et le chiffre de plus de 1 000 milliards de paramètres (>1T) sont rapportés par des analystes, et non des engagements de Z.ai.

• Non confirmé : l'existence du modèle anonyme en tant que produit distinct, son identification en tant que G​LM, son nom de GLM 5.3-Vision ou 5.5, et son score de 61. Les quatre points reposent sur un seul post non répliqué d'un analyste.

• Non confirmé également : savoir si ce modèle anonyme est même distinct de GLM-5.3 lui-même. Un point d’accès GLM-5.3 en direct sous un alias non étiqueté produirait la même empreinte de service. Tant qu’un nom, une fiche modèle ou une publication des poids ne tranche pas la question, l’interprétation « nouveau modèle » reste l’hypothèse a priori la plus forte, mais pas un fait.

Que regarder ensuite

• Vendredi 28 août — les poids de GLM-5.3. Si le modèle anonyme est en réalité un 5.3 renommé ou un 5.3-Vision, la publication des poids et la carte du modèle le détermineront rapidement.

• Une seconde observation corroborante. L'empreinte d'un analyste est une hypothèse ; une seconde lecture indépendante de la même entrée anonyme, ou une liste d'Artificial Analysis qui la nomme, la transforme en preuve.

• Toute déclaration de Z.ai. GLM-5.5 a été annoncé pour la fenêtre d'août, et le mois est presque terminé. Un nom officiel, une page de tarification ou une entrée du journal des modifications de l'API est l'événement qui transforme cette fuite en une histoire de lancement.

• Que le score AA se concrétise à 61. Si le modèle anonyme est réel et appartient à la famille G​LM, un score d’indice indépendant proche de 61 serait le premier nombre open-weights à franchir 60.

Que le travail d’attention de vLLM reçoive ou non un nom de modèle. La PR #53785 cible les dimensions de tête « GLM-5 » sans nommer 5.3-Vision ni 5.5 ; un merge, une entrée dans les modèles pris en charge ou une fiche de modèle associant cette géométrie à un nom spécifique serait le signal le plus fort à ce jour.

Comment agir face à une fuite comme celle-ci

Une fuite est une raison de se préparer, pas de changer de plateforme. Si le prochain modèle de la famille G​LM se place en tête ou quasi en tête du classement des modèles à poids ouverts, la question pratique est de savoir s'il faut lui acheminer du trafic réel — et un modèle non éprouvé, appuyé sur les affirmations du fournisseur et la projection d'un seul analyste, est exactement le cas où l'on veut un filet de sécurité plutôt qu'un pari. Le GLM-5.3 sorti la semaine dernière est déjà en service sur OrcaRouter — la page du modèle l'affiche à 1,26 $ / 3,96 $ par million de jetons, soit une remise de lancement de 10 % sur le prix catalogue du fournisseur de 1,40 $ / 4,40 $, répercutée sans aucune marge — et la configuration d'acheminement est celle qu'un 5.5 ou un 5.3-Vision héritera le jour de sa sortie. Dirigez une partie du trafic vers le nouveau modèle via le routeur avec bascule automatique vers un modèle éprouvé — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — et vous obtenez un signal de qualité sur votre propre charge de travail au lieu d'un diaporama. Si la projection de la fuite est juste, vous l'apprenez en premier ; si elle est fausse, la bascule l'absorbe et rien ne sort cassé. Même clé, pas de second contrat, et pas besoin de choisir entre les deux noms candidats jusqu'à ce que Z.ai le fasse.

Le prochain G​LM arrive — la seule question ouverte est le nom qu’il portera. GLM 5.3-Vision serait Z.ai comblant la lacune la plus reprochée sur le modèle qu’il vient de livrer ; GLM 5.5 serait le fleuron à mille milliards de paramètres vers lequel tout le mois pointe. L’entrée anonyme teortaxesTex, dont l’empreinte a été relevée le 20 août, est le premier objet concret qui ressemble à l’un ou l’autre, et ses 61 points projetés sur l’AA Intelligence Index le placeraient devant tous les modèles à poids ouverts actuellement au classement. Cinq jours après l’empreinte, la pile de service a aussi bougé : le travail sur l’attention G​LM-5 de vLLM est exactement le genre de fondations qu’un nouveau modèle laisse derrière lui, même s’il ne nomme aucune variante. Rien de tout cela n’est confirmé, et cette page sera mise à jour dès que le nom, la fiche ou les poids le résoudront. D’ici là, la démarche à faible risque est d’avoir le routage prêt — pas de parier la pile sur une empreinte.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement