Une carte de titre hero pour Ox Alpha, le modèle frontalier anonyme, montrant une puce de modèle en forme de point d’interrogation avec des entrées de texte, d’image et de vidéo affluant et des blocs de jetons sortant, avec trois pastilles indiquant « Contexte de 1M jetons », « Gratuit pendant une semaine » et « Créateur inconnu », et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

Ox Alpha dévoilé : Z.AI le publie en open-weight sous le nom de GLM-5.3-Flash

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le soir du mercredi 26 août, le mystère s'est terminé comme l'avaient prédit les analyses forensiques. Z.AI — le laboratoire de Pékin à l'origine de la série GLM — a publié le modèle qu'il testait sous un masque en tant que produit open-weight, sous le nom GLM-5.3-Flash, exactement le sous-nom sur lequel les analyses forensiques du tokenizer et les marchés de prédiction avaient convergé. Ox Alpha, le modèle anonyme qui domine les classements d'utilisation depuis son apparition le 20 août, est désormais un modèle publié et auto-hébergeable : licence MIT, 320 milliards de paramètres au total avec 18 milliards actifs par token, la fenêtre de contexte de 1 048 576 tokens et l'entrée texte/image/vidéo qu'il annonçait sur la fiche, et les poids sur Hugging Face. La révélation a aussi résolu la plus grande énigme de la semaine anonyme — comment un modèle sans propriétaire pouvait traiter 100 000 milliards de tokens par jour : Z.AI déclare que le service tournait entièrement sur environ 100 000 puces d'IA chinoises, la première fois que des puces chinoises supportaient un trafic mondial de niveau frontière. Cette capacité avait aussi engendré l'hypothèse erronée la plus populaire de la semaine — à cette échelle, de nombreux observateurs, encouragés par des messages cryptiques de chercheurs de Google DeepMind, affirmaient qu'Ox Alpha devait être Gemini fonctionnant sur du matériel NVIDIA ; la révélation a corrigé cela aussi. Le même soir, Alibaba a publié Qwen3.8-Flash-Next, un aperçu open-weight de son architecture Qwen4 — en une seule soirée, deux versions open-weight de niveau frontière de laboratoires chinois. Les quatre versions anonymes précédant Ox Alpha ont toutes finalement été revendiquées par des laboratoires chinois : Zhipu AI avec GLM-5, Xiaomi avec MiMo-V2-Pro, Ant Group avec Lingxi Ling-2.6-flash, et Meituan avec LongCat-2.0. Ox Alpha n'est plus une expérience exclusive à une plateforme ; c'est un modèle que les développeurs peuvent auto-héberger.

Chaque chiffre de cet article provient des déclarations de l'opérateur lui-même, des données de la fiche de la plateforme, d'une annonce publique ou de l'empreinte communautaire. Les chiffres DeepSWE sont les mesures communautaires du chercheur indépendant Ben Davis — une exécution complète de 113 tâches, et non une entrée officielle au classement, même si le chiffre d'environ 63 % concorde désormais étroitement avec le score DeepSWE v1.1 de 63,4 rapporté par le fournisseur Z.AI. La question de l'identité est tranchée : le 26 août, Z.AI a publié Ox Alpha en tant que modèle à poids ouverts sous le nom GLM-5.3-Flash — licence MIT, 320 milliards de paramètres au total dont 18 milliards actifs — confirmant le sous-nom vers lequel convergeaient les analyses forensiques du tokeniseur et de l'encodeur vidéo. L'architecture, le nombre de paramètres et la tarification sont désormais publiés par l'entreprise ; ce qui reste déclaré par le fournisseur plutôt que vérifié de manière indépendante, c'est la suite de benchmarks et l'affirmation de Z.AI selon laquelle l'inférence de la semaine anonyme a tourné sur environ 100 000 puces IA chinoises domestiques, avec un coût par jeton comparable au matériel NVIDIA standard — une affirmation d'entreprise que de nombreux médias ont depuis reprise, et non un chiffre audité. L'hypothèse Gemini de la première heure — que la capacité de 100 000 milliards de jetons par jour avait fait naître et que des publications cryptiques de chercheurs de Google DeepMind avaient encouragée — était erronée, et la sortie l'a tranchée. La note de qualité attribuée à l'analyste teortaxesTex — et sa suggestion qu'un Ox Alpha davantage entraîné pourrait être le cheval de trait d'un GLM 5.5 plus puissant — est l'évaluation personnelle de cet analyste issue d'un post sur les réseaux sociaux, et non une mesure indépendante ni une déclaration de Zhipu. La démo d'animation en boucle décrite ci-dessous est également un rapport communautaire — un post de développeur sur X, repris sur les forums de développeurs chinois — et non une revendication de capacité du fournisseur ; l'opérateur n'a annoncé aucune fonctionnalité de ce type.

Ce que nous savons — et ce que nous ne savons pas.

La version rapide :

L'opérateur décrit Ox Alpha comme « un modèle de pointe conçu pour un codage efficace, un travail agentique soutenu et une utilisation en production réelle » — un modèle de raisonnement destiné à l'ingénierie logicielle à long horizon et aux flux de travail qui combinent texte et contexte visuel.

• Il dispose d'une fenêtre contextuelle de 1 048 576 jetons (1M), d'une limite de sortie de 131 072 jetons, et accepte les entrées texte, image et vidéo — la première des versions anonymes à annoncer la prise en charge vidéo, et une capacité que la version GLM-5.3-Flash confirme comme native plutôt qu'ajoutée après coup.

C'était gratuit pendant une semaine : 0 $ par million de jetons en entrée et en sortie, l'opérateur affirmant « des limites de débit généreuses, une utilisation quasi illimitée » et 100 000 milliards de jetons par jour de capacité de service — une capacité que la révélation préciserait plus tard comme étant provisionnée sur environ 100 000 puces chinoises domestiques.

• Confirmé : le 26 août, Z.AI a publié Ox Alpha comme modèle à poids ouverts sous le nom GLM-5.3-Flash — licence MIT, 320B de paramètres au total avec 18B actifs — le sous-nom exact sur lequel avaient convergé le tokenizer, l'encodeur vidéo, la forensique des codes d'erreur et les marchés prédictifs. L'analyste indépendant teortaxesTex l'évalue à peu près au niveau de GLM-5.3, mis à part la vision, et suggère qu'un Ox Alpha davantage entraîné pourrait être le cheval de bataille derrière un GLM 5.5 bien plus puissant.

• La lecture flash-multimodale a désormais une démo à son actif : invité à générer une animation en boucle d'un pélican à vélo qui ouvre un téléphone jouant la même animation, Ox Alpha a répondu avec une animation en boucle autonome dans un seul fichier HTML/SVG — une démo communautaire, pas une allégation du fournisseur.

• Les premières données d'activité sur la plateforme montrent déjà un trafic de production réel, notamment un agent de codage de Nous Research et l'éditeur Zed.

• L'entreprise l'a maintenant livré — le 26 août, Z.AI a publié Ox Alpha sous le nom de GLM-5.3-Flash à poids ouverts sous licence MIT, mettant fin d'un coup aux questions d'identité, de spécifications et de prix : 320 milliards de paramètres au total avec 18 milliards actifs, nativement multimodal, avec un prix catalogue Z.AI de 0,15 $ en entrée / 0,50 $ en sortie par million de tokens et une promo de lancement de 50 % annoncée comme ne durant que jusqu'au 9 septembre — une date désormais dépassée de huit jours, le tarif réduit étant toujours celui appliqué. Z.AI a également révélé que le service anonyme de la semaine à 100T de tokens par jour tournait sur environ 100 000 puces chinoises domestiques, une première à cette échelle. Ce que la révélation n'incluait pas, c'est un benchmark indépendant — la fiche de scores du modèle est déclarée par le fournisseur — donc le nombre indépendant le plus représentatif reste l'exécution complète des 113 tâches DeepSWE de Ben Davis à environ 63 %, au même niveau que GPT-5.6 Sol mid.

Ce qu'est Ox Alpha

La description de la plateforme présente Ox Alpha comme « un modèle de raisonnement conçu pour le codage, le travail agentique soutenu et les charges de travail de production — ingénierie logicielle à long horizon, raisonnement complexe et flux de travail combinant texte et contexte visuel ». C'est un positionnement spécifique : il est conçu pour les boucles d'agents de longue durée et pour le code, et non pour la conversation générale. Le contexte de 1M est l'indice révélateur — c'est suffisamment d'espace pour une session d'agent de plusieurs heures ou un grand dépôt — et la limite de sortie de 131K permet de longues générations en une seule fois. Il prend en charge l'appel d'outils et de fonctions ainsi que la sortie JSON structurée, ce qui constitue le reste de la checklist agentique.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

L'entrée vidéo est l'élément le plus distinctif de la fiche technique. Aucun des modèles anonymes précédents ne la mettait en avant, et un modèle capable d'accepter des trames vidéo en plus du texte et des images vise une classe de charge de travail différente de celle des versions optimisées pour le chat qui l'ont précédé. C'est également, comme l'analyse forensique le montrerait plus tard, l'un des indicateurs d'identité les plus forts qu'un modèle puisse porter. Tout cela — la description, les spécifications, les chiffres de vitesse — provenait de l'opérateur et de la fiche de la plateforme. La sortie de GLM-5.3-Flash a confirmé les spécifications principales (320B-A18B, multimodal natif) ; les chiffres de vitesse et de capacité restent des affirmations du fournisseur.

L'histoire multimodale a gagné une démo concrète cette semaine. Le développeur Chetaslua — dont les sondes côté serveur font partie de la piste d'empreinte numérique — a publié un test dans lequel il a demandé à Ox Alpha de créer une boucle d'un pélican faisant du vélo et ouvrant un téléphone qui rejoue la même animation : une boucle autoréférentielle dans la boucle. Son rapport montre le modèle produisant une animation HTML/SVG en un seul fichier — un pélican avec des pattes à deux segments qui pédalent réellement, une vitesse de roue synchronisée avec la vitesse au sol, un arrière-plan en parallaxe, et l'aboutissement du téléphone dans la boucle. Des forums de développeurs chinois ont exécuté séparément leurs propres invites pélican-vélo et discuté du résultat, la démo n'est donc pas une seule affirmation invérifiable. Comme la sortie est du code, elle est conforme à la spécification texte uniquement de la plateforme : compréhension multimodale et génération créative de code fonctionnant ensemble, et non synthèse vidéo native. La conclusion de Chetaslua — que c'est là le bénéfice de la multimodalité et qu'un modèle open-source capable arrivera avec elle — est sa propre prévision, pas une déclaration du fournisseur ; l'opérateur n'a rien annoncé.

L'offre gratuite pendant une semaine

La promotion était agressive. Gratuite pendant la semaine où elle a été proposée, « des limites de débit généreuses, une utilisation quasi illimitée » et une capacité annoncée de 100 000 milliards de tokens par jour, avec la note de l'opérateur invitant les utilisateurs à « voir ce que vous pouvez faire ». Au pied de la lettre, 100 T de tokens par jour placeraient cet opérateur parmi les plus grands fournisseurs d'inférence au monde — la revendication ressemble moins à une spécification qu'à un défi de stress-test, ce qui correspond au schéma habituel : les sorties anonymes sont la manière dont un laboratoire obtient un trafic réel à l'échelle frontière sans mettre son nom sur la porte. La lecture ainsi confirmée a rendu la revendication d'échelle concrète plutôt que simplement plus facile à faire cadrer : Z.AI a révélé que le service de 100 T de tokens par jour fonctionnait sur environ 100 000 puces d'IA chinoises domestiques — la première fois qu'une sortie de classe frontière est servie à cette échelle sans matériel NVIDIA. Cette divulgation reste une affirmation de l'entreprise, désormais reprise par plusieurs médias mais non vérifiée de manière indépendante, et elle comporte une seconde affirmation du fournisseur, plus nuancée : Z.AI déclare que le coût par token sur le cluster domestique est comparable à celui des GPU NVIDIA grand public.

L'autre face du « gratuit pendant une semaine » était que le prix qui suivait était inconnu — la révélation y a répondu. Le prix catalogue publié par Z.AI pour GLM-5.3-Flash est de 0,15 $ par million de tokens d'entrée, 0,50 $ par million de tokens de sortie et 0,03 $ par million d'entrées mises en cache. Une promotion de lancement de 50 % était annoncée comme devant durer jusqu'au 9 septembre 2026, ramenant ces tarifs à 0,075 $ / 0,25 $. Huit jours après cette date, le tarif réduit est toujours celui appliqué : relue le 17 septembre 2026, la page du modèle z-ai/glm-5.3-flash affiche l'entrée à 0,075 $, la sortie à 0,25 $ et les lectures de cache à 0,0173 $ par million de tokens, sans aucune mention promotionnelle. Face au tarif catalogue de GLM-5.3 de 1,40 $ / 4,40 $, cela représente environ un vingtième. La conséquence pratique est que la date de fin du 9 septembre est périmée plutôt que contraignante — un développeur qui budgète sur 0,15 $ / 0,50 $ budgète sur un montant que personne ne paie actuellement. Ce que les pages de tarification ne tranchent pas, c'est le pourquoi. La liste de modèles de Z.AI elle-même affiche toujours 0,15 $ / 0,50 $ pour GLM-5.3-Flash, de sorte que savoir si la promo a été prolongée, rendue permanente ou simplement laissée en cours ne peut être étayé par nos sources ; le tarif réduit est le fait observé à cette date, et la cause reste ouverte.

Le premier benchmark complet — et il se place à parité avec GPT-5.6 Sol mid

Ox Alpha n'a toujours aucune entrée sur les trackers indépendants tels que Artificial Analysis ou LMArena — le mot « frontier » est celui de l'opérateur lui-même, et les chiffres de benchmark que Z.AI a publiés avec la sortie de GLM-5.3-Flash (DeepSWE v1.1 : 63,4, AutomationBench : 48,8, un Artificial Analysis Intelligence Index de 57) sont rapportés par le fournisseur, et non des scores indépendants. Ce qui a changé depuis le lancement, c'est que des chiffres mesurés par la communauté commencent à circuler — et le tableau s'est resserré. Sur Kingbench, les premières exécutions placent Ox Alpha à 87,5, juste en dessous des 91,25 de GLM-5.3. Sur DeepSWE, le chercheur indépendant Ben Davis a d'abord exécuté un sous-ensemble de 10 tâches et rapporté un Pass@1 de 80 %, devant Claude Fable 5 (65 %), GLM-5.3 et Grok 4.6 (62 %), et GPT-5.6 Sol (52 %). Il a depuis effectué une exécution complète sur l'ensemble des 113 tâches de DeepSWE, et le résultat corrigé est d'environ 63 % — plus ou moins au niveau de GPT-5.6 Sol mid. Le sous-ensemble à 80 % était le chiffre qui attirait l'œil, mais dix tâches représentent moins de 9 % du benchmark ; Davis lui-même a signalé que le chiffre de l'exécution complète est celui qui « a beaucoup plus de sens ». Ce sont des chiffres mesurés par la communauté — ni un benchmark du fournisseur, ni un score officiel de leaderboard — mais l'exécution complète est le chiffre le plus représentatif que quiconque ait obtenu du modèle, et il correspond désormais étroitement au score DeepSWE v1.1 de 63,4 rapporté par Z.AI — un recoupement utile, même si le chiffre de l'entreprise est une affirmation plutôt qu'une mesure.

Une comparaison compte plus maintenant qu’au lancement. DeepSeek V4 Pro 0813 — la version GA du produit phare de DeepSeek, sortie le 13 août — affiche un DeepSWE de 62,7 sur la propre fiche de référence de DeepSeek, contre 12,8 pour l’aperçu antérieur DeepSeek V4 Pro Preview. Les deux chiffres sont annoncés par le fournisseur, non reproduits par un laboratoire indépendant à l’heure où nous écrivons. Lus aux côtés du passage communautaire sur l’ensemble complet de GLM-5.3-Flash à ~63 % et du DeepSWE v1.1 de 63,4 de Z.AI, les 62,7 de DeepSeek placent les deux revendications chinoises les plus connues en matière d’agents de codage dans la même fourchette basse des années 60. L’écart de dix points qui semblait être la carte de visite d’Ox Alpha a été mesuré contre DeepSeek V4 Flash 0731, le petit modèle moins cher ; contre le produit phare de DeepSeek, GLM-5.3-Flash se place à égalité, pas à dix points d’avance.

L'autre leçon concerne le nombre lui-même. L'analyste teortaxesTex — qui suit ces estimations depuis la semaine anonyme — note que le premier rapport sur Ox Alpha donnait aussi 80 % DeepSWE : il s'agissait du sous-ensemble de 10 tâches très visible de Davis, et le résultat final sur l'ensemble complet de 113 tâches était de 63 %. Avec le 62,7 officiel de DeepSeek V4 Pro 0813 dans la même fourchette, son constat est que rien ne s'est encore approché d'un 80 % légitimement reproduit — le chiffre de 80 % ne cesse d'apparaître tôt dans la vie publique d'un modèle, puis de se stabiliser autour de 60 % une fois l'ensemble complet exécuté. C'est sa lecture d'analyste, pas une mesure, mais c'est la bonne grille de lecture pour le prochain titre DeepSWE, y compris celui concernant GLM-5.3-Flash lui-même.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

Ce qui existe aussi, c'est l'usage. Les données d'activité de la plateforme montrent un trafic de production réel dès les premières heures — notamment Hermes Agent, le projet de codage agentique de Nous Research, et l'éditeur Zed. Les deux correspondent exactement aux cas d'utilisation « travail agentique soutenu et codage » pour lesquels le modèle est positionné. Ce n'est pas un score, mais c'est un signal : des développeurs avec de vraies charges de travail ont décidé qu'un pari gratuit, de classe frontière et anonyme valait la peine d'être branché. Avant que le run DeepSWE complet n'arrive, cette adoption précoce était la seule preuve disponible ; le chiffre d'environ 63 % sur l'ensemble complet donne désormais au modèle un point de repère pour la comparer.

Les petits caractères de la conservation des données

L'annonce de la semaine gratuite vante « zéro conservation des données ». La fiche du modèle sur la plateforme raconte une histoire plus nuancée : les invites et les réponses sont conservées par le fournisseur mais ne sont pas utilisées pour l'entraînement, selon les conditions du modèle furtif de la plateforme. La différence est importante si vous êtes sur le point de coller du code propriétaire dans une fenêtre de 1 million de jetons appartenant à un fournisseur qui est resté anonyme jusqu'à ce que Z.AI se manifeste le 26 août. Traitez « zéro conservation des données » comme du marketing jusqu'à ce que Z.AI publie des conditions qui le disent explicitement — et faites transiter tout ce que vous ne voudriez pas voir consigné par un modèle distinct et identifiable.

Le playbook du modèle anonyme

Ox Alpha est la cinquième sortie anonyme en six mois, et les quatre précédentes se sont résolues de la même manière — des débuts anonymes, une explosion de trafic gratuit, puis une entreprise qui se manifeste :

• Pony Alpha (février 2026) — confirmé par Zhipu AI environ cinq jours après le lancement comme GLM-5, son modèle phare MoE de 744B paramètres.

• Hunter Alpha (11 mars) — un modèle gratuit à mille milliards de paramètres avec un contexte de 1M qui est devenu le sujet de spéculation du printemps, largement soupçonné d'être Deep​Seek V4 ; révélé comme étant le MiMo-V2-Pro de Xiaomi, avec le compagnon Healer Alpha identifié comme MiMo-V2-Omni.

• Elephant Alpha (avril) — un modèle de texte gratuit, axé sur l'efficacité, qu'Ant Group a revendiqué comme étant Lingxi Ling-2.6-flash environ deux semaines après son apparition.

• Owl Alpha (fin avril) — un modèle orienté agent avec appel d'outils natif et un contexte d'environ 1M que Meituan a confirmé comme étant LongCat-2.0 le 30 juin, le premier modèle à mille milliards de paramètres entièrement entraîné et servi sur des puces chinoises domestiques.

• Ox Alpha (20 août) — révélé le 26 août comme GLM-5.3-Flash, un modèle open-weight sous licence MIT de 320B-A18B ; l’identité, la licence et les spécifications étaient toutes officielles le jour même où le masque est tombé.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

Pourquoi lancer un bon modèle derrière un masque ? La lecture standard, que le cycle Hunter Alpha a rendue concrète, est que l'anonymat élimine le biais de marque dans les évaluations, et que l'utilisation gratuite permet de crowdsourcer des données d'évaluation réelles à l'échelle des modèles de pointe, pendant que tout le monde débat du propriétaire. Comme le dit une analyse de ce schéma : « l'absence de marque est le marketing. » L'avantage supplémentaire, c'est la rapidité : un modèle anonyme peut atteindre un public mondial de développeurs en quelques heures, sans événement de lancement, et le mystère lui-même devient la distribution.

Qui est Ox Alpha ?

Jusqu'à la sortie du 26 août, aucune entreprise ne l'avait revendiqué et Zhipu AI n'avait rien dit — mais la situation des preuves concrètes a changé dans les 48 heures suivant les débuts du modèle, et c'est pourquoi les analyses forensiques ci-dessous expliquent que la révélation — sous le nom de GLM-5.3-Flash — ait été accueillie avec si peu de surprise. Le chiffre de capacité a d'abord joué contre l'expertise : 100 000 milliards de jetons par jour ressemblait à la signature d'un laboratoire de premier plan sur silicium NVIDIA, et la théorie selon laquelle Ox Alpha était un nouveau Gemini — encouragée par des publications sibyllines de chercheurs de Google DeepMind — avait un réel élan jusqu'à ce que la preuve par le tokeniseur, puis la sortie de Z.AI elle-même, la closent. Le signal le plus fort est le tokeniseur. Un outil de prise d'empreinte conçu par la communauté, modelprint, a exécuté neuf sondes d'infrastructure contre Ox Alpha et a constaté qu'Ox Alpha correspondait à GLM-5.3 de Z.ai sur six, les quatre comptes de tokeniseur normalisés correspondant à la famille GLM, tandis que le meilleur candidat non-GLM n'en obtenait que deux sur quatre. Le chercheur indépendant Ben Davis a rapporté que les comptes de jetons d'Ox Alpha correspondaient exactement à ceux de GLM-5.3 sur 25 invites de test, avec seulement une différence constante de +75 jetons qu'il a attribuée à un wrapper caché. La correspondance du tokeniseur est le signal d'identité le plus difficile à falsifier — un modèle ne peut pas changer sa façon de segmenter le texte sans être réentraîné.

La voie vidéo est la deuxième signature. La consommation de jetons vidéo d'Ox Alpha correspondait exactement à celle de GLM-5V-Turbo sur quatre échantillons contrôlés — les mêmes mécanismes d'échantillonnage d'images, de mise à l'échelle de la durée et de résolution — tandis que MiMo v2.5, Qwen 3.8 Max et GLM-4.6V divergeaient tous. C'est un indice fort : le traitement vidéo est profondément ancré dans le modèle, pas une simple greffe. Le reste de la pile d'empreintes va dans le même sens : Ox Alpha rejette l'entrée audio comme GLM-5V, partage le code d'erreur caractéristique « 1301 » de GLM, produit un style de sortie similaire (environ 1,3 émoji pour 1 000 caractères), présente la même configuration restreinte de paramètres et d'API que celle apparue sur la fiche GLM-5.3 de la plateforme deux jours avant le lancement d'Ox Alpha, et a une limite de connaissances proche de novembre 2025.

Cette identification a un précédent dans le propre répertoire de Zhipu : Pony Alpha, la sortie anonyme de février, s'est révélée être GLM-5, revendiquée environ cinq jours après le lancement. L'interprétation qui circulait cette semaine parmi les analystes — selon laquelle Ox Alpha serait GLM-5.3, vraisemblablement le modèle Flash — a été reprise par Pliny the Liberator, qui a déclaré que son agent avait confirmé « Ox-alpha est de Zai, famille GLM-5.X ». L'analyste indépendant teortaxesTex fait la même évaluation sur la qualité et ajoute une affirmation sur le calendrier : il situe Ox Alpha à peu près au niveau de GLM-5.3, mise à part la vision, et trouve la rapidité d'exécution l'aspect le plus frappant — compresser le GLM-5.3 purement textuel et le livrer avec une vision fonctionnelle dans les jours suivant le lancement du 14 août. C'est l'évaluation d'un analyste, pas un score indépendant, et il soutient qu'elle devrait faire réfléchir sur le récit selon lequel « la Chine publie des modèles tout juste sortis du four ». Son dernier post superpose une hypothèse de feuille de route à cette lecture : le cycle de mise à jour de GLM-5 pourrait être court ; Ox Alpha est suffisamment proche de GLM-5.3 pour que son utilisation comme sous-agent ait à peine de sens — « exécutez simplement ox @4 à la place » est son raccourci pour exécuter le modèle directement ; et un Ox Alpha davantage entraîné aurait beaucoup de sens comme cheval de trait, pour reprendre son mot, une « beast of burden », pour un GLM 5.5 bien plus puissant. C'est une spéculation d'analyste sur une feuille de route, pas une déclaration de Zhipu. La question du sous-nom, en revanche, est réglée : le 26 août, Z.AI a publié Ox Alpha sous le nom de GLM-5.3-Flash. La complication qui maintenait autrefois l'étiquette Flash du côté « présumé » — GLM-5.3 lancé le 14 août comme modèle purement textuel, tandis qu'Ox Alpha annonce une entrée vidéo — est exactement ce que la publication a résolu : GLM-5.3-Flash est un modèle distinct, nativement multimodal, plutôt que le même modèle purement textuel. Des théories alternatives — l'équipe MiMo de Xiaomi, DeepSeek — ont été avancées et largement écartées sur la base du tokenizer et des preuves vidéo, et la publication tranche définitivement la question de la famille.L'argument de Davis pour accorder de l'importance à l'étiquette Flash s'est avéré être l'argument pratique : parce qu'Ox Alpha est réellement GLM-5.3-Flash, avec des performances au niveau intermédiaire de GPT-5.6 Sol, il peut désormais être exécuté localement — les poids sont sur Hugging Face, et SGLang, vLLM et TokenSpeed le servent — ce qui transforme un modèle de codage de pointe de milieu de gamme en un coût matériel unique plutôt qu'en une facture par jeton pour quiconque est prêt à l'héberger.

Le cadrage géopolitique est celui des analystes, pas celui des faits : « Cela met une pression encore plus immense sur les Frontier Labs américains, et l'écart avec la Chine se réduit. » C'est une interprétation de ce qu'un modèle gratuit de niveau Zhipu, fonctionnant à l'échelle frontière, signifie pour l'ordre concurrentiel — et la divulgation du matériel lui confère un avantage que les analystes ne possédaient pas. Servir 100 000 milliards de tokens par jour sur environ 100 000 puces nationales est la première démonstration à grande échelle qu'une pile chinoise sans silicium NVIDIA peut supporter le trafic d'inférence de pointe — le scénario contre lequel Jensen Huang, PDG de NVIDIA, avait mis en garde sur le podcast Dwarkesh ce printemps, lorsqu'il soutenait que les contrôles à l'exportation accéléreraient la construction d'une pile indépendante de NVIDIA en Chine et qu'un modèle de pointe fonctionnant mieux sur du matériel chinois domestique serait une « issue horrible » pour les États-Unis. Le chiffre de parité des coûts de Z.AI reste une affirmation du fournisseur, mais l'événement lui-même est bien réel. Le même soir, le point a été concrétisé côté modèles : au moment où Z.AI publiait GLM-5.3-Flash, Alibaba lançait Qwen3.8-Flash-Next, son aperçu open-weight de l'architecture Qwen4. Deux publications open-weight de classe frontière chinoise en une seule nuit, c'est la forme concrète de ce que les observateurs ont appelé « une grande journée pour l'open source chinois ».

Devriez-vous construire dessus cette semaine ?

La semaine gratuite est terminée, mais le test reste bon marché : le tarif réellement appliqué le 17 septembre est de 0,075 $ en entrée / 0,25 $ en sortie par million de tokens, et non le prix catalogue de 0,15 $ / 0,50 $ — la promo de lancement à 50 % qui devait se terminer le 9 septembre est toujours en vigueur huit jours plus tard. Si vous faites du travail agentique à long horizon, que vous codez sur de longs contextes ou que vous exploitez des pipelines très gourmands en vidéo, c’est exactement l’intersection où se positionne Ox Alpha — et avec les poids ouverts, vous pouvez lancer le test sur votre propre matériel plutôt qu’à la merci d’une plateforme anonyme. Deux mises en garde. Premièrement, l’étiquette « frontière » reste une affirmation : le tableau de scores de GLM-5.3-Flash est déclaré par le fournisseur, et le seul chiffre indépendant solide — le run DeepSWE de Davis à ~63 % — est fort, mais loin des 80 % viraux du premier sous-ensemble de 10 tâches. Deuxièmement, le prix de 0 $ était limité dans le temps, et le dévoilement a fixé le prix de ce qui suit — bon marché pour la capacité, mais plus gratuit. Ce que la publication à poids ouverts supprime, c’est la dépendance : les fichiers sont sortis, donc le modèle peut être auto-hébergé plutôt que loué. C’est la forme d’un test, pas d’une dépendance.

La façon sûre en production de mener un test comme celui-ci est une chaîne de repli : le modèle expérimental répond lorsqu'il est en bonne santé, et la requête bascule vers un modèle éprouvé dès qu'il cale, renvoie une erreur ou disparaît. C'est à cela que sert une couche de routage. La révélation rend le choix du repli trivial : Ox Alpha est GLM-5.3-Flash, et le modèle lui-même est en ligne sur OrcaRouter sous son vrai nom à 0,075 $ en entrée / 0,25 $ en sortie par million de tokens, avec les lectures de cache à 0,0173 $ — le tarif de lancement à -50 % qui devait prendre fin le 9 septembre et qui, au 17 septembre, est toujours le prix affiché sur la page plutôt que le tarif catalogue de 0,15 $ / 0,50 $. Il est répercuté avec 0 % de marge, une seule API pour plus de 200 modèles, avec basculement automatique afin qu'un pic de trafic de la semaine de lancement ne devienne pas votre panne. Mettez le nouveau modèle à l'essai en tête, avec un repli éprouvé derrière lui dans la chaîne ; quand un prix change, le montant que vous voyez sur OrcaRouter est celui que vous payez, le jour même. Ou renoncez complètement à l'API — les poids sont ouverts, donc l'auto-hébergement de GLM-5.3-Flash derrière la même chaîne est aussi envisageable.

Que regarder

Six éléments révéleront la suite de l’histoire. Le benchmark indépendant : le tableau de scores de GLM-5.3-Flash est déclaré par le fournisseur, le run DeepSWE de Davis à ~63 % est le seul chiffre indépendant solide jusqu’ici, les 62,7 officiels de DeepSeek V4 Pro 0813 se situent désormais dans la même bande, et une entrée Artificial Analysis ou LMArena — ou un face-à-face indépendant — constituerait la vérification finale pour savoir si « frontier » est un fait ou un slogan. La trajectoire des prix : la question de régime stable a une réponse au vu des éléments disponibles — la promo de 50 % devait se terminer le 9 septembre, pourtant le 17 septembre le tarif réduit de 0,075 $ / 0,25 $ est toujours ce qui est servi, donc c’est le chiffre promotionnel, et non le prix catalogue de 0,15 $ / 0,50 $, qui doit servir de base au budget ; ce qui reste non résolu, c’est la cause, puisque le prix catalogue de Z.AI lui-même n’a pas bougé. L’affirmation matérielle : Z.AI dit que la semaine anonyme a tourné sur environ 100 000 puces domestiques à parité de coût avec NVIDIA — le premier test public de cette affirmation à grande échelle consiste à savoir si elle résiste à un examen indépendant, et si la pile domestique devient la norme par défaut pour la gamme GLM. Les calculs d’adoption : savoir si le trafic au sommet des plateformes qu’Ox Alpha a attiré sous le masque se convertit en déploiements auto-hébergés et via API maintenant qu’il a un nom, une licence et un prix. La suite : savoir si GLM-5.3-Flash fait d’Ox Alpha un marchepied — l’indice de teortaxesTex est qu’une version davantage entraînée devient la bête de somme d’un GLM 5.5 bien plus fort, ce qui ferait de cette sortie la fondation du prochain GLM. Et la réaction : avec Qwen3.8-Flash-Next qui atterrit la même nuit et une révélation sur les puces domestiques derrière, la pression est sur les labos de pointe américains — et sur le débat sur les contrôles à l’exportation — pour répondre ; surveillez si un fast-follow, un mouvement de prix ou une réponse politique arrive de l’autre côté de l’écart.

Le verdict honnête : Ox Alpha a été une expérience inhabituellement bon marché dans les deux sens. La plateforme a testé si un modèle anonyme de classe frontière à 0 $ pouvait conquérir du trafic de production réel en une semaine — ce fut le cas, de manière suffisamment convaincante pour que Z.AI non seulement se manifeste le sixième jour, mais publie les poids sous forme de modèle ouvert la même nuit. Vous pouvez à votre tour tester si le modèle mérite une place dans votre stack, désormais sans le risque lié à l'anonymat : GLM-5.3-Flash est un modèle nommé, sous licence MIT, auto-hébergeable, à un prix publié, et la question du matériel a elle aussi reçu une réponse — Z.AI affirme que le service à 100 T tokens/jour tournait sur environ 100 000 puces chinoises domestiques, déclaration de l'entreprise mais désormais largement rapportée. Ce qu'il reste à apprendre, c'est si le terme « frontière » survit à une mesure indépendante, si l'affirmation de parité de coûts de Z.AI avec des puces domestiques tient à grande échelle, pourquoi la promotion de lancement à 50 % est encore le prix appliqué huit jours après la date de fin annoncée du 9 septembre, et si la révélation fait de GLM-5.3-Flash le cheval de trait d'un GLM 5.5 plus puissant, comme le suggère teortaxesTex. Lancez l'expérience, mais lancez-la avec une solution de repli en dessous.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement