
Ox Alpha : la fiche technique complète du modèle furtif désormais commercialisé sous le nom de GLM-5.3-Flash
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 316 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 196 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Ox Alpha est le nom anonyme sous lequel GLM-5.3-Flash a été présenté en avant-première ; il a été dévoilé le 26 août 2026, et ce n'est pas un modèle que l'on peut appeler aujourd'hui. La fiche de prévisualisation qui portait le nom Ox Alpha ne le propose plus ; le modèle sous-jacent dispose d'une page fournisseur, de poids sous licence MIT, d'une grille tarifaire publiée et d'une surface d'API documentée, l'ensemble appartenant à Z.ai. Cette page est la référence pour ce modèle — l'enveloppe, les modalités, la grille tarifaire, la surface des points de terminaison, chaque chiffre de benchmark publié avec la révision ou le harnais qui lui est associé, et, parce que l'alias renvoie encore un résultat de recherche pauvre et déroutant, une déclaration claire de ce qui n'est documenté nulle part. Tout ce qui suit a été consulté le 2026-09-28 à partir de la documentation de modèle et de la page de tarification propres à Z.ai, de la fiche de modèle Z.ai sur Hugging Face, d'Artificial Analysis et de notre propre catalogue ; les chiffres publiés par le fournisseur et les chiffres mesurés par un tiers indépendant sont étiquetés séparément, et rien ici n'est déduit d'une ressemblance.
À quoi le nom Ox Alpha fait référence aujourd'hui
L'alias est retiré, et c'est le fournisseur qui l'a retiré. La documentation de Z.ai pour GLM-5.3-Flash indique que le modèle a été testé anonymement sous le nom ox-alpha avant sa sortie, afin de recueillir les retours des utilisateurs, et que cette campagne anonyme est devenue le modèle le plus populaire de cette semaine-là. Les repères datables sont courts et précis : l'entrée en mode furtif présentait Ox Alpha comme sorti le 20 août 2026, et la révélation est tombée le 26 août — la même date que porte la page de documentation de Z.ai et la même date de sortie que celle que notre propre catalogue enregistre pour z-ai/glm-5.3-flash.
Deux choses en découlent, et toutes deux importent pour un lecteur qui a cherché ce nom.
• L’alias n’est pas une route. Notre catalogue renvoie « modèle introuvable » pour une recherche stealth/ox-alpha, relevé le 2026-09-28. Il n’y a rien à appeler sous ce nom, car le produit du fournisseur porte le nom du fournisseur.
• Il n'existe pas non plus de dépôt de poids appartenant à un fournisseur sous cet alias. Une recherche d'ox-alpha sur Hugging Face renvoie des dépôts communautaires créés pendant la fenêtre de stealth de fin août 2026, ainsi qu'un dépôt composé uniquement d'une fiche, daté du 27 septembre 2026, qui ne contient aucun poids et pointe vers la publication officielle de Z.ai. Un nom de dépôt est une étiquette choisie par son auteur ; ce n'est en rien une documentation. L'organisation de Z.ai elle-même publie le modèle sous zai-org/GLM-5.3-Flash, le dépôt ayant été créé le 2026-08-25 en UTC.
La question du fournisseur qui a dominé la semaine anonyme est close, et elle s'est close de manière ordinaire : un laboratoire s'est manifesté et a apposé son nom sur le modèle. Ce qui reste est une spécification, ce dont traite cette page. L'histoire de la découverte — l'identification par empreinte qui a précédé la révélation, la lignée de modèles anonymes à laquelle il appartient, et la divulgation du matériel de service qui l'a accompagnée — se trouve dans notre article précédent sur l'enquête Ox Alpha, et cette page ne revient sur aucun de ces éléments.
L'enveloppe, telle que le fournisseur la documente

Ce sont des chiffres rapportés par Z.ai, lus sur la page de documentation du fournisseur le 2026-09-28, et trois des quatre dimensions de l’enveloppe sont corroborées de manière indépendante — la fiche modèle d’Artificial Analysis indique les mêmes 320B au total, 18B actifs, une fenêtre de contexte de 1 000 000 de tokens et une licence MIT, et notre propre fiche catalogue indique les limites de contexte et de sortie.
• Fenêtre de contexte — 1 000 000 de tokens (documentation Z.ai ; Artificial Analysis ; notre propre fiche catalogue, qui indique 1 000 000)
• Sortie maximale — 128K jetons (documentation Z.ai) ; notre fiche indique 128 000
• Entrée — texte, image, vidéo et fichier (documentation Z.ai, consultée le 2026-09-28) ; notre fiche liste texte, image et vidéo, et ne prétend pas accepter de fichiers en entrée
• Sortie — texte uniquement, sur chaque source
• Paramètres — 320B au total avec 18B activés par token (documentation et fiche modèle de Z.ai ; Artificial Analysis relève indépendamment 320B et 18B)
• Licence — MIT, avec des poids publiés sur Hugging Face (fiche modèle du fournisseur ; Artificial Analysis classe le modèle comme un modèle à poids ouverts sous une licence permissive)
• Architecture — un hybride d’attention sparse et linéaire, que Z.ai décrit comme le premier modèle de frontière open source à combiner les deux, réduisant le calcul d’attention de 3,01× et le cache KV de 4,44× par rapport à GLM-5.3, ainsi qu’une étape IndexPool qui compresse quatre vecteurs de clés d’indexeur en un seul en contexte long, et des Hyper-Connections à contrainte de variété pour l’efficacité de mise à l’échelle. Tout est déclaré par le fournisseur ; il n’existe aucun audit architectural indépendant à citer.
• Pré-entraînement — un corpus multimodal de 30 000 milliards de tokens (selon Z.ai). Le fournisseur ne publie aucun chiffre total de calcul d’entraînement ni de répartition des paramètres par couche au-delà des 320B/18B annoncés.
Une affirmation d'enveloppe s'est resserrée depuis le lancement, et c'est la documentation actuelle qu'il faut citer. La divulgation sur le matériel de service qui a circulé en août estimait la capacité de la semaine anonyme à environ 100 000 puces chinoises domestiques. La documentation de Z.ai telle qu'elle se lit aujourd'hui indique que le modèle a été servi « sur des dizaines de milliers d'accélérateurs développés localement », avec une amélioration de service de bout en bout de 3× par rapport à la base de référence du fournisseur sur le même matériel et un coût par token que le fournisseur décrit comme comparable à celui des GPU NVIDIA courants. Des dizaines de milliers, c'est ce que la page indique maintenant ; le chiffre plus élevé est celui de l'époque du lancement. Les deux sont des affirmations de l'entreprise, aucune n'a été auditée de manière indépendante, et la direction de la révision est à la baisse.
La grille tarifaire, et pourquoi le nombre servi est celui qui compte
La page de tarification de Z.ai indique GLM-5.3-Flash à 0,15 $ par million de jetons d'entrée, 0,03 $ par million de jetons d'entrée mis en cache et 0,50 $ par million de jetons de sortie, et le palier frère FlashX à 0,37 $ / 0,075 $ / 1,25 $. Il s'agit du prix catalogue du fournisseur, relevé sur sa propre page le 28 septembre 2026.
Le tarif réellement appliqué sur notre route aujourd'hui est plus bas, et c'est là le point pratique de cette section. Sur la fiche OrcaRouter de z-ai/glm-5.3-flash consultée le 2026-09-28, l'entrée est facturée à $0.075 par million de tokens, la sortie à $0.25 par million et le cache à $0.0173 par million. C'est la moitié du tarif catalogue du fournisseur, sur le même modèle, le même jour — le chiffre remisé plutôt que le tarif affiché, sans mention promotionnelle sur la fiche. Notre précédente couverture de ce modèle relevait le même écart après la fin de la fenêtre promotionnelle annoncée ; l'observation tient toujours aujourd'hui, et nous ne parvenons toujours pas à en déterminer la source, nous rapportons donc le tarif appliqué et laissons la cause ouverte.
L'entrée mise en cache est le point où les trois sources divergent visiblement, ce qui rappelle utilement qu'un « $0.03 » dans un tableau n'est pas nécessairement un prix que quiconque paie. La page du fournisseur indique $0.03 par million de tokens d'entrée mis en cache ; la fiche de modèle d'Artificial Analysis porte un prix de cache-hit de $0.026 ; notre route sert les lectures de cache à $0.0173. Les trois ont été relevées le 2026-09-28 ou peu avant, et toutes trois rapportées par le fournisseur ou la plateforme. Nous citons le chiffre catalogue du fournisseur comme chiffre catalogue et le chiffre servi comme ce qui est réellement facturé à un appelant.
Faites le calcul pour une tâche d’agent représentative — 100 000 jetons d’entrée et 10 000 jetons de sortie, sans succès de cache :
• Au tarif catalogue du fournisseur — 100 000 tokens × 0,15 $/1 M = 0,015 $, plus 10 000 × 0,50 $/1 M = 0,005 $, donc 0,020 $ par appel
• Au tarif que notre route applique aujourd’hui — 0,0075 $ plus 0,0025 $, soit 0,010 $ par appel, exactement la moitié
C’est là toute la raison de vérifier le prix appliqué plutôt que le prix catalogue avant de dimensionner un agent à long horizon qui exécute de nombreux appels par jour : l’écart entre ces deux nombres correspond à l’écart entre deux budgets. OrcaRouter répercute le prix catalogue du fournisseur avec 0 % de marge, ce qui explique pourquoi la remise proposée par le vendeur apparaît sur votre carte plutôt que d’être absorbée quelque part en cours de route.
Modalités et surface des points de terminaison
Le fournisseur documente une forme d'interface et deux codes de modèle : glm-5.3-flash et glm-5.3-flashx, tous deux servis via l'API Chat Completion. Les images sont insérées sous forme de bloc de contenu de type image_url dans le tableau de contenu du message, en prenant soit une URL — ce que le fournisseur recommande — soit une URL de données base64, et plusieurs blocs d'images peuvent être envoyés dans un seul message. La diffusion en flux est prise en charge, et Z.ai recommande d'activer stream et tool_stream ensemble pour les requêtes en flux. L'appel d'outils, la mise en cache du contexte et la sortie JSON structurée sont toutes des capacités documentées ; la réflexion est prise en charge mais, comme l'explique la section suivante, n'est pas facultative.
FlashX est un palier de service distinct du même modèle plutôt qu'une capacité distincte : Z.ai le documente à 200 tokens par seconde, et indique qu'il n'est pas encore disponible sur le GLM Coding Plan. Ce n'est pas le palier que propose notre catalogue, et ce n'est pas ce que décrivent les chiffres de cette page.
Sur notre route, la surface des points de terminaison est plus étroite et mérite d'être énoncée avec précision. La fiche de z-ai/glm-5.3-flash expose POST /v1/chat/completions — uniquement des complétions de chat, sans second point de terminaison de protocole — et accepte reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens et stop. Les badges de capacités de la fiche sont vision, outils, JSON et raisonnement. Le contexte est de 1 000 000 de tokens et la sortie maximale de 128 000, ce qui correspond à la documentation du fournisseur.
Effort et réflexion : les réglages qui fixent chaque chiffre de benchmark
Voici la partie de la spécification qui modifie le plus votre façon de lire les scores, et le fournisseur la documente précisément. GLM-5.3-Flash prend un reasoning_effort paramètre avec trois niveaux — low, high et max — et sa valeur par défaut est max si vous ne passez rien, ou si vous passez une valeur qui n'est ni low ni high. Le raisonnement ne peut pas être désactivé : le fournisseur indique que thinking.type ne prend en charge que enabled. L'indicateur clear_thinking du modèle de chat a pour valeur par défaut false, et Z.ai recommande de le passer explicitement à true pour les scénarios de chat. Les paramètres d'échantillonnage recommandés par le fournisseur sont temperature 1 et top_p 0.95, et il déclare sans détour que la reproduction des benchmarks et des classements doit conserver l'effort max par défaut.
Si l’on rapproche ces deux faits, la conséquence pour quiconque compare des chiffres est inévitable : un score cité sans niveau d’effort n’est pas une mesure complète, car les réglages low, high et max sont des points de fonctionnement différents du même modèle, et le réglage par défaut est le plus coûteux des trois. Notre fiche expose reasoning et reasoning_effort parmi ses paramètres pris en charge, donc ce réglage est accessible via la route, et pas seulement via le fournisseur.
La fiche comparative, avec la révision ci-jointe
Z.ai publie un tableau de benchmarks pour GLM-5.3-Flash, et celui-ci est entièrement rapporté par le fournisseur — le relevé indépendant d'Artificial Analysis ne reproduit pas ces lignes. Les chiffres phares du fournisseur en matière de codage et d'agentique sont DeepSWE v1.1 à 63,4 contre 46,2 pour GLM-5.2, et AutomationBench v1.0.6 à 48,8 contre 26,2 pour GLM-5.2. Le reste de la fiche, telle que notre propre catalogue la présente avec Z.ai comme source nommée : Humanity's Last Exam avec outils 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography avec outils 78, CharXiv raisonnement avec outils 89,4, et côté vision MMVU 80,5, MVBench 77,8 et BabyVision 53,4.
Deux lignes de fournisseur méritent que leurs notes de bas de page soient intégrées dans la phrase, car ce sont celles qu'un lecteur est le plus susceptible de citer sans elles. L'évaluation de codage interne de Z.ai, Z.ai Code Bench v1.0, place GLM-5.3-Flash à 29,0 à effort maximal contre Claude Opus 4.8 à 29,5 — une quasi-égalité sur le propre banc d'essai du fournisseur, exécuté sur Claude Code 2.1.207, selon le fournisseur. Il ne s'agit pas d'une comparaison indépendante, et ce n'est pas non plus une comparaison à effort égal menée par un tiers ; c'est Z.ai qui évalue son modèle face à un concurrent sur sa propre évaluation. Et le fournisseur cite un Artificial Analysis Intelligence Index de 57 à 0,045 $ par tâche, en précisant que la révision est v4.1.1.
Ce dernier chiffre doit être distingué de ce qu'Artificial Analysis publie aujourd'hui, car les deux ne peuvent pas être mis côte à côte comme une évolution. La page qu'Artificial Analysis consacre à GLM-5.3-Flash, consultée le 2026-09-28, rapporte un Intelligence Index de 41.8 sur l'index v4.3.2, enregistré à effort maximal. La v4.3.2 intègre dix évaluations — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR v1.1 — ce que la v4.1.1 ne faisait pas. Deux révisions d'index, deux ensembles de tâches, deux chiffres. Aucun des deux n'est faux ; il ne s'agit pas de la même mesure, et citer 57 à côté de 41.8 comme si le modèle avait bougé serait une erreur dans un sens comme dans l'autre.
Ce que le relevé indépendant corrobore, c’est l’enveloppe plutôt que les scores : Artificial Analysis enregistre indépendamment 320 B de paramètres au total, 18 B activés, une fenêtre de contexte de 1 000 000 de tokens, une licence MIT, des poids ouverts et une date de sortie au 26/08/2026, et indique les tarifs du fournisseur à 0,15 $ en entrée et 0,50 $ en sortie par million de tokens, avec un prix de 0,026 $ en cas de cache-hit. Lorsque le fournisseur publie un score et que le tiers indépendant ne le fait pas, nous le signalons ; lorsque le tiers indépendant confirme une spécification, il s’agit de la classe de faits la plus solide de cette page.
Il n’y a ici aucun face-à-face apparié, et le dire est plus utile que d’en produire un. Personne n’a publié de série de tests de GLM-5.3-Flash contre Claude Opus 4.8, GPT-6 Sol ou Grok 4.7 à un niveau d’effort déclaré sur un harnais commun — la propre comparaison de Z.ai se fait sur son propre banc d’essai, à effort maximal, contre le réglage par défaut d’un concurrent. Tant que cela ne change pas, la comparaison honnête entre ce modèle et n’importe quoi d’autre porte sur le prix, l’enveloppe et la surface des points de terminaison, les trois choses sur cette page que tout le monde peut lire à partir des mêmes chiffres.
Ce qui n'est pas documenté, dit simplement
Une page de référence pour un modèle dont la surface informationnelle est limitée n’est utile que si elle est honnête sur les lacunes, et celle-ci en présente plusieurs.
• Aucune date limite de connaissances du fournisseur. La documentation de Z.ai et la fiche modèle Hugging Face n’en indiquent aucune, et le dossier d’Artificial Analysis laisse ce champ vide. Les estimations issues de la fenêtre furtive relèvent d’un travail communautaire, pas d’un chiffre du fournisseur, et cette page n’en reprend aucune comme si c’en était un.
• Aucune note de bas de page relative au harnais pour la majeure partie de la feuille de benchmark. La fiche du modèle comporte bien des notes de bas de page pour l'exécution HLE avec outils — température 1,0, top_p 0,95, une longueur de génération maximale de 163 840 jetons, une évaluation sur un contexte allant jusqu'à 300 000 jetons avec une stratégie de gestion du contexte, et GPT-5.6 Luna à effort moyen comme modèle juge — et pour NL2Repo et DeepSWE, que le fournisseur indique avoir été exécutés avec le harnais mini-swe-agent. Les lignes restantes sont de simples pourcentages, sans harnais ni effort associés.
• Aucune explication de l'écart de prix des entrées mises en cache. Trois chiffres pour la même quantité sur le même modèle, et aucune source n'indique pourquoi ils diffèrent.
• Aucun benchmark indépendant de la période de diffusion anonyme. L’annonce furtive a disparu ; quoi qu’elle ait mesuré, cela ne pourra plus être mesuré, et aucun tiers n’a publié d’exécution contre l’alias pendant qu’il était actif.
• Aucune comparaison avec des tiers à effort équivalent, pour la raison indiquée ci-dessus.
• Aucune confirmation du fournisseur concernant le nombre de puces de l’époque du lancement. La documentation indique des dizaines de milliers d’accélérateurs nationaux ; le chiffre de 100 000 ne figure pas sur la page.
C'est dit : ce que notre catalogue propose, vérifié aujourd'hui

Le modèle derrière Ox Alpha est en ligne dans notre catalogue sous son propre nom, vérifié aujourd'hui plutôt que supposé. Une lecture de l'API du modèle OrcaRouter pour z-ai/glm-5.3-flash le 2026-09-28 a renvoyé la fiche complète : contexte de 1 000 000 de tokens, sortie maximale de 128 000, entrée texte, image et vidéo avec sortie texte, les pastilles de capacités vision, outils, JSON et raisonnement, une date de sortie au 2026-08-26, non déprécié et non retiré, au prix de 0,075 $ par million de tokens d'entrée, 0,25 $ par million de tokens de sortie et 0,0173 $ par million de tokens d'entrée mis en cache, sur l'unique point de terminaison POST /v1/chat/completions.
Notre propre mesure de playground sur sept jours, effectuée sur cette carte pour la même période, donne 61,8 jetons de sortie par seconde, un temps jusqu’au premier jeton (p50) de 7,39 secondes et un taux d’erreur de 1,47 %. Ce sont des chiffres de première main concernant notre service, et non des chiffres de fournisseur ni des benchmarks indépendants, et c’est pour cette raison qu’ils sont les seuls chiffres de vitesse sur cette page.
L'alias lui-même ne figure pas sur la route. Si vous êtes arrivé ici après avoir cherché Ox Alpha, le modèle à appeler est z-ai/glm-5.3-flash, et le format de requête est celui décrit ci-dessus. Il se trouve sur la même clé que tout le reste du catalogue — une API unique pour plus de 200 modèles, le prix du fournisseur répercuté sans marge ajoutée, et un basculement automatique si un fournisseur flanche, de sorte qu'un modèle que vous évaluez ne doit pas nécessairement être un modèle dont dépend votre chaîne de production.

Une clarification sur ce qu’est cette page, puisqu’un lecteur qui arrive depuis le nom propre du modèle la mérite. Il s’agit d’une page de référence pour un modèle déjà présent au catalogue, et non d’un rapport de lancement : GLM-5.3-Flash date du 26 août 2026, et sa place ici tient au fait que le nom Ox Alpha continue d’être recherché sans page dédiée sur laquelle atterrir, non à la fraîcheur de la sortie. La date ci-dessus sert à dater le modèle, non à faire office d’actualité. Ce qui modifierait cette page, c’est l’une de quatre choses : un benchmark indépendant exécuté avec un effort déclaré, une date limite de connaissances déclarée par le fournisseur, une évolution du tarif servi, ou une décision de Z.ai de préciser ce qu’était réellement le nombre de puces à l’époque du lancement. Tant que l’une de ces choses ne se concrétise pas, la spécification ci-dessus constitue l’intégralité de ce que le fournisseur documente, et les lacunes énumérées dans la section précédente font tout autant partie de la réponse que les chiffres.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
