Un carton-titre généré affichant « GLM-5.3-Flash Révélé » avec le sous-titre « Le modèle multimodal ouvert de pointe de Zhipu était l'anonyme Ox Alpha — désormais à un dixième du prix de GLM-5.3 », avec des icônes plates en trait d'une puce éclair, d'un badge MIT et d'une icône image-vidéo.
Guides & Insights

GLM-5.3-Flash dévoilé : l'anonyme « Ox Alpha » était en réalité le modèle multimodal de pointe ouvert de Zhipu.

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le modèle qui a passé une semaine en tête des classements d'utilisation des plateformes de codage tierces a enfin un nom et un prix. Le 26 août 2026, Zhipu AI a confirmé que le modèle gratuit « Ox Alpha » que les développeurs faisaient tourner à plein régime depuis le 20 août est le GLM-5.3-Flash — un modèle à mélange d'experts de 320 milliards de paramètres au total, dont 18 milliards actifs (320B-A18B), la première version nativement multimodale de la série GLM-5, et l'un des modèles de pointe les moins chers de tous les tarifs au lancement. Zhipu propose GLM-5.3-Flash à un dixième du tarif API de son modèle phare GLM-5.3, ou un vingtième pendant une remise à durée limitée, et les poids ouverts — sous licence MIT — ont été publiés sur Hugging Face le même jour. Contrairement à GLM-5.3, dont les poids sont toujours attendus pour la fin du mois, ce modèle peut être auto-hébergé dès cette semaine, pas la suivante.

Voici la version courte : Zhipu a open-sourcé son modèle de grande taille le moins cher à ce jour, il bat son propre GLM-5.2 sur les benchmarks tout en ne mobilisant qu'une fraction des paramètres actifs, et le fournisseur situe son score sur l'Artificial Analysis Intelligence Index à 57 — égalant Claude Opus 4.8, selon les documents de lancement de Zhipu. Tous les chiffres de benchmark associés à ce lancement sont rapportés par le fournisseur et n'ont pas encore été reproduits au moment de la rédaction ; les prix et les nombres de paramètres sont des faits établis.

Ce qui a réellement été livré

GLM-5.3-Flash est un MoE de 320B au total / 18B actifs avec 45 couches, ce qui place son empreinte active à un peu plus de la moitié des ~32B paramètres actifs de GLM-5.2. La capacité phare est la multimodalité : il accepte nativement des entrées texte, image et vidéo — le premier modèle GLM-5 à le faire — plutôt que de faire passer la vision par un adaptateur séparé. Le contexte va jusqu'à 1 million de jetons, et Zhipu affirme que le coût de service en contexte long revient à environ un tiers de celui de GLM-5.3.

{{1}}Côté architecture,{{/1}} {{2}}Zhipu le décrit comme le premier modèle de pointe open source à utiliser une conception hybride d'attention éparse et d'attention linéaire,{{/2}} {{3}}associé à des Hyper-Connexions à Contrainte de Variété (mHC) pour la mise à l'échelle et à un mécanisme IndexPool{{/3}} {{4}}qui compresse quatre vecteurs clés d'indexeur en un pool pondéré unique afin de réduire la latence sur les longs contextes.{{/4}} {{5}}Le pré-entraînement a été réalisé sur un corpus multimodal de 30 000 milliards de jetons.{{/5}} {{6}}Rien de tout cela n'a encore été audité de manière indépendante — c'est la description que Zhipu fait de son propre modèle —{{/6}} {{7}}mais les affirmations concernant l'efficacité du service sont suffisamment précises pour être testées une fois que les poids seront disponibles pour la pile d'inférence open source.{{/7}}

La fiche technique du jour de lancement, en un coup d'œil :

• Paramètres — 320B au total / 18B actifs, 45 couches, MoE.

• Modalité — entrée native de texte, d’image et de vidéo ; sortie de texte.

Fenêtre de contexte — jusqu'à 1 000 000 de jetons.

• Licence — MIT, poids ouverts disponibles sur Hugging Face dès le lancement.

Prix — 0,15 $ / 0,50 $ par million de jetons (entrée / sortie), 0,03 $ par million de jetons d’entrée en cache ; une promotion de -50 % jusqu’au 9 septembre 2026 la réduit à 0,075 $ / 0,25 $ / 0,015 $. Au prix catalogue, cela représente environ un dixième des 1,40 $ / 4,40 $ de GLM-5.3.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

La semaine Ox Alpha

La révélation clôt une semaine de spéculations. Le 20 août, un modèle anonyme est apparu sur une plateforme d'API IA tierce avec une fenêtre de contexte d'un million de jetons, une entrée texte/image/vidéo, et un prix de zéro, et il est rapidement devenu le modèle le plus appelé des classements hebdomadaires de la plateforme. La communauté l'a identifié en moins de 48 heures comme appartenant à la famille GLM de Zhipu — le même schéma anonyme-puis-revendiqué qui avait auparavant permis d'identifier des modèles d'autres laboratoires chinois — et les analystes ont largement supposé qu'il s'agissait d'une variante Flash du GLM-5.3. L'annonce du 26 août a confirmé cette hypothèse et ajouté le détail que la semaine gratuite était un test délibéré : Zhipu affirme que le passage anonyme a établi des records de volume d'appels sur les plateformes de codage où il était proposé, tout le trafic étant servi par des puces chinoises domestiques.

Ce contexte de semaine gratuite est important pour les attentes tarifaires. Un modèle offert à 0 $ pendant une semaine, puis lancé à un dixième du tarif du produit phare, avec une remise à durée limitée au vingtième du prix, est une manœuvre délibérée de création de marché dans le segment économique — et la mention « durée limitée » est l'élément à surveiller. La remise est une décision tarifaire qui peut être annulée ; les poids ouverts MIT, eux, ne le peuvent pas.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Ce que ça coûte, en dollars réels

La grille tarifaire de Zhipu est publiée en dollars réels, non pas seulement sous forme de ratios : 0,15 $ par million de jetons d'entrée, 0,50 $ par million de jetons de sortie et 0,03 $ par million de jetons d'entrée en cache. Par rapport aux 1,40 $ / 4,40 $ publiés pour GLM-5.3, cela revient à environ un dixième du prix catalogue ; une promotion de lancement de −50 % valable jusqu'au 9 septembre 2026 ramène ces prix à 0,075 $ / 0,25 $ / 0,015 $, soit environ un vingtième. Zhipu évalue également le coût du modèle par tâche AA Intelligence Index à environ 0,045 $ — chiffre rapporté par le fournisseur — ce qui est le chiffre qui sous-tend la formulation « 1/40 d'Opus 4.8 ». Pour un modèle qui obtient des scores dans la même fourchette que des modèles facturés 10 à 40 fois plus chers, l'avantage économique mis en avant est réel ; il faut toutefois noter que la remise de lancement est temporaire et que le coût par tâche dépend de la verbosité du modèle en production.

L'histoire de l'efficacité est ce sur quoi Zhipu s'appuie pour revendiquer son avantage de coût. Face à GLM-5.3, le fournisseur annonce un coût de calcul d'attention réduit de 3,0x et un cache KV réduit de 4,4x, et revendique le coût de calcul d'attention le plus bas parmi les modèles d'entrée de gamme comparés — GLM-5.3, DeepSeek V4 Flash et Kimi K3 — tout en concédant que son cache KV reste légèrement plus important que ceux de DeepSeek V4 Flash et de Kimi K3. Côté serving, Zhipu rapporte une amélioration de 3x des performances d'inférence de bout en bout par rapport à la référence sur des puces chinoises domestiques, atteignant un coût par jeton qu'elle juge comparable à celui des GPU NVIDIA grand public. Toutes ces données émanent du fournisseur et aucune n'a encore été reproduite de manière indépendante ; ce sont les bons chiffres à confronter aux poids ouverts.

Pourquoi la révélation est importante

Même en mettant les benchmarks de côté, ce lancement change le paysage des modèles ouverts de deux manières. Premièrement, il s'agit d'un modèle multimodal à poids ouverts dans la catégorie frontière, à prix abordable — la combinaison de la licence MIT, du contexte de 1M, de l'entrée native image/vidéo et du coût par tâche de quelques centimes n'a pas d'équivalent direct chez les laboratoires frontières américains, dont les modèles multimodaux équivalents coûtent un ordre de grandeur de plus et sont distribués en code fermé. Deuxièmement, il concurrence le produit phare de Zhipu : GLM-5.3 est le modèle de 743B qui a obtenu un score de 60, mesuré indépendamment, à l'AA Intelligence Index ce mois-ci, et GLM-5.3-Flash est positionné comme « intelligence de pointe, coût éclair » face à cette même famille. Le discours de Zhipu est qu'un modèle plus petit et moins cher peut capturer l'essentiel des capacités du produit phare — ce qui, si les affirmations du fournisseur en matière de codage et de capacités agentiques se confirment, est le même argument d'économie post-entraînement autour duquel l'industrie tourne en rond depuis le début de l'année.

Une réserve permet de relativiser cela. Le score AA Index de 57 de GLM-5.3-Flash provient des documents de lancement de Zhipu, pas encore du classement Artificial Analysis, et la comparaison de code avec Claude Opus 4.8 est une évaluation interne de Zhipu via Z.ai Code Bench. Considérez le score de 57 et la parité en codage comme des affirmations jusqu'à ce qu'une mesure indépendante arrive — le modèle a été largement testé de manière anonyme, donc les chiffres de tiers devraient arriver rapidement.

Essayez-le et voyez comment la couche de routage s'intègre.

L'accès dès le premier jour se fait via l'API propre de Zhipu, les poids ouverts sur Hugging Face (zai-org/GLM-5.3-Flash, MIT), et les produits de codage de Zhipu — ZCode et le GLM Coding Plan, qui comprend un lot de cartes d'expérience quotidiennes. Pour l'auto-hébergement, la licence MIT ainsi que le support de vLLM et SGLang signifient que les affirmations d'efficacité de service ci-dessus sont directement vérifiables.

Côté routage, GLM-5.3-Flash lui-même ne figure pas encore sur la liste d'OrcaRouter à la date de cette mise à jour. Le reste de la famille GLM y est : GLM-5.3 est devenu disponible de notre côté le jour même où l'API de Zhipu a été ouverte, au prix catalogue de Zhipu, avec une marge de 0 % répercutée. Cette répercussion est précisément le mécanisme qui compte pour un lancement comme celui-ci — un changement de prix du fournisseur, que la remise soit maintenue ou que la grille tarifaire évolue par la suite, apparaît de notre côté le jour même, sans renégociation. Si vous souhaitez exécuter Flash avec le reste de la gamme GLM sur une seule clé une fois qu'il sera disponible, c'est la configuration à adopter ; en attendant, les poids sur Hugging Face sont le moyen le plus rapide de le tester vous-même.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Que regarder ensuite

Trois éléments permettront de connaître la véritable histoire au cours des deux prochaines semaines. Premièrement, une mesure indépendante d'Artificial Analysis du 57 — le modèle tournait déjà en conditions réelles sous le nom d'Ox Alpha, donc le classement devrait rapidement rattraper son retard. Deuxièmement, la question de savoir si la promotion de -50 % — actuellement prévue pour se terminer le 9 septembre 2026 — sera prolongée au-delà de cette date, car cela déterminera le coût en régime permanent du Flash. Troisièmement, les poids de GLM-5.3, toujours promis pour autour du 28 août — la même semaine où les poids MIT du Flash ont été publiés, ce qui donnerait à la communauté des poids ouverts deux niveaux de la même famille à comparer en même temps.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube