Une carte de titre hero pour l'article intitulé « GLM-5.3-Flash : exigences en VRAM », avec le sous-titre « De combien de mémoire avez-vous besoin pour exécuter un MoE de 320B », des badges pilule « 320B au total · 18B actifs », « contexte de 1M de tokens », « builds MLX communautaires », et une carte de résumé indiquant « 2bit-lite : ~102 Go de poids / 112 Go de RAM — la version qui tient dans un Mac de 128 Go », avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Exigences VRAM de GLM-5.3-Flash : combien de mémoire faut-il pour exécuter un MoE 320B ?

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GLM-5.3-Flash ne tient sur aucun GPU grand public. La plus petite version utilisable, 2bit-lite, nécessite environ 102 Go de poids et 112 Go de RAM. Un Mac de 128 Go est le point d'entrée ; un seul H200 suffit pour 2bit-lite avec environ 39 Go de libre ; tous les autres devraient utiliser l'API hébergée, z-ai/glm-5.3-flash.

Voilà toute la réponse d'un seul trait, et il vaut la peine de le dire clairement ici même : aucune configuration matérielle grand public ne peut exécuter ce modèle. Le modèle de mélange d'experts vision-langage à 320B de paramètres de Z.ai, publié le 26 août 2026, nécessite une mémoire de classe serveur dans toutes les quantifications. Le chiffre « 18B actifs » décrit le calcul par jeton, et non la mémoire résidente — les 320B de poids restent chargés. Les cibles locales réalistes sont les grands Mac à mémoire unifiée, les serveurs multi-GPU et un seul H200 de 141 Go. Si vous ne possédez pas l'un de ceux-ci, les chiffres ci-dessous ne sont pas une liste de courses ; ils sont la raison d'appeler le modèle via une API à la place.

Une note de cadrage avant les chiffres : les chiffres de mémoire de cet article sont des conclusions de la communauté, et non des recommandations du fournisseur. Z.ai publie les poids et les spécifications d'API ; il ne publie pas les exigences de mémoire pour l'inférence locale. Le tableau par quantification provient de la fiche modèle orcarouter/GLM-5.3-Flash-MLX sur Hugging Face, une quantification MLX des poids ouverts maintenue par un groupe communautaire, et les chiffres de déploiement proviennent de praticiens qui ont réellement chargé le modèle. Lorsqu'un chiffre est rapporté par le fournisseur — le prix, et les affirmations concernant l'efficacité du cache KV de l'architecture — nous le signalons comme tel.

La réponse courte : ce qui tient sur ce que vous possédez

Partez de ce que vous avez réellement, car l'échelle de quantification n'a de sens que par rapport à une machine cible :

• GPU grand public (RTX 4090, RTX 5090, et tout ce qui est en dessous) — non. Aucune carte grand public n'a assez de VRAM : la plus petite configuration nécessite ~102 Go de poids à elle seule, soit environ l'équivalent de cinq RTX 5090. La RAM système n'y change rien, car les poids doivent résider sur l'appareil.

• Mac 128 Go (M4 ou M5 Max) — la version 2bit-lite (~102 Go de pondérations / 112 Go de RAM minimale), et uniquement après avoir augmenté la limite de mémoire câblée. Plus de détails ci-dessous. C'est la seule machine grand public sur laquelle le modèle tient.

• Mac Studio de 192 Go et 256 Go — les modes 3 bits (~184 / 200 Go) et 2 bits (~145 / 160 Go) deviennent accessibles ; le mode 4 bits nécessite ~224 Go, ce dont seule la configuration 256 Go s'approche.

• Un seul H200 (141 Go de VRAM) — 2bit-lite tient avec environ 39 Go restants pour le cache KV, ce qui signifie des contextes courts uniquement.

• Serveur multi-GPU — tout, y compris le 4-bit, le 6-bit et la build de référence FP8 d'environ 328 Go.

• Pour tous les autres — l'API hébergée, z-ai/glm-5.3-flash. Ce n'est pas un lot de consolation ; c'est là que le modèle est réellement rapide et peu coûteux à utiliser, et c'est abordé en bas de cette page.

Deux nombres, pas un : poids vs mémoire totale

Chaque quantification sur la fiche du modèle comporte deux colonnes — la taille des poids et la RAM minimale — et l'écart entre les deux est la partie que la plupart des articles omettent. La colonne des poids représente les fichiers du modèle : chaque paramètre, dans cette précision, résidant en mémoire. La colonne de RAM minimale représente ce que la machine doit contenir à l'exécution : les poids plus le cache KV, les activations et les tampons qui croissent avec la longueur du contexte.

Le chiffre de 18B actifs est ce qui induit les gens en erreur. GLM-5.3-Flash est un MoE de 320B au total / 18B actifs : par jeton, seulement environ 18B de paramètres sont calculés. C'est une économie de calcul, pas une économie de mémoire. Les 320B de poids résident en mémoire, peu importe les experts qui sont activés, car le routeur ne sait pas de quels experts il a besoin avant de voir le jeton. Le MoE achète de la vitesse, pas de l'empreinte mémoire — un point que la propre fiche du modèle illustre, avec le total de 320B affiché aux côtés des 18B actifs.

Donc, quand une build indique « ~204 Go de poids / 224 Go de RAM min. », les ~20 Go supplémentaires sont des frais généraux d’exécution — cache KV, activations, tampons de contexte. Augmentez la longueur du contexte et cet écart grandit. La colonne RAM min., et non la colonne poids, est celle à utiliser pour dimensionner une machine.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

Le modèle lui-même — architecture, licence et présentation propre à Z.ai — est documenté sur la fiche officielle du fournisseur, affichée ci-dessus. La mémoire locale n'y est pas couverte ; c'est pourquoi cette page existe. Les chiffres ci-dessous proviennent du portage MLX communautaire des poids ouverts.

L'échelle de quantification

Le tableau sur la fiche orcarouter/GLM-5.3-Flash-MLX est celui que les praticiens utilisent effectivement pour charger les modèles aujourd'hui. Il répertorie cinq versions quantifiées plus la référence FP8, chacune avec la taille des poids et la RAM minimale :

• Référence FP8 — ~328 Go de poids. Le point de référence non quantisé auquel les poids ouverts sont livrés.

• 6 bits — ~296 Go de poids / 320 Go de RAM min. Quasi sans perte ; la version de meilleure qualité.

• 4-bit — ~204 Go / 224 Go. Le réglage par défaut recommandé pour un usage quotidien.

• 3-bit — ~184 Go / 200 Go. Agressif mais utilisable.

• 2-bit — ~145 Go / 160 Go. Au mieux.

• 2bit-lite — ~102 Go / 112 Go. La plus petite version ; la seule qui tient sur un Mac de 128 Go ou un seul H200.

La qualité chute à mesure que les bits diminuent, et la fiche le quantifie. Par rapport à la référence FP8, la perplexité se dégrade de +0,24 % en 6 bits, +2,96 % en 4 bits, +9,96 % en 3 bits, +56,9 % en 2 bits et +141 % en 2bit-lite (chiffres de perplexité issus de la même fiche modèle). Les recommandations de la fiche : 6 bits pour une quasi-sans-pertes, 4 bits comme défaut quotidien, 3 bits et 2 bits en cas de contrainte mémoire, 2bit-lite uniquement quand rien d'autre ne convient — et la génération de code long n'est pas fiable en 2bit-lite. Ce dernier avertissement compte pour un modèle de raisonnement à 320B : c'est le 2bit-lite qui permet d'acheter le Mac 128 Go, et l'impact sur la qualité se fait sentir exactement là où le travail de code fait le plus mal.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

Deux nombres dans cette échelle méritent qu'on y regarde de plus près, car ils décident de toute la question du matériel.

Pourquoi 2bit-lite existe

2bit-lite n'est pas un niveau de qualité supplémentaire — c'est un niveau de taille créé pour une seule raison : le 2-bit standard ne rentre pas. Avec ses ~102 Go de poids, c'est la seule version qui passe sous les ~112 Go de mémoire utilisable d'un Mac 128 Go, et la seule qui tienne dans les 141 Go d'un seul H200 tout en laissant de la place pour un cache KV. La fiche du modèle le dit bien : le 2-bit standard ne rentre pas sur un Mac 128 Go ; 2bit-lite, lui, rentre, avec une limite de mémoire câblée relevée. Sur un H200, il tient « avec ~39 Go restants pour le cache KV » (les mots de la fiche). Ces 39 Go représentent l'intégralité du budget de travail pour tout ce que le modèle fait après le chargement — ce qui nous amène au contexte.

Le coût du cache KV en contexte long

GLM-5.3-Flash dispose d’une fenêtre de contexte de 1 M de jetons, et c’est dans les contextes longs que les plans de mémoire locale échouent. L’attention hybride sparse-plus-linéaire du modèle — NoPE-MLA avec un mécanisme de pool d’indices — est réellement efficace : Z.ai indique qu’elle réduit le calcul d’attention de 3,01× et la taille du cache KV de 4,44× par rapport à son propre GLM-5.3 (chiffres fournis par le fournisseur). Mais « 4,44× plus petit que GLM-5.3 » laisse toujours un cache mesuré en dizaines de GiB lorsque l’on pousse vers un contexte complet de 1 M.

Le meilleur chiffre public dont nous disposons provient d'un déploiement communautaire qui a exécuté le modèle sur quatre nœuds DGX Spark : 16 Gio de cache KV par rang — soit environ 64 Gio au total sur les quatre — pour contenir un contexte complet de 1 M de jetons, dimensionné pour prendre en charge quelques requêtes simultanées en contexte complet. C'est plus que le budget mémoire total de la plupart des machines individuelles, avant même un seul poids. Sur un seul H200, le calcul est l'objet de cette page : 2bit-lite laisse environ 39 Go pour tout le reste après les poids — confortable pour une courte conversation, mais épuisé en quelques minutes à mesure que le contexte approche des 100 000 jetons.

La règle pratique : la colonne min-RAM suppose un contexte raisonnable. Si votre charge de travail exécute de longs documents, des boucles d'agent ou du code à l'échelle d'un dépôt, prévoyez de la mémoire pour le cache KV en plus — et pour tout ce qui approche 1 million de jetons, arrêtez de faire les calculs et utilisez l'API. Ces observations sur le dimensionnement sont des conclusions de la communauté ; il n'existe pas de recommandation du fournisseur pour le budget du cache KV.

La limite de mémoire filaire de macOS : pourquoi un Mac de 128 Go ne parvient toujours pas à charger

La panne la plus courante signalée par les praticiens n’est pas « pas assez de RAM ». C’est un Mac de 128 Go avec un modèle d’environ 102 Go qui refuse de se charger. La cause est la limite de mémoire câblée de macOS. Sur Apple Silicon, le GPU ne peut pas adresser toute la mémoire unifiée : Metal expose un « ensemble de travail maximal recommandé » d’environ deux tiers de la RAM physique, et les allocations au-delà échouent même lorsque la machine dispose de mémoire libre.

Ainsi, le budget Metal par défaut d’un Mac de 128 Go se situe quelque part dans la plage de 80 à 90 Go — en dessous de ce dont la version 2bit-lite a besoin (~112 Go de RAM minimale avec un modèle résident d’environ 102 Go). Le chargement échoue sur le budget Metal, pas sur la capacité de RAM. Le correctif dans tous les retours de praticiens que nous avons trouvés est le même : augmenter la limite câblée avec sudo sysctl iogpu.wired_limit_mb=…, en définissant une valeur supérieure à l’empreinte totale du modèle en Mo, et s’attendre à ce qu’elle se réinitialise au redémarrage. Certains guides communautaires définissent également la limite câblée depuis Python via mlx.metal.set_wired_limit() afin que les poids du modèle soient épinglés et que macOS cesse de compresser les pages Metal inactives.

Encore un hic : les runtimes se comportent différemment. MLX applique le budget Metal et échoue sèchement lorsqu’il est dépassé, tandis que les runtimes basés sur llama.cpp (le chemin GGUF) ne l’appliquent généralement pas et laissent macOS utiliser le swap à la place. C’est pourquoi le même modèle peut refuser de se charger dans un runtime et « se charger » dans un autre — et pourquoi un modèle swappé peut être lent au point d’être inutilisable. Ce sont des constatations de la communauté sur le comportement de macOS, et non des recommandations d’Apple.

L'alternative hébergée : z-ai/glm-5.3-flash

Pour tous ceux que les chiffres ci-dessus excluent — c’est-à-dire la plupart des gens — Z.ai sert le modèle lui-même sous le nom z-ai/glm-5.3-flash, et c’est là que le « Flash » dans le nom se manifeste réellement. Le prix catalogue de Z.ai est de $0.15 par million de jetons d’entrée, $0.03 par million de jetons d’entrée en cache, et $0.50 par million de jetons de sortie ; une promotion de lancement court jusqu’au 9 septembre 2026, à $0.075 / $0.015 / $0.25 (tarifs fournis par le vendeur, en vigueur au moment de la rédaction). L’entrée en cache à un cinquième de l’entrée fraîche est le levier de coût le plus important : toute charge de travail avec un préfixe réutilisable — invites système, définitions d’outils, longs documents partagés — devrait atteindre le tarif de lecture en cache.

Le calcul de la mémoire doit faire partie de la décision. Servir vous-même un modèle de 320B signifie lui dédier 112 à 320 Go de mémoire, qu'il soit inactif ou saturé. Le point de terminaison hébergé déplace tout cela hors de vos machines, et aux prix promotionnels de lancement, le modèle coûte moins cher par jeton que de nombreux modèles dix fois plus petits — ce qui est tout l'intérêt d'un MoE à 18B actifs.

C'est aussi l'endroit naturel pour le point de routage. Grâce à OrcaRouter, z-ai/glm-5.3-flash fait partie des 200+ modèles derrière une API unique, au prix catalogue du fournisseur avec une marge de 0 % — ainsi, la promotion de lancement, et toute future baisse de prix, sont en vigueur le jour même de leur annonce. Le basculement automatique signifie qu'un modèle vieux de trois jours avec un chemin de service instable n'est pas un pari sur votre stack de production : si le fournisseur rencontre une erreur ou est saturé, la requête bascule vers un fournisseur sain au lieu d'échouer. Essayer un modèle non éprouvé en toute sécurité, c'est exactement à cela que sert un routeur.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

FAQ

Puis-je exécuter GLM-5.3-Flash sur une RTX 5090 ?

Non. La plus petite version pèse environ 102 Go de poids à elle seule, et une RTX 5090 a 32 Go de VRAM. Aucun GPU grand public ne s'en approche ; le modèle nécessite des Mac à mémoire unifiée, un seul H200, ou un serveur multi-GPU.

Est-ce que 18B actif signifie que GLM-5.3-Flash fonctionne sur du matériel grand public ?

Non. Le chiffre de 18B actifs correspond au calcul par token. Les 320B paramètres restent tous en mémoire, car le routeur ne peut pas savoir de quels experts un token a besoin avant de le voir. Le MoE économise du calcul, pas de la mémoire.

Quel est le moyen le moins cher d'essayer GLM-5.3-Flash ?

L’API hébergée, z-ai/glm-5.3-flash. Au prix de lancement promotionnel, elle coûte 0,075 $ par million de jetons d’entrée, et les jetons d’entrée mis en cache coûtent 0,015 $. L’auto-hébergement de la plus petite version nécessite de lui dédier environ 112 Go de RAM, ce qui n’a de sens que si vous possédez déjà le matériel.

Le résumé honnête : GLM-5.3-Flash est un modèle de classe serveur dans toutes ses versions. Le Mac de 128 Go obtient la seule version qui lui convient — 2bit-lite, avec une limite de mémoire câblée relevée, des contextes courts, et un coût qualité documenté sur le code long. Un seul H200 obtient la même version avec environ 39 Go de marge KV. Le matériel serveur, lui, dispose de la vraie échelle, de la 4-bit par défaut jusqu’à la 6-bit quasi sans perte. Et pour tous les autres — la plupart des lecteurs — l’endpoint hébergé z-ai/glm-5.3-flash est la bonne réponse, et les chiffres ci-dessus en sont la raison, pas une liste de courses. Pour l’installation pas à pas sur un MacBook Pro, notre guide d’installation MacBook couvre l’ensemble du processus de bout en bout ; pour savoir comment les versions quantifiées se comparent en qualité et quand choisir chacune, le guide de build MLX donne le détail ; et la couverture de la sortie apporte le contexte de lancement et les affirmations de benchmarks.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement