
Comment exécuter GLM-5.3-Flash sur un MacBook Pro : le guide MLX 2bit-Lite
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Exécuter GLM-5.3-Flash sur un MacBook Pro signifie une seule machine exactement : un MacBook Pro M4/M5 Max à 128 Go exécutant la version 2bit-lite de notre conversion MLX, avec la limite de mémoire filaire de macOS relevée. Si votre MacBook Pro a moins de 128 Go — un M4 Pro à 36 Go, un M4 Max à 48 Go — ce guide n'est pas pour vous ; passez à la dernière section et utilisez plutôt l'API hébergée z-ai/glm-5.3-flash. GLM-5.3-Flash (poids sur zai-org/GLM-5.3-Flash) est le modèle Mixture-of-Experts à 320 milliards de paramètres de Z.ai, avec 18B actifs par jeton — publié le 26 août 2026, le premier GLM-5 nativement multimodal — et même la plus petite version de notre portage MLX nécessite ~102 Go de poids et ~112 Go de mémoire. C'est tout le marché, et nous n'allons pas l'atténuer.
Il s'agit d'une documentation de première main, et non d'un article de lancement : les poids ci-dessous sont la propre compilation d'OrcaRouter (orcarouter/GLM-5.3-Flash-MLX, MIT), produite avec notre méthode de quantification OrcaSAQ sans calibration. Nous l'avons publiée le 26 août et avons publiquement corrigé le tir le lendemain, car la plage de quantification d'origine ne rendait pas pratique l'utilisation sur MacBook Pro pour la plupart des gens — la compilation 2 bits standard nécessitait encore ~160 Go, ce qu'aucun ordinateur portable ne possède. Le 27 août, nous avons reconstruit la variante la plus petite sous le nom 2bit-lite spécifiquement pour tenir sur un MacBook Pro de 128 Go, et cet article est le compte rendu honnête de ce que cela vous apporte et de ce que cela coûte. Chaque nombre marqué note de terrain ci-dessous a été mesuré lors de notre exécution de vérification sur un seul H200 ; rien ici n'est un benchmark de fournisseur. Là où nous reprenons des pratiques de la communauté — la commande de mémoire câblée, le versionnage mlx-vlm — nous les identifions comme telles.
Quelle version correspond à quel Mac (à lire avant de télécharger quoi que ce soit)
Les cinq builds du dépôt correspondent chacun à une quantité minimale de RAM. Sur un MacBook Pro, la question « quel build » a exactement une réponse — tout ce qui est au-dessus de 2bit-lite relève de la conversation Mac Studio :
• 6-bit — ~296 Go de poids / ~320 Go de RAM / quasi sans perte. Mac Studio avec 512 Go uniquement.
• 4 bits — ~204 Go / ~224 Go / notre valeur par défaut recommandée. Mac Studio 256 Go. C'est ce que reflète la racine du dépôt.
• 3-bit — ~184 Go / ~200 Go. Mac Studio 256 Go.
• 2-bit — ~145 Go / ~160 Go. Mac Studio 192 Go. C'était le plus petit build que nous ayons livré le jour du lancement, et c'était l'erreur.
• 2bit-lite — ~102 Go / ~112 Go. La seule version qui tient sur une machine de 128 Go — un MacBook Pro M4/M5 Max de 128 Go, ou un Mac Studio ou un Mac mini de 128 Go. Tout ordinateur portable Apple Silicon de 128 Go (M3 Max ou plus récent) suit la même logique, juste plus lentement.
Le piège caché dans cette échelle : la commande de téléchargement par défaut du README récupère la version 4 bits (~204 Go), qui est le bon choix par défaut pour une machine de 256 Go et inutile sur un ordinateur portable. Si vous suivez la commande par défaut sur un MacBook Pro, vous vous retrouvez avec un modèle qui ne s'allouera pas. Le chemin 2bit-lite nécessite explicitement un --include, décrit ci-dessous.
Il existe aussi un plafond dur que vous atteindrez avant même que les calculs ci-dessus ne s'appliquent. macOS ne permet pas à un processus de s'emparer de toute la mémoire unifiée d'un Mac de 128 Go ; le plafond par défaut utilisable par le GPU est d'environ 91–96 Go (valeur obtenue par rétro-ingénierie communautaire et corroborée dans plusieurs articles sur des configurations MLX de grands modèles). Cela est inférieur aux ~102 Go de poids à eux seuls, donc même la version 2bit-lite ne se chargera pas tant que vous n'aurez pas relevé la limite de mémoire câblée. Cette étape est obligatoire, et elle est traitée à la Section 4.
Installez mlx-vlm — et seulement mlx-vlm.
GLM-5.3-Flash est un modèle vision-langage, donc il fonctionne sous mlx-vlm, pas mlx-lm. C'est la façon la plus courante de rester coincé, alors dis-le d'emblée : mlx-lm est pour les modèles texte uniquement ; exécuter un modèle multimodal via celui-ci produit une erreur de chargement déroutante. Installez le package VLM en version 0.6.17 ou supérieure :
pip install -U "mlx-vlm>=0.6.17"
L'épinglage de version n'est pas là pour faire joli. glm5_next — l'architecture hybride d'attention éparse-plus-linéaire derrière GLM-5.3-Flash — n'a été intégré à mlx-vlm que le jour même de la sortie du modèle (26 août 2026), et toute version antérieure ne reconnaîtra pas la config. L'architecture compte pour une seconde raison : c'est une topologie entièrement nouvelle, et les ports de la première vague présentaient de véritables bugs de correction que des sorties fluides ne révéleraient pas. Un audit communautaire du runtime du premier chemin MLX de glm5_next en a trouvé et corrigé quatre — un clamp SwiGLU non appliqué sur chaque bloc FFN, des tenseurs d'hyper-connexion contraints par une variété convertis au mauvais dtype (ce qui corrompait silencieusement la matrice de mélange de l'attention), deux discordances d'epsilon dans les normes d'attention, et des logits de routeur en bf16 là où la référence utilise float32. Après les corrections, les résultats numériques correspondaient à la référence à environ 1e-7. Ce qu'il faut retenir : gardez mlx-vlm à jour et méfiez-vous de la toute première version de tout port d'une nouvelle architecture.
Téléchargez les poids : les drapeaux d'exclusion, et l'inclusion dont vous avez réellement besoin.
La racine du dépôt reflète la build 4-bit, et les cinq variantes sont fournies dans des sous-dossiers. La commande par défaut télécharge la racine et utilise --exclude afin qu'aucun des cinq dossiers de variantes (qui représentent au total environ 800 Go) ne soit téléchargé :
hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"
Sur un MacBook Pro, cette commande est erronée pour vous — elle vous donne la racine 4 bits. Pour un ordinateur portable de 128 Go, ne récupérez que le 2bit-lite sous-dossier :
hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX
C'est le téléchargement d'environ 102 Go, et il est autonome — le dossier 2bit-lite/ contient son propre config.json, donc vous pointez le générateur directement dessus. Si hf n'est pas dans votre PATH, installez-le : pip install -U huggingface_hub. Avant de commencer, vérifiez que vous avez environ 110 Go d'espace disque libre et que le stockage de votre Mac n'est pas sur ses derniers 100 Go libres — MLX mappe les poids en mémoire, et c'est avec un SSD presque plein que ces configurations meurent en plein téléchargement.

Augmenter la limite de mémoire câblée — l'étape que tout le monde oublie
C'est l'étape décisive sur un MacBook Pro de 128 Go, et la carte README suppose que vous la connaissez plutôt que de vous donner la commande explicitement. Le plafond par défaut de l'ensemble de travail Metal sur un Mac de 128 Go est d'environ 91 à 96 Go, ce qui est inférieur aux ~102 Go des poids 2bit-lite — donc sans cette étape, le modèle ne parvient pas à allouer la mémoire et le chargement échoue. La solution standard de la communauté est un sysctl qui relève le plafond de mémoire câblée du GPU en mégaoctets :
sudo sysctl iogpu.wired_limit_mb=114688
Cela fixe un plafond d'environ 112 Go, laissant environ 14 Go de réserve pour le système d'exploitation. Sur les machines de 128 Go, les valeurs observées dans la communauté vont d'environ 114688 (112 Go) à 122880 (120 Go) ; ne le réglez pas au maximum — macOS a besoin d'une marge, sinon vous aurez des saccades du serveur de fenêtres et un système qui hoquette sous la pression mémoire. Après l'avoir défini, chargez le modèle et surveillez le moniteur d'activité : si la pression mémoire passe au jaune, réduisez la valeur.
Deux remarques pratiques, toutes deux issues de la pratique de la communauté plutôt que de nos notes de terrain. Premièrement, le paramètre sysctl est réinitialisé au redémarrage et ne s'applique qu'à la session terminal dans laquelle vous l'avez défini ; prévoyez donc de le relancer (ou de le scripter via un LaunchAgent) — l'oublier après un redémarrage est l'échec classique du « ça marchait hier ». Deuxièmement, MLX expose également un paramètre interne au processus, mlx.core.metal.set_wired_limit(bytes), sur macOS 15.0 et versions ultérieures ; il doit rester sous le plafond sysctl, et c'est l'option la plus portable si vous scriptez un notebook. Quelle que soit l'option choisie, l'effet est le même : sans cela, rien ne fonctionne ici.
Exécutez-le : texte, image et l'API Python.
Avec les poids en place et la limite relevée, la génération se fait en une seule commande. Texte :
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Expliquez l'intrication quantique en une phrase." --max-tokens 256
L'entrée d'images fonctionne de la même manière avec une option --image — c'est là que le modèle multimodal montre sa valeur sur un ordinateur portable, car la tour de vision reste à plus haute précision dans la configuration OrcaSAQ :
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Décris cette image." --max-tokens 256
Pour un script, l'API Python a la même forme que celle que connaissent les utilisateurs de mlx-vlm :
from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Décris cette image.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))
Gardez --max-tokens modeste. D'après nos notes de terrain du run H200, 2bit-lite tient environ 10 tok/s, donc une réponse de 1 024 jetons représente déjà une attente de deux minutes — et c'est sur les sorties longues que le budget KV et l'effondrement de la qualité se font sentir (ci-dessous). Sur un ordinateur portable, attendez-vous à ce que ce soit plus lent, pas plus rapide, jusqu'à ce qu'une valeur mesurée soit disponible.
Quelle qualité vous obtenez réellement (l'échelle mesurée)
Voici la partie honnête du manuel, et nous n'allons pas l'enjoliver. OrcaSAQ se dégrade gracieusement jusqu'à 3 bits, puis le coût grimpe rapidement. Par rapport à la référence FP8 (perplexité 2,7797) :
• 6-bit — perplexité de 2,7864 (+0,24 %), accord de token top-1 à 97,76 %. Quasi sans perte, comme annoncé.
• 4-bit — perplexité 2.8620 (+2.96%), top-1 96.13%. Le réglage par défaut recommandé.
• 3-bit — perplexité 3.0566 (+9.96%), top-1 92.06%. Agressif mais utilisable.
• 2-bit — perplexité 4,3622 (+56,9 %), top-1 86,56 %. Un vrai coût.
• 2bit-lite — perplexité 6.7018 (+141%), top-1 77.19%. La plus petite version, et la seule qu'un MacBook Pro peut contenir.
Ce sont des chiffres mesurés à partir de notre propre pipeline de conversion. 2bit-lite présente une régression de perplexité de 141 % et un accord de token top-1 inférieur à 78 % — vous exécutez un modèle visiblement dégradé, et les modes de défaillance ci-dessous sont ce à quoi cette dégradation ressemble en pratique. C'est une démonstration brillante et un assistant de forme courte raisonnable ; ce n'est pas un substitut au modèle en pleine précision.
En matière de rapidité, nous vous devons la même honnêteté. La note de terrain publiée correspond au H200 : ~10 tok/s, stable en multi-tours, convient pour les questions-réponses courantes et les textes courts. Nous n'avons pas encore de chiffre mesuré pour la version 2bit-lite sur MacBook Pro, et nous n'allons pas en inventer un — le débit sur Apple Silicon dépend ici de la bande passante mémoire, de la thermique et de la couverture des kernels MLX pour l'attention hybride, aucun de ces éléments n'ayant été mesuré pour cette version sur ce portable. Le point de données Apple Silicon publié le plus proche auquel nous pouvons vous renvoyer est un ~450 tok/s indépendant pour une version 4-bit de GLM-5.3-Flash sur un Mac de 512 Go avec un runtime MLX différent — une version différente, une précision différente, et une machine de bureau, donc ne l'interprétez pas non plus comme votre chiffre. Prévoyez de la lenteur ; soyez agréablement surpris si ce n'est pas le cas.
Cache KV et contexte long : attention à la marge de manœuvre
GLM-5.3-Flash annonce une fenêtre de contexte de 1 million de jetons. Ce nombre n'a aucune importance sur ce matériel, et un guide qui prétendrait le contraire vous rendrait un mauvais service. La note de terrain tient en une ligne : donnez au runtime un budget KV suffisant pour la longueur cible. Sur un seul H200, la version 2bit-lite laisse environ 39 Go de marge pour le cache KV une fois les poids chargés. Sur un MacBook Pro de 128 Go, l'arithmétique est plus sévère : environ 102 Go de poids pour un plafond d'environ 112 Go laissent environ 26 Go avant même de compter l'ensemble de travail de macOS — et les couches hybrides à attention linéaire rendent l'empreinte KV de ce modèle faible par rapport à un modèle dense de cette taille, mais elle croît néanmoins linéairement avec le contexte.
Les recommandations côté serveur de la communauté au sens large corroborent ce point : une configuration qui se charge correctement avec un contexte de 8K peut épuiser la mémoire à 128K. Sur l’ordinateur portable, gardez des contextes courts — quelques milliers de jetons de questions-réponses ou une seule image — et n’essayez pas de lui faire avaler un livre. Dès qu’une charge de travail nécessite réellement un long contexte, vous vous trouvez dans la dernière section de cet article.
La génération de code long n'est pas fiable avec 2bit-lite (lisez ceci deux fois)
Voici la section qu’un guide pratique qui cache ses modes de défaillance serait inutile sans, donc elle mérite son propre titre. Les notes de terrain du H200 sont sans ambiguïté : les questions-réponses courantes et les textes courts donnent de bons résultats, et la génération de code long n’est pas fiable à cette précision. Trois modes de défaillance reproduits lors de notre exécution de vérification :
• Boucles de répétition — le modèle commence à répéter les mêmes lignes ou blocs au lieu de progresser, généralement après quelques centaines de jetons.
• Code de colle manquant — imports, câblage et gestion d'erreurs silencieusement omis. La fonction générée semble correcte isolément et ne s'exécute pas, car l'échafaudage environnant est tout simplement absent.
• Churn de réécriture — au lieu d'une modification minimale, le modèle réécrit de grandes parties d'un fichier, et les sorties des tours successifs ne concordent pas entre elles.
Ces phénomènes sont reproductibles avec 2bit-lite, et ce sont précisément les choses que prédit une concordance top-1 de 77 %. Ce que font réellement les praticiens qui gardent la version portable à portée de main :
• Utilisez-le pour l'explication, le résumé, les questions-réponses et la compréhension d'images — des tâches courtes où il est réellement bon.
• Si vous devez demander du code, demandez une petite fonction à la fois avec une signature explicite, et vérifiez chacune avant de continuer. Ne lui donnez pas un fichier entier et ne lui demandez pas une fonctionnalité.
• Pour tout ce qui est long — un module complet, une refactorisation, une longue session d'agent — acheminez vers l'API de pleine précision. Ce n'est pas un contournement ; c'est l'architecture correcte, et c'est la dernière section.
Quand ne pas faire cela du tout : appelez z-ai/glm-5.3-flash à la place

La règle de décision honnête : exécutez 2bit-lite sur un MacBook Pro M4/M5 Max de 128 Go uniquement lorsque vous voulez spécifiquement un modèle multimodal de 320B sur un ordinateur portable que vous pouvez transporter — Q&R hors ligne, documents privés, compréhension d’images sans que rien ne quitte la machine. Choisissez l’API pour tout le reste :
• Tout MacBook Pro de moins de 128 Go — aucune version n'est disponible pour vous. N'essayez pas de la charger ; utilisez l'API.
• Génération de code long ou raisonnement en contexte long — 2bit-lite échoue systématiquement sur ce point précis. Utilisez l'API.
• Travail sensible à la qualité — 77,19 % d’accord top-1 et +141 % de perplexité sont une vraie chute, pas une erreur d’arrondi. Utilisez l’API.
• Débit garanti ou latence prévisible — aucun chiffre mesuré sur ordinateur portable n'existe encore, et la note de terrain est de 10 tok/s. Utilisez l'API.

Le modèle hébergé est z-ai/glm-5.3-flash, servi en pleine précision sur OrcaRouter au tarif actuel de Z.ai — 0,07 $ par million de jetons en entrée et 0,25 $ par million de jetons en sortie au moment où j'écris ces lignes (tarif de lancement ; le tarif publié par Z.ai est de 0,15 $ / 0,50 $). Il s'agit du prix communiqué par le fournisseur, et il est répercuté sans marge, donc une baisse de prix chez Z.ai se reflète chez nous le jour même. Vous obtenez une clé API qui donne également accès aux 200+ autres modèles que nous acheminons, et le basculement automatique fait qu'une expérience avec ce nouveau modèle ne mise pas votre chemin de production sur un seul fournisseur. Dans le temps qu'il faut pour télécharger 102 Go et attendre la première génération à froid, l'API a déjà répondu à une semaine de questions — et elle y répond en pleine précision.
L'inférence locale vaut la peine lorsque la raison est locale — confidentialité, travail hors ligne, aucune limite de débit, une démo qui fonctionne sur batterie. Elle ne vaut pas la peine sur le plan du coût ou de la qualité pour toute autre raison, et elle ne vaut pas la peine du tout sur une machine de moins de 128 Go.
FAQ
Un Mac de 64 Go ou 96 Go peut-il exécuter GLM-5.3-Flash localement ? Non. La plus petite version, 2bit-lite, nécessite environ 112 Go minimum après les frais généraux de macOS, et même une machine de 128 Go doit augmenter la limite de mémoire câblée pour la charger. Si votre Mac a moins de 128 Go, la voie locale n'existe pas ; utilisez plutôt z-ai/glm-5.3-flash via l'API.
J'ai installé mlx-vlm et le modèle ne charge pas — quel est le problème ? Les deux causes habituelles, dans l'ordre : une version antérieure à 0.6.17, qui précède la prise en charge de glm5_next et ne reconnaîtra pas l'architecture ; et la limite de mémoire câblée non relevée, car la version d'environ 102 Go ne peut pas allouer sous le plafond Metal par défaut d'environ 91 à 96 Go sur un Mac de 128 Go. Corrigez les deux (mettez à jour le paquet, exécutez sysctl) et le modèle se chargera.
Le build local 2bit-lite est-il le même modèle que l'API z-ai/glm-5.3-flash ? Mêmes poids GLM-5.3-Flash sous-jacents, mais pas la même qualité. 2bit-lite est une quantification 2 bits avec une concordance de token top-1 de 77,19 % par rapport à la référence FP8, et la génération de code long n'est pas fiable. L'API fournit la pleine précision. Ils ne sont interchangeables que pour des tâches courtes et peu exigeantes en qualité.
La version de 30 secondes
Une machine, une compilation, un sysctl obligatoire. Si vous avez un MacBook Pro M4/M5 Max de 128 Go : installez mlx-vlm>=0.6.17, téléchargez uniquement 2bit-lite/ (~102 Go), augmentez la limite de mémoire câblée avec sudo sysctl iogpu.wired_limit_mb=114688, et exécutez mlx_vlm.generate — pour les questions-réponses, les textes courts et les images. Acceptez que la génération de code long ne soit pas fiable à cette précision, qu'il n'y ait pas encore de débit mesuré sur ordinateur portable, et qu'un Mac de 128 Go soit le minimum, pas la norme. Si l'un de ces avertissements est rédhibitoire — ou si votre Mac a moins de 128 Go — le même modèle en pleine précision est à un appel API sur z-ai/glm-5.3-flash.
Pas sur un Mac de 128 Go ? z-ai/glm-5.3-flash sert le même modèle en pleine précision sur OrcaRouter — une seule clé API, les tarifs fournisseurs répercutés avec 0 % de marge, et pas de téléchargement de 102 Go.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
