Hero-titelkaart voor het artikel 'How to Run GLM-5.3-Flash on a MacBook Pro' met de ondertitel 'The 2bit-Lite MLX Playbook', met daarop een gestileerde MacBook Pro met een zacht neuraalnetwerkmotief boven het toetsenbord en drie chips met de labels '2bit-lite', '~102 GB' en '128 GB Mac'.
Guides & Insights

Hoe voer je GLM-5.3-Flash uit op een MacBook Pro: Het 2bit-Lite MLX-draaiboek

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het draaien van GLM-5.3-Flash op een MacBook Pro betekent exact één machine: een 128 GB M4/M5 Max MacBook Pro met de 2bit-lite build van onze MLX-conversie, met de verhoogde wired-memory-limiet van macOS. Als je MacBook Pro minder dan 128 GB heeft — een 36 GB M4 Pro, een 48 GB M4 Max — dan is dit playbook niets voor jou; ga naar het laatste gedeelte en gebruik in plaats daarvan de gehoste z-ai/glm-5.3-flash API. GLM-5.3-Flash (gewichten op zai-org/GLM-5.3-Flash) is het Mixture-of-Experts-model van Z.ai met 320 miljard parameters en 18B actieve parameters per token — uitgebracht op 26 augustus 2026, de eerste native multimodale GLM-5 — en zelfs de kleinste build van onze MLX-port heeft ~102 GB aan gewichten en ~112 GB aan geheugen nodig. Dat is de hele markt, en we gaan het niet verzachten.

Dit is documentatie van eigen hand, geen lanceringsartikel: de onderstaande gewichten zijn de build van OrcaRouter zelf (orcarouter/GLM-5.3-Flash-MLX, MIT), geproduceerd met onze kalibratievrije OrcaSAQ-kwantiseringsmethode. We hebben het op 26 augustus uitgebracht en de volgende dag publiekelijk onze koers bijgesteld, omdat het oorspronkelijke kwantiseringsbereik het gebruik op een MacBook Pro voor de meeste mensen niet praktisch maakte — de reguliere 2-bit-build had nog steeds ~160 GB nodig, wat geen enkele laptop heeft. Op 27 augustus hebben we de kleinste variant herbouwd als 2bit-lite specifiek om in een MacBook Pro met 128 GB te passen, en dit stuk is de eerlijke weergave van wat dat je oplevert en wat het kost. Elk getal gemarkeerd met veldnotitie hieronder is gemeten op onze verificatierun met één H200; niets hier is een leveranciersbenchmark. Waar we communitypraktijk herhalen — de wired-memory-opdracht, mlx-vlm-versiebeheer — labelen we die als zodanig.

Welke build past bij welke Mac (lees dit voordat je iets downloadt)

De vijf builds in de repo komen elk overeen met een minimaal RAM-getal. Op een MacBook Pro heeft "welke build" precies één antwoord — alles boven 2bit-lite is een Mac Studio-aangelegenheid:

6-bit — ~296 GB aan gewichten / ~320 GB RAM / nagenoeg verliesvrij. Alleen Mac Studio met 512 GB.

4-bit — ~204 GB / ~224 GB / onze aanbevolen standaard. Mac Studio 256 GB. Dit is wat de repo-root weerspiegelt.

3-bit — ~184 GB / ~200 GB. Mac Studio 256 GB.

2-bit — ~145 GB / ~160 GB. Mac Studio 192 GB. Dit was de kleinste build die we op dag één uitbrachten, en dat was de misser.

2bit-lite — ~102 GB / ~112 GB. De enige build die op een 128 GB-machine past — een 128 GB M4/M5 Max MacBook Pro, of een 128 GB Mac Studio of Mac mini. Elke 128 GB Apple Silicon-laptop (M3 Max of nieuwer) is hetzelfde verhaal, alleen langzamer.

De valkuil die in die ladder schuilgaat: het standaard downloadcommando van de README downloadt de 4-bit build (~204 GB), wat de juiste standaard is voor een 256 GB-machine en nutteloos op een laptop. Als je het standaardcommando op een MacBook Pro volgt, krijg je een model dat niet zal alloceren. Het 2bit-lite pad vereist een expliciete --include, hieronder behandeld.

Er is ook een harde bovengrens waar je tegenaan loopt voordat de bovenstaande berekening zelfs maar van toepassing is. macOS laat een proces niet het volledige unified memory van een 128 GB Mac opeisen; de standaard GPU-bruikbare limiet is ongeveer 91–96 GB (door de community reverse-engineered en bevestigd in verschillende artikelen over MLX-opstellingen met grote modellen). Dat is minder dan de ~102 GB die alleen de gewichten al innemen, dus zelfs 2bit-lite zal niet laden totdat je de wired-memory limiet verhoogt. Die stap is verplicht, en dat is Sectie 4.

Installeer mlx-vlm — en alleen mlx-vlm.

GLM-5.3-Flash is een visueel-taalmodel, dus het draait onder mlx-vlm, niet mlx-lm. Dit is veruit de meest voorkomende manier waarop mensen vastlopen, dus zeg het vroeg: mlx-lm is voor tekst-only modellen; het draaien van een multimodaal model ermee geeft een verwarrende laadfout. Installeer het VLM-pakket op versie 0.6.17 of hoger:

pip install -U "mlx-vlm>=0.6.17"

De versie-pin is geen versiering. glm5_next — de hybride sparse-plus-linear-attention architectuur achter GLM-5.3-Flash — verscheen pas in mlx-vlm op dezelfde dag dat het model uitkwam (26 augustus 2026), en alles wat ouder is zal de config niet herkennen. De architectuur is om een tweede reden van belang: dit is een gloednieuwe topologie, en de eerste golf ports bevatte echte correctheidsbugs die vloeiende output niet zouden onthullen. Een community-runtime-audit van het vroege glm5_next MLX-pad vond en repareerde er vier — een niet-toegepaste SwiGLU-clamp op elk FFN-blok, manifold-beperkte hyper-connectietensoren die naar het verkeerde dtype werden gecast (wat de attention-mixmatrix stilzwijgend beschadigde), twee epsilon-mismatches in de attention-normen, en bf16-router-logits waar de referentie float32 gebruikt. Na de fixes kwamen de numerieke resultaten overeen met de referentie tot ongeveer 1e-7. De les voor jou: houd mlx-vlm actueel en behandel de allereerste release van een port van een nieuwe architectuur met wantrouwen.

Download de gewichten: de exclude-vlaggen, en de include die je daadwerkelijk nodig hebt.

De repository-hoofdmap spiegelt de 4-bit build, en alle vijf varianten worden als submappen geleverd. Het standaardcommando downloadt de hoofdmap en gebruikt --exclude zodat geen van de vijf variantmappen (die samen ongeveer 800 GB groot zijn) meekomen:

hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"

Op een MacBook Pro is dat commando voor jou verkeerd — het geeft je de 4-bit root. Haal voor een laptop van 128 GB alleen de 2bit-lite submap op:

hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX

Dat is de download van ~102 GB, en het is zelfvoorzienend — de 2bit-lite/ map bevat zijn eigen config.json, dus je wijst de generator er direct naartoe. Als hf niet op je PATH staat, installeer het dan: pip install -U huggingface_hub. Controleer voordat je begint dat je ~110 GB vrije schijfruimte hebt en dat je Mac niet op de laatste vrije 100 GB zit — MLX mapt de gewichten in het geheugen, en een bijna volle SSD is hoe deze opstellingen halverwege de download sneuvelen.

Screenshot of the Hugging Face repository card for orcarouter/GLM-5.3-Flash-MLX showing the title, the tagline 'An MLX build of the official GLM-5.3-Flash — 2bit-lite / 2 / 3 / 4 / 6-bit OrcaSAQ quant for Apple Silicon & MLX', and the model tags glm5_next, Apple Silicon, quantized 2-8bit, Mixture of Experts, vision-language and MIT

Verhoog de limiet van het wired-geheugen — de stap die iedereen vergeet.

Dit is de beslissende stap op een 128 GB MacBook Pro, en de README-kaart gaat ervan uit dat je dit weet, in plaats van het commando letterlijk uit te schrijven. Het standaard Metal-werksetplafond op een 128 GB Mac ligt op ruwweg 91–96 GB, wat onder de ~102 GB aan 2bit-lite-gewichten zit — dus zonder deze stap kan het model geen geheugen toewijzen en loopt het laden vast. De community-standaardoplossing is een sysctl die het plafond voor GPU-wired-geheugen in megabytes verhoogt:

sudo sysctl iogpu.wired_limit_mb=114688

Dat stelt een plafond van ~112 GB in, waardoor er ongeveer 14 GB overblijft als reserve voor het besturingssysteem. Op machines met 128 GB variëren de community-waarden in de praktijk van ~114688 (112 GB) tot ~122880 (120 GB); zet het niet op het maximum — macOS heeft ruimte nodig, anders krijg je haperingen van de window-server en het systeem onder geheugendruk. Laad na het instellen het model en houd de Activiteitsmonitor in de gaten: als de geheugendruk geel wordt, verlaag dan het getal.

Twee praktische opmerkingen, beide uit de communitypraktijk in plaats van onze veldnotities. Ten eerste: de sysctl wordt gereset bij het herstarten en geldt voor de terminalsessie waarin je hem instelt, dus plan om hem opnieuw uit te voeren (of script hem via een LaunchAgent) — het vergeten na een herstart is de klassieke 'het werkte gisteren'-fout. Ten tweede biedt MLX ook een in-process knop, mlx.core.metal.set_wired_limit(bytes), op macOS 15.0 en nieuwer; het moet onder het sysctl-plafond blijven, en het is de meer portabele optie als je een notebook script. Welke je ook gebruikt, het effect is hetzelfde: zonder dit werkt hier niets.

Voer het uit: tekst, afbeelding en de Python-API.

Nu de gewichten op hun plaats zitten en de limiet is verhoogd, is generatie één commando. Tekst:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Leg kwantumverstrengeling uit in één zin." --max-tokens 256

Beeldinvoer werkt op dezelfde manier met een --image-vlag — dit is waar het multimodale model zijn waarde bewijst op een laptop, aangezien de vision-toren op hogere precisie blijft in de OrcaSAQ-layout:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Beschrijf deze afbeelding." --max-tokens 256

Voor een script heeft de Python API dezelfde vorm die mlx-vlm-gebruikers kennen:

from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Beschrijf deze afbeelding.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))

Houd --max-tokens bescheiden. Op onze H200-veldnotitierun haalt 2bit-lite ruwweg 10 tok/s, dus een antwoord van 1.024 tokens is al een wachttijd van twee minuten — en lange uitvoer is precies waar het KV-budget en de kwaliteitsinstorting toeslaan (hieronder). Op een laptop moet je verwachten dat het langzamer aanvoelt, niet sneller, totdat er een gemeten cijfer is.

Welke kwaliteit je daadwerkelijk krijgt (de gemeten ladder)

Hier is het eerlijke deel van het draaiboek, en we gaan het niet verbloemen. OrcaSAQ degradeert sierlijk tot 3-bit, waarna de kosten snel oplopen. Ten opzichte van de FP8-referentie (perplexiteit 2.7797):

6-bit — perplexity 2,7864 (+0,24%), top-1 tokenovereenstemming 97,76%. Nagenoeg verliesvrij, zoals aangekondigd.

4-bit — perplexiteit 2,8620 (+2,96%), top-1 96,13%. De aanbevolen standaard.

3-bit — perplexity 3.0566 (+9.96%), top-1 92.06%. Agressief maar bruikbaar.

2-bit — perplexity 4.3622 (+56,9%), top-1 86,56%. Een echte kostenpost.

2bit-lite — perplexity 6.7018 (+141%), top-1 77.19%. De kleinste build, en de enige die in een MacBook Pro past.

Dat zijn gemeten getallen uit onze eigen conversiepipeline. 2bit-lite is een 141% perplexity-regressie en een top-1-tokenovereenkomst onder de 78% — je draait een merkbaar verslechterd model, en de faalwijzen hieronder zijn hoe die verslechtering er in de praktijk uitziet. Het is een briljante demo en een redelijke korte-vorm-assistent; het is geen vervanging voor het full-precision-model.

Op het gebied van snelheid zijn we je dezelfde eerlijkheid verschuldigd. De gepubliceerde veldnotitie is H200: ~10 tok/s, stabiel in multi-turn, alledaagse Q&A en korte teksten prima. We hebben nog geen gemeten cijfer voor MacBook Pro met 2bit-lite, en we gaan er geen verzinnen — de doorvoersnelheid van Apple Silicon hangt hier af van geheugenbandbreedte, thermisch gedrag en MLX-kerneldekking voor de hybride attention, waarvan we geen enkele voor deze build op deze laptop hebben gemeten. Het dichtstbijzijnde gepubliceerde Apple Silicon-datapunt waarnaar we je kunnen verwijzen, is een onafhankelijke ~450 tok/s voor een 4-bit GLM-5.3-Flash-build op een 512 GB Mac onder een andere MLX-runtime — een andere build, een andere precisie en een desktopmachine, dus zie het ook niet als jouw cijfer. Reken op traag; wees aangenaam verrast als dat niet zo is.

KV-cache en lange context: let op de headroom

GLM-5.3-Flashadverteert met een contextvenster van 1M tokens. Dat getal is irrelevant op deze hardware, en een how-to die anders beweert, zou je een slechte dienst bewijzen. De veldnotitie is één regel: geef de runtime voldoende KV-budget voor je beoogde lengte. Op een enkele H200 laat 2bit-lite na het laden van de gewichten ongeveer 39 GB vrije ruimte over voor de KV-cache. Op een MacBook Pro met 128 GB is de rekensom zwaarder: ~102 GB aan gewichten tegen een plafond van ~112 GB laat in de orde van 26 GB over vóór het eigen werkset van macOS — en de hybride linear-attention-lagen maken de KV-voetafdruk van dit model klein ten opzichte van een dense model van deze omvang, maar het groeit nog steeds lineair met de context.

Advies over server-side gebruik vanuit de bredere gemeenschap bevestigt dit punt: een configuratie die prima laadt bij een context van 8K kan zonder geheugen komen te zitten bij 128K. Houd op de laptop de contexten kort — een paar duizend tokens voor Q&A of een enkele afbeelding — en probeer er geen boek in te voeren. Zodra een workload echt lange context nodig heeft, zit je in het laatste gedeelte van dit artikel.

Het genereren van lange code is niet betrouwbaar bij 2bit-lite (lees dit twee keer)

Dit is het onderdeel dat een handleiding die zijn faalwijzen verbergt niet zou kunnen missen, dus het krijgt een eigen kop. De H200-veldnotities zijn ondubbelzinnig: alledaagse Q&A en korte tekst komen er goed uit, en lange codegeneratie is niet betrouwbaar op deze precisie. Drie faalwijzen gereproduceerd tijdens onze verificatierun:

Herhalingslussen — het model begint dezelfde regels of blokken te herhalen in plaats van vooruitgang te boeken, meestal na een paar honderd tokens.

Ontbrekende lijmcode — imports, verbindingen en foutafhandeling worden stilzwijgend weggelaten. De gegenereerde functie ziet er in isolatie goed uit, maar draait niet, omdat de omliggende scaffolding eenvoudigweg ontbreekt.

Herschrijf-churn — in plaats van een minimale bewerking herschrijft het model grote delen van een bestand, en opeenvolgende beurten zijn het oneens met elkaars output.

Deze zijn reproduceerbaar bij 2bit-lite, en het zijn precies de dingen die een 77% top-1-overeenkomst voorspelt. Wat beoefenaars die de laptop-build aanhouden, in de praktijk doen:

• Gebruik het voor uitleg, samenvatting, Q&A en beeldbegrip — korte taken waarvoor het echt goed is.

• Als je om code moet vragen, vraag dan om één kleine functie tegelijk met een expliciete handtekening, en controleer elke functie voordat je verdergaat. Geef het niet een heel bestand en vraag om een feature.

• Voor alles wat lang duurt — een volledige module, een refactor, een lange agentsessie — route naar de API met volledige precisie. Dat is geen workaround; het is de juiste architectuur, en het is de laatste sectie.

Wanneer je dit helemaal niet moet doen: roep in plaats daarvan z-ai/glm-5.3-flash aan.

Comparison scoreboard titled 'GLM-5.3-Flash on a Mac — the scoreboard' contrasting the 2bit-lite MLX local build (102 GB weights on disk, 112 GB minimum RAM, +141% perplexity vs FP8, 77.19% top-1 agreement, unreliable long code generation, ~10 tok/s per H200 field note) against the hosted z-ai/glm-5.3-flash API (0 GB on disk, no RAM, FP8 reference quality, reliable long code, datacenter speed), with a footer noting quality is measured by OrcaRouter, speed is an H200 field note, and the API is at Z.ai launch pricing

De eerlijke beslisregel: draai 2bit-lite op een 128 GB M4/M5 Max MacBook Pro alleen wanneer je specifiek een 320B multimodaal model wilt op een laptop die je mee kunt nemen — offline Q&A, privédocumenten, beeldbegrip waarbij niets de machine verlaat. Kies voor al het overige de API:

Elke MacBook Pro met minder dan 128 GB — er is geen build voor jou. Probeer het niet te laden; gebruik de API.

Lange codegeneratie of redeneren met lange contexten — 2bit-lite faalt hier steevast op. Gebruik de API.

Kwaliteitsgevoelig werk — 77,19% top-1-overeenstemming en +141% perplexiteit zijn een echte daling, geen afrondingsfout. Gebruik de API.

Gegarandeerde doorvoer of voorspelbare latentie — er bestaat nog geen gemeten laptopwaarde, en de veldnotitie is 10 tok/s. Gebruik de API.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash showing the model ID, 'by Z.ai - 2026-08-26', a 1M-token context window, text plus image plus video in / text out, 320B total / 18B active parameters, and the input/output price of $0.07 / $0.25 per million tokens

Het gehoste model is z-ai/glm-5.3-flash, aangeboden in volledige precisie op OrcaRouter tegen de huidige prijzen van Z.ai — $0,07 per miljoen invoertokens en $0,25 per miljoen uitvoertokens op het moment van schrijven (introductieprijzen; de gepubliceerde prijslijst van Z.ai is $0,15 / $0,50). Dat is de door de leverancier gerapporteerde prijs, en deze wordt doorberekend met een opslag van 0%, dus een prijsverlaging van Z.ai verschijnt dezelfde dag bij ons. Je krijgt één API-sleutel die ook toegang geeft tot de andere 200+ modellen die wij routeren, en automatische failover betekent dat een experiment met dit nieuwe model jouw productiepad niet afhankelijk maakt van één enkele provider. In de tijd die nodig is om 102 GB te downloaden en te wachten op de eerste koude generatie, heeft de API al een week aan vragen beantwoord — en dat doet zij in volledige precisie.

Lokale inferentie is de moeite waard; de reden is lokaal — privacy, offline werk, geen limieten, een demo die op batterij werkt. Het is niet de moeite waard op basis van kosten- of kwaliteitsberekeningen om welke andere reden dan ook, en het is helemaal niet de moeite waard op een machine met minder dan 128 GB.

Veelgestelde vragen

Kan een Mac met 64 GB of 96 GB GLM-5.3-Flash lokaal draaien?Nee. De kleinste build, 2bit-lite, heeft na macOS-overhead minimaal ongeveer 112 GB nodig, en zelfs een machine met 128 GB moet de limiet voor wired memory verhogen om het te laden. Als je Mac minder dan 128 GB heeft, bestaat het lokale pad niet; routeer z-ai/glm-5.3-flash in plaats daarvan via de API.

Ik heb mlx-vlm geïnstalleerd en het model laadt niet — wat is er mis? De twee gebruikelijke oorzaken, in volgorde: een versie lager dan 0.6.17, die ouder is dan de ondersteuning voor glm5_next en de architectuur niet herkent; en de limiet voor wired geheugen niet is verhoogd, omdat de build van ~102 GB geen geheugen kan toewijzen onder de standaard Metal-limiet van ~91–96 GB op een Mac met 128 GB. Verhelp beide (upgrade het pakket, voer de sysctl uit) en het laadt.

Is de lokale 2bit-lite-build hetzelfde model als de z-ai/glm-5.3-flash API? Dezelfde onderliggende GLM-5.3-Flash-gewichten, maar niet dezelfde kwaliteit. 2bit-lite is een 2-bit kwantisatie met 77,19% top-1 tokenovereenkomst tegenover de FP8-referentie, en lange codegeneratie is onbetrouwbaar. De API serveert volledige precisie. Ze zijn alleen uitwisselbaar voor kort, kwaliteitstolerant werk.

De 30-secondenversie

Eén machine, één build, één verplichte sysctl. Als je een 128 GB MacBook Pro met M4/M5 Max hebt: installeer mlx-vlm>=0.6.17, download alleen 2bit-lite/ (~102 GB), verhoog de limiet voor wired geheugen met sudo sysctl iogpu.wired_limit_mb=114688, en draai mlx_vlm.generate — voor Q&A, korte tekst en afbeeldingen. Accepteer dat het genereren van lange code bij deze precisie niet betrouwbaar is, dat er nog geen gemeten doorvoer op laptops is, en dat een Mac met 128 GB de ondergrens is, niet de norm. Als een van die kanttekeningen een dealbreaker is — of je Mac minder dan 128 GB heeft — dan is hetzelfde model op volledige precisie slechts één API-aanroep verwijderd op z-ai/glm-5.3-flash.

Niet op een Mac met 128 GB? z-ai/glm-5.3-flash serveert hetzelfde model met volledige precisie op OrcaRouter — één API-sleutel, doorberekende providerprijzen met 0% opslag, en geen 102 GB-download.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube