Karta tytułowa hero artykułu „Jak uruchomić GLM-5.3-Flash na MacBooku Pro” z podtytułem „2bit-Lite MLX Playbook”, przedstawiająca stylizowanego MacBooka Pro z subtelnym motywem sieci neuronowej nad klawiaturą oraz trzema chipami oznaczonymi „2bit-lite”, „~102 GB” i „128 GB Mac”.
Guides & Insights

Jak uruchomić GLM-5.3-Flash na MacBooku Pro: Poradnik 2bit-Lite MLX

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Uruchamianie GLM-5.3-Flash na MacBooku Pro oznacza dokładnie jedną maszynę: 128 GB M4/M5 Max MacBook Pro z uruchomioną 2bit-lite kompilacją naszej konwersji MLX, z podniesionym limitem pamięci przypiętej macOS. Jeśli Twój MacBook Pro ma mniej niż 128 GB — 36 GB M4 Pro, 48 GB M4 Max — ten poradnik nie jest dla Ciebie; przejdź do ostatniej sekcji i skorzystaj z hostowanego API z-ai/glm-5.3-flash zamiast tego. GLM-5.3-Flash (wagi pod adresem zai-org/GLM-5.3-Flash) to model Mixture-of-Experts Z.ai z 320 miliardami parametrów i 18B aktywnych na token — wydany 26 sierpnia 2026 roku, pierwszy natywnie multimodalny GLM-5 — a nawet najmniejsza kompilacja naszego portu MLX wymaga ~102 GB wag i ~112 GB pamięci. To cały rynek i nie zamierzamy tego łagodzić.

To jest dokumentacja z pierwszej ręki, a nie opis premiery: wagi poniżej są własną kompilacją OrcaRouter (orcarouter/GLM-5.3-Flash-MLX, MIT), wyprodukowane naszą metodą kwantyzacji OrcaSAQ bez kalibracji. Opublikowaliśmy je 26 sierpnia i następnego dnia publicznie skorygowaliśmy kurs, ponieważ oryginalny zakres kwantyzacji nie czynił korzystania z MacBooka Pro praktycznym dla większości ludzi — zwykła kompilacja 2-bitowa wciąż wymagała około 160 GB, których nie ma żaden laptop. 27 sierpnia przebudowaliśmy najmniejszy wariant jako 2bit-lite specjalnie, aby zmieścił się w MacBooku Pro z 128 GB, a ten tekst jest szczerym opisem tego, co to daje i jakie są koszty. Każda liczba oznaczona jako notatka terenowa poniżej została zmierzona podczas naszego pojedynczego przebiegu weryfikacyjnego na H200; nic tutaj nie jest benchmarkiem producenta. Tam, gdzie powtarzamy praktyki społeczności — polecenie wired-memory, wersjonowanie mlx-vlm — oznaczamy je jako takie.

Która kompilacja pasuje do którego Maca (przeczytaj to przed pobraniem czegokolwiek)

Każdy z pięciu buildów w repozytorium odpowiada minimalnej wartości pamięci RAM. Na MacBooku Pro, „który build” ma dokładnie jedną odpowiedź — wszystko powyżej 2bit-lite to rozmowa o Mac Studio:

6-bit — ~296 GB wagi / ~320 GB RAM / niemal bezstratny. Tylko Mac Studio z 512 GB.

4-bit — ~204 GB / ~224 GB / nasze zalecane ustawienie domyślne. Mac Studio 256 GB. To właśnie odwzorowuje katalog główny repozytorium.

3-bit — ~184 GB / ~200 GB. Mac Studio 256 GB.

2-bit — ~145 GB / ~160 GB. Mac Studio 192 GB. To był najmniejszy wariant, który wypuściliśmy pierwszego dnia, i to była pomyłka.

2bit-lite — ~102 GB / ~112 GB. Jedyna wersja, która mieści się w maszynie z 128 GB — 128 GB M4/M5 Max MacBook Pro, 128 GB Mac Studio lub Mac mini. Każdy 128 GB laptop z Apple Silicon (M3 Max lub nowszy) to ta sama historia, tylko wolniejsza.

Pułapka ukryta w tej drabinie: domyślne polecenie pobierania z README pobiera wersję 4-bitową (~204 GB), która jest właściwym domyślnym wyborem dla maszyny z 256 GB, a na laptopie bezużyteczna. Jeśli wykonasz domyślne polecenie na MacBooku Pro, otrzymasz model, który nie zostanie zaalokowany. Ścieżka 2bit-lite wymaga jawnego --include, omówionego poniżej.

Istnieje również twardy limit, na który trafisz, zanim powyższe obliczenia w ogóle zaczną obowiązywać. macOS nie pozwala procesowi przejąć całej pamięci zunifikowanej Maca z 128 GB; domyślny limit pamięci dostępnej dla GPU wynosi z grubsza 91–96 GB (odkryty przez społeczność metodą inżynierii wstecznej i potwierdzony w kilku artykułach o konfiguracjach MLX dla dużych modeli). To poniżej samych ~102 GB wag, więc nawet wersja 2bit-lite nie załaduje się, dopóki nie podniesiesz limitu pamięci przypiętej. Ten krok jest obowiązkowy i opisano go w sekcji 4.

Zainstaluj mlx-vlm — i tylko mlx-vlm.

GLM-5.3-Flash to model wizyjno-językowy, więc działa pod mlx-vlm, a nie mlx-lm. To najczęstszy powód, dla którego ludzie utykają, więc powiedz to od razu: mlx-lm służy do modeli tekstowych; uruchomienie za jego pomocą modelu multimodalnego powoduje mylący błąd ładowania. Zainstaluj pakiet VLM w wersji co najmniej 0.6.17:

pip install -U "mlx-vlm>=0.6.17"

Przypięcie wersji nie jest ozdobą. glm5_next — hybrydowa architektura sparse-plus-linear-attention stojąca za GLM-5.3-Flash — trafiła do mlx-vlm dopiero tego samego dnia, w którym model się ukazał (26 sierpnia 2026), a każda starsza wersja nie rozpozna konfiguracji. Architektura ma znaczenie także z drugiego powodu: to całkowicie nowa topologia, a porty z pierwszej fali miały realne błędy poprawności, których płynny output nie ujawniłby. Społecznościowy audyt środowiska uruchomieniowego wczesnej ścieżki glm5_next MLX znalazł i naprawił cztery z nich — niezastosowany klamp SwiGLU w każdym bloku FFN, tensory hiperpołączeń z ograniczeniami rozmaitości rzutowane na niewłaściwy dtype (co po cichu uszkadzało macierz mieszającą uwagę), dwie niezgodności epsilon w normach uwagi oraz logity routera w bf16, podczas gdy referencja używa float32. Po poprawkach numeryka zgadzała się z referencją do około 1e-7. Wniosek dla Ciebie: utrzymuj mlx-vlm w aktualnej wersji i traktuj pierwsze wydanie portu nowej architektury z podejrzliwością.

Pobierz wagi: flagi wykluczania oraz to, co faktycznie musisz uwzględnić.

Katalog główny repozytorium odpowiada buildowi 4-bitowemu, a wszystkie pięć wariantów jest dostarczanych jako podfoldery. Domyślne polecenie pobiera katalog główny i używa --exclude, więc żaden z pięciu folderów wariantów (które łącznie mają około 800 GB) nie jest pobierany:

hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"

Na MacBooku Pro ta komenda jest dla Ciebie błędna — daje ci 4-bitowy root. W przypadku laptopa 128 GB pobierz tylko 2bit-lite podfolder:

hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX

To jest ten ~102 GB pakiet do pobrania i jest samowystarczalny — 2bit-lite/ to folder, który zawiera własny config.json, więc wystarczy skierować generator na ten folder. Jeśli hf nie ma w PATH, zainstaluj go: pip install -U huggingface_hub. Zanim zaczniesz, upewnij się, że masz ~110 GB wolnego miejsca na dysku i że na Macu nie zostało Ci tylko ostatnie 100 GB wolnego miejsca — MLX mapuje wagi w pamięci, a przy prawie pełnym SSD takie konfiguracje padają w trakcie pobierania.

Screenshot of the Hugging Face repository card for orcarouter/GLM-5.3-Flash-MLX showing the title, the tagline 'An MLX build of the official GLM-5.3-Flash — 2bit-lite / 2 / 3 / 4 / 6-bit OrcaSAQ quant for Apple Silicon & MLX', and the model tags glm5_next, Apple Silicon, quantized 2-8bit, Mixture of Experts, vision-language and MIT

Zwiększ limit pamięci wired — krok, o którym wszyscy zapominają

To jest krok decydujący o powodzeniu lub porażce na MacBooku Pro z 128 GB, a karta README zakłada, że go znasz, zamiast podać polecenie wprost. Domyślny limit zestawu roboczego Metal na Macu z 128 GB wynosi mniej więcej 91–96 GB, czyli poniżej ~102 GB wag 2bit-lite — więc bez tego kroku model nie może przydzielić pamięci i ładowanie kończy się niepowodzeniem. Standardowym rozwiązaniem społeczności jest sysctl, który podnosi limit przypiętej pamięci GPU w megabajtach:

sudo sysctl iogpu.wired_limit_mb=114688

To ustawia pułap ~112 GB, pozostawiając około 14 GB rezerwy dla systemu operacyjnego. W maszynach z 128 GB pamięci wartości stosowane w społeczności wahają się od ~114688 (112 GB) do ~122880 (120 GB); nie ustawiaj wartości maksymalnej — macOS potrzebuje zapasu, w przeciwnym razie pod presją pamięci pojawiają się przycięcia serwera okien i zacinanie systemu. Po ustawieniu tej wartości załaduj model i obserwuj Monitor aktywności: jeśli ciśnienie pamięci zmieni kolor na żółty, zmniejsz tę liczbę.

Dwie praktyczne uwagi, obie z praktyki społeczności, a nie z naszych notatek terenowych. Po pierwsze, sysctl resetuje się po restarcie i dotyczy sesji terminala, w której go ustawisz, więc zaplanuj ponowne uruchomienie (lub zautomatyzuj je przez LaunchAgent) — zapomnienie o tym po restarcie to klasyczny błąd „wczoraj działało”. Po drugie, MLX udostępnia również wewnątrzprocesowy parametr, mlx.core.metal.set_wired_limit(bytes), w systemie macOS 15.0 i nowszych; musi pozostać poniżej limitu sysctl i jest bardziej przenośną opcją, jeśli piszesz skrypty w notebooku. Którejkolwiek metody użyjesz, efekt jest ten sam: bez tego nic tutaj nie zadziała.

Uruchom to: tekst, obraz i Python API

Z wagami na miejscu i podniesionym limitem, generowanie to jedna komenda.

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Wyjaśnij splątanie kwantowe w jednym zdaniu." --max-tokens 256

Wejście obrazu działa tak samo z --image jako flagą — to tutaj model multimodalny pokazuje swoją wartość na laptopie, ponieważ wieża wizyjna pozostaje w wyższej precyzji w układzie OrcaSAQ:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Opisz ten obraz." --max-tokens 256

W przypadku skryptu, Python API ma ten sam kształt, który znają użytkownicy mlx-vlm:

from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Opisz ten obraz.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))

Utrzymuj --max-tokens na umiarkowanym poziomie. Podczas naszego testu na H200, 2bit-lite osiąga mniej więcej 10 tok/s, więc odpowiedź o długości 1024 tokenów to już dwie minuty czekania — a właśnie w przypadku długich odpowiedzi budżet KV i załamanie jakości dają się we znaki (poniżej). Na laptopie należy się spodziewać, że będzie działać wolniej, a nie szybciej, dopóki nie pojawi się zmierzona wartość.

Jaką jakość faktycznie otrzymujesz (mierzona drabina)

Oto uczciwa część podręcznika i nie zamierzamy jej tuszować. OrcaSAQ łagodnie degraduje się do 3 bitów, potem koszt szybko rośnie. Względem referencji FP8 (perplexity 2.7797):

6-bit— perpleksja 2.7864 (+0.24%), zgodność tokenów top-1 97.76%. Prawie bezstratne, zgodnie z deklaracją.

4-bit — perplexity 2,8620 (+2,96%), top-1 96,13%. Zalecana wartość domyślna.

3-bit — perplexity 3.0566 (+9.96%), top-1 92.06%. Agresywne, ale użyteczne.

2-bit — perplexity 4.3622 (+56.9%), top-1 86.56%. Realny koszt.

2bit-lite — perplexity 6.7018 (+141%), top-1 77.19%. Najmniejsza wersja i jedyna, którą MacBook Pro udźwignie.

To są zmierzone wartości z naszego własnego potoku konwersji. 2bit-lite to 141% regresja perplexity i zgodność tokenów top-1 poniżej 78% — uruchamiasz wyraźnie zdegradowany model, a poniższe tryby awarii pokazują, jak ta degradacja wygląda w praktyce. To znakomite demo i rozsądny asystent do krótkich form; nie zastępuje modelu o pełnej precyzji.

Jeśli chodzi o szybkość, jesteśmy Ci winni tę samą szczerość. Opublikowana notatka terenowa to H200: ~10 tok/s, stabilna wieloobrotowa rozmowa, codzienne pytania i odpowiedzi oraz krótkie teksty działają dobrze. Nie mamy jeszcze zmierzonej wartości dla MacBooka Pro w wariancie 2bit-lite i nie zamierzamy jej zmyślać — przepustowość Apple Silicon zależy tutaj od przepustowości pamięci, termiki oraz pokrycia jąder MLX dla hybrydowej uwagi, z których żadnego nie zmierzyliśmy dla tej kompilacji na tym laptopie. Najbliższym opublikowanym punktem danych dla Apple Silicon, na który możemy Cię wskazać, jest niezależne ~450 tok/s dla kompilacji 4-bit GLM-5.3-Flash na Macu z 512 GB pod innym środowiskiem uruchomieniowym MLX — inna kompilacja, inna precyzja i komputer stacjonarny, więc nie traktuj tego również jako swojej wartości. Nastaw się na wolne działanie; miło się zaskocz, jeśli tak nie będzie.

KV cache i długi kontekst: pamiętaj o zapasie

GLM-5.3-Flashreklamuje okno kontekstowe o długości 1 miliona tokenów. Ta liczba jest bez znaczenia na tym sprzęcie, a poradnik, który twierdzi inaczej, wyrządziłby ci niedźwiedzią przysługę. Praktyczna wskazówka brzmi jednym zdaniem: zapewnij środowisku uruchomieniowemu wystarczający budżet KV dla docelowej długości. Na pojedynczym H200 tryb 2bit-lite pozostawia około 39 GB wolnego miejsca na pamięć podręczną KV po załadowaniu wag. Na MacBooku Pro z 128 GB pamięci arytmetyka jest bardziej surowa: ~102 GB wag przy limicie ~112 GB pozostawia rzędu 26 GB przed uwzględnieniem własnego zestawu roboczego macOS — a hybrydowe warstwy liniowej uwagi sprawiają, że ślad KV tego modelu jest niewielki w porównaniu z gęstym modelem tej wielkości, ale wciąż rośnie liniowo wraz z kontekstem.

Wskazówki od szerszej społeczności dotyczące strony serwera potwierdzają tę tezę: konfiguracja, która ładuje się bez problemu przy kontekście 8K, może zabraknąć pamięci przy 128K. Na laptopie trzymaj krótkie konteksty — kilka tysięcy tokenów pytań i odpowiedzi lub pojedynczy obraz — i nie próbuj wczytywać mu książki. W momencie, gdy obciążenie naprawdę wymaga długiego kontekstu, znajdujesz się w ostatniej sekcji tego artykułu.

Generowanie długiego kodu nie jest niezawodne przy 2bit-lite (przeczytaj to dwa razy)

To jest sekcja, bez której poradnik ukrywający swoje tryby awarii byłby bezwartościowy, więc ma własny nagłówek. Notatki terenowe H200 są jednoznaczne: codzienne pytania i odpowiedzi oraz krótkie formy tekstowe wychodzą dobrze, a generowanie długiego kodu przy tej precyzji nie jest niezawodne. Trzy tryby awarii odtworzone podczas naszego przebiegu weryfikacyjnego:

Pętle powtarzania — model zaczyna powtarzać te same linie lub bloki zamiast robić postępy, zwykle po kilkuset tokenach.

Brakujący kod spajający — importy, powiązania i obsługa błędów zostały po cichu pominięte. Wygenerowana funkcja wygląda poprawnie w izolacji, ale nie działa, ponieważ otaczające rusztowanie po prostu nie istnieje.

Ciągłe przepisywanie — zamiast minimalnej edycji, model przepisuje duże fragmenty pliku, a kolejne odpowiedzi są ze sobą sprzeczne.

Są one odtwarzalne na 2bit-lite i są dokładnie tym, co przewiduje 77% zgodność top-1. Co właściwie robią praktycy, którzy nadal używają wersji na laptopa:

• Używaj go do wyjaśnień, podsumowań, pytań i odpowiedzi oraz rozumienia obrazów — krótkich zadań, w których jest naprawdę dobry.

• Jeśli musisz prosić o kod, proś o jedną małą funkcję na razz jasno określoną sygnaturą i weryfikuj każdą, zanim przejdziesz dalej. Nie podawaj mu całego pliku i nie proś o funkcjonalność.

• Do wszystkiego, co długie — pełnego modułu, refaktoryzacji, długiej sesji agenta — kieruj do API o pełnej precyzji. To nie jest obejście; to poprawna architektura, i to ostatnia sekcja.

Kiedy nie robić tego wcale: zamiast tego wywołaj z-ai/glm-5.3-flash

Comparison scoreboard titled 'GLM-5.3-Flash on a Mac — the scoreboard' contrasting the 2bit-lite MLX local build (102 GB weights on disk, 112 GB minimum RAM, +141% perplexity vs FP8, 77.19% top-1 agreement, unreliable long code generation, ~10 tok/s per H200 field note) against the hosted z-ai/glm-5.3-flash API (0 GB on disk, no RAM, FP8 reference quality, reliable long code, datacenter speed), with a footer noting quality is measured by OrcaRouter, speed is an H200 field note, and the API is at Z.ai launch pricing

Uczciwa zasada decyzyjna: uruchamiaj 2bit-lite na MacBooku Pro M4/M5 Max z 128 GB tylko wtedy, gdy konkretnie chcesz multimodalny model 320B na laptopie, który możesz nosić ze sobą — pytania i odpowiedzi offline, prywatne dokumenty, rozumienie obrazów, przy czym nic nie opuszcza urządzenia. Do wszystkiego innego wybierz API:

Dowolny MacBook Pro o pojemności poniżej 128 GB — nie ma dla Ciebie kompilacji. Nie próbuj jej wczytywać; użyj API.

Generowanie długiego kodu lub rozumowanie w długim kontekście — 2bit-lite zawodzi właśnie w tym, niezawodnie. Użyj API.

Praca wrażliwa na jakość — 77,19% zgodności top-1 i +141% perplexity to realny spadek, a nie błąd zaokrąglenia. Użyj API.

Gwarantowana przepustowość lub przewidywalne opóźnienie — nie ma jeszcze zmierzonej wartości dla laptopa, a notatka z terenu wynosi 10 tok/s. Skorzystaj z API.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash showing the model ID, 'by Z.ai - 2026-08-26', a 1M-token context window, text plus image plus video in / text out, 320B total / 18B active parameters, and the input/output price of $0.07 / $0.25 per million tokens

Hostowany model to z-ai/glm-5.3-flash, obsługiwany w pełnej precyzji na OrcaRouter w obecnych cenach Z.ai — $0.07 za milion tokenów wejściowych i $0.25 za milion tokenów wyjściowych w momencie pisania (cennik na okres premiery; opublikowany cennik Z.ai to $0.15 / $0.50). To cena raportowana przez dostawcę, przekazywana dalej z 0% narzutem, więc obniżka ceny ze strony Z.ai pojawia się u nas tego samego dnia. Otrzymujesz jeden klucz API, który działa też z ponad 200 innymi modelami, które obsługujemy, a automatyczne przełączanie awaryjne sprawia, że eksperyment z tym nowym modelem nie uzależnia Twojej ścieżki produkcyjnej od jednego dostawcy. W tym samym czasie, w którym pobierzesz 102 GB i przeczekasz pierwsze generowanie na zimno, API już odpowiedziało na pytania z całego tygodnia — i odpowiada na nie w pełnej precyzji.

Lokalna inferencja jest opłacalna, gdy powód jest lokalny — prywatność, praca offline, brak limitów zapytań, demo działające na baterii. Nie jest opłacalna w rachunku kosztów i jakości z żadnego innego powodu, a na maszynie z mniej niż 128 GB nie jest opłacalna wcale.

Często zadawane pytania

Czy Mac z 64 GB lub 96 GB pamięci może uruchomić GLM-5.3-Flash lokalnie?Nie. Najmniejsza kompilacja, 2bit-lite, wymaga co najmniej około 112 GB po uwzględnieniu narzutu macOS, a nawet maszyna z 128 GB musi podnieść limit pamięci przypiętej (wired memory), aby go załadować. Jeśli Twój Mac ma mniej niż 128 GB, ścieżka lokalna nie istnieje; skieruj z-ai/glm-5.3-flash przez API.

Zainstalowałem mlx-vlm i model nie chce się wczytać — co jest nie tak? Dwie najczęstsze przyczyny, w kolejności: wersja niższa niż 0.6.17, która powstała przed dodaniem obsługi glm5_next i nie rozpozna architektury; oraz niepodniesienie limitu pamięci przypiętej, ponieważ wersja ~102 GB nie może zaalokować pamięci przy domyślnym limicie Metal wynoszącym ~91–96 GB na Macu z 128 GB. Napraw obie (zaktualizuj pakiet, uruchom sysctl), a model się załaduje.

Czy lokalna wersja 2bit-lite to ten sam model co API z-ai/glm-5.3-flash? Te same bazowe wagi GLM-5.3-Flash, ale nie ta sama jakość. 2bit-lite to kwantyzacja 2-bitowa z 77,19% zgodnością tokenów top-1 względem referencji FP8, a generowanie długiego kodu jest zawodne. API udostępnia pełną precyzję. Można je stosować zamiennie tylko przy krótkich zadaniach tolerujących niższą jakość.

Wersja 30-sekundowa

Jedna maszyna, jedna kompilacja, jeden obowiązkowy sysctl. Jeśli masz 128 GB M4/M5 Max MacBook Pro: zainstaluj mlx-vlm>=0.6.17, pobierz tylko 2bit-lite/ (~102 GB), podnieś limit pamięci przewodowej za pomocą sudo sysctl iogpu.wired_limit_mb=114688 i uruchom mlx_vlm.generate — do pytań i odpowiedzi, krótkich tekstów i obrazów. Przyjmij do wiadomości, że generowanie długiego kodu nie jest niezawodne przy tej precyzji, że nie ma jeszcze zmierzonej przepustowości na laptopie i że Mac z 128 GB to dolna granica, a nie standard. Jeśli którekolwiek z tych zastrzeżeń jest dla ciebie nie do przyjęcia — lub twój Mac ma mniej niż 128 GB — ten sam model w pełnej precyzji jest dostępny jednym wywołaniem API na z-ai/glm-5.3-flash.

Not on a 128 GB Mac? z-ai/glm-5.3-flash serves the same model at full precision on OrcaRouter — one API key, provider pricing passed through at 0% markup, and no 102 GB download.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube