Karta hero z tytułem artykułu 'Wymagania VRAM dla GLM-5.3-Flash', podtytułem 'Ile pamięci potrzebujesz, aby uruchomić model 320B MoE', plakietkami '320B łącznie · 18B aktywnych', 'kontekst 1M tokenów', 'społecznościowe kompilacje MLX' oraz kartą podsumowania o treści '2bit-lite: ~102 GB wagi / 112 GB RAM — wersja, która mieści się na Macu z 128 GB', z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GLM-5.3-Flash: wymagania VRAM — ile pamięci potrzebujesz do uruchomienia modelu MoE 320B?

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GLM-5.3-Flash nie zmieści się na żadnym konsumenckim GPU. Najmniejsza użyteczna wersja, 2bit-lite, wymaga ~102 GB wag i 112 GB RAM. Mac z 128 GB to minimalna konfiguracja; pojedynczy H200 mieści 2bit-lite z ~39 GB zapasu; wszyscy pozostali powinni korzystać z hostowanego API, z-ai/glm-5.3-flash.

To jest cała odpowiedź w jednym tchu i warto powiedzieć to wprost: nie istnieje konfiguracja sprzętu konsumenckiego, która uruchomi ten model. Model Z.ai — wizyjno-językowy mixture-of-experts z 320 miliardami parametrów, wydany 26 sierpnia 2026 roku — w każdej kwantyzacji wymaga pamięci klasy serwerowej. Wartość „18B aktywnych” opisuje obliczenia przypadające na token, a nie pamięć rezydentną — wszystkie 320 miliardów wag pozostaje załadowanych. Realistyczne cele lokalne to duże Maci z pamięcią unifikowaną, serwery z wieloma GPU i pojedynczy H200 z 141 GB. Jeśli nie posiadasz żadnego z nich, poniższe liczby nie są listą zakupów; są powodem, dla którego warto wywoływać model przez API.

Jedna uwaga wprowadzająca do poniższych liczb: liczby dotyczące pamięci w tym materiale to ustalenia społeczności, a nie wytyczne producenta. Z.ai publikuje wagi i specyfikacje API;{{1}} nie publikuje wymagań pamięciowych dla wnioskowania lokalnego.{{/1}} Tabela dla poszczególnych kwantyzacji pochodzi z karty modelu orcarouter/GLM-5.3-Flash-MLX w serwisie Hugging Face, kwantyzacji MLX otwartych wag, którą utrzymuje grupa społecznościowa,{{2}} a liczby dotyczące wdrożeń pochodzą od praktyków, którzy faktycznie załadowali model.{{/2}} Tam, gdzie liczba pochodzi od producenta — ceny oraz deklaracje architektury o wydajności pamięci podręcznej KV — oznaczamy to w ten sposób.{{3}}{{/3}}

Krótka odpowiedź: co pasuje na to, co posiadasz.

Zacznij od tego, co faktycznie masz, ponieważ drabina kwantyzacji ma sens tylko w odniesieniu do maszyny docelowej:

• Konsumencka karta graficzna (RTX 4090, RTX 5090 i wszystko poniżej) — nie. Żadna pojedyncza karta konsumencka nie ma wystarczającej ilości VRAM: najmniejsza kompilacja to ~102 GB samych wag, czyli mniej więcej tyle, ile ma pięć kart RTX 5090. Pamięć systemowa tego nie zmienia, ponieważ wagi muszą znajdować się w pamięci urządzenia.

• Mac 128 GB (M4 lub M5 Max) — wersja 2bit-lite (~102 GB wag / 112 GB minimalnej pamięci RAM) i tylko po podniesieniu limitu pamięci zajętej (wired memory). Więcej o tym poniżej. To jedyna maszyna klasy konsumenckiej, na której mieści się ten model.

• 192 GB i 256 GB Mac Studio — 3-bit (~184 / 200 GB) i 2-bit (~145 / 160 GB) stają się osiągalne; 4-bit wymaga ~224 GB, do którego zbliża się tylko wariant 256 GB.

• Pojedynczy H200 (141 GB VRAM) — 2bit-lite mieści się, pozostawiając około 39 GB na pamięć podręczną KV, co oznacza tylko krótkie konteksty.

• Serwer multi-GPU — wszystko, w tym wersje 4-bit, 6-bit oraz referencyjna kompilacja FP8 (~328 GB).

{{1}}Wszyscy pozostali — API hostowane, z-ai/glm-5.3-flash.{{/1}} {{2}}To nie jest nagroda pocieszenia; to właśnie tam model jest naprawdę szybki i tani w użyciu i jest to opisane na dole tej strony.{{/2}}

Dwie liczby, nie jedna: wagi a całkowita pamięć

Każda kwantyzacja na karcie modelu ma dwie kolumny — rozmiar wag i minimalną pamięć RAM — a różnica między nimi to część, którą pomija większość opisów. Kolumna wag to pliki modelu: każdy parametr, w danej precyzji, przebywający w pamięci. Kolumna minimalnej pamięci RAM to to, co maszyna musi pomieścić w czasie działania: wagi oraz pamięć podręczna KV, aktywacje i bufory, które rosną wraz z długością kontekstu.

To właśnie liczba 18B aktywnych parametrów wprowadza ludzi w błąd. GLM-5.3-Flash to model MoE z 320B parametrów łącznie i 18B aktywnymi: na każdy token w obliczeniach bierze udział tylko około 18B parametrów. To oszczędność mocy obliczeniowej, a nie pamięci. W pamięci pozostają wszystkie 320B wag niezależnie od tego, które z ekspertów zostaną uruchomione, ponieważ router nie wie, których ekspertów potrzebuje, dopóki nie zobaczy tokenu. MoE daje szybkość, ale nie zmniejsza śladu pamięciowego — co zresztą widać na karcie samego modelu, gdzie 320B łącznie widnieje obok 18B aktywnych.

Więc kiedy build podaje „~204 GB wag / 224 GB min. RAM”, te dodatkowe ~20 GB to narzut w czasie działania — pamięć podręczna KV, aktywacje, bufory kontekstu. Zwiększ długość kontekstu, a ta różnica rośnie. Maszynę należy dobierać pod kolumnę min. RAM, a nie pod kolumnę wag.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

Sam model — architektura, licencja i własne ujęcie Z.ai — jest udokumentowany na oficjalnej karcie dostawcy, pokazanej powyżej. Lokalna pamięć nie jest tam omówiona; dlatego powstała ta strona. Poniższe liczby pochodzą ze społecznościowego portu MLX otwartych wag.

Drabina kwantyzacji

Tabela na karcie orcarouter/GLM-5.3-Flash-MLX jest tą, z której praktycy faktycznie dziś korzystają. Wymienia ona pięć skwantowanych wariantów oraz referencję FP8, każdy z rozmiarem wag i minimalną ilością pamięci RAM:

Referencja FP8 — wagi o wielkości ~328 GB. Niezkwantowany punkt odniesienia, na którym dostępne są otwarte wagi.

• 6-bit — ~296 GB wag / min. 320 GB RAM. Prawie bezstratny; wariant o najwyższej jakości.

4-bit — ~204 GB / 224 GB. Rekomendowany domyślny wybór na co dzień.

• 3-bit — ~184 GB / 200 GB. Agresywne, ale użyteczne.

• 2-bit — ~145 GB / 160 GB. Najlepsze starania.

• 2bit-lite — ~102 GB / 112 GB. Najmniejsza wersja; jedyna, która mieści się na Macu z 128 GB lub pojedynczym H200.

Jakość spada wraz ze spadkiem liczby bitów, a karta modelu ujmuje to ilościowo. W porównaniu z referencją FP8, perplexity pogarsza się o +0,24% przy 6 bitach, +2,96% przy 4 bitach, +9,96% przy 3 bitach, +56,9% przy 2 bitach i +141% przy 2bit-lite (wartości perplexity pochodzą z tej samej karty modelu). Wytyczne samej karty modelu: 6 bitów dla jakości niemal bezstratnej, 4 bity jako domyślny wybór na co dzień, 3 i 2 bity przy ograniczonej pamięci, 2bit-lite tylko wtedy, gdy nic innego się nie mieści — a generowanie długiego kodu przy 2bit-lite nie jest niezawodne. To ostatnie ostrzeżenie ma znaczenie dla modelu rozumującego 320B: to 2bit-lite pozwala kupić Maca z 128 GB, a podatek jakościowy trafia dokładnie tam, gdzie praca nad kodem boli najbardziej.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

Dwie liczby w tej drabinie zasługują na bliższe przyjrzenie się, ponieważ decydują o całej kwestii sprzętu.

Dlaczego istnieje 2bit-lite

2bit-lite nie jest dodatkowym poziomem jakości — to poziom rozmiaru stworzony z jednego powodu: zwykły 2-bit się nie mieści. Przy ~102 GB wag to jedyna wersja, która mieści się w ~112 GB użytecznej pamięci na Macu 128 GB, i jedyna, która mieści się w 141 GB pojedynczego H200, zostawiając miejsce na pamięć podręczną KV. Karta modelu mówi wprost: zwykły 2-bit nie mieści się w Macu 128 GB; 2bit-lite się mieści, z podniesionym limitem pamięci przypisanej. Na H200 mieści się „z ~39 GB pozostałymi na pamięć podręczną KV” (słowa karty). Te 39 GB to cały budżet roboczy na wszystko, co model robi po załadowaniu — co prowadzi nas do kontekstu.

Ile kosztuje pamięć podręczna KV przy długim kontekście

GLM-5.3-Flash ma okno kontekstowe o wielkości 1 miliona tokenów, a długi kontekst to miejsce, w którym plany dotyczące pamięci lokalnej umierają. Hybrydowa mechanika uwagi modelu, obejmująca rzadkie i liniowe składniki — NoPE-MLA z mechanizmem indeksowania puli — jest naprawdę wydajna: Z.ai podaje, że zmniejsza koszty obliczeniowe uwagi 3,01-krotnie, a rozmiar pamięci podręcznej KV 4,44-krotnie w porównaniu z własnym GLM-5.3 (dane producenta). Jednak „4,44 razy mniejsze niż GLM-5.3” wciąż oznacza pamięć podręczną mierzoną w dziesiątkach GiB, gdy zbliżasz się do pełnego kontekstu o wielkości 1 miliona tokenów.

Najlepsze publiczne dane, jakie mamy, pochodzą ze wdrożenia społecznościowego, które uruchomiło model na czterech węzłach DGX Spark: {{1}}16 GiB pamięci podręcznej KV na rangę{{/1}} — łącznie około 64 GiB we wszystkich czterech — {{2}}do utrzymania pełnego kontekstu 1M tokenów{{/2}}, o pojemności wystarczającej do obsługi kilku równoczesnych żądań z pełnym kontekstem. {{3}}To więcej niż cały budżet pamięci większości pojedynczych maszyn, zanim uwzględni się choćby jedną wagę.{{/3}} {{4}}Na pojedynczym H200 sednem tej strony jest arytmetyka: 2bit-lite pozostawia ~39 GB na wszystko oprócz wag — zapas wystarczający na krótką rozmowę, który znika w ciągu kilku minut, gdy kontekst rośnie w stronę 100 tys. tokenów.{{/4}}

Praktyczna zasada: kolumna min-RAM zakłada rozsądny kontekst. Jeśli Twoje obciążenie obejmuje długie dokumenty, pętle agentów lub kod na skalę repozytorium, dolicz pamięć na KV-cache — a przy czymkolwiek bliskim 1M tokenów przestań liczyć i użyj API. Te obserwacje dotyczące rozmiarów to ustalenia społeczności; nie istnieją żadne wytyczne producentów dotyczące budżetowania KV.

Limit zablokowanej pamięci w macOS: dlaczego Mac z 128 GB nadal się nie ładuje

Najczęściej zgłaszanym przez praktyków problemem nie jest „za mało RAM-u”. To 128 GB Mac z modelem o wielkości ~102 GB, który nie chce się załadować. Przyczyną jest limit pamięci przypiętej w macOS. Na Apple Silicon GPU nie może zaadresować całej pamięci współdzielonej: Metal udostępnia „zalecany maksymalny zestaw roboczy” wynoszący mniej więcej dwie trzecie fizycznego RAM-u, a alokacje powyżej tej wartości kończą się niepowodzeniem, nawet gdy maszyna ma wolną pamięć.

Tak więc domyślny budżet Metal dla Maca z 128 GB RAM mieści się gdzieś w zakresie 80–90 GB — poniżej tego, czego potrzebuje wersja 2bit-lite (~112 GB min. RAM z modelem rezydentnym o wielkości ~102 GB). Wczytywanie kończy się niepowodzeniem z powodu budżetu Metal, a nie pojemności RAM. Naprawa w każdym znalezionym przez nas raporcie praktyków jest taka sama: podnieś limit pamięci przypiętej za pomocą sudo sysctl iogpu.wired_limit_mb=…, ustawiając wartość powyżej całkowitego zapotrzebowania modelu w MB, i spodziewaj się, że zresetuje się po restarcie. Niektóre poradniki społeczności ustawiają również limit pamięci przypiętej z Pythona przez mlx.metal.set_wired_limit(), aby wagi modelu były przypięte, a macOS przestał kompresować nieużywane strony Metal.

Jeszcze jedna komplikacja: środowiska uruchomieniowe zachowują się różnie. MLX egzekwuje limit pamięci Metal i w przypadku jego przekroczenia twardo kończy działanie, podczas gdy środowiska oparte na llama.cpp (ścieżka GGUF) zazwyczaj go nie egzekwują i pozwalają macOS na użycie swapu. Dlatego ten sam model może odmówić załadowania w jednym środowisku, a w innym „załadować się” — i dlatego wyswapowany model może być tak wolny, że aż bezużyteczny. To ustalenia społeczności na temat zachowania macOS, a nie wytyczne Apple.

Alternatywa hostowana: z-ai/glm-5.3-flash

Dla wszystkich, których powyższe liczby wykluczają — a jest to {{1}}większość ludzi{{/1}} — Z.ai udostępnia sam model jako z-ai/glm-5.3-flash, i właśnie tutaj {{2}}„Flash" w nazwie{{/2}} faktycznie się ujawnia. Cena katalogowa Z.ai wynosi 0,15 USD za milion tokenów wejściowych, 0,03 USD za milion tokenów wejściowych z pamięci podręcznej i 0,50 USD za milion tokenów wyjściowych; promocja startowa obowiązuje do 9 września 2026 r. w cenach 0,075 / 0,015 / 0,25 USD (ceny podane przez dostawcę, aktualne w momencie pisania). Wejście z pamięci podręcznej kosztujące jedną piątą ceny świeżego wejścia to największa dźwignia kosztowa: każde zadanie z prefiksem możliwym do ponownego wykorzystania — promepty systemowe, definicje narzędzi, długie współdzielone dokumenty — powinno być rozliczane w cenie odczytu z pamięci podręcznej.

Bilans pamięci powinien być częścią tej decyzji. Serwowanie modelu 320B we własnym zakresie oznacza przeznaczenie 112–320 GB pamięci na ten model, niezależnie od tego, czy jest bezczynny, czy w pełni obciążony. Zarządzany endpoint przenosi to wszystko poza Twoje maszyny, a przy cenach promocyjnych z okazji premiery model kosztuje mniej za token niż wiele modeli dziesięciokrotnie mniejszych — co jest całym sensem MoE z 18B aktywnymi parametrami.

To także naturalne miejsce dla punktu routingu. Dzięki OrcaRouter, z-ai/glm-5.3-flash jest jednym z ponad 200 modeli za pojedynczym API, wycenianym według ceny listowej dostawcy z 0% narzutu — więc promocja startowa i każda przyszła obniżka cen są aktywne tego samego dnia, w którym zostaną ogłoszone. Automatyczne przełączanie awaryjne oznacza, że trzydniowy model z niestabilną ścieżką serwowania nie jest zakładem na Twój stos produkcyjny: jeśli dostawca zwróci błąd lub osiągnie nasycenie, żądanie jest przekierowywane do zdrowego dostawcy zamiast kończyć się niepowodzeniem. Bezpieczne wypróbowanie niesprawdzonego modelu to dokładnie to, do czego służy router.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

Najczęściej zadawane pytania

Czy mogę uruchomić GLM-5.3-Flash na RTX 5090?

Nie. Najmniejszy build to ~102 GB samych wag, a RTX 5090 ma 32 GB pamięci VRAM. Żadna konsumencka karta graficzna się nie zbliża; model wymaga komputerów Mac z pamięcią zunifikowaną, jednego H200 lub serwera multi-GPU.

Czy 18B aktywnych oznacza, że GLM-5.3-Flash działa na sprzęcie konsumenckim?

Nie. Liczba 18B aktywnych parametrów odnosi się do obliczeń na token. Wszystkie 320B parametrów pozostają w pamięci, ponieważ router nie może wiedzieć, których ekspertów potrzebuje token, dopóki go nie zobaczy. MoE oszczędza moc obliczeniową, a nie pamięć.

Jaki jest najtańszy sposób, aby wypróbować GLM-5.3-Flash?

Hostowane API, z-ai/glm-5.3-flash. W promocyjnej cenie na start kosztuje 0,075 USD za milion tokenów wejściowych, a tokeny z pamięci podręcznej kosztują 0,015 USD. Samodzielne hostowanie najmniejszej wersji oznacza przeznaczenie na nią ~112 GB pamięci RAM, co ma sens tylko wtedy, gdy już posiadasz odpowiedni sprzęt.

Uczciwe podsumowanie: GLM-5.3-Flash to model klasy serwerowej w każdej wersji. Mac z 128 GB RAM otrzymuje tę jedną wersję, która pasuje — 2bit-lite, z podniesionym limitem pamięci zablokowanej, krótkimi kontekstami i udokumentowaną obniżką jakości przy długim kodzie. Pojedynczy H200 dostaje tę samą wersję z ~39 GB zapasu na KV. Sprzęt serwerowy ma prawdziwą drabinę opcji — od 4-bitów jako domyślnej po niemal bezstratne 6-bitów. A dla wszystkich innych — czyli większości czytelników — hostowany endpoint z-ai/glm-5.3-flash to właściwa odpowiedź, a powyższe liczby są tego powodem, a nie listą zakupów. Jeśli chodzi o instalację krok po kroku na MacBooku Pro, nasz przewodnik instalacji na MacBooku obejmuje cały proces od początku do końca; jeśli chodzi o porównanie wersji kwantyzowanych pod kątem jakości i to, kiedy wybrać którą, przewodnik po kompilacjach MLX zawiera szczegóły; a relacja z premiery niesie kontekst wydania i deklaracje dotyczące benchmarków.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie