
GLM-5.3-Flash: wymagania VRAM — ile pamięci potrzebujesz do uruchomienia modelu MoE 320B?
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 221 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
GLM-5.3-Flash nie zmieści się na żadnym konsumenckim GPU. Najmniejsza użyteczna wersja, 2bit-lite, wymaga ~102 GB wag i 112 GB RAM. Mac z 128 GB to minimalna konfiguracja; pojedynczy H200 mieści 2bit-lite z ~39 GB zapasu; wszyscy pozostali powinni korzystać z hostowanego API, z-ai/glm-5.3-flash.
To jest cała odpowiedź w jednym tchu i warto powiedzieć to wprost: nie istnieje konfiguracja sprzętu konsumenckiego, która uruchomi ten model. Model Z.ai — wizyjno-językowy mixture-of-experts z 320 miliardami parametrów, wydany 26 sierpnia 2026 roku — w każdej kwantyzacji wymaga pamięci klasy serwerowej. Wartość „18B aktywnych” opisuje obliczenia przypadające na token, a nie pamięć rezydentną — wszystkie 320 miliardów wag pozostaje załadowanych. Realistyczne cele lokalne to duże Maci z pamięcią unifikowaną, serwery z wieloma GPU i pojedynczy H200 z 141 GB. Jeśli nie posiadasz żadnego z nich, poniższe liczby nie są listą zakupów; są powodem, dla którego warto wywoływać model przez API.
Jedna uwaga wprowadzająca do poniższych liczb: liczby dotyczące pamięci w tym materiale to ustalenia społeczności, a nie wytyczne producenta. Z.ai publikuje wagi i specyfikacje API;{{1}} nie publikuje wymagań pamięciowych dla wnioskowania lokalnego.{{/1}} Tabela dla poszczególnych kwantyzacji pochodzi z karty modelu orcarouter/GLM-5.3-Flash-MLX w serwisie Hugging Face, kwantyzacji MLX otwartych wag, którą utrzymuje grupa społecznościowa,{{2}} a liczby dotyczące wdrożeń pochodzą od praktyków, którzy faktycznie załadowali model.{{/2}} Tam, gdzie liczba pochodzi od producenta — ceny oraz deklaracje architektury o wydajności pamięci podręcznej KV — oznaczamy to w ten sposób.{{3}}{{/3}}
Krótka odpowiedź: co pasuje na to, co posiadasz.
Zacznij od tego, co faktycznie masz, ponieważ drabina kwantyzacji ma sens tylko w odniesieniu do maszyny docelowej:
• Konsumencka karta graficzna (RTX 4090, RTX 5090 i wszystko poniżej) — nie. Żadna pojedyncza karta konsumencka nie ma wystarczającej ilości VRAM: najmniejsza kompilacja to ~102 GB samych wag, czyli mniej więcej tyle, ile ma pięć kart RTX 5090. Pamięć systemowa tego nie zmienia, ponieważ wagi muszą znajdować się w pamięci urządzenia.
• Mac 128 GB (M4 lub M5 Max) — wersja 2bit-lite (~102 GB wag / 112 GB minimalnej pamięci RAM) i tylko po podniesieniu limitu pamięci zajętej (wired memory). Więcej o tym poniżej. To jedyna maszyna klasy konsumenckiej, na której mieści się ten model.
• 192 GB i 256 GB Mac Studio — 3-bit (~184 / 200 GB) i 2-bit (~145 / 160 GB) stają się osiągalne; 4-bit wymaga ~224 GB, do którego zbliża się tylko wariant 256 GB.
• Pojedynczy H200 (141 GB VRAM) — 2bit-lite mieści się, pozostawiając około 39 GB na pamięć podręczną KV, co oznacza tylko krótkie konteksty.
• Serwer multi-GPU — wszystko, w tym wersje 4-bit, 6-bit oraz referencyjna kompilacja FP8 (~328 GB).
{{1}}Wszyscy pozostali — API hostowane, z-ai/glm-5.3-flash.{{/1}} {{2}}To nie jest nagroda pocieszenia; to właśnie tam model jest naprawdę szybki i tani w użyciu i jest to opisane na dole tej strony.{{/2}}
Dwie liczby, nie jedna: wagi a całkowita pamięć
Każda kwantyzacja na karcie modelu ma dwie kolumny — rozmiar wag i minimalną pamięć RAM — a różnica między nimi to część, którą pomija większość opisów. Kolumna wag to pliki modelu: każdy parametr, w danej precyzji, przebywający w pamięci. Kolumna minimalnej pamięci RAM to to, co maszyna musi pomieścić w czasie działania: wagi oraz pamięć podręczna KV, aktywacje i bufory, które rosną wraz z długością kontekstu.
To właśnie liczba 18B aktywnych parametrów wprowadza ludzi w błąd. GLM-5.3-Flash to model MoE z 320B parametrów łącznie i 18B aktywnymi: na każdy token w obliczeniach bierze udział tylko około 18B parametrów. To oszczędność mocy obliczeniowej, a nie pamięci. W pamięci pozostają wszystkie 320B wag niezależnie od tego, które z ekspertów zostaną uruchomione, ponieważ router nie wie, których ekspertów potrzebuje, dopóki nie zobaczy tokenu. MoE daje szybkość, ale nie zmniejsza śladu pamięciowego — co zresztą widać na karcie samego modelu, gdzie 320B łącznie widnieje obok 18B aktywnych.
Więc kiedy build podaje „~204 GB wag / 224 GB min. RAM”, te dodatkowe ~20 GB to narzut w czasie działania — pamięć podręczna KV, aktywacje, bufory kontekstu. Zwiększ długość kontekstu, a ta różnica rośnie. Maszynę należy dobierać pod kolumnę min. RAM, a nie pod kolumnę wag.

Sam model — architektura, licencja i własne ujęcie Z.ai — jest udokumentowany na oficjalnej karcie dostawcy, pokazanej powyżej. Lokalna pamięć nie jest tam omówiona; dlatego powstała ta strona. Poniższe liczby pochodzą ze społecznościowego portu MLX otwartych wag.
Drabina kwantyzacji
Tabela na karcie orcarouter/GLM-5.3-Flash-MLX jest tą, z której praktycy faktycznie dziś korzystają. Wymienia ona pięć skwantowanych wariantów oraz referencję FP8, każdy z rozmiarem wag i minimalną ilością pamięci RAM:
Referencja FP8 — wagi o wielkości ~328 GB. Niezkwantowany punkt odniesienia, na którym dostępne są otwarte wagi.
• 6-bit — ~296 GB wag / min. 320 GB RAM. Prawie bezstratny; wariant o najwyższej jakości.
4-bit — ~204 GB / 224 GB. Rekomendowany domyślny wybór na co dzień.
• 3-bit — ~184 GB / 200 GB. Agresywne, ale użyteczne.
• 2-bit — ~145 GB / 160 GB. Najlepsze starania.
• 2bit-lite — ~102 GB / 112 GB. Najmniejsza wersja; jedyna, która mieści się na Macu z 128 GB lub pojedynczym H200.
Jakość spada wraz ze spadkiem liczby bitów, a karta modelu ujmuje to ilościowo. W porównaniu z referencją FP8, perplexity pogarsza się o +0,24% przy 6 bitach, +2,96% przy 4 bitach, +9,96% przy 3 bitach, +56,9% przy 2 bitach i +141% przy 2bit-lite (wartości perplexity pochodzą z tej samej karty modelu). Wytyczne samej karty modelu: 6 bitów dla jakości niemal bezstratnej, 4 bity jako domyślny wybór na co dzień, 3 i 2 bity przy ograniczonej pamięci, 2bit-lite tylko wtedy, gdy nic innego się nie mieści — a generowanie długiego kodu przy 2bit-lite nie jest niezawodne. To ostatnie ostrzeżenie ma znaczenie dla modelu rozumującego 320B: to 2bit-lite pozwala kupić Maca z 128 GB, a podatek jakościowy trafia dokładnie tam, gdzie praca nad kodem boli najbardziej.

Dwie liczby w tej drabinie zasługują na bliższe przyjrzenie się, ponieważ decydują o całej kwestii sprzętu.
Dlaczego istnieje 2bit-lite
2bit-lite nie jest dodatkowym poziomem jakości — to poziom rozmiaru stworzony z jednego powodu: zwykły 2-bit się nie mieści. Przy ~102 GB wag to jedyna wersja, która mieści się w ~112 GB użytecznej pamięci na Macu 128 GB, i jedyna, która mieści się w 141 GB pojedynczego H200, zostawiając miejsce na pamięć podręczną KV. Karta modelu mówi wprost: zwykły 2-bit nie mieści się w Macu 128 GB; 2bit-lite się mieści, z podniesionym limitem pamięci przypisanej. Na H200 mieści się „z ~39 GB pozostałymi na pamięć podręczną KV” (słowa karty). Te 39 GB to cały budżet roboczy na wszystko, co model robi po załadowaniu — co prowadzi nas do kontekstu.
Ile kosztuje pamięć podręczna KV przy długim kontekście
GLM-5.3-Flash ma okno kontekstowe o wielkości 1 miliona tokenów, a długi kontekst to miejsce, w którym plany dotyczące pamięci lokalnej umierają. Hybrydowa mechanika uwagi modelu, obejmująca rzadkie i liniowe składniki — NoPE-MLA z mechanizmem indeksowania puli — jest naprawdę wydajna: Z.ai podaje, że zmniejsza koszty obliczeniowe uwagi 3,01-krotnie, a rozmiar pamięci podręcznej KV 4,44-krotnie w porównaniu z własnym GLM-5.3 (dane producenta). Jednak „4,44 razy mniejsze niż GLM-5.3” wciąż oznacza pamięć podręczną mierzoną w dziesiątkach GiB, gdy zbliżasz się do pełnego kontekstu o wielkości 1 miliona tokenów.
Najlepsze publiczne dane, jakie mamy, pochodzą ze wdrożenia społecznościowego, które uruchomiło model na czterech węzłach DGX Spark: {{1}}16 GiB pamięci podręcznej KV na rangę{{/1}} — łącznie około 64 GiB we wszystkich czterech — {{2}}do utrzymania pełnego kontekstu 1M tokenów{{/2}}, o pojemności wystarczającej do obsługi kilku równoczesnych żądań z pełnym kontekstem. {{3}}To więcej niż cały budżet pamięci większości pojedynczych maszyn, zanim uwzględni się choćby jedną wagę.{{/3}} {{4}}Na pojedynczym H200 sednem tej strony jest arytmetyka: 2bit-lite pozostawia ~39 GB na wszystko oprócz wag — zapas wystarczający na krótką rozmowę, który znika w ciągu kilku minut, gdy kontekst rośnie w stronę 100 tys. tokenów.{{/4}}
Praktyczna zasada: kolumna min-RAM zakłada rozsądny kontekst. Jeśli Twoje obciążenie obejmuje długie dokumenty, pętle agentów lub kod na skalę repozytorium, dolicz pamięć na KV-cache — a przy czymkolwiek bliskim 1M tokenów przestań liczyć i użyj API. Te obserwacje dotyczące rozmiarów to ustalenia społeczności; nie istnieją żadne wytyczne producentów dotyczące budżetowania KV.
Limit zablokowanej pamięci w macOS: dlaczego Mac z 128 GB nadal się nie ładuje
Najczęściej zgłaszanym przez praktyków problemem nie jest „za mało RAM-u”. To 128 GB Mac z modelem o wielkości ~102 GB, który nie chce się załadować. Przyczyną jest limit pamięci przypiętej w macOS. Na Apple Silicon GPU nie może zaadresować całej pamięci współdzielonej: Metal udostępnia „zalecany maksymalny zestaw roboczy” wynoszący mniej więcej dwie trzecie fizycznego RAM-u, a alokacje powyżej tej wartości kończą się niepowodzeniem, nawet gdy maszyna ma wolną pamięć.
Tak więc domyślny budżet Metal dla Maca z 128 GB RAM mieści się gdzieś w zakresie 80–90 GB — poniżej tego, czego potrzebuje wersja 2bit-lite (~112 GB min. RAM z modelem rezydentnym o wielkości ~102 GB). Wczytywanie kończy się niepowodzeniem z powodu budżetu Metal, a nie pojemności RAM. Naprawa w każdym znalezionym przez nas raporcie praktyków jest taka sama: podnieś limit pamięci przypiętej za pomocą sudo sysctl iogpu.wired_limit_mb=…, ustawiając wartość powyżej całkowitego zapotrzebowania modelu w MB, i spodziewaj się, że zresetuje się po restarcie. Niektóre poradniki społeczności ustawiają również limit pamięci przypiętej z Pythona przez mlx.metal.set_wired_limit(), aby wagi modelu były przypięte, a macOS przestał kompresować nieużywane strony Metal.
Jeszcze jedna komplikacja: środowiska uruchomieniowe zachowują się różnie. MLX egzekwuje limit pamięci Metal i w przypadku jego przekroczenia twardo kończy działanie, podczas gdy środowiska oparte na llama.cpp (ścieżka GGUF) zazwyczaj go nie egzekwują i pozwalają macOS na użycie swapu. Dlatego ten sam model może odmówić załadowania w jednym środowisku, a w innym „załadować się” — i dlatego wyswapowany model może być tak wolny, że aż bezużyteczny. To ustalenia społeczności na temat zachowania macOS, a nie wytyczne Apple.
Alternatywa hostowana: z-ai/glm-5.3-flash
Dla wszystkich, których powyższe liczby wykluczają — a jest to {{1}}większość ludzi{{/1}} — Z.ai udostępnia sam model jako z-ai/glm-5.3-flash, i właśnie tutaj {{2}}„Flash" w nazwie{{/2}} faktycznie się ujawnia. Cena katalogowa Z.ai wynosi 0,15 USD za milion tokenów wejściowych, 0,03 USD za milion tokenów wejściowych z pamięci podręcznej i 0,50 USD za milion tokenów wyjściowych; promocja startowa obowiązuje do 9 września 2026 r. w cenach 0,075 / 0,015 / 0,25 USD (ceny podane przez dostawcę, aktualne w momencie pisania). Wejście z pamięci podręcznej kosztujące jedną piątą ceny świeżego wejścia to największa dźwignia kosztowa: każde zadanie z prefiksem możliwym do ponownego wykorzystania — promepty systemowe, definicje narzędzi, długie współdzielone dokumenty — powinno być rozliczane w cenie odczytu z pamięci podręcznej.
Bilans pamięci powinien być częścią tej decyzji. Serwowanie modelu 320B we własnym zakresie oznacza przeznaczenie 112–320 GB pamięci na ten model, niezależnie od tego, czy jest bezczynny, czy w pełni obciążony. Zarządzany endpoint przenosi to wszystko poza Twoje maszyny, a przy cenach promocyjnych z okazji premiery model kosztuje mniej za token niż wiele modeli dziesięciokrotnie mniejszych — co jest całym sensem MoE z 18B aktywnymi parametrami.
To także naturalne miejsce dla punktu routingu. Dzięki OrcaRouter, z-ai/glm-5.3-flash jest jednym z ponad 200 modeli za pojedynczym API, wycenianym według ceny listowej dostawcy z 0% narzutu — więc promocja startowa i każda przyszła obniżka cen są aktywne tego samego dnia, w którym zostaną ogłoszone. Automatyczne przełączanie awaryjne oznacza, że trzydniowy model z niestabilną ścieżką serwowania nie jest zakładem na Twój stos produkcyjny: jeśli dostawca zwróci błąd lub osiągnie nasycenie, żądanie jest przekierowywane do zdrowego dostawcy zamiast kończyć się niepowodzeniem. Bezpieczne wypróbowanie niesprawdzonego modelu to dokładnie to, do czego służy router.

Najczęściej zadawane pytania
Czy mogę uruchomić GLM-5.3-Flash na RTX 5090?
Nie. Najmniejszy build to ~102 GB samych wag, a RTX 5090 ma 32 GB pamięci VRAM. Żadna konsumencka karta graficzna się nie zbliża; model wymaga komputerów Mac z pamięcią zunifikowaną, jednego H200 lub serwera multi-GPU.
Czy 18B aktywnych oznacza, że GLM-5.3-Flash działa na sprzęcie konsumenckim?
Nie. Liczba 18B aktywnych parametrów odnosi się do obliczeń na token. Wszystkie 320B parametrów pozostają w pamięci, ponieważ router nie może wiedzieć, których ekspertów potrzebuje token, dopóki go nie zobaczy. MoE oszczędza moc obliczeniową, a nie pamięć.
Jaki jest najtańszy sposób, aby wypróbować GLM-5.3-Flash?
Hostowane API, z-ai/glm-5.3-flash. W promocyjnej cenie na start kosztuje 0,075 USD za milion tokenów wejściowych, a tokeny z pamięci podręcznej kosztują 0,015 USD. Samodzielne hostowanie najmniejszej wersji oznacza przeznaczenie na nią ~112 GB pamięci RAM, co ma sens tylko wtedy, gdy już posiadasz odpowiedni sprzęt.
Uczciwe podsumowanie: GLM-5.3-Flash to model klasy serwerowej w każdej wersji. Mac z 128 GB RAM otrzymuje tę jedną wersję, która pasuje — 2bit-lite, z podniesionym limitem pamięci zablokowanej, krótkimi kontekstami i udokumentowaną obniżką jakości przy długim kodzie. Pojedynczy H200 dostaje tę samą wersję z ~39 GB zapasu na KV. Sprzęt serwerowy ma prawdziwą drabinę opcji — od 4-bitów jako domyślnej po niemal bezstratne 6-bitów. A dla wszystkich innych — czyli większości czytelników — hostowany endpoint z-ai/glm-5.3-flash to właściwa odpowiedź, a powyższe liczby są tego powodem, a nie listą zakupów. Jeśli chodzi o instalację krok po kroku na MacBooku Pro, nasz przewodnik instalacji na MacBooku obejmuje cały proces od początku do końca; jeśli chodzi o porównanie wersji kwantyzowanych pod kątem jakości i to, kiedy wybrać którą, przewodnik po kompilacjach MLX zawiera szczegóły; a relacja z premiery niesie kontekst wydania i deklaracje dotyczące benchmarków.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
