
GLM-5.3-Flash VRAM-krav: Hur mycket minne du behöver för att köra en 320B MoE
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 221 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
GLM-5.3-Flash får inte plats på något konsument-GPU. Det minsta användbara bygget, 2bit-lite, kräver ~102 GB vikter och 112 GB RAM. En 128 GB Mac är ingångspunkten; en enda H200 rymmer 2bit-lite med ~39 GB över; alla andra bör använda den hostade API:n, z-ai/glm-5.3-flash.
Det är hela svaret i ett andetag, och det är värt att säga rakt ut här: det finns ingen konsumenthårdvarukonfiguration som kan köra den här modellen. Z.ais vision-language-mixture-of-experts-modell med 320 miljarder parametrar, släppt den 26 augusti 2026, kräver serverklassat minne i varje kvantisering. Siffran ”18B aktiv” beskriver beräkning per token, inte beständigt minne – alla 320 miljarder vikter förblir inladdade. De realistiska lokala målen är stora Mac-datorer med enhetligt minne, multi-GPU-servrar och en enda H200 med 141 GB. Om du inte äger någon av dessa är siffrorna nedan inte en inköpslista; de är anledningen till att anropa modellen via ett API i stället.
En inledande anmärkning före siffrorna: minnessiffrorna i denna text är communityns rön, inte leverantörens vägledning. Z.ai publicerar vikter och API-specifikationer; företaget publicerar inte minneskrav för lokal inferens. Tabellen per kvantisering kommer från modellkortet orcarouter/GLM-5.3-Flash-MLX på Hugging Face, en MLX-kvantisering av de öppna vikterna som en communitygrupp underhåller, och driftsättningssiffrorna kommer från utövare som faktiskt har laddat modellen. Där en siffra är leverantörsrapporterad — prissättning och arkitekturens påståenden om KV-cacheeffektivitet — märker vi den som sådan.
Det korta svaret: vad som passar på det du äger
Utgå från det du faktiskt har, eftersom kvantiseringsstegen bara är meningsfull mot en målmaskin:
• Konsument-GPU (RTX 4090, RTX 5090 och allt därunder) — nej. Inte ett enda konsumentkort har tillräckligt med VRAM: den minsta konstruktionen är ~102 GB enbart i vikter, ungefär värt fem RTX 5090. System-RAM ändrar inte detta, eftersom vikterna måste finnas på enheten.
• 128 GB Mac (M4 eller M5 Max) — 2bit-lite-bygget (~102 GB vikter / 112 GB minsta RAM), och bara efter att ha höjt gränsen för trådat minne. Mer om det nedan. Det här är den enda maskinen i konsumentklass som modellen får plats på.
• 192 GB och 256 GB Mac Studio — 3-bit (~184 / 200 GB) och 2-bit (~145 / 160 GB) blir tillgängliga; 4-bit kräver ~224 GB, vilket endast 256 GB-nivån närmar sig.
• En enskild H200 (141 GB VRAM) — 2bit-lite får plats med ungefär 39 GB kvar för KV-cachen, vilket innebär endast korta kontexter.
• Multi-GPU-server — allt, inklusive 4-bit, 6-bit och ~328 GB FP8-referensbygget.
• Alla andra — den hostade API:n, z-ai/glm-5.3-flash. Det är inte ett tröstpris; det är där modellen faktiskt är snabb och billig att använda, och det tas upp längst ner på den här sidan.
Två siffror, inte en: vikter vs totalt minne
Varje kvantisering på modellkortet har {{1}}två kolumner{{/1}} — {{2}}viktstorlek och minsta RAM{{/2}} — och {{3}}gapet mellan dem är den del de flesta artiklar utelämnar{{/3}}. {{4}}Viktkolumnen är modellfilerna{{/4}}: {{5}}varje parameter, i den precisionen, lagrad i minnet{{/5}}. {{6}}Minsta-RAM-kolumnen är vad maskinen måste hålla vid körning{{/6}}: {{7}}vikterna plus KV-cachen, aktiveringarna och buffertarna som växer med kontextlängden{{/7}}.
Det som folk missförstår är siffran 18B-active. GLM-5.3-Flash är en MoE med totalt 320B parametrar, varav 18B är aktiva: per token är det bara cirka 18B parametrar som beräknas. Det är en besparing i beräkning, inte i minne. Alla 320B vikter ligger i minnet oavsett vilka experter som aktiveras, eftersom routern inte vet vilka experter den behöver förrän den ser token. MoE ger hastighet, inte fotavtryck – en poäng som modellens eget kort illustrerar med exempel, där de 320B totalt visas tillsammans med de 18B aktiva.
Så när en build säger "~204 GB vikter / 224 GB min RAM," är de extra ~20 GB runtime-overhead — KV-cache, aktiveringar, kontextbuffertar. Ökar du kontextlängden växer den skillnaden. Min-RAM-kolumnen, inte viktkolumnen, är den man ska dimensionera en maskin efter.

Själva modellen — arkitektur, licens och Z.ai:s egen beskrivning — dokumenteras på leverantörens officiella kort, som visas ovan. Lokalt minne täcks inte där; det är därför den här sidan finns. Siffrorna nedan kommer från communityns MLX-port av de öppna vikterna.
Kvantiseringsstegen
Tabellen på orcarouter/GLM-5.3-Flash-MLX-kortet är den som praktiker faktiskt laddar från idag. Den listar fem kvantiserade byggen plus FP8-referensen, var och en med viktstorlek och minsta RAM-minne:
• FP8-referens — ~328 GB vikter. Den okvantiserade referenspunkten som de öppna vikterna levereras med.
• 6-bit — ~296 GB vikter / 320 GB min RAM. Nästan förlustfri; bygget med bäst kvalitet.
• 4-bit — ~204 GB / 224 GB. Det rekommenderade standardalternativet för dagligt bruk.
• 3-bit — ~184 GB / 200 GB. Aggressiv men användbar.
• 2-bit — ~145 GB / 160 GB. Bästa möjliga.
• 2bit-lite — ~102 GB / 112 GB. Den minsta versionen; den enda som ryms på en 128 GB Mac eller en enda H200.
Kvaliteten sjunker när bitarna minskar, och kortet kvantifierar det. Jämfört med FP8-referensen försämras perplexiteten med +0,24 % vid 6 bitar, +2,96 % vid 4 bitar, +9,96 % vid 3 bitar, +56,9 % vid 2 bitar och +141 % vid 2bit-lite (perplexitetssiffror från samma modellkort). Kortets egna vägledning: 6 bitar för nästan förlustfritt, 4 bitar som standard i vardagen, 3 bitar och 2 bitar när minnet är begränsat, 2bit-lite bara när inget annat passar – och lång kodgenerering är inte tillförlitlig vid 2bit-lite. Den sista varningen är viktig för en 320B-resonemangsmodell: 2bit-lite är det som ger dig 128 GB Mac, och kvalitetsskatten landar precis där kodningsarbete gör mest ont.

Två siffror i den stegen förtjänar en närmare titt eftersom de avgör hela hårdvarufrågan.
Varför 2bit-lite finns
2bit-lite är inte en extra kvalitetsnivå – det är en storleksnivå skapad av en enda anledning: vanlig 2-bit får inte plats. Med vikter på ~102 GB är det den enda versionen som ryms under de ~112 GB användbart minne på en 128 GB Mac, och den enda som får plats på en enskild H200:s 141 GB med utrymme kvar för en KV-cache. Modellkortet säger lika mycket: vanlig 2-bit får inte plats på en 128 GB Mac; 2bit-lite gör det, med en höjd gräns för trådat minne. På en H200 får den plats "med ~39 GB kvar för KV-cachen" (kortets ord). Dessa 39 GB är hela arbetsbudgeten för allt modellen gör efter inläsning – vilket för oss till kontext.
Vad KV-cachen kostar vid lång kontext
GLM-5.3-Flash har ett kontextfönster på 1M-token, och lång kontext är där lokala minnesplaner dör. Modellens hybrida gles-plus-linjära uppmärksamhet — NoPE-MLA med en index-pool-mekanism — är genuint effektiv: Z.ai rapporterar att den minskar uppmärksamhetsberäkningen 3,01× och KV-cachestorleken 4,44× jämfört med dess egen GLM-5.3 (leverantörsrapporterade siffror). Men ”4,44× mindre än GLM-5.3” lämnar fortfarande en cache som mäts i tiotals GiB när du trycker mot en full 1M-kontext.
Den bästa offentliga siffran vi har kommer från en community-distribution som körde modellen över fyra DGX Spark-noder: 16 GiB KV-cache per rank — cirka 64 GiB totalt över de fyra — för att hålla ett fullt 1M-token-kontext, dimensionerat för att stödja några få samtidiga fullkontextförfrågningar. Det är mer än hela minnesbudgeten för de flesta enskilda maskiner, innan en enda vikt. På en enskild H200 är aritmetiken poängen med denna sida: 2bit-lite lämnar ~39 GB för allt efter vikterna — bekvämt för en kort chatt, borta på minuter när kontextet klättrar mot 100K tokens.
Den praktiska regeln: min-RAM-kolumnen förutsätter ett rimligt sammanhang. Om din arbetsbelastning kör långa dokument, agentloopar eller kod i repositorieskala, budgetera KV-cache-minne utöver det — och för allt nära 1M tokens, sluta räkna och använd API:et. Dessa storleksobservationer är community-rön; det finns ingen vägledning från leverantörer för KV-budgetering.
Gränsen för trådat minne i macOS: varför en Mac med 128 GB fortfarande inte kan ladda
Det vanligaste felet som utövare rapporterar är inte "för lite RAM-minne." Det är en Mac med 128 GB och en modell på ~102 GB som vägrar att ladda. Orsaken är macOS:s gräns för trådat minne. På Apple Silicon kan GPU:n inte adressera allt enhetligt minne: Metal presenterar en "rekommenderad maximal arbetsuppsättning" på ungefär två tredjedelar av det fysiska RAM-minnet, och allokeringar över den misslyckas även när maskinen har ledigt minne.
Så en 128 GB Mac:s standard Metal-budget ligger någonstans i intervallet 80–90 GB — under vad 2bit-lite-bygget behöver (~112 GB min RAM med en modell på ~102 GB resident). Inläsningen misslyckas på grund av Metal-budgeten, inte på grund av RAM-kapaciteten. Fixen i varje praktikerrapport vi hittat är densamma: höj den trådbundna gränsen med `sudo sysctl iogpu.wired_limit_mb=…`, sätt ett värde över modellens totala fotavtryck i MB, och förvänta dig att den återställs vid omstart. Vissa communityguider sätter också den trådbundna gränsen från Python via `mlx.metal.set_wired_limit()` så att modellens vikter låses fast och macOS slutar komprimera inaktiva Metal-sidor.
Ännu en detalj: körtider beter sig olika. MLX upprätthåller Metal-budgeten och slår hårt när den överskrids, medan körtider baserade på llama.cpp (GGUF-vägen) i allmänhet inte upprätthåller den utan låter macOS använda swap-minne istället. Det är därför samma modell kan vägra att ladda i en körtid och "ladda" i en annan — och varför en swappad modell kan vara så långsam att den blir oanvändbar. Detta är communityns upptäckter om macOS-beteende, inte Apples vägledning.
Det värdbaserade alternativet: z-ai/glm-5.3-flash
För alla som utesluts av siffrorna ovan — vilket är de flesta — tillhandahåller Z.ai själva modellen som z-ai/glm-5.3-flash, och det är här som "Flash" i namnet faktiskt visar sig. Z.ai:s listpris är $0,15 per miljon inmatningstokens, $0,03 per miljon cachelagrade inmatningstokens och $0,50 per miljon utmatningstokens; en lanseringskampanj pågår till den 9 september 2026 till $0,075 / $0,015 / $0,25 (priser rapporterade av leverantören, aktuella vid skrivande stund). Cachelagrad inmatning till en femtedel av färsk inmatning är den enskilt största kostnadsfaktorn: alla arbetsbelastningar med ett återanvändbart prefix — systemprompter, verktygsdefinitioner, långa delade dokument — bör dra nytta av prissättningen för cache-läsning.
Minnesmatematiken bör ingå i beslutet. Att själv servera en 320B-modell innebär att man avsätter 112–320 GB minne till den, oavsett om den är inaktiv eller mättad. Den värdbaserade slutpunkten flyttar allt detta från dina maskiner, och till introduktionspriser kostar modellen mindre per token än många modeller en tiondel av dess storlek — vilket är hela poängen med en 18B-aktiv MoE.
Detta är också den naturliga platsen för routingpunkten. Genom OrcaRouter är z-ai/glm-5.3-flash en av 200+ modeller bakom ett enda API, prissatt till leverantörens listpris med 0% påslag — så lanseringserbjudandet och eventuella framtida prissänkningar blir live samma dag som de tillkännages. Automatisk failover innebär att en tre dagar gammal modell med en ostadig serveringsväg inte är en satsning på din produktionsstack: om leverantören felar eller blir mättad, rullas begäran över till en frisk leverantör istället för att misslyckas. Att säkert prova en oprövad modell är precis vad en router är till för.

Vanliga frågor
Kan jag köra GLM-5.3-Flash på ett RTX 5090?
Nej. Det minsta bygget är ~102 GB enbart i vikter, och ett RTX 5090 har 32 GB VRAM. Ingen konsument-GPU kommer i närheten; modellen kräver Macar med enhetligt minne, en enda H200, eller en server med flera GPU:er.
Betyder 18B aktiv att GLM-5.3-Flash körs på konsumenthårdvara?
Nej. Siffran 18B aktiv avser beräkning per token. Alla 320B parametrar ligger kvar i minnet, eftersom routern inte kan veta vilka experter en token behöver förrän den ser token. MoE sparar beräkning, inte minne.
Vad är det billigaste sättet att prova GLM-5.3-Flash?
Det värdbaserade API:t, z-ai/glm-5.3-flash. Till lanseringspriset kostar det $0,075 per miljon inmatningstoken, och cachade inmatningstoken kostar $0,015. Att själv hosta den minsta builden innebär att avsätta ~112 GB RAM till den, vilket bara är vettigt om du redan äger hårdvaran.
Den ärliga sammanfattningen: GLM-5.3-Flash är en serverklassmodell i varje bygge. 128 GB Mac får det enda bygget som passar — 2bit-lite, med höjd gräns för trådat minne, korta kontexter och en dokumenterad kvalitetsförlust för lång kod. En enskild H200 får samma bygge med ~39 GB KV-headroom. Serverhårdvara får den riktiga skalan, från 4-bit som standard upp till nära förlustfri 6-bit. Och för alla andra – de flesta läsare – är den hostade z-ai/glm-5.3-flash-endpointen rätt svar, och siffrorna ovan är anledningen, inte en inköpslista. För steg-för-steg-installation på en MacBook Pro täcker vår MacBook-installationsgenomgång hela flödet från början till slut; för hur kvantiseringsbyggen står sig kvalitetsmässigt och när du ska välja vilket finns detaljerna i MLX-byggguiden; och lanseringsbevakningen innehåller lanseringskontexten och benchmark-påståendena.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
