
Requisiti VRAM di GLM-5.3-Flash: Quanta memoria serve per eseguire un MoE da 320B
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
GLM-5.3-Flash non sta su nessuna GPU consumer. La build utilizzabile più piccola, 2bit-lite, richiede ~102 GB di pesi e 112 GB di RAM. Un Mac da 128 GB è il punto di partenza; una singola H200 contiene 2bit-lite con ~39 GB liberi; tutti gli altri dovrebbero usare l'API ospitata, z-ai/glm-5.3-flash.
Questa è l'intera risposta in un solo respiro, e vale la pena dirlo chiaramente, qui e ora: non esiste una configurazione hardware consumer in grado di eseguire questo modello. Il modello vision-language mixture-of-experts di Z.ai con 320 miliardi di parametri, rilasciato il 26 agosto 2026, richiede memoria di classe server in ogni quantizzazione. La cifra "18B active" descrive il calcolo per token, non la memoria residente: tutti i 320 miliardi di pesi restano caricati. Gli obiettivi locali realistici sono Mac con ampia memoria unificata, server multi-GPU e una singola H200 da 141 GB. Se non ne possiedi una, i numeri qui sotto non sono una lista della spesa; sono il motivo per chiamare il modello tramite un'API.
Una nota introduttiva prima dei dati: i numeri relativi alla memoria in questo articolo sono risultati della community, non indicazioni del fornitore. Z.ai pubblica pesi e specifiche API; non pubblica i requisiti di memoria per l'inferenza locale. La tabella per quantizzazione proviene dalla scheda del modello orcarouter/GLM-5.3-Flash-MLX su Hugging Face, una quantizzazione MLX dei pesi aperti mantenuta da un gruppo della community, e i numeri di deployment provengono da professionisti che hanno effettivamente caricato il modello. Dove una cifra è riportata dal fornitore — prezzi e dichiarazioni sull'efficienza della cache KV dell'architettura — lo etichettiamo come tale.
La risposta breve: cosa si adatta a ciò che possiedi
Parti da ciò che hai effettivamente, perché la scala di quantizzazione ha senso solo rispetto a una macchina target:
• GPU consumer (RTX 4090, RTX 5090 e tutte le inferiori) — no. Nessuna scheda consumer ha abbastanza VRAM: la build più piccola richiede ~102 GB di soli pesi, pari a circa cinque RTX 5090. La RAM di sistema non cambia la cosa, perché i pesi devono risiedere sul dispositivo.
• Mac da 128 GB (M4 o M5 Max) — la build 2bit-lite (~102 GB di pesi / 112 GB di RAM minima), e solo dopo aver alzato il limite della memoria wired. Maggiori informazioni qui sotto. Questo è l'unico computer di classe consumer su cui il modello ci sta.
• Mac Studio da 192 GB e 256 GB — diventano raggiungibili la modalità a 3 bit (~184 / 200 GB) e quella a 2 bit (~145 / 160 GB); la modalità a 4 bit richiede ~224 GB, a cui solo il livello da 256 GB si avvicina.
• Singola H200 (141 GB di VRAM) — il 2bit-lite ci sta con circa 39 GB rimasti per la cache KV, il che significa solo contesti brevi.
• Server multi-GPU — tutto, comprese le versioni a 4-bit, a 6-bit e la build di riferimento FP8 da ~328 GB.
• Tutti gli altri — l'API ospitata, z-ai/glm-5.3-flash. Non è un premio di consolazione; è dove il modello è davvero veloce ed economico da usare, ed è trattato in fondo a questa pagina.
Due numeri, non uno: pesi vs memoria totale
Ogni quantizzazione sulla scheda del modello ha due colonne — dimensione dei pesi e RAM minima — e il divario tra loro è la parte che la maggior parte degli articoli tralascia. La colonna dei pesi riguarda i file del modello: ogni parametro, con quella precisione, residente in memoria. La colonna della RAM minima indica ciò che la macchina deve mantenere in esecuzione: i pesi più la cache KV, le attivazioni e i buffer che crescono con la lunghezza del contesto.
Il dato dei 18B attivi è il punto in cui le persone si lasciano ingannare. GLM-5.3-Flash è un MoE da 320B totali / 18B attivi: per ogni token, solo circa 18B parametri vengono calcolati. Questo è un risparmio di calcolo, non di memoria. Tutti i 320B di pesi risiedono in memoria indipendentemente da quali esperti vengono attivati, perché il router non sa quali esperti gli servono finché non vede il token. La MoE compra velocità, non ingombro — un punto che la scheda del modello stesso dimostra con un esempio, mostrando i 320B totali insieme ai 18B attivi.
Quindi quando una build dice "~204 GB pesi / 224 GB RAM minima", i ~20 GB extra sono overhead di runtime — cache KV, attivazioni, buffer di contesto. Aumenta la lunghezza del contesto e quel delta cresce. La colonna della RAM minima, non quella dei pesi, è quella in base a cui dimensionare una macchina.

Il modello stesso — architettura, licenza e l'inquadramento di Z.ai — è documentato sulla scheda ufficiale del fornitore, mostrata sopra. La memoria locale non è coperta lì; è per questo che esiste questa pagina. I numeri qui sotto provengono dal porting MLX della community dei pesi aperti.
La scala di quantizzazione
La tabella sulla scheda orcarouter/GLM-5.3-Flash-MLX è quella che i professionisti stanno effettivamente caricando oggi. Elenca cinque build quantizzati più il riferimento FP8, ciascuno con dimensione dei pesi e RAM minima:
• Riferimento FP8 — ~328 GB di pesi. Il punto di riferimento non quantizzato in cui vengono rilasciati i pesi open.
• 6-bit — ~296 GB di pesi / 320 GB di RAM minima. Quasi senza perdite; la build di qualità migliore.
• 4-bit — ~204 GB / 224 GB. Il default consigliato per l'uso quotidiano.
• 3-bit — ~184 GB / 200 GB. Aggressivo ma utilizzabile.
• 2-bit — ~145 GB / 160 GB. Best-effort.
• 2bit-lite — ~102 GB / 112 GB. La build più piccola; l'unica che sta su un Mac da 128 GB o su una singola H200.
La qualità cala man mano che i bit diminuiscono, e la scheda lo quantifica. Rispetto al riferimento FP8, la perplexity degrada di +0,24% a 6 bit, +2,96% a 4 bit, +9,96% a 3 bit, +56,9% a 2 bit e +141% a 2bit-lite (dati di perplexity dalla stessa scheda del modello). Le indicazioni della scheda stessa: 6 bit per una resa quasi senza perdite, 4 bit come default quotidiano, 3 bit e 2 bit quando la memoria è limitata, 2bit-lite solo quando non c'è altro spazio — e la generazione di codice lunga non è affidabile a 2bit-lite. Quest'ultimo avvertimento è importante per un modello di ragionamento da 320B: 2bit-lite è ciò che ti permette di ottenere il Mac da 128 GB, e il costo in termini di qualità ricade esattamente dove il lavoro di codifica fa più male.

Due numeri in quella scala meritano un'attenzione più ravvicinata, perché decidono l'intera questione hardware.
Perché 2bit-lite esiste
2bit-lite non è un livello di qualità extra — è un livello dimensionale creato per una sola ragione: il 2-bit normale non ci sta. Con ~102 GB di pesi, è l'unica build che scivola sotto i ~112 GB di memoria utilizzabile su un Mac da 128 GB, e l'unica che entra nei 141 GB di una singola H200 lasciando spazio per una cache KV. La scheda del modello lo dice chiaramente: il 2-bit normale non ci sta su un Mac da 128 GB; 2bit-lite sì, con un limite di memoria wired più alto. Su una H200 ci sta "con ~39 GB rimasti per la cache KV" (parole della scheda). Quei 39 GB sono l'intero budget di lavoro per tutto ciò che il modello fa dopo il caricamento — il che ci porta al contesto.
Quanto costa la KV cache con contesto lungo
GLM-5.3-Flash ha una finestra di contesto da 1 milione di token, ed è proprio sui contesti lunghi che i piani di memoria locale falliscono. L'attenzione ibrida sparse-plus-lineare del modello — NoPE-MLA con meccanismo di index-pool — è realmente efficiente: Z.ai riferisce che riduce il calcolo dell'attenzione di 3,01× e la dimensione della cache KV di 4,44× rispetto al proprio GLM-5.3 (dati forniti dal fornitore). Ma "4,44× più piccola di GLM-5.3" lascia comunque una cache misurabile in decine di GiB quando ci si spinge verso un contesto pieno da 1 milione.
Il miglior dato pubblico che abbiamo proviene da una distribuzione della community che ha eseguito il modello su quattro nodi DGX Spark: 16 GiB di cache KV per rank — circa 64 GiB totali sui quattro — per contenere un contesto completo da 1 milione di token, dimensionato per supportare alcune richieste concorrenti a contesto completo. Ciò supera l'intero budget di memoria della maggior parte delle macchine singole, prima ancora di caricare un singolo peso. Su una singola H200, l'aritmetica è il punto di questa pagina: la 2bit-lite lascia ~39 GB per tutto il resto dopo i pesi — comodi per una breve chat, esauriti in pochi minuti man mano che il contesto sale verso i 100K token.
La regola pratica: la colonna min-RAM presuppone un contesto ragionevole. Se il tuo carico di lavoro esegue documenti lunghi, loop di agenti o codice su scala di repository, metti in conto anche la memoria della cache KV — e per qualsiasi cosa vicina a 1 milione di token, smetti di fare i calcoli e usa l'API. Queste osservazioni sul dimensionamento sono risultati della community; non esiste alcuna indicazione del fornitore per il budget della cache KV.
Il limite della memoria wired in macOS: perché un Mac da 128 GB non riesce comunque a caricare
Il guasto più comune segnalato dai professionisti non è "RAM insufficiente". È un Mac da 128 GB con un modello di circa 102 GB che rifiuta di caricarsi. La causa è il limite di memoria wired di macOS. Su Apple Silicon, la GPU non può indirizzare tutta la memoria unificata: Metal espone un "set di lavoro massimo consigliato" di circa due terzi della RAM fisica, e le allocazioni superiori falliscono anche quando la macchina ha memoria libera.
Quindi il budget Metal predefinito di un Mac da 128 GB si attesta all'incirca nella fascia 80–90 GB — al di sotto di quanto richiesto dalla build 2bit-lite (~112 GB di RAM minima con un modello residente di ~102 GB). Il caricamento fallisce per il budget Metal, non per la capacità di RAM. La soluzione in ogni report di professionisti che abbiamo trovato è la stessa: alzare il limite wired con sudo sysctl iogpu.wired_limit_mb=…, impostando un valore superiore all'ingombro totale del modello in MB, e aspettarsi che si azzeri al riavvio. Alcune guide della community impostano anche il limite wired da Python tramite mlx.metal.set_wired_limit(), così che i pesi del modello vengano bloccati in memoria e macOS smetta di comprimere le pagine Metal inattive.
Un'altra complicazione: i runtime si comportano in modo diverso. MLX applica il budget Metal e fallisce bruscamente quando viene superato, mentre i runtime basati su llama.cpp (il percorso GGUF) di norma non lo applicano e lasciano che macOS usi lo swap. Ecco perché lo stesso modello può rifiutarsi di caricarsi in un runtime e "caricarsi" in un altro — e perché un modello in swap può essere così lento da risultare inutilizzabile. Questi sono riscontri della community sul comportamento di macOS, non indicazioni di Apple.
L'alternativa ospitata: z-ai/glm-5.3-flash
Per tutti coloro che i numeri sopra escludono — cioè la maggior parte — Z.ai mette a disposizione il modello stesso come z-ai/glm-5.3-flash, ed è qui che la "Flash" nel nome si vede davvero. Il prezzo di listino di Z.ai è $0.15 per milione di token di input, $0.03 per milione di token di input in cache e $0.50 per milione di token di output; una promozione di lancio è attiva fino al 9 settembre 2026 a $0.075 / $0.015 / $0.25 (prezzi dichiarati dal fornitore, aggiornati al momento della scrittura). L'input in cache a un quinto dell'input nuovo è la più grande leva di costo: qualsiasi workload con un prefisso riutilizzabile — prompt di sistema, definizioni di strumenti, lunghi documenti condivisi — dovrebbe sfruttare il prezzo di lettura della cache.
Il calcolo della memoria fa parte della decisione. Servire un modello da 320B da soli significa dedicargli 112–320 GB di memoria, sia che sia inattivo o saturato. L'endpoint ospitato sposta tutto questo dalle tue macchine, e ai prezzi promozionali di lancio il modello costa meno per token rispetto a molti modelli un decimo delle sue dimensioni — che è esattamente lo scopo di un MoE con 18B attivi.
Questo è anche il luogo naturale per il punto di routing. Attraverso OrcaRouter, z-ai/glm-5.3-flash è uno dei 200+ modelli dietro una singola API, al prezzo di listino del provider con 0% di markup — quindi la promo di lancio, e qualsiasi futuro taglio di prezzo, sono attivi lo stesso giorno in cui vengono annunciati. Il failover automatico significa che un modello vecchio di tre giorni con un percorso di servizio instabile non è una scommessa sul tuo stack di produzione: se il provider va in errore o si satura, la richiesta passa a un provider sano invece di fallire. Testare un modello non collaudato in sicurezza è esattamente ciò a cui serve un router.

Domande frequenti
Posso eseguire GLM-5.3-Flash su una RTX 5090?
No. La build più piccola è di ~102 GB di soli pesi, e una RTX 5090 ha 32 GB di VRAM. Nessuna GPU consumer si avvicina; il modello richiede Mac con memoria unificata, un singolo H200, o un server multi-GPU.
18B attivi significa che GLM-5.3-Flash gira su hardware consumer?
No. Il dato di 18B attivi si riferisce al calcolo per token. Tutti i 320B parametri restano residenti in memoria, perché il router non può sapere di quali esperti un token ha bisogno finché non vede il token. MoE risparmia calcolo, non memoria.
Qual è il modo più economico per provare GLM-5.3-Flash?
L'API ospitata, z-ai/glm-5.3-flash. Al prezzo promozionale di lancio costa $0.075 per milione di token di input, e i token di input in cache costano $0.015. L'hosting autonomo della build più piccola significa dedicarle ~112 GB di RAM, il che ha senso solo se si possiede già l'hardware.
Il riepilogo onesto: GLM-5.3-Flash è un modello di classe server in ogni build. Il Mac da 128 GB riceve l'unica build adatta — 2bit-lite, con un aumento del limite di memoria wired, contesti brevi e una penalità di qualità documentata sul codice lungo. Una singola H200 ottiene la stessa build con ~39 GB di margine KV. L'hardware server ha la vera scala, dal 4-bit come predefinito fino al 6-bit quasi lossless. E per tutti gli altri — la maggior parte dei lettori — l'endpoint hosted z-ai/glm-5.3-flash è la risposta giusta, e i numeri sopra sono il motivo, non una lista della spesa. Per l'installazione passo passo su un MacBook Pro, la nostra guida all'installazione su MacBook copre l'intero flusso dall'inizio alla fine; per come le build di quantizzazione si confrontano in termini di qualità e quando sceglierle, la guida alle build MLX fornisce i dettagli; e la copertura del rilascio riporta il contesto del lancio e le affermazioni sui benchmark.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
