
Requisitos de VRAM do GLM-5.3-Flash: Quanta memória você precisa para executar um MoE de 320B
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O GLM-5.3-Flash não cabe em nenhuma GPU de consumo. A menor versão utilizável, 2bit-lite, precisa de ~102 GB de pesos e 112 GB de RAM. Um Mac de 128 GB é o ponto de entrada; uma única H200 comporta o 2bit-lite com ~39 GB de sobra; todos os demais devem usar a API hospedada, z-ai/glm-5.3-flash.
Essa é a resposta completa em uma única frase, e vale a pena dizê-la claramente aqui: não existe configuração de hardware de consumo que execute este modelo. O modelo de visão-linguagem com mistura de especialistas de 320B parâmetros da Z.ai, lançado em 26 de agosto de 2026, exige memória de classe servidor em todas as quantizações. O valor "18B ativos" descreve o cálculo por token, não a memória residente — todos os 320B de pesos permanecem carregados. Os alvos locais realistas são Macs grandes com memória unificada, servidores multi-GPU e uma única H200 com 141 GB. Se você não possui um desses, os números abaixo não são uma lista de compras; eles são o motivo para chamar o modelo por meio de uma API em vez disso.
Uma nota de contextualização antes dos números: os valores de memória neste texto são descobertas da comunidade, não orientações do fornecedor. A Z.ai publica pesos e especificações de API; não publica requisitos de memória para inferência local. A tabela por quantização vem do model card orcarouter/GLM-5.3-Flash-MLX no Hugging Face, uma quantização MLX dos pesos abertos mantida por um grupo da comunidade, e os números de implantação vêm de profissionais que realmente carregaram o modelo. Quando um número é reportado pelo fornecedor — preços e as alegações de eficiência do cache KV da arquitetura — nós o rotulamos como tal.
A resposta curta: o que cabe no que você tem
Comece pelo que você realmente tem, porque a escada de quantização só faz sentido em relação a uma máquina alvo:
• GPU de consumo (RTX 4090, RTX 5090 e todas as inferiores) — não. Nenhuma placa de consumo tem VRAM suficiente: a menor configuração exige ~102 GB só de pesos, o equivalente a cerca de cinco RTX 5090. A RAM do sistema não muda isso, pois os pesos precisam estar residentes no dispositivo.
• Mac de 128 GB (M4 ou M5 Max) — a versão 2bit-lite (~102 GB de pesos / 112 GB de RAM mínima), e somente após aumentar o limite de memória fixa. Mais sobre isso abaixo. Esta é a única máquina de classe consumidora em que o modelo cabe.
• Mac Studio de 192 GB e 256 GB — 3-bit (~184 / 200 GB) e 2-bit (~145 / 160 GB) tornam-se alcançáveis; 4-bit precisa de ~224 GB, que apenas a versão de 256 GB se aproxima.
• H200 único (141 GB de VRAM) — 2bit-lite cabe com cerca de 39 GB restantes para o cache KV, o que significa apenas contextos curtos.
• Servidor multi-GPU — tudo, incluindo 4-bit, 6-bit e o build de referência de ~328 GB FP8.
• Todos os demais — a API hospedada, z-ai/glm-5.3-flash. Isso não é um prêmio de consolação; é onde o modelo é realmente rápido e barato de usar, e está abordado no final desta página.
Dois números, não um: pesos vs memória total
Cada quantização no card do modelo tem duas colunas — tamanho do peso e RAM mínima — e a lacuna entre elas é a parte que a maioria dos artigos ignora. A coluna de pesos corresponde aos arquivos do modelo: cada parâmetro, nessa precisão, residente em memória. A coluna de RAM mínima é o que a máquina deve reter em tempo de execução: os pesos mais o cache KV, as ativações e os buffers que crescem com o comprimento do contexto.
O número de 18B ativos é onde as pessoas se enganam. GLM-5.3-Flash é um MoE de 320B total / 18B ativos: por token, apenas cerca de 18B de parâmetros computam. Isso é uma economia de computação, não de memória. Todos os 320B de pesos ficam na memória, independentemente de quais especialistas são ativados, porque o roteador não sabe quais especialistas precisa até ver o token. MoE compra velocidade, não footprint — um ponto que a própria ficha do modelo demonstra, com os 320B totais em exibição ao lado dos 18B ativos.
Então, quando um build diz "~204 GB de pesos / 224 GB de RAM mínima," os ~20 GB extras são sobrecarga de tempo de execução — cache KV, ativações, buffers de contexto. Aumente o comprimento do contexto e essa diferença cresce. A coluna de RAM mínima, não a coluna de pesos, é a que deve ser usada para dimensionar uma máquina.

O modelo em si — arquitetura, licença e a própria apresentação da Z.ai — está documentado na ficha oficial do fornecedor, mostrada acima. A memória local não é abordada lá; é por isso que esta página existe. Os números abaixo vêm do port MLX da comunidade dos pesos abertos.
A escada de quantização
A tabela no cartão orcarouter/GLM-5.3-Flash-MLX é a que os praticantes estão realmente carregando hoje. Ela lista cinco versões quantizadas mais a referência FP8, cada uma com tamanho de peso e RAM mínima:
• Referência FP8 — ~328 GB de pesos. O ponto de referência não quantizado no qual os pesos abertos são disponibilizados.
• 6-bit — ~296 GB de pesos / 320 GB de RAM mín. Quase sem perdas; a versão de melhor qualidade.
• 4-bit — ~204 GB / 224 GB. O padrão recomendado para uso diário.
• 3-bit — ~184 GB / 200 GB. Agressivo, mas utilizável.
• 2-bit — ~145 GB / 160 GB. Melhor esforço.
• 2bit-lite — ~102 GB / 112 GB. A menor build; a única que cabe em um Mac de 128 GB ou em um único H200.
A qualidade cai à medida que os bits diminuem, e o card quantifica isso. Em relação à referência FP8, a perplexidade degrada em +0,24% em 6 bits, +2,96% em 4 bits, +9,96% em 3 bits, +56,9% em 2 bits e +141% em 2bit-lite (números de perplexidade do próprio card do modelo). As orientações do próprio card: 6 bits para qualidade quase sem perdas, 4 bits como padrão do dia a dia, 3 bits e 2 bits quando houver restrição de memória, 2bit-lite apenas quando nada mais couber — e a geração de código longa não é confiável em 2bit-lite. Esse último aviso é importante para um modelo de raciocínio de 320B: é o 2bit-lite que permite usar o Mac de 128 GB, e o custo de qualidade recai exatamente onde o trabalho de programação mais dói.

Dois números nessa escada merecem uma análise mais detalhada porque eles decidem toda a questão de hardware.
Por que 2bit-lite existe
2bit-lite não é um nível extra de qualidade — é um nível de tamanho criado por um motivo: o 2-bit comum não cabe. Com ~102 GB de pesos, é a única versão que se encaixa abaixo dos ~112 GB de memória utilizável em um Mac de 128 GB, e a única que cabe nos 141 GB de um único H200 com espaço sobrando para um cache KV. O card do modelo diz exatamente isso: o 2-bit comum não cabe em um Mac de 128 GB; o 2bit-lite cabe, com um limite elevado de memória fixa. Em um H200, ele cabe "com ~39 GB sobrando para o cache KV" (palavras do card). Esses 39 GB são todo o orçamento de trabalho para tudo o que o modelo faz após o carregamento — o que nos leva ao contexto.
Quanto custa o cache KV em contexto longo
O GLM-5.3-Flash tem uma janela de contexto de 1M de tokens, e é no contexto longo que os planos de memória local morrem. A atenção híbrida esparsa-mais-linear do modelo — NoPE-MLA com um mecanismo de pool de índices — é genuinamente eficiente: a Z.ai relata que ela reduz a computação da atenção em 3.01× e o tamanho do cache KV em 4.44× em relação ao seu próprio GLM-5.3 (números fornecidos pelo fornecedor). Mas "4.44× menor que o GLM-5.3" ainda deixa um cache medido em dezenas de GiB quando você se aproxima de um contexto completo de 1M.
O melhor número público que temos vem de uma implantação comunitária que executou o modelo em quatro nós DGX Spark: 16 GiB de cache KV por rank — cerca de 64 GiB no total entre os quatro — para manter um contexto completo de 1M de tokens, dimensionado para suportar algumas solicitações simultâneas de contexto completo. Isso é mais do que todo o orçamento de memória da maioria das máquinas individuais, antes mesmo de um único peso. Em um único H200, a aritmética é o ponto desta página: 2bit-lite deixa ~39 GB para tudo depois dos pesos — confortável para um bate-papo curto, consumido em minutos à medida que o contexto sobe para 100K tokens.
A regra prática: a coluna min-RAM pressupõe um contexto razoável. Se a sua carga de trabalho processa documentos longos, loops de agentes ou código em escala de repositório, reserve memória de cache KV adicional — e para qualquer coisa perto de 1 milhão de tokens, pare de fazer a aritmética e use a API. Essas observações de dimensionamento são conclusões da comunidade; não existem diretrizes de fornecedores para o orçamento de cache KV.
O limite de memória wired do macOS: por que um Mac de 128 GB ainda falha ao carregar
A falha mais comum relatada por profissionais da área não é "memória RAM insuficiente". É um Mac de 128 GB com um modelo de ~102 GB que se recusa a carregar. A causa é o limite de memória fixa do macOS. No Apple Silicon, a GPU não consegue endereçar toda a memória unificada: o Metal expõe um "working set máximo recomendado" de aproximadamente dois terços da RAM física, e alocações acima disso falham mesmo quando a máquina tem memória livre.
Portanto, o orçamento padrão de Metal de um Mac de 128 GB fica em algum lugar na faixa de 80–90 GB — abaixo do que a compilação 2bit-lite precisa (~112 GB de RAM mínima com um modelo residente de ~102 GB). A carga falha no orçamento de Metal, não na capacidade de RAM. A correção em todos os relatos de profissionais que encontramos é a mesma: aumente o limite de memória fixada (wired) com sudo sysctl iogpu.wired_limit_mb=…, definindo um valor acima do footprint total do modelo em MB, e espere que ele seja redefinido na reinicialização. Alguns guias da comunidade também definem o limite de memória fixada a partir do Python via mlx.metal.set_wired_limit(), para que os pesos do modelo sejam fixados e o macOS pare de comprimir páginas de Metal ociosas.
Mais uma complicação: os runtimes se comportam de maneira diferente. O MLX impõe o orçamento do Metal e falha de forma abrupta quando este é excedido, enquanto runtimes baseados em llama.cpp (o caminho GGUF) geralmente não o impõem e deixam o macOS usar swap em vez disso. É por isso que o mesmo modelo pode se recusar a carregar em um runtime e "carregar" em outro — e por que um modelo em swap pode ficar lento a ponto de se tornar inutilizável. Essas são constatações da comunidade sobre o comportamento do macOS, não orientações da Apple.
A alternativa hospedada: z-ai/glm-5.3-flash
Para todos a quem os números acima excluem — ou seja, a maioria das pessoas — a Z.ai oferece o próprio modelo como z-ai/glm-5.3-flash, e é aqui que o "Flash" no nome realmente aparece. O preço de tabela da Z.ai é de $0.15 por milhão de tokens de entrada, $0.03 por milhão de tokens de entrada em cache e $0.50 por milhão de tokens de saída; uma promoção de lançamento vai até 9 de setembro de 2026, a $0.075 / $0.015 / $0.25 (preços informados pelo fornecedor, atuais no momento da escrita). A entrada em cache a um quinto do preço da entrada nova é a maior alavanca de custo: qualquer carga de trabalho com um prefixo reutilizável — prompts de sistema, definições de ferramentas, documentos compartilhados longos — deve estar atingindo o preço de leitura de cache.
A matemática de memória pertence à decisão. Servir um modelo de 320B por conta própria significa dedicar 112–320 GB de memória a ele, esteja ocioso ou saturado. O endpoint hospedado tira tudo isso de suas máquinas e, com os preços promocionais de lançamento, o modelo custa menos por token do que muitos modelos com um décimo do seu tamanho — que é exatamente o objetivo de um MoE com 18B ativos.
Este é também o lugar natural para o ponto de roteamento. Por meio do OrcaRouter, z-ai/glm-5.3-flash é um dos 200+ modelos por trás de uma única API, com preço de tabela do provedor e margem de lucro de 0% — portanto, a promoção de lançamento e qualquer redução futura de preço entram em vigor no mesmo dia em que são anunciadas. O failover automático significa que um modelo de três dias com um caminho de serviço instável não é uma aposta na sua stack de produção: se o provedor apresentar erro ou saturar, a solicitação é redirecionada para um provedor saudável em vez de falhar. Testar um modelo não comprovado com segurança é exatamente para isso que serve um roteador.

Perguntas Frequentes
Posso executar o GLM-5.3-Flash em uma RTX 5090?
Não. A menor versão tem ~102 GB apenas de pesos, e uma RTX 5090 tem 32 GB de VRAM. Nenhuma GPU de consumo chega perto; o modelo precisa de Macs com memória unificada, um único H200 ou um servidor multi-GPU.
18B ativo significa que o GLM-5.3-Flash roda em hardware de consumo?
Não. O valor de 18B ativos refere-se ao cálculo por token. Todos os 320B de parâmetros permanecem residentes na memória, porque o roteador não consegue saber de quais especialistas um token precisa até ver o token. MoE economiza computação, não memória.
Qual é a maneira mais barata de experimentar o GLM-5.3-Flash?
A API hospedada, z-ai/glm-5.3-flash. No preço promocional de lançamento, custa US$ 0,075 por milhão de tokens de entrada, e tokens de entrada em cache custam US$ 0,015. Hospedar por conta própria a menor compilação significa dedicar ~112 GB de RAM a ela, o que só faz sentido se você já possui o hardware.
O resumo honesto: GLM-5.3-Flash é um modelo de classe servidor em todos os builds. O Mac de 128 GB recebe o único build que cabe — 2bit-lite, com o limite de memória fixa elevado, contextos curtos e um custo de qualidade documentado para código longo. Uma única H200 recebe o mesmo build com ~39 GB de folga de KV. Hardware de servidor recebe a verdadeira escada, desde o 4-bit como padrão até o 6-bit quase sem perdas. E para todos os demais — a maioria dos leitores — o endpoint hospedado z-ai/glm-5.3-flash é a resposta certa, e os números acima são o motivo, não uma lista de compras. Para a instalação passo a passo em um MacBook Pro, nosso guia de instalação para MacBook cobre todo o fluxo de ponta a ponta; para saber como os builds de quantização se comparam em qualidade e quando escolher cada um, o guia de builds do MLX traz os detalhes; e a cobertura do lançamento traz o contexto do lançamento e as afirmações de benchmark.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
