Um cartão de título hero para o artigo intitulado 'Requisitos de VRAM do GLM-5.3-Flash', com o subtítulo 'Quanta memória você precisa para executar um MoE de 320B', badges em formato de pílula '320B total · 18B ativos', 'Contexto de 1M de tokens', 'Builds comunitárias de MLX', e um cartão de resumo que diz '2bit-lite: ~102 GB de pesos / 112 GB de RAM — o build que cabe em um Mac de 128 GB', com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Requisitos de VRAM do GLM-5.3-Flash: Quanta memória você precisa para executar um MoE de 320B

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O GLM-5.3-Flash não cabe em nenhuma GPU de consumo. A menor versão utilizável, 2bit-lite, precisa de ~102 GB de pesos e 112 GB de RAM. Um Mac de 128 GB é o ponto de entrada; uma única H200 comporta o 2bit-lite com ~39 GB de sobra; todos os demais devem usar a API hospedada, z-ai/glm-5.3-flash.

Essa é a resposta completa em uma única frase, e vale a pena dizê-la claramente aqui: não existe configuração de hardware de consumo que execute este modelo. O modelo de visão-linguagem com mistura de especialistas de 320B parâmetros da Z.ai, lançado em 26 de agosto de 2026, exige memória de classe servidor em todas as quantizações. O valor "18B ativos" descreve o cálculo por token, não a memória residente — todos os 320B de pesos permanecem carregados. Os alvos locais realistas são Macs grandes com memória unificada, servidores multi-GPU e uma única H200 com 141 GB. Se você não possui um desses, os números abaixo não são uma lista de compras; eles são o motivo para chamar o modelo por meio de uma API em vez disso.

Uma nota de contextualização antes dos números: os valores de memória neste texto são descobertas da comunidade, não orientações do fornecedor. A Z.ai publica pesos e especificações de API; não publica requisitos de memória para inferência local. A tabela por quantização vem do model card orcarouter/GLM-5.3-Flash-MLX no Hugging Face, uma quantização MLX dos pesos abertos mantida por um grupo da comunidade, e os números de implantação vêm de profissionais que realmente carregaram o modelo. Quando um número é reportado pelo fornecedor — preços e as alegações de eficiência do cache KV da arquitetura — nós o rotulamos como tal.

A resposta curta: o que cabe no que você tem

Comece pelo que você realmente tem, porque a escada de quantização só faz sentido em relação a uma máquina alvo:

• GPU de consumo (RTX 4090, RTX 5090 e todas as inferiores) — não. Nenhuma placa de consumo tem VRAM suficiente: a menor configuração exige ~102 GB só de pesos, o equivalente a cerca de cinco RTX 5090. A RAM do sistema não muda isso, pois os pesos precisam estar residentes no dispositivo.

• Mac de 128 GB (M4 ou M5 Max) — a versão 2bit-lite (~102 GB de pesos / 112 GB de RAM mínima), e somente após aumentar o limite de memória fixa. Mais sobre isso abaixo. Esta é a única máquina de classe consumidora em que o modelo cabe.

• Mac Studio de 192 GB e 256 GB — 3-bit (~184 / 200 GB) e 2-bit (~145 / 160 GB) tornam-se alcançáveis; 4-bit precisa de ~224 GB, que apenas a versão de 256 GB se aproxima.

• H200 único (141 GB de VRAM) — 2bit-lite cabe com cerca de 39 GB restantes para o cache KV, o que significa apenas contextos curtos.

• Servidor multi-GPU — tudo, incluindo 4-bit, 6-bit e o build de referência de ~328 GB FP8.

• Todos os demais — a API hospedada, z-ai/glm-5.3-flash. Isso não é um prêmio de consolação; é onde o modelo é realmente rápido e barato de usar, e está abordado no final desta página.

Dois números, não um: pesos vs memória total

Cada quantização no card do modelo tem duas colunas — tamanho do peso e RAM mínima — e a lacuna entre elas é a parte que a maioria dos artigos ignora. A coluna de pesos corresponde aos arquivos do modelo: cada parâmetro, nessa precisão, residente em memória. A coluna de RAM mínima é o que a máquina deve reter em tempo de execução: os pesos mais o cache KV, as ativações e os buffers que crescem com o comprimento do contexto.

O número de 18B ativos é onde as pessoas se enganam. GLM-5.3-Flash é um MoE de 320B total / 18B ativos: por token, apenas cerca de 18B de parâmetros computam. Isso é uma economia de computação, não de memória. Todos os 320B de pesos ficam na memória, independentemente de quais especialistas são ativados, porque o roteador não sabe quais especialistas precisa até ver o token. MoE compra velocidade, não footprint — um ponto que a própria ficha do modelo demonstra, com os 320B totais em exibição ao lado dos 18B ativos.

Então, quando um build diz "~204 GB de pesos / 224 GB de RAM mínima," os ~20 GB extras são sobrecarga de tempo de execução — cache KV, ativações, buffers de contexto. Aumente o comprimento do contexto e essa diferença cresce. A coluna de RAM mínima, não a coluna de pesos, é a que deve ser usada para dimensionar uma máquina.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

O modelo em si — arquitetura, licença e a própria apresentação da Z.ai — está documentado na ficha oficial do fornecedor, mostrada acima. A memória local não é abordada lá; é por isso que esta página existe. Os números abaixo vêm do port MLX da comunidade dos pesos abertos.

A escada de quantização

A tabela no cartão orcarouter/GLM-5.3-Flash-MLX é a que os praticantes estão realmente carregando hoje. Ela lista cinco versões quantizadas mais a referência FP8, cada uma com tamanho de peso e RAM mínima:

• Referência FP8 — ~328 GB de pesos. O ponto de referência não quantizado no qual os pesos abertos são disponibilizados.

• 6-bit — ~296 GB de pesos / 320 GB de RAM mín. Quase sem perdas; a versão de melhor qualidade.

• 4-bit — ~204 GB / 224 GB. O padrão recomendado para uso diário.

• 3-bit — ~184 GB / 200 GB. Agressivo, mas utilizável.

• 2-bit — ~145 GB / 160 GB. Melhor esforço.

• 2bit-lite — ~102 GB / 112 GB. A menor build; a única que cabe em um Mac de 128 GB ou em um único H200.

A qualidade cai à medida que os bits diminuem, e o card quantifica isso. Em relação à referência FP8, a perplexidade degrada em +0,24% em 6 bits, +2,96% em 4 bits, +9,96% em 3 bits, +56,9% em 2 bits e +141% em 2bit-lite (números de perplexidade do próprio card do modelo). As orientações do próprio card: 6 bits para qualidade quase sem perdas, 4 bits como padrão do dia a dia, 3 bits e 2 bits quando houver restrição de memória, 2bit-lite apenas quando nada mais couber — e a geração de código longa não é confiável em 2bit-lite. Esse último aviso é importante para um modelo de raciocínio de 320B: é o 2bit-lite que permite usar o Mac de 128 GB, e o custo de qualidade recai exatamente onde o trabalho de programação mais dói.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

Dois números nessa escada merecem uma análise mais detalhada porque eles decidem toda a questão de hardware.

Por que 2bit-lite existe

2bit-lite não é um nível extra de qualidade — é um nível de tamanho criado por um motivo: o 2-bit comum não cabe. Com ~102 GB de pesos, é a única versão que se encaixa abaixo dos ~112 GB de memória utilizável em um Mac de 128 GB, e a única que cabe nos 141 GB de um único H200 com espaço sobrando para um cache KV. O card do modelo diz exatamente isso: o 2-bit comum não cabe em um Mac de 128 GB; o 2bit-lite cabe, com um limite elevado de memória fixa. Em um H200, ele cabe "com ~39 GB sobrando para o cache KV" (palavras do card). Esses 39 GB são todo o orçamento de trabalho para tudo o que o modelo faz após o carregamento — o que nos leva ao contexto.

Quanto custa o cache KV em contexto longo

O GLM-5.3-Flash tem uma janela de contexto de 1M de tokens, e é no contexto longo que os planos de memória local morrem. A atenção híbrida esparsa-mais-linear do modelo — NoPE-MLA com um mecanismo de pool de índices — é genuinamente eficiente: a Z.ai relata que ela reduz a computação da atenção em 3.01× e o tamanho do cache KV em 4.44× em relação ao seu próprio GLM-5.3 (números fornecidos pelo fornecedor). Mas "4.44× menor que o GLM-5.3" ainda deixa um cache medido em dezenas de GiB quando você se aproxima de um contexto completo de 1M.

O melhor número público que temos vem de uma implantação comunitária que executou o modelo em quatro nós DGX Spark: 16 GiB de cache KV por rank — cerca de 64 GiB no total entre os quatro — para manter um contexto completo de 1M de tokens, dimensionado para suportar algumas solicitações simultâneas de contexto completo. Isso é mais do que todo o orçamento de memória da maioria das máquinas individuais, antes mesmo de um único peso. Em um único H200, a aritmética é o ponto desta página: 2bit-lite deixa ~39 GB para tudo depois dos pesos — confortável para um bate-papo curto, consumido em minutos à medida que o contexto sobe para 100K tokens.

A regra prática: a coluna min-RAM pressupõe um contexto razoável. Se a sua carga de trabalho processa documentos longos, loops de agentes ou código em escala de repositório, reserve memória de cache KV adicional — e para qualquer coisa perto de 1 milhão de tokens, pare de fazer a aritmética e use a API. Essas observações de dimensionamento são conclusões da comunidade; não existem diretrizes de fornecedores para o orçamento de cache KV.

O limite de memória wired do macOS: por que um Mac de 128 GB ainda falha ao carregar

A falha mais comum relatada por profissionais da área não é "memória RAM insuficiente". É um Mac de 128 GB com um modelo de ~102 GB que se recusa a carregar. A causa é o limite de memória fixa do macOS. No Apple Silicon, a GPU não consegue endereçar toda a memória unificada: o Metal expõe um "working set máximo recomendado" de aproximadamente dois terços da RAM física, e alocações acima disso falham mesmo quando a máquina tem memória livre.

Portanto, o orçamento padrão de Metal de um Mac de 128 GB fica em algum lugar na faixa de 80–90 GB — abaixo do que a compilação 2bit-lite precisa (~112 GB de RAM mínima com um modelo residente de ~102 GB). A carga falha no orçamento de Metal, não na capacidade de RAM. A correção em todos os relatos de profissionais que encontramos é a mesma: aumente o limite de memória fixada (wired) com sudo sysctl iogpu.wired_limit_mb=…, definindo um valor acima do footprint total do modelo em MB, e espere que ele seja redefinido na reinicialização. Alguns guias da comunidade também definem o limite de memória fixada a partir do Python via mlx.metal.set_wired_limit(), para que os pesos do modelo sejam fixados e o macOS pare de comprimir páginas de Metal ociosas.

Mais uma complicação: os runtimes se comportam de maneira diferente. O MLX impõe o orçamento do Metal e falha de forma abrupta quando este é excedido, enquanto runtimes baseados em llama.cpp (o caminho GGUF) geralmente não o impõem e deixam o macOS usar swap em vez disso. É por isso que o mesmo modelo pode se recusar a carregar em um runtime e "carregar" em outro — e por que um modelo em swap pode ficar lento a ponto de se tornar inutilizável. Essas são constatações da comunidade sobre o comportamento do macOS, não orientações da Apple.

A alternativa hospedada: z-ai/glm-5.3-flash

Para todos a quem os números acima excluem — ou seja, a maioria das pessoas — a Z.ai oferece o próprio modelo como z-ai/glm-5.3-flash, e é aqui que o "Flash" no nome realmente aparece. O preço de tabela da Z.ai é de $0.15 por milhão de tokens de entrada, $0.03 por milhão de tokens de entrada em cache e $0.50 por milhão de tokens de saída; uma promoção de lançamento vai até 9 de setembro de 2026, a $0.075 / $0.015 / $0.25 (preços informados pelo fornecedor, atuais no momento da escrita). A entrada em cache a um quinto do preço da entrada nova é a maior alavanca de custo: qualquer carga de trabalho com um prefixo reutilizável — prompts de sistema, definições de ferramentas, documentos compartilhados longos — deve estar atingindo o preço de leitura de cache.

A matemática de memória pertence à decisão. Servir um modelo de 320B por conta própria significa dedicar 112–320 GB de memória a ele, esteja ocioso ou saturado. O endpoint hospedado tira tudo isso de suas máquinas e, com os preços promocionais de lançamento, o modelo custa menos por token do que muitos modelos com um décimo do seu tamanho — que é exatamente o objetivo de um MoE com 18B ativos.

Este é também o lugar natural para o ponto de roteamento. Por meio do OrcaRouter, z-ai/glm-5.3-flash é um dos 200+ modelos por trás de uma única API, com preço de tabela do provedor e margem de lucro de 0% — portanto, a promoção de lançamento e qualquer redução futura de preço entram em vigor no mesmo dia em que são anunciadas. O failover automático significa que um modelo de três dias com um caminho de serviço instável não é uma aposta na sua stack de produção: se o provedor apresentar erro ou saturar, a solicitação é redirecionada para um provedor saudável em vez de falhar. Testar um modelo não comprovado com segurança é exatamente para isso que serve um roteador.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

Perguntas Frequentes

Posso executar o GLM-5.3-Flash em uma RTX 5090?

Não. A menor versão tem ~102 GB apenas de pesos, e uma RTX 5090 tem 32 GB de VRAM. Nenhuma GPU de consumo chega perto; o modelo precisa de Macs com memória unificada, um único H200 ou um servidor multi-GPU.

18B ativo significa que o GLM-5.3-Flash roda em hardware de consumo?

Não. O valor de 18B ativos refere-se ao cálculo por token. Todos os 320B de parâmetros permanecem residentes na memória, porque o roteador não consegue saber de quais especialistas um token precisa até ver o token. MoE economiza computação, não memória.

Qual é a maneira mais barata de experimentar o GLM-5.3-Flash?

A API hospedada, z-ai/glm-5.3-flash. No preço promocional de lançamento, custa US$ 0,075 por milhão de tokens de entrada, e tokens de entrada em cache custam US$ 0,015. Hospedar por conta própria a menor compilação significa dedicar ~112 GB de RAM a ela, o que só faz sentido se você já possui o hardware.

O resumo honesto: GLM-5.3-Flash é um modelo de classe servidor em todos os builds. O Mac de 128 GB recebe o único build que cabe — 2bit-lite, com o limite de memória fixa elevado, contextos curtos e um custo de qualidade documentado para código longo. Uma única H200 recebe o mesmo build com ~39 GB de folga de KV. Hardware de servidor recebe a verdadeira escada, desde o 4-bit como padrão até o 6-bit quase sem perdas. E para todos os demais — a maioria dos leitores — o endpoint hospedado z-ai/glm-5.3-flash é a resposta certa, e os números acima são o motivo, não uma lista de compras. Para a instalação passo a passo em um MacBook Pro, nosso guia de instalação para MacBook cobre todo o fluxo de ponta a ponta; para saber como os builds de quantização se comparam em qualidade e quando escolher cada um, o guia de builds do MLX traz os detalhes; e a cobertura do lançamento traz o contexto do lançamento e as afirmações de benchmark.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente