Una tarjeta de título hero para el artículo titulado 'Requisitos de VRAM de GLM-5.3-Flash' con el subtítulo 'Cuánta memoria necesitas para ejecutar un MoE de 320B', insignias tipo píldora '320B total · 18B activos', 'contexto de 1M de tokens', 'compilaciones MLX de la comunidad', y una tarjeta de resumen que dice '2bit-lite: ~102 GB de pesos / 112 GB de RAM — la compilación que cabe en un Mac de 128 GB', con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Requisitos de VRAM de GLM-5.3-Flash: cuánta memoria necesitas para ejecutar un MoE de 320B

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GLM-5.3-Flash no cabe en ninguna GPU de consumo. La compilación utilizable más pequeña, 2bit-lite, necesita ~102 GB de pesos y 112 GB de RAM. Una Mac de 128 GB es el punto de entrada; una sola H200 admite 2bit-lite con ~39 GB de espacio libre; todos los demás deberían usar la API alojada, z-ai/glm-5.3-flash.

Esa es la respuesta completa en una sola bocanada, y vale la pena decirlo claramente aquí mismo: no existe ninguna configuración de hardware de consumo que ejecute este modelo. El modelo de visión-lenguaje de mezcla de expertos con 320B parámetros de Z.ai, lanzado el 26 de agosto de 2026, necesita memoria de clase servidor en todas las cuantizaciones. La cifra de «18B activos» describe el cómputo por token, no la memoria residente: todos los pesos de 320B permanecen cargados. Los objetivos locales realistas son Macs de memoria unificada grande, servidores multi-GPU y una sola H200 con 141 GB. Si no posees uno de esos, los números a continuación no son una lista de compras; son la razón para llamar al modelo a través de una API en su lugar.

Una nota de contexto antes de las cifras: los números de memoria en esta pieza son hallazgos de la comunidad, no indicaciones del proveedor. Z.ai publica pesos y especificaciones de API; no publica requisitos de memoria para inferencia local. La tabla por cuantización proviene de la ficha del modelo orcarouter/GLM-5.3-Flash-MLX en Hugging Face, una cuantización MLX de los pesos abiertos que mantiene un grupo de la comunidad, y los números de despliegue provienen de profesionales que realmente han cargado el modelo. Cuando una cifra es reportada por el proveedor —precios y las afirmaciones de eficiencia del caché KV de la arquitectura— lo etiquetamos como tal.

La respuesta corta: qué cabe en lo que tienes.

Empieza desde lo que realmente tienes, porque la escalera de cuantización solo tiene sentido frente a una máquina objetivo:

• GPU de consumo (RTX 4090, RTX 5090 y todo lo inferior) — no. Ni una sola tarjeta de consumo tiene suficiente VRAM: la configuración más pequeña requiere ~102 GB solo de pesos, aproximadamente el equivalente a cinco RTX 5090. La RAM del sistema no cambia esto, porque los pesos deben residir en el dispositivo.

• Mac de 128 GB (M4 o M5 Max): el build 2bit-lite (~102 GB de pesos / 112 GB de RAM mínima), y solo después de elevar el límite de memoria cableada. Más sobre eso a continuación. Es la única máquina de consumo en la que cabe el modelo.

• Mac Studio de 192 GB y 256 GB — el modo de 3 bits (~184 / 200 GB) y el de 2 bits (~145 / 160 GB) se vuelven alcanzables; el modo de 4 bits necesita ~224 GB, una cifra a la que solo se acerca la variante de 256 GB.

• Un solo H200 (141 GB de VRAM) — 2bit-lite cabe con aproximadamente 39 GB libres para la caché KV, lo que significa solo contextos cortos.

• Servidor multi-GPU — todo, incluyendo 4 bits, 6 bits y la compilación de referencia FP8 de ~328 GB.

• Todos los demás — la API alojada, z-ai/glm-5.3-flash. Eso no es un premio de consolación; es donde el modelo es realmente rápido y barato de usar, y se cubre al final de esta página.

Dos números, no uno: pesos vs memoria total

Cada cuantificación en la tarjeta del modelo tiene dos columnas — tamaño de pesos y RAM mínima — y la brecha entre ambas es la parte que la mayoría de los análisis omiten. La columna de pesos corresponde a los archivos del modelo: cada parámetro, en esa precisión, residente en memoria. La columna de RAM mínima es lo que la máquina debe mantener en tiempo de ejecución: los pesos más la caché KV, las activaciones y los búferes que crecen con la longitud del contexto.

La cifra de 18B activos es donde la gente se confunde. GLM-5.3-Flash es un MoE de 320B totales / 18B activos: por token, solo se computan unos 18B de parámetros. Eso es un ahorro de cómputo, no de memoria. Los 320B de pesos permanecen en memoria sin importar qué expertos se activen, porque el router no sabe qué expertos necesita hasta que ve el token. MoE compra velocidad, no huella de memoria — un punto que la propia ficha del modelo demuestra con el ejemplo, mostrando los 320B totales junto a los 18B activos.

Entonces, cuando una compilación dice «~204 GB de pesos / 224 GB de RAM mínima», los ~20 GB adicionales son sobrecarga en tiempo de ejecución: caché KV, activaciones, búferes de contexto. Si aumentas la longitud del contexto, ese delta crece. La columna de RAM mínima, no la de pesos, es con la que se debe dimensionar una máquina.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

El modelo en sí — arquitectura, licencia y el propio encuadre de Z.ai — está documentado en la tarjeta oficial del proveedor, mostrada arriba. La memoria local no se cubre allí; por eso existe esta página. Los números a continuación provienen del port comunitario de MLX de los pesos abiertos.

La escalera de cuantización

La tabla en la ficha de orcarouter/GLM-5.3-Flash-MLX es la que los profesionales están cargando actualmente. Enumera cinco compilaciones cuantizadas más la referencia FP8, cada una con tamaño de pesos y RAM mínima:

Referencia FP8 — ~328 GB de pesos. El punto de referencia sin cuantificar en el que se distribuyen los pesos abiertos.

• 6 bits — ~296 GB de pesos / 320 GB de RAM mínima. Casi sin pérdidas; la compilación de mayor calidad.

• 4-bit — ~204 GB / 224 GB. El valor predeterminado recomendado para el uso diario.

• 3-bit — ~184 GB / 200 GB. Agresivo pero utilizable.

• 2-bit — ~145 GB / 160 GB. Mejor esfuerzo.

• 2bit-lite — ~102 GB / 112 GB. La compilación más pequeña; la única que cabe en una Mac de 128 GB o en una sola H200.

La calidad cae a medida que bajan los bits, y la ficha lo cuantifica. En relación con la referencia FP8, la perplejidad se degrada en +0,24 % a 6 bits, +2,96 % a 4 bits, +9,96 % a 3 bits, +56,9 % a 2 bits y +141 % con 2bit-lite (cifras de perplejidad de la misma ficha del modelo). Las indicaciones de la propia ficha: 6 bits para casi sin pérdida, 4 bits como predeterminado para el uso diario, 3 bits y 2 bits cuando la memoria está limitada, 2bit-lite solo cuando nada más cabe — y la generación de código largo no es fiable con 2bit-lite. Esa última advertencia es importante para un modelo de razonamiento de 320B: 2bit-lite es lo que te permite adquirir la Mac de 128 GB, y el impuesto de calidad recae exactamente donde el trabajo de codificación duele más.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

Dos números en esa escalera merecen un examen más detenido, porque deciden toda la cuestión del hardware.

Por qué existe 2bit-lite

2bit-lite no es un nivel adicional de calidad: es un nivel de tamaño creado por una sola razón: el 2-bit normal no cabe. Con ~102 GB de pesos, es la única versión que se queda por debajo de los ~112 GB de memoria utilizable en una Mac de 128 GB, y la única que cabe en los 141 GB de una sola H200 dejando espacio para la caché KV. La ficha del modelo lo dice claramente: el 2-bit normal no cabe en una Mac de 128 GB; 2bit-lite sí cabe, con un límite de memoria cableada aumentado. En una H200 cabe «con ~39 GB libres para la caché KV» (palabras de la ficha). Esos 39 GB son todo el presupuesto de trabajo para todo lo que el modelo hace después de la carga, lo que nos lleva al contexto.

El costo de la caché KV en contextos largos

GLM-5.3-Flash tiene una ventana de contexto de 1M de tokens, y el contexto largo es donde mueren los planes de memoria local. La atención híbrida dispersa-más-lineal del modelo — NoPE-MLA con un mecanismo de agrupación de índices — es genuinamente eficiente: Z.ai informa que reduce el cómputo de atención en 3.01× y el tamaño de la caché KV en 4.44× en comparación con su propio GLM-5.3 (cifras reportadas por el proveedor). Pero "4.44× más pequeño que GLM-5.3" todavía deja una caché medida en decenas de GiB cuando se intenta alcanzar un contexto completo de 1M.

La mejor cifra pública que tenemos proviene de un despliegue comunitario que ejecutó el modelo en cuatro nodos DGX Spark: 16 GiB de caché KV por rango — unos 64 GiB en total entre los cuatro — para mantener un contexto completo de 1M tokens, dimensionado para soportar unas pocas peticiones concurrentes de contexto completo. Eso es más que todo el presupuesto de memoria de la mayoría de las máquinas individuales, antes de un solo peso. En una sola H200, la aritmética es el punto central de esta página: 2bit-lite deja ~39 GB para todo lo demás después de los pesos — cómodo para un chat breve, pero se agota en minutos a medida que el contexto asciende hacia los 100K tokens.

La regla práctica: la columna de RAM mínima asume un contexto razonable. Si su carga de trabajo procesa documentos largos, bucles de agente o código a escala de repositorio, presupueste memoria de caché KV adicional — y para cualquier cosa cercana a 1M de tokens, deje de hacer cálculos y use la API. Estas observaciones de dimensionamiento son hallazgos de la comunidad; no existe orientación del proveedor para el presupuesto de caché KV.

El límite de memoria wired de macOS: por qué una Mac de 128 GB sigue sin cargar

El fallo más común reportado por los profesionales no es "no hay suficiente RAM". Es una Mac de 128 GB con un modelo de ~102 GB que se niega a cargar. La causa es el límite de memoria cableada de macOS. En Apple Silicon, la GPU no puede acceder a toda la memoria unificada: Metal expone un "conjunto de trabajo máximo recomendado" de aproximadamente dos tercios de la RAM física, y las asignaciones por encima de ese límite fallan incluso cuando la máquina tiene memoria libre.

Entonces, el presupuesto de Metal predeterminado de una Mac de 128 GB se sitúa en algún lugar del rango de 80–90 GB, por debajo de lo que necesita la compilación 2bit-lite (~112 GB de RAM mínima con un modelo residente de ~102 GB). La carga falla por el presupuesto de Metal, no por la capacidad de RAM. La solución en todos los informes de profesionales que encontramos es la misma: aumentar el límite wired con sudo sysctl iogpu.wired_limit_mb=…, estableciendo un valor por encima de la huella total del modelo en MB, y esperar que se restablezca al reiniciar. Algunas guías de la comunidad también establecen el límite wired desde Python mediante mlx.metal.set_wired_limit() para que los pesos del modelo estén fijos y macOS deje de comprimir las páginas de Metal inactivas.

Una arruga más: los runtimes se comportan de manera diferente. MLX aplica el presupuesto de Metal y falla de forma contundente cuando se supera, mientras que los runtimes basados en llama.cpp (la ruta GGUF) generalmente no lo aplican y dejan que macOS use swap en su lugar. Por eso el mismo modelo puede negarse a cargar en un runtime y "cargar" en otro, y por eso un modelo con swap puede ser tan lento que resulte inutilizable. Estos son hallazgos de la comunidad sobre el comportamiento de macOS, no una guía de Apple.

La alternativa alojada: z-ai/glm-5.3-flash

{{1}}Para todos aquellos a quienes los números anteriores descartan — que es la mayoría —{{/1}} {{2}}Z.ai ofrece el propio modelo como z-ai/glm-5.3-flash, y aquí es donde el «Flash» del nombre realmente se hace visible.{{/2}} {{3}}El precio de lista de Z.ai es de $0.15 por millón de tokens de entrada, $0.03 por millón de tokens de entrada en caché y $0.50 por millón de tokens de salida;{{/3}} {{4}}una promoción de lanzamiento vigente hasta el 9 de septiembre de 2026 ofrece precios de $0.075 / $0.015 / $0.25 (precios reportados por el proveedor, vigentes al momento de redactar este texto).{{/4}} {{5}}La entrada en caché a una quinta parte del precio de la entrada nueva es la palanca de costos más importante:{{/5}} {{6}}cualquier carga de trabajo con un prefijo reutilizable — indicaciones del sistema, definiciones de herramientas, documentos compartidos extensos — debería estar aprovechando el precio de lectura de caché.{{/6}}

El cálculo de memoria forma parte de la decisión. Servir un modelo de 320B por tu cuenta significa dedicarle 112–320 GB de memoria, ya sea que esté inactivo o saturado. El endpoint alojado saca todo eso de tus máquinas, y con los precios promocionales de lanzamiento el modelo cuesta menos por token que muchos modelos de una décima parte de su tamaño — que es el objetivo principal de un MoE con 18B activos.

Este es también el lugar natural para el punto de enrutamiento. A través de OrcaRouter, z-ai/glm-5.3-flash es uno de los más de 200 modelos detrás de una única API, con precio de lista del proveedor y un margen del 0% — así que la promoción de lanzamiento, y cualquier futura bajada de precio, están activas el mismo día en que se anuncian. La conmutación automática por error significa que un modelo de tres días de antigüedad con una ruta de servicio inestable no es una apuesta para tu stack de producción: si el proveedor falla o se satura, la solicitud se transfiere a un proveedor saludable en lugar de fallar. Probar de forma segura un modelo no probado es exactamente para lo que sirve un enrutador.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

Preguntas frecuentes

¿Puedo ejecutar GLM-5.3-Flash en una RTX 5090?

No. La compilación más pequeña es de ~102 GB solo en pesos, y una RTX 5090 tiene 32 GB de VRAM. Ninguna GPU de consumo se acerca; el modelo requiere Macs con memoria unificada, una sola H200 o un servidor con múltiples GPU.

¿Significa 18B activo que GLM-5.3-Flash funciona en hardware de consumo?

No. La cifra de 18B activos es cómputo por token. Todos los parámetros de 320B permanecen residentes en memoria, porque el router no puede saber qué expertos necesita un token hasta que ve el token. MoE ahorra cómputo, no memoria.

¿Cuál es la forma más barata de probar GLM-5.3-Flash?

La API alojada, z-ai/glm-5.3-flash. Con el precio promocional de lanzamiento cuesta $0.075 por millón de tokens de entrada, y los tokens de entrada en caché cuestan $0.015. Autoalojar la compilación más pequeña implica dedicarle ~112 GB de RAM, lo cual solo tiene sentido si ya posees el hardware.

El resumen honesto: GLM-5.3-Flash es un modelo de clase servidor en todas sus versiones. La Mac de 128 GB recibe la única versión que le cabe: 2bit-lite, con un aumento del límite de memoria fija, contextos cortos y una penalización de calidad documentada en código largo. Una sola H200 recibe la misma versión con unos 39 GB de margen de KV. El hardware de servidor recibe la verdadera escalera, desde 4-bit como opción predeterminada hasta 6-bit casi sin pérdidas. Y para todos los demás —la mayoría de los lectores— el endpoint alojado z-ai/glm-5.3-flash es la respuesta correcta, y los números anteriores son la razón, no una lista de compras. Para la instalación paso a paso en una MacBook Pro, nuestra guía de instalación para MacBook cubre todo el flujo de principio a fin; para saber cómo se comparan las versiones de cuantización en calidad y cuándo elegir cada una, la guía de compilación de MLX tiene el detalle; y la cobertura del lanzamiento incluye el contexto de salida y las afirmaciones de los benchmarks.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario