'GLM-5.3-Flash VRAM Requirements' 기사의 히어로 타이틀 카드. 부제목: '320B MoE를 실행하는 데 필요한 메모리 용량'. 필 배지: '총 320B · 활성 18B', '1M-토큰 컨텍스트', '커뮤니티 MLX 빌드'. 요약 카드: '2bit-lite: 가중치 ~102GB / RAM 112GB — 128GB Mac에 맞는 빌드'. 오른쪽 하단 모서리에 OrcaRouter 로고.
Guides & Insights

GLM-5.3-Flash VRAM 요구 사항: 320B MoE를 실행하는 데 필요한 메모리 용량

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

GLM-5.3-Flash는 어떤 소비자용 GPU에도 들어가지 않습니다. 가장 작은 사용 가능한 빌드인 2bit-lite는 가중치 약 102GB와 RAM 112GB가 필요합니다. 128GB Mac이 최소 진입 사양이며, H200 한 대에는 약 39GB의 여유를 남기고 2bit-lite가 들어갑니다. 그 외 사용자는 호스팅 API인 z-ai/glm-5.3-flash를 사용해야 합니다.

이것이 한 번에 드리는 전체 답변입니다. 그리고 바로 여기서 분명히 말할 가치가 있습니다. 이 모델을 실행할 수 있는 소비자용 하드웨어 구성은 없습니다. 2026년 8월 26일에 출시된 Z.ai의 320B 파라미터 비전-언어 전문가 혼합(MoE) 모델은 모든 양자화 수준에서 서버급 메모리가 필요합니다. '18B 활성' 수치는 토큰당 연산량을 설명할 뿐, 상주 메모리를 의미하지 않습니다. 320B 가중치 전체가 로드된 상태로 유지됩니다. 현실적인 로컬 실행 대상은 대용량 통합 메모리 Mac, 멀티 GPU 서버, 그리고 141GB의 단일 H200입니다. 이러한 장비를 보유하지 않았다면 아래의 수치는 구매 목록이 아니라, API를 통해 모델을 호출해야 하는 이유입니다.

수치를 소개하기 전에 한 가지 참고 사항이 있습니다. 이 글의 메모리 수치는 커뮤니티 조사 결과이지, 공급업체 지침이 아닙니다. Z.ai는 가중치와 API 사양을 공개하지만, 로컬 추론 메모리 요구 사항은 공개하지 않습니다. 양자화별 표는 Hugging Face의 orcarouter/GLM-5.3-Flash-MLX 모델 카드에서 가져온 것으로, 커뮤니티 그룹이 유지 관리하는 공개 가중치의 MLX 양자화입니다. 배포 수치는 실제로 모델을 로드한 실무자들에게서 얻은 것입니다. 가격 및 아키텍처의 KV-cache 효율성 주장처럼 공급업체가 보고한 수치에는 그렇게 명시했습니다.

짧은 답: 당신이 가진 것에 무엇이 맞는지

실제로 갖고 있는 것에서 시작하세요. 양자화 사다리는 대상 머신을 기준으로 할 때만 의미가 있기 때문입니다:

• 소비자용 GPU(RTX 4090, RTX 5090 및 그 이하) — 아니요. 단 하나의 소비자용 카드도 충분한 VRAM을 갖추지 못했습니다. 가장 작은 구성도 가중치만 약 102GB로, RTX 5090 약 5개 분량입니다. 시스템 RAM은 이를 바꾸지 못합니다. 가중치가 장치에 상주해야 하기 때문입니다.

• 128GB Mac(M4 또는 M5 Max) — 2bit-lite 빌드(약 102GB 가중치 / 최소 112GB RAM)이며, wired-memory 한도를 올린 후에만 가능합니다. 자세한 내용은 아래에서 다룹니다. 이 모델이 구동될 수 있는 유일한 소비자급 기기입니다.

• 192GB 및 256GB Mac Studio — 3비트(~184/200GB) 및 2비트(~145/160GB)가 도달 가능해집니다. 4비트는 ~224GB가 필요하며, 256GB 모델만이 이에 근접합니다.

• 단일 H200(141GB VRAM) — 2bit-lite는 대략 39GB를 KV 캐시용으로 남겨두고 들어가므로, 짧은 컨텍스트만 가능합니다.

• 멀티 GPU 서버 — 4비트, 6비트, 약 328GB FP8 참조 빌드를 포함한 모든 것

• 그 외의 모든 사람들 — 호스팅 API, z-ai/glm-5.3-flash. 그것은 위로상이 아닙니다; 그것은 모델이 실제로 빠르고 저렴하게 사용할 수 있는 곳이며, 이 페이지 하단에서 다룹니다.

두 개의 숫자, 하나가 아닌: 가중치 대 총 메모리

모델 카드의 모든 양자화에는 가중치 크기와 최소 RAM이라는 두 개의 열이 있으며, 이 둘 사이의 간극이 대부분의 글에서 빠뜨리는 부분입니다. 가중치 열은 모델 파일, 즉 해당 정밀도의 모든 파라미터가 메모리에 상주함을 의미합니다. 최소 RAM 열은 런타임 중에 머신이 보유해야 하는 것, 즉 가중치에 KV 캐시, 활성화(activations), 그리고 컨텍스트 길이에 따라 증가하는 버퍼를 더한 것을 의미합니다.

사람들이 오해하는 지점은 18B-활성 수치입니다. GLM-5.3-Flash는 총 320B/활성 18B MoE입니다. 토큰당 약 18B 파라미터만 연산됩니다. 이는 연산 절약이지 메모리 절약이 아닙니다. 라우터는 토큰을 볼 때까지 어떤 전문가가 필요한지 알지 못하므로, 어떤 전문가가 활성화되든 모든 320B 가중치가 메모리에 상주합니다. MoE는 속도를 얻는 것이지 메모리 공간을 아끼는 것이 아닙니다. 이는 모델 카드 자체가 18B 활성과 함께 총 320B를 표시함으로써 예시로 보여주는 지점입니다.

즉, 빌드에 '~204GB 가중치 / 224GB 최소 RAM'이라고 명시되어 있다면, 그 추가 ~20GB는 런타임 오버헤드(KV 캐시, 활성화 값, 컨텍스트 버퍼)입니다. 컨텍스트 길이를 늘리면 그 차이는 더 벌어집니다. 머신 크기를 산정할 때는 가중치 열이 아니라 최소 RAM 열을 기준으로 삼아야 합니다.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

모델 자체 — 아키텍처, 라이선스, 그리고 Z.ai의 자체적인 설명 — 는 위에 표시된 공급업체 공식 카드에 문서화되어 있습니다. 로컬 메모리는 해당 카드에서 다루지 않으며, 그래서 이 페이지가 존재합니다. 아래의 수치는 오픈 가중치의 커뮤니티 MLX 포트에서 나온 것입니다.

양자화 사다리

orcarouter/GLM-5.3-Flash-MLX 카드의 표는 실무자들이 오늘날 실제로 로드하고 있는 내용입니다. 이 표에는 FP8 기준 모델과 함께 5가지 양자화 빌드가 나열되어 있으며, 각각의 가중치 크기와 최소 RAM이 명시되어 있습니다:

• FP8 레퍼런스 — 약 328 GB 가중치. 오픈 가중치가 제공되는 비양자화 기준점입니다.

• 6-bit — ~296 GB 가중치 / 최소 320 GB RAM. 거의 무손실; 최고 품질의 빌드.

• 4비트 — ~204 GB / 224 GB. 일상적인 사용에 권장되는 기본값입니다.

• 3비트 — ~184GB / 200GB. 공격적이지만 사용 가능합니다.

• 2비트 — ~145 GB / 160 GB. 최선 노력.

• 2bit-lite — ~102 GB / 112 GB. 가장 작은 빌드이며, 128 GB Mac 또는 단일 H200에 맞는 유일한 버전입니다.

비트가 줄어들수록 품질이 떨어지며, 카드는 이를 수치로 정량화한다. FP8 기준과 비교할 때, perplexity는 6비트에서 +0.24%, 4비트에서 +2.96%, 3비트에서 +9.96%, 2비트에서 +56.9%, 2bit-lite에서 +141% 악화된다(perplexity 수치는 동일한 모델 카드에서 가져온 것이다). 카드 자체의 지침은 다음과 같다: 6비트는 거의 무손실용, 4비트는 일상의 기본값, 3비트와 2비트는 메모리 제약이 있을 때, 2bit-lite는 다른 방법이 없을 때만 — 그리고 2bit-lite에서는 긴 코드 생성이 안정적이지 않다. 마지막 경고는 320B 추론 모델에게 중요하다: 2bit-lite가 128GB Mac을 가능하게 해주는 옵션이며, 품질 저하라는 대가는 정확히 코딩 작업이 가장 큰 타격을 받는 지점에 발생한다.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

그 사다리에 있는 두 숫자는 더 자세히 살펴볼 가치가 있다. 그것들이 하드웨어 문제 전체를 결정하기 때문이다.

2bit-lite가 존재하는 이유

2bit-lite는 품질의 추가 등급이 아닙니다. 단 한 가지 이유로 만들어진 크기 등급입니다: 일반 2-bit는 맞지 않기 때문입니다. 약 102GB의 가중치로, 128GB Mac의 사용 가능한 메모리 약 112GB 아래에 들어가는 유일한 빌드이며, KV 캐시를 위한 여유 공간을 남기고 단일 H200의 141GB에 맞는 유일한 빌드이기도 합니다. 모델 카드에도 그렇게 명시되어 있습니다: 일반 2-bit는 128GB Mac에 맞지 않지만, 2bit-lite는 상향된 유선 메모리 제한으로 맞습니다. H200에서는 "KV 캐시용으로 약 39GB가 남은" 상태로 맞습니다(카드의 표현). 그 39GB는 모델이 로딩 후 수행하는 모든 작업에 대한 전체 작업 예산입니다. 그리고 이것이 컨텍스트로 이어집니다.

긴 컨텍스트에서 KV cache의 비용

GLM-5.3-Flash는 1M 토큰 컨텍스트 창을 가지며, 긴 컨텍스트는 로컬 메모리 계획이 무너지는 지점입니다. 이 모델의 하이브리드 희소+선형 어텐션 — 인덱스 풀 메커니즘을 갖춘 NoPE-MLA — 은 진정으로 효율적입니다. Z.ai는 이 어텐션 계산을 자사의 GLM-5.3 대비 3.01배, KV 캐시 크기를 4.44배 줄인다고 보고합니다(벤더 제공 수치). 그러나 "GLM-5.3보다 4.44배 작다"는 말은, 전체 1M 컨텍스트에 근접할 때 여전히 수십 GiB 단위로 측정되는 캐시를 남깁니다.

우리가 보유한 최고의 공개 수치는 커뮤니티 배포에서 나온 것으로, 해당 배포는 모델을 DGX Spark 노드 4개에 걸쳐 실행했습니다: 전체 1M-토큰 컨텍스트를 담기 위해 랭크당 16GiB의 KV 캐시 — 4개 합산 약 64GiB — 를 사용했으며, 이는 소수의 동시 전체-컨텍스트 요청을 지원할 수 있는 크기입니다. 이는 단일 가중치 하나도 올리기 전에 대부분의 단일 머신이 가진 전체 메모리 예산보다 많은 양입니다. 단일 H200에서의 계산이 바로 이 페이지의 핵심입니다: 2bit-lite는 가중치 이후의 모든 것을 위해 약 39GB를 남겨두며, 이는 짧은 채팅에는 충분하지만 컨텍스트가 100K 토큰에 가까워지면 몇 분 만에 소진됩니다.

실용적인 규칙: min-RAM 열은 합리적인 컨텍스트를 가정합니다. 워크로드가 긴 문서, 에이전트 루프, 또는 저장소 규모의 코드를 실행한다면 KV-캐시 메모리를 추가로 예산에 포함하세요. 그리고 100만 토큰에 가까운 경우에는 계산을 그만두고 API를 사용하세요. 이러한 용량 산정 관찰 결과는 커뮤니티에서 얻은 것이며, KV 예산 책정에 대한 공식 벤더 가이드라인은 존재하지 않습니다.

macOS 고정 메모리 한계: 128GB Mac에서도 여전히 로드에 실패하는 이유

실무자들이 보고하는 가장 흔한 실패는 "RAM 부족"이 아닙니다. 128GB Mac에서 약 102GB 모델이 로드되지 않는 경우입니다. 원인은 macOS의 와이어드 메모리 한계입니다. Apple Silicon에서 GPU는 통합 메모리의 전체를 주소 지정할 수 없습니다. Metal은 물리적 RAM의 약 2/3에 해당하는 "권장 최대 작업 세트"를 노출하며, 기기에 여유 메모리가 있어도 그 이상의 할당은 실패합니다.

그래서 128GB Mac의 기본 Metal 예산은 80~90GB 범위로, 2bit-lite 빌드에 필요한 메모리(약 102GB 상주 모델 기준 최소 112GB RAM)보다 낮습니다. 로드 실패는 RAM 용량 때문이 아니라 Metal 예산 때문입니다. 우리가 찾은 모든 실무자 보고서에서 해결책은 동일합니다: sudo sysctl iogpu.wired_limit_mb=…로 wired limit을 높여 모델의 전체 MB 크기보다 큰 값을 설정하는 것이며, 재부팅 시 초기화된다는 점을 감안해야 합니다. 일부 커뮤니티 가이드에서는 Python에서 mlx.metal.set_wired_limit()를 통해 wired limit을 설정하기도 합니다. 이렇게 하면 모델의 가중치가 고정되고 macOS가 유휴 Metal 페이지를 압축하지 않게 됩니다.

한 가지 더 복잡한 점은 런타임별로 동작이 다르다는 것입니다. MLX는 Metal 메모리 예산을 강제하며 이를 초과하면 바로 실패하는 반면, llama.cpp 기반 런타임(GGUF 경로)은 일반적으로 이를 강제하지 않고 macOS가 스왑하도록 둡니다. 그래서 같은 모델도 한 런타임에서는 로드되지 않고 다른 런타임에서는 "로드"되는 일이 생기며, 스왑된 모델은 사용할 수 없을 정도로 느려질 수 있습니다. 이는 Apple의 공식 지침이 아니라 macOS 동작에 대한 커뮤니티의 발견 사실입니다.

호스팅된 대안: z-ai/glm-5.3-flash

위의 숫자들이 배제하는 모든 사람들 — 즉 대부분의 사람들 — 을 위해, Z.ai는 z-ai/glm-5.3-flash로 모델 자체를 제공하며, 바로 여기서 이름 속 "Flash"가 실제로 드러납니다. Z.ai의 정가(목록 가격)는 입력 토큰 100만 개당 $0.15, 캐시된 입력 토큰 100만 개당 $0.03, 출력 토큰 100만 개당 $0.50이며, 출시 프로모션은 2026년 9월 9일까지 $0.075 / $0.015 / $0.25로 진행됩니다(벤더 보고 기준 가격, 작성 시점 기준). 캐시된 입력이 신규 입력의 5분의 1 가격이라는 점은 가장 큰 비용 절감 수단입니다. 재사용 가능한 접두사(시스템 프롬프트, 도구 정의, 긴 공유 문서)가 있는 모든 워크로드는 캐시 읽기 가격을 적용받아야 합니다.

메모리 계산은 결정에 포함되어야 합니다. 320B 모델을 직접 서빙한다는 것은 유휴 상태든 포화 상태든 112–320GB의 메모리를 전용으로 할당한다는 뜻입니다. 호스팅 엔드포인트는 그 모든 것을 사용자 머신에서 옮겨 주며, 출시 프로모션 가격 기준으로 이 모델은 크기가 10분의 1인 많은 모델보다 토큰당 비용이 더 낮습니다. 이것이 바로 18B 활성 MoE의 핵심입니다.

이것은 또한 라우팅 포인트를 위한 자연스러운 위치입니다. OrcaRouter를 통해 z-ai/glm-5.3-flash는 단일 API 뒤에 있는 200개 이상의 모델 중 하나이며, 제공업체의 공시 가격에 0% 마크업이 적용된 가격으로 제공됩니다. 따라서 출시 프로모션과 향후 가격 인하는 발표된 당일에 바로 적용됩니다. 자동 장애 조치(failover)는 서빙 경로가 불안정한 3일 된 모델이 프로덕션 스택에 대한 도박이 되지 않음을 의미합니다. 제공업체가 오류를 일으키거나 포화 상태가 되면 요청은 실패하는 대신 정상 제공업체로 전환됩니다. 검증되지 않은 모델을 안전하게 시도하는 것이 바로 라우터의 목적입니다.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

자주 묻는 질문

RTX 5090에서 GLM-5.3-Flash를 실행할 수 있나요?

아니요. 가장 작은 빌드도 가중치만 약 102GB이고, RTX 5090은 VRAM이 32GB입니다. 어떤 소비자용 GPU도 이에 근접하지 못합니다. 이 모델은 통합 메모리 Mac, 단일 H200, 또는 멀티 GPU 서버가 필요합니다.

18B 활성이 GLM-5.3-Flash가 소비자용 하드웨어에서 실행된다는 뜻인가요?

아니요. 18B 활성 수치는 토큰당 연산량입니다. 라우터는 토큰을 확인하기 전까지 해당 토큰이 어떤 expert를 필요로 하는지 알 수 없기 때문에 320B 파라미터 전체가 메모리에 상주합니다. MoE는 연산량을 절약할 뿐 메모리를 절약하지 않습니다.

GLM-5.3-Flash를 시도하는 가장 저렴한 방법은 무엇인가요?

호스팅된 API, z-ai/glm-5.3-flash. 출시 프로모션 가격으로 입력 토큰 100만 개당 $0.075이며, 캐시된 입력 토큰은 $0.015입니다. 가장 작은 빌드를 자체 호스팅하려면 약 112GB의 RAM을 전용으로 할당해야 하며, 이는 이미 하드웨어를 보유한 경우에만 합리적입니다.

솔직한 요약: GLM-5.3-Flash는 모든 빌드에서 서버급 모델입니다. 128GB Mac은 2bit-lite라는 맞는 빌드를 하나 얻습니다. 와이어드 메모리 한도 상향, 짧은 컨텍스트, 긴 코드에 대한 문서화된 품질 저하가 따릅니다. 단일 H200은 약 39GB의 KV 헤드룸으로 동일한 빌드를 얻습니다. 서버 하드웨어는 기본 4비트부터 거의 무손실 6비트까지 진짜 사다리를 갖춥니다. 그리고 그 외 다른 모든 사람들, 즉 대부분의 독자들에게는 호스팅된 z-ai/glm-5.3-flash 엔드포인트가 정답이며, 위 숫자는 쇼핑 목록이 아니라 바로 그 이유입니다. MacBook Pro에서의 단계별 설치는 MacBook 설치 워크스루가 전체 흐름을 처음부터 끝까지 다루고, 양자화 빌드 간 품질 비교와 각각을 선택할 시점은 MLX 빌드 가이드에 자세히 나와 있습니다. 릴리스 보도에는 출시 맥락과 벤치마크 주장이 담겨 있습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트