Kartu judul hero untuk artikel berjudul 'Kebutuhan VRAM GLM-5.3-Flash' dengan subjudul 'Berapa banyak memori yang Anda butuhkan untuk menjalankan MoE 320B', badge pil '320B total · 18B aktif', 'Konteks 1M token', 'Build komunitas MLX', dan kartu ringkasan berbunyi '2bit-lite: ~102 GB bobot / 112 GB RAM — build yang muat di Mac 128 GB', dengan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

GLM-5.3-Flash Persyaratan VRAM: Berapa Banyak Memori yang Anda Butuhkan untuk Menjalankan 320B MoE

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GLM-5.3-Flash tidak muat di GPU konsumen mana pun. Build terkecil yang dapat digunakan, 2bit-lite, membutuhkan sekitar 102 GB untuk bobot dan 112 GB RAM. Mac 128 GB adalah titik masuknya; satu H200 dapat memuat 2bit-lite dengan sisa sekitar 39 GB; yang lainnya harus menggunakan API yang di-host, z-ai/glm-5.3-flash.

Itulah jawaban lengkap dalam satu tarikan napas, dan perlu dikatakan secara gamblang di sini: tidak ada konfigurasi perangkat keras konsumen yang mampu menjalankan model ini. Model mixture-of-experts visi-bahasa dengan 320 miliar parameter milik Z.ai, yang dirilis pada 26 Agustus 2026, membutuhkan memori kelas server dalam setiap kuantisasinya. Angka "18B aktif" menggambarkan komputasi per token, bukan memori residen — semua 320 miliar bobot tetap dimuat penuh. Target lokal yang realistis adalah Mac dengan memori terpadu besar, server multi-GPU, dan satu H200 berkapasitas 141 GB. Jika Anda tidak memiliki salah satu dari itu, angka-angka di bawah ini bukanlah daftar belanja; melainkan alasan untuk memanggil model tersebut melalui API.

Satu catatan pembingkaian sebelum angka-angka: angka memori dalam tulisan ini adalah temuan komunitas, bukan panduan vendor. Z.ai menerbitkan bobot dan spesifikasi API; mereka tidak menerbitkan kebutuhan memori inferensi lokal. Tabel per-kuantisasi berasal dari kartu model orcarouter/GLM-5.3-Flash-MLX di Hugging Face, sebuah kuantisasi MLX dari bobot terbuka yang dipelihara oleh kelompok komunitas, dan angka penerapannya berasal dari praktisi yang benar-benar telah memuat model tersebut. Jika suatu angka dilaporkan oleh vendor — harga, dan klaim efisiensi KV-cache arsitektur — kami menandainya demikian.

Jawaban singkatnya: apa yang muat di perangkat yang Anda miliki.

Mulailah dari apa yang sebenarnya Anda miliki, karena tangga kuantisasi hanya masuk akal jika disesuaikan dengan mesin target:

• GPU konsumen (RTX 4090, RTX 5090, dan semua di bawahnya) — tidak. Tidak ada satu pun kartu konsumen yang memiliki VRAM cukup: build terkecil adalah ~102 GB hanya untuk bobot, kira-kira setara dengan lima RTX 5090. RAM sistem tidak mengubah hal ini, karena bobot harus berada di perangkat.

• Mac 128 GB (M4 atau M5 Max) — build 2bit-lite (sekitar 102 GB bobot / RAM minimum 112 GB), dan hanya setelah menaikkan batas memori berkabel. Lebih lanjut di bawah ini. Ini adalah satu-satunya mesin kelas konsumen yang dapat memuat model ini.

• Mac Studio 192 GB dan 256 GB — 3-bit (~184 / 200 GB) dan 2-bit (~145 / 160 GB) menjadi dapat dijangkau; 4-bit membutuhkan ~224 GB, yang hanya didekati oleh varian 256 GB.

• H200 tunggal (141 GB VRAM) — 2bit-lite muat dengan sisa sekitar 39 GB untuk cache KV, yang berarti hanya konteks pendek.

• Server Multi-GPU — semuanya, termasuk 4-bit, 6-bit, dan build referensi FP8 ~328 GB.

• Semua orang lain — API yang dihosting, z-ai/glm-5.3-flash. Itu bukan hadiah hiburan; di situlah modelnya sebenarnya cepat dan murah digunakan, dan itu dibahas di bagian bawah halaman ini.

Dua angka, bukan satu: bobot vs memori total

Setiap kuantisasi pada kartu model memiliki dua kolom — ukuran bobot dan RAM minimum — dan selisih di antara keduanya adalah bagian yang paling sering dilewatkan sebagian besar tulisan. Kolom bobot adalah file model: setiap parameter, pada presisi tersebut, tersimpan di memori. Kolom RAM minimum adalah apa yang harus ditampung mesin saat runtime: bobot ditambah cache KV, aktivasi, dan buffer yang bertambah seiring panjang konteks.

Angka 18B-aktif adalah tempat orang terkecoh. GLM-5.3-Flash adalah MoE dengan total 320B / 18B aktif: per token, hanya sekitar 18B parameter yang dihitung. Itu penghematan komputasi, bukan penghematan memori. Semua bobot 320B tetap berada di memori terlepas dari expert mana yang aktif, karena router tidak tahu expert mana yang dibutuhkan sampai melihat token. MoE memberikan kecepatan, bukan jejak memori — sebuah poin yang ditunjukkan oleh kartu model itu sendiri, dengan total 320B ditampilkan bersama 18B aktif.

Jadi ketika build menyebutkan "~204 GB bobot / 224 GB RAM minimum," selisih ~20 GB itu adalah overhead runtime — cache KV, aktivasi, buffer konteks. Naikkan panjang konteks dan selisih itu ikut membesar. Kolom RAM minimum, bukan kolom bobot, yang harus dipakai sebagai acuan untuk menentukan spesifikasi mesin.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

Model itu sendiri — arsitektur, lisensi, dan cara Z.ai menampilkannya — didokumentasikan pada kartu resmi vendor yang ditampilkan di atas. Memori lokal tidak tercakup di sana; itulah sebabnya halaman ini ada. Angka-angka di bawah ini berasal dari port MLX komunitas dari open weights.

Tangga kuantisasi

Tabel pada kartu orcarouter/GLM-5.3-Flash-MLX adalah yang benar-benar dimuat oleh para praktisi saat ini. Ini mencantumkan lima build terkuantisasi ditambah referensi FP8, masing-masing dengan ukuran bobot dan RAM minimum:

• Referensi FP8 — bobot ~328 GB. Titik referensi tanpa kuantisasi tempat bobot terbuka dirilis.

• 6-bit — ~296 GB bobot / 320 GB RAM min. Hampir tanpa kehilangan; build dengan kualitas terbaik.

• 4-bit — ~204 GB / 224 GB. Default harian yang direkomendasikan.

• 3-bit — ~184 GB / 200 GB. Agresif tetapi dapat digunakan.

• 2-bit — ~145 GB / 160 GB. Upaya terbaik.

• 2bit-lite — ~102 GB / 112 GB. Build terkecil; satu-satunya yang muat di Mac 128 GB atau satu H200.

Kualitas menurun seiring berkurangnya bit, dan kartu tersebut mengukurnya. Dibandingkan dengan referensi FP8, perplexity terdegradasi sebesar +0,24% pada 6-bit, +2,96% pada 4-bit, +9,96% pada 3-bit, +56,9% pada 2-bit, dan +141% pada 2bit-lite (angka perplexity dari kartu model yang sama). Panduan pada kartu itu sendiri: 6-bit untuk hampir tanpa kehilangan, 4-bit sebagai default harian, 3-bit dan 2-bit saat memori terbatas, 2bit-lite hanya jika tidak ada pilihan lain yang muat — dan pembuatan kode panjang tidak andal pada 2bit-lite. Peringatan terakhir itu penting bagi model penalaran 320B: 2bit-lite adalah alasan Anda membeli Mac 128 GB, dan pajak kualitasnya jatuh tepat di tempat yang paling menyakitkan pada pekerjaan coding.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

Dua angka dalam tangga itu layak dicermati lebih dekat karena keduanya menentukan seluruh persoalan perangkat keras.

Mengapa 2bit-lite ada

2bit-lite bukanlah tingkatan kualitas tambahan — ini adalah tingkatan ukuran yang dibuat karena satu alasan: 2-bit reguler tidak muat. Dengan bobot ~102 GB, ini adalah satu-satunya build yang muat di bawah ~112 GB memori yang dapat digunakan pada Mac 128 GB, dan satu-satunya yang muat di 141 GB sebuah H200 tunggal dengan sisa ruang untuk cache KV. Kartu model menyatakan demikian: 2-bit reguler tidak muat di Mac 128 GB; 2bit-lite muat, dengan batas memori berkabel yang dinaikkan. Pada H200, ia muat "dengan sisa ~39 GB untuk cache KV" (kata-kata kartu tersebut). 39 GB itu adalah seluruh anggaran kerja untuk semua yang dilakukan model setelah dimuat — yang membawa kita ke konteks.

Berapa biaya KV cache pada konteks panjang

GLM-5.3-Flash memiliki jendela konteks 1M token, dan konteks panjang adalah tempat rencana memori lokal mati. Perhatian hibrida sparse-plus-linear model ini — NoPE-MLA dengan mekanisme index-pool — benar-benar efisien: Z.ai melaporkan bahwa ini memangkas komputasi atensi 3.01× dan ukuran cache KV 4.44× dibandingkan dengan GLM-5.3 miliknya sendiri (angka yang dilaporkan vendor). Tetapi '4.44× lebih kecil dari GLM-5.3' masih menyisakan cache yang diukur dalam puluhan GiB ketika Anda mendorong menuju konteks 1M penuh.

Angka publik terbaik yang kami miliki adalah dari penerapan komunitas yang menjalankan model di empat node DGX Spark: 16 GiB cache KV per rank — sekitar 64 GiB total di keempat node — untuk menampung konteks 1M-token penuh, yang diukur untuk mendukung beberapa permintaan konteks penuh secara bersamaan. Itu lebih dari seluruh anggaran memori kebanyakan mesin tunggal, sebelum satu bobot pun. Pada satu H200, aritmetikanya adalah inti dari halaman ini: 2bit-lite menyisakan ~39 GB untuk semua yang lain setelah bobot — nyaman untuk obrolan singkat, habis dalam hitungan menit saat konteks naik menuju 100K token.

Aturan praktisnya: kolom RAM minimum mengasumsikan konteks yang wajar. Jika beban kerja Anda menjalankan dokumen panjang, loop agen, atau kode skala repositori, tambahkan anggaran memori cache KV — dan untuk apa pun yang mendekati 1M token, berhenti menghitung dan gunakan API. Pengamatan ukuran ini adalah temuan komunitas; tidak ada panduan vendor untuk penganggaran KV.

Batas memori tertambat macOS: mengapa Mac 128 GB masih gagal dimuat

Kegagalan yang paling umum dilaporkan oleh praktisi bukanlah "RAM tidak cukup." Melainkan Mac 128 GB dengan model ~102 GB yang menolak untuk dimuat. Penyebabnya adalah batas wired memory macOS. Pada Apple Silicon, GPU tidak dapat mengakses seluruh memori terpadu: Metal mengekspos "recommended max working set" sekitar dua pertiga dari RAM fisik, dan alokasi di atasnya gagal bahkan ketika mesin memiliki memori kosong.

Jadi, anggaran Metal bawaan Mac 128 GB berada di kisaran 80–90 GB — di bawah kebutuhan build 2bit-lite (~112 GB RAM minimum dengan model residen ~102 GB). Pemuatan gagal karena anggaran Metal, bukan kapasitas RAM. Perbaikan di setiap laporan praktisi yang kami temukan sama: naikkan batas wired dengan sudo sysctl iogpu.wired_limit_mb=…, atur nilainya di atas total footprint model dalam MB, dan perkirakan akan direset saat reboot. Beberapa panduan komunitas juga mengatur batas wired dari Python melalui mlx.metal.set_wired_limit() sehingga bobot model terkunci dan macOS berhenti mengompres halaman Metal yang idle.

Satu lagi kerumitan: runtime berperilaku berbeda. MLX memberlakukan batas Metal dan gagal total ketika terlampaui, sementara runtime berbasis llama.cpp (jalur GGUF) umumnya tidak memberlakukannya dan membiarkan macOS melakukan swap sebagai gantinya. Itulah sebabnya model yang sama dapat menolak untuk dimuat di satu runtime dan "dimuat" di runtime lain — dan mengapa model yang di-swap bisa menjadi lambat hingga tidak dapat digunakan. Ini adalah temuan komunitas tentang perilaku macOS, bukan panduan Apple.

Alternatif terhosting: z-ai/glm-5.3-flash

Bagi semua orang yang angka-angka di atas mengesampingkan — yang merupakan kebanyakan orang — Z.ai menyajikan model itu sendiri sebagai z-ai/glm-5.3-flash, dan di sinilah "Flash" pada nama tersebut benar-benar muncul. Harga daftar Z.ai adalah $0,15 per juta token input, $0,03 per juta token input yang di-cache, dan $0,50 per juta token output; promosi peluncuran berlangsung hingga 9 September 2026, dengan harga $0,075 / $0,015 / $0,25 (harga yang dilaporkan vendor, berlaku saat penulisan). Input yang di-cache dengan harga seperlima dari input segar adalah pengungkit biaya terbesar: beban kerja apa pun dengan prefiks yang dapat digunakan kembali — perintah sistem, definisi alat, dokumen bersama yang panjang — seharusnya memanfaatkan harga pembacaan cache.

Perhitungan memori seharusnya menjadi bagian dari keputusan. Menyajikan model 320B sendiri berarti mendedikasikan 112–320 GB memori untuknya, baik saat idle maupun jenuh. Endpoint yang di-hosting memindahkan semua itu dari mesin Anda, dan dengan harga promo peluncuran, biaya model per token lebih rendah daripada banyak model sepersepuluh ukurannya — itulah inti dari MoE aktif 18B.

Ini juga merupakan tempat alami untuk titik routing. Melalui OrcaRouter, z-ai/glm-5.3-flash adalah salah satu dari 200+ model di balik satu API, dengan harga sesuai daftar harga penyedia dan tanpa markup — sehingga promo peluncuran, dan potongan harga apa pun di masa depan, langsung aktif pada hari yang sama saat diumumkan. Failover otomatis berarti model yang baru berumur tiga hari dengan jalur servis yang tidak stabil bukanlah taruhan pada stack produksi Anda: jika penyedia mengalami kesalahan atau jenuh, permintaan dialihkan ke penyedia yang sehat, bukan gagal. Mencoba model yang belum terbukti secara aman adalah persis untuk apa router ada.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

FAQ

Bisakah saya menjalankan GLM-5.3-Flash pada RTX 5090?

Tidak. Build terkecil saja ~102 GB hanya untuk bobotnya, dan RTX 5090 punya VRAM 32 GB. Tidak ada GPU konsumen yang mendekati; model itu butuh Mac dengan memori terpadu, satu H200, atau server multi-GPU.

Apakah 18B aktif berarti GLM-5.3-Flash berjalan di perangkat keras konsumen?

Tidak. Angka aktif 18B adalah komputasi per-token. Semua 320B parameter tetap berada di memori, karena router tidak dapat mengetahui ahli mana yang dibutuhkan token sampai ia melihat token tersebut. MoE menghemat komputasi, bukan memori.

Apa cara termurah untuk mencoba GLM-5.3-Flash?

API yang di-host, z-ai/glm-5.3-flash. Dengan harga promo peluncuran, biayanya $0.075 per juta token masukan, dan token masukan yang di-cache berbiaya $0.015. Menghosting sendiri build terkecil berarti mendedikasikan ~112 GB RAM untuk itu, yang hanya masuk akal jika Anda sudah memiliki perangkat kerasnya.

Ringkasan yang jujur: GLM-5.3-Flash adalah model kelas server dalam setiap build. Mac 128 GB mendapatkan satu build yang cocok — 2bit-lite, dengan peningkatan batas memori terkunci, konteks pendek, dan penalti kualitas yang terdokumentasi pada kode panjang. Satu H200 mendapatkan build yang sama dengan ruang KV ~39 GB. Perangkat keras server mendapatkan tangga sesungguhnya, dari 4-bit sebagai default hingga 6-bit yang hampir lossless. Dan untuk semua orang lainnya — sebagian besar pembaca — endpoint z-ai/glm-5.3-flash yang di-hosting adalah jawaban yang tepat, dan angka-angka di atas adalah alasannya, bukan daftar belanja. Untuk instalasi langkah demi langkah di MacBook Pro, panduan instalasi MacBook kami mencakup seluruh alur dari awal hingga akhir; untuk perbandingan kualitas antar build kuantisasi dan kapan memilih masing-masing, panduan build MLX memuat detailnya; dan liputan rilis memuat konteks peluncuran serta klaim tolok ukur.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari