
Cara Menjalankan GLM-5.3-Flash di MacBook Pro: Buku Panduan MLX 2bit-Lite
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Menjalankan GLM-5.3-Flash pada MacBook Pro berarti tepat satu mesin: sebuah 128 GB M4/M5 Max MacBook Pro yang menjalankan 2bit-lite build dari konversi MLX kami, dengan batas memori wired macOS dinaikkan. Jika MacBook Pro Anda memiliki kurang dari 128 GB — M4 Pro 36 GB, M4 Max 48 GB — playbook ini bukan untuk Anda; lompat ke bagian terakhir dan gunakan API z-ai/glm-5.3-flash yang dihosting sebagai gantinya. GLM-5.3-Flash (bobot di zai-org/GLM-5.3-Flash) adalah model Mixture-of-Experts 320 miliar parameter milik Z.ai dengan 18B aktif per token — dirilis 26 Agustus 2026, GLM-5 multimodal asli pertama — dan bahkan build terkecil dari port MLX kami membutuhkan ~102 GB bobot dan ~112 GB memori. Itulah seluruh pasar, dan kami tidak akan memperlunaknya.
Ini adalah dokumentasi pihak pertama, bukan tulisan peluncuran: bobot di bawah ini adalah buatan OrcaRouter sendiri (orcarouter/GLM-5.3-Flash-MLX, MIT), dihasilkan dengan metode kuantisasi OrcaSAQ bebas kalibrasi kami. Kami merilisnya pada 26 Agustus dan secara terbuka mengubah arah pada hari berikutnya, karena rentang kuantisasi awal tidak membuat penggunaan MacBook Pro praktis bagi kebanyakan orang — build 2-bit reguler masih membutuhkan sekitar 160 GB, yang tidak dimiliki laptop mana pun. Pada 27 Agustus kami membangun ulang varian terkecil sebagai 2bit-lite secara khusus agar muat di MacBook Pro 128 GB, dan tulisan ini adalah catatan jujur tentang apa yang Anda peroleh dan apa yang harus dikorbankan. Setiap angka yang ditandai catatan lapangan di bawah ini diukur pada verifikasi run H200 tunggal kami; tidak ada satu pun di sini yang merupakan tolok ukur vendor. Jika kami mengulang praktik komunitas — perintah wired-memory, versi mlx-vlm — kami menandainya demikian.
Build mana yang cocok untuk Mac mana (baca ini sebelum mengunduh apa pun)
Kelima build di repo masing-masing memetakan ke angka RAM minimum. Di MacBook Pro, "build mana" memiliki tepat satu jawaban — semua yang di atas 2bit-lite adalah pembicaraan Mac Studio:
• 6-bit — ~296 GB bobot / ~320 GB RAM / hampir lossless. Mac Studio dengan 512 GB saja.
• 4-bit — ~204 GB / ~224 GB / default yang kami rekomendasikan. Mac Studio 256 GB. Inilah yang dicerminkan oleh repo root.
• 3-bit — ~184 GB / ~200 GB. Mac Studio 256 GB.
• 2-bit — ~145 GB / ~160 GB. Mac Studio 192 GB. Ini adalah build terkecil yang kami rilis pada hari pertama, dan di situlah letak kesalahannya.
• 2bit-lite — ~102 GB / ~112 GB. Satu-satunya build yang muat di mesin 128 GB — MacBook Pro M4/M5 Max 128 GB, atau Mac Studio atau Mac mini 128 GB. Laptop Apple Silicon 128 GB mana pun (M3 Max atau yang lebih baru) ceritanya sama, hanya lebih lambat.
Perangkap yang tersembunyi di tangga itu: perintah unduhan default di README menarik build 4-bit (~204 GB), yang merupakan default yang tepat untuk mesin 256 GB dan tidak berguna di laptop. Jika Anda mengikuti perintah default di MacBook Pro, Anda akan mendapatkan model yang gagal mengalokasikan memori. Jalur 2bit-lite secara eksplisit memerlukan --include, dibahas di bawah ini.
Ada juga batas keras yang akan Anda temui bahkan sebelum perhitungan di atas berlaku. macOS tidak mengizinkan sebuah proses mengambil seluruh memori terpadu Mac 128 GB; batas default penggunaan GPU sekitar 91–96 GB (direkayasa balik oleh komunitas dan dikonfirmasi dalam beberapa tulisan tentang pengaturan MLX model besar). Itu lebih rendah dari ~102 GB untuk bobot saja, jadi bahkan 2bit-lite tidak akan dimuat sampai Anda menaikkan batas memori wired. Langkah itu wajib dilakukan, dan itu adalah Bagian 4.
Instal mlx-vlm — dan hanya mlx-vlm
GLM-5.3-Flash adalah model visi-bahasa, jadi ia berjalan di bawah mlx-vlm, bukan mlx-lm. Ini adalah cara paling umum orang terjebak, jadi sampaikan sejak awal: mlx-lm untuk model teks saja; menjalankan model multimodal melaluinya menghasilkan error pemuatan yang membingungkan. Instal paket VLM pada versi 0.6.17 atau lebih baru:
pip install -U "mlx-vlm>=0.6.17"
Mengunci versi bukan sekadar hiasan. glm5_next — arsitektur hibrida sparse-plus-linear-attention di balik GLM-5.3-Flash — baru ditambahkan ke mlx-vlm tepat di hari yang sama dengan perilisan model (26 Agustus 2026), dan versi yang lebih lama tidak akan mengenali konfigurasinya. Arsitektur ini penting karena alasan kedua: ini adalah topologi yang benar-benar baru, dan port gelombang pertama memiliki bug nyata yang memengaruhi kebenaran keluaran tetapi tidak akan terungkap dari keluaran yang lancar. Audit runtime oleh komunitas terhadap jalur awal MLX glm5_next menemukan dan memperbaiki empat di antaranya — clamp SwiGLU yang tidak diterapkan pada setiap blok FFN, tensor hyper-connection dengan kendala manifold di-cast ke dtype yang salah (yang diam-diam merusak matriks pencampuran attention), dua ketidakcocokan epsilon pada norma attention, dan logit router bf16 padahal referensinya menggunakan float32. Setelah perbaikan, hasil numerik cocok dengan referensi hingga kira-kira 1e-7. Kesimpulannya untuk Anda: jaga mlx-vlm tetap mutakhir, dan curigai rilis pertama dari port arsitektur baru mana pun.
Unduh bobot: flag exclude, dan include yang sebenarnya Anda butuhkan
Root repositori mencerminkan build 4-bit, dan kelima varian dikemas sebagai subfolder. Perintah default mengunduh root dan menggunakan --exclude sehingga tidak ada satu pun dari kelima folder varian (yang totalnya sekitar 800 GB) yang ikut terunduh:
hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"
Pada MacBook Pro, perintah itu salah untuk Anda — perintah itu memberi Anda root 4-bit. Untuk laptop 128 GB, ambil hanya 2bit-lite subfolder:
hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX
Itu adalah unduhan ~102 GB, dan bersifat mandiri — 2bit-lite/ yang berisi config.json sendiri, jadi Anda tinggal mengarahkan generator langsung ke sana. Jika hf tidak ada di PATH Anda, instal: pip install -U huggingface_hub. Sebelum memulai, pastikan Anda memiliki ~110 GB ruang disk kosong dan penyimpanan Mac Anda tidak hanya menyisakan 100 GB terakhir — MLX melakukan memory-map pada bobot, dan SSD yang hampir penuh adalah penyebab setup ini gagal di tengah unduhan.

Naikkan batas memori terkunci — langkah yang semua orang lupakan
Ini adalah langkah penentu pada MacBook Pro 128 GB, dan kartu README menganggap Anda sudah mengetahuinya alih-alih menjelaskan perintahnya. Batas atas working-set Metal bawaan pada Mac 128 GB kira-kira 91–96 GB, yang berada di bawah bobot 2bit-lite yang sekitar 102 GB — jadi tanpa langkah ini model gagal dialokasikan dan pemuatannya berhenti. Perbaikan standar komunitas adalah sysctl yang menaikkan batas atas memori wired GPU dalam megabita:
sudo sysctl iogpu.wired_limit_mb=114688
Itu menetapkan batas atas sekitar 112 GB, menyisakan kira-kira 14 GB sebagai cadangan OS. Pada mesin 128 GB, nilai komunitas di lapangan berkisar dari ~114688 (112 GB) hingga ~122880 (120 GB); jangan memaksimalkannya — macOS membutuhkan ruang cadangan atau Anda akan mengalami kegagapan window-server dan sistem tersendat saat tekanan memori. Setelah mengaturnya, muat model dan perhatikan Activity Monitor: jika tekanan memori berubah kuning, kurangi angka tersebut.
Dua catatan praktis, keduanya berasal dari praktik komunitas, bukan dari catatan lapangan kami. Pertama, pengaturan sysctl akan direset saat reboot dan hanya berlaku untuk sesi terminal tempat Anda mengaturnya, jadi rencanakan untuk menjalankannya ulang (atau buat skripnya melalui LaunchAgent) — lupa melakukannya setelah reboot adalah kegagalan klasik "kemarin berhasil". Kedua, MLX juga mengekspos pengaturan dalam proses, mlx.core.metal.set_wired_limit(bytes), pada macOS 15.0 dan yang lebih baru; nilai ini harus tetap di bawah batas atas sysctl, dan ini adalah opsi yang lebih portabel jika Anda membuat skrip untuk notebook. Apa pun yang Anda gunakan, efeknya sama: tanpa itu, tidak ada yang berjalan di sini.
Jalankan: teks, gambar, dan API Python
Dengan bobot terpasang dan batas dinaikkan, generasi adalah satu perintah. Teks:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Jelaskan keterikatan kuantum dalam satu kalimat." --max-tokens 256
Input gambar bekerja dengan cara yang sama dengan --image flag — di sinilah model multimodal membuktikan kegunaannya di laptop, karena tower visi tetap berada pada presisi yang lebih tinggi dalam tata letak OrcaSAQ:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Jelaskan gambar ini." --max-tokens 256
Untuk sebuah skrip, bentuk API Python-nya sama seperti yang diketahui pengguna mlx-vlm:
from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Jelaskan gambar ini.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))
Jaga --max-tokens tetap sederhana. Pada pengujian lapangan H200 kami, 2bit-lite bertahan di sekitar 10 tok/s, jadi jawaban 1.024 token sudah merupakan waktu tunggu dua menit — dan pada keluaran yang panjang, anggaran KV dan penurunan kualitas mulai terasa (lihat di bawah). Di laptop, Anda harus memperkirakan bahwa rasanya akan lebih lambat, bukan lebih cepat, sampai ada angka terukur.
Kualitas apa yang sebenarnya Anda dapatkan (tangga yang diukur)
Berikut adalah bagian jujur dari buku pedoman ini, dan kami tidak akan menutup-nutupinya. OrcaSAQ menurun secara bertahap hingga 3-bit, lalu biayanya naik dengan cepat. Dibandingkan dengan referensi FP8 (perplexity 2.7797):
• 6-bit — perplexity 2,7864 (+0,24%), kesesuaian token top-1 97,76%. Hampir tanpa kehilangan, sesuai klaim.
• 4-bit — perplexity 2.8620 (+2,96%), top-1 96,13%. Default yang disarankan.
• 3-bit — perplexity 3.0566 (+9,96%), top-1 92,06%. Agresif tetapi dapat digunakan.
• 2-bit — perplexity 4,3622 (+56,9%), top-1 86,56%. Biaya yang sesungguhnya.
• 2bit-lite — perplexity 6.7018 (+141%), top-1 77.19%. Varian terkecil, dan satu-satunya yang bisa muat di MacBook Pro.
Itu adalah angka terukur dari pipeline konversi kami sendiri. 2bit-lite adalah regresi perplexity sebesar 141% dan kesepakatan token top-1 di bawah 78% — Anda menjalankan model yang terdegradasi secara signifikan, dan mode kegagalan di bawah ini adalah seperti apa degradasi itu dalam praktiknya. Ini adalah demo yang brilian dan asisten bentuk-pendek yang wajar; ini bukan pengganti untuk model presisi penuh.
Terkait kecepatan, kami berutang kejujuran yang sama kepada Anda. Catatan lapangan yang dipublikasikan adalah H200: ~10 tok/s, multi-turn yang stabil, Q&A sehari-hari dan teks pendek baik-baik saja. Kami belum memiliki angka MacBook Pro terukur untuk 2bit-lite, dan kami tidak akan mengarangnya — throughput Apple Silicon di sini bergantung pada bandwidth memori, termal, dan cakupan kernel MLX untuk hybrid attention, yang semuanya belum kami ukur untuk build ini di laptop ini. Titik data Apple Silicon terdekat yang telah dipublikasikan yang dapat kami tunjukkan adalah ~450 tok/s independen untuk build GLM-5.3-Flash 4-bit di Mac 512 GB dengan runtime MLX yang berbeda — build yang berbeda, presisi yang berbeda, dan mesin desktop, jadi jangan baca itu sebagai angka Anda juga. Rencanakan untuk lambat; berbahagialah jika ternyata tidak.
KV cache dan konteks panjang: perhatikan ruang kosongnya
GLM-5.3-Flash mengiklankan jendela konteks 1 juta token. Angka itu tidak relevan pada perangkat keras ini, dan panduan yang berpura-pura sebaliknya hanya akan merugikan Anda. Catatan praktisnya satu baris: beri runtime anggaran KV yang cukup untuk panjang target Anda. Pada satu H200, 2bit-lite menyisakan sekitar 39 GB ruang kosong untuk cache KV setelah bobot dimuat. Pada MacBook Pro 128 GB, perhitungannya lebih ketat: ~102 GB bobot dibandingkan batas ~112 GB menyisakan sekitar 26 GB sebelum working set macOS sendiri — dan lapisan attention linear hibrida membuat jejak KV model ini kecil relatif terhadap model padat seukuran ini, tetapi tetap tumbuh linear seiring konteks.
Panduan dari sisi serving yang berasal dari komunitas yang lebih luas menegaskan poin tersebut: konfigurasi yang berjalan normal pada konteks 8K bisa kehabisan memori pada 128K. Di laptop, pertahankan konteks yang pendek — beberapa ribu token tanya jawab atau satu gambar — dan jangan coba memberinya buku. Saat beban kerja benar-benar membutuhkan konteks panjang, Anda berada di bagian terakhir tulisan ini.
Generasi kode panjang tidak dapat diandalkan pada 2bit-lite (baca ini dua kali)
Ini adalah bagian yang tanpanya sebuah panduan cara yang menyembunyikan mode kegagalannya akan menjadi tidak berharga, jadi bagian ini memiliki judul tersendiri. Catatan lapangan H200 jelas: Tanya jawab sehari-hari dan teks bentuk pendek hasilnya baik, sedangkan pembuatan kode panjang tidak andal pada tingkat presisi ini. Tiga mode kegagalan yang terulang pada uji verifikasi kami:
• Perulangan repetitif — model mulai mengulangi baris atau blok yang sama alih-alih membuat kemajuan, biasanya setelah beberapa ratus token.
• Kode perekat yang hilang — impor, perangkaian, dan penanganan error dihilangkan secara diam-diam. Fungsi yang dihasilkan tampak benar secara terpisah tetapi tidak berjalan, karena kerangka pendukung di sekitarnya sama sekali tidak ada.
• Churn penulisan ulang — alih-alih penyuntingan minimal, model menulis ulang bagian-bagian besar dari sebuah berkas, dan giliran-giliran berikutnya tidak sepakat dengan keluaran satu sama lain.
Hal-hal ini dapat direproduksi pada 2bit-lite, dan justru itulah hal-hal yang diprediksi oleh kesepakatan top-1 77%. Apa yang sebenarnya dilakukan oleh para praktisi yang mempertahankan build laptop:
• Gunakan untuk penjelasan, peringkasan, tanya jawab, dan pemahaman gambar — pekerjaan singkat yang benar-benar bagus.
• Jika Anda harus meminta kode, mintalah satu fungsi kecil pada satu waktudengan tanda tangan yang eksplisit, dan periksa masing-masing sebelum melanjutkan. Jangan berikan seluruh file dan minta fitur.
Untuk apa pun yang panjang — modul lengkap, refaktorisasi, sesi agen yang lama — arahkan ke API presisi penuh {{1}}...{{/1}}. Itu bukan solusi sementara; itu arsitektur yang benar, dan itu adalah bagian terakhir {{2}}...{{/2}}.
Kapan tidak melakukan ini sama sekali: panggil z-ai/glm-5.3-flash sebagai gantinya

Aturan keputusan yang jujur: jalankan 2bit-lite pada MacBook Pro M4/M5 Max 128 GB hanya ketika Anda secara khusus menginginkan model multimodal 320B di laptop yang bisa Anda bawa — tanya jawab offline, dokumen pribadi, pemahaman gambar dengan tidak ada apa pun yang keluar dari mesin. Pilih API untuk hal lainnya:
• MacBook Pro mana pun di bawah 128 GB — tidak ada build untuk Anda. Jangan mencoba memuatnya; gunakan API.
• Pembuatan kode panjang atau penalaran konteks panjang — 2bit-lite pasti gagal tepat pada hal ini. Gunakan API.
• Pekerjaan yang sensitif terhadap kualitas — 77.19% kesepakatan top-1 dan +141% perplexity adalah penurunan nyata, bukan kesalahan pembulatan. Gunakan API.
• Throughput terjamin atau latensi yang dapat diprediksi — belum ada angka terukur untuk laptop, dan catatan lapangannya adalah 10 tok/s. Gunakan API.

Model yang dihosting adalah z-ai/glm-5.3-flash, yang disajikan dengan presisi penuh di OrcaRouter dengan harga Z.ai saat ini — $0.07 per juta token input dan $0.25 per juta token output pada saat penulisan ini (harga periode peluncuran; daftar harga yang dipublikasikan Z.ai adalah $0.15 / $0.50). Itulah harga yang dilaporkan vendor, dan diteruskan dengan markup 0%, sehingga penurunan harga Z.ai langsung terlihat di sisi kami pada hari yang sama. Anda mendapatkan satu kunci API yang juga menjangkau 200+ model lain yang kami rute, dan failover otomatis berarti eksperimen dengan model baru ini tidak mempertaruhkan jalur produksi Anda pada satu penyedia. Dalam waktu yang sama dengan yang dibutuhkan untuk mengunduh 102 GB dan menunggu generasi dingin pertama selesai, API sudah menjawab pertanyaan senilai satu minggu — dan menjawabnya dengan presisi penuh.
Inferensi lokal layak dilakukan ketika alasannya adalah lokal — privasi, pekerjaan offline, tanpa batas permintaan, demo yang berjalan dengan baterai. Ia tidak layak dilakukan berdasarkan perhitungan biaya atau kualitas untuk alasan lainnya, dan ia tidak layak dilakukan sama sekali pada mesin dengan RAM kurang dari 128 GB.
FAQ
Bisakah Mac 64 GB atau 96 GB menjalankan GLM-5.3-Flash secara lokal?Tidak. Build terkecil, 2bit-lite, membutuhkan sekitar minimal 112 GB setelah overhead macOS, dan bahkan mesin 128 GB pun harus menaikkan batas memori wired untuk memuatnya. Jika Mac Anda di bawah 128 GB, jalur lokal tidak ada; gunakan z-ai/glm-5.3-flash melalui API sebagai gantinya.
Saya memasang mlx-vlm dan modelnya gagal dimuat — apa yang salah? Dua penyebab umum, secara berurutan: versi di bawah 0.6.17, yang mendahului dukungan glm5_next dan tidak akan mengenali arsitektur tersebut; dan batas memori wired tidak dinaikkan, karena build ~102 GB tidak dapat mengalokasikan di bawah batas bawaan Metal ~91–96 GB pada Mac 128 GB. Perbaiki keduanya (tingkatkan paketnya, jalankan sysctl) dan model akan dimuat.
Apakah build 2bit-lite lokal adalah model yang sama dengan API z-ai/glm-5.3-flash?Bobot GLM-5.3-Flash yang mendasarinya sama, tetapi kualitasnya tidak sama. 2bit-lite adalah kuantisasi 2-bit dengan kesesuaian token top-1 sebesar 77.19% terhadap referensi FP8, dan generasi kode panjang tidak dapat diandalkan. API menyajikan presisi penuh. Keduanya hanya dapat dipertukarkan untuk pekerjaan bentuk pendek yang toleran terhadap kualitas.
Versi 30 detik
Satu mesin, satu build, satu sysctl wajib. Jika Anda memiliki MacBook Pro M4/M5 Max 128 GB: instal mlx-vlm>=0.6.17, hanya unduh 2bit-lite/ (~102 GB), naikkan batas memori wired dengan sudo sysctl iogpu.wired_limit_mb=114688, lalu jalankan mlx_vlm.generate — untuk Q&A, teks pendek, dan gambar. Terimalah bahwa pembuatan kode panjang tidak andal pada presisi ini, bahwa belum ada throughput laptop yang terukur, dan bahwa Mac 128 GB adalah batas bawah, bukan standar. Jika salah satu peringatan tersebut merupakan dealbreaker — atau Mac Anda di bawah 128 GB — model yang sama pada presisi penuh hanya berjarak satu panggilan API di z-ai/glm-5.3-flash.
Tidak menggunakan Mac 128 GB? z-ai/glm-5.3-flash menyajikan model yang sama dengan presisi penuh di OrcaRouter — satu kunci API, harga penyedia diteruskan dengan markup 0%, dan tanpa unduhan 102 GB.
