
Yêu cầu VRAM của GLM-5.3-Flash: Bạn cần bao nhiêu bộ nhớ để chạy MoE 320B
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 221 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
GLM-5.3-Flash không vừa trên bất kỳ GPU tiêu dùng nào. Bản dựng nhỏ nhất có thể dùng được, 2bit-lite, cần khoảng 102 GB trọng số và 112 GB RAM. Một chiếc Mac 128 GB là điểm khởi đầu; một H200 duy nhất vừa 2bit-lite với khoảng 39 GB dư; mọi người khác nên dùng API được lưu trữ, z-ai/glm-5.3-flash.
Đó là toàn bộ câu trả lời trong một hơi, và đáng để nói thẳng ngay tại đây: không có cấu hình phần cứng tiêu dùng nào chạy được mô hình này. Mô hình hỗn hợp chuyên gia thị giác-ngôn ngữ 320B tham số của Z.ai, phát hành ngày 26 tháng 8 năm 2026, cần bộ nhớ cấp máy chủ ở mọi mức lượng tử hóa. Con số "18B hoạt động" mô tả khối lượng tính toán trên mỗi token, không phải bộ nhớ thường trú — toàn bộ 320B trọng số vẫn được nạp. Các mục tiêu cục bộ thực tế là các máy Mac bộ nhớ hợp nhất lớn, máy chủ đa GPU, và một H200 duy nhất ở mức 141 GB. Nếu bạn không sở hữu một trong những thứ đó, các con số dưới đây không phải là danh sách mua sắm; chúng là lý do để gọi mô hình qua API thay vào đó.
Trước khi xem các số liệu, cần lưu ý một điểm về cách trình bày: các con số về bộ nhớ trong bài này là kết quả cộng đồng tìm ra, không phải hướng dẫn từ nhà cung cấp. Z.ai công bố trọng số và thông số API; họ không công bố yêu cầu về bộ nhớ cho suy luận cục bộ. Bảng phân theo mức lượng tử hóa lấy từ thẻ mô hình orcarouter/GLM-5.3-Flash-MLX trên Hugging Face — một bản lượng tử hóa MLX của trọng số mở do một nhóm cộng đồng duy trì — còn các số liệu triển khai đến từ những người thực hành đã thực sự tải mô hình. Ở chỗ nào có con số do nhà cung cấp công bố — chẳng hạn giá cả và các tuyên bố về hiệu quả bộ đệm KV của kiến trúc — chúng tôi đều ghi chú rõ như vậy.
Câu trả lời ngắn gọn: thứ gì vừa với thứ bạn đang sở hữu
Bắt đầu từ những gì bạn thực sự có, bởi vì bậc thang lượng tử hóa chỉ có ý nghĩa khi đối chiếu với một máy mục tiêu:
• GPU tiêu dùng (RTX 4090, RTX 5090 và mọi thứ thấp hơn) — không. Không một card tiêu dùng nào có đủ VRAM: bản dựng tối thiểu đã cần ~102 GB chỉ riêng trọng số, tương đương khoảng năm chiếc RTX 5090. RAM hệ thống không thay đổi điều này, vì các trọng số phải nằm trên thiết bị.
• 128 GB Mac (M4 hoặc M5 Max) — bản dựng 2bit-lite (~102 GB trọng số / 112 GB RAM tối thiểu), và chỉ sau khi tăng giới hạn bộ nhớ có dây. Chi tiết hơn ở bên dưới. Đây là một chiếc máy thuộc phân khúc tiêu dùng duy nhất mà mô hình có thể chạy được.
• Mac Studio 192 GB và 256 GB — các mức 3-bit (~184 / 200 GB) và 2-bit (~145 / 160 GB) trở nên khả dụng; 4-bit cần ~224 GB, chỉ phân khúc 256 GB mới tiệm cận.
• Single H200 (141 GB VRAM) — 2bit-lite vừa khớp với khoảng 39 GB còn lại cho KV cache, nghĩa là chỉ hỗ trợ ngữ cảnh ngắn.
• Máy chủ đa GPU — tất cả, bao gồm 4-bit, 6-bit và bản dựng tham chiếu FP8 ~328 GB.
• Tất cả những người khác — API được lưu trữ, z-ai/glm-5.3-flash. Đó không phải là giải an ủi; đó là nơi mô hình thực sự nhanh và rẻ để sử dụng, và nó được đề cập ở cuối trang này.
Hai con số, không phải một: trọng số so với tổng bộ nhớ
Mọi lượng tử hóa trên thẻ mô hình đều có hai cột — kích thước trọng số và RAM tối thiểu — và khoảng cách giữa chúng là phần mà hầu hết các bài viết bỏ qua. Cột trọng số là các tệp mô hình: mọi tham số, ở độ chính xác đó, nằm trong bộ nhớ. Cột RAM tối thiểu là những gì máy phải giữ trong thời gian chạy: trọng số cộng với bộ đệm KV, các kích hoạt và các bộ đệm tăng theo độ dài ngữ cảnh.
Con số 18B active là nơi khiến mọi người hiểu lầm. {{1}}GLM-5.3-Flash là một MoE có tổng 320B / 18B active: với mỗi token, chỉ khoảng 18B tham số được tính toán. Đó là tiết kiệm tính toán, không phải tiết kiệm bộ nhớ.{{/1}} {{2}}Toàn bộ 320B trọng số nằm trong bộ nhớ bất kể expert nào được kích hoạt, vì router không biết mình cần expert nào cho đến khi nhìn thấy token.{{/2}} {{3}}MoE mang lại tốc độ, không phải diện tích bộ nhớ{{/3}} {{4}}— một điểm mà chính thẻ thông số của mô hình minh họa bằng ví dụ, khi đặt tổng 320B bên cạnh con số 18B active.{{/4}}
Vậy khi một bản build ghi "~204 GB trọng số / 224 GB RAM tối thiểu," thì khoảng ~20 GB thừa ra chính là chi phí chạy thực tế — KV cache, kích hoạt, bộ đệm ngữ cảnh. Đẩy độ dài ngữ cảnh lên thì phần chênh lệch đó càng lớn. Cột RAM tối thiểu, chứ không phải cột trọng số, mới là thứ dùng để định cỡ máy.

Bản thân mô hình — kiến trúc, giấy phép và cách Z.ai tự giới thiệu — được ghi trên thẻ chính thức của nhà cung cấp, hiển thị ở trên. Bộ nhớ cục bộ không được đề cập ở đó; đó là lý do trang này tồn tại. Các số liệu bên dưới lấy từ bản chuyển MLX của cộng đồng từ các trọng số mở.
Bậc thang lượng tử hóa
Bảng trên thẻ orcarouter/GLM-5.3-Flash-MLX là bảng mà những người thực hành hiện đang thực sự tải về hôm nay. Bảng liệt kê năm bản dựng lượng tử hóa cùng với bản tham chiếu FP8, mỗi bản có kích thước trọng số và RAM tối thiểu:
• Tham chiếu FP8 — ~328 GB trọng số. Điểm tham chiếu chưa lượng tử hóa mà các trọng số mở được phát hành.
• 6-bit — ~296 GB trọng số / tối thiểu 320 GB RAM. Gần như không mất dữ liệu; bản dựng chất lượng tốt nhất.
• 4-bit — ~204 GB / 224 GB. Mặc định khuyến nghị hàng ngày.
• 3-bit — ~184 GB / 200 GB. Mạnh mẽ nhưng vẫn dùng được.
• 2-bit — ~145 GB / 160 GB. Nỗ lực tốt nhất.
• 2bit-lite — ~102 GB / 112 GB. Bản dựng nhỏ nhất; bản duy nhất phù hợp với Mac 128 GB hoặc một H200.
Chất lượng giảm khi số bit tụt xuống, và model card định lượng được điều đó. So với chuẩn FP8, perplexity suy giảm +0,24% ở 6-bit, +2,96% ở 4-bit, +9,96% ở 3-bit, +56,9% ở 2-bit và +141% ở 2bit-lite (số liệu perplexity lấy từ cùng model card). Hướng dẫn của chính model card: 6-bit cho chất lượng gần như không mất mát, 4-bit là mặc định hàng ngày, 3-bit và 2-bit khi bộ nhớ bị hạn chế, 2bit-lite chỉ khi không còn lựa chọn nào khác phù hợp — và sinh mã dài không đáng tin cậy ở 2bit-lite. Cảnh báo cuối đó rất quan trọng với một mô hình suy luận 320B: chính 2bit-lite giúp bạn có được chiếc Mac 128 GB, và cái giá chất lượng rơi đúng vào nơi công việc lập trình đau nhất.

Hai con số trong bậc thang đó đáng để xem xét kỹ hơn vì chúng quyết định toàn bộ vấn đề phần cứng.
Tại sao 2bit-lite tồn tại
2bit-lite không phải là một cấp chất lượng bổ sung — nó là một cấp kích thước được tạo ra vì một lý do duy nhất: 2-bit thông thường không vừa. Với ~102 GB trọng số, đây là bản dựng duy nhất nằm gọn dưới ~112 GB bộ nhớ khả dụng trên Mac 128 GB, và cũng là bản duy nhất vừa với 141 GB của một chiếc H200 đơn lẻ mà vẫn còn chỗ cho bộ đệm KV. Thẻ mô hình nói rõ điều đó: 2-bit thông thường không vừa với Mac 128 GB; 2bit-lite thì vừa, với giới hạn bộ nhớ có dây được nâng lên. Trên H200, nó vừa "với ~39 GB còn lại cho bộ đệm KV" (đúng lời thẻ mô hình). 39 GB đó là toàn bộ ngân sách hoạt động cho mọi thứ mô hình làm sau khi tải — điều này dẫn chúng ta đến phần ngữ cảnh.
Chi phí của KV cache ở ngữ cảnh dài
GLM-5.3-Flash có cửa sổ ngữ cảnh 1M token, và ngữ cảnh dài chính là nơi các kế hoạch bộ nhớ cục bộ chết đứng. Cơ chế attention lai kết hợp sparse và linear của mô hình — NoPE-MLA với cơ chế index-pool — thực sự hiệu quả: Z.ai báo cáo rằng nó cắt giảm 3,01 lần chi phí tính toán attention và 4,44 lần dung lượng KV cache so với GLM-5.3 của chính họ (số liệu do nhà cung cấp công bố). Nhưng "nhỏ hơn 4,44 lần so với GLM-5.3" vẫn để lại một bộ đệm có dung lượng hàng chục GiB khi bạn tiến tới ngữ cảnh 1M đầy đủ.
Con số công khai tốt nhất mà chúng tôi có là từ một lần triển khai cộng đồng chạy mô hình trên bốn nút DGX Spark: 16 GiB KV cache mỗi rank — tổng cộng khoảng 64 GiB trên cả bốn nút — để chứa trọn ngữ cảnh 1 triệu token, được định cỡ nhằm phục vụ một vài yêu cầu đồng thời sử dụng ngữ cảnh đầy đủ. Con số này đã vượt quá toàn bộ ngân sách bộ nhớ của hầu hết các máy đơn lẻ, chưa tính đến dù chỉ một trọng số. Trên một H200 đơn lẻ, cốt lõi của trang này nằm ở phép toán: 2bit-lite để lại khoảng 39 GB cho mọi thứ ngoài trọng số — thoải mái cho một cuộc trò chuyện ngắn, nhưng sẽ cạn kiệt chỉ trong vài phút khi ngữ cảnh tăng dần lên 100K token.
Quy tắc thực tế: cột min-RAM giả định một ngữ cảnh hợp lý. Nếu khối lượng công việc của bạn xử lý tài liệu dài, vòng lặp agent, hoặc mã ở quy mô repository, hãy dự trù thêm bộ nhớ KV-cache — và với bất cứ thứ gì gần 1M token, hãy ngừng tính toán mà dùng API. Những quan sát về định cỡ này là phát hiện từ cộng đồng; không có hướng dẫn nào từ nhà cung cấp về việc lập ngân sách KV.
Giới hạn bộ nhớ wired của macOS: tại sao một chiếc Mac 128 GB vẫn không thể tải được
Lỗi phổ biến nhất mà những người thực hành báo cáo không phải là "không đủ RAM". Đó là một chiếc Mac 128 GB không chịu nạp một mô hình ~102 GB. Nguyên nhân là giới hạn bộ nhớ cố định của macOS. Trên Apple Silicon, GPU không được phép truy cập toàn bộ bộ nhớ hợp nhất: Metal đưa ra "kích thước bộ làm việc tối đa được khuyến nghị" khoảng hai phần ba RAM vật lý, và các cấp phát vượt quá mức đó sẽ thất bại ngay cả khi máy còn bộ nhớ trống.
Do đó, ngân sách Metal mặc định của một chiếc Mac 128 GB nằm đâu đó trong khoảng 80–90 GB — thấp hơn mức mà bản dựng 2bit-lite cần (~112 GB RAM tối thiểu với mô hình thường trú ~102 GB). Việc tải thất bại do ngân sách Metal, không phải do dung lượng RAM. Giải pháp trong mọi báo cáo thực hành mà chúng tôi tìm thấy đều giống nhau: tăng giới hạn wired bằng lệnh `sudo sysctl iogpu.wired_limit_mb=…`, đặt giá trị lớn hơn tổng dung lượng chiếm chỗ của mô hình tính bằng MB, và lưu ý rằng nó sẽ được đặt lại sau khi khởi động lại. Một số hướng dẫn cộng đồng cũng đặt giới hạn wired từ Python thông qua `mlx.metal.set_wired_limit()` để trọng số của mô hình được cố định và macOS ngừng nén các trang Metal không hoạt động.
Thêm một rắc rối nữa: các runtime hoạt động khác nhau. MLX thực thi hạn mức Metal và lỗi nặng khi vượt quá, trong khi các runtime dựa trên llama.cpp (đường dẫn GGUF) thường không thực thi hạn mức đó và để macOS swap thay vào đó. Đó là lý do cùng một mô hình có thể từ chối tải trong runtime này nhưng "tải" được trong runtime khác — và vì sao một mô hình bị swap có thể chậm đến mức không dùng được. Đây là những phát hiện từ cộng đồng về hành vi của macOS, không phải hướng dẫn của Apple.
Lựa chọn thay thế được lưu trữ: z-ai/glm-5.3-flash
Đối với tất cả những người bị loại trừ bởi các con số nêu trên — tức là hầu hết mọi người — Z.ai phục vụ chính mô hình này với tên gọi z-ai/glm-5.3-flash, và đây là nơi chữ "Flash" trong tên gọi thực sự thể hiện. Giá niêm yết của Z.ai là 0,15 USD cho mỗi triệu token đầu vào, 0,03 USD cho mỗi triệu token đầu vào được lưu cache và 0,50 USD cho mỗi triệu token đầu ra; chương trình khuyến mãi ra mắt kéo dài đến ngày 9 tháng 9 năm 2026 với mức giá 0,075 / 0,015 / 0,25 USD (mức giá do nhà cung cấp công bố, tính đến thời điểm viết bài). Đầu vào được lưu cache có giá chỉ bằng một phần năm đầu vào mới — đây là đòn bẩy chi phí lớn nhất: bất kỳ khối lượng công việc nào có tiền tố có thể tái sử dụng — lời nhắc hệ thống, định nghĩa công cụ, tài liệu dùng chung dài — đều nên tận dụng mức giá đọc cache.
Bài toán bộ nhớ nằm trong quyết định. Tự vận hành mô hình 320B nghĩa là bạn phải dành 112–320 GB bộ nhớ cho nó dù nó ở trạng thái nhàn rỗi hay bão hòa. Điểm cuối được lưu trữ chuyển toàn bộ điều đó ra khỏi máy của bạn, và với giá ưu đãi khi ra mắt, mô hình này có chi phí mỗi token thấp hơn nhiều mô hình chỉ bằng một phần mười kích thước của nó — đó chính là toàn bộ ý nghĩa của một MoE kích hoạt 18B.
Đây cũng là vị trí tự nhiên cho điểm định tuyến. Thông qua OrcaRouter, z-ai/glm-5.3-flash là một trong hơn 200 mô hình đứng sau một API duy nhất, được định giá theo giá niêm yết của nhà cung cấp với mức chênh lệch 0% — vì vậy chương trình khuyến mãi ra mắt và mọi đợt giảm giá trong tương lai đều có hiệu lực ngay trong ngày chúng được công bố. Chuyển đổi dự phòng tự động có nghĩa là một mô hình mới ra mắt ba ngày với đường dẫn phục vụ không ổn định không phải là một canh bạc cho hệ thống sản xuất của bạn: nếu nhà cung cấp gặp lỗi hoặc quá tải, yêu cầu sẽ được chuyển sang một nhà cung cấp hoạt động tốt thay vì thất bại. Thử nghiệm an toàn một mô hình chưa được kiểm chứng chính là mục đích của bộ định tuyến.

FAQ
Tôi có thể chạy GLM-5.3-Flash trên RTX 5090 không?
Không. Bản build nhỏ nhất đã chiếm ~102 GB chỉ riêng phần trọng số, trong khi RTX 5090 chỉ có 32 GB VRAM. Không một GPU tiêu dùng nào đạt đến mức đó; mô hình này cần Mac bộ nhớ hợp nhất, một chiếc H200 duy nhất, hoặc một server đa GPU.
18B active có nghĩa là GLM-5.3-Flash chạy được trên phần cứng tiêu dùng không?
Không. Con số 18B tham số hoạt động là mức tính toán cho mỗi token. Toàn bộ 320B tham số vẫn được giữ trong bộ nhớ, vì bộ định tuyến không thể biết token cần những expert nào cho đến khi nó nhìn thấy token đó. MoE tiết kiệm chi phí tính toán, chứ không tiết kiệm bộ nhớ.
Cách rẻ nhất để thử GLM-5.3-Flash là gì?
API được lưu trữ, z-ai/glm-5.3-flash. Với giá khuyến mãi ra mắt, chi phí là $0,075 cho mỗi triệu token đầu vào và token đầu vào được lưu trong bộ nhớ đệm có giá $0,015. Tự lưu trữ phiên bản nhỏ nhất đồng nghĩa với việc phải dành ~112 GB RAM cho nó, điều này chỉ hợp lý nếu bạn đã sẵn có phần cứng.
Nói tóm lại một cách thẳng thắn: GLM-5.3-Flash là mô hình cấp máy chủ trong mọi bản build. Mac 128 GB nhận được đúng một bản build phù hợp — 2bit-lite, với giới hạn bộ nhớ wired được nâng lên, ngữ cảnh ngắn, và mức đánh đổi chất lượng đã được ghi nhận khi xử lý mã dài. Một chiếc H200 duy nhất dùng cùng bản build với ~39 GB dư địa KV. Phần cứng máy chủ mới có đầy đủ nấc thang thực sự, từ 4-bit mặc định lên đến 6-bit gần như lossless. Và với tất cả những người còn lại — hầu hết độc giả — endpoint z-ai/glm-5.3-flash được lưu trữ là câu trả lời đúng, và những con số trên chính là lý do, không phải danh sách mua sắm. Để cài đặt từng bước trên MacBook Pro, hướng dẫn cài đặt MacBook của chúng tôi bao quát toàn bộ quy trình từ đầu đến cuối; để so sánh chất lượng giữa các bản build lượng tử hóa và biết khi nào nên dùng loại nào, hướng dẫn build MLX cung cấp chi tiết; và bài đưa tin về bản phát hành mang bối cảnh ra mắt cùng các tuyên bố điểm chuẩn.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
