Thẻ tiêu đề chính cho bài viết 'Cách chạy GLM-5.3-Flash trên MacBook Pro' với phụ đề 'Cẩm nang MLX 2bit-Lite', minh họa một chiếc MacBook Pro cách điệu với họa tiết mạng nơ-ron mềm mại phía trên bàn phím và ba con chip được gắn nhãn '2bit-lite', '~102 GB' và '128 GB Mac'
Guides & Insights

Cách chạy GLM-5.3-Flash trên MacBook Pro: Sổ tay 2bit-Lite MLX

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Chạy GLM-5.3-Flash trên MacBook Pro nghĩa là chính xác một máy: một MacBook Pro M4/M5 Max 128 GB chạy bản 2bit-lite của bản chuyển đổi MLX của chúng tôi, với giới hạn bộ nhớ wired của macOS được nâng lên. Nếu MacBook Pro của bạn có dưới 128 GB — M4 Pro 36 GB, M4 Max 48 GB — thì playbook này không dành cho bạn; hãy chuyển đến phần cuối và định tuyến qua API z-ai/glm-5.3-flash được lưu trữ thay vào đó. GLM-5.3-Flash (trọng số tại zai-org/GLM-5.3-Flash) là mô hình Mixture-of-Experts 320 tỷ tham số của Z.ai với 18B tham số hoạt động trên mỗi token — phát hành ngày 26 tháng 8 năm 2026, GLM-​5 đa phương thức gốc đầu tiên — và ngay cả bản build nhỏ nhất của bản port MLX của chúng tôi cũng cần ~102 GB trọng số và ~112 GB bộ nhớ. Đó là toàn bộ thị trường, và chúng tôi sẽ không làm dịu đi điều đó.

Đây là tài liệu chính thức từ nhà sản xuất, không phải bài viết công bố: các trọng số bên dưới là bản dựng riêng của OrcaRouter (orcarouter/GLM-5.3-Flash-MLX, MIT), được tạo ra bằng phương pháp lượng tử hóa OrcaSAQ không cần hiệu chuẩn của chúng tôi. Chúng tôi đã phát hành nó vào ngày 26 tháng 8 và công khai điều chỉnh hướng đi vào ngày hôm sau, vì dải lượng tử hóa ban đầu không làm cho việc sử dụng MacBook Pro trở nên thực tế với hầu hết mọi người — bản dựng 2-bit thông thường vẫn cần khoảng 160 GB, mà không một chiếc laptop nào có. Vào ngày 27 tháng 8, chúng tôi đã xây dựng lại biến thể nhỏ nhất thành 2bit-lite cụ thể để phù hợp với MacBook Pro 128 GB, và bài viết này là lời tường thuật trung thực về những gì nó mang lại cho bạn và cái giá phải trả. Mọi con số được đánh dấu là ghi chú hiện trường bên dưới được đo trên một lần chạy xác minh với H200 duy nhất của chúng tôi; không có gì ở đây là benchmark của nhà cung cấp. Khi chúng tôi lặp lại thực hành của cộng đồng — lệnh wired-memory, phiên bản mlx-vlm — chúng tôi ghi rõ như vậy.

Bản dựng nào phù hợp với Mac nào (hãy đọc phần này trước khi tải bất cứ thứ gì)

Năm bản build trong repo đều tương ứng với một mức RAM tối thiểu. Trên MacBook Pro, câu hỏi "chọn build nào" chỉ có một câu trả lời duy nhất — mọi thứ trên 2bit-lite là chuyện của Mac Studio:

6-bit — ~296 GB trọng số / ~320 GB RAM / gần như lossless. Chỉ dành cho Mac Studio 512 GB.

4-bit — ~204 GB / ~224 GB / bản mặc định khuyến nghị của chúng tôi. Mac Studio 256 GB. Đây là những gì thư mục gốc của repo phản chiếu.

3-bit — ~184 GB / ~200 GB. Mac Studio 256 GB.

2-bit — ~145 GB / ~160 GB. Mac Studio 192 GB. Đây là bản build nhỏ nhất chúng tôi phát hành trong ngày đầu tiên, và đó là sai lầm.

2bit-lite — ~102 GB / ~112 GB. Bản dựng duy nhất phù hợp với máy 128 GB — MacBook Pro M4/M5 Max 128 GB, hoặc Mac Studio hoặc Mac mini 128 GB. Bất kỳ laptop Apple Silicon 128 GB nào (M3 Max trở lên) cũng tương tự, chỉ chậm hơn.

Cái bẫy ẩn trong cái thang đó: lệnh tải xuống mặc định của README sẽ kéo về bản build 4-bit (~204 GB), vốn là mặc định đúng cho máy 256 GB nhưng vô dụng trên laptop. Nếu bạn làm theo lệnh mặc định trên MacBook Pro, bạn sẽ nhận được một mô hình không thể phân bổ. Đường dẫn 2bit-lite yêu cầu một cách tường minh --include, được đề cập bên dưới.

Ngoài ra còn có một giới hạn cứng mà bạn sẽ chạm phải trước khi phép toán ở trên có thể áp dụng. macOS không cho phép một tiến trình chiếm toàn bộ bộ nhớ thống nhất của một chiếc Mac 128 GB; giới hạn GPU có thể sử dụng mặc định là khoảng 91–96 GB (được cộng đồng đảo ngược kỹ thuật và xác nhận trong nhiều bài viết về các thiết lập MLX cho mô hình lớn). Con số đó thấp hơn ~102 GB chỉ riêng trọng số, vì vậy ngay cả 2bit-lite cũng sẽ không tải được cho đến khi bạn nâng giới hạn bộ nhớ wired. Bước đó là bắt buộc, và nó nằm ở Phần 4.

Cài đặt mlx-vlm — và chỉ mlx-vlm

GLM-5.3-Flash là một mô hình thị giác-ngôn ngữ, vì vậy nó chạy bằng mlx-vlm, không phải mlx-lm. Đây là lỗi phổ biến nhất khiến mọi người mắc kẹt, vì vậy hãy nói rõ ngay từ đầu: mlx-lm dành cho các mô hình chỉ có văn bản; chạy một mô hình đa phương thức qua nó sẽ gây ra lỗi tải gây khó hiểu. Cài đặt gói VLM ở phiên bản 0.6.17 trở lên:

pip install -U "mlx-vlm>=0.6.17"

Việc khóa phiên bản không phải là trang trí. glm5_next — kiến trúc attention lai sparse-plus-linear đằng sau GLM-5.3-Flash — chỉ xuất hiện trong mlx-vlm vào đúng ngày mô hình được phát hành (26 tháng 8 năm 2026), và bất kỳ phiên bản cũ hơn sẽ không nhận ra cấu hình. Kiến trúc này quan trọng vì lý do thứ hai: đây là một cấu trúc liên kết hoàn toàn mới, và các bản chuyển thể đợt đầu có những lỗi về tính đúng đắn thực sự mà đầu ra mượt mà sẽ không bộc lộ. Một cuộc kiểm tra runtime cộng đồng trên đường dẫn MLX glm5_next ban đầu đã tìm và sửa bốn trong số đó — một clamp SwiGLU chưa được áp dụng trên mỗi khối FFN, các tensor siêu kết nối bị ràng buộc đa tạp được ép sang sai dtype (âm thầm làm hỏng ma trận trộn attention), hai sai lệch epsilon trong các chuẩn hóa attention, và logits router bf16 trong khi bản tham chiếu dùng float32. Sau các bản sửa, số liệu khớp với bản tham chiếu đến khoảng 1e-7. Bài học dành cho bạn: hãy cập nhật mlx-vlm, và hãy nghi ngờ bản phát hành đầu tiên của bất kỳ bản chuyển thể kiến trúc mới nào.

Tải các trọng số: các cờ loại trừ, và phần bao gồm mà bạn thực sự cần

Thư mục gốc của kho lưu trữ phản ánh bản build 4-bit và cả năm biến thể được phân phối dưới dạng các thư mục con. Lệnh mặc định tải xuống thư mục gốc và sử dụng --exclude để không có thư mục biến thể nào trong số năm thư mục (tổng cộng khoảng 800 GB) được tải kèm theo:

hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"

Trên MacBook Pro, lệnh đó không đúng với bạn — nó đưa cho bạn root 4-bit. Với laptop 128 GB, chỉ tải thư mục con 2bit-lite:

hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX

Đó là bản tải xuống ~102 GB, và nó khép kín — thư mục 2bit-lite/ tự mang theo config.json của riêng nó, vì vậy bạn trỏ trình tạo trực tiếp vào đó. Nếu hf không nằm trong PATH của bạn, hãy cài đặt nó: pip install -U huggingface_hub. Trước khi bắt đầu, hãy xác nhận bạn có ~110 GB dung lượng trống và rằng ổ cứng Mac của bạn không đang ở mức chỉ còn 100 GB trống cuối cùng — MLX ánh xạ bộ nhớ các trọng số, và một SSD gần đầy chính là cách các thiết lập này chết giữa lúc tải xuống.

Screenshot of the Hugging Face repository card for orcarouter/GLM-5.3-Flash-MLX showing the title, the tagline 'An MLX build of the official GLM-5.3-Flash — 2bit-lite / 2 / 3 / 4 / 6-bit OrcaSAQ quant for Apple Silicon & MLX', and the model tags glm5_next, Apple Silicon, quantized 2-8bit, Mixture of Experts, vision-language and MIT

Nâng giới hạn bộ nhớ wired — bước mà ai cũng quên

Đây là bước quyết định thành bại trên MacBook Pro 128 GB, và thẻ README giả định bạn đã biết điều đó thay vì viết rõ lệnh ra. Trần working-set Metal mặc định trên máy Mac 128 GB là khoảng 91–96 GB, thấp hơn mức ~102 GB trọng số 2bit-lite — nên nếu không có bước này, mô hình không thể cấp phát và quá trình tải sẽ chết. Giải pháp chuẩn của cộng đồng là một sysctl giúp nâng trần bộ nhớ wired của GPU, tính bằng megabyte:

sudo sysctl iogpu.wired_limit_mb=114688

Điều này đặt ra mức trần ~112 GB, chừa khoảng 14 GB làm vùng dự phòng cho hệ điều hành. Trên các máy 128 GB, các giá trị cộng đồng sử dụng thực tế dao động từ ~114688 (112 GB) đến ~122880 (120 GB); đừng đặt tối đa — macOS cần dư địa, nếu không bạn sẽ gặp tình trạng window-server bị giật và hệ thống bị khựng khi bộ nhớ chịu áp lực. Sau khi đặt giá trị, hãy nạp mô hình và theo dõi Activity Monitor: nếu áp lực bộ nhớ chuyển sang màu vàng, hãy giảm con số xuống.

Hai lưu ý thực tế, cả hai đều rút ra từ kinh nghiệm cộng đồng chứ không phải từ ghi chú thực địa của chúng tôi. Thứ nhất, sysctl sẽ bị đặt lại khi khởi động lại máy và chỉ áp dụng cho phiên terminal nơi bạn thiết lập nó, vì vậy hãy lên kế hoạch chạy lại lệnh này (hoặc dùng LaunchAgent để tự động hóa) — quên nó sau khi khởi động lại chính là lỗi kinh điển kiểu "hôm qua vẫn chạy được". Thứ hai, MLX cũng cung cấp một tham số điều chỉnh trong tiến trình, mlx.core.metal.set_wired_limit(bytes), trên macOS 15.0 trở lên; giá trị của nó phải nằm dưới mức trần của sysctl và đây là lựa chọn khả chuyển hơn nếu bạn đang viết kịch bản trong notebook. Dù bạn dùng cách nào, hiệu quả đều như nhau: không có nó, không gì ở đây chạy được.

Chạy nó: văn bản, hình ảnh và API Python.

Với các trọng số được thiết lập và giới hạn được nâng lên, việc tạo sinh chỉ cần một lệnh duy nhất.

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "Giải thích sự vướng víu lượng tử trong một câu." --max-tokens 256

Việc nhập hình ảnh cũng hoạt động theo cách tương tự khi sử dụng cờ --image — đây là lúc mô hình đa phương thức chứng tỏ giá trị của nó trên máy tính xách tay, vì tháp thị giác duy trì độ chính xác cao hơn trong bố cục OrcaSAQ:

python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "Mô tả hình ảnh này." --max-tokens 256

Đối với script, Python API có cùng cấu trúc như người dùng mlx-vlm đã biết:

from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "Mô tả hình ảnh này.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))

Giữ --max-tokensở mức vừa phải. Trong lần chạy ghi chú thực địa trên H200 của chúng tôi, 2bit-lite duy trì khoảng 10 tok/s, nên một câu trả lời 1.024 token đã đồng nghĩa với việc chờ đợi hai phút — và các đầu ra dài chính là nơi ngân sách KV và sự sụp đổ chất lượng gây ảnh hưởng (bên dưới). Trên máy tính xách tay, bạn nên kỳ vọng nó sẽ chậm hơn, chứ không nhanh hơn, cho đến khi có số liệu đo được.

{{KEEP}}Chất lượng thực tế bạn đang nhận được (thang đo đã được đo lường){{/KEEP}}

Đây là phần thật lòng của cuốn sổ tay, và chúng tôi sẽ không tô vẽ nó. OrcaSAQ suy giảm một cách duyên dáng xuống đến 3-bit, sau đó chi phí tăng vọt. So với tham chiếu FP8 (perplexity 2.7797):

6-bit — perplexity 2.7864 (+0.24%), tỷ lệ khớp token top-1 đạt 97.76%. Gần như không mất mát, đúng như quảng cáo.

4-bit — perplexity 2.8620 (+2,96%), top-1 96,13%. Giá trị mặc định được khuyến nghị.

3-bit — perplexity 3.0566 (+9.96%), top-1 92.06%. Mạnh tay nhưng vẫn dùng được.

2-bit — perplexity 4.3622 (+56.9%), top-1 86.56%. Một cái giá thực sự phải trả.

2bit-lite — perplexity 6.7018 (+141%), top-1 77.19%. Bản dựng nhỏ nhất và là bản duy nhất mà MacBook Pro có thể chạy được.

Đó là những con số đo được từ quy trình chuyển đổi của chính chúng tôi. 2bit-lite có độ suy giảm perplexity 141% và tỷ lệ khớp token top-1 dưới 78% — bạn đang chạy một mô hình bị suy giảm rõ rệt, và các chế độ lỗi bên dưới chính là biểu hiện của sự suy giảm đó trong thực tế. Đây là một bản demo xuất sắc và một trợ lý dạng ngắn hợp lý; nó không thể thay thế cho mô hình full-precision.

Về tốc độ, chúng tôi cũng phải thành thật với bạn như vậy. Bản ghi chú thực địa được công bố là H200: ~10 tok/s, ổn định khi hội thoại nhiều lượt, phù hợp cho hỏi đáp hàng ngày và văn bản ngắn. Chúng tôi vẫn chưa có số liệu đo được trên MacBook Pro cho bản 2bit-lite, và chúng tôi sẽ không tự bịa ra một con số — thông lượng trên Apple Silicon ở đây phụ thuộc vào băng thông bộ nhớ, điều kiện nhiệt, và mức độ bao phủ kernel MLX cho cơ chế attention lai, những yếu tố chúng tôi chưa đo lường cho bản build này trên chiếc laptop này. Điểm dữ liệu Apple Silicon gần nhất đã được công bố mà chúng tôi có thể chỉ cho bạn là con số ~450 tok/s độc lập cho bản build 4-bit GLM-5.3-Flash trên máy Mac 512 GB với một runtime MLX khác — một bản build khác, độ chính xác khác, và là một máy để bàn, nên cũng đừng coi đó là con số của bạn. Cứ đặt kỳ vọng là sẽ chậm; nếu không chậm thì đó là một bất ngờ thú vị.

KV cache và ngữ cảnh dài: chú ý khoảng trống

GLM-5.3-Flash quảng cáo ngữ cảnh lên tới 1 triệu token. Con số đó không có ý nghĩa trên phần cứng này, và một bài hướng dẫn giả vờ điều ngược lại sẽ gây bất lợi cho bạn. Lưu ý thực tế chỉ vỏn vẹn một dòng: cấp cho runtime đủ ngân sách KV cho độ dài mục tiêu của bạn. Trên một H200 duy nhất, 2bit-lite để lại khoảng 39 GB dung lượng trống cho KV cache sau khi tải trọng số. Trên MacBook Pro 128 GB, phép tính còn khắc nghiệt hơn: ~102 GB trọng số so với trần ~112 GB chỉ để lại khoảng 26 GB trước khi tính đến bộ nhớ làm việc của chính macOS — và các lớp attention tuyến tính lai khiến dung lượng KV của mô hình này nhỏ so với một mô hình dense cùng kích thước, nhưng nó vẫn tăng tuyến tính theo độ dài ngữ cảnh.

Hướng dẫn về phía phục vụ từ cộng đồng rộng lớn xác nhận quan điểm: một cấu hình tải tốt ở ngữ cảnh 8K có thể hết bộ nhớ ở 128K. Trên laptop, hãy giữ ngữ cảnh ngắn — vài nghìn token cho hỏi đáp hoặc một hình ảnh — và đừng cố cho nó đọc cả quyển sách. Ngay khi một khối lượng công việc thực sự cần ngữ cảnh dài, bạn đang ở phần cuối của bài viết này.

Việc tạo mã dài không đáng tin cậy ở 2bit-lite (hãy đọc điều này hai lần)

Đây là phần mà nếu thiếu nó, một bài hướng dẫn giấu đi các chế độ lỗi của mình sẽ trở nên vô giá trị, nên nó được đặt tiêu đề riêng. Các ghi chú thực địa H200 rất rõ ràng: các câu hỏi đáp thường ngày và văn bản ngắn cho kết quả tốt, còn việc tạo mã dài không đáng tin cậy ở mức độ chính xác này. Ba chế độ lỗi đã được tái hiện trong lần chạy xác minh của chúng tôi:

Vòng lặp lặp lại — mô hình bắt đầu lặp lại các dòng hoặc khối giống nhau thay vì tiến triển, thường là sau vài trăm token.

Thiếu mã kết nối — các phần import, kết nối và xử lý lỗi bị âm thầm loại bỏ. Hàm được tạo ra trông có vẻ đúng khi đứng riêng lẻ nhưng không chạy được, vì bộ khung xung quanh hoàn toàn không tồn tại.

Viết lại lan man — thay vì chỉnh sửa tối thiểu, mô hình viết lại các phần lớn của tệp và các lượt liên tiếp không nhất quán với kết quả của nhau.

Những điều này có thể tái tạo tại 2bit-lite, và chúng chính xác là những gì mà mức đồng thuận top-1 77% dự đoán. Những người thực hành vẫn giữ bản dựng laptop bên mình thực sự làm gì:

• Dùng nó để giải thích, tóm tắt, hỏi đáp và hiểu hình ảnh — công việc dạng ngắn mà nó thực sự làm tốt.

• Nếu bạn phải yêu cầu mã, hãy yêu cầu mỗi lần một hàm nhỏ với chữ ký tường minh, và xác minh từng hàm trước khi tiếp tục. Đừng đưa cho nó cả một tệp và yêu cầu một tính năng.

• Đối với bất cứ điều gì dài — một mô-đun đầy đủ, một lần tái cấu trúc, một phiên agent dài — hãy định tuyến đến API có độ chính xác đầy đủ. Đó không phải là một cách xử lý tạm thời; đó là kiến trúc đúng đắn, và đó là phần cuối cùng.

Khi nào không nên làm điều này: hãy gọi z-ai/glm-5.3-flash thay vào đó

Comparison scoreboard titled 'GLM-5.3-Flash on a Mac — the scoreboard' contrasting the 2bit-lite MLX local build (102 GB weights on disk, 112 GB minimum RAM, +141% perplexity vs FP8, 77.19% top-1 agreement, unreliable long code generation, ~10 tok/s per H200 field note) against the hosted z-ai/glm-5.3-flash API (0 GB on disk, no RAM, FP8 reference quality, reliable long code, datacenter speed), with a footer noting quality is measured by OrcaRouter, speed is an H200 field note, and the API is at Z.ai launch pricing

Quy tắc quyết định trung thực: chỉ chạy 2bit-lite trên MacBook Pro M4/M5 Max 128 GB khi bạn thực sự muốn một mô hình đa phương thức 320B trên một chiếc laptop bạn có thể mang theo — hỏi đáp ngoại tuyến, tài liệu riêng tư, hiểu hình ảnh mà không có gì rời khỏi máy. Chọn API cho mọi thứ khác:

Mọi MacBook Pro dưới 128 GB — không có bản dựng nào dành cho bạn. Đừng cố tải nó; hãy dùng API.

Sinh mã dài hoặc suy luận ngữ cảnh dài — 2bit-lite chắc chắn thất bại đúng ở điểm này. Hãy sử dụng API.

Công việc nhạy cảm về chất lượng — 77.19% top-1 agreement và +141% perplexity là sự sụt giảm thực sự, không phải lỗi làm tròn. Hãy sử dụng API.

Thông lượng đảm bảo hoặc độ trễ dự đoán được — chưa có số liệu đo trên laptop và ghi nhận thực tế là 10 tok/s. Hãy sử dụng API.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash showing the model ID, 'by Z.ai - 2026-08-26', a 1M-token context window, text plus image plus video in / text out, 320B total / 18B active parameters, and the input/output price of $0.07 / $0.25 per million tokens

Mô hình được lưu trữ là z-ai/glm-5.3-flash, được phục vụ với độ chính xác đầy đủ trên OrcaRouter với mức giá hiện tại của Z.ai — $0.07 cho mỗi triệu token đầu vào và $0.25 cho mỗi triệu token đầu ra tính đến thời điểm viết bài (giá giai đoạn ra mắt; giá niêm yết công khai của Z.ai là $0.15 / $0.50). Đó là giá do nhà cung cấp công bố và được chuyển qua không cộng thêm phí (0% markup), vì vậy nếu Z.ai giảm giá, điều đó sẽ được phản ánh ngay trong ngày ở phía chúng tôi. Bạn có một khóa API duy nhất và khóa này cũng truy cập được hơn 200 mô hình khác mà chúng tôi định tuyến, và cơ chế chuyển đổi dự phòng tự động có nghĩa là thử nghiệm với mô hình mới này sẽ không khiến quy trình sản xuất của bạn phụ thuộc vào một nhà cung cấp duy nhất. Trong cùng khoảng thời gian cần để tải xuống 102 GB và chờ đợi lần tạo sinh đầu tiên chậm chạp, API đã trả lời được lượng câu hỏi của cả một tuần — và nó trả lời với độ chính xác đầy đủ.

Suy luận cục bộ đáng giá khi lý do là cục bộ — quyền riêng tư, làm việc ngoại tuyến, không giới hạn tốc độ, một bản demo chạy bằng pin. Về mặt chi phí hay chất lượng, nó không đáng giá vì bất kỳ lý do nào khác, và hoàn toàn không đáng giá trên một máy có dưới 128 GB.

Câu hỏi thường gặp

Máy Mac 64 GB hoặc 96 GB có thể chạy GLM-5.3-Flash cục bộ không?Không. Bản build nhỏ nhất, 2bit-lite, cần tối thiểu khoảng 112 GB sau khi tính cả phần overhead của macOS, và ngay cả máy 128 GB cũng phải nâng giới hạn bộ nhớ wired mới tải được. Nếu Mac của bạn dưới 128 GB, không tồn tại phương án chạy cục bộ; thay vào đó, hãy gọi z-ai/glm-5.3-flash qua API.

Tôi đã cài mlx-vlm và model không tải được — vấn đề là gì? Hai nguyên nhân thường gặp, theo thứ tự: phiên bản thấp hơn 0.6.17, phiên bản này có trước khi hỗ trợ glm5_next và sẽ không nhận diện được kiến trúc; và giới hạn bộ nhớ wired chưa được tăng lên, vì bản build ~102 GB không thể cấp phát dưới trần Metal mặc định ~91–96 GB trên Mac 128 GB. Khắc phục cả hai (nâng cấp gói, chạy sysctl) và nó sẽ tải được.

Bản dựng 2bit-lite cục bộ có phải cùng một mô hình với API z-ai/glm-5.3-flash không? Có cùng trọng số GLM-5.3-Flash cơ bản, nhưng chất lượng không giống nhau. 2bit-lite là bản lượng tử hóa 2-bit với mức khớp token top-1 là 77.19% so với tham chiếu FP8, và việc sinh mã dài không đáng tin cậy. API phục vụ độ chính xác đầy đủ. Chúng chỉ có thể thay thế cho nhau trong các tác vụ ngắn, chấp nhận được về chất lượng.

Phiên bản 30 giây

Một máy, một bản dựng, một sysctl bắt buộc. Nếu bạn có MacBook Pro M4/M5 Max 128 GB: hãy cài đặt mlx-vlm>=0.6.17, chỉ tải về 2bit-lite/ (~102 GB), tăng giới hạn bộ nhớ wired với sudo sysctl iogpu.wired_limit_mb=114688, và chạy mlx_vlm.generate — để hỏi đáp, văn bản ngắn và hình ảnh. Hãy chấp nhận rằng việc tạo mã nguồn dài không đáng tin cậy ở độ chính xác này, rằng vẫn chưa có số liệu đo đạc về thông lượng trên máy tính xách tay, và rằng Mac 128 GB là mức tối thiểu, không phải tiêu chuẩn. Nếu bất kỳ cảnh báo nào trong số đó là trở ngại — hoặc Mac của bạn dưới 128 GB — chính mô hình đó ở độ chính xác đầy đủ chỉ cách một lệnh gọi API trên z-ai/glm-5.3-flash.

Not on a 128 GB Mac? z-ai/glm-5.3-flash serves the same model at full precision on OrcaRouter — one API key, provider pricing passed through at 0% markup, and no 102 GB download.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube