Một thẻ tiêu đề cho Qwen3.8-27B với MLX trên Apple Silicon, hiển thị biểu tượng laptop tối giản với huy hiệu động cơ MLX và thẻ giá ghi chữ miễn phí, trên máy Mac của bạn.
Guides & Insights

Qwen3.8-27B với MLX trên Apple Silicon: Đúng vậy, nó chạy được — Đây là những gì bạn thực sự cần

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Qwen3.8 27B chạy trên Apple Silicon ngay hôm nay thông qua MLX. Thẻ là qwen3.8:27b-mlx trong Ollama, được thêm vào từ Ollama v0.32.12, và bản 4-bit tải về khoảng 18 GB và cần khoảng 16–19 GB bộ nhớ hợp nhất — khiến cho Mac từ 24 GB+ là mức tối thiểu thực tế và Mac 16 GB không thể. Trọng số được cấp phép Apache 2.0, miễn phí khi sử dụng trên phần cứng của bạn, đó chính là toàn bộ ý nghĩa của mô hình. Bản phát hành của Ali​baba mới có hai ngày (13–14 tháng 8, 2026), vì vậy mọi con số dưới đây đều được ghi chú: những gì từ thẻ mô hình của Ali​baba, những gì chúng tôi xác minh trên trang Ollama hôm nay, và những gì là dự đoán hoặc đo lường của bên thứ ba.

Bảng thông tin 30 giây

Qwen3.8 27B là mô hình dense 27 tỷ tham số của Alibaba, ra mắt vào ngày 13–14 tháng 8 năm 2026 theo giấy phép Apache 2.0 — trọng số được đăng tải lên Hugging Face và ModelScope vào ngày 13, còn tệp LICENSE xuất hiện vào sáng hôm sau. Đây là bản dense anh em có thể triển khai của Qwen3.8-Max 2,4 nghìn tỷ tham số. Theo thẻ mô hình, mọi số liệu do Alibaba công bố đều chưa được tái tạo độc lập.

Kích thước — mô hình dense 27B, tổng cộng 27,78B tham số tính cả bộ mã hóa thị giác.

Kiến trúc — 64 tầng, kích thước ẩn 5.120, từ vựng 248.320.

Chú ý lai — 16 lớp chú ý toàn phần cộng với 48 lớp tuyến tính Gated DeltaNet, tỷ lệ 3:1.

Ngữ cảnh — 262.144 token nguyên bản, có thể mở rộng lên 1M qua YaRN (Ollama liệt kê tag ở mức 256K).

Đầu vào — hiểu trực tiếp hình ảnh và video bên cạnh văn bản, từ tài liệu đến video dài hàng giờ.

Trọng số — 55.6 GB ở định dạng BF16, bao gồm cả đầu giải mã suy đoán MTP.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

Về phía MLX, đã xác minh hôm nay: Ollama phát hành qwen3.8:27b-mlx — một bản dựng gốc MLX cho Apple Silicon với dung lượng tải xuống ~18 GB 4-bit — và ghi chú phát hành v0.32.12 nêu rõ tối ưu hóa cho Apple Silicon. mlx-lm, bộ công cụ Python của Apple, hỗ trợ kiến trúc này cho việc sinh văn bản và chuyển đổi, và các bản lượng tử hóa MLX (3/5/6-bit, cùng MXFP4 và NVFP4) đã xuất hiện trong vòng vài giờ sau khi có các trọng số. Phần còn lại của bài viết này giả định một chiếc Mac dòng M với bộ nhớ thống nhất từ 24 GB trở lên.

MLX thay đổi điều gì về bộ nhớ

Trên Apple Silicon không có VRAM riêng biệt. MLX chạy trên bộ nhớ hợp nhất của dòng M, vì vậy con số quan trọng là tổng RAM trong máy Mac của bạn trừ đi phần mà macOS và mọi thứ khác đang chiếm giữ. Một mô hình "khớp trong 17 GB" cần một máy có dung lượng thoải mái hơn mức đó.

Tin tốt là Qwen3.8 27B có chi phí vận hành rẻ hơn so với con số tham số của nó. Vì chỉ có 16 lớp attention đầy đủ lưu giữ bộ đệm KV — còn 48 lớp tuyến tính thì không — chi phí bộ đệm khoảng 64 KB mỗi token, tức xấp xỉ một phần tư so với những gì một mô hình dense 64 lớp thông thường phải trả. Ở mức tối đa, toàn bộ cửa sổ 262K cần ~16.4 GB bộ đệm cộng với trọng số, một mức ngân sách dành cho máy chủ, chứ không phải laptop.

Bậc thang thực tế dành cho Mac: kích thước tệp cộng với khoảng trống bộ nhớ đệm.

4-bit MLX — tổng cộng ~16–19 GB. Phù hợp với Mac 24 GB với cửa sổ khoảng 64K–96K; lựa chọn mặc định hợp lý.

6-bit MLX — ~21–22 GB. 32 GB machines; the quality jump over 4-bit is modest.

8-bit MLX — ~27–30 GB. Máy từ 48 GB trở lên; gần như lossless.

BF16 — khoảng 55,6 GB. Chỉ các máy studio dòng M-series Max và Ultra cao cấp nhất.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

Nguồn số liệu: con số 4-bit bám sát GGUF Q4_K_M đã đo (17.1 GB, unsloth, ngày 14 tháng 8) và bản tải xuống 18 GB của Ollama; các con số 8-bit và BF16 bám sát thẻ BF16 của chính Ali​baba và dòng Qwen3.6-27B. Con số bộ đệm 64 KB mỗi token được suy ra từ kiến trúc, không được in trên bảng thông số kỹ thuật, và chỉ đúng với các runtime bỏ qua bộ đệm KV trên các lớp tuyến tính theo cách MLX làm.

Ba cách để chạy nó, từ đơn giản nhất đến kiểm soát nhiều nhất

Cách A — Ollama, đơn giản nhất

Nâng cấp lên Ollama 0.32.12 hoặc mới hơn, sau đó:

ollama pull qwen3.8:27b-mlx — tải về bản build MLX ~18 GB.

ollama run qwen3.8:27b-mlx — trò chuyện tương tác với mẫu suy nghĩ đã được thiết lập.

ollama serve — cung cấp API tương thích OpenAI trên localhost:11434 cho các ứng dụng của bạn.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

Một vấn đề đã biết, từ một issue GitHub còn mở tại thời điểm viết: qwen3.8:27b-mlx từ chối vai trò "developer" trên endpoint /v1/responses, điều này làm hỏng ollama launch codex cho mô hình này — trong khi trực tiếp ollama run hoạt động bình thường. Nếu bạn đang xây dựng một vòng lặp agent kiểu Codex trên bản MLX, hãy kiểm tra chính xác endpoint bạn định sử dụng trước khi đặt cược vòng lặp vào nó.

Đường dẫn B — mlx-lm, kiểm soát tối đa

Bộ công cụ riêng của Apple. Cài đặt nó bằng pip install mlx-lm, sau đó hoặc tải xuống checkpoint MLX đã được lượng tử hóa sẵn hoặc tự chuyển đổi các trọng số BF16 chính thức:

mlx_lm.generate --model <checkpoint>chạy trực tiếp một checkpoint; các bản lượng tử hóa 4-bit và 8-bit từ cộng đồng cho mô hình 27B vẫn đang được đăng tải lên mlx-community chỉ trong vài ngày sau khi phát hành.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — chỉ cần chuyển đổi một lần; tốn khoảng một lần tải xuống.

mlx_lm.server --model <checkpoint> — Máy chủ tương thích O​penAI tự động áp dụng mẫu chat dạng thinking-block cho bạn.

Nếu bản lượng tử hóa chính xác bạn muốn chưa có sẵn, việc chuyển đổi từ trọng số chính thức là một thao tác nhanh chóng trên mọi Mac dòng M và giúp loại bỏ mọi nghi ngờ về những gì bên thứ ba đã phát hành.

Cách C — LM Studio, một cú nhấp chuột

LM Studio sử dụng backend MLX trên Apple Silicon và đã hỗ trợ Qwen3.8 27B ngay khi phát hành: tìm kiếm mô hình, chọn một bản lượng tử hóa (quant) phù hợp với RAM của bạn, và nó sẽ tải về và chạy. Nếu bạn thích giao diện đồ họa, đây là con đường thân thiện nhất, và bài hướng dẫn đồng hành của chúng tôi bao quát toàn bộ quy trình từ đầu đến cuối — xem "Cách chạy Qwen3.8 27B cục bộ" trong các bài đọc liên quan bên dưới.

Cái bẫy template

Qwen3.8 27B mặc định có suy luận (thinking), và các khối think được hiển thị bởi chat template, không phải bởi lõi mô hình. Kiểm thử bên thứ ba trong 48 giờ đầu ghi nhận rằng template chính thức bao bọc mọi lượt trả lời của assistant trong một khối think — kể cả những khối rỗng — và trong các vòng lặp agent đa lượt, các khối này lồng vào nhau và lịch sử bị cắt ngắn, gây cảm giác như mất trí nhớ. Đây không phải lỗi lượng tử hóa. Nếu runtime đi kèm một template đã sửa, hãy dùng nó; khi bạn đang xây dựng vòng lặp agent và không cần suy luận, hãy tắt thinking theo từng yêu cầu — chat template hiển thị cờ enable_thinking, và mô hình nhận reasoning_effort ở mức xhigh, medium hoặc low.

Cảm giác thực sự như thế nào

Một bài kiểm tra độc lập trên {{1}}Mac mini M4{{/1}} với {{2}}32 GB bộ nhớ hợp nhất{{/2}}, chạy bản dựng {{3}}MLX 4-bit{{/3}}, đo được tốc độ sinh khoảng {{4}}5–6 token/giây{{/4}}. Đó là con số nên được dùng để đặt kỳ vọng: {{5}}phù hợp cho soạn thảo tương tác, suy luận dài hơi và các cuộc gọi agent thỉnh thoảng; khó chịu cho các vòng lặp agentic dài và các tác vụ hàng loạt{{/5}}. Giai thoại của cùng một người kiểm thử — {{6}}suy nghĩ nhiều phút rồi cho ra một ứng dụng nhỏ trông có vẻ đúng nhưng thực ra không cộng lại chính xác{{/6}} — là lời nhắc nhở tốt rằng {{7}}một mô hình 27B trên laptop là trợ lý có năng lực nhưng không phải là không thể sai sót{{/7}}.

Tốc độ tỷ lệ với phân khúc chip: một con chip M-series Max với băng thông bộ nhớ và số nhân cao hơn sẽ chạy nhanh hơn đáng kể so với M4 cơ bản trong bản mini. Nhưng 5–6 tok/s ở phiên bản khởi điểm là mức cơ sở trung thực, và bạn nên đánh giá mọi tiêu đề kiểu "chạy được trên Apple Silicon" dựa trên con số đó.

Context 262K là tính năng phía máy chủ.

Cửa sổ ngữ cảnh 262K nguyên bản của Qwen3.8 27B thực sự hữu ích — nhưng trên máy Mac, nó bị giới hạn bởi bộ nhớ, không phải bởi mô hình. Với 64 KB bộ đệm KV cho mỗi token, một cửa sổ 8K tốn khoảng 0,5 GB, 32K khoảng 2 GB, 128K khoảng 8 GB, và toàn bộ 262K khoảng 16,4 GB, ngoài trọng số. Trên một máy 24 GB chạy ở độ chính xác 4-bit, trần thực tế là khoảng 64K–96K token; muốn đạt tới 128K+ cần một máy 32 GB+, còn để dùng toàn bộ cửa sổ thì cần một máy có bộ nhớ hợp nhất gần như toàn bộ là bộ đệm. Hãy lên kế hoạch cho độ dài ngữ cảnh bạn thực sự cần và giới hạn nó trong cấu hình runtime — mô hình sẽ hoạt động tốt, và tệp hoán đổi của bạn sẽ không bị sử dụng.

Khi Apple Silicon là câu trả lời sai

Hãy đi theo một hướng khác nếu bất kỳ điều nào trong số này là khối lượng công việc của bạn:

• Bạn có một chiếc Mac 8 GB hoặc 16 GB. Bản build 4-bit đã cần ~17 GB bộ nhớ hợp nhất; ít hơn mức đó sẽ phải swap và mô hình trở nên không dùng được. Đây là sai lầm phổ biến nhất, và không có thủ thuật lượng tử hóa nào khắc phục được.

Bạn cần cửa sổ 262K đầy đủ hoặc bản mở rộng YaRN lên 1M. Ngân sách KV đó là ngân sách của máy chủ, không phải của laptop.

• Bạn đang phục vụ người khác. Một chiếc laptop chỉ là một chỗ ngồi; thông lượng đa người dùng cần một máy GPU hoặc một API được lưu trữ.

• Bạn cần di chuyển nhanh trên các vòng lặp tác tử dài. 5–6 tok/s là ổn cho một con người đọc theo, nhưng chậm đối với một tác tử phụ.

Cách diễn giải thẳng thắn: Lời chào hàng của Qwen3.8 27B là nó miễn phí khi sử dụng trên phần cứng bạn sở hữu — trái ngược với mô hình API tính phí theo token. Đó chính xác là lý do nó không nằm trong danh mục OrcaRouter (danh mục này định tuyến cho thế hệ Qwen3.6/3.5-27B trước đó và dòng API Qwe​n được lưu trữ). Chúng tôi là công cụ sai cho câu chuyện miễn phí-cục bộ, và đó chính là điểm mấu chốt: khi một khối lượng công việc vượt quá khả năng của Mac, các lựa chọn thay thế là một hộp GPU, GPU thuê, hoặc API Qwe​n được lưu trữ — không phải một bộ định tuyến tình cờ mang dòng 27B cụ thể này.

Kết luận

Qwen3.8 27B trên Apple Silicon là có thật, nó tốt, và phạm vi ứng dụng hẹp. Bản dựng MLX 4-bit phù hợp với Mac 24 GB+ RAM, tải về dưới tên qwen3.8:27b-mlx trong Ollama, không tốn phí mỗi token, và là mô hình mở cấp độ tác tử thực sự dùng được đầu tiên chạy vừa trên một chiếc laptop. Sự đánh đổi là tốc độ (5–6 tok/s trên M4 mini) và ngữ cảnh (giới hạn thấp hơn hẳn 262K trừ khi bạn có đủ RAM). Nếu bạn có Mac 24 GB+ và khối lượng công việc mà 27B có thể gánh vác, đây là mô hình địa phương miễn phí tốt nhất hiện có trong tuần này. Nếu bạn có Mac 16 GB hoặc cần thông lượng sản xuất, thì không phải vậy — và lựa chọn thay thế là một hướng trả phí, một quyết định hoàn toàn khác.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube