一張適用於 Apple Silicon 上搭配 MLX 的 Qwen3.8-27B 的標題卡,顯示極簡筆電圖示、MLX 引擎徽章,以及寫著「免費」的價格標籤,就在你的 Mac 上。
Guides & Insights

Qwen3.8-27B 搭配 MLX 在 Apple Silicon 上:是的,它能運行——這裡是你真正需要的

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8 27B 現今可透過 MLX 在 Apple Silicon 上執行。其標籤為 qwen3.8:27b-mlx,在 Ollama 中,自 Ollama v0.32.12 起加入;4-bit 版的下載大小約為 18 GB,且需要約 16–19 GB 的統一記憶體——這使得配備 24 GB 以上記憶體的 Mac 是實際可行的最低門檻,而 16 GB 的 Mac 則不行。權重採用 Apache 2.0 授權,在你自己的硬體上使用時完全免費,而這正是這款模型的重點。Ali​baba 的發布至今才兩天(2026 年 8 月 13–14 日),因此以下每個數字都有標注:哪些來自 Ali​baba 的模型卡、哪些是我們今天在 Ollama 頁面上驗證的,以及哪些是第三方預測或實測結果。

30秒數據表

Qwen3.8 27B 是 Ali​baba 的稠密型 270 億參數模型,於 2026 年 8 月 13 日至 14 日以 Apache 2.0 授權釋出——權重於 13 日上架 Hugging Face 與 ModelScope,LICENSE 檔案則在隔天早晨出現。它是 2.4T 參數 Qwen3.8-Max 的可部署稠密姊妹模型。根據模型卡,以下皆為 Ali​baba 自行回報、尚未經獨立重現的內容:

規模 — 27B 密集參數,27.78B 總參數(計入視覺編碼器)。

架構 — 64 層,隱藏層大小 5,120,詞彙量 248,320。

混合注意力 — 16 個全注意力層加上 48 個 Gated DeltaNet 線性層,比例為 3:1。

上下文 — 原生 262,144 tokens,可透過 YaRN 擴展至 1M(Ollama 將此標籤列為 256K)。

輸入 — 在文字基礎上原生理解圖像與影片,從文件到小時級影片。

權重 — BF16 格式下為 55.6 GB,包含 MTP 推測解碼頭。

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

在 MLX 方面,今日已驗證: Ollama 提供了 qwen3.8:27b-mlx——一個專為 Apple Silicon 打造的 MLX 原生版本,約 18 GB 的 4-bit 下載——而 v0.32.12 的發布說明也特別提到 Apple Silicon 最佳化。 mlx-lm,這是 Apple 的 Python 工具鏈,支援該架構的生成與轉換;而 MLX 量化格式(3/5/6-bit,以及 MXFP4 和 NVFP4)在權重發布後數小時內就已出現。本文其餘內容假設你使用的是配備 24 GB 以上統一記憶體的 M 系列 Mac。

MLX 對記憶體做了哪些改變

在 Apple Silicon 上沒有獨立的 VRAM。MLX 運行於 M 系列晶片的統一記憶體池中,因此真正重要的數字是 Mac 的總 RAM 減去 macOS 及其他所有程式所佔用的記憶體。一個「能裝進 17 GB」的模型,需要一台記憶體容量遠超過這個數字的機器。

好消息是,Qwen3.8 27B 的持有成本比其參數量所暗示的更低。因為只有 16 個全注意力層會保留 KV 快取,而 48 個線性層不會,所以每個 token 的快取成本約為 64 KB,大約是傳統 64 層稠密模型所需成本的四分之一。在最極端的情況下,完整的 262K 視窗除了權重之外還需要約 16.4 GB 的快取,這屬於伺服器級別的預算,而非筆記型電腦級別的預算。

Mac 的實際可行階梯,檔案大小加上快取餘裕:

4-bit MLX — 總計約 16–19 GB。適用於 24 GB 的 Mac,約有 64K–96K 的上下文視窗;是合理的預設值。

6-bit MLX — 約 21–22 GB。32 GB 的機器;與 4-bit 相比,品質提升幅度不大。

8-bit MLX——約27–30 GB。需48 GB以上記憶體;近乎無損。

BF16 — 約 55.6 GB。僅限最高階的 M系列 Max 和 Ultra 工作室機型。

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

來源:4-bit 數值追蹤的是實測的 GGUF Q4_K_M(17.1 GB,unsloth,8月14日)與18 GB Ollama 下載量;8-bit 與 BF16 數值追蹤的是阿里巴巴自家的 BF16 卡與 Qwen3.6-27B 系列。每個 token 64 KB 的快取數值是從架構推導而來,並非規格表上印製的數值,且僅適用於像 MLX 那樣在線性層上跳過 KV 快取的執行環境。

三種執行方式,從最簡單到掌控度最高

路徑 A — Ollama,最簡單的方案

請升級至 Ollama 0.32.12 或更新版本,然後:

ollama pull qwen3.8:27b-mlx — 下載約 18 GB 的 MLX 版本。

ollama run qwen3.8:27b-mlx——已整合思考模板的互動式聊天。

ollama serve — 在 localhost:11434 上為你的應用程式提供與 OpenAI 相容的 API。

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

一個已知的問題,來自撰寫本文時一個尚未解決的 GitHub issue:qwen3.8:27b-mlx 在 /v1/responses 端點上拒絕「developer」角色,這會中斷 ollama launch codex在此模型上——而直接執行ollama run則運作正常。如果你正在 MLX 版本上建置類 Codex 的 agent 迴圈,請先測試你打算使用的確切端點,再讓整個迴圈依賴它。

路徑 B — mlx-lm,最具控制力

Apple 自家的工具包。使用 pip install mlx-lm 安裝它,然後要嘛拉取預先量化的 MLX 檢查點,要嘛自己轉換官方的 BF16 權重:

mlx_lm.generate --model <checkpoint> — 直接執行 checkpoint;社群對 27B 的 4-bit 和 8-bit 量化版本在發布後數天內仍持續上傳到 mlx-community。

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — 只需轉換一次;成本約為一次下載。

mlx_lm.server --model <checkpoint> — 與 OpenAI 相容的伺服器,會為您套用思考區塊聊天範本。

如果你想要的確切量化版本尚未上線,從官方權重自行轉換在任何 M 系列 Mac 上都是一項簡單快速的任務,也能消除對第三方所提供內容的任何疑慮。

路徑 C — LM Studio,一鍵安裝

LM Studio 在 Apple Silicon 上使用 MLX 後端,並在推出時就收錄了 Qwen3.8 27B:搜尋該模型,挑選符合你記憶體(RAM)容量的量化版本,它就會下載並執行。如果你偏好圖形介面(GUI),這是最容易上手的方式,而我們的配套教學會從頭到尾逐步帶領你完成——請參閱下方相關閱讀中的〈如何在本地執行 Qwen3.8 27B〉。

模板陷阱

Qwen3.8 27B 預設會進行思考,而思考區塊是由聊天模板(chat template)渲染的,並非模型核心。前 48 小時的第三方測試指出,官方模板會把每一輪助理回覆都包進思考區塊——即使是空的也一樣——而且在多輪代理迴圈中,這些區塊會互相嵌套,歷史紀錄會被截斷,讀起來就像失憶。這不是量化(quantization)的問題。如果執行環境提供了修正過的模板,請直接使用;當你在建構代理迴圈且不需要推理時,可以在每次請求中停用思考——聊天模板提供了 enable_thinking 旗標,而模型接受 xhigh、medium 或 low 的 reasoning_effort 設定。

實際感受是什麼

在配備 32 GB 統一記憶體的 Mac mini M4 上,使用 MLX 4-bit 版本進行獨立測試,測得的生成速度約為每秒 5–6 個 token。這個數字應該用來設定期望:對於互動式草稿、長篇推理和偶爾的代理呼叫來說很合適;但對於長時間的代理迴圈和批次作業來說則很痛苦。同一測試者的軼事——先進行長達數分鐘的思考,然後產生一個看起來正確但實際上加總不起來的小應用程式——正好提醒我們,筆電上的 27B 是一個有能力但並非萬無一失的助手。

{{1}}速度隨晶片等級提升:配備更多記憶體頻寬與核心的M系列Max,運行速度明顯比mini中的基本款M4更快。{{/1}}但{{2}}入門款的5–6 tok/s是誠實的基準{{/2}},你應該以此來判斷任何{{3}}「可在Apple Silicon上運行」的標題{{/3}}。

262K 上下文是伺服器端功能

Qwen3.8 27B 的原生 262K 視窗確實實用——但在 Mac 上,它受記憶體限制,而非模型本身。以每個 token 64 KB 的 KV 快取計算,8K 視窗約需 0.5 GB,32K 約 2 GB,128K 約 8 GB,而完整 262K 則在權重之外另需約 16.4 GB。在 24 GB 的機器上執行 4-bit,實際上限大約是 64K–96K tokens;要達到 128K+ 需要 32 GB+ 的機器,而完整視窗則需要一台統一記憶體幾乎全是快取的機器。請規劃你實際需要的上下文,並在執行時期設定中設定上限——模型會很滿意,你的 swap 檔也會保持安靜。

當 Apple Silicon 並非正解時

如果以下任何一項是您的工作負載,請改走其他路徑:

• 你有一部 8 GB 或 16 GB 的 Mac。4-bit 版本已經需要約 17 GB 的統一記憶體;低於這個容量就會用到交換(swap),模型將無法使用。這是最常見的單一失誤,而且再多的量化技巧也無法解決。

• 你需要完整的262K上下文視窗或1M YaRN擴展。那個KV預算是伺服器預算,不是筆記型電腦預算。

• 你是在服務他人。一台筆記型電腦只是一個座位;多人使用的吞吐量需要 GPU 主機或託管 API。

• 在長時間的代理迴圈中,你需要快速運作。5–6 tok/s 對人類跟讀來說夠用,但對子代理來說太慢。

The honest framing: Qwen3.8 27B 的賣點是,在你自己擁有的硬體上使用時完全免費——這與按 token 計費的 API 模型正好相反。這正是它不在 OrcaRouter 目錄中的原因(該目錄路由的是較早的 Qwen3.6/3.5-27B 世代,以及託管的 Qwe​n API 產品線)。對「免費本地部署」這個故事而言,我們是錯誤的工具,而這正是重點:當一個工作負載超出 Mac 的負荷時,替代方案是 GPU 主機、租用 GPU,或託管的 Qwe​n API——而不是一個恰巧收錄了這個特定 27B 的路由器。

底線

Qwen3.8 27B 在 Apple Silicon 上是真實的、優秀的,而且範圍明確狹窄。4-bit MLX 版本適合 24 GB 以上的 Mac,在 Ollama 中以 qwen3.8:27b-mlx 下載,每個 token 零成本,而且是第一款真正可用、能裝進筆電的 agent 級開源模型。取捨在於速度(M4 mini 上 5–6 tok/s)和上下文(除非記憶體足夠,否則請把它限制在遠低於 262K)。如果你有 24 GB 以上的 Mac,而且工作負載是 27B 能承擔的,這就是本週最好的免費本地模型。如果你有 16 GB 的 Mac,或需要生產級吞吐量,那它就不是——而替代方案是付費途徑,這完全是另一種決策。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube