一张用于在 Apple Silicon 上搭配 MLX 运行 Qwen3.8-27B 的标题卡片,展示了一个极简风格的笔记本电脑图标,带有 MLX 引擎徽章,以及一个写着“免费”的价格标签,就在你的 Mac 上。
Guides & Insights

Qwen3.8-27B 与 MLX 在 Apple Silicon 上:确实能跑 — 这才是你真正需要的

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8 27B 现已通过 MLX 在 Apple Silicon 上运行。对应的标签是 qwen3.8:27b-mlx,位于 Ollama 中,自 Ollama v0.32.12 起添加。4-bit 构建的下载大小约为 18 GB,需要约 16–19 GB 的统一内存——这意味着 24 GB 以上内存的 Mac 才是现实的门槛,而 16 GB 内存的 Mac 则无法运行。权重采用 Apache 2.0 许可,在你自己的硬件上使用时完全免费,这正是该模型的全部意义。Ali​baba 发布至今仅两天(2026 年 8 月 13–14 日),因此下文每个数字都有明确标注:哪些来自 Ali​baba 的模型卡,哪些是我们今天在 Ollama 页面上验证的,哪些是第三方预测或测量结果。

30秒速览

Qwen3.8 27B 是阿里巴巴的稠密型 270 亿参数模型,于 2026 年 8 月 13 日至 14 日在 Apache 2.0 许可下发布——权重于 13 日上线 Hugging Face 和 ModelScope,LICENSE 文件于次日早上出现。它是 2.4T 参数 Qwen3.8-Max 的可部署稠密兄弟模型。根据模型卡,所有数据均为 Ali​baba 自行报告,尚未经独立复现:

大小 — 27B 稠密参数,计入视觉编码器后总参数为 27.78B。

架构 — 64层,隐藏大小5,120,词表248,320。

混合注意力 — 16个全注意力层加上48个Gated DeltaNet线性层,比例为3:1。

上下文 — 原生支持 262,144 个 token,可通过 YaRN 扩展至 1M(Ollama 将该标签列为 256K)。

输入 — 在文本基础上原生支持图像和视频理解,从文档到小时级视频。

权重 — 55.6 GB(BF16 格式),包含 MTP 推测解码头。

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

在 MLX 方面,今天已确认:Ollama 提供了 qwen3.8:27b-mlx——这是面向 Apple Silicon 的 MLX 原生构建,4-bit 下载大小约为 18 GB——并且 v0.32.12 的发布说明特别提到了 Apple Silicon 优化。mlx-lm 是 Apple 的 Python 工具链,支持该架构的生成和转换,MLX 量化(3/5/6-bit,以及 MXFP4 和 NVFP4)在权重发布后数小时内即已出现。本文其余部分假设使用配备 24 GB 或以上统一内存的 M 系列 Mac。

MLX 对内存做了哪些改变

{{1}}在 Apple Silicon 上没有独立的 VRAM。{{/1}}{{2}}MLX 运行在 M 系列统一内存池上,因此真正重要的数字是 Mac 的总内存减去 macOS 及其他一切所占用的部分。{{/2}}一个 {{3}}“适配 17 GB”{{/3}} 的模型,需要一台内存远比这充裕的机器。

好消息是,Qwen3.8 27B 的存储成本比其参数数量所暗示的要低。由于只有16个全注意力层保留 KV 缓存——48个线性层不保留——缓存成本约为每 token 64 KB,大约是传统64层密集模型所需成本的四分之一。在极限情况下,完整的262K窗口除了权重之外还需要约16.4 GB的缓存,这属于服务器级预算,而非笔记本电脑级预算。

Mac 的现实标准,即文件大小加上缓存余量:

4-bit MLX:总计约 16–19 GB,可适配 24 GB 的 Mac(约 64K–96K 上下文窗口),是合理的默认选择。

6-bit MLX — 约 21–22 GB。适用于 32 GB 机器;与 4-bit 相比,质量提升有限。

8-bit MLX — 约 27–30 GB。48 GB 及以上内存;接近无损。

BF16 — 约 55.6 GB。只有顶配的 M 系列 Max 和 Ultra Mac Studio 机型才支持。

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

数据来源:4-bit 数据对应实测的 GGUF Q4_K_M(17.1 GB,unsloth,8月14日)以及 18 GB 的 Ollama 下载;8-bit 和 BF16 数据对应阿里巴巴自家的 BF16 卡和 Qwen3.6-27B 系列。每 token 64 KB 的缓存数据是根据架构推导得出的,并非印在规格表上,并且仅适用于像 MLX 那样在线性层上跳过 KV 缓存的运行时。

运行它的三种方式,从最简单到最可控

路径 A — Ollama,最简单的

升级到 Ollama 0.32.12 或更新版本,然后:

ollama pull qwen3.8:27b-mlx — 下载约 18 GB 的 MLX 构建版本。

ollama run qwen3.8:27b-mlx — 已接入思考模板的交互式聊天。

ollama serve — 在 localhost:11434 上为你的应用提供兼容 OpenAI 的 API。

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

一个已知的小毛病(出自写作时仍活跃的 GitHub issue):qwen3.8:27b-mlx 在 /v1/responses 端点上拒绝“developer”角色,这会使ollama launch codex对此模型失效——而直接使用ollama run则正常。如果你正在基于 MLX 构建 Codex 风格的智能体循环,在把循环押注于它之前,请先测试你计划使用的确切端点。

路径 B — mlx-lm,控制力最强

苹果自家的工具包。使用以下命令安装:pip install mlx-lm,然后要么拉取预量化的 MLX 检查点,要么自行转换官方的 BF16 权重:

mlx_lm.generate --model <checkpoint> — 直接运行检查点;社区为 27B 制作的 4 位和 8 位量化版本在发布后数天内仍持续上传至 mlx-community。

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 —— 转换一次;成本约等于一次下载。

mlx_lm.server --model <checkpoint>—兼容 OpenAI 的服务器,可为您应用思维块聊天模板。

如果你想要的确切量化版本还没出来,在任何M系列Mac上从官方权重转换都很简单,并且能消除对第三方所提供内容的任何疑虑。

路径 C — LM Studio,一键式

LM Studio 在 Apple Silicon 上使用 MLX 后端,并在发布时支持了 Qwen3.8 27B:搜索该模型,选择一个适合你内存的量化版本,即可下载并运行。如果你更喜欢 GUI,这是最友好的方式,我们的配套指南会从头到尾覆盖整个过程——见下方相关阅读中的“How to Run Qwen3.8 27B Locally”。

模板陷阱

Qwen3.8 27B 默认会进行思考,思考块由聊天模板渲染,而非模型核心。发布后头 48 小时的第三方测试指出,官方模板会将每一轮助手回复都包裹进思考块中——即使是空回复也一样——而且在多轮智能体循环中,块会嵌套、历史记录会被截断,读起来就像失忆。这不是量化造成的。如果某个运行时提供了修正后的模板,请使用它;当你在构建智能体循环且不需要推理时,可按请求禁用思考——聊天模板暴露了 enable_thinking 标志,模型的 reasoning_effort 可设为 xhigh、medium 或 low。

它的真实感受是怎样的

一项在配备 32 GB 统一内存的 Mac mini M4 上独立进行的测试,运行 MLX 4-bit 构建版本,测得生成速度约为 5–6 tokens/s。这个数字应当用来设定预期:对交互式起草、长文推理和偶尔的智能体调用来说足够好用;对长时间的智能体循环和批处理任务来说则会令人痛苦。同一位测试者的轶事——模型思考了好几分钟,随后生成的小应用看起来没问题但实际上计算对不上——是一个很好的提醒:笔记本电脑上的 27B 模型是一个有能力但并非万无一失的助手。

速度随芯片级别而提升:拥有更多内存带宽和核心的 M 系列 Max 运行速度明显快于 mini 中的基础款 M4。但入门款上的 5–6 tok/s 才是诚实的基线,任何宣称“可在 Apple Silicon 上运行”的标题都应以此作为衡量标准。

262K 上下文是一项服务器功能。

Qwen3.8 27B 的原生 262K 上下文窗口确实实用——但在 Mac 上,限制因素在于内存,而不是模型本身。按照每个 token 64 KB 的 KV 缓存计算,8K 窗口大约占用 0.5 GB,32K 大约 2 GB,128K 大约 8 GB,而完整的 262K 除了权重之外还要占用约 16.4 GB。在 24 GB 内存、运行 4-bit 量化的机器上,实际上限大约在 64K–96K tokens 之间;要达到 128K+ 需要 32 GB+ 内存的机器,而要跑满完整窗口,则需要一台统一内存大部分被缓存占用的机器。请规划你实际需要的上下文长度,并在运行时配置中设置上限——这样模型运行顺畅,你的交换文件也能保持安静。

当 Apple Silicon 是错误答案时

如果以下任何一项是您的工作负载,请另辟蹊径:

• 你有一台 8 GB 或 16 GB 的 Mac。4-bit 版本已经需要约 17 GB 的统一内存;低于此容量就会发生交换(swap),模型将无法使用。这是最常见的误区,再多的量化技巧也无法解决。

你需要完整的262K上下文窗口,或者1M YaRN扩展。那个KV预算是服务器级别的预算,不是笔记本电脑级别的预算。

• 你在为其他人提供服务。笔记本电脑只是一个座位;多用户吞吐量需要GPU机箱或托管API。

在长智能体循环中,你需要快速推进。5–6 tok/s 对人类跟读来说没问题,但对子代理来说则太慢了。

坦诚地说:Qwen3.8 27B 的卖点在于,它在你自己的硬件上使用时是免费的——这与按 token 收费的 API 模型正好相反。这正是它不在 OrcaRouter 目录中的原因(该目录路由的是早期的 Qwen3.6/3.5-27B 系列以及托管的 Qwe​n API 产品线)。对于免费本地部署这个方向,我们是用错工具了,而这就是重点:当一个工作负载超出了 Mac 的能力范围时,替代方案是 GPU 主机、租用 GPU 或托管的 Qwe​n API——而不是一个恰好支持这个特定 27B 的路由器。

底线

Qwen3.8 27B 在 Apple Silicon 上是真的,表现不错,但适用面很窄。4-bit MLX 构建适配 24 GB 以上的 Mac,在 Ollama 中以下载名 qwen3.8:27b-mlx 获取,每个 token 零成本,是第一款真正可用、达到智能体级别且能装进笔记本电脑的开源模型。代价是速度(M4 mini 上约 5–6 tok/s)和上下文长度(除非内存充足,否则请远设在 262K 以下)。如果你有一台 24 GB+ 的 Mac,且工作负载是 27B 能承担的,那这就是本周最好的免费本地模型。如果你只有 16 GB 的 Mac,或需要生产级吞吐量,那它就不适合——而替代方案是付费路径,这完全是另一个决策。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube