
Qwen3.8-27B 与 MLX 在 Apple Silicon 上:确实能跑 — 这才是你真正需要的
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 217 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Qwen3.8 27B 现已通过 MLX 在 Apple Silicon 上运行。对应的标签是 qwen3.8:27b-mlx,位于 Ollama 中,自 Ollama v0.32.12 起添加。4-bit 构建的下载大小约为 18 GB,需要约 16–19 GB 的统一内存——这意味着 24 GB 以上内存的 Mac 才是现实的门槛,而 16 GB 内存的 Mac 则无法运行。权重采用 Apache 2.0 许可,在你自己的硬件上使用时完全免费,这正是该模型的全部意义。Alibaba 发布至今仅两天(2026 年 8 月 13–14 日),因此下文每个数字都有明确标注:哪些来自 Alibaba 的模型卡,哪些是我们今天在 Ollama 页面上验证的,哪些是第三方预测或测量结果。
30秒速览
Qwen3.8 27B 是阿里巴巴的稠密型 270 亿参数模型,于 2026 年 8 月 13 日至 14 日在 Apache 2.0 许可下发布——权重于 13 日上线 Hugging Face 和 ModelScope,LICENSE 文件于次日早上出现。它是 2.4T 参数 Qwen3.8-Max 的可部署稠密兄弟模型。根据模型卡,所有数据均为 Alibaba 自行报告,尚未经独立复现:
• 大小 — 27B 稠密参数,计入视觉编码器后总参数为 27.78B。
• 架构 — 64层,隐藏大小5,120,词表248,320。
• 混合注意力 — 16个全注意力层加上48个Gated DeltaNet线性层,比例为3:1。
• 上下文 — 原生支持 262,144 个 token,可通过 YaRN 扩展至 1M(Ollama 将该标签列为 256K)。
• 输入 — 在文本基础上原生支持图像和视频理解,从文档到小时级视频。
• 权重 — 55.6 GB(BF16 格式),包含 MTP 推测解码头。

在 MLX 方面,今天已确认:Ollama 提供了 qwen3.8:27b-mlx——这是面向 Apple Silicon 的 MLX 原生构建,4-bit 下载大小约为 18 GB——并且 v0.32.12 的发布说明特别提到了 Apple Silicon 优化。mlx-lm 是 Apple 的 Python 工具链,支持该架构的生成和转换,MLX 量化(3/5/6-bit,以及 MXFP4 和 NVFP4)在权重发布后数小时内即已出现。本文其余部分假设使用配备 24 GB 或以上统一内存的 M 系列 Mac。
MLX 对内存做了哪些改变
{{1}}在 Apple Silicon 上没有独立的 VRAM。{{/1}}{{2}}MLX 运行在 M 系列统一内存池上,因此真正重要的数字是 Mac 的总内存减去 macOS 及其他一切所占用的部分。{{/2}}一个 {{3}}“适配 17 GB”{{/3}} 的模型,需要一台内存远比这充裕的机器。
好消息是,Qwen3.8 27B 的存储成本比其参数数量所暗示的要低。由于只有16个全注意力层保留 KV 缓存——48个线性层不保留——缓存成本约为每 token 64 KB,大约是传统64层密集模型所需成本的四分之一。在极限情况下,完整的262K窗口除了权重之外还需要约16.4 GB的缓存,这属于服务器级预算,而非笔记本电脑级预算。
Mac 的现实标准,即文件大小加上缓存余量:
• 4-bit MLX:总计约 16–19 GB,可适配 24 GB 的 Mac(约 64K–96K 上下文窗口),是合理的默认选择。
• 6-bit MLX — 约 21–22 GB。适用于 32 GB 机器;与 4-bit 相比,质量提升有限。
• 8-bit MLX — 约 27–30 GB。48 GB 及以上内存;接近无损。
• BF16 — 约 55.6 GB。只有顶配的 M 系列 Max 和 Ultra Mac Studio 机型才支持。

数据来源:4-bit 数据对应实测的 GGUF Q4_K_M(17.1 GB,unsloth,8月14日)以及 18 GB 的 Ollama 下载;8-bit 和 BF16 数据对应阿里巴巴自家的 BF16 卡和 Qwen3.6-27B 系列。每 token 64 KB 的缓存数据是根据架构推导得出的,并非印在规格表上,并且仅适用于像 MLX 那样在线性层上跳过 KV 缓存的运行时。
运行它的三种方式,从最简单到最可控
路径 A — Ollama,最简单的
升级到 Ollama 0.32.12 或更新版本,然后:
• ollama pull qwen3.8:27b-mlx — 下载约 18 GB 的 MLX 构建版本。
• ollama run qwen3.8:27b-mlx — 已接入思考模板的交互式聊天。
• ollama serve — 在 localhost:11434 上为你的应用提供兼容 OpenAI 的 API。

一个已知的小毛病(出自写作时仍活跃的 GitHub issue):qwen3.8:27b-mlx 在 /v1/responses 端点上拒绝“developer”角色,这会使ollama launch codex对此模型失效——而直接使用ollama run则正常。如果你正在基于 MLX 构建 Codex 风格的智能体循环,在把循环押注于它之前,请先测试你计划使用的确切端点。
路径 B — mlx-lm,控制力最强
苹果自家的工具包。使用以下命令安装:pip install mlx-lm,然后要么拉取预量化的 MLX 检查点,要么自行转换官方的 BF16 权重:
• mlx_lm.generate --model <checkpoint> — 直接运行检查点;社区为 27B 制作的 4 位和 8 位量化版本在发布后数天内仍持续上传至 mlx-community。
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 —— 转换一次;成本约等于一次下载。
• mlx_lm.server --model <checkpoint>—兼容 OpenAI 的服务器,可为您应用思维块聊天模板。
如果你想要的确切量化版本还没出来,在任何M系列Mac上从官方权重转换都很简单,并且能消除对第三方所提供内容的任何疑虑。
路径 C — LM Studio,一键式
LM Studio 在 Apple Silicon 上使用 MLX 后端,并在发布时支持了 Qwen3.8 27B:搜索该模型,选择一个适合你内存的量化版本,即可下载并运行。如果你更喜欢 GUI,这是最友好的方式,我们的配套指南会从头到尾覆盖整个过程——见下方相关阅读中的“How to Run Qwen3.8 27B Locally”。
模板陷阱
Qwen3.8 27B 默认会进行思考,思考块由聊天模板渲染,而非模型核心。发布后头 48 小时的第三方测试指出,官方模板会将每一轮助手回复都包裹进思考块中——即使是空回复也一样——而且在多轮智能体循环中,块会嵌套、历史记录会被截断,读起来就像失忆。这不是量化造成的。如果某个运行时提供了修正后的模板,请使用它;当你在构建智能体循环且不需要推理时,可按请求禁用思考——聊天模板暴露了 enable_thinking 标志,模型的 reasoning_effort 可设为 xhigh、medium 或 low。
它的真实感受是怎样的
一项在配备 32 GB 统一内存的 Mac mini M4 上独立进行的测试,运行 MLX 4-bit 构建版本,测得生成速度约为 5–6 tokens/s。这个数字应当用来设定预期:对交互式起草、长文推理和偶尔的智能体调用来说足够好用;对长时间的智能体循环和批处理任务来说则会令人痛苦。同一位测试者的轶事——模型思考了好几分钟,随后生成的小应用看起来没问题但实际上计算对不上——是一个很好的提醒:笔记本电脑上的 27B 模型是一个有能力但并非万无一失的助手。
速度随芯片级别而提升:拥有更多内存带宽和核心的 M 系列 Max 运行速度明显快于 mini 中的基础款 M4。但入门款上的 5–6 tok/s 才是诚实的基线,任何宣称“可在 Apple Silicon 上运行”的标题都应以此作为衡量标准。
262K 上下文是一项服务器功能。
Qwen3.8 27B 的原生 262K 上下文窗口确实实用——但在 Mac 上,限制因素在于内存,而不是模型本身。按照每个 token 64 KB 的 KV 缓存计算,8K 窗口大约占用 0.5 GB,32K 大约 2 GB,128K 大约 8 GB,而完整的 262K 除了权重之外还要占用约 16.4 GB。在 24 GB 内存、运行 4-bit 量化的机器上,实际上限大约在 64K–96K tokens 之间;要达到 128K+ 需要 32 GB+ 内存的机器,而要跑满完整窗口,则需要一台统一内存大部分被缓存占用的机器。请规划你实际需要的上下文长度,并在运行时配置中设置上限——这样模型运行顺畅,你的交换文件也能保持安静。
当 Apple Silicon 是错误答案时
如果以下任何一项是您的工作负载,请另辟蹊径:
• 你有一台 8 GB 或 16 GB 的 Mac。4-bit 版本已经需要约 17 GB 的统一内存;低于此容量就会发生交换(swap),模型将无法使用。这是最常见的误区,再多的量化技巧也无法解决。
你需要完整的262K上下文窗口,或者1M YaRN扩展。那个KV预算是服务器级别的预算,不是笔记本电脑级别的预算。
• 你在为其他人提供服务。笔记本电脑只是一个座位;多用户吞吐量需要GPU机箱或托管API。
在长智能体循环中,你需要快速推进。5–6 tok/s 对人类跟读来说没问题,但对子代理来说则太慢了。
坦诚地说:Qwen3.8 27B 的卖点在于,它在你自己的硬件上使用时是免费的——这与按 token 收费的 API 模型正好相反。这正是它不在 OrcaRouter 目录中的原因(该目录路由的是早期的 Qwen3.6/3.5-27B 系列以及托管的 Qwen API 产品线)。对于免费本地部署这个方向,我们是用错工具了,而这就是重点:当一个工作负载超出了 Mac 的能力范围时,替代方案是 GPU 主机、租用 GPU 或托管的 Qwen API——而不是一个恰好支持这个特定 27B 的路由器。
最重要的一点
Qwen3.8 27B 在 Apple Silicon 上是真的,表现不错,但适用面很窄。4-bit MLX 构建适配 24 GB 以上的 Mac,在 Ollama 中以下载名 qwen3.8:27b-mlx 获取,每个 token 零成本,是第一款真正可用、达到智能体级别且能装进笔记本电脑的开源模型。代价是速度(M4 mini 上约 5–6 tok/s)和上下文长度(除非内存充足,否则请远设在 262K 以下)。如果你有一台 24 GB+ 的 Mac,且工作负载是 27B 能承担的,那这就是本周最好的免费本地模型。如果你只有 16 GB 的 Mac,或需要生产级吞吐量,那它就不适合——而替代方案是付费路径,这完全是另一个决策。
