
Qwen3.8-27B 与 MLX 在 Apple Silicon 上:确实能跑 — 这才是你真正需要的
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 22 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
Qwen3.8 27B 现已通过 MLX 在 Apple Silicon 上运行。对应的标签是 qwen3.8:27b-mlx,位于 Ollama 中,自 Ollama v0.32.12 起添加。4-bit 构建的下载大小约为 18 GB,需要约 16–19 GB 的统一内存——这意味着 24 GB 以上内存的 Mac 才是现实的门槛,而 16 GB 内存的 Mac 则无法运行。权重采用 Apache 2.0 许可,在你自己的硬件上使用时完全免费,这正是该模型的全部意义。Alibaba 发布至今仅两天(2026 年 8 月 13–14 日),因此下文每个数字都有明确标注:哪些来自 Alibaba 的模型卡,哪些是我们今天在 Ollama 页面上验证的,哪些是第三方预测或测量结果。
30秒速览
Qwen3.8 27B 是阿里巴巴的稠密型 270 亿参数模型,于 2026 年 8 月 13 日至 14 日在 Apache 2.0 许可下发布——权重于 13 日上线 Hugging Face 和 ModelScope,LICENSE 文件于次日早上出现。它是 2.4T 参数 Qwen3.8-Max 的可部署稠密兄弟模型。根据模型卡,所有数据均为 Alibaba 自行报告,尚未经独立复现:
• 大小 — 27B 稠密参数,计入视觉编码器后总参数为 27.78B。
• 架构 — 64层,隐藏大小5,120,词表248,320。
• 混合注意力 — 16个全注意力层加上48个Gated DeltaNet线性层,比例为3:1。
• 上下文 — 原生支持 262,144 个 token,可通过 YaRN 扩展至 1M(Ollama 将该标签列为 256K)。
• 输入 — 在文本基础上原生支持图像和视频理解,从文档到小时级视频。
• 权重 — 55.6 GB(BF16 格式),包含 MTP 推测解码头。

在 MLX 方面,今天已确认:Ollama 提供了 qwen3.8:27b-mlx——这是面向 Apple Silicon 的 MLX 原生构建,4-bit 下载大小约为 18 GB——并且 v0.32.12 的发布说明特别提到了 Apple Silicon 优化。mlx-lm 是 Apple 的 Python 工具链,支持该架构的生成和转换,MLX 量化(3/5/6-bit,以及 MXFP4 和 NVFP4)在权重发布后数小时内即已出现。本文其余部分假设使用配备 24 GB 或以上统一内存的 M 系列 Mac。
MLX 对内存做了哪些改变
{{1}}在 Apple Silicon 上没有独立的 VRAM。{{/1}}{{2}}MLX 运行在 M 系列统一内存池上,因此真正重要的数字是 Mac 的总内存减去 macOS 及其他一切所占用的部分。{{/2}}一个 {{3}}“适配 17 GB”{{/3}} 的模型,需要一台内存远比这充裕的机器。
好消息是,Qwen3.8 27B 的存储成本比其参数数量所暗示的要低。由于只有16个全注意力层保留 KV 缓存——48个线性层不保留——缓存成本约为每 token 64 KB,大约是传统64层密集模型所需成本的四分之一。在极限情况下,完整的262K窗口除了权重之外还需要约16.4 GB的缓存,这属于服务器级预算,而非笔记本电脑级预算。
Mac 的现实标准,即文件大小加上缓存余量:
• 4-bit MLX:总计约 16–19 GB,可适配 24 GB 的 Mac(约 64K–96K 上下文窗口),是合理的默认选择。
• 6-bit MLX — 约 21–22 GB。适用于 32 GB 机器;与 4-bit 相比,质量提升有限。
• 8-bit MLX — 约 27–30 GB。48 GB 及以上内存;接近无损。
• BF16 — 约 55.6 GB。只有顶配的 M 系列 Max 和 Ultra Mac Studio 机型才支持。

数据来源:4-bit 数据对应实测的 GGUF Q4_K_M(17.1 GB,unsloth,8月14日)以及 18 GB 的 Ollama 下载;8-bit 和 BF16 数据对应阿里巴巴自家的 BF16 卡和 Qwen3.6-27B 系列。每 token 64 KB 的缓存数据是根据架构推导得出的,并非印在规格表上,并且仅适用于像 MLX 那样在线性层上跳过 KV 缓存的运行时。
运行它的三种方式,从最简单到最可控
路径 A — Ollama,最简单的
升级到 Ollama 0.32.12 或更新版本,然后:
• ollama pull qwen3.8:27b-mlx — 下载约 18 GB 的 MLX 构建版本。
• ollama run qwen3.8:27b-mlx — 已接入思考模板的交互式聊天。
• ollama serve — 在 localhost:11434 上为你的应用提供兼容 OpenAI 的 API。

一个已知的小毛病(出自写作时仍活跃的 GitHub issue):qwen3.8:27b-mlx 在 /v1/responses 端点上拒绝“developer”角色,这会使ollama launch codex对此模型失效——而直接使用ollama run则正常。如果你正在基于 MLX 构建 Codex 风格的智能体循环,在把循环押注于它之前,请先测试你计划使用的确切端点。
路径 B — mlx-lm,控制力最强
苹果自家的工具包。使用以下命令安装:pip install mlx-lm,然后要么拉取预量化的 MLX 检查点,要么自行转换官方的 BF16 权重:
• mlx_lm.generate --model <checkpoint> — 直接运行检查点;社区为 27B 制作的 4 位和 8 位量化版本在发布后数天内仍持续上传至 mlx-community。
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 —— 转换一次;成本约等于一次下载。
• mlx_lm.server --model <checkpoint>—兼容 OpenAI 的服务器,可为您应用思维块聊天模板。
如果你想要的确切量化版本还没出来,在任何M系列Mac上从官方权重转换都很简单,并且能消除对第三方所提供内容的任何疑虑。
路径 C — LM Studio,一键式
LM Studio 在 Apple Silicon 上使用 MLX 后端,并在发布时支持了 Qwen3.8 27B:搜索该模型,选择一个适合你内存的量化版本,即可下载并运行。如果你更喜欢 GUI,这是最友好的方式,我们的配套指南会从头到尾覆盖整个过程——见下方相关阅读中的“How to Run Qwen3.8 27B Locally”。
模板陷阱
Qwen3.8 27B 默认会进行思考,思考块由聊天模板渲染,而非模型核心。发布后头 48 小时的第三方测试指出,官方模板会将每一轮助手回复都包裹进思考块中——即使是空回复也一样——而且在多轮智能体循环中,块会嵌套、历史记录会被截断,读起来就像失忆。这不是量化造成的。如果某个运行时提供了修正后的模板,请使用它;当你在构建智能体循环且不需要推理时,可按请求禁用思考——聊天模板暴露了 enable_thinking 标志,模型的 reasoning_effort 可设为 xhigh、medium 或 low。
它的真实感受是怎样的
一项在配备 32 GB 统一内存的 Mac mini M4 上独立进行的测试,运行 MLX 4-bit 构建版本,测得生成速度约为 5–6 tokens/s。这个数字应当用来设定预期:对交互式起草、长文推理和偶尔的智能体调用来说足够好用;对长时间的智能体循环和批处理任务来说则会令人痛苦。同一位测试者的轶事——模型思考了好几分钟,随后生成的小应用看起来没问题但实际上计算对不上——是一个很好的提醒:笔记本电脑上的 27B 模型是一个有能力但并非万无一失的助手。
速度随芯片级别而提升:拥有更多内存带宽和核心的 M 系列 Max 运行速度明显快于 mini 中的基础款 M4。但入门款上的 5–6 tok/s 才是诚实的基线,任何宣称“可在 Apple Silicon 上运行”的标题都应以此作为衡量标准。
262K 上下文是一项服务器功能。
Qwen3.8 27B 的原生 262K 上下文窗口确实实用——但在 Mac 上,限制因素在于内存,而不是模型本身。按照每个 token 64 KB 的 KV 缓存计算,8K 窗口大约占用 0.5 GB,32K 大约 2 GB,128K 大约 8 GB,而完整的 262K 除了权重之外还要占用约 16.4 GB。在 24 GB 内存、运行 4-bit 量化的机器上,实际上限大约在 64K–96K tokens 之间;要达到 128K+ 需要 32 GB+ 内存的机器,而要跑满完整窗口,则需要一台统一内存大部分被缓存占用的机器。请规划你实际需要的上下文长度,并在运行时配置中设置上限——这样模型运行顺畅,你的交换文件也能保持安静。
当 Apple Silicon 是错误答案时
如果以下任何一项是您的工作负载,请另辟蹊径:
• 你有一台 8 GB 或 16 GB 的 Mac。4-bit 版本已经需要约 17 GB 的统一内存;低于此容量就会发生交换(swap),模型将无法使用。这是最常见的误区,再多的量化技巧也无法解决。
你需要完整的262K上下文窗口,或者1M YaRN扩展。那个KV预算是服务器级别的预算,不是笔记本电脑级别的预算。
• 你在为其他人提供服务。笔记本电脑只是一个座位;多用户吞吐量需要GPU机箱或托管API。
在长智能体循环中,你需要快速推进。5–6 tok/s 对人类跟读来说没问题,但对子代理来说则太慢了。
坦诚地说:Qwen3.8 27B 的卖点在于,它在你自己的硬件上使用时是免费的——这与按 token 收费的 API 模型正好相反。这正是它不在 OrcaRouter 目录中的原因(该目录路由的是早期的 Qwen3.6/3.5-27B 系列以及托管的 Qwen API 产品线)。对于免费本地部署这个方向,我们是用错工具了,而这就是重点:当一个工作负载超出了 Mac 的能力范围时,替代方案是 GPU 主机、租用 GPU 或托管的 Qwen API——而不是一个恰好支持这个特定 27B 的路由器。
底线
Qwen3.8 27B 在 Apple Silicon 上是真的,表现不错,但适用面很窄。4-bit MLX 构建适配 24 GB 以上的 Mac,在 Ollama 中以下载名 qwen3.8:27b-mlx 获取,每个 token 零成本,是第一款真正可用、达到智能体级别且能装进笔记本电脑的开源模型。代价是速度(M4 mini 上约 5–6 tok/s)和上下文长度(除非内存充足,否则请远设在 262K 以下)。如果你有一台 24 GB+ 的 Mac,且工作负载是 27B 能承担的,那这就是本周最好的免费本地模型。如果你只有 16 GB 的 Mac,或需要生产级吞吐量,那它就不适合——而替代方案是付费路径,这完全是另一个决策。
