一张关于 Ollama 上 Qwen3.8-27B 的文章标题卡,展示了一个极简终端窗口,其中显示命令 'ollama run qwen3.8:27b' 和一个闪烁的光标,三个徽标分别写着 "18 GB 下载"、"Q4_K_M 默认" 和 "262K 上下文",以及说明文字 "免费运行,用你自己的硬件"。
Guides & Insights

Ollama 上的 Qwen3.8-27B:一条命令、四种量化,以及“免费”的真实代价

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

用一条命令即可运行:ollama run qwen3.8:27b。这就是本页所讨论问题的全部答案。Qwen3.8 27B——Ali​baba 的稠密 270 亿参数模型,权重于 2026 年 8 月 14 日以 Apache 2.0 许可发布——本周已在 Ollama 模型库中上线,而且其默认构建已经是相当合理的 18 GB Q4_K_M 量化版本(17 GB 权重外加 931 MB 视觉编码器)。它能在 24 GB 显卡上以常规上下文长度完整运行;显卡较小时会分流到 CPU;每个 token 都不花一分钱。

本文所有内容均以 2026 年 8 月 15 日为准。规格来自 Qwen3.8 27B 模型卡;下载大小、标签和下载次数来自 Ollama 库的实时页面;基准测试数字由 Alibaba 报告,尚未经过独立复现。该模型几天前才发布,因此任何可能变化的内容都应视为暂定。

真正有效的一行命令

如果你已经安装了 Ollama,只需两个字就能搞定:

ollama run qwen3.8:27b

Ollama 支持已在 v0.32.12 中落地——发布说明直白地写道:“本次发布新增了对 Qwen 3.8 27B 的支持。”首次运行会下载默认构建(约 18 GB,Q4_K_M),随后你会进入一个默认开启思考模式的聊天 REPL。模型库页面列出了该构建,能力标签为“vision tools thinking 27b”,由此可知视觉与工具调用路径已接入同一下载包。截至撰写本文时,该页面显示下载量已超过 40,000 次,标签列表已涵盖十一个变体。

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

你会实际用到的两种变体:

• ollama run qwen3.8:27b-mlx —— Apple Silicon 构建版本,同样占用 18 GB 内存,但针对 Metal 编译;Ollama 的发行说明专门对它进行了优化,称其“能实现最大性能与输出质量,适合重复性任务和编码智能体”。

• ollama run qwen3.8:27b-q8_0 —— 30 GB 的 8 位量化版本,适合显存充足、希望权重更接近全精度时使用。

你实际上正在下载什么

名字里写的是 27B,但完整参数量是 28B:一个 27.3B 的稠密语言模型,外加一个 461M 的视觉编码器,让它具备原生图像和视频输入能力。以下是直接来自模型卡的主要规格:

• 64 层,隐藏层大小 5,120,词汇表 248,320。

• 混合注意力:16 层全 Gated Attention 和 48 层线性 Gated DeltaNet —— 3:1 的精简线性混合,这也是 27B 能够保持 262,144 token 原生上下文(可扩展至 1M)而无需让 KV 缓存消耗整个数据中心的原因。

• 原生图像和视频理解——“从 STEM 图表和文档到小时级视频”是阿里巴巴的措辞。

• Apache 2.0。下载它、修改它、基于它销售产品。该许可证正是本文其余部分经济学分析所依赖的法律事实。

全精度参照是 BF16,这正是 56 GB 标签存在的原因;每个更小的标签都是以精度换取占用空间,而你要权衡取舍的参照正是模型卡自身的基准测试。

先选量化,再看显存,而不是反过来

Ollama 提供了十一个标签,但决策归结为三种规模。

• 18 GB — Q4_K_M(默认)。在正常上下文长度下可完整放入 24 GB 显卡(RTX 4090 / 5090 级别),在 16 GB 显卡上则可通过部分 CPU 卸载来运行——速度较慢,但能跑起来。这就是"直接就能跑"的版本。

• 30 GB — Q8_0。权重接近全精度,需要大约 40 GB 显存才能完全驻留在 GPU 上。对于 27B 模型,在为此付出代价之前,你应该已经清楚自己为什么需要这份额外的保真度。

• 56 GB — BF16。参考版本。需要 H100 级别或 96 GB 的硬件。没人会在消费级 GPU 上跑这个,而这也没关系。

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

让人栽跟头的是 KV 缓存。18 GB 的下载量并不意味着 18 GB 显存就够用于 262K 上下文的会话——在长上下文下,缓存会在权重之外再增加数 GB,这就是为什么 24 GB 显卡在 8K–32K 上下文下能轻松装下这个模型,但在 262K 下就不行。在临界配置的显卡上,应该降低上下文,而不是降低量化精度。

Apple Silicon 在这里是一等目标

Ollama 的 v0.32.12 版本说明特别提到了 macOS。具体来说,ollama run qwen3.8:27b-mlx 需要约 18 GB 统一内存,因此一台 24 GB 以上的 Mac 可以完全在 GPU 上运行它,并为上下文留出余量。此外还有 32 GB 的 mxfp8 MLX 标签和 56 GB 的 mlx-bf16 标签,适用于 64–128 GB 的机器。如果你的 M 系列 Mac 一直在关注桌面级模型的新闻,这就是你一直在等待的版本。

背景:规格表上是262K,实际体验却更少

模型卡上列出的是 262,144 个原生 token,可扩展至 1M;Ollama 的模型库页面把同一个窗口标为 256K。两者都没错——262,144 就是 256K 乘以 1024——但两者都不意味着你应该在 24 GB 显卡上把这个数字填进 --num-ctx。KV cache 大致随上下文线性增长,所以在消费级硬件上,你能长期停留的区间是 16K–64K,而不是 262K。先从 Ollama 的默认值开始,只有当任务确实需要时才调高 --num-ctx;还要记住,1M 这个数字需要扩展机制,以及足以喂饱它的 VRAM。

哪些地方仍然不稳——在押注之前,请先读这个

• 目前尚无独立基准测试。截至 8 月 15 日,模型卡上的每一项数据都只是阿里巴巴的单方说法。其宣称相较 Qwen3.6-27B 的提升幅度很大——SWE-bench Pro 61.7 对 53.5,Terminal Bench 2.1 73.0 对 63.4,LiveCodeBench v6 90.3 对 83.9,GPQA Diamond 89.2 对 87.8——这些数字读起来都还算可信,但没有任何一项经过外部测试框架的复现。不要仅凭这些数据就做出生产决策。

• 该视觉技术栈才刚问世几天。一份早期缺陷报告(ollama issue #17753)显示,Q4 构建版本将视觉输入经由 Qwen3.5 解析器处理,导致图像处理失败;该问题已在几天内通过 PR #17755 修复,但对于一个刚发布一周的模型而言,多模态路径恰恰是你在依赖它之前应当测试的地方。

• 默认构建包含 MTP。 q4_K_M 标签同时也是多 token 预测构建——解码更快,也正是“18 GB”与“27B”能够并存而不矛盾的原因。

• 在 Apple 设备上,量化标签可能会产生误导。18 GB 的 "mlx" 和 "nvfp4" 标签在量化方式上并不相同——NVFP4 是 NVIDIA 的 FP4 格式——因此在 Mac 上,除非你确实需要用于 Blackwell GPU 的 FP8/FP4 变体,否则建议选择普通的 -mlx 构建版本。

“免费”这个词在那个标题里承担了太多分量

自托管一个 27B 模型按 token 计算是免费的,但它并非没有成本。诚实的说法是:有三种选项,各自以不同的“货币”计价:

• 自己运行(Ollama)。每 token 成本 $0,离线、无限量、私密——而且硬件归你所有。一块 24 GB 的 GPU 或一台 18 GB+ 的 Mac 都是实打实的开销,电费和搭建时间同样如此。当 Qwen3.8 27B 成为日常主力模型时,这就是正确的选择。

• 调用一个 $0 的限速 API。 OrcaRouter 在自己的基础设施上以零成本提供 Qwen3.8 27B(模型 ID qwen/qwen3.8-27b-free,每次请求 $0,限速)——由于权重是开放的,没有按 token 计算的供应商成本需要转嫁。当你想试用这个模型,又不想为了测试一个刚发布一周的版本而购买硬件时,这是正确的选择。

• 调用无限制的 API。同一个模型在 OrcaRouter 上不受速率限制时,每百万输入 token 为 $0.33,每百万输出 token 为 $2.40(qwen/qwen3.8-27b,262K 上下文,文本、图像和视频输入)。当你需要生产级规模、又不想时刻守着 GPU 时,这是正确的选择。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

决定二者之间取舍的这笔账是这样的:偶尔使用在 $0 或 $0.33/$2.40 时,比按 GPU 的价格更划算;每日交互式使用在本地更便宜;持续的生产吞吐量,以无需保持常驻运行的 API 形式最便宜。无论这笔账怎么算,隐私和离线需求都会把你推向第一列。

当这个推荐有误时

• 你确实需要 100K+ 的上下文。模型能做到这一点,而你那块 24 GB 的显卡做不到。在真正的长上下文场景中,40 GB+ 的 GPU 或更长上下文的 API 并不是奢侈品。

• 你需要在今天就拿到可用于生产的视频能力。视觉路径的解析器 bug 刚刚修复;把一个只有一周新的多模态模型用于生产视频,这种赌注在没有备用方案的情况下不该下。

• 你想要的是并发。一块消费级 GPU 一次只能流式输出一到两个生成结果。27B 并不是一台服务机。

• 你使用的是仅配备 CPU 的硬件。在 CPU 上以 4-bit 运行 27B 模型只是一个缓慢的演示,而不是一个工具。在拥有 GPU 之前,使用 API 才是诚实的选择。

底线

Qwen3.8 27B 跑在 Ollama 上,是迄今任何人推出的、运行当代 27B 模型最省事的方式:一条命令、一个能塞进 24 GB 显卡的 18 GB 默认配置、一流的 Apple Silicon 构建版本,还有 Apache 2.0 的自由。你该选的量化版本几乎总是默认的 Q4_K_M——只有当你确实能量出差别时,才改用 q8_0。而这里的“免费”是有条件的:如果你只是偶尔碰一下这个模型,那么 $0 的限流 API 比买硬件更自由;如果它成了你每天都要用的主力,本地副本就是你拥有的最便宜的东西。在你拿这些数字做判断之前,先核实一下——本文内容在 2026 年 8 月 15 日时都还成立,而这个模型每天都在变。