关于 Ollama 上 Qwen3.8-27B 的文章标题卡片,展示了一个极简终端窗口,包含命令 'ollama run qwen3.8:27b' 和一个闪烁的光标,三个徽章分别写着 '18 GB 下载'、'Q4_K_M 默认' 和 '262K 上下文',以及标语 '免费运行,你的硬件'。
Guides & Insights

在 Ollama 上运行 Qwen3.8-27B:一条命令、四种量化版本,以及“免费”的真正代价

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

用一条命令运行它:ollama run qwen3.8:27b。这就是本页所讨论问题的全部答案。Qwen3.8 27B——Ali​baba 的 270 亿参数稠密模型,其权重于 2026 年 8 月 14 日以 Apache 2.0 许可证发布——本周已在 Ollama 库中上线,默认构建已经是一个合理的 18 GB Q4_K_M 量化版本(17 GB 权重外加 931 MB 视觉编码器)。在常规上下文长度下,它可以完全在 24 GB GPU 上运行;当你的显卡显存较小时,会拆分到 CPU 上运行;而且每个 token 零成本。

这里的所有内容均截至2026年8月15日。规格参数来自Qwen3.8 27B模型卡;下载大小、标签和下载次数来自Ollama库的实时页面;基准测试数据由阿里巴巴报告,目前尚无独立复现验证。该模型于几天前发布,因此任何可能变化的信息都应视为暂时性内容。

真正管用的一句话

如果你已经安装了 Ollama,你只差两个词:

ollama run qwen3.8:27b

Ollama 支持已在 v0.32.12 中落地——发布说明写得直白:“此版本增加了对 Qwe​n 3.8 27B 的支持。”首次运行会下载默认构建(约 18 GB,Q4_K_M),然后进入一个默认开启思考模式的聊天 REPL。库页面将该构建列在带有“vision tools thinking 27b”能力标签的条目下,由此可知视觉与工具调用路径都已集成到同一个下载中。截至本文撰写时,该页面显示下载量已超过 40,000 次,标签列表也已涵盖 11 个变体。

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

你真正会使用的两个变体:

• ollama run qwen3.8:27b-mlx —— 这是 Apple Silicon 构建版本,占用空间同样为 18 GB,但针对 Metal 进行了编译;这正是 Ollama 发布说明中特别优化的版本,“以实现适合重复性任务和编码智能体的最佳性能与输出质量”。

• ollama run qwen3.8:27b-q8_0 — 一个30 GB的8位量化版本,适用于当你拥有足够的VRAM并且希望权重更接近全精度时。

您实际下载的内容

名字上写的是27B,但完整参数数量是28B:一个27.3B的稠密语言模型,加上一个461M的视觉编码器,使其原生支持图像和视频输入。其余的关键规格直接来自模型卡:

• 64层,隐藏层大小5,120,词表大小248,320。

• 混合注意力:16 个完整门控注意力层和 48 个线性门控 DeltaNet 层——3:1 的偏线性混合,这也是 27B 模型能够保持 262,144 token 原生上下文(可扩展至 1M)而无需 KV 缓存占用整个数据中心的原因。

• 原生图像和视频理解 — “从 STEM 图表和文档到小时级视频”是 Alibaba 的措辞。

• Apache 2.0。下载它、修改它,并基于它销售产品。该许可证是本文其余部分的经济考量所依赖的法律事实。

全精度参考是BF16,这就是存在56 GB标签的原因;每个更小的标签都是用精度换取体积的取舍,而模型卡自身的基准测试就是你要权衡的参照。

先选量化级别,再检查显存,而不是反过来。

Ollama 为你提供十一个标签,但选择最终归结为三种尺寸。

18 GB — Q4_K_M(默认)。在正常上下文下可完全装进 24 GB 显存显卡(RTX 4090 / 5090 级别);在 16 GB 显存显卡上可部分卸载到 CPU 运行——速度较慢,但能用。这就是“即开即用”的版本。

30 GB — Q8_0.权重接近全精度,需要约 40 GB 的 VRAM 才能完全驻留在 GPU 上。在 27B 模型上,你在付费之前就应该已经知道为何需要额外的保真度。

56 GB — BF16。参考构建。需要 H100 级别或 96 GB 的硬件。没有人会在消费级 GPU 上运行它,这也无妨。

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

最让人栽跟头的数字是 KV 缓存。18 GB 的下载量并不意味着 18 GB 显存就足以支撑一次 262K 上下文的会话——在长上下文下,缓存会在权重之外额外占用数 GB,这就是为什么 24 GB 的显卡能在 8K–32K 上下文下轻松运行这个模型,但在 262K 下就不行。在显存吃紧的显卡上,请降低上下文长度,而不是降低量化等级。

Apple Silicon 在这里是一流的目标平台

Ollama 的 v0.32.12 发布说明特别点名了 macOS。具体来说,`ollama run qwen3.8:27b-mlx` 需要大约 18 GB 的统一内存,因此 24 GB 及以上的 Mac 可以在 GPU 上完整运行它,并为上下文留出余量。此外,还有面向 64–128 GB 机器的 32 GB mxfp8 MLX 标签和 56 GB mlx-bf16 标签。如果你的 M 系列 Mac 一直在关注桌面级机型的新消息,那么这就是你一直在等待的版本。

背景:规格表上是262K,实际坐上去感受更少

模型卡列出了 262,144 个原生 token,可扩展至 1M;Ollama 的库页面则将同一窗口报告为 256K。两者都没错 —— 262,144 是 256K 乘以 1024 —— 但这都不意味着你应该在 24 GB 显卡上把该数字填入 --num-ctx。KV 缓存大致随上下文线性增长,因此在消费级硬件上,你会停留在 16K–64K,而非 262K。从 Ollama 默认值开始,仅当任务确实需要时再调高 --num-ctx,并记住,1M 这个数字需要扩展机制以及足够的显存来支撑。

仍不稳固之处——下注前先读一读

尚无独立的基准测试结果。模型卡上的每个数字都只是 Alibaba 截至8月15日的说法。声称相对 Qwen3.6-27B 的提升幅度很大——SWE-bench Pro 61.7 对 53.5、Terminal Bench 2.1 73.0 对 63.4、LiveCodeBench v6 90.3 对 83.9、GPQA Diamond 89.2 对 87.8——这些看起来都合理,但没有一项被外部测试框架复现过。不要仅凭这些数据来做生产决策。

视觉栈才问世几天。早期的一份 bug 报告(ollama issue #17753)显示,Q4 构建将视觉输入路由到 Qwen3.5 解析器,在处理图像时失败;该问题在几天内就通过 PR #17755 修复了,但一个才一周大的模型,其多模态路径正是你在依赖它之前应该测试的地方。

默认构建包含 MTP。q4_K_M 标签同样也是多 token 预测构建——解码速度更快,这也是"18 GB"和"27B"能够同时存在而不矛盾的原因。

量化标签在 Apple 上可能具有误导性。 18 GB 的 "mlx" 和 "nvfp4" 标签在量化方式上有所不同——NVFP4 是 NVIDIA 的 FP4 格式——因此,除非你特别需要用于 Blackwell GPU 的 FP8/FP4 变体,否则在 Mac 上建议选择普通的 -mlx 版本。

“Free”这个词在那个标题里承担了很大的作用。

自托管27B模型每个token是免费的,但并非完全免费。诚实的说法是,有三种选择,各自花费不同的货币:

自行运行(Ollama)。每 token 0 美元,离线、不限量、私密——而硬件归你所有。24 GB 显卡或 18 GB+ 的 Mac 是一笔实打实的投入,电费和部署时间也同样如此。当 Qwen3.8 27B 成为日常主力时,这才是正确的选择。

调用 $0 限流 API。OrcaRouter 在自己的基础设施上以零成本提供 Qwen3.8 27B(模型 ID qwen/qwen3.8-27b-free,每请求 $0,限流)——因为权重是开放的,没有需要转嫁的每 token 供应商成本。当你想试用该模型,又不想购买硬件来测试发布仅一周的版本时,这是正确的选择。

调用无限API。同一个模型,在没有速率限制的情况下,在OrcaRouter(qwen/qwen3.8-27b,262K上下文,文本、图像和视频输入)上,每百万输入token的价格为$0.33,每百万输出token的价格为$2.40。当您需要生产规模且不想照看GPU时,这是正确的选择。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

决定二者取舍的算法很简单:偶尔使用的话,按$0或$0.33/$2.40计费比购买GPU更划算;日常交互式使用在本地更便宜;持续的生产吞吐量则以无需自己一直维护的API最为便宜。无论算法如何,隐私和离线需求都会把你推向第一列。

当此推荐有误时。

你确实需要 100K+ 的上下文。 模型可以做到;但你的 24 GB 显卡做不到。在真正的长上下文场景下,40 GB+ 的 GPU 或更长上下文的 API 并非奢侈品。

你今天就需要在生产中使用视频。视觉路径的解析器 bug 刚刚修复;在一个仅一周大的多模态模型上做视频生产,是你在没有后备方案时不应下的赌注。

你需要并发。 一块消费级 GPU 一次只能流式处理一两代生成。27B 不是服务机。

你现在使用的是纯CPU硬件。在CPU上运行4-bit量化的27B模型只是缓慢的演示,而非工具。在拥有GPU之前,API是诚实的选择。

底线

在 Ollama 上运行 Qwen3.8 27B,是迄今任何一方已发布的当代 27B 模型中最简单的运行方式:一条命令,默认 18 GB 能装进 24 GB 显卡,一流的 Apple Silicon 构建,还有 Apache 2.0 的自由。你该选的量化版本几乎总是默认的 Q4_K_M——只有当你实际测得出差异时,才改用 q8_0。而“免费”是有条件的:如果你只是偶尔用一下模型,$0 限速 API 比买硬件更自由;如果它成了你的日常主力,本地副本就是你拥有的最便宜的东西。在基于这些数字构建之前,先核实它们——本文中的一切在 2026 年 8 月 15 日都是真实的,而这个模型每天都在变。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube