
在 Ollama 上运行 Qwen3.8-27B:一条命令、四种量化版本,以及“免费”的真正代价
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 18 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
用一条命令运行它:ollama run qwen3.8:27b。这就是本页所讨论问题的全部答案。Qwen3.8 27B——Alibaba 的 270 亿参数稠密模型,其权重于 2026 年 8 月 14 日以 Apache 2.0 许可证发布——本周已在 Ollama 库中上线,默认构建已经是一个合理的 18 GB Q4_K_M 量化版本(17 GB 权重外加 931 MB 视觉编码器)。在常规上下文长度下,它可以完全在 24 GB GPU 上运行;当你的显卡显存较小时,会拆分到 CPU 上运行;而且每个 token 零成本。
这里的所有内容均截至2026年8月15日。规格参数来自Qwen3.8 27B模型卡;下载大小、标签和下载次数来自Ollama库的实时页面;基准测试数据由阿里巴巴报告,目前尚无独立复现验证。该模型于几天前发布,因此任何可能变化的信息都应视为暂时性内容。
真正管用的一句话
如果你已经安装了 Ollama,你只差两个词:
ollama run qwen3.8:27b
Ollama 支持已在 v0.32.12 中落地——发布说明写得直白:“此版本增加了对 Qwen 3.8 27B 的支持。”首次运行会下载默认构建(约 18 GB,Q4_K_M),然后进入一个默认开启思考模式的聊天 REPL。库页面将该构建列在带有“vision tools thinking 27b”能力标签的条目下,由此可知视觉与工具调用路径都已集成到同一个下载中。截至本文撰写时,该页面显示下载量已超过 40,000 次,标签列表也已涵盖 11 个变体。

你真正会使用的两个变体:
• ollama run qwen3.8:27b-mlx —— 这是 Apple Silicon 构建版本,占用空间同样为 18 GB,但针对 Metal 进行了编译;这正是 Ollama 发布说明中特别优化的版本,“以实现适合重复性任务和编码智能体的最佳性能与输出质量”。
• ollama run qwen3.8:27b-q8_0 — 一个30 GB的8位量化版本,适用于当你拥有足够的VRAM并且希望权重更接近全精度时。
您实际下载的内容
名字上写的是27B,但完整参数数量是28B:一个27.3B的稠密语言模型,加上一个461M的视觉编码器,使其原生支持图像和视频输入。其余的关键规格直接来自模型卡:
• 64层,隐藏层大小5,120,词表大小248,320。
• 混合注意力:16 个完整门控注意力层和 48 个线性门控 DeltaNet 层——3:1 的偏线性混合,这也是 27B 模型能够保持 262,144 token 原生上下文(可扩展至 1M)而无需 KV 缓存占用整个数据中心的原因。
• 原生图像和视频理解 — “从 STEM 图表和文档到小时级视频”是 Alibaba 的措辞。
• Apache 2.0。下载它、修改它,并基于它销售产品。该许可证是本文其余部分的经济考量所依赖的法律事实。
全精度参考是BF16,这就是存在56 GB标签的原因;每个更小的标签都是用精度换取体积的取舍,而模型卡自身的基准测试就是你要权衡的参照。
先选量化级别,再检查显存,而不是反过来。
Ollama 为你提供十一个标签,但选择最终归结为三种尺寸。
• 18 GB — Q4_K_M(默认)。在正常上下文下可完全装进 24 GB 显存显卡(RTX 4090 / 5090 级别);在 16 GB 显存显卡上可部分卸载到 CPU 运行——速度较慢,但能用。这就是“即开即用”的版本。
• 30 GB — Q8_0.权重接近全精度,需要约 40 GB 的 VRAM 才能完全驻留在 GPU 上。在 27B 模型上,你在付费之前就应该已经知道为何需要额外的保真度。
• 56 GB — BF16。参考构建。需要 H100 级别或 96 GB 的硬件。没有人会在消费级 GPU 上运行它,这也无妨。

最让人栽跟头的数字是 KV 缓存。18 GB 的下载量并不意味着 18 GB 显存就足以支撑一次 262K 上下文的会话——在长上下文下,缓存会在权重之外额外占用数 GB,这就是为什么 24 GB 的显卡能在 8K–32K 上下文下轻松运行这个模型,但在 262K 下就不行。在显存吃紧的显卡上,请降低上下文长度,而不是降低量化等级。
Apple Silicon 在这里是一流的目标平台
Ollama 的 v0.32.12 发布说明特别点名了 macOS。具体来说,`ollama run qwen3.8:27b-mlx` 需要大约 18 GB 的统一内存,因此 24 GB 及以上的 Mac 可以在 GPU 上完整运行它,并为上下文留出余量。此外,还有面向 64–128 GB 机器的 32 GB mxfp8 MLX 标签和 56 GB mlx-bf16 标签。如果你的 M 系列 Mac 一直在关注桌面级机型的新消息,那么这就是你一直在等待的版本。
背景:规格表上是262K,实际坐上去感受更少
模型卡列出了 262,144 个原生 token,可扩展至 1M;Ollama 的库页面则将同一窗口报告为 256K。两者都没错 —— 262,144 是 256K 乘以 1024 —— 但这都不意味着你应该在 24 GB 显卡上把该数字填入 --num-ctx。KV 缓存大致随上下文线性增长,因此在消费级硬件上,你会停留在 16K–64K,而非 262K。从 Ollama 默认值开始,仅当任务确实需要时再调高 --num-ctx,并记住,1M 这个数字需要扩展机制以及足够的显存来支撑。
仍不稳固之处——下注前先读一读
• 尚无独立的基准测试结果。模型卡上的每个数字都只是 Alibaba 截至8月15日的说法。声称相对 Qwen3.6-27B 的提升幅度很大——SWE-bench Pro 61.7 对 53.5、Terminal Bench 2.1 73.0 对 63.4、LiveCodeBench v6 90.3 对 83.9、GPQA Diamond 89.2 对 87.8——这些看起来都合理,但没有一项被外部测试框架复现过。不要仅凭这些数据来做生产决策。
• 视觉栈才问世几天。早期的一份 bug 报告(ollama issue #17753)显示,Q4 构建将视觉输入路由到 Qwen3.5 解析器,在处理图像时失败;该问题在几天内就通过 PR #17755 修复了,但一个才一周大的模型,其多模态路径正是你在依赖它之前应该测试的地方。
• 默认构建包含 MTP。q4_K_M 标签同样也是多 token 预测构建——解码速度更快,这也是"18 GB"和"27B"能够同时存在而不矛盾的原因。
• 量化标签在 Apple 上可能具有误导性。 18 GB 的 "mlx" 和 "nvfp4" 标签在量化方式上有所不同——NVFP4 是 NVIDIA 的 FP4 格式——因此,除非你特别需要用于 Blackwell GPU 的 FP8/FP4 变体,否则在 Mac 上建议选择普通的 -mlx 版本。
“Free”这个词在那个标题里承担了很大的作用。
自托管27B模型每个token是免费的,但并非完全免费。诚实的说法是,有三种选择,各自花费不同的货币:
• 自行运行(Ollama)。每 token 0 美元,离线、不限量、私密——而硬件归你所有。24 GB 显卡或 18 GB+ 的 Mac 是一笔实打实的投入,电费和部署时间也同样如此。当 Qwen3.8 27B 成为日常主力时,这才是正确的选择。
• 调用 $0 限流 API。OrcaRouter 在自己的基础设施上以零成本提供 Qwen3.8 27B(模型 ID qwen/qwen3.8-27b-free,每请求 $0,限流)——因为权重是开放的,没有需要转嫁的每 token 供应商成本。当你想试用该模型,又不想购买硬件来测试发布仅一周的版本时,这是正确的选择。
• 调用无限API。同一个模型,在没有速率限制的情况下,在OrcaRouter(qwen/qwen3.8-27b,262K上下文,文本、图像和视频输入)上,每百万输入token的价格为$0.33,每百万输出token的价格为$2.40。当您需要生产规模且不想照看GPU时,这是正确的选择。

决定二者取舍的算法很简单:偶尔使用的话,按$0或$0.33/$2.40计费比购买GPU更划算;日常交互式使用在本地更便宜;持续的生产吞吐量则以无需自己一直维护的API最为便宜。无论算法如何,隐私和离线需求都会把你推向第一列。
当此推荐有误时。
• 你确实需要 100K+ 的上下文。 模型可以做到;但你的 24 GB 显卡做不到。在真正的长上下文场景下,40 GB+ 的 GPU 或更长上下文的 API 并非奢侈品。
• 你今天就需要在生产中使用视频。视觉路径的解析器 bug 刚刚修复;在一个仅一周大的多模态模型上做视频生产,是你在没有后备方案时不应下的赌注。
• 你需要并发。 一块消费级 GPU 一次只能流式处理一两代生成。27B 不是服务机。
• 你现在使用的是纯CPU硬件。在CPU上运行4-bit量化的27B模型只是缓慢的演示,而非工具。在拥有GPU之前,API是诚实的选择。
底线
在 Ollama 上运行 Qwen3.8 27B,是迄今任何一方已发布的当代 27B 模型中最简单的运行方式:一条命令,默认 18 GB 能装进 24 GB 显卡,一流的 Apple Silicon 构建,还有 Apache 2.0 的自由。你该选的量化版本几乎总是默认的 Q4_K_M——只有当你实际测得出差异时,才改用 q8_0。而“免费”是有条件的:如果你只是偶尔用一下模型,$0 限速 API 比买硬件更自由;如果它成了你的日常主力,本地副本就是你拥有的最便宜的东西。在基于这些数字构建之前,先核实它们——本文中的一切在 2026 年 8 月 15 日都是真实的,而这个模型每天都在变。
