
Ollama 上的 Qwen3.8-27B:一条命令、四种量化,以及“免费”的真实代价
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 348 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 107 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
用一条命令即可运行:ollama run qwen3.8:27b。这就是本页所讨论问题的全部答案。Qwen3.8 27B——Alibaba 的稠密 270 亿参数模型,权重于 2026 年 8 月 14 日以 Apache 2.0 许可发布——本周已在 Ollama 模型库中上线,而且其默认构建已经是相当合理的 18 GB Q4_K_M 量化版本(17 GB 权重外加 931 MB 视觉编码器)。它能在 24 GB 显卡上以常规上下文长度完整运行;显卡较小时会分流到 CPU;每个 token 都不花一分钱。
本文所有内容均以 2026 年 8 月 15 日为准。规格来自 Qwen3.8 27B 模型卡;下载大小、标签和下载次数来自 Ollama 库的实时页面;基准测试数字由 Alibaba 报告,尚未经过独立复现。该模型几天前才发布,因此任何可能变化的内容都应视为暂定。
真正有效的一行命令
如果你已经安装了 Ollama,只需两个字就能搞定:
ollama run qwen3.8:27b
Ollama 支持已在 v0.32.12 中落地——发布说明直白地写道:“本次发布新增了对 Qwen 3.8 27B 的支持。”首次运行会下载默认构建(约 18 GB,Q4_K_M),随后你会进入一个默认开启思考模式的聊天 REPL。模型库页面列出了该构建,能力标签为“vision tools thinking 27b”,由此可知视觉与工具调用路径已接入同一下载包。截至撰写本文时,该页面显示下载量已超过 40,000 次,标签列表已涵盖十一个变体。

你会实际用到的两种变体:
• ollama run qwen3.8:27b-mlx —— Apple Silicon 构建版本,同样占用 18 GB 内存,但针对 Metal 编译;Ollama 的发行说明专门对它进行了优化,称其“能实现最大性能与输出质量,适合重复性任务和编码智能体”。
• ollama run qwen3.8:27b-q8_0 —— 30 GB 的 8 位量化版本,适合显存充足、希望权重更接近全精度时使用。
你实际上正在下载什么
名字里写的是 27B,但完整参数量是 28B:一个 27.3B 的稠密语言模型,外加一个 461M 的视觉编码器,让它具备原生图像和视频输入能力。以下是直接来自模型卡的主要规格:
• 64 层,隐藏层大小 5,120,词汇表 248,320。
• 混合注意力:16 层全 Gated Attention 和 48 层线性 Gated DeltaNet —— 3:1 的精简线性混合,这也是 27B 能够保持 262,144 token 原生上下文(可扩展至 1M)而无需让 KV 缓存消耗整个数据中心的原因。
• 原生图像和视频理解——“从 STEM 图表和文档到小时级视频”是阿里巴巴的措辞。
• Apache 2.0。下载它、修改它、基于它销售产品。该许可证正是本文其余部分经济学分析所依赖的法律事实。
全精度参照是 BF16,这正是 56 GB 标签存在的原因;每个更小的标签都是以精度换取占用空间,而你要权衡取舍的参照正是模型卡自身的基准测试。
先选量化,再看显存,而不是反过来
Ollama 提供了十一个标签,但决策归结为三种规模。
• 18 GB — Q4_K_M(默认)。在正常上下文长度下可完整放入 24 GB 显卡(RTX 4090 / 5090 级别),在 16 GB 显卡上则可通过部分 CPU 卸载来运行——速度较慢,但能跑起来。这就是"直接就能跑"的版本。
• 30 GB — Q8_0。权重接近全精度,需要大约 40 GB 显存才能完全驻留在 GPU 上。对于 27B 模型,在为此付出代价之前,你应该已经清楚自己为什么需要这份额外的保真度。
• 56 GB — BF16。参考版本。需要 H100 级别或 96 GB 的硬件。没人会在消费级 GPU 上跑这个,而这也没关系。

让人栽跟头的是 KV 缓存。18 GB 的下载量并不意味着 18 GB 显存就够用于 262K 上下文的会话——在长上下文下,缓存会在权重之外再增加数 GB,这就是为什么 24 GB 显卡在 8K–32K 上下文下能轻松装下这个模型,但在 262K 下就不行。在临界配置的显卡上,应该降低上下文,而不是降低量化精度。
Apple Silicon 在这里是一等目标
Ollama 的 v0.32.12 版本说明特别提到了 macOS。具体来说,ollama run qwen3.8:27b-mlx 需要约 18 GB 统一内存,因此一台 24 GB 以上的 Mac 可以完全在 GPU 上运行它,并为上下文留出余量。此外还有 32 GB 的 mxfp8 MLX 标签和 56 GB 的 mlx-bf16 标签,适用于 64–128 GB 的机器。如果你的 M 系列 Mac 一直在关注桌面级模型的新闻,这就是你一直在等待的版本。
背景:规格表上是262K,实际体验却更少
模型卡上列出的是 262,144 个原生 token,可扩展至 1M;Ollama 的模型库页面把同一个窗口标为 256K。两者都没错——262,144 就是 256K 乘以 1024——但两者都不意味着你应该在 24 GB 显卡上把这个数字填进 --num-ctx。KV cache 大致随上下文线性增长,所以在消费级硬件上,你能长期停留的区间是 16K–64K,而不是 262K。先从 Ollama 的默认值开始,只有当任务确实需要时才调高 --num-ctx;还要记住,1M 这个数字需要扩展机制,以及足以喂饱它的 VRAM。
哪些地方仍然不稳——在押注之前,请先读这个
• 目前尚无独立基准测试。截至 8 月 15 日,模型卡上的每一项数据都只是阿里巴巴的单方说法。其宣称相较 Qwen3.6-27B 的提升幅度很大——SWE-bench Pro 61.7 对 53.5,Terminal Bench 2.1 73.0 对 63.4,LiveCodeBench v6 90.3 对 83.9,GPQA Diamond 89.2 对 87.8——这些数字读起来都还算可信,但没有任何一项经过外部测试框架的复现。不要仅凭这些数据就做出生产决策。
• 该视觉技术栈才刚问世几天。一份早期缺陷报告(ollama issue #17753)显示,Q4 构建版本将视觉输入经由 Qwen3.5 解析器处理,导致图像处理失败;该问题已在几天内通过 PR #17755 修复,但对于一个刚发布一周的模型而言,多模态路径恰恰是你在依赖它之前应当测试的地方。
• 默认构建包含 MTP。 q4_K_M 标签同时也是多 token 预测构建——解码更快,也正是“18 GB”与“27B”能够并存而不矛盾的原因。
• 在 Apple 设备上,量化标签可能会产生误导。18 GB 的 "mlx" 和 "nvfp4" 标签在量化方式上并不相同——NVFP4 是 NVIDIA 的 FP4 格式——因此在 Mac 上,除非你确实需要用于 Blackwell GPU 的 FP8/FP4 变体,否则建议选择普通的 -mlx 构建版本。
“免费”这个词在那个标题里承担了太多分量
自托管一个 27B 模型按 token 计算是免费的,但它并非没有成本。诚实的说法是:有三种选项,各自以不同的“货币”计价:
• 自己运行(Ollama)。每 token 成本 $0,离线、无限量、私密——而且硬件归你所有。一块 24 GB 的 GPU 或一台 18 GB+ 的 Mac 都是实打实的开销,电费和搭建时间同样如此。当 Qwen3.8 27B 成为日常主力模型时,这就是正确的选择。
• 调用一个 $0 的限速 API。 OrcaRouter 在自己的基础设施上以零成本提供 Qwen3.8 27B(模型 ID qwen/qwen3.8-27b-free,每次请求 $0,限速)——由于权重是开放的,没有按 token 计算的供应商成本需要转嫁。当你想试用这个模型,又不想为了测试一个刚发布一周的版本而购买硬件时,这是正确的选择。
• 调用无限制的 API。同一个模型在 OrcaRouter 上不受速率限制时,每百万输入 token 为 $0.33,每百万输出 token 为 $2.40(qwen/qwen3.8-27b,262K 上下文,文本、图像和视频输入)。当你需要生产级规模、又不想时刻守着 GPU 时,这是正确的选择。

决定二者之间取舍的这笔账是这样的:偶尔使用在 $0 或 $0.33/$2.40 时,比按 GPU 的价格更划算;每日交互式使用在本地更便宜;持续的生产吞吐量,以无需保持常驻运行的 API 形式最便宜。无论这笔账怎么算,隐私和离线需求都会把你推向第一列。
当这个推荐有误时
• 你确实需要 100K+ 的上下文。模型能做到这一点,而你那块 24 GB 的显卡做不到。在真正的长上下文场景中,40 GB+ 的 GPU 或更长上下文的 API 并不是奢侈品。
• 你需要在今天就拿到可用于生产的视频能力。视觉路径的解析器 bug 刚刚修复;把一个只有一周新的多模态模型用于生产视频,这种赌注在没有备用方案的情况下不该下。
• 你想要的是并发。一块消费级 GPU 一次只能流式输出一到两个生成结果。27B 并不是一台服务机。
• 你使用的是仅配备 CPU 的硬件。在 CPU 上以 4-bit 运行 27B 模型只是一个缓慢的演示,而不是一个工具。在拥有 GPU 之前,使用 API 才是诚实的选择。
底线
Qwen3.8 27B 跑在 Ollama 上,是迄今任何人推出的、运行当代 27B 模型最省事的方式:一条命令、一个能塞进 24 GB 显卡的 18 GB 默认配置、一流的 Apple Silicon 构建版本,还有 Apache 2.0 的自由。你该选的量化版本几乎总是默认的 Q4_K_M——只有当你确实能量出差别时,才改用 q8_0。而这里的“免费”是有条件的:如果你只是偶尔碰一下这个模型,那么 $0 的限流 API 比买硬件更自由;如果它成了你每天都要用的主力,本地副本就是你拥有的最便宜的东西。在你拿这些数字做判断之前,先核实一下——本文内容在 2026 年 8 月 15 日时都还成立,而这个模型每天都在变。
