一张主视觉标题卡,显示 Qwen3.8-27B GGUF,副标题为“适合你 GPU 的量化版本”,带有一个下载图标,以及 Q4_K_M 17.1GB 和 UD-IQ2 9.0GB 的文件标签。
Guides & Insights

Qwen3.8-27B GGUF:该为你的 GPU 下载哪种量化版本

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

下载 unsloth/Qwen3.8-27B-GGUF 包,并将文件与你实际拥有的显卡相匹配。这就是全部答案:24GB 的 GPU(RTX 4090 或 3090)应拉取 17.1GB 的 Q4_K_M;16GB 的 GPU 应拉取 15.7GB 的 IQ4_XS(或者,如果你想要上下文余量,可选 13.8GB 的 Q3_K_M);12GB 的 GPU 只能使用 2 位文件,9.0GB 的 UD-IQ2_XXS,这是需要明知而做出的妥协。Qwen3.8 27B —— Alibaba 的稠密 270 亿参数模型,Apache 2.0 权重发布于 2026 年 8 月 13 日至 14 日 —— 在本地运行成本异常低,因为其混合注意力仅缓存 64 层中的 16 层,所以 24GB 上的 4 位量化可轻松承载 32K–64K token 的上下文。而 GGUF 是唯一零边际成本的途径:无需 API 密钥,没有按 token 计费,也没有数据离开你的机器。

关于信息来源:架构、上下文窗口和许可证均为官方信息,出自 Hugging Face 上的 Qwen3.8 27B 模型卡,于 2026 年 8 月 15 日核实。GGUF 各尺寸数据来自 unsloth 与 ggml-org 的 GGUF 仓库,同日获取。每块 GPU 的显存建议为 unsloth 的官方推荐。KV 缓存字节估算值与每秒 token 数均为发布后最初几天内的社区实测数据,并非厂商规格。下文列出的每一项基准测试均由阿里巴巴报告,且未经复现。

文件选择器,每行一个 quant

• UD-IQ2_XXS — 9.0GB — 唯一能轻松适配 12GB 显卡的选项;预计会有明显的质量损失。

• UD-Q2_K_XL — 10.7GB — 12GB 显卡,几乎没有剩余的上下文空间可用了。

• Q3_K_M — 13.8GB — 适合希望为上下文留出余量的 16GB 显卡。

• IQ4_XS — 15.7GB — 16GB 显卡:能完整容纳的最大量化版本。

• Q4_K_M — 17.1GB — 24GB 显卡:最佳选择,也是本文向你推荐的文件。

• Q5_K_M — 19.8GB — 24GB,牺牲上下文余量以换取小幅质量提升。

• Q6_K — 22.9GB — 挤一挤能装进 24GB;近乎无损。

• Q8_0 — 29.0GB — 需要 32GB 显存、双卡拆分或 CPU 卸载。

• BF16 — 54.7GB — 服务器显卡及大内存 CPU 配置;参考精度。

两种包,两种 Q4_K_M 体积:unsloth 的是 17.1GB;ggml-org 的是 19.0GB。unsloth 包对其 UD-* 文件使用 Dynamic V3.0(预览版)量化,也是大多数本地应用默认选用的那个;ggml-org 包则提供标准 K-quants,外加用于投机解码的独立多 token 预测头。两种 Q4_K_M 都能用——差别只是几百兆字节和那个 MTP 文件。

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

为什么这个 27B 能装进比大多数更小的显卡里

Qwen3.8 27B 有 64 层,但只有 16 层使用全注意力。其余 48 层使用 Gated DeltaNet 线性注意力,它维护的是固定大小的循环状态,而非不断增长的键值缓存。模型卡自身的块布局是每 1 个(Gated Attention → FFN)对应 3 个(Gated DeltaNet → FFN)——也就是 3:1 的混合比例。实际效果是:在相同上下文长度下,KV 缓存大约只有传统 27B 稠密模型所需量的四分之一。本周的社区测量显示,缓存在 8K 上下文下约为 0.5GB,32K 时约为 2.0GB,而在完整的 262K 原生窗口下为 16.4GB。这颠覆了通常的建议——你的显存预算大部分要花在权重上,而不是上下文上——一块 24GB 的显卡可以轻松跑 Q4_K_M 加 64K–96K 上下文。你还可以用 llama.cpp 的 --cache-type-k 参数进一步缩减缓存,它会量化缓存本身。

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

三个第一天就会让你栽跟头的陷阱

• 旧版 llama.cpp 构建会拒绝该文件。该 GGUF 注册了新的 qwen35 架构,因此你需要一个当前版本的构建——发布周之前的任何版本都会因架构错误而无法加载它。请先更新 llama.cpp,然后再下载。

• 模板陷阱。 官方 Jinja 聊天模板会把每个助手回合都包裹在一个 think 块中,即使推理轨迹为空,这会在多轮聊天中产生嵌套块和截断的历史记录——看起来就像模型忘了你说过什么。使用 --jinja 运行 llama.cpp,并优先选择附带修正后的 chat_template.jinja 的包。

• 视觉功能需要单独的文件。文本功能开箱即用;但除非你同时加载 mmproj 投影器(约 0.9GB),否则图像和视频会静默失效。它并未列在 unsloth 的 GGUF 仓库页面上——你可以从基础仓库或 ggml-org 打包中获取。如果你打算输入文档或截图,请在服务器命令后追加 --mmproj。

运行它:这些命令

llama.cpp,一旦你有了当前构建:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

……如果需要视觉能力,就加上 --mmproj Qwen3.8-27B-mmproj-bf16.gguf。

Ollama,如果你想用库里的条目:ollama pull qwen3.8:27b,然后 ollama run qwen3.8:27b。LM Studio 和 Unsloth Desktop 会自动识别聊天模板并启用内存卸载——对于首次运行来说,它们是最省心的选择。

本地 vs API:诚实的成本账

GGUF 是免费路线:边际成本为零,没有速率限制,也不会有任何东西离开你的机器。从绝对意义上说,它并不是一条便宜的路线——你得自备 24GB GPU(一块二手的 RTX 3090 或全新的 RTX 4090,外加电费),而在 12GB 显卡上跑 2-bit 文件,体验会大打折扣。

该 API 路由之所以存在,是因为权重采用 Apache 2.0 许可,因此提供服务的边际成本几乎为零,任何人都可以托管。Qwen3.8 27B 现已在 OrcaRouter 上线,价格为每百万输入 token 0.33 美元、每百万输出 token 2.40 美元——即按供应商标价原样转售、不加价——而由于权重是开放的,还有一个限速的免费层级,每次请求收费 0 美元,超出其配额时会返回 HTTP 429。一个具有代表性的每月 1000 万 token、输入占比 70% 的场景,在付费层级上的费用约为 9.51 美元。如果你已经拥有 GPU,本地部署在成本上更划算;如果没有,对于副业项目而言,租用 token 比买一张显卡更合适。

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

当这个推荐有误时

Q4_K_M 在 24GB 上是默认选择,并非万能答案。遇到以下情况时,请另作选择:

• 在服务器或工作站上,你需要最高质量——Q8_0 为 29GB,或 BF16 为 54.7GB,并配合 CPU 和 RAM 卸载,而不是 4 位文件。

• 您使用的是 Blackwell RTX 50 系列显卡——在同样的 24GB 显存下,NVFP4 变体的速度约快 1.5 倍,并使用 FP8 KV 缓存来支持更长的上下文。在 5090 上,NVFP4 在此模型上胜过任何 GGUF。

• 你需要完整的 262K 上下文——除了权重之外,还要为大约 16GB 的缓存留出预算;这会把 24GB 显卡压到 Q3_K_M,或者迫使你进行 KV 量化。

• 你依赖投机解码——请选择 ggml-org 包,它会保留多 token 预测头;有些量化版本为了节省约 0.5GB 会将其剥离。

• 你只有 12GB——实话实说:2-bit 的 27B 明显不如同一模型正常部署时的表现。在决定搭建本地 2-bit 方案之前,先试试免费 API 额度;如果它够用,GGUF 可以等到硬件跟上再说。

最重要的一点

Qwen3.8 27B 是罕见的能毫无妥协地装进 24GB 显卡的 27B 模型:17.1GB 的 Q4_K_M 下载文件、一份最新的 llama.cpp 构建,以及便宜到长上下文几乎不花什么代价的 KV 缓存。如果你拥有相应的硬件,就下载那个文件;记住视觉能力需要单独的 mmproj,并且第一次遇到多轮对话显得健忘时,要做好撞上模板陷阱的准备。如果你没有相应的硬件,同一个模型也提供 $0.33/$2.40 的 API,还有免费但限流的层级,所以没有理由去跑一个自己并不满意的 2-bit 文件。GGUF 是那条免费的路径;只是如今它不再是唯一的路径了。