一张英雄标题卡片,上面显示Qwen3.8-27B GGUF,副标题为“适合您的GPU的量化版本”,包含一个下载图标,以及Q4_K_M 17.1GB和UD-IQ2 9.0GB的文件标签。
Guides & Insights

Qwen3.8-27B GGUF:为您的GPU下载哪个量化版本

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

下载 unsloth/Qwen3.8-27B-GGUF 包,并将文件与你实际拥有的显卡匹配。这就是全部答案:24GB 显存的 GPU(RTX 4090 或 3090)应选用 Q4_K_M(17.1GB);16GB 显存的 GPU 应选用 IQ4_XS(15.7GB)(如果想留出上下文余量,可选 13.8GB 的 Q3_K_M);12GB 显存的 GPU 只能使用 2-bit 文件,UD-IQ2_XXS(9.0GB),这是一个需要清醒认识的妥协方案。Qwen3.8 27B —— 阿里巴巴的稠密 270 亿参数模型,Apache 2.0 权重于 2026 年 8 月 13–14 日发布 —— 本地运行成本异常低廉,因为其混合注意力机制仅缓存 64 层中的 16 层,所以在 24GB 显存上运行 4-bit 量化可轻松承载 32K–64K token 的上下文。而且 GGUF 是唯一零边际成本的途径:无需 API 密钥,不按 token 计费,数据也不会离开你的机器。

关于信息来源:架构、上下文窗口和许可证均为官方信息,来自 Hugging Face 上的 Qwen3.8 27B 模型卡,于 2026 年 8 月 15 日核实。GGUF 文件大小来自 unsloth 和 ggml-org 的 GGUF 仓库,同日获取。每 GPU 的显存(VRAM)建议来自 unsloth 的官方推荐。KV 缓存字节估算和每秒 token 数为发布后最初几天内的社区实测数据,并非厂商规格。下文列出的每项基准测试均由 Alibaba 报告,且未经复现。

文件选择器,每个数量一行。

UD-IQ2_XXS — 9.0GB — 是12GB显卡唯一舒适的选择;预计会有明显的画质损失。

UD-Q2_K_XL — 10.7GB — 12GB显卡,上下文空间几乎所剩无几。

Q3_K_M — 13.8GB — 适合需要上下文余量的16GB显卡。

IQ4_XS — 15.7GB — 16GB显卡:能完整容纳的最大量化版本。

Q4_K_M — 17.1GB — 24GB显卡:最佳选择,也是本文推荐的文件。

Q5_K_M — 19.8GB — 24GB,以上下文余量换取小幅质量提升。

Q6_K — 22.9GB — 勉强能塞进24GB;近乎无损。

Q8_0 — 29.0GB — 32GB,双卡拆分或CPU卸载。

BF16 — 54.7GB — 服务器显卡和高内存 CPU 配置;参考精度。

两个包,两种 Q4_K_M 大小:unsloth 的是 17.1GB;ggml-org 的是 19.0GB。unsloth 的包对其 UD-* 文件使用 Dynamic V3.0(预览版)量化,也是大多数本地应用默认使用的那个;ggml-org 的包则提供标准 K-quants,外加用于推测解码的独立多 token 预测头。两个 Q4_K_M 版本都可以用——差别只是几百 MB 和 MTP 文件。

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

为什么这个27B能装进比大多数都小的显卡里

Qwen3.8 27B 拥有 64 层,但只有 16 层使用全注意力。其余 48 层使用 Gated DeltaNet 线性注意力,它保持固定大小的循环状态,而不是不断增长的键值缓存。模型卡自带的块布局是每 1×(Gated Attention → FFN) 对应 3×(Gated DeltaNet → FFN)——即 3:1 的混合比例。实际效果是:同等上下文下,KV 缓存约为传统 27B 稠密模型所需的大约四分之一。本周的社区实测显示,8K 上下文下缓存约为 0.5GB,32K 下约为 2.0GB,在完整的 262K 原生窗口下约为 16.4GB。这颠覆了通常的建议——你的显存预算大部分花在权重上,而不是上下文上;一张 24GB 显卡可以在 64K–96K 上下文下轻松运行 Q4_K_M。你还可以通过 llama.cpp 的 --cache-type-k 标志进一步压缩缓存,该标志会对缓存本身进行量化。

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

三个第一天就会让你栽跟头的陷阱

旧的 llama.cpp 构建会拒绝该文件。GGUF 注册了新的 qwen35 架构,因此你需要一个当前的构建版本——发布周之前的任何版本在加载时都会报架构错误。请先更新 llama.cpp,再下载。

模板陷阱。 官方 Jinja 聊天模板会将每个助手轮次都包裹在思考块中,即使推理痕迹为空,这会在多轮对话中产生嵌套块和被截断的历史记录——看起来就像模型忘记了你说过的话。使用 --jinja 运行 llama.cpp,并优先选择附带已修正的 chat_template.jinja 的软件包。

视觉功能需要一个单独的文件。文本功能开箱即用;图像和视频则静默无效,除非你同时加载 mmproj 投影器(约 0.9GB)。它没有列在 unsloth 的 GGUF 仓库页面上——请从基础仓库或 ggml-org 压缩包中获取。如果你打算输入文档或截图,请在服务器命令后追加 --mmproj。

运行它:命令

llama.cpp,一旦你拥有当前构建:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...如果你需要视觉功能,请添加 --mmproj Qwen3.8-27B-mmproj-bf16.gguf。

Ollama,如果你想要这个库条目:先运行 ollama pull qwen3.8:27b,再运行 ollama run qwen3.8:27b。LM Studio 和 Unsloth Desktop 会自动读取聊天模板并自动进行内存卸载——它们是首次运行时最省事的路径。

本地 vs API:真实的经济账

GGUF 是免费路线:边际成本为零,没有速率限制,数据不会离开你的机器。但从绝对成本来看,它并非廉价路线——你得自备 24GB 显存的 GPU(二手 RTX 3090 或全新 RTX 4090,外加电费),而在 12GB 显存的显卡上运行 2-bit 文件,体验会大打折扣。

API 路由之所以存在,是因为权重采用 Apache 2.0 许可,因此服务的边际成本几乎为零,任何人都可以托管。Qwen3.8 27B 今天已在 OrcaRouter 上线,输入每百万 token 0.33 美元,输出每百万 token 2.40 美元——按提供商列表价格原价转售,不加任何加价——而且由于权重是开放的,还有一个限速免费层,每请求收费 0 美元,超过上限时返回 HTTP 429。一个典型的每月 1000 万 token 使用量、其中 70% 为输入的场景,在付费层大约需要 9.51 美元。如果你已经拥有 GPU,本地部署在成本上更划算;如果没有,那么按量租用 token 比为了一个副业项目买一块显卡更合适。

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

当此推荐有误时。

Q4_K_M 在 24GB 上是默认选择,而非通用答案。在以下情况中选择其他方案:

您需要在服务器或工作站上获得最高质量——即 Q8_0 格式 29GB 或 BF16 格式 54.7GB,支持 CPU 和 RAM 卸载,而不是 4-bit 文件。

你正在使用 Blackwell RTX 50 系列显卡——NVFP4 变体在同样的 24GB 显存下大约快 1.5 倍,并使用 FP8 KV 缓存以获得更长的上下文。在 5090 上,NVFP4 在这款模型上胜过任何 GGUF。

你需要完整的262K上下文——除了权重之外,还需为约16GB的缓存预留空间;这会让24GB显卡只能使用Q3_K_M量化级别,或迫使进行KV量化。

你依赖投机解码 — 选择ggml-org包,它保留了多token预测头;有些量化版本会移除它以节省约0.5GB空间。

你只有12GB——坦白说:2-bit量化版的27B模型明显不如正常部署的同一模型。在投入本地2-bit方案之前,先试试免费API接口;如果效果够用,GGUF可以等硬件跟上后再考虑。

底线

Qwen3.8 27B是少有的能无妥协地放进24GB显卡的27B模型:17.1GB的Q4_K_M下载文件、当前版本的llama.cpp构建,以及足够便宜的KV缓存,让长上下文几乎不花什么成本。如果你拥有这块硬件,就下载那个文件;记住视觉功能需要单独的mmproj;并且要提防模板陷阱——当多轮对话第一次看起来像在遗忘时。如果你不拥有这块硬件,同一个模型也可以作为$0.33/$2.40的API使用,带免费限流额度,所以没有理由去运行一个你自己都不满意的2-bit文件。GGUF是免费路径;只是它不再是唯一的路径了。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube