Qwen3.8-27B Hugging Face 下载指南的标题卡片,展示仓库路径 Qwen/Qwen3.8-27B、Apache 2.0 许可证徽章,以及 BF16、55.6 GB 和 18 个 safetensors 分片等标签。
Guides & Insights

Hugging Face 上的 Qwen3.8-27B:官方仓库、所含内容与下载方法

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8 27B 在 Hugging Face 上的地址是 Qwen/Qwen3.8-27B,由 Qwe​n 组织于 2026 年 8 月 14 日以 Apache 2.0 许可证发布。该仓库存放了 55.6 GB 的 BF16 safetensors 权重,分布在 18 个分片中,还有配套的 tokenizer、聊天模板和配置文件——免费下载、免费商用,且不按 token 收费。有两个地方容易让人踩坑:官方仓库只提供 safetensors 格式,而大家在消费级 GPU 上运行的 GGUF 量化版本放在单独的社区仓库中;此外,发布前曾出现过仿冒仓库,因此只有 Qwe​n 组织的仓库才是正版。本文是下载指南:介绍仓库内容、三种下载方式,以及如何验证你拿到的是真正的权重。

快速事实,2026年8月15日核实

仓库Qwen/Qwen3.8-27B托管于 Hugging Face,由 Qwen 组织发布;镜像位于Qwen/Qwen3.8-27B,托管于 ModelScope。

已发布——权重于2026年8月14日上线;按不同时区划分的报道也提到8月13日;一周前的预发布文章则称其处于待发布状态。

许可证 — Apache 2.0:可下载、修改和再分发,允许商业使用。

大小 — 55.57 GB 的 safetensors,分布在 18 个分片中(每个 2.1–3.99 GB);仓库页面将总数四舍五入为 55.6 GB。

模型 — 27B 密集参数(算上视觉编码器则为 28B),64 层,隐藏层大小 5,120,词表大小 248,320。

注意力——混合架构:48 层 Gated DeltaNet(线性注意力)层与 16 层完整 Gated Attention 层,并训练了多 token 预测——正是这 3:1 的分配比例,让 262,144 个 token 的原生上下文能在 27B 模型上运行。

上下文 — 原生支持 262,144 个 token,可通过 YaRN RoPE 缩放扩展至 1,000,000 个。

输入 — 原生图像和视频与文本一同输入;返回文本。

Signal——模型卡片上30天滚动计数器显示的91,917次下载,查询于2026年8月15日。

以上所有数据均来自 Hugging Face 模型页面、仓库树及配置,对应的是Qwen3.8 27B,访问日期为 2026年8月15日。模型卡上宣称的基准测试数据(SWE-bench Pro 61.7、LiveCodeBench v6 90.3、OSWorld-Verified 84.3)均由 Ali​baba 自行报告;截至目前,尚无独立实验室复现这些结果。

为什么要下载它:本地与API的取舍问题

开放权重是唯一一类模型,其处理一个token的边际成本仅相当于你的电费。无需许可费,无需按token付费,没有速率限制,而且没有任何数据会离开你的机器。Qwen3.8 27B采用 Apache 2.0 许可,因此这种自由是永久的:阿里巴巴无法撤回权重、重新许可或向你收费。

权衡在于硬件和部署。完整的BF16权重需要80 GB级GPU才能以原生精度运行,而55.6 GB的下载量不容小觑。如果你想在为此投入之前先评估模型,走API路线会更快:Qwen3.8 27B在OrcaRouter上以Qwe​n每百万输入token $0.33、每百万输出token $2.40的价格提供服务,不加任何加成——而且OrcaRouter还为同一模型提供限速的免费档,因此零成本的冒烟测试完全无需下载。但API只是便利,不是依赖——权重才是产品,而它们是免费的。

仓库里到底有什么?

这个仓库不仅仅是权重。它是一个完整可运行的包:18个分片加上Transformers、vLLM和SGLang所需的元数据文件。从上到下查看:

model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — 权重,每个分片 2.1–3.99 GB,总计 55.57 GB。

model.safetensors.index.json — 将每个张量映射到其分片;这是加载器首先读取的文件。

config.json —— 架构:64 层,隐藏大小 5,120,词汇量 248,320,以及 Gated DeltaNet / Gated Attention 布局。

tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — 分词器。

chat_template.jinja——聊天模板,包括思考块;llama.cpp 需要将其作为 jinja 模板传入,否则模型会用思考标签回答你。

preprocessor_config.jsonvideo_preprocessor_config.json——图像和视频预处理。

crc32.txt — 每个分片的校验和;用它校验下载,传输损坏不再是谜团。

README.md(65 kB 的模型卡)、LICENSE(Apache 2.0)、generation_config.json.gitattributes(将权重文件标记为 Git LFS)。

A repository file-table card for Qwen/Qwen3.8-27B: 18 safetensors weight shards at 2.1 to 3.99 GB each totalling 55.57 GB, plus the index, config, tokenizer files, chat template, checksum file, model card, and license with their sizes.

这种布局的一个后果与下述假仓库问题密切相关。该仓库的真正副本体积庞大且内容完整。一个名称中带有"Qwen3.8"、除README外空无一物的占位仓库,并非一次失败的下载——它是一个不同的空仓库。

如何下载它——三种方法

方法一,huggingface-cli,是最简洁的路径。该模型是公开的,因此无需登录;它会将全部18个分片及元数据拉取到一个文件夹中:

huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

对于 55.6 GB 的传输,hf_transfer 后端值得安装——它可将下载并行化,通常能大幅缩短时间:

pip install hf_transfer

HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

方法二,git clone,可将仓库作为带历史记录的工作副本获取。需要 Git LFS:

安装 git lfs

git clone https://huggingface.co/Qwen/Qwen3.8-27B

方法三,浏览器——打开“文件”选项卡并逐个下载分片。只有在您需要一个文件(例如,仅需 config.json 来检查架构)时才合理。对于整个仓库,需要手动下载 18 次并检查校验和;请使用 CLI。

A download-command card showing the three ways to fetch Qwen/Qwen3.8-27B: the recommended huggingface-cli download with --local-dir, the hf_transfer speed-up one-liner, and a git clone with Git LFS installed.

你实际应该下载哪些文件

官方仓库提供的是BF16 safetensors格式——全精度,55.6 GB——如果你有80 GB级别的GPU,或者之后想自行量化,这就是正确的产物。没有官方的GGUF。人们在消费级显卡上实际运行的GGUF构建版是社区发布的:Hugging Face上列出了303个基于该基础模型量化的版本(查询于2026年8月15日),而runbooks指向的是unsloth和lmstudio-community的构建。粗略的阶梯是:

BF16 safetensors — 55.6 GB,以原生精度运行需要 80 GB 级 GPU。

GGUF Q8_0 — 约 29 GB,可装入 48 GB 的显卡。

GGUF Q4_K_M — 约 17 GB,是 24 GB 显卡的标准选择。

GGUF 2-bit——约 9 GB,勉强能装进 12 GB 显卡,但质量损失明显。

如果你想从 GGUF 构建中获得视觉能力,还需要视觉编码器的独立 mmproj 文件,这在每个社区卡上都有说明。关于量化与运行时的完整详解——包括 llama.cpp 聊天模板的注意事项——我们的运行手册提供了在本地运行 Qwen3.8 27B 的细节。

如何分辨真正的仓库和伪造的仓库

在权重文件发布之前,Hugging Face 搜索里全是没有任何权重文件的 "Qwen3.8" 仓库——那些占位卡和 fork 是为了抢先截住提前搜索的人。有些至今还在。验证清单如下:

请核实发布者,而不是名称。 真正的仓库位于 Qwen 组织下:Qwen/Qwen3.8-27B。名为 Qwen3.8 27B 的仓库若位于其他账户下,则并非官方发布,无论其看起来多么专业。

使用官方合集。 Qwe​n 维护着 huggingface.co/collections/Qwen/qwen38;其中的每个仓库都属于他们。

检查许可证字段。真实卡片显示为 Apache 2.0。

检查大小和形状。真正的仓库有 18 个 safetensors 分片,总计约 55.6 GB,一个 crc32.txt 校验文件,以及一个 65 kB 的 README。零权重文件意味着仓库为空,而不是下载损坏。

将下载量视作信号,而非确证。真正的仓库一天内下载量就突破了 91,000 次,这足以说明大家的指向。但伪造的仓库也可能被人下载;发布者才是保证。

下载完成后,验证完整性:{{1}}检查每个分片的 CRC32 是否与 crc32.txt 匹配{{/1}},或{{2}}使用 Transformers 加载模型,并确认状态字典加载时无警告{{/2}}。这样既能捕获传输损坏,也能捕获被重新打包的错误模型。

当下载是错误之举时

下载 55.6 GB 对每个人来说未必都是正确的选择,这篇文章的诚实版本也直白地说明了这一点。

你只是想评估模型。API 方式更快——一次结构化测试只需几分钱、几分钟,而不是下载模型再花一下午进行设置。

你没有接近80 GB显存的GPU。 BF16下载不适合你。请选择GGUF量化版本或API。

你需要经过验证的基准测试结果。的每一个关键数字都Qwen3.8 27B是Ali​baba截至2026年8月15日报告的。如果你的决策取决于独立实验室已复现的数字,请等待它们——权重文件仍会在这里。

你正在基于一个几天前发布的模型进行构建。权重于8月14日发布。今天查看OrcaRouter的模型页面,显示过去七天的错误率为33.3%,p50首token延迟为225毫秒——这是一个处于早期负载下的全新模型,因此请将早期遥测数据视为临时数据。自托管用户应锁定其下载的提交版本并保留备用方案;API用户应保留故障转移规则作为同样的保障。

The OrcaRouter model page for Qwen3.8 27B at qwen/qwen3.8-27b, showing the by-Qwen vendor label, vision-tools-JSON capability badges, a 262K-token context window, text-image-and-video input, and p50 first-token latency of 225 ms.

你需要一份支持合同。Apache 2.0 虽然宽松,但许可证不是 SLA。如果你的工作负载需要厂商支持,托管 API 路线是更稳妥的选择。

底线

真正的 Qwen3.8 27B位于 Hugging Face,地址是 Qwen/Qwen3.8-27B。采用 Apache 2.0 许可,发布于 2026 年 8 月 14 日,包含 18 个分片的 BF16 safetensors 文件,总大小 55.6 GB。使用 huggingface-cli 或 git clone 即可下载;确认发布者是 Qwe​n 组织后,你就拥有了一款最先进的开源权重 27B 模型,任何人都无法夺走它,也不会向你收费。如果你的使用场景不需要如此大的投入,通过 API 调用同一模型只需几美分。不过,权重才是关键——而且它们是免费的。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube