
Hugging Face 上的 Qwen3.8-27B:官方仓库、所含内容与下载方法
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 22 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1349 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 284 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
Qwen3.8 27B 在 Hugging Face 上的地址是 Qwen/Qwen3.8-27B,由 Qwen 组织于 2026 年 8 月 14 日以 Apache 2.0 许可证发布。该仓库存放了 55.6 GB 的 BF16 safetensors 权重,分布在 18 个分片中,还有配套的 tokenizer、聊天模板和配置文件——免费下载、免费商用,且不按 token 收费。有两个地方容易让人踩坑:官方仓库只提供 safetensors 格式,而大家在消费级 GPU 上运行的 GGUF 量化版本放在单独的社区仓库中;此外,发布前曾出现过仿冒仓库,因此只有 Qwen 组织的仓库才是正版。本文是下载指南:介绍仓库内容、三种下载方式,以及如何验证你拿到的是真正的权重。
快速事实,2026年8月15日核实
• 仓库 — Qwen/Qwen3.8-27B托管于 Hugging Face,由 Qwen 组织发布;镜像位于Qwen/Qwen3.8-27B,托管于 ModelScope。
• 已发布——权重于2026年8月14日上线;按不同时区划分的报道也提到8月13日;一周前的预发布文章则称其处于待发布状态。
• 许可证 — Apache 2.0:可下载、修改和再分发,允许商业使用。
• 大小 — 55.57 GB 的 safetensors,分布在 18 个分片中(每个 2.1–3.99 GB);仓库页面将总数四舍五入为 55.6 GB。
• 模型 — 27B 密集参数(算上视觉编码器则为 28B),64 层,隐藏层大小 5,120,词表大小 248,320。
• 注意力——混合架构:48 层 Gated DeltaNet(线性注意力)层与 16 层完整 Gated Attention 层,并训练了多 token 预测——正是这 3:1 的分配比例,让 262,144 个 token 的原生上下文能在 27B 模型上运行。
• 上下文 — 原生支持 262,144 个 token,可通过 YaRN RoPE 缩放扩展至 1,000,000 个。
• 输入 — 原生图像和视频与文本一同输入;返回文本。
• Signal——模型卡片上30天滚动计数器显示的91,917次下载,查询于2026年8月15日。
以上所有数据均来自 Hugging Face 模型页面、仓库树及配置,对应的是Qwen3.8 27B,访问日期为 2026年8月15日。模型卡上宣称的基准测试数据(SWE-bench Pro 61.7、LiveCodeBench v6 90.3、OSWorld-Verified 84.3)均由 Alibaba 自行报告;截至目前,尚无独立实验室复现这些结果。
为什么要下载它:本地与API的取舍问题
开放权重是唯一一类模型,其处理一个token的边际成本仅相当于你的电费。无需许可费,无需按token付费,没有速率限制,而且没有任何数据会离开你的机器。Qwen3.8 27B采用 Apache 2.0 许可,因此这种自由是永久的:阿里巴巴无法撤回权重、重新许可或向你收费。
权衡在于硬件和部署。完整的BF16权重需要80 GB级GPU才能以原生精度运行,而55.6 GB的下载量不容小觑。如果你想在为此投入之前先评估模型,走API路线会更快:Qwen3.8 27B在OrcaRouter上以Qwen每百万输入token $0.33、每百万输出token $2.40的价格提供服务,不加任何加成——而且OrcaRouter还为同一模型提供限速的免费档,因此零成本的冒烟测试完全无需下载。但API只是便利,不是依赖——权重才是产品,而它们是免费的。
仓库里到底有什么?
这个仓库不仅仅是权重。它是一个完整可运行的包:18个分片加上Transformers、vLLM和SGLang所需的元数据文件。从上到下查看:
• model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — 权重,每个分片 2.1–3.99 GB,总计 55.57 GB。
• model.safetensors.index.json — 将每个张量映射到其分片;这是加载器首先读取的文件。
• config.json —— 架构:64 层,隐藏大小 5,120,词汇量 248,320,以及 Gated DeltaNet / Gated Attention 布局。
• tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — 分词器。
• chat_template.jinja——聊天模板,包括思考块;llama.cpp 需要将其作为 jinja 模板传入,否则模型会用思考标签回答你。
• preprocessor_config.json和video_preprocessor_config.json——图像和视频预处理。
• crc32.txt — 每个分片的校验和;用它校验下载,传输损坏不再是谜团。
• README.md(65 kB 的模型卡)、LICENSE(Apache 2.0)、generation_config.json、.gitattributes(将权重文件标记为 Git LFS)。

这种布局的一个后果与下述假仓库问题密切相关。该仓库的真正副本体积庞大且内容完整。一个名称中带有"Qwen3.8"、除README外空无一物的占位仓库,并非一次失败的下载——它是一个不同的空仓库。
如何下载它——三种方法
方法一,huggingface-cli,是最简洁的路径。该模型是公开的,因此无需登录;它会将全部18个分片及元数据拉取到一个文件夹中:
huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
对于 55.6 GB 的传输,hf_transfer 后端值得安装——它可将下载并行化,通常能大幅缩短时间:
pip install hf_transfer
HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
方法二,git clone,可将仓库作为带历史记录的工作副本获取。需要 Git LFS:
安装 git lfs
git clone https://huggingface.co/Qwen/Qwen3.8-27B
方法三,浏览器——打开“文件”选项卡并逐个下载分片。只有在您需要一个文件(例如,仅需 config.json 来检查架构)时才合理。对于整个仓库,需要手动下载 18 次并检查校验和;请使用 CLI。

你实际应该下载哪些文件
官方仓库提供的是BF16 safetensors格式——全精度,55.6 GB——如果你有80 GB级别的GPU,或者之后想自行量化,这就是正确的产物。没有官方的GGUF。人们在消费级显卡上实际运行的GGUF构建版是社区发布的:Hugging Face上列出了303个基于该基础模型量化的版本(查询于2026年8月15日),而runbooks指向的是unsloth和lmstudio-community的构建。粗略的阶梯是:
• BF16 safetensors — 55.6 GB,以原生精度运行需要 80 GB 级 GPU。
• GGUF Q8_0 — 约 29 GB,可装入 48 GB 的显卡。
• GGUF Q4_K_M — 约 17 GB,是 24 GB 显卡的标准选择。
• GGUF 2-bit——约 9 GB,勉强能装进 12 GB 显卡,但质量损失明显。
如果你想从 GGUF 构建中获得视觉能力,还需要视觉编码器的独立 mmproj 文件,这在每个社区卡上都有说明。关于量化与运行时的完整详解——包括 llama.cpp 聊天模板的注意事项——我们的运行手册提供了在本地运行 Qwen3.8 27B 的细节。
如何分辨真正的仓库和伪造的仓库
在权重文件发布之前,Hugging Face 搜索里全是没有任何权重文件的 "Qwen3.8" 仓库——那些占位卡和 fork 是为了抢先截住提前搜索的人。有些至今还在。验证清单如下:
• 请核实发布者,而不是名称。 真正的仓库位于 Qwen 组织下:Qwen/Qwen3.8-27B。名为 Qwen3.8 27B 的仓库若位于其他账户下,则并非官方发布,无论其看起来多么专业。
• 使用官方合集。 Qwen 维护着 huggingface.co/collections/Qwen/qwen38;其中的每个仓库都属于他们。
• 检查许可证字段。真实卡片显示为 Apache 2.0。
• 检查大小和形状。真正的仓库有 18 个 safetensors 分片,总计约 55.6 GB,一个 crc32.txt 校验文件,以及一个 65 kB 的 README。零权重文件意味着仓库为空,而不是下载损坏。
• 将下载量视作信号,而非确证。真正的仓库一天内下载量就突破了 91,000 次,这足以说明大家的指向。但伪造的仓库也可能被人下载;发布者才是保证。
下载完成后,验证完整性:{{1}}检查每个分片的 CRC32 是否与 crc32.txt 匹配{{/1}},或{{2}}使用 Transformers 加载模型,并确认状态字典加载时无警告{{/2}}。这样既能捕获传输损坏,也能捕获被重新打包的错误模型。
当下载是错误之举时
下载 55.6 GB 对每个人来说未必都是正确的选择,这篇文章的诚实版本也直白地说明了这一点。
你只是想评估模型。API 方式更快——一次结构化测试只需几分钱、几分钟,而不是下载模型再花一下午进行设置。
你没有接近80 GB显存的GPU。 BF16下载不适合你。请选择GGUF量化版本或API。
你需要经过验证的基准测试结果。的每一个关键数字都Qwen3.8 27B是Alibaba截至2026年8月15日报告的。如果你的决策取决于独立实验室已复现的数字,请等待它们——权重文件仍会在这里。
你正在基于一个几天前发布的模型进行构建。权重于8月14日发布。今天查看OrcaRouter的模型页面,显示过去七天的错误率为33.3%,p50首token延迟为225毫秒——这是一个处于早期负载下的全新模型,因此请将早期遥测数据视为临时数据。自托管用户应锁定其下载的提交版本并保留备用方案;API用户应保留故障转移规则作为同样的保障。

你需要一份支持合同。Apache 2.0 虽然宽松,但许可证不是 SLA。如果你的工作负载需要厂商支持,托管 API 路线是更稳妥的选择。
底线
真正的 Qwen3.8 27B位于 Hugging Face,地址是 Qwen/Qwen3.8-27B。采用 Apache 2.0 许可,发布于 2026 年 8 月 14 日,包含 18 个分片的 BF16 safetensors 文件,总大小 55.6 GB。使用 huggingface-cli 或 git clone 即可下载;确认发布者是 Qwen 组织后,你就拥有了一款最先进的开源权重 27B 模型,任何人都无法夺走它,也不会向你收费。如果你的使用场景不需要如此大的投入,通过 API 调用同一模型只需几美分。不过,权重才是关键——而且它们是免费的。
