一张主视觉标题卡片,上面显示 Qwen3.8-27B on vLLM,副标题为“可在单卡或双卡 GPU 上投入生产”,包含一个服务器图标,以及标注为 NVFP4 24.6 GiB、FP8 48GB 和 BF16 80GB 的格式标签。
Guides & Insights

Qwen3.8-27B 在 vLLM 上:在一张或两张 GPU 上投入生产

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

是的 — Qwen3.8 27B 如今已在生产环境中运行于 vLLM,而且在大多数情况下,单张 GPU 即可。关键的版本是 vLLM 0.17.0 或更新:它内置了官方配方、该模型所需的混合注意力内核,以及一个兼容 OpenAI 的 /v1 端点。对于单张 Blackwell GPU,请运行 NVFP4 量化版本 — vLLM 自身的配方测得其在张量并行规模为 1 时占用 24.6 GiB 的显存。对于单张 48GB 显卡,运行 FP8。完整的 BF16 版本是一个 51.7GB 的检查点,需要一张 80GB GPU 或两张 48GB 显卡进行张量并行。具体命令如下;第一条是一行命令。

这里的所有内容均在 2026 年 8 月 15 日(权重上线的第三天)得到验证。架构、上下文和许可信息来自 Hugging Face 上的 Qwen3.8 27B 模型卡;检查点大小是该仓库 18 个 safetensors 分片的总和;vLLM 命令和 24.6 GiB 这个数字来自 vLLM 针对该模型自己的配方页面。Qwen3.8 27B 是阿里巴巴的稠密型 270 亿参数多模态模型——采用 Apache 2.0 权重,发布于 8 月 13 日至 14 日——由于权重是开放的,你可以自行部署提供服务,而不是租用 token。这个分支才是本文真正要讲的内容。

重要事实,有据可查

架构 — 27B 密集模型(计入视觉塔和填充词汇后为 27.8B),64 层,隐藏大小 5,120,词汇量 248,320。官方模型卡,今日已验证。

注意力——混合架构:16 个全注意力层、48 个 Gated DeltaNet 线性层,按 3:1 的块模式排列。只有 16 层保留不断增长的键值缓存,其余 48 层则保持固定大小的循环状态。

上下文 — 原生支持262,144个tokens,通过YaRN RoPE缩放可扩展至约1M。模型卡片,今日已验证。

输入:原生文本、图像和视频;文本输出。vLLM 通过标准 chat-completions API 提供全部三种模态,无需单独的投影器文件。

许可证——Apache 2.0。正是这一点,才使得"自己部署还是租用Token"的问题得以存在。

权重 — BF16 检查点总计 51.7GB,跨 18 个 safetensors 分片(Hugging Face,今日已验证)。Qwe​n 还发布了为 vLLM 构建的 FP8 和 NVFP4 检查点。

vLLM 要求 — 0.17.0 或更高版本,且 transformers ≥ 5.8.0。今天已在 vLLM 的配方页面验证。“任何 vLLM”都不是安全的指令;新版本添加的是循环层内核。

多令牌预测——一种推测解码草稿头内置于检查点中,因此你无需单独的草稿模型。vLLM 文档中说明了该标志;目前尚无独立的加速数据。

GPU 天梯——哪张显卡上使用哪种量化

三种服务格式覆盖了实际应用范围。根据你实际拥有的VRAM来选择,而不是依据“最佳量化”。

NVFP4——按照 vLLM 在 TP1 下的配置方案,总大小为 24.6 GiB(权重加 FP8 KV 缓存)。单块 Blackwell 级 GPU 即可装下——实际就是 32GB 的 RTX 5090 或 B200。这是延迟最低的路径,也是单卡可保留上下文最多的路径:vLLM 的配置方案显示,即使在 1M 上下文扩展下,KV token 容量也达到 6.6M。

FP8——约26GB的权重。一张48GB显卡(L40S、RTX A6000、RTX 6000 Ada)即可部署并留有上下文空间;两张48GB显卡通过张量并行可提供更大的上下文长度或更高并发余量。当您想要尽可能大的KV缓存时,vLLM自身的方案可在四卡GB300机架上以TP4运行FP8。

BF16 — 51.7GB 的权重,因此单块 80GB GPU(H100、A100 80GB、B200、GB300)或两块 48GB 显卡(TP2)即可运行。这是参考精度选项,也是下方 1M 上下文扩展命令实际使用的选项。

MXFP4— 请勿在 NVIDIA 上使用。vLLM 的 MXFP4 路径目前缺少线性方法支持;相同的权重以 NVFP4 发布,而 NVFP4 才是 NVIDIA 方案实际使用的格式。

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

运行它 — vLLM 命令

低延迟单GPU默认配置(NVFP4,一块Blackwell GPU),直接取自vLLM的方案:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

同一配方中的 FP8 命令(TP4、一个 GB300 托盘、最大 KV 缓存):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

对于两张 48GB 显卡,保留 FP8 命令,使用 --tensor-parallel-size 2 而不是 4。

将此附加到任一命令以启用 MTP 推测解码:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

1M上下文的扩展(同样来自vLLM的方案):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

vLLM 自己的页面承诺了什么、又没有承诺什么

尚无 27B 的吞吐量数据。截至 8 月 15 日,vLLM 的 recipe 页面未发布 Qwen3.8 27B 的吞吐量或延迟基准测试结果。网上流传的“每 GPU 每秒 4,000+ tokens”的数字,属于 72-GPU GB300 NVL72 机架上的 Qwen3.8 2.4T-A95B,系供应商报告,并非本模型。你会在社区中看到的 GGUF 在 llama.cpp 或 Ollama 下的每秒 token 数——那是与 vLLM 服务不同的运行时和不同的工作负载。

关于廉价KV缓存的说法取决于运行时。模型卡显示64层中只有16层保留缓存,但只有服务引擎真正实现了Gated DeltaNet层时,这才有帮助。vLLM 0.17+是实现了该功能的版本;这就是为什么版本固定是本文首先提及的内容,而不是脚注。

MTP 已内建,但此处并未测量。 草稿头位于检查点中,vLLM 文档也已记录了该标志,但尚未有人发布过该 27B 模型在 vLLM 上的独立加速数据。请根据您自己的流量进行测量。

NVIDIA 是经过验证的路径。vLLM 的配方是为 NVIDIA GPU(NVFP4 和 FP8)编写的。这种混合注意力模型在 AMD Instinct 或 Intel Gaudi 上的部署仍属尖端前沿,本文也不故作掩饰。

自助服务,或租用代币

这就是Apache 2.0发挥作用的地方。Qwen3.8 27B没有按token收取的许可费用,所以唯一真正的问题在于你是拥有硬件,还是按量租用token。

自托管(本文)——你只需为GPU付费一次,之后的每个token都是免费的。你已拥有的RTX 5090让NVFP4命令成为零边际成本的端点,数据不会离开本机。如果必须租用GPU,云5090或一对A6000s就是成本项,而整个论点只有在你已经拥有显卡或有持续使用量时才成立。

租用 token——因为权重是开放的,多个主机都在运行它,价格下限就是硬件成本。Qwen3.8 27B 今天已在 OrcaRouter 上线,每百万输入 token 收费 0.33 美元,每百万输出 token 收费 2.40 美元——没有需要转嫁的供应商加价,因为 OrcaRouter 在自己的基础设施上运行开放权重——同样的开放权重还支撑着一个限速的免费层,每个请求收费 0 美元,超过上限时返回 HTTP 429。一个典型的 1000 万 token 月份,按 70% 输入计算,在付费层大约需要 9.51 美元。

决策规则——如果你已经拥有GPU,就自行托管。如果需要购买或租用GPU,那么在副业项目规模下,API很快就会收支平衡,而且同一个兼容O​penAI的客户端可以指向任一端点,因此迁移时代码无需更改。

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

当 vLLM 是错误的答案时

你只是一个人,守着一台笔记本电脑——vLLM 是服务引擎,不是桌面应用。对于单用户本地运行,使用带 Q4 GGUF 的 llama.cpp 或 Ollama 会更简单,也只需要一张 24GB 显存的显卡,而非 Blackwell GPU;我们的《如何在本地运行 Qwen3.8-27B》指南会从头到尾带你走通这条路。

你需要有保证的吞吐量,且零运维——自托管意味着你得自己处理告警、队列和故障转移。如果“API 宕机”不该出现在你的词汇表里,那就租用令牌,让别人来运维整套系统吧。

你确实需要完整约100万token的上下文,且达到前沿质量——这正是Qwen3.8 2.4T-A95B的职责所在,由vLLM或SGLang在72-GPU GB300 NVL72机架上提供推理服务。运行在一两块GPU上的Qwen3.8 27B无法与之匹敌;我们关于2.4T的部署文章解释了为什么该模型属于完全不同类别的问题。

你使用的是较旧的 24GB 显卡——NVFP4 是 Blackwell 格式;在 Ampere(RTX 3090)或 Ada(RTX 4090)24GB 显卡上,FP8 路径是 vLLM 的选项;除此之外,llama.cpp 下的 GGUF 量化是务实的选择。同一模型在 24GB 显卡上是另一回事。

您必须在一张卡上实现最大并发——上述单 GPU 默认值只是起点,而非最终的生产形态。请根据您自己的请求混合情况调整 --max-num-seqs、KV 缓存和 MTP 配置,然后再算完成。

底线

Qwen3.8 27B 是罕见的稠密 27B 模型,vLLM 可在生产环境中用单块 GPU 为其提供服务。升级到 vLLM 0.17.0+,为 32GB Blackwell 显卡拉取 NVFP4 量化版(24.6 GiB),为单张 48GB 显卡或两张张量并行显卡拉取 FP8 量化版,而为 80GB GPU 保留 BF16。命令都只需一行,端点是 OpenAI 兼容的,而且由于权重采用 Apache 2.0 许可,你可以自行部署,也可以按每百万 token $0.33/$2.40 的价格租用(提供免费额度)——无论哪种方式,客户端代码都一样。目前还没有人对 vLLM 上的 27B 给出独立的吞吐量数据,所以在启动之后,先预留一个小时的基准测试时间,再向任何人承诺延迟数字。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube