
Qwen3.8-27B 在 vLLM 上:在一张或两张 GPU 上投入生产
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 42 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
是的 — Qwen3.8 27B 如今已在生产环境中运行于 vLLM,而且在大多数情况下,单张 GPU 即可。关键的版本是 vLLM 0.17.0 或更新:它内置了官方配方、该模型所需的混合注意力内核,以及一个兼容 OpenAI 的 /v1 端点。对于单张 Blackwell GPU,请运行 NVFP4 量化版本 — vLLM 自身的配方测得其在张量并行规模为 1 时占用 24.6 GiB 的显存。对于单张 48GB 显卡,运行 FP8。完整的 BF16 版本是一个 51.7GB 的检查点,需要一张 80GB GPU 或两张 48GB 显卡进行张量并行。具体命令如下;第一条是一行命令。
这里的所有内容均在 2026 年 8 月 15 日(权重上线的第三天)得到验证。架构、上下文和许可信息来自 Hugging Face 上的 Qwen3.8 27B 模型卡;检查点大小是该仓库 18 个 safetensors 分片的总和;vLLM 命令和 24.6 GiB 这个数字来自 vLLM 针对该模型自己的配方页面。Qwen3.8 27B 是阿里巴巴的稠密型 270 亿参数多模态模型——采用 Apache 2.0 权重,发布于 8 月 13 日至 14 日——由于权重是开放的,你可以自行部署提供服务,而不是租用 token。这个分支才是本文真正要讲的内容。
重要事实,有据可查
• 架构 — 27B 密集模型(计入视觉塔和填充词汇后为 27.8B),64 层,隐藏大小 5,120,词汇量 248,320。官方模型卡,今日已验证。
• 注意力——混合架构:16 个全注意力层、48 个 Gated DeltaNet 线性层,按 3:1 的块模式排列。只有 16 层保留不断增长的键值缓存,其余 48 层则保持固定大小的循环状态。
• 上下文 — 原生支持262,144个tokens,通过YaRN RoPE缩放可扩展至约1M。模型卡片,今日已验证。
• 输入:原生文本、图像和视频;文本输出。vLLM 通过标准 chat-completions API 提供全部三种模态,无需单独的投影器文件。
• 许可证——Apache 2.0。正是这一点,才使得"自己部署还是租用Token"的问题得以存在。
• 权重 — BF16 检查点总计 51.7GB,跨 18 个 safetensors 分片(Hugging Face,今日已验证)。Qwen 还发布了为 vLLM 构建的 FP8 和 NVFP4 检查点。
• vLLM 要求 — 0.17.0 或更高版本,且 transformers ≥ 5.8.0。今天已在 vLLM 的配方页面验证。“任何 vLLM”都不是安全的指令;新版本添加的是循环层内核。
• 多令牌预测——一种推测解码草稿头内置于检查点中,因此你无需单独的草稿模型。vLLM 文档中说明了该标志;目前尚无独立的加速数据。
GPU 天梯——哪张显卡上使用哪种量化
三种服务格式覆盖了实际应用范围。根据你实际拥有的VRAM来选择,而不是依据“最佳量化”。
• NVFP4——按照 vLLM 在 TP1 下的配置方案,总大小为 24.6 GiB(权重加 FP8 KV 缓存)。单块 Blackwell 级 GPU 即可装下——实际就是 32GB 的 RTX 5090 或 B200。这是延迟最低的路径,也是单卡可保留上下文最多的路径:vLLM 的配置方案显示,即使在 1M 上下文扩展下,KV token 容量也达到 6.6M。
• FP8——约26GB的权重。一张48GB显卡(L40S、RTX A6000、RTX 6000 Ada)即可部署并留有上下文空间;两张48GB显卡通过张量并行可提供更大的上下文长度或更高并发余量。当您想要尽可能大的KV缓存时,vLLM自身的方案可在四卡GB300机架上以TP4运行FP8。
• BF16 — 51.7GB 的权重,因此单块 80GB GPU(H100、A100 80GB、B200、GB300)或两块 48GB 显卡(TP2)即可运行。这是参考精度选项,也是下方 1M 上下文扩展命令实际使用的选项。
• MXFP4— 请勿在 NVIDIA 上使用。vLLM 的 MXFP4 路径目前缺少线性方法支持;相同的权重以 NVFP4 发布,而 NVFP4 才是 NVIDIA 方案实际使用的格式。

运行它 — vLLM 命令
低延迟单GPU默认配置(NVFP4,一块Blackwell GPU),直接取自vLLM的方案:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
同一配方中的 FP8 命令(TP4、一个 GB300 托盘、最大 KV 缓存):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
对于两张 48GB 显卡,保留 FP8 命令,使用 --tensor-parallel-size 2 而不是 4。
将此附加到任一命令以启用 MTP 推测解码:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
1M上下文的扩展(同样来自vLLM的方案):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
vLLM 自己的页面承诺了什么、又没有承诺什么
• 尚无 27B 的吞吐量数据。截至 8 月 15 日,vLLM 的 recipe 页面未发布 Qwen3.8 27B 的吞吐量或延迟基准测试结果。网上流传的“每 GPU 每秒 4,000+ tokens”的数字,属于 72-GPU GB300 NVL72 机架上的 Qwen3.8 2.4T-A95B,系供应商报告,并非本模型。你会在社区中看到的 GGUF 在 llama.cpp 或 Ollama 下的每秒 token 数——那是与 vLLM 服务不同的运行时和不同的工作负载。
• 关于廉价KV缓存的说法取决于运行时。模型卡显示64层中只有16层保留缓存,但只有服务引擎真正实现了Gated DeltaNet层时,这才有帮助。vLLM 0.17+是实现了该功能的版本;这就是为什么版本固定是本文首先提及的内容,而不是脚注。
• MTP 已内建,但此处并未测量。 草稿头位于检查点中,vLLM 文档也已记录了该标志,但尚未有人发布过该 27B 模型在 vLLM 上的独立加速数据。请根据您自己的流量进行测量。
• NVIDIA 是经过验证的路径。vLLM 的配方是为 NVIDIA GPU(NVFP4 和 FP8)编写的。这种混合注意力模型在 AMD Instinct 或 Intel Gaudi 上的部署仍属尖端前沿,本文也不故作掩饰。
自助服务,或租用代币
这就是Apache 2.0发挥作用的地方。Qwen3.8 27B没有按token收取的许可费用,所以唯一真正的问题在于你是拥有硬件,还是按量租用token。
• 自托管(本文)——你只需为GPU付费一次,之后的每个token都是免费的。你已拥有的RTX 5090让NVFP4命令成为零边际成本的端点,数据不会离开本机。如果必须租用GPU,云5090或一对A6000s就是成本项,而整个论点只有在你已经拥有显卡或有持续使用量时才成立。
• 租用 token——因为权重是开放的,多个主机都在运行它,价格下限就是硬件成本。Qwen3.8 27B 今天已在 OrcaRouter 上线,每百万输入 token 收费 0.33 美元,每百万输出 token 收费 2.40 美元——没有需要转嫁的供应商加价,因为 OrcaRouter 在自己的基础设施上运行开放权重——同样的开放权重还支撑着一个限速的免费层,每个请求收费 0 美元,超过上限时返回 HTTP 429。一个典型的 1000 万 token 月份,按 70% 输入计算,在付费层大约需要 9.51 美元。
• 决策规则——如果你已经拥有GPU,就自行托管。如果需要购买或租用GPU,那么在副业项目规模下,API很快就会收支平衡,而且同一个兼容OpenAI的客户端可以指向任一端点,因此迁移时代码无需更改。

当 vLLM 是错误的答案时
• 你只是一个人,守着一台笔记本电脑——vLLM 是服务引擎,不是桌面应用。对于单用户本地运行,使用带 Q4 GGUF 的 llama.cpp 或 Ollama 会更简单,也只需要一张 24GB 显存的显卡,而非 Blackwell GPU;我们的《如何在本地运行 Qwen3.8-27B》指南会从头到尾带你走通这条路。
• 你需要有保证的吞吐量,且零运维——自托管意味着你得自己处理告警、队列和故障转移。如果“API 宕机”不该出现在你的词汇表里,那就租用令牌,让别人来运维整套系统吧。
• 你确实需要完整约100万token的上下文,且达到前沿质量——这正是Qwen3.8 2.4T-A95B的职责所在,由vLLM或SGLang在72-GPU GB300 NVL72机架上提供推理服务。运行在一两块GPU上的Qwen3.8 27B无法与之匹敌;我们关于2.4T的部署文章解释了为什么该模型属于完全不同类别的问题。
• 你使用的是较旧的 24GB 显卡——NVFP4 是 Blackwell 格式;在 Ampere(RTX 3090)或 Ada(RTX 4090)24GB 显卡上,FP8 路径是 vLLM 的选项;除此之外,llama.cpp 下的 GGUF 量化是务实的选择。同一模型在 24GB 显卡上是另一回事。
• 您必须在一张卡上实现最大并发——上述单 GPU 默认值只是起点,而非最终的生产形态。请根据您自己的请求混合情况调整 --max-num-seqs、KV 缓存和 MTP 配置,然后再算完成。
底线
Qwen3.8 27B 是罕见的稠密 27B 模型,vLLM 可在生产环境中用单块 GPU 为其提供服务。升级到 vLLM 0.17.0+,为 32GB Blackwell 显卡拉取 NVFP4 量化版(24.6 GiB),为单张 48GB 显卡或两张张量并行显卡拉取 FP8 量化版,而为 80GB GPU 保留 BF16。命令都只需一行,端点是 OpenAI 兼容的,而且由于权重采用 Apache 2.0 许可,你可以自行部署,也可以按每百万 token $0.33/$2.40 的价格租用(提供免费额度)——无论哪种方式,客户端代码都一样。目前还没有人对 vLLM 上的 27B 给出独立的吞吐量数据,所以在启动之后,先预留一个小时的基准测试时间,再向任何人承诺延迟数字。
