Qwen3.8-27B on vLLM と表示され、サブタイトルに「1枚または2枚のGPUで本番環境にデプロイ」と書かれたヒーロータイトルカード、サーバーアイコン、および NVFP4 24.6 GiB、FP8 48GB、BF16 80GB とラベル付けされたフォーマットチップ。
Guides & Insights

vLLM上のQwen3.8-27B: 1台または2台のGPUで本番環境にデプロイする

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

はい — Qwen3.8 27B は現在 vLLM 上で本番稼働しており、ほとんどの場合は単一 GPU で動作します。重要なバージョンは vLLM 0.17.0 以降です。このバージョンには、公式レシピ、このモデルが必要とするハイブリッドアテンションカーネル、そして O​penAI 互換の /v1 エンドポイントが同梱されています。Blackwell GPU 1 枚の場合、NVFP4 量子化を実行してください。vLLM 自身のレシピでは、テンソル並列サイズ 1 で 24.6 GiB の VRAM と測定されています。48GB カード 1 枚の場合、FP8 を実行します。完全な BF16 は 51.7GB のチェックポイントで、80GB GPU 1 枚か、48GB カード 2 枚をテンソル並列で使用します。正確なコマンドは以下にあります。最初のものは 1 行コマンドです。

ここに記載されている内容はすべて、ウェイトが公開されてから3日目の2026年8月15日に検証されました。アーキテクチャ、コンテキスト、ライセンスは、Hugging Face上のQwen3.8 27Bモデルカードに基づいており、チェックポイントサイズはリポジトリ内の18個のsafetensorsシャードの合計です。vLLMのコマンドと24.6 GiBという数値は、このモデルに関するvLLM公式のレシピページからのものです。Qwen3.8 27Bは、Ali​babaによる270億パラメータのデンス型マルチモーダルモデルです。Apache 2.0ライセンスのウェイトで、8月13日から14日にリリースされました。ウェイトがオープンであるため、トークンをレンタルする代わりに、自分でサーブ(推論を実行)できます。この記事が本当に取り上げているのは、その分岐点です。

重要な事実を、出典付きで。

アーキテクチャ — 27Bのdense(ビジョンタワーとパディングされた語彙を含めると27.8B)、64層、隠れサイズ5,120、語彙数248,320。公式モデルカード、本日確認済み。

アテンション — ハイブリッド: フルアテンション層16層と、Gated DeltaNet線形層48層を3:1のブロックパターンで配置。増大し続けるキー・バリューキャッシュを保持するのは16層のみで、残りの48層は代わりに固定サイズのリカレント状態を保持します。

コンテキスト — ネイティブで262,144トークン、YaRN RoPEスケーリングにより約100万トークンまで拡張可能。モデルカード、本日確認済み。

入力 — テキスト、画像、動画にネイティブ対応、テキスト出力。vLLM は標準の chat-completions API を通じてこれら 3 つすべてを公開しており、別のプロジェクターファイルは不要です。

ライセンス — Apache 2.0。この一点こそが、「自分で運用する vs トークンをレンタルする」という疑問がそもそも存在する理由です。

重み — BF16チェックポイントは合計51.7GBで、18個のsafetensorsシャードに分散しています(Hugging Face、本日確認済み)。Qwe​nはまた、vLLM向けに構築されたFP8およびNVFP4チェックポイントも公開しています。

vLLMの要件 — 0.17.0以降、transformers ≥ 5.8.0が必要。本日、vLLMのレシピページで確認済み。「どのvLLMでも」は安全な指示ではありません。新しいバージョンで追加されるのは、リカレント層のカーネルです。

マルチトークン予測 — 投機的デコーディングのドラフトヘッドがチェックポイントに組み込まれているため、別個のドラフトモデルは不要です。vLLMにはこのフラグのドキュメントがありますが、独立した高速化の数値はまだ存在しません。

GPUラダー — どのカードにどの量子化か

「3つのサービングフォーマットが実用的な範囲をカバーしています。「ベストな量子化」ではなく、実際に搭載しているVRAMに基づいて選んでください。」

NVFP4 — vLLMのレシピ(TP1)によると、合計24.6 GiB(重みとFP8 KVキャッシュを含む)。単一のBlackwellクラスGPUに収まる — 実際には32GBのRTX 5090またはB200。これは最も低遅延の経路であり、1カードあたりのコンテキストを最も多く保持するものです:vLLMのレシピによると、1Mコンテキスト拡張でも6.6M KVトークン容量を報告しています。

FP8 — 重みは約26GB。48GBカード1枚(L40S、RTX A6000、RTX 6000 Ada)で、コンテキスト用の余裕を残して処理できる。テンソル並列で48GBカード2枚を使えば、より長いコンテキストやより高い同時実行性に対応できる。最大のKVキャッシュが必要なら、vLLMの独自レシピは4つのGPUを備えたGB300トレイ全体でTP4のFP8を実行する。

BF16 — 重みは51.7GBなので、80GB GPU1枚(H100、A100 80GB、B200、GB300)またはTP2で48GBカード2枚で足ります。これは参照精度のオプションであり、以下の1Mコンテキスト拡張コマンドが実際に使用するものです。

MXFP4 — NVIDIA では使用しないでください。vLLM の MXFP4 パスには現在、linear-method のサポートがありません。同じ重みは NVFP4 として公開されており、これは NVIDIA レシピが実際に使用する形式です。

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

実行してください — vLLMコマンドを

低遅延シングルGPUのデフォルト(NVFP4、Blackwell GPU 1基)、vLLMのレシピからの原文:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

同じレシピからのFP8コマンド(TP4、GB300トレイ1台、最大KVキャッシュ):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

48GBカード2枚の場合、FP8コマンドを維持し、--tensor-parallel-size 2を4の代わりに設定します。

MTP投機的デコードを有効にするには、この内容をどちらかのコマンドに追加してください:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

1Mコンテキスト拡張(これもvLLMのレシピから):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

vLLM自身のページが約束することと約束しないこと

まだ27Bのスループット数値はありません。 8月15日時点で、vLLMのレシピページにはQwen3.8 27Bのスループットやレイテンシのベンチマークは公開されていません。出回っている「1 GPUあたり毎秒4,000+トークン」という数値は、72-GPU GB300 NVL72ラック上のQwen3.8 2.4T-A95Bのもので、ベンダー報告値であり、このモデルのものではありません。また、コミュニティで見かけるllama.cppやOllamaにおけるGGUFの秒間トークン数は、vLLMサービングとは異なるランタイムおよび異なるワークロードのものです。

「低コストKVキャッシュ」という主張は実行環境に依存します。モデルカードには64層中16層のみがキャッシュを保持すると記載されていますが、これはサービングエンジンが実際にGated DeltaNet層を実装している場合にのみ有効です。vLLM 0.17+がその実装を含むバージョンであり、この記事でバージョン固定を脚注ではなく最初に挙げているのはそのためです。

MTPは組み込まれていますが、ここでは未測定です。 ドラフトヘッドはチェックポイントにあり、vLLMはそのフラグを文書化していますが、この27BについてvLLM上での独立した高速化数値をまだ誰も公開していません。それを自分のトラフィックで測定する計画を立ててください。

NVIDIA は検証済みの経路です。vLLM のレシピは NVIDIA GPU(NVFP4 および FP8)向けに書かれています。このハイブリッドアテンションモデルの AMD Instinct や Intel Gaudi へのデプロイは依然として最先端の領域であり、本記事もその点を隠すつもりはありません。

自分でサーブするか、トークンをレンタルしてください。

これこそがApache 2.0の働く場です。Qwen3.8 27Bにはトークンごとのライセンス料がないため、本当に問われるのは、ハードウェアを所有するか、トークンをレンタルするかだけです。

セルフホスト(本記事) — GPUに一度だけ支払えば、それ以降のトークンはすべて無料です。すでに所有しているRTX 5090なら、NVFP4コマンドはデータを外部に出さない限界費用ゼロのエンドポイントになります。GPUをレンタルしなければならない場合、クラウドの5090やA6000を2枚組で使うのが費用項目となり、この議論が成立するのは、すでにカードを持っているか、継続的な利用量がある場合だけです。

トークンをレンタル — 重みがオープンであるため、複数のホストがそれを実行し、価格の下限はハードウェアコストです。Qwen3.8 27Bは本日OrcaRouterで利用可能で、入力トークン100万あたり$0.33、出力トークン100万あたり$2.40です — OrcaRouterはオープンウェイトを自社インフラで実行しているため、転嫁すべきベンダーマークアップはありません — そして同じオープンウェイトが、リクエストあたり$0で、上限を超えるとHTTP 429を返すレート制限付き無料ティアを賄っています。代表的な例として、入力70%で月間1000万トークンの場合、有料ティアでは約$9.51になります。

判断ルール — すでに GPU を所有しているなら、セルフホストする。もし GPU を購入またはレンタルする必要があるなら、API はサイドプロジェクト規模ですぐに元が取れ、同じ O​penAI 互換クライアントはどちらのエンドポイントにも接続できるので、移行してもコードは変わりません。

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

vLLMが間違った答えである場合

あなたは1人でノートパソコンを使っています — vLLMはサーバー向けエンジンであり、デスクトップアプリではありません。単一ユーザーのローカル実行には、Q4 GGUFを使用したllama.cppまたはOllamaの方がシンプルで、Blackwell GPUではなく24GBのグラフィックカードが必要です。私たちの「how-to-run-Qwen3.8-27B-locally」ガイドでは、その手順を最初から最後まで解説しています。

保証されたスループットを運用コストゼロで実現したい — セルフホスティングでは、ページングもキューイングもフェイルオーバーも、すべて自分で管理することになります。「APIがダウンしている」という言葉を自分の語彙に入れたくないのであれば、トークンをレンタルして、他の誰かに運用を任せましょう。

フロンティア品質の完全な約1Mコンテキストが本当に必要です — それがQwen3.8 2.4T-A95Bの役割であり、72-GPU GB300 NVL72ラック上でvLLMまたはSGLangによって提供されます。1〜2枚のGPU上のQwen3.8 27Bはそれに匹敵しません。2.4Tに関する当社のサービング記事では、そのモデルが異なるクラスの問題である理由を説明しています。

古い24GBカードを使用している場合 — NVFP4はBlackwell形式です。Ampere(RTX 3090)やAda(RTX 4090)の24GBカードでは、FP8パスがvLLMの選択肢となり、その先はllama.cppによるGGUF量子化が現実的な落とし所です。同じモデルでも24GBカード上では別物です。

1枚のカードで最大同時実行を提供する必要があります — 上記のシングルGPU向けデフォルト設定は出発点であり、本番構成ではありません。--max-num-seqs、KVキャッシュ、MTP設定は、実際のリクエスト構成に合わせて調整してから、完了と見なしてください。

結論

Qwen3.8 27Bは、vLLMが本番環境で単一GPU上で提供する珍しいdense 27Bモデルです。vLLM 0.17.0+にアップデートし、32GB Blackwellカード用にNVFP4量子化(24.6 GiB)を取得し、48GBカード1枚またはテンソル並列で2枚の場合はFP8量子化を取得し、80GB GPUにはBF16を予約してください。コマンドはワンライナーで、エンドポイントはO​penAI互換、ウェイトはApache 2.0なので、自分でサーブするか、無料枠付きで100万トークンあたり$0.33/$2.40でレンタルできます — どちらも同じクライアントコードです。まだ誰も持っていないのは、vLLM上の27Bの独立したスループット数値です。起動後にベンチマークに1時間を割り当ててから、レイテンシー数を約束してください。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube