การ์ดหัวเรื่องหลักที่แสดงข้อความ Qwen3.8-27B บน vLLM พร้อมคำบรรยายว่า 'ให้บริการในระบบโปรดักชันบน GPU หนึ่งหรือสองตัว' ไอคอนเซิร์ฟเวอร์ และชิปรูปแบบที่ติดป้ายว่า NVFP4 24.6 GiB, FP8 48GB และ BF16 80GB
Guides & Insights

Qwen3.8-27B บน vLLM: ให้บริการในโปรดักชันบน GPU หนึ่งหรือสองตัว

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ใช่ — Qwen3.8 27B ทำงานในโพรดักชันบน vLLM ในปัจจุบัน และบน GPU ตัวเดียวในกรณีส่วนใหญ่ เวอร์ชันที่สำคัญคือ vLLM 0.17.0 หรือใหม่กว่า: มันมาพร้อมกับสูตรอย่างเป็นทางการ เคอร์เนลไฮบริดแอตเทนชันที่โมเดลนี้ต้องการ และเอนด์พอยต์ /v1 ที่เข้ากันได้กับ O​penAI สำหรับ GPU Blackwell หนึ่งตัว ให้รัน NVFP4 quant — สูตรของ vLLM เองวัดได้ที่ 24.6 GiB ของ VRAM ที่ tensor-parallel size 1 สำหรับการ์ด 48GB หนึ่งใบ ให้รัน FP8 BF16 เต็มรูปแบบ ซึ่งเป็น checkpoint ขนาด 51.7GB ต้องใช้ GPU 80GB หนึ่งตัว หรือการ์ด 48GB สองใบใน tensor-parallel คำสั่งที่แน่นอนอยู่ด้านล่าง; คำสั่งแรกเป็นคำสั่งบรรทัดเดียว

ทุกอย่างที่นี่ได้รับการตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 ซึ่งเป็นวันที่สามที่น้ำหนักโมเดลเปิดใช้งานจริง สถาปัตยกรรม บริบท และใบอนุญาตมาจากการ์ดโมเดล Qwen3.8 27B บน Hugging Face; ขนาด checkpoint คือผลรวมของ shards safetensors ทั้ง 18 ชิ้นใน repo; คำสั่ง vLLM และตัวเลข 24.6 GiB มาจากหน้า recipe ของ vLLM สำหรับโมเดลนี้โดยเฉพาะ Qwen3.8 27B คือโมเดลมัลติโมดัลแบบ dense ขนาด 27 พันล้านพารามิเตอร์ของ Ali​baba — น้ำหนักอยู่ภายใต้ Apache 2.0 เปิดตัวเมื่อวันที่ 13–14 สิงหาคม — และเนื่องจากน้ำหนักเปิดเผย คุณจึงสามารถเสิร์ฟมันได้ด้วยตัวเองแทนที่จะเช่า token fork นั้นคือสิ่งที่บทความนี้พูดถึงจริงๆ

ข้อเท็จจริงที่สำคัญ, พร้อมแหล่งอ้างอิง

สถาปัตยกรรม — 27B เดนส์ (27.8B เมื่อนับรวมทาวเวอร์ประมวลผลภาพและคำศัพท์แบบมีแพด), 64 เลเยอร์, hidden size 5,120, ขนาดคำศัพท์ 248,320. การ์ดโมเดลอย่างเป็นทางการ ตรวจสอบแล้ววันนี้

ความสนใจ — ไฮบริด: เลเยอร์ความสนใจแบบเต็มรูปแบบ 16 เลเยอร์ และเลเยอร์เชิงเส้น Gated DeltaNet จำนวน 48 เลเยอร์ในรูปแบบบล็อก 3:1 มีเพียง 16 เลเยอร์เท่านั้นที่เก็บแคชคีย์-ค่าที่เพิ่มขึ้นเรื่อยๆ ส่วนอีก 48 เลเยอร์ที่เหลือเก็บสถานะรีเคอร์เรนต์ขนาดคงที่แทน

บริบท — 262,144 โทเค็นในตัว ขยายได้ถึงประมาณ 1M ผ่านการปรับสเกล YaRN RoPE การ์ดโมเดล ตรวจสอบแล้ววันนี้

อินพุต — รองรับข้อความ รูปภาพ และวิดีโอแบบเนทีฟ; เอาต์พุตเป็นข้อความ vLLM รองรับทั้งสามรูปแบบผ่าน API chat-completions มาตรฐาน โดยไม่ต้องมีไฟล์โปรเจกเตอร์แยกต่างหาก

สัญญาอนุญาต — Apache 2.0. ข้อเท็จจริงเพียงข้อนี้เองคือเหตุผลที่ทำให้เกิดคำถามที่ว่า "ให้บริการเองเทียบกับการเช่าโทเคน" ขึ้นมาได้

น้ำหนัก — เช็คพอยต์ BF16 มีขนาดรวม 51.7GB กระจายอยู่ใน 18 ชาร์ด safetensors (Hugging Face, ตรวจสอบวันนี้) Qwe​n ยังเผยแพร่เช็คพอยต์ FP8 และ NVFP4 ที่สร้างสำหรับ vLLM.

ข้อกำหนด vLLM — 0.17.0 หรือใหม่กว่า โดยมี transformers ≥ 5.8.0 หน้าสูตรของ vLLM ตรวจสอบแล้ววันนี้ "Any vLLM" ไม่ใช่คำแนะนำที่ปลอดภัย เคอร์เนลของเลเยอร์แบบ recurrent คือสิ่งที่เวอร์ชันใหม่เพิ่มเข้ามา

การทำนายหลายโทเค็น — หัวแบบร่างสำหรับการถอดรหัสเชิงคาดการณ์ถูกบรรจุอยู่ใน checkpoint แล้ว จึงไม่จำเป็นต้องมีโมเดลแบบร่างแยกต่างหาก vLLM ระบุ flag นี้ไว้ในเอกสาร; ยังไม่มีตัวเลขการเพิ่มความเร็วจากการทดสอบอิสระ

บันได GPU — ควรใช้ควอนต์ไหนกับการ์ดไหน

รูปแบบการให้บริการสามแบบครอบคลุมช่วงที่ใช้งานได้จริง เลือกตาม VRAM ที่คุณมีจริง ไม่ใช่ตาม "best quant"

NVFP4 — 24.6 GiB ทั้งหมด (น้ำหนักโมเดลบวกกับ FP8 KV cache) ตามสูตรของ vLLM ที่ TP1 รองรับ GPU ตระกูล Blackwell หนึ่งตัวได้ ในทางปฏิบัติคือ RTX 5090 ขนาด 32GB หรือ B200 นี่คือเส้นทางที่มีความหน่วงต่ำที่สุด และเป็นแบบที่เก็บบริบทได้มากที่สุดต่อการ์ด: สูตรของ vLLM รายงานความจุ KV-token 6.6M แม้ในการขยายบริบท 1M

FP8 — น้ำหนักประมาณ 26GB การ์ด 48GB หนึ่งใบ (L40S, RTX A6000, RTX 6000 Ada) รองรับมันได้โดยมีพื้นที่เหลือสำหรับ context การ์ด 48GB สองใบแบบ tensor-parallel จะให้พื้นที่ว่างสำหรับ context ที่ยาวขึ้นหรือการทำงานพร้อมกันที่สูงขึ้น สูตรของ vLLM เองจะรัน FP8 ที่ TP4 บน tray GB300 ที่มี GPU สี่ตัวเมื่อคุณต้องการ KV cache ที่ใหญ่ที่สุดเท่าที่จะเป็นไปได้

BF16 — น้ำหนัก 51.7GB ดังนั้น GPU ขนาด 80GB ตัวเดียว (H100, A100 80GB, B200, GB300) หรือการ์ด 48GB สองใบที่ TP2 ก็เพียงพอ นี่คือตัวเลือกความแม่นยำอ้างอิง และเป็นตัวเลือกที่คำสั่งขยายบริบท 1M ด้านล่างใช้งานจริง

MXFP4 — ห้ามใช้กับ NVIDIA เส้นทาง MXFP4 ของ vLLM ยังขาดการสนับสนุน linear-method อยู่ในขณะนี้ น้ำหนักเดียวกันนี้ถูกเผยแพร่เป็น NVFP4 ซึ่งเป็นรูปแบบที่ NVIDIA recipe ใช้จริง

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

รันมัน — คำสั่ง vLLM

ค่าเริ่มต้นของ single-GPU ที่มีความหน่วงต่ำ (NVFP4, GPU Blackwell หนึ่งตัว) ซึ่งมาจากสูตรของ vLLM แบบคำต่อคำ:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

คำสั่ง FP8 จากสูตรเดียวกัน (TP4, ถาด GB300 หนึ่งถาด, KV cache ที่ใหญ่ที่สุด):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

สำหรับการ์ด 48GB สองใบ ให้คงคำสั่ง FP8 และตั้งค่า --tensor-parallel-size 2 แทนที่ 4.

ผนวกสิ่งนี้ต่อท้ายคำสั่งใดคำสั่งหนึ่งเพื่อเปิดใช้งานการถอดรหัสเชิงคาดการณ์ MTP:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

ส่วนขยายบริบท 1M (ซึ่งมาจากสูตรของ vLLM ด้วยเช่นกัน):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

สิ่งที่หน้าเพจของ vLLM เองให้สัญญาและไม่ให้สัญญา

ยังไม่มีตัวเลข throughput สำหรับ 27B ณ วันที่ 15 สิงหาคม หน้า recipe ของ vLLM ไม่ได้เผยแพร่ benchmarks ด้าน throughput หรือ latency สำหรับ Qwen3.8 27B ตัวเลข "4,000+ tokens ต่อวินาทีต่อ GPU" ที่มีพูดกันนั้นเป็นของ Qwen3.8 2.4T-A95B บน rack GB300 NVL72 ที่มี 72 GPU เป็นข้อมูลที่ผู้ขายรายงาน และไม่ใช่รุ่นนี้ ตัวเลข tokens ต่อวินาทีจากชุมชนที่คุณจะเห็นหมุนเวียนสำหรับ GGUF ภายใต้ llama.cpp หรือ Ollama เป็น runtime ที่ต่างไปและ workload ที่ต่างจากการ serving ด้วย vLLM

การกล่าวอ้างเรื่อง cheap-KV-cache ขึ้นอยู่กับรันไทม์. การ์ดโมเดลระบุว่ามีเพียง 16 จาก 64 เลเยอร์ที่เก็บแคช แต่จะช่วยได้ก็ต่อเมื่อเซิร์ฟวิ่งเอนจินนำเลเยอร์ Gated DeltaNet ไปใช้จริง vLLM 0.17+ คือเวอร์ชันที่ทำเช่นนั้น นั่นคือเหตุผลที่การล็อกเวอร์ชันเป็นสิ่งแรกในบทความนี้แทนที่จะเป็นเชิงอรรถ

MTP ถูกสร้างไว้แล้วแต่ยังไม่ได้วัดประสิทธิภาพในที่นี้ดราฟต์เฮดอยู่ใน checkpoint และ vLLM มีเอกสารเกี่ยวกับแฟล็กนี้ แต่ยังไม่มีใครเผยแพร่ตัวเลขการเร่งความเร็วแบบอิสระสำหรับโมเดล 27B บน vLLM นี้เลย ควรวางแผนวัดผลกับทราฟฟิกของคุณเอง

NVIDIA คือเส้นทางที่ผ่านการทดสอบแล้ว สูตรของ vLLM เขียนขึ้นสำหรับ GPU ของ NVIDIA (NVFP4 และ FP8) การปรับใช้โมเดล hybrid-attention บน AMD Instinct หรือ Intel Gaudi ยังเป็นเทคโนโลยีล้ำสมัยที่ยังไม่เสถียร และบทความนี้ก็ไม่ได้เสแสร้งว่าเป็นอย่างอื่น

เสิร์ฟด้วยตัวเอง หรือเช่าโทเคน

นี่คือจุดที่ Apache 2.0 ทำงานของมัน ไม่มีค่าธรรมเนียมใบอนุญาตต่อโทเคนสำหรับ Qwen3.8 27B ดังนั้นคำถามที่แท้จริงเพียงข้อเดียวคือคุณเป็นเจ้าของฮาร์ดแวร์เองหรือเช่าโทเคน

โฮสต์เอง (บทความนี้) — คุณจ่ายค่า GPU เพียงครั้งเดียว และทุกโทเค็นหลังจากนั้นก็ฟรี RTX 5090 ที่คุณมีอยู่แล้วทำให้คำสั่ง NVFP4 กลายเป็นเอนด์พอยต์ที่ต้นทุนส่วนเพิ่มเป็นศูนย์ โดยไม่มีข้อมูลใดหลุดออกจากเครื่อง หากต้องเช่า GPU คลาวด์ 5090 หรือ A6000 สองตัวก็จะกลายเป็นรายการค่าใช้จ่าย และข้อโต้แย้งทั้งหมดจะได้ผลก็ต่อเมื่อคุณมีการ์ดอยู่แล้วหรือมีปริมาณการใช้งานที่ต่อเนื่องมากพอเท่านั้น

เช่าโทเคน — เนื่องจากน้ำหนักเปิด (open weights) หลายโฮสต์จึงรันมัน และราคาขั้นต่ำคือต้นทุนฮาร์ดแวร์ Qwen3.8 27B เปิดใช้งานบน OrcaRouter แล้ววันนี้ที่ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต — ไม่มีมาร์กอัปจากผู้ให้บริการที่ต้องบวกเพิ่ม เพราะ OrcaRouter รันน้ำหนักเปิดบนโครงสร้างพื้นฐานของตัวเอง — และน้ำหนักเปิดเดียวกันนี้ทำให้มีฟรีเทียร์แบบจำกัดอัตราที่คิดเงิน $0 ต่อคำขอ และคืน HTTP 429 เมื่อเกินขีดจำกัด เดือนตัวอย่างที่มี 10 ล้านโทเคน โดย 70% เป็นอินพุต จะมีค่าใช้จ่ายประมาณ $9.51 ในแบบเสียเงิน.

หลักการตัดสินใจ — ถ้าคุณมี GPU อยู่แล้วก็โฮสต์เอง ถ้าต้องซื้อหรือเช่า GPU ตัวใหม่ API จะคุ้มทุนอย่างรวดเร็วที่ปริมาณงานระดับโปรเจกต์ย่อย และไคลเอนต์ที่เข้ากันได้กับ O​penAI ตัวเดียวกันก็ชี้ไปที่เอนด์พอยต์ใดก็ได้ โค้ดจึงไม่ต้องเปลี่ยนแปลงเมื่อคุณย้าย

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

เมื่อ vLLM เป็นคำตอบที่ผิด

คุณคือคนคนหนึ่งที่ใช้แล็ปท็อป — vLLM เป็นเอนจินสำหรับให้บริการ ไม่ใช่แอปเดสก์ท็อป สำหรับการรันในเครื่องแบบผู้ใช้คนเดียว llama.cpp หรือ Ollama ที่ใช้ GGUF ระดับ Q4 นั้นง่ายกว่า และต้องการการ์ด 24GB ไม่ใช่ GPU ตระกูล Blackwell คู่มือวิธีรัน Qwen3.8-27B ในเครื่องของเราจะพาคุณไปตลอดเส้นทางนั้นแบบครบทุกขั้นตอน

คุณต้องการปริมาณงานที่รับประกันได้โดยไม่ต้องจัดการอะไรเลย — การโฮสต์ด้วยตนเองหมายความว่าคุณต้องรับผิดชอบเรื่องการเพจ การจัดคิว และการเฟลโอเวอร์เอง ถ้าประโยคที่ว่า "API ล่ม" ไม่ใช่ประโยคที่คุณอยากได้ยิน ก็ให้เช่าโทเคนแทนแล้วให้คนอื่นดูแลระบบทั้งหมด

คุณจำเป็นต้องมีบริบทเต็มรูปแบบ ~1M ที่คุณภาพระดับแนวหน้าจริงๆ — นั่นคือหน้าที่ของ Qwen3.8 2.4T-A95B ซึ่งให้บริการโดย vLLM หรือ SGLang บนแร็ค GB300 NVL72 ที่มี GPU 72 ตัว Qwen3.8 27B บน GPU หนึ่งหรือสองตัวจะไม่เทียบเท่าได้ บทความการให้บริการของเราเกี่ยวกับ 2.4T อธิบายว่าทำไมโมเดลนั้นจึงเป็นปัญหาคนละระดับ

คุณใช้การ์ด 24GB รุ่นเก่า — NVFP4 เป็นฟอร์แมตของ Blackwell; บนการ์ด 24GB รุ่น Ampere (RTX 3090) หรือ Ada (RTX 4090) เส้นทาง FP8 คือตัวเลือกของ vLLM และถัดจากนั้น GGUF quant ภายใต้ llama.cpp คือทางเลือกที่ใช้งานได้จริง โมเดลเดียวกันบนการ์ด 24GB เป็นคนละเรื่องกัน

คุณต้องให้บริการความพร้อมกันสูงสุดบนการ์ดใบเดียว — ค่าเริ่มต้นสำหรับ GPU ตัวเดียวด้านบนเป็นเพียงจุดเริ่มต้น ไม่ใช่รูปแบบการใช้งานจริง ควรปรับ --max-num-seqs, แคช KV และการกำหนดค่า MTP ตามปริมาณคำขอของคุณเองก่อนที่จะถือว่าเสร็จสิ้น

บรรทัดล่าง

Qwen3.8 27B เป็นรุ่น dense 27B ที่หายากซึ่ง vLLM ให้บริการบน GPU ตัวเดียวในโปรดักชัน อัปเดตเป็น vLLM 0.17.0+ โหลด quant ของ NVFP4 สำหรับการ์ด Blackwell ขนาด 32GB ที่ 24.6 GiB ใช้ quant ของ FP8 สำหรับการ์ด 48GB หนึ่งใบหรือสองใบในโหมด tensor-parallel และสำรอง BF16 สำหรับ GPU ขนาด 80GB คำสั่งทั้งหมดเป็นบรรทัดเดียว endpoint เข้ากันได้กับ O​penAI และเนื่องจาก weights อยู่ภายใต้สัญญาอนุญาต Apache 2.0 คุณจึงให้บริการได้ด้วยตัวเองหรือเช่าในราคา $0.33/$2.40 ต่อล้านโทเคนพร้อม tier ฟรี โดยใช้โค้ดฝั่ง client เดียวกันไม่ว่าจะเลือกแบบไหน สิ่งเดียวที่ยังไม่มีใครได้คือตัวเลข throughput ที่เป็นอิสระสำหรับ 27B บน vLLM ดังนั้นจงกันเวลาหนึ่งชั่วโมงสำหรับการ benchmark หลังจากบูตมัน ก่อนที่จะสัญญากับใครเรื่องตัวเลข latency

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube