
Qwen3.8-27B บน vLLM: ให้บริการในโปรดักชันบน GPU หนึ่งหรือสองตัว
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 ต่อ 1 ล้านโทเค็น · 42 tok/s
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
ใช่ — Qwen3.8 27B ทำงานในโพรดักชันบน vLLM ในปัจจุบัน และบน GPU ตัวเดียวในกรณีส่วนใหญ่ เวอร์ชันที่สำคัญคือ vLLM 0.17.0 หรือใหม่กว่า: มันมาพร้อมกับสูตรอย่างเป็นทางการ เคอร์เนลไฮบริดแอตเทนชันที่โมเดลนี้ต้องการ และเอนด์พอยต์ /v1 ที่เข้ากันได้กับ OpenAI สำหรับ GPU Blackwell หนึ่งตัว ให้รัน NVFP4 quant — สูตรของ vLLM เองวัดได้ที่ 24.6 GiB ของ VRAM ที่ tensor-parallel size 1 สำหรับการ์ด 48GB หนึ่งใบ ให้รัน FP8 BF16 เต็มรูปแบบ ซึ่งเป็น checkpoint ขนาด 51.7GB ต้องใช้ GPU 80GB หนึ่งตัว หรือการ์ด 48GB สองใบใน tensor-parallel คำสั่งที่แน่นอนอยู่ด้านล่าง; คำสั่งแรกเป็นคำสั่งบรรทัดเดียว
ทุกอย่างที่นี่ได้รับการตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 ซึ่งเป็นวันที่สามที่น้ำหนักโมเดลเปิดใช้งานจริง สถาปัตยกรรม บริบท และใบอนุญาตมาจากการ์ดโมเดล Qwen3.8 27B บน Hugging Face; ขนาด checkpoint คือผลรวมของ shards safetensors ทั้ง 18 ชิ้นใน repo; คำสั่ง vLLM และตัวเลข 24.6 GiB มาจากหน้า recipe ของ vLLM สำหรับโมเดลนี้โดยเฉพาะ Qwen3.8 27B คือโมเดลมัลติโมดัลแบบ dense ขนาด 27 พันล้านพารามิเตอร์ของ Alibaba — น้ำหนักอยู่ภายใต้ Apache 2.0 เปิดตัวเมื่อวันที่ 13–14 สิงหาคม — และเนื่องจากน้ำหนักเปิดเผย คุณจึงสามารถเสิร์ฟมันได้ด้วยตัวเองแทนที่จะเช่า token fork นั้นคือสิ่งที่บทความนี้พูดถึงจริงๆ
ข้อเท็จจริงที่สำคัญ, พร้อมแหล่งอ้างอิง
• สถาปัตยกรรม — 27B เดนส์ (27.8B เมื่อนับรวมทาวเวอร์ประมวลผลภาพและคำศัพท์แบบมีแพด), 64 เลเยอร์, hidden size 5,120, ขนาดคำศัพท์ 248,320. การ์ดโมเดลอย่างเป็นทางการ ตรวจสอบแล้ววันนี้
• ความสนใจ — ไฮบริด: เลเยอร์ความสนใจแบบเต็มรูปแบบ 16 เลเยอร์ และเลเยอร์เชิงเส้น Gated DeltaNet จำนวน 48 เลเยอร์ในรูปแบบบล็อก 3:1 มีเพียง 16 เลเยอร์เท่านั้นที่เก็บแคชคีย์-ค่าที่เพิ่มขึ้นเรื่อยๆ ส่วนอีก 48 เลเยอร์ที่เหลือเก็บสถานะรีเคอร์เรนต์ขนาดคงที่แทน
• บริบท — 262,144 โทเค็นในตัว ขยายได้ถึงประมาณ 1M ผ่านการปรับสเกล YaRN RoPE การ์ดโมเดล ตรวจสอบแล้ววันนี้
• อินพุต — รองรับข้อความ รูปภาพ และวิดีโอแบบเนทีฟ; เอาต์พุตเป็นข้อความ vLLM รองรับทั้งสามรูปแบบผ่าน API chat-completions มาตรฐาน โดยไม่ต้องมีไฟล์โปรเจกเตอร์แยกต่างหาก
• สัญญาอนุญาต — Apache 2.0. ข้อเท็จจริงเพียงข้อนี้เองคือเหตุผลที่ทำให้เกิดคำถามที่ว่า "ให้บริการเองเทียบกับการเช่าโทเคน" ขึ้นมาได้
• น้ำหนัก — เช็คพอยต์ BF16 มีขนาดรวม 51.7GB กระจายอยู่ใน 18 ชาร์ด safetensors (Hugging Face, ตรวจสอบวันนี้) Qwen ยังเผยแพร่เช็คพอยต์ FP8 และ NVFP4 ที่สร้างสำหรับ vLLM.
• ข้อกำหนด vLLM — 0.17.0 หรือใหม่กว่า โดยมี transformers ≥ 5.8.0 หน้าสูตรของ vLLM ตรวจสอบแล้ววันนี้ "Any vLLM" ไม่ใช่คำแนะนำที่ปลอดภัย เคอร์เนลของเลเยอร์แบบ recurrent คือสิ่งที่เวอร์ชันใหม่เพิ่มเข้ามา
• การทำนายหลายโทเค็น — หัวแบบร่างสำหรับการถอดรหัสเชิงคาดการณ์ถูกบรรจุอยู่ใน checkpoint แล้ว จึงไม่จำเป็นต้องมีโมเดลแบบร่างแยกต่างหาก vLLM ระบุ flag นี้ไว้ในเอกสาร; ยังไม่มีตัวเลขการเพิ่มความเร็วจากการทดสอบอิสระ
บันได GPU — ควรใช้ควอนต์ไหนกับการ์ดไหน
รูปแบบการให้บริการสามแบบครอบคลุมช่วงที่ใช้งานได้จริง เลือกตาม VRAM ที่คุณมีจริง ไม่ใช่ตาม "best quant"
• NVFP4 — 24.6 GiB ทั้งหมด (น้ำหนักโมเดลบวกกับ FP8 KV cache) ตามสูตรของ vLLM ที่ TP1 รองรับ GPU ตระกูล Blackwell หนึ่งตัวได้ ในทางปฏิบัติคือ RTX 5090 ขนาด 32GB หรือ B200 นี่คือเส้นทางที่มีความหน่วงต่ำที่สุด และเป็นแบบที่เก็บบริบทได้มากที่สุดต่อการ์ด: สูตรของ vLLM รายงานความจุ KV-token 6.6M แม้ในการขยายบริบท 1M
• FP8 — น้ำหนักประมาณ 26GB การ์ด 48GB หนึ่งใบ (L40S, RTX A6000, RTX 6000 Ada) รองรับมันได้โดยมีพื้นที่เหลือสำหรับ context การ์ด 48GB สองใบแบบ tensor-parallel จะให้พื้นที่ว่างสำหรับ context ที่ยาวขึ้นหรือการทำงานพร้อมกันที่สูงขึ้น สูตรของ vLLM เองจะรัน FP8 ที่ TP4 บน tray GB300 ที่มี GPU สี่ตัวเมื่อคุณต้องการ KV cache ที่ใหญ่ที่สุดเท่าที่จะเป็นไปได้
• BF16 — น้ำหนัก 51.7GB ดังนั้น GPU ขนาด 80GB ตัวเดียว (H100, A100 80GB, B200, GB300) หรือการ์ด 48GB สองใบที่ TP2 ก็เพียงพอ นี่คือตัวเลือกความแม่นยำอ้างอิง และเป็นตัวเลือกที่คำสั่งขยายบริบท 1M ด้านล่างใช้งานจริง
• MXFP4 — ห้ามใช้กับ NVIDIA เส้นทาง MXFP4 ของ vLLM ยังขาดการสนับสนุน linear-method อยู่ในขณะนี้ น้ำหนักเดียวกันนี้ถูกเผยแพร่เป็น NVFP4 ซึ่งเป็นรูปแบบที่ NVIDIA recipe ใช้จริง

รันมัน — คำสั่ง vLLM
ค่าเริ่มต้นของ single-GPU ที่มีความหน่วงต่ำ (NVFP4, GPU Blackwell หนึ่งตัว) ซึ่งมาจากสูตรของ vLLM แบบคำต่อคำ:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
คำสั่ง FP8 จากสูตรเดียวกัน (TP4, ถาด GB300 หนึ่งถาด, KV cache ที่ใหญ่ที่สุด):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
สำหรับการ์ด 48GB สองใบ ให้คงคำสั่ง FP8 และตั้งค่า --tensor-parallel-size 2 แทนที่ 4.
ผนวกสิ่งนี้ต่อท้ายคำสั่งใดคำสั่งหนึ่งเพื่อเปิดใช้งานการถอดรหัสเชิงคาดการณ์ MTP:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
ส่วนขยายบริบท 1M (ซึ่งมาจากสูตรของ vLLM ด้วยเช่นกัน):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
สิ่งที่หน้าเพจของ vLLM เองให้สัญญาและไม่ให้สัญญา
• ยังไม่มีตัวเลข throughput สำหรับ 27B ณ วันที่ 15 สิงหาคม หน้า recipe ของ vLLM ไม่ได้เผยแพร่ benchmarks ด้าน throughput หรือ latency สำหรับ Qwen3.8 27B ตัวเลข "4,000+ tokens ต่อวินาทีต่อ GPU" ที่มีพูดกันนั้นเป็นของ Qwen3.8 2.4T-A95B บน rack GB300 NVL72 ที่มี 72 GPU เป็นข้อมูลที่ผู้ขายรายงาน และไม่ใช่รุ่นนี้ ตัวเลข tokens ต่อวินาทีจากชุมชนที่คุณจะเห็นหมุนเวียนสำหรับ GGUF ภายใต้ llama.cpp หรือ Ollama เป็น runtime ที่ต่างไปและ workload ที่ต่างจากการ serving ด้วย vLLM
• การกล่าวอ้างเรื่อง cheap-KV-cache ขึ้นอยู่กับรันไทม์. การ์ดโมเดลระบุว่ามีเพียง 16 จาก 64 เลเยอร์ที่เก็บแคช แต่จะช่วยได้ก็ต่อเมื่อเซิร์ฟวิ่งเอนจินนำเลเยอร์ Gated DeltaNet ไปใช้จริง vLLM 0.17+ คือเวอร์ชันที่ทำเช่นนั้น นั่นคือเหตุผลที่การล็อกเวอร์ชันเป็นสิ่งแรกในบทความนี้แทนที่จะเป็นเชิงอรรถ
• MTP ถูกสร้างไว้แล้วแต่ยังไม่ได้วัดประสิทธิภาพในที่นี้ดราฟต์เฮดอยู่ใน checkpoint และ vLLM มีเอกสารเกี่ยวกับแฟล็กนี้ แต่ยังไม่มีใครเผยแพร่ตัวเลขการเร่งความเร็วแบบอิสระสำหรับโมเดล 27B บน vLLM นี้เลย ควรวางแผนวัดผลกับทราฟฟิกของคุณเอง
• NVIDIA คือเส้นทางที่ผ่านการทดสอบแล้ว สูตรของ vLLM เขียนขึ้นสำหรับ GPU ของ NVIDIA (NVFP4 และ FP8) การปรับใช้โมเดล hybrid-attention บน AMD Instinct หรือ Intel Gaudi ยังเป็นเทคโนโลยีล้ำสมัยที่ยังไม่เสถียร และบทความนี้ก็ไม่ได้เสแสร้งว่าเป็นอย่างอื่น
เสิร์ฟด้วยตัวเอง หรือเช่าโทเคน
นี่คือจุดที่ Apache 2.0 ทำงานของมัน ไม่มีค่าธรรมเนียมใบอนุญาตต่อโทเคนสำหรับ Qwen3.8 27B ดังนั้นคำถามที่แท้จริงเพียงข้อเดียวคือคุณเป็นเจ้าของฮาร์ดแวร์เองหรือเช่าโทเคน
• โฮสต์เอง (บทความนี้) — คุณจ่ายค่า GPU เพียงครั้งเดียว และทุกโทเค็นหลังจากนั้นก็ฟรี RTX 5090 ที่คุณมีอยู่แล้วทำให้คำสั่ง NVFP4 กลายเป็นเอนด์พอยต์ที่ต้นทุนส่วนเพิ่มเป็นศูนย์ โดยไม่มีข้อมูลใดหลุดออกจากเครื่อง หากต้องเช่า GPU คลาวด์ 5090 หรือ A6000 สองตัวก็จะกลายเป็นรายการค่าใช้จ่าย และข้อโต้แย้งทั้งหมดจะได้ผลก็ต่อเมื่อคุณมีการ์ดอยู่แล้วหรือมีปริมาณการใช้งานที่ต่อเนื่องมากพอเท่านั้น
• เช่าโทเคน — เนื่องจากน้ำหนักเปิด (open weights) หลายโฮสต์จึงรันมัน และราคาขั้นต่ำคือต้นทุนฮาร์ดแวร์ Qwen3.8 27B เปิดใช้งานบน OrcaRouter แล้ววันนี้ที่ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต — ไม่มีมาร์กอัปจากผู้ให้บริการที่ต้องบวกเพิ่ม เพราะ OrcaRouter รันน้ำหนักเปิดบนโครงสร้างพื้นฐานของตัวเอง — และน้ำหนักเปิดเดียวกันนี้ทำให้มีฟรีเทียร์แบบจำกัดอัตราที่คิดเงิน $0 ต่อคำขอ และคืน HTTP 429 เมื่อเกินขีดจำกัด เดือนตัวอย่างที่มี 10 ล้านโทเคน โดย 70% เป็นอินพุต จะมีค่าใช้จ่ายประมาณ $9.51 ในแบบเสียเงิน.
• หลักการตัดสินใจ — ถ้าคุณมี GPU อยู่แล้วก็โฮสต์เอง ถ้าต้องซื้อหรือเช่า GPU ตัวใหม่ API จะคุ้มทุนอย่างรวดเร็วที่ปริมาณงานระดับโปรเจกต์ย่อย และไคลเอนต์ที่เข้ากันได้กับ OpenAI ตัวเดียวกันก็ชี้ไปที่เอนด์พอยต์ใดก็ได้ โค้ดจึงไม่ต้องเปลี่ยนแปลงเมื่อคุณย้าย

เมื่อ vLLM เป็นคำตอบที่ผิด
• คุณคือคนคนหนึ่งที่ใช้แล็ปท็อป — vLLM เป็นเอนจินสำหรับให้บริการ ไม่ใช่แอปเดสก์ท็อป สำหรับการรันในเครื่องแบบผู้ใช้คนเดียว llama.cpp หรือ Ollama ที่ใช้ GGUF ระดับ Q4 นั้นง่ายกว่า และต้องการการ์ด 24GB ไม่ใช่ GPU ตระกูล Blackwell คู่มือวิธีรัน Qwen3.8-27B ในเครื่องของเราจะพาคุณไปตลอดเส้นทางนั้นแบบครบทุกขั้นตอน
• คุณต้องการปริมาณงานที่รับประกันได้โดยไม่ต้องจัดการอะไรเลย — การโฮสต์ด้วยตนเองหมายความว่าคุณต้องรับผิดชอบเรื่องการเพจ การจัดคิว และการเฟลโอเวอร์เอง ถ้าประโยคที่ว่า "API ล่ม" ไม่ใช่ประโยคที่คุณอยากได้ยิน ก็ให้เช่าโทเคนแทนแล้วให้คนอื่นดูแลระบบทั้งหมด
• คุณจำเป็นต้องมีบริบทเต็มรูปแบบ ~1M ที่คุณภาพระดับแนวหน้าจริงๆ — นั่นคือหน้าที่ของ Qwen3.8 2.4T-A95B ซึ่งให้บริการโดย vLLM หรือ SGLang บนแร็ค GB300 NVL72 ที่มี GPU 72 ตัว Qwen3.8 27B บน GPU หนึ่งหรือสองตัวจะไม่เทียบเท่าได้ บทความการให้บริการของเราเกี่ยวกับ 2.4T อธิบายว่าทำไมโมเดลนั้นจึงเป็นปัญหาคนละระดับ
• คุณใช้การ์ด 24GB รุ่นเก่า — NVFP4 เป็นฟอร์แมตของ Blackwell; บนการ์ด 24GB รุ่น Ampere (RTX 3090) หรือ Ada (RTX 4090) เส้นทาง FP8 คือตัวเลือกของ vLLM และถัดจากนั้น GGUF quant ภายใต้ llama.cpp คือทางเลือกที่ใช้งานได้จริง โมเดลเดียวกันบนการ์ด 24GB เป็นคนละเรื่องกัน
• คุณต้องให้บริการความพร้อมกันสูงสุดบนการ์ดใบเดียว — ค่าเริ่มต้นสำหรับ GPU ตัวเดียวด้านบนเป็นเพียงจุดเริ่มต้น ไม่ใช่รูปแบบการใช้งานจริง ควรปรับ --max-num-seqs, แคช KV และการกำหนดค่า MTP ตามปริมาณคำขอของคุณเองก่อนที่จะถือว่าเสร็จสิ้น
บรรทัดล่าง
Qwen3.8 27B เป็นรุ่น dense 27B ที่หายากซึ่ง vLLM ให้บริการบน GPU ตัวเดียวในโปรดักชัน อัปเดตเป็น vLLM 0.17.0+ โหลด quant ของ NVFP4 สำหรับการ์ด Blackwell ขนาด 32GB ที่ 24.6 GiB ใช้ quant ของ FP8 สำหรับการ์ด 48GB หนึ่งใบหรือสองใบในโหมด tensor-parallel และสำรอง BF16 สำหรับ GPU ขนาด 80GB คำสั่งทั้งหมดเป็นบรรทัดเดียว endpoint เข้ากันได้กับ OpenAI และเนื่องจาก weights อยู่ภายใต้สัญญาอนุญาต Apache 2.0 คุณจึงให้บริการได้ด้วยตัวเองหรือเช่าในราคา $0.33/$2.40 ต่อล้านโทเคนพร้อม tier ฟรี โดยใช้โค้ดฝั่ง client เดียวกันไม่ว่าจะเลือกแบบไหน สิ่งเดียวที่ยังไม่มีใครได้คือตัวเลข throughput ที่เป็นอิสระสำหรับ 27B บน vLLM ดังนั้นจงกันเวลาหนึ่งชั่วโมงสำหรับการ benchmark หลังจากบูตมัน ก่อนที่จะสัญญากับใครเรื่องตัวเลข latency
