
Qwen3.8-27B trên vLLM: Triển khai trong môi trường sản xuất trên một hoặc hai GPU
- obsidianMỚIQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 trên 1 triệu token · 42 tok/s
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
Có — Qwen3.8 27B đang phục vụ production trên vLLM hiện nay, và trên một GPU đơn lẻ trong hầu hết các trường hợp. Phiên bản cần có là vLLM 0.17.0 trở lên: nó cung cấp công thức chính thức, các kernel hybrid-attention mà mô hình này cần, và một endpoint /v1 tương thích OpenAI. Đối với một GPU Blackwell, hãy chạy bản lượng tử NVFP4 — công thức của vLLM đo nó ở 24.6 GiB VRAM với tensor-parallel size 1. Đối với một thẻ 48GB đơn lẻ, hãy chạy FP8. BF16 đầy đủ, một checkpoint 51.7GB, cần một GPU 80GB hoặc hai thẻ 48GB trong tensor-parallel. Các lệnh chính xác ở dưới; lệnh đầu tiên là một dòng lệnh duy nhất.
Mọi thứ tại đây đã được xác minh vào ngày 15 tháng 8 năm 2026, ngày thứ ba kể từ khi các trọng số được phát hành. Kiến trúc, ngữ cảnh và giấy phép được lấy từ thẻ mô hình Qwen3.8 27B trên Hugging Face; kích thước checkpoint là tổng của 18 mảnh safetensors trong kho lưu trữ; các lệnh vLLM và con số 24.6 GiB đến từ trang recipe vLLM dành riêng cho mô hình này. Qwen3.8 27B là mô hình đa phương thức 27 tỷ tham số dày đặc của Alibaba — trọng số Apache 2.0, phát hành ngày 13–14 tháng 8 — và vì trọng số mở, bạn có thể tự phục vụ nó thay vì thuê token. Bản fork đó chính là thứ mà bài viết này thực sự đề cập.
Những sự thật quan trọng, kèm theo nguồn
• Kiến trúc — 27B dense (27.8B nếu tính cả tháp thị giác và từ vựng được padding), 64 lớp, kích thước ẩn 5.120, từ vựng 248.320. Thẻ mô hình chính thức, đã được xác minh hôm nay.
• Attention — dạng lai: 16 lớp full-attention, 48 lớp tuyến tính Gated DeltaNet theo cấu trúc khối 3:1. Chỉ 16 lớp giữ bộ đệm khóa-giá trị tăng dần; 48 lớp còn lại, thay vào đó, duy trì trạng thái hồi quy kích thước cố định.
• Ngữ cảnh — 262.144 token nguyên bản, có thể mở rộng lên khoảng 1M thông qua tỷ lệ RoPE YaRN. Thẻ mô hình, đã xác minh hôm nay.
• Đầu vào — văn bản, hình ảnh và video; đầu ra là văn bản. vLLM cung cấp cả ba định dạng này thông qua API chat-completions tiêu chuẩn, không cần tệp projector riêng.
• Giấy phép — Apache 2.0. Chỉ riêng thực tế này là lý do tại sao câu hỏi "tự phục vụ hay thuê token" lại tồn tại.
• Trọng số — checkpoint BF16 có tổng dung lượng 51,7GB trên 18 shard safetensors (Hugging Face, đã xác minh hôm nay). Qwen cũng công bố các checkpoint FP8 và NVFP4 được thiết kế cho vLLM.
• Yêu cầu vLLM — 0.17.0 trở lên, với transformers ≥ 5.8.0. Trang recipe của vLLM, đã xác minh hôm nay. “Bất kỳ vLLM nào” không phải là chỉ dẫn an toàn; các kernel lớp hồi quy chính là thứ phiên bản mới bổ sung.
• Dự đoán đa token — đầu dự thảo giải mã suy đoán (speculative-decoding) được tích hợp sẵn trong checkpoint, vì vậy bạn không cần mô hình dự thảo riêng. vLLM có tài liệu về flag này; vẫn chưa có số liệu tăng tốc độc lập nào.
Nấc thang {{1}}GPU{{/1}} — chọn quant nào cho card nào
Ba định dạng phục vụ bao phủ phạm vi thực tế. Hãy chọn theo VRAM bạn thực sự có, không phải theo "lượng tử tốt nhất".
• NVFP4 — 24,6 GiB tổng cộng (trọng số và bộ đệm KV FP8), theo công thức của vLLM tại TP1. Vừa khít với một GPU thuộc dòng Blackwell — trong thực tế là RTX 5090 32GB hoặc B200. Đây là đường dẫn có độ trễ thấp nhất và là lựa chọn giữ được nhiều ngữ cảnh nhất trên mỗi card: công thức vLLM báo cáo dung lượng 6,6 triệu token KV ngay cả ở chế độ mở rộng ngữ cảnh 1M.
• FP8 — khoảng 26GB trọng số. Một card 48GB (L40S, RTX A6000, RTX 6000 Ada) đủ sức phục vụ mô hình và còn dư chỗ cho ngữ cảnh; hai card 48GB trong chế độ tensor-parallel giúp bạn có thêm dư địa cho ngữ cảnh dài hơn hoặc độ đồng thời cao hơn. Công thức riêng của vLLM chạy FP8 ở TP4 trên khay GB300 bốn GPU khi bạn muốn có bộ nhớ đệm KV lớn nhất có thể.
• BF16 — 51.7GB trọng lượng, do đó một GPU 80GB (H100, A100 80GB, B200, GB300) hoặc hai thẻ 48GB ở TP2. Đây là tùy chọn độ chính xác tham chiếu, và đây là tùy chọn mà lệnh mở rộng ngữ cảnh 1M bên dưới thực sự sử dụng.
• MXFP4 — không sử dụng trên NVIDIA. Đường dẫn MXFP4 của vLLM hiện đang thiếu hỗ trợ phương pháp tuyến tính; các trọng số tương tự được xuất bản dưới dạng NVFP4, đây là định dạng mà công thức NVIDIA thực sự sử dụng.

Chạy nó — các lệnh vLLM
Giá trị mặc định độ trễ thấp cho GPU đơn (NVFP4, một GPU Blackwell), nguyên văn từ công thức của vLLM:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
Lệnh FP8 từ cùng công thức (TP4, một khay GB300, bộ đệm KV lớn nhất):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
Với hai thẻ 48GB, giữ lệnh FP8 và đặt --tensor-parallel-size 2 thay vì 4.
Thêm phần này vào một trong hai lệnh để bật giải mã dự đoán MTP:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
Phần mở rộng ngữ cảnh 1M (cũng từ công thức của vLLM):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
Các trang của vLLM hứa hẹn những gì và không hứa hẹn những gì
• Chưa có số liệu thông lượng nào cho 27B. Tính đến ngày 15 tháng 8, trang recipe của vLLM không công bố benchmark thông lượng hay độ trễ nào cho Qwen3.8 27B. Con số '4,000+ token mỗi giây trên mỗi GPU' được lan truyền là của Qwen3.8 2.4T-A95B trên rack GB300 NVL72 gồm 72 GPU, do nhà cung cấp báo cáo, chứ không phải của mô hình này. Các con số token mỗi giây từ cộng đồng mà bạn sẽ thấy lưu hành cho GGUF trên llama.cpp hoặc Ollama — một môi trường chạy khác và một khối lượng công việc khác so với việc phục vụ bằng vLLM.
• Tuyên bố về KV-cache giá rẻ phụ thuộc vào thời gian chạy. Thẻ mô hình cho biết chỉ 16 trong số 64 lớp giữ bộ đệm, nhưng điều đó chỉ hữu ích nếu công cụ phục vụ thực sự triển khai các lớp Gated DeltaNet. vLLM 0.17+ là phiên bản làm được điều đó; đó là lý do tại sao việc cố định phiên bản là điều đầu tiên trong bài viết này thay vì là chú thích cuối trang.
• MTP được tích hợp sẵn nhưng chưa được đo lường ở đây. Draft head nằm trong checkpoint và vLLM có tài liệu về flag này, nhưng chưa ai công bố con số tăng tốc độc lập cho mô hình 27B này trên vLLM. Hãy lên kế hoạch đo lường trên lưu lượng truy cập của riêng bạn.
• NVIDIA là con đường đã được kiểm chứng. Công thức của vLLM được viết cho GPU NVIDIA (NVFP4 và FP8). Việc triển khai mô hình attention lai này trên AMD Instinct hoặc Intel Gaudi vẫn còn ở giai đoạn tiên phong chưa ổn định, và bài viết này không khẳng định điều ngược lại.
Tự phục vụ, hoặc thuê token
Đây là nơi Apache 2.0 phát huy tác dụng. Không có phí cấp phép theo token cho Qwen3.8 27B, vì vậy câu hỏi thực sự duy nhất là bạn sở hữu phần cứng hay thuê token.
• Tự lưu trữ (bài viết này) — bạn trả phí GPU một lần, và mọi token sau đó đều miễn phí. Một chiếc RTX 5090 bạn đã sở hữu biến lệnh NVFP4 thành một endpoint có chi phí biên bằng không, không có dữ liệu nào rời khỏi máy. Nếu bạn phải thuê GPU, một chiếc 5090 đám mây hoặc một cặp A6000s là khoản chi, và toàn bộ lập luận chỉ đúng nếu bạn đã có sẵn card hoặc khối lượng sử dụng ổn định.
• Thuê token — bởi vì trọng số là mở, nhiều máy chủ chạy nó, và giá sàn là chi phí phần cứng. Qwen3.8 27B hiện đã hoạt động trên OrcaRouter với giá $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra — không có phí cộng thêm từ nhà cung cấp, vì OrcaRouter chạy các trọng số mở trên hạ tầng của chính mình — và chính các trọng số mở đó tài trợ cho một gói miễn phí có giới hạn tốc độ với chi phí $0 cho mỗi yêu cầu và trả về HTTP 429 khi bạn vượt quá giới hạn. Một tháng 10 triệu token tiêu biểu với 70% token đầu vào có chi phí khoảng $9.51 ở gói trả phí.
• Quy tắc quyết định — nếu bạn đã sở hữu GPU, hãy tự lưu trữ (self-host). Nếu bạn phải mua hoặc thuê một GPU, API sẽ hòa vốn nhanh chóng ở quy mô dự án phụ, và cùng một client tương thích OpenAI có thể trỏ tới cả hai endpoint, nên mã nguồn sẽ không thay đổi khi bạn chuyển đổi.

Khi vLLM là câu trả lời sai
• Bạn chỉ là một người dùng trên một chiếc laptop — vLLM là một engine phục vụ mô hình, không phải ứng dụng desktop. Để chạy cục bộ cho một người dùng, llama.cpp hoặc Ollama với GGUF Q4 đơn giản hơn và chỉ cần card 24GB, không cần GPU Blackwell; hướng dẫn chạy Qwen3.8-27B cục bộ của chúng tôi sẽ dẫn bạn đi trọn con đường đó.
• Bạn cần thông lượng đảm bảo với zero ops — tự lưu trữ nghĩa là bạn phải tự lo phân trang, xếp hàng và chuyển đổi dự phòng. Nếu "API bị sập" không phải là câu bạn muốn có trong vốn từ vựng của mình, hãy thuê tokens và để người khác vận hành hạ tầng.
• Bạn thực sự cần ngữ cảnh đầy đủ ~1M với chất lượng hàng đầu — đó là nhiệm vụ của Qwen3.8 2.4T-A95B, được phục vụ bởi vLLM hoặc SGLang trên một rack GB300 NVL72 với 72 GPU. Qwen3.8 27B trên một hoặc hai GPU sẽ không thể sánh được; bài viết về cách phục vụ mô hình 2.4T của chúng tôi giải thích vì sao mô hình đó thuộc một lớp bài toán khác.
• Bạn đang sử dụng một card 24GB đời cũ — NVFP4 là định dạng của Blackwell; trên các card 24GB Ampere (RTX 3090) hoặc Ada (RTX 4090), tùy chọn vLLM là đường dẫn FP8, và ngoài ra, lượng tử GGUF trên llama.cpp là điểm dừng thực dụng. Cùng một mô hình trên card 24GB lại là một vấn đề khác.
• Bạn phải phục vụ độ đồng thời tối đa trên một card — các mặc định đơn GPU ở trên chỉ là điểm khởi đầu, không phải cấu hình sản xuất. Hãy tinh chỉnh --max-num-seqs, KV cache và cấu hình MTP dựa trên cơ cấu yêu cầu của riêng bạn trước khi coi là hoàn tất.
Kết luận
Qwen3.8 27B là một trong những mô hình dense 27B hiếm hoi mà vLLM phục vụ trên một GPU duy nhất trong môi trường sản xuất. Hãy cập nhật lên vLLM 0.17.0+, kéo bản lượng tử NVFP4 cho card Blackwell 32GB ở mức 24.6 GiB, bản FP8 cho một card 48GB hoặc hai card chạy tensor-parallel, và dành BF16 cho GPU 80GB. Các lệnh chỉ là một dòng, endpoint tương thích OpenAI, và vì trọng số được cấp phép Apache 2.0, bạn có thể tự phục vụ hoặc thuê với giá $0.33/$2.40 mỗi triệu token, kèm gói miễn phí — mã khách hàng vẫn như nhau trong cả hai trường hợp. Điều duy nhất mà chưa ai có là con số thông lượng độc lập cho 27B trên vLLM, vì vậy hãy dành một giờ để benchmark sau khi khởi động trước khi hứa hẹn với bất kỳ ai về con số độ trễ.
