Karta tytułowa hero z napisem Qwen3.8-27B na vLLM z podtytułem „wdroż go produkcyjnie na jednej lub dwóch kartach GPU”, ikoną serwera oraz chipami formatów oznaczonymi jako NVFP4 24,6 GiB, FP8 48 GB i BF16 80 GB.
Guides & Insights

Qwen3.8-27B na vLLM: Serwuj go w produkcji na jednej lub dwóch kartach GPU

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tak — Qwen3.8 27B działa w produkcji na vLLM już dziś, i w większości przypadków na pojedynczym GPU. Liczy się wersja vLLM 0.17.0 lub nowsza: obejmuje oficjalny przepis, jądra hybrydowej uwagi, których potrzebuje ten model, oraz endpoint /v1 zgodny z O​penAI. Dla jednego GPU Blackwell uruchom kwantyzację NVFP4 — według własnego przepisu vLLM zajmuje ona 24,6 GiB VRAM przy rozmiarze tensor-parallel równym 1. Dla pojedynczej karty 48 GB uruchom FP8. Pełne BF16, punkt kontrolny o wadze 51,7 GB, wymaga jednego GPU 80 GB lub dwóch kart 48 GB w tensor-parallel. Dokładne polecenia znajdują się poniżej; pierwsze z nich jest jednowierszowe.

Wszystko tutaj zostało zweryfikowane 15 sierpnia 2026 roku, trzeciego dnia po udostępnieniu wag. Architektura, kontekst i licencja pochodzą z karty modelu Qwen3.8 27B na Hugging Face; rozmiar punktu kontrolnego to suma 18 shardów safetensors w repozytorium; polecenia vLLM i wartość 24,6 GiB pochodzą ze strony przepisu vLLM dla tego modelu. Qwen3.8 27B to gęsty model multimodalny Ali​baby o 27 miliardach parametrów — wagi na licencji Apache 2.0, wydany 13–14 sierpnia — a ponieważ wagi są otwarte, możesz uruchomić go samodzielnie zamiast wynajmować tokeny. O tym forku właśnie jest ten artykuł.

Fakty, które mają znaczenie, wraz ze źródłami.

Architektura — gęsty model 27B (27,8B licząc wieżę wizyjną i dopełnione słownictwo), 64 warstwy, rozmiar ukryty 5 120, słownictwo 248 320. Oficjalna karta modelu, zweryfikowana dzisiaj.

Uwaga — hybryda: 16 warstw pełnej uwagi, 48 liniowych warstw Gated DeltaNet w układzie blokowym 3:1. Tylko 16 warstw utrzymuje rosnącą pamięć podręczną klucz-wartość; pozostałe 48 utrzymuje natomiast stan rekurencyjny o stałym rozmiarze.

Kontekst — 262 144 tokeny natywnie, rozszerzalny do około 1M za pomocą skalowania YaRN RoPE. Karta modelu, zweryfikowana dzisiaj.

Wejście — natywny tekst, obraz i wideo; wyjście tekstowe. vLLM udostępnia wszystkie trzy przez standardowe API chat-completions, bez osobnego pliku projektora.

Licencja — Apache 2.0. Ten jeden fakt sprawia, że pytanie „serwować samemu czy wynajmować tokeny” w ogóle istnieje.

Wagi — checkpoint BF16 ma łącznie 51.7GB w 18 shardach safetensors (Hugging Face, zweryfikowano dzisiaj). Qwe​n publikuje również checkpointy FP8 i NVFP4 przeznaczone dla vLLM.

Wymaganie vLLM — 0.17.0 lub nowsza, z transformers ≥ 5.8.0. Strona przepisów vLLM, sprawdzona dzisiaj. „Dowolny vLLM” nie jest bezpieczną instrukcją; jądra warstwy rekurencyjnej to właśnie to, co dodaje nowa wersja.

Predykcja wielotokenowa — głowica szkicująca do dekodowania spekulacyjnego jest zawarta w punkcie kontrolnym, więc nie jest potrzebny osobny model szkicujący. vLLM dokumentuje tę flagę; nie istnieje jeszcze niezależna wartość przyspieszenia.

Drabina GPU — który quant na której karcie

Trzy formaty serwowania obejmują praktyczny zakres. Wybieraj według faktycznie posiadanej pamięci VRAM, a nie według „best quant”.

NVFP4 — 24.6 GiB łącznie (wagi plus pamięć podręczna KV w formacie FP8), zgodnie z przepisem vLLM przy TP1. Mieści się na pojedynczym GPU klasy Blackwell — w praktyce na 32GB RTX 5090 lub B200. To ścieżka o najniższym opóźnieniu i ta, która zachowuje najwięcej kontekstu na kartę: przepis vLLM podaje pojemność 6,6 mln tokenów KV nawet przy rozszerzeniu kontekstu do 1M.

FP8 — około 26 GB wag. Jedna karta 48 GB (L40S, RTX A6000, RTX 6000 Ada) obsłuży to z zapasem na kontekst; dwie karty 48 GB w tensor-parallel zapewniają zapas na dłuższy kontekst lub większą współbieżność. Gdy chcesz uzyskać jak największą pamięć podręczną KV, własna konfiguracja vLLM uruchamia FP8 z TP4 na tray GB300 z czterema GPU.

BF16 — 51.7GB wag, więc pojedyncze GPU z 80GB (H100, A100 80GB, B200, GB300) lub dwie karty 48GB przy TP2. To opcja z referencyjną precyzją i to właśnie z niej korzysta poniższe polecenie rozszerzenia kontekstu do 1M.

MXFP4 — nie używać na NVIDIA. Ścieżka MXFP4 w vLLM nie obejmuje obecnie obsługi metody liniowej; te same wagi są publikowane jako NVFP4, czyli format faktycznie używany w przepisie NVIDIA.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

Uruchom to — polecenia vLLM

Domyślna konfiguracja o niskim opóźnieniu dla pojedynczego GPU (NVFP4, jeden procesor graficzny Blackwell), dosłownie z przepisu vLLM:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

Komenda FP8 z tego samego przepisu (TP4, jedna taca GB300, największa pamięć podręczna KV):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

Dla dwóch kart 48GB zachowaj polecenie FP8 i ustaw --tensor-parallel-size 2 zamiast 4.

Dołącz to do obu poleceń, aby włączyć spekulatywne dekodowanie MTP:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

Rozszerzenie kontekstu 1M (również z przepisu vLLM):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

Co obiecują, a czego nie obiecują własne strony vLLM

Brak jeszcze danych o przepustowości dla 27B. Według stanu na 15 sierpnia strona z przepisami vLLM nie publikuje żadnych benchmarków przepustowości ani opóźnień dla Qwen3.8 27B. Krążąca liczba „4,000+ tokenów na sekundę na GPU” dotyczy modelu Qwen3.8 2.4T-A95B na stojaku GB300 NVL72 z 72 procesorami GPU, jest podawana przez producenta i nie dotyczy tego modelu. Społecznościowe liczby tokenów na sekundę, które można zobaczyć w obiegu dla GGUF w llama.cpp lub Ollamie — to inne środowisko uruchomieniowe i inne obciążenie niż serwowanie vLLM.

Twierdzenie o taniej pamięci podręcznej KV jest zależne od środowiska uruchomieniowego. Karta modelu podaje, że tylko 16 z 64 warstw przechowuje pamięć podręczną, ale to pomaga tylko wtedy, gdy silnik serwujący rzeczywiście implementuje warstwy Gated DeltaNet. vLLM 0.17+ to wersja, która to robi; dlatego przypięcie wersji jest w tym artykule na pierwszym miejscu, a nie w przypisie.

MTP jest wbudowane, ale nie zostało tutaj zmierzone. Głowica draftowa znajduje się w checkpoincie, a vLLM dokumentuje tę flagę, ale nikt jeszcze nie opublikował niezależnej wartości przyspieszenia dla tego 27B na vLLM. Zaplanuj pomiar na własnym ruchu.

NVIDIA to sprawdzona ścieżka. Przepis vLLM jest napisany dla procesorów graficznych NVIDIA (NVFP4 i FP8). Wdrożenia tego modelu z hybrydową uwagą na układach AMD Instinct lub Intel Gaudi są wciąż eksperymentalne, a ten artykuł nie udaje, że jest inaczej.

Podawaj to sam albo wynajmij tokeny.

To jest miejsce, gdzie Apache 2.0 wykonuje swoją pracę. Nie ma opłaty licencyjnej za token w Qwen3.8 27B, więc jedyne prawdziwe pytanie brzmi: czy posiadasz sprzęt, czy wynajmujesz tokeny.

Hostowanie u siebie (ten artykuł) — płacisz raz za GPU, a każdy kolejny token jest darmowy. RTX 5090, który już masz, sprawia, że komenda NVFP4 to punkt końcowy o zerowym koszcie krańcowym, bez wypuszczania danych poza komputer. Jeśli musisz wynająć GPU, chmurowy 5090 lub para A6000 to pozycja kosztowa, a cały ten wywód ma sens tylko wtedy, gdy już masz kartę lub stały wolumen.

Wynajmij tokeny — ponieważ wagi są otwarte, kilku dostawców go uruchamia, a dolna granica ceny to koszt sprzętu. Qwen3.8 27B jest dziś dostępny na OrcaRouter za 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych — bez marży dostawcy, bo OrcaRouter uruchamia otwarte wagi na własnej infrastrukturze — a te same otwarte wagi finansują darmowy poziom z limitem żądań, który pobiera 0 USD za żądanie i zwraca HTTP 429 po przekroczeniu limitu. Reprezentatywny miesiąc z 10 milionami tokenów przy 70% tokenów wejściowych kosztuje około 9,51 USD na płatnym poziomie.

Zasada decyzyjna — jeśli już posiadasz GPU, hostuj samodzielnie. Jeśli musiałbyś go kupić lub wynająć, API szybko osiąga próg rentowności przy wolumenach projektu pobocznego, a ten sam klient zgodny z OpenAI może wskazywać na którykolwiek z tych punktów końcowych, więc kod nie zmienia się przy przenoszeniu.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

Kiedy vLLM jest złą odpowiedzią

Jesteś jedną osobą przy laptopie — vLLM to silnik serwujący, a nie aplikacja desktopowa. Do lokalnego uruchomienia przez jednego użytkownika prostsze są llama.cpp lub Ollama z modelem Q4 GGUF — potrzeba karty z 24 GB pamięci, a nie GPU Blackwell; nasz przewodnik how-to-run-Qwen3.8-27B-locally przeprowadzi Cię przez ten proces od początku do końca.

Potrzebujesz gwarantowanej przepustowości i zerowej obsługi operacyjnej — własny hosting oznacza, że sam odpowiadasz za paginację, kolejkowanie i przełączanie awaryjne. Jeśli „API nie działa" nie ma znaleźć się w twoim słowniku, wynajmij tokeny i pozwól komuś innemu zarządzać flotą.

Naprawdę potrzebujesz pełnego ~1M kontekstu na poziomie frontier — to zadanie modelu Qwen3.8 2.4T-A95B, obsługiwanego przez vLLM lub SGLang na szafie GB300 NVL72 z 72 GPU. Model Qwen3.8 27B na jednej lub dwóch kartach GPU mu nie dorówna; nasz artykuł o serwowaniu modelu 2.4T wyjaśnia, dlaczego to zupełnie inna klasa problemu.

Jesteś na starszej karcie 24GB — NVFP4 to format Blackwell; na kartach 24GB z architekturą Ampere (RTX 3090) lub Ada (RTX 4090) ścieżka FP8 jest opcją vLLM, a poza tym kwantyzacja GGUF w llama.cpp to pragmatyczny wybór. Ten sam model na karcie 24GB to inna sprawa.

Musisz zapewnić maksymalną współbieżność na jednej karcie — powyższe wartości domyślne dla pojedynczego GPU to punkt wyjścia, a nie docelowa konfiguracja produkcyjna. Dostosuj --max-num-seqs, pamięć podręczną KV i konfigurację MTP do własnego miksu zapytań, zanim uznasz zadanie za zakończone.

Sedno sprawy

Qwen3.8 27B to rzadki gęsty model 27B, który vLLM obsługuje na pojedynczym GPU w produkcji. Zaktualizuj do vLLM 0.17.0+, pobierz kwantyzację NVFP4 dla karty Blackwell z 32 GB (24,6 GiB), kwantyzację FP8 dla jednej karty 48 GB lub dwóch w tensor-parallel, a BF16 zarezerwuj dla GPU z 80 GB. Komendy to jednolinijkowce, endpoint jest zgodny z O​penAI, a ponieważ wagi są na licencji Apache 2.0, możesz uruchomić go samodzielnie lub wynająć za 0,33/2,40 USD za milion tokenów z darmowym poziomem — w obu przypadkach ten sam kod klienta. Jedyną rzeczą, której nikt jeszcze nie ma, jest niezależny pomiar przepustowości dla 27B na vLLM, więc po uruchomieniu zarezerwuj sobie godzinę na benchmarki, zanim obiecasz komukolwiek wartość opóźnienia.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube