Karta tytułowa artykułu 'Qwen3.8-27B VRAM Requirements' przedstawiająca układ GPU z etykietą pamięci ~17 GB oraz plakietkami kwantyzacji dla Q4_K_M, Q6_K i Q8_0.
Guides & Insights

Qwen3.8-27B Wymagania VRAM: ile sprzętu naprawdę potrzebujesz

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Około 17 GB pamięci VRAM to liczba, która krąży w kontekście Qwen3.8-27B — Daniel Han z Unsloth powiedział, że model „po premierze powinien zmieścić się w mniej więcej 17 GB VRAM" — i warto precyzyjnie określić, czym ta liczba jest, a czym nie jest. To prognoza oparta na poprzedniku modelu 27B, a nie specyfikacja od Alibaby, ponieważ model nie został jeszcze wydany; oficjalne repozytorium zapowiedziano na tydzień 10 sierpnia 2026 roku i w momencie pisania tego tekstu nadal się nie pojawiło. Niniejszy artykuł porządkuje kwestię VRAM, dzieląc ją na to, na czym możesz planować, co jest naprawdę niepewne, oraz jak ta liczba zmienia się w zależności od kwantyzacji, rozmiaru okna kontekstowego i środowiska uruchomieniowego.

Najpierw szczera odpowiedź.

Nie ma jeszcze oficjalnej specyfikacji sprzętowej dla Qwen3.8-27B. Wszystko poniżej to prognozy na podstawie Qwen3.6-27B, modelu, którego następcą jest 27B — ta sama liczba parametrów, najprawdopodobniej ta sama architektura hybrydowa i najbliższy dostępny punkt odniesienia do szacowania wymagań sprzętowych. Traktuj te liczby jako ramy planistyczne, a nie listę wymagań. Pierwsze realne pomiary pojawią się w ciągu kilku dni od publikacji wag ze strony osób zajmujących się kwantyzacją i opiekunów frameworków do wnioskowania — i to na nich należy oprzeć decyzję zakupową.

Drabina quantów

Ile pamięci VRAM potrzebujesz, zależy prawie wyłącznie od tego, jaką kwantyzację uruchomisz. Wychodząc od zmierzonej przez społeczność tabeli Qwen3.6-27B:

• Q4_K_M — mniej więcej 16 GB VRAM. Złoty środek dla kart z 24 GB i prawdopodobne źródło tej liczby „17 GB". Domyślny wybór większości zespołów.

• Q3_K_M / IQ3 — około 13 GB VRAM. Mieści się na kartach 16 GB, a nawet 12 GB, z wyraźnym spadkiem jakości.

• Q6_K — około 21 GB VRAM. Prawie bezstratny i ciasne, ale realne dopasowanie na karcie 24 GB.

• Q8_0 — mniej więcej 27–30 GB pamięci VRAM. Dla kart 48 GB, gdy chcesz wycisnąć ostatnie krople jakości.

• Serwowanie FP8 — około 27 GB VRAM dla wag, dlatego pojedynczy L40S jest powszechnym wyborem GPU do inferencji.

• Pełna precyzja (BF16) — około 54 GB VRAM. Realistycznie rzecz biorąc, to karta klasy H100, czyli obszar, w którym ludzie przestają nazywać to „lokalnym”.

W skrócie: karta GPU z 24 GB to bezpieczny zakup dla tego modelu, karta z 16 GB może go uruchomić tylko jeśli zaakceptujesz niskie kwantyzacje, a każda karta z 8 GB lub mniej odpada, chyba że model okaże się znacznie lżejszy niż jego poprzednik.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

Zmienna, której nikt nie cytuje: długość kontekstu

Każda liczba powyżej dotyczy umiarkowanego kontekstu. Pamięć VRAM rośnie wraz z kontekstem, ponieważ pamięć podręczna KV musi znajdować się obok wag. W przypadku Qwen3.6-27B kontekst 2K mieścił się w około 11 GB, kontekst 32K sprawiał, że ta sama kwantyzacja przekraczała 14 GB, a 128K ponad dwukrotnie zwiększało zajętość pamięci podręcznej. Jeśli Qwen3.8-27B zachowa duże natywne okno kontekstowe — a generacja Qwe​n zmierza w tym kierunku — zaplanuj kilka GB zapasu poza rozmiarem kwantyzacji lub ogranicz kontekst w konfiguracji środowiska uruchomieniowego. Wybieranie długości kontekstu, której w praktyce nie używasz, to najczęstszy sposób, w jaki zespoły kupują większą kartę, niż potrzebują.

Niewiadoma architektury hybrydowej

Qwen3.6-27B był modelem hybrydowym: tylko 16 z jego 65 warstw korzystało z tradycyjnej pamięci podręcznej KV, a 48 używało stałego stanu rekurencyjnego. Efektem było około czterokrotnie mniejsze zużycie pamięci KV niż w gęstym modelu o tej samej wielkości — co w dużej mierze wyjaśnia, dlaczego model 27B sprawiał wrażenie modelu mieszczącego się na karcie 24 GB, a nie 48 GB. Jeśli Qwen3.8-27B zachowa hybrydową konstrukcję (prawdopodobne, ale niepotwierdzone), powyższe wyliczenia dotyczące długości kontekstu okażą się korzystniejsze, niż się wydaje. Haczyk tkwi w obsłudze środowisk uruchomieniowych: wersja llama.cpp lub vLLM, która nie implementuje warstw rekurencyjnych, zgłosi znacznie wyższe zużycie pamięci. Zanim przyjmiesz, że te szacunki się sprawdzą, sprawdź, które środowiska uruchomieniowe mają już zaimplementowaną obsługę.

Które GPU faktycznie działają

Konkretnie, w przypadku zwykłych kart:

• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M bez problemu, Q6_K, jeśli chcesz trochę ścisnąć. To jest docelowa grupa odbiorców.

RTX 3060 / 4060 Ti 16 GB — tylko kwantyzacje poziomu IQ4 lub Q3, z umiarkowanym kontekstem. Do użycia, ale nieprzyjemne.

• Karty 12 GB — Q3_K_M w obniżonej jakości. Dobre do eksperymentów, nie do serwowania.

• Apple Silicon — 24 GB Mac uruchamia te same pliki Q4 przez MLX lub llama.cpp; modele bazowe z 16 GB pamięci mają problemy z wymianą strony (swap-thrash) i w praktyce odpadają, tak jak było w przypadku Qwen3.6-27B.

• 48 GB i więcej (A6000, L40S, konfiguracje z dwiema kartami) — serwowanie Q8_0 lub FP8 z prawdziwym zapasem wydajności.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Albo całkowicie pomiń GPU.

{{1}}Jeśli matematyka sprzętowa ci nie gra, model też nie musi.{{/1}} OrcaRouter to jedno API obejmujące ponad 200 modeli — w tym rodzinę Qwe​n — które przekazuje ceny z cennika dostawcy bez żadnej marży, więc Qwen3.8-Max kosztuje obecnie $2.00 za milion tokenów wejściowych i $6.00 za milion tokenów wyjściowych, tyle samo co na stronie z cennikiem samego dostawcy. Sam model 27B będzie modelem lokalnym, ale gdy jego wagi trafią do sieci i zyska zaufanie, ten sam klucz będzie kierował zapytania do dowolnego dostawcy, który go udostępni — możesz już teraz budować na tej generacji i w ogóle nie dotykać rynku odsprzedawców GPU.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Konkluzja w kwestii sprzętu: planuj 16 GB, aby komfortowo uruchomić model w precyzji 4-bitowej, 24 GB dla bezpieczeństwa, aby mieć zapas na kontekst i wyższe kwantyzacje, a każdą podaną tu liczbę traktuj jako wstępną, dopóki repozytorium nie zostanie opublikowane i nie pojawią się pierwsze rzeczywiste pomiary. Prognoza „17 GB" jest rozsądną liczbą do planowania — ale póki co to nie fakt.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube