
Qwen3.8-27B Wymagania VRAM: ile sprzętu naprawdę potrzebujesz
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 2382 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
Około 17 GB pamięci VRAM to liczba, która krąży w kontekście Qwen3.8-27B — Daniel Han z Unsloth powiedział, że model „po premierze powinien zmieścić się w mniej więcej 17 GB VRAM" — i warto precyzyjnie określić, czym ta liczba jest, a czym nie jest. To prognoza oparta na poprzedniku modelu 27B, a nie specyfikacja od Alibaby, ponieważ model nie został jeszcze wydany; oficjalne repozytorium zapowiedziano na tydzień 10 sierpnia 2026 roku i w momencie pisania tego tekstu nadal się nie pojawiło. Niniejszy artykuł porządkuje kwestię VRAM, dzieląc ją na to, na czym możesz planować, co jest naprawdę niepewne, oraz jak ta liczba zmienia się w zależności od kwantyzacji, rozmiaru okna kontekstowego i środowiska uruchomieniowego.
Najpierw szczera odpowiedź.
Nie ma jeszcze oficjalnej specyfikacji sprzętowej dla Qwen3.8-27B. Wszystko poniżej to prognozy na podstawie Qwen3.6-27B, modelu, którego następcą jest 27B — ta sama liczba parametrów, najprawdopodobniej ta sama architektura hybrydowa i najbliższy dostępny punkt odniesienia do szacowania wymagań sprzętowych. Traktuj te liczby jako ramy planistyczne, a nie listę wymagań. Pierwsze realne pomiary pojawią się w ciągu kilku dni od publikacji wag ze strony osób zajmujących się kwantyzacją i opiekunów frameworków do wnioskowania — i to na nich należy oprzeć decyzję zakupową.
Drabina quantów
Ile pamięci VRAM potrzebujesz, zależy prawie wyłącznie od tego, jaką kwantyzację uruchomisz. Wychodząc od zmierzonej przez społeczność tabeli Qwen3.6-27B:
• Q4_K_M — mniej więcej 16 GB VRAM. Złoty środek dla kart z 24 GB i prawdopodobne źródło tej liczby „17 GB". Domyślny wybór większości zespołów.
• Q3_K_M / IQ3 — około 13 GB VRAM. Mieści się na kartach 16 GB, a nawet 12 GB, z wyraźnym spadkiem jakości.
• Q6_K — około 21 GB VRAM. Prawie bezstratny i ciasne, ale realne dopasowanie na karcie 24 GB.
• Q8_0 — mniej więcej 27–30 GB pamięci VRAM. Dla kart 48 GB, gdy chcesz wycisnąć ostatnie krople jakości.
• Serwowanie FP8 — około 27 GB VRAM dla wag, dlatego pojedynczy L40S jest powszechnym wyborem GPU do inferencji.
• Pełna precyzja (BF16) — około 54 GB VRAM. Realistycznie rzecz biorąc, to karta klasy H100, czyli obszar, w którym ludzie przestają nazywać to „lokalnym”.
W skrócie: karta GPU z 24 GB to bezpieczny zakup dla tego modelu, karta z 16 GB może go uruchomić tylko jeśli zaakceptujesz niskie kwantyzacje, a każda karta z 8 GB lub mniej odpada, chyba że model okaże się znacznie lżejszy niż jego poprzednik.

Zmienna, której nikt nie cytuje: długość kontekstu
Każda liczba powyżej dotyczy umiarkowanego kontekstu. Pamięć VRAM rośnie wraz z kontekstem, ponieważ pamięć podręczna KV musi znajdować się obok wag. W przypadku Qwen3.6-27B kontekst 2K mieścił się w około 11 GB, kontekst 32K sprawiał, że ta sama kwantyzacja przekraczała 14 GB, a 128K ponad dwukrotnie zwiększało zajętość pamięci podręcznej. Jeśli Qwen3.8-27B zachowa duże natywne okno kontekstowe — a generacja Qwen zmierza w tym kierunku — zaplanuj kilka GB zapasu poza rozmiarem kwantyzacji lub ogranicz kontekst w konfiguracji środowiska uruchomieniowego. Wybieranie długości kontekstu, której w praktyce nie używasz, to najczęstszy sposób, w jaki zespoły kupują większą kartę, niż potrzebują.
Niewiadoma architektury hybrydowej
Qwen3.6-27B był modelem hybrydowym: tylko 16 z jego 65 warstw korzystało z tradycyjnej pamięci podręcznej KV, a 48 używało stałego stanu rekurencyjnego. Efektem było około czterokrotnie mniejsze zużycie pamięci KV niż w gęstym modelu o tej samej wielkości — co w dużej mierze wyjaśnia, dlaczego model 27B sprawiał wrażenie modelu mieszczącego się na karcie 24 GB, a nie 48 GB. Jeśli Qwen3.8-27B zachowa hybrydową konstrukcję (prawdopodobne, ale niepotwierdzone), powyższe wyliczenia dotyczące długości kontekstu okażą się korzystniejsze, niż się wydaje. Haczyk tkwi w obsłudze środowisk uruchomieniowych: wersja llama.cpp lub vLLM, która nie implementuje warstw rekurencyjnych, zgłosi znacznie wyższe zużycie pamięci. Zanim przyjmiesz, że te szacunki się sprawdzą, sprawdź, które środowiska uruchomieniowe mają już zaimplementowaną obsługę.
Które GPU faktycznie działają
Konkretnie, w przypadku zwykłych kart:
• RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M bez problemu, Q6_K, jeśli chcesz trochę ścisnąć. To jest docelowa grupa odbiorców.
RTX 3060 / 4060 Ti 16 GB — tylko kwantyzacje poziomu IQ4 lub Q3, z umiarkowanym kontekstem. Do użycia, ale nieprzyjemne.
• Karty 12 GB — Q3_K_M w obniżonej jakości. Dobre do eksperymentów, nie do serwowania.
• Apple Silicon — 24 GB Mac uruchamia te same pliki Q4 przez MLX lub llama.cpp; modele bazowe z 16 GB pamięci mają problemy z wymianą strony (swap-thrash) i w praktyce odpadają, tak jak było w przypadku Qwen3.6-27B.
• 48 GB i więcej (A6000, L40S, konfiguracje z dwiema kartami) — serwowanie Q8_0 lub FP8 z prawdziwym zapasem wydajności.

Albo całkowicie pomiń GPU.
{{1}}Jeśli matematyka sprzętowa ci nie gra, model też nie musi.{{/1}} OrcaRouter to jedno API obejmujące ponad 200 modeli — w tym rodzinę Qwen — które przekazuje ceny z cennika dostawcy bez żadnej marży, więc Qwen3.8-Max kosztuje obecnie $2.00 za milion tokenów wejściowych i $6.00 za milion tokenów wyjściowych, tyle samo co na stronie z cennikiem samego dostawcy. Sam model 27B będzie modelem lokalnym, ale gdy jego wagi trafią do sieci i zyska zaufanie, ten sam klucz będzie kierował zapytania do dowolnego dostawcy, który go udostępni — możesz już teraz budować na tej generacji i w ogóle nie dotykać rynku odsprzedawców GPU.

Konkluzja w kwestii sprzętu: planuj 16 GB, aby komfortowo uruchomić model w precyzji 4-bitowej, 24 GB dla bezpieczeństwa, aby mieć zapas na kontekst i wyższe kwantyzacje, a każdą podaną tu liczbę traktuj jako wstępną, dopóki repozytorium nie zostanie opublikowane i nie pojawią się pierwsze rzeczywiste pomiary. Prognoza „17 GB" jest rozsądną liczbą do planowania — ale póki co to nie fakt.
