
Qwen3.8-27B GGUF: Którą kwantyzację pobrać dla swojej karty graficznej
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Pobierz pakiet unsloth/Qwen3.8-27B-GGUF i dopasuj plik do karty, którą faktycznie posiadasz. To cała odpowiedź: karta z 24 GB (RTX 4090 lub 3090) powinna pobrać plik Q4_K_M o rozmiarze 17,1 GB; karta z 16 GB powinna pobrać plik IQ4_XS o rozmiarze 15,7 GB (albo plik Q3_K_M o rozmiarze 13,8 GB, jeśli chcesz mieć zapas na kontekst); karta z 12 GB jest ograniczona do plików 2-bitowych, plik UD-IQ2_XXS o rozmiarze 9,0 GB, i to kompromis, który trzeba świadomie zaakceptować. Qwen3.8 27B — gęsty model firmy Alibaba o 27 miliardach parametrów, którego wagi na licencji Apache 2.0 wydano 13–14 sierpnia 2026 — działa lokalnie wyjątkowo tanio, bo jego hybrydowy mechanizm uwagi buforuje tylko 16 z 64 warstw, więc kwantyzacja 4-bitowa na karcie z 24 GB bez problemu udźwignie 32K–64K tokenów kontekstu. A GGUF to jedyna opcja o zerowym koszcie krańcowym: bez klucza API, bez rachunku za token, bez wypuszczania danych poza komputer.
W kwestii źródeł: architektura, okno kontekstu i licencja są oficjalne — pochodzą z karty modelu Qwen3.8 27B na Hugging Face, zweryfikowanej 15 sierpnia 2026 r. Rozmiary GGUF pochodzą z repozytoriów GGUF unsloth i ggml-org, również z tego samego dnia. Zalecenia dotyczące VRAM na GPU są oficjalną rekomendacją unsloth. Szacunki rozmiaru KV-cache w bajtach oraz wartości tokenów na sekundę zostały zmierzone przez społeczność w pierwszych dniach po premierze, a nie pochodzą ze specyfikacji producenta. Każdy benchmark wymieniony poniżej jest raportowany przez Alibabę i nie został zreprodukowany.
Selektor plików, jedna linia na kwant
• UD-IQ2_XXS — 9.0GB — jedyna wygodna opcja dla karty 12GB; spodziewaj się widocznej utraty jakości.
• UD-Q2_K_XL — 10.7GB — karty 12GB, z prawie zerowym zapasem kontekstu.
• Q3_K_M — 13.8GB — karty 16GB, które chcą mieć zapas kontekstu.
• IQ4_XS — 15.7GB — karty 16GB: największa kwantyzacja, która mieści się w całości.
• Q4_K_M — 17,1 GB — karty 24GB: złoty środek i plik, do którego prowadzi ten artykuł.
• Q5_K_M — 19.8GB — 24GB, wymieniając zapas kontekstu na niewielką poprawę jakości.
• Q6_K — 22,9 GB — mieści się w 24 GB, jeśli się upchnie; prawie bezstratny.
• Q8_0 — 29.0GB — 32GB, podział na dwie karty lub odciążenie CPU.
• BF16 — 54,7 GB — karty serwerowe i konfiguracje CPU z dużą ilością RAM; precyzja referencyjna.
Dwa pakiety, dwa rozmiary Q4_K_M: unsloth ma 17,1 GB; ggml-org ma 19,0 GB. Pakiet unsloth używa kwantyzacji Dynamic V3.0 (preview) dla swoich plików UD-* i to do niego domyślnie odwołuje się większość lokalnych aplikacji; pakiet ggml-org zawiera standardowe K-quanty oraz oddzielną głowicę przewidywania wielu tokenów używaną do dekodowania spekulatywnego. Każdy Q4_K_M działa — różnica to kilkaset megabajtów i plik MTP.

Dlaczego ten 27B mieści się na kartach mniejszych niż większość
Qwen3.8 27B ma 64 warstwy, ale tylko 16 używa pełnej uwagi. Pozostałe 48 używa liniowej uwagi Gated DeltaNet, która utrzymuje stan rekurencyjny o stałym rozmiarze zamiast rosnącej pamięci podręcznej kluczy i wartości (KV). Układ bloków w karcie modelu to 3×(Gated DeltaNet → FFN) na każde 1×(Gated Attention → FFN) — współczynnik hybrydowy 3:1. Praktyczny efekt: pamięć podręczna KV to mniej więcej jedna czwarta tego, czego konwencjonalny model gęsty 27B potrzebuje dla tego samego kontekstu. Pomiary społeczności w tym tygodniu określają tę pamięć na około 0,5 GB przy kontekście 8K, 2,0 GB przy 32K i 16,4 GB przy pełnym natywnym oknie 262K. To odwraca zwykłą radę — większość budżetu VRAM pochłaniają wagi, a nie kontekst, a karta z 24 GB może uruchomić Q4_K_M z kontekstem 64K–96K bez wysiłku. Tę pamięć można zmniejszyć jeszcze bardziej za pomocą flagi --cache-type-k w llama.cpp, która kwantyzuje samą pamięć podręczną.

Trzy pułapki, które zaskoczą Cię pierwszego dnia
• Starsze kompilacje llama.cpp odrzucają ten plik.Ten plik GGUF rejestruje nową architekturę qwen35, więc potrzebujesz aktualnej kompilacji — wszystko sprzed tygodnia premiery odmawia wczytania go z błędem architektury. Najpierw zaktualizuj llama.cpp, zanim pobierzesz plik.
• Pułapka szablonu. Oficjalny szablon czatu Jinja opakowuje każdą turę asystenta w blok think nawet wtedy, gdy ślad rozumowania jest pusty, co tworzy zagnieżdżone bloki i obciętą historię w rozmowach wieloturnusowych — wygląda to tak, jakby model zapomniał, co powiedziałeś. Uruchom llama.cpp z flagą --jinja i preferuj pakiet, który zawiera poprawiony chat_template.jinja.
• Wizja wymaga osobnego pliku. Tekst działa od razu; obrazy i wideo po cichu nic nie robią, dopóki nie załadujesz także projektu mmproj, ważącego około 0,9 GB. Nie ma go na stronie repozytorium GGUF na unsloth — pobierz go z bazowego repozytorium lub z pakietu ggml-org. Jeśli planujesz podawać dokumenty lub zrzuty ekranu, dodaj --mmproj do polecenia serwera.
Uruchom to: polecenia
llama.cpp, gdy masz aktualną kompilację:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
...i dodaj --mmproj Qwen3.8-27B-mmproj-bf16.gguf, jeśli potrzebujesz wizji.
Ollama, jeśli chcesz wpis z biblioteki: ollama pull qwen3.8:27b, a następnie ollama run qwen3.8:27b. LM Studio i Unsloth Desktop automatycznie przejmują szablon czatu i przeładowanie RAM — to najmniej skomplikowana ścieżka na pierwsze uruchomienie.
Lokalnie a API: uczciwa ekonomia
GGUF to darmowa trasa: zerowy koszt krańcowy, brak limitów zapytań, nic nie opuszcza Twojej maszyny. Nie jest to jednak tania trasa w ujęciu bezwzględnym — musisz zapewnić GPU z 24 GB (używaną RTX 3090 lub nową RTX 4090, plus prąd), a plik 2-bitowy na karcie z 12 GB to doświadczenie pełne kompromisów.
Trasa API istnieje, ponieważ wagi są na licencji Apache 2.0, więc koszt krańcowy obsługi jest bliski zeru i każdy może hostować. Qwen3.8 27B jest dziś dostępny na OrcaRouter w cenie 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych — cena listowa dostawcy bez żadnej marży — a ponieważ wagi są otwarte, istnieje również ograniczony limitem darmowy poziom, który kosztuje 0 USD za żądanie i zwraca HTTP 429 po przekroczeniu limitu. Reprezentatywny miesiąc z 10 milionami tokenów przy 70% udziale tokenów wejściowych kosztuje około 9,51 USD na płatnym poziomie. Jeśli już masz GPU, lokalnie wygrywa pod względem kosztów; jeśli nie, wynajęcie tokenów jest lepsze niż kupowanie karty dla projektu pobocznego.

Gdy to zalecenie jest błędne
Q4_K_M na 24GB to domyślna opcja, a nie uniwersalna odpowiedź. Wybierz coś innego, gdy:
• Potrzebujesz maksymalnej jakości na serwerze lub stacji roboczej — Q8_0 w 29GB lub BF16 w 54.7GB z odciążeniem CPU i RAM, a nie plik 4-bitowy.
• Korzystasz z karty z serii Blackwell RTX 50 — wariant NVFP4 jest około 1,5× szybszy przy tych samych 24 GB pamięci VRAM i używa pamięci podręcznej KV w formacie FP8 dla dłuższego kontekstu.
• Potrzebujesz pełnego kontekstu 262K — przeznacz około 16GB na cache oprócz wag; to spycha kartę 24GB do Q3_K_M lub wymusza kwantyzację KV.
• Polegasz na dekodowaniu spekulacyjnym — wybierz pakiet ggml-org, który zachowuje głowicę do przewidywania wielu tokenów; niektóre kwantyzacje usuwają ją, aby zaoszczędzić około 0,5 GB.
• Masz tylko 12GB — szczera odpowiedź: 2-bitowy 27B jest wyraźnie gorszy niż ten sam model serwowany prawidłowo. Zanim zdecydujesz się na lokalną konfigurację 2-bitową, wypróbuj darmowy poziom API; jeśli będzie wystarczająco dobry, GGUF może poczekać, aż sprzęt nadąży.
Sedno sprawy
Qwen3.8 27B to ten rzadki model 27B, który mieści się na karcie 24GB bez kompromisów: pobranie Q4_K_M o wielkości 17,1 GB, aktualna kompilacja llama.cpp i tania pamięć podręczna KV, dzięki czemu długi kontekst kosztuje prawie nic. Pobierz ten plik, jeśli masz odpowiedni sprzęt, pamiętaj, że wizja wymaga osobnego mmproj, i nastaw się na pułapkę z szablonem, gdy po raz pierwszy rozmowa wieloetapowa zacznie wyglądać na zapominającą. Jeśli nie masz takiego sprzętu, ten sam model dostępny jest jako API za 0,33 USD / 2,40 USD z darmowym limitowanym poziomem, więc nie ma powodu, by uruchamiać 2-bitowy plik, z którego nie jesteś zadowolony. GGUF to darmowa ścieżka; to już jednak nie jedyna droga.
