Karta tytułowa w sekcji hero z napisem Qwen3.8-27B with Unsloth, z podtytułem 'uruchom, skwantyzuj lub dostrój lokalnie', ikoną okna terminala oraz chipami z napisami 'UD-Q4_K_XL 17.9GB' i 'Studio no-config'.
Guides & Insights

Qwen3.8-27B z Unsloth: Uruchom, skwantyzuj lub dostrój go lokalnie

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tak — Unsloth uruchamia Qwen3.8 27B i jest to najszybszy sposób, aby umieścić nowy model Ali​baba na licencji Apache-2.0 na własnym GPU. Cała odpowiedź w jednym zdaniu: otwórz Unsloth Studio, wyszukaj „Qwen3.8 27B", wybierz UD-Q4_K_XL (17.9GB) na karcie 24 GB i rozmawiaj w mniej niż minutę. Pod tym kliknięciem Unsloth wypuścił trzy rzeczy w tym samym tygodniu, w którym opublikowano wagi (13–14 sierpnia 2026 r.): unsloth/Qwen3.8-27B-GGUF pakiet zbudowany na kwantyzacji Unsloth Dynamic V3.0 (preview), pełne wsparcie w Unsloth Studio i Desktop oraz v0.1.800-beta — wydanie z eksportem GGUF, wykrywaniem imatrix i ulepszeniami dopasowania do VRAM. Narzędzie to udostępnia również fine-tuning modelu — według Unsloth trening jest 2× szybszy i zużywa 70% mniej VRAM. Qwen3.8 27B to gęsty model wizyjno-językowy o 27 miliardach parametrów, którego hybrydowa uwaga utrzymuje tylko 16 z 64 warstw w pełnej uwadze, dlatego plik 4-bitowy mieści się na kartach, na których większość modeli 27B się nie mieści.

Co do źródeł: fakty o modelu są oficjalne, pochodzą z karty modelu Qwen3.8 27B w serwisie Hugging Face, zweryfikowane 15 sierpnia 2026 r. Wsparcie Unsloth, rozmiary kwantyzacji, wymagania co do VRAM i polecenia instalacji pochodzą z notatek wydania i dokumentacji Unsloth, aktualnych tego samego dnia. Cena API pochodzi bezpośrednio z katalogu OrcaRouter, tego samego dnia. Stwierdzenia Unsloth „2× szybciej, 70% mniej VRAM" i „zdecydowanie najmocniejszy model w swojej klasie" to deklaracje producenta, które nie zostały niezależnie potwierdzone.

Co "Qwen3.8 + Unsloth" oznacza: cztery różne rzeczy

Unsloth to cztery odrębne rzeczy, a wyniki wyszukiwania po słowach kluczowych mieszają je ze sobą. Wiedza o tym, której z nich potrzebujesz, to połowa konfiguracji:

unsloth/Qwen3.8-27B-GGUF — pliki z kwantyzowanymi wagami na Hugging Face, 21 kwantów plus projektor wizyjny. Zbudowane za pomocą Dynamic V3.0 (podgląd), a nie starszego Dynamic 2.0 (który został ogłoszony 24 kwietnia 2025 r. i jest wcześniejszy niż ten model). To metoda „pobierz plik”, dostępna z każdej kompilacji llama.cpp.

Unsloth Studio — aplikacja przeglądarkowa, którą instalujesz lub uruchamiasz z przestrzeni Hugging Face. Przeszukuj centrum modeli, kliknij kwantyzację, czatuj z narzędziami. Bez ręcznej konfiguracji szablonu ani parametrów inferencji.

Unsloth Desktop — lokalna aplikacja GUI dla systemów macOS, Windows i Linux, która obejmuje Studio i trenowanie. To właśnie tutaj odbywa się dostrajanie „2× szybciej przy 70% mniejszym zużyciu VRAM".

Biblioteka unsloth dla Pythona — from unsloth import FastLanguageModel, API do fine-tuningu QLoRA używane w notebookach i skryptach.

Notatki z wydania Unsloth dla wersji v0.1.800-beta, zatytułowanego „Release Qwen3.8 27B", informują, że Qwen3.8 27B oraz Qwen3.8-2.4T-A95B o 2,4T parametrów „mogą być teraz uruchamiane lokalnie w Unsloth", że wersja 27B „działa na 17 GB RAM dzięki Unsloth Dynamic GGUF" oraz że „można również dostroić Qwen3.8 27B w Unsloth". To samo wydanie dodaje kwantyzacje NVFP4, sprawdza miejsce na dysku przed eksportem GGUF, wykrywa rzeczywiste wsparcie imatrix GGUF w Studio i przyspiesza wnioskowanie nawet o 10% na GGUF z konfigurowalnym limitem VRAM.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Wybieraj kwantyzację według VRAM, a nie według przeczuć.

Tabela pamięci Unslotha obejmuje sumę pamięci RAM i VRAM (lub pamięci zunifikowanej) i jest to oficjalne wytyczne. Model Qwen3.8 27B w 4-bitach wymaga 17–19 GB; 24 GB RTX 4090, RTX 5080 lub Mac z 24 GB pamięci zunifikowanej to realistyczne minimum dla wygodnej konfiguracji 4-bitowej. Trzy opcje, które obejmują prawie wszystkich:

12GB → UD-IQ2_XXS przy 9.0GB — jedyny plik, który mieści się w całości; spodziewaj się widocznej utraty jakości. Podejmij tę decyzję świadomie.

16GB → UD-Q3_K_XL przy 13.4GBnajlepszy plik 3-bitowy, według własnego pickera Unsloth.

24GB → UD-Q4_K_XL o rozmiarze 17.9GB — rekomendowany plik 4-bitowy i domyślna odpowiedź tego artykułu.

48–64GB → UD-Q8_K_XL przy 31.5GB — niemal bezstratna na stacji roboczej lub w konfiguracji z dwoma GPU.

Pełna drabinka, z listy plików unsloth/Qwen3.8-27B-GGUF oraz dokumentacji Unsloth, obu zweryfikowanych 15 sierpnia 2026 r.: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Standardowe K-quanty (Q4_K_M 17,1 GB, Q8_0 29,0 GB) też tam są, a pakiet zawiera projektor wizyjny (mmproj-BF16, 931 MB), więc obrazy i wideo działają, jeśli go załadujesz. Unsloth nazywa całą drabinkę „Dynamic V3.0 (preview)" — nowszą niż Dynamic 2.0, którą zobaczysz w starszych publikacjach, a która została zbudowana dla modeli wydanych ponad rok wcześniej.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Uruchom to z Unsloth w trzy minuty

Trasa jednym kliknięciem: na macOS lub Linux, curl -fsSL https://unsloth.ai/install.sh | sh, następnie unsloth studio -p 8888 i otwórz http://127.0.0.1:8888. Na Windows, irm https://unsloth.ai/install.ps1 | iex. Jeśli chcesz całkowicie uniknąć instalacji, Studio Unsloth jest również opublikowane jako Space na Hugging Face — otwórz je w przeglądarce, wyszukaj „Qwen3.8 27B” i wybierz kwantyzację odpowiednią do posiadanej pamięci. Studio automatycznie dostraja parametry próbkowania i szablon czatu, przenosi dane do RAM, gdy zabraknie pamięci VRAM, oraz wykrywa konfiguracje z wieloma GPU — część „no-config” jest prawdziwa i jest to najszybszy sposób na uruchomienie modelu z tego tygodnia.

Jeśli już używasz llama.cpp, ścieżka „pliki najpierw”: pobierz jeden kwant i uruchom go bezpośrednio. To są własne polecenia Unsloth, zweryfikowane względem ich dokumentacji:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Te wartości próbkowania to zalecane przez kartę modelu ustawienia trybu myślenia. Zamień glob --include na *UD-Q3_K_XL* w przypadku karty z 16 GB, a jeśli potrzebujesz obsługi wizji, dodaj --mmproj wskazujący na mmproj-BF16.gguf z pakietu. Jeden haczyk: llama.cpp musi być w aktualnej wersji — plik rejestruje nową architekturę qwen35, a cokolwiek sprzed tygodnia premiery odmówi jego załadowania.

Dostrój to z Unsloth

Dostrajanie jest tym, gdzie Unsloth zdobywa swoją reputację: biblioteka twierdzi, że zapewnia 2× szybsze trenowanie przy 70% mniejszym zużyciu VRAM w porównaniu ze standardowymi Transformers + PEFT, co sprawia, że QLoRA na 27B jest wykonalna na pojedynczej karcie konsumenckiej. Punkt wejścia do dostrajania to zwykłe unsloth/Qwen3.8-27B repozytorium (strona plików safetensors, 28B) zamiast pakietu GGUF. Standardowy wzorzec QLoRA Unsloth zastosowany do tego modelu:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

następnie standardowa pętla trl.SFTTrainer na twoim zestawie danych. Ten fragment to standardowy wzorzec QLoRA z dokumentacji Unsloth — twierdzenia dotyczące benchmarków treningowych należą do Unsloth i nie są czymś, co odtworzyłem — i dotyczą go dwa zastrzeżenia: jądra Unsloth modyfikują warstwy transformera tekstu, więc zaplanuj obsługę enkodera wizji osobno, i utrzymuj pakiet unsloth w bieżącej wersji, ponieważ ta architektura ma zaledwie kilka dni, a niezgodności wersji kończą się głośnymi błędami.

Co Unsloth Studio robi za Ciebie

Uruchamianie GGUF ręcznie oznacza balansowanie między rozmiarem kontekstu, przenoszeniem do RAM a wywoływaniem narzędzi. Studio sprowadza to do wartości domyślnych: dobiera rozmiar kontekstu na podstawie faktycznie wolnej pamięci, zwalnia nieużywane modele wizyjne z VRAM, aby zrobić miejsce na czat lub trenowanie, wykrywa układy multi-GPU oraz podłącza wyszukiwanie w sieci, wykonywanie kodu i połączenia z agentami (Claude Code, Codex, MCP) od razu po wyjęciu z pudełka. Wydanie v0.1.800-beta zaostrzyło też elementy, które w praktyce bywają uciążliwe: eksport GGUF sprawdza teraz miejsce na dysku przed rozpoczęciem długiego scalania zamiast przerywać w połowie, Studio wykrywa, czy eksportowany przez nie GGUF faktycznie obsługuje imatrix (więc nie marnujesz przebiegu), a zabezpieczenia pamięci nie rezerwują już nadmiarowo pamięci GPU. Jak na model, który ma trzy dni, „no-config” robi naprawdę dobrą robotę.

Lokalnie za darmo vs płatne API: rzetelny rachunek ekonomiczny

Podstawowa różnica między Unsloth a API nie dotyczy jakości — chodzi o to, kto jest właścicielem sprzętu. Unsloth to darmowa droga: zerowy koszt krańcowy na token, nic nie opuszcza Twojej maszyny, brak limitów szybkości i pełna kontrola nad wagami. Nie jest to jednak darmowe w sensie absolutnym: zapewniasz GPU i prąd, a plik 2-bitowy na karcie 12 GB to doświadczenie okupione kompromisami. Qwen3.8 27B to model gęsty i obsługujący wizję, więc 4-bitowa wersja to 17,9 GB wag przed uwzględnieniem kontekstu; sprzęt to cena wstępu.

Opcja API istnieje, ponieważ wagi są udostępnione na licencji Apache-2.0, więc każdy może je hostować przy niemal zerowym koszcie krańcowym. Qwen3.8 27B znajduje się dziś w katalogu OrcaRouter w cenie $0.33 za milion tokenów wejściowych i $2.40 za milion tokenów wyjściowych, model hostowany samodzielnie na naszej własnej infrastrukturze — bez marży dostawcy do doliczenia — z oknem kontekstowym 262 tys. tokenów oraz obsługą tekstu, obrazu i wideo na wejściu. Ponieważ wagi są otwarte, dostępny jest również limitowany darmowy poziom, który kosztuje $0 za żądanie. Reprezentatywny miesiąc z 10 milionami tokenów przy 70% udziale tokenów wejściowych kosztuje około $9.51 na płatnym poziomie. Jeśli masz już kartę z 24 GB pamięci, lokalne uruchomienie wygrywa pod względem kosztów; jeśli nie, wynajmowanie tokenów w tej cenie bije zakup karty do projektu pobocznego, a darmowy poziom to uczciwy sposób na przetestowanie modelu, zanim zdecydujesz się na zakup jakiegokolwiek sprzętu.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Kiedy Unsloth jest złą odpowiedzią

Unsloth Studio i pakiet GGUF to właściwy wybór w przypadku pojedynczej maszyny. Są złym wyborem, gdy:

Masz kartę Blackwell z serii RTX 50. Kwanty unsloth/Qwen3.8-27B-NVFP4 są mniej więcej 1,5× szybsze niż BF16 przy tej samej ilości VRAM i używają pamięci podręcznej KV w formacie FP8 dla dłuższego kontekstu. Ta ścieżka prowadzi przez vLLM lub SGLang, a nie przez GGUF ani Studio.

W produkcji potrzebujesz pełnego natywnego okna 262K lub rozszerzenia 1M YaRN. Gęsty model wizyjny przy długim kontekście jest ciężki; Unsloth z przyjemnością dobierze dla Ciebie krótszy kontekst, ale serwerowa struktura z właściwym zarządzaniem KV bije na głowę lokalną aplikację.

Obsługujesz wielu użytkowników. Unsloth to lokalna aplikacja i biblioteka do dostrajania, a nie serwer wielodostępowy. Aby uzyskać współbieżność, automatyczne skalowanie i gwarancje dostępności, potrzebujesz hostowanego punktu końcowego.

W ogóle nie masz GPU. Szczera odpowiedź: 2-bitowy model 27B na karcie 12 GB jest wyraźnie gorszy niż ten sam model serwowany poprawnie. Najpierw skorzystaj z darmowego poziomu API; jeśli to wystarczy, kup sprzęt, gdy przypadek użycia się potwierdzi.

Chcesz dostroić stronę wizualną. Przyspieszenia Unslotha dotyczą warstw transformera tekstowego; pełne dostrojenie multimodalne wymaga innego stosu.

Sedno sprawy

Qwen3.8 27B z Unslothem to od tego tygodnia problem rozwiązany: zainstaluj Studio, wybierz UD-Q4_K_XL dla karty 24 GB (UD-Q3_K_XL dla 16 GB, UD-IQ2_XXS dla 12 GB), a model działa bez konfiguracji i bez opłat za token. Ścieżka fine-tuningu jest realna, a deklaracje prędkości Unsloth to powód, dla którego QLoRA 27B jest praktyczna na jednej karcie. Wiedz, że drabinka kwantyzacji to Dynamic V3.0 (wersja zapoznawcza), a nie Dynamic 2.0 opisywany w starszych artykułach; utrzymuj llama.cpp w aktualnej wersji; a jeśli nie posiadasz sprzętu, te same wagi są dostępne przez API za 0,33 USD/2,40 USD z darmowym limitowanym poziomem — więc nie ma powodu, by uruchamiać plik 2-bitowy, z którego nie jesteś zadowolony. Lokalnie to darmowa ścieżka i po raz pierwszy w tej klasie wag jest to również ścieżka łatwa.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube