
Qwen3.8-27B z Unsloth: Uruchom, skwantyzuj lub dostrój go lokalnie
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 za 1 mln tokenów · 18 tok/s
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Tak — Unsloth uruchamia Qwen3.8 27B i jest to najszybszy sposób, aby umieścić nowy model Alibaba na licencji Apache-2.0 na własnym GPU. Cała odpowiedź w jednym zdaniu: otwórz Unsloth Studio, wyszukaj „Qwen3.8 27B", wybierz UD-Q4_K_XL (17.9GB) na karcie 24 GB i rozmawiaj w mniej niż minutę. Pod tym kliknięciem Unsloth wypuścił trzy rzeczy w tym samym tygodniu, w którym opublikowano wagi (13–14 sierpnia 2026 r.): unsloth/Qwen3.8-27B-GGUF pakiet zbudowany na kwantyzacji Unsloth Dynamic V3.0 (preview), pełne wsparcie w Unsloth Studio i Desktop oraz v0.1.800-beta — wydanie z eksportem GGUF, wykrywaniem imatrix i ulepszeniami dopasowania do VRAM. Narzędzie to udostępnia również fine-tuning modelu — według Unsloth trening jest 2× szybszy i zużywa 70% mniej VRAM. Qwen3.8 27B to gęsty model wizyjno-językowy o 27 miliardach parametrów, którego hybrydowa uwaga utrzymuje tylko 16 z 64 warstw w pełnej uwadze, dlatego plik 4-bitowy mieści się na kartach, na których większość modeli 27B się nie mieści.
Co do źródeł: fakty o modelu są oficjalne, pochodzą z karty modelu Qwen3.8 27B w serwisie Hugging Face, zweryfikowane 15 sierpnia 2026 r. Wsparcie Unsloth, rozmiary kwantyzacji, wymagania co do VRAM i polecenia instalacji pochodzą z notatek wydania i dokumentacji Unsloth, aktualnych tego samego dnia. Cena API pochodzi bezpośrednio z katalogu OrcaRouter, tego samego dnia. Stwierdzenia Unsloth „2× szybciej, 70% mniej VRAM" i „zdecydowanie najmocniejszy model w swojej klasie" to deklaracje producenta, które nie zostały niezależnie potwierdzone.
Co "Qwen3.8 + Unsloth" oznacza: cztery różne rzeczy
Unsloth to cztery odrębne rzeczy, a wyniki wyszukiwania po słowach kluczowych mieszają je ze sobą. Wiedza o tym, której z nich potrzebujesz, to połowa konfiguracji:
• unsloth/Qwen3.8-27B-GGUF — pliki z kwantyzowanymi wagami na Hugging Face, 21 kwantów plus projektor wizyjny. Zbudowane za pomocą Dynamic V3.0 (podgląd), a nie starszego Dynamic 2.0 (który został ogłoszony 24 kwietnia 2025 r. i jest wcześniejszy niż ten model). To metoda „pobierz plik”, dostępna z każdej kompilacji llama.cpp.
• Unsloth Studio — aplikacja przeglądarkowa, którą instalujesz lub uruchamiasz z przestrzeni Hugging Face. Przeszukuj centrum modeli, kliknij kwantyzację, czatuj z narzędziami. Bez ręcznej konfiguracji szablonu ani parametrów inferencji.
• Unsloth Desktop — lokalna aplikacja GUI dla systemów macOS, Windows i Linux, która obejmuje Studio i trenowanie. To właśnie tutaj odbywa się dostrajanie „2× szybciej przy 70% mniejszym zużyciu VRAM".
• Biblioteka unsloth dla Pythona — from unsloth import FastLanguageModel, API do fine-tuningu QLoRA używane w notebookach i skryptach.
Notatki z wydania Unsloth dla wersji v0.1.800-beta, zatytułowanego „Release Qwen3.8 27B", informują, że Qwen3.8 27B oraz Qwen3.8-2.4T-A95B o 2,4T parametrów „mogą być teraz uruchamiane lokalnie w Unsloth", że wersja 27B „działa na 17 GB RAM dzięki Unsloth Dynamic GGUF" oraz że „można również dostroić Qwen3.8 27B w Unsloth". To samo wydanie dodaje kwantyzacje NVFP4, sprawdza miejsce na dysku przed eksportem GGUF, wykrywa rzeczywiste wsparcie imatrix GGUF w Studio i przyspiesza wnioskowanie nawet o 10% na GGUF z konfigurowalnym limitem VRAM.

Wybieraj kwantyzację według VRAM, a nie według przeczuć.
Tabela pamięci Unslotha obejmuje sumę pamięci RAM i VRAM (lub pamięci zunifikowanej) i jest to oficjalne wytyczne. Model Qwen3.8 27B w 4-bitach wymaga 17–19 GB; 24 GB RTX 4090, RTX 5080 lub Mac z 24 GB pamięci zunifikowanej to realistyczne minimum dla wygodnej konfiguracji 4-bitowej. Trzy opcje, które obejmują prawie wszystkich:
• 12GB → UD-IQ2_XXS przy 9.0GB — jedyny plik, który mieści się w całości; spodziewaj się widocznej utraty jakości. Podejmij tę decyzję świadomie.
• 16GB → UD-Q3_K_XL przy 13.4GBnajlepszy plik 3-bitowy, według własnego pickera Unsloth.
• 24GB → UD-Q4_K_XL o rozmiarze 17.9GB — rekomendowany plik 4-bitowy i domyślna odpowiedź tego artykułu.
• 48–64GB → UD-Q8_K_XL przy 31.5GB — niemal bezstratna na stacji roboczej lub w konfiguracji z dwoma GPU.
Pełna drabinka, z listy plików unsloth/Qwen3.8-27B-GGUF oraz dokumentacji Unsloth, obu zweryfikowanych 15 sierpnia 2026 r.: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Standardowe K-quanty (Q4_K_M 17,1 GB, Q8_0 29,0 GB) też tam są, a pakiet zawiera projektor wizyjny (mmproj-BF16, 931 MB), więc obrazy i wideo działają, jeśli go załadujesz. Unsloth nazywa całą drabinkę „Dynamic V3.0 (preview)" — nowszą niż Dynamic 2.0, którą zobaczysz w starszych publikacjach, a która została zbudowana dla modeli wydanych ponad rok wcześniej.

Uruchom to z Unsloth w trzy minuty
Trasa jednym kliknięciem: na macOS lub Linux, curl -fsSL https://unsloth.ai/install.sh | sh, następnie unsloth studio -p 8888 i otwórz http://127.0.0.1:8888. Na Windows, irm https://unsloth.ai/install.ps1 | iex. Jeśli chcesz całkowicie uniknąć instalacji, Studio Unsloth jest również opublikowane jako Space na Hugging Face — otwórz je w przeglądarce, wyszukaj „Qwen3.8 27B” i wybierz kwantyzację odpowiednią do posiadanej pamięci. Studio automatycznie dostraja parametry próbkowania i szablon czatu, przenosi dane do RAM, gdy zabraknie pamięci VRAM, oraz wykrywa konfiguracje z wieloma GPU — część „no-config” jest prawdziwa i jest to najszybszy sposób na uruchomienie modelu z tego tygodnia.
Jeśli już używasz llama.cpp, ścieżka „pliki najpierw”: pobierz jeden kwant i uruchom go bezpośrednio. To są własne polecenia Unsloth, zweryfikowane względem ich dokumentacji:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Te wartości próbkowania to zalecane przez kartę modelu ustawienia trybu myślenia. Zamień glob --include na *UD-Q3_K_XL* w przypadku karty z 16 GB, a jeśli potrzebujesz obsługi wizji, dodaj --mmproj wskazujący na mmproj-BF16.gguf z pakietu. Jeden haczyk: llama.cpp musi być w aktualnej wersji — plik rejestruje nową architekturę qwen35, a cokolwiek sprzed tygodnia premiery odmówi jego załadowania.
Dostrój to z Unsloth
Dostrajanie jest tym, gdzie Unsloth zdobywa swoją reputację: biblioteka twierdzi, że zapewnia 2× szybsze trenowanie przy 70% mniejszym zużyciu VRAM w porównaniu ze standardowymi Transformers + PEFT, co sprawia, że QLoRA na 27B jest wykonalna na pojedynczej karcie konsumenckiej. Punkt wejścia do dostrajania to zwykłe unsloth/Qwen3.8-27B repozytorium (strona plików safetensors, 28B) zamiast pakietu GGUF. Standardowy wzorzec QLoRA Unsloth zastosowany do tego modelu:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
następnie standardowa pętla trl.SFTTrainer na twoim zestawie danych. Ten fragment to standardowy wzorzec QLoRA z dokumentacji Unsloth — twierdzenia dotyczące benchmarków treningowych należą do Unsloth i nie są czymś, co odtworzyłem — i dotyczą go dwa zastrzeżenia: jądra Unsloth modyfikują warstwy transformera tekstu, więc zaplanuj obsługę enkodera wizji osobno, i utrzymuj pakiet unsloth w bieżącej wersji, ponieważ ta architektura ma zaledwie kilka dni, a niezgodności wersji kończą się głośnymi błędami.
Co Unsloth Studio robi za Ciebie
Uruchamianie GGUF ręcznie oznacza balansowanie między rozmiarem kontekstu, przenoszeniem do RAM a wywoływaniem narzędzi. Studio sprowadza to do wartości domyślnych: dobiera rozmiar kontekstu na podstawie faktycznie wolnej pamięci, zwalnia nieużywane modele wizyjne z VRAM, aby zrobić miejsce na czat lub trenowanie, wykrywa układy multi-GPU oraz podłącza wyszukiwanie w sieci, wykonywanie kodu i połączenia z agentami (Claude Code, Codex, MCP) od razu po wyjęciu z pudełka. Wydanie v0.1.800-beta zaostrzyło też elementy, które w praktyce bywają uciążliwe: eksport GGUF sprawdza teraz miejsce na dysku przed rozpoczęciem długiego scalania zamiast przerywać w połowie, Studio wykrywa, czy eksportowany przez nie GGUF faktycznie obsługuje imatrix (więc nie marnujesz przebiegu), a zabezpieczenia pamięci nie rezerwują już nadmiarowo pamięci GPU. Jak na model, który ma trzy dni, „no-config” robi naprawdę dobrą robotę.
Lokalnie za darmo vs płatne API: rzetelny rachunek ekonomiczny
Podstawowa różnica między Unsloth a API nie dotyczy jakości — chodzi o to, kto jest właścicielem sprzętu. Unsloth to darmowa droga: zerowy koszt krańcowy na token, nic nie opuszcza Twojej maszyny, brak limitów szybkości i pełna kontrola nad wagami. Nie jest to jednak darmowe w sensie absolutnym: zapewniasz GPU i prąd, a plik 2-bitowy na karcie 12 GB to doświadczenie okupione kompromisami. Qwen3.8 27B to model gęsty i obsługujący wizję, więc 4-bitowa wersja to 17,9 GB wag przed uwzględnieniem kontekstu; sprzęt to cena wstępu.
Opcja API istnieje, ponieważ wagi są udostępnione na licencji Apache-2.0, więc każdy może je hostować przy niemal zerowym koszcie krańcowym. Qwen3.8 27B znajduje się dziś w katalogu OrcaRouter w cenie $0.33 za milion tokenów wejściowych i $2.40 za milion tokenów wyjściowych, model hostowany samodzielnie na naszej własnej infrastrukturze — bez marży dostawcy do doliczenia — z oknem kontekstowym 262 tys. tokenów oraz obsługą tekstu, obrazu i wideo na wejściu. Ponieważ wagi są otwarte, dostępny jest również limitowany darmowy poziom, który kosztuje $0 za żądanie. Reprezentatywny miesiąc z 10 milionami tokenów przy 70% udziale tokenów wejściowych kosztuje około $9.51 na płatnym poziomie. Jeśli masz już kartę z 24 GB pamięci, lokalne uruchomienie wygrywa pod względem kosztów; jeśli nie, wynajmowanie tokenów w tej cenie bije zakup karty do projektu pobocznego, a darmowy poziom to uczciwy sposób na przetestowanie modelu, zanim zdecydujesz się na zakup jakiegokolwiek sprzętu.

Kiedy Unsloth jest złą odpowiedzią
Unsloth Studio i pakiet GGUF to właściwy wybór w przypadku pojedynczej maszyny. Są złym wyborem, gdy:
• Masz kartę Blackwell z serii RTX 50. Kwanty unsloth/Qwen3.8-27B-NVFP4 są mniej więcej 1,5× szybsze niż BF16 przy tej samej ilości VRAM i używają pamięci podręcznej KV w formacie FP8 dla dłuższego kontekstu. Ta ścieżka prowadzi przez vLLM lub SGLang, a nie przez GGUF ani Studio.
• W produkcji potrzebujesz pełnego natywnego okna 262K lub rozszerzenia 1M YaRN. Gęsty model wizyjny przy długim kontekście jest ciężki; Unsloth z przyjemnością dobierze dla Ciebie krótszy kontekst, ale serwerowa struktura z właściwym zarządzaniem KV bije na głowę lokalną aplikację.
• Obsługujesz wielu użytkowników. Unsloth to lokalna aplikacja i biblioteka do dostrajania, a nie serwer wielodostępowy. Aby uzyskać współbieżność, automatyczne skalowanie i gwarancje dostępności, potrzebujesz hostowanego punktu końcowego.
• W ogóle nie masz GPU. Szczera odpowiedź: 2-bitowy model 27B na karcie 12 GB jest wyraźnie gorszy niż ten sam model serwowany poprawnie. Najpierw skorzystaj z darmowego poziomu API; jeśli to wystarczy, kup sprzęt, gdy przypadek użycia się potwierdzi.
• Chcesz dostroić stronę wizualną. Przyspieszenia Unslotha dotyczą warstw transformera tekstowego; pełne dostrojenie multimodalne wymaga innego stosu.
Sedno sprawy
Qwen3.8 27B z Unslothem to od tego tygodnia problem rozwiązany: zainstaluj Studio, wybierz UD-Q4_K_XL dla karty 24 GB (UD-Q3_K_XL dla 16 GB, UD-IQ2_XXS dla 12 GB), a model działa bez konfiguracji i bez opłat za token. Ścieżka fine-tuningu jest realna, a deklaracje prędkości Unsloth to powód, dla którego QLoRA 27B jest praktyczna na jednej karcie. Wiedz, że drabinka kwantyzacji to Dynamic V3.0 (wersja zapoznawcza), a nie Dynamic 2.0 opisywany w starszych artykułach; utrzymuj llama.cpp w aktualnej wersji; a jeśli nie posiadasz sprzętu, te same wagi są dostępne przez API za 0,33 USD/2,40 USD z darmowym limitowanym poziomem — więc nie ma powodu, by uruchamiać plik 2-bitowy, z którego nie jesteś zadowolony. Lokalnie to darmowa ścieżka i po raz pierwszy w tej klasie wag jest to również ścieżka łatwa.
