
Jak uruchomić Qwen3.8-27B-Uncensored lokalnie: kwanty GGUF, llama.cpp i Ollama
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Aby uruchomić Qwen3.8-27B-Uncensored lokalnie, pobierz z Hugging Face repozytorium GGUF orcarouter/Qwen3.8-27B-Uncensored-GGUF, wybierz kwantyzację w zależności od pamięci VRAM — Q4_K_M (16,8 GB) dla GPU z 24 GB, IQ4_XS (15,3 GB) dla GPU z 16 GB, Q3_K_M (13,5 GB), gdy potrzebujesz zapasu na kontekst — i uruchom ją za pomocą aktualnej kompilacji llama.cpp z flagą --jinja, dodając --mmproj, jeśli potrzebujesz obsługi wizji. Ten sam plik importuje się do Ollamy za pomocą trzech poleceń. To wersja GGUF odabliterowanej kompilacji Qwen3.8 27B, wydanej 16 sierpnia 2026 roku, z natywnym kontekstem 262K, projektorem wizji i głowicą spekulacyjnego dekodowania MTP zachowanymi w każdej kwantyzacji. Jest to narzędzie badawcze, nie asystent: usunięto z niego zachowania polegające na odmowie, nie ma wbudowanych zabezpieczeń, a licencja to Apache 2.0. Przeczytaj opis granic bezpieczeństwa na dole tej strony przed pobraniem — to jest sens repozytorium z ograniczonym dostępem.
Który GGUF pobrać, w zależności od VRAM
Repo zawiera jedną parę w pełnej precyzji i dwanaście skwantowanych plików, więc decyzja o pobraniu jest tak naprawdę decyzją o VRAM. Poniższe liczby to rozmiary plików odczytane z repozytorium Hugging Face w dniu 2026-08-16.

Co właściwie znajduje się w repozytorium?
orcarouter/Qwen3.8-27B-Uncensored-GGUF zawiera piętnaście plików modelu: wagi F16 podzielone na dwie części, dwanaście skwantyzowanych plików GGUF — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M i IQ4_XS — oraz projektor wizyjny mmproj. Jest to eksport GGUF tej samej odabliterowanej kompilacji co Qwen3.8-27B-Uncensored-FP8, przepakowany dla lokalnych środowisk uruchomieniowych klasy llama.cpp, i dziedziczy licencję Apache 2.0 modelu bazowego oraz jego natywny kontekst 262 144 tokenów.
Trzy właściwości dotyczą każdego kwantu. Architektura to qwen35 — hybrydowa uwaga z 48 warstwami liniowymi Gated DeltaNet i 16 warstwami pełnej uwagi — dlatego repozytorium nie ładuje się w starszych kompilacjach llama.cpp i dlatego pamięć podręczna KV pozostaje mała. Głowa MTP (nextn) do spekulacyjnego dekodowania jest zachowana we wszystkich kwantach, zarówno K-quant, jak i IQ. Szablon czatu to szablon Qwen Jinja, który należy jawnie włączyć (patrz poniżej), w przeciwnym razie rozmowy wieloturowe przestaną działać.
Dlaczego cache KV pozostaje na tyle mały, że ma znaczenie
To jest szczegół, dzięki któremu lokalna historia działa. Spośród 64 warstw tylko 16 używa pełnej uwagi; pozostałe 48 używa liniowej uwagi Gated DeltaNet, która nie przechowuje konwencjonalnej pamięci podręcznej KV. Praktyczny efekt, zmierzony w oryginalnym runbooku dla tej architektury, to pamięć podręczna KV wynosząca około 2 GB przy kontekście 32K — około jednej czwartej tego, czego potrzebowałby konwencjonalny model 27B. Dlatego plik Q4_K_M o rozmiarze 16,8 GB wciąż mieści się na karcie 24 GB z długim oknem kontekstowym i dlatego nieocenzurowana linia GGUF działa na sprzęcie, który w ogóle nie mógłby pomieścić checkpointa BF16 o rozmiarze 55,6 GB.
Uruchom to z llama.cpp
llama.cpp jest zamierzoną ścieżką. Potrzebujesz aktualnej kompilacji: wersja główna rejestruje architekturę qwen35, a starsze kompilacje w ogóle odrzucają plik. Kształt polecenia, zgodnie z notatkami dotyczącymi użycia z karty modelu oraz instrukcją obsługi tej architektury, jest następujący:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
To daje ci kompatybilny z OpenAI endpoint na localhost:8080. Dla wejścia obrazowego dodaj --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Zamień Q4_K_M na kwantyzację pasującą do twojej pamięci VRAM; flagi są identyczne.
Uruchom to z Ollama
Ollama uruchamia ten sam plik poprzez zaimportowanie go z pliku Modelfile, co jest obsługiwanym sposobem dodania modelu GGUF, którego nie ma w bibliotece. W katalogu, w którym znajduje się pobrany quant:
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
Zapisz tę linię jako Modelfile, a następnie ollama create qwen3.8-27b-uncensored -f Modelfile i ollama run qwen3.8-27b-uncensored. W przypadku obsługi wizji dodaj linię mmproj do Modelfile (FROM ... Q4_K_M.gguf plus ścieżka do mmproj), a Ollama automatycznie podłącza projektor. Obowiązują te same zastrzeżenia dotyczące --ctx i szablonu: ustaw rozmiar kontekstu, który faktycznie możesz zmieścić, i pamiętaj, że model pozbawiony odmów odpowiada bez żadnych zabezpieczeń między tobą a wynikiem.
Co faktycznie zmieniło usunięcie odmowy
Karta modelu publikuje zestaw testów oceny bezpieczeństwa dla tej kompilacji. Przy wyłączonym myśleniu odmowa w standardowych benchmarkach szkodliwych promptów spada z 64–99% na modelu bazowym do 0–6% na wagach po abliteracji; przy włączonym myśleniu praktycznie nigdy nie odmawia — 1,7% lub mniej. Benchmarki możliwości pozostają w granicach ±1,3 punktu od modelu bazowego. Taki kształt ma każde wydanie po abliteracji w tej linii: odmowy usunięte, możliwości nienaruszone, a także zastrzeżenie, że spora część odpowiedzi nadal zaczyna się od krótkiego oświadczenia poprzedzającego właściwą odpowiedź — artefakt treningowy, a nie odmowa.
Odwrotna strona medalu jest całym sensem poniższej granicy bezpieczeństwa: model, który nigdy nie odmawia, nie jest lepszym asystentem — to inny rodzaj obiektu. Jest to przyrząd testowy do pomiaru mechanizmów odmowy i do sprawdzania, czy twoja własna bariera bezpieczeństwa działa.
Co właściwie z tym zrobić w badaniach
Trzy legalne projekty, które stanowią dozwolone zastosowanie modelu z usuniętą funkcją odmowy:
Kiedy ten build jest złą odpowiedzią.
Jeśli chcesz zwykłego asystenta lub cokolwiek, co postawiłbyś przed użytkownikami końcowymi, to niewłaściwy model — nie ma żadnych sensownych wbudowanych zabezpieczeń, będzie spełniać prośby, których model bazowy odmawia, a Apache 2.0 nie przenosi twojej odpowiedzialności. Do tego użyj oryginalnego dopasowanego Qwen3.8-27B. Jeśli chcesz obejść odmowy na czacie, pakiet promptów systemowych osiąga więcej przy mniejszym ryzyku niż edycja wag. A jeśli nie masz w ogóle GPU, ale nadal chcesz studiować model, hostowana karta obsidian/Qwen3.8-27B na OrcaRouter obsługuje tę samą linię bez cenzury po $0.40 za milion tokenów wejściowych i $4.21 za milion tokenów wyjściowych z tym samym kontekstem 262K; jest ona udostępniana wyłącznie badaczom bezpieczeństwa i AI-safety, tak samo jak repozytorium, a decyzja o moderacji nadal leży po twojej stronie. Karta modelu zawiera ceny i szczegóły benchmarków.
Granica bezpieczeństwa — przeczytaj to przed pobraniem

W tym modelu w znacznym stopniu usunięto dostosowanie bezpieczeństwa. Będzie on spełniał szkodliwe, nieetyczne, obraźliwe lub nielegalne prośby, których oryginalny Qwen3.8-27B by odmówił, i nie ma w nim żadnych znaczących wbudowanych zabezpieczeń. Jest on udostępniany wyłącznie do legalnych badań — interpretowalności, bezpieczeństwa AI, badania mechanizmów odmowy, red-teamingu, oceny odporności i kontrolowanych eksperymentów. Ponosisz pełną odpowiedzialność i odpowiadasz za sposób użycia oraz za wszystko, co generuje, a nie wolno Ci udostępniać go użytkownikom końcowym ani wdrażać go do produkcji bez dodania własnych warstw bezpieczeństwa, moderacji i zapobiegania nadużyciom. Autorzy nie ponoszą odpowiedzialności za niewłaściwe użycie. Pobranie repozytorium oznacza akceptację tych warunków; licencja to Apache 2.0.
Ten artykuł celowo nie zawiera szkodliwych promptów. Liczby odmów powyżej pochodzą z własnego pakietu oceny bezpieczeństwa karty modelu, co jest właściwym sposobem mierzenia modelu tej klasy: uruchom standardowe benchmarki odmów, przeczytaj liczby i zaprojektuj swoje badania wokół tego, co one pokazują.
Źródła i data
Wszystkie powyższe fakty zweryfikowano 2026-08-16. Lista plików i ich rozmiary pochodzą z repozytorium Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (utworzonego 16 sierpnia 2026; architektura qwen35; Apache 2.0; gated). Liczby dotyczące odmów i możliwości pochodzą z zestawu oceny bezpieczeństwa karty modelu. Pomiar pamięci podręcznej KV (~2 GB przy kontekście 32K) pochodzi z runbooka OrcaRouter dla tej architektury, How to Run Qwen 3.8 27B Locally. Ceny hostingu i bramkowanie pochodzą ze strony modelu obsidian/Qwen3.8-27B, sprawdzonej tego samego dnia. Rozmiary skwantyzowanych plików są podane w dziesiętnych GB, tak jak są przechowywane na Hugging Face.
Do legalnych badań, wagi znajdują się na Hugging Face: Pobierz z Hugging Face — bez karty kredytowej, gotowe w 60 sekund.
