Edytorska płaska ilustracja wektorowa do sekcji hero bloga technologicznego o uruchamianiu nieocenzurowanego, poddanego abliteracji dużego modelu językowego lokalnie na własnym sprzęcie: duży zaokrąglony układ modelu w głębokim błękicie z miękką cyjanową poświatą unosi się po lewej stronie środka, a jego wewnętrzny obwód rozpływa się z zamkniętego kształtu kłódki w otwarty. Po jego prawej stronie kompaktowa karta GPU na stole warsztatowym oraz smukłe okno terminala z abstrakcyjnymi poziomymi paskami poleceń i małą sylwetką lamy obok. W górnym rogu mała ikona mikroskopu i zaokrąglona tarcza z trójkątem ostrzegawczym, sugerujące zastosowanie badawcze i granice bezpieczeństwa. Miękkie jasnoniebieskie i białe tło, dużo wolnej przestrzeni w dolnej jednej trzeciej. Brak czytelnego tekstu.
Guides & Insights

Jak uruchomić Qwen3.8-27B-Uncensored lokalnie: kwanty GGUF, llama.cpp i Ollama

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Aby uruchomić Qwen3.8-27B-Uncensored lokalnie, pobierz z Hugging Face repozytorium GGUF orcarouter/Qwen3.8-27B-Uncensored-GGUF, wybierz kwantyzację w zależności od pamięci VRAM — Q4_K_M (16,8 GB) dla GPU z 24 GB, IQ4_XS (15,3 GB) dla GPU z 16 GB, Q3_K_M (13,5 GB), gdy potrzebujesz zapasu na kontekst — i uruchom ją za pomocą aktualnej kompilacji llama.cpp z flagą --jinja, dodając --mmproj, jeśli potrzebujesz obsługi wizji. Ten sam plik importuje się do Ollamy za pomocą trzech poleceń. To wersja GGUF odabliterowanej kompilacji Qwen3.8 27B, wydanej 16 sierpnia 2026 roku, z natywnym kontekstem 262K, projektorem wizji i głowicą spekulacyjnego dekodowania MTP zachowanymi w każdej kwantyzacji. Jest to narzędzie badawcze, nie asystent: usunięto z niego zachowania polegające na odmowie, nie ma wbudowanych zabezpieczeń, a licencja to Apache 2.0. Przeczytaj opis granic bezpieczeństwa na dole tej strony przed pobraniem — to jest sens repozytorium z ograniczonym dostępem.

Który GGUF pobrać, w zależności od VRAM

Repo zawiera jedną parę w pełnej precyzji i dwanaście skwantowanych plików, więc decyzja o pobraniu jest tak naprawdę decyzją o VRAM. Poniższe liczby to rozmiary plików odczytane z repozytorium Hugging Face w dniu 2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

Co właściwie znajduje się w repozytorium?

orcarouter/Qwen3.8-27B-Uncensored-GGUF zawiera piętnaście plików modelu: wagi F16 podzielone na dwie części, dwanaście skwantyzowanych plików GGUF — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M i IQ4_XS — oraz projektor wizyjny mmproj. Jest to eksport GGUF tej samej odabliterowanej kompilacji co Qwen3.8-27B-Uncensored-FP8, przepakowany dla lokalnych środowisk uruchomieniowych klasy llama.cpp, i dziedziczy licencję Apache 2.0 modelu bazowego oraz jego natywny kontekst 262 144 tokenów.

Trzy właściwości dotyczą każdego kwantu. Architektura to qwen35 — hybrydowa uwaga z 48 warstwami liniowymi Gated DeltaNet i 16 warstwami pełnej uwagi — dlatego repozytorium nie ładuje się w starszych kompilacjach llama.cpp i dlatego pamięć podręczna KV pozostaje mała. Głowa MTP (nextn) do spekulacyjnego dekodowania jest zachowana we wszystkich kwantach, zarówno K-quant, jak i IQ. Szablon czatu to szablon Qwen Jinja, który należy jawnie włączyć (patrz poniżej), w przeciwnym razie rozmowy wieloturowe przestaną działać.

Dlaczego cache KV pozostaje na tyle mały, że ma znaczenie

To jest szczegół, dzięki któremu lokalna historia działa. Spośród 64 warstw tylko 16 używa pełnej uwagi; pozostałe 48 używa liniowej uwagi Gated DeltaNet, która nie przechowuje konwencjonalnej pamięci podręcznej KV. Praktyczny efekt, zmierzony w oryginalnym runbooku dla tej architektury, to pamięć podręczna KV wynosząca około 2 GB przy kontekście 32K — około jednej czwartej tego, czego potrzebowałby konwencjonalny model 27B. Dlatego plik Q4_K_M o rozmiarze 16,8 GB wciąż mieści się na karcie 24 GB z długim oknem kontekstowym i dlatego nieocenzurowana linia GGUF działa na sprzęcie, który w ogóle nie mógłby pomieścić checkpointa BF16 o rozmiarze 55,6 GB.

Uruchom to z llama.cpp

llama.cpp jest zamierzoną ścieżką. Potrzebujesz aktualnej kompilacji: wersja główna rejestruje architekturę qwen35, a starsze kompilacje w ogóle odrzucają plik. Kształt polecenia, zgodnie z notatkami dotyczącymi użycia z karty modelu oraz instrukcją obsługi tej architektury, jest następujący:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

To daje ci kompatybilny z OpenAI endpoint na localhost:8080. Dla wejścia obrazowego dodaj --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. Zamień Q4_K_M na kwantyzację pasującą do twojej pamięci VRAM; flagi są identyczne.

Uruchom to z Ollama

Ollama uruchamia ten sam plik poprzez zaimportowanie go z pliku Modelfile, co jest obsługiwanym sposobem dodania modelu GGUF, którego nie ma w bibliotece. W katalogu, w którym znajduje się pobrany quant:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

Zapisz tę linię jako Modelfile, a następnie ollama create qwen3.8-27b-uncensored -f Modelfile i ollama run qwen3.8-27b-uncensored. W przypadku obsługi wizji dodaj linię mmproj do Modelfile (FROM ... Q4_K_M.gguf plus ścieżka do mmproj), a Ollama automatycznie podłącza projektor. Obowiązują te same zastrzeżenia dotyczące --ctx i szablonu: ustaw rozmiar kontekstu, który faktycznie możesz zmieścić, i pamiętaj, że model pozbawiony odmów odpowiada bez żadnych zabezpieczeń między tobą a wynikiem.

Co faktycznie zmieniło usunięcie odmowy

Karta modelu publikuje zestaw testów oceny bezpieczeństwa dla tej kompilacji. Przy wyłączonym myśleniu odmowa w standardowych benchmarkach szkodliwych promptów spada z 64–99% na modelu bazowym do 0–6% na wagach po abliteracji; przy włączonym myśleniu praktycznie nigdy nie odmawia — 1,7% lub mniej. Benchmarki możliwości pozostają w granicach ±1,3 punktu od modelu bazowego. Taki kształt ma każde wydanie po abliteracji w tej linii: odmowy usunięte, możliwości nienaruszone, a także zastrzeżenie, że spora część odpowiedzi nadal zaczyna się od krótkiego oświadczenia poprzedzającego właściwą odpowiedź — artefakt treningowy, a nie odmowa.

Odwrotna strona medalu jest całym sensem poniższej granicy bezpieczeństwa: model, który nigdy nie odmawia, nie jest lepszym asystentem — to inny rodzaj obiektu. Jest to przyrząd testowy do pomiaru mechanizmów odmowy i do sprawdzania, czy twoja własna bariera bezpieczeństwa działa.

Co właściwie z tym zrobić w badaniach

Trzy legalne projekty, które stanowią dozwolone zastosowanie modelu z usuniętą funkcją odmowy:

Kiedy ten build jest złą odpowiedzią.

Jeśli chcesz zwykłego asystenta lub cokolwiek, co postawiłbyś przed użytkownikami końcowymi, to niewłaściwy model — nie ma żadnych sensownych wbudowanych zabezpieczeń, będzie spełniać prośby, których model bazowy odmawia, a Apache 2.0 nie przenosi twojej odpowiedzialności. Do tego użyj oryginalnego dopasowanego Qwen3.8-27B. Jeśli chcesz obejść odmowy na czacie, pakiet promptów systemowych osiąga więcej przy mniejszym ryzyku niż edycja wag. A jeśli nie masz w ogóle GPU, ale nadal chcesz studiować model, hostowana karta obsidian/Qwen3.8-27B na OrcaRouter obsługuje tę samą linię bez cenzury po $0.40 za milion tokenów wejściowych i $4.21 za milion tokenów wyjściowych z tym samym kontekstem 262K; jest ona udostępniana wyłącznie badaczom bezpieczeństwa i AI-safety, tak samo jak repozytorium, a decyzja o moderacji nadal leży po twojej stronie. Karta modelu zawiera ceny i szczegóły benchmarków.

Granica bezpieczeństwa — przeczytaj to przed pobraniem

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

W tym modelu w znacznym stopniu usunięto dostosowanie bezpieczeństwa. Będzie on spełniał szkodliwe, nieetyczne, obraźliwe lub nielegalne prośby, których oryginalny Qwen3.8-27B by odmówił, i nie ma w nim żadnych znaczących wbudowanych zabezpieczeń. Jest on udostępniany wyłącznie do legalnych badań — interpretowalności, bezpieczeństwa AI, badania mechanizmów odmowy, red-teamingu, oceny odporności i kontrolowanych eksperymentów. Ponosisz pełną odpowiedzialność i odpowiadasz za sposób użycia oraz za wszystko, co generuje, a nie wolno Ci udostępniać go użytkownikom końcowym ani wdrażać go do produkcji bez dodania własnych warstw bezpieczeństwa, moderacji i zapobiegania nadużyciom. Autorzy nie ponoszą odpowiedzialności za niewłaściwe użycie. Pobranie repozytorium oznacza akceptację tych warunków; licencja to Apache 2.0.

Ten artykuł celowo nie zawiera szkodliwych promptów. Liczby odmów powyżej pochodzą z własnego pakietu oceny bezpieczeństwa karty modelu, co jest właściwym sposobem mierzenia modelu tej klasy: uruchom standardowe benchmarki odmów, przeczytaj liczby i zaprojektuj swoje badania wokół tego, co one pokazują.

Źródła i data

Wszystkie powyższe fakty zweryfikowano 2026-08-16. Lista plików i ich rozmiary pochodzą z repozytorium Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (utworzonego 16 sierpnia 2026; architektura qwen35; Apache 2.0; gated). Liczby dotyczące odmów i możliwości pochodzą z zestawu oceny bezpieczeństwa karty modelu. Pomiar pamięci podręcznej KV (~2 GB przy kontekście 32K) pochodzi z runbooka OrcaRouter dla tej architektury, How to Run Qwen 3.8 27B Locally. Ceny hostingu i bramkowanie pochodzą ze strony modelu obsidian/Qwen3.8-27B, sprawdzonej tego samego dnia. Rozmiary skwantyzowanych plików są podane w dziesiętnych GB, tak jak są przechowywane na Hugging Face.

Do legalnych badań, wagi znajdują się na Hugging Face: Pobierz z Hugging Face — bez karty kredytowej, gotowe w 60 sekund.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube