Karta nagłówkowa (hero) do artykułu 'Qwen 3.8 27B Uncensored GGUF': zaokrąglona karta w stylu badawczym z tytułem 'Qwen3.8-27B Uncensored GGUF', podtytułem 'Abliterated local build for llama.cpp', chipami z napisami '12 QUANT TIERS', '262K CONTEXT', 'VISION + MTP' oraz ikoną tarczy z etykietą RESEARCH-ONLY. Logo OrcaRouter umieszczone w prawym dolnym rogu.
Guides & Insights

Qwen 3.8 27B Uncensored GGUF: lokalna kompilacja po abliteracji, 12 kwantyzacji i granica wyłącznie do badań

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen 3.8 27B uncensored GGUF to prawdziwy plik do pobrania, a wersją, od której warto zacząć, jest Qwen3.8-27B-Uncensored-GGUF — opublikowany na Hugging Face 16 sierpnia 2026 roku jako natywny dla llama.cpp odpowiednik naszej wersji FP8 po abliteracji. To te same wagi pozbawione odmowy o 27 miliardach parametrów co Qwen3.8-27B-Uncensored-FP8, przekonwertowane do GGUF do lokalnej inferencji: F16 plus 12 poziomów kwantyzacji od Q2_K do Q8_0 (w tym kwantyzacje imatrix IQ3_M i IQ4_XS), okno kontekstowe 262K, osobny projektor wizyjny oraz nienaruszona głowica spekulatywnego dekodowania MTP. „Uncensored” oznacza abliterację — kierunek odmowy został usunięty z wag przez ortogonalizację — więc model odpowie tam, gdzie zgodny z zasadami model bazowy odmawia, i właśnie dlatego jest przeznaczony wyłącznie do badań. Oto, co faktycznie zawiera repozytorium, która kwantyzacja pasuje do Twojej karty GPU, jak uruchomić model w llama.cpp oraz jakie granice bezpieczeństwa akceptujesz, pobierając go.

Wersja 30-sekundowa: F16 plus 12 quantów, Q4_K_M przy 16,8 GB to domyślny wybór, potrzebujesz kompilacji llama.cpp z maja 2026 roku lub nowszej, a to jest narzędzie badawcze bez zabezpieczeń — nie jest to coś do wdrożenia dla użytkowników końcowych.

Co tak naprawdę oznacza „nieocenzurowany GGUF" — i czym ta kompilacja różni się od wersji FP8

GGUF to jednoplikowy format modelu używany przez llama.cpp; FP8 to schemat kwantyzacji działający na serwerach GPU vLLM. Nasze dwa wydania bez cenzury to te same wagi po abliteracji w dwóch środowiskach uruchomieniowych. Qwen3.8-27B-Uncensored-FP8 (15 sierpnia 2026) jest przeznaczony dla vLLM na serwerze, poddany ponownej kwantyzacji do oficjalnego schematu Qwen3.8-27B-FP8, dzięki czemu działa na identycznej ścieżce jądra. Qwen3.8-27B-Uncensored-GGUF (16 sierpnia 2026) jest przeznaczony dla llama.cpp na lokalnej maszynie — desktopowym GPU lub stacji roboczej, którą kontrolujesz. Te same wagi, inny model wdrożenia: API w chmurze vs proces lokalny.

Abliteracja to interwencja na poziomie wag, a nie dostrajanie. Kierunek odmowy to wektor w strumieniu rezydualnym modelu, który po aktywacji generuje „I can't help with that”; proces ten znajduje ów kierunek i ortogonalizuje go z wag, zgodnie z podejściem Arditi i in. 2024 („Refusal in Language Models Is Mediated by a Single Direction”). Żadne nowe wagi nie są trenowane. Bazą jest Qwen/Qwen3.8-27B — gęsty model 27B o hybrydowej architekturze (48 warstw liniowej atencji Gated DeltaNet i 16 warstw pełnej atencji), natywnej obsłudze wizji i kontekście 262 144 tokenów. Licencja to Apache 2.0, odziedziczona z bazy. Należy zauważyć, że oficjalne repozytorium Qwen udostępnia wyłącznie safetensory BF16 — nie ma oficjalnego Qwen GGUF — więc każdy nieocenzurowany GGUF tego modelu, w tym ten, jest konwersją otwartych wag.

Drabina kwantowa — F16 plus 12 poziomów

Repo zawiera F16 (54,6 GB w dwóch plikach) i 12 poziomów kwantyzacji. Rozmiary poniżej to rozmiary plików podane w repo, odczytane 16 sierpnia 2026; rozmiary plików GGUF mogą się nieznacznie różnić w zależności od kompilacji.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54,6 GB (2 pliki) — precyzja referencyjna

Q8_0 — 29.0 GB — prawie bezstratna, dla wysokiej klasy GPU

Q6_K — 22.4 GB — optymalny stosunek jakości do gigabajta

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — wysoka jakość na większych kartach

Q4_K_M — 16.8 GB — zalecany jako domyślny

Q4_K_S — 15.8 GB

IQ4_XS — 15.3 GB — najlepszy niskobitowy wybór (kalibrowany imatrix)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — dla kart 16 GB

IQ3_M — 12.8 GB — mały rozmiar (kalibrowany imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — najmniejszy kwant K, widoczny kompromis jakościowy

Wskazówki sprzętowe: Q4_K_M na karcie 24 GB (RTX 4090 lub RTX 3090); IQ4_XS lub Q3_K_M, jeśli masz 16 GB; Q2_K tylko wtedy, gdy jesteś ograniczony do 12 GB. Ponieważ baza wykorzystuje hybrydową uwagę Gated DeltaNet, pamięć podręczna KV jest mała — około 0,5 GB przy kontekście 8K — więc możesz przesunąć okno znacznie dalej niż w konwencjonalnym gęstym modelu 27B. Wizja dodaje jeden osobny plik: projektor F16 waży 931 MB. Istnieje również 9-kwantowa społecznościowa seria abliterowana dla tej samej bazy; nasza jest konwersją udokumentowanej abliteracji FP8, z kwantyzacjami imatrix i liczbami refusal-delta z karty modelu.

Jak to uruchomić w llama.cpp

Trzy kroki. Jeden nieoczywisty wymóg: architektura qwen35 i obsługa MTP trafiły do llama.cpp w maju 2026, więc zaktualizuj do wersji z 2026-05 lub nowszej — starsze wersje nie wczytają tych plików (zgodnie z README repozytorium).

1. Pobierz wybrany kwant oraz projektor wizyjny. Repozytorium jest z ograniczonym dostępem, więc najpierw zaloguj się do Hugging Face i zaakceptuj warunki — przeczytanie README jest częścią zaakceptowania tego, czym jest ten model.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. Uruchom llama-server. To udostępnia punkt końcowy zgodny z OpenAI; -ngl 99/ przenosi każdą warstwę do GPU.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (Opcjonalnie) włącz głowicę spekulacyjnego dekodowania MTP. Dodaj --spec-type draft-mtp/ — głowica nextn jest wbudowana w każdy kwant, więc nie jest potrzebny osobny model roboczy.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

Badania wyłącznie tekstowe mogą pominąć --mmproj/; wejście obrazu wymaga go, ponieważ jest to natywny model wizyjno-językowy. Endpoint to http://localhost:8080/v1/chat/completions, więc istniejący kod OpenAI SDK działa po podmianie adresu bazowego.

Nie masz GPU? Ta sama nieocenzurowana linia jest hostowana

Lokalny GGUF nie kosztuje nic za token, ale wymaga około 17 GB VRAM w wariancie Q4_K_M. Jeśli nie posiadasz takiego sprzętu, hostowany model obsidian/Qwen3.8-27B na OrcaRouter udostępnia tę samą nieocenzurowaną linię 27B — wizję, rozumowanie, kontekst 262K — za 0,40 USD za milion tokenów wejściowych i 4,21 USD za milion tokenów wyjściowych, z dostępem ograniczonym do badaczy bezpieczeństwa, zespołów red team i badaczy bezpieczeństwa AI. Ta sama rodzina wag, dwa środowiska uruchomieniowe: GGUF lokalnie, FP8 w chmurze. Decyzja o moderacji w obu przypadkach pozostaje po Twojej stronie.

Granica bezpieczeństwa — przeczytaj to przed pobraniem

Ten model został w znacznym stopniu pozbawiony swojego wyrównania bezpieczeństwa. Będzie spełniał szkodliwe, nieetyczne, obraźliwe lub nielegalne żądania, które bazowy Qwen3.8-27B by odrzucił, i nie ma żadnych znaczących wbudowanych zabezpieczeń. Jest udostępniany wyłącznie do legalnych badań — interpretowalności, badania mechanizmów odmowy, red-teamingu, oceny odporności oraz testowania zabezpieczeń. Przyjmujesz pełną odpowiedzialność i ponosisz pełne ryzyko za sposób, w jaki go używasz, oraz za wszystko, co generuje, i nie możesz wdrażać go u użytkowników końcowych ani do produkcji bez dodania własnych warstw bezpieczeństwa, moderacji i zapobiegania nadużyciom. Autorzy nie ponoszą żadnej odpowiedzialności. Licencja to Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

Zmierzone zachowanie pokazuje, ile kosztuje „brak cenzury". Z pakietu oceny bezpieczeństwa z karty modelu — uruchomionego na kompilacji FP8, datowanej na 15 sierpnia 2026 r., czyli na wagach, które konwertuje ten plik GGUF: odsetek odmów na szkodliwe prompty spada z 64–99% w modelu bazowym do 0–6% w wagach po abliteracji, nadmierne odmowy na nieszkodliwe prompty spadają z 5,6% do 0,4%, a wyniki możliwości pozostają w granicach ±1,3 punktu względem modelu bazowego. Te liczby wyjaśniają, dlaczego ta klasa modeli jest uzasadnionym obiektem badań — i jednocześnie są ostrzeżeniem.

Ten artykuł celowo nie zawiera szkodliwych promptów. Jeśli oceniasz model, uruchom standardowe benchmarki odmowy — AdvBench, HarmBench, StrongREJECT, XSTest-safe — i sam przeczytaj liczby. To jest usankcjonowany sposób badania modelu z usuniętą odmową.

Kiedy ten build jest złą odpowiedzią.

1. Chcesz zwykłego asystenta. Zły model. Nie ma żadnych zabezpieczeń i spełni szkodliwe żądania. Zamiast tego użyj dostrojonego Qwen3.8-27B.

2. Wszystko, co udostępnisz użytkownikom końcowym. Niewłaściwy model niezależnie od intencji. Apache 2.0 nie przenosi twojej odpowiedzialności, a udostępnianie użytkownikom modelu bez zabezpieczeń nie jest strategią wdrożenia.

3. Korzystasz z Apple Silicon. GGUF będzie działać, ale konwersja modelu bazowego do formatu MLX będzie bardziej naturalnym rozwiązaniem — zobacz nasz osobny przewodnik po MLX.

4. Nie chcesz go w ogóle uruchamiać. Skorzystaj z hostowanej karty — te same wagi, bez 17 GB VRAM i ta sama brama dostępu tylko do badań.

Sedno sprawy

"Qwen 3.8 27B uncensored GGUF" ma odpowiedź i jest to konkretny plik do pobrania: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 poziomów kwantyzacji dla llama.cpp, abliterowane wagi z naszej kompilacji FP8, kontekst 262K, wizja i MTP, na licencji Apache 2.0 i wyłącznie do celów badawczych. Wybierz Q4_K_M na karcie 24 GB, zaktualizuj llama.cpp po maju 2026 r. i uruchom go jako lokalny serwer zgodny z OpenAI. To instrument badawczy do badania odmów i testowania zabezpieczeń — nie czatbot i nie coś do wdrożenia produkcyjnego. Wagi są darmowe; odpowiedzialność za to, co z nimi zrobisz, spoczywa w całości na Tobie.

W przypadku legalnych badań, F16 i wszystkie 12 poziomów kwantyzacji znajdują się na Hugging Face: Pobierz plik GGUF z Hugging Face

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube