
Qwen 3.8 27B Uncensored GGUF: lokalna kompilacja po abliteracji, 12 kwantyzacji i granica wyłącznie do badań
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
Qwen 3.8 27B uncensored GGUF to prawdziwy plik do pobrania, a wersją, od której warto zacząć, jest Qwen3.8-27B-Uncensored-GGUF — opublikowany na Hugging Face 16 sierpnia 2026 roku jako natywny dla llama.cpp odpowiednik naszej wersji FP8 po abliteracji. To te same wagi pozbawione odmowy o 27 miliardach parametrów co Qwen3.8-27B-Uncensored-FP8, przekonwertowane do GGUF do lokalnej inferencji: F16 plus 12 poziomów kwantyzacji od Q2_K do Q8_0 (w tym kwantyzacje imatrix IQ3_M i IQ4_XS), okno kontekstowe 262K, osobny projektor wizyjny oraz nienaruszona głowica spekulatywnego dekodowania MTP. „Uncensored” oznacza abliterację — kierunek odmowy został usunięty z wag przez ortogonalizację — więc model odpowie tam, gdzie zgodny z zasadami model bazowy odmawia, i właśnie dlatego jest przeznaczony wyłącznie do badań. Oto, co faktycznie zawiera repozytorium, która kwantyzacja pasuje do Twojej karty GPU, jak uruchomić model w llama.cpp oraz jakie granice bezpieczeństwa akceptujesz, pobierając go.
Wersja 30-sekundowa: F16 plus 12 quantów, Q4_K_M przy 16,8 GB to domyślny wybór, potrzebujesz kompilacji llama.cpp z maja 2026 roku lub nowszej, a to jest narzędzie badawcze bez zabezpieczeń — nie jest to coś do wdrożenia dla użytkowników końcowych.
Co tak naprawdę oznacza „nieocenzurowany GGUF" — i czym ta kompilacja różni się od wersji FP8
GGUF to jednoplikowy format modelu używany przez llama.cpp; FP8 to schemat kwantyzacji działający na serwerach GPU vLLM. Nasze dwa wydania bez cenzury to te same wagi po abliteracji w dwóch środowiskach uruchomieniowych. Qwen3.8-27B-Uncensored-FP8 (15 sierpnia 2026) jest przeznaczony dla vLLM na serwerze, poddany ponownej kwantyzacji do oficjalnego schematu Qwen3.8-27B-FP8, dzięki czemu działa na identycznej ścieżce jądra. Qwen3.8-27B-Uncensored-GGUF (16 sierpnia 2026) jest przeznaczony dla llama.cpp na lokalnej maszynie — desktopowym GPU lub stacji roboczej, którą kontrolujesz. Te same wagi, inny model wdrożenia: API w chmurze vs proces lokalny.
Abliteracja to interwencja na poziomie wag, a nie dostrajanie. Kierunek odmowy to wektor w strumieniu rezydualnym modelu, który po aktywacji generuje „I can't help with that”; proces ten znajduje ów kierunek i ortogonalizuje go z wag, zgodnie z podejściem Arditi i in. 2024 („Refusal in Language Models Is Mediated by a Single Direction”). Żadne nowe wagi nie są trenowane. Bazą jest Qwen/Qwen3.8-27B — gęsty model 27B o hybrydowej architekturze (48 warstw liniowej atencji Gated DeltaNet i 16 warstw pełnej atencji), natywnej obsłudze wizji i kontekście 262 144 tokenów. Licencja to Apache 2.0, odziedziczona z bazy. Należy zauważyć, że oficjalne repozytorium Qwen udostępnia wyłącznie safetensory BF16 — nie ma oficjalnego Qwen GGUF — więc każdy nieocenzurowany GGUF tego modelu, w tym ten, jest konwersją otwartych wag.
Drabina kwantowa — F16 plus 12 poziomów
Repo zawiera F16 (54,6 GB w dwóch plikach) i 12 poziomów kwantyzacji. Rozmiary poniżej to rozmiary plików podane w repo, odczytane 16 sierpnia 2026; rozmiary plików GGUF mogą się nieznacznie różnić w zależności od kompilacji.

• F16 — 54,6 GB (2 pliki) — precyzja referencyjna
• Q8_0 — 29.0 GB — prawie bezstratna, dla wysokiej klasy GPU
• Q6_K — 22.4 GB — optymalny stosunek jakości do gigabajta
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — wysoka jakość na większych kartach
• Q4_K_M — 16.8 GB — zalecany jako domyślny
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — najlepszy niskobitowy wybór (kalibrowany imatrix)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — dla kart 16 GB
• IQ3_M — 12.8 GB — mały rozmiar (kalibrowany imatrix)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — najmniejszy kwant K, widoczny kompromis jakościowy
Wskazówki sprzętowe: Q4_K_M na karcie 24 GB (RTX 4090 lub RTX 3090); IQ4_XS lub Q3_K_M, jeśli masz 16 GB; Q2_K tylko wtedy, gdy jesteś ograniczony do 12 GB. Ponieważ baza wykorzystuje hybrydową uwagę Gated DeltaNet, pamięć podręczna KV jest mała — około 0,5 GB przy kontekście 8K — więc możesz przesunąć okno znacznie dalej niż w konwencjonalnym gęstym modelu 27B. Wizja dodaje jeden osobny plik: projektor F16 waży 931 MB. Istnieje również 9-kwantowa społecznościowa seria abliterowana dla tej samej bazy; nasza jest konwersją udokumentowanej abliteracji FP8, z kwantyzacjami imatrix i liczbami refusal-delta z karty modelu.
Jak to uruchomić w llama.cpp
Trzy kroki. Jeden nieoczywisty wymóg: architektura qwen35 i obsługa MTP trafiły do llama.cpp w maju 2026, więc zaktualizuj do wersji z 2026-05 lub nowszej — starsze wersje nie wczytają tych plików (zgodnie z README repozytorium).
1. Pobierz wybrany kwant oraz projektor wizyjny. Repozytorium jest z ograniczonym dostępem, więc najpierw zaloguj się do Hugging Face i zaakceptuj warunki — przeczytanie README jest częścią zaakceptowania tego, czym jest ten model.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. Uruchom llama-server. To udostępnia punkt końcowy zgodny z OpenAI; -ngl 99/ przenosi każdą warstwę do GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (Opcjonalnie) włącz głowicę spekulacyjnego dekodowania MTP. Dodaj --spec-type draft-mtp/ — głowica nextn jest wbudowana w każdy kwant, więc nie jest potrzebny osobny model roboczy.

Badania wyłącznie tekstowe mogą pominąć --mmproj/; wejście obrazu wymaga go, ponieważ jest to natywny model wizyjno-językowy. Endpoint to http://localhost:8080/v1/chat/completions, więc istniejący kod OpenAI SDK działa po podmianie adresu bazowego.
Nie masz GPU? Ta sama nieocenzurowana linia jest hostowana
Lokalny GGUF nie kosztuje nic za token, ale wymaga około 17 GB VRAM w wariancie Q4_K_M. Jeśli nie posiadasz takiego sprzętu, hostowany model obsidian/Qwen3.8-27B na OrcaRouter udostępnia tę samą nieocenzurowaną linię 27B — wizję, rozumowanie, kontekst 262K — za 0,40 USD za milion tokenów wejściowych i 4,21 USD za milion tokenów wyjściowych, z dostępem ograniczonym do badaczy bezpieczeństwa, zespołów red team i badaczy bezpieczeństwa AI. Ta sama rodzina wag, dwa środowiska uruchomieniowe: GGUF lokalnie, FP8 w chmurze. Decyzja o moderacji w obu przypadkach pozostaje po Twojej stronie.
Granica bezpieczeństwa — przeczytaj to przed pobraniem
Ten model został w znacznym stopniu pozbawiony swojego wyrównania bezpieczeństwa. Będzie spełniał szkodliwe, nieetyczne, obraźliwe lub nielegalne żądania, które bazowy Qwen3.8-27B by odrzucił, i nie ma żadnych znaczących wbudowanych zabezpieczeń. Jest udostępniany wyłącznie do legalnych badań — interpretowalności, badania mechanizmów odmowy, red-teamingu, oceny odporności oraz testowania zabezpieczeń. Przyjmujesz pełną odpowiedzialność i ponosisz pełne ryzyko za sposób, w jaki go używasz, oraz za wszystko, co generuje, i nie możesz wdrażać go u użytkowników końcowych ani do produkcji bez dodania własnych warstw bezpieczeństwa, moderacji i zapobiegania nadużyciom. Autorzy nie ponoszą żadnej odpowiedzialności. Licencja to Apache 2.0.

Zmierzone zachowanie pokazuje, ile kosztuje „brak cenzury". Z pakietu oceny bezpieczeństwa z karty modelu — uruchomionego na kompilacji FP8, datowanej na 15 sierpnia 2026 r., czyli na wagach, które konwertuje ten plik GGUF: odsetek odmów na szkodliwe prompty spada z 64–99% w modelu bazowym do 0–6% w wagach po abliteracji, nadmierne odmowy na nieszkodliwe prompty spadają z 5,6% do 0,4%, a wyniki możliwości pozostają w granicach ±1,3 punktu względem modelu bazowego. Te liczby wyjaśniają, dlaczego ta klasa modeli jest uzasadnionym obiektem badań — i jednocześnie są ostrzeżeniem.
Ten artykuł celowo nie zawiera szkodliwych promptów. Jeśli oceniasz model, uruchom standardowe benchmarki odmowy — AdvBench, HarmBench, StrongREJECT, XSTest-safe — i sam przeczytaj liczby. To jest usankcjonowany sposób badania modelu z usuniętą odmową.
Kiedy ten build jest złą odpowiedzią.
1. Chcesz zwykłego asystenta. Zły model. Nie ma żadnych zabezpieczeń i spełni szkodliwe żądania. Zamiast tego użyj dostrojonego Qwen3.8-27B.
2. Wszystko, co udostępnisz użytkownikom końcowym. Niewłaściwy model niezależnie od intencji. Apache 2.0 nie przenosi twojej odpowiedzialności, a udostępnianie użytkownikom modelu bez zabezpieczeń nie jest strategią wdrożenia.
3. Korzystasz z Apple Silicon. GGUF będzie działać, ale konwersja modelu bazowego do formatu MLX będzie bardziej naturalnym rozwiązaniem — zobacz nasz osobny przewodnik po MLX.
4. Nie chcesz go w ogóle uruchamiać. Skorzystaj z hostowanej karty — te same wagi, bez 17 GB VRAM i ta sama brama dostępu tylko do badań.
Sedno sprawy
"Qwen 3.8 27B uncensored GGUF" ma odpowiedź i jest to konkretny plik do pobrania: Qwen3.8-27B-Uncensored-GGUF — F16 plus 12 poziomów kwantyzacji dla llama.cpp, abliterowane wagi z naszej kompilacji FP8, kontekst 262K, wizja i MTP, na licencji Apache 2.0 i wyłącznie do celów badawczych. Wybierz Q4_K_M na karcie 24 GB, zaktualizuj llama.cpp po maju 2026 r. i uruchom go jako lokalny serwer zgodny z OpenAI. To instrument badawczy do badania odmów i testowania zabezpieczeń — nie czatbot i nie coś do wdrożenia produkcyjnego. Wagi są darmowe; odpowiedzialność za to, co z nimi zrobisz, spoczywa w całości na Tobie.
W przypadku legalnych badań, F16 i wszystkie 12 poziomów kwantyzacji znajdują się na Hugging Face: Pobierz plik GGUF z Hugging Face
