Titelkaart voor het artikel 'Qwen Uncensored, Explained', met een afgeronde onderzoekskaart met een schild dat wordt geopend om een circuit-brein te onthullen, een microscooppictogram en een label met de tekst RESEARCH-ONLY, en chips met de tekst ABLITERATED, BLOCK-FP8 en 262K CONTEXT.
Guides & Insights

Qwen zonder censuur, uitgelegd: zo draai je de Abliterated Qwen3.8-27B-FP8

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Qwen ongecensureerd op Hugging Face betekent bijna altijd abliteratie — de weigeringsrichting van het model verwijderd uit zijn residustroom — en de build om mee te beginnen is Qwen3.8-27B-Uncensored-FP8, uitgebracht op Hugging Face op 15 augustus 2026. Het is een geablitereerde, block-FP8-build van Qwen3.8-27B die draait op exact hetzelfde vLLM-kernelpad als de officiële FP8-release, met de 262K-context, vision-toren en MTP-speculatieve-decoderingkop intact — en het trok op dag één 257 likes en 4.285 downloads. Het is een onderzoekstool, geen chatbot: geen ingebouwde beveiligingen, Apache 2.0, en het zal voldoen aan verzoeken die het basismodel weigert. Deze gids behandelt wat abliteratie daadwerkelijk veranderde, hoe je de 30,9 GB aan gewichten van Hugging Face haalt, hoe je het model serveert met vLLM, SGLang of Transformers, en wat je erop moet draaien voor legitiem onderzoek.

Wat "qwen uncensored" eigenlijk betekent

Abliteration is een interventie op gewichtsniveau, geen fine-tuning. De weigerrichting is een vector in de residuele stroom van het model die, wanneer geactiveerd, "Ik kan daar niet mee helpen" produceert; abliteration vindt die richting en orthogonaliseert deze uit de gewichten. In deze build werd de verwijdering toegepast op 131 residuele-schrijfmatrices (de methode van Arditi et al. 2024, "Refusal in Language Models Is Mediated by a Single Direction"), en het resultaat werd opnieuw gekwantiseerd om byte-voor-byte overeen te komen met het officiële Qwen3.8-27B-FP8-schema, zodat vLLM het serveert via het identieke FP8-kernelpad. Er werden geen nieuwe gewichten getraind.

Dat onderscheid is belangrijk omdat de topresultaten voor 'qwen uncensored' drie verschillende dingen door elkaar halen: abliterated gewichtswijzigingen zoals deze, system-prompt 'uncensored packs' die alleen weigeringen op promptniveau maskeren, en LoRA-fijnafstellingen die zonder veiligheidsdata zijn getraind. Ze zijn niet gelijkwaardig, en de meeste pagina's die voor de query ranken vertellen je niet welke familie ze beschrijven. Als je het weigeringsmechanisme zelf wilt bestuderen, is alleen de interventie op gewichtsniveau het echte werk.

Wat het verwijderen van weigeringen daadwerkelijk deed — de cijfers

De modelkaart publiceert een veiligheidsevaluatiesuite, uitgevoerd op het via vLLM bediende model en gedateerd 15 augustus 2026. Met denken uitgeschakeld zakt de weigering op zeven benchmarks voor schadelijke prompts van 64–99% op de basis naar 0–6% op deze build: AdvBench 99.0% naar 0.0%, JailbreakBench 94.0% naar 0.0%, StrongREJECT 97.3% naar 2.0%, HarmBench 98.7% naar 2.7%, MaliciousInstruct 99.0% naar 0.0%, SimpleSafetyTests 64.0% naar 6.0%, ForbiddenQuestions 73.3% naar 4.7%. Met denken ingeschakeld weigert het model vrijwel nooit — 1.7% of minder. Een apart, opmerkelijk getal is het waarschuwingspercentage: 30–50% van de "ongecensureerde" antwoorden plaatst nog steeds een korte disclaimer vóór het antwoord; dat is een trainingsartefact, geen weigering.

De keerzijde is wat niet veranderde. Overmatige weigering op onschuldige prompts daalt van 5,6% naar 0,4% op XSTest-safe, en elke capaciteitsbenchmark blijft binnen ±1,3 punten van de basis: MMLU 84,3% naar 84,7%, GSM8K 90,0% naar 88,7%, MMLU-Pro 77,6% naar 76,8%, CMMLU 81,4% naar 80,8%. WikiText-2 perplexity is 6,96. Met andere woorden, de interventie verwijderde het weigeringsgedrag zonder het model wezenlijk te verslechteren.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Hoe haal je het van Hugging Face

De repository is orcarouter/Qwen3.8-27B-Uncensored-FP8 en is gated: je logt in met een Hugging Face-account en accepteert de voorwaarden voordat de bestanden worden gedownload — de gate is zelf de disclaimer, want het lezen van de README hoort bij het accepteren van wat dit model is. Wat je downloadt is 30,9 GB verdeeld over zeven safetensors-shards (1.606 tensoren) in block-FP8 (E4M3, 128-bij-128-blokken, dynamische activeringen), waarbij de vision tower, norms, embeddings en lm_head in BF16 zijn gehouden. De licentie is Apache 2.0, overgenomen van de basis-Qwen/Qwen3.8-27B. Geen enkele Hugging Face Inference Provider host het — je draait het zelf, of gebruikt een hosted card.

Hoe het uit te voeren

De gewichten zijn ongeveer 31 GB — ongeveer de helft van de ~56 GB BF16-checkpoint — en de kaart beveelt een enkele H100 80GB of H200 143GB aan, met ~40 GB VRAM als praktische ondergrens voor gewichten plus een kleine KV-cache. Volledige 262K context vereist meer, maar een FP8 KV-cache halveert dat. De setup die de kaart heeft geverifieerd was één H200 met --max-num-seqs 96, FP8 KV-cache en MTP ingeschakeld.

vLLM is het beoogde pad, en het is één opdracht, omdat het FP8-schema exact overeenkomt met de officiële build:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

Dat geeft je een OpenAI-compatibel eindpunt op localhost:8000/v1/chat/completions. Het Docker-equivalent is docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8. Voor de volledige setup suggereert de kaart: --language-model-only voor tekst-only serving, --speculative-config '{"method":"mtp","num_speculative_tokens":3}' om de MTP-speculatieve-decoderingkop in te schakelen, --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3, en --enable-auto-tool-choice --tool-call-parser qwen3_coder voor tool calling. Geef --quantization fp8 niet door — het schema wordt uit config.json gelezen. Laat --kv-cache-dtype fp8 weg als je een BF16 KV-cache wilt, en laat --language-model-only weg als je de vision-toren nodig hebt.

Voor SGLang: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Voor Transformers documenteert de kaart zowel de pipeline-API — pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8") — als AutoProcessor.from_pretrained(...) plus AutoModelForMultimodalLM.from_pretrained(..., device_map="auto").

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

Wat je er in onderzoek daadwerkelijk mee kunt doen

Het doel van een model zonder weigeringen is om een studieobject te zijn, en deze build is ongewoon gemakkelijk te bestuderen omdat de interventie gedocumenteerd is. Drie concrete, legitieme onderzoeksprojecten:

• Reproduceer de weigeringsdelta. Voer AdvBench, HarmBench, StrongREJECT of XSTest-safe uit tegen zowel de geablitereerde build als de basis-FP8, en bevestig de cijfers van de kaart: 64–99% naar 0–6% op schadelijke prompts, 5,6% naar 0,4% overmatige weigering op goedaardige prompts. Dat voor/na-paar is precies de meting die een veiligheidsteam nodig heeft om te weten of een methode voor het verwijderen van weigeringen werkt en wat deze kost.

• Bestudeer waar weigering leeft. Omdat de build de 131 matrices documenteert die georthogonaliseerd zijn, kun je de richtingen van de residustroom vergelijken met de basis en zien wat de interventie heeft verplaatst. Het thinking-on-resultaat is hier informatief: weigering daalt tot 1,7% of minder wanneer denken is ingeschakeld, wat bewijs is dat het redeneerspoor is waar de richting het meest ertoe doet.

• Evalueer je eigen guardrail. Een baseline zonder guardrail is de juiste controle voor het testen van een moderatielaag. Voer je filter uit over de outputs van dit model en meet wat het opvangt — zo kwantificeer je de veiligheidslaag die je erbovenop toevoegt.

Wanneer dit model het verkeerde antwoord is

Als je een normale assistent wilt, of iets dat je voor eindgebruikers zou plaatsen, dan is dit het verkeerde model — het heeft geen betekenisvolle ingebouwde beveiligingsmaatregelen, het zal voldoen aan verzoeken die het basismodel weigert, en Apache 2.0 draagt je aansprakelijkheid niet over. Gebruik in plaats daarvan het originele afgestemde Qwen3.8-27B. Als je weigeringen op een chatbot wilt omzeilen, bereik je met een system-prompt-pakket meer met minder risico dan met een gewichtsbewerking. En als je geen ~40 GB-kaart hebt maar het model toch wilt bestuderen, biedt de gehoste card obsidian/Qwen3.8-27B op OrcaRouter dezelfde ongecensureerde 27B-lijn voor $0,40 per miljoen invoertokens en $4,21 per miljoen uitvoertokens, met dezelfde 262K-context — deze is beperkt tot beveiligings- en AI-veiligheidsonderzoekers, en de moderatiebeslissing blijft aan jouw kant.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

De veiligheidsgrens — lees dit voordat je downloadt

Bij dit model is de safety-alignment grotendeels verwijderd. Het zal voldoen aan schadelijke, onethische, aanstootgevende of illegale verzoeken die de originele Qwen3.8-27B zou weigeren, en het heeft geen noemenswaardige ingebouwde waarborgen. Het wordt uitsluitend uitgebracht voor legitiem onderzoek — interpreteerbaarheid, AI-veiligheid en onderzoek naar weigeringsmechanismen, red-teaming, robuustheidsevaluatie en gecontroleerde experimenten. U aanvaardt de volledige verantwoordelijkheid en aansprakelijkheid voor hoe u het gebruikt en voor alles wat het genereert, en u mag het niet aan eindgebruikers of in productie inzetten zonder uw eigen veiligheids-, moderatie- en misbruikpreventielagen toe te voegen. De auteurs aanvaarden geen aansprakelijkheid voor misbruik. Het downloaden van de repository betekent dat u deze voorwaarden aanvaardt; de licentie is Apache 2.0.

Dit artikel bevat bewust geen schadelijke prompts. De weigeringscijfers hierboven komen uit de eigen veiligheidsevaluatiesuite van de modelkaart, wat de juiste manier is om een model van deze klasse te meten: voer de standaard weigeringsbenchmarks uit, lees de cijfers en ontwerp je onderzoek rond wat ze laten zien.

Kortom

"Qwen uncensored" is een zoektocht naar een techniek, en de versie die je eerst moet proberen is Qwen3.8-27B-Uncensored-FP8: de enige build van Qwen3.8 zonder weigeringen die serveert op het officiële FP8-vLLM-kernelpad met 262K context, vision en MTP intact, ondersteund door een gepubliceerde voor/na-evaluatie. Haal de gated 30,9 GB van Hugging Face, serveer het met vLLM op een enkele H100 of H200, en gebruik het waarvoor het bedoeld is — het meten van weigeringen, het bestuderen van het weigeringsmechanisme en het testen van guardrails. Gebruik het niet als chatbot en lever het niet aan eindgebruikers. De gewichten zijn gratis; de verantwoordelijkheid voor wat je ermee doet ligt volledig bij jou.

Voor legitiem onderzoek zijn de gewichten te vinden op Hugging Face: Download van Hugging Face

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube