
Qwen3.8-27B-Uncensored Benchmarks: weigering stort in, capaciteit blijft
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Het benchmarkverhaal van Qwen3.8 27B Uncensored (Aggressive) — de abliterated build van Qwen3.8 27B, uitgebracht als een FP8-checkpoint op 15 augustus 2026 en een GGUF-build op 16 augustus — is niet dat het sterker is geworden. Het is dat het is gestopt met weigeren. De modelkaart rapporteert dat de weigering van schadelijke prompts instort van 64–99% op het basismodel naar 0–6% op de abliterated build met denken uit, en op of onder 1,7% met denken aan, terwijl elke capaciteitsbenchmark binnen ±1,3 punten van het basismodel uitkomt en de WikiText-2 perplexity op 6,96 ligt. Als je hier bent voor de qwen uncensored benchmarks, dan zijn dat de kerncijfers: het is geen slimmer model, het is een model dat niet weigert.
Dat onderscheid doet ertoe, want het meeste dat scoort op 'ongecensureerde benchmarks' is ofwel een dunne lijst van capaciteitsscores, ofwel een hype-bericht dat beweert dat het model 'beter' is. Geen van beide is wat abliteration doet. Dit artikel doorloopt de werkelijk gemeten data — refusal collapse, over-refusal, behoud van capaciteiten en perplexity — de methode die dit opleverde, en de veiligheidsgrens die je moet lezen voordat je de gewichten aanraakt.
Wat een ongecensureerde benchmark-rondgang daadwerkelijk meet
Een gewone modelreview rapporteert één as: capaciteit — MMLU, GSM8K, programmeren, redeneren. Een abliterated model is interessant op een andere as, en de hele bedoeling van het 'uncensored'-label is dat de veiligheidsas is verschoven. Dus de nuttige vraag voor Qwen3.8-27B-Uncensored-FP8 is niet 'is het slimmer?' maar 'wat heeft het verwijderen van het weigeringsmechanisme gekost, en hoe grondig is het verwijderd?'
Drie families van getallen moeten samen gelezen worden. Weigeringspercentage bij benchmarks met schadelijke prompts — hoe vaak het model weigert; hoe hoger de basis, hoe zichtbaarder de verwijdering. Overmatige weigering bij goedaardige prompts — hoe vaak het ten onrechte een onschuldig verzoek weigert; lager is beter voor iedereen. En behoud van capaciteiten — of de bewerking het model heeft verslechterd. Een benchmarksamenvatting die alleen capaciteitsscores toont, beantwoordt de verkeerde vraag.
De methode: abliteration is een gewichtsbewerking, geen fine-tune.
Wat abliteration onderscheidt van de community-"jailbreak"-pakketten is waar de verandering plaatsvindt. Een jailbreak op promptniveau omhult de input; abliteration wijzigt de gewichten. De methode die hier wordt toegepast is Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". De kernbevinding is dat weigeringsgedrag in veel modellen wordt aangestuurd door één enkele richting in de residual stream — schat die richting in, verwijder hem, en het model stopt met weigeren zonder hertraind te worden.
Concreet beschrijft de kaart het schatten van één weigeringsrichting uit het massief-activatie-gemaskeerde gemiddelde verschil van schadelijke minus onschadelijke last-token-residuen op laag 38 (round(0.6 × 64)), met AdvBench als de schadelijke set en Alpaca als de onschadelijke set. De bewerking is een orthogonalisatie, W′ = W − r(rᵀW), berekend in float32 en toegepast op 131 residu-schrijvende matrices — de aandachtsuitvoerprojecties, de lineair-aandachtsuitvoerprojecties, de MLP-neerwaartse projecties, en één inbeddingsrijruimte. Er wordt geen trainingsstap uitgevoerd; de visiontoren blijft onaangeroerd; de MTP-speculatieve-decoderingkop wordt consistent geablitereerd. Daarom overleeft de capaciteit: het verwijderen van een richting is een veel zachtere ingreep dan het fine-tunen van het model om te gehoorzamen.
Weigering stort in: de cijfers
Gemeten op de vLLM-geserveerde FP8-build en gepubliceerd op de Hugging Face-modelkaart (2026-08-15), daalt de weigering op benchmarks met schadelijke prompts van 64–99% op de basisversie naar 0–6% op de ongecensureerde build met denken uit:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (schadelijk) — 94,0% → 0,0%
• StrongREJECT — 97,3% → 2,0%
• HarmBench (standaard) — 98.7% → 2.7%
• MaliciousInstruct — 99,0% → 0,0%
• SimpleSafetyTests — 64,0% → 6,0%
• ForbiddenQuestions — 73.3% → 4.7%
Met denken ingeschakeld is weigering in wezen nooit — 1,7% op AdvBench en 0,0% op de meeste rest. De modelkaart voegt één eerlijk voorbehoud toe: 30–50% van de antwoorden beginnen nog steeds met een korte disclaimer. Dat is een trainingsartefact, geen weigering — het model antwoordt, maar nuanceert zijn opening. Het leest als wrijving, niet als veiligheid.

Overmatig weigeren is ook een fout.
Het minder bekende getal bevindt zich aan de andere kant van de veiligheidsas. Op XSTest-safe — 250 goedaardige prompts die afgestemde modellen soms per ongeluk weigeren — weigert het basismodel 5,6% van de tijd overmatig. De ongecensureerde versie weigert overmatig in 0,4%. Het verwijderen van de weigeringsrichting zorgt er niet alleen voor dat het model geen schadelijke verzoeken weigert; het zorgt er ook voor dat het geen onschadelijke verzoeken weigert die het eerder door overgeneralisatie markeerde. Voor iedereen die evaluatie- of red-team-tools bouwt waarbij een weigeringsvrije basislijn het uitgangspunt is, is dit een echte verbetering van de tool, geen bijwerking waar je je voor hoeft te verontschuldigen.
Capaciteit wordt behouden, niet verbeterd
Dit is waar het frame "ongecensureerd = sterker" sterft. De modelkaart rapporteert de abliterated FP8-build tegenover de officiële basis-FP8 met dezelfde scripts en instellingen:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77,6% → 76,8%
• CMMLU (0-shot, Chinees) — 81,4% → 80,8%
Elke score valt binnen ±1,3 punten van de basis, en de ruwe perplexiteit van WikiText-2 komt uit op 6,96 — het bewijs op de kaart dat taalmodellering zelf niet is verslechterd. De eerlijke lezing: abliteratie is vrijwel capaciteitsneutraal op deze architectuur. Je krijgt geen beter model; je krijgt hetzelfde model zonder het weigeringsgedrag.

Dezelfde waarschuwing geldt voor het bredere ecosysteem: beweringen over 'lossless uncensored' bij community-builds verdienen het met scepsis te worden bekeken. Een vergelijking tussen drie methoden op een 4B open-weight-build op Hugging Face wees uit dat de techniek die beweerde verliesvrij te zijn, TruthfulQA met ongeveer 7 punten en Lambada met ongeveer 4 punten liet dalen, terwijl het HarmBench-aanvalssuccespercentage 100% bedroeg; de andere twee methoden zaten op 99,2% en 95,5%. En een agressieve test op een andere build leverde nul weigeringen op, maar produceerde onsamenhangende woordbrei, dus de uitgebrachte versie schakelde terug naar mildere per-laag-parameters. Abliteratieresultaten zijn methode-specifiek — deze cijfers zijn specifiek de gegevens op de modelkaart van de FP8-build.
Wat de kaart niet beweert
Lees de methodologie voordat u de cijfers aanhaalt. De kaart bestempelt zijn weigeringsmeting als "indicatief, geen LLM-beoordelaar / publicatie-grade nummer": weigering werd beoordeeld door een op regels gebaseerde classificatie van openingszinnen, met een apart "caveat"-emmer voor antwoorden die gehoor gaven maar een disclaimer vooraf plaatsten. De benchmarks zijn tekst-only, uitgevoerd tegen de vLLM-geserveerde FP8-build met alleen het taalmodel, en de capaciteitssuite gebruikte standaard evaluatiescripts. Het juiste kader: dit zijn de eigen gemeten gegevens van de leverancier, reproduceerbaar op basis van de gepubliceerde kaart — niet een onafhankelijke uitvoering door een derde partij, en geen bewering over de GGUF-build, die gekwantiseerd wordt geleverd voor llama.cpp en afzonderlijk moet worden geëvalueerd.
De veiligheidsgrens
Dit is het deel dat niet afgezwakt kan worden. Bij een ge-ablitereerd model is het weigeringsmechanisme grotendeels verwijderd. Concreet: het zal voldoen aan schadelijke, onethische of illegale verzoeken die het basismodel Qwen3.8 27B zou weigeren, en het heeft geen betekenisvolle ingebouwde vangrails. De legitieme toepassingen zijn onderzoek — interpreteerbaarheid (het bestuderen van hoe weigeringsrichtingen zijn gecodeerd), AI-veiligheid en onderzoek naar weigeringsmechanismen, red-teaming (het testen van modellen met invoer die hun vangrails probeert te omzeilen), en robuustheidsevaluatie. Het wordt uitgebracht onder de Apache 2.0-licentie, overgenomen van het basismodel, strikt als onderzoeksartefact. U aanvaardt de volledige verantwoordelijkheid en aansprakelijkheid voor hoe u het gebruikt en voor alles wat het genereert. Zet het niet in voor eindgebruikers of in productie zonder uw eigen veiligheids-, moderatie- en misbruikpreventielagen — en voor elke productie- of consumentgerichte toepassing is de standaard Qwen3.8 27B het model dat u eigenlijk wilt.
Wanneer een ongecensureerde benchmark het verkeerde is om op te zoeken
Als je vraag is "welk model is het sterkst in wiskunde of coderen?", lees je de verkeerde cijfers — de ongecensureerde build is geen capaciteitsupgrade. Als je toepassing schadelijke verzoeken moet weigeren, is dit model het tegenovergestelde van wat je zoekt. Als je een product uitbrengt, bouw dan niet voort op een abliterated checkpoint. En als je eigenlijk op zoek bent naar een jailbreak, dan is dat iets heel anders — prompt-level packs vallen buiten de weight-level interventie die hier wordt besproken en zijn niet het onderwerp van dit artikel. De benchmarkgegevens in dit stuk bestaan voor één nauwe, legitieme vraag: wat het verwijderen van weigering doet met een Qwen3.8 27B, gemeten.
Hoe krijg je er toegang toe?
Beide builds staan op Hugging Face onder Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, ongeveer 30,9 GB aan gewichten, draaiend op het standaard vLLM FP8-kernelpad met 262K context, tools, thinking en MTP intact) en orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 plus 12 quant-tiers voor llama.cpp, met Q4_K_M op 16,8 GB als de aanbevolen standaard voor een 24 GB GPU). De modelkaart op OrcaRouter bevat de prijzen en de benchmarkdetails — de uncensored build staat daar vermeld als obsidian/Qwen3.8-27B voor $0,40 per miljoen input-tokens en $4,21 per miljoen output-tokens, met 262K context, en de toegang is beperkt tot beveiligingsonderzoekers, red teams en AI-veiligheidsonderzoekers.

De bottom line
De qwen-uncensored-benchmarks beantwoorden een specifieke vraag, en het antwoord is helder: door weigering via abliteration uit Qwen3.8 27B te verwijderen, blijft de capaciteit binnen ±1,3 punten, terwijl de weigering bij schadelijke prompts instort van 64–99% naar 0–6%, overmatige weigering daalt van 5,6% naar 0,4% en de perplexiteit blijft op 6,96. Lees die getallen als 'weigert niet', nooit als 'sterker'. Voor interpreteerbaarheid, veiligheid en red-team-onderzoek is dat precies het hulpmiddel dat de modelkaart beschrijft. Voor alles wat een gebruiker onder ogen komt, is het per constructie het verkeerde model.
Voor legitiem onderzoeksgebruik zijn de gewichten op Hugging Face onder Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (de GGUF-build voor llama.cpp is te vinden op orcarouter/Qwen3.8-27B-Uncensored-GGUF).
