
Ongecensureerde LLM, uitgelegd: De abliteratietechniek, het onderzoeksgebruik, en de grens die je niet overschrijdt
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
Een ongecensureerde LLM is een taalmodel waarvan het weigeringsgedrag — het deel van het model dat een verzoek afwijst in plaats van het te beantwoorden — opzettelijk is verwijderd. De meeste worden gebouwd door abliteratie: een onderzoeker vindt de enige interne richting die weigering medieert en wist die uit de gewichten, waardoor de rest van het model grotendeels intact blijft. Het resultaat is een model dat antwoordt waar een normaal model nee zou zeggen, wat precies de reden is waarom het wordt bestudeerd en precies de reden waarom het niet voor productie is. We hebben zo’n build geleverd, Qwen3.8-27B-Uncensored-FP8, een geablitereerde en FP8-gekwantiseerde Qwen3.8 27B, aan Hugging Face onder Apache 2.0 als een onderzoeksartefact. Deze pagina is de categorie-uitleg: wat deze modellen zijn, het onderzoek dat ze rechtvaardigt, hoe je er veilig mee werkt, en waar de grens ligt.
Eén insteek houdt de hele categorie eerlijk, dus laat ik het vooropstellen: een ongecensureerd model is niet slimmer, meer waarheidsgetrouw of capabeler dan het model waaruit het voortkwam. Het zijn dezelfde gewichten met één gedrag eraf gehaald. Alles wat het nog weet, wist het altijd al — wat veranderd is, is dat het niet langer weigert. Dat maakt het een werkelijk nuttig object voor veiligheidsonderzoek, en een werkelijk onveilig ding om in te zetten. Beide helften van die zin zijn dragend, en de rest van deze pagina legt beide uit.
Wat "ongecensureerd" eigenlijk betekent
• Of open het via onze modelkaart, die de prijs- en benchmarkgegevens bevat.
De techniek komt voort uit een bevinding op het gebied van interpreteerbaarheid uit 2024. In "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024) toonden de auteurs aan dat bij 13 open chatmodellen variërend van 1,8B tot 72B parameters, weigering wordt bepaald door ongeveer een eendimensionale deelruimte van de residustroom — de interne toestand die informatie tussen lagen doorgeeft. Verwijder die richting en het model stopt met weigeren; voeg hem weer toe en het model weigert ook onschadelijke verzoeken.
Abliteration operationaliseert die bevinding: schat de richting en orthogonaliseer die vervolgens uit de gewichtsmatrices die naar de residustroom schrijven. In onze eigen build, Qwen3.8-27B-Uncensored-FP8, werd de weigeringsrichting op één enkele laag geschat en verwijderd uit 131 residu-schrijvende matrices, waardoor de vision-toren onaangetast bleef. Wat overblijft is dezelfde kennis, dezelfde redenering en dezelfde context van 262.144 tokens — met de weigering eruit gehaald. En om precies te zijn over het label: "uncensored" betekent niet "aligned" of veilig. Het betekent dat de beveiliging is uitgeschakeld. We komen terug op wat dat van jou vraagt.
Het onderzoek dat hen creëerde
Het resultaat van de weigeringsrichting deed twee dingen tegelijk. Wetenschappelijk gezien verklaarde het een veiligheidsgedrag mechanistisch: er is een echt, vindbaar circuit dat een model 'nee' laat zeggen. Praktisch liet het zien hoe breekbaar alignment kan zijn — een enkele rank-one-bewerking van de gewichten kan het gedrag uitschakelen, zonder dat er fine-tuning nodig is. Dat is geen gebrek in het model van één lab; de auteurs reproduceerden het in meer dan een dozijn chatmodellen.
Tegen 2026 is de techniek een pipeline geworden die met één commando werkt, wat een feit met twee kanten is. Heretic, een open-sourcebibliotheek, schat per laag de weigeringsrichtingen en orthogonaliseert ze uit de attention- en MLP-projecties; een rapport uit mei 2026 schatte het verwijderen van guardrails voor Meta's Llama 3.3 op ongeveer 10 minuten en voor Google's Gemma 4 op ongeveer 90 minuten, met meer dan 3.500 afgeleide modellen en meer dan 13 miljoen cumulatieve downloads. Abliterix (Wu Wangzhang) volgt een voorzichtiger aanpak: het extraheert een weigeringsrichting uit 800 schadelijke en 800 goedaardige prompts, past een orthogonale projectie toe, levert de bewerking als rank-1 LoRA-adapters zodat de basisgewichten onaangeroerd blijven, en rapporteert het weigeringspercentage en de KL-divergentie zodat de capaciteitskosten zichtbaar blijven. Op een 0.8B Qwen3.5-model rapporteerde het 0 van 200 weigeringen op schadelijke prompts.
Lees die alinea zoals een veiligheidsonderzoeker dat zou doen. Het doel van het bouwen van deze tools is niet dat iemand de beveiligingen van een model eraf zou halen voor de lol. Het punt is dat het verwijderen triviaal en openbaar is — dus het meten ervan, bestuderen hoe het werkt, en het bouwen van beveiligingen die het overleven is op zichzelf een onderzoeksprogramma. Dat is red-teaming in de white-box zin: je kunt een systeem niet verdedigen totdat je weet hoe gemakkelijk het te breken is.
Waarom ongecensureerde modellen populair werden in 2026
Drie krachten kwamen samen. Ten eerste de open-weights-golf: Qwen3.8 27B en zijn peers worden onder permissieve licenties uitgebracht, en abliteration heeft geen trainingsrun nodig — je past de gewichten aan en kwantiseert opnieuw. Ten tweede is de tooling volwassen geworden, van onderzoekscode tot bibliotheken die met één commando werken, zodat een competente ingenieur in een middag een build kan produceren. Ten derde werd Hugging Face het distributiekanaal, wat betekent dat tractie meetbaar is.
Ons eigen datapunt: Qwen3.8-27B-Uncensored-FP8, uitgebracht op 15 augustus 2026, had binnen ongeveer een dag 257 likes en 4.285 downloads (geverifieerd op 16 augustus). Het is niet zo dat tienduizenden mensen een onbewaakt model willen implementeren. Het is dat veel onderzoekers en ingenieurs er een willen bestuderen — en de downloadaantallen zijn de vraagcurve voor die nieuwsgierigheid.
Waarvoor het dient: de legitieme onderzoeksdoeleinden.
Hier is de verdedigbare lijst, en het is de volledige lijst. Als een gebruik er niet op staat, ga ervan uit dat het niet legitiem is:
• Interpreteerbaarheid — onderzoeken wat het weigeringscircuit werkelijk is, waar het zich bevindt, en waarom het verwijderen van één richting het gedrag verandert.
• Red-teaming en evaluatie van guardrails — het bouwen van een moderatielaag en testen of deze vangt wat een model zonder weigeringen produceert.
• Oversafety-meting — kwantificeren hoe vaak basismodellen goedaardige verzoeken weigeren, en dat scheiden van echte veiligheid.
• Robustheidsonderzoek — het meten van hoe gemakkelijk alignment verwijderd kan worden, wat essentiële informatie is voor iedereen die safety fine-tuning ontwerpt.
• Gecontroleerde veiligheidsexperimenten — benchmarksuites zoals AdvBench en JailbreakBench bestaan juist om weigeringsgedrag op een gestandaardiseerde, reproduceerbare manier te kunnen meten.

Al deze zaken hebben één eigenschap gemeen: het model is het onderwerp van studie, niet de oplevering. De output van dit onderzoek is een paper, een benchmarkresultaat of een betere vangrail — nooit een dienst.
Hoe je er een op verantwoorde wijze uitvoert (als je daadwerkelijk onderzoek doet)
Als je een legitieme reden hebt om met een abliterated model te werken, zijn de gebruiksregels eenvoudig:
Voer het lokaal uit, in een sandbox en idealiter air-gapped. Geen openbaar endpoint, geen chatdienst, geen gedeelde server.
• Serveer het met standaard tooling — vLLM of llama.cpp — op dezelfde manier als je elk open-weights model zou doen. Onze build is een block-FP8-kwantificatie die draait op het standaard vLLM FP8-kernelpad met zijn 262K context, thinking-toggle en tool calling intact.
Meet, praat er niet alleen maar over. Kwantificeer weigering op een benchmarksuite met schadelijke prompts en vergelijk die met het basismodel; kwantificeer overmatige weigering op goedaardige prompts; rapporteer KL-divergentie zodat capaciteitsdrift zichtbaar is. Dat is het verschil tussen een experiment en een anekdote.

Houd outputs in een gecontroleerde omgeving. Log, beoordeel en vernietig in plaats van te verspreiden.
• Als je je eigen guardrails evalueert, plaats je moderatielaag vóór het model en test deze — dat is het hele punt van de oefening.
• Voor het volledige specificatieblad, de benchmarktabel en de hostingdetails, open ons model card — dat is de canonieke referentie voor deze build.
De veiligheidsgrens: wat "alleen voor onderzoek" betekent
Hier is het deel dat niet vaak genoeg kan worden benadrukt. Een abliterated model heeft geen betekenisvolle ingebouwde vangrails. Het zal voldoen aan verzoeken die een normaal model weigert. Dat is het kenmerk, en het is ook het risico — daarom draagt elke serieuze release ervan, inclusief de onze, dezelfde waarschuwingen.
• Geen ingebouwde beperkingen. Het weigeringsgedrag is verdwenen; gedraag je niet alsof het er nog is.
• Niet voor eindgebruikers, niet voor productie. Een product, een chatbot, een API die het publiek bedient, een intern hulpmiddel waar je collega's op vertrouwen — geen van deze is de juiste plek voor een ongecensureerd model.
• De verantwoordelijkheid ligt bij jou. We leveren Qwen3.8-27B-Uncensored-FP8 onder Apache 2.0, wat permissief is wat betreft redistributie. Een licentie is geen veiligheidscertificaat: permissieve code verandert niet wat het model zal doen, en het draagt de zorgplicht niet over.
• Als je het gebruikt, ben je eigenaar van de outputs. De gecontroleerde omgeving is jouw taak; dat geldt ook voor het beslissen wat je er wel en niet in stopt, en wat je doet met wat eruit komt.

Wanneer een ongecensureerd model het verkeerde antwoord is
De duidelijkste manier om het te zeggen: als er een persoon aan de andere kant van het model zit, is een ongecensureerd model het verkeerde antwoord. Elk product dat betrouwbaar moet zijn, elke assistent wiens oordeel ertoe doet, alles waarbij een weigering het juiste gedrag is — gebruik in plaats daarvan het basismodel. De reden dat Qwen3.8 27B in zijn normale vorm bestaat, is juist dat weigering een functie is, geen bug, voor bijna elk reëel gebruik. De abliterated build bestaat alleen voor de hierboven genoemde niche-onderzoeksgevallen en voor niets anders.
Kortom. Een ongecensureerde LLM is geen productcategorie en geen hack. Het is een onderzoeksartefact met een echte wetenschappelijke afstamming — van de refusal-direction-bevinding tot de geautomatiseerde tools van 2026 — en een harde uitrolgrens. De modellen zijn reëel, de vraag is meetbaar, en de legitieme toepassingen zijn dat ook: interpreteerbaarheid, red-teaming, guardrail-evaluatie en gecontroleerde veiligheidsexperimenten. De grens tussen het bestuderen van de guard en het uitschakelen van de guard voor iemand anders is het hele punt van deze pagina, en die grens verschuift niet.
Deze exacte build is publiek beschikbaar onder Apache 2.0 — alleen voor onderzoek. Je kunt de gewichten downloaden op Hugging Face
