Titelkort för den ocensurerade LLM-förklararen, som visar en schematisk bild av en modell där en enskild markerad riktning lyfts ut ur dess interna ström och är överstruken, med brickor där det står REFUSAL REMOVED, RESEARCH-ONLY och APACHE 2.0, samt ikoner för tolkningsbarhet, red-teaming och utvärdering av skyddsräcken.
Guides & Insights

Ocensurerad LLM, förklarad: Abliterationstekniken, forskningsanvändningen och gränsen du inte överskrider

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En ocensurerad LLM är en språkmodell vars vägransbeteende — den del av modellen som avböjer en begäran i stället för att svara på den — medvetet har tagits bort. De flesta byggs genom abliteration: en forskare hittar den enda interna riktningen som förmedlar vägran och raderar den från vikterna, vilket lämnar resten av modellen i stort sett intakt. Resultatet är en modell som svarar där en normal modell skulle säga nej, vilket är precis varför den studeras och precis varför den inte är avsedd för produktion. Vi släppte en sådan version, Qwen3.8-27B-Uncensored-FP8, en ablitererad och FP8-kvantiserad Qwen3.8 27B, till Hugging Face under Apache 2.0 som en artefakt enbart för forskning. Den här sidan är en förklaringssida för kategorin: vad dessa modeller är, forskningen som motiverar dem, hur man arbetar med dem säkert och var gränsen går.

En formulering håller hela kategorin ärlig, så låt mig säga det direkt: en ocensurerad modell är inte smartare, mer sanningsenlig eller mer kapabel än modellen den kommer ifrån. Det är samma vikter med ett beteende borttaget. Allt den fortfarande vet, har den alltid vetat – det som har förändrats är att den inte längre vägrar. Det gör den till ett genuint användbart objekt för säkerhetsforskning och en genuint osäker sak att driftsätta. Båda halvorna av den meningen är bärande, och resten av den här sidan förklarar båda.

Vad 'ocensurerad' egentligen betyder

• Eller nå det via vårt modellkort, som innehåller pris- och benchmarkdetaljer.

Tekniken kommer från ett tolkningsbarhetsfynd från 2024. I "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024) visade författarna att vägran i 13 öppna chattmodeller, från 1.8B till 72B parametrar, styrs av ungefär ett endimensionellt delrum i residualströmmen – det interna tillstånd som för information mellan lager. Tar man bort den riktningen slutar modellen att vägra; lägger man tillbaka den vägrar modellen även oskyldiga förfrågningar.

Abliteration operationaliserar detta fynd: uppskatta riktningen, ortogonalisera sedan bort den från de viktmatriser som skriver till residualströmmen. På vår egen build, Qwen3.8-27B-Uncensored-FP8, uppskattades vägransriktningen i ett enda lager och togs bort från 131 residualskrivande matriser, vilket lämnade visionstornet orört. Det som överlever är samma kunskap, samma resonemang och samma 262 144-tokens kontext – med vägran borttagen. Och för att vara exakt med etiketten: "uncensored" betyder inte anpassad eller säker. Det betyder att skyddet är av. Vi återkommer till vad det kräver av dig.

Forskningen som skapade dem

Vägransriktningsresultatet gjorde två saker samtidigt. Vetenskapligt förklarade det ett säkerhetsbeteende mekanistiskt: det finns en verklig, påvisbar krets som får en modell att säga nej. I praktiken visade det hur skör anpassningen kan vara — en enda rang-ett-redigering av vikterna kan stänga av beteendet, utan finjustering. Det är inte en brist i ett enda labbs modell; författarna reproducerade det i ett drygt dussin chattmodeller.

År 2026 har tekniken blivit en pipeline med ett enda kommando, vilket är ett tveeggat faktum. {{1}}Heretic, ett bibliotek med öppen källkod, skattar refuseringsriktningar per lager och ortogonaliserar bort dem från attention- och MLP-projektioner{{/1}}; en rapport från maj 2026 uppskattade borttagningen av skyddsräcken för Metas Llama 3.3 till cirka 10 minuter och Googles Gemma 4 till cirka 90 minuter, med fler än 3 500 derivatmodeller och över 13 miljoner kumulativa nedladdningar. {{2}}Abliterix (Wu Wangzhang) tar en mer försiktig väg: det extraherar en refuseringsriktning från 800 skadliga och 800 ofarliga prompts, tillämpar en ortogonal projektion, levererar redigeringen som rank-1 LoRA-adaptrar så att basvikterna förblir orörda, och rapporterar refuseringsgrad och KL-divergens så att kapacitetskostnaden förblir synlig{{/2}}. På en {{3}}0.8B Qwen3.5-modell rapporterade det 0 av 200 refuseringar på skadliga prompts{{/3}}.

Läs det stycket som en säkerhetsforskare skulle göra. Poängen med att bygga dessa verktyg är inte att vem som helst ska kunna ta bort en modells skyddsmekanismer för skojs skull. Poängen är att borttagandet är trivialt och offentligt – så att mäta det, studera hur det fungerar och bygga skyddsmekanismer som överlever det är i sig ett forskningsprogram. Det är red-teaming i white-box-bemärkelse: du kan inte försvara ett system förrän du vet hur lätt det är att bryta.

Varför ocensurerade modeller blev heta 2026

Tre krafter konvergerade. För det första, öppenviktsvågen: Qwen3.8 27B och dess gelikar levereras under tillåtande licenser, och abliteration kräver ingen träningskörning — du redigerar vikterna och kvantiserar om. För det andra mognade verktygen från forskningskod till enkommando-bibliotek, så en kompetent ingenjör kan producera en build på en eftermiddag. För det tredje blev Hugging Face distributionskanalen, vilket innebär att genomslagskraften är mätbar.

Vår egen datapunkt: Qwen3.8-27B-Uncensored-FP8, släppt den 15 augusti 2026, hade 257 gillamarkeringar och 4 285 nedladdningar inom ungefär en dag (verifierat den 16 augusti). Det är inte så att tiotusentals människor vill distribuera en oskyddad modell. Det är att många forskare och ingenjörer vill studera en — och nedladdningssiffrorna är efterfrågekurvan för den nyfikenheten.

Vad det är till för: de legitima forskningsanvändningarna

Här är den försvarbara listan, och det är hela listan. Om en användning inte finns på den, anta att den inte är legitim:

• Interpretabilitet — att studera vad vägrarkretsen faktiskt är, var den finns, och varför att ta bort en riktning förändrar beteendet.

• Red-teaming och utvärdering av skyddsräcken — bygga ett modereringslager och testa om det fångar upp vad en modell utan vägran producerar.

• Översäkerhetsmätning — kvantifiera hur ofta basmodeller avvisar godartade förfrågningar, och skilja det från verklig säkerhet.

• Robusthetsforskning — att mäta hur lätt anpassning kan tas bort, vilket är väsentlig information för alla som utformar säkerhetsfinjustering.

• Kontrollerade säkerhetsexperiment — benchmark-sviter som AdvBench och JailbreakBench finns just för att avvisningsbeteende ska kunna mätas på ett standardiserat, reproducerbart sätt.

A card titled The research that justifies them, showing three flat icons with short labels: a magnifier over a model layer labeled interpretability, a shield with a crosshair labeled red-teaming, and a checklist over a moderation layer labeled guardrail evaluation.

Alla dessa delar en egenskap: modellen är föremål för studien, inte leverabeln. Resultatet av denna forskning är en artikel, ett benchmarkresultat eller en bättre skyddsmekanism — aldrig en tjänst.

Hur man genomför en på ett ansvarsfullt sätt (om du faktiskt forskar)

Om du har en legitim anledning att arbeta med en ablitererad modell, är reglerna enkla:

• Kör det lokalt, i en sandlåda och helst utan nätverksanslutning. Ingen publik slutpunkt, ingen chattjänst, ingen delad server.

• Servera den med standardverktyg — vLLM eller llama.cpp — på samma sätt som du skulle göra med vilken öppen-viktsmodell som helst. Vår build är en block-FP8-kvantisering som körs på standardvLLM:s FP8-kärnväg med dess 262K-kontext, thinking-toggle och tool calling intakt.

• Mät, don't bara chatta. Kvantifiera vägran på en benchmark-svit med skadliga promptar och jämför med basmodellen; kvantifiera övervägran på benigna promptar; rapportera KL-divergens så att kapacitetsdrift blir synlig. Det är skillnaden mellan ett experiment och en anekdot.

A scoreboard card for Qwen3.8-27B-Uncensored-FP8, listing harmful-prompt refusal 0-6% with thinking off versus a 64-99% base, at most 1.7% with thinking on, benign over-refusal 0.4% versus a 5.6% base, MMLU 84.7 versus 84.3, GSM8K 88.7 versus 90.0, and 262,144-token context, with a footer reading orcarouter build card, Hugging Face, Aug 16 2026.

Förvara utdata i en kontrollerad miljö. Logga, granska och förstör snarare än att sprida vidare.

• Om du utvärderar dina egna skyddsräcken, placera ditt modereringslager framför modellen och testa det — det är hela poängen med övningen.

För det fullständiga specifikationsbladet, benchmarktabellen och hostingdetaljerna, öppna vårt modellkort — det är den kanoniska referensen för denna version.

Säkerhetsgränsen: vad "endast för forskning" innebär

Här är den del som inte kan framhållas nog ofta. En ablitererad modell har inga verkliga inbyggda skyddsmekanismer. Den kommer att följa förfrågningar som en vanlig modell vägrar. Det är funktionen, och det är också risken — vilket är anledningen till att varje seriös lansering av en sådan, inklusive vår, bär samma varningar.

• Inga inbyggda skyddsräcken. Vägrarbeteendet är borta; bete dig inte som om det inte är det.

• Inte för slutanvändare, inte för produktion. En produkt, en chatbot, ett API som betjänar allmänheten, ett internt verktyg som dina kollegor förlitar sig på — ingen av dessa är rätt plats för en ocensurerad modell.

• Ansvaret är ditt. Vi tillhandahåller Qwen3.8-27B-Uncensored-FP8 under Apache 2.0, som är tillåtande vad gäller vidaredistribution. En licens är inte ett säkerhetsintyg: tillåtande kod ändrar inte vad modellen kommer att göra, och den överför inte omsorgsplikten.

• Om du använder det, äger du resultaten. Den kontrollerade miljön är din uppgift; likaså att bestämma vad du ska och inte ska mata det med, och vad du gör med det som kommer ut.

A two-column boundary card titled The line you don't cross. The research side lists interpretability of refusal circuits, red-teaming and guardrail evaluation, oversafety measurement, robustness research and controlled safety experiments. The deployment side lists end-user chatbots, production APIs, unmoderated public service, internal tools for your team and anything with users on the other end, each marked with a cross. A footer reads No built-in guardrails, research only, and Apache 2.0 is not a safety certificate.

När en ocensurerad modell är det felaktiga svaret

Det tydligaste sättet att säga det: om det finns en person i andra änden av modellen, är en ocensurerad modell fel svar. Alla produkter som behöver vara pålitliga, alla assistenter vars omdöme spelar roll, allt där ett avslag är det korrekta beteendet — använd basmodellen istället. Anledningen till att Qwen3.8 27B finns i sin normala form är just att avslag är en funktion, inte en bugg, för nästan alla verkliga användningar. Den abliterade versionen finns för de smala forskningsfallen ovan och för ingenting annat.

Summan av kardemumman. En ocensurerad LLM är inte en produktkategori och den är inte ett hack. Det är en forskningsartefakt med en genuin vetenskaplig härstamning — från refusal-direction-fyndet till de automatiserade verktygen från 2026 — och en hård driftsättningsgräns. Modellerna är verkliga, efterfrågan är mätbar, och de legitima användningsområdena är också verkliga: tolkningsbarhet, red-teaming, guardrail-utvärdering och kontrollerade säkerhetsexperiment. Linjen mellan att studera skyddet och att stänga av skyddet för någon annan är hela poängen med den här sidan, och den flyttar sig inte.

Denna exakta build är offentlig under Apache 2.0 — endast för forskning. Du kan ladda ner vikterna på Hugging Face

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube