Ett titelkort för en Qwen3.8-27B-Uncensored benchmark-rapport, som visar en avvisningsgradmätare som kollapsar från 99 procent i rött på en panel märkt Base till 0 procent i grönt på en panel märkt Uncensored, med en överstruken sköldikon på den högra panelen och en horisontell linje under som anger kapacitet inom plus eller minus 1,3 poäng.
Guides & Insights

Qwen3.8-27B-Uncensored Riktmärken: Vägran kollapsar, förmågan består

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Benchmarkhistorien om Qwen3.8 27B Uncensored (Aggressive) — det ablitererade bygget av Qwen3.8 27B släppt som en FP8-checkpoint den 15 augusti 2026 och ett GGUF-bygge den 16 augusti — är inte att den blev starkare. Det är att den slutade vägra. Modellkortet rapporterar att vägran vid skadliga prompts kollapsar från 64–99 % på basmodellen till 0–6 % på det ablitererade bygget med tänkande avstängt, och till eller under 1,7 % med tänkande påslaget, medan varje kapacitetsriktmärke landar inom ±1,3 poäng från basmodellen och WikiText-2-perplexiteten ligger på 6,96. Om du är här för qwen uncensored-riktmärkena är det de viktigaste siffrorna: det är inte en smartare modell, det är en modell som inte vägrar.

Den skillnaden spelar roll, eftersom det mesta som hamnar på "ocensurerade benchmarks" antingen är en tunn listartikel med kapacitetspoäng eller ett hype-inlägg som hävdar att modellen är "bättre". Inget av detta är vad abliteration gör. Den här artikeln går igenom de faktiska mätdata — refusal collapse, övervägran, förmågebevarande och perplexitet — metoden som producerade dem, och säkerhetsgränsen du bör läsa innan du rör vikterna.

Vad en ocensurerad benchmark-översikt faktiskt mäter

En vanlig modellrecension rapporterar en axel: kapacitet — MMLU, GSM8K, kodning, resonemang. En ablitererad modell är intressant på en annan axel, och hela poängen med etiketten "ocensurerad" är att säkerhetsaxeln har flyttats. Så den användbara frågan för Qwen3.8-27B-Uncensored-FP8 är inte "är den smartare?" utan "vad kostade det att ta bort vägransmekanismen, och hur fullständigt togs den bort?"

Tre familjer av siffror måste läsas tillsammans. Avvisningsfrekvens på benchmarks med skadliga uppmaningar — hur ofta modellen avvisar; ju högre bas, desto mer synlig är borttagningen. Överavvisande på godartade uppmaningar — hur ofta den felaktigt avvisar en oskyldig begäran; lägre är bättre för alla. Och förmågebevarande — huruvida redigeringen försämrade modellen. En benchmarksammanfattning som bara skriver ut förmågepoäng svarar på fel fråga.

Metoden: abliteration är en viktredigering, inte en finjustering.

Vad som skiljer abliteration från communityns "jailbreak"-paket är var förändringen sker. En jailbreak på promptnivå omsluter indata; abliteration ändrar vikterna. Metoden här är Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". Kärnslutsatsen är att vägrarbeteende i många modeller drivs av en enda riktning i residualströmmen — uppskatta den riktningen, ta bort den, och modellen slutar vägra utan att omskolas.

Konkret beskriver kortet hur en vägransriktning skattas från den massiv-aktiveringsmaskerade medelskillnaden mellan skadliga och ofarliga sista-token-residualer vid lager 38 (round(0.6 × 64)), med AdvBench som det skadliga datasetet och Alpaca som det ofarliga datasetet. Redigeringen är en ortogonalisering, W′ = W − r(rᵀW), beräknad i float32 och tillämpad på 131 residualskrivande matriser — attention-utmatningsprojektionerna, linear-attention-utmatningsprojektionerna, MLP-nedprojektionerna och ett embedding-radrum. Inget träningssteg körs; visionstornet lämnas orört; MTP:s spekulativa avkodningshuvud ablitereras konsekvent. Det är därför förmågan överlever: att ta bort en riktning är ett långt skonsammare ingrepp än att finjustera modellen till medgörlighet.

Vägran rasar samman: siffrorna

Uppmätt på det vLLM-betjänade FP8-bygget och publicerat på Hugging Face-modellkortet (2026-08-15), sjunker vägran på benchmarks med skadliga uppmaningar från 64–99% på basmodellen till 0–6% på det ocensurerade bygget med tänkande avstängt:

• AdvBench — 99.0% → 0.0%

• JailbreakBench (skadligt) — 94.0% → 0.0%

• StrongREJECT — 97,3% → 2,0%

• HarmBench (standard) — 98.7% → 2.7%

• MaliciousInstruct — 99.0% → 0.0%

• SimpleSafetyTests — 64.0% → 6.0%

• ForbiddenQuestions — 73.3% → 4.7%

Med tankeförmågan aktiverad är vägran i princip aldrig förekommande — 1,7 % på AdvBench och 0,0 % på det mesta av det övriga. Kortet lägger till en ärlig brasklapp: 30–50 % av svaren inleds fortfarande med en kort ansvarsfriskrivning. Det är en träningsartefakt, inte en vägran — modellen svarar, men garderar sin inledning. Det upplevs som friktion, inte säkerhet.

A two-column scoreboard comparing harmful-prompt refusal rates for the base Qwen3.8 27B versus the abliterated Qwen3.8-27B-Uncensored build across seven benchmarks, the base column reading 99.0, 94.0, 97.3, 98.7, 99.0, 64.0 and 73.3 percent and the uncensored column reading 0.0, 0.0, 2.0, 2.7, 0.0, 6.0 and 4.7 percent, with a footer noting the data is from the Hugging Face model card, measured on the vLLM-served FP8 build, 2026-08-15.

Övervägran faller också

Det mindre uppmärksammade talet sitter på andra sidan säkerhetsaxeln. På XSTest-safe — 250 välartade prompts som anpassade modeller ibland avvisar av misstag — överavvisar basmodellen 5,6 % av gångerna. Den ocensurerade versionen överavvisar 0,4 %. Att ta bort avvisningsriktningen hindrar inte bara modellen från att avvisa skadliga förfrågningar; det hindrar den också från att avvisa ofarliga sådana som den tidigare flaggade genom övergeneralisering. För den som bygger utvärderings- eller red-team-verktyg där en avvisningsfri baslinje är poängen, är detta en verklig förbättring av verktyget, inte en bieffekt att be om ursäkt för.

Förmågan bevaras, inte förbättras.

Det är här som idén om "ocensurerad = starkare" dör. Modellkortet rapporterar den abliterated FP8-versionen mot den officiella bas-FP8:en med samma skript och inställningar:

• MMLU (0-shot) — 84.3% → 84.7%

• GSM8K (CoT) — 90,0% → 88,7%

• MMLU-Pro (CoT) — 77.6% → 76.8%

• CMMLU (0-shot, kinesiska) — 81.4% → 80.8%

Varje poäng hamnar inom ±1,3 poäng från baslinjen, och råperplexiteten för WikiText-2 landar på 6,96 — kortets bevis på att språkmodelleringen i sig inte har försämrats. Den ärliga tolkningen: abliteration är nära kapacitetsneutral på denna arkitektur. Du får inte en bättre modell; du får samma modell utan vägransbeteendet.

A scoreboard for the Qwen3.8-27B-Uncensored capability retention results: MMLU 84.3 to 84.7, GSM8K 90.0 to 88.7, MMLU-Pro 77.6 to 76.8, CMMLU 81.4 to 80.8, every score within plus or minus 1.3 points of the base, with a highlight panel showing WikiText-2 perplexity 6.96 and over-refusal on XSTest-safe falling from 5.6 percent to 0.4 percent, and a footer noting the source is the Hugging Face model card, measured on the vLLM-served FP8 build.

Samma varning gäller för det bredare ekosystemet: påståenden om "förlustfri ocensurerad" på communitybyggen förtjänar att läsas skeptiskt. En jämförelse mellan tre metoder på ett 4B open-weight-bygge på Hugging Face visade att tekniken som påstods vara förlustfri faktiskt sänkte TruthfulQA med cirka 7 poäng och Lambada med cirka 4, medan dess HarmBench-attackfrekvens nådde 100 %; de andra två metoderna låg på 99,2 % och 95,5 %. Och ett aggressivt försök på ett annat bygge uppnådde noll vägran men producerade osammanhängande ordsallad, så den levererade versionen gick tillbaka till mildare per-lager-parametrar. Abliteration-resultat är metodspecifika – dessa siffror är specifikt FP8-byggets kortdata.

Vad kortet inte påstår

Läs metodiken innan du citerar siffrorna. Kortet etiketterar sitt vägrarmått som "indikativt, inte ett LLM-domar-/publikationskvalitetstal": vägran bedömdes av en regelbaserad klassificerare av inledningsfraser, med en separat "caveat"-bucket för svar som följde instruktionen men inledde med en ansvarsfriskrivning. Benchmarkarna är textbaserade och kördes mot det vLLM-serverade FP8-bygget med endast språkmodellen, och kapacitetssviten använde standardutvärderingsskript. Rätt sätt att se det: detta är leverantörens egna mätdata, reproducerbart från det publicerade kortet — inte en oberoende tredjepartskörning och inte ett påstående om GGUF-bygget, som levereras kvantiserat för llama.cpp och bör utvärderas separat.

Säkerhetsgränsen

Detta är den del som inte kan kringgås. En abliterad modell har fått sin vägrarmekanism i stort sett borttagen. Konkret: den kommer att följa skadliga, oetiska eller olagliga förfrågningar som basmodellen Qwen3.8 27B skulle vägra, och den har inga meningsfulla inbyggda skyddsräcken. De legitima användningsområdena är forskning – interpretabilitet (att studera hur vägrardirektiv kodas), AI-säkerhet och studier av vägrarmekanismer, red-teaming (att testa modeller med indata som försöker kringgå deras skyddsräcken) samt robusthetsutvärdering. Den släpps under Apache 2.0-licensen, ärvd från basmodellen, strikt som ett forskningsartefakt. Du tar fullt ansvar och är fullt ansvarig för hur du använder den och för allt den genererar. Distribuera den inte till slutanvändare eller i produktion utan egna säkerhets-, modererings- och missbruksförebyggande lager – och för all produktions- eller konsumentinriktad användning är standardmodellen Qwen3.8 27B den modell du faktiskt vill ha.

När ett ocensurerat riktmärke är fel sak att slå upp

Om din fråga är "vilken modell är starkast på matematik eller kodning?", läser du fel siffror — den ocensurerade versionen är ingen kapacitetsuppgradering. Om din applikation behöver avvisa skadliga förfrågningar är den här modellen raka motsatsen till vad du vill ha. Om du lanserar en produkt, bygg inte på en "abliterated" checkpoint. Och om det du egentligen är ute efter är en jailbreak, är det något helt annat — prompt-baserade paket ligger utanför den viktintervention som diskuteras här och är inte ämnet för denna artikel. Benchmarkdatan i den här texten finns för en enda snäv, legitim fråga: vad borttagandet av vägran gör med en Qwen3.8 27B, mätt.

Hur du kommer åt det

Båda byggen finns på Hugging Face under Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, cirka 30,9 GB vikter, som serveras på standardvägen för vLLM FP8-kärnor med 262K kontext, verktyg, tänkande och MTP intakta) och orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 plus 12 kvantiseringsnivåer för llama.cpp, med Q4_K_M på 16,8 GB som rekommenderad standard för en 24 GB GPU). Detta modellkort på OrcaRouter har prissättningen och benchmarkdetaljerna — det ocensurerade bygget är listat där som obsidian/Qwen3.8-27B till 0,40 USD per miljon input och 4,21 USD per miljon output-tokens, med 262K kontext, och åtkomst är begränsad till säkerhetsforskare, red teams och AI-säkerhetsforskare.

The OrcaRouter model page for obsidian Qwen3.8-27B, showing the uncensored build's 0.40 USD per million input and 4.21 USD per million output pricing, a 262K token context window, a released August 15 2026 label, and the researcher-access gating note.

Slutsatsen

De ocensurerade Qwen-riktmärkena besvarar en snäv fråga, och svaret är tydligt: att ta bort vägran från Qwen3.8 27B via abliteration lämnar kapaciteten inom ±1,3 poäng medan vägran på skadliga uppmaningar kollapsar från 64–99% till 0–6%, övervägran sjunker från 5,6% till 0,4%, och perplexiteten håller sig på 6,96. Läs dessa siffror som "vägrar inte", aldrig som "starkare". För tolkningsbarhet, säkerhet och red-team-forskning är det exakt det verktyg som modellkortet beskriver. För allt som möter en användare är det fel modell per konstruktion.

För legitim forskningsanvändning finns vikterna på Hugging Face under Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (GGUF-bygget för llama.cpp finns på orcarouter/Qwen3.8-27B-Uncensored-GGUF).

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube