
Qwen3.8-27B-Uncensored Riktmärken: Vägran kollapsar, förmågan består
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Benchmarkhistorien om Qwen3.8 27B Uncensored (Aggressive) — det ablitererade bygget av Qwen3.8 27B släppt som en FP8-checkpoint den 15 augusti 2026 och ett GGUF-bygge den 16 augusti — är inte att den blev starkare. Det är att den slutade vägra. Modellkortet rapporterar att vägran vid skadliga prompts kollapsar från 64–99 % på basmodellen till 0–6 % på det ablitererade bygget med tänkande avstängt, och till eller under 1,7 % med tänkande påslaget, medan varje kapacitetsriktmärke landar inom ±1,3 poäng från basmodellen och WikiText-2-perplexiteten ligger på 6,96. Om du är här för qwen uncensored-riktmärkena är det de viktigaste siffrorna: det är inte en smartare modell, det är en modell som inte vägrar.
Den skillnaden spelar roll, eftersom det mesta som hamnar på "ocensurerade benchmarks" antingen är en tunn listartikel med kapacitetspoäng eller ett hype-inlägg som hävdar att modellen är "bättre". Inget av detta är vad abliteration gör. Den här artikeln går igenom de faktiska mätdata — refusal collapse, övervägran, förmågebevarande och perplexitet — metoden som producerade dem, och säkerhetsgränsen du bör läsa innan du rör vikterna.
Vad en ocensurerad benchmark-översikt faktiskt mäter
En vanlig modellrecension rapporterar en axel: kapacitet — MMLU, GSM8K, kodning, resonemang. En ablitererad modell är intressant på en annan axel, och hela poängen med etiketten "ocensurerad" är att säkerhetsaxeln har flyttats. Så den användbara frågan för Qwen3.8-27B-Uncensored-FP8 är inte "är den smartare?" utan "vad kostade det att ta bort vägransmekanismen, och hur fullständigt togs den bort?"
Tre familjer av siffror måste läsas tillsammans. Avvisningsfrekvens på benchmarks med skadliga uppmaningar — hur ofta modellen avvisar; ju högre bas, desto mer synlig är borttagningen. Överavvisande på godartade uppmaningar — hur ofta den felaktigt avvisar en oskyldig begäran; lägre är bättre för alla. Och förmågebevarande — huruvida redigeringen försämrade modellen. En benchmarksammanfattning som bara skriver ut förmågepoäng svarar på fel fråga.
Metoden: abliteration är en viktredigering, inte en finjustering.
Vad som skiljer abliteration från communityns "jailbreak"-paket är var förändringen sker. En jailbreak på promptnivå omsluter indata; abliteration ändrar vikterna. Metoden här är Arditi et al. (2024), "Refusal in Language Models Is Mediated by a Single Direction". Kärnslutsatsen är att vägrarbeteende i många modeller drivs av en enda riktning i residualströmmen — uppskatta den riktningen, ta bort den, och modellen slutar vägra utan att omskolas.
Konkret beskriver kortet hur en vägransriktning skattas från den massiv-aktiveringsmaskerade medelskillnaden mellan skadliga och ofarliga sista-token-residualer vid lager 38 (round(0.6 × 64)), med AdvBench som det skadliga datasetet och Alpaca som det ofarliga datasetet. Redigeringen är en ortogonalisering, W′ = W − r(rᵀW), beräknad i float32 och tillämpad på 131 residualskrivande matriser — attention-utmatningsprojektionerna, linear-attention-utmatningsprojektionerna, MLP-nedprojektionerna och ett embedding-radrum. Inget träningssteg körs; visionstornet lämnas orört; MTP:s spekulativa avkodningshuvud ablitereras konsekvent. Det är därför förmågan överlever: att ta bort en riktning är ett långt skonsammare ingrepp än att finjustera modellen till medgörlighet.
Vägran rasar samman: siffrorna
Uppmätt på det vLLM-betjänade FP8-bygget och publicerat på Hugging Face-modellkortet (2026-08-15), sjunker vägran på benchmarks med skadliga uppmaningar från 64–99% på basmodellen till 0–6% på det ocensurerade bygget med tänkande avstängt:
• AdvBench — 99.0% → 0.0%
• JailbreakBench (skadligt) — 94.0% → 0.0%
• StrongREJECT — 97,3% → 2,0%
• HarmBench (standard) — 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
Med tankeförmågan aktiverad är vägran i princip aldrig förekommande — 1,7 % på AdvBench och 0,0 % på det mesta av det övriga. Kortet lägger till en ärlig brasklapp: 30–50 % av svaren inleds fortfarande med en kort ansvarsfriskrivning. Det är en träningsartefakt, inte en vägran — modellen svarar, men garderar sin inledning. Det upplevs som friktion, inte säkerhet.

Övervägran faller också
Det mindre uppmärksammade talet sitter på andra sidan säkerhetsaxeln. På XSTest-safe — 250 välartade prompts som anpassade modeller ibland avvisar av misstag — överavvisar basmodellen 5,6 % av gångerna. Den ocensurerade versionen överavvisar 0,4 %. Att ta bort avvisningsriktningen hindrar inte bara modellen från att avvisa skadliga förfrågningar; det hindrar den också från att avvisa ofarliga sådana som den tidigare flaggade genom övergeneralisering. För den som bygger utvärderings- eller red-team-verktyg där en avvisningsfri baslinje är poängen, är detta en verklig förbättring av verktyget, inte en bieffekt att be om ursäkt för.
Förmågan bevaras, inte förbättras.
Det är här som idén om "ocensurerad = starkare" dör. Modellkortet rapporterar den abliterated FP8-versionen mot den officiella bas-FP8:en med samma skript och inställningar:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90,0% → 88,7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, kinesiska) — 81.4% → 80.8%
Varje poäng hamnar inom ±1,3 poäng från baslinjen, och råperplexiteten för WikiText-2 landar på 6,96 — kortets bevis på att språkmodelleringen i sig inte har försämrats. Den ärliga tolkningen: abliteration är nära kapacitetsneutral på denna arkitektur. Du får inte en bättre modell; du får samma modell utan vägransbeteendet.

Samma varning gäller för det bredare ekosystemet: påståenden om "förlustfri ocensurerad" på communitybyggen förtjänar att läsas skeptiskt. En jämförelse mellan tre metoder på ett 4B open-weight-bygge på Hugging Face visade att tekniken som påstods vara förlustfri faktiskt sänkte TruthfulQA med cirka 7 poäng och Lambada med cirka 4, medan dess HarmBench-attackfrekvens nådde 100 %; de andra två metoderna låg på 99,2 % och 95,5 %. Och ett aggressivt försök på ett annat bygge uppnådde noll vägran men producerade osammanhängande ordsallad, så den levererade versionen gick tillbaka till mildare per-lager-parametrar. Abliteration-resultat är metodspecifika – dessa siffror är specifikt FP8-byggets kortdata.
Vad kortet inte påstår
Läs metodiken innan du citerar siffrorna. Kortet etiketterar sitt vägrarmått som "indikativt, inte ett LLM-domar-/publikationskvalitetstal": vägran bedömdes av en regelbaserad klassificerare av inledningsfraser, med en separat "caveat"-bucket för svar som följde instruktionen men inledde med en ansvarsfriskrivning. Benchmarkarna är textbaserade och kördes mot det vLLM-serverade FP8-bygget med endast språkmodellen, och kapacitetssviten använde standardutvärderingsskript. Rätt sätt att se det: detta är leverantörens egna mätdata, reproducerbart från det publicerade kortet — inte en oberoende tredjepartskörning och inte ett påstående om GGUF-bygget, som levereras kvantiserat för llama.cpp och bör utvärderas separat.
Säkerhetsgränsen
Detta är den del som inte kan kringgås. En abliterad modell har fått sin vägrarmekanism i stort sett borttagen. Konkret: den kommer att följa skadliga, oetiska eller olagliga förfrågningar som basmodellen Qwen3.8 27B skulle vägra, och den har inga meningsfulla inbyggda skyddsräcken. De legitima användningsområdena är forskning – interpretabilitet (att studera hur vägrardirektiv kodas), AI-säkerhet och studier av vägrarmekanismer, red-teaming (att testa modeller med indata som försöker kringgå deras skyddsräcken) samt robusthetsutvärdering. Den släpps under Apache 2.0-licensen, ärvd från basmodellen, strikt som ett forskningsartefakt. Du tar fullt ansvar och är fullt ansvarig för hur du använder den och för allt den genererar. Distribuera den inte till slutanvändare eller i produktion utan egna säkerhets-, modererings- och missbruksförebyggande lager – och för all produktions- eller konsumentinriktad användning är standardmodellen Qwen3.8 27B den modell du faktiskt vill ha.
När ett ocensurerat riktmärke är fel sak att slå upp
Om din fråga är "vilken modell är starkast på matematik eller kodning?", läser du fel siffror — den ocensurerade versionen är ingen kapacitetsuppgradering. Om din applikation behöver avvisa skadliga förfrågningar är den här modellen raka motsatsen till vad du vill ha. Om du lanserar en produkt, bygg inte på en "abliterated" checkpoint. Och om det du egentligen är ute efter är en jailbreak, är det något helt annat — prompt-baserade paket ligger utanför den viktintervention som diskuteras här och är inte ämnet för denna artikel. Benchmarkdatan i den här texten finns för en enda snäv, legitim fråga: vad borttagandet av vägran gör med en Qwen3.8 27B, mätt.
Hur du kommer åt det
Båda byggen finns på Hugging Face under Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, cirka 30,9 GB vikter, som serveras på standardvägen för vLLM FP8-kärnor med 262K kontext, verktyg, tänkande och MTP intakta) och orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 plus 12 kvantiseringsnivåer för llama.cpp, med Q4_K_M på 16,8 GB som rekommenderad standard för en 24 GB GPU). Detta modellkort på OrcaRouter har prissättningen och benchmarkdetaljerna — det ocensurerade bygget är listat där som obsidian/Qwen3.8-27B till 0,40 USD per miljon input och 4,21 USD per miljon output-tokens, med 262K kontext, och åtkomst är begränsad till säkerhetsforskare, red teams och AI-säkerhetsforskare.

Slutsatsen
De ocensurerade Qwen-riktmärkena besvarar en snäv fråga, och svaret är tydligt: att ta bort vägran från Qwen3.8 27B via abliteration lämnar kapaciteten inom ±1,3 poäng medan vägran på skadliga uppmaningar kollapsar från 64–99% till 0–6%, övervägran sjunker från 5,6% till 0,4%, och perplexiteten håller sig på 6,96. Läs dessa siffror som "vägrar inte", aldrig som "starkare". För tolkningsbarhet, säkerhet och red-team-forskning är det exakt det verktyg som modellkortet beskriver. För allt som möter en användare är det fel modell per konstruktion.
För legitim forskningsanvändning finns vikterna på Hugging Face under Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (GGUF-bygget för llama.cpp finns på orcarouter/Qwen3.8-27B-Uncensored-GGUF).
