
Qwen3.8-27B-Uncensored 벤치마크: 거부 반응 붕괴, 성능 유지
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
The benchmark story of Qwen3.8 27B Uncensored (Aggressive) — the abliterated build of Qwen3.8 27B released as an FP8 checkpoint on August 15, 2026 and a GGUF build on August 16 — is not that it got stronger. It is that it stopped refusing. The model card reports harmful-prompt refusal collapsing from 64–99% on the base to 0–6% on the abliterated build with thinking off, and at or below 1.7% with thinking on, while every capability benchmark lands within ±1.3 points of the base and WikiText-2 perplexity sits at 6.96. If you are here for the qwen uncensored benchmarks, those are the headline numbers: it is not a smarter model, it is a non-refusing one.
그 구분이 중요한 이유는, "검열되지 않은 벤치마크"에서 높은 순위를 차지하는 대부분의 결과물이 성능 점수의 빈약한 목록형 글이거나 모델이 "더 낫다"고 주장하는 홍보성 게시물이기 때문이다. abliteration이 하는 일은 그 어느 쪽도 아니다. 이 글은 실제 측정된 데이터(거부 붕괴, 과잉 거부, 능력 유지, 퍼플렉시티), 그 데이터를 만들어낸 방법, 그리고 가중치를 건드리기 전에 반드시 읽어야 할 안전 경계를 살펴본다.
검열되지 않은 벤치마크 라운드업이 실제로 측정하는 것
일반적인 모델 리뷰는 하나의 축을 다룹니다: 능력 — MMLU, GSM8K, 코딩, 추론. Abliterated 모델은 다른 축에서 흥미롭고, "검열되지 않은"이라는 라벨의 핵심은 안전 축이 이동했다는 것입니다. 그래서 유용한 질문은 다음과 같습니다: Qwen3.8-27B-Uncensored-FP8에게는 "더 똑똑한가?"가 아니라 "거부 메커니즘을 제거하는 데 드는 비용이 무엇이며, 얼마나 철저히 제거되었는가?"입니다.
세 가지 숫자 계열은 함께 읽어야 합니다. 유해 프롬프트 벤치마크에서의 거부율 — 모델이 거부하는 빈도; 기준이 높을수록 제거 효과가 더 두드러집니다. 무해한 프롬프트에 대한 과잉 거부 — 무고한 요청을 잘못 거부하는 빈도; 낮을수록 모두에게 좋습니다. 그리고 능력 유지 — 편집이 모델을 저하시켰는지 여부. 능력 점수만 출력하는 벤치마크 요약은 잘못된 질문에 답하고 있는 것입니다.
abliteration이라는 방법은 파인튜닝이 아닌 가중치 편집입니다.
abliteration과 커뮤니티 '탈옥' 팩을 구분하는 것은 변경이 일어나는 위치입니다. 프롬프트 수준의 탈옥은 입력을 감싸고, abliteration은 가중치를 수정합니다. 여기서 사용하는 방법은 Arditi et al. (2024)의 "언어 모델의 거부 반응은 단일 방향에 의해 매개된다"입니다. 핵심 발견은 많은 모델에서 거부 행동이 잔차 스트림의 단일 방향에 의해 발생한다는 것입니다. 그 방향을 추정하여 제거하면 모델을 재학습하지 않아도 거부를 중단하게 됩니다.
구체적으로, 해당 카드는 massive-activation-masked(대규모 활성화 마스킹) 평균 차이, 즉 레이어 38(round(0.6 × 64))에서 유해 마지막 토큰 잔차에서 무해 마지막 토큰 잔차를 뺀 값으로부터 하나의 거부 방향을 추정한다고 설명하며, 이때 유해 세트로는 AdvBench를, 무해 세트로는 Alpaca를 사용합니다. 편집은 직교화(orthogonalization), 즉 W′ = W − r(rᵀW)이며, float32로 계산되어 131개의 잔차 기록 행렬 — attention 출력 projection, linear-attention 출력 projection, MLP 하향 projection, 그리고 하나의 임베딩 행 공간 — 에 적용됩니다. 훈련 단계는 실행되지 않으며, 비전 타워는 그대로 두고, MTP 추측 디코딩 헤드도 일관되게 abliterate 처리됩니다. 이것이 능력이 유지되는 이유입니다. 방향을 제거하는 것은 모델을 순응하도록 미세 조정하는 것보다 훨씬 더 부드러운 개입이기 때문입니다.
거부가 무너진다: 그 숫자들
vLLM으로 서빙되는 FP8 빌드에서 측정되고 Hugging Face 모델 카드(2026-08-15)에 게시된 바에 따르면, {{1}}유해 프롬프트 벤치마크에 대한 거부율은 기본 빌드의 64–99%에서 검열 해제 빌드의 0–6%로 떨어집니다{{/1}} (thinking을 끈 상태에서):
• AdvBench — 99.0% → 0.0%
• JailbreakBench (유해) — 94.0% → 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (표준) — 98.7% → 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
thinking을 활성화하면 거부는 사실상 발생하지 않습니다. AdvBench에서 1.7%, 나머지 대부분에서는 0.0%입니다. 카드에는 정직한 주의사항이 하나 더해집니다. 답변의 30~50%는 여전히 짧은 면책 문구를 앞에 붙입니다. 이는 훈련 부산물이지 거부가 아닙니다. 모델은 답변을 하지만 서두를 얼버무립니다. 이는 안전 장치가 아니라 마찰로 읽힙니다.

과도한 거절도 실패입니다.
덜 알려진 수치는 안전 축의 반대편에 있다. XSTest-safe — 정렬된 모델들이 실수로 거절하기도 하는 250개의 무해한 프롬프트 — 에서 기본 모델은 5.6%의 확률로 과도하게 거절한다. 무검열 빌드는 0.4%만 과도하게 거절한다. 거절 방향을 제거하면 모델이 유해한 요청을 거절하지 않게 될 뿐만 아니라, 과일반화로 인해 이전에 거절했던 무해한 요청들도 거절하지 않게 된다. 거절이 없는 기준선이 핵심인 평가 또는 레드팀 도구를 구축하는 사람들에게 이는 사과해야 할 부작용이 아니라 도구의 실질적인 개선이다.
능력은 향상되는 것이 아니라 보존된다.
이것이 "검열되지 않음 = 더 강함"이라는 프레임이 죽는 지점이다. 모델 카드는 동일한 스크립트와 설정으로 공식 기본 FP8과 대비하여 abliterated FP8 빌드를 보고한다:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot, 중국어) — 81.4% → 80.8%
모든 점수는 기준치 대비 ±1.3점 이내에 들어오며, WikiText-2 raw perplexity는 6.96을 기록했다 — 언어 모델링 자체가 저하되지 않았음을 보여주는 카드의 증거다. 솔직히 말하자면: {{1}}abliteration은 이 아키텍처에서 성능 중립에 가깝다{{/1}}. 더 나은 모델을 얻는 것이 아니라, {{2}}거부 행동이 없는{{/2}} 동일한 모델을 얻는 것이다.

동일한 경고는 더 넓은 생태계에도 적용됩니다. 커뮤니티 빌드의 "무손실 무검열" 주장은 회의적으로 읽을 필요가 있습니다. Hugging Face의 4B 오픈 가중치 빌드에 대한 3자 비교에서 무손실을 주장한 기법은 실제로 TruthfulQA를 약 7포인트, Lambada를 약 4포인트 하락시켰으며, HarmBench 공격 성공률은 100%에 달했습니다. 다른 두 방법은 각각 99.2%와 95.5%를 기록했습니다. 또한 다른 빌드에서 시도된 공격적인 실험은 거부 응답이 전혀 없었지만 비문법적인 단어 샐러드를 생성했기 때문에, 출시 버전은 보다 온화한 레이어별 파라미터로 후퇴했습니다. Abliteration 결과는 방법별로 다릅니다. 이 수치는 구체적으로 FP8 빌드의 카드 데이터입니다.
카드가 주장하지 않는 것
숫자를 인용하기 전에 방법론을 읽으십시오. 카드는 거부 측정치를 '참고용이며, LLM 판정자/게재 수준의 숫자가 아님'으로 표시합니다. 거부는 규칙 기반 시작 문구 분류기로 판정되었으며, 준수했지만 면책 조항을 앞에 덧붙인 답변을 위한 별도의 '주의사항' 버킷이 있습니다. 벤치마크는 텍스트 전용이며, 언어 모델만으로 vLLM이 서빙하는 FP8 빌드를 대상으로 실행되었고, 능력 평가 제품군은 표준 평가 스크립트를 사용했습니다. 올바르게 이해하자면: 이는 게시된 카드에서 재현할 수 있는 공급업체 자체 측정 데이터이며, 독립적인 제3자 실행이 아니고, llama.cpp용으로 양자화되어 제공되는 GGUF 빌드에 대한 주장도 아닙니다. GGUF 빌드는 별도로 평가해야 합니다.
안전 경계
이 부분은 얼버무릴 수 없습니다. abliteration된 모델은 거부 메커니즘이 상당 부분 제거되었습니다. 구체적으로 말하면, 기본 모델인 Qwen3.8 27B가 거부했을 유해하거나 비윤리적이거나 불법적인 요청에도 응할 것이며, 의미 있는 내장 가드레일이 없습니다. 정당한 용도는 연구입니다 — 즉, 해석 가능성(거부 방향이 어떻게 인코딩되는지 연구하는 것), AI 안전성 및 거부 메커니즘 연구, 레드티밍(가드레일을 우회하려는 입력으로 모델을 시험하는 것), 그리고 견고성 평가 등입니다. 이 모델은 기본 모델로부터 상속받은 Apache 2.0 라이선스 하에, 순전히 연구용 산출물로서만 배포됩니다. 사용자는 이 모델의 사용 방식과 이 모델이 생성하는 모든 것에 대해 전적인 책임과 법적 책임을 부담합니다. 자체적인 안전, 모더레이션, 악용 방지 계층을 갖추지 않은 채로는 이 모델을 최종 사용자에게 배포하거나 프로덕션에 투입하지 마십시오 — 프로덕션 또는 소비자 대상 사용에는 표준 Qwen3.8 27B가 바로 여러분이 실제로 원하는 모델입니다.
검열되지 않은 벤치마크가 찾아보기엔 잘못된 것일 때
"어떤 모델이 수학이나 코딩에서 가장 강한가?"라는 질문을 하고 있다면, 당신은 잘못된 숫자를 보고 있는 것입니다 — 검열 해제 빌드는 성능 업그레이드가 아닙니다. 애플리케이션이 유해한 요청을 거부해야 한다면, 이 모델은 당신이 원하는 것의 정반대입니다. 제품을 출시하려는 경우, abliterated 체크포인트 위에 구축하지 마십시오. 그리고 실제로 원하는 것이 탈옥(jailbreak)이라면, 그것은 완전히 다른 것입니다 — 프롬프트 수준 패키지는 여기서 논의되는 가중치 수준 개입의 범위 밖에 있으며 이 글의 주제가 아닙니다. 이 글의 벤치마크 데이터는 하나의 좁고 정당한 질문에 답하기 위해 존재합니다: 거부 기능을 제거하는 것이 Qwen3.8 27B에 어떤 영향을 미치는지, 측정된 결과로 말입니다.
그것에 접근하는 방법
두 빌드 모두 Apache 2.0 라이선스로 Hugging Face에 있습니다: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3, 가중치 약 30.9GB, 표준 vLLM FP8 커널 경로에서 262K 컨텍스트, 도구, 추론, MTP가 그대로 유지된 채 서빙됨) 및 orcarouter/Qwen3.8-27B-Uncensored-GGUF (llama.cpp용 F16 및 12가지 양자화 등급, 24GB GPU에는 16.8GB의 Q4_K_M이 권장 기본값). 모델 카드(OrcaRouter)에는 가격 및 벤치마크 세부 정보가 있습니다 — uncensored 빌드는 obsidian/Qwen3.8-27B로 등재되어 있으며, 입력 토큰 100만 개당 $0.40, 출력 토큰 100만 개당 $4.21, 262K 컨텍스트를 제공하고, 접근은 보안 연구자, 레드팀, AI 안전 연구자로 제한됩니다.

요점
qwen 검열 해제 벤치마크는 좁은 질문에 답하며, 그 답은 명확합니다: abliteration을 통해 Qwen3.8 27B에서 거부를 제거하면 성능은 ±1.3포인트 이내로 유지되는 반면, 유해 프롬프트에 대한 거부율은 64–99%에서 0–6%로 붕괴하고, 과잉 거부는 5.6%에서 0.4%로 떨어지며, 퍼플렉시티는 6.96으로 유지됩니다. 이 수치를 "거부하지 않는다"로 읽어야지, "더 강력하다"로 절대 읽지 마십시오. 해석 가능성, 안전성, 레드팀 연구를 위해서는 이것이 바로 모델 카드가 설명하는 도구입니다. 사용자를 마주하는 어떤 용도로든, 이는 구조적으로 잘못된 모델입니다.
정당한 연구 목적을 위해, 모델 가중치는 Apache 2.0 라이선스로 Hugging Face에 공개되어 있습니다 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (llama.cpp용 GGUF 빌드는 orcarouter/Qwen3.8-27B-Uncensored-GGUF에 있습니다).
