기사 'Qwen Uncensored, Explained'의 타이틀 카드. 둥근 리서치 카드로, 회로로 된 뇌를 드러내기 위해 열리는 방패, 현미경 아이콘, RESEARCH-ONLY라고 적힌 라벨이 있으며, ABLITERATED, BLOCK-FP8, 262K CONTEXT라고 적힌 칩들이 포함되어 있다.
Guides & Insights

Qwen 검열 해제판 해설: Abliterated Qwen3.8-27B-FP8 실행 방법

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen uncensored는 Hugging Face에서 거의 항상 abliteration을 의미합니다 — 모델의 거부 방향이 잔류 스트림에서 제거된 것 — 그리고 시작할 빌드는 Qwen3.8-27B-Uncensored-FP8이며, 2026년 8월 15일에 Hugging Face에 공개되었습니다. 이는 Qwen3.8-27B의 abliterated, block-FP8 빌드로, 공식 FP8 릴리스와 정확히 동일한 vLLM 커널 경로에서 서빙되며, 262K 컨텍스트, 비전 타워, MTP 추측 디코딩 헤드가 그대로 유지됩니다. 또한 첫날 257개의 좋아요와 4,285회의 다운로드를 기록했습니다. 이것은 챗봇이 아니라 연구 도구입니다. 내장된 가드레일이 없고, Apache 2.0이며, 기본 모델이 거부하는 요청에도 응합니다. 이 가이드는 abliteration이 실제로 무엇을 바꿨는지, Hugging Face에서 30.9GB의 가중치를 받는 방법, vLLM, SGLang 또는 Transformers로 모델을 서빙하는 방법, 그리고 합법적인 연구를 위해 무엇을 실행해야 하는지를 다룹니다.

'qwen uncensored'가 실제로 뜻하는 바

Abliteration은 파인튜닝이 아닌 가중치 수준의 개입입니다. {{1}}거부 방향은 모델의 잔차 스트림에 있는 벡터로, 활성화되면 "그건 도와드릴 수 없습니다"라는 응답을 생성합니다. Abliteration은 이 방향을 찾아내 가중치에서 직교화하여 제거합니다.{{/1}} 이 빌드에서는 131개의 잔차 스트림 기록 행렬에 제거가 적용되었으며 {{2}}(Arditi 외 2024, "Refusal in Language Models Is Mediated by a Single Direction"의 방법){{/2}}, 그 결과는 공식 Qwen3.8-27B-FP8 스킴과 바이트 단위로 일치하도록 재양자화되었고, {{3}}그래서 vLLM이 동일한 FP8 커널 경로에서 이를 서빙합니다.{{/3}} 새로운 가중치는 훈련되지 않았습니다.{{/4}}

이러한 구분이 중요한 이유는 'qwen uncensored' 검색 상위 결과에 서로 다른 세 가지가 섞여 있기 때문입니다: 이 글과 같은 abliterated 가중치 편집, 프롬프트 수준에서만 거부를 가리는 시스템 프롬프트 'uncensored packs', 그리고 안전 데이터 없이 훈련된 LoRA 파인튠입니다. 이들은 동등하지 않으며, 이 검색어로 상위 노출되는 대부분의 페이지는 자신이 어떤 유형을 설명하는지 알려주지 않습니다. 거부 메커니즘 자체를 연구하려 한다면 가중치 수준의 개입만이 진짜입니다.

거부 제거가 실제로 한 일 — 수치

모델 카드에는 vLLM으로 서빙된 모델에서 실행되고 2026년 8월 15일자로 작성된 안전성 평가 제품군이 게시되어 있습니다. thinking을 끈 상태에서, 일곱 가지 유해 프롬프트 벤치마크에 대한 거부율은 기본 모델의 64~99%에서 이 빌드에서는 0~6%로 급락합니다: AdvBench 99.0%→0.0%, JailbreakBench 94.0%→0.0%, StrongREJECT 97.3%→2.0%, HarmBench 98.7%→2.7%, MaliciousInstruct 99.0%→0.0%, SimpleSafetyTests 64.0%→6.0%, ForbiddenQuestions 73.3%→4.7%. thinking을 켠 상태에서는 모델이 사실상 전혀 거부하지 않으며, 그 비율은 1.7% 이하입니다. 별도로 주목할 만한 수치로는 주의사항 비율이 있습니다. '검열되지 않은' 답변의 30~50%는 여전히 답변 앞에 짧은 면책 조항을 덧붙이는데, 이는 거부가 아니라 훈련 과정의 산물입니다.

반대편은 변하지 않은 부분입니다. 온건한 프롬프트에 대한 과잉 거부는 XSTest-safe에서 5.6%에서 0.4%로 감소하며, 모든 역량 벤치마크는 기본 대비 ±1.3포인트 이내를 유지합니다: MMLU 84.3%에서 84.7%로, GSM8K 90.0%에서 88.7%로, MMLU-Pro 77.6%에서 76.8%로, CMMLU 81.4%에서 80.8%로. WikiText-2 퍼플렉서티는 6.96입니다. 즉, 이 개입은 모델을 의미 있게 저하시키지 않으면서 거부 행동을 제거했습니다.

A before-and-after card for Qwen3.8-27B-Uncensored-FP8, with a Base column and an Abliterated column: refusal with thinking off 64-99% down to 0-6%, refusal with thinking on down to 1.7% or less, over-refusal on benign prompts 5.6% down to 0.4%, MMLU 84.3% to 84.7%, GSM8K 90.0% to 88.7%, and WikiText-2 perplexity 6.96, with a footer reading Model-card evaluation, vLLM-served, August 15 2026.

Hugging Face에서 가져오는 방법

이 저장소는 orcarouter/Qwen3.8-27B-Uncensored-FP8이며 게이트가 걸려 있습니다. 파일이 다운로드되기 전에 Hugging Face 계정으로 로그인하고 조건에 동의해야 합니다. 게이트 자체가 면책 조항입니다. README를 읽는 것이 이 모델의 본질을 수용하는 과정의 일부이기 때문입니다. 다운로드하는 것은 7개의 safetensors 샤드(1,606개의 텐서)에 걸쳐 30.9GB이며, 블록-FP8(E4M3, 128x128 블록, 동적 활성화) 형식이고, 비전 타워, norms, embeddings, lm_head는 BF16으로 유지됩니다. 라이선스는 기본 Qwen/Qwen3.8-27B에서 상속된 Apache 2.0입니다. 어떤 Hugging Face Inference Provider도 이를 호스팅하지 않으므로 직접 실행하거나 호스팅된 카드를 사용해야 합니다.

실행 방법

가중치는 대략 31GB로, 약 56GB BF16 체크포인트의 절반 정도이며, 카드는 단일 H100 80GB 또는 H200 143GB를 권장합니다. 가중치와 작은 KV 캐시를 위한 실질적인 최소 VRAM은 약 40GB입니다. 전체 262K 컨텍스트는 더 많은 메모리가 필요하지만, FP8 KV 캐시를 사용하면 그 절반으로 줄어듭니다. 카드가 검증한 설정은 --max-num-seqs 96, FP8 KV 캐시 및 MTP를 활성화한 H200 하나였습니다.

vLLM이 의도된 경로이며, FP8 스킴이 공식 빌드와 정확히 일치하기 때문에 명령어 하나면 됩니다:

vllm serve "orcarouter/Qwen3.8-27B-Uncensored-FP8"

이렇게 하면 localhost:8000/v1/chat/completions에서 OpenAI 호환 엔드포인트를 얻을 수 있습니다. Docker에 해당하는 명령은 docker model run hf.co/orcarouter/Qwen3.8-27B-Uncensored-FP8입니다. 전체 설정을 위해 카드에서는 다음을 제안합니다: 텍스트 전용 서빙에는 --language-model-only, MTP 추측 디코딩 헤드를 활성화하려면 --speculative-config '{"method":"mtp","num_speculative_tokens":3}', --kv-cache-dtype fp8, --max-model-len 262144, --reasoning-parser qwen3, 그리고 도구 호출을 위해 --enable-auto-tool-choice --tool-call-parser qwen3_coder를 사용하세요. --quantization fp8은 전달하지 마세요 — 해당 스킴은 config.json에서 읽힙니다. BF16 KV 캐시를 원하면 --kv-cache-dtype fp8을 빼고, 비전 타워가 필요하면 --language-model-only를 빼세요.

SGLang의 경우: python3 -m sglang.launch_server --model-path "orcarouter/Qwen3.8-27B-Uncensored-FP8" --host 0.0.0.0 --port 30000. Transformers의 경우, 카드에는 파이프라인 API(pipeline("image-text-to-text", model="orcarouter/Qwen3.8-27B-Uncensored-FP8"))와 AutoProcessor.from_pretrained(...) 및 AutoModelForMultimodalLM.from_pretrained(..., device_map="auto")가 모두 문서화되어 있습니다.

A how-to-run card for Qwen3.8-27B-Uncensored-FP8 listing the essentials: 30.9 GB of block-FP8 weights across 7 shards, roughly 40 GB of VRAM floor with H100 80GB or H200 143GB recommended, the vLLM one-liner vllm serve orcarouter/Qwen3.8-27B-Uncensored-FP8, serve flags MTP 3 speculative tokens, FP8 KV cache, max-model-len 262144, tool-call-parser qwen3_coder, and a footer reading From the Hugging Face model card, August 15 2026.

연구에서 실제로 그것을 어떻게 활용할 것인가

거부 제거 모델의 요점은 연구 대상이 되는 데 있으며, 이 빌드는 개입이 문서화되어 있어 연구하기에 유난히 쉽다. 구체적이고 정당한 연구 프로젝트 세 가지:

• 거부 델타를 재현하세요. abliterated 빌드와 기본 FP8 모두에 대해 AdvBench, HarmBench, StrongREJECT 또는 XSTest-safe를 실행하고 카드의 수치를 확인하세요: 유해 프롬프트에서는 64–99%에서 0–6%로, 무해한 프롬프트에서는 과잉 거부가 5.6%에서 0.4%로. 그 전후 쌍은 안전 팀이 거부 제거 방법이 효과가 있는지와 그 비용이 무엇인지 파악하는 데 필요한 바로 그 측정치입니다.

• 거부가 어디에 자리 잡고 있는지 연구하세요. 빌드가 직교화된 131개의 행렬을 문서화하기 때문에, 잔차 스트림 방향을 기준선과 비교하여 개입이 무엇을 이동시켰는지 확인할 수 있습니다. 여기서 thinking-on 결과가 유익합니다. thinking이 활성화되면 거부율이 1.7% 이하로 떨어지는데, 이는 추론 흔적이 방향이 가장 중요하게 작용하는 곳이라는 증거입니다.

• 자신의 가드레일을 평가하세요. 가드레일이 없는 기준선이 중재 계층을 테스트하기 위한 올바른 대조군입니다. 이 모델의 출력에 필터를 실행하여 그것이 잡아내는 것을 측정하세요 — 그것이 바로 추가하는 안전 계층을 정량화하는 방법입니다.

이 모델이 오답인 경우

일반적인 어시스턴트나 최종 사용자 앞에 둘 만한 것을 원한다면, 이는 잘못된 모델입니다. 의미 있는 기본 안전장치가 내장되어 있지 않고, 기본 모델이 거부하는 요청도 수행하며, Apache 2.0이 귀하의 책임을 덜어주지도 않기 때문입니다. 대신 원래 정렬된 Qwen3.8-27B를 사용하세요. 챗봇에서 거부를 우회하려면, 시스템 프롬프트 팩이 가중치 편집보다 위험을 덜 감수하면서 더 많은 효과를 냅니다. 그리고 약 40GB 카드가 없어도 여전히 모델을 연구하고 싶다면, OrcaRouter의 호스팅 카드 obsidian/Qwen3.8-27B가 동일한 무검열 27B 라인을 입력 토큰 100만 개당 $0.40, 출력 토큰 100만 개당 $4.21에 동일한 262K 컨텍스트로 제공합니다. 이 서비스는 보안 및 AI 안전 연구자에게만 접근이 제한되며, 검열 결정은 여전히 귀하의 몫입니다.

A safety-boundary card for Qwen3.8-27B-Uncensored-FP8 with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services with a warning that the model has no built-in guardrails, and a footer reading Apache 2.0, research-only, you assume full responsibility.

안전 경계 — 다운로드 전에 읽어 보세요

이 모델은 안전 정렬이 상당 부분 제거되었습니다. 원래 Qwen3.8-27B가 거부했을 유해하거나 비윤리적이거나 공격적이거나 불법적인 요청에도 응할 것이며, 의미 있는 내장 안전장치가 없습니다. 이 모델은 해석 가능성, AI 안전 및 거부 메커니즘 연구, 레드티밍, 견고성 평가, 통제된 실험 등 정당한 연구 목적으로만 엄격히 공개되었습니다. 사용자는 이 모델을 사용하는 방식과 모델이 생성하는 모든 결과물에 대해 전적인 책임과 법적 책임을 부담하며, 자체적인 안전·중재·악용 방지 계층을 추가하지 않는 한 최종 사용자에게 배포하거나 프로덕션에 배포해서는 안 됩니다. 저자는 오용에 대한 어떠한 책임도 지지 않습니다. 리포지토리를 다운로드하면 이러한 조건에 동의하는 것으로 간주되며, 라이선스는 Apache 2.0입니다.

이 기사에는 의도적으로 유해한 프롬프트가 포함되어 있지 않습니다. 위의 거부 수치는 모델 카드 자체의 안전성 평가 스위트에서 나온 것으로, 이 등급의 모델을 측정하는 올바른 방법입니다: 표준 거부 벤치마크를 실행하고, 수치를 읽고, 그 수치가 보여주는 바에 따라 연구를 설계하십시오.

결론

"Qwen uncensored"는 기법을 찾는 검색어이며, 가장 먼저 시도해 볼 버전은 Qwen3.8-27B-Uncensored-FP8입니다. 이는 공식 FP8 vLLM 커널 경로에서 262K 컨텍스트, 비전, MTP를 모두 유지한 채 서빙되는 유일한 거부-제거 Qwen3.8 빌드로, 공개된 전후 평가 결과가 뒷받침합니다. Hugging Face에서 게이트된 30.9GB를 내려받아 단일 H100 또는 H200에서 vLLM으로 서빙하고, 원래 용도인 거부 측정, 거부 메커니즘 연구, 가드레일 테스트에 사용하십시오. 챗봇으로 사용하거나 최종 사용자에게 배포하지 마십시오. 가중치는 무료이며, 가중치로 무엇을 하든 그 책임은 전적으로 여러분의 몫입니다.

정당한 연구를 위해, 가중치는 Hugging Face에 있습니다: Hugging Face에서 다운로드

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube