
검열되지 않은 LLM, 설명: Abliteration 기법, 연구 용도, 그리고 넘지 말아야 할 선
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
검열되지 않은 LLM은 거부 행동(요청에 응답하는 대신 거부하는 모델의 부분)이 의도적으로 제거된 언어 모델입니다. 대부분은 abliteration 기법으로 만들어집니다. 연구자는 거부를 매개하는 단일 내부 방향을 찾아 가중치에서 지우며, 나머지 모델은 대체로 온전히 남깁니다. 그 결과 일반적인 모델이라면 "아니요"라고 말할 상황에서 응답하는 모델이 되며, 이것이 바로 연구되는 이유이자 프로덕션에는 적합하지 않은 이유입니다. 우리는 그러한 빌드 하나를,Qwen3.8-27B-Uncensored-FP8, abliteration 및 FP8 양자화를 적용한 Qwen3.8 27B를 Apache 2.0 라이선스 하에 연구 전용 산출물로 Hugging Face에 공개했습니다. 이 페이지는 카테고리 설명으로, 이러한 모델이 무엇인지, 이를 정당화하는 연구, 안전하게 다루는 방법, 그리고 경계가 어디에 있는지를 다룹니다.
한 가지 프레임이 이 전체 범주를 정직하게 유지하므로, 먼저 분명히 말해 두겠습니다: 무검열 모델은 원래 모델보다 더 똑똑하지도, 더 진실하지도, 더 유능하지도 않습니다. 그것은 같은 가중치에서 한 가지 행동만 뺀 것입니다. 그것이 여전히 알고 있는 모든 것은 원래부터 알고 있었던 것이며, 달라진 것은 더 이상 거부하지 않는다는 점뿐입니다. 그로 인해 이것은 안전 연구에는 진정으로 유용한 대상이 되지만, 배포하기에는 진정으로 안전하지 않은 것이 됩니다. 그 문장의 양쪽 절반은 모두 중요한 의미를 지니며, 이 페이지의 나머지 부분은 둘 다를 설명합니다.
"uncensored"가 실제로 의미하는 것
• 또는 저희 모델 카드를 통해 접속할 수 있으며, 가격 및 벤치마크 세부 정보가 포함되어 있습니다.
이 기술은 2024년 해석 가능성(interpretability) 연구 결과에서 비롯되었습니다. "Refusal in Language Models Is Mediated by a Single Direction" (Arditi 외, arXiv:2406.11717, NeurIPS 2024)에서 저자들은 1.8B에서 72B 파라미터에 이르는 13개의 오픈 채팅 모델 전반에 걸쳐 거부 동작이 잔차 스트림(residual stream) — 레이어 간 정보를 전달하는 내부 상태 — 의 대략 1차원 부분공간에 의해 제어된다는 것을 보여주었습니다. 그 방향을 제거하면 모델은 거부를 멈추고, 다시 추가하면 모델은 무해한 요청도 거부하게 됩니다.
Abliteration은 그 발견을 구체화한다: 방향을 추정한 다음, 잔차 스트림에 쓰는 가중치 행렬들에서 그 방향을 직교화하여 제거한다. 우리 자체 빌드인 Qwen3.8-27B-Uncensored-FP8에서는 거부 방향을 단일 레이어에서 추정하고 131개의 잔차 스트림 기록 행렬에서 제거했으며, 비전 타워는 건드리지 않았다. 살아남는 것은 동일한 지식, 동일한 추론, 동일한 262,144-토큰 컨텍스트이며, 거부 반응만 빠져 있다. 그리고 라벨에 대해 정확히 말하자면, "uncensored"는 정렬(align)되거나 안전하다는 뜻이 아니다. 그것은 가드가 꺼져 있음을 의미한다. 그것이 당신에게 무엇을 요구하는지는 다시 다루겠다.
그것들을 만든 연구
거부 방향 결과는 한 번에 두 가지를 해냈다. 과학적으로는 안전 행동을 메커니즘적으로 설명했다. 즉, 모델이 '아니요'라고 말하게 만드는 실제로 존재하고 찾을 수 있는 회로가 있다는 것이다. 실용적으로는 정렬이 얼마나 취약할 수 있는지 보여주었다. 가중치에 대한 단일 랭크-원 편집만으로 미세 조정 없이도 행동을 꺼버릴 수 있다는 것이다. 그것은 한 연구실 모델의 결함이 아니다. 저자들은 12개 이상의 채팅 모델에서 이를 재현했다.
2026년까지 이 기술은 원커맨드 파이프라인이 되었는데, 이는 양날의 검과 같은 사실이다. 오픈소스 라이브러리인 Heretic은 레이어별로 거부 방향을 추정하고 이를 어텐션 및 MLP 프로젝션에서 직교화하여 제거한다. 2026년 5월 보고서에 따르면 Meta의 Llama 3.3은 약 10분, Google의 Gemma 4는 약 90분 만에 가드레일 제거가 가능하며, 파생 모델은 3,500개 이상, 누적 다운로드는 1,300만 회를 넘는다. Abliterix(Wu Wangzhang)는 더 신중한 접근 방식을 취한다. 800개의 유해 프롬프트와 800개의 정상 프롬프트에서 거부 방향을 추출하고, 직교 투영을 적용한 뒤, 기본 가중치가 그대로 유지되도록 편집을 rank-1 LoRA 어댑터로 제공한다. 또한 거부율과 KL 발산을 보고하여 성능 비용이 계속 드러나게 한다. 0.8B Qwen3.5 모델에서는 유해 프롬프트 200개 중 0개에 대한 거부가 보고되었다.
안전 연구자의 관점으로 그 문단을 읽으십시오. 이러한 도구를 만드는 목적은 누군가가 재미로 모델의 가드레일을 제거해야 한다는 것이 아닙니다. 핵심은 제거가 사소하고 공개적이라는 점입니다. 따라서 이를 측정하고, 작동 방식을 연구하며, 그것을 견디는 가드레일을 구축하는 것 자체가 하나의 연구 프로그램입니다. 그것이 화이트박스 의미에서의 레드팀링입니다. 시스템을 방어하려면 시스템이 얼마나 쉽게 깨지는지 알아야만 합니다.
2026년에 무검열 모델이 인기를 끈 이유
세 가지 힘이 수렴했다. 첫째, 오픈-웨이트 물결이다: Qwen3.8 27B와 그 동급 모델들이 허용적 라이선스로 배포되며, abliteration은 학습 실행이 필요 없다 — 가중치를 편집하고 다시 양자화하면 된다. 둘째, 도구가 연구용 코드에서 원커맨드 라이브러리로 성숙해져, 유능한 엔지니어라면 오후 하나로 빌드를 만들 수 있게 되었다. 셋째, Hugging Face가 배포 채널이 되면서 트랙션을 측정할 수 있게 되었다.
우리 자체 데이터 포인트: 2026년 8월 15일에 출시된 Qwen3.8-27B-Uncensored-FP8은 하루 만에 좋아요 257개와 다운로드 4,285회를 기록했습니다(8월 16일 확인). 수만 명의 사람들이 가드레일 없는 모델을 배포하려는 것은 아닙니다. 많은 연구자와 엔지니어가 하나를 연구하려는 것이며, 다운로드 수는 그 호기심에 대한 수요 곡선입니다.
용도: 합법적인 연구 용도
여기에 정당한 목록이 있으며, 이것이 전체 목록입니다. 목록에 없는 용도가 있다면, 합법적이지 않은 것으로 간주하십시오:
• 해석 가능성 — 거부 회로가 실제로 무엇인지, 어디에 위치하는지, 그리고 한 방향을 제거하면 왜 동작이 바뀌는지 연구하는 것.
• 레드티밍 및 가드레일 평가 — 모더레이션 계층을 구축하고, 거부 응답이 제거된 모델이 만들어내는 출력을 해당 계층이 실제로 걸러내는지 테스트하는 작업
• 과잉 안전 측정 — 기본 모델이 무해한 요청을 거부하는 빈도를 정량화하고, 이를 실제 안전과 구분하는 것.
• 견고성 연구 — 정렬이 얼마나 쉽게 제거될 수 있는지 측정하는 것으로, 안전 미세 조정을 설계하는 모든 사람에게 필수적인 정보입니다.
• 통제된 안전 실험 — AdvBench 및 JailbreakBench와 같은 벤치마크 스위트는 거부 행동을 표준화되고 재현 가능한 방식으로 측정할 수 있도록 하기 위해 마련되어 있습니다.

이 모든 것은 한 가지 속성을 공유합니다: 모델은 연구 대상이지 결과물이 아닙니다. 이 연구의 산출물은 논문, 벤치마크 결과, 또는 더 나은 보호 장치입니다 — 결코 서비스가 아닙니다.
하나를 책임감 있게 운영하는 방법 (실제로 연구를 한다면)
abliterated 모델로 작업해야 할 정당한 이유가 있다면, 운영 규칙은 간단합니다:
• 로컬에서 실행하고, 샌드박스 처리하며, 이상적으로는 에어갭(air-gapped) 상태로 유지하세요. 공개 엔드포인트, 채팅 서비스, 공유 서버가 없어야 합니다.
• 표준 도구인 vLLM 또는 llama.cpp로 다른 오픈 가중치 모델과 동일한 방식으로 서빙하세요. 우리의 빌드는 표준 vLLM FP8 커널 경로에서 실행되는 블록-FP8 양자화로, 262K 컨텍스트, thinking 토글, 도구 호출 기능이 그대로 유지됩니다.
• 측정하세요, 그냥 대화만 하지 마세요. 유해 프롬프트 벤치마크 스위트에서 거부율을 정량화하고 기본 모델과 비교하세요. 무해한 프롬프트에 대한 과잉 거부를 정량화하고, 능력 변화가 드러나도록 KL 발산을 보고하세요. 그것이 실험과 일화의 차이입니다.

• 출력물을 통제된 환경에 보관하십시오. 유포하기보다 기록하고 검토한 후 폐기하십시오.
• 자신의 가드레일을 평가하는 경우, 모델 앞에 모더레이션 계층을 배치하고 테스트하세요 — 그것이 바로 이 작업의 핵심입니다.
• 전체 사양 시트, 벤치마크 표 및 호스팅 세부 정보를 확인하려면 모델 카드를 여세요 — 이는 이 빌드의 표준 참조 자료입니다.
안전 경계: '연구 전용'이 의미하는 바
아무리 강조해도 지나치지 않은 부분이 있다. Abliterated 모델에는 의미 있는 내장 가드레일이 없다. 일반적인 모델이 거부하는 요청에도 응할 것이다. 그것이 특징이자 동시에 위험이다. 그래서 우리의 것을 포함한 모든 진지한 릴리스에는 동일한 경고가 담겨 있다.
• 내장된 가드레일이 없습니다. 거부 행동은 사라졌습니다. 그렇지 않은 것처럼 행동하지 마십시오.
• 최종 사용자용이 아니며, 프로덕션용이 아닙니다. 제품, 챗봇, 대중에게 서비스를 제공하는 API, 동료들이 의존하는 내부 도구 — 이 중 어느 것도 무검열 모델의 올바른 용처가 아닙니다.
• 책임은 당신에게 있습니다. 저희는 Qwen3.8-27B-Uncensored-FP8을 Apache 2.0 라이선스로 배포하며, 이는 재배포에 대해 허용적입니다. 라이선스는 안전 인증서가 아닙니다: 허용적 코드는 모델의 작동 방식을 바꾸지 않으며, 주의 의무를 이전하지도 않습니다.
• 사용한다면 출력물은 여러분의 것입니다. 통제된 환경을 조성하는 것은 여러분의 몫이며, 무엇을 입력할지 말지, 결과물로 무엇을 할지 결정하는 것도 마찬가지입니다.

검열되지 않은 모델이 틀린 답일 때
가장 명확하게 말하자면: 모델 반대편에 사람이 있다면, 검열되지 않은 모델은 잘못된 답입니다. 신뢰할 수 있어야 하는 모든 제품, 판단이 중요한 모든 어시스턴트, 거절이 올바른 행동인 모든 경우에는 기본 모델을 사용하세요. Qwen3.8 27B가 일반 형태로 존재하는 이유는 바로 거절이 거의 모든 실제 용도에서 버그가 아니라 기능이기 때문입니다. abliterated 빌드는 위에서 언급한 제한된 연구 사례를 위해서만 존재하며, 그 외의 용도로는 존재하지 않습니다.
결론입니다. 검열되지 않은 LLM은 제품 범주도 아니고 해킹도 아닙니다. 그것은 진정한 과학적 계보를 가진 연구 산출물입니다 — 거부 방향 발견부터 2026년의 자동화 도구까지 — 그리고 단단한 배포 경계를 가집니다. 모델은 실제이며, 수요는 측정 가능하고, 합법적인 용도도 실제입니다: 해석 가능성, 레드팀링, 가드레일 평가, 그리고 통제된 안전 실험. 가드를 연구하는 것과 다른 사람을 위해 가드를 끄는 것 사이의 경계가 바로 이 페이지의 전부이며, 그 경계는 움직이지 않습니다.
이 정확한 빌드는 Apache 2.0 — 연구 전용으로 공개되어 있습니다. Hugging Face에서 가중치를 다운로드할 수 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
