
Abliteration, 설명: 훈련 없이 거부 제거가 작동하는 방식
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 1009 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
Abliteration은 가중치 편집을 통해 훈련 실행 없이 LLM의 거부 행동, 즉 '그건 도와드릴 수 없습니다'라는 반사를 제거합니다. 이 방식은 거부가 모델의 잔류 스트림에서 단일 방향에 의해 매개되기 때문에 작동합니다. 그 방향을 찾아 스트림에 쓰는 행렬에서 빼면 모델은 능력을 유지하면서 거부를 중단합니다. 가장 명확한 공개 사례는 Qwen3.8 27B Uncensored (Aggressive)인데, 그 모델 카드에 따르면 유해 프롬프트 거부율이 AdvBench에서 99.0%에서 0.0%로 급락하고 MMLU는 실제로 0.1포인트 상승합니다. 이것이 메커니즘이 작동하는 방식이고, 측정된 수치가 말하는 바이며, 경계가 있는 곳입니다.
이것은 파인튜닝도, RLHF도, 탈옥 프롬프트도 아닙니다. Abliteration은 해석 가능성 연구 결과를 선형대수로 구현한 것입니다. 2024년 논문에서 내부 표현의 한 방향이 안전 훈련이 엄청난 노력을 들여 설치한 행동을 제어하며, 가중치를 직접 편집함으로써 그 방향을 끌 수 있음을 보여주었습니다. 이 편집은 사영(projection)이기 때문에 비용이 낮고, 단일 GPU에서 재현 가능하며, 정상적이고 공유 가능한 체크포인트를 남깁니다. 그래서 Qwen3.8-27B 패밀리를 포함한 오픈 모델의 abliterated 빌드는 "검열되지 않은" 연구용 체크포인트를 만드는 표준 방식이 되었습니다.
거부 방향: 수천 차원의 흐름 속 하나의 벡터
트랜스포머 내부에서, 모든 토큰은잔차 스트림을 통과합니다 — 레이어들이 읽고 쓰는 지속적으로 업데이트되는 표현입니다. 각 레이어의 어텐션과 MLP 블록은 스트림을 입력으로 받아 그 출력을 다시 더합니다. 스트림은 사실상 모델의 작업 메모리입니다: 토큰 위치마다 하나의 벡터이며, 차원은 모델의 너비와 같습니다.
이 모든 것을 시작한 2024년 논문 — Andy Arditi와 동료들이 저술한, "언어 모델의 거부는 단일 방향에 의해 매개된다" (arXiv:2406.11717, NeurIPS 2024) — 채팅 모델이 거부하려 할 때와 따를 때의 스트림 벡터가 어떻게 보이는지 측정했습니다. 총 13개의 오픈 가중치 채팅 모델(1.8B~72B 파라미터)에서, 답은 놀랍도록 일관적이었습니다. 그 차이는 본질적으로 하나의 방향입니다. 마지막 토큰에서, 잔류 스트림은 모델이 거부할 때 단일 거부 방향을 따라 큰 성분을 가지며, 따를 때는 거의 없습니다. 기하학적 구조는 유해 범주 전반에 걸쳐 정렬되며, 이것이 투영이 전체 부분공간에 퍼지지 않고 첫 번째 특이 벡터에 집중되는 이유입니다.
그 방향을 찾으려면, 유해(harmful) 및 무해(harmless)라는 두 프롬프트 집합에서 활성화를 수집하고, 각 집합의 마지막 토큰 잔차들의 평균을 구합니다. 거부 방향은 대략 mean(harmful) − mean(harmless)이며, 단위 길이로 정규화됩니다. 원래 논문에서는 이를 선형 프로빙(linear probing)으로 설명했지만, Qwen3.8-27B-Uncensored-FP8 같은 프로덕션 빌드는 단일 방향(k=1)을 거대 활성화 마스킹 평균 차이, 즉 유해 및 무해 마지막 토큰 잔차의 평균 차이로 추정합니다. 유해/무해 분할 외의 레이블은 없고, 기울기도 없고, 훈련도 없습니다.
편집: 스트림에 쓰는 모든 매트릭스에서 방향을 뺍니다.
거부 방향 r(잔차 스트림에서의 단위 벡터)을 확보했다면, 개입은 랭크-1 투영입니다. 출력이 잔차 스트림에 더해지는 모든 가중치 행렬은 r로부터 "정화"될 수 있습니다:
W' = W − r(rᵀW)
쉽게 말하면: 각 행렬의 출력에서 r 방향 성분을 계산해 제거합니다. 스트림에 쓰는 행렬은 출력 투영들입니다 — 어텐션 출력 투영(o_proj), MLP 다운 투영(down_proj), 그리고 토큰 임베딩의 행 공간입니다. 이 편집은 float32로 실행되며 GPU 하나에서 몇 분이 걸리고, 이미 수집한 활성화 쌍 외에는 옵티마이저도 훈련 데이터도 필요하지 않습니다.
방향을 제거하는 방법에는 두 가지가 있으며, 이를 분리하여 유지할 가치가 있습니다:
• 활성화 어블레이션 — 순전파에 훅을 걸어 라이브 활성화에서 r-성분을 뺍니다. 되돌릴 수 있고 가중치를 건드리지 않으므로, 동일한 체크포인트에서 거부와 순응을 비교하는 실험에 이상적입니다.
• 가중치 직교화 — 가중치 자체에 투영을 적용하여 영구적이고 공유 가능한 체크포인트를 생성합니다. 이것이 "abliteration"이 의미하는 바이며, 검열되지 않은 모델 레포에 포함되는 것입니다.

직교화는 의도적으로 단순합니다. 가중치에서 거부 구성 요소만 제거할 뿐 그 이상은 없습니다. 지식을 추가하거나 추론을 개선하거나 모델을 더 진실되게 만들 수 없습니다. 이것이 바로 abliterated 모델이 거부 반사만 빠진 기본 모델처럼 행동하는 이유입니다.
실제 빌드에서 131 matrices가 어떻게 보이는지: Qwen3.8-27B-Uncensored-FP8
구체적으로 말하자면: Qwen3.8-27B-Uncensored-FP8 (Hugging Face, 2026-08-15 게시, Apache 2.0)은 Qwen3.8-27B의 abliterated 빌드입니다. Qwen3.8-27B는 하이브리드 어텐션 모델로, 16개의 전체 어텐션 레이어와 48개의 Gated DeltaNet 선형 레이어(총 64개 레이어), 그리고 다중 토큰 예측(MTP) 헤드로 구성됩니다. 이 빌드는 거부 방향을 131개의 잔차 기록 행렬:
• self_attn.o_proj — 행렬 17개 (전체 어텐션 레이어 16개 + MTP)
• linear_attn.out_proj — 48개의 행렬 (Gated DeltaNet 레이어)
• mlp.down_proj — 65개의 행렬 (64개 레이어 + MTP)
• embed_tokens (행 공간) — 행렬 1개
거부 방향은 레이어 38 — round(0.6 × 64), 즉 방향이 가장 집중된 레이어 — 에서 추정되었으며, 편집 후 최대 잔여 누출은 1.8e-2였습니다. 비전 타워는 그대로 두었고, MTP 헤드는 본체와 일관되게 abliteration하여 추측 디코딩이 다운스트림에서 거부를 재도입하지 않도록 했습니다. 편집은 float32로 계산된 후 공식 Qwen3.8-27B-FP8 체크포인트와 동일한 방식으로 block-FP8로 재양자화되었습니다. 빌드는 공식 체크포인트와 FP8 코드가 99.9% 동일함을 보고하는데, 이를 통해 재양자화가 편집을 뒤섞지 않았음을 알 수 있습니다.
측정 결과: 거부가 붕괴되고, 능력은 유지된다
아래의 모든 수치는 Qwen3.8-27B-Uncensored-FP8의 모델 카드에서 가져온 것으로, 2026-08-15에 발행되었고 vLLM으로 평가되었습니다. 이 수치는 공급업체가 보고한 것이며 독립적으로 재현된 것이 아닙니다. 또한 이는 공개된 abliteration 편집 전후 비교 중 가장 완전한 자료입니다.
유해 프롬프트 벤치마크에서의 거부, 추론 끔 (거부율; 낮을수록 더 무검열됨):
• AdvBench (n=100): 99.0% → 0.0%
• StrongREJECT (n=150): 97.3% → 2.0%
• HarmBench 표준 (n=150): 98.7% → 2.7%
• MaliciousInstruct (n=100): 99.0% → 0.0%
• JailbreakBench 유해성 (n=100): 94.0% → 0.0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
전체 스위트에서 유해한 프롬프트에 대한 거부율은 다음으로부터 하락한다: 기본 모델의 64–99%에서 편집 후 0–6%로. thinking을 켜면 (enable_thinking=true), 남은 거부율은 더욱 낮아진다 — 모든 곳에서 ≤1.7%이며, 대부분의 벤치마크에서 정확히 0%이다. 비대칭성은 유익하다: 거부 방향은 주로 빠른 비-사고 경로에 존재하므로, 출력 헤드에서 제거되면 추론 과정이 걸려 넘어질 것이 거의 없다.
과잉 거부 — 기본 모델이 잘못 거부하는 무해한 프롬프트 — 도 감소합니다: XSTest-safe(n=250)는 5.6%에서 0.4%로 떨어집니다. 방향을 제거하는 것은 유해한 거부를 막을 뿐만 아니라, 단지 위험해 보였을 뿐인 무해한 요청을 모델이 거부하지 않게 합니다. 그 숫자는 기본 모델의 '안전성' 중 일부가 오경보 비용임을 조용히 시사합니다.
능력치, 모두 기준치 대비 ±1.3 포인트 이내:
• MMLU (0-shot 문자): 84.3% → 84.7% (+0.4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (제로샷): 81.4% → 80.8% (−0.6)
WikiText-2 perplexity는 6.96이다. 다시 말해, 이 편집은 수술적으로 정밀하게 표적화되어 있다. 지식 위에 설치된 행동을 제거하고, 지식을 — 적어도 이러한 평가들에서 측정했을 때 — 본질적으로 온전하게 남겨 둔다.

솔직한 경고
헤드라인 숫자가 말해 주지 않는 세 가지가 있습니다. 첫째, abliteration은 깨끗한 온/오프 스위치가 아닙니다. 약 30~50%의 유해 프롬프트 응답에는 여전히 짧은 안전 고지가 앞에 붙습니다. 모델은 따르지만, 주의 문구 하나가 훈련 산출물로 남아 있는 것입니다. 단방향 편집은 훈련 시점의 행동 흔적을 완전히 지우지 못합니다.
둘째로, 거부 반응은 중복적으로 인코딩되어 있습니다. 한 방향으로 절제하면 대부분 제거되지만, 일부 범주는 다른 범주보다 더 깊이 내재되어 있어 너무 공격적으로 절제하면 모델이 횡설수설하게 될 수 있습니다. 과도한 절제(over-abliteration)는 이론적인 것이 아니라 실제로 발생하는 실패 모드입니다. 여러분은 다이얼을 돌리고 있으며, 그 다이얼에는 바닥이 있습니다.
셋째, 능력 비용은 방향 및 레이어에 따라 달라집니다. 이 빌드는 방향이 올바른 레이어에서 추정되고 투영이 일관되게 적용되었기 때문에 ±1.3 포인트 이내에 도달했습니다. 추정을 잘못된 레이어로 옮기거나 투영을 더 강하게 밀어붙이면 동일한 방법이 추론 능력을 눈에 띄게 손상시킬 수 있습니다. 결과는 방법에 의해 보장되는 것이 아니라 빌드에 의해 얻어집니다.
abliteration이 잘못된 도구인 경우
규정을 준수하는 어시스턴트가 필요하다면 abliterate하지 마세요. 정렬된 기본 체크포인트가 필요하지, 거부 반응이 제거된 빌드가 아닙니다. 30GB 가중치를 다운로드하지 않고 거부 반응이 제거된 Qwen3.8-27B를 평가하려면, 해당 제품군은 OrcaRouter(obsidian/Qwen3.8-27B, 1M 토큰당 입력 $0.40 / 출력 $4.21, 262K 컨텍스트, 2026-08-15 등재)에서 제공되며, 완전히 잠금 해제된 변형은 보안 연구자와 레드팀을 대상으로 접근이 제한되어 있습니다.
선별적 거부를 원한다면 — 무기는 거부하고 나머지는 모두 답하는 것 — LoRA나 DPO 파인튜닝, 또는 시스템 프롬프트 가드레일이 제어 수단을 제공합니다. Abliteration은 대략적이고 전역적인 편집일 뿐이라, 특정 범주 하나를 구분해 낼 수 없습니다.
가역적으로 실험하고 싶다면, 가중치를 편집하는 대신 추론 시 활성화 절제부터 시작하세요. 동일한 체크포인트에서 거부와 수용을 비교한 다음, 동작이 원하는 대로일 때만 가중치 편집을 확정할 수 있습니다.
안전 경계 — 사용 전에 이 내용을 읽으십시오
abliterated 모델에는 내장된 안전장치가 없습니다. 정렬된 모델의 경우, 거부 메커니즘이 바로 그 안전장치입니다. 이를 제거하면 기본 모델이 답할 수 있는 모든 것에 원시 가중치가 응답하게 됩니다. 프로젝션은 안전성을 추가하지 않으며, 다운스트림에서 출력을 걸러내는 장치도 없습니다.
정당한 용도는 연구 목적입니다: 해석 가능성 (거부가 가중치의 어디에 위치하는지, 그리고 그 방향이 무엇을 더 제어하는지 연구하는 것), 레드티밍 및 가드레일 평가 (스스로 검열하지 않는 모델을 상대로 자체 안전 레이어를 테스트하는 것), 그리고 과잉 안전 측정 (XSTest에서 5.6% → 0.4%로의 감소는 정렬된 모델이 무해한 입력을 거부하는 빈도를 정량화합니다). 모든 경우에 모델은 연구의 대상이지 결과물이 아닙니다.
경계는 장식이 아닙니다:
• 연구 전용 — 프로덕션, 최종 사용자 제품 또는 내부 도구용이 아님.
• 가드레일 없음 — 출력물은 필터링되지 않습니다. 귀하가 출력물과 그 결과에 대한 책임을 집니다.
• 라이선스는 안전 인증서가 아니다 — Apache 2.0은 사용을 허용할 뿐이지, 그것을 보증하지 않는다.
두 Hugging Face 저장소(Qwen3.8-27B-Uncensored-FP8 및 2026-08-16에 게시된 GGUF 재패키지 Qwen3.8-27B-Uncensored-GGUF)는 모두게이트(gated) 상태입니다: 다운로드를 시작하기 전에 연구 전용 제한을 인정해야 합니다.

결론
Abliteration은 LLM 해석 가능성 분야에서 가장 깔끔한 결과 중 하나입니다. 잔차 스트림의 단일 선형 방향이 안전 훈련이 엄청난 컴퓨팅을 들여 설치한 행동을 매개하며, rank-1 가중치 투영만으로 훈련 실행 없이 이를 제거할 수 있습니다. 측정된 사례 — Qwen3.8-27B-Uncensored-FP8 — 는 그 편집이 정밀함을 보여줍니다. 거부율이 64–99%에서 0–6%로 붕괴하고, 과잉 거부는 그 자체의 일부 수준(5.6% → 0.4%)으로 줄어들며, 성능은 ±1.3포인트 이내로 유지됩니다. 이는 또한 이것이 왜 제품이 아닌 연구 도구인지를 정확히 보여줍니다. 가드레일이 없고, 잔여 고지사항이 있으며, 책임을 사용자에게 지우는 경계를 갖습니다. 거부를 이해하고, 가드레일을 테스트하고, 과잉 안전을 측정하는 데 사용하세요. 사용자 앞에 내놓을 용도가 아닙니다.
Qwen3.8-27B-Uncensored-FP8은 Apache 2.0 하의 연구 산출물입니다 — 게이트(gated) 처리되어 있으며, 여기서 호스팅되는 서비스가 아닙니다.Hugging Face에서 가중치를 다운로드하세요
