
Qwen 3.8 27B Uncensored GGUF: Abliterated 로컬 빌드, 12개 퀀트, 그리고 연구 전용 경계
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
Qwen 3.8 27B uncensored GGUF는 실제 다운로드이며, 시작할 빌드는 Qwen3.8-27B-Uncensored-GGUF입니다. — 2026년 8월 16일 Hugging Face에 게시된, 우리의 abliterated FP8 릴리스의 llama.cpp 네이티브 자매 버전입니다. 이는 Qwen3.8-27B-Uncensored-FP8과 동일한 거부 제거된 270억 파라미터 가중치를 로컬 추론용 GGUF로 변환한 것입니다: F16 및 Q2_K부터 Q8_0까지 12가지 양자화 등급(imatrix 퀀트 IQ3_M 및 IQ4_XS 포함), 262K 컨텍스트 창, 별도의 비전 프로젝터, MTP 추측 디코딩 헤드가 그대로 포함됩니다. "Uncensored"는 abliterated를 의미합니다 — 거부 방향이 가중치에서 직교화되었으므로 — 정렬된 베이스가 거부하는 부분에서 답변할 수 있으며, 이것이 바로 연구 전용인 이유입니다. 저장소에 실제로 포함된 내용, 어떤 퀀트가 GPU에 적합한지, llama.cpp에서 실행하는 방법, 다운로드 시 수용하는 안전 경계는 다음과 같습니다.
30초 요약: {{1}}F16과 12개 퀀트, 16.8GB의 Q4_K_M이 기본 선택이며{{/1}}, {{2}}2026년 5월 이후 버전의 llama.cpp 빌드가 필요합니다{{/2}}, {{3}}그리고 이것은 가드레일이 없는 연구용 도구입니다{{/3}} — {{4}}최종 사용자에게 배포할 것이 아닙니다{{/4}}.
"검열되지 않은 GGUF"가 실제로 의미하는 것 — 그리고 이 빌드가 FP8 버전과 어떻게 다른지
GGUF는 llama.cpp가 사용하는 단일 파일 모델 형식이며, FP8은 vLLM GPU 서버에서 실행되는 양자화 방식입니다. 저희의 두 무검열 릴리스는 두 런타임에서 동일한 abliterated 가중치를 사용합니다. Qwen3.8-27B-Uncensored-FP8(2026년 8월 15일)은 서버의 vLLM을 대상으로 하며, 공식 Qwen3.8-27B-FP8 방식으로 재양자화되어 동일한 커널 경로에서 서빙됩니다. Qwen3.8-27B-Uncensored-GGUF(2026년 8월 16일)는 로컬 머신의 llama.cpp를 대상으로 합니다 — 사용자가 제어하는 데스크톱 GPU 또는 워크스테이션입니다. 동일한 가중치, 다른 배포 모델: 클라우드 API와 로컬 프로세스입니다.
Abliteration은 파인튜닝이 아닌 가중치 수준의 개입입니다. 거부 방향(Refusal Direction)은 모델의 잔차 스트림에 있는 벡터로, 활성화되면 "그건 도와드릴 수 없습니다"라는 응답을 생성합니다. 이 빌드는 Arditi 외 2024("Refusal in Language Models Is Mediated by a Single Direction")의 접근 방식에 따라 해당 방향을 찾아내고 이를 가중치에서 직교화합니다. 새로운 가중치는 훈련되지 않습니다. 기본 모델은 Qwen/Qwen3.8-27B로, 하이브리드 아키텍처(48개의 Gated DeltaNet 선형 어텐션 레이어와 16개의 풀 어텐션 레이어), 네이티브 비전, 262,144 토큰 컨텍스트를 갖춘 dense 27B 모델입니다. 라이선스는 기본 모델에서 계승된 Apache 2.0입니다. 참고로 Qwen의 공식 저장소는 BF16 safetensors만 제공하며 공식 Qwen GGUF는 없으므로, 이 모델의 검열되지 않은 GGUF(이것 포함)는 모두 오픈 가중치를 변환한 것입니다.
퀀트 래더 — F16과 12개 계층
이 저장소는 F16(두 파일에 걸쳐 54.6GB) 및 12가지 양자화 계층을 제공합니다. 아래 크기는 2026년 8월 16일에 읽은 저장소 자체 파일 크기이며, GGUF 파일 크기는 빌드마다 약간 다를 수 있습니다.

• F16 — 54.6 GB (파일 2개) — 레퍼런스 정밀도
• Q8_0 — 29.0 GB — 거의 무손실, 고성능 GPU용
• Q6_K — 22.4 GB — 기가바이트당 품질 최적점
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — 더 큰 카드에서 고품질
• Q4_K_M — 16.8 GB — 권장 기본값
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — 최고의 저비트 선택 (imatrix 보정)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — 16GB 카드용
• IQ3_M — 12.8 GB — 작은 용량 (imatrix-보정)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — 가장 작은 K-양자화로, 눈에 띄는 품질 저하가 있습니다
하드웨어 가이드: 24GB 카드(RTX 4090 또는 RTX 3090)에서는 Q4_K_M, 16GB라면 IQ4_XS 또는 Q3_K_M, 12GB로 빠듯한 경우에만 Q2_K를 사용하세요. 베이스 모델이 하이브리드 Gated DeltaNet 어텐션을 사용하므로 KV 캐시가 작아서(8K 컨텍스트에서 약 0.5GB) 기존 27B Dense 모델보다 훨씬 더 긴 윈도우를 사용할 수 있습니다. 비전은 별도 파일 하나를 추가합니다: F16 프로젝터는 931MB입니다. 동일한 베이스 모델에 대한 9-양자화 커뮤니티 abliterated 시리즈도 존재합니다. 우리 것은 문서화된 FP8 abliteration의 변환이며, imatrix 양자화와 모델 카드의 refusal-delta 수치가 그대로 이어집니다.
llama.cpp에서 실행하는 방법
세 단계. 한 가지 간과하기 쉬운 요구 사항: qwen35 아키텍처와 MTP 지원은 2026년 5월에 llama.cpp에 추가되었으므로, 2026-05 이상의 빌드로 업데이트하세요 — 이전 빌드는 이러한 파일을 로드할 수 없습니다(저장소 README에 따르면).
1. 선택한 양자화 모델과 비전 프로젝터를 다운로드하세요. 저장소는 접근이 제한되어 있으므로 먼저 Hugging Face에 로그인하고 조건을 수락해야 합니다 — README를 읽는 것은 이 모델이 무엇인지 수락하는 과정의 일부입니다.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. llama-server를 시작합니다. 이 서버는 OpenAI 호환 엔드포인트를 제공하며, -ngl 99/ 모든 레이어를 GPU로 오프로드합니다.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (선택 사항) MTP 추측 디코딩 헤드를 활성화합니다. 추가 --spec-type draft-mtp/ — nextn 헤드는 모든 양자화에 내장되어 있으므로 별도의 드래프트 모델이 필요하지 않습니다.

텍스트 전용 연구 실행에서는 --mmproj를 생략할 수 있습니다. /; 이미지 입력에는 필요합니다. 네이티브 비전-언어 모델이기 때문입니다. 엔드포인트는 http://localhost:8080/v1/chat/completions이므로 기존 OpenAI SDK 코드는 base-URL만 교체하면 동작합니다.
GPU가 없나요? 동일한 무삭제 라인이 호스팅됩니다.
{{1}}로컬 GGUF는 토큰당 비용이 들지 않지만 Q4_K_M 등급에는 약 17GB의 VRAM이 필요합니다.{{/1}} {{2}}하드웨어를 보유하지 않은 경우 OrcaRouter의 호스팅 카드 {{3}}obsidian/Qwen3.8-27B{{/3}}가 동일한 무검열 27B 라인(비전, 추론, 262K 컨텍스트)을 입력 토큰 100만 개당 $0.40, 출력 토큰 100만 개당 $4.21에 제공하며, 액세스는 보안 연구원, 레드 팀, AI 안전 연구원에게만 제한됩니다.{{/2}} {{4}}동일한 가중치 계열, 두 가지 런타임: 로컬의 GGUF, 클라우드의 FP8.{{/4}} {{5}}중재 결정은 어느 쪽이든 사용자 측에 유지됩니다.{{/5}}
안전 경계 — 다운로드 전에 읽어 보세요
이 모델은 안전 정렬이 상당 부분 제거된 상태입니다. 기본 Qwen3.8-27B가 거부할 유해하거나 비윤리적이거나 공격적이거나 불법적인 요청에도 응할 것이며, 의미 있는 내장 안전장치가 없습니다. 이 모델은 해석 가능성, 거부 메커니즘 연구, 레드티밍, 견고성 평가, 안전장치 테스트 등 정당한 연구 목적으로만 엄격히 공개되었습니다. 사용자는 이 모델을 사용하는 방식과 이 모델이 생성하는 모든 것에 대해 전적인 책임과 법적 책임을 지며, 자체적인 안전·중재·악용 방지 계층을 추가하지 않는 한 최종 사용자에게 배포하거나 프로덕션 환경에 배포해서는 안 됩니다. 저자는 어떠한 책임도 지지 않습니다. 라이선스는 Apache 2.0입니다.

측정된 동작은 "uncensored"가 어떤 대가를 치르는지 보여줍니다. 모델 카드의 안전성 평가 스위트에서 — FP8 빌드에서 실행되고 2026년 8월 15일자로, 이 GGUF가 변환하는 가중치입니다 — 유해 프롬프트 거부율은 기본 모델의 64–99%에서 abliterated 가중치에서는 0–6%로 떨어지고, 양성 과잉 거부는 5.6%에서 0.4%로 감소하며, 기능 점수는 기본 모델 대비 ±1.3포인트 이내를 유지합니다. 이러한 수치가 이 클래스의 모델을 합법적인 연구 대상으로 만드는 이유이며 — 동시에 경고이기도 합니다.
이 글에는 의도적으로 유해한 프롬프트가 포함되어 있지 않습니다. 모델을 평가한다면 표준 거부 벤치마크(AdvBench, HarmBench, StrongREJECT, XSTest-safe)를 실행하고 그 수치를 직접 확인하십시오. 그것이 거부 기능이 제거된 모델을 연구하는 공인된 방법입니다.
이 빌드가 잘못된 답일 때
1. 당신은 일반적인 어시스턴트를 원합니다. 잘못된 모델입니다. 가드레일이 없어 유해한 요청을 따를 것입니다. 대신 정렬된 Qwen3.8-27B를 사용하세요.
2. 최종 사용자 앞에 두는 모든 것. 의도와 무관하게 잘못된 모델입니다. Apache 2.0은 귀하의 책임을 이전하지 않으며, 가드레일이 없는 모델을 사용자에게 배포하는 것은 배포 전략이 아닙니다.
3. Apple Silicon을 사용 중입니다. GGUF도 실행되지만, 베이스 모델의 MLX 변환이 더 자연스럽게 맞습니다 — 별도의 MLX 가이드를 참조하세요.
4. 전혀 실행하고 싶지 않습니다. 호스팅된 카드를 사용하세요 — 동일한 가중치, 17GB의 VRAM 불필요, 그리고 동일한 연구 전용 게이트.
결론
"Qwen 3.8 27B uncensored GGUF"에는 답이 있습니다. 그것은 구체적인 다운로드입니다: Qwen3.8-27B-Uncensored-GGUF — F16 및 llama.cpp용 12가지 양자화 등급, FP8 빌드에서 얻은 abliterated 가중치, 262K 컨텍스트, 비전, MTP를 포함하며 Apache 2.0 및 연구 전용입니다. 24GB 카드에서 Q4_K_M을 선택하고 llama.cpp를 2026년 5월 이후 버전으로 업데이트한 다음, 로컬 OpenAI 호환 서버로 실행하세요. 이것은 거부 반응을 연구하고 가드레일을 테스트하기 위한 연구 도구입니다 — 챗봇이 아니며, 배포할 것이 아닙니다. 가중치는 무료입니다. 그 가중치로 무엇을 하든 책임은 전적으로 여러분의 몫입니다.
정당한 연구를 위해 F16과 12개 양자화 단계는 모두 Hugging Face에 있습니다: Hugging Face에서 GGUF를 다운로드하세요
