
로컬에서 Qwen3.8-27B-Uncensored 실행하는 방법: GGUF 양자화, llama.cpp와 Ollama
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Qwen3.8-27B-Uncensored를 로컬에서 실행하려면 Hugging Face에서 게이트(gated) GGUF 저장소 orcarouter/Qwen3.8-27B-Uncensored-GGUF를 내려받고, VRAM에 따라 양자화 버전을 고르세요 — 24GB GPU에는 Q4_K_M(16.8GB), 16GB GPU에는 IQ4_XS(15.3GB), 컨텍스트 여유 공간이 필요하면 Q3_K_M(13.5GB) — 그런 다음 최신 llama.cpp 빌드에서 --jinja 플래그를 사용해 서빙하고, 비전이 필요하면 --mmproj를 추가하세요. 동일한 파일은 세 개의 명령으로 Ollama에 가져올 수 있습니다. 이것은 2026년 8월 16일에 출시된 abliterated Qwen3.8 27B 빌드의 GGUF 버전으로, 모든 양자화 버전에 네이티브 262K 컨텍스트, 비전 프로젝터, MTP 추측 디코딩 헤드가 보존되어 있습니다. 이것은 어시스턴트가 아니라 연구 도구입니다. 거부 동작이 제거되어 있고 내장 가드레일이 없으며, 라이선스는 Apache 2.0입니다. 다운로드하기 전에 이 페이지 하단의 안전 경계를 읽으세요 — 이것이 게이트 저장소의 존재 이유입니다.
VRAM별로 어떤 GGUF를 다운로드할지
이 저장소에는 전체 정밀도(full-precision) 쌍 하나와 양자화(quantized) 파일 12개가 포함되어 있으므로, 다운로드 결정은 사실상 VRAM 결정입니다. 아래 숫자는 2026-08-16에 Hugging Face 저장소에서 읽은 파일 크기입니다.

저장소에 실제로 무엇이 있나요?
orcarouter/Qwen3.8-27B-Uncensored-GGUF는 15개의 모델 파일을 보유하고 있습니다: F16 가중치가 두 부분으로 나뉘어 있고, 12개의 양자화된 GGUF(Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M, IQ4_XS), 그리고 mmproj 비전 프로젝터가 있습니다. 이는 Qwen3.8-27B-Uncensored-FP8과 동일한 abliterated 빌드의 GGUF 내보내기로, llama.cpp 계열 로컬 런타임에 맞게 다시 패키징되었으며, 기본 모델의 Apache 2.0 라이선스와 기본 262,144 토큰 컨텍스트를 상속합니다.
세 가지 속성이 모든 퀀트에 공통으로 적용됩니다. 아키텍처는 qwen35 — 48개의 Gated DeltaNet 선형 레이어와 16개의 전체 어텐션 레이어를 갖춘 하이브리드 어텐션 — 이것이 리포지토리가 이전 llama.cpp 빌드에서 로드되지 않고 KV 캐시가 작게 유지되는 이유입니다. 그 MTP (nextn) 추측 디코딩 헤드는 모든 퀀트(K-quant 및 IQ 모두)에서 보존됩니다. 그리고 채팅 템플릿은 Qwen Jinja 템플릿으로, 명시적으로 활성화해야 합니다(아래 참조). 그렇지 않으면 다중 턴 대화가 깨집니다.
KV 캐시가 중요할 만큼 작게 유지되는 이유
이것이 이 로컬 스토리가 성립하도록 만드는 세부 사항입니다. 64개 레이어 중 16개만 전체 어텐션을 사용하며, 나머지 48개는 기존 KV 캐시를 유지하지 않는 Gated DeltaNet 선형 어텐션을 사용합니다. 이 아키텍처의 원래 런북에서 측정된 실질적 효과는 대략 32K 컨텍스트에서 2GB — 기존 27B가 필요로 하는 용량의 약 4분의 1입니다. 그렇기 때문에 16.8GB Q4_K_M 파일이 긴 컨텍스트 창에서도 24GB 카드에 여전히 들어맞고, 무검열 GGUF 라인이 55.6GB BF16 체크포인트를 전혀 호스팅할 수 없는 하드웨어에서도 플레이 가능한 것입니다.
llama.cpp로 실행하세요.
llama.cpp가 의도된 경로입니다. 최신 빌드가 필요합니다: 트렁크는 qwen35 아키텍처를 등록하며, 이전 빌드는 파일을 완전히 거부합니다. 명령 형태는 모델 카드의 사용 노트와 이 아키텍처의 런북에 따르면 다음과 같습니다:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
그러면 localhost:8080에서 OpenAI 호환 엔드포인트를 얻을 수 있습니다. 이미지 입력을 위해 --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf를 추가하세요. Q4_K_M을 VRAM에 맞는 양자화로 교체하세요. 플래그는 동일합니다.
Ollama로 실행하세요
Ollama는 Modelfile에서 가져와 동일한 파일을 실행합니다. 이는 라이브러리에 없는 GGUF를 추가하는 지원되는 방식입니다. 다운로드한 양자화 모델이 있는 디렉터리에서:
FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
그 줄을 Modelfile로 저장한 다음, ollama create qwen3.8-27b-uncensored -f Modelfile 그리고 ollama run qwen3.8-27b-uncensored를 실행하세요. 비전(vision) 기능을 사용하려면 Modelfile에 mmproj 줄을 추가하세요(FROM ... Q4_K_M.gguf 및 mmproj 경로). 그러면 Ollama가 프로젝터를 자동으로 연결합니다. --ctx 및 템플릿 관련 주의사항도 동일하게 적용됩니다: 실제로 수용할 수 있는 컨텍스트 크기를 설정하고, 거부 응답이 제거된(refusal-removed) 모델은 사용자와 출력 사이에 가드레일 없이 응답한다는 점을 기억하세요.
거부 제거가 실제로 바꾼 것
모델 카드는 이 빌드에 대한 안전성 평가 스위트를 게시합니다. 추론을 끄면, 표준 유해 프롬프트 벤치마크에서의 거부율은 다음과 같이 감소합니다: 베이스 모델의 64–99%에서 0–6%로 abliterated 가중치에서는; 추론을 켜면 거부율은 사실상 거의 없습니다 — 1.7% 이하입니다. 능력 벤치마크는 베이스 모델 대비 ±1.3포인트 이내를 유지합니다. 이것이 이 라인의 모든 abliterated 릴리스의 특징입니다: 거부가 제거되고, 능력이 유지되며, 응답 앞에 짧은 면책 조항을 덧붙이는 답변의 적지 않은 비율이 여전히 존재한다는 주의사항이 있습니다 — 이는 훈련 아티팩트이지 거부가 아닙니다.
이면이 바로 아래 안전 경계의 핵심입니다. 결코 거부하지 않는 모델은 더 나은 어시스턴트가 아니라 다른 종류의 객체입니다. 그것은 거부 메커니즘을 측정하고 자신의 가드레일이 작동하는지 확인하기 위한 테스트 도구입니다.
연구에서 실제로 그것을 어떻게 활용할 것인가
거부 제거 모델의 공식적인 용도인 세 가지 합법적 프로젝트:
이 빌드가 잘못된 답일 때
일반 어시스턴트나 최종 사용자 앞에 둘 만한 무엇이든 원한다면, 이 모델은 잘못된 선택입니다 — 의미 있는 내장 가드레일이 없고, 기본 모델이 거부하는 요청에도 응하며, Apache 2.0은 당신의 책임을 넘겨주지 않습니다. 그런 용도에는 원래 정렬된 Qwen3.8-27B를 사용하세요. 챗봇에서 거부를 우회하고 싶다면, 시스템 프롬프트 팩이 가중치 편집보다 더 큰 효과를 내면서 위험도 더 적습니다. 그리고 GPU가 전혀 없어도 이 모델을 연구하고 싶다면, OrcaRouter의 호스팅 카드 obsidian/Qwen3.8-27B는 동일한 무검열 라인을 제공하며, 입력 토큰 100만 개당 0.40달러, 출력 100만 개당 4.21달러에 동일한 262K 컨텍스트를 제공합니다. 이 카드는 저장소와 동일하게 보안 및 AI 안전 연구자에게만 공개되며, 모더레이션 결정은 여전히 당신의 몫입니다. 그 모델 카드에는 가격과 벤치마크 세부 정보가 있습니다.
안전 경계 — 다운로드 전에 읽어 보세요

이 모델은 안전 정렬이 상당 부분 제거되었습니다. 원래 Qwen3.8-27B가 거부했을 유해하거나 비윤리적이거나 공격적이거나 불법적인 요청에도 응할 것이며, 의미 있는 내장 안전장치가 없습니다. 이 모델은 해석 가능성, AI 안전 및 거부 메커니즘 연구, 레드티밍, 견고성 평가, 통제된 실험 등 정당한 연구 목적으로만 엄격히 공개되었습니다. 사용자는 이 모델을 사용하는 방식과 모델이 생성하는 모든 결과물에 대해 전적인 책임과 법적 책임을 부담하며, 자체적인 안전·중재·악용 방지 계층을 추가하지 않는 한 최종 사용자에게 배포하거나 프로덕션에 배포해서는 안 됩니다. 저자는 오용에 대한 어떠한 책임도 지지 않습니다. 리포지토리를 다운로드하면 이러한 조건에 동의하는 것으로 간주되며, 라이선스는 Apache 2.0입니다.
이 기사에는 의도적으로 유해한 프롬프트가 포함되어 있지 않습니다. 위의 거부 수치는 모델 카드 자체의 안전성 평가 스위트에서 나온 것으로, 이 등급의 모델을 측정하는 올바른 방법입니다: 표준 거부 벤치마크를 실행하고, 수치를 읽고, 그 수치가 보여주는 바에 따라 연구를 설계하십시오.
출처 및 날짜
위의 모든 사실은 2026-08-16에 검증되었습니다. 파일 목록과 크기는 Hugging Face 리포지토리 orcarouter/Qwen3.8-27B-Uncensored-GGUF(2026년 8월 16일 생성, 아키텍처 qwen35, Apache 2.0, 게이티드)에서 읽었습니다. 거부율 및 기능 수치는 모델 카드의 안전성 평가 제품군에서 가져왔습니다. KV-캐시 측정값(32K 컨텍스트에서 약 2GB)은 이 아키텍처의 OrcaRouter 런북인 How to Run Qwen 3.8 27B Locally에서 가져왔습니다. 호스팅 요금 및 게이팅은 같은 날 확인한 obsidian/Qwen3.8-27B 모델 페이지에서 가져왔습니다. 양자화된 파일 크기는 Hugging Face에 저장된 십진수 GB입니다.
합법적인 연구를 위해, 가중치는 Hugging Face에 있습니다: Hugging Face에서 다운로드 — 신용카드 필요 없음, 60초면 바로 사용 가능.
