
Qwen3.8-Flash-Next-Uncensored: llama.cpp 및 Apple Silicon에서 Abliterated MoE 실행하기
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
무엇이든 다운로드하기 전에: Qwen3.8-Flash-Next-Uncensored은 Qwen3.8-27B-Uncensored이 아닙니다. 두 모델은 같은 패밀리 이름과 abliteration 기법을 공유하지만, 서로 다른 가중치 배포판에서 나온 다른 모델이며, 이 블로그의 모든 이전 "Qwen uncensored" 게시물은 27B에 관한 것입니다. 여기서 다루는 대상은 OrcaRouter가 2026년 8월 26일에 Hugging Face에 게시한 두 파일 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF 및 orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — Qwen3.8-Flash-Next의 abliterated 빌드, 알리바바의 Qwen4 아키텍처를 미리 선보이는 176B 저장 / 6B 활성 라우팅 혼합 전문가(mixture-of-experts) 모델입니다. 우리는 이 배포판을 "GGUF + 네이티브 MLX, 최대 262K 컨텍스트"로 발표했으며, 보안 연구자, 레드 팀, 블루 팀을 대상으로 했습니다. 이 런북은 우리의 모델 카드를 바탕으로 작성되었습니다: 라우팅 MoE 내부에서 거부 제거(refusal removal)가 무엇을 하는지, 262K 컨텍스트 주장이 실제로 메모리에서 얼마나 비용이 드는지, 두 파일 라인을 서빙하는 방법, 연구 라인이 어디에 위치하는지. 만약 abliteration 입문서나 27B 양자화 수학(quant math)을 찾아 오셨다면, 이 시리즈의 이전 게시물들이 그 내용을 다룹니다.

먼저, 대문.
두 저장소 모두 Hugging Face에서 게이트 처리되어 있습니다(게이트: 자동). 각 저장소에 로그인하고 저장소 이용약관에 동의하기 전까지는 파일을 다운로드할 수 없습니다 — GGUF와 MLX 저장소는 각각 자체 게이트를 가지고 있습니다. 이것은 게이트가 없는 GGUF 라인과의 가장 실질적인 차이점입니다: 단순한 "hf download" 한 줄 명령은 바이트 하나를 가져오기도 전에 인증 오류로 실패합니다. 흐름은 다음과 같습니다:
• Hugging Face에 로그인(또는 가입)하고 huggingface_hub를 설치한 다음, hf auth login을 한 번 실행하여 토큰을 디스크에 저장하세요.
• 브라우저에서 orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF를 열고 약관에 동의한 다음, orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX에 대해서도 동일하게 반복합니다.
• 그때부터 인증된 토큰으로 hf download를 하면 다른 저장소처럼 작동합니다. 당신이 받는 모든 quant와 MLX weights는 Apache-2.0 하의 연구 산출물입니다 — 기본 모델과 동일한 라이선스죠 — 그리고 그 게이트는 거래의 일부입니다: 약관을 읽는 것이 모델 사용의 첫 단계입니다.

abliteration이 라우팅된 MoE에 어떤 영향을 미치는가
이 기법은 이 블로그의 다른 곳에서 이미 다룬 Arditi 스타일의 가중치 편집입니다. 흥미로운 점은 이 기법이 특히 이 아키텍처에 어떤 영향을 미치는가입니다. dense 27B 모델에서는 131개의 잔차 행렬이었습니다. Qwen3.8-Flash-Next-Uncensored의 MLX 모델 카드에는 149개의 residual-writer 텐서에 abliteration이 적용된 것으로 기록되어 있으며, 이 모델을 바로 그 모델답게 만드는 구성 요소들 — MoE 라우터, 51B n-gram 임베딩 테이블, 비전 타워 — 는 명시적으로 전혀 건드리지 않았습니다.
라우팅된 모델에서 그 "한 번도 건드리지 않음"이 전부입니다. 모든 토큰은 512개 전문가 중 10개를 활성화하며, 거부를 소유한 단일 전문가는 없습니다. 거부 행동은 최종 출력을 구성하는 잔차 스트림에 존재하며, 이는 직교화가 제거하는 방향과 정확히 일치합니다. 따라서 라우터는 동일한 전문가들을 계속 라우팅하고, n-gram 테이블은 동일한 임베딩을 계속 생성하며, 변화하는 것은 출력 투영이 실행된 후 모델이 말하는 내용입니다. GGUF 모델 카드에 게시된 검사 결과는 이러한 변화의 형태를 유해 프롬프트 거부가 기본 모델의 64~100%에서 이 빌드에서는 약 0~3.3%로 감소하고, 무해한 과잉 거부는 0%에 가까우며, MMLU-Pro / GSM8K / CMMLU 방식 검사에서 성능은 기본 모델 대비 ±2포인트 이내로 보고합니다. 이는 카드 자체의 수치로, 독립적으로 재현된 것이 아니라 자체 보고된 값입니다.
MTP 헤드: MLX에는 존재하지만 GGUF에서는 제외됨
Qwen3.8-Flash-Next는 약 4B 규모의 MTP(다중 토큰 예측) 추측 헤드를 탑재하고 있으며, 두 빌드는 이에 대해 서로 다른 입장을 취한다. GGUF 저장소는 이 헤드를 제외한다 — 모델 카드에는 이 파일들이 MTP 추측 초안 헤드를 포함하지 않는다고 명시되어 있다 — 그 이유는 llama.cpp의 qwen4exp 지원이 아직 MTP를 구현하지 않아 헤드가 파일에서 무용지물이 되기 때문이다. MLX 빌드는 이를 유지하므로 Apple Silicon에서는 여전히 추측 디코딩을 사용할 수 있다. 베이스 모델을 실행하는 실무자들이 확인해 준 실제 결과는 다음과 같다. llama.cpp GGUF 라인은 현재 추측 디코딩 없이 실행되는 반면, MTP를 활성화한 SGLang 구성은 동일한 하드웨어 등급에서 디코딩 속도를 두 배 이상 높인다. llama.cpp가 언젠가 qwen4exp용 MTP를 지원하게 되면 GGUF 라인도 공짜로 속도 향상을 얻을 수 있지만, 이번 주에 그렇게 될 것을 기대하며 하드웨어를 구매하지는 말라.
262K 컨텍스트 주장과 KV 캐시 비용
네이티브 컨텍스트는 262,144 토큰(YaRN으로 1M까지 확장 가능)이며, 실제로 제약이 되는 것은 메모리입니다. 좋은 소식은 아키텍처가 KV 캐시를 작게 유지한다는 것입니다. 48개 레이어 중 36개는 Gated DeltaNet 선형 어텐션을 사용하여 히스토리를 고정 크기의 순환 상태로 압축하고, 오직 12개의 전체 어텐션 레이어만 시퀀스 길이에 따라 증가하는 기존 KV 캐시를 보유합니다.
커뮤니티에서 측정한 두 데이터 포인트는 모두 기본 모델에 대한 것이며, 그대로 적용됩니다. RTX 3090 4개 구성의 GGUF 배포에서는 추가 KV가 카드당 약 0.78GB에 불과했음에도 컨텍스트가 65K에서 131K로 증가했다고 보고되었으며, 단일 DGX Spark는 Q4급 파일로 전체 262K 컨텍스트를 실행하면서 n-gram 테이블을 CPU에 고정하고 NVMe에서 mmap하여 모델을 128GB 풀 중 약 76.9GB에 상주시켰습니다. GGUF 모델 카드의 메모리 산정식은 총계 = 파일 크기 + KV 캐시 + 약 0.9GB mmproj입니다. 양자화 선택의 결과는 다음과 같습니다. 262K 컨텍스트에서 KV 캐시는 실질적인 비용 항목이지만, 가중치가 지배적이므로 27B GGUF 가이드의 VRAM 우선 로직이 동일하게 적용됩니다. 차이점은 파일 크기 자체로, IQ2_XXS가 약 52GB에서 Q5_K_M이 약 125GB까지입니다.
GGUF 라인: 13개 양자화 버전, 분할 파일, mmproj, 그리고 llama.cpp 빌드
GGUF 저장소는 13가지 양자화 수준을 제공합니다 — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — IQ 양자화는 영어, 중국어 및 코드 보정 텍스트에 대한 중요도 행렬로 구축되었습니다. 모든 양자화는 다중 부분으로 구성되며, llama-gguf-split으로 분할되므로, 하나의 양자화에 대해 전체 세트를 다운로드하고 로더가 ...-00001-of-000NN.gguf 부분을 가리키게 하십시오. Q6_K, Q8_0 또는 F16 등급은 없습니다. 그 이유는 경제적이기보다 구조적입니다: n-gram(PLE) 임베딩 테이블은 하나의 텐서이며, 6비트 이상에서는 Hugging Face의 파일당 50GB 제한을 충족하기에 너무 큽니다. 단일 GGUF 텐서는 파일 간에 분할할 수 없으므로 라인의 최대는 Q5_K_M입니다.
절대 건너뛰면 안 되는 다른 파일은 mmproj-...-F16.gguf로, 약 0.9GB입니다. 이는 비전-언어 모델이며, llama.cpp는 이미지 입력을 처리하려면 프로젝터가 필요합니다. Qwen3.8-Flash-Next는 멀티모달이고, 이 빌드도 마찬가지입니다 — abliteration은 비전 타워에는 영향을 미치지 않습니다.
{{1}}llama.cpp 지원은 아직 메인라인에 포함되지 않았습니다. 아키텍처 ID는 qwen4exp이며, 기본 빌드는 "unknown architecture 'qwen4_exp'" 오류로 실패합니다. PR #27742(브랜치 qwen4exp/qwen3.8-flash-next)의 빌드가 필요하며, llama-cli, llama-mtmd-cli, llama-server, llama-gguf-split 타겟으로 컴파일해야 합니다. 그다음 서빙 구성은 일반적인 llama.cpp 서버에 Qwen 전용 플래그를 사용하고, 파트 파일의 퀀트 이름을 사용하는 형태입니다:{{/1}}
llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
-c를 수용할 수 있는 컨텍스트로 설정하세요. 카드의 예시는 8192에서 시작합니다. 추론은 기본적으로 활성화되어 있으며 reasoning_content에 반환됩니다. 도구 호출은 OpenAI 호환 엔드포인트를 통해 작동합니다. 위의 샘플링 값은 모델 카드의 권장 사항입니다. 기본 모델을 사용하는 실무자들은 비추론 인스트럭트 모드에서 presence penalty 1.5와 함께 temp 0.7 / top-p 0.80 / top-k 20을 사용하며, --chat-template-kwargs {"reasoning_effort":"medium"}로 추론 깊이를 조정합니다.
Apple Silicon에서의 MLX 빌드
MLX 리포지토리는 네이티브 Apple-Silicon 경로입니다. 동일한 가중치, 동일한 거부 제거, Metal 네이티브 런타임을 사용합니다. 기본적으로 4비트(~163GB), 발표된 6비트 빌드(~192GB), 8비트 등급(~221GB)을 제공합니다. 또한 융합된 3D 전문가와 n-gram 테이블이 명목상 태그보다 높은 정밀도로 유지되기 때문에, 실제 정밀도는 균일 4비트보다 훨씬 높습니다. 모델 카드에는 "4비트" 태그에 대해 가중치당 유효 비트가 약 7.85로 나열되어 있습니다. 이것이 리포지토리 크기가 크게 보이는 이유입니다. n-gram 테이블이 커뮤니티 양자화 모델들이 압축하는 방식처럼 줄어들지 않기 때문입니다.

하드웨어가 실질적인 제약 조건입니다. MLX는 Apple Silicon(Metal)에서만 실행되며, 가중치를 담으려면 통합 메모리가 필요합니다. 모델 카드에는 "163GB 가중치를 처리할 만큼 충분한 통합 메모리를 갖춘 Mac(예: M 시리즈 Ultra)"이라는 문구가 있습니다. 4비트 티어는 192GB급 머신으로, 6비트 빌드는 256GB급으로 취급하세요. 카드의 태그에는 qwen4_exp, MoE, MTP, 함수 호출, 비전-언어 등 전체 기능 세트가 기록되어 있으며, 이미지 입력은 mlx-vlm을 통해 처리됩니다. MTP 추측 헤드도 포함되어 있는데, 이것이 GGUF 라인 대비 MLX 빌드만의 은근한 장점입니다.
The vision path, for those using it
비전-언어 모델이기 때문에, 멀티모달 경로는 부가 기능이 아니라 런북의 일부입니다. llama.cpp에서 이미지 입력에는 mmproj 프로젝터와 llama-mtmd-cli / llama-server를 포함한 빌드가 모두 필요합니다. MLX에서는 텍스트 전용 mlx-lm 드라이버 대신 mlx-vlm으로 구동합니다. 레드팀에게 비전 경로는 흥미로운 평가 작업이 있는 곳입니다: 멀티모달 가드레일, 이미지에 담긴 프롬프트 인젝션, 자체 시스템 스크린샷에 대한 OCR, 그리고 전체 파이프라인을 겨냥한 적대적 이미지가 그것입니다. abliteration이 전체 모델을 포괄하고 비전 타워는 그대로 두기 때문에, 텍스트 헤드에서 거부 반응을 촉발했을 이미지가 단순히 거부 행동이 없는 모델에 도달하게 됩니다. GGUF 카드에 따르면 비전 및 멀티턴 도구 호출이 이 빌드에서 검증되었다고 하지만, 별도의 비전 평가 스위트는 공개되지 않았습니다.
이것이 무엇을 위한 것인지, 그리고 그 선이 어디에 있는지
{{1}}이 빌드는 오직 한 종류의 작업을 위해 존재한다. 즉, 거부 반응이 제거된 모델이 무엇을 할 수 있는지 평가하는 일이며, 이는 시스템을 이해하고 방어하는 데 기여한다.{{/1}} {{2}}레드 팀의 경우, 이는 정중히 거절하지 않는 모델을 상대로 자체 가드레일을 시험한다는 뜻이다{{/2}} — {{3}}프롬프트 인젝션 저항성, 데이터 유출 시나리오, 도구 사용 남용, 그리고 "기본 모델은 거절한다"와 "모델이 실제로는 이것을 할 수 없다" 사이의 간극을 시험하는 것이다.{{/3}} {{4}}그 간극이 바로 abliterated 빌드의 연구 가치 전부다. 그것은 거부 레이어가 숨기고 있던 것, 곧 정책에 의한 보안과 역량에 의한 보안의 차이를 알려 준다.{{/4}} {{5}}블루 팀의 경우, 동일한 가중치는 공격자의 현실적 기준선이다. 적대적 행위자가 이것을 다운로드하여 실행할 수 있다면, 방어 체계는 거절하는 대신 답변하는 모델을 상대로도 견뎌야 한다.{{/5}} {{6}}이를 기반으로 한 평가는 맞춤 제작되어 정렬된 적 없는 모델이 해낼 수 있는 일의 하한선이다{{/6}} — 그렇게 취급하되, 상한선으로 취급하지 말라.
거부를 제거하는 것이 무엇을 바꾸고 무엇을 바꾸지 않는지 분명히 해야 합니다. 그것은 출력 행동을 바꿉니다 — 모델이 더 이상 거부하지 않게 됩니다 — 그러나 능력은 바꾸지 않습니다. 새로운 지식도, 새로운 기술도, 새로운 연산도 없습니다. 동일한 훈련, 모델이 실제로 생성할 수 있는 것에 대한 동일한 한계가 그대로입니다. Abliteration된 모델은 이전에 불가능했던 악성코드를 설계할 수 없습니다. 단지 얼버무리는 대신 답할 뿐이며, 더 허용적으로 바뀌었다고 해서 출력이 더 진실되지는 않습니다. 카드의 ±2점 능력 범위와 거부 수치의 붕괴는 같은 사실을 양면에서 본 것입니다.
경계선이 어디에 있느냐는 gated-repo 계약에 달려 있으며, 이는 형식적인 문구가 아닙니다. 정당한 사용: 자신의 시스템 평가, 모델에 대한 공개 취약점 연구, 탐지 및 방어 평가 구축, 거부 메커니즘 연구. 비정당한 사용: 사용자 대면 어시스턴트로 배포, 소유하지 않거나 테스트 권한이 없는 시스템에 대한 작동하는 멀웨어 또는 익스플로잇 생성, 사기, 무기 자료. Apache-2.0 라이선스와 적용 가능한 법률이 최소 기준이며, 게이트는 그 위에 있는 명시적 연구 목적 계약입니다. 사용 사례가 "사용자에게 챗봇을 제공하는 것"이라면, 이는 귀하의 모델이 아닙니다. 이는 실수가 아니라 의도된 설계입니다.
제공된 기준선을 얻는 방법
이러한 가중치는 의도적으로 로컬 전용입니다. 레드팀의 프로브 페이로드가 제3자 API를 경유해서는 안 되며, 셀프 호스팅이 바로 그 핵심입니다. 비교를 위해 검열된 서비스 기준선이 필요할 때 — 알리바바의 Qwen3.8-Flash, 입력 100만 토큰당 $0.16, 출력 100만 토큰당 $0.47 — OrcaRouter는 공급업체 공시 가격 그대로, 0% 마크업과 자동 장애 조치로 이를 라우팅합니다. 따라서 평가 하네스는 하나의 키로 추가 계약 없이 호스팅 기본 모델과 로컬 비검열 빌드 사이를 이동할 수 있습니다. 오픈 Qwen3.8-Flash-Next 가중치는 아직 저희 카탈로그에 없습니다. 저희가 라우팅하는 런타임이 이를 지원하게 되면, 동일한 원키·공시 가격 체계에 포함됩니다.
여기서 시작하세요
어떤 라인이 자신의 하드웨어에 맞는지 결정한 다음, 해당 게이트를 읽으십시오. 128GB 이상 통합 메모리 Mac에서는 MLX 빌드가 MTP와 비전을 한곳에서 제공하므로, MLX 저장소 약관에 동의하고 4비트 또는 6비트 가중치를 받아 mlx-vlm으로 구동하십시오. NVIDIA, AMD 또는 CPU 환경에서는 PR #27742에서 llama.cpp를 빌드하고, GGUF 저장소 약관에 동의하고, 적합한 양자화 모델을 받은 다음 mmproj 파일을 잊지 마십시오. 두 경우 모두 거부 수치와 성능 범위는 저장소 자체의 것으로, 카드에 게시되어 있으며 이 글을 쓰는 시점까지 재현되지 않았습니다. 이를 정직하게 읽는 방법은 독립적인 감사가 아닌, 공급업체가 자체 편집에 대해 측정한 값으로 보는 것입니다. 위의 게이트, 라이선스, 안전 경계는 세 가지 관점에서 본 동일한 텍스트입니다. 이것은 연구 도구이며, 그러한 조건으로 배포됩니다.
Flash-Next의 5가지 빌드(BF16, GGUF, MLX, FP8, NVFP4)는 모두 Hugging Face의 Qwen3.8-Flash-Next-Uncensored 컬렉션에 모여 있습니다.
27B 제품군과 혼동하지 마세요: Qwen3.8-27B-Uncensored는 다른 베이스에서 abliterated된 다른 모델로, 자체 컬렉션과 자체 런북을 보유하고 있습니다. 동일한 기법, 다른 가중치입니다.
이 가중치는 설계상 로컬 전용입니다. abliterated 빌드를 측정하기 위한 호스팅 기준선으로서, Qwen3.8-Flash는 OrcaRouter에서 공급업체 목록 가격에 0% 마크업으로 제공됩니다 — 안전 정렬이 그대로 유지된 기본 모델입니다.
