Qwen3.8-27B-Uncensored-NVFP4를 위한 히어로 타이틀 카드로, abliterated Qwen3.8-27B의 Blackwell 서빙용 NVFP4 빌드입니다. GPU 칩 아이콘(FP4 태그), vLLM 번개 아이콘, 262K 컨텍스트 윈도우 게이지, 잠금 아이콘 옆에 'Qwen3.8-27B-Uncensored-NVFP4' 제목과 'A Serving Runbook for Blackwell GPUs' 부제가 표시되며, 오른쪽 하단에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Qwen3.8-27B-Uncensored-NVFP4: Blackwell GPU용 서빙 런북

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen3.8-27B-Uncensored-NVFP4는 2026년 8월 19일부터 Hugging Face에 있었고, 이후 10일 동안 약 32,700회 다운로드되었습니다. 이 글은 출시 보도가 아닙니다 — 가중치는 열흘 된 것이고, 보도할 발표도 없으며, 형제 빌드인 Qwen3.8-27B-Uncensored-FP8Qwen3.8-27B-Uncensored-GGUF는 이미 이 블로그에 문서화되어 있습니다. 이 글은 사람들이 지금 바로 다운로드하고 있는 빌드를 위한 런북입니다: NVFP4가 실제로 무엇인지, 이 특정 빌드가 왜 FP8과 혼합되는지, 어떤 GPU가 이점을 얻고 어떤 GPU는 그렇지 않은지, 서빙하는 방법, 그리고 FP8 또는 GGUF 빌드 대신 이 빌드를 선택해야 하는 사람 — 그리고 선택해서는 안 되는 사람입니다.

먼저 한 가지 분명히 해두겠습니다. 처음 다운로드하는 사람마다 반드시 걸려 넘어지는 문제인데, 이 저장소는 게이트(gated)되어 있습니다. 단순한 hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4 한 줄 명령은 Hugging Face에 로그인하고 모델 페이지에서 저장소의 액세스 약관을 수락하기 전까지는 인증 오류로 실패합니다. 아래 내용은 두 가지를 모두 완료했음을 전제로 합니다.

또한 미리 말하자면: 이 리포지토리의 모델 카드는 동일한 게이트 뒤에 있으므로, 여기의 어떤 내용도 그 카드를 의역한 것이 아닙니다. 이어지는 내용은 공개 파일 목록과 리포지토리 메타데이터, NVIDIA의 공개 NVFP4 문서, 그리고 Blackwell에서 Qwen3.8-27B NVFP4 빌드를 서비스하는 실무자들의 현장 보고에 기반을 두고 있습니다. 숫자가 공급업체가 아닌 실무자에게서 나온 경우, 본문에 그렇게 명시되어 있습니다.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-27B-Uncensored-NVFP4 repo (captured August 29 2026), showing the access gate 'You need to agree to share your contact information to access this model', total downloads of 32,764, the apache-2.0 license, the BF16 / F8_E4M3 / U8 tensor types, and the abliterated, nvfp4, fp4, fp8, vllm and mixed-precision tags.

이 빌드가 무엇인지

Qwen3.8-27B-Uncensored-NVFP4의 NVFP4 양자화 버전이며Qwen3.8-27B-UncensoredAli​baba의 Qw​en/Qwen3.8-27Borcarouter 조직이 2026-08-18에 공개했습니다. Abliteration은 잔여 스트림에서 모델의 거부 방향을 제거합니다. 이 기법은 저희 uncensored-model 설명서에 설명되어 있으며, 여기서는 다시 설명하지 않습니다. 기본 모델은 하이브리드 어텐션을 갖춘 밀집 27B 모델로, 선형 어텐션 레이어 48개와 전체 어텐션 레이어 16개, 기본 이미지 및 비디오 이해, 262,144 토큰 컨텍스트, 내장 MTP 추측 디코딩 헤드를 포함합니다. Apache 2.0 라이선스가 처음부터 끝까지 적용됩니다.

이 빌드가 흥미로운 이유는 abliteration이 아니라 양자화 레이아웃입니다. 의도적으로 양자화된 빌드이기 때문입니다 — NVFP4를 검색했다면 그 포맷이 핵심입니다. 저장소의 공개 메타데이터 및 양자화 구성(config)에 따르면, 이는 혼합 정밀도 compressed-tensors 빌드입니다: 어텐션 프로젝션은 FP8(E4M3), MLP는 NVFP4(4비트, 패킹), 그리고 비전 인코더, MTP 헤드, lm_head 및 선형 어텐션 정규화와 편향은 BF16으로 유지됩니다. 공개 파일 목록의 safetensors 메타데이터는 이 구성과 일치합니다: 약 35억 개의 파라미터가 BF16, 94억 개가 FP8-E4M3, 150억 개가 패킹된 4비트 텐서이며, 디스크에서 약 24.7GB로 다섯 개의 샤드와 별도의 model-extra 샤드에 걸쳐 있습니다. 이 중 어느 것도 서빙 방식에 대한 주장이 아닙니다 — 이 정확한 저장소의 런타임 VRAM 및 처리량은 현재 제가 인용할 수 있는 곳 어디에도 게시되어 있지 않습니다. 디스크 크기는 파일 목록에서, 포맷은 구성(config)에서 비롯되었으며, 아래의 서빙 동작은 밀접하게 관련된 NVFP4 빌드에서 커뮤니티가 검증한 것입니다.

NVFP4가 무엇인지, 그리고 FP8 및 INT8/AWQ와 어떻게 다른지

NVFP4는 NVIDIA의 4비트 부동소수점 형식으로, Blackwell의 5세대 텐서 코어를 위해 도입되었으며, NVIDIA의 공식 기술 블로그가 이에 대한 적절한 1차 출처입니다. 이 형식은 가중치를 E2M1(부호 비트 1개, 지수 비트 2개, 가수 비트 1개)로 저장하고 블록 단위로 스케일링합니다. 즉, 16개 값마다 E4M3 FP8 스케일을 공유하고, 전체 텐서는 텐서별 FP32 스칼라를 갖습니다. 이 2단계 방식이 바로 이 형식의 핵심입니다. 단순한 4비트 부동소수점이 잃어버릴 동적 범위를 블록당 몇 비트의 오버헤드 비용으로 회복합니다. 실용적 차이점을 한 줄로 요약하면:

NVFP4 vs FP8 — 둘 다 부동소수점이지만, FP8(E4M3, 8비트)은 Hopper와 Blackwell에서 실행되는 반면, NVFP4는 4비트이며 Blackwell에서만 기본적으로 가속됩니다. NVIDIA는 FP16보다 약 3.5배, FP8보다 약 1.8배 더 작은 가중치를 언급하며, Blackwell에서는 행렬 곱셈(matmul)이 FP4 텐서 코어에서 직접 실행됩니다.

NVFP4 대 INT8/AWQ — INT8(W8A8)과 AWQ(W4A16)는 Ampere 이후부터 지원되는 정수 형식입니다. AWQ는 4비트이지만 정수이며, 대부분의 하드웨어에서 가중치는 행렬 곱셈을 위해 더 넓은 유형으로 역양자화됩니다. NVFP4는 블록 스케일링이 있는 4비트 부동소수점이므로 하위 비트에서 더 많은 정밀도를 유지하며, 정수 형식에는 없는 네이티브 FP4 GEMM 경로를 갖추고 있습니다.

NVFP4 vs MXFP4 — 이 둘은 자주 혼동됩니다. MXFP4는 32개 요소 블록과 E8M0(2의 거듭제곱) 스케일을 사용합니다. NVFP4는 16개 요소 블록과 E4M3 스케일을 사용합니다. 더 미세한 블록은 NVFP4에 더 나은 이상치 격리를 제공하며, 이것이 이 형식이 Blackwell 서빙 스택에서 사실상의 4비트 표준이 된 이유입니다.

A two-column scoreboard titled 'NVFP4 vs FP8 — the format scoreboard', comparing NVFP4 (4-bit float E2M1, native FP4 GEMM on Blackwell, not accelerated on Hopper, this uncensored build ~24.7 GB on disk, ~3.5x smaller than FP16, best pick on Blackwell for the smallest footprint) against FP8 (8-bit float E4M3, native FP8 GEMM, full Hopper support, this uncensored build ~30.9 GB on disk, ~1.8x smaller than FP16, best pick on Hopper for max fidelity), with a footer line 'Format facts per NVIDIA; build sizes from public file listings.' and the OrcaRouter logo bottom-right.

어떤 하드웨어가 혜택을 받는지 — 그리고 어떤 하드웨어는 그렇지 않은지

이 빌드에 관한 가장 중요한 사실 하나: NVFP4는 Blackwell 포맷입니다. NVFP4는 FP4 GEMM을 네이티브로 구현하는 텐서 코어를 갖춘 GPU에서만 제 역할을 하며, 그 외의 하드웨어에서는 사양상 아무리 빠르더라도 잘못된 도구입니다.

Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — 바로 NVFP4가 적합한 경우입니다: 네이티브 FP4 텐서 코어, uncensored 라인에서 가장 작은 서버급 설치 공간, 그리고 이 빌드를 위해 만들어진 포맷입니다.

Hopper — H100/H200 — 네이티브 FP4 GEMM을 지원하지 않습니다. NVFP4는 더 느리고 이득이 없는 weight-only 디콴트(dequant) 경로로 저하됩니다. 여기서는 Qwen3.8-27B-Uncensored-FP8을 사용하세요. 해당 빌드는 정확히 이 하드웨어에서 검증되었습니다.

Ampere/Ada — RTX 3090/4090 — NVFP4는 이것들에서도 가속되지 않습니다. 16.8GB의 Q4_K_M 등급을 갖춘 GGUF 빌드가 24GB 카드에 적합한 도구입니다.

Apple Silicon — NVFP4는 Mac에서는 의미가 없습니다. 실행되는 것은 MLX 빌드(또는 GGUF)입니다.

솔직히 짚고 가자면, 커뮤니티 포크는 pre-Blackwell 하드웨어에서 NVFP4 weight-only를 실행합니다. 동일한 abliterated 모델의 커뮤니티 NVFP4 빌드는 패치된 vLLM 포크를 통해 V100급 카드용으로 명시적으로 설정되어 있으며, 최근 Qwen3.8-27B 관련 DGX Spark 레시피는 별개의 것입니다. 이는 각자의 주의사항이 있는 전문가용 경로일 뿐, 이 빌드가 목표로 하는 바가 아닙니다. Blackwell 사용자라면 그런 것은 전혀 상관없습니다. Blackwell이 아니라면 FP8 또는 GGUF 빌드가 더 나은 다운로드입니다.

서빙하는 방법

리포지토리는 vLLM용으로 태그되어 있으며, compressed-tensors 형식은 config.json에서 자동으로 읽히므로 양자화 방식을 직접 선택할 필요가 없습니다. Qwen3.8-27B NVFP4 빌드에서 실무자들이 공통적으로 사용하는 스택은 Blackwell 카드에서 구동되는 최신 vLLM, FP8 KV 캐시, 그리고 추측 디코딩에 사용되는 모델 자체의 MTP 헤드입니다. 가장 널리 인용되는 커뮤니티 참고 자료인 Unsloth의 NVFP4 가이드에서는 빠른 FP4 경로를 위해 FlashInfer 및 CUTLASS-DSL 커널 의존성과 함께 vLLM 0.25.0 이상을 권장합니다.

FP8 빌드의 검증된 플래그와 커뮤니티 NVFP4 레시피에서 조합한 작동 가능한 시작점, 모두 한 줄에:

vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'

FP8 KV cache — 캐시 메모리를 절반으로 줄이는 가장 폭넓게 호환되는 방식입니다. 실무자들은 이를 통해 보유할 수 있는 컨텍스트가 대략 두 배로 늘어난다고 보고합니다. NVFP4 KV-cache 지원도 존재하지만 일부 attention 백엔드로 제한되므로, FP8 KV가 더 안전한 기본값입니다.

MTP 추측 디코딩 — 모델에는 MTP 드래프트 헤드가 포함되어 있으며, 양자화는 이를 BF16으로 유지한다. 실무자들은 Blackwell에서 NVFP4 가중치와 함께 드래프트 토큰 2~3개가 잘 작동한다고 보고하며, 특히 JSON 및 도구 호출과 같은 구조화된 출력에서 가장 큰 효과를 본다.

비전 — 이 빌드에서는 비전 인코더가 BF16으로 유지됩니다. 텍스트 전용으로 서비스하려면 --language-model-only를 추가하고, 이미지나 비디오 입력이 필요하면 이를 제거하세요.

DGX Spark에서 — 현장에서 보고된 몇 가지 주의사항: --gpu-memory-utilization을 0.90 이하로 유지하세요 (더 높은 값은 가중치 로드 중에 시스템을 멈추게 했습니다), 그리고 --safetensors-load-strategy lazy를 추가하세요 (메모리가 부족한 경우). 또한 sm_121a 커널을 위해서는 vLLM의 GB10 빌드가 필요합니다.

솔직한 성능 평가: 바로 이 저장소에 대해 공개된 독립적인 처리량 수치는 없습니다. 존재하는 측정값은 밀접하게 관련된 NVFP4 빌드에 대한 것입니다. Unsloth는 자체 Qwen3.8-27B-NVFP4 빌드에서 B200 기준 BF16 대비 초당 토큰 수가 1.41–1.49배라고 보고합니다(배치 1에서 89.8~133.7 tok/s, 배치 64에서 3,048~4,407 tok/s). 또한 NVIDIA 포럼의 한 DGX Spark 사용자는 NVFP4 가중치, FP8 KV 캐시, MTP 깊이 3으로 약 20–32 tok/s를 보고했습니다. 둘 다 인용할 가치가 있지만, 어느 것도 이 저장소의 벤치마크는 아닙니다.

실제로 작동하는 사용 패턴

Blackwell에서 Qwen3.8-27B 계열 모델을 실행하는 실무자들은 몇 가지 설정으로 의견이 모입니다. 이는 벤더 가이드가 아닌 현장 보고서로 취급하세요. Qwen은 이러한 내용의 대부분을 문서화하지 않으며, 이 저장소의 모델 카드 자체도 게이트(gated) 처리되어 있습니다.

reasoning_effort is the dial that matters most. The default xhigh makes the model think for a long time on every request. People running agent loops set medium by default and drop to low — or disable thinking entirely with enable_thinking: false — for latency-sensitive single calls. On a single Blackwell GPU, xhigh reasoning on a routine task is how you end up with a fast model and slow answers.

샘플러는 사고 모드와 짝을 이루며, 독립적이지 않습니다.커뮤니티 합의: 사고 모드 켜짐은 temperature 1.0 / top_p 0.95로 실행되고, 사고 모드 꺼짐은 temperature 0.7 / top_p 0.80과 presence_penalty 1.5로 실행됩니다. 두 설정을 바꾸면 출력 품질이 저하됩니다.

현재 채팅 템플릿을 사용하세요. qwen3_5 템플릿은 모든 어시스턴트 턴을 think 블록으로 감싸며, 오래된 템플릿 때문에 많은 실무자들이 루프나 잘린 응답을 보고했습니다. 커뮤니티에서 수정된 Qw​en-Fixed-Chat-Templates 및 Qw​en-Sharp 변형은 preserve_thinking을 설정하여 루프를 멈춥니다. 서빙된 출력이 stop 토큰을 넘어 계속 이어진다면 이 부분을 가장 먼저 확인하세요.

에이전트 작업에서 긴 추론 트레이스에 대한 예산을 책정하세요. 실무자들은 3.8세대 모델이 3.6세대 전작보다 작업당 약 두 배의 토큰을 생성한다고 보고합니다. 품질 향상은 부분적으로 더 긴 사고 과정 덕분입니다. 긴 xhigh 답변의 경우 추론 출력을 스트리밍하지 않으면 게이트웨이 타임아웃이 발생합니다.

도구 호출은 양자화를 거쳐도 그대로 유지됩니다.함수 호출 경로는 abliteration과 4비트 변환을 모두 견뎌내며, qwen3_coder 도구 호출 파서로 활성화하면 모델은 기본 모델과 동일한 방식으로 도구를 선택합니다.

A screenshot of the Artificial Analysis page for Qwen3.8 27B (medium) (captured August 29 2026), showing an Intelligence score of 44, a speed of 52.3 tokens per second, the comparison summary paragraph, $0.50 per 1M input and $3.00 per 1M output token pricing, and a 256k-token context window.

이 빌드를 선택해야 하는 사람 — 그리고 선택하지 말아야 하는 사람

FP8 및 GGUF 게시물에서 이미 자세히 다룬 양자화 선택 계산을 반복하지 않고, 정직한 결정은 다음과 같습니다:

NVFP4를 선택하세요.Blackwell에서 서빙하고, uncensored 라인에서 FP4 텐서 코어 속도를 갖춘 가장 작은 서버급 풋프린트를 원하고, 정당하게 abliterated 모델이 필요한 연구, 레드팀 또는 해석 가능성 작업을 수행한다면,

Qwen3.8-27B-Uncensored-FP8을 선택하세요, Hopper를 사용 중이거나, 가장 폭넓게 검증된 vLLM 경로를 원한다면 — 8비트에서 동일한 가중치이며, H200에서 검증되었고, 대략 40GB의 VRAM 하한을 가집니다.

소비자용 GPU나 Mac을 사용 중이거나, vLLM보다 llama.cpp를 선호한다면 Qwen3.8-27B-Uncensored-GGUF를 선택하세요 — Q4_K_M 티어가 로컬 환경의 최적 선택입니다.

어느 쪽도 선택하지 마세요, 만약 최대 충실도를 원하거나, 사용자 대면 기능을 구축하거나 (아래 안전 경계 참조), 또는 전혀 자체 호스팅을 원하지 않는다면 — 동일한 무검열 라인이 OrcaRouter를 통해 연구자에게만 제공되므로 GPU가 필요 없습니다.

안전 경계 — 연구 전용

이것은 abliterated 모델이며, 양자화는 가드레일을 다시 추가하지 않습니다. 거부 방향은 Qwen/Qwen3.8-27B의 잔차 스트림에서 제거되었고, NVFP4는 정밀도 변경일 뿐 안전 개입이 아닙니다. 즉, 이 모델은 기본 모델이 거부하는 요청도 수행하며, 이 빌드에는 내장된 콘텐츠 조정 기능이 없습니다. 이 모델은 해석 가능성, AI 안전성 및 레드팀 연구를 위해 Apache 2.0 라이선스로 배포되며, 모든 책임은 사용자에게 있습니다.

검열되지 않은 모델 분야에서 너무 드물게 언급되는 두 가지 평가 노트가 있습니다. 첫째, 단 하나의 탈옥 프로브가 손쉽게 통과한다고 해서 안전성 평가를 통과한 것은 아닙니다 {{1}}— abliterated 모델은 그런 테스트를 의도적으로 실패합니다.{{/1}} 실제로 중요하게 여기는 것을 적절한 평가 묶음(유해성: AdvBench, HarmBench, StrongREJECT; 과잉 거부: XSTest-safe)으로 측정하고, 개입 전후의 거부율을 비교하세요. 둘째, 기본 모델만 평가하지 말고 양자화된 모델도 평가하세요. 4비트 빌드는 종합 점수가 정상으로 보여도 경계 사례에서 동작이 달라질 수 있습니다.{{2}} 자체 모더레이션 및 악용 방지 레이어 없이 최종 사용자에게 배포하지 마세요.{{/2}}

OrcaRouter가 적합한 위치

열흘 된 양자화 빌드는 하드와이어링보다 라우팅을 써야 하는 전형적인 사례입니다. 직접 실행하는 NVFP4 빌드를 가리키는 라우트를 세우고, 빌드가 부하에서 문제를 일으키면 호스팅 모델로 장애 조치할 수 있습니다. 하나의 인터페이스로, 공급자를 전환할 때 재배선 없이 말이죠. OrcaRouter는 공급자 목록 가격을 0% 마크업으로 통과시키므로, 기본 모델의 가격이 변동하면 엔드포인트가 청구 주기가 아니라 당일에 이를 반영합니다.

그리고 핵심이 GPU를 전혀 실행하지 않는 것이라면: 동일한 무검열 라인은 OrcaRouter를 통해 제공되며, 보안 연구원과 레드 팀으로 제한되고, 공급업체 간 자동 장애 조치가 지원됩니다. 이 NVFP4 빌드를 자체 호스팅하든 호스팅된 라인을 호출하든, 어느 쪽이든 API 키 하나면 충분합니다.

요점

Qwen3.8-27B-Uncensored-NVFP4는 Blackwell에서 abliterated 모델을 서빙하고 FP4 텐서 코어 속도로 가장 작은 설치 공간을 원한다면 올바른 다운로드입니다. Hopper(FP8 빌드 사용), 컨슈머 또는 Apple GPU(GGUF 또는 MLX 빌드 사용)에서 사용하거나 최대 충실도가 필요하다면 잘못된 다운로드입니다. 이것은 새로운 것이 아닙니다 — 2026년 8월 19일부터 다운로드 가능했습니다 — 하지만 현재 대량으로 다운로드되고 있으며, 이제 게이트를 수락하기 전에 무엇을 선택하게 될지 알 수 있습니다.

이 모델의 또 다른 빌드가 아닙니다 — Qwen3.8-Flash-Next-Uncensored는 별도의 릴리스입니다: Qwen4 아키텍처의 176B 저장 / 6B 활성 혼합 전문가(MoE) 프리뷰인 Qwen3.8-Flash-Next에서 abliteration된 버전입니다. 동일한 abliteration 기법, 다른 가중치, 자체 컬렉션입니다.

여섯 가지 27B 빌드 — BF16, GGUF, MLX, FP8, INT8, NVFP4 — 가 모두 수집되어 있습니다.Qwen3.8-27B-Uncensored 컬렉션에 Hugging Face에 있는

이 가중치는 설계상 로컬 전용입니다. abliterated 빌드와 비교할 호스팅 기준선으로, Qwen3.8-27B가 OrcaRouter에서 공급업체 정가에 0% 마크업으로 제공됩니다 — 안전 정렬이 그대로 유지된 원본 모델입니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube