기사 'Qwen3.8-Flash-Next-Uncensored-NVFP4: Blackwell 서빙 런북'의 히어로 타이틀 카드로, 헤드라인, 부제목 'Blackwell 서빙 런북 — NVFP4 experts, FP8 attention, BF16 PLE', 그리고 네 개의 사양 칩('Blackwell 전용 — FP4 텐서 코어', '330 GB → 178 GB', 'Hugging Face에서 게이팅됨', '262K 컨텍스트')을 표시하며, OrcaRouter 로고가 오른쪽 하단에 합성되어 있다.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored-NVFP4: 블랙웰 서빙 런북

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen3.8-Flash-Next-Uncensored-NVFP4는 정확히 하나의 GPU 제품군인 Blackwell에서만 실행됩니다. NVFP4는 하드웨어 FP4 텐서 코어에서 실행되며, Hopper(H100/H200) 및 그 이전 세대에는 그러한 코어가 없습니다. Hopper를 사용 중이라면 여기서 중단하세요 — 원하는 것은 Qwen3.8-Flash-Next-Uncensored-FP8 빌드입니다. 아래의 모든 내용은 Blackwell(B100, B200, GB200 또는 RTX 50 시리즈 카드), qwen4_exp를 지원하는 최신 vLLM 빌드, 그리고 transformers ≥ 5.16을 가정합니다.

이것은 Qw​en의 Qw​en/Qwen3.8-Flash-Next abliterated(거부 응답 제거) 빌드를 NVFP4로 양자화한 것입니다. BF16 기준 330 GB에서 디스크 기준 178 GB로 줄었습니다. OrcaRouter가 2026년 8월 27일에 이 모델을 Hugging Face에 orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4라는 이름으로 게시했습니다. 이 저장소는 게이트(gated) 상태입니다. Hugging Face에 로그인하고 저장소의 이용 약관에 동의해야 하며, 그렇지 않으면 hf downloadvllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 둘 다 데이터가 한 바이트도 전송되기 전에 인증 오류로 실패합니다. 이 페이지는 출시 보도가 아니라 서빙 런북(serving runbook)입니다. 이 빌드는 나온 지 이틀밖에 안 되었으며, 사람들이 실제로 맞닥뜨리는 질문은 하드웨어, 플래그, 그리고 어떤 빌드를 고를지입니다.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 repo (captured August 29 2026), showing the gate banner 'You need to agree to share your contact information to access this model', 'Login or Sign Up to review the conditions', Model size 125B params, tensor types F8_E4M3 · BF16 · U8 · I64, the apache-2.0 licence, the base-model line Qwen/Qwen3.8-Flash-Next, and the abliterated, uncensored, nvfp4, fp4, fp8, vllm and vision-language tags.

그리고 숫자가 시작되기 전에: Qwen3.8-Flash-Next-UncensoredQwen3.8-27B-Uncensored가 아닙니다. 둘은 같은 패밀리 이름과 abliteration 기법을 공유하지만 서로 다른 모델입니다 — 서로 다른 기본 가중치, 서로 다른 아키텍처, 서로 다른 Hugging Face 컬렉션을 가집니다. Flash-Next는 Qw​en/Qwen3.8-Flash-Next에서 abliteration되었으며, 이는 Qwen4 아키텍처(qwen4_exp)의 라우팅된 mixture-of-experts 프리뷰입니다: 10개의 라우팅된 전문가와 1개의 공유 활성 전문가로 구성된 512개 전문가, 하이브리드 어텐션(전체 어텐션 레이어와 함께하는 Gated DeltaNet 선형 레이어), Hyper-Connections, PLE n-gram 임베딩, 네이티브 비전 및 비디오 타워, MTP 추측 디코딩 헤드를 갖습니다. 27B는 Qw​en/Qwen3.8-27B에서 abliteration되었으며, 이는 전혀 다른 밀집(dense) 기본 모델입니다. 27B 페이지의 서빙 수치는 이 모델에 전혀 적용되지 않습니다. 27B 페이지가 실제로 유용한 부분 — abliteration 입문서, 일반적인 양자화 선택 계산 — 은 아래에 무엇이 적용되고 적용되지 않는지와 함께 링크되어 있습니다.

A scoreboard card for Qwen3.8-Flash-Next-Uncensored-NVFP4 with six rows: base model Qwen/Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + accepted terms), precision NVFP4 experts - FP8 attention - BF16 PLE, on-disk size 178 GB from 330 GB BF16, KV cache BF16 (not quantized), hardware Blackwell only (FP4 tensor cores); footer reads 'All figures from the orcarouter model card, August 29 2026 - self-reported, not independently audited.'

이 빌드가 무엇인지, 정밀함 하나하나를 짚어가며

Qwen3.8-Flash-Next는 라우팅 MoE입니다. 모든 토큰은 512개의 전문가 중 10개와 공유 전문가 1개를 활성화하며, 저장된 모델이 훨씬 더 큼에도 불구하고 토큰당 실제로 활성화되는 파라미터는 수십억 개에 불과합니다. NVFP4 빌드는 해당 스택의 혼합 정밀도 압축 텐서 양자화이며, 분할이 핵심입니다:

MoE 전문가 가중치 — NVFP4 (4비트, NVIDIA FP4 E2M1, FP8 블록 스케일을 갖춘 그룹-16).

• 주의 (self_attn.{q,k,v,o}), linear_attn 프로젝션, 공유 전문가(shared expert), lm_head — FP8 (8-bit)로 설정.

• PLE n-gram 임베딩, 토큰 및 비전 임베딩, Hyper-Connections, QSA 인덱서, Gated-DeltaNet conv/dt, 모든 norm, 그리고 전체 비전 타워 — BF16, 전체 정밀도로 유지됨.

변환의 세 가지 속성은 정밀도 구분 자체보다 더 중요합니다. 첫째, 이 변환은 가중치 전용이라는 점입니다. 활성화는 런타임에 동적으로 양자화되고, 정적 캘리브레이션은 없으며, 가중치는 BF16 체크포인트에서 직접 파생됩니다(카드는 이 파생을 데이터 프리(data-free)라고 부릅니다). 둘째, abliteration 편집은 가중치에 내장되어 있어 거부 제거가 양자화 후에도 유지됩니다. 4비트 변환은 정밀도 변경이지 안전 개입이 아닙니다. 셋째, KV 캐시는 양자화되지 않으며 런타임에 BF16으로 유지됩니다. 마지막 항목은 놓치기 쉬운데, 모델의 기본 262,144-토큰 컨텍스트에서는 KV 캐시가 가중치와 함께 실제 메모리 비용 항목이 되므로 중요합니다.

디스크 상 용량은 하나의 텐서가 대부분을 차지합니다. 카드 설명에 따르면 PLE n-gram 임베딩은 설계상 BF16으로 유지되는 단일 ~66B 파라미터 텐서이며, 이는 가장 큰 샤드이자 빌드 용량이 더 작은 수치가 아닌 178GB가 된 이유입니다. 덮어두지 않고 짚고 넘어가야 할 불일치가 하나 있습니다. FP8 자매 카드는 동일한 테이블을 51B 파라미터 PLE n-gram으로 표기하고, 이 카드의 W4A4 노트는 약 100GB로 언급합니다. 두 카드는 동일한 테이블에 대해 서로 다른 수치를 제시하므로, 각각 해당 카드의 수치로 취급하십시오. 배포 규모를 산정할 때는 테이블이 BF16 기준으로 크다고 가정하고 그에 맞춰 계획하십시오.

하드웨어 전제 조건, 자세히 설명하면

이것은 페이지에서 가장 짧지만 가장 중요한 섹션입니다. NVFP4는 Blackwell 형식으로, 빠른 경로는 5세대 텐서 코어에서의 네이티브 FP4 GEMM이며 해당 하드웨어가 없으면 실행될 수 없습니다. 카드 자체의 요구 사항은 명확합니다. 즉 Blackwell GPU(B100 / B200 / GB200 / RTX 50 시리즈)입니다. NVFP4는 하드웨어 FP4 텐서 코어를 사용하므로 FP4 연산이 없는 Hopper(H100/H200) 또는 이전 세대에서는 실행되지 않습니다.

리다이렉트, 한 곳에:

• Hopper(H100/H200)에서는 — 대신 Qwen3.8-Flash-Next-Uncensored-FP8을 제공하세요. 동일한 가중치를 8비트로 사용하며, Hopper와 Blackwell에서 실행되고, 이 블로그의 FP8 실행 가이드(runbook)가 다루는 빌드입니다.

• 소비자용 NVIDIA GPU 또는 CPU 시스템에서 — 13개의 llama.cpp 퀀트를 포함한 GGUF 빌드가 로컬 실행 방법입니다.

• Apple Silicon에서 — 4/6/8비트 등급의 MLX 빌드는 네이티브 Metal 경로입니다.

런타임 요구 사항은 실리콘만큼이나 구속적입니다. qwen4_exp는 완전히 새로운 아키텍처이므로, 이를 지원하지 않는 기존 vLLM 빌드는 체크포인트 로드를 거부합니다. qwen4_exp 지원 및 compressed-tensors NVFP4 리더(형식은 수동 선택이 아닌 config.json에서 감지됨)를 갖춘 최신 vLLM과 transformers ≥ 5.16이 필요합니다. 멀티모달 입력에는 런타임의 Qw​en 비전 스택이 추가로 필요하며, 텍스트 전용 서빙은 그것 없이도 작동합니다.

카드의 serve 명령, 플래그별로

모델 카드 자체의 호출 방법은 좋은 출발점이며, 각 플래그의 용도를 이해하는 것이 무작정 복사해서 붙여넣기보다 훨씬 중요합니다:

vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

--tensor-parallel-size 4 — 가중치가 디스크에서 약 178GB이므로 카드가 이를 4개의 GPU에 분할합니다. 이것이 빌드가 크기에 맞춰진 형태이며, 제안으로 간주하지 마십시오.

--trust-remote-code — 사용자 정의 아키텍처에 필요합니다. qwen4_exp의 모델링 코드는 아직 표준 transformers 레지스트리에 등록되지 않았으므로, vLLM이 저장소에서 아키텍처 코드를 로드합니다. 이는 코드를 신뢰한다는 뜻이며, 완전히 새로운 아키텍처에서는 일반적이면서도 실질적인 결정입니다.

--enable-expert-parallel — 전문가를 복제하는 대신 텐서 병렬 랭크들에 걸쳐 분할합니다. 이것이 TP4에서 512-전문가 MoE를 실현 가능하게 만듭니다. FP8 자매 카드는 해당 빌드에서 더 명확한 이유를 설명합니다. 즉, 그것 없이는 MoE 중간 너비를 TP로 나눈 값이 FP8 블록 크기로 나누어떨어지지 않습니다. 선택 사항이 아니라 필수로 취급하십시오.

--enable-auto-tool-choice 및 --tool-call-parser qwen3_coder — 이 두 가지가 함께 함수 호출을 활성화합니다. auto 플래그는 모델이 도구 호출 여부를 결정하도록 하며, qwen3_coder 파서는 해당 도구 호출 형식을 해석합니다. 이는 Qwen3.8-27B와 Qwen3.8-Flash-Next가 사용하는 것과 동일한 파서 계열입니다.

일단 가동되면, /v1/chat/completions의 OpenAI 호환 엔드포인트는 런타임의 Qwen4 스택을 통해 전체 기능 세트를 제공합니다: 위에서 설명한 도구 호출, chat_template_kwargs.enable_thinking을 통한 추론, 그리고 image_url 콘텐츠 부분을 통한 비전 기능입니다. 멀티모달을 위해 별도의 서버가 필요하지 않습니다. 동일한 엔드포인트입니다.

카드의 구조적 참고 사항: 이 빌드에는 완전히 정적인 W4A4 변형이 없으며, 저렴하게 만들 수도 없습니다. 정적 W4A4 변환에는 활성화 보정 순방향 패스가 필요하며, 해당 패스는 단일 GPU에서 약 100GB의 n-gram 임베딩을 유지해야 합니다. 이것은 PLE 테이블이 파일 목록을 지배하는 것과 같은 이유이며, 이 빌드가 동적 활성화와 함께 가중치 전용으로 유지되는 이유이기도 합니다.

커뮤니티 현장 보고서 — 이를 섬기는 것이 실제로 어떤 모습인지

이 정확한 저장소에 대한 처리량이나 지연 시간 수치는 게시되지 않았으며, 이 페이지는 이를 임의로 만들어 내지 않을 것입니다. 실제로 존재하는 것은 기본 Qwen3.8-Flash-Next NVFP4 빌드를 서빙하는 실무자들로부터의 증가하는 현장 보고서입니다 — 동일한 아키텍처, 동일한 NVFP4/FP8/BF16 정밀도 분할, abliteration 편집만 제외하고 — 그리고 서빙 동작은 그대로 적용됩니다. 이는 커뮤니티 발견 사항이지 공급업체 지침이 아니며, 이를 보고한 사람들은 동일한 양자화 방식을 사용하는 Blackwell 하드웨어에 있었습니다.

MTP 추측 디코딩은 단연 가장 큰 성능 향상 요인입니다. 이 모델은 다중 토큰 예측 드래프트 헤드를 탑재하며, RTX PRO 6000(96GB, SM120) 하나에서 MTP 모듈은 NVFP4로 양자화되어 약 0.51GB의 VRAM을 차지합니다. 보고서는 최대 4 중 2.3~3.9의 수용 길이와 0.86~0.96의 수용률을 측정했습니다. 같은 보고서는 대략 105 tok/s의 기준선과 비교해 단일 스트림 디코딩 중앙값이 180~226 tok/s(코딩 216.9, 에이전트 도구 호출 워크로드 225.8, 추론 136.6)라고 측정했으며, 216,685 토큰 프롬프트에 8.4초 만에 응답했습니다. 이 숫자는 사양이 아니라 한 사람의 시스템에서 나온 것으로 취급하세요.

PLE n-gram 임베딩을 호스트 RAM으로 오프로드하세요. 테이블이 매우 크고 처리량 병목인 경우가 드물기 때문에, 단일 Blackwell 카드에 대한 커뮤니티 레시피에서는 이를 호스트에 고정하고 (RTX PRO 6000 보고서에서 ~50 GiB의 여유 호스트 RAM) NVMe에서 mmap하여, 약간의 지연 시간을 희생하면서 모델을 아예 맞출 수 있게 합니다. 매우 큰 VRAM 예산이 없는 한 이런 방식을 사용할 것으로 예상하세요.

컨텍스트 창을 명시적으로 고정하세요.BF16 KV 캐시와 MTP가 활성화된 상태에서 자동 크기 조정된 KV 풀이 카드가 수용할 수 있는 용량을 넘어 부풀어 올라 긴 프리필 중 OOM이 발생했습니다. max-model-len / max-total-tokens를 262144로 고정하면 여유 공간이 회복되었습니다. 262K 컨텍스트에서 KV 캐시는 기본값이 아니라 예산을 세워야 하는 항목입니다.

FlashInfer autotune 버그가 조용히 출력을 손상시킵니다. 현장에서 가장 중요한 장애 모드는 autotune이 지연 시간만으로 fused-MoE 커널 전략을 선택하고 수치 정확성을 전혀 확인하지 않는다는 것입니다. 그 결과 일부 shape에서 디코딩이 반복 토큰으로 붕괴됩니다. RTX PRO 6000 보고서에서는 autotune을 켠 상태에서 36개 생성 중 36개가 손상되었고, 끈 상태에서는 36개 중 0개가 손상되는 것으로 재현되었습니다. 해결 방법은 FlashInfer autotune을 비활성화하는 것입니다 (vLLM에서는 --no-enable-flashinfer-autotune, SGLang에서는 --disable-flashinfer-autotune). 서비스 중인 출력이 갑자기 저하된다면 다른 것을 건드리기 전에 이 항목부터 확인하세요.

DGX Spark (GB10, SM121)는 자체 패치가 필요합니다.NVFP4 가중치(커뮤니티 빌드 기준 약 126GiB)는 128GB Spark 하나에 맞지 않으므로, SGLang 레시피는 RoCE를 통해 두 노드에 걸쳐 tensor-parallel 2로 실행됩니다. QSA 희소 디코드 리졸버는 is_sm100_supported() 검사를 통과해야만 빠른 FlashInfer 커널을 사용할 수 있게 되어 있는데, 이 검사가 SM121에서 실패하여 워밍업 중 죽는 경로로 폴백합니다. 해결책은 작은 패치와 PLE 오프로드입니다. 디코드 속도는 ~47–50tok/s가 예상되며, MTP4와 CUDA 그래프를 사용하면 70 부근까지 피크를 냅니다. 벤치마크를 약속하기 전에 커널이 실제로 SM121에서 실행되는지 확인하세요.

Qwen4 스택을 통한 추론, 도구 호출 및 비전

Qwen3.8 세대에 대한 커뮤니티 합의는 이 모델에도 그대로 적용되며, 평소와 같은 주의사항은 이것이 공급업체 지침이 아닌 현장 관행이라는 점입니다.

가장 중요한 다이얼은 reasoning_effort입니다.채팅 템플릿은 기본적으로 xhigh로 설정되어 모델이 모든 요청에서 길게 생각하게 합니다. 에이전트 루프 운영자는 기본적으로 medium을 설정하고 지연 시간에 민감한 호출에는 low로 낮춥니다. enable_thinking을 false로 설정하면 추론이 필요하지 않을 때 추론을 완전히 비활성화합니다. 단일 Blackwell 카드에서 일상적인 호출에 xhigh를 유지하는 것은 빠른 모델이 느린 답변을 만드는 방식입니다.

샘플러와 추론 모드를 함께 사용하세요.실무자들은 추론 모드가 켜져 있을 때 temperature 1.0 / top-p 0.95, 꺼져 있을 때 temperature 0.7 / top-p 0.80 및 presence penalty 약 1.5로 수렴합니다. 두 세트를 혼합하면 출력 품질이 저하됩니다.

도구 호출은 abliteration과 4비트 변환 모두에서도 살아남습니다. 함수 호출 경로는 온전하게 유지되며, 이것이 qwen3_coder 파서와 auto-tool-choice 플래그가 연결하는 부분입니다. 레드 팀에게 이는 양날의 검과 같은 사실입니다. 정렬되지 않은 모델에서 에이전트 악용이 완전히 작동한다는 뜻이기 때문입니다 — 아래에서 다룹니다.

비전이 보존되며, 그로 인해 공격 표면이 넓어집니다. 비전 타워는 abliteration의 적용을 전혀 받지 않았고 BF16 상태를 유지하므로, 이미지 입력은 image_url 콘텐츠 파트를 통해 작동합니다. 검열되지 않은 라인을 평가하는 실무자들은 멀티모달 경로를 일급 평가 대상으로 취급하는데, 이는 이미지에 실린 프롬프트 인젝션이 거부 동작이 전혀 없는 모델에 그대로 도달하기 때문입니다.

어떤 빌드를 제공해야 합니까?

Flash-Next 컬렉션에는 BF16, GGUF, MLX, FP8, 그리고 이 NVFP4 빌드까지 다섯 가지 빌드가 있으며, 솔직한 선택 기준은 순위가 아니라 하드웨어와 트레이드오프에 관한 것입니다.

NVFP4 (이 빌드, 디스크에서 약 178GB) — Blackwell 추천 빌드입니다. FP4 텐서 코어, 4비트 experts, 컬렉션에서 가장 최신 빌드이자 vLLM 서버 빌드 중 가장 작은 빌드이며, 이 페이지에서 다루는 빌드입니다.

FP8 (디스크에서 약 186GB) — Hopper에 적합한 선택이며, Blackwell에서도 마찬가지로 잘 작동합니다. 동일한 가중치를 8비트로 저장한 것으로, 더 널리 검증된 vLLM 경로이자 전문가 병렬 요구 사항이 더 명확한 경로입니다.

GGUF (13가지 양자화, IQ2_XXS ~52 GB에서 Q5_K_M ~125 GB까지) — 소비자용 NVIDIA, AMD 또는 CPU 시스템을 위한 llama.cpp의 선택. Blackwell도 vLLM도 필요 없습니다.

MLX (4/6/8비트 등급, 약 163–221GB) — Apple Silicon용 선택, 네이티브 Metal, MTP 헤드 포함.

선택하기 전에 솔직한 참고 사항 두 가지를 드립니다. 첫째, NVFP4와 FP8 빌드는 디스크에서 약 8GB 차이밖에 나지 않습니다. 둘 다 대용량 n-gram 테이블을 BF16으로 유지하기 때문이며, 4비트 절감 효과는 전체 용량이 아니라 전문가 가중치에 집중되어 있습니다. Blackwell에서 NVFP4의 진짜 장점은 그 전문가들에 대한 FP4 텐서 코어 속도이지, 파일 크기가 획기적으로 작아지는 것이 아닙니다. 둘째, 카드에는 NVFP4가 결정론적 가중치 도출 방식으로, 4비트 전문가로 인한 약간의 추가 품질 트레이드오프와 함께 abliteration 평가를 그대로 이어받는다고 설명되어 있지만, 그 트레이드오프를 수치화하지는 않습니다. 이는 수치화되지 않은 것이므로, 더 작은 전문가로 인한 실질적이지만 명시되지 않은 비용으로 취급하시기 바랍니다. 무시할 수준이 아닙니다.

평가를 올바르게 읽음

해당 카드는 vLLM으로 서빙된 BF16 빌드에서 측정된 abliteration을 공식 {{KEEP}}Qw​en/Qwen3.8-Flash-Next{{/KEEP}}와 대비하여 보고합니다: {{1}}유해 프롬프트 거부율이 64–100%에서 대략 0–3.3%로 붕괴하고, 무해한 프롬프트의 과잉 거부율은 거의 0에 머물며, 성능은 기본 모델 대비 ±2포인트 이내입니다.{{/1}} 이 수치에 대해 올바르게 이해해야 할 세 가지가 있습니다. {{2}}이는 BF16 빌드에서 측정된 값으로, 이 4비트 빌드에서는 직접 측정된 것이 아니라 추론에 의해 물려받은 값입니다.{{/2}} {{3}}이는 공급업체 자체 수치이며, 컬렉션의 카드들이 발표용이 아닌 참고용으로 설명하는 규칙 기반 시작 문구 분류기로 생성된 것입니다. 즉, 자체 편집에 대한 내부 측정이지 독립적인 감사가 아닙니다.{{/3}} 그리고 {{4}}이 수치는 위에서 언급한 NVFP4 품질 트레이드오프에 대해 아무것도 말하지 않으며, 카드는 이를 수치화하지도 않습니다.{{/4}}

안전 경계 — 연구 전용

카드의 면책 조항은 노골적이며, 이 페이지에서 가장 판에 박힌 문구처럼 읽혀서는 안 되는 부분입니다. 이 모델은 안전 정렬이 상당 부분 제거되었습니다. 잔여 스트림(residual stream)에서 거부 방향(refusal direction)을 직교화하여 제거했기 때문에, 원래 Qwen3.8-Flash-Next라면 거부했을 유해하거나 비윤리적 또는 불법적인 요청에도 이 모델은 응할 것입니다. 이 모델은 해석 가능성, AI 안전성 및 거부 메커니즘 연구, 레드티밍, 견고성 평가 등 정당한 연구 목적으로만 배포되며, 저자들은 오용에 대한 어떠한 책임도 지지 않습니다. 모델이 생성하는 결과물에 대한 전적인 책임은 사용자에게 있으며, 어떤 결과물이 사용자에게 닿기 전에 자체적인 안전 및 중재 계층을 추가해야 합니다. Apache 2.0이 최소 기준이며, 그 위에 연구 목적 게이트가 자리합니다.

무검열 모델에 관한 논의가 잘못 짚는 두 가지가 있으며, 이 모델 카드는 그 점들을 놓칠 수 없게 만든다. 첫째, 이 모델을 상대로 성공하는 탈옥 프로브는 안전성 평가를 통과한 것이 아니라, 그 모델이 내세우는 동작 그 자체다. Abliterated 모델은 그러한 프로브를 의도적으로 실패시킨다. 단일한 '탈옥할 수 있나' 테스트로 측정하는 것은 편집이 작동했는지를 측정하는 것이지, 가드레일이 강한지를 측정하는 것이 아니다. 둘째, 보존된 비전 타워와 온전한 도구 호출 경로는 실제 공격 표면을 텍스트 너머로 넓힌다. 이미지 입력 프롬프트 인젝션과 에이전트 도구 오용이 모두 완전히 작동하며, 이것이 정확히 레드팀 프레이밍이 이 모델을 챗봇 후보가 아닌 능력 프로브로 취급하는 이유다. 사용 사례가 사용자 대면 어시스턴트를 출시하는 것이라면, 이 모델은 당신을 위한 모델이 아니며, 그것은 의도된 바다.

OrcaRouter가 적합한 위치

이틀 된, 게이트된, 자체 호스팅 전용 빌드는 하드와이어링 대신 라우팅을 사용해야 하는 전형적인 사례입니다. 이 NVFP4 빌드를 직접 실행하면, 그 빌드를 가리키고 부하가 걸릴 때 빌드가 문제를 일으키면 호스팅된 모델로 장애 조치되는 라우트를 만들 수 있습니다. 하나의 인터페이스만 사용하므로 공급자를 전환할 때 재연결할 필요가 없습니다. 특히 평가 작업의 경우, 검열된 서빙 기준 모델이 비교 대상으로 적합하며, 이는 한 번의 키 입력으로 접근할 수 있습니다. 카탈로그에는 Ali​baba의 Qwen3.8-Flash가 입력 100만 개당 $0.15, 출력 100만 개당 $0.47에 제공되며, 공급업체 정가 그대로 0% 마크업으로 전달됩니다. 따라서 레드팀 하네스는 추가 계약 없이 호스팅된 검열 기본 모델과 로컬의 무검열 빌드 사이를 전환할 수 있으며, 공급업체의 가격 변동은 같은 날 엔드포인트에 반영됩니다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash (captured August 29 2026), showing the tagline 'Qwen3.8 Flash is a multimodal reasoning model from Alibaba', the Vision / Tools / JSON / Reasoning feature tags, pricing of $0.15 per 1M input tokens and $0.47 per 1M output tokens, a 1M-token context window with 131K max output, and the API endpoint https://api.orcarouter.ai/v1.

이것을 다운로드해야 하는 사람 — 그리고 다운로드하지 말아야 하는 사람

Blackwell을 사용 중이고, FP4 텐서 코어 속도를 갖춘 Flash-Next 컬렉션에서 가장 작은 서버 풋프린트를 원하며, 이 라인이 존재하는 이유인 연구 작업을 수행 중이라면 orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4를 다운로드하세요. Hopper를 사용 중이거나 더 폭넓게 검증된 경로를 원한다면 Qwen3.8-Flash-Next-Uncensored-FP8을 다운로드하세요. 소비자용 GPU나 CPU 시스템을 사용 중이라면 GGUF 빌드를, Apple Silicon을 사용 중이라면 MLX 빌드를 다운로드하고, 사용자 대상 배포가 목표라면 아무것도 다운로드하지 마세요. 어느 쪽이든 수락하기 전에 게이트와 고지 사항을 읽으세요. 그것들은 형식적인 것이 아니라 모델의 약관입니다.

Flash-Next의 5가지 빌드(BF16, GGUF, MLX, FP8, NVFP4)는 모두 Hugging Face의 Qwen3.8-Flash-Next-Uncensored 컬렉션에 모여 있습니다.

이것의 또 다른 빌드가 아니라 다른 모델입니다: Qwen3.8-27B-Uncensored는 다른 베이스에서 abliteration되었으며, 자체 컬렉션과 자체 런북을 보유하고 있습니다.

이 가중치는 설계상 로컬 전용입니다. abliterated 빌드를 측정하기 위한 호스팅 기준선으로서, Qwen3.8-Flash는 OrcaRouter에서 공급업체 목록 가격에 0% 마크업으로 제공됩니다 — 안전 정렬이 그대로 유지된 기본 모델입니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube