{{1}}'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' 기사용 히어로 타이틀 카드{{/1}}로, {{2}}'Qwen3.8-27B-Uncensored-MLX' 헤드라인{{/2}}, {{3}}'The Apple Silicon Runbook' 부제목{{/3}}, {{4}}2-bit, 4-bit, 6-bit, 8-bit로 표시된 퀀트 칩 행{{/4}}({{5}}4-bit 강조{{/5}}), {{6}}양식화된 LM Studio 창{{/6}}({{7}}{{KEEP}}'4-bit build at repo root'{{/KEEP}} 표시{{/7}}), {{8}}262K 컨텍스트 모티프{{/8}}, {{9}}모서리에 OrcaRouter 로고가 합성된 형태{{/9}}입니다.
Guides & Insights

Apple Silicon에서 Qwen3.8-27B-Uncensored-MLX: 빌드 고르는 방법, LM Studio 또는 mlx-vlm에서 로드하는 방법, 그리고 262K 컨텍스트 길들이기

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

가장 알아두면 좋은 점은orcarouter/Qwen3.8-27B-Uncensored-MLX에 대해 실행할 때 하위 폴더를 선택할 필요가 없다는 것입니다. OrcaRouter의 abliterated, Apple-Silicon 빌드인 Qw​en/Qwen3.8-27B는 — 2026년 8월 17일에 Hugging Face에 게시되었으므로 새롭지는 않지만 문서화가 부족한 — 4비트 빌드의 사본을 저장소 루트에 유지합니다. 이는 특히 하나의 저장소를 하나의 모델로 취급하는 도구, 가장 중요하게는 LM Studio가 전혀 구성 없이 로드할 수 있도록 하기 위한 것입니다. 이 한 가지 결정 덕분에 이 카드는 지난 한 달 동안 약 83,000건의 다운로드를 기록했으며, 비슷한 MLX 변환 모델은 그에 비해 아주 적은 다운로드를 받고 있습니다. 그 외의 모든 것은 실제 선택입니다: 네 가지 정밀도 중 어떤 것이 Mac의 통합 메모리에 맞는지, 어떤 러너를 사용하는지, 선택한 비트 폭에서 비전 및 도구 호출 기능이 유지되는지, 그리고 262,144 토큰 컨텍스트 창이 하드웨어에서 감수할 비용만큼 가치가 있는지 여부입니다. 이 런북은 그러한 결정들을 순서대로 안내합니다. 이것은 자사 문서입니다. 아래의 크기, 정밀도 및 정확도 수치는 OrcaRouter 자체가 이 정확한 빌드에서 측정한 것이며, 모든 커뮤니티 수치는 그렇게 표시되어 있습니다.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

이 레포에는 정확히 무엇이 들어 있나요?

이것은 Qwen/Qwen3.8-27B의 abliterated 빌드입니다 — 27B 규모의 밀집 하이브리드 어텐션 모델(Gated DeltaNet 선형 어텐션 + 전체 어텐션)로, 기본적으로 비전-언어 기능을 갖추고 있으며 사고 제어, 도구 호출, 다중 토큰 예측(MTP) 헤드, 262,144 토큰 컨텍스트 창을 지원합니다. Abliteration은 잔차 스트림에서 거부 방향을 직교화하여 모델의 거부 행동을 제거합니다. 이 기법이 처음이라면 이 페이지보다 해당 기법에 대한 입문서를 먼저 읽는 것이 좋습니다. 이 페이지는 방법론이 아니라 빌드 실행에 관한 내용이기 때문입니다. 가중치는 기본 모델에서 상속된 Apache-2.0 라이선스를 따릅니다.

이 저장소를 qwen-3-8-27b-mlx와 혼동하지 마세요. 그것은 MLX 형식의 동일한 기본 모델이며 abliteration 상태입니다. 독자들은 종종 하나를 다른 것으로 착각합니다: 이쪽은 거부 응답 제거 연구용 빌드이고, 저쪽은 Apple Silicon용 일반 Qw​en/Qwen3.8-27B입니다. 다운로드 시간을 낭비하기 전에 저장소 이름을 확인하세요.

보기보다 중요한 구조적 세부 사항이 하나 있습니다: 비전 타워, 모든 정규화(norm), 그리고 선형 어텐션 conv1d는 BF16으로 유지되고, 언어 모델의 선형 레이어만 — 다음을 포함하여: embed_tokenslm_head — 양자화됩니다. 이것이 양자화 후에도 이미지 이해가 유지되는 이유이며, 또한 아래의 디스크 내 크기가 단순한 "27B at N bits" 추정치보다 약간 더 큰 이유이기도 합니다. 모델의 일부는 결코 압축되지 않기 때문입니다.

결정: 어떤 빌드가 어떤 Mac에 맞는지

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

네 가지 정밀도가 하위 폴더로 제공됩니다 — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — 모두 그룹 크기 64의 MLX 아핀 양자화입니다. 4-bit 빌드는 저장소 루트에도 추가로 미러링되어 있습니다. Mac의 통합 메모리를 먼저 기준으로 선택하고, 품질은 두 번째로 고려하세요:

8비트 — 디스크에서 약 27.5GB를 차지하며, 64GB Mac이 필요합니다(32GB 머신에서도 로드할 수 있지만 다른 작업을 위한 공간이 거의 남지 않습니다). BF16 소스 대비 코사인 충실도는 0.9997로 사실상 무손실에 가깝습니다. 품질이 가장 중요하고 메모리가 넉넉할 때 선택하세요.

6비트 — 약 22GB, 24~32GB Mac에 적합합니다. 충실도 0.9996, 우수함. 48GB 머신 사용자 대부분에게 GB당 품질 대비 최고의 균형입니다.

4-bit — 약 15GB, 24GB Mac에서 충분히 쾌적합니다. 충실도 0.996, 매우 좋습니다. 이것이 우리가 권장하는 기본값이며, 그 이유로 저장소 루트에 있는 사본입니다.

2비트 — 약 8.7GB로 16GB Mac에 맞습니다. 충실도는 0.92이고, 27B에서는 심각하게 저하됩니다: 반복 루프, 깨진 텍스트, 코드와 중국어, 부분적 시각 인식. 카드에는 분명히 적혀 있습니다 — 보관용일 뿐 실제 작업용이 아닙니다. 16GB Mac은 기술적으로 로드할 수 있지만, 그렇다고 사용 가능한 것은 아닙니다.

{{1}}디스크 상의 크기는 메모리 수치와 다릅니다.{{/1}} {{2}}가중치는 macOS, KV 캐시, Metal의 스크래치 버퍼와 함께 통합 메모리에 들어가야 하므로 여유를 남겨두어야 합니다.{{/2}} {{3}}M1 Pro 32GB Mac에서 4비트 빌드의 커뮤니티 실행은 디스크 상 가중치가 약 16GB였지만 추론 피크는 18.5–21.7GB로 측정되었습니다. 8비트 MLX 빌드의 커뮤니티 실행은 가중치가 약 29.5GB임에도 불구하고 피크가 약 34–36GB로 보고됩니다.{{/3}} {{4}}동일한 커뮤니티 테스트에서 나온 실무 지침은 다음과 같습니다. 16GB는 27B 모델에 실질적인 옵션이 아니며, 24GB는 짧은 컨텍스트로 4비트를 시도할 수 있고, 32GB가 무난한 시작점입니다.{{/4}} {{5}}저희 VRAM 계획 문서는 전체 제품군에 대해 동일한 계산을 설명합니다.{{/5}}

리포지토리 전체 목록은 모든 정밀도를 합쳐 약 94GB에 달하므로, 필요한 하위 폴더만 다운로드하세요:hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — 선택한 정밀도로 바꿔서요. 루트의 4-bit 복사본은 4-bit 하위 폴더와 중복되므로 둘 다 받을 필요가 없습니다.

첫 번째 방법 — LM Studio, 설정 불필요

루트 4비트 복사본은 LM Studio가 전체 저장소를 하나의 모델로 취급할 수 있도록 하기 위해 특별히 존재합니다. 모델 ID를 검색하고 원하는 정밀도를 선택하면(루트 복사본은 4비트입니다) 앱이 나머지를 처리합니다. 세 가지 주의사항은 모두 우리 카드에서 나온 것이며, 이것이 작동과 실패 사이의 모든 차이를 만듭니다:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

이 리포지토리는 접근이 제한되어 있습니다. 익명 다운로드는 HTTP 401 오류가 발생합니다. 모델 페이지에서 약관에 동의한 다음, Hugging Face 읽기 토큰을 LM Studio의 Settings → Integrations → Hugging Face에 붙여넣으세요. 이 과정을 건너뛰면 로드가 그냥 실패합니다.

KV 캐시 양자화를 끄십시오.MLX 비전 모델은 이 아키텍처에서 KV 캐시 양자화를 지원하지 않으며, 활성화하면 초기화 중 로딩이 실패합니다(mlx-engine#286으로 추적됨). 이는 GGUF 빌드에 대한 조언과 반대입니다. GGUF 빌드에서는 K/V 캐시를 양자화하는 것이 실질적인 VRAM 절약이지만, 두 형식은 여기서 상호 교환할 수 없습니다.

런타임을 업데이트하세요. qwen3_5 아키텍처 지원은 mlx-vlm 0.6.x에 추가되었으며, 이전에 번들된 런타임은 이러한 가중치를 전혀 로드할 수 없습니다. 반면, LM Studio의 "Likely too large" 배지는 RAM 경고일 뿐 오류가 아닙니다. 통합 메모리가 위의 지침을 충족한다면 무시하세요.

LM Studio에서 어떤 정밀도를 선택해야 할까요: 8비트는 디스크에서 약 29.5GB이며 64GB Mac이 필요합니다. 6비트는 약 22GB로 48GB 장치에 적합합니다. 4비트는 약 16GB로 32GB Mac에서 올바른 선택입니다. 다른 하드웨어에서 llama.cpp / Ollama 경로를 원한다면, 검열되지 않은 모델용 로컬 실행 가이드에서 해당 경로를 별도로 다룹니다.

경로 2 — 하위 폴더의 mlx-vlm 및 mlx-lm

명령줄 경로는 정밀한 제어를 직접 제공하며 에이전트 도구용 Open​AI 호환 서버도 제공합니다. 요구 사항: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 및 mlx ≥ 0.32; Metal 백엔드는 Apple Silicon에서 자동으로 선택됩니다). 위에서 하위 폴더를 다운로드한 후:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "양자 얽힘을 한 문장으로 설명하세요." --max-tokens 256

추가하세요--image path/to/image.png비전 입력을 위해, 또는 서빙하세요:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

비전은 양자화에서 살아남는다

비전 타워와 conv1d가 BF16으로 유지되므로 4/6/8비트에서도 이미지 이해가 보존됩니다. 프로브 이미지(모양, 색상, 위치, 배경, 이미지 내 텍스트)에서 4/6/8비트 빌드는 모든 것을 올바르게 설명했지만, 2비트는 부분적으로만 설명했습니다. 빌드를 선택할 때 비전이 중요하다면 4비트가 최저 권장 수준입니다. 이 빌드에 대한 Apple Silicon 특화 비전 처리량은 공개하지 않았으므로, 자신의 칩 클래스에서 명명된 실행 결과가 아닌 한 tok/s 수치를 신뢰하지 마십시오.

보존된 비전 타워 역시 위험 표면의 일부이며, 이를 분명히 말할 가치가 있습니다. 이미지도 읽을 수 있는 abliterated 모델은 텍스트 전용 안전 문제가 아닙니다.

도구 호출 및 에이전트 사용

도구 호출은 베이스 모델 고유의 기능이며, abliteration 후에도 유지됩니다. 이 때문에 이 빌드는 에이전트 시스템을 레드티밍하는 데 실질적으로 유용하면서도, 실제 서비스를 겨냥하면 실질적으로 위험해집니다. 표준 설정은 위의 mlx_lm.server 엔드포인트이며, 모든 OpenAI 호환 에이전트가 접근할 수 있습니다. 에이전트로 실행한다면 자신이 무엇을 활성화했는지 이해하십시오. 거부 응답이 없는 모델에 함수 호출과 262K 컨텍스트가 결합된 것은 채팅 모델과는 다른 안전 태세이며, 카드가 연구 전용으로 규정된 것도 바로 그런 이유입니다.

262K 컨텍스트와 그 실제 비용

이 아키텍처는 이 모델에게 비정상적으로 저렴한 긴 컨텍스트를 제공한다. 여기서 하이브리드 어텐션이란 48개의 선형 어텐션(Gated DeltaNet) 레이어가 16개의 전체 어텐션 레이어와 번갈아 배치된 구조를 의미하며, 오직 16개의 전체 어텐션 레이어만이 기존의 KV 캐시를 보유한다 — 선형 레이어는 대신 컴팩트한 순환 상태를 유지한다. 따라서 262,144개의 토큰은 전체 어텐션 27B에서보다 훨씬 적은 비용이 든다. 이는 기본 모델에 대한 구조적 사실이지, 사용자의 Mac에 대한 약속이 아니다.

실제로 이 컨텍스트 윈도우는 무료 티어가 아니라 하나의 역량입니다. M4 Max에서 진행된 커뮤니티 장문맥 테스트에서는 짧은 컨텍스트에서 약 63 tok/s를 기록했고, 31K 토큰에서는 약 11 tok/s까지 떨어졌습니다. 캐시가 차오르면서 디코드 성능이 급격히 저하되며, 매우 긴 프롬프트에서의 첫 토큰 지연 시간이 보통 순수 처리량보다 더 큰 장벽입니다. 추측 기반 및 ANE 기반 프리필은 디코드가 아닌 입력 처리를 개선합니다. 이 빌드에 대한 자체 Apple-Silicon KV-캐시 비용 수치는 공개되지 않았습니다. 자신의 하드웨어에 대한 정확한 수치가 필요하다면 커뮤니티 벤치마크가 정직한 출처이며, 커뮤니티 합의는 262K 전체를 기본적으로 켜 두는 기본값이 아니라 의도적으로 사용하는 기능으로 취급하는 것입니다.

속도 — 실제로 측정되는 것

우리는 이 빌드에 대해 정확히 하나의 속도 수치만 공개하며, 그것은 Apple Silicon이 아닙니다. MLX CUDA 백엔드를 통한 단일 H200에서 약 32–37 tok/s의 안정 상태 속도로, 이는 가중치가 macOS 외부에서도 실행됨을 확인시켜 줍니다. Mac에서는 저희 카드가 의도적으로 tok/s를 공개하지 않습니다. 칩, 정밀도, 러너에 따라 달라지기 때문입니다. 알아 둘 가치가 있는 실무자 수치이며, 모두 그렇게 표시되어 있습니다:

• 이 정확한 빌드, 4비트, M1 Pro 32GB: 짧은 실행에서 생성 속도 약 8.7 tok/s, 프리필 속도 약 41.7 tok/s (커뮤니티 테스트, 2026년 8월). 오래된 칩이지만 현실적인 하한선입니다.

네이티브 MTP를 지원하는 oMLX를 M4 Max에서 실행했을 때, 원본(비-abliterated) 체크포인트 기준으로 산문 53.3 tok/s, 코드 72.1 tok/s를 기록했고, 4K에서 프리필 속도는 약 273.7 tok/s였습니다. MTP 없이 원시 디코딩할 경우 약 24.6 tok/s입니다. 이 수치는 실무자가 다른 체크포인트와 런타임에서 측정한 것이므로, abliterated 가중치가 접근할 수 있는 상한선으로 보아야 하며 보장된 성능은 아닙니다.

• M3 Ultra에서 oMLX 듀얼-ANE 프리필(abliterated oQ4e-MTP): 프리필 속도가 16K에서 약 17.7%, 32K에서 약 18.9% 향상되었고, Lightning MTP를 통한 디코딩은 16K에서 최대 약 75 tok/s에 달합니다. 한계도 분명합니다. 비공개 Apple 런타임 인터페이스와 근사 INT8 가중치를 사용하며, 최대 메모리를 약 4GB 추가로 소모하고, 모델 로드 시간을 약 3.4초에서 28초로 늘립니다. 이는 프롬프트 입력 최적화이지 생성 가속기가 아닙니다.

MTP 헤드 — 러너가 지원한다면 무료 속도 향상

이 빌드는 기본 모델의 다중 토큰 예측 드래프터를 mtp/ 하위 폴더에 포함합니다 (아키텍처 qwen3_5_mtp). 또한 모든 주요 정밀도에서 작동합니다. 수용은 무손실입니다 — greedy 디코딩 시 출력은 드래프터 없이 실행한 것과 동일합니다 — 따라서 적용될 때 품질 손실 없이 진정한 속도 향상을 제공합니다. 모델 카드의 두 가지 설정 참고 사항: mlx-vlm 빌드는 다음을 포함해야 합니다: qwen3_5_mtp 드래프터 (main 브랜치), 그리고 다음 두 가지를 모두 전달해야 합니다: --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp--draft-kind mtp. 설정 mtp_enabled 만으로는 아무 효과가 없습니다. 러너가 드래프터를 지원하지 않으면 드래프터는 무시되고 모델은 정상적으로 실행됩니다 — 아무것도 깨지지 않습니다.

안전 — 실행하기 전에 읽으세요, 실행한 후가 아니라

모델 카드 자체의 면책 조항은 이례적으로 솔직하며, 이 페이지는 그 점을 완화하지 않습니다. 이 빌드의 안전 정렬은 상당 부분 제거되었습니다. 이 모델은 기본 Qw​en/Qwen3.8-27B가 거부했을 유해하거나 비윤리적이거나 공격적이거나 불법적인 요청에도 응하며, 의미 있는 내장 안전장치가 없습니다. 이 모델은 오직 합법적인 연구—해석 가능성, AI 안전 및 거부 메커니즘 연구, 레드팀(red-teaming), 견고성 평가, 통제된 실험—을 위해서만 배포되었습니다. 그런 목적이 아니라면, 이 모델은 적합하지 않습니다.

카드의 두 가지 경고는 강조할 가치가 있다. 첫째, 탈옥 및 안전성 검사는 무력화된 모델에서 사소하게 '성공'하는데, 이는 안전성 평가를 통과한 것이 아니라 거부 방향이 제거된 모델의 예상된 동작이다. 거부가 없다는 것은 안전의 증거가 아니다. 둘째, 유지된 비전, 도구 호출 및 262K 컨텍스트는 공격 표면을 이미지 이해와 에이전트 활용으로 확장한다. 스크린샷을 읽고 도구를 호출할 수 있는 무검열 모델은 채팅 전용 거부 제거 빌드보다 더 광범위한 위험이다. 저비트 양자화는 그 위에 세 번째 불안정 계층을 추가한다. 2비트에서는 깨진 출력이 거부로 오인될 수도 있는데, 이는 그 자체로 혼란스러운 실패 유형이다.

귀하는 사용 및 출력물에 대한 전적인 책임과 법적 책임을 집니다. Apache-2.0 라이선스는 기본 모델에서 상속되며 이 사실을 변경하지 않습니다. 즉, 사용을 허용할 뿐 배포의 안전을 보장하지 않습니다. 이를 최종 사용자, 미성년자 또는 프로덕션 환경에 배포하려는 모든 사람은 먼저 자체적인 모더레이션, 안전 및 악용 방지 계층을 추가하고 관련 법률을 준수해야 합니다. 실제로 이를 실행하는 연구자의 경우 실질적인 안전장치는 다음과 같습니다: 격리된(가급적 오프라인) 환경, 실제 서비스를 대상으로 하지 않는 에이전트 도구, 최종 사용자에 대한 노출 금지, 그리고 출력물이 외부로 나가기 전에 검토하는 것입니다.

로컬이 답이 아닐 때

로컬이 이 빌드의 핵심입니다. 가중치는 디스크에 있고, 토큰당 비용이 없으며, 어떤 것도 기계 밖으로 나가지 않습니다. 하지만 로컬은 또한 한계입니다. Apple Silicon 전용이며, 양자화 품질을 감수해야 하고, 기계가 바쁘면 중복성이 없습니다. 실제 워크로드를 위해 API를 통해 non-abliterated 27B급 모델이 필요하거나, 동일한 프롬프트로 로컬 빌드와 호스팅 모델을 A/B 비교하려는 경우, 그 간극을 메우기 위해 라우팅 레이어가 존재합니다. OrcaRouter는 200개 이상의 모델을 하나의 API 키로 공급업체 목록 가격에 제공하며, 자동 장애 조치와 라우팅 DSL을 갖추고 있습니다. 공급업체의 가격 인하는 발표 당일에 저희 쪽에서도 적용되는데, 저희는 목록 가격을 그대로 전달하기 때문입니다. 하나의 API, 하나의 통합으로, 두 번째 계정을 만들지 않고도 검증되지 않은 로컬 설정을 호스팅 모델과 비교할 수 있습니다. 저희는 이 MLX 빌드를 호스팅하지 않습니다. 설계상 로컬 가중치이기 때문이며, API는 그 대체가 아니라 보완하는 경로입니다.

빠른 의사결정 가이드

• 16 GB Mac — 솔직히 이 모델은 아닙니다. 2비트는 맞지만 보관 전용일 뿐입니다. 어느 쪽이든 메모리와 싸우게 될 것입니다. 더 작은 무검열 모델이나 18–24 GB 머신을 위해 만들어진 커뮤니티 혼합 3/6비트 변환을 살펴보세요.

• 24GB Mac — 4비트, 그리고 컨텍스트를 짧게 유지하세요. 비전과 긴 컨텍스트를 동시에 실행하지 마세요.

• 32 GB Mac — 4-bit가 최적이며, 컨텍스트를 작게 유지한다면 6-bit도 괜찮습니다.

• 48GB Mac — 헤드룸이 있는 6비트; 윈도우를 밀지 않으면 8비트.

• 64GB 이상 — 8비트, 거의 무손실, 그리고 위의 주의사항과 함께 262K 컨텍스트가 가능합니다.

이것이 전체 런북입니다. 이 모델은 2026년 8월 17일자 모델이며, 출시 뉴스가 아니고 그럴 필요도 없습니다. 83,000건의 다운로드는 사람들이 하우투(how-to)를 원했기 때문에 이루어졌고, 이 페이지가 바로 그 하우투입니다. 저장소(repo) 루트에서 시작해 LM Studio에서 4비트를 로드하고, 품질과 무엇을 맞바꾸는지 알게 될 때만 기본 빌드를 유지하세요. GGUF 또는 FP8 계열에서 오셨다면 관련 가이드에서 해당 경로를 다룹니다. 여기의 의사 결정 프레임워크는 동일하지만, 양자화(quant) 수학은 다릅니다.

이 모델의 또 다른 빌드가 아닙니다 — Qwen3.8-Flash-Next-Uncensored는 별도의 릴리스입니다: Qwen4 아키텍처의 176B 저장 / 6B 활성 혼합 전문가(MoE) 프리뷰인 Qwen3.8-Flash-Next에서 abliteration된 버전입니다. 동일한 abliteration 기법, 다른 가중치, 자체 컬렉션입니다.

여섯 가지 27B 빌드 — BF16, GGUF, MLX, FP8, INT8, NVFP4 — 가 모두 수집되어 있습니다.Qwen3.8-27B-Uncensored 컬렉션에 Hugging Face에 있는

이 가중치는 설계상 로컬 전용입니다. abliterated 빌드와 비교할 호스팅 기준선으로, Qwen3.8-27B가 OrcaRouter에서 공급업체 정가에 0% 마크업으로 제공됩니다 — 안전 정렬이 그대로 유지된 원본 모델입니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube