
Qwen 3.8 27B Uncensored GGUF:去審查化本地建置、12 種量化版本,與研究專用界線
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
Qwen 3.8 27B uncensored GGUF 是真實可下載的,建議從 Qwen3.8-27B-Uncensored-GGUF 這個版本開始——該版本於 2026 年 8 月 16 日發布於 Hugging Face,是我們 abliterated FP8 版本的 llama.cpp 原生姊妹版本。它具備與 Qwen3.8-27B-Uncensored-FP8 相同、已移除拒絕機制的 270 億參數權重,並轉換為 GGUF 格式以進行本地推論:包含 F16 以及從 Q2_K 到 Q8_0 的 12 種量化等級(包括 imatrix 量化 IQ3_M 與 IQ4_XS)、262K 上下文視窗、獨立的視覺投影器,以及完整的 MTP 推測解碼頭。「Uncensored」意味著 abliterated——拒絕方向已從權重中正交化移除——因此它會在對齊的基礎模型拒絕回答之處提供答案,而這正是它僅供研究使用的原因。以下說明該儲存庫實際包含的內容、哪種量化等級適合你的 GPU、如何在 llama.cpp 中執行它,以及你下載時所接受的安全界線。
30 秒版本:{{1}}F16 加上 12 種量化版本,16.8 GB 的 Q4_K_M 是預設選擇{{/1}},{{2}}你需要 2026 年 5 月或更新版本的 llama.cpp 建置{{/2}},而且{{3}}這是一個沒有護欄的研究工具——不適合部署給終端使用者{{/3}}。
「未審查 GGUF」實際上的含義 — 以及此版本與 FP8 版本的不同之處
GGUF 是 llama.cpp 使用的單一檔案模型格式;FP8 是一種在 vLLM GPU 伺服器上執行的量化方案。我們的兩個無審查版本,是同一組 abliterated 權重,分別以兩種執行環境提供。Qwen3.8-27B-Uncensored-FP8(2026年8月15日)針對伺服器上的 vLLM,重新量化為官方 Qwen3.8-27B-FP8 方案,以在完全相同的核心路徑上提供服務。Qwen3.8-27B-Uncensored-GGUF(2026年8月16日)針對本機上的 llama.cpp — 也就是你掌控的桌面 GPU 或工作站。相同權重,不同的部署模式:雲端 API 對比本機處理程序。
Abliteration 是一種權重層級的介入方式,而非微調。拒絕方向是模型殘差流中的一個向量,當它被啟動時,會產生「我無法協助處理此事」的反應;此建置會找出該方向,並依照 Arditi 等人 2024 年論文(《Refusal in Language Models Is Mediated by a Single Direction》)的方法,將其從權重中正交化去除。過程中不會訓練任何新的權重。基底模型為 Qwen/Qwen3.8-27B——這是一個密集的 27B 模型,採用混合架構(48 層 Gated DeltaNet 線性注意力層與 16 層全注意力層),具備原生視覺能力,並支援 262,144 個 token 的上下文長度。授權為 Apache 2.0,繼承自基底模型。請注意,Qwen 官方倉庫僅提供 BF16 safetensors——沒有官方的 Qwen GGUF——因此任何此模型的未審查 GGUF(包括本檔案)都是開放權重的轉換版本。
量化階梯 — F16 加上12個層級
該儲存庫提供 F16(54.6 GB,分佈於兩個檔案)和 12 個量化層級。以下大小為儲存庫自身的檔案大小,資料讀取於 2026 年 8 月 16 日;GGUF 檔案大小會隨建置版本略有差異。

• F16 — 54.6 GB(2 個檔案) — 參考精度
• Q8_0 — 29.0 GB — 近乎無損,適合高階GPU
• Q6_K — 22.4 GB — 每 GB 品質的最佳甜蜜點
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — 在較大顯示卡上具有高品質
• Q4_K_M — 16.8 GB — 建議的預設選項
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — 最佳低位元之選(經 imatrix 校準)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — 適用於 16 GB 顯示卡
• IQ3_M — 12.8 GB — 佔用空間小(imatrix 校準)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — 最小的 K-quant,品質折衷明顯可見
硬體建議:24 GB 顯示卡(RTX 4090 或 RTX 3090)使用 Q4_K_M;16 GB 使用 IQ4_XS 或 Q3_K_M;若僅有 12 GB,則只能用 Q2_K。由於基礎模型採用混合式 Gated DeltaNet 注意力機制,KV 快取很小——8K 上下文下約為 0.5 GB——因此可將視窗推到遠比傳統 27B 稠密模型更高的程度。視覺功能需另加一個獨立檔案:F16 投影器為 931 MB。同一個基礎模型也有社群製作的 9 量化等級 abliterated 系列;我們的版本是官方記載之 FP8 abliteration 的轉換版,並沿用 imatrix 量化及模型卡上的 refusal-delta 數值。
如何在 llama.cpp 中執行它
三個步驟。一個不明顯的要求:qwen35 架構和 MTP 支援於 2026 年 5 月加入 llama.cpp,因此 請更新至 2026-05 或更新版本的建置——較舊的建置將無法載入這些檔案(依據 repo README 的說明)。
1. 下載您所選的量化版本以及視覺投影器。 該儲存庫設有存取限制(gated),因此您需先登入 Hugging Face 並接受其條件——閱讀 README 是接受此模型本質的一部分。
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. 啟動 llama-server。 這會提供一個與 OpenAI 相容的端點;-ngl 99 / 會將每一層都卸載至 GPU。
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (可選) 啟用 MTP 推測解碼頭。新增 --spec-type draft-mtp/ — nextn 頭已嵌入每個量化模型中,因此無需單獨的草稿模型。

純文字研究執行可省略 --mmproj/;但影像輸入則需要它,因為這是原生視覺語言模型。端點為 http://localhost:8080/v1/chat/completions,因此現有的 OpenAI SDK 程式碼只需替換 base URL 即可運作。
沒有 GPU?同一未經審查的版本也有託管服務。
本地 GGUF 每 token 零成本,但 Q4_K_M 等級需要約 17 GB 的 VRAM。若您沒有相應硬體,OrcaRouter 上代管的 obsidian/Qwen3.8-27B 卡提供相同的無審查 27B 系列——視覺、推理、262K 上下文——每百萬輸入 token 0.40 美元,每百萬輸出 4.21 美元,存取權限僅限於安全研究人員、紅隊和 AI 安全研究人員。相同權重家族,兩種運行方式:本地 GGUF,雲端 FP8。無論哪種方式,審核決定權都掌握在您手中。
安全界限 — 下載前請先閱讀
此模型的安全對齊已被大幅移除。它會遵從基礎 Qwen3.8-27B 會拒絕的有害、不道德、冒犯性或非法請求,而且沒有任何有意義的內建防護措施。它僅為合法的研究目的而發布——可解釋性、拒絕機制研究、紅隊測試、穩健性評估與防護措施測試。您需對如何使用它以及它所產生的所有內容承擔全部責任與法律責任,而且在未加入您自己的安全、內容審核與濫用防範層之前,不得將其部署給最終使用者或投入生產環境。作者不承擔任何責任。授權條款為 Apache 2.0。

測量到的行為告訴你「未審查」所付出的代價。根據模型卡的安全評估套件——在 FP8 建置上執行,日期為 2026 年 8 月 15 日,也就是這個 GGUF 所轉換的權重:有害提示詞的拒答率從基礎版的 64–99% 降至 abliterated 權重的 0–6%,良性過度拒答從 5.6% 降至 0.4%,能力分數則維持在基礎版的 ±1.3 分以內。這些數字就是為何這類模型是正當研究對象的原因——同時也是警訊。
這篇文章刻意不包含任何有害的提示詞。如果你正在評估此模型,請執行標準的拒絕基準測試——AdvBench、HarmBench、StrongREJECT、XSTest-safe——並親自閱讀數據。這是研究一個已移除拒絕機制的模型的正式認可方式。
當這個組建是錯誤的答案時
1. 您想要一個正常的助手。錯誤的模型。它沒有護欄,會遵從有害的請求。請改用已對齊的 Qwen3.8-27B。
2. 任何你會放在終端使用者面前的東西。無論意圖為何,這都是錯誤的模型。Apache 2.0 不會轉移你的責任,將沒有防護措施的模型交付給使用者並非部署策略。
3. 你使用的是 Apple Silicon。GGUF 可以運行,但基礎模型的 MLX 轉換版本更為合適——請參閱我們單獨的 MLX 指南。
4. 你根本不想運行它。 使用託管顯示卡——相同的權重,無需 17 GB 的顯示記憶體,而且同樣僅限研究用途。
底線
「Qwen 3.8 27B uncensored GGUF」有一個答案,而且是具體的下載:Qwen3.8-27B-Uncensored-GGUF — 包含 F16 與 12 種量化層級,適用於 llama.cpp,採用我們 FP8 建置中經過去除拒絕訓練(abliterated)的權重,支援 262K 上下文、視覺與 MTP,以 Apache 2.0 授權釋出,僅限研究用途。在 24 GB 顯示卡上選用 Q4_K_M,將 llama.cpp 更新至 2026 年 5 月之後的版本,然後以本機 OpenAI 相容伺服器的方式執行。它是一件研究工具,用於研究拒絕機制與測試安全護欄 — 不是聊天機器人,也不是可以出貨上市的東西。權重是免費的;你用它們做了什麼,責任完全在你自己。
用於合法研究,F16 與全部 12 個量化層級都位於 Hugging Face:從 Hugging Face 下載 GGUF
