
如何在本機執行 Qwen3.8-27B-Uncensored:GGUF 量化版本、llama.cpp 與 Ollama
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
要在本機執行 Qwen3.8-27B-Uncensored,請從 Hugging Face 拉取需申請存取的 GGUF 儲存庫 orcarouter/Qwen3.8-27B-Uncensored-GGUF,依你的 VRAM 挑選量化版本——24 GB GPU 用 Q4_K_M(16.8 GB),16 GB GPU 用 IQ4_XS(15.3 GB),想要更多上下文空間時則用 Q3_K_M(13.5 GB)——並使用現行的 llama.cpp 建置版本搭配 --jinja 旗標進行部署,若需要視覺功能則加上 --mmproj。 同一個檔案只需三個指令即可匯入 Ollama。這是 abliterated Qwen3.8 27B 建置版的 GGUF 格式,於 2026 年 8 月 16 日釋出,每個量化版本都保留了原生 262K 上下文、視覺投影器(vision projector)與 MTP 推測解碼頭(speculative-decoding head)。它是研究工具,不是助理:它已移除拒絕行為,沒有內建護欄,授權為 Apache 2.0。下載前請先閱讀本頁底部的安全界線——這就是這個需申請存取儲存庫的意義所在。
依 VRAM 該下載哪個 GGUF
該儲存庫提供一個全精度配對和十二個量化檔案,因此下載與否其實取決於 VRAM。以下數字是 2026-08-16 自 Hugging Face 儲存庫讀取的檔案大小。

這個 repo 裡實際上有什麼?
orcarouter/Qwen3.8-27B-Uncensored-GGUF 包含十五個模型檔案:F16 權重拆成兩部分、十二個量化 GGUF——Q2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M、Q6_K、Q8_0、IQ3_M 與 IQ4_XS——以及 mmproj 視覺投影器。它是與 Qwen3.8-27B-Uncensored-FP8 相同之 abliterated 建置的 GGUF 匯出,重新包裝以供 llama.cpp 類別的本地執行環境使用,並繼承基礎模型的 Apache 2.0 授權及其原生 262,144 token 的上下文長度。
三個特性在所有量化版本中保持一致。其架構為 qwen35——採用混合注意力機制,包含48個Gated DeltaNet線性層與16個全注意力層——這正是該儲存庫無法在舊版llama.cpp版本中載入、且KV快取能保持小巧的原因。該MTP(nextn)推測解碼頭在所有量化版本中均予以保留,無論是K-quant還是IQ皆然。此外,聊天模板為Qwen Jinja模板,你必須明確啟用(見下文),否則多輪對話會出錯。
為什麼 KV 快取依然小到不容忽視
這就是讓本地部署故事得以成立的關鍵細節。在 64 層中,僅有 16 層使用完整注意力機制;其餘 48 層使用 Gated DeltaNet 線性注意力,完全不保留傳統的 KV 快取。根據此架構的原始操作手冊測量,實際效果是 KV 快取約為32K 上下文下的 2 GB——大約是傳統 27B 模型所需記憶體的四分之一。這就是為什麼 16.8 GB 的 Q4_K_M 檔案仍能裝進 24 GB 顯示卡並支援長上下文視窗,也是為什麼未經審查的 GGUF 系列能在連 55.6 GB BF16 檢查點都完全無法容納的硬體上順利運行。
使用 llama.cpp 執行它。
llama.cpp 是預期的途徑。你需要目前的建置版本:主幹已註冊 qwen35 架構,而較舊的建置版本會直接拒絕該檔案。命令的形式,根據模型卡的使用說明和此架構的運行手冊,是:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
這會讓你在 localhost:8080 取得一個 OpenAI 相容的端點。若要進行影像輸入,請加上 --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf。請將 Q4_K_M 換成符合你 VRAM 的量化版本;其旗標完全相同。
使用 Ollama 執行它
Ollama 透過從 Modelfile 匯入同一個檔案來執行,這是新增不在模型庫中的 GGUF 的支援方式。在存放您下載的量化檔的目錄中:
./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
將該行儲存為 Modelfile,然後ollama create qwen3.8-27b-uncensored -f Modelfile再ollama run qwen3.8-27b-uncensored。若要用於視覺功能,請在 Modelfile 中加入 mmproj 那一行(FROM ... Q4_K_M.gguf 加上 mmproj 路徑),Ollama 會自動將投影器接好。同樣的 --ctx 與範本注意事項也適用:設定你實際上能容納的上下文大小,並記住,移除了拒絕回應機制的模型,會在沒有任何防護欄的情況下直接回答你。
拒絕移除實際上改變了什麼
模型卡發布了此版本的安全評估套件。在關閉思考模式時,標準有害提示基準上的拒答率從基礎模型的64–99%降至0–6%(去對齊權重);開啟思考模式時則幾乎從不拒答——1.7%或更低。能力基準與基礎模型維持在±1.3個百分點以內。這就是此系列每次去對齊發布的型態:移除拒答、保留能力,並附帶一項提醒——仍有相當比例的回答會在回應前加上一段簡短免責聲明,這是訓練產物,而非拒答。
另一面正是以下安全邊界的重點所在:一個從不拒絕的模型並不是更好的助手,而是一種不同類型的物件。它是一種用於測量拒絕機制、並查明你自己的護欄是否有效運作的測試儀器。
在研究中實際該如何使用它
三個合法專案,為移除拒絕機制之模型的核准用途:
當這個組建是錯誤的答案時
如果你想要一個普通的助手,或任何你會放在終端使用者面前的東西,那這個模型就是錯的——它沒有實質的內建護欄,它會順從基礎模型拒絕的請求,而且 Apache 2.0 不會免除你的責任。那種用途請用原始對齊的 Qwen3.8-27B。如果你想在聊天機器人上迴避拒絕,系統提示詞套件比調整權重更能達成目標,風險也更低。如果你完全沒有 GPU,但仍想研究這個模型,OrcaRouter 上託管的 obsidian/Qwen3.8-27B 提供相同的無審查版本,輸入 token 每百萬 0.40 美元、輸出每百萬 4.21 美元,同樣有 262K 上下文;它和這個 repo 一樣,僅開放給安全和 AI 安全研究人員,而且審核決定仍然在你這邊。該模型卡包含定價和基準測試詳細資訊。
安全界限 — 下載前請先閱讀

此模型的安全對齊已被大幅移除。它會順從原始 Qwen3.8-27B 會拒絕的有害、不道德、冒犯性或非法請求,而且沒有任何具實質意義的內建護欄。它僅為合法的研究目的而發布:可解釋性、AI 安全與拒答機制研究、紅隊測試、穩健性評估及受控實驗。您需對自己的使用方式以及它所產生的所有內容承擔全部責任與法律責任;除非您自行加入安全、內容審核與濫用防護層,否則不得將其部署給終端使用者或投入生產環境。作者對任何濫用行為概不承擔責任。下載此儲存庫即表示您接受上述條件;授權條款為 Apache 2.0。
這篇文章刻意不含任何有害提示。上述的拒絕數字來自模型卡自身的安全評估套件,這是衡量此類模型的正確方式:執行標準的拒絕基準測試,閱讀數據,並根據數據所顯示的結果來設計你的研究。
來源與日期
以上所有事實均已於 2026-08-16 驗證。檔案清單與大小取自 Hugging Face 儲存庫 orcarouter/Qwen3.8-27B-Uncensored-GGUF(建立於 2026 年 8 月 16 日;架構 qwen35;Apache 2.0;需授權存取)。拒絕回應與能力數據來自模型卡的安全評估套件。KV-cache 測量(32K 上下文約 2 GB)取自 OrcaRouter 針對此架構的 runbook《How to Run Qwen 3.8 27B Locally》。託管定價與存取限制來自 obsidian/Qwen3.8-27B 模型頁面,於同日查證。量化檔案大小以 Hugging Face 上儲存的十進制 GB 為準。
若為合法研究用途,權重可在 Hugging Face 上取得:從 Hugging Face 下載 — 無需信用卡,60 秒內即可使用。
