適用於科技部落格主視覺的編輯式平面向量插畫,主題是在自有硬體上本機執行未經審查、已去除安全限制(abliterated)的大型語言模型:畫面中央偏左漂浮著一顆深藍色的大型圓角模型晶片,散發柔和的青色光芒;晶片內部電路從封閉的鎖頭形狀逐漸溶解成開啟的鎖頭形狀。晶片右側是放在工作檯上的小巧 GPU 顯示卡,以及一個纖薄的終端機視窗,視窗內有抽象的橫向指令列,旁邊還有一隻小小的羊駝剪影。上方角落有一個小型顯微鏡圖示,以及一面綴有警告三角形的圓角盾牌,暗示研究用途與安全界線。背景為柔和的淺藍色與白色,下方三分之一留有寬敞的空白空間。畫面中沒有可讀文字。
Guides & Insights

如何在本機執行 Qwen3.8-27B-Uncensored:GGUF 量化版本、llama.cpp 與 Ollama

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

要在本機執行 Qwen3.8-27B-Uncensored,請從 Hugging Face 拉取需申請存取的 GGUF 儲存庫 orcarouter/Qwen3.8-27B-Uncensored-GGUF,依你的 VRAM 挑選量化版本——24 GB GPU 用 Q4_K_M(16.8 GB),16 GB GPU 用 IQ4_XS(15.3 GB),想要更多上下文空間時則用 Q3_K_M(13.5 GB)——並使用現行的 llama.cpp 建置版本搭配 --jinja 旗標進行部署,若需要視覺功能則加上 --mmproj。 同一個檔案只需三個指令即可匯入 Ollama。這是 abliterated Qwen3.8 27B 建置版的 GGUF 格式,於 2026 年 8 月 16 日釋出,每個量化版本都保留了原生 262K 上下文、視覺投影器(vision projector)與 MTP 推測解碼頭(speculative-decoding head)。它是研究工具,不是助理:它已移除拒絕行為,沒有內建護欄,授權為 Apache 2.0。下載前請先閱讀本頁底部的安全界線——這就是這個需申請存取儲存庫的意義所在。

依 VRAM 該下載哪個 GGUF

該儲存庫提供一個全精度配對和十二個量化檔案,因此下載與否其實取決於 VRAM。以下數字是 2026-08-16 自 Hugging Face 儲存庫讀取的檔案大小。

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

這個 repo 裡實際上有什麼?

orcarouter/Qwen3.8-27B-Uncensored-GGUF 包含十五個模型檔案:F16 權重拆成兩部分、十二個量化 GGUF——Q2_K、Q3_K_S、Q3_K_M、Q3_K_L、Q4_K_S、Q4_K_M、Q5_K_S、Q5_K_M、Q6_K、Q8_0、IQ3_M 與 IQ4_XS——以及 mmproj 視覺投影器。它是與 Qwen3.8-27B-Uncensored-FP8 相同之 abliterated 建置的 GGUF 匯出,重新包裝以供 llama.cpp 類別的本地執行環境使用,並繼承基礎模型的 Apache 2.0 授權及其原生 262,144 token 的上下文長度。

三個特性在所有量化版本中保持一致。其架構為 qwen35——採用混合注意力機制,包含48個Gated DeltaNet線性層與16個全注意力層——這正是該儲存庫無法在舊版llama.cpp版本中載入、且KV快取能保持小巧的原因。該MTP(nextn)推測解碼頭在所有量化版本中均予以保留,無論是K-quant還是IQ皆然。此外,聊天模板為Qwen Jinja模板,你必須明確啟用(見下文),否則多輪對話會出錯。

為什麼 KV 快取依然小到不容忽視

這就是讓本地部署故事得以成立的關鍵細節。在 64 層中,僅有 16 層使用完整注意力機制;其餘 48 層使用 Gated DeltaNet 線性注意力,完全不保留傳統的 KV 快取。根據此架構的原始操作手冊測量,實際效果是 KV 快取約為32K 上下文下的 2 GB——大約是傳統 27B 模型所需記憶體的四分之一。這就是為什麼 16.8 GB 的 Q4_K_M 檔案仍能裝進 24 GB 顯示卡並支援長上下文視窗,也是為什麼未經審查的 GGUF 系列能在連 55.6 GB BF16 檢查點都完全無法容納的硬體上順利運行。

使用 llama.cpp 執行它。

llama.cpp 是預期的途徑。你需要目前的建置版本:主幹已註冊 qwen35 架構,而較舊的建置版本會直接拒絕該檔案。命令的形式,根據模型卡的使用說明和此架構的運行手冊,是:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

這會讓你在 localhost:8080 取得一個 OpenAI 相容的端點。若要進行影像輸入,請加上 --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf。請將 Q4_K_M 換成符合你 VRAM 的量化版本;其旗標完全相同。

使用 Ollama 執行它

Ollama 透過從 Modelfile 匯入同一個檔案來執行,這是新增不在模型庫中的 GGUF 的支援方式。在存放您下載的量化檔的目錄中:

./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

將該行儲存為 Modelfile,然後ollama create qwen3.8-27b-uncensored -f Modelfileollama run qwen3.8-27b-uncensored。若要用於視覺功能,請在 Modelfile 中加入 mmproj 那一行(FROM ... Q4_K_M.gguf 加上 mmproj 路徑),Ollama 會自動將投影器接好。同樣的 --ctx 與範本注意事項也適用:設定你實際上能容納的上下文大小,並記住,移除了拒絕回應機制的模型,會在沒有任何防護欄的情況下直接回答你。

拒絕移除實際上改變了什麼

模型卡發布了此版本的安全評估套件。在關閉思考模式時,標準有害提示基準上的拒答率從基礎模型的64–99%降至0–6%(去對齊權重);開啟思考模式時則幾乎從不拒答——1.7%或更低。能力基準與基礎模型維持在±1.3個百分點以內。這就是此系列每次去對齊發布的型態:移除拒答、保留能力,並附帶一項提醒——仍有相當比例的回答會在回應前加上一段簡短免責聲明,這是訓練產物,而非拒答。

另一面正是以下安全邊界的重點所在:一個從不拒絕的模型並不是更好的助手,而是一種不同類型的物件。它是一種用於測量拒絕機制、並查明你自己的護欄是否有效運作的測試儀器。

在研究中實際該如何使用它

三個合法專案,為移除拒絕機制之模型的核准用途:

當這個組建是錯誤的答案時

如果你想要一個普通的助手,或任何你會放在終端使用者面前的東西,那這個模型就是錯的——它沒有實質的內建護欄,它會順從基礎模型拒絕的請求,而且 Apache 2.0 不會免除你的責任。那種用途請用原始對齊的 Qwen3.8-27B。如果你想在聊天機器人上迴避拒絕,系統提示詞套件比調整權重更能達成目標,風險也更低。如果你完全沒有 GPU,但仍想研究這個模型,OrcaRouter 上託管的 obsidian/Qwen3.8-27B 提供相同的無審查版本,輸入 token 每百萬 0.40 美元、輸出每百萬 4.21 美元,同樣有 262K 上下文;它和這個 repo 一樣,僅開放給安全和 AI 安全研究人員,而且審核決定仍然在你這邊。該模型卡包含定價和基準測試詳細資訊。

安全界限 — 下載前請先閱讀

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

此模型的安全對齊已被大幅移除。它會順從原始 Qwen3.8-27B 會拒絕的有害、不道德、冒犯性或非法請求,而且沒有任何具實質意義的內建護欄。它僅為合法的研究目的而發布:可解釋性、AI 安全與拒答機制研究、紅隊測試、穩健性評估及受控實驗。您需對自己的使用方式以及它所產生的所有內容承擔全部責任與法律責任;除非您自行加入安全、內容審核與濫用防護層,否則不得將其部署給終端使用者或投入生產環境。作者對任何濫用行為概不承擔責任。下載此儲存庫即表示您接受上述條件;授權條款為 Apache 2.0。

這篇文章刻意不含任何有害提示。上述的拒絕數字來自模型卡自身的安全評估套件,這是衡量此類模型的正確方式:執行標準的拒絕基準測試,閱讀數據,並根據數據所顯示的結果來設計你的研究。

來源與日期

以上所有事實均已於 2026-08-16 驗證。檔案清單與大小取自 Hugging Face 儲存庫 orcarouter/Qwen3.8-27B-Uncensored-GGUF(建立於 2026 年 8 月 16 日;架構 qwen35;Apache 2.0;需授權存取)。拒絕回應與能力數據來自模型卡的安全評估套件。KV-cache 測量(32K 上下文約 2 GB)取自 OrcaRouter 針對此架構的 runbook《How to Run Qwen 3.8 27B Locally》。託管定價與存取限制來自 obsidian/Qwen3.8-27B 模型頁面,於同日查證。量化檔案大小以 Hugging Face 上儲存的十進制 GB 為準。

若為合法研究用途,權重可在 Hugging Face 上取得:從 Hugging Face 下載 — 無需信用卡,60 秒內即可使用。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube