
Qwen3.8-27B 搭配 Unsloth:在本機執行、量化或微調
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百萬 tokens · 18 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
是的 — Unsloth 可以執行 Qwen3.8 27B,這是讓 Alibaba 全新的 Apache-2.0 模型跑在你自己的 GPU 上最快的方法。一句話總結:開啟 Unsloth Studio,搜尋「Qwen3.8 27B」,選擇 UD-Q4_K_XL (17.9GB)搭配 24GB 顯示卡,不到一分鐘就能開始聊天。在這次點擊的背後,Unsloth 在權重發布的同一週(2026年8月13–14日)推出了三項東西:unsloth/Qwen3.8-27B-GGUF模型包,建立在 Unsloth Dynamic V3.0(預覽版)量化之上,並在 Unsloth Studio 與 Desktop 中獲得完整支援,以及v0.1.800-beta版本,提供 GGUF 匯出、imatrix 偵測與 VRAM 適配改進。它還可以微調模型 — Unsloth 宣稱訓練速度快 2 倍、VRAM 減少 70%。Qwen3.8 27B 是密集的 270 億參數視覺語言模型,其混合注意力僅讓 64 層中的 16 層使用完整注意力,這就是為什麼 4-bit 檔案能裝進大多數 27B 模型裝不下的顯示卡。
關於資料來源:模型事實為官方資料,來自 Hugging Face 上的 Qwen3.8 27B 模型卡,於 2026 年 8 月 15 日驗證。Unsloth 支援、量化大小、VRAM 需求及安裝指令,均來自 Unsloth 的發行說明與文件,驗證日期相同。API 價格取自 OrcaRouter 目錄的即時報價,日期相同。Unsloth 宣稱的「速度快 2 倍、減少 70% VRAM」與「同尺寸中迄今最強大的模型」為廠商說法,未經獨立重現驗證。
「Qwen3.8 + Unsloth」的含義:四種不同的事物
Unsloth 是四個不同的東西,而關鍵字搜尋結果把它們混在一起。知道你需要哪一個,就等於完成了一半的設定:
• unsloth/Qwen3.8-27B-GGUF —— Hugging Face 上的量化權重檔案,共 21 個量化版本,外加一個視覺投影器。此模型採用 Dynamic V3.0(預覽版)建置,而非較舊的 Dynamic 2.0(後者於 2025 年 4 月 24 日發布,早於此模型)。這是「下載檔案」的路徑,可搭配任何 llama.cpp 建置版本使用。
• Unsloth Studio — 可安裝或從 Hugging Face Space 執行的瀏覽器應用程式。搜尋模型中心、點擊量化版本、與工具聊天。無需手動設定範本或推論參數。
• Unsloth Desktop — 適用於 macOS、Windows 與 Linux 的本機 GUI 應用程式,整合了 Studio 與訓練功能。這就是「速度快 2 倍、VRAM 使用量減少 70%」的微調功能所在。
• unsloth Python 函式庫 — 從 unsloth 匯入 FastLanguageModel,這是在 notebook 和腳本中使用的 QLoRA 微調 API。
Unsloth 的 v0.1.800-beta 版本發布說明,標題為「Release Qwen3.8 27B」,指出 Qwen3.8 27B 和參數量達 2.4T 的 Qwen3.8-2.4T-A95B「現在可以在 Unsloth 中於本機執行」,並表示 27B「透過 Unsloth Dynamic GGUFs 可在 17GB RAM 上運行」,且「你也可以在 Unsloth 中微調 Qwen3.8 27B」。同一版本還新增 NVFP4 量化、在 GGUF 匯出前檢查磁碟空間、在 Studio 中偵測真正的 GGUF imatrix 支援,並讓 GGUF 上的推論速度提升最高 10%,同時具備可調的 VRAM 限制。

依 VRAM 挑選你的 quant,而非憑感覺
Unsloth 的記憶體表格是以 RAM 加上 VRAM(或統一記憶體)的總量計算,這是官方指引。4-bit 的 Qwen3.8 27B 需要 17–19GB;24GB 的 RTX 4090、RTX 5080,或配備 24GB 統一記憶體的 Mac,是舒適 4-bit 設定的實際最低門檻。涵蓋幾乎所有人的三個選擇:
• 12GB → UD-IQ2_XXS(9.0GB)——唯一能完整放入的檔案;預期會有明顯的品質損失。請在知情的情況下做出此選擇。
• 16GB → UD-Q3_K_XL(13.4GB) — 依照Unsloth自家的選擇器,這是最好的3位元檔案。
• 24GB → UD-Q4_K_XL(17.9GB) — 本文推薦的 4-bit 檔案,也是本文的預設答案。
• 48–64GB → UD-Q8_K_XL(31.5GB)——在工作站或雙 GPU 配置上接近無損。
完整的階梯(ladder),來自 unsloth/Qwen3.8-27B-GGUF 檔案清單與 Unsloth 的文件,兩者皆於 2026 年 8 月 15 日驗證:UD-Q8_K_XL 31.5GB、UD-Q6_K_XL 25.9GB、UD-Q5_K_XL 20.2GB、UD-Q4_K_XL 17.9GB、UD-Q3_K_XL 13.4GB、UD-Q2_K_XL 10.7GB、UD-IQ3_XXS 11.9GB、UD-IQ2_M 10.3GB、UD-IQ2_XXS 9.0GB。標準 K-quants(Q4_K_M 17.1GB、Q8_0 29.0GB)也在其中,而且這個套件隨附視覺投影器(mmproj-BF16,931MB),所以如果你載入它,圖片和影片就能運作。Unsloth 將整個階梯稱為「Dynamic V3.0(預覽版)」——比你在舊文章中會看到的 Dynamic 2.0 更新,後者是為一年多前發布的模型所建構的。

用 Unsloth 在三分鐘內運行它
一鍵安裝路線:在 macOS 或 Linux 上,執行 `curl -fsSL https://unsloth.ai/install.sh | sh`,然後執行 `unsloth studio -p 8888` 並開啟 http://127.0.0.1:8888。在 Windows 上,執行 `irm https://unsloth.ai/install.ps1 | iex`。如果你想要完全零安裝,Unsloth 的 Studio 也有以 Hugging Face Space 形式發布的版本——在瀏覽器中開啟它,搜尋「Qwen3.8 27B」,再依你的記憶體容量挑選量化版本。Studio 會自動調校取樣參數與聊天模板,在 VRAM 不足時卸載到 RAM,並偵測多 GPU 配置——「免設定」這部分是貨真價實的,也是本週跑起最新模型的最快方式。
先檔案的路線,如果你已經在使用 llama.cpp:下載一個量化版本並直接執行。這些是 Unsloth 自己的指令,已對照其文件驗證過:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
那些採樣值是模型卡推薦的思考模式設定。在 16GB 顯示卡上,將 --include 的 glob 換成 *UD-Q3_K_XL*;如果需要視覺功能,請加上 --mmproj 指向該套件中的 mmproj-BF16.gguf。有個陷阱:llama.cpp 必須是目前版本——該檔案註冊了新的 qwen35 架構,任何早於發布週的版本都無法載入它。
使用 Unsloth 對其進行微調
微調正是 Unsloth 奠定聲譽之處:該程式庫宣稱相較於標準 Transformers + PEFT,訓練速度提升 2 倍,VRAM 使用量減少 70%,這使得 QLoRA 在 27B 模型上僅需單張消費級顯示卡即可運行。微調的入口是普通的 unsloth/Qwen3.8-27B 儲存庫(safetensors,28B 檔案頁面),而非 GGUF 套件。套用於此模型的標準 Unsloth QLoRA 模式如下:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
然後在你的資料集上執行標準的 trl.SFTTrainer 迴圈。那段程式碼是 Unsloth 文件中的標準 QLoRA 模式——訓練基準測試的宣稱是 Unsloth 自己的,不是我複製出來的——而且有兩個注意事項:Unsloth 的 kernel 會修補文字 transformer 層,所以要計畫單獨處理視覺編碼器;另外,請將 unsloth 套件保持在目前版本,因為這個架構才剛推出幾天,版本不符會大聲失敗。
Unsloth Studio 為您處理的事項
手動執行 GGUF 意味著要在上下文大小、RAM 卸載和工具呼叫之間小心翼翼地拿捏。Studio 將這些收斂成預設值:它會根據實際可用的記憶體來決定上下文大小,卸載閒置的視覺模型以釋放 VRAM 給聊天或訓練使用,偵測多 GPU 配置,並開箱即用地接好網路搜尋、程式碼執行和代理連線(Claude Code、Codex、MCP)。v0.1.800-beta 版本也改善了實務上會造成困擾的部分:GGUF 匯出現在會在開始長時間合併前檢查磁碟空間,而不是中途失敗;Studio 會偵測要匯出的 GGUF 是否真的支援 imatrix(這樣你就不會白跑一次);記憶體保護也不再過度保留 GPU 記憶體。對一個才推出三天的模型來說,「no-config」確實是在做實事。
本地免費 vs API 付費:誠實的經濟學
Unsloth 與 API 之間的核心差異不在於品質——而在於誰擁有硬體。{{1}}Unsloth 是免費路線:每個 token 的邊際成本為零,沒有任何資料離開你的機器,沒有速率限制,並且完全掌控權重。{{/1}}{{2}}它不是絕對意義上的免費:你需要自備 GPU 和電力,而 2-bit 檔案在 12GB 顯示卡上是妥協過的體驗。{{/2}}{{3}}Qwen3.8 27B 是密集且具視覺能力的模型,因此 4-bit 在上下文之前就需要 17.9GB 的權重;{{/3}}{{4}}機器本身就是入場門票。{{/4}}
這條 API 路線之所以存在,是因為這些權重採用 Apache-2.0 授權,因此任何人都能以接近零的邊際成本託管它們。Qwen3.8 27B 現已在 OrcaRouter 的目錄中,價格為 每百萬輸入 token 0.33 美元、每百萬輸出 token 2.40 美元,該模型在我們自己的基礎設施上自行託管——沒有需要轉嫁的供應商價格——並具備 262K token 的上下文視窗,以及文字、圖片和影片輸入。由於權重是開放的,也提供有限速率的免費方案,每次請求收費 0 美元。以代表性的每月 1,000 萬 token、其中 70% 為輸入比例計算,付費方案約需 9.51 美元。如果你已經擁有一張 24GB 顯示卡,本地部署在成本上更勝一籌;如果沒有,以這個價格租用 token 比為了副專案購買顯示卡更划算,而免費方案則是在你投入任何硬體之前測試模型的老實作法。

當 Unsloth 是錯誤答案時
Unsloth Studio 和 GGUF 套件對單一機器來說是正確的選擇。但在以下情況下則不然:
• 你擁有一張 Blackwell RTX 50 系列顯卡。 unsloth/Qwen3.8-27B-NVFP4 量化版本在相同 VRAM 下約比 BF16 快 1.5 倍,並使用 FP8 KV 快取以支援更長的上下文。這條路徑是透過 vLLM 或 SGLang 執行,而不是 GGUF 或 Studio。
• 在生產環境中,您需要完整的 262K 原生上下文視窗,或 1M YaRN 擴充功能。密集視覺模型在長上下文下負擔很重;Unsloth 的上下文大小調整雖能輕鬆為您縮短上下文,但具備適當 KV 管理的服務堆疊仍勝過本地應用程式。
• 您正在服務許多使用者。Unsloth 是本機應用程式與微調函式庫,而非多租用戶伺服器。若需要並行處理、自動擴展及正常運行時間保證,您需要託管端點。
• 你完全沒有 GPU。老實說,在 12GB 顯示卡上跑 2-bit 27B 模型,會明顯比妥善部署的同一模型更差。請先使用免費的 API 方案;如果效果足夠好,等應用場景獲得驗證後再購買硬體。
• 您想要微調視覺部分。 Unsloth 的加速針對文字 transformer 層;完整的多模態微調需要不同的技術棧。
底線
截至本週,Qwen3.8 27B 搭配 Unsloth 已經不再是難題:安裝 Studio,24GB 顯示卡選 UD-Q4_K_XL(16GB 選 UD-Q3_K_XL,12GB 選 UD-IQ2_XXS),模型就能直接執行,無需任何設定,也沒有按 token 計費的問題。微調路徑確實可行,而 Unsloth 的速度宣稱正是讓 27B QLoRA 在單張顯示卡上得以實作的原因。要知道,這個量化階梯是 Dynamic V3.0(預覽版),不是舊文章所寫的 Dynamic 2.0;請讓 llama.cpp 保持在最新版本;如果你沒有自己的硬體,同樣的權重可透過 $0.33/$2.40 的 API 取得,並附有免費但限速的方案——所以你完全沒有理由去跑一個自己不滿意的 2-bit 檔案。本機執行是免費的路徑,而且在此重量級別中,首次也是簡單的路徑。
