文章《Qwen3.8-27B VRAM Requirements》的標題卡片,顯示一個帶有約 17 GB 記憶體標籤的 GPU 晶片,以及 Q4_K_M、Q6_K 和 Q8_0 的量化徽章。
Guides & Insights

Qwen3.8-27B VRAM 需求:你實際需要多少硬體

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

大約 17 GB 的 VRAM 是 Qwen3.8-27B 流傳的數字——Unsloth 的 Daniel Han 表示,該模型「在發佈時應該可以容納在大約 17GB 的 VRAM 中」——而我們值得精確說明這個數字的含義與局限。這是基於 27B 前代機型的推測,並非阿里巴巴的官方規格,因為該模型尚未發布;官方儲存庫原本承諾於 2026 年 8 月 10 日當週發布,但在撰寫本文時尚未出現。本文將 VRAM 問題梳理為你可以據以規劃的部分、真正不確定的部分,以及這個數字如何隨你的量化、上下文視窗和執行環境而變動。

誠實的回答優先

目前還沒有 Qwen3.8-27B 的官方硬體規格。以下所有資訊都是根據 Qwen3.6-27B 推算而來——27B 所接續的正是這個模型,兩者參數數量相同、很可能採用相同的混合式架構,也是目前最接近的尺寸參考依據。請將這些數字視為規劃範圍,而非需求清單。權重發布後的幾天內,量化工具與推論框架的維護者就會提供第一批實際量測數據,而這些數據才是你採購時應鎖定的依據。

量化階梯

你需要多少 VRAM 幾乎完全取決於你執行哪種量化。從社群測量的 Qwen3.6-27B 表格往上推算:

• Q4_K_M — 約 16 GB 的 VRAM。24 GB 顯示卡的甜蜜點,很可能就是「17 GB」這個數字的來源。多數團隊的預設選擇。

• Q3_K_M / IQ3 — 約需 13 GB VRAM。可放入 16 GB 甚至 12 GB 的顯示卡,但品質會明顯下降。

• Q6_K — 約 21 GB VRAM。近乎無損,而且在 24 GB 的顯示卡上雖緊繃但確實裝得下。

• Q8_0 — 約需 27–30 GB 的 VRAM。適用於想要榨取最後一點品質的 48 GB 顯示卡。

• FP8 推論 — 權重約需 27 GB VRAM,因此單張 L40S 是常見的推論 GPU 選擇。

• 全精度(BF16)——約 54 GB VRAM。實際上需要 H100 等級的顯示卡,這已經到了大家不再稱之為「本地」的領域。

簡而言之:24 GB 的 GPU 是{{1}}這款模型的安全選擇{{/1}},16 GB 的顯示卡只有在你能接受{{2}}低量化版本{{/2}}時才能運行,而 8 GB 或以下的顯示卡都不行,除非這個模型最終{{3}}比前代明顯精簡得多{{/3}}。

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

無人提及的變數:上下文長度

上方的每個數字都是針對適中的上下文長度。顯存會隨上下文長度而擴展,因為 KV 快取必須與權重一同駐留。在 Qwen3.6-27B 上,2K 上下文約需 11 GB,32K 上下文會把同一個量化模型推過 14 GB,而 128K 則讓快取佔用空間膨脹超過兩倍。如果 Qwen3.8-27B 維持大型原生上下文窗口——而 Qwen 世代一直有此趨勢——請在量化大小之外預留數 GB 的餘量,或在執行時配置中限制上下文長度。選擇一個實際上不會用到的上下文長度,是團隊最後買了一張比實際需求更大的顯示卡的最常見原因。

混合架構的萬用字元

Qwen3.6-27B 是一個混合模型:其 65 層中只有 16 層使用傳統的 KV 快取,而其餘 48 層使用固定的循環狀態。結果是,與相同規模的密集模型相比,KV 記憶體用量大約少了四倍——這在很大程度上解釋了為什麼 27B 模型感覺像是 24 GB 顯示卡就能跑的模型,而不是需要 48 GB 的模型。如果 Qwen3.8-27B 保留混合設計(可能性很高,但尚未證實),上述關於上下文長度的計算就會比表面上看起來更有利。問題在於執行環境的支援:如果 llama.cpp 或 vLLM 的建置版本未實作循環層,回報的記憶體使用量就會高得多。在假定這些預估值成立之前,請先確認哪些執行環境已合併相關支援。

哪些 GPU 實際上能用?

具體來說,對於普通卡牌:

• RTX 4090 / 3090 / 5090(24 GB)— 跑 Q4_K_M 綽綽有餘,若你願意擠一下也能跑 Q6_K。這正是目標用戶群。

• RTX 3060 / 4060 Ti 16 GB — 僅限 IQ4 或 Q3 級別的量化,搭配適度的上下文。可用,但不理想。

• 12 GB 顯示卡 — Q3_K_M 品質較低。適合實驗,不適合正式服務。

Apple Silicon — 24 GB 的 Mac 可透過 MLX 或 llama.cpp 執行相同的 Q4 檔案;16 GB 的基礎型號則會因記憶體交換而抖動(swap-thrash),實際上等同出局,正如 Qwen3.6-27B 當時的情況。

• 48 GB 及以上(A6000、L40S、雙卡配置)— Q8_0 或 FP8 推論服務,具備充足的記憶體餘裕。

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

或者完全跳過 GPU

如果硬體成本這筆帳算不來,那模型也未必非得自己跑。OrcaRouter 是一個 API,涵蓋 200 多個模型——包括 Qwe​n 系列——並以零加價直接轉傳供應商列表價格,因此 Qwen3.8-Max 目前的成本是每百萬輸入 tokens 2.00 美元、每百萬輸出 tokens 6.00 美元,與廠商自家定價頁面完全相同。27B 本身將是本地模型,但當其權重釋出並贏得信任後,同一把金鑰會路由到任何託管該模型的供應商——你現在就能針對這一代進行開發,完全不必碰 GPU 轉售市場。

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

硬體問題的重點是:計畫使用 16 GB 以舒適地執行 4-bit,24 GB 以穩妥並為上下文和更高量化等級留出餘裕,並將這裡的每個數字視為暫定,直到儲存庫釋出且首批實際測量結果出現。「17 GB」的預估值是合理的規劃數字——但目前還不是事實。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube