
Qwen3.8-27B 在 Ollama 上:一條指令、四種量化,以及「免費」的真正代價
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百萬 tokens · 18 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
用一條指令執行它:ollama run qwen3.8:27b。這就是本頁所探討問題的完整答案。Qwen3.8 27B — Alibaba 的稠密式 270 億參數模型,權重於 2026 年 8 月 14 日以 Apache 2.0 授權釋出 — 本週已在 Ollama 函式庫上線,預設版本已是合理的 18 GB Q4_K_M 量化(17 GB 權重加上 931 MB 視覺編碼器)。它在一般上下文長度下可完整運行於 24 GB GPU,顯示卡較小時會分流至 CPU,而且每個 token 都不用花費。
這裡的所有內容均以 2026 年 8 月 15 日為準。規格來自 Qwen3.8 27B 模型卡;下載大小、標籤與下載次數來自 Ollama 線上函式庫頁面;基準測試數據由 Alibaba 提供,尚無獨立複現結果。該模型於數日前發布,因此所有可能變動的資訊皆應視為暫定。
真正有效的一行代碼
如果你已經安裝了 Ollama,你只差兩個字:
運行 ollama qwen3.8:27b
Ollama 支援已於 v0.32.12 落地——發行說明簡潔地寫道:「此版本新增對 Qwen 3.8 27B 的支援。」首次執行會下載預設建置(約 18 GB,Q4_K_M),然後便會進入一個預設開啟思考模式的聊天 REPL。函式庫頁面以能力標籤「vision tools thinking 27b」列出此建置,藉此即可得知視覺與工具呼叫路徑已整合到同一個下載中。截至撰寫本文時,該頁面顯示超過 40,000 次下載,以及一個已涵蓋十一種變體的標籤清單。

兩種你真的會想使用的變體:
• ollama run qwen3.8:27b-mlx — Apple Silicon 版本,同樣佔用 18 GB 空間,但為 Metal 編譯;Ollama 的版本說明特別針對此版本進行最佳化,「for maximum performance and output quality suitable for repeated tasks and coding agents.」
• ollama run qwen3.8:27b-q8_0 — 一個 30 GB 的 8-bit 量化版本,適合當你擁有足夠 VRAM 且希望權重更接近全精度時使用。
您實際下載的內容
名稱寫的是27B,但完整參數數量是28B:一個273億的稠密語言模型,加上一個4.61億的視覺編碼器,讓它原生支援圖片與影片輸入。其餘的標題規格,直接來自模型卡:
• 64 層,隱藏層大小 5,120,詞彙量 248,320。
• 混合注意力:16 個完整的 Gated Attention 層與 48 個線性 Gated DeltaNet 層 — 3:1 的偏線性組合,這正是 27B 模型能在 KV 快取不耗盡整個資料中心的情況下,維持 262,144 token 原生上下文(可擴展至 1M)的原因。
原生圖像和視頻理解——「從STEM圖表和文檔到小時級視頻」是阿里巴巴的措辭。
• Apache 2.0。下載它、修改它、用它銷售產品。該許可證是本文其餘經濟論述所依賴的法律事實。
全精度參考是 BF16,這就是 56 GB 標籤存在的原因;每個較小的標籤都是以精度換取體積的取捨,而模型卡自帶的基準測試正是你取捨時的對照基準。
先選定量化等級,再檢查你的VRAM,而不是反過來。
Ollama 提供十一種標籤,但最終的選擇歸結為三種尺寸。
• 18 GB — Q4_K_M(預設)。在正常上下文長度下可完全放入 24 GB 顯示卡(RTX 4090 / 5090 等級);在 16 GB 顯示卡上則需部分 CPU 卸載——速度較慢,但可以運行。這是最適合「直接就跑」的版本。
• 30 GB — Q8_0. 權重接近全精度,需要約 40 GB 的 VRAM 才能完全在 GPU 上運行。在 27B 上,你應該已經知道為什麼在付費前需要額外的保真度。
• 56 GB — BF16。這是參考版本。需要 H100 級別或 96 GB 的硬體。沒有人會在消費級 GPU 上運行這個,這沒關係。

最常讓人搞錯的數字是 KV 快取。18 GB 的下載量並不代表 18 GB 的 VRAM 就足以應付 262K 上下文的會話——在長上下文時,快取會在權重之外再增加數 GB 的空間,這就是為什麼一張 24 GB 的顯示卡在 8K–32K 上下文時能輕鬆容納這個模型,但在 262K 時卻不行。在效能吃緊的顯示卡上,請降低上下文長度,而不是調低量化等級。
Apple Silicon 在此是一等目標。
Ollama 的 v0.32.12 版本說明特別點名了 macOS。具體來說,`ollama run qwen3.8:27b-mlx` 需要約 18 GB 的統一記憶體,因此配備 24 GB 以上記憶體的 Mac 可以完全在 GPU 上運行,並為上下文預留充足空間。此外還有 32 GB 的 mxfp8 MLX 標籤,以及適用於 64–128 GB 機型的 56 GB mlx-bf16 標籤。如果你的 M 系列 Mac 一直在關注桌面級模型的消息,這個版本正是你等待已久的版本。
背景:規格表上寫著 262K,實際坐上座位時卻更少
模型卡片列出 262,144 個原生 token,可擴展至 1M;Ollama 的函式庫頁面則將相同視窗標示為 256K。兩者都正確——262,144 就是 256K 乘以 1024——但兩者都不代表你應該在 24 GB 顯示卡上把這個數字填進 --num-ctx。KV 快取會隨上下文長度近似線性成長,因此在消費級硬體上,你會實際使用在 16K–64K 之間,而不是 262K。從 Ollama 預設值開始,只有當任務確實需要時才調高 --num-ctx,並記得 1M 這個數字需要擴展機制加上足夠的 VRAM 來支撐。
還有哪些地方不穩妥——下注之前先讀讀這個
• 尚無獨立基準測試。 模型卡上的每個數字都是Alibaba截至8月15日的說法。相較於Qwen3.6-27B,宣稱的進步幅度很大——SWE-bench Pro 61.7對53.5,Terminal Bench 2.1 73.0對63.4,LiveCodeBench v6 90.3對83.9,GPQA Diamond 89.2對87.8——而且這些數字讀起來都合理,但目前沒有一項曾被外部測試框架重現。不要僅憑這些數字來做生產決策。
• 視覺處理堆疊才剛推出數天。 一份早期的錯誤回報(ollama issue #17753)顯示,Q4 版本將視覺輸入導向 Qwen3.5 解析器,並在處理圖片時失敗;此問題已在 PR #17755 中於數日內修復。但對於問世僅一週的模型,多模態路徑正是你在依賴它之前應該測試的地方。
• 預設建置包含 MTP。q4_K_M 標籤也是多 token 預測建置——解碼速度更快,也是「18 GB」與「27B」能並存而無矛盾的原因。
• 在 Apple 裝置上,量化標籤可能造成誤導。「mlx」與「nvfp4」這兩個 18 GB 標籤在量化方式上有所不同——NVFP4 是 NVIDIA 的 FP4 格式——因此在 Mac 上請優先選擇單純的 -mlx 版本,除非你特別需要針對 Blackwell GPU 的 FP8/FP4 變體。
「免費」在那個標題裡出了不少力。
自行託管一個27B模型,每個token是免費的,但這並非真正免費。誠實的說法是三個選項,各自以不同的貨幣計價:
• 自己運行(Ollama)。 每個 token $0、離線、無限、私密——而且硬體是你自己的。24 GB GPU 或 18 GB+ 的 Mac 是一筆實打實的購買,電費和設定時間也不例外。當 Qwen3.8 27B 成為日常主力時,這才是正確的選擇。
• 呼叫一個 $0 且有限速的 API。 OrcaRouter 在自己的基礎設施上以零成本提供 Qwen3.8 27B(模型 ID:qwen/qwen3.8-27b-free,每次請求 $0,有限速)——因為權重是開放的,所以沒有需要轉嫁的每 token 供應商成本。當你想試用這個模型、而不想為了測試一週前發布的版本購買硬體時,這是最正確的選擇。
• 呼叫無速率限制的 API。 相同的模型在無速率限制下,於 OrcaRouter(qwen/qwen3.8-27b,262K 上下文,文字、影像與影片輸入)的價格為每百萬輸入 token 美金 $0.33,每百萬輸出 token 美金 $2.40。當你需要生產規模且不想費心照料 GPU 時,這是最合適的選擇。

決定兩者取捨的數學是:偶爾使用時,以 $0 或 $0.33/$2.40 的價格比買一張 GPU 更划算;每日互動使用在本地端更便宜;持續的生產吞吐量,以不需自行維持運作的 API 最便宜。無論數學怎麼算,隱私與離線需求都會把你推向第一欄。
當此建議有誤時
• 你真的需要 100K+ 的上下文長度。 模型做得到;但你的 24 GB 顯示卡做不到。在真正的長上下文場景中,40 GB+ 的 GPU 或支援更長上下文的 API 並非奢求。
• 你今天就需要在生產環境中使用影片功能。 視覺路徑的剖析器錯誤才剛修正;在僅一週大的多模態模型上運行生產級影片,是一場你不該在沒有備援方案的情況下下的賭注。
• 你要的是並發。一張消費級 GPU 一次只能串流一兩個生成任務。27B 不是伺服器級的機器。
• 你目前使用的是只有 CPU 的硬體。在 CPU 上以 4-bit 執行 27B 模型只是緩慢的示範,不是實用的工具。在你擁有 GPU 之前,使用 API 才是誠實的選擇。
底線
在 Ollama 上執行 Qwen3.8 27B,是目前任何人已推出的同代 27B 模型中最容易上手的方式:一條指令搞定、預設 18 GB 可裝進 24 GB 顯示卡、具備一流的 Apple Silicon 版本,還享有 Apache 2.0 的自由。你該選的量化版本幾乎永遠是預設的 Q4_K_M——只有當你能量測出差異時,才升級到 q8_0。而「免費」是有條件的:若你只是偶爾碰一下模型,$0 且有限速的 API 會比買硬體更划算;若它成為你的日常主力,本機副本反而是你擁有過最便宜的東西。在拿這些數字當依據之前,先自己驗證——本文所述在 2026 年 8 月 15 日皆為真,而這個模型每天都在變化。
