為 Ollama 上的 Qwen3.8-27B 一文所設計的標題卡,畫面顯示一個極簡終端機視窗,內有指令「ollama run qwen3.8:27b」與閃爍的游標,三個徽章分別寫著「18 GB 下載」、「Q4_K_M 預設」和「262K 上下文」,以及圖說「在你的硬體上免費執行」。
Guides & Insights

Qwen3.8-27B 在 Ollama 上:一個指令、四種量化,以及「免費」的真正代價

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

用一個指令就能執行:ollama run qwen3.8:27b。這就是本頁所探討問題的完整答案。Qwen3.8 27B——阿里巴巴的稠密 270 億參數模型,權重於 2026 年 8 月 14 日以 Apache 2.0 授權釋出——本週在 Ollama 模型庫正式上線,而預設版本已經是相當合理的 18 GB Q4_K_M 量化(17 GB 權重加上 931 MB 視覺編碼器)。在一般上下文長度下,它完全能在 24 GB GPU 上運行;顯示卡較小時則會拆分至 CPU,而且每個 token 都零成本。

這裡的所有內容都標註為 2026 年 8 月 15 日。規格來自 Qwen3.8 27B 模型卡;下載大小、標籤與下載次數來自即時的 Ollama 函式庫頁面;基準測試數字為阿里巴巴所報告,尚未有獨立複驗。該模型幾天前才推出,因此請將任何可能變動的內容視為暫定。

真正有效的一句話

如果你已經安裝了 Ollama,就只差兩個字:

ollama run qwen3.8:27b

Ollama 支援已於 v0.32.12 正式推出——發行說明寫得很直白:「本次發行新增對 Qwen 3.8 27B 的支援。」首次執行會下載預設組建(約 18 GB,Q4_K_M),接著直接帶你進入聊天 REPL,且預設開啟思考模式。函式庫頁面以能力標籤「vision tools thinking 27b」列出這個組建,由此可知視覺與工具呼叫路徑都已納入同一次下載。截至本文撰寫時,該頁面顯示下載次數已超過 40,000 次,標籤清單也已涵蓋十一種變體。

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

你會實際用到的兩種變體:

• ollama run qwen3.8:27b-mlx — Apple Silicon 版本,佔用空間同為 18 GB,但針對 Metal 編譯;Ollama 的發行說明特別針對它進行最佳化,「以達到最高效能與輸出品質,適合重複性任務與程式編寫代理」。

• ollama run qwen3.8:27b-q8_0 —— 30 GB 的 8 位元量化版本,適合在你擁有足夠 VRAM、且希望權重更接近全精度時使用。

你實際上正在下載什麼

名稱寫著 27B,但完整參數量其實是 28B:一個 27.3B 的稠密語言模型,加上一個 461M 的視覺編碼器,讓它具備原生圖片與影片輸入能力。其餘重點規格,直接取自模型卡:

• 64 層、隱藏大小 5,120、詞彙量 248,320。

• 混合注意力:16 層完整的 Gated Attention 與 48 層線性 Gated DeltaNet——以 3:1 比例偏向線性的混合,也是 27B 能維持 262,144 token 原生上下文(可延伸至 1M)的原因,而不會讓 KV cache 吃掉一整個資料中心。

• 原生圖像與影片理解 ——「從 STEM 圖表與文件到長達數小時的影片」是 Alibaba 的說法。

• Apache 2.0。下載它、修改它,並據以販售產品。這份授權是本文其餘經濟論述所仰賴的法律事實。

全精度參考是 BF16,這就是 56 GB 標籤存在的原因;每個較小的標籤都是以精度換取佔用空間,而模型卡自身的基準測試結果,正是你權衡取捨的依據。

先挑一個量化版本,再檢查你的 VRAM,而不是反過來。

Ollama 提供你十一個標籤,但抉擇其實收斂為三種尺寸。

• 18 GB — Q4_K_M(預設)。在一般上下文長度下,能完整放入 24 GB 的顯示卡(RTX 4090 / 5090 等級),而在 16 GB 顯示卡上則可透過部分 CPU 卸載來執行——較慢,但可行。這是「直接就能跑」的版本。

• 30 GB — Q8_0。權重接近完整精度,需要大約 40 GB 的 VRAM 才能完全保留在 GPU 上。在 27B 模型上,你應該早就知道為何在為此付出代價之前,會想要這種額外的保真度。

• 56 GB — BF16。參考組建。需要 H100 等級或 96 GB 的硬體。沒有人會在消費級 GPU 上跑這個,而這也沒關係。

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

真正讓人栽跟頭的數字是 KV 快取。18 GB 的下載檔並不代表 18 GB 的 VRAM 就足以應付 262K 上下文的工作階段——在長上下文下,快取會在權重之外額外加上好幾 GB,這就是為什麼 24 GB 的顯示卡能在 8K–32K 上下文下輕鬆容納這個模型,但在 262K 下就不行。如果顯示卡只在及格邊緣,要降的是上下文,不是量化。

Apple Silicon 在這裡是一流的目標平台

Ollama 的 v0.32.12 發行說明特別提到 macOS。`ollama run qwen3.8:27b-mlx` 需要約 18 GB 的統一記憶體,因此 24 GB 以上的 Mac 可以完全在 GPU 上執行,並有足夠的上下文餘裕。另外還有 64 GB 的 mxfp8 MLX 標籤,以及給 64–64 GB 機器的 64 GB mlx-bf16。如果你的 M 系列 Mac 一直關注桌上型模型的新聞,這就是你期待已久的版本。

背景:規格表上是 262K,實際坐上去卻沒那麼多。

模型卡列出 262,144 個原生 token,可延伸至 1M;Ollama 的模型庫頁面回報相同的視窗為 256K。兩者皆為真——262,144 是 256K 乘以 1024——而且兩者都不代表你應該在 24 GB 的顯示卡上把那個數字輸入 --num-ctx。KV 快取會隨著上下文大致呈線性成長,因此在消費級硬體上,你會實際運作在 16K–64K,而非 262K。從 Ollama 預設值開始,只有在任務確實需要時才提高 --num-ctx,並記住 1M 這個數字需要延伸機制,還需要足夠的 VRAM 來支撐它。

還有什麼仍不穩——在你下注之前,先讀這個

• 目前尚無獨立基準測試結果。截至 8 月 15 日,模型卡上的每一項數字都只是阿里巴巴的片面說法。相較於 Qwen3.6-27B,其宣稱的增益幅度相當大——SWE-bench Pro 61.7 對 53.5、Terminal Bench 2.1 73.0 對 63.4、LiveCodeBench v6 90.3 對 83.9、GPQA Diamond 89.2 對 87.8——這些數字讀起來都 plausible 合理,但沒有任何一項經過外部測試框架重現。切勿單憑這些數字就做出正式生產決策。

• 這套視覺技術堆疊才推出幾天而已。一份早期的錯誤回報(ollama 問題 #17753)顯示,Q4 版本會把視覺輸入導向 Qwen3.5 解析器,並在圖像上出錯;這個問題在幾天內便於 PR #17755 中修復,但對於一個才問世一週的模型來說,多模態路徑正是你在依賴它之前應該先測試的地方。

• 預設建置包含 MTP。 q4_K_M 標籤同時也是多詞元預測建置——解碼更快,也是「18 GB」與「27B」能夠並存而不矛盾的原因。

• 在 Apple 裝置上,量化標籤可能會造成誤導。18 GB 的「mlx」與「nvfp4」標籤在量化方式上並不相同——NVFP4 是 NVIDIA 的 FP4 格式——因此在 Mac 上,除非你確實需要供 Blackwell GPU 使用的 FP8/FP4 變體,否則請優先選用純 mlx 版本。

「免費」在那個標題裡可說是身負重任。

自行託管 27B 模型以每 token 計算雖然免費,但並不是真的免費。誠實的說法是:有三個選項,各自以不同的貨幣計價:

• 自己跑(Ollama)。 每 token $0、離線、無限、私密——而且硬體是你的。24 GB GPU 或 18 GB+ 的 Mac 是一筆真實的購買,電力與設定時間也是。當 Qwen3.8 27B 成為日常主力時,這才是正確的選擇。

• 呼叫 $0 的限流 API。OrcaRouter 在自家基礎設施上以零成本提供 Qwen3.8 27B(模型 ID qwen/qwen3.8-27b-free,每筆請求 $0,有速率限制)——因為權重是開放的,沒有可轉嫁的每詞元供應商成本。當你想試用這款模型,又不想為了測試一週前才發布的版本而添購硬體時,這正是合適的選擇。

• 呼叫無流量限制的 API。在 OrcaRouter 上,同樣的模型若不受速率限制,每百萬個輸入權杖為 $0.33,每百萬個輸出權杖為 $2.40(qwen/qwen3.8-27b,262K 上下文,支援文字、圖像與影片輸入)。當你需要生產規模,又不想時時看顧 GPU 時,這正是正確的選擇。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

決定兩者之間取捨的數學:偶爾使用時,選擇 $0 或 $0.33/$2.40 的方案,比付出 GPU 的價格更能回本;每日互動使用則以地端較便宜;持續的生產吞吐量,則以你不需要一直維持運作的 API 最便宜。無論數學怎麼說,隱私與離線需求都會把你推向第一欄。

當這項推薦錯誤時

• 你真的需要 100K+ 的上下文。模型做得到;你那張 24 GB 的顯示卡做不到。在真正的長上下文情境下,40 GB+ 的 GPU 或更長上下文的 API 並不是奢侈品。

• 你今天就需要在生產環境中使用影片。 視覺路徑的解析器錯誤才剛修好;在一個才問世一週的多模態模型上跑生產影片,是你不該在沒有備援方案時下的賭注。

• 你想要並行處理。一張消費級 GPU 一次只能串流一或兩個生成。27B 不是一台服務主機。

• 你目前使用的是僅有 CPU 的硬體。在 CPU 上以 4 位元執行 27B 模型只是緩慢的示範,稱不上工具。在你擁有 GPU 之前,使用 API 才是務實的選擇。

最重要的是

Qwen3.8 27B 在 Ollama 上,是迄今任何人推出過、最容易運行當代 27B 模型的方式:一行指令、預設 18 GB 且能塞進 24 GB 顯示卡、一流的 Apple Silicon 版本,以及 Apache 2.0 的自由。你該選的量化幾乎總是預設的 Q4_K_M——只有在你能測出差異時,才換到 q8_0。而「免費」是有條件的:如果你只是偶爾碰一下這個模型,$0 的限流 API 比買硬體更自由;如果它成為你的每日主力,本地副本就是你擁有最便宜的東西。在你依據這些數字打造之前,先驗證它們——本文所有內容在 2026 年 8 月 15 日為真,而這個模型每天都在變。