Ollama 上 Qwen3.8-27B 文章的標題卡,顯示一個極簡的終端機視窗,其中包含指令「ollama run qwen3.8:27b」和一個閃爍的游標,三個徽章分別寫著「18 GB 下載」、「Q4_K_M 預設」和「262K 上下文」,以及說明文字「免費執行,你的硬體」。
Guides & Insights

Qwen3.8-27B 在 Ollama 上:一條指令、四種量化,以及「免費」的真正代價

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

用一條指令執行它:ollama run qwen3.8:27b。這就是本頁所探討問題的完整答案。Qwen3.8 27B — Ali​baba 的稠密式 270 億參數模型,權重於 2026 年 8 月 14 日以 Apache 2.0 授權釋出 — 本週已在 Ollama 函式庫上線,預設版本已是合理的 18 GB Q4_K_M 量化(17 GB 權重加上 931 MB 視覺編碼器)。它在一般上下文長度下可完整運行於 24 GB GPU,顯示卡較小時會分流至 CPU,而且每個 token 都不用花費。

這裡的所有內容均以 2026 年 8 月 15 日為準。規格來自 Qwen3.8 27B 模型卡;下載大小、標籤與下載次數來自 Ollama 線上函式庫頁面;基準測試數據由 Alibaba 提供,尚無獨立複現結果。該模型於數日前發布,因此所有可能變動的資訊皆應視為暫定。

真正有效的一行代碼

如果你已經安裝了 Ollama,你只差兩個字:

運行 ollama qwen3.8:27b

Ollama 支援已於 v0.32.12 落地——發行說明簡潔地寫道:「此版本新增對 Qwe​n 3.8 27B 的支援。」首次執行會下載預設建置(約 18 GB,Q4_K_M),然後便會進入一個預設開啟思考模式的聊天 REPL。函式庫頁面以能力標籤「vision tools thinking 27b」列出此建置,藉此即可得知視覺與工具呼叫路徑已整合到同一個下載中。截至撰寫本文時,該頁面顯示超過 40,000 次下載,以及一個已涵蓋十一種變體的標籤清單。

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

兩種你真的會想使用的變體:

• ollama run qwen3.8:27b-mlx — Apple Silicon 版本,同樣佔用 18 GB 空間,但為 Metal 編譯;Ollama 的版本說明特別針對此版本進行最佳化,「for maximum performance and output quality suitable for repeated tasks and coding agents.」

• ollama run qwen3.8:27b-q8_0 — 一個 30 GB 的 8-bit 量化版本,適合當你擁有足夠 VRAM 且希望權重更接近全精度時使用。

您實際下載的內容

名稱寫的是27B,但完整參數數量是28B:一個273億的稠密語言模型,加上一個4.61億的視覺編碼器,讓它原生支援圖片與影片輸入。其餘的標題規格,直接來自模型卡:

• 64 層,隱藏層大小 5,120,詞彙量 248,320。

• 混合注意力:16 個完整的 Gated Attention 層與 48 個線性 Gated DeltaNet 層 — 3:1 的偏線性組合,這正是 27B 模型能在 KV 快取不耗盡整個資料中心的情況下,維持 262,144 token 原生上下文(可擴展至 1M)的原因。

原生圖像和視頻理解——「從STEM圖表和文檔到小時級視頻」是阿里巴巴的措辭。

• Apache 2.0。下載它、修改它、用它銷售產品。該許可證是本文其餘經濟論述所依賴的法律事實。

全精度參考是 BF16,這就是 56 GB 標籤存在的原因;每個較小的標籤都是以精度換取體積的取捨,而模型卡自帶的基準測試正是你取捨時的對照基準。

先選定量化等級,再檢查你的VRAM,而不是反過來。

Ollama 提供十一種標籤,但最終的選擇歸結為三種尺寸。

18 GB — Q4_K_M(預設)。在正常上下文長度下可完全放入 24 GB 顯示卡(RTX 4090 / 5090 等級);在 16 GB 顯示卡上則需部分 CPU 卸載——速度較慢,但可以運行。這是最適合「直接就跑」的版本。

30 GB — Q8_0. 權重接近全精度,需要約 40 GB 的 VRAM 才能完全在 GPU 上運行。在 27B 上,你應該已經知道為什麼在付費前需要額外的保真度。

56 GB — BF16。這是參考版本。需要 H100 級別或 96 GB 的硬體。沒有人會在消費級 GPU 上運行這個,這沒關係。

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

最常讓人搞錯的數字是 KV 快取。18 GB 的下載量並不代表 18 GB 的 VRAM 就足以應付 262K 上下文的會話——在長上下文時,快取會在權重之外再增加數 GB 的空間,這就是為什麼一張 24 GB 的顯示卡在 8K–32K 上下文時能輕鬆容納這個模型,但在 262K 時卻不行。在效能吃緊的顯示卡上,請降低上下文長度,而不是調低量化等級。

Apple Silicon 在此是一等目標。

Ollama 的 v0.32.12 版本說明特別點名了 macOS。具體來說,`ollama run qwen3.8:27b-mlx` 需要約 18 GB 的統一記憶體,因此配備 24 GB 以上記憶體的 Mac 可以完全在 GPU 上運行,並為上下文預留充足空間。此外還有 32 GB 的 mxfp8 MLX 標籤,以及適用於 64–128 GB 機型的 56 GB mlx-bf16 標籤。如果你的 M 系列 Mac 一直在關注桌面級模型的消息,這個版本正是你等待已久的版本。

背景:規格表上寫著 262K,實際坐上座位時卻更少

模型卡片列出 262,144 個原生 token,可擴展至 1M;Ollama 的函式庫頁面則將相同視窗標示為 256K。兩者都正確——262,144 就是 256K 乘以 1024——但兩者都不代表你應該在 24 GB 顯示卡上把這個數字填進 --num-ctx。KV 快取會隨上下文長度近似線性成長,因此在消費級硬體上,你會實際使用在 16K–64K 之間,而不是 262K。從 Ollama 預設值開始,只有當任務確實需要時才調高 --num-ctx,並記得 1M 這個數字需要擴展機制加上足夠的 VRAM 來支撐。

還有哪些地方不穩妥——下注之前先讀讀這個

尚無獨立基準測試。 模型卡上的每個數字都是Ali​baba截至8月15日的說法。相較於Qwen3.6-27B,宣稱的進步幅度很大——SWE-bench Pro 61.7對53.5,Terminal Bench 2.1 73.0對63.4,LiveCodeBench v6 90.3對83.9,GPQA Diamond 89.2對87.8——而且這些數字讀起來都合理,但目前沒有一項曾被外部測試框架重現。不要僅憑這些數字來做生產決策。

視覺處理堆疊才剛推出數天。 一份早期的錯誤回報(ollama issue #17753)顯示,Q4 版本將視覺輸入導向 Qwen3.5 解析器,並在處理圖片時失敗;此問題已在 PR #17755 中於數日內修復。但對於問世僅一週的模型,多模態路徑正是你在依賴它之前應該測試的地方。

預設建置包含 MTP。q4_K_M 標籤也是多 token 預測建置——解碼速度更快,也是「18 GB」與「27B」能並存而無矛盾的原因。

在 Apple 裝置上,量化標籤可能造成誤導。「mlx」與「nvfp4」這兩個 18 GB 標籤在量化方式上有所不同——NVFP4 是 NVIDIA 的 FP4 格式——因此在 Mac 上請優先選擇單純的 -mlx 版本,除非你特別需要針對 Blackwell GPU 的 FP8/FP4 變體。

「免費」在那個標題裡出了不少力。

自行託管一個27B模型,每個token是免費的,但這並非真正免費。誠實的說法是三個選項,各自以不同的貨幣計價:

自己運行(Ollama)。 每個 token $0、離線、無限、私密——而且硬體是你自己的。24 GB GPU 或 18 GB+ 的 Mac 是一筆實打實的購買,電費和設定時間也不例外。當 Qwen3.8 27B 成為日常主力時,這才是正確的選擇。

呼叫一個 $0 且有限速的 API。 OrcaRouter 在自己的基礎設施上以零成本提供 Qwen3.8 27B(模型 ID:qwen/qwen3.8-27b-free,每次請求 $0,有限速)——因為權重是開放的,所以沒有需要轉嫁的每 token 供應商成本。當你想試用這個模型、而不想為了測試一週前發布的版本購買硬體時,這是最正確的選擇。

呼叫無速率限制的 API。 相同的模型在無速率限制下,於 OrcaRouter(qwen/qwen3.8-27b,262K 上下文,文字、影像與影片輸入)的價格為每百萬輸入 token 美金 $0.33,每百萬輸出 token 美金 $2.40。當你需要生產規模且不想費心照料 GPU 時,這是最合適的選擇。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

決定兩者取捨的數學是:偶爾使用時,以 $0 或 $0.33/$2.40 的價格比買一張 GPU 更划算;每日互動使用在本地端更便宜;持續的生產吞吐量,以不需自行維持運作的 API 最便宜。無論數學怎麼算,隱私與離線需求都會把你推向第一欄。

當此建議有誤時

你真的需要 100K+ 的上下文長度。 模型做得到;但你的 24 GB 顯示卡做不到。在真正的長上下文場景中,40 GB+ 的 GPU 或支援更長上下文的 API 並非奢求。

你今天就需要在生產環境中使用影片功能。 視覺路徑的剖析器錯誤才剛修正;在僅一週大的多模態模型上運行生產級影片,是一場你不該在沒有備援方案的情況下下的賭注。

你要的是並發。一張消費級 GPU 一次只能串流一兩個生成任務。27B 不是伺服器級的機器。

你目前使用的是只有 CPU 的硬體。在 CPU 上以 4-bit 執行 27B 模型只是緩慢的示範,不是實用的工具。在你擁有 GPU 之前,使用 API 才是誠實的選擇。

底線

在 Ollama 上執行 Qwen3.8 27B,是目前任何人已推出的同代 27B 模型中最容易上手的方式:一條指令搞定、預設 18 GB 可裝進 24 GB 顯示卡、具備一流的 Apple Silicon 版本,還享有 Apache 2.0 的自由。你該選的量化版本幾乎永遠是預設的 Q4_K_M——只有當你能量測出差異時,才升級到 q8_0。而「免費」是有條件的:若你只是偶爾碰一下模型,$0 且有限速的 API 會比買硬體更划算;若它成為你的日常主力,本機副本反而是你擁有過最便宜的東西。在拿這些數字當依據之前,先自己驗證——本文所述在 2026 年 8 月 15 日皆為真,而這個模型每天都在變化。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube