對決 Qwen3.8-27B 與 Qwen 3.8 的英雄標題卡,展示兩張圓角晶片卡——具備 262K 上下文與 Apache 2.0 授權的 27B 稠密模型,對上擁有自訂授權的 2.4T/95B 活躍參數 MoE 核心——以及右下角的 OrcaRouter 標誌。
Guides & Insights

Qwen3.8-27B 對決 Qwen 3.8:同一世代,一張 GPU 對上整個機架

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

本週,阿里巴巴把 Qwen3.8-27B 放上了 Cerebras 的快速推論通道——這是這款稠密 27B 模型首度擁有真正快速的託管選項——而 Artificial Analysis 也終於把這場對決的雙方都納入索引。Qwen3.8-27B 在 AA Intelligence Index 上拿下 34 分。Qwen 3.8,也就是大多數人在不帶後綴寫出這個名字時所指的開放核心版本,則拿下 40 分。這兩個數字重新開啟了一項比較,而八月發表時的報導只能完全仰賴廠商的說法。

「Qwen 3.8」這個獨立名稱背後的模型是 Qwen3.8-2.4T-A95B:阿里巴巴以自訂授權條款發布的 2.4 兆參數混合專家權重。Qwen3.8-27B 是同一世代的稠密模型成員——約 270 億參數,Apache 2.0 授權,尺寸適合單一 GPU。它們共享家族名稱、原生 262K 上下文長度,以及相同的發布時程。關於它們的其他一切都是一組對比的寫照:一個你能擁有,另一個你只能租用。如今兩者都有了各自獨立的數據,以下是它們各自實際上適合的用途。

同一世代,相反的形狀

Qwen3.8-27B 是稠密模型——270 億參數(計入視覺編碼器則為 280 億)、64 層,以及由 48 層 Gated DeltaNet 線性注意力層對上 16 層全注意力層所構成的混合注意力堆疊。正是這種混合設計,讓一個 27B 模型能承載 262,144 個 token 的原生上下文。Qwen3.8-2.4T-A95B 則是旗艦架構:總參數 2.4 兆,每個 token 約有 950 億活躍參數,92 層、每層 512 個專家,而這 92 層中有 69 層採用線性注意力。同樣的手法,九十倍的規模。

• 架構 — Qwen3.8-27B:27B 稠密模型,每個 token 都會點亮全部參數。Qwen3.8-2.4T-A95B:總計 2.4T/約 95B 啟用的 MoE。

• 上下文 — 兩者皆為 262K 原生;27B 的 1M 擴充僅限託管版,2.4T 實測可達約 984K。

• 輸入 — Qwen3.8-27B:文字、圖像與影片。Qwen3.8-2.4T-A95B:僅文字,思考鎖定開啟。

• 授權 — Qwen3.8-27B:Apache 2.0。Qwen3.8-2.4T-A95B:自訂 Qwen3.8-Max 授權。

• 權重 — Qwen3.8-27B:55.6GB BF16,量化後約為 16GB 的 Q4 版本。Qwen3.8-2.4T-A95B:約 2.4TB BF16,得靠一整座 GPU 機架,不是桌機跑得動的。

• 你會在何處遇見它們——Qwen3.8-27B:可自行託管,或便宜租用。Qwen3.8-2.4T-A95B:租用,因為沒有明智的人會自己擁有那整櫃機器。

獨立數字,終於

每一篇關於 Qwen3.8-27B 的 August 對比文章,都帶著同樣的但書:「目前尚無獨立評分。」這已經不再是事實。Artificial Analysis 截至本週已測量了這兩個模型,而資料的樣貌確實很有意思。

在 Intelligence Index 上,Qwen3.8-2.4T-A95B 得分 40,在其類別 113 個模型中排名第 4。Qwen3.8-27B 得分 34——這使其在開放權重 4–40B 尺寸級別的 140 個模型中排名第一,對稠密 27B 模型而言是相當強勁的表現。依獨立量測結果,兩者都偏慢:27B 每秒輸出 39.0 個 token,2.4T 則為 38.1 個,而同類中位數約為 90。兩者也都冗長,27B 在整個 index 測試執行中產生約 2 億個輸出 token,而同類中位數為 6,800 萬。兩者都不是引領話題的前沿模型;兩者都是主力工作馬,而該指數顯示,2.4T 是明顯更強的主力。

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

獨立方的定價以美元講述了同樣的故事。Artificial Analysis 將 27B 在 Qwen Cloud 託管版本上的價格定為每百萬輸入 $0.50、每百萬輸出 $3.00(90% 快取折扣),而 2.4T 則為 $2.00 / $6.00(88% 快取折扣)。每項 Intelligence Index 任務的成本:27B 為 $0.82,2.4T 則為 $2.16。較小的模型每單位智慧的執行成本更低——而兩者相對於其速度等級都偏貴,因為兩者都是會大量消耗輸出 token 的推理模型。

其他一切——SWE-bench Pro 61.7、DeepSWE 1.1 42.2、27B 的 LiveCodeBench v6 90.3;2.4T 的 86.6 Terminal-Bench 2.1 與 67.7 SWE-bench Pro——仍是廠商自行報告、未經重現,且本文從頭到尾都如此標註。上述 AA 指數是這一切之下的獨立下限。

Cerebras 的上市改變了什麼

2026年9月12日,Qwen 帳號宣布 Qwen3.8-27B 現已在 Cerebras 上運行,其目錄條目已在「Qwen 3.8 27B 現已在 Cerebras PayGo 上推出」的橫幅下上線。Cerebras 將其列為每百萬輸入 $0.99、每百萬輸出 $1.49,運行於讓該公司以速度打響名號的 WSE 級硬體上。這讓 27B 獲得了 2.4T 核心從未有過的東西:一條快速通道。

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

這很重要,因為從第一天起,慢又冗長就是 27B 唯一的真正缺點。在獨立測試框架上,它的速度是 39 t/s;在我們自家的服務遙測中,它一直維持約每秒 154 個輸出 token,首 token 延遲的 p50 為 4.48 秒——而現在還有第二家供應商在同一軸線上競爭。相較之下,2.4T 完全沒有快速通道:在 38 t/s 的速度下,你付的是頂尖價格,換來的卻是中段班的速度,而唯一的變通之道,就是自己租用 GPU 叢集來跑開放權重。

27B 三條通道,2.4T 一條

截至今天,dense 27B 可透過三種方式租用,而在你挑選之前,價差值得先讀一讀:

• 自架通道 — Qwen3.8-27B 已在 OrcaRouter 上線,每百萬 $0.33 / $2.40,運行於我們自家的基礎設施上。市場上最便宜的輸入價格,輸出約 154 tok/s,262K 上下文。

• 廠商通道 — Qwen Cloud 的託管版本,每百萬 $0.50 / $3.00,具備 1M-token 上下文與 90% 快取折扣。

• 快速通道 — Cerebras PayGo,每百萬 $0.99 / $1.49,定位於速度而非價格。

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

2.4T 的開放核心並沒有對等的價差。服務同一套架構的旗艦 API——Qwen3.8-Max——每百萬要價 $2.00 / $6.00,而無論你稱它為 Max 還是開放核心,這個數字都一樣。改用權重自己跑,經濟帳就翻轉到硬體上:2.4T 需要約 2.4TB 的 BF16 權重和一臺多 GPU 節點,這是一項沒人會輕易做出的資本決策。一張 24GB 的 GPU 跑 27B 的 Q4 版本,邊際成本四捨五入後就是零。

決定多數團隊的那個實例:每天 1 億輸入 token 與 2,000 萬輸出 token。以 2.4T 的 $2/$6 費率計算,那是每天約 $320,一年約 $117,000。換成 27B、以我們的 $0.33/$2.40 計算,則是每天約 $81——而若是自架版本,那就只是電費而已。2.4T 能為你換來實質的品質優勢,AA 40 對上 34。那股優勢是否值得每月五位數的帳單,正是這組搭配所提出的全部問題。

在它們真正分歧的地方

除了索引之外,還有三項實務上的差異會決定哪一個適合特定的工作負載。

多模態輸入是最乾淨的篩選條件。Qwen3.8-27B 能讀取文字、圖像和影片——截圖、圖表、含圖的文件、影片幀全都進入同一個 262K 視窗。Qwen3.8-2.4T-A95B 則極度限定於純文字。如果你的輸入包含任何視覺內容,那麼無論 2.4T 的指數多高,它都已出局。

思考控制是次要的。27B 的推理模式可以依每次請求關閉,這對延遲敏感的擷取來說很重要,因為在這種情境下,思維鏈純屬額外負擔;它也會暴露 reasoning_effort。2.4T 核心無法關閉思考——每個回應都會以 think> 區塊開頭,而且無論你想不想要,都得為那些 token 付費。旗艦 API 修正了這點,但開放核心並沒有。

授權條款排在第三,而它在規模化時悄悄發揮關鍵作用。27B 採用 Apache 2.0,這是寬鬆授權的標準範例:可修改、可再散布、可商業化,還包含專利授權。2.4T 則採用自訂的 Qwen3.8-Max 授權條款——精神上屬寬鬆,但那是阿里巴巴自家的條款,並非社群標準;在據此打造產品之前,值得先讀過那份文件。

導向決策的

這場對決的兩邊都能透過同一把 OrcaRouter 金鑰存取,這正是「我該選哪一個」這個問題能用極低成本實測回答的原因。Qwen3.8-27B 已上線,型號為 qwen/qwen3.8-27b,以供應商定價提供、零加成,而建構於同一 2.4T 核心的旗艦 API 已上線,型號為 qwen/qwen3.8-max,每百萬 token 收費 $2.00 / $6.00——這是阿里巴巴自家的價格,直接原價傳遞,因此供應商任何價格變動,當天就會在此生效。

同樣的 2.4T 架構若以可下載權重形式提供,並不是我們所供應的服務——如果你今天想透過 API 取得這個開放核心,旗艦通道就是實際取得它的途徑,而 qwen/qwen3.8 已預先接好,一旦有供應商提供開放權重即可啟用。將視覺與延遲敏感的流量導向 qwen/qwen3.8-27b,並把困難推理的長尾流量導向 qwen/qwen3.8-max 的路由規則,設定起來零成本,還會在供應商之間自動容錯移轉。一組金鑰、無需第二份合約,而且這種拆分只是設定變更,而不是重新架構——這是測試 2.4T 多出的六個指數分數對你來說是否值得每百萬個輸出 token $5.67 的最便宜方式。

該由誰來選擇哪一個

• 若你的輸入包含圖像或影片、若你想要可隨時關閉的思考功能、若你擁有或打算入手 24GB 的 GPU,或者若你的每 token 花費量大到「$0.33/$2.40 對比 $2.00/$6.00」本身就是全部理由,那就選 Qwen3.8-27B。

• 若你只處理文字、想要這個系列中最強的獨立推理分數(AA 40),而且 $2/$6 的費率——或運行 GPU 節點的成本——穩穩落在你的預算內,就選 Qwen 3.8(2.4T 核心)。

• 若你的流量橫跨這兩種使用情境,就兩者都選:讓流量經由閘道路由,由路由器依模態與難度分流,並在任一模型的下一個檢查點或價格出爐時再改變主意。

裁決

Qwen 3.8 這個名稱向來是兩個產品假裝成同一個家族,而如今兩者都有各自獨立的數字可以爭論。Qwen3.8-2.4T-A95B 是更強的大腦,純文字、昂貴,而且以 $2/$6 的價格無可否認地有利可圖。Qwen3.8-27B 則是可以部署的那一個——多模態、Apache 2.0、可自行架設,而且從本週起,它終於也有了快速通道。指數差距是真的:40 對 34。價格差距也是:當你把 2.4T 當成 API 來跑時,每 token 成本大約是五倍。對大多數團隊來說,這個決定無關那六點指數差距,而在於你買的是 token 還是硬體——而 27B 是兩者中唯一讓你買得到硬體的那一個。