「Qwen3.8-Max 對決 Qwen 3.8」的英雄標題卡,副標題為「單一 2.4T 核心——租用 API 或開放權重」,徽章標示 2026 年 9 月 2 日 0902 更新、每 1M tokens 收費 $2/$6 的代管 API,以及 8 月 12 日的開放權重;頁尾則註明 0902 版本在獨立 Code Arena WebDev 中以 1,691 分位列第 1,且開放檢查點尚無獨立評測分數。
Guides & Insights

Qwen3.8-Max 對比 Qwen 3.8:單個 2.4T 核心,租用還是本地運行——0902 更新之後

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月2日,阿里巴巴發布了 Qwen3.8-Max 的一個標註日期的更新——這個建置被它標記為 Qwen3.8-Max-0902——而同一週內,一個獨立的程式碼排行榜便把這個新快照列為第一名。那同一個 2.4 兆參數核心的下載版本,也就是多數人寫「Qwen 3.8」而不加後綴時所指的模型,仍停留在 8 月 12 日的檢查點:純文字、推理鎖定開啟,而且要在任何比 GPU 機架更小的硬體上執行,還差數百 GB。官方託管旗艦版與開放權重之間的差距在 8 月還不存在;現在它成了整個比較的核心,也是同一個模型一直用兩個名稱賣給你的原因。

Qwen3.8-Max 是阿里巴巴代管的旗艦產品:這是一個 2.4 兆參數的稀疏混合專家模型,每個 token 約有 950 億參數處於啟用狀態;自 8 月 3 日起透過付費 API 提供服務,並具備 100 萬 token 的多模態上下文視窗。若將 Qwen 3.8 作為獨立名稱看待,它則代表同一世代的開放釋出——其中最重要的是 Qwen3.8-2.4T-A95B,這是阿里巴巴在 8 月 12 日以自訂授權發布的權重。兩者並非一個平價版、一個旗艦版的關係;它們是同一個大腦以兩種方式販售,而 9 月的一次後訓練處理已開始讓這兩種交付方式產生分歧。本文旨在釐清你實際上看到的是哪個「Qwen 3.8」、0902 版本更新改變了什麼,以及你今天該選擇哪條路——租用 API 或自行執行權重。

不是競爭關係的配對

在日期和費率表之前,先談架構:Qwen3.8-Max 與 Qwen3.8-2.4T-A95B 採用共享的細粒度 MoE 設計——每層 512 個專家(每層 10 個路由專家加上 1 個共享專家)、共 92 層,並以混合堆疊架構呈現,其中 92 層中有 69 層使用線性注意力(Gated DeltaNet 結合門控注意力),並穿插完整注意力來處理長上下文工作。這就是為什麼模型卡能在 API 上宣稱百萬 token 上下文,也是為什麼開放版本能達到原生 262K,並在合適的服務配置下朝百萬延伸。這兩個名稱之間的差異不在權重架構本身,而在於邊界;而自 9 月 2 日以來,這些邊界已經移動了。

• 參數 — Qwen3.8-Max:總計 2.4T / 約 95B 啟用,MoE。Qwen3.8-2.4T-A95B:相同核心,相同啟用數量。

• 發布 — Qwen3.8-Max:託管API,自8月3日起上線,9月2日更新為Qwen3.8-Max-0902。Qwen3.8-2.4T-A95B:可下載權重,首次發布於8月12日,此後沒有更新的檢查點。

• 模態 — Qwen3.8-Max:支援文字、圖片與影片輸入。Qwen3.8-2.4T-A95B:僅支援文字。

• 推理控制 — Qwen3.8-Max:思考可切換,包括非思考模式。Qwen3.8-2.4T-A95B:思考永遠開啟,僅有推理強度調整(低/高/超高)。

• 工具 — Qwen3.8-Max:原生函式呼叫、五種內建工具與結構化輸出。Qwen3.8-2.4T-A95B:沒有原生工具層;能獲得哪些功能取決於你用以部署的推論框架。

9月2日更新改變了什麼

0902 版本是後訓練(post-training)的成果,並非新的架構。阿里巴巴將它聚焦於 Qwen3.8-Max 原本就以之聞名的兩大領域——程式設計,以及它所稱的「cowork」(指南針長時程的代理與辦公室工作)——而環繞這套版本產生的各項數據,正是這次更新之所以重要的原因。在獨立的 Code Arena: WebDev 排行榜上,Qwen3.8-Max-0902 以 1,691 Elo 初次登場,比前一版高出 22 分,一上榜便足以躍居首位。阿里巴巴也將這套版本定位為該排行榜成本效益 Pareto 前沿上得分最高的模型,混合費率約為每百萬個 token 5 美元——這是將 2 美元與 6 美元的牌價,以輸出密集的代理流量加權計算的結果,大約是同級前沿模型在其他平台呼叫費用的四分之一。這些數據屬於不同範疇,讀者應加以釐清:1,691 Elo 是獨立競技場的結果;而 Pareto 前沿的定位,則是阿里巴巴自己對這個獨立排行榜所做的詮釋。

阿里巴巴內部對 0902 版本的評估(由廠商回報且未經重現)顯示出相同的趨勢:Terminal-Bench 3.0 從 11.3 升至 29.0,ProgramBench 從 10.5 升至 28.0,JobBench 從 53.4 升至 64.0,WorkArena Elo 從 1,348 升至 1,468。應將這些數據視為「此次改版在代理(agentic)與程式編寫(coding)兩個軸線上有所推進」,而非經驗證的分數。在一般智能方面,Artificial Analysis 的 Intelligence Index 將 Qwen3.8-Max 評為 56 分——具競爭力,但並非選擇它的原因;程式編寫與代理能力的表現才是。

大部分報導忽略的部分是,截至撰寫本文時,0902 的後訓練僅限 API 使用。阿里巴巴尚未發布更新後模型的開放檢查點——Hugging Face 上的 Qwen3.8-2.4T-A95B 權重仍可追溯到 8 月 12 日的發布版本。這意味著託管的 Qwen3.8-Max 與可下載的核心模型,已不再像 8 月中旬時那樣是同一款模型。API 具備 9 月的後訓練成果,而權重版本則沒有。如果你運行開放版本的全部理由是要精確重現旗艦模型的行為,那麼這個假設已於 9 月 2 日悄悄失效。

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

他們真正分歧的五個地方

暫且擱下共享架構不提,實際差異就很清楚了。模態是第一個篩選條件:如果你的工作負載包含圖片或影片——螢幕截圖、圖表、含圖形的文件、影片影格——只有 Qwen3.8-Max 能處理這些,而且它的 100 萬 token 視窗是原生支援,不是擴充功能。開放權重版本僅限文字。推理控制是第二個條件:託管 API 可以關閉思考模式執行,這對延遲敏感且高流量的擷取作業很重要,因為在這些情境下,思考鏈只是純粹的額外負擔;開放版本則無法關閉。工具支援是第三個條件:函式呼叫、五種內建工具和 JSON 模式都是託管產品的一部分,而開放版本則取決於你的伺服層提供哪些功能。

上下文長度的實際情況遠比規格表乍看之下更為微妙。兩邊都能達到約一百萬個 token,但託管模型是原生支援多模態輸入來達成;而開放版本 262K 的原生上下文則必須在配置中擴展,而且擴展視窗中的每個 token 都只是文字。輸出上限也有差異——API 最高允許約 131K 個輸出 token,開放版本通常也配置成相近的上限,但開放一側的實際天花板是由你的伺服部署堆疊決定的,而非由模型本身決定。

每條路線的實際成本

這就是這兩種交付方案完全無法再相提並論的地方。Qwen3.8-Max 的定價為:每百萬個輸入 token 2.00 美元、每百萬個輸出 token 6.00 美元,每百萬個快取輸入則為 0.25 美元。由於 OrcaRouter 以 0% 加價直接傳遞供應商定價,因此這就是您在 OrcaRouter 支付的費率;當 Alibaba 變更價格時,新數字會在同一天生效。0902 快照另外固定為 qwen/qwen3.8-max-0902,供希望擁有可重現行為的團隊使用——價格相同、功能相同,但採用固定的檢查點,而非持續滾動更新的模型。在 OrcaRouter 的流量上,Qwen3.8-Max 的 7 天中位數首次輸出 token 時間約為 2 至 4 秒,而 Artificial Analysis 測得每秒約 45 至 48 個輸出 token:並不算慢,但相當冗長,這正是為何在此模型上執行代理式任務,即使費率低廉,仍可能消耗出乎意料的 token 數量。

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B 沒有定價,因為價格就是你的基礎設施。BF16 權重大約需要 4.9 TB,即便是官方的 FP8 版本也約需 2.4 TB,所以這屬於機架級硬體:有文件記載的最小伺服配置從大約八顆 B300 或 GB300 GPU 起跳,而完整的 GB300 NVL72 機架則是參考部署。積極的量化改變了下限——NVFP4 版本約需 1.3 TB,而 Unsloth 的 1-bit 分層量化可將模型壓縮到約 397 GB,這終於讓單一配置良好的節點變得可行——但這些途徑全都假設你以資料中心規模營運 GPU。提供開放檢查點的第三方主機會以低於 Max 的每 token 單價販售 token 給你,但你會因此失去多模態輸入、非思考模式、原生工具與 0902 後續訓練,而且目前尚無任何針對該可下載檢查點本身的獨立評測發表。阿里巴巴自家的模型卡對這段關係相當坦承:它將 Qwen3.8-Max 描述為基於 Qwen3.8-2.4T-A95B 打造的官方版本,在開放核心之上加入了視覺輸入、非思考支援、預設 1M 上下文與內建工具。

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

獨立數據對比廠商宣稱

在這裡,來源的可信度比在多數對比中更為重要,因為雙方的證據年代差異相當大。Qwen3.8-Max 已獲得獨立評測:0902 版在 Code Arena: WebDev 的 1,691 分結果,以及 Artificial Analysis 的 Intelligence Index 56 分,都是第三方測量數據;而讓 Pareto-frontier 說法顯得意義的定價,則是已公開的價目表。Qwen3.8-2.4T-A95B 尚無這些資料——阿里巴巴發布的基準測試表格描述的是 Max 級核心,並非對可下載 checkpoint 的獨立執行結果;因此,這項比較中開源的一方在很大程度上仍只是「廠商聲稱核心的成績如此」。若你是以效能表現為依據來決定取捨,在第三方實際運行之前,請將開源權重的主要數字視為宣稱。

該由誰來選擇哪一個

The decision falls out of the list above. Reach for the hosted Qwen3.8-Max — today, specifically the 0902 build — when you need the September post-training, image or video input, a non-thinking mode, native tools and structured output, or a million-token window without standing up infrastructure. That is the coding-and-agentic frontier position, and at $2/$6 with $0.25 cached input it is aggressively priced for what it is.

選擇 Qwen3.8-2.4T-A95B 的時機是當控制權重於便利性時:你需要將權重部署在自己的硬體或你已營運的供應商上、你想要一個可稽核且可重現的固定檢查點,或者你的持續使用量使每 token 成本成為主導因素,而你已準備好運行一個 2.4T MoE。請接受其取捨清單——僅限文字、思考功能永遠開啟、無原生工具、尚無 0902 後期訓練——並依據你的營收級距核實授權條款,因為客製化的 Qwen3.8-Max 授權並非 Apache 2.0,且對大型商業營運者附加了額外條件。

如果您的工作負載屬於高吞吐量、單一 GPU 或延遲敏感類型,這兩者可能都不是正確的車道——該世代的 270 億參數兄弟型號 Qwen3.8-27B 才是專為此而設計的,我們在 Qwen3.8-27B 與 Qwen3.8-Max 的比較中已另行說明。

如何在不用押上全部籌碼的情況下嘗試兩者

要乾淨地進行這項呼叫,最理想的方式是讓雙方都在你自己的提示詞上運行,而正是在這裡,路由層才能真正發揮其價值,而不是事後才硬加上去。Qwen3.8-Max 與固定的 Qwen3.8-Max-0902 快照版本,兩者都位於 OrcaRouter 上同一個 OpenAI 相容端點之後,因此在滾動旗艦版與可重現的檢查點之間切換,只需變更模型 ID,而無需重新部署。當團隊決定將開放權重引入內部部署時,路由 DSL 可以將自架的 vLLM 或 SGLang 端點(提供 Qwen3.8-2.4T-A95B 服務)置於前端,並將其放入相同的呼叫圖中——大量流量送往自家部署,困難提示詞與多模態請求則分流至託管的 Qwen3.8-Max,兩者之間具備自動容錯移轉。以這種方式嘗試新的檢查點,成本只是一次配置變更,而非一次遷移,這正是當這項比較的兩端仍以不同速度演進時,你所需要的一切。

重點

Qwen3.8-Max 和 Qwen 3.8 並非兩個爭搶同一份工作的模型。它們是同一個 2.4 兆參數的核心,以租用 API 與可下載權重兩種形式交付,而 9 月 2 日的更新讓這兩種交付有了不同的含義。租用 API,你獲得的是 0902 後期訓練版本,它在 Code Arena: WebDev 取得領先,並具備視覺能力、非思考模式、原生工具支援,以及原生百萬 token 上下文視窗,價格為 $2/$6,快取輸入 $0.25。運行開放權重,你獲得的是凍結於 8 月 12 日狀態的相同架構——僅限文字、推理模式鎖定開啟——目前尚無獨立評測成績,而且得自付資料中心級別的硬體帳單。如果你看重 9 月帶來的編碼與代理式能力進展,今天兩個名稱中只有一個具備這些。如果你更看重可重現的控制權,兩個名稱中也只有一個真正歸你所有、能夠留存。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新