為 Qwen3.8 Max Prime 打造的主視覺標題卡,這是阿里巴巴為 Qwen3.8-Max 旗艦模型推出的 1.5 至 2 倍輸送量服務層級,規格標籤顯示相同的 2.4T 總參數量與約 95B 活躍參數,Prime 定價為 $3.301/$9.902,標準版為 $1.65/$4.951。
Guides & Insights

Qwen3.8 Max Prime:阿里巴巴在其旗艦旁擺上第二張價目表

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月22日,在杭州的雲棲大會上,阿里巴巴的MaaS業務線宣布推出一種名為Prime模式的服務層級——優速模式——並在價目表上為它新增了一個模型ID:qwen3.8-max-prime。那個ID並不是一個新模型。它是Qwen3.8-Max,即那款於2026年8月3日正式全面推出的2.4兆參數稀疏混合專家旗艦模型,只是透過更快的通道來提供。Qwen3.8 Max Prime與基礎模型擁有相同的權重、相同的上下文視窗、相同的工具鏈,以及相同的使用限制。不同之處在於吞吐量與價格,而價格大約翻了一倍。

9 月 2 日,該公司推出了以 Qwen3.8-Max-0902 為代號的後訓練更新版本,聚焦於程式編寫與代理式工作,且僅提供 API。9 月 22 日則新增了速度層級。兩者都不是正式發布,而把其中任何一個當成發布來解讀,都會讓你付出金錢代價。

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Prime 模式究竟是什麼

阿里巴巴自家的文件將 Prime 模式描述為「對輸出速度敏感的場景」的通道——AI 程式設計助理、多步驟代理推理、即時對話——並直白地說明其效益:TPS 會提升至標準 API 的 1.5 至 2 倍。不需要設定任何新參數。只要把model 的值改成 Prime ID,你就踏上快車道了。

文件對於哪些部分不會改變也同樣明確:「模型支援的能力與使用限制與原始模型相同。」因此,並沒有更大的上下文、更好的推理模式,也沒有額外的工具介面。那是同一個服務堆疊,只是背後有更多餘裕。

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

費率表,請仔細閱讀。

Alibaba 的國際定價頁面將這兩個 ID 並排列出,讓比較變得格外清晰。每百萬個 token:

• 輸入 — qwen3.8-max-prime $3.301 對比 qwen3.8-max $1.65

• 輸出 — qwen3.8-max-prime $9.902 對比 qwen3.8-max $4.951

• 快取命中 — qwen3.8-max-prime $0.413,對比同一頁面列為折扣項目的標準 ID 快取讀取費率

• 比率 — 輸入與輸出皆為 2.0×,並非四捨五入的近似值,而是公佈數字本身的字面運算結果

在中國費率表上,同樣的 2× 以人民幣計價依然成立:Prime ID 每百萬輸入為 ¥24、輸出為 ¥72,而標準版本則是 ¥12 和 ¥36,快取命中為 ¥3。

Qwen3.8-Max 廣受引用的發布價格是每百萬 token 輸入 2 美元、輸出 6 美元。這是八月報導所採用的頭條數字,但並非今日國際費率表上的數字。如果你正在做支出建模,請使用你所在地區的費率表,而不是發布時的頭條數字,並在承諾之前再次確認——自 9 月 2 日以來,Alibaba 已修訂此頁面兩次。

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

節流規則才是真正的功能

大多數人一眼掃過的那一行,其實對正式環境最為關鍵。Alibaba 的 Prime 文件指出,當你的用量達到速率限制時,若平台仍有閒置資源,你不會被限流,因此你實際可用的吞吐量不會低於所載明的上限。

那是軟性上限搭配硬性下限,與標準層級限制的形態不同。這意味著 1.5–2 倍這個數字是對下限的承諾,而不是對上限的封頂:在資源競爭下你能拿到該限制,而在容量閒置時你能拿到更多。對於一個會發出數十個循序呼叫的代理迴圈而言,這種不對稱性比原始的 TPS 倍數更有價值,因為決定你的工作流程能否完成的,是最慢那一次呼叫的尾延遲。

標準模型的動態 TPM 限制依每月 Model Studio 消費額分級——同一系列文件顯示,基礎 qwen3.8-max ID 在各級別分別為 5,000,000、10,000,000 和 20,000,000 TPM,並每月更新。Prime 並未移除該結構;它改變的是這個結構產生影響的方式。

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

還沒有人測量過的事物

坦白說,缺口就在這裡。1.5–2 倍這個數字是廠商自行宣稱的。我們找不到任何針對 Prime 模式的獨立吞吐量實測數據,而這點很重要,因為標準版本本身的獨立數據在速度方面並不亮眼。

Artificial Analysis 以其自有測試框架評估模型,目前對 0902 版本的 Qwen3.8-Max 給出的 Intelligence Index 為 45,其中 GPQA Diamond 為 92.8%、Terminal-Bench Hard 為 38.9%、Humanity's Last Exam 為 43.1%——並將其每項任務的實測成本列為 $5.41。這些是標準 SKU 上的獨立數據,擷取於 2026-09-24。它們也提醒我們,該指數自八月的發布報導以來已經修訂,因此不要把舊的指數數值與當前的數值並列,然後稱之為趨勢。

AA 沒有的,是 Prime 資料列。在有人實測之前,這項速度說法都只是 Alibaba 單方面的說法;正確的做法是用你自己的工作負載來測試,而不是假定它已達頂規。

這讓路由決策處於什麼位置

Prime 是阿里巴巴在其自家 API 上販售的層級,而且那是取得它的唯一途徑。我們這裡不託管 qwen3.8-max-prime。OrcaRouter 真正路由的是標準的 Qwen3.8-Max 及其帶日期的固定版本 Qwen3.8-Max-0902,兩者都與 Qwen3.8 系列其餘成員使用同一把金鑰——Qwen3.8、Qwen3.8-Flash、Qwen3.8-27B——並與其他 200 多個模型並列,供應商定價以 0% 加成原樣傳遞。最後這一點,正是 9 月 2 日的更新以及未來任何 Max 費率變動,都能在阿里巴巴端生效的同一天落到我們這邊的原因。

實際上的拆分方式如下:讓你的預設流量透過路由器走標準 ID,萬一單一供應商路徑品質下滑,容錯移轉機制能保護你。至於那些實際時鐘延遲本身就是產品價值的特定呼叫——互動式補全、緊湊的代理步驟——就移到 Prime,並以 2× 而非 1.5× 來衡量這個決策的代價。

誰該轉換,誰該等待

如果你的使用者正在等待 token,就切換:自動完成、一輪對話,或有人在緊盯的程式碼編輯迴圈。在速度範圍的最高端,Prime 每移除一秒延遲都是成本中性的——你正好付兩倍價格,換得正好一半時間。在速度範圍的最低端,你是用 2× 的價格換取 1.5×,這相當於每省下一秒就有 33% 的溢價。如果你的工作負載是跑整夜的批次工作,那筆溢價買不到任何你需要的東西。

如果你的成本模型是建立在 $2/$6 的上市宣傳價上,或者你的請求屬於輸入密集型,那就先等等。供應商的速度宣稱講的是 TPS——每秒輸出 token 數——而 prefill 是另一個不同的管線階段。長脈絡請求在輸入 token 上就是付雙倍,無論輸出是否更快送達。在移轉之前,先測量這個情境。

再看看你價目表上的日期。Qwen3.8-Max 自 8 月 3 日起上市,更新過一次,也重新包裝過一次,至今也才七週大。新聞點在於那個等級,不在模型本身。