
Qwen3.8-Max 對比 Qwen3.7-Max:兩個 Max 層級、16 個指數點,以及一個讓價格倒轉的促銷方案
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 495 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 186 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
四天前,廠商告訴我們,Qwen3.8-Max已不是它在八月發布的模型。在一份日期為2026年9月22日、來自杭州雲棲大會的新聞稿中,該公司揭露,其旗艦模型在超過一個月內完成了33 個迭代循環的全自動化訓練與後訓練工作,而最終建置出的版本使其 Artificial Analysis Intelligence Index從 40 提升至 45。模型 ID 從未改變。它背後的數字變了。
這一點在一個特定情境中最為要緊:Qwen3.8-Max與Qwen3.7-Max之間的比較——也就是它所取代的 Max 層級。Qwen3.8-Max 於 2026 年 8 月 3 日正式全面推出;Qwen3.7-Max 則在 5 月問世。紙面上看來,這像是一次輕鬆的世代交替——更新的旗艦、更高的分數,直接換過去就好。但數字說出的實情更令人尷尬。較舊的層級速度快上三到四倍,每完成一項任務的成本大約只要五分之一,而在純知識基準測試上與較新的層級完全相同。較新的層級具備多模態能力,在代理式工作上表現大幅優異,而且在國際價目表上更便宜。你該呼叫哪一個,取決於多數比較都會略過的一個問題:你買的是知識,還是工具呼叫。
Apsara 披露的內容實際上聲稱什麼
這份披露是一份廠商聲明,由阿里巴巴發布於自家新聞網站,也應以此角度來看待。它所述的內容很具體:在超過一個月的全自動化執行期間,涵蓋流程管線設計、資料驗證、迭代實驗與錯誤診斷,Qwen3.8-Max 完成了 33 個循環,而自主訓練優化加上後訓練技術造就了分數的變動。阿里巴巴也描述了第二項晶片設計實驗,在該實驗中,模型在一個設計生命週期內進行了超過 60 小時的自我改進,發出超過 10,000 次 EDA 工具呼叫,並產出符合生產水準的晶片匯流排模組,同時將晶片面積縮減 42%,且未提及有任何效能上的犧牲。這一切都只是阿里巴巴對自家模型的自述,公司外部沒有任何單位重現過。
不過,分數的變動本身並非廠商的主張。該指數屬於 Artificial Analysis,而 45 這個分數就列在這家第三方機構的 Qwen3.8 Max (0902) 頁面上。它原先的 40 分則位於同一機構針對 8 月 3 日版本的頁面,該頁面現已標記為已棄用,並指向目前的版本。因此,這個差值是一個廠商自述的原因,附著在一個獨立評分的結果上,這比單憑其中任何一半都更有力。截至本文寫作之時,這也是任何人所擁有、最具體的公開證據,證明一家前沿實驗室在未發布新版本編號的情況下,改變了其旗艦模型受測的能力。
關於這次發布,還有兩件容易被忽略的事,而且兩者都是關鍵支柱。首先,阿里巴巴確認Qwen 4正在訓練中,並預計 Qwen 4.5 與 Qwen 5 系列將擴展到 5 至 10 兆個參數。其次,還有一個更新版模型的帶日期快照。阿里巴巴將後訓練版本固定為qwen3.8-max-0902,於9月2日,而且它可獨立路由。那個固定版本,正是對 RSI 披露所暗示一切的实际解答,我們之後會再回來談這點。
計分板
六個維度,雙方皆然,並明確保留來源查核的嚴謹性,因為這兩欄並未受到同等的驗證。
• 上下文視窗 — Qwen3.8-Max 1,000,000 個 token 對比 Qwen3.7-Max 1,000,000 個 token(相同)
• 最大輸出 — 131,072 個 token,對比阿里巴巴自家模型頁面的 131,072 個 token(兩者相同;請注意,我們目錄中 Qwen3.7-Max 的頁面標示為 64,000,這項不一致我們選擇如實標示,而非粉飾帶過)
• 輸入模態 — 文字、圖像與影片 vs 僅文字
• 每 100 萬個 token 的國際定價 — 輸入 $2.00 / 輸出 $6.00,對比輸入 $2.50 / 輸出 $7.50;同一份價目表在北京、法蘭克福和維吉尼亞州已向這兩款模型收取 $1.65 / $4.951
• Artificial Analysis 智慧指數 — 45 對 29
• 獨立輸出速度 — 39.7 tokens/sec 對比 211.3 tokens/sec,以相同的 211 個模型比較類別為基準測量,其中 Artificial Analysis 將較新的層級評為明顯偏慢,而較舊的層級則評為明顯偏快
最後兩行就是整篇文章。在同一個指數系列中,較新的層級領先 16 點。在速度上,它則落後五倍以上。

這 16 分從何而來——以及不是從何而來
把 Index 拆解成它的各個部分,升級的形貌就會清楚浮現,而那並不是行銷所暗示的形貌。
在知識與推理方面,這兩個模型實際上不相上下。GPQA Diamond:92.8 對 92.3。Humanity's Last Exam:43.1 對 40.5。長上下文回憶:80.33 對 79。SciCode:52.1 對 49.5。如果你的工作負載是在大型語料庫上進行問答,這個世代躍進不過是捨入誤差。為此支付數倍價格將難以證明其合理性。
在代理式與程式編寫工作上,差距大幅拉開。Terminal-Bench 2.1:88.76 對 74.53。Artificial Analysis 的程式編碼指數:76.2 對 66。而這組之中差距最懸殊的是銀行工具使用任務,Qwen3.8-Max 錄得47.84,Qwen3.7-Max 則為11.75——正好在 RSI 描述所稱、自動化循環所優化的那項能力上出現四倍差距:流程設計、資料驗證、迭代實驗、錯誤診斷。一個花一個月改進自身訓練迴圈的模型,就是一個在迴圈上變得更好的模型。
關於那些個別列,有一點必須誠實說明。這兩個模型頁面都屬於同一個 Intelligence Index 修訂版本系列(v4.3 與 v4.3.2),因此標題上 45 對 29 的比較是公平的。各基準測試的逐項列並非同一世代:Qwen3.7-Max 的任務層級數據可追溯至五月的評估窗口,而 Qwen3.8-Max 的數據則來自九月系列。要看趨勢方向,而非第三位有效數字。
價格問題是兩個問題
在阿里巴巴的國際價目表上,較新的 Max 比它所取代的版本更便宜:$2.00 / $6.00(Qwen3.8-Max)對比$2.50 / $7.50(Qwen3.7-Max),以每百萬個詞元計。隨著世代演進,輸入與輸出兩個方向都降價 20%,這種情況並不尋常,本身就值得注意。快取的經濟效益也更有利於較新的等級——隱式快取為 $0.25,對比 $0.50;顯式快取讀取為 $0.17,對比 $0.25。
這是第一個問題,而它有個取決於地區的答案,卻被大多數報導一筆抹平。阿里巴巴對這兩款模型$1.65 輸入 / $4.951 輸出的收費,在北京、法蘭克福與維吉尼亞都一樣。那 20% 的差距只存在於新加坡的國際卡。若你的流量落在這三個地區,如今兩款 Max 等級的輸入與輸出 token 費用相同,決策就簡化為單純比能力——此時較新的模型除了吞吐量之外全面勝出,也就沒什麼算術可做了。
第二個問題是陷阱。Qwen3.7-Max 目前的價格並非 $2.50 / $7.50。它是以$1.25 / $3.75提供服務——定價表的一半,屬於促銷價。這使得前一代層級在今日成為更便宜的選項,而且差距懸殊。這也意味著你這週能測量到的價格,並不是你將會承諾的價格。阿里巴巴自家的模型頁面明白指出,公布的表格顯示的是原始定價,且「不含任何限時促銷」,並引導你前往主控台查看目前優惠。促銷在本質上就是一種可能結束的費率。一旦結束,Qwen3.7-Max 不只是變得比今天更貴;它會比擊敗它的那個模型貴上 25%。
我們以 0% 加成原樣轉嫁供應商費率,所以標價和優惠在變更當天就會在我們這邊生效——這對比價很方便,但對編預算的人卻沒什麼幫助。請以標價卡為基準建立模型,並把優惠費率視為額外上行空間。

逆轉成本論據的那個數字
詞元價格不等於一項任務的實際成本。Artificial Analysis 公布的每項任務成本數據,納入了快取經濟效益、推理量與回答長度,而按此標準衡量,排名會完全反轉:Qwen3.8-Max 每項 Intelligence Index 任務為 5.41 美元,相較之下Qwen3.7-Max 為 1.15 美元。溢價達 4.7 倍,而詞元費率依你所在區域不同,可能便宜 20% 或完全相同。
差距主要來自冗長程度。在同一項評估中,較新的模型產生了 1.9 億個輸出 token,而較舊的模型則產生 1.2 億,而且它會長篇推理才能得出答案。如果你正為高用量、中等難度的工作負載按輸出 token 付費,那麼在任何一種費率表上、以任何 token 價格來看,較新的 Max 都不是較便宜的模型。它是較昂貴的那一個,而 token 的標價並不是做出這項決定的正確工具。
{{1}}速度{{/1}},以及我們自身流量所揭示的情況
吞吐量差距大到足以改變架構選擇。Artificial Analysis 將 Qwen3.8-Max 列為每秒 39.7 個 token——其摘要稱該模型明顯偏慢——而 Qwen3.7-Max 則是每秒 211.3 個 token,並稱其明顯偏快。這正是把模型放在互動式介面之後,與放在佇列之後的差別——而在Qwen3.8-Max上,這是我們自家統計面板最先顯示給你看的項目。
我們自己的 playground 遙測資料,涵蓋截至 9 月 25 日的七天,對延遲的說明稍微更細膩一些,而且附帶一個但書:這些是我們在自己的路由上所做的量測,不是受控基準測試。Qwen3.8-Max 首次回應的中位數為 2,611 毫秒,速度為每秒 54.7 個 token,錯誤率為 2.45%;固定的 0902 版本中位數為 3,360 毫秒,速度為每秒 46.2 個 token,錯誤率明顯更乾淨,為 0.66%。Qwen3.7-Max 的中位數為 4,509 毫秒,但速度達每秒 169.8 個 token,錯誤率為 3.80%。所以較舊的層級一開始回應較慢,接著串流速度卻快了三倍,同時更常失敗。如果你的工作負載具突發性,那麼錯誤率的差異比中位數更值得關注。
兩個層級都與固定快照一同在同一個 OrcaRouter 金鑰上正式上線,並可跨供應商自動容錯移轉。對這類比較而言,實務重點正在於:用你自己的提示詞分別對兩個 Max 世代進行衡量,只是變更設定,而不是再簽一份合約。

可重現性現在是決定性因素
這是 Apsara 揭露內容中,至今無人定價的那一部分。一個仍在線上運作的模型 ID,其實測能力在一個月內從 40 變動到 45,期間沒有版本變更,當時也沒有任何公告,這是可重現性的風險。如果你的產品行為取決於一個會變動的 ID,那麼你手上的模型就可能會在一套凍結的評估套件、快取提示詞庫,或已簽核的迴歸測試集底下自行改善——或偏移。
兩代都提供帶日期的快照,而這就是緩解措施。阿里巴巴記載 Qwen3.7-Max 在功能上等同於qwen3.7-max-2026-05-20,另有 2026-05-17 與 2026-06-08 的後續帶日期建置版本。Qwen3.8-Max 則有qwen3.8-max-0902,也就是後訓練的九月建置版本,而這正是 45 所指的版本。如果你要交付任何需要可重現性的東西,請釘選帶日期的 ID,並把浮動的那個視為預備環境目標。RSI 循環是浮動 ID 的一項特性;釘選就是你選擇退出這些循環的方式。
有一個命名細節值得了解,以免你誤讀目錄。阿里巴巴列出了第三種帶日期的形式,qwen3.8-max-2026-09-02,與 0902 別名並列;它們指的是同一個建置版本。原本 8 月 3 日的發佈版本在我們這邊已不再可供路由——我們提供的是 Qwen3.8-Max、其 0902 固定版本,以及 Qwen3.7-Max。
誰應該選哪個
這個決定並非取決於哪個模型更好,而是取決於你買的是什麼。
繼續使用 Qwen3.7-Max如果你的工作負載只涉及文字、偏重知識而非工具,且對吞吐量敏感——例如大批量分類、擷取、長上下文檢索、批次摘要。在 GPQA Diamond 和長上下文召回測試中,它與較新模型的差距在一個百分點以內,串流速度快三到四倍,而每項任務的成本為 $1.15,相較之下對方是 $5.41。對於想在融合或路由配置中取得便宜的第二意見的人來說,它也是正確的選擇,因為以其促銷價格而言,它完全屬於另一個價格級別。兩點提醒:促銷就是促銷,而且 Artificial Analysis 已將該模型標記為棄用,由 Qwen3.8-Max 取而代之。不要因此展開多年期的承諾。
若下列任一情況成立,請改用 Qwen3.8-Max:你需要圖片或影片輸入,而 Qwen3.7-Max 完全不支援這類輸入;你的工作負載具代理性質,包含冗長的工具呼叫鏈或多步驟的編碼迴圈,此時 Terminal-Bench 2.1 上 88.76 對 74.53 的差距,以及四倍的工具使用落差,正是能否上線交付的關鍵;或者你是依新加坡國際費率卡計價,較新的模型就是便宜 20%,沒有取捨需要衡量。請鎖定qwen3.8-max-0902,若你需要讓行為維持不變。
如果你在北京、法蘭克福或維吉尼亞,這個選擇比任何比較所暗示的都更明確:兩個 Max 級別的費用都是$1.65 / $4.951每百萬個 token。完全相同。在這樣的價格下,多模態輸入無需額外付費、Index 高出 16 點,工具使用分數還好了四倍,這根本不是一項需要抉擇的決定,而是免費——而繼續留在 Qwen3.7-Max 的唯一理由,就只剩下原始吞吐量了。
兩個值得直接回答的問題
33 輪的訓練執行是否意味著模型在既有的 API 流量下發生了變化? 這正是該揭露內容所暗示的,也是為什麼會有帶日期的固定版本存在。阿里雲將改良後的模型描述為「更新後的 Qwen3.8-Max」,那是浮動 ID,而非新的 ID。如果你在整個九月都有工作負載跑在浮動 ID 上,那麼在那段期間,為你提供服務的模型其測得能力已經變動了。阿里雲並未針對其間的各個組建發布變更記錄,因此要知道自己實際用的是哪種行為,唯一可靠的方法就是固定版本。
RSI 的說法是否經過獨立驗證? 它產出的分數確實是——該指數出自 Artificial Analysis,而 45 分就掛在他們的頁面上。其背後的機制是阿里巴巴對自家訓練流程的自行描述,沒有外部重現、沒有公開的評估協議,也沒有第三方觀察那 33 次循環。請把「33 次迭代循環」當成廠商說法,而把「40 之後的 45」當成實測的一組數據。這兩者不是同一類陳述,而這個差異正是這則標題值得仔細閱讀、而非直接複述的原因。
下一個值得關注的不是 Qwen 4。而是 Qwen3.7-Max 的半價促銷,能否在原本要取代它的模型問世後依然存在。如果無法,許多團隊將會發現,他們一直是在拿定價與折扣相比,而且兩個同系列產品中較舊的那個,從頭到尾都是比較貴的那一個。
