一張生成的標題卡,標題為「Qwen 4.5 與 Qwen 5:5 到 10 兆參數」,副標為「路線圖區間,而非規格」,三張卡片分別寫著「路線圖目標 / 5-10T 參數」、「出貨旗艦 / Qwen3.8-Max 2.4T」以及「發布日期 / 尚未公布」。頁尾一行寫著「根據 Alibaba 2026 年 9 月 22 日的新聞稿;未發布模型卡。」白色背景上的扁平向量編輯風格,帶有藍到青的漸層渲染,OrcaRouter 標誌合成於右下角。
Guides & Insights

Qwen 4.5 與 Qwen 5 瞄準 5 到 10 兆參數:Alibaba 說了什麼、沒說什麼

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 2026 年 9 月 22 日於杭州舉行的雲棲大會上,該公司為下下一代模型給出了規模數字。Qwen 4.5Qwen 5系列「預計將擴展至 5 到 10 兆個參數」,這是該公司自家英文新聞稿的措辭——這是路線圖上的一句話,而非規格。這兩款模型都沒有發布日期、模型卡、API 識別碼、價格或已公布的基準測試分數,這意味著今天這兩者都無法被呼叫。你實際買得到的旗艦模型是Qwen3.8-Max,自 2026 年 8 月 3 日起正式全面推出,擁有 2.4 兆個參數。大會結束後的這幾天裡,那句話在許多報導中被簡化成「一款 10 兆參數模型即將問世」的說法——這比該公司實際提出的宣稱更強烈、也更簡單。這兩句話之間的差距,大約是一年的規劃。

這個說法,以及它廣為流傳的版本

臺上有兩件事被提及,值得分開來看,因為它們所承載的資訊量差異極大。第一件是狀態更新:Qwen 4 正在訓練中,採用全新架構。第二件是路線圖:Qwen 4.5 與 Qwen 5 系列預計將達到 5 至 10 兆的參數區間。

阿里巴巴的英文新聞稿把這兩者都歸給公司,而非歸於任何具名高階主管。更進一步的會議報導則把這份路線圖歸給劉大一恒——他在阿里巴巴 Token Hub 主持 Qwen 大型語言模型專案——並轉述他的論述,指規模化是通往人工超智慧的關鍵路徑。這套論述正是那個參數量被提出時所處的脈絡,也說明了為何這個數字是一個區間,而非一個目標。

接著流傳開來的是該區間的上限。隨後出現的英文標題中,至少有一則描述了某個被預告的 10 兆參數模型,另有數則描述了打造一個 5 到 10 兆參數模型的計畫。這兩者都是對一張投影片的合理解讀,但兩者都不是明確規格;而對任何必須據此規劃的人來說,這個差別很重要。

5兆是一代人的目標,10兆是另一代人的目標

關於這項公告,最值得正確理解的一件事是:5 到 10 兆是一個橫跨兩個世代的區間,而不是單一模型帶有很寬的容差。阿里巴巴自己的句子把這個區間連結到「即將推出的 Qwen 4.5 與 Qwen 5 模型系列」——是系列,複數,合在一起看。

同一場會議的中文報導,又一次精準地朝不同方向發展:標題描述 Qwen 4.5 之後的模型擴展到 5 兆至 10 兆的範圍。這種解讀也把 10 兆那一端放到 Qwen 4.5 之後。所有來源唯一一致的说法是,該區間涵蓋 Qwen 4.5 到 Qwen 5 的跨度。把 10 兆明確歸給 Qwen 5 是一種變成標題的推論,而非引述。

為了有個規模概念,而這些是本篇報導中唯一已公布而非預測的數字:

• 5 到 10 兆——阿里巴巴新聞稿所賦予 Qwen 4.5 與 Qwen 5 系列的參數範圍

• 2.4 兆 — Qwen3.8-Max 的總參數量,這款已正式推出的旗艦模型,根據其官方模型卡

• 950億 — Qwen3.8-Max 每個 token 的活躍參數,這個數字決定了服務一個 token 的成本

• 10 兆——這個範圍的上限,也是其中唯一登上大多數英文頭條的部分

• 0 — Qwen 4.5 或 Qwen 5 已發布的規格、發布日期、價格、上下文視窗或基準測試分數的數量

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

真正重要的參數數值,是沒有人發表過的那一個

總參數量是實驗室選擇對外宣稱的數字。活躍參數量則是買家真正需要的數字,而路線圖並未納入這一項。

Qwen3.8-Max 是一個混合專家模型,總參數量達 2.4 兆,每個 token 啟用 950 億個參數。啟用比例大約是 4%:模型把大量知識存放在權重中,但在任何給定的 token 上並不會讀取它們,而只為其中一小部分付出運算成本。總參數量告訴你這個東西佔用多少記憶體,以及你需要多大的機器。啟用參數量告訴你每次它回答時你要付多少代價。

把這個比例往前推,問題的輪廓就變得清晰可見。一個以同樣 4% 活化率打造的 10 兆參數模型,每個 token 將活化約 4,000 億個參數——是 Qwen3.8-Max 目前活化量的四倍以上。這只是基於一項明示假設的算術推算,並非對 Qwen 5 的斷言:提高稀疏度,活化數量就下降;壓低稀疏度,它便會攀升。但正是這道算術,決定了 10 兆參數模型究竟是能上線服務的產品,還是研究用的產物;而這也正是「5 兆到 10 兆」這個標題所引人遐想、卻又留下未竟的計算。

這也正是路由經濟學不再流於抽象的地方。在 OrcaRouter 上,供應商的定價是以零加成直接轉嫁的,因此廠商對 Qwen 某一層級的降價,當天就會反映在你的金鑰上,而不是等到續約時才生效。服務成本確實難以確定的模型世代,正是這種直接轉嫁比事先針對一個沒人公布過的數字所談成的折扣更有價值的情況。

晶片公告才是實際的時間表

阿里巴巴在同一份新聞稿中宣布了模型路線圖與一款新加速器,而這兩者之間的關聯比新聞稿所述更為緊密。

T-Head 的 Zhenwu V900 是一款訓練與推論處理器,配備 216 GB 記憶體與 1,200 GB/s 的晶片間頻寬,原生支援 FP8 與 FP4,並宣稱效能是 5 月推出的前代 Zhenwu M890 的三倍。量產與商業發布預定於 2027 年第一季。一款搭配的超節點伺服器可支援多達 50 萬張卡的叢集,而 T-Head 表示 Zhenwu 系列已服務超過 650 家客戶。

把這兩則公告合起來讀,先後順序就一目了然。以10兆規模訓練與服務混合專家模型,首先是互連問題,其次才是運算問題,因為專家平行意味著持續在晶片之間搬移激活值,而1,200 GB/s的晶片間頻寬,正是決定此事是否可行的數字。按那種時程推出的晶片,會讓這類前沿規模訓練的最早可能窗口落到2027年後段——而且即使到了那時,晶片出貨也完全不代表訓練能跑完。阿里巴巴把這兩個主題放進同一份發布,藉此把它們連結起來;這個連結本身是我們的解讀,而且已如此標明。

公司自身的時間範圍與此一致。執行長吳泳銘設定了目標:到 2032 年,全球 Alibaba Cloud 資料中心容量要超過 20 吉瓦——這是容量目標,而非已部署容量,而且是五年以上的時間跨度,而非下一季的時間跨度。

支撐著藍圖的自我提升主張

一項 5 到 10 兆規模的計畫之所以還值得爭論,而不只是單純昂貴,原因在於遞迴式自我改進:如果訓練流程能自我改良,每一代所需的算力就會下降,而前沿也會更接近可負擔的水準。這是這份路線圖底下最關鍵的支撐主張,也是 Alibaba 說過最難以驗證的一件事。

公司公布的內容:Qwen3.8-Max 在約一個月的全自動工作中完成了 33 次迭代循環,涵蓋流程設計、資料驗證與錯誤診斷,並將其 Artificial Analysis 分數從 40 提升至 45。在一項晶片設計實驗中,該模型在一個設計生命週期內投入超過 60 小時的自我改進,進行了超過 10,000 次電子設計自動化工具呼叫,並在沒有效能損失的情況下將晶片面積縮減了 42%。會議中的一份報告也指出,透過自主調校一款新的 T-Head GPU,推論吞吐量提升了 96%。

這些是由供應商自行回報的,尚未經過獨立重現。這不是什麼技術性細節——一個為自己的實驗打分的自主迴圈,等於是在拿自己的評分器衡量自己,而外界無從檢核其評分標準。對這場會議的報導普遍都這麼說,讀者也應據此理解。

同一個說法裡還有第二個陷阱,而它關乎的是標籤,而非誠實。阿里巴巴沒有說明其 40 到 45 的變動是相對於哪一版的 Artificial Analysis Intelligence Index 測量,而該指數自這款模型發布以來已經重建過。Qwen3.8 Max(0902)目前的 Artificial Analysis 頁面顯示 45 —— 這是獨立數據,依據的是今天生效的修訂版。同一個模型在八月中旬、依據當時生效的修訂版所記錄的讀數是 56。45 和 56 不是以相同單位所做的同一項測量,把其中一個從另一個減掉,得出的數字毫無意義。該頁面沒有載明的是阿里巴巴聲稱其所改善的起始值 40:那個差值的起點是該公司自家的數字,只有終點恰好落在獨立讀數現在所在的位置。把這個變動理解為一個方向,而不是一項測量。

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

阿里巴巴在同一場大會上究竟推出了什麼?

撇除路線圖不談,這場大會依然帶來了實實在在的發布,而且全部都是多模態的:

• Qwen3.8-LiveTranslate — 同步口譯,延遲(LAAL)縮短近 20%,從 2.8 秒降至 2.3 秒

• Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-TTS 與 Qwen-Audio-3.1-Realtime — 煥然一新的語音套件

• Qwen-Audio-3.1-TTS-Next — 電影級音景,能從文字腳本融合對白與氛圍,專為有聲書、影視、播客與遊戲而設

• Qwen-Image 3.1 — 專為創意設計與電子商務行銷調校的圖像生成,預計今年稍晚推出,並原生支援透明背景生成

• Qwen Intelligence — 一個針對智慧型手機製造商的全端代理式平台

那份清單上的每一項,都是附有交付時程的產品。那個前沿規模的宣稱,則是議程上唯一沒有附上日期的項目,而這種對比並非偶然:推出多模態層級,才能為一整年的路線圖提供資金;而路線圖,正是讓下一輪募資或下一份雲端合約成為一個故事、而不是一張試算表的關鍵。這兩件事都是真的。只有其中一項是你能說得準的。

今天有什麼是可呼叫的,而要改變這一點,必須改變什麼

Qwen 3.8 世代仍是可購買產品線的全部。Qwen3.8-Max 自 2026 年 8 月 3 日起正式開放使用,每百萬輸入 token 收費 2.00 美元、每百萬輸出 token 收費 6.00 美元,在完整的 1,000,000 token 上下文範圍內均一價,不收取長提示詞附加費。其權重於 2026 年 8 月 12 日以 Qwen3.8-2.4T-A95B 之名,在自訂的 Qwen 授權條款下以 BF16 與 FP8 格式發布。其供應商基準測試表成績亮眼但未經審計——Terminal-Bench 2.1 為 86.6、GPQA Diamond 為 92.6、OSWorld-Verified 為 86.1,全部都是阿里巴巴自家的數據——獨立評測的結果則不如供應商所呈現的那般好看:Artificial Analysis 將 Qwen3.8 Max (0902) 的 Intelligence Index 評為 45,在 212 個模型中排名第 24,每項 Intelligence Index 任務的實測成本為 5.41 美元,輸出速度為每秒 39.2 個 token——在 212 個模型中排名第 159,接近該領域的慢速端。同一頁面所列的上下文視窗為 984k,而我們自家模型頁面則標示 1,000,000,這個落差在你規劃長上下文工作負載規模之前值得留意。前沿級的分數,中段班的速度:這就是這款已出貨旗艦機種的誠實總結,也是任何 Qwen 4.5 必須同時在兩項軸線上超越的基準。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter 搭載 Qwen 3.8 系列——qwen/qwen3.8-max、qwen3.8-flash 與 qwen3.8-27b——在單一相容 OpenAI 的端點上,與其他 200 多個模型並列,這意味著 Qwen 4.5 層級只會是既有金鑰上的模型 ID 變更,而不是新的供應商合約、新的帳單和新的 SDK。一旦推出,該目錄就是它會現身的地方。如今,Qwen 4.5 和 Qwen 5 都不在其中,因為兩者都尚未發布——再多的路線圖消息也改變不了這一點。

像這樣的路線圖,其實際用途恰恰與遷移計畫相反。如果某個 Qwen 4.5 層級的模型最終看起來對你的工作負載可行,要查證的最省錢做法,是在自動備援機制後方將一部分真實流量導向它,這樣一來,若某個模型結果證明速度慢、成本高,或表現比現行模型更差,你付出的代價只是單一工作負載的一個百分比,而不是一季的時間。這正是容錯移轉的用途所在,而一個未經證實、問世僅數日的前沿模型,就是採用它的最明確案例。

值得觀察什麼,以及還不該相信什麼

當一小組具體事物出現時,路線圖上的一行才會成為正式發布。一張載有總參數量、活躍參數量與上下文視窗的模型卡。一個可在請求中傳入的 API 識別碼。模型中樞上的權重。獨立排行榜上附有日期的條目。一個價格。其中任何一項都是訊號;大多數同時出現,就是一場正式推出。

那些不是發布的東西,無論看起來多麼技術性:會議上的一句提及;某個 serving 框架的 pull request 新增了針對實驗性 Qwen 版本的架構分支,那是某人的推論堆疊上的引擎工作,而不是你能呼叫的模型;一個已經出貨的世代的帶日期快照 ID;以及一則改述某段台上發言的社群貼文。催生這篇文章的訊號是上述最後一項,而它值得寫成文章的原因是,其背後的說法可以對照阿里巴巴自家的新聞稿來查核——5 到 10 兆的區間、Qwen 4 的狀態以及 RSI 數字全都出自那裡。訊號指向了這個故事;但它並不是故事本身。

近期真正的問題比新聞標題所暗示的更狹隘。阿里巴巴已表示 Qwen 4 正在訓練中,這使 Qwen 4 在序列上領先 4.5 和 5——因此接下來值得關注的,不是一個 10 兆參數的模型,而是 Qwen 4 是否會伴隨模型卡、價格與端點一同推出,以及何時推出。在這條鏈上的某個環節真正落地之前,對於 5 到 10 兆參數區間,誠實的立場是:它是一個發展方向,已在正式紀錄中揭露,但沒有附加任何規格,也沒有日期。請為 Qwen3.8-Max 做規劃,把 4.5 和 5 這個區間當作一項擴展論題、而非產品來觀察,並把你在一個沒有模型卡的模型上看到的每個參數數量都視為預測。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新