
Qwen3.8-Flash-Next 已發布:阿里巴巴在 Qwen4 登場前就先推出 Qwen4 架構
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 84 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
Qwen3.8-Flash-Next 終於有了阿里巴巴並未產出的數字——而它們所呈現的,並非這個故事最響亮版本所宣稱的內容。在9月7日重新表述為 v4.3 的 Artificial Analysis Intelligence Index 上,阿里巴巴的開放權重預覽版得分40,在其比較類別的113個模型中排名第五。DeepSeek V4 Flash 0731(Reasoning, Max Effort)——它持續被拿來對比的模型——得分35,排名第九。這不是平起平坐;這代表較小模型領先五分。這也是第一個廣泛、獨立的評分榜,涵蓋了一個直到本月為止,唯一公佈數字都來自廠商自身的模型。模型本身並不新:權重於8月24日在 Hugging Face 上線,正式的 ModelScope 發布則於8月26日上線。本月改變的是,讀者現在可以查核這些說法,而不必照單全收。
重新審視這篇貼文的起因來自 X 上的 @teortaxesTex,他問道,這個預覽版是否正被默默低估:據稱它與 DeepSeek V4 Flash 0731 同屬 Artificial Analysis 的同一級別,「幾乎小了 4 倍」,且「活躍參數少了將近 3 倍」。這三項說法中有兩項一碰上已公布的數據就站不住腳——而修正後反而對該模型有利,因為在真正重要的數字上,這個預覽版領先其比較對象,而非與之持平。
先從規模說起,這部分的數字沒有模糊空間。Qwen3.8-Flash-Next 儲存約 180B 個參數——一個 125B 的混合專家主體、一張獨立的 51B n-gram 嵌入表,以及約 4B 的多詞元預測層——並在每個詞元啟動其中 6B。DeepSeek V4 Flash 0731 儲存 284B,啟動 13B。這些是 Qwen 模型卡與 DeepSeek 文件上的數字,也是 Artificial Analysis 在兩個模型頁面上所載的數字。它們得出的比例是 1.6 倍(就儲存參數而言),以及 2.2 倍(就啟動參數而言)。這確實是一段貨真價實的效率佳話,也是這套架構之所以重要的原因——但這不是 4 倍,也不是 3 倍。我們遍尋各處,都找不到任何已公布的數字能支持這些更大的倍數。如果原意指的是服務時的記憶體佔用量,而非參數數量,那個數字同樣沒有公布。
宣布了什麼
Alibaba 在發布 Qwen4 模型之前,先發布了 Qwen4 架構。Qwen3.8-Flash-Next——一個基於將驅動 Qwen4 系列的下一代架構所打造的開放權重、多模態專家混合模型——分兩步推出:官方的 Qwen/Qwen3.8-Flash-Next 儲存庫於 8 月 24 日在 Hugging Face 上線,比預告計時器所指向的 ModelScope 發布早了兩天。正式的 ModelScope 發布於 8 月 26 日 UTC+08:00 23:00 登場,同時公佈了所提供之 Qwen3.8-Flash 變體的價格。此後不斷流傳的模型卡頭條宣稱是:一個每個 token 激活 6B 參數的模型,在 Alibaba 自己的表格中,於 9 個可比較基準中的 8 個上擊敗了 Claude Opus 4.6 Max。Alibaba 不斷表示,完整的 Qwen4 系列稍後才會推出。
如果你這個月還沒在關注 Alibaba 的發布節奏,那基準點就是 Qwen3.8-Max——這款擁有 2.4 兆參數的旗艦模型於 8 月 3 日發布,不到兩週後便以 Qwen3.8-2.4T-A95B 開源。Qwen3.8-Flash-Next 的權重在那之後不到一個月就釋出。同一個推出 2.4 兆參數開放權重模型的實驗室,如今在那個世代的旗艦甚至還沒被命名之前,就已經把下一代的架構交了出來。

值得重讀的部分,是 Alibaba 自己的說法。該模型被描述為建構在下一代架構之上,「將驅動即將推出的 Qwen4 系列」——而且明確不是 Qwen4 本身。Alibaba 提出的理由是,架構變更應該在該系列到來之前先交到社群手中,如此一來,當真正的產品推出時,執行環境、量化與應用程式就能準備就緒。這是一種行銷定位,但同時也是一項技術承諾:先預覽困難的部分,帶著社群一起前進。
模型卡釐清了什麼,以及沒有釐清什麼:
• 已確認,根據官方模型卡:Qwen3.8-Flash-Next 是開放權重、多模態,且基於 Qwen4 架構的混合專家模型——該模型卡稱其為「將支撐 Qwen4 的架構之實驗性預覽」。
• 已確認,根據模型卡與設定:兩項重點架構變更 — 門控 Delta 網路(GDN)與 Qwen 稀疏注意力(QSA)— 位於一個 48 層混合架構中,該架構包含 36 層線性注意力與 12 層完整注意力。
• 已從儲存庫確認:總參數為 125B,每個 token 啟用 6B(512 個專家,10 個路由加上 1 個共用)——一旦將獨立的 51B n-gram 嵌入表和 MTP 層計入,Artificial Analysis 列出 180B——原生上下文為 262,144 個 token,可在 Qwen Community License 1.0 下擴展至 1,000,000。
• 不再未經證實:該模型現已經過獨立評分,而且是兩次。Alibaba 的表格仍是供應商自己的,且仍未被重現,但它不再是房間裡唯一的證據。
首批獨立評分已經出爐——結果顯示的是「領先」,而非「持平」
Artificial Analysis 於 9 月 7 日發布 Intelligence Index v4.3,而正是這次重新評分,才讓這一切具有可比性。v4.3 更新以難度高出許多的 Terminal-Bench v4.0 取代 Terminal-Bench v2.1,並將 τ³-Banking 換成 AutomationBench-AA——這是一項代理式工作流程基準測試,與 Zapier 合作打造,採用由 657 項任務組成的私有保留測試集。私有保留資料的權重上升至 45%。其明言目的是阻止前沿模型鑽指數漏洞,而對分數的影響相當大:兩大領先者 GPT-6 Astra 與 Claude Fable 5.1,在舊標準下都曾獲六字頭的分數,如今雙雙落在 53。
當你解讀社群數據時,這點很重要。九月初針對 Qwen3.8-Flash-Next 和 DeepSeek V4 Flash 0731 流傳的「56 對 52」數字,是在 v4.3 之前的指數上計算出來的;在 v4.3 之下,兩者分別為 40 和 35。拿其中一組與另一組相提並論,等於是在比較兩場不同的考試。
在目前的指數上,以下是這兩個模型在 Artificial Analysis 自家評估中的實際比較:
• 智慧指數 — Qwen3.8-Flash-Next 40(同級 113 款中排名第 5)對比 DeepSeek V4 Flash 0731(推理、最高強度)35(113 款中排名第 9)。
• 代理式知識工作 — AA-Briefcase 1587 對 1259;GDPval-AA v2 1647 對 1468;AutomationBench-AA 56% 對 54%。
• 終端機與程式開發 — Terminal-Bench v4.0 25% 對 12%;SciCode 51% 對 50%。
• 一般與科學推理 — Humanity's Last Exam 38% vs 39%;CritPt 11% vs 17%;GDP.pdf 16% vs 11%;AA-LCR v1.1 80% vs 80%。
• 事實回憶與虛構 — AA-Omniscience −10 對 −14,Qwen 預覽版以四分優勢勝出。
• 價格 — 每百萬輸入 $0.15 / 每百萬輸出 $0.47,對比 $0.44 / $1.32;混合後每百萬 token $0.0882,對比 $0.2298。每項 Intelligence Index 任務成本:$0.37,對比 $0.22。
• 速度與延遲 — 每秒輸出 53 個 token,相較於 210 個;首個 token 的時間為 2.80 秒,相較於 0.98 秒;端到端回應時間為 49.76 秒,相較於 12.88 秒;每項任務耗時 1,572.60 秒,相較於 221.65 秒。
• Token 使用量 — 每個任務 108k 輸出 token,相較於 62k,其中 72k 是推理 token,相較於 45k。Artificial Analysis 稱這個預覽版「非常冗長」且「比平均更慢」。
• 上下文與規模 — 256k tokens 對比 1,000k;180B 總計 / 6B 活躍 對比 284B / 13B。
綜合來看,這比「同級」是更犀利的答案。Qwen3.8-Flash-Next 在 Artificial Analysis 衡量的幾乎每一個軸線上,都贏得了準確度與效率的論證——它是得分更高的模型、體積更小,而且每 token 成本約為三分之一。DeepSeek V4 Flash 0731 則直接贏得了生產環境的論證:四倍吞吐量、四分之一的端到端延遲、每完成任務的實際耗時少七倍,以及四倍的上下文視窗。而在每完成任務的成本上——這個數字能不受 token 冗長度影響——DeepSeek 是更便宜的模型,為 0.22 美元對上 0.37 美元,儘管其標價更高。如果「被低估」的意思是「在每參數品質上比其聲譽更好」,這個標籤是公允的。如果它的意思是「你應該改跑這個」,那麼速度與延遲欄位顯示的可不是這麼回事。

在 Artificial Analysis 之外,也有獨立證據。第三方測試框架 smf-bench 於 9 月 5 日發布了一項「Official A」執行結果:Qwen3.8-Flash-Next 在單台 DGX Spark 上以 NVIDIA 的 NVFP4 量化執行、關閉 thinking,在 157 項中拿下 137 項(87.3%),其程式設計部分更是完美拿下 30 項中的 30 項;相較之下,使用兩台 Spark 執行 DeepSeek V4 Flash Vision-Exp,在同一套 157 項測試框架中拿下 157 項中的 117 項。那只是一套測試框架、一種機器類別,不能取代廣泛評估——但它是指向同一方向的第二個資料點,而且來自一個對兩家供應商都毫無利害關係的人。
Qwen4架構實際上是什麼
兩種機制承載了這個故事。第一種是 GDN——Gated Delta Network——它是 Alibaba 的線性注意力層。標準 Transformer 會保留一個隨序列長度增長的鍵值快取,而 GDN 層則維護固定大小的遞迴狀態,並以學習到的閘控規則更新它;其譜系可追溯至 DeltaNet 與 Mamba-2。其回報正是自 Qwen3-Next 以來一直默默驅動 Qwen 系列的那一項:長上下文之所以能保持低成本,是因為狀態不會增長,同時仍有少數全注意力層留在組合中,負責線性注意力不擅長的精確檢索。在當前世代中,這個組合大約每有一層全注意力層,就有三層 GDN——社群對 Qwen3.8-2.4T-A95B 檢查點的分析數出 69 層 GDN 對比 23 層注意力。Qwen3.8-Flash-Next 也顯示同樣的三比一劃分:36 層線性注意力對上 12 層全注意力。
第二個是 QSA——Qwen Sparse Attention——這才是真正全新的部分,而它目前公開的說明仍相當單薄:模型卡補充提到它在微區塊層級運作,預算為 512 區塊/2048 個 token,但至今還沒有完整的技術文件。這種細節的匱乏本身,正是這個模式的一部分。Qwen3-Next 在 2025 年底的預覽版引進了 Gated DeltaNet,當時的文件同樣單薄,而這個架構要等到 Qwen3.5 系列採用之後,才獲得完整的規格說明。對讀者而言,兩次的實務結論都一樣:架構金絲雀先出現,文件和正式發布的模型隨後才跟上。
已經奏效過一次的策略手冊
Alibaba 之前已經跑過這套完全相同的劇本,而且奏效了。2025 年底,Qwen3-Next 預覽了 Gated DeltaNet,以及線性注意力與全注意力混合的架構。當 Qwen3.5 系列推出時,它大規模採用了那套藍圖——而此後這個混合架構一路延續到 Qwen3.8 世代,包括 2.4T 旗艦。這個先例之所以在此重要,在於它所暗示的時機。完整的 Qwen4 家族應該預期會出現在這次預覽之後,而不是包含在這次預覽之中;如果 Qwen3-Next 的時間差可作為參考,那麼「這是架構」與「這是家族」之間的距離是以月為單位來衡量的。模型卡中沒有任何內容能證實這點——這是從 Alibaba 如今已跑過兩次的模式所做出的推論。
我們還不知道的事
未知已經縮小,但尚未消失:
• 供應商基準表仍然出自供應商之手。Artificial Analysis 現在已獨立為該模型評分,補上了發布報導中最大的缺口——但阿里巴巴自家的頭條宣稱,也就是該模型在 9 個可比較基準中的 8 個上勝過 Claude Opus 4.6 Max,是同時建立在阿里巴巴自家的內部評估(CoWorkBench、JobBench、AndroidWorld)與公開評估之上,而這些評估沒有一項被第三方重現過。
• 預覽版是否與實際提供服務的模型相同。該模型卡將 Qwen3.8-Flash-Next 定位為開放權重的實驗性預覽版,而正式上線服務的生產變體——Qwen Cloud 的 Qwen3.8-Flash——則增加了預設 1,000,000 個 token 的上下文與內建工具。至於該服務模型是否只是在更大上下文視窗下的相同架構,目前仍未說明;而上述獨立評分是針對開放權重預覽版,而非提供服務的 API 模型。
• 該授權條款是已知且真實存在的授權:Qwen 社群授權條款 1.0 允許商業使用,包括販售衍生作品,但若你經營 Model-as-a-Service 或 AI 工作助理業務,且營收與月活躍使用者數超過既定門檻,就必須與 Alibaba 另行簽訂商業協議。它與以營收為門檻的 Qwen3.8-Max 授權並不相同,但在以這些權重為基礎進行開發之前,值得先讀一讀。
• 有一份值得標記的實地報告:9月6日一篇關於社群 NVFP4 建置版本的文章記錄到,當思考與多 token 預測同時啟用時,會出現受文法約束的工具呼叫失敗,並追溯至 xgrammar 的約束解碼路徑。那是量化社群建置版本中的執行階段錯誤,而非模型本身的特性——但如果你的評估框架依賴受文法約束的工具呼叫,這就是第一個該測試的項目。
一個以兩週為週期迭代的家庭
圍繞其外的發布節奏本身就是一段故事。Qwen3.8-Max,這款擁有 2.4 兆參數的旗艦模型,於 8 月 3 日發布;開放權重的 Qwen3.8-2.4T-A95B 緊接著在 8 月 12 至 13 日推出;以免費 Apache-2.0 授權釋出的 Qwen3.8-27B 幾天後登場;而現在,還不到月底,下一世代的架構已經搶先曝光——並在一週後接受了獨立基準測試。目前沒有其他實驗室以這樣的節奏迭代。對正在挑選模型的讀者而言,實際後果是「最好的 Qwen」是個移動標靶——而世代之間的差距到來得比周遭生態系通常能適應的速度更快。買的與其說是一個模型,不如說是一個決策,這正日益成為站得住腳的做法。
開發人員現在應該做什麼
效率數字對地端推論取捨的改變,比發布本身還大。一個在現行指數上得分 40 的 6B 活躍參數模型是可壓縮的:NVIDIA 官方的 NVFP4 量化,正是 9 月 5 日 smf-bench 測試所用的版本,而在此之外的社群 NVFP4 與 FP8 版本也已在流通,這正是讓一個 180B 儲存規模的模型得以進行單一 GPU 等級部署的根本原因。但注意事項不變——這仍是未經驗證的預覽版,廠商提供的數據表未被重現,而獨立評測分數的分布樣貌(在知識工作與終端機任務上表現強勁,在長期儲存庫生成與單次代理通過率上較弱)意味著,這款模型的弱點恰好出現在正式環境程式碼變更所處的地方。在它接觸任何重要事物之前,先拿一份真實工作負載的低風險複本來跑,並讓自動容錯移轉吸收預覽版出狀況的時刻。
在價格方面,發表時仍模糊不清的情況如今已具體明確。Artificial Analysis 列出預覽版的服務費率為每百萬輸入 token $0.15、每百萬輸出 token $0.47,相較於 DeepSeek V4 Flash 0731 的 $0.44 與 $1.32——與已提供服務的 Qwen3.8-Flash 變體處於相同數量級,Qwen Cloud 將其列為 ¥1 與 ¥3(約 $0.16 與 $0.47)。正式生產變體才是你今天實際能呼叫的版本:它在此路由為 qwen/qwen3.8-flash,而 OrcaRouter 以 0% 加價直接傳遞供應商定價,因此當 Alibaba 調整該數字時,端點會在同一天跟著變動。本文中的比較模型也是如此——DeepSeek V4 Flash 0731 路由為 deepseek/deepseek-v4-flash-0731,採用供應商定價,這使得上述對決中每 token 成本的那一半,能用你自己的流量來驗證,而不是用基準測試的 token 數量。這裡未路由的是開放權重 Flash-Next 預覽版本身:今天要使用它,你得自行下載權重並自行提供服務,這正是為什麼上述量化故事比定價更重要。這一代必須突破的天花板仍可在同一個端點上看到:Qwen3.8-Max(qwen/qwen3.8-max)為每百萬輸入 token $2.00、每百萬輸出 token $6.00,同樣以供應商定價直接傳遞。

實務上的先後順序沒有太大改變,但背後的信心已經不同了。如果你想取得已提供服務的正式生產版本,又不想下載 100GB 的權重,Qwen3.8-Flash 已經可以按定價直接呼叫。如果你想要的是架構——GDN、QSA、n-gram 表、卸載技巧——權重可供下載,執行環境也已就緒:vLLM 從第一天就提供支援,其卸載路徑會把 510 億參數的 n-gram 嵌入表保留在主機記憶體,而非常駐於 VRAM,SGLang 和 TensorRT-LLM 也在 NVIDIA 的 Day 0 名單中,而 Ollama 的模型庫收錄了 MLX 版本,可在 Apple Silicon 上拉取。唯一該停止的,就是把這款模型在品質上當成未知數。它現在已經過實測,而且實測結果很好。
接下來要看什麼
• 獨立數字能否在指數成熟之際依然成立。Qwen3.8-Flash-Next 的 40 分伴隨著異常高昂的 token 代價——它在該指數測試中燒掉了 245M tokens,而中位數為 140M——且 Artificial Analysis 自家的註記稱其「非常冗長」。靠更長的推理產出的分數依然是分數,但這正是那種會隨評估方式改變而變動的東西。下一次指數改版才是真正的考驗:40 究竟是一個水準,還是局部最大值。
• 實際提供服務的 Qwen3.8-Flash 是否會被單獨評分。本文中每個獨立數字都是針對開放權重預覽版。具備 1M 上下文與內建工具的正式版本身並沒有獨立的評分,而如果它只是在更長上下文下的同一架構,那會是一項成本低廉的評估,應該有人發表。
• day-0 推論服務支援在實務上能否站得住腳——廠商所稱的 GB300 吞吐量數據仍只是廠商說法,而 TP4 專家平行與 KV-offload 組態也仍然太新,因此仍顯脆弱。
• 阿里巴巴還要等多久,完整的 Qwen4 系列才會跟進預覽版。
這則報導中「我們目前所知」的部分,如今大致已經底定。規格表已公開,權重可供下載,架構已獲確認,所供應的 Qwen3.8-Flash 變體已在託管 API 上以定價上線,而且該模型已由兩個獨立第三方分別評分——較小的模型贏得品質論點,較大的模型則贏得吞吐量論點。仍未明朗的是,一個 6B 活躍參數的預覽版能否泛化到它當初調校所依據的基準之外,以及 Alibaba 會等多久才讓完整的 Qwen4 系列接續推出。最後這個問題仍是此次發布未能解答的問題,也仍將是最重要的問題。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
