主視覺標題卡用於文章『Qwen3.8-Flash-Next — 洩漏報告』,帶有『未經驗證 — QWEN4 架構預覽』徽章,副標題為『阿里巴巴在模型發布前率先推出 Qwen4 架構』,三個標籤分別是『來源:@kimmonismus』、『2026年8月25日』與『發布時間:2026年8月26日 23:00 UTC+08』,左側卡片寫著『主張:一個開放權重的多模態 MoE,預覽 Qwen4 架構』,右側卡片寫著『狀態:權重尚未發布,約 24 小時內推出』。OrcaRouter 標誌合成於右下角。
Guides & Insights

Qwen3.8-Flash-Next:阿里巴巴在 Qwen4 問世前預覽 Qwen4 架構

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

阿里巴巴在推出 Qwen4 模型之前,將先發布 Qwen4 架構。Qwen3.8-Flash-Next——一款基於下一代架構打造、採用開放權重的多模態混合專家模型,該架構將驅動 Qwen4 系列——預定於 2026 年 8 月 26 日北京時間 23:00 在 ModelScope 公開上線。阿里巴巴將這次發布定調為技術預覽:開發者能提早取得架構,完整的 Qwen4 系列隨後推出。截至撰寫本文為止,參數量、授權條款與價格均尚未確認,因此這是一篇「目前已知資訊」的彙整——以下每項具體內容都標註了其確定程度。

如果你這個月沒有持續追蹤阿里巴巴的發布節奏,重點就在 Qwen3.8-Max——這款 2.4 兆參數的旗艦模型於 8 月 3 日發布,不到兩週後便以 Qwen3.8-2.4T-A95B 的名義開源。緊接著不到一個月,Qwen3.8-Flash-Next 登場。這間實驗室才剛推出 2.4 兆參數的開放權重模型,如今又在下一世代旗艦尚未命名之前,率先公開了該世代的架構。

宣布了什麼

這個訊號循著慣常管道傳進了圈子。8 月 25 日,ModelScope 上出現了一個 Qwen3.8-Flash-Next 的預告頁面,掛著「即將開源釋出」徽章、標語「邁向新世代——疾速如電」,還有一個指向 2026-08-26 23:00(UTC+08:00)的發布倒數計時器。阿里巴巴的 Qw​en 團隊當天也在 X 上發文:「下一波 Qw​en 浪潮即將到來。」而讓我們得知這則消息的,是 X 使用者 @kimmonismus 的貼文;他以稍微不同的措辭描述了同一件事:一個基於次世代架構的開放權重多模態 MoE,提前開放給社群搶先使用,以便為 Qwen4 系列做好準備。

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

值得重讀的部分是阿里巴巴自己的表述框架。該模型被描述為建構在「將為即將到來的 Qwen4 系列提供動力」的下一代架構之上——且明確不是 Qwen4 本身。阿里巴巴闡明的理由是,架構變革應該在該系列正式到來之前就交到社群手中,以便在正式產品推出時,執行環境、量化方案和應用程式都能準備就緒。這是行銷立場,但也是技術承諾:先預覽最困難的部分,帶著社群一起前進。

今天已證實了什麼,而什麼尚未證實:

• 根據預告和Qwen的聲明,已確認:Qwen3.8-Flash-Next是開放權重、多模態的MoE模型,基於Qwen4架構。

• 已確認,根據 Qw​en 的聲明:它引入了兩項重大架構變更——GDN 混合架構與 Qw​en 稀疏注意力(QSA)。

• 根據預告證實:發布時間為 2026-08-26 23:00 (UTC+08:00),在 ModelScope 上。

• 尚未確認:總參數或啟用中參數、授權條款、上下文長度、API 可用性或定價,以及所有基準測試分數。由於權重尚未釋出,目前尚無獨立評估。

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Qwen4架構實際上是什麼

整個故事由兩個機制推動。第一個是阿里巴巴的線性注意力層 GDN(Gated Delta Network)。標準 Transformer 會保存一個隨序列長度增長的鍵值快取,而 GDN 層則維護一個固定大小的遞迴狀態,並以習得的門控規則更新它;其系譜可一路追溯至 DeltaNet 與 Mamba-2。這項設計的價值,正在於它從 Qwen3-Next 以來默默驅動著 Qw​en 系列:長上下文的成本維持低廉,因為狀態不會增長;同時,少數全注意力層仍保留在混合架構中,負責執行線性注意力所不擅長的精確檢索。在當前這一代中,混合比例大約是每三個 GDN 層搭配一個全注意力層——社群對 Qwen3.8-2.4T-A95B 檢查點的分析統計出 69 個 GDN 層與 23 個注意力層。Qwen3.8-Flash-Next 則被描述為奠基於同一系譜的「GDN 混合架構」。

第二項是 QSA — Qw​en Sparse Attention — 這才是真正的新東西,目前還沒有任何公開的技術說明:只有名字,以及它被標榜為預覽版兩大重點變更之一的宣傳。這種細節的缺乏本身就是一種模式。Qwen3-Next 在 2025 年底的預覽版中引入了 Gated DeltaNet,文件資料同樣稀缺,而該架構直到 Qw​en3.5 系列採用之後才獲得完整的規範。對讀者而言,兩次得到的實際啟示都相同:架構這隻金絲雀會先出現,文件和正式版模型隨後才到。

已經奏效過一次的策略手冊

阿里巴巴以前就用過這套手法,而且奏效了。2025 年底,Qwen3-Next 預覽了 Gated DeltaNet,以及線性注意力與完整注意力的混合架構。當 Qwen3.5 系列推出時,它大規模採用了這套藍圖——而這個混合架構自此貫穿 Qwen3.8 世代,包括 2.4T 旗艦模型。這個先例之所以重要,在於它所暗示的時機。完整的 Qwen4 家族應該要等這次預覽之後才會登場,而不是隨預覽一起推出;如果以 Qwen3-Next 的間隔作為參考,從「這是架構」到「這是整個家族」之間,相隔的時間是以月來計算的。預告中沒有任何內容能證實這點——這是從阿里巴巴如今已執行兩次的模式所推斷出來的。

我們還不知道的事

未知數正是預覽的重點,而且這些未知都是真實的:

• 參數。預告未透露任何資訊。X 與 Reddit 上的社群猜測——並無官方背書——指向一個總參數量約 125B、啟用參數量約 6B 的配置,並帶有大型 n-gram 嵌入查找表。將其視為謠言即可。

•「Flash」層級。在 Qw​en3.5 世代中,僅限雲端的 Qwen3.5-Flash 是開放權重 Qwen3.5-35B-A3B 的增強版本。Qwen3.8-Flash-Next 是否為類似規模之 Qw​en3.8 模型的開放權重對應版本仍屬未知;它也可能是 125B-A6B 級別的模型。兩種解讀都只是猜測。

• 授權條款。阿里巴巴近期的 Qw​en 系列釋出,涵蓋 Apache-2.0(Qw​en3.8-27B)到受營收限制的 Qwen3.8-Max 授權。Flash-Next 最終落在哪種授權,將決定其能否商用,以及可用於哪些範圍。

• 基準測試。Qw​en 的聲明強調代理式編碼、長時程任務與多模態智慧,但未附任何數據,且在權重釋出之前沒有獨立評估。

一個以兩週為週期迭代的家庭

周邊的發布節奏本身就是另一個故事。Qwen3.8-Max,這款擁有2.4兆參數的旗艦級模型,於8月3日發布;開放權重的Qwen3.8-2.4T-A95B緊接於8月12日至13日推出;免費的Apache-2.0授權Qw​en3.8-27B也在數日後問世;而現在,就在這個月結束之前,下一代架構已經開始預覽。目前沒有其他實驗室以如此節奏迭代更新。對於正在挑選模型的讀者而言,實際的後果是「最好的Qw​en」是一個不斷移動的目標——而世代之間的落差來得比周邊生態系統通常的適應速度更快。購買決策而非購買模型,正日益成為站得住腳的選擇。

開發人員現在應該做什麼

{{1}}規畫要涵蓋架構,而不只是模型本身。{{/1}}{{2}}Qwen3.8-Flash-Next 在第一天就會是未經驗證的預覽版:沒有獨立的基準測試、執行時期生態系仍在追趕中,而且對於會用到它的工作負載而言至關重要的代理式與長程任務能力,只有廠商的說詞可以參考。{{/2}}{{3}}安全的評估方式不是把它接進正式營運路徑,而是將工作負載的低風險副本導向它,將輸出與現行模型比較,並讓自動容錯轉移來吸收提供全新開放權重模型的供應商出錯的時刻。{{/3}}{{4}}在 OrcaRouter 上,這正是你已經在用的同一個端點和同一把金鑰:{{/4}}{{5}}Qwen3.8-Flash-Next 和你目前的模型位於同一個 API 之後,路由 DSL 可以在任何東西被提交之前,用相同的提示詞將預覽版與現行模型進行 A/B 比較。{{/5}}

定價(若有的話)也應以同樣方式解讀。阿里巴巴尚未公布 Flash-Next 的 API 定價,而未發布的權重也無法在任何地方路由。一旦有供應商公布它,OrcaRouter 便會以 0% 加成直接沿用供應商的牌價——因此無論阿里巴巴最終的數字為何,都會在當天原封不動地顯示出來。目前你實際上能呼叫的最接近基準是 Qwen3.8-Max(qwen/qwen3.8-max),也就是這個架構最終將位居其下的旗艦:100 萬 token 的上下文視窗,輸入 token 每百萬個 $2.00、輸出 token 每百萬個 $6.00,均按牌價轉傳。當 Flash-Next 的價格出爐時,請把這個數字記在心裡;這就是下一代必須超越的成本。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

說看就看的內容

發布計時器歸零的那一刻,有四件事至關重要:

• 參數數量與活躍參數等級——這是傳聞中所描述的 125B-A6B 級模型,還是較小的入門款。

• 授權——寬鬆的,如同 Qwen3.8-27B,或受限的,如同 Max 授權。

• 首批獨立評測是否重現供應商宣稱的代理式編碼與長時程能力——值得信賴的是數字,而非行銷話術。

阿里巴巴會等多久,才讓完整的 Qwen4 系列跟進預覽版?

那些事從這裡無法得知。今天能夠確知的是阿里巴巴所做決定的形貌:它押注自家下一代架構值得在旗艦產品之前先對外公開。這個賭注就是故事的核心——而權重明天就會釋出。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube