Qwen3.8-Flash-Next 發布 — 深入阿里巴巴 Qwen4 架構預覽。重新生成的插圖。
Guides & Insights

Qwen3.8-Flash-Next 版本發布:深入阿里巴巴 Qwen4 架構預覽

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Ali​baba在2026年8月26日發布的最有用的文件不是新聞資料包——而是一份技術報告。當天發布的開放權重多模態混合專家模型Qwen3.8-Flash-Next,隨附一篇題為「On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability」的論文,而這份報告才是重點。它做到了廠商發布幾乎從不會做的事:公開了消融實驗、負面結果和訓練配方實驗,然後將每一項發現與這個模型所預示的Qwen4系列架構串聯起來。

8月26日實際出貨了什麼

就 Qw​en 在 2026 年的標準而言,這個模型本身相當樸素,而這是刻意為之。Qwen3.8-Flash-Next 儲存了 125B 的主模型參數,加上一個獨立的 51B n-gram 嵌入表——在 4B 的多 token 預測模組之前大約是 176B——但每個 token 只啟動 6B。它是一個具備 512 個專家的混合專家(MoE)模型,採用 top-10 路由和 48 層結構,原生支援 262,144 個 token 的上下文,並可透過 YaRN 擴展至 1M。它接受文字、圖像和影片輸入,並輸出文字。權重以 qwen-community-1.0 授權發佈在 Hugging Face 和 ModelScope 上,而 Ali​baba 自家部落格稱其為「將支撐 Qwen4 的架構的實驗性預覽」——這正是 Qwen3-Next 對 Qw​en3.5 系列所扮演的角色,是一隻在旗艦機型之前飛行的金絲雀。

同一天,阿里巴巴也啟用了商業對應版本:在 QwenCloud API 上提供名為 Qwen3.8-Flash 的託管建置,每百萬輸入 token 收費 0.16 美元,每百萬輸出 token 收費 0.47 美元。這兩者容易混淆,值得釐清。Qwen3.8-Flash-Next 是技術報告所剖析的開放權重預覽版;Qwen3.8-Flash 則是生產環境 API 建置,有定價,預設 1M-token 上下文,並採用與 OpenAIAnthropic 相容的請求格式。價格、基準測試與架構論點皆源自同一套工程。

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

技術報告中的四項架構押注

這篇論文的主軸是四個賭注,關乎長上下文、低成本的前沿模型應該是什麼樣貌,且每個賭注都有實驗證據支持。

• {{1}}注意力{{/1}} — {{2}}{{KEEP}}GDN{{/KEEP}} + QSA 混合架構{{/2}}。每四層中有三層使用 {{3}}門控 DeltaNet{{/3}},這是一種線性注意力層,能將歷史壓縮為固定大小的循環狀態,而非隨序列長度增長的 KV 快取。其餘一層使用 {{4}}Qw​en 稀疏注意力{{/4}},它將序列聚合為微區塊,以低成本進行評分,並僅對關鍵區域執行完整注意力。{{5}}阿里​巴巴{{/5}} 報告指出,在 1M 上下文情境下,預填充速度最高可提升 7.6 倍,解碼速度最高可提升 4.9 倍;{{6}}SGLang{{/6}} 自己的首日基準測試測得更高數字,分別是 10.2 倍和 6.6 倍。在 90% 前綴快取命中率下,預填充吞吐量達到 {{7}}Qwen3.7-Plus{{/7}} 的 8.6 倍。這些是供應商及合作夥伴提供的數據,並非經獨立審核的結果。

• 殘差流 — 閘控殘差。單一殘差路徑被拓寬為四個並行分支,採用逐元素動態閘控,此為 Hyper-Connection 風格的多分支設計,搭配 GatedNorm 風格的調控。閘控機制調節每個分支的讀取與寫入,論文指出這能抑制激活異常值,實際上也讓殘差狀態能以 FP8 格式儲存。

• 嵌入(Embedding)——51B n-gram 表。並非每個 token 對應一個嵌入,而是模型以當前 token 加上前面的 token 作為鍵來查詢查找表,儲存完整詞組與局部模式。每個 token 的成本幾乎為零;而且因為查找位址可預先得知,所以它可以放在主機記憶體中、非同步預先提取,完全不用佔用 GPU 記憶體。這正是讓一個 176B 儲存的檢查點能在 75GB 等級機器上執行的關鍵,其根源可追溯至 Gemma 3n 的逐層嵌入與 Deep​Seek 的 Engram。

• 最佳化 — Muon,已調校。訓練使用 Muon 最佳化器,這是一種基於正交化的動量方法,應用於二維線性映射(注意力、GDN 和 MoE 專家權重),而嵌入、路由器和低秩參數則保留使用 AdamW。論文也報告了一個值得一讀的負面結果:批次大小預熱被放棄,因為它最終導致最佳化器步驟增加 18.8%,卻沒有改善任何事物。

基準表格,請仔細閱讀

這裡的每個頭條數字都是 Qw​en 自家發布的,揭露於模型卡與報告中,而其中沒有一項經過獨立重現——這款模型才問世一天,尚無任何第三方做過審核。即使如此解讀,依然令人震撼,因為 Qwen3.8-Flash-Next 正以 6B 個活躍參數,與規模更大、更成熟穩健的 DeepSeek-V4-Flash-0731 交鋒而不落下風。

• DeepSWE 1.1 — 58.7 對 54.4(廠商回報)。

• SWE-bench Pro — 62.5 對 56.0(供應商回報)。

• Toolathlon 已驗證 — 73.5 對 70.3(廠商回報)。

• LiveCodeBench v6 — 91.9 對 90.6(廠商回報)。

• GPQA Diamond — 91.7 vs 90.8(廠商報告)

• IFBench — 81.3 對比 79.2(廠商報告)。

接著是報告公開印出的落差:NL2Repo-Bench 為 48.1,DeepSeek-V4-Flash-0731 則為 54.2——在倉儲層級的程式碼生成上確實居於劣勢,而這正是較小模型跟不上的唯一一個代理式編碼面向。Agents' Last Exam 則打成平手,24.3 對 25.2。在辦公室自動化方面,Qw​en 回報 CoWorkBench 為 73.9——但這是內部基準,Ali​baba 並未將其納入主圖表。

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

在視覺部分,自報表格顯示 AndroidWorld 84.5 對比 Claude Opus 4.6 Max 的 62.0,RealWorldQA 88.5 對比 73.9。Humanity's Last Exam 是唯一一個 Qw​en 徹底輸給 Claude Opus 4.6 Max 的頭條——而該成績的評定本身是由 GPT-4o 進行的,因此這個比較也不夠純淨。

價格:旗艦款的十二分之一

{{1}}接下來是對預算而言至關重要的數字。{{/1}}{{2}}在 QwenCloud 上,Qwen3.8-Flash 的服務版本每百萬輸入 token 收費 0.16 美元,每百萬輸出 token 收費 0.47 美元。{{/2}}{{3}}這大約是阿里巴巴自家旗艦模型 Qwen3.8-Max 價格的十二分之一,後者每百萬輸入 token 收費 2.00 美元,每百萬輸出 token 收費 6.00 美元{{/3}}{{4}}——而根據該報告,這款模型的訓練算力約為 Qwen3.7-Plus 的九分之一。{{/4}}{{5}}中國模型廠商整個夏天都在調降 Flash 級別的價格,{{/5}}{{6}}而這次發布正是 Qw​en 一方在此攻勢中的落地之作,除了降價之外,還附上了架構上的理由。{{/6}}

對於在該類別中進行比較的任何人來說,當每個供應商都顯示相同的數字時,計算就更容易。OrcaRouter 以供應商的列表價格(0% 加價)路由 Qw​en 系列的其他成員——Qwen3.8-Max、Qwen3.8-27B 和 Qwen3.8——因此供應商降價在宣布當天就會在我們這邊生效。Qwen3.8-Flash-Next 尚未出現在我們的目錄中;當它到達我們路由的運行時,它將納入同樣的一鍵式列表價格設定,無需第二份合約。

你今天可以用它做什麼

Day-zero 支援異常廣泛。SGLang 附帶 cookbook 頁面和專用映像檔(lmsysorg/sglang:qwen38flashnext);vLLM 提供 vllm/vllm-openai:qwen38-flash-next;NVIDIA 則在 GB300 NVL72 機架上以 FP8 格式驗證了兩者以及 TensorRT LLM,每顆 GPU 每秒超過 16,000 個 token,NeMo 則涵蓋微調。在資料中心規模以下,該模型可在 DGX Spark 叢集和 4×RTX PRO 6000 工作站上運行;而同一天社群推出的量化成果——Unsloth 的 GGUFs 和一個僅佔 75GB RAM、準確度約為完整版 80% 的 1-bit 建置——意味著這個 176B 大小的檢查點確實可以在小型團隊自有的硬體上運行。寧可呼叫 API 也不自行部署的團隊,可透過 Ali​baba 自家的 QwenCloud 以及數個第三方平台使用 Qwen3.8-Flash API,不過開放權重才是大多數早期採用者會率先拿到的東西。

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

那份清單背後的 VRAM 計算核心是 n-gram 表,也是各 serving 技術棧接下來匯聚的方向。技術報告中刻意不放入 GPU 記憶體的那份逐層嵌入(per-layer embedding)是純查詢結構——每生成一個 token,模型只會從其 3.2 億列中提取約 16 列——這正是讓卸載成本低廉的原因。vLLM 目前是從專用的開發映像檔服務 Qwen3.8-Flash-Next,而架構支援的 pull request 仍處於開啟狀態;這項工作最新的部分,是來自同一位 vLLM 作者的草稿 PR(vllm-project/vllm#54371,尚未合併),新增了 PLE-Offload 服務路徑,將表格保留在主機記憶體中,並透過 CUDA 統一虛擬定址讀取,而非保留 VRAM。在 FP8 精度下,這張表約佔 ~173GB checkpoint 中的 48GB,因此卸載它正是資料中心 GPU 與單張 96GB 顯示卡之間的差異所在——例如一張 RTX PRO 6000,或一組 DGX Spark 的統一記憶體池。目前這項功能還很早,請把它視為方向而非現階段受支援的選項;但這是執行期追趕上技術報告既有宣稱的跡象,也是如果你一直因為 VRAM 數字而卻步時,值得關注的重點。

一個僅有一天的預覽版,其數字尚未被複現,是教科書級別不應將生產路徑押注於其上的案例,而這正是故障轉移的用途。如果某個執行環境搭載了 Qwen3.8-Flash-Next,你將一個端點指向它,並設定自動故障轉移到你已信任的模型,你就能在非關鍵流量上獲得新架構的優勢,同時在它出問題時有乾淨的後備方案——無需重新佈線,因為那是路由規則,而非程式碼變更。

這個預覽對於 Qwen4 說明了什麼

阿里​巴巴之前就玩過這套了。Qwen3-Next 在 2025 年底預覽了 Gated DeltaNet,文件內容很單薄,直到 Qw​en3.5 系列大規模採用後,這個架構才被完整定義出來。現在這個模式正在重演:Qwen3.8-Flash-Next 是金絲雀,而這份報告就是「用實驗來訂規格」。具體要觀察的重點是:Qwen4 旗艦是否會採用三比一的 GDN 與 QSA 配置、n-gram 嵌入能否在旗艦級規模的生產環境中存活下來,以及最重要的——獨立評測是否會證實 6B-active 對比更大模型的優勢。如果這套效率論點成立,Qwen4 旗艦的伺服成本可能會比前一代大幅降低。

常見問題

Qwen3.8-Flash-Next 和 Qwen3.8-Flash — 是同一个模型嗎?

不,這個區別很重要。Qwen3.8-Flash-Next 是這份技術報告所分析的開放權重架構預覽版;Qwen3.8-Flash 則是阿里​巴巴在 QwenCloud 上提供的生產級 API 版本,定價為每百萬 tokens $0.16/$0.47,預設上下文為 1M。兩者工程系出同源,但屬於不同產物——一個用於自行託管與檢視,另一個是需要付費的受管服務。

生產工作負載今天應該遷移到它上面嗎?

不能沒有第二意見。每一項基準測試都是廠商自行回報、未經重現的;這個架構還很新,服務堆疊仍在收斂中——vLLM 自身的支援也還在透過開放式 pull request 逐步到位——而唯一一個代理式編碼(agentic coding)缺口(NL2Repo)恰恰正是生產環境開發者會遇到的任務類型。開放權重讓自行評估的成本很低,加上 Day-0 就有 SGLang 和 vLLM 的支援,本週就可以啟動試點——但試點應該放在容錯移轉(failover)之後起步,這才是誠實的做法,而不是直接切換(cutover)。

Qwen4 實際出貨是什麼時候?

Ali​baba 尚未說明。此發布中唯一的時間線索是歷史性的:最後一個金絲雀版本 Qwen3-Next 在 Qw​en3.5 系列採用其架構之前約一季發布。依此節奏,Qwen4 的旗艦型號比看起來更近——但這份報告明確是關於架構,而非路線圖。

底線

Qwen3.8-Flash-Next 是少數「論文即產品」的發布。就模型本身而言,誠實的成績單上寫著:6B 激活參數在多數共享基準上媲美遠比它大的模型、在儲存庫層級程式碼上有一項明確指出的差距、服務價格僅為旗艦款的十二分之一,以及一個代表 Qwen 對前沿模型如何變便宜之解答的架構。技術報告說明了 Qwen3.8-Flash-Next 的用途——而它並不是這個模型。它是未來 Qwen4 架構的證據,值得在 Qwen4 發布前好好閱讀,因為它所改變的決定,正是 Qwen4 到來時你將做出的那個決定。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube