
認識 Qwen3.8-Flash:一款開放權重的多模態 MoE,預覽 Qwen4 架構——在 QwenCloud 上每 1M tokens 只需 $0.15/$0.47
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
2026年8月26日,Qwen 團隊將 Qwen3.8-Flash 背後的權重開源——以 Qwen3.8-Flash-Next 之名發布於 Hugging Face 和 ModelScope——並在 QwenCloud API 上推出了以 Qwen3.8-Flash 為名的生產模型,隔日確認了其官方定價。最引人注目的數字——於8月28日獲阿里巴巴自家公告正式確認——是一個1250億參數的多模態混合專家(MoE)模型,每個 token 僅啟動約60億參數,稀疏度約95%,建構於阿里巴巴明確描述為 Qwen4 世代早期預覽的架構之上。生產 API 已於 QwenCloud 上線,定價為每百萬輸入 token 0.15 美元、每百萬輸出 token 0.47 美元、每百萬個快取命中的 token 0.016 美元——這是運行結構上源自阿里巴巴下一代旗艦模型之物的最便宜方式,也是該實驗室首次在完整模型系列問世前,將架構預覽以公開開放權重的形式發布。
有一項數字比規格表上的其他數據都更具分量:6B。Qwen3.8-Flash 的能力並非來自龐大的體量,而是來自它將算力配置於何處。一個 125B 的 MoE 主體、一張 51B 的 N-gram 嵌入表,以及一個小型多 token 預測模組,在磁碟上儲存了將近 180B 個參數,但每個 token 只會路由通過其中的 6B。這就是這次整個發布所押注的核心,也是訓練成本之所以能大幅下降的原因。
實際發佈的內容
{{1}}Qwen3.8-Flash{{/1}}(不帶後綴)是{{2}}正式上線的模型{{/2}},目前已部署於{{3}}QwenCloud API{{/3}}及阿里巴巴的{{4}}Qwen Office{{/4}}產品中;它配備{{5}}100萬 token 的預設上下文{{/5}}與{{6}}內建工具{{/6}},每百萬 token 收費{{7}}$0.15/$0.47{{/7}},而{{8}}快取命中{{/8}}則為{{9}}$0.016{{/9}}。自{{10}}8月28日{{/10}}起,可用範圍擴大:根據{{11}}阿里巴巴的公告{{/11}},Qwen3.8-Flash 現在也可透過{{12}}OpenCode Go{{/12}}(即{{13}}開源終端編碼代理的固定費率訂閱服務{{/13}})使用——{{14}}OpenCode 自家的模型清單{{/14}}以{{15}}qwen3.8-flash{{/15}}之名收錄,並採用相同的每百萬 token {{16}}$0.15/$0.47{{/16}}費率。

Qwen Studio 的官方公告將開放權重發布定位為對生態系的邀請:提早發布結構性變更,讓社群和推論技術棧能在完整的 Qwen4 產品線建立之前進行調適。第一個成功的跡象是 SGLang——LMSYS 支援的推論引擎——在同一天發布對 Qwen3.8-Flash-Next 的當日支援,該模型也已配置支援 Transformers、vLLM 和 TokenSpeed。
建築即是故事
這不是一個縮小版的 Qwen 3.8 世代模型。Qwen3.8-Flash 引入了四項變革,團隊表示 Qwen4 系列也將繼承這些變革,每一項都針對不同的瓶頸。
• 注意力 — Gated DeltaNet 加上 Qwen Sparse Attention。Gated DeltaNet(GDN)在每四層中的三層將歷史壓縮為固定大小的狀態,因此模型不會在每一步都重新閱讀所有內容;QSA 接著將長上下文視為搜尋問題——一個輕量級索引器將序列聚合為微區塊,對區塊級重要性進行評分,並將注意力引導到最相關的區域。根據阿里巴巴的測量,QSA 注意力核心在 1M token 上下文下可達到最高 7.6× 更快的預填充和 4.9× 更快的解碼(供應商報告)。
• 殘差 — 門控殘差。單一殘差流變成四個並行分支,採用逐元素門控,讓網路能針對每個 token 自行決定在各分支上讀取與寫入的幅度;其中一個分支會演變為一條連接早期注意力層與深層網路的長距離通道。殘差狀態以 FP8 儲存,以降低記憶體頻寬。
• 嵌入 — N-gram 嵌入。一個以目前 token 及前幾個 token 為鍵的 51B 參數查找表。它增加容量而不增加每個 token 的計算量,而且因為該表可置於主機記憶體中並非同步預取,所以不會永久佔用 GPU 記憶體。
• 最佳化器 — Muon。大型二維線性參數(注意力、GDN、MoE 專家)使用 Muon 訓練,而嵌入層、路由器及 Gated Residual 低秩部分則維持使用 AdamW;團隊針對新架構重新擬合了混合方案的擴展定律。

對開發者來說,其中兩項立刻就有影響:注意力堆疊是讓 100 萬 token 上下文能成為預設能力而非遠大目標的原因,而 N-gram 表則是讓 125B 模型仍能輕量部署的關鍵。其餘內容都是 Qwen4 的預覽材料——而這正是阿里巴巴對它的定位。
如實標註的基準表
{{1}}本節中的所有數字均為阿里巴巴自家的評估,數據發布僅一天,截至撰稿時尚未有任何獨立實驗室重現。請將這些數字視為方向性表述,而非定論。{{/1}} 在阿里巴巴的評測套件中,Qwen3.8-Flash-Next(6B 活躍參數)在 SWE-bench Pro 取得 62.5 分、DeepSWE 1.1 取得 58.7 分、CoWorkBench 取得 73.9 分、AndroidWorld 取得 84.5 分、MathVision 取得 95.7 分,JobBench 得分為 55.7 分——而基礎版本 Qwen3.8-Flash-Next-Base 在一對一全面比較中,被報導為 14 項基準中 8 項的最佳開源模型,包括 MMLU-Pro、SuperGPQA、BBH 和 MMMU。{{/2}}
阿里巴巴的家族定位說法應被如實標記為——宣稱。該公司表示,Qwen3.8-Flash 在 SWE-bench Pro 上以 9.1 分勝過 Claude Opus 4.6,在 JobBench 上約領先 20 分,並且已逼近 Claude Opus 4.8。全部皆為廠商自報,全部未經重現。今天可獨立驗證的範圍更窄:權重已發布,推論技術棧已能運行這些權重,而 SGLang 當天就發布了支援。獨立重現這份基準測試表的結果,只需要數天而非數週。
費用是多少
定價是最容易驗證的部分,因為它是公開價格而非基準價格。8月27日,阿里巴巴正式確認了生產環境的 QwenCloud 價格:每百萬輸入 token 為 0.15 美元,每百萬輸出 token 為 0.47 美元,每百萬快取命中為 0.016 美元;中國國內價格則為人民幣 0.8/2.7/0.1 元。對代理型(agentic)工作負載而言,快取命中的價格才是關鍵:長上下文代理每一輪都會重新讀取大量歷史紀錄,重複讀取只需花費極少的成本,而這正是 Qwen4-preview 注意力堆疊所針對的工作負載。中國媒體報導立即將這項標誌性價格與同業相比——大約是 DeepSeek-V4-Flash 收費的三分之一,在頂尖封閉模型旁邊更是微不足道的零頭。根據阿里巴巴自己的計算,這次訓練成本大約是 Qwen3.7-Plus 的九分之一,而正是這種結構性優勢讓 API 價格得以維持在目前的水平。
與 Qwen 3.8 系列其他成員相比,差距十分明顯:旗艦機型 Qwen3.8-Max 每百萬 token 收費 $2.00 和 $6.00,而且已以供應商列表價格上線 OrcaRouter,零加價。如今正式版 Qwen3.8-Flash API 已開放,同樣的直通計費也適用於官方 $0.15/$0.47 費率及 $0.016 快取命中費率——路由層就是「讀到降價消息」與「在設定檔中享有降價」之間的差異。兩個模型共用同一把金鑰,兩者之間可故障轉移,無需第二份合約。
「Qwen4 預覽」是什麼意思
從字面上解讀這份公告,利害關係就很清楚:這不是 Qwen 3.8 的新等級——而是 Qwen4 的架構提早推出,包裝在一個更小、更便宜型號的保護品牌之下。這樣做的理由很充分:框架、量化與部署模式都需要時間成熟,而在阿里巴巴於其上打造昂貴模型之前,一個 6B-active 模型正是讓社群大規模壓力測試 GDN + QSA 的廉價方式。另一面是,生產環境中的 Qwen3.8-Flash 是一個 API,建立在更廣泛生態系統仍在審計的架構之上。早期採用者,本質上,就是測試集。
快速嘗試它的途徑
今天你有四個實際可行的選項。透過 vLLM、SGLang、Transformers 或 TokenSpeed 自行託管開放權重——對於任何未達完整節點的設置,FP8 版本是明智的第一站。呼叫 QwenCloud API,現已以官方 $0.15/$0.47 價格上線,快取命中為 $0.016。在 OpenCode Go 中使用它,這是開源終端機編碼代理的固定費率訂閱,本週新增了 Qwen3.8-Flash(由阿里巴巴於 8 月 28 日宣布,並在 OpenCode 自己的模型清單中確認)。或者像你已經呼叫 Qwen3.8-Max 那樣,透過路由器呼叫生產用 Flash,官方價格原價轉傳,零加價——無需維護任何客製化整合。

開放的問題才是誠實的問題:一個啟動60億參數的模型,能否在各種工作負載下於生產環境中站穩腳跟?還是那張今天看起來像剛出爐的基準測試表,一個月後依然如此?這不是等待的理由——而是把它放在故障轉移之後、而不是整個技術棧最前端的理由。權重已經釋出,價格已經定案,而這個架構是阿里巴巴宣示的方向。接下來幾週將決定6B是否足夠。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
