Qwen3.8-Flash-Next 對決 Qwen3.8-27B — Qwen4-preview MoE 對上開源權重的主力。重新生成的插圖。
Guides & Insights

Qwen3.8-Flash-Next 對比 Qwen3.8-27B:Qwen4-preview MoE 對上開放權重的主力

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

關於 Qwen3.8-Flash-Next 令人意外的地方,不在於阿里巴巴宣稱每個 token 僅啟動 60 億參數的模型能擊敗大多數開源模型——而在於服務它所需的記憶體,比它所被拿來比較的 270 億參數密集模型還要多。Qwen3.8-Flash-Next 於 2026 年 8 月 26 日作為 Qwen4 架構預覽版開源,將一個 510 億參數的 N-gram 查找表存放在系統 RAM 而非 VRAM 中;Qwen3.8-27B 是 Apache-2.0 授權的多模態密集模型,於 8 月中旬推出,是當前 Qwen 3.8 世代中開源權重的主力,以 4-bit 量化即可放進單張 24GB 顯示卡。在阿里巴巴自家的基準測試表上,新的 MoE 在 22 項對比基準中贏過 27B 達 21 項。而在獨立證據方面——競技場排名、法律代理人研究、第三方吞吐量測量——兩者之中只有 27B 擁有這些。這個組合就是全部的決策依據。

{{1}}一句話總結這場對決:兩款同世代的開放權重、文字加視覺模型,具備相同的 262K 原生上下文,皆為在資料中心之外運行而設計——但在架構、授權、價格,以及有多少說法已獲驗證等方面,兩者截然不同。{{/1}}Qwen3.8-Flash-Next 是稀疏 MoE 模型,預演了 Qwen4 預期將繼承的一切。Qw​en3.8-27B 是稠密模型,將阿里巴巴打造 2.4T 旗艦時學到的經驗,壓縮成單張 GPU 即可運行的規模。要在兩者之間做選擇,與其說取決於能力——阿里巴巴表示預覽版領先——不如說取決於你是否信任一份剛發布一天的廠商規格表,勝過一個已被社群徹底剖析的模型。

計分板

先談來源:以下每個 Qwen3.8-Flash-Next 的數據都是阿里巴巴自家發布,{{1}}僅有一天歷史且未經複現{{/1}}。Qwen3.8-27B 的頭條基準測試宣稱同樣由阿里巴巴報告,但 27B 擁有獨立驗證結果 — {{2}}人類偏好競技場排名、法律領域研究,以及 AMD 吞吐量測量{{/2}} — {{3}}這些都是預覽版無法比擬的{{/3}}。

• 總參數 — Qwen3.8-Flash-Next:125B MoE + 51B N-gram + MTP(儲存約180B),6B 活躍。Qw​en3.8-27B:約27B 密集參數(含視覺編碼器為28B),全部活躍。

• 架構 — Qwen3.8-Flash-Next:Qwen4 預覽版 — Qwen Sparse Attention 與 Gated DeltaNet 交替,具門控殘差、N-gram 嵌入,以 Muon 進行訓練。Qwen3.8-27B:48 個 GDN 線性注意力層加上 16 個完整注意力層(3:1),密集。

• 上下文 — 原生支援 262,144 個 token,可透過 YaRN 擴展至 1M。

• 模態 — 兩者皆接受文字、圖片與影片輸入,並回傳文字。

• 授權 — Qwen3.8-Flash-Next:qwen-community-1.0。Qw​en3.8-27B:Apache 2.0。

• 價格 — Qwen3.8-Flash-Next:$0.16 / $0.47 每 1M(已公布;正式 API 尚未開放)。Qw​en3.8-27B:$0.33 / $2.40 每 1M,今日上線。

• 執行佔用空間 — Qwen3.8-Flash-Next:51B 表存放於主機 RAM,約需 96GB 系統記憶體,外加任何 GPU;FP8 約 186GB,Q4 GGUF 約 82GB。Qw​en3.8-27B:BF16 約 55.6GB,4-bit 版本可裝入 24GB 顯示卡。

• 獨立證據 — Qwen3.8-Flash-Next:尚無。Qw​en3.8-27B:Arena.ai Image-to-WebDev 排名第一的開放模型、Code Arena WebDev 整體第九名、Harvey 法律代理基準排名第一的開放權重、AMD 實測吞吐量。

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

根據阿里巴巴自己的數據,預覽版幾乎全面勝出

阿里巴巴公布的對比數據顯示,Qw​en3.8-Flash-Next 在 22 項語言與視覺基準中,有 21 項取得與 Qw​en3.8-27B 相當或更佳的成績,而且這些領先並非表面功夫。在 SWE-bench Pro 上,62.5 對 61.7 只是小幅領先;但 DeepSWE 的 58.7 對 42.2、JobBench 的 55.7 對 33.4,以及 CoWorkBench 的 73.9 對 70.7,則是在 Flash 等級所鎖定的代理式與辦公室工作負載上,出現了實質差距。預覽版的頭條數據——LiveCodeBench v6 91.9、GPQA Diamond 91.7、MathVision 95.7——同樣超越了阿里巴巴表格中 27B 對應的成績。這次發布的核心論點,用數據來講就是:以極小部分的有效運算量,獲得較大的 Qw​en 3.8 系列大部分推理與程式編寫能力。

把標籤貼在那句話上。這些是阿里巴巴自己的評測結果,出自阿里巴巴自己的評測框架;預覽版的情況才一天前出爐,且兩者皆未經重複驗證。KGP Talkie 的架構拆解在這場對比中排名居前,也得出了相同型態的結論,但它依據的是同一份廠商資料表。廠商的表格只是一種承諾;本段內容沒有任何部分經過獨立證實。

27B 擁有而 Flash-Next 沒有的:證據

這是雙方對比不再懸殊的地方。Qw​en3.8-27B 開源兩週以來,社群已產出三個獨立的數據點。在 Arena.ai 的 Image-to-WebDev 排行榜上——由真人盲測投票,決定兩個匿名輸出中哪一個更值得採用——27B 在開源模型中排名第一,整體排名第七,報告分數為 1,574。在姊妹榜 Code Arena WebDev 上,它以 1,595 分位居整體第九,是同級尺寸中唯一進入前十的模型。法律 AI 公司 Harvey 和 Engram 進行了一項模擬律師事務所研究,將改編版 27B 放在其法律代理基準的頂端——但前提是該模型事先研讀過測試語料庫,因此這證明了微調的上限空間,而非原廠權重的分數。AMD 發布了 Day-0 吞吐量測量數據:在 Ryzen AI Max+ 395 上為每秒 24.5 個 token,在 Radeon AI PRO R9700 上為每秒 51.8 個 token。這些都不是通用品質分數——27B 仍未有 Artificial Analysis 指數——但每一項都是實際運行過該模型的第三方數據。

Qwen3.8-Flash-Next 完全沒有那些。它整份基準測試表都是阿里巴巴的,撰寫本文時才出爐幾小時,而且沒有任何獨立實驗室重現過任何一列。這不是指控;這就是「剛發布一天」的定義。但正是這種不對稱性應該左右你的選擇:預覽版在僅有的數據上領先,而每一筆數據都是由希望你相信它的廠商寫下的。

部署分支

這兩個模型之間的實際差異在於參數存放的位置,而這決定了你需要什麼硬體。Qwen3.8-Flash-Next 刻意將其 51B N-gram 嵌入表卸載到主機記憶體,以便進行非同步預取——這就是為什麼它增加 51B 參數容量卻不增加每個 token 的運算量。其後果是,該模型無法像先前的本機 Qw​en 那樣放進 24GB 的消費級顯示卡。社群估算 Q4 GGUF 總共約 82GB(約 58GB 的主要權重加上 24GB 的查找表),FP8 版本約 186GB,BF16 約 360GB;可行的配置是一台擁有約 96GB 系統 RAM 的機器,再加上任何能運行有效 6B 的 GPU。其回報在於每個 token 的運算成本很低——這是該架構的整個賭注——而且長達 1M token 的上下文仍能維持可負擔的價格,因為 GDN 層會壓縮歷史記錄,而不是讓 KV cache 不斷增長。

Qw​en3.8-27B 則是另一種方向的模型:它是密集模型,因此每個 token 都要跑全部 27B 參數,但體積夠小,整個模型可以放進你已有的硬體裡。BF16 權重大約是 55.6GB;在 4-bit 量化下,它可以跑在 24GB 的顯示卡上,例如 RTX 3090 或 4090;而 AMD 的測試數據顯示,在 AI Max 等級與 Radeon PRO 硬體上,它可達到每秒 24.5 至 51.8 個 token。如果限制是單一台工作站,27B 是真正放得下的選擇;如果限制是規模化後的每個 token 成本,Flash-Next 才是帳面上勝出的那一個。

定價分歧

API 價格從另一面印證了同樣的情況。Qw​en3.8-27B 今天已在 OrcaRouter 上線,每百萬輸入 token 收費 $0.33,每百萬輸出 token 收費 $2.40,供應商列表價格以零加價原價轉傳——自託管選項也變得可調用,無需購買 GPU。Qwen3.8-Flash-Next 目前尚未路由到任何地方:在正式版 Qwen3.8-Flash 以公告的 $0.16/$0.47 價格於 QwenCloud API 上線之前,開放權重是唯一途徑。當該 API 開放時,同樣的原價轉傳會讓 $0.16/$0.47 的價格在當天就落在我們這端,與 27B 使用同一個金鑰,並在兩者之間自動故障轉移——因此,要採用一個剛問世一天的架構,正確做法不是把生產環境押在它身上,而是將部分流量指向它,以經過驗證的模型作為後備。路由層也可以代理你自己託管的模型,這正是目前評估 Flash-Next 開放權重的實際途徑,無需再進行第二次整合。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

要執行哪一個?

如果想現在就跟上 Qwen4 的方向,請選擇 Qwen3.8-Flash-Next;如果你的工作量夠大,讓 $0.16/$0.47 對比 $0.33/$2.40 成為實際考量的數字,或者你有足夠的 RAM 可以自行部署,而且能接受供應商規格表上的條件,也請選擇它。如果你需要 Apache-2.0 授權條款、單張 24GB 顯示卡、現在就能呼叫的模型,或任何程度的獨立證據,請選擇 Qwen3.8-27B——它是兩者中唯一曾由阿里巴巴以外的人執行過的模型。

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

以上兩張截圖分別是兩個部分的公開介面:{{1}}OrcaRouter 清單中顯示 Qw​en3.8-27B 目前以 $0.33/$2.40 提供服務{{/1}},以及 {{2}}Hugging Face 上的 {{KEEP}}Qwen/Qwen3.8-Flash-Next{{/KEEP}} 模型卡片{{/2}}。

而誠實的結尾是一個問題,因為證據基礎只有一天:一個啟動其60億參數的模型,能否在獨立重現下保持21/22的成績?還是那份讓它輕量服務的N-gram表,也正是它在真實工作負載上失敗的原因?27B已經經受了兩週的社群檢視。Flash-Next正處於27B兩週前的位置——這正是應該並行運行兩者、而非二選一的最佳理由。