
Qwen3.8-Flash-Next vs Qwen3.8-27B:Qwen4-preview MoE 对阵开源权重主力型号
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 578 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 182 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Qwen3.8-Flash-Next最令人意外的地方,不在于阿里巴巴声称其每个token仅激活60亿参数的模型就能击败开源领域的大部分对手——而在于部署运行它所需的内存竟然比被拿来对比的270亿参数稠密模型还要多。作为Qwen4架构的预览版,Qwen3.8-Flash-Next于2026年8月26日开源,它将一张510亿参数的N-gram查找表存放在系统RAM而非VRAM中;而Qwen3.8-27B是8月中旬发布的Apache-2.0多模态稠密模型,也是当前Qwen 3.8一代中开源权重的主力干将,在4-bit量化下可装入单张24GB显卡。在阿里巴巴自家的基准测试表上,这款新MoE在22项对比基准中有21项胜过27B。而在独立证据方面——竞技场排名、法律智能体研究、第三方吞吐量测量——两者之中只有27B拥有这些。这一组合就是全部决策依据。
一句话概括这场对决:两款同代开放权重、文本+视觉模型,原生上下文同为262K,均为在数据中心之外运行而设计——但在架构、许可证、价格以及其说法被验证的程度上截然不同。Qwen3.8-Flash-Next是稀疏MoE,预览了Qwen4预期继承的一切。Qwen3.8-27B是稠密模型,将阿里巴巴构建2.4T旗舰时学到的经验压缩到单张GPU即可运行。在两者之间做选择,与其说是能力问题——阿里巴巴称预览版更胜一筹——不如说是你是否信任一份仅发布一天的厂商规格表,胜过信任一个已被社区深入剖析的模型。
记分牌
先说明来源:下文所有 Qwen3.8-Flash-Next 的数据均出自阿里巴巴自家,仅发布一天,且未经第三方复现。Qwen3.8-27B 的头条基准测试成绩同样由阿里巴巴报告,但 27B 拥有独立结果——人类偏好竞技场排名、法律领域研究以及 AMD 吞吐量实测——这些都是预览版无法企及的。
• 总参数 — Qwen3.8-Flash-Next:125B MoE + 51B N-gram + MTP(存储约180B),6B激活。Qwen3.8-27B:约27B稠密(含视觉编码器为28B),全部激活。
• 架构 — Qwen3.8-Flash-Next:Qwen4 预览版 — Qwen 稀疏注意力与 Gated DeltaNet 交替,门控残差,N-gram 嵌入,使用 Muon 训练。Qwen3.8-27B:48 个 GDN 线性注意力层加 16 个全注意力层(3:1),密集。
• 上下文 — 两者均原生支持 262,144 token,可通过 YaRN 扩展至 1M。
• 模态 — 两者都接受文本、图像和视频输入并返回文本。
• 许可 — Qwen3.8-Flash-Next:qwen-community-1.0。Qwen3.8-27B:Apache 2.0。
• 价格 — Qwen3.8-Flash-Next:每 1M $0.16 / $0.47(已公布;生产 API 尚未开放)。Qwen3.8-27B:每 1M $0.33 / $2.40,今日上线。
• 运行占用 — Qwen3.8-Flash-Next:主机 RAM 中的 51B 表,约 96GB 系统内存,另加 GPU 显存;FP8 约 186GB,Q4 GGUF 约 82GB。Qwen3.8-27B:BF16 约 55.6GB,4-bit 可装入 24GB 显卡。
• 独立证据 — Qwen3.8-Flash-Next:暂无。Qwen3.8-27B:在 Arena.ai Image-to-WebDev 上排名第一的开源模型,在 Code Arena WebDev 上总体排名第九,在 Harvey's Legal Agent 基准测试中排名第一的开源权重模型,AMD 实测吞吐量。

按照阿里巴巴自己的数据,预览版几乎全面胜出。
阿里巴巴发布的对比显示,Qwen3.8-Flash-Next 在22项语言和视觉基准中有21项得分与 Qwen3.8-27B 持平或更高,而且这些优势并非表面功夫。SWE-bench Pro 62.5 对 61.7 只是微弱领先,但 DeepSWE 58.7 对 42.2、JobBench 55.7 对 33.4、CoWorkBench 73.9 对 70.7 则是实实在在的差距——这正是 flash 层级所瞄准的智能体与办公工作负载。该预览版的头号数字——LiveCodeBench v6 91.9、GPQA Diamond 91.7、MathVision 95.7——同样在阿里巴巴的表格上超越了 27B 的对应行。这就是本次发布以数据形式陈述的核心论点:以一小部分活跃算力,获得更大 Qwen 3.8 系列的大部分推理与编码能力。
把标签保留在那句话上。这些是阿里巴巴自己的评估,来自阿里巴巴自己的测试框架;就预览版而言,评估结果只有一天之隔,而且两者均未经复现验证。针对这一对阵排名靠前的 KGP Talkie 架构拆解也得出了相同形态的结论,但它依据的是同一份供应商资料。供应商表格只是承诺;本段中的任何内容都未经独立证实。
27B 有而 Flash-Next 没有的:证据
竞争格局从这里开始不再一边倒。Qwen3.8-27B 已经公开发布两周,社区产出了三个独立的数据点。在 Arena.ai 的 Image-to-WebDev 排行榜上——由盲评人类投票决定观众更愿意发布两个匿名输出中的哪一个——27B 在开放模型中排名第 1,总排名第 7,报告得分为 1,574。在姊妹榜单 Code Arena WebDev 上,它以 1,595 分位列总榜第 9,是前十名中唯一属于该规模等级的模型。法律 AI 公司 Harvey 和 Engram 进行了一项模拟律师事务所研究,将适配后的 27B 置于其法律智能体基准的榜首——但需要说明的是,该模型事先学习了测试语料库,因此这更多是微调空间的展示,而非对原始权重的评分。AMD 发布了 Day-0 吞吐量数据:在 Ryzen AI Max+ 395 上为 24.5 tokens/s,在 Radeon AI PRO R9700 上为 51.8 tokens/s。这些都不是通用质量评分——目前仍没有针对 27B 的 Artificial Analysis 指数——但每一项都是实际运行过该模型的第三方。
Qwen3.8-Flash-Next完全没有这些。它的整张基准测试表都来自阿里巴巴,撰写本文时数据才出炉几个小时,没有任何独立实验室复现过哪怕一行结果。这不是指控,而是对刚发布一天的版本的定义。但恰恰是这种不对称性应当主导选择:预览版在现有仅有的数据上领先,而每一个数据都出自那个希望你相信它的厂商之手。
部署分支
这两个模型之间的实际区别在于参数存放的位置,而这决定了你需要什么样的硬件。Qwen3.8-Flash-Next 刻意将其 51B 的 N-gram 嵌入表卸载到主机内存中,在那里可以异步预取——这就是为什么它增加了 51B 的参数容量却不会增加每个 token 的计算量。结果是,该模型无法像之前的本地 Qwen 那样装进一张 24GB 的消费级显卡。社区估算 Q4 GGUF 总量约为 82GB(约 58GB 主权重加上 24GB 查找表),FP8 版本约为 186GB,BF16 约为 360GB;可行的配置是一台拥有约 96GB 系统内存的机器,外加任意一块能运行激活的 6B 模型的 GPU。其回报是每个 token 的计算成本很低——这是该架构押上的全部赌注——而且长 1M token 的上下文依然负担得起,因为 GDN 层压缩历史记录,而不是让 KV 缓存不断增长。
Qwen3.8-27B 则是另一种情况:它是稠密模型,因此每个 token 都会运行全部 27B 参数,但它的规模足够小,整体可以放进你已有的硬件中。BF16 权重约为 55.6GB;在 4-bit 量化下,它可以运行在 24GB 显存的显卡上,如 RTX 3090 或 4090,并且 AMD 的测量显示,在 AI Max 级和 Radeon PRO 硬件上,它能达到每秒 24.5 到 51.8 个 token。如果限制条件是一台单独的工作站,那么 27B 才是真正能放下的那个;如果限制条件是规模化的每 token 成本,那么 Flash-Next 在纸面上更胜一筹。
定价区间
API 价格从另一面讲述了同一个故事。Qwen3.8-27B 今天已在 OrcaRouter 上线,每百万输入 token 0.33 美元,每百万输出 token 2.40 美元,提供商列表价格零加价直接传导——自助托管选项已可调用,无需购买 GPU。Qwen3.8-Flash-Next 目前还没有路由到任何地方:在生产级 Qwen3.8-Flash 以公布的 0.16/0.47 美元在 QwenCloud API 上开放之前,开放权重是唯一路径。当该 API 开放时,同样的直通会在同一天把 0.16/0.47 美元的价格放到我们这边,与 27B 使用同一个 key,并可在两者之间自动故障转移——因此,采用一天前才出现的架构的方式,不是把生产押在它上面,而是把一部分流量指向它,并以经过验证的模型作为回退。路由层还可以代理你自己托管的模型,这是今天在不做第二次集成的情况下评估 Flash-Next 开放权重的实际路径。

该运行哪一个
如果你现在就想搭上 Qwen4 的方向,如果你的工作负载量大到让 $0.16/$0.47 对比 $0.33/$2.40 的差价成为实打实的数字,或者如果你有足够的内存自行托管并且不介意受制于厂商,那就选 Qwen3.8-Flash-Next。如果你需要 Apache-2.0 许可条款、单张 24GB 显卡、一个今天就能调用的模型,或者任何程度的独立证据——那就选 Qwen3.8-27B,它是这两者中唯一被阿里巴巴以外的人真正运行过的。

上面的两张截图分别展示了两半的公开表面:OrcaRouter 列表显示 Qwen3.8-27B 目前可以以 $0.33/$2.40 的价格调用,以及 Hugging Face 上的 Qwen/Qwen3.8-Flash-Next 模型卡。
而诚实的结论是一个问号,因为证据基础才只有一天:一个激活了60亿参数的模型,能否在独立复现中保持22项测试拿下21项的战绩?还是说,让它服务精简的N-gram表,恰恰就是在真实工作负载上掉链子的东西?27B已经经受了两周的社区审视。Flash-Next现在正处于27B两周前的位置——这正是让它们并排运行、而非二选一的最佳理由。
