
Qwen3.8-Flash-Next 发布:阿里在 Qwen4 问世之前就推出了 Qwen4 架构
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 84 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
Qwen3.8-Flash-Next 终于有了不是阿里巴巴自己产出的数字——而这些数字所说明的,与这个故事最响亮的版本并不一致。在 9 月 7 日改版为 v4.3 的 Artificial Analysis Intelligence Index 上,阿里巴巴的开放权重预览版得分为 40,在其比较类别的 113 个模型中排名第五。DeepSeek V4 Flash 0731(Reasoning,Max Effort)——那个它不断被拿来与之比较的模型——得分为 35,排名第九。这并非势均力敌;这是更小的那个模型领先五分。这也是第一个覆盖到该模型的广泛而独立的评分榜,而直到本月,这个模型唯一公布过的数字都来自厂商自己。这个模型本身并不新:权重已于 8 月 24 日在 Hugging Face 上线,正式的 ModelScope 发布则于 8 月 26 日落地。这个月的变化在于,读者如今可以核实这些说法,而不必照单全收。
重新审视这条帖子的提示来自 X 上的 @teortaxesTex,他询问这个预览版是否被悄悄低估了:据称它与 DeepSeek V4 Flash 0731 同属 Artificial Analysis 的同一档位,“体积几乎只有其四分之一”,“活跃参数几乎只有其三分之一”。这三个说法中有两个经不起已公布数据的检验——而这一更正反而对模型有利,因为在真正重要的数字上,这个预览版领先于它的对比对象,而非与之持平。
先从规模说起,这里的数字没有歧义。Qwen3.8-Flash-Next 存储约 180B 参数——125B 的专家混合主体、独立的 51B n-gram 嵌入表,以及约 4B 的多 token 预测层——每个 token 激活其中 6B。DeepSeek V4 Flash 0731 存储 284B,激活 13B。这些正是 Qwen 模型卡和 DeepSeek 文档上给出的数字,也是 Artificial Analysis 在两个模型页面上列出的数字。由此得出的比例为1.6x(存储参数),2.2x(激活参数)。这确实是一个实实在在的效率优势,也正是这一架构之所以重要的原因——但它不是 4x,也不是 3x。我们找不到任何已公布的数字能支持更大的倍数。如果本意是指服务时的内存占用而非参数数量,那么那个数字同样没有公布。
宣布了什么
阿里巴巴先发布了 Qwen4 架构,之后才发布 Qwen4 模型。Qwen3.8-Flash-Next——一个基于下一代架构构建的开放权重、多模态混合专家模型,而这一架构将支撑 Qwen4 系列——分两步亮相:官方 Qwen/Qwen3.8-Flash-Next 仓库于 8 月 24 日在 Hugging Face 上线,比预热倒计时所指的 ModelScope 发布早了两天。正式的 ModelScope 发布于 UTC+08:00 时间 8 月 26 日 23:00 落地,同时上线的服务版 Qwen3.8-Flash 变体也于同一时间公布定价。模型卡上最引人注目的说法此后一直在流传:在阿里巴巴自己的对比表中,一个每 token 激活 6B 参数的模型在 9 项可比基准中的 8 项上击败了 Claude Opus 4.6 Max。阿里巴巴一再表示,完整的 Qwen4 系列稍后才会推出。
如果你这个月还没有关注阿里巴巴的发布节奏,那么关键锚点就是 Qwen3.8-Max——这个拥有 2.4 万亿参数的旗舰模型于 8 月 3 日发布,并在不到两周后以 Qwen3.8-2.4T-A95B 开源。Qwen3.8-Flash-Next 的权重在那之后不到一个月就发布了。同一个实验室刚推出了一个 2.4 万亿参数的开放权重模型,如今又在这一代之后的旗舰甚至尚未定名之前,就放出了下一代的架构。

值得重读的部分是Alibaba自己的表述。该模型被描述为基于下一代架构构建,“该架构将为即将推出的Qwen4系列提供动力”——并明确表示它并非Qwen4本身。Alibaba给出的理由是,在系列发布之前,架构变更就应该交到社区手中,这样当真正的产品发布时,运行时、量化方法和应用程序都已准备就绪。这是一种营销定位,但同时也是一项技术承诺:先预览困难的部分,带领社区一同前进。
模型卡能解决什么,不能解决什么:
• 已确认,根据官方模型卡:Qwen3.8-Flash-Next 是开放权重、多模态、基于 Qwen4 架构的混合专家模型——模型卡称其为“将支撑 Qwen4 的架构的实验性预览”。
• 已确认,根据模型卡和配置:两个核心架构变更 — Gated Delta Network(GDN)和 Qwen Sparse Attention(QSA)— 位于一个 48 层混合架构内,该架构运行 36 层线性注意力层和 12 层全注意力层。
• 已从代码仓库确认:总参数量 125B,每 token 激活 6B(512 个专家,其中 10 个路由专家加 1 个共享专家)——一旦将独立的 51B n-gram 嵌入表和 MTP 层计入,Artificial Analysis 列出的便是 180B——原生上下文为 262,144 个 token,在 Qwen Community License 1.0 下可扩展至 1,000,000。
• 不再未经证实:该模型如今已获得两次独立评分。阿里巴巴的榜单仍是厂商自家的,也仍未被复现,但它已不再是唯一的证据。
首批独立评分出炉——它们说的是"领先",而非"持平"
Artificial Analysis 于 9 月 7 日发布了 Intelligence Index v4.3,而正是重新评分,才让这一切还能有任何可比性。v4.3 更新用难度高得多的 Terminal-Bench v4.0 取代了 Terminal-Bench v2.1,并将 τ³-Banking 替换为 AutomationBench-AA——一个与 Zapier 合作构建、基于 657 项任务的私有留出测试集的智能体工作流基准。私有留出集的权重升至 45%。其宣称目的是阻止前沿模型钻空子操纵该指数,而这对分数的影响很大:两大领先者 GPT-6 Astra 和 Claude Fable 5.1 此前在旧量表上的得分都在 60 多分,如今均落在 53 分。
当你阅读社区数据时,这一点很重要。9 月初围绕 Qwen3.8-Flash-Next 和 DeepSeek V4 Flash 0731 流传的“56 比 52”数字,是在 v4.3 之前的索引上计算出来的;在 v4.3 下,这一对分别处在 40 和 35。引用其中一组来对比另一组,就是在拿两场不同的考试作比较。
在当前指数上,这两个模型在 Artificial Analysis 自己的评估中的实际对比如下:
• 智能指数 — Qwen3.8-Flash-Next 40(同类 113 个中第 5)vs DeepSeek V4 Flash 0731(推理,最大投入)35(113 个中第 9)。
• 智能体式知识工作 — AA-Briefcase 1587 对 1259;GDPval-AA v2 1647 对 1468;AutomationBench-AA 56% 对 54%。
• 终端与编程 — Terminal-Bench v4.0 25% 对 12%;SciCode 51% 对 50%。
• 通用与科学推理——Humanity's Last Exam 38% 对 39%;CritPt 11% 对 17%;GDP.pdf 16% 对 11%;AA-LCR v1.1 80% 对 80%。
• 事实回忆与虚构 —— AA-Omniscience −10 对 −14,Qwen 预览版领先四分。
• 价格 — 每百万输入 $0.15 / 每百万输出 $0.47,对比 $0.44 / $1.32;混合后每百万 token $0.0882,对比 $0.2298。每项 Intelligence Index 任务成本:$0.37 对比 $0.22。
• 速度与延迟——每秒 53 个输出 token,对比 210 个;首个 token 时间 2.80 秒,对比 0.98 秒;端到端响应 49.76 秒,对比 12.88 秒;每任务耗时 1,572.60 秒,对比 221.65 秒。
• Token 使用量——每个任务 108k 输出 token,对比 62k,其中 72k 为推理 token,对比 45k。Artificial Analysis 称该预览版“非常冗长”且“比平均水平更慢”。
• 上下文与规模 — 256k tokens 对比 1,000k;总计 180B / 激活 6B 对比 284B / 13B。
把两者放在一起看,得出的答案比“同一梯队”要鲜明得多。在 Artificial Analysis 衡量的几乎每一个维度上,Qwen3.8-Flash-Next 都赢下了准确性与效率之争——它得分更高,体量更小,而每 token 的成本只有约三分之一。DeepSeek V4 Flash 0731 则在生产端毫无争议地胜出:吞吐量四倍,端到端延迟四分之一,每完成一个任务所耗的挂钟时间少七倍,上下文窗口是四倍。而在成本按完成任务计——这才是能经受住 token 冗长度考验的数字——DeepSeek 反而是更便宜的模型,$0.22 对 $0.37,尽管它的标价更高。如果“被低估”指的是“在每参数质量上优于其名声”,那这个标签名至实归。如果它指的是“你本该改用这个”,那么速度与延迟这两列给出的答案恰恰相反。

除了 Artificial Analysis 之外,也有独立证据。第三方测试框架 smf-bench 于 9 月 5 日发布了一次“Official A”运行结果:在单台 DGX Spark 上以 NVIDIA 的 NVFP4 量化运行 Qwen3.8-Flash-Next,关闭思考模式,得分 137/157(87.3%),其编码部分更是取得 30/30 的零瑕疵成绩;而在同一套 157 项测试框架上,双 Spark 运行的 DeepSeek V4 Flash Vision-Exp 得分为 117/157。这只是在单一机器类别上的单一测试框架,并不能替代广泛评估——但它是一个指向同一方向的第二个数据点,而且来自一个与两家供应商都没有利益关联的人。
Qwen4架构实际上是什么
两种机制共同承载了这个故事。第一种是 GDN——Gated Delta Network(门控 Delta 网络)——即 Alibaba 的线性注意力层。标准 Transformer 会保留一个随序列长度增长的键值缓存,而 GDN 层则维护固定大小的循环状态,并用学到的门控规则更新它;其谱系可追溯至 DeltaNet 和 Mamba-2。收益正是自 Qwen3-Next 以来一直默默支撑 Qwen 系列的那一点:长上下文保持低廉,因为状态不会增长,同时少数全注意力层仍留在混合架构中,负责线性注意力不擅长的精确检索。在当前一代中,这种混合大约为每层全注意力对应三层 GDN——社区对 Qwen3.8-2.4T-A95B 检查点的分析统计出 69 层 GDN 对 23 层注意力。Qwen3.8-Flash-Next 也呈现出同样的三比一划分:36 层线性注意力对 12 层全注意力。
第二项,QSA——Qwen Sparse Attention——才是真正全新的部分,而关于它的公开描述仍然很少:模型卡补充说,它以微块级别运行,预算为 512 个块 / 2048 个 token,但目前还没有完整的技术说明。细节如此稀缺,这本身就是这一模式的一部分。Qwen3-Next 在 2025 年末的预览引入了 Gated DeltaNet,文档同样单薄,直到 Qwen3.5 系列采用它之后,该架构才得到完整说明。对读者来说,这两次的实际启示是一样的:架构预警信号先出现,文档和生产模型随后才出现。
已经成功过一次的策略手册
阿里巴巴以前就上演过这套一模一样的打法,而且奏效了。2025 年底,Qwen3-Next 预览了 Gated DeltaNet,以及线性注意力与全注意力的混合方案。Qwen3.5 系列发布时,规模化地采用了这一蓝图——此后这一混合架构一直延续到 Qwen3.8 世代,包括 2.4T 的旗舰型号。这一先例在此处之所以重要,在于它所暗示的时机。完整的 Qwen4 家族应当预期出现在这次预览之后,而不是其中;如果以 Qwen3-Next 的间隔为参照,"这是架构"与"这是家族"之间的距离是以月计的。模型卡中没有任何内容能证实这一点——这是从阿里巴巴如今已两次重复的模式中得出的推断。
我们仍然不知道的事
未知数已经减少,但并未消失:
厂商基准测试表仍然是厂商自家的。Artificial Analysis 现已对该模型进行独立评分,这填补了发布报道中最大的空白——但阿里巴巴自己的头条宣称,即该模型在 9 项可比基准中的 8 项上击败 Claude Opus 4.6 Max,依据的是阿里巴巴自家的内部评估(CoWorkBench、JobBench、AndroidWorld)以及公开评估,而这些评估中没有一项得到第三方复现。
• 预览版是否与正式提供服务的版本为同一模型。模型卡将 Qwen3.8-Flash-Next 定位为开放权重的实验性预览版,而生产环境所提供的变体——Qwen Cloud 的 Qwen3.8-Flash——则额外提供默认 1,000,000 token 的上下文和内置工具。该正式服务模型是否只是在更大上下文窗口下的同一架构,目前仍未说明;而上述独立评测分数针对的是开放权重的预览版,而非正式服务的 API 模型。
• 该许可证是已知且真实存在的许可证:Qwen 社区许可证 1.0 允许商业使用,包括销售衍生作品,但如果你经营模型即服务或 AI 工作助手业务,并且超过规定的收入和月活跃用户阈值,则需要与阿里巴巴另行签订商业协议。它不同于按收入设限的 Qwen3.8-Max 许可证,但在基于这些权重进行构建之前,值得一读。
• 一份值得标记的一线报告:9月6日一篇关于社区 NVFP4 构建的记述记录了一次语法约束的工具调用失败,发生在思考和 multi-token prediction 同时启用时,并追溯至 xgrammar 的约束解码路径。这是量化社区构建中的运行时 bug,而非模型本身的特性——但如果你的评估框架依赖语法约束的工具调用,这就是首先要测试的东西。
一个以两周为周期迭代的家庭
这种密集的发布节奏本身就是一段故事。Qwen3.8-Max,这个 2.4 万亿参数的旗舰模型,于 8 月 3 日发布;开放权重的 Qwen3.8-2.4T-A95B 紧随其后,于 8 月 12–13 日登场;采用 Apache-2.0 许可的免费 Qwen3.8-27B 几天后落地;而如今,在本月结束之前,下一代架构已经放出预览——并在一周后接受了独立基准测试。目前没有任何其他实验室以这样的节奏迭代。对于挑选模型的读者来说,实际的后果是,“最好的 Qwen”是一个不断移动的目标——而且代际之间的差距,到来的速度往往快于周边生态系统通常的适应速度。与其买一个模型,不如买一个决策,这正越来越成为一种站得住脚的做法。
开发者现在应该做什么
效率数据对本地推理权衡格局的改变,比发布本身还要大。一个在当前指数上得分 40 的 6B 激活参数模型是可压缩的:英伟达官方的 NVFP4 量化正是 9 月 5 日 smf-bench 运行所采用的那一种,而在此之外的社区 NVFP4 和 FP8 构建版本也已在流传,这正是让一个存储量为 180B 的模型以单 GPU 级别部署在根本上可行的原因。但保留意见依然不变——这只是一个未经证实的预览版,厂商给出的表格尚未被复现,而且独立评分的分布形态(在知识工作和终端任务上强劲,在长周期仓库生成和一次性智能体通过率上较弱)意味着,该模型的弱点恰好出现在生产代码变更所在之处。在它接触任何重要事务之前,先让它跑一份低风险的真实工作负载副本,并让自动故障转移在预览版行为异常时兜底。
在价格方面,发布时还模糊不清的图景如今已变得具体。Artificial Analysis 列出该预览版的计费费率为每百万输入 token 0.15 美元、每百万输出 token 0.47 美元,而 DeepSeek V4 Flash 0731 为 0.44 美元和 1.32 美元——与已上线的 Qwen3.8-Flash 变体处于同一数量级,Qwen Cloud 将其标价为 ¥1 和 ¥3(约合 0.16 美元和 0.47 美元)。生产版本才是你今天真正可以调用的那个:它在这里被路由为 qwen/qwen3.8-flash,而 OrcaRouter 以 0% 加价率直接透传厂商的标价,因此当阿里巴巴调整该数字时,该端点当天就会随之变动。本文中的对比模型也是如此——DeepSeek V4 Flash 0731 被路由为 deepseek/deepseek-v4-flash-0731,按提供商的标价计费,这使得上述对比中每 token 成本这一半可以对照你自己的流量进行验证,而不是对照基准测试的 token 计数。没有在这里被路由的是开放权重的 Flash-Next 预览版本身:今天要用它,你得自行拉取权重并自行部署,这正是为什么上文的量化话题比标价更重要。这一代产品必须跨越的天花板在同一个端点上依然可见:Qwen3.8-Max(qwen/qwen3.8-max)的定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,同样按厂商标价透传。

实际推进顺序没有太大变化,但它背后的信心已经不同了。如果你想要已经上线服务的生产版本,又不想拉取 100GB 的权重,那么 Qwen3.8-Flash 已经可以按标价调用了。如果你想要的是架构——GDN、QSA、n-gram 表、卸载技巧——权重可以下载,运行时也已就绪:vLLM 从第一天起就能提供服务,其卸载路径会把 51B 参数的 n-gram 嵌入表保留在主机内存中,而不是常驻 VRAM;SGLang 和 TensorRT-LLM 都在 NVIDIA 的 Day 0 列表中;Ollama 的库还带有 MLX 构建,你可以在 Apple Silicon 上拉取。唯一不该再做的,就是把这款模型的质量当作未知数。它现在已经被评测过了,而且评测结果很好。
接下来看什么
• 随着该指数日趋成熟,这些独立数字是否依然站得住脚。Qwen3.8-Flash-Next 的 40 分伴随着异常高昂的 token 账单——它在指数评测中烧掉了 2.45 亿 token,而中位数仅为 1.4 亿——Artificial Analysis 自己的评注也称其「非常啰嗦」。靠更长时间推理得出的分数依然是分数,但这类分数会随着评测方式的变化而变动。下一次指数修订才是真正的考验:40 究竟是一个稳定水平,还是一个局部最大值。
• 线上提供的 Qwen3.8-Flash 是否会单独评分。本文中每一个独立数字都针对开放权重预览版。带有 1M 上下文和内置工具的生产变体自身没有独立评分,而如果它是在更长上下文下的同一架构,那么这是一项有人应当发布的低成本评估。
• 首日即支持在实际中表现如何——厂商给出的 GB300 吞吐数字仍只是厂商宣称,而 TP4 专家并行与 KV 卸载配置也依然太新,还不够稳定。
• 阿里巴巴要等多久,完整的 Qwen4 系列才会跟随预览版发布。
这个故事中“我们目前已知”的部分,如今已大体尘埃落定。规格表已公开,权重可下载,架构已确认,所提供的 Qwen3.8-Flash 变体已在托管 API 上按标价上线,并且该模型已由两个独立方分别评分——较小的模型在质量之争中胜出,较大的模型则在吞吐量之争中胜出。仍未确定的是,一个 6B 激活参数的预览版能否泛化到它调优所针对的基准之外,以及 Alibaba 会等多久才让完整的 Qwen4 系列紧随其后。最后一个问题仍是此次发布未予回答的那个问题,也仍将是最重要的那个问题。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
