
Qwen3.8-Flash-Next:阿里巴巴在Qwen4问世之前预览Qwen4架构
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
阿里巴巴将在发布Qwen4模型之前公布Qwen4架构。Qwen3.8-Flash-Next——一个基于下一代架构构建的开权重、多模态混合专家模型,该架构将为Qwen4系列提供支持——计划于2026年8月26日北京时间23:00在ModelScope上线。阿里巴巴将这次发布定位为技术预览:开发者提前获得架构,完整的Qwen4系列稍后推出。截至撰写本文时,参数数量、许可证和价格均未确认,因此这是一篇"目前所知"的报道——下文每项具体信息都标注了其可靠性程度。
如果你这个月没有密切关注阿里巴巴的发布节奏,那么锚点是Qwen3.8-Max——这款2.4万亿参数的旗舰模型于8月3日发布,不到两周后便以Qwen3.8-2.4T-A95B的形式开源。Qwen3.8-Flash-Next在不到一个月后也随之登场。同一个实验室,刚推出了一款2.4万亿参数的开源权重模型,现在又在下一代旗舰尚未命名之前,就公开了下一代模型的架构。
宣布了什么
信号通过常规渠道传达到了竞技场。8月25日,ModelScope上出现了Qwen3.8-Flash-Next的预热页面,带有“即将开放发布”的徽章,标语为“迈向下一代——闪电般快速”,倒计时指向2026-08-26 23:00(UTC+08:00)。同日,阿里巴巴的Qwen团队在X上发帖——“下一波Qwen浪潮即将到来。”将这条消息推送给我们的是X上的@kimmonismus,其表述略有不同:一个基于下一代架构的开放权重多模态MoE,提前开放以便社区为Qwen4系列做好准备。

最值得重读的是阿里巴巴自己的表述方式。该模型被描述为基于下一代架构构建——该架构“将为即将推出的 Qwen4 系列提供动力”——并且明确表示它不是 Qwen4 本身。阿里巴巴给出的理由是,架构上的这些变化应该在新系列到来之前就交到社区手中,这样当真正的产品正式发布时,运行时、量化方案和应用都已准备就绪。这是一种营销姿态,但同时也是一项技术承诺:先预览最困难的部分,带动社区一起前行。
今天已确认的是什么,未确认的又是什么:
• 已确认,根据预告和 Qwen 声明:Qwen3.8-Flash-Next 是开放权重、多模态模型,并且是基于 Qwen4 架构的 MoE 模型。
• 已确认,根据Qwen的声明:它引入了两项重大架构变化——GDN混合架构和Qwen稀疏注意力(QSA)。
• 已确认,根据预告:发布时间为 2026-08-26 23:00 (UTC+08:00),在 ModelScope 上。
• 未确认:总参数或激活参数、许可条款、上下文长度、API可用性或定价,以及每项基准测试分数。由于权重尚未发布,目前尚无独立评估。

Qwen4架构实际上是什么
推动这个故事的,是两条机制。第一条是GDN——门控Delta网络——阿里巴巴的线性注意力层。标准Transformer会维护一个随序列长度增长的键值缓存,而GDN层则维护固定大小的循环状态,并用可学习的门控规则更新它;其谱系可追溯至DeltaNet和Mamba-2。回报在于,自Qwen3-Next以来,它一直在默默驱动Qwen系列:长上下文保持低成本,因为状态不会增长;同时少数全注意力层留在混合结构中,负责线性注意力所不擅长的精确检索。在当前这一代中,混合比例约为每三个GDN层对应一个全注意力层——社区对Qwen3.8-2.4T-A95B检查点的分析统计出69个GDN层与23个注意力层。Qwen3.8-Flash-Next被描述为正是沿袭这一谱系的“GDN混合架构”。
第二个,QSA —— Qwen 稀疏注意力 —— 才是真正的新东西,目前还没有公开的技术描述:只有名字,以及它被列为该预览版两大头条变化之一的说法。这种细节的缺失本身就是模式的一部分。Qwen3-Next 在 2025 年末的预览版引入了 Gated DeltaNet,文档同样稀少,直到 Qwen3.5 系列采用后,该架构才得到完整说明。对读者来说,两次的实际结论是一样的:架构金丝雀会先出现,文档和生产模型随后才到。
已经成功过一次的策略手册
阿里巴巴以前就采用过完全相同的打法,而且奏效了。2025年底,Qwen3-Next 预览了 Gated DeltaNet 以及线性注意力与全注意力的混合架构。当 Qwen3.5 系列发布时,它在大规模上采用了这一蓝图——此后,这种混合架构一直延续贯穿 Qwen3.8 代际,包括 2.4T 旗舰模型。这一先例之所以重要,在于它暗示的时间节奏:完整的 Qwen4 系列应在这次预览之后才会到来,而不是包含在预览之内;如果以 Qwen3-Next 的间隔时间为参照,那么从“架构在此”到“系列在此”的距离以月计算。预告中没有任何内容证实这一点——这只是从阿里巴巴现已两次采用的模式中得出的推断。
我们仍然不知道的事
未知事物正是预览的意义所在,而它们是真实存在的:
• 参数。预告未披露任何参数。X和Reddit上的社区猜测——并无官方背书——指向一个总参数约125B/激活参数约6B的配置,带有大型n-gram嵌入查找表。请将其视为传闻。
• “{{1}}Flash{{/1}}”层级。在{{2}}Qwen3.5{{/2}}这一代中,仅限云端的{{3}}Qwen3.5-Flash{{/3}}是开放权重模型{{4}}Qwen3.5-35B-A3B{{/4}}的增强版本。{{5}}Qwen3.8-Flash-Next{{/5}}是否是类似规模的{{6}}Qwen3.8{{/6}}模型的开放权重对应版本尚不清楚;它也可能是{{7}}125B-A6B-class{{/7}}模型。两种解读都只是推测。
• 许可。阿里巴巴近期发布的 Qwen 系列涵盖从 Apache-2.0(Qwen3.8-27B)到受收入门槛限制的 Qwen3.8-Max 许可。Flash-Next 的归属将决定其能否用于商业用途,以及可用于哪些商业场景。
• 基准测试。Qwen 声明强调了代理式编码、长时程任务和多模态智能,但未附带任何数据,且在权重发布之前也不存在独立的评估。
一个以两周为周期迭代的家庭
整个发布节奏本身就是一段故事。8月3日,拥有2.4万亿参数的旗舰模型Qwen3.8-Max发布;8月12日至13日,开放权重的Qwen3.8-2.4T-A95B接踵而至;几天后,采用Apache-2.0许可的免费Qwen3.8-27B也正式落地;而现在,在这个月尚未结束之际,下一代架构已经开始预览。目前没有任何其他实验室能按这样的节奏迭代。对于挑选模型的读者来说,实际后果是“最好的Qwen”是一个不断移动的目标——代际之间的差距来得比周边生态系统通常的适应速度还快。购买一个决策而非一个模型,正日益成为更站得住脚的选择。
开发者现在应该做什么
{{1}}规划时要从架构出发,而不仅仅是模型本身。{{/1}}{{2}}Qwen3.8-Flash-Next 上线首日仍会是一个未经证实的预览版本:{{/2}}没有独立的基准测试,{{3}}运行时生态仍在追赶,{{/3}}而关系到使用它的工作负载的智能体与长周期能力,目前也只有供应商的单方面宣称。{{4}}安全的评估方式不是把它接入生产路径,而是将低风险的工作负载副本路由给它,对比其输出与现有模型,并让自动故障转移来吸收提供全新开放权重模型的供应商出现异常时的波动。{{/4}}{{5}}在 OrcaRouter 上,这就是你已经在用的同一个端点和同一个密钥:{{/5}}{{6}}Qwen3.8-Flash-Next 与你当前的模型同处于一个 API 之后,{{/6}}路由 DSL 可以在一切尚未落定之前,用相同的提示词对预览版和现有模型进行 A/B 对比。
定价(若存在)应以同样的方式解读。阿里巴巴尚未公布 Flash-Next 的 API 价格,未发布的权重也无法在任何地方路由。当有供应商提供该模型时,OrcaRouter 会以 0% 加价原样透传供应商标价——因此无论阿里巴巴给出的数字是多少,都会在当天原封不动地呈现出来。目前你能实际调用的最接近基准是 Qwen3.8-Max(qwen/qwen3.8-max),即该架构最终将置于其下的旗舰模型:1,000,000 token 的上下文窗口,每百万输入 token 定价 2.00 美元,每百万输出 token 定价 6.00 美元,均按标价透传。当 Flash-Next 的价格公布时,请记住这个数字;这是下一代必须超越的成本。

在掉落时该看什么
发布计时器耗尽的那一刻,有四件事至关重要:
• 参数量与活跃参数层级——这是传闻中描述的 125B-A6B 级模型,还是规格较小的型号?
• 许可证 — 像 Qwen3.8-27B 那样宽松,或像 Max 许可证那样受限。
• 首批独立评估是否复现了供应商关于智能体编码和长周期任务的主张——值得信任的是数字,而不是营销话术。
• 阿里巴巴在预览版之后多久才会推出完整的Qwen4系列?
这些从当下无从得知。今天可知的是阿里巴巴所做决定的大致形态:它押注于在旗舰产品之前公开其下一代架构是值得的。这场赌注就是故事本身——而权重将于明日发布。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
