
Qwen3.8-Flash-Next 发布:揭秘阿里巴巴 Qwen4 架构预览
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
{{1}}Alibaba于2026年8月26日发布的最有用的文档并非新闻资料包,而是一份技术报告。{{/1}}{{2}}Qwen3.8-Flash-Next(当天发布的开放权重多模态混合专家模型)随附了一篇题为"On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability"的论文,{{/2}}而这份报告才是重头戏。{{3}}它做到了厂商发布新品时几乎从不会做的事情:{{/3}}它公布了消融实验、负面结果和训练配方实验,然后将每项发现与{{4}}该模型旨在预览的{{/4}}Qwen4系列架构联系起来。
8月26日实际发布了什么
就Qwen在2026年的标准而言,这个模型本身颇为克制,而这正是有意为之。Qwen3.8-Flash-Next存储了125B主模型参数,外加一块独立的51B n-gram嵌入表——不计4B多token预测模块,总共约176B——但每个token仅激活6B参数。它是一个512专家的混合专家模型,采用top-10路由和48层架构,原生支持262,144个token的上下文,并可通过YaRN扩展到1M。它接受文本、图像和视频输入,输出文本。权重以qwen-community-1.0许可证发布在Hugging Face和ModelScope上,而Alibaba自己的博客称其为“一个将支撑Qwen4的架构的实验性预览”——与Qwen3-Next对Qwen3.5系列所扮演的角色相同:一羽在旗舰之前飞出的金丝雀。
同一天,Alibaba启用了其商业对应版本:一个在QwenCloud API上提供的托管构建,名为Qwen3.8-Flash,输入每百万token收费0.16美元,输出每百万token收费0.47美元。这两者很容易混淆,值得分清。Qwen3.8-Flash-Next是技术报告剖析的开放权重预览版;Qwen3.8-Flash是生产级API构建,已定价,默认支持1M token上下文,并兼容OpenAI和Anthropic的请求格式。价格、基准测试和架构论证都源自同一套工程。

技术报告中的四项架构押注
这篇论文的主干是四个赌注,关乎一个长上下文、低成本的前沿模型应当是什么样子,每个赌注都附有实验支撑。
• 注意力机制——GDN + QSA 混合架构。每四层中有三层使用 Gated DeltaNet,这是一种线性注意力层,将历史信息压缩为固定大小的循环状态,而非随序列长度增长的 KV 缓存。剩余一层是 Qwen Sparse Attention,它将序列聚合为微块,以低成本为其评分,并且只对关键区域运行完整注意力。Alibaba 报告称,在 1M 上下文下,prefill 速度提升最高达 7.6×,decode 速度提升最高达 4.9×;SGLang 自己的 day-0 基准测试结果更高,分别为 10.2× 和 6.6×。在 90% 前缀缓存命中率下,prefill 吞吐量达到 Qwen3.7-Plus 的 8.6×。这些是供应商与合作伙伴报告的数据,并非经独立审计的结果。
• 残差流 —— 门控残差。单条残差路径被扩展为四个并行分支,采用逐元素动态门控,这是一种 Hyper-Connection 风格的多分支设计,带有 GatedNorm 风格的控制。门控调节每个分支的读取和写入,论文称这能抑制激活异常值,并且在实际中使残差状态能够以 FP8 存储。
• 嵌入(Embedding)——即 51B 的 n-gram 表。模型并非为每个 token 提供一个嵌入,而是以当前 token 及其前面的 token 为键查询查找表,从而存储完整短语和局部模式。这样每个 token 的代价几乎为零;由于查找地址事先已知,它可以驻留在主机内存中并通过异步预取加载,完全不占 GPU 内存。正是这一技巧让存储容量达 176B 的检查点得以在 75GB 级别的机器上运行,其思路可追溯至 Gemma 3n 的逐层嵌入和 DeepSeek 的 Engram。
• 优化 — Muon,已调优。训练使用 Muon 优化器,这是一种基于正交化的动量方法,应用于二维线性映射(注意力、GDN 和 MoE 专家权重),而 AdamW 则保留用于嵌入、路由器和低秩参数。论文还报告了一个值得一读的负面结果:批量大小预热被放弃了,因为事实证明它会多消耗 18.8% 的优化器步数,却没有带来任何改进。
仔细阅读基准表。
这里的每一个头条数字都是 Qwen 自己的,发布在模型卡和报告中,而且这些数字都没有被独立复现——这个模型才发布一天,还没有第三方对其进行审计。即使这样看待,它仍然令人瞩目,因为 Qwen3.8-Flash-Next 正在与 DeepSeek-V4-Flash-0731 一较高下,后者是一个更大且更成熟的模型,而前者仅用 6B 激活参数。
• DeepSWE 1.1 — 58.7 对比 54.4(供应商报告)
• SWE-bench Pro — 62.5 对比 56.0(供应商报告)。
• Toolathlon 已验证 — 73.5 vs 70.3(厂商报告)。
• LiveCodeBench v6 — 91.9 对比 90.6(供应商报告)。
• GPQA Diamond — 91.7 vs 90.8(供应商报告)。
• IFBench — 81.3 对比 79.2(厂商报告)。
然后,报告公开指出的差距是:NL2Repo-Bench 上 48.1 对 DeepSeek-V4-Flash-0731 的 54.2——在仓库级代码生成上确实存在明显不足,而这是智能体编码中较小模型唯一跟不上的维度。在 Agents' Last Exam 上则基本打平:24.3 对 25.2。在办公自动化方面,Qwen 报告 CoWorkBench 为 73.9——但那是内部基准,Alibaba 没有把它放进主图表。

在视觉方面,自我报告表格显示AndroidWorld为84.5,而Claude Opus 4.6 Max为62.0;RealWorldQA为88.5,对比73.9。Humanity's Last Exam是Qwen唯一一项完全输给Claude Opus 4.6 Max的头条指标——而且该分数的评判本身是由GPT-4o完成的,所以即便这个对比也不够干净。
价格:旗舰产品的十二分之一
{{1}}接下来是预算真正关心的数字。在QwenCloud上,托管的Qwen3.8-Flash版本定价为每百万输入token 0.16美元、每百万输出token 0.47美元。这大约是Ali{{2}}baba自家旗舰模型Qwen3.8-Max价格的十二分之一——后者每百万输入token收费2.00美元、每百万输出token收费6.00美元——而报告称,该模型的训练算力约为Qwen3.7-Plus的九分之一。中国模型厂商整个夏天都在下调flash级产品的价格,而此次发布正是Qw{{3}}en在这场攻势中的落子,它附带了架构上的理由,而不仅仅是一次降价。{{/3}}{{/2}}{{/1}}
对于任何在同类产品中进行比较的人来说,当每个提供商都显示相同的数字时,计算就更容易了。OrcaRouter 以提供商的标价、0% 加价路由 Qwen 系列的其他成员——Qwen3.8-Max、Qwen3.8-27B 和 Qwen3.8——因此,供应商降价的消息一经宣布,我们这边就会立即生效。Qwen3.8-Flash-Next 尚不在我们的目录中;一旦它进入我们路由的运行时,它就会像其他模型一样,无需第二份合同即可纳入同一个一键式标价设置。
如今你可以用它做什么
首日服务支持异常广泛。SGLang 提供了 cookbook 页面和专用镜像(lmsysorg/sglang:qwen38flashnext);vLLM 则有 vllm/vllm-openai:qwen38-flash-next;NVIDIA 对两者以及 TensorRT LLM 在 GB300 NVL72 机架上进行了验证,FP8 下每 GPU 每秒超过 16,000 个 token,NeMo 则覆盖了微调。在数据中心规模之下,该模型可运行于 DGX Spark 集群和 4×RTX PRO 6000 工作站上,此外,同日发布的社区量化系列——Unsloth 的 GGUF 以及可在 75GB 内存中运行、准确性约为完整版 80% 的 1-bit 构建——意味着这个存储大小为 176B 的检查点确实可以在小团队自有的硬件上运行。那些更愿意调用而非自行运行的团队,可以通过阿里巴巴自家的 QwenCloud 以及多个第三方平台使用 Qwen3.8-Flash API,不过大多数早期采用者首先拿到的还是开放权重。

那份列表背后的 VRAM 计算就是 n-gram 表,也是各 serving 栈下一步要收敛之处。技术报告把每层嵌入保留在 GPU 内存之外,它是一个纯查找结构——每生成一个 token,模型只从其 3.2 亿行中拉取约 16 行——这正是 offload 成本低廉的原因。vLLM 在架构支持的 pull request 仍未合并的情况下,从专用 dev 镜像提供 Qwen3.8-Flash-Next;这项工作的最新部分,是来自同一位 vLLM 作者的 draft PR(vllm-project/vllm#54371,尚未合并),新增了一条 PLE-Offload serving 路径,把表保存在主机内存中,并通过 CUDA 统一虚拟寻址读取,而不是预留 VRAM。在 FP8 下,该表约占 ~173GB checkpoint 里的 48GB,因此 offload 它,决定着你需要的是数据中心 GPU 还是单张 96GB 显卡——一块 RTX PRO 6000,或一个 DGX Spark 的统一内存池。现在还为时过早,请把它视为方向,而不是今天受支持的选项;但这是运行时在追赶技术报告早已声称的内容,也是如果你一直是被 VRAM 的数字所制约,值得关注的东西。
一个只存在一天、数据无法复现的预览版,正是教科书式的案例——不应该把生产路径押在它上面,而这正是故障转移的用武之地。如果运行时搭载了 Qwen3.8-Flash-Next,你将一个端点指向它,并配置自动故障转移到你已信任的模型,那么你既能在非关键流量上享受到新架构的优势,又能在它表现不佳时获得干净的降级方案——无需重新接线,因为这是路由规则,而不是代码变更。
这个预览透露了Qwen4的哪些信息
Alibaba以前就玩过这一套。Qwen3-Next在2025年底预览了Gated DeltaNet,文档寥寥无几,直到Qwen3.5系列大规模采用后,该架构才得到完整定义。如今这一模式正在重演:Qwen3.8-Flash-Next是金丝雀,这份报告则是以实验来书写规格。值得关注的具体要点在于:Qwen4旗舰是否会采用GDN与QSA三比一的拆分比例;n-gram嵌入能否在旗舰规模的生产服务中经受住考验;以及最关键的——独立评测能否证实6B-active相比更大模型的优势。如果效率论点成立,Qwen4旗舰可能会以远低于上一代的推理服务成本问世。
常见问题
Qwen3.8-Flash-Next 和 Qwen3.8-Flash — 是同一个模型吗?
不,两者的区别很重要。Qwen3.8-Flash-Next 是技术报告所分析的开放权重架构预览版;Qwen3.8-Flash 则是阿里巴巴在 QwenCloud 上提供的生产级 API 构建版本,定价为每百万 token 0.16/0.47 美元,默认上下文长度为 100 万。两者工程同源,但产物不同——一个用于自托管和检视,另一个是收费的托管服务。
如今生产工作负载应该迁移到它吗?
不是没有第二意见就不能作数。每项基准测试都是厂商自报且未经复现的;这个架构足够新,服务栈仍在趋同之中——vLLM 自身的支持还在通过开放的拉取请求陆续落地——而且唯一一个智能体编码缺口(NL2Repo)恰恰落在生产环境程序员会遇到的这类任务上。开放权重让你可以低成本地自行评估,而 SGLang 和 vLLM 的 day-0 支持也让本周就能启动试点成为可能——但以故障转移为后盾的试点才是诚实的起步方式,而不是直接切换。
Qwen4 实际什么时候发布?
Alibaba 尚未表态。本次发布中唯一的时间信号是历史性的:上一次金丝雀版本 Qwen3-Next 大约在其架构被 Qwen3.5 系列采用的一个季度前发布。按照这个节奏,Qwen4 的旗舰型号比看起来更近——但该报告明确是关于架构的,而非路线图。
底线
Qwen3.8-Flash-Next 是少有的将论文作为产品本身的发布。就模型本身而言,诚实的成绩单如下:6B 激活参数在大多数共享基准测试中媲美远大于它的模型,在仓库级代码上存在一个已指出的差距,服务价格仅为旗舰版的十二分之一,还有一个架构——这是 Qwen 对前沿模型如何变便宜的答案。技术报告说明了 Qwen3.8-Flash-Next 的用途——而它不是模型本身。它是将成为 Qwen4 的架构的证据,值得在 Qwen4 发布之前阅读,因为它所改变的决策,正是你在 Qwen4 到来时将要做出的那个。
