
认识一下 Qwen3.8-Flash:一款开放权重的多模态 MoE 模型,预览了 Qwen4 架构——在 QwenCloud 上每百万 token 仅需 $0.15/$0.47
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
2026年8月26日,Qwen团队开源了Qwen3.8-Flash背后的权重——以Qwen3.8-Flash-Next的名称发布在Hugging Face和ModelScope上——并在QwenCloud API上推出了以Qwen3.8-Flash命名的生产模型,次日确认了其官方定价。最受关注的数据——8月28日阿里巴巴官方公告中正式确认——是一个1250亿参数的多模态混合专家(MoE)模型,每个token仅激活约60亿参数,稀疏度约为95%,其架构被阿里巴巴明确描述为Qwen4世代的早期预览。该生产API已在QwenCloud上线,输入token每百万0.15美元,输出token每百万0.47美元,缓存命中每百万0.016美元——这是运行与阿里巴巴下一代旗舰模型在结构上一脉相承的产品的最便宜方式,也是该实验室首次在完整模型系列尚未问世之前,就以公开开源权重的形式发布架构预览。
规格表中有一个数字比其他所有内容都更有分量:6B。Qwen3.8-Flash 的能力并不来自粗暴的规模堆砌——而来自它对算力部署的取舍。一个 125B 的 MoE 主体、一个 51B 的 N-gram 嵌入表,加上一个小型多 token 预测模块,在磁盘上存放着近 180B 的参数,但每个 token 实际只路由经过其中 6B 个参数。这就是整个版本所押注的关键,也是训练成本能降到如此之低的原因。
实际发布的内容
Qwen3.8-Flash(不带后缀)是现已上线QwenCloud API及阿里巴巴Qwen Office产品中的生产化模型;它默认提供100万token的上下文长度和内置工具,定价为每百万token $0.15/$0.47,缓存命中价格为$0.016。8月28日,可用范围进一步扩大:根据阿里巴巴的公告,Qwen3.8-Flash现在也可以通过OpenCode Go(开源终端编码代理的固定费率订阅服务)使用——OpenCode自己的模型列表将其列为qwen3.8-flash,价格同样是每百万token $0.15/$0.47。

Qwen Studio官方公告将开源权重发布定位为对生态系统的邀约:尽早交付结构性变更,以便社区和推理栈在完整的Qwen4系列构建完成之前完成适配。这一策略奏效的首个迹象是,由LMSYS支持的推理引擎SGLang在发布当天即为Qwen3.8-Flash-Next提供了首发支持,同时该模型也已完成了对Transformers、vLLM和TokenSpeed的适配。
建筑即故事
这不是一个缩小版的 Qwen 3.8 代模型。Qwen3.8-Flash 引入了四项改动,团队表示 Qwen4 系列将继承这些改动,每一项都针对不同的瓶颈。
• {{1}}注意力——门控DeltaNet加Qwen稀疏注意力{{/1}}。门控DeltaNet(GDN)在每四层中的三层将历史压缩为固定大小的状态,因此模型无需在每一步重新读取全部内容;QSA则将长上下文视为搜索问题——轻量级索引器将序列聚合为微块,评估块级重要性,并将注意力导向最相关的区域。根据阿里巴巴的测量,QSA注意力内核在100万token上下文下可实现最高7.6倍的预填充加速和4.9倍的解码加速({{2}}供应商报告{{/2}})。
• {{1}}残差{{/1}} — {{2}}门控残差{{/2}}。单一残差流变为四个并行分支,并采用逐元素门控,让网络能够针对每个 token 决定在各分支上读写多少信息;其中一个分支稳定成为连接早期注意力层与深层网络的长距离通道。残差状态以 FP8 格式存储,以降低内存带宽消耗。
• 嵌入 — N-gram 嵌入。一个 51B 参数的查找表,以当前词元及其前面几个词元为键。它增加了容量而不增加每个词元的计算量,并且由于查找表可以存放在主机内存中并异步预取,因此不会永久占用 GPU 内存。
• 优化器 — Muon。{{1}}大型二维线性参数(注意力、GDN、MoE 专家)使用 Muon 训练{{/1}},{{2}}而嵌入、路由器和门控残差低秩部分则继续使用 AdamW{{/2}};{{3}}团队针对新架构重新拟合了缩放定律{{/3}},{{4}}以适配这一混合方案{{/4}}。

{{1}}对于开发者而言,其中两项会立刻产生影响:注意力栈使得100万token的上下文可以成为默认配置,而非挑战性目标,{{/1}}{{2}}而N-gram表则使得125B模型仍然能够轻量部署。{{/2}}{{3}}其余内容为{{/3}} {{KEEP}}Qwen4{{/KEEP}} {{4}}的预告——这正是阿里巴巴对它的定位。{{/4}}
如实标注的基准表
本节中的每一个数字都是阿里巴巴自己的评估,截至撰写本文时这些数据仅有一天的历史,且尚未被任何独立实验室复现。请把它们视为方向性说法,而非最终定论。在阿里巴巴的测试套件中,Qwen3.8-Flash-Next(6B 激活参数)在 SWE-bench Pro 上取得 62.5 分,DeepSWE 1.1 上 58.7 分,CoWorkBench 上 73.9 分,AndroidWorld 上 84.5 分,MathVision 上 95.7 分,JobBench 得分为 55.7 分——而其基础版本 Qwen3.8-Flash-Next-Base 在 14 项基准测试的正面对比中,据称在包括 MMLU-Pro、SuperGPQA、BBH 和 MMMU 在内的 8 项上是最佳开源模型。
阿里巴巴关于模型家族定位的宣称,就应该被标注为它们本来的性质——宣称。该公司称,Qwen3.8-Flash 在 SWE-bench Pro 上比 Claude Opus 4.6 高 9.1 分,在 JobBench 上高出约 20 分,并且已经逼近 Claude Opus 4.8 的水平。这些全部是厂商自报,均未经复现。目前可独立核查的内容较为有限:权重已放出,推理栈已经能运行这些模型,SGLang 也在同一天就发布了支持。对这份基准测试表的独立复现,几天内就能完成,而不是几周。
费用是多少
定价是最容易验证的部分,因为它是公布出来的价格,而非基准——8月27日,阿里巴巴正式确认了QwenCloud的生产计费标准:每百万输入token收费0.15美元,每百万输出token收费0.47美元,缓存命中每百万收费0.016美元;国内价格则为0.8元/2.7元/0.1元。对智能体工作负载而言,缓存命中这个数字才是关键:长上下文智能体每一轮都要重新读取大量历史记录,而重复读取只需花费几分钱——这正是Qwen4-preview注意力栈瞄准的工作负载。国内媒体随即把这一标价与同类产品对比——大约只有DeepSeek-V4-Flash收费的三分之一,与前沿闭源模型相比更是小到可以忽略不计。按照阿里巴巴自己的核算,本轮训练运行的成本约为Qwen3.7-Plus的九分之一,正是这种结构性杠杆让API价格得以定在目前的位置。
与 Qwen 3.8 系列的其他模型相比,差距一目了然:旗舰型号 Qwen3.8-Max 按每百万 token $2.00 / $6.00 计费,并且已经以提供商标价、零加价上线 OrcaRouter。如今生产版 Qwen3.8-Flash API 正式开放,同样的直通价格也适用于官方 $0.15/$0.47 费率和 $0.016 缓存命中费率——有了路由层,你就不只是在新闻里读到降价,而是能把它写进配置。两个模型共用一个 key,支持互相故障转移,无需第二份合同。
「Qwen4的预览」是什么意思?
从字面上解读这则公告,利害关系就很清楚了:这不是Qwen 3.8的一个新层级——而是Qwen4的架构在更小、更便宜型号的品牌保护下提前发布。这样做的理由很充分:框架、量化和部署模式都需要时间成熟,而一个6B激活的模型,是社区在阿里巴巴基于其构建昂贵产品之前,大规模压力测试GDN + QSA的廉价方式。另一面在于,生产环境的Qwen3.8-Flash是一个API,所基于的架构更广泛的生态系统仍在审计中。早期采用者,本质上就是测试集。
尝试它的快捷路径
如今你有四种现实可行的选择。通过 vLLM、SGLang、Transformers 或 TokenSpeed 自托管开放权重——在低于完整节点配置的任何设备上,FP8 版本都是明智的第一选择。调用 QwenCloud API,现已按官方 $0.15/$0.47 费率上线,缓存命中价为 $0.016。在 OpenCode Go 中使用它——这是开源终端编程代理的固定费率订阅,本周新增了 Qwen3.8-Flash(阿里巴巴于 8 月 28 日发布,并在 OpenCode 自己的模型列表中得到确认)。或者通过路由器调用生产版 Flash,方式与你调用 Qwen3.8-Max 相同,官方费率零加价直通——无需维护任何定制集成。

悬而未决的问题才是诚实的问题:一个激活其60亿参数的模型,能否在广泛的工作负载下经受住生产环境的考验?还是说,那张今天看起来还崭新的基准测试表,一个月后仍会保持原样?这并非观望的理由——而是应将其置于故障转移之后、而非整个技术栈之前的理由。权重已发布,价格已确定,架构是阿里明确宣布的方向。接下来几周将决定60亿参数是否已然足够。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
