生成了标题为"Ling-3.1-flash vs Qwen3.8-Flash"的编辑型主视觉卡片,副标题为"同一个问题的两种答案:如何打造一个快速档位?"左侧面板标题为"扩大规模,对外宣布",配有说明文字"总计约 560B · 活跃约 25B · 100 万上下文",以及一个标签"权重:即将推出"。右侧面板标题为"缩小体量,直接交付",配有"总计 125B · 活跃 6B · 预览 Qwen4",以及一个标签"权重:已在 Hugging Face 上"。
Engineering & Research

Ling-3.1-flash 对比 Qwen3.8-Flash:构建快速层的两种方式,而只有一种真正落地

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

今年秋天,两家中国实验室研究了同一个问题——如何打造一个足够廉价、足够快、又足以置身于智能体循环之中的模型——却得出了截然相反的答案。蚂蚁集团于 2026 年 9 月 30 日发布的 Ling-3.1-flash,是一个约 5600 亿参数的混合专家模型,每个 token 激活约 250 亿参数,标称上下文窗口最高可达 100 万 token,并明确表示打算“很快”开源。阿里巴巴 Qwen 团队于 2026 年 8 月 26 日发布的 Qwen3.8-Flash,是一个 1250 亿参数的多模态混合专家模型,每个 token 激活约 60 亿参数;其权重已以 Qwen3.8-Flash-Next 之名登陆 Hugging Face,该生产模型已在 QwenCloud API 上线,每百万输入 token 收费 0.15 美元、每百万输出 token 收费 0.47 美元,并在 SGLang 中获得首日支持。一家实验室选择做大并对外公布,另一家则选择做小并交付落地。这一差异比两家实验室所发布的任何基准测试都更具启发意义。

这也是必须仔细阅读这一比较的原因。Ling-3.1-flash 没有权重、没有许可证、没有模型卡、没有 API 定价,也没有独立评测;已公开的全部记录只有一篇发布公告、一张厂商基准图表,以及在 Ant 自家 Ling Studio 产品中的一个位置。Qwen3.8-Flash 则一应俱全,并且早四周就被不在阿里巴巴工作的人实际运行过。比较架构选择是公平的;比较能力则还谈不上公平。

这两个设计决策,以及它们为何会产生分歧

Qwen 的赌注是:快速层在结构上就应当与旗舰模型不同,而不只是比它更小。Qwen3.8-Flash 在 1250 亿参数中激活 60 亿——稀疏度约为 95%——其能力来自算力被路由到何处,而非来自原始的规模广度。阿里巴巴已明确表示,其底层架构将 Gated DeltaNet 与 Qwen Sparse Attention 以及一张 N-gram 嵌入表配对,是 Qwen4 代的早期预览,并有意提前发布,以便推理引擎、量化工具链和部署模式能在昂贵的模型建立其上之前围绕它成熟起来。结果就是一个按构造即每 token 成本低廉的模型:每个 token 约 60 亿参数的计算量,而阿里巴巴定的价格为每百万 token 输入 0.15 美元、输出 0.47 美元。

就公告所披露的信息来看,蚂蚁的押注更接近传统意义上的扩展,只是搭配了非常长的上下文。Ling-3.1-flash 保持了很大的活跃比例——每 token 约从 5600 亿参数中激活 250 亿,也就是大约二十二分之一——并宣称窗口最高可达 100 万 token,是上一代 Ling 所提供窗口的四倍。Ling Studio 应用将其描述为专为“通用智能体、搜索、日常办公以及软件/代码开发”而构建,这属于快速档位的定位,但其参数经济性却属于远为重型的模型。在相同输入下,一个 token 经过 250 亿活跃参数所产生的算力消耗,大约是通过 60 亿活跃参数时的四倍,而这还没有把任何定价决策考虑在内。

两种方法都没有错,两者都是对“什么限制了一个低成本模型”的合理回答。Qwen 押注的是稀疏性和新的注意力堆栈就是上限。Ant 押注的是上限在于上下文和世界知识,而且它承担得起算力。对读者而言,区分二者的不是设计哲学,而是交付方式:一个你可以下载并测量的设计,对比一个你只能读到文字描述的设计。

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

每一项会让你付出什么代价,以及这在实践中意味着什么

这个价格差距并不微妙,也谈不上接近。Qwen3.8-Flash 公布的价格是每百万输入 token 0.15 美元、每百万输出 0.47 美元,缓存读取则是每百万 0.018 美元——阿里巴巴的公告、厂商的生产环境模型卡,以及我们对外提供的路由模型页面上都是同样的数字,这正是零加价直通在对照三个来源核验时所呈现的样子。而 Ant 根本没有公布 Ling-3.1-flash 的任何费率——没有 API 价格,没有缓存折扣,没有任何可比的数字。Ling 系列唯一公布过的数字来自上一代产品,标价为每百万输入 0.075 美元、输出 0.22 美元,大致是 Qwen 输入费率的一半,不到其输出费率的一半。如果新的 Ling 档位定价接近旧款的位置,那么纸面上它会比 Qwen3.8-Flash 更便宜;如果它的定价接近其 25B 激活参数所意味着的算力成本,那就不会。无论哪种说法都只是猜测,因为这个数字根本不存在。

上下文才是 Ling 真正占优的地方。Ant 为 Ling-3.1-flash 标称最高 100 万 token;Qwen3.8-Flash 在生产 API 上默认提供 1M token 上下文,开放权重版本则具有 262,144 token 的原生窗口,且可扩展。围绕 Ling 这一数字有两点保留意见,且都没有得到解决。首先,“最高 1M”是规格,而非实测——对于一款 Ant 之外无人能调用的模型,还没有人公布其长上下文检索表现。其次,上一代 Ling 在宣称窗口与其背后的架构说法之间也存在完全相同的落差,而答案只有在权重、格式和上下文限制最终公布后才揭晓。那个作为宣传亮点的 1M 是一个承诺。而 Qwen3.8-Flash 上的 1M 是实际提供服务的默认值,你可以拿 Ant 的说法与之对照。

为什么“预览”是这件事某一面最诚实的说法

阿里巴巴自己对 Qwen3.8-Flash 的定位是:这是一款以生产级名称发布的架构预览版——开放权重之所以带上“Next”后缀,正是为了不让任何人把原型与经过调优的 serving 模型混为一谈。这一说法并非靠营销得到验证,而是被后续事件所印证:SGLang 在发布当天就为 Qwen3.8-Flash-Next 提供了 day-0 支持,该模型也完成了面向 Transformers、vLLM 和 TokenSpeed 的配置,此后其权重又被各个量化社区陆续采用。版本号很快变得稀松平常,而这才是一款已发布模型应有的样子。

Ant 的公告在更早一步就呈现出相同的形态:在发布前先放出规格说明,并明确表示该模型即将开源。这是一种正当的发布方式——Ling-3.0-flash 在 7 月正是走的这条路线,权重于 8 月 7 日以 MIT 许可落地,大约两周之后。但这两个项目如今的状况并不可比,再怎么解读图表也无法弥合差距。值得具体说明的是,外部人士能为两者分别带来什么。

对于 Ling-3.1-flash,今天可独立核查的是:公告确实存在,日期为 9 月 30 日;参数量、活跃参数量和上下文长度这些数字是 Ant 自己的;该模型出现在 Ant 的 Ling Studio 产品中;以及没有发布任何权重、许可证或模型卡。对于 Qwen3.8-Flash,可独立核查的是:权重可以 BF16 和 FP8 格式下载;许可条款可读;API 价格已公布;以及自 8 月下旬以来,Alibaba 的基准测试声明一直可供复现。第二个列表更长,而这就是整个比较的缩影。

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

这两者实际上会如何被评估

Ant 发布了一张基准测试卡,用 Ling-3.1-flash 与 GPT-5.6 Sol、Claude Opus 5、Kimi K3、两个 GLM 变体以及 DeepSeek-V4.1-Flash 进行对比,主要数字为 GDPVal-AA v2.1 上 1,673 Elo、FrontierSWE 上 75.16、HealthBench Professional 上 65.35。在任何人就这些数字展开争论之前,这张卡上就有两个问题。第一个是对比集:Ant 选的两款前沿模型都落后一代,因为 Claude Opus 5.5 和 GPT-6 Sol 已于 2026 年 9 月 22 日上线,现在已可路由,这意味着这张卡是用一个 10 月模型去对标 7 月的前沿模型,而不是当前的前沿模型。第二个是这张卡本身的一处脚注,称 HealthBench Professional 的结果来自“AQ 环境”,并且该模型的医疗保健能力目前只能在 AQ 中体验——而这一环境没有任何公开文档对其进行定义。一个未说明评估环境的头条分数,即便在原则上也不可复现。

相比之下,Qwen3.8-Flash 的那些类似宣称,是在权重已经发布之后才提出的,而阿里巴巴把自己的定位押注在一个任何人都能验证的说法上:能力来自稀疏比率,而非参数数量。四周的使用并不足以盖棺定论,但已足够长,让这些说法不再无人质疑——而这正是一个模型有用的状态。

今天到底该拿这个做什么

对构建者来说,实际的分野很简单。Ling-3.1-flash 并不是你本周就能采用的组件:没有可调用的端点,没有可托管的权重,没有可检查的许可证,也没有可供预算对照的价格。无论最终模型是什么样子,现在有用的做法是设置一个触发条件——权重发布、许可证宽松、在 FrontierSWE 上有一个接近 75.16 的独立得分——然后再回来评估。上一代自身的历史表明,权重可能在公告发布两周后就到来,因此这个触发条件可能会很快被触发。

Qwen3.8-Flash 已经是一个组件。它已作为路由模型上线我们的目录,按供应商标价、零加价——路由卡片上标注的是输入 $0.15、输出 $0.47,缓存读取每百万 $0.018,与阿里巴巴公布的数字一致,这才是 0% 加价政策在实践中的含义,而不是幻灯片上的说辞。只需一个密钥它便与 Claude Opus 5、GPT-5.6 Sol 和 DeepSeek-V4.1-Flash 并列,因此 Ant 所邀请的那场比较——让候选者对上当下前沿——只需把配置指向两个路由即可运行,而无需维护两套集成,自动故障转移还能应对供应商出状况的那个周末。这正是架构讨论与实验之间的区别。

结论,就目前所能给出的而言:Qwen 做出了更大胆的架构赌注,并有信心尽早发布,任人剖析。Ant 下了更重的赌注——更多参数、每个 token 更多活跃计算量、更长上下文——而到目前为止,只发布了一张图表,而不是一个模型。图表看起来不错。图表也是大家唯一拥有的东西。

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新