“Ling-3.1-flash vs GLM-5.3-Flash”的主标题卡,副标题为“四倍吞吐量,对一点指数之差”。两张圆角卡片并排摆放,中间留有明显间距:左侧标注为“Ling-3.1-flash”,内容为“速度:211 tok/s”、“AA 指数:41”、“许可证:未公开”;右侧标注为“GLM-5.3-Flash”,内容为“速度:53 tok/s”、“AA 指数:42”、“许可证:MIT”。页脚一行写着“吞吐量来自各厂商自己的 API;指数依据 Artificial Analysis。”OrcaRouter 标志合成在右下角。
Guides & Insights

Ling-3.1-flash 对比 GLM-5.3-Flash:四倍吞吐量换取指数上的一分之差

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash 和 GLM-5.3-Flash在 Artificial Analysis 智能指数上仅相差一分——41 对 42——这让它们看起来像是同一个决定做了两遍。事实并非如此。GLM-5.3-Flash 在 Z.ai 自家 API 上的输出速度为每秒 53.0 个 token;Ling-3.1-flash 在 InclusionAI 的 API 上则为每秒 211.0 个 token。这是四倍的吞吐量差距,远比该指数在它们之间拉开的任何差距都要大。其中一个模型在几乎所有质量维度上都是两者中更强的那个,并且以 MIT 许可证开源。另一个则是率先完成输出的那个,是闭源的,并且没有公布价格、许可证或检查点。在两者之间做选择,取决于你的工作负载在等待什么。

Axis Ling-3.1-flash 大获全胜

在能力水平相同的模型之间做选择时,速度绝不是可有可无的注脚;而在这里,它正是 Ant 模型全部的理由所在。

• 输出吞吐量 — Ling-3.1-flash 在 InclusionAI 的 API 上达到每秒 211.0 个 token,而 GLM-5.3-Flash 在 Z.ai 上为每秒 53.0 个 token。生成速率是后者的四倍。

• 首 token 时间——Ling-3.1-flash 为 1.80 秒,GLM-5.3-Flash 为 3.18 秒。Z.ai 模型还在思考时,Ant 模型已经开始作答,在交互式和流式使用场景中,这比吞吐量更重要。

• Intelligence Index 任务耗时——Ling-3.1-flash 约 357 秒,而 GLM-5.3-Flash 约 979 秒。GLM-5.3-Flash 完成单次评估任务的端到端耗时接近前者的三倍,因为它的每 token 速度更慢,启动也更慢。

对于一个要发起十几次串行调用的智能体循环,或者一个有人盯着 token 陆续到达的产品来说,这不是什么打破平局的附加因素——而是偏好某个模型的全部理由。GLM-5.3-Flash 在纸面上是更好的模型,在请求路径中却是更慢的那个。

GLM-5.3-Flash 更胜一筹的地方

在其他所有地方,这份清单都已经长得足以让吞吐量优势必须证明自己配得上占有一席之地。

• 知识可靠性——GLM-5.3-Flash 在 AA-Omniscience 上得分 +7.47,是三款 Flash 层级模型中最好的,在已回答问题上幻觉率为 27.6%。Ling-3.1-flash 得分为 +2.22,幻觉率为 37.9%。在一个对编造比对拒答惩罚更重的指标上,这一差距是真实存在的,并且指向与该指数相同的方向。

• 科学知识——GLM-5.3-Flash 在 GPQA Diamond 上得分 0.912。Ling-3.1-flash 没有公布 GPQA Diamond 一行的成绩。DeepSeek V4.1 Flash(Max)也是如此。一个在研究生水平的科学问题上拿到 0.91 的模型,与一个尚未在这些问题上被测量的模型,是完全不同的工具。

• 模态 — GLM-5.3-Flash 支持文本、图像和视频。Ling-3.1-flash 仅支持文本。这不是靠某项基准测试就能弥合的性能差距,而是一项根本不具备的能力。

• 权重与许可——GLM-5.3-Flash 以 MIT 协议开放权重,可下载并自行托管。Ling-3.1-flash 未发布任何检查点,也没有许可文本,并被归类为专有。

• 智能体式知识工作 — 在 AA-Briefcase v1.1 上,GLM-5.3-Flash 取得 1,453.73 Elo,超过 Ling-3.1-flash 的 1,400.35,而该基准正是专门围绕知识工作任务而非终端操控构建的。

• 价格 — GLM-5.3-Flash 在 Z.ai 的 API 上公布的价格为每百万输入 $0.15、每百万输出 $0.50,而 Ling-3.1-flash 则为 $0.30 和 $0.90。输入费率只有其一半,输出费率也约为其一半,而这款模型不仅指数得分更高,还开放权重。

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Ant 模型作出回应的那些行

Ling-3.1-flash 并非在所有方面都落于下风。在智能体终端任务上它略微领先,在编程科学上则持平:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 对 GLM-5.3-Flash 0.328。实际上打成平手,且两者都低于前沿梯队。

• SciCode — Ling-3.1-flash 0.541 对比 GLM-5.3-Flash 0.516。以微弱优势获胜。

• AutomationBench-AA — 0.617 对 0.604。又一次微弱取胜。

• GDPval-AA — Ling-3.1-flash 1,621.75 Elo 对 GLM-5.3-Flash 1,646.86。GLM 扳回一局。

把四行放在一起读,格局就很清楚了。两个模型但凡能分出高下,差距也落在单次评估运行的噪声范围之内。它们之间一个点的指数差异并不是排名,而是一次抛硬币,只是可靠性那几行让天平略微偏向 GLM。真正不是抛硬币的,是 4 倍的吞吐量差距和 2 倍的价格差距,而这两项都指向相反的方向。

还有一个值得指出的服务层面细节,因为它会改变那个吞吐量差距的大小,具体取决于你从哪里调用模型。Z.ai 自家 API 的实测值为每秒 53.0 个 token。我们自己的目录中,GLM-5.3-Flash 在我们线路上的七天实测结果显示,输出速度为每秒 150.6 个 token,首 token 延迟中位数为 4.2 秒。同样的权重,由不同的部署提供服务时,运行速度接近三倍。厂商的吞吐量数字是提供方的属性,而不是模型的属性。

规范,逐行

每行以主语开头:

• 规模 —— Ling-3.1-flash 总参数 560B / 激活 25B,对比 GLM-5.3-Flash 总参数 320B / 激活 18B。

• 声明的上下文——两者均为 1M token。GLM-5.3-Flash 的长上下文推理项在 AA-LCR 上测得 0.80;Ling-3.1-flash 的则为 0.83。两者都接近 DeepSeek V4.1 Flash (Max) 的 0.84,也就是说,在这一层级,长上下文推理已不再是差异化因素。

• 输出上限 — 在我们的产品目录中,GLM-5.3-Flash 为 128,000 tokens,而 Ling-3.1-flash 没有公布上限。这两者之中,一个可以为长文本生成进行规模规划,另一个则不能。

• 索引 — 41 对 42。

• 吞吐量 — 每秒 211.0 个词元,供应商 API 为 53.0,我们的路由实测为 150.6。

• 权重 — 无许可证的专有 vs 以 MIT 许可开源。

• 模态——仅文本 vs 文本、图像和视频输入。

• 价格 — 每百万输入/输出 $0.30 / $0.90,而 Z.ai 的 API 为 $0.15 / $0.50。

如何实际运行这个比较

GLM-5.3-Flash 现已上架 OrcaRouter 目录,标价为每百万输入 $0.075、每百万输出 $0.25、每百万缓存读取 $0.0173——请查看实时卡片,而不是这段文字,因为服务费率会变动,而直通安排意味着供应商的价格变化会在当天反映到我们这边。对于这一特定对比,该安排的价值在于:GLM-5.3-Flash 的开放性和价格优势,是让它成为明智默认选项的两个因素;而一条封闭的 0% 加价路由,正是你在不新增供应商关系的情况下,持续用 Ling-3.1-flash 与它对比测试的方式。

Ling-3.1-flash 并不在我们的目录中——用我们的公开模型 API 查询,InclusionAI 旗下的该模型会返回未找到,本文也不会暗示我们提供该模型。它通过蚂蚁自有的 API 以及承载该发布的第三方平台运行,这才是其可用范围的如实情况。

这种比较的有效形态不是二选一。GLM-5.3-Flash 是开源的、最便宜的、多模态的,在知识类问题上更可靠,并可通过 23 家提供商获取——这是一条默认路径。Ling-3.1-flash 的优势在于智能体循环中的吞吐量和 TTFT,而代价是它是闭源的、纯文本的、更贵,且可接入的入口更少。将交互式和延迟敏感的工作交给快模型,把批处理、知识密集型和多模态工作留给开源模型,并在两者之间设置回退,这样缓慢的上游就不会变成缓慢的产品。

该选哪一个

如果您的评估标准是能力、成本、开放性和模态,那么 GLM-5.3-Flash 会在这场较量中胜出,而且差距并不小——更高的指数得分、该层级中最佳的知识可靠性表现、0.912 的 GPQA Diamond、MIT 权重、视频输入、一半的价格,以及背后 23 家提供商的支持。如果您的标准还包括用户等待的时间长短,或一个任务能发起多少次串行调用,那么 Ling-3.1-flash 才是能跑完任务的模型,其四倍的生成速率在智能体循环中绝非可以忽略的舍入误差。

真正能一锤定音的,是两家厂商都没有以可比较的形式公布的一个服务细节:经由你的服务商、在你的工作负载上实际交付的吞吐量。两个模型应答的都是同一套与 OpenAI 兼容的 chat-completions 格式,这意味着在它们之间切换只是改一项配置,而非一次迁移——而对于两个索引得分仅差一分、速度却相差四倍的模型来说,用自己的流量把这一个数字测出来,比再读一行基准测试成绩更值得花上一个下午。

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新