“Ling-3.1-flash vs DeepSeek V4.1 Flash”主视觉标题卡,副标题为“指数高两点,账单翻三倍”。两张圆角卡片并排摆放,中间留有明显间隙:左侧标注“Ling-3.1-flash”,内容为“AA 指数:41”“单任务成本:$0.99”“权重:闭源”;右侧标注“DeepSeek V4.1 Flash(Max)”,内容为“AA 指数:39”“单任务成本:$0.27”“权重:MIT”。页脚一行文字为“成本与指数数据均来自 Artificial Analysis。”右下角合成有 OrcaRouter 标志。
Guides & Insights

Ling-3.1-flash 对比 DeepSeek V4.1 Flash:指数差两分,账单贵三倍

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash 与 DeepSeek V4.1 Flash(Max)在 Artificial Analysis Intelligence Index 上相差两分——41 对 39——但在价格上却完全不在一个量级。用构成该指数的十项评估分别测试每个模型,Ling-3.1-flash 每项任务成本约为 0.99 美元,而 DeepSeek 为 0.27 美元。两者都是约 5500 亿参数的混合专家模型,均声称支持 100 万 token 上下文。一个是来自蚂蚁集团 InclusionAI 实验室的闭源纯文本模型,于 2026-10-01 发布,至今未公布权重或许可证。另一个自 2026-09-10 起以 MIT 许可证开源,支持图像和文本,可在 23 家提供商上运行,是大多数团队早已放进配置文件里的模型。在大多数维度上,二者差距悬殊。有趣的问题是,这两分的差距究竟为何存在。

Ling-3.1-flash 真正领先之处

在衡量驱动终端和编写必须能运行的代码的评估中,它处于领先,而这个差距值得被精确说明,因为总体数据掩盖了它。

• Terminal-Bench 4.0 —— Ling-3.1-flash 0.333 对 DeepSeek V4.1 Flash(Max)0.268。就绝对值而言,两者都是不算高的数字;但这一差距已达到 DeepSeek 得分的四分之一。

• SciCode — 0.541 对比 0.519。

• CritPt 物理推理 — 0.180 对比 0.143。

• GDPval-AA 智能体真实世界工作 — 1,621.75 Elo 对 1,600 Elo。

这四者中有两项几乎打平,一项是小幅胜出,而 Terminal-Bench 4.0 是唯一一行差异在更换随机种子后仍能保持的。与之相对的是 DeepSeek 胜出的地方:AA-Briefcase v1.1 智能体知识工作以 1,420.47 Elo 对 1,400.35,AutomationBench-AA 以 0.689 对 0.617,AA-LCR 长上下文推理以 0.84 对 0.83,以及——对生产而言最重要的一行——AA-Omniscience 以 −5.30 对 Ling-3.1-flash 的 +2.22,而在这项指标上,幻觉比拒答更糟。DeepSeek 在那里的准确率为 46.4%,在其回答的问题中幻觉率为 96.5%;Ling-3.1-flash 的正确回答率为 29.1%,幻觉率为 37.9%。两者都不是那种不前置检索就能直接指向知识库的模型。

价格差距大于指数差距,而这不仅仅是费率卡。

标称价格看起来几乎相同。Artificial Analysis 记录的两者均为每百万输入 token 0.30 美元。但在另外两个数字上,二者却出现了明显分化:

• 输出 — Ling-3.1-flash 每百万 $0.90,对比 DeepSeek V4.1 Flash (Max) 每百万 $1.20。这里 Ling-3.1-flash 直接就是更便宜的模型,便宜 25%。

• 缓存读取——Ling-3.1-flash 每百万 $0.06,而 DeepSeek V4.1 Flash (Max) 每百万 $0.006,98% 的折扣对比 80% 的折扣。正是在这一点上,这两个模型不再具有可比性。

在 7:2:1 的缓存命中/输入/输出混合比例下,Ling-3.1-flash 的混合费率为 $0.192,DeepSeek V4.1 Flash (Max) 为 $0.184——几乎不相上下。但这种混合比例是对你如何使用模型的一种假设,而这个假设在其中起了很大作用。任何提示词复用率很高的工作负载——很长的系统提示词、检索前导文、每一轮都重新发送累积上下文的智能体循环——都会把实际有效的混合比例推向缓存读取,而在那里,缓存定价 10 倍的差异就会占主导。Token 量也会以同样的方式产生叠加效应:Ling-3.1-flash 是个话多的推理模型,在各项索引评估中生成 2.2 亿个输出 token,而 DeepSeek 为 2.5 亿个,并且每个评估任务平均耗时约 357 秒,而 DeepSeek 为 285 秒。它每给出一个答案都要做更多思考,并因此花更长时间。

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

一个实操示例:在两者上使用相同的智能体循环

假设一个工具驱动的智能体,每个任务消耗 100 万输入 token,其中 90% 由缓存提供,并返回 20 万个输出 token。按照上述数据,在 Ling-3.1-flash 上:90 万个缓存输入 token 按每百万 $0.06 计,加上 10 万个全新输入按 $0.30 计,再加上 20 万个输出按 $0.90 计,每个任务约为 $0.26。同样的循环在 DeepSeek V4.1 Flash (Max) 上约为 $0.14——大致是前者的一半。

现在套用 DeepSeek 的时段安排,因为这是大多数对比都会跳过的一环。DeepSeek 的非高峰费率就是上面那个,非高峰覆盖周末以及一天中的大部分时间;但在两个工作日窗口,即 UTC 01:00–04:00 和 06:00–10:00,输入和缓存定价会翻倍。把同一个循环挪进高峰窗口,DeepSeek 的成本会落到接近 $0.28——这时 Ling-3.1-flash 那个统一且更高的费率卡在这一小时里反而成了更便宜的选择,而 10× 缓存折扣已经被时钟抵消了。

整个决策就浓缩在这一组数字里。如果你的 agent 流量缓存占比很高,而且你能安排调度时间,那么 DeepSeek V4.1(Max)的成本大约只有 Ling-3.1-flash 的一半,换来的只是两个点的指数差距。如果你的流量缓存占比很高,且恰好落在 DeepSeek 的高峰时段,那么两个模型的成本大致相当,此时 Ling-3.1-flash 在终端 agent 那一行略胜一筹,就成了打破平局的决定性因素。

无需进行比较的轴

有三个维度相差甚远,而它们往往在讨论价格之前就已决定架构走向。

• 权重与许可 — Ling-3.1-flash 未公开权重,没有许可文本,Artificial Analysis 将其归类为专有模型。DeepSeek V4.1 Flash (Max) 则以 MIT 协议开放权重,可从 Hugging Face 下载,且允许商业使用。前者无法自行托管、微调和气隙部署;后者可以。

• 模态——Ling-3.1-flash 是文本输入、文本输出。DeepSeek V4.1 Flash(Max)可同时接受图像与文本,并在多模态基准测试中接受评分。如果你的流程中有任何环节会把截图、图表或扫描件交给模型,那么比较到此就结束了。

• 服务面 — DeepSeek V4.1 Flash(Max)可通过 23 家提供商获取,其中包括 OrcaRouter;Ling-3.1-flash 通过厂商自有 API 以及承载其发布的第三方平台运行。对于生产路径而言,提供商数量是一种韧性属性,而非人气竞赛。

还有一个不对称之处未出现在上述任何列表中:DeepSeek V4.1 Flash (Max) 在单次响应中可提供 384,000 个输出 token。Ant 尚未公布 Ling-3.1-flash 的最大输出长度,因此目前还无法针对它来估算长生成工作负载。未公布上限并不等于上限就小,但它同样不是一个可用于设计的数字。

同时运行两者,以及那实际上是什么样子

Ling-3.1-flash 目前不在 OrcaRouter 的模型目录中——通过我们的公开模型 API 查询,InclusionAI 下的该模型返回结果为未找到,本文不会假装并非如此。按提供商的标价、零加价,DeepSeek V4.1 Flash 现在即可路由,因此供应商的价格一旦变动,我们这边当天就会同步生效;它与目录中的其他模型一样,共用同一个 API 密钥,并支持在上游提供商之间自动故障转移。

这种不对称有着很实际的形态。面对这样一种对比——一个模型是闭源的,价格大约是前代的四倍,而且只能通过单一供应商获取——理智的做法是把那个开源、被广泛服务的模型作为默认路径,而把挑战者当作需要测试、而非需要押注的东西。DeepSeek V4.1 Flash (Max) 如今就能扛起生产循环——开放权重、图像输入、384K 输出、98% 缓存折扣——而 Ling-3.1-flash 则承接那些专属于智能体的工作,因为它的 Terminal-Bench 和 SciCode 优势恰好能在这类场景中发挥作用。由于两者都使用 OpenAI 兼容的 chat-completions 格式,这种分工更像是一项路由决策,而不是一个集成项目:一个端点、一把密钥,再加一条规则,把每个模型可 measurably 更擅长处理的任务分别送过去。

裁决

就现有证据来看,DeepSeek V4.1 Flash (Max) 在这场对决中胜出,而它的胜势主要来自两个 Index 评分点之外的因素:MIT 许可下的开放权重、图像输入、384,000 个输出 token、98% 的缓存折扣,以及 23 家可供故障转移的服务商。Ling-3.1-flash 的理由更窄,却也切实成立——在两者之中,它是更出色的终端与工具智能体,也是这对组合中唯一没有发布内含高峰时段倍率的价格表的那个。

有两件事会改变这一评估。如果 Ant 以宽松许可证发布权重,开放度差距就会消失,这种比较也就变成一场纯粹的能力与成本对话。而如果 Ant 实际提供的长上下文窗口能在两个模型都宣称的 100 万 token 上得到验证,那么上下文持平的宣称就不再只是一个宣称。在那之前,诚实的总结是:一个模型可以赢得智能体基准测试中的某一行,却仍然输掉整场评估——而且这两个模型之间两点的指数差距大约值每任务成本的 3.6 倍,这是一种只有特定工作负载才应该做的取舍。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.