
Ling-3.1-flash 对比 DeepSeek V4.1 Flash:指数差两分,账单贵三倍
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Ling-3.1-flash 与 DeepSeek V4.1 Flash(Max)在 Artificial Analysis Intelligence Index 上相差两分——41 对 39——但在价格上却完全不在一个量级。用构成该指数的十项评估分别测试每个模型,Ling-3.1-flash 每项任务成本约为 0.99 美元,而 DeepSeek 为 0.27 美元。两者都是约 5500 亿参数的混合专家模型,均声称支持 100 万 token 上下文。一个是来自蚂蚁集团 InclusionAI 实验室的闭源纯文本模型,于 2026-10-01 发布,至今未公布权重或许可证。另一个自 2026-09-10 起以 MIT 许可证开源,支持图像和文本,可在 23 家提供商上运行,是大多数团队早已放进配置文件里的模型。在大多数维度上,二者差距悬殊。有趣的问题是,这两分的差距究竟为何存在。
Ling-3.1-flash 真正领先之处
在衡量驱动终端和编写必须能运行的代码的评估中,它处于领先,而这个差距值得被精确说明,因为总体数据掩盖了它。
• Terminal-Bench 4.0 —— Ling-3.1-flash 0.333 对 DeepSeek V4.1 Flash(Max)0.268。就绝对值而言,两者都是不算高的数字;但这一差距已达到 DeepSeek 得分的四分之一。
• SciCode — 0.541 对比 0.519。
• CritPt 物理推理 — 0.180 对比 0.143。
• GDPval-AA 智能体真实世界工作 — 1,621.75 Elo 对 1,600 Elo。
这四者中有两项几乎打平,一项是小幅胜出,而 Terminal-Bench 4.0 是唯一一行差异在更换随机种子后仍能保持的。与之相对的是 DeepSeek 胜出的地方:AA-Briefcase v1.1 智能体知识工作以 1,420.47 Elo 对 1,400.35,AutomationBench-AA 以 0.689 对 0.617,AA-LCR 长上下文推理以 0.84 对 0.83,以及——对生产而言最重要的一行——AA-Omniscience 以 −5.30 对 Ling-3.1-flash 的 +2.22,而在这项指标上,幻觉比拒答更糟。DeepSeek 在那里的准确率为 46.4%,在其回答的问题中幻觉率为 96.5%;Ling-3.1-flash 的正确回答率为 29.1%,幻觉率为 37.9%。两者都不是那种不前置检索就能直接指向知识库的模型。
价格差距大于指数差距,而这不仅仅是费率卡。
标称价格看起来几乎相同。Artificial Analysis 记录的两者均为每百万输入 token 0.30 美元。但在另外两个数字上,二者却出现了明显分化:
• 输出 — Ling-3.1-flash 每百万 $0.90,对比 DeepSeek V4.1 Flash (Max) 每百万 $1.20。这里 Ling-3.1-flash 直接就是更便宜的模型,便宜 25%。
• 缓存读取——Ling-3.1-flash 每百万 $0.06,而 DeepSeek V4.1 Flash (Max) 每百万 $0.006,98% 的折扣对比 80% 的折扣。正是在这一点上,这两个模型不再具有可比性。
在 7:2:1 的缓存命中/输入/输出混合比例下,Ling-3.1-flash 的混合费率为 $0.192,DeepSeek V4.1 Flash (Max) 为 $0.184——几乎不相上下。但这种混合比例是对你如何使用模型的一种假设,而这个假设在其中起了很大作用。任何提示词复用率很高的工作负载——很长的系统提示词、检索前导文、每一轮都重新发送累积上下文的智能体循环——都会把实际有效的混合比例推向缓存读取,而在那里,缓存定价 10 倍的差异就会占主导。Token 量也会以同样的方式产生叠加效应:Ling-3.1-flash 是个话多的推理模型,在各项索引评估中生成 2.2 亿个输出 token,而 DeepSeek 为 2.5 亿个,并且每个评估任务平均耗时约 357 秒,而 DeepSeek 为 285 秒。它每给出一个答案都要做更多思考,并因此花更长时间。

一个实操示例:在两者上使用相同的智能体循环
假设一个工具驱动的智能体,每个任务消耗 100 万输入 token,其中 90% 由缓存提供,并返回 20 万个输出 token。按照上述数据,在 Ling-3.1-flash 上:90 万个缓存输入 token 按每百万 $0.06 计,加上 10 万个全新输入按 $0.30 计,再加上 20 万个输出按 $0.90 计,每个任务约为 $0.26。同样的循环在 DeepSeek V4.1 Flash (Max) 上约为 $0.14——大致是前者的一半。
现在套用 DeepSeek 的时段安排,因为这是大多数对比都会跳过的一环。DeepSeek 的非高峰费率就是上面那个,非高峰覆盖周末以及一天中的大部分时间;但在两个工作日窗口,即 UTC 01:00–04:00 和 06:00–10:00,输入和缓存定价会翻倍。把同一个循环挪进高峰窗口,DeepSeek 的成本会落到接近 $0.28——这时 Ling-3.1-flash 那个统一且更高的费率卡在这一小时里反而成了更便宜的选择,而 10× 缓存折扣已经被时钟抵消了。
整个决策就浓缩在这一组数字里。如果你的 agent 流量缓存占比很高,而且你能安排调度时间,那么 DeepSeek V4.1(Max)的成本大约只有 Ling-3.1-flash 的一半,换来的只是两个点的指数差距。如果你的流量缓存占比很高,且恰好落在 DeepSeek 的高峰时段,那么两个模型的成本大致相当,此时 Ling-3.1-flash 在终端 agent 那一行略胜一筹,就成了打破平局的决定性因素。
无需进行比较的轴
有三个维度相差甚远,而它们往往在讨论价格之前就已决定架构走向。
• 权重与许可 — Ling-3.1-flash 未公开权重,没有许可文本,Artificial Analysis 将其归类为专有模型。DeepSeek V4.1 Flash (Max) 则以 MIT 协议开放权重,可从 Hugging Face 下载,且允许商业使用。前者无法自行托管、微调和气隙部署;后者可以。
• 模态——Ling-3.1-flash 是文本输入、文本输出。DeepSeek V4.1 Flash(Max)可同时接受图像与文本,并在多模态基准测试中接受评分。如果你的流程中有任何环节会把截图、图表或扫描件交给模型,那么比较到此就结束了。
• 服务面 — DeepSeek V4.1 Flash(Max)可通过 23 家提供商获取,其中包括 OrcaRouter;Ling-3.1-flash 通过厂商自有 API 以及承载其发布的第三方平台运行。对于生产路径而言,提供商数量是一种韧性属性,而非人气竞赛。
还有一个不对称之处未出现在上述任何列表中:DeepSeek V4.1 Flash (Max) 在单次响应中可提供 384,000 个输出 token。Ant 尚未公布 Ling-3.1-flash 的最大输出长度,因此目前还无法针对它来估算长生成工作负载。未公布上限并不等于上限就小,但它同样不是一个可用于设计的数字。
同时运行两者,以及那实际上是什么样子
Ling-3.1-flash 目前不在 OrcaRouter 的模型目录中——通过我们的公开模型 API 查询,InclusionAI 下的该模型返回结果为未找到,本文不会假装并非如此。按提供商的标价、零加价,DeepSeek V4.1 Flash 现在即可路由,因此供应商的价格一旦变动,我们这边当天就会同步生效;它与目录中的其他模型一样,共用同一个 API 密钥,并支持在上游提供商之间自动故障转移。
这种不对称有着很实际的形态。面对这样一种对比——一个模型是闭源的,价格大约是前代的四倍,而且只能通过单一供应商获取——理智的做法是把那个开源、被广泛服务的模型作为默认路径,而把挑战者当作需要测试、而非需要押注的东西。DeepSeek V4.1 Flash (Max) 如今就能扛起生产循环——开放权重、图像输入、384K 输出、98% 缓存折扣——而 Ling-3.1-flash 则承接那些专属于智能体的工作,因为它的 Terminal-Bench 和 SciCode 优势恰好能在这类场景中发挥作用。由于两者都使用 OpenAI 兼容的 chat-completions 格式,这种分工更像是一项路由决策,而不是一个集成项目:一个端点、一把密钥,再加一条规则,把每个模型可 measurably 更擅长处理的任务分别送过去。
裁决
就现有证据来看,DeepSeek V4.1 Flash (Max) 在这场对决中胜出,而它的胜势主要来自两个 Index 评分点之外的因素:MIT 许可下的开放权重、图像输入、384,000 个输出 token、98% 的缓存折扣,以及 23 家可供故障转移的服务商。Ling-3.1-flash 的理由更窄,却也切实成立——在两者之中,它是更出色的终端与工具智能体,也是这对组合中唯一没有发布内含高峰时段倍率的价格表的那个。
有两件事会改变这一评估。如果 Ant 以宽松许可证发布权重,开放度差距就会消失,这种比较也就变成一场纯粹的能力与成本对话。而如果 Ant 实际提供的长上下文窗口能在两个模型都宣称的 100 万 token 上得到验证,那么上下文持平的宣称就不再只是一个宣称。在那之前,诚实的总结是:一个模型可以赢得智能体基准测试中的某一行,却仍然输掉整场评估——而且这两个模型之间两点的指数差距大约值每任务成本的 3.6 倍,这是一种只有特定工作负载才应该做的取舍。


