
Claude Haiku 5.5 对比 Ling 3.1 Flash:一个每次回答成本高出四倍的 5600 亿参数模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
六天之差。InclusionAI 发布了Ling 3.1 Flash,时间是 2026 年 10 月 1 日;厂商则在Claude Haiku 5.5于 10 月 7 日发布。两者都以 flash 级模型的名义出售,都带有一百万 token 的上下文窗口,而在唯一一个把两者都跑过一遍的独立榜单上,它们的推理行成绩极为接近,差距落在噪声范围内。可到了衡量智能体究竟能不能把活干完的那一行,两者相差 26 分;再看衡量干完的活要花多少钱的那一行,那个拥有 5600 亿参数的模型,价格是参数规模从未公布的那个模型的 4.5 倍。
这两份价目表都没有预示这一点。Ling 3.1 Flash 的标价是每百万输入 token 0.30 美元、每百万输出 token 0.90 美元。Claude Haiku 5.5 对于最多 100,000 token 的提示词标价为 0.10 美元和 0.50 美元,超过后则升至 0.50 美元和 2.50 美元。按每 token 价格来看,Ling 的输入成本是其三倍,输出成本略低于两倍,而这种差距只需一行就能终结比较。
它并不能了结这一点,因为费率卡按 token 计价,而决策按任务计价。这两个数字从这场较量中得出时符号相反,原因并不是冗长。
一项已完成任务的成本,而不是一个 token 的成本
在 Artificial Analysis Intelligence Index v4.3.2 上,完成一项完整索引任务的实测成本为 Claude Haiku 5.5 的 0.21 美元,Ling 3.1 Flash 为 0.99 美元。这是 4.6 倍的差距——比 3 倍的输入比率更大,且方向相同。
那个显而易见的解释——贵的模型话更多——是错的。Ling 3.1 Flash 在每个索引任务中生成 100,671 个输出 token;Claude Haiku 5.5 生成了 162,164 个。更便宜的那个模型反而更话痨,多出 60% 以上。所以钱也没有流向价目表所暗示的地方。
拆分每任务成本,它就会落在该指数方法论实际花钱的地方。在 Claude Haiku 5.5 的 0.21 美元中,约 62% 来自输入侧;在 Ling 3.1 Flash 的 0.99 美元中,约 91% 来自输入侧。这些都是缓存密集型的推理运行,而两家厂商对缓存输入 token 的定价截然不同:Claude Haiku 5.5 为每百万 0.01 美元,Ling 3.1 Flash 为每百万 0.06 美元——在占账单大头的这唯一一项上相差 6 倍。公布的价目表比较的是 0.10 美元与 0.30 美元。决定发票金额的那一项比较的是 0.01 美元与 0.06 美元。
我们自己的目录是以 0% 加价转售供应商的标价,因此你能在真实账单(而非模拟账单)上分辨这两种情况。Ling 3.1 Flash 不在目录里——无论以其供应商路径的哪种拼写都解析不到:不在 InclusionAI 下,不在 Ling 下,也不在我们试过的八种形式中的任何一种下——所以上面的 $0.30 和 $0.90 是供应商自己公布的价格,我们今天无法为你路由。Claude Haiku 5.5 也不在目录里;它通过 Anthropic 自家的 API 运行。本次对比的邻近范围内,目录确实收录的是 GLM 5.3 Flash、DeepSeek V4.1 Flash、Qwen3.8 Flash 和 Gemini 3.8 Flash,均按供应商标价、0% 加价提供,因此供应商那边一改价,同一天就会传到我们这边。如果下面的结论是,Ling 3.1 Flash 的智能体特性正是你的工作负载所需,那么实际的下一步就是用同一个密钥,对我们确实能路由的、具备智能体能力的模型做一次正面对比 并自带底层自动故障转移,而当成本上限属于路由而非应用代码时,就用路由 DSL。

两者均被测量的七行
Artificial Analysis是唯一一个同时运行了这两个模型的榜单,重叠部分虽然不多,但颇具信息量。各行数据彼此并不一致,而分歧的方向并非随机。
• 智能指数 v4.3.2 — Claude Haiku 5.5 (Max) 为 43.40,相较 Ling 3.1 Flash 的 41.09。Anthropic 以 2.31 分领先。
• 每个完成的 Index 任务成本 — 在同一看板上为 $0.21,而 $0.99。
• 每个 Index 任务的耗时 — Claude Haiku 5.5 为 424.6 秒,而 Ling 3.1 Flash 为 360.4 秒。这一行打破了预期:就整个 Index 而言,5600 亿参数的模型是两者中更快的那个,快约 15%。
• Terminal Bench 4.0 — 0.3283 对 0.3333。Ling 3.1 Flash 领先半分,而在一项两家厂商都引用的基准测试中,这算是平局。
• SciCode — 0.5498 对 0.5405。Claude Haiku 5.5 领先 0.9 分。也是平局。
• Humanity's Last Exam,无工具——0.4439 对 0.3943。Claude Haiku 5.5 领先 5 个百分点,首次出现真正的差距。
• AutomationBench,部分得分——0.3541 对 0.6174。Ling 3.1 Flash 领先 26 分,且领先幅度比这份列表中其他所有差距的总和还要大。
在那个共享集合之外还有两行数据,值得纳入,因为它们是最受买家关注的两项。在 GDPval-AA 上——Artificial Analysis 在 44 个职业中运行该评估——两者分别为 1620.05 和 1621.75,统计上难分伯仲。在 AA-Briefcase v1.1 上——一项采用 Elo 评级的长篇幅专业工作评估——Claude Haiku 5.5 的得分为 1577.72,而 Ling 3.1 Flash 为 1400.35,差距 177 分,对 Anthropic 有利。这是整个榜单上两者之间最大的非智能体类差距。
本应决定这些对话中大多数的唯一一行
索引层面的平均值掩盖了时间和资金的实际去向,而这一对是这批数据中最明显的例子。在 Terminal Bench 4.0 上,除得分之外,各项评估指标在任何维度上都不接近。
• Terminal Bench 4.0、Ling 3.1 Flash — 0.3333,每任务 5.49 美元、每任务 1,283 秒。
• Terminal Bench 4.0,Claude Haiku 5.5 — 每项任务 0.65 美元、每项任务 908 秒,成绩 0.3283。
它们之间的得分只差千分之五分。成本是 8.4 倍,墙钟时间是 1.4 倍。一个团队如果看了基准测试表,并选择了得分为 0.3333 的模型,那么按照 Artificial Analysis 自己的核算,它就是选择支付八倍费用,晚三分之一分钟得到相同的答案。
这并不是在主张得分毫无意义;而是在说,得分是已完成工作量与尝试工作量之比,它完全没有说明为达到这一得分消耗了多少资源。智能体完成任务的基准测试,恰恰是这种区别影响最大的场景,因为会重试的智能体每次重试都要付出全额代价,而每次尝试成本高出八倍的模型,会把重试循环变成一项预算支出。

5600亿参数,无需下载
这是 Ling 3.1 Flash 规格表中真正不寻常的部分,而且并非尺寸。
Ling 3.1 Flash 是一个稀疏混合专家模型——总参数量 5600 亿,每个 token 激活 250 亿——而 Artificial Analysis 将其归类为专有。没有权重,没有许可证文件,也没有代码仓库。这种形态的大型稀疏模型通常会以开放发布的形式出现,因为这一层级的其他模型都是这么做的:GLM 5.3 Flash 以 MIT 许可证发布权重,总参数 3200 亿、激活 180 亿;DeepSeek V4.1 Flash 以 MIT 许可证发布权重,总参数 5520 亿、激活 160 亿。Ling 3.1 Flash 是同一量级、同一类架构,却仅以 API 形式发布。
那个选择有一个基准测试行不会显示的后果。一个拥有 250 亿活跃参数的模型必须在某处被提供服务,而如果你无法持有检查点,你就无法选择在哪里或以什么利润率来提供——你只能租用供应商对它的服务。上面 5.49 美元的 Terminal Bench 任务价格主要不是 token 费率的产物;它是从唯一能运行大型稀疏模型的一方租用该模型的成本。这一层级中的开放权重同类模型让你可以选择自己推动那个数字。
反过来也一样,同样的坦诚也适用。开源发布并不自动就是更好的产品:你在接过权重的同时,也继承了服务部署的负担、量化上的取舍和不停升级的跑步机,而一份许可证文件并不是一份支持合同。Anthropic 为 Claude Haiku 5.5 公布了退役承诺:不早于 2027 年 10 月 7 日,且是在配有系统卡的第一方 API 上。你想要这两种安排中的哪一种,问的是你的团队,而不是这两个模型中的任何一个。
Ling 3.1 Flash 是做什么用的
完整读下来,这份评测描述的是一款自洽的产品,而不是一款处处妥协的产品:一个大型、稀疏、长上下文的模型,在完成自主多步骤工作流方面胜过这一价格区间内所有被测对象,在困难的单次推理上表现平平,并且以固定费率提供,不存在提示长度带来的价格陡增。在 AutomationBench 上,它领先 Claude Haiku 5.5 达 26 分,而它的 AA-Briefcase 得分是本次对比中唯一一处它落在中游之后、而非前列的地方。
那是对批处理式智能体工作器的一种站得住脚的描述:让它面对一队必须逐一完成的结构化任务,接受任务以分钟计,让提示词足够长,以至于某个阈值步骤会带来惩罚性代价,并且把终点处的可靠性看得比任何单个 token 的成本更重要。它不擅长的,正是 flash 级模型通常被采购来做的事情。它只接受文本——完全没有图像输入,而 Claude Haiku 5.5 同时接受文本和图像。它的索引任务时间更短,但它的 Terminal Bench 任务时间更长,而且完成每个索引任务需 $0.99,而后者为 $0.21,它花费了四倍半的钱,却只得到几乎相同的综合得分。

根据现有证据,两者中的哪一个
如果你的工作是文本输入、文本输出,按使用量以 token 计价,那么在所有会进入账单的项目上,Claude Haiku 5.5 在这场比较中都胜出:更低的索引任务成本、在对智能体最重要的基准上更低的实际任务成本、更高的综合评分、更好的长篇专业工作得分、更好的保真度,以及另一款模型完全不提供的图像输入。
如果你手头的工作是一个必须完成多步骤工作流的无人值守智能体,那么 Ling 3.1 Flash 在唯一一个恰好衡量这一点的共享基准上,比 Claude Haiku 5.5 高出 26 分,这值得测试,而不是因为价格就将其否定。要在你自己的 trace 上测试它,而不是在这张表上——并且按每完成一个任务来为测试计价,因为当智能体重试时,真正变化的正是这个数字。
如果你需要拿到模型权重,那么这两个都不是你的选择。Ling 3.1 Flash 是专有模型,参数量为 5600 亿;Claude Haiku 5.5 也是专有模型,未公布参数量。这一层级的开源发布在榜单的其他位置,而那种比较完全起始于另一组不同的行。
综合评分给出的是 2.31 分。智能体基准测试则说相反方向是 26。费率表说输入上是 3×;完成任务成本则说,在与费率表相同的方向上,是 4.6×。四个数字,两个方向——这就是为什么唯一可靠的解决办法,是让两者都对照你自己工作的追踪记录来运行,并从已完成的任务中读取成本,而不是从 token 中读取。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
