为“Claude Haiku 5.5 对比 Ling 3.0 Flash”生成的主视觉卡片,包含两个由一条细线分隔的面板:左侧标注为“Claude Haiku 5.5”,带有“指数 43”和“当前”;右侧标注为“Ling 3.0 Flash”,带有“指数 20”和“已弃用”。页脚一行写着“得分依据 Artificial Analysis。”OrcaRouter 标志合成在右下角。
Engineering & Research

Claude Haiku 5.5 对比 Ling 3.0 Flash:其中一款模型已有后继版本

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

先从那个奇怪的细节说起,因为它本应影响这一决策。Ling 3.0 Flash——Ant Group 的 1240 亿参数开放权重模型,于 2026 年 8 月以 MIT 许可发布——现已被标记为弃用,而 Ling 3.1 Flash 被指定为其替代品。Claude Haiku 5.5 于 2026 年 10 月 7 日面世,也就是本文写作的两天前,并且 Anthropic 已承诺在 2027 年 10 月之前不会将其退役。两个模型处于同一价格区间,而其中一个已经被指向自己的继任者。

这种不对称性是对质量的评判。Ling 3.0 Flash 是一个真正快速的模型,拥有开放权重和不寻常的架构,并且在多个维度上完全胜过 A​nthropic 这一档。但这确实意味着这种比较是有保质期的,任何把两者视为同等持久的文章,都是在向你兜售会过期的那部分。

两个版本,两个截然不同的时代

这里的独立数据来自 Artificial Analysis;厂商特定的说法来自模型卡和文档,并且已标注。

• 发布 — Ling 3.0 Flash 于 2026 年 8 月 4 日发布,其 Hugging Face 仓库的日期为 8 月 2 日。Claude Haiku 5.5 于 2026 年 10 月 7 日发布。

• 许可证 — Ling 3.0 Flash 采用 MIT 许可证,这几乎是开放权重模型所能达到的最宽松程度。Claude Haiku 5.5 则是专有模型,仅提供 API。

• 状态 — Ling 3.0 Flash 带有弃用标记,指向 Ling 3.1 Flash。Claude Haiku 5.5 为当前版本,并承诺在 2027 年 10 月之前不会退役。

• 采用情况——Ling 3.0 Flash 仓库已获得 11,797 次下载和 427 个点赞。这是一个真实但并不庞大的规模,也能较为合理地反映围绕该模型成长起来的第三方工具生态有多大。

这个时间差的重要性超过六周这个数字所暗示的程度。Ling 3.0 Flash 发布时,其自身系列已经在迭代;Claude Haiku 5.5 发布时,则是一个尚无已公布继任者的产品线中的最新成员。

架构才是值得读两遍的部分

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash 是一个混合专家模型,总参数量为 1240 亿,每个 token 激活 51 亿。这个比例正是整个经济性论证的核心:你可以容纳大模型的显存占用,却只需付出小模型的计算成本。已公布的配置很具体,而且它并不是标准 Transformer 的换皮:

• 分层 — 35 个 KDA 层与 7 个 Gated MLA 层,比例为 5:1,外加 2 个密集层。已发布的训练方案分阶段将上下文窗口从 8K 扩展到 32K 再扩展到 256K,而不是从头开始训练长窗口。

专家——512 个路由专家和 1 个共享专家,每个 token 激活 8 个,隐藏层大小为 2,560,专家中间层大小为 768,稠密中间层大小为 6,144。词表大小为 157,184 个 token。

• 服务——该卡的参考部署使用 SGLang,搭配 --context-length 262144,并报告称,在长输入下,HiCache 结合 Mooncake 缓存可将首 token 时间缩短 60–80% 甚至更多。这是厂商报告的数据,文中也已如实如此说明。

这些都不是噱头。5.1B 的活跃参数规模,正是 Ling 3.0 Flash 能以所达到的吞吐量提供服务的原因;而缓存方面的工作,则是它在长提示词上的首 token 延迟仍保持可用的原因。Claude Haiku 5.5 的做法则相反:一个置于 API 之后的稠密专有模型,拥有 1,000,000 token 的窗口,并由自适应思考按请求决定要做多少工作。针对同一个成本问题,这是两种自洽的答案。

这些数字,并排

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• 独立评分——Claude Haiku 5.5 在智能指数上获得 43 分,182 个中排名第二。Ling 3.0 Flash 获得 20 分,在同类 65 个中排名第三。

• 每百万 token 的输入价格 — Claude Haiku 5.5 在 100,000 token 以内为 $0.10,超过后为 $0.50。Ling 3.0 Flash 为 $0.075,并享有 80% 缓存折扣。

• 输出价格(每百万 token)——Claude Haiku 5.5 为 0.50 美元(100,000 token 以内),超出后为 2.50 美元。Ling 3.0 Flash 为 0.22 美元。

• 综合成本——在董事会采用的混合计算方式下,Ling 3.0 Flash 为每百万 token 0.05 美元,而 Claude Haiku 5.5 为 0.08 美元。

• 速度 — Ling 3.0 Flash 每秒输出 333.6 个 token,在其所属类别的 65 个模型中排名第一,而 Claude Haiku 5.5 为 240.4。首 token 时间几乎持平:2.50 秒,对比该榜单对 Anthropic 模型的测量值。

• 上下文 — Ling 3.0 Flash 为 262,000 个 token;Claude Haiku 5.5 为 1,000,000 个。

• 输入模态 — Ling 3.0 Flash 仅支持文本。Claude Haiku 5.5 支持文本和图像。

• 权重 — Ling 3.0 Flash 采用 MIT 许可且可下载。Claude Haiku 5.5 为专有。

Ling 的卖点是速度和价格,而非深度

43 与 20 之间 23 分的 Index 差距是最醒目的看点,而它指向的方向与所有同类对比完全一致:Claude Haiku 5.5 是更强的模型,而且差距并不小。不过 Ling 那一列干净利落地赢下了两行,而这两行恰恰都是会体现在账单或延迟预算上的那种指标。

首先是吞吐量。333.6 tokens 每秒是榜单上同类中最快的,比 Claude Haiku 5.5 领先约 39%;再加上更低的混合成本,这意味着批量生成——分类扫描、数据标注、大批量结构化抽取——在 Ling 3.0 Flash 上运行的成本可衡量地更低。当任务定义清晰、失败模式显而易见时,一个在 Index 上落后 23 分的模型仍然可能是正确之选。

其次,80% 的缓存折扣。对于具有大型稳定前缀和少量变化尾部的负载,Ling 3.0 Flash 上的有效输入费率会远低于标价,而模型卡中的缓存设计正是针对这种模式。Claude Haiku 5.5 的缓存读取费率为 $0.01,从绝对值来看更便宜,但其缓存写入费用为 $0.125,并且该模型在 100,000 个输入 token 处设有阶梯定价,而 Ling 没有。

制衡因素是冗长,而这也是适用于 Anthropic 模型的同一个问题。Artificial Analysis 记录到,在 Ling 3.0 Flash 上运行 Index 时输出 token 达 2.6 亿,而中位数为 1 亿,并将其标记为冗长。对于按 token 计价的模型,这会侵蚀费率优势——输出费率便宜 2.3 倍,却有一部分被写出更多 token 的模型消耗掉,因此优势比模型卡所显示的要小。

厂商基准测试声称的内容,以及未提及的部分

Ling 3.0 Flash 自家卡片报告了一组成绩亮眼的数据:MathArena AIME 2026 为 93.2,HMMT 2026 年 2 月为 87,SWE-Bench Pro 为 56.6,SWE-Bench Multilingual Resolved 为 72.4,Humanity's Last Exam 为 22.7。这些每一项都由厂商自行报告,且在这里没有任何一项得到独立复现。它们也不是在与 Claude Haiku 5.5 使用同一测试框架的条件下测得的——Anthropic 公布的是自己的一套数据(GDPval-AA v2.1 为 1620,OSWorld 2.1 为 72.4%,Terminal-Bench 4.0 为 39.2%),而两家厂商跑的是不同的测试套件。唯一共同的衡量标准是那个独立榜单,而在那里,答案毫不含糊。

在数学分数之外还值得一提的是:HLE 的那项数值 22.7 明显低于 Anthropic 为 Claude Haiku 5.5 报告的不使用工具时的 45.9。两者所用的测试框架不同,因此并非直接可比,但这一差距也不是用框架差异就能解释掉的。

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

继任者问题

对于任何打算把规划延伸到当前季度之后的人来说,正是这一点决定了他们如何比较,而这与基准测试毫无关系。

Ling 3.0 Flash 已弃用,建议改用 Ling 3.1 Flash。这并不意味着它会停止工作——开放权重不会过期,MIT 许可证也无法被撤销。但这确实意味着围绕它的生态会逐渐偏移:推理框架支持、量化版本发布、漏洞修复和社区工具都会跟随当前模型,而被弃用的模型只能分到这些关注度的尾巴。如果你今天还在基于 Ling 3.0 Flash 构建,你就是在基于已经冻结且最终定稿的权重上构建,这对于稳定的工作负载来说没问题,但对于任何你期望能持续改进的东西来说就很尴尬。

Claude Haiku 5.5 提供的则是一组镜像般的保障:你拿不到权重,但你能得到一个供应商,其商业利益就在于让模型保持快速、持续修补并提供服务,此外还有到 2027 年 10 月为止的不退役承诺,以及一旦该承诺结束便会公布的迁移路径。

这条路线的两侧,仅需一把钥匙即可通过

诚实的可用性说明:OrcaRouter 不提供 Ling 3.0 Flash,也不提供 Claude Haiku 5.5。Ling 3.0 Flash 通过供应商自己的分发渠道和若干第三方平台提供;Claude Haiku 5.5 可在 Anthropic 的 API 和各大云平台上使用。

剩下的就是这两个模型都引出的路由问题。Claude Haiku 5.5 得分 43、拥有 100 万 token 的上下文窗口,是天然的上探目标;Ling 3.0 Flash 每秒 333 token 的速度,则是天然的批量处理档位。一条把大批量、需求明确的工作交给快速档、并把任何未通过长度或质量检查的任务上探到更强模型的路线,正是路由器所编排的那种安排——在 OrcaRouter 上,Anthropic 的 Claude Haiku 4.5、Claude Sonnet 5.5 和 Claude Opus 5.5 今天已在目录中,同时还有DeepSeek V4.1 Flash 和 GLM 5.3 Flash 等大型开放权重选项,因此上探档和批量档现在都能搭建并做负载测试。一个密钥,底层自动故障转移,供应商目录价以 0% 加价透传,因此价格变动当天即可生效。

这两个中的哪一个,以及持续多久?

如果任务是开放式的、你需要图像或百万级 token 窗口、你希望有厂商为正常运行时间兜底,或者你正在规划下个季度之后的事,那就选 Claude Haiku 5.5。它领先 23 个 Index 分,是当前版本而非已弃用版本,而且价格差距足够小,以至于分数差距占据主导。

如果负载是批量、规格明确且对延迟敏感的,如果重点在于 MIT 许可证或开放权重,或者如果你的账单真正来自稳定前缀上的 80% 缓存折扣,那就选择 Ling 3.0 Flash。它是更快的模型,也是每 token 更便宜的模型,而且对于 20-Index 模型能处理的任务,它确实很擅长。只是要清楚,你采用的是已经完成的模型,而不是仍在维护的模型,并且它所指向的后续版本已经存在。