一张生成的主视觉卡片,标题为“Claude Haiku 5.5 vs DeepSeek V4.1 Flash”,引题为“两个模型,两种廉价理念”,展示 Claude Haiku 5.5 的输入 $0.10、输出 $0.50、指数 43.40,对比 DeepSeek V4.1 Flash 的输入 $0.30、输出 $1.20、指数 39.46,下方条形栏显示“每项已完成任务的成本 $0.21 vs $0.27”。
Engineering & Research

Claude Haiku 5.5 vs DeepSeek V4.1 Flash:更便宜的价格标签,并不代表模型更便宜

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

从价目表来看,这差距可不小。Claude Haiku 5.5由该厂商于 2026 年 10 月 7 日发布,标价为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。DeepSeek V4.1 Flash于 2026 年 9 月 10 日发布,在独立榜单上标价为 0.30 美元和 1.20 美元,或在厂商自己的非高峰价目表上为 0.15 美元和 0.60 美元。该厂商在两项计量上都要便宜两到三倍,而这是 Haiku 级模型首次低于 DeepSeek Flash 的费率。

然后你衡量一个已完成任务的成本,差距就崩塌了。在同一次评估运行中,一项 Intelligence Index 任务在 Claude Haiku 5.5 上花费 $0.21,在 DeepSeek V4.1 Flash 上花费 $0.27——是 20% 的优势,而不是 200% 的优势。原因就在同一页上:Claude Haiku 5.5 每项任务生成 162,164 个输出 token,而 DeepSeek 为 88,574 个。你每个 token 支付更少,却买到近两倍的数量。

这种反转就是整个对比的核心,下面的一切都是在讨论你的负载最终会落在它的哪一边。

均按原文评定,照原文理解

每百万词元,以美元计。Anthropic 的数据来自 Anthropic 自己的定价文档;DeepSeek 的数据来自 DeepSeek 的模型与定价页面,该页面是其高峰与低谷定价结构的权威说明。独立测量数据来自 Artificial Analysis Intelligence Index v4.3.2,读取于 2026-10-08。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs DeepSeek V4.1 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 39.46, cost per task $0.21 against $0.27, output tokens per task 162,164 against 88,574, Terminal Bench 4.0 0.3283 against 0.2677, AutomationBench 0.3541 against 0.6889 and open weights 'no' against 'yes, MIT', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; prices per vendor documentation.'

• 输入 — Claude Haiku 5.5 在 100,000 个 token 以内为 $0.10,超出后为 $0.50。DeepSeek V4.1 Flash 在榜单卡片上统一为 $0.30,或在 DeepSeek 的非高峰时段为 $0.15。

• 输出 — Claude Haiku 5.5:0.50 美元,最多 100,000 个 token;超出部分为 2.50 美元。DeepSeek V4.1 Flash:统一价 1.20 美元,非高峰时段为 0.60 美元。

• 缓存输入——Claude Haiku 5.5 在 100,000 个 token 以下为 $0.01,以上为 $0.05,相当于 90% 的折扣。DeepSeek V4.1 Flash 为 $0.006,相当于 98% 的折扣。这是唯一一项 DeepSeek 卡在绝对价格上更便宜的计费指标,而且便宜的程度超出人们的预期。

• 分时定价——Anthropic 没有。DeepSeek 在工作日 UTC 01:00 至 04:00 以及 06:00 至 10:00 将两项计量都翻倍,中国法定节假日除外。其他所有时段,包括整个周末,均为非高峰时段。

• 上下文与输出上限——各为 100 万 token。Claude Haiku 5.5 单次响应上限为 128,000 个 token;DeepSeek V4.1 Flash 的上限为 384,000 个 token。

• 权重 — Claude Haiku 5.5 为专有模型,仅提供 API,模型 ID 为 claude-haiku-5-5。DeepSeek V4.1 Flash 以 MIT 许可开源,总参数量 552B,激活参数 16B,已发布于 Hugging Face。

• 模态——两者都接受文本和图像并返回文本。两者均非原生支持视频。

• 独立评分 — Claude Haiku 5.5 (Max) 为 43.40,而 DeepSeek V4.1 Flash (Max) 为 39.46。在包含 182 个模型的榜单上相差 3.94 分。

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

为什么按任务计算的数字胜过按 token 计算的数字

标价之所以按 token 报价,是因为计量的就是 token。但用它来衡量工作负载的成本并不可靠,因为推理模型会自行决定一项任务需要多少 token,而这里的两个模型在这方面相差达 1.8 倍。

Claude Haiku 5.5 在每项 Intelligence Index 任务中输出 162,164 个输出 token,其中 129,047 个为推理,33,118 个为回答。DeepSeek V4.1 Flash 输出 88,574 个,其中 62,670 个为推理,25,904 个为回答。两者都将思考按输出计费。因此,输出率低 60% 的模型在昂贵的那项计量上花费了将近两倍,而算下来两者相差不到六美分。

还有第二种效应朝着同一方向起作用。索引运行的消耗同样由输入和输出主导,因为测试框架会重新发送上下文:Claude Haiku 5.5 每任务 $0.2128 可拆解为 $0.1317 的输入和 $0.0811 的输出,而在输入这一项中,其中 $0.0954 是缓存读取,$0.0337 是缓存写入,全新输入则仅为 $0.0026。DeepSeek 的 $0.2652 拆分为 $0.1589 的输入和 $0.1063 的输出,其中输入里有 $0.0966 属于缓存写入。这两个模型读取的缓存上下文量大致相当;而 DeepSeek 为同样的读取和写入付出了更高的代价。

Anthropic 自家的发布文章一开篇,就从另一个方向给出了类似的提醒。文章称,Haiku 5.5“在用于提示词最多 100,000 个 token 的任务时性价比尤其高,而这类任务约占我们此前 Haiku 模型所收到请求的 90%。”这个限定语绝非空话——请看下面的断崖。

10 万 token 悬崖才是真正的分水岭

Anthropic 对 Claude Haiku 5.5 并非采用统一固定定价。0.10 美元和 0.50 美元的计费标准适用于不超过 100,000 个 token 的提示词,超过该阈值后则分别变为 0.50 美元和 2.50 美元——输入价格上涨五倍,输出价格上涨五倍,且按整个请求计费,而非仅对超出的部分计费。

DeepSeek 的计价结构完全不同。其费率取决于你何时发送,而非发送量。一份 15 万 token 的提示词与一份 500 token 的提示词单位 token 价格相同,只是会在两个工作日时段内翻倍。

把长提示词流水线同时放到两者上,对比就会急剧反转。在 150,000 个输入 token、20,000 个输出的情况下,Claude Haiku 5.5 计费为 0.125 美元的输入和 0.05 美元的输出——单次调用 0.175 美元——而 DeepSeek 在非高峰时段计费为 0.0225 美元和 0.012 美元,合计不到四美分。也就是说,DeepSeek 以大约 4.5 倍的优势获胜,而同样这两个模型,在短提示词场景下却是 Anthropic 以三倍优势获胜。

抽象来说,这两种结构没有优劣之分。一种按你发送的量来计价,另一种按你发送的时间来计价,而在发起请求时,这两个变量中只有一个由你掌控。

DeepSeek的另一大杠杆,市场尚未计入

缓存这条线值得单独审视,因为它是本次比较中最便宜的计量表,而且是随产量增长而非缩减的那一项。

DeepSeek 的缓存命中费率为每百万 token $0.006,标称有 98% 的折扣——大约只有 Anthropic $0.01 的六分之一,也只是双方全新输入成本的一小部分。任何会重新发送稳定前缀的内容——一长段系统提示、一组检索到的文档、一个工具 schema——从第二轮起,每一轮都会按该费率计费。上面的索引运行已经显示出这一占比有多大:Claude Haiku 5.5 每任务输入成本中的 $0.0954 是缓存读取,而这仅来自 $0.0026 的未缓存输入。

因此,实际的分野比“Anthropic 更便宜”更窄。如果你的请求很短、是单轮且缓存已预热,那么 Claude Haiku 5.5 在价格上领先,在能力上以 3.94 个指数点领先,并在综合智能体(agentic)指标行上领先。如果你的请求很长、前缀负载很重,或者可以安排到 DeepSeek 的非高峰时段,那么 DeepSeek V4.1 Flash 在成本上占据绝对优势,而且差距并不小。

你今天实际可以调用什么

两个模型都可访问,但可达性并不对称,而这种不对称值得说明,而不是留给你自己去发现。

DeepSeek V4.1 Flash 现已上架 OrcaRouter 目录,按供应商标价原样传递,0% 加价——在这里这比通常更重要,因为 DeepSeek 的费率具有峰值结构。我们列出输入 $0.15、输出 $0.60、缓存读取 $0.003,并在定价记录中保留工作日两个翻倍时段,因此路由到 DeepSeek 线路的请求按 DeepSeek 的计费方式计费,而不是按混合平均值。自动故障转移位于该路由之下,因此高峰窗口的 429 或供应商服务中断会转移调用,而不是让其失败。

Claude Haiku 5.5 并不在目录中。Anthropic 的模型可以通过 Anthropic 直接访问,也可以通过其三个云合作伙伴——发布公告中点名的 AWS、Google Cloud 和 Microsoft Azure——访问,而这是唯一诚实的说法。目录中确实收录的 Anthropic 系列产品是 Claude Sonnet 5.5 和 Claude Opus 5.5,正因如此,从廉价的分类调用升级到中端智能体调用的路径才是一种路由配置,而非第二次集成。

A capture of the OrcaRouter model page for DeepSeek V4.1 Flash under deepseek/deepseek-v4.1-flash, showing a 1M-token context, a 384K maximum output, text and image input, public benchmarks dated 2026-09-10, a p50 time to first token of 1.74 seconds, and the page's own description of the model as the smallest in DeepSeek's new architecture family, released September 10, 2026.

该选哪一个

如果你的流量是分类、抽取、路由决策、摘要和子代理回合——短提示、高吞吐量、还夹杂着图像——那么 Claude Haiku 5.5 是更好的模型,而且在 100,000 个 token 以下,也是更便宜的那个。它的指数得分高出 3.94 点,能处理图像,并且 Anthropic 还提供了一个可调节的投入力度旋钮,让你无需更换模型,就能在单次调用的能力与成本之间进行权衡。

如果你的流量以长文档为主、检索密集,或者你可以对调用进行调度,那么在算术上 DeepSeek V4.1 Flash 更胜一筹:每次长调用的成本仅为三分之一到四分之一,缓存费率是 Anthropic 的六分之一,响应上限达 384,000 个 token,而且拥有开放权重——万一按 token 计费的模式哪天不再划算,你也能把它握在手里。

这次比较真正厘清的,比“Anthropic 如今是廉价选项”要更窄。它厘清的是:一个小型 Anthropic 模型可以在标价上低于 DeepSeek Flash 的费率,同时在账单上落在其 20% 以内——而这两个事实之间的差距,是一个冗长度设置。

一个 API 覆盖 200 多个模型,一把密钥,自动故障转移在底层兜底,所以高峰时段的 429 或服务商短暂中断只会把调用转移走,而不是让它失败。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新