
Claude Sonnet 5.5 对比 DeepSeek V4 Pro:20 个指数点,以及 $0.022 的缓存读取
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
把两张价目表并排放到一起,这场比较还没开始就已经分出胜负了。Claude Sonnet 5.5 自 2026 年 9 月 28 日起正式可用,每百万输入 token 收费 2.00 美元,每百万输出 token 收费 10.00 美元。DeepSeek V4 Pro 于 2026 年 4 月 24 日发布,价格分别是 0.66 美元和 1.98 美元。在智能体工作中,输出才是真正关键的那一项,而 10.00 美元对 1.98 美元,是五比一的差距——每十万 token 一美元对二十美分。再看能力这一侧,Artificial Analysis 在 Intelligence Index v4.3 上给 Claude Sonnet 5.5 打了 56 分,给 DeepSeek V4 Pro 打了 36 分,在同一套评测体系下相差二十分。这就是全部的张力所在:DeepSeek 的模型输出价格只有对手的五分之一,而实测能力约为对手的三分之二,如果不清楚你的工作负载究竟拿 token 做了什么,这两个事实就无法归结为一条单一的建议。
每个模型究竟是什么,准确地说
命名是这一对比最先出错的地方,所以先在这里把它理清。我们列表中的 DeepSeek V4 Pro 对应的是deepseek/deepseek-v4-pro,发布于 2026 年 4 月 24 日,上下文长度为 1,048,576 token,最大输出 384,000 token,仅支持文本输入。Artificial Analysis 追踪的一个快照将其标注为 DeepSeek V4 Pro 0813——即 8 月 13 日的构建版本——下文引用的数据均出自该行。Sonnet 这边则是 Anthropic 的anthropic/claude-sonnet-5.5,支持文本、图像和文件输入,100 万上下文,128K 最大输出。如果你拿厂商页面和评测机构页面对比,发现数字对不上,先检查构建版本后缀,再下结论说其中一方有错。
DeepSeek V4 Pro 仅支持文本输入。Claude Sonnet 5.5 还能接收图像和文件。这是第一个结构性差异,而且并非微不足道:任何需要摄入截图、PDF 或图表的流水线,都不能简单地把其中一个换成另一个,因为其中一个看不见。
费率卡,逐行
• 输入 — DeepSeek V4 Pro 每百万 $0.66,而 Claude Sonnet 5.5 为 $2.00;DeepSeek 便宜 67%
• 输出 — 每百万 $1.98 对 $10.00;DeepSeek 便宜 80%,是本次对比中差距最大的一项
• 缓存读取 — 每百万 $0.022,对比 $0.20;在主导长时间智能体循环的这一项上,DeepSeek 便宜 89%
• 缓存写入 — 在 Claude Sonnet 5.5 上,五分钟窗口为每百万 $2.50;DeepSeek V4 Pro 的目录行不含单独的缓存写入条目
• 上下文 — 1,048,576 tokens 对比 1,000,000;DeepSeek 略长一些,这一区别没有实际影响
• 最大输出——384,000 个 token 对 128,000 个;在制约批量生成的上限上,DeepSeek 以三倍优势胜出
• 输入模态 — 仅文本 vs 文本、图像和文件
{{1}}推理{{/1}}——两者都使用可配置的推理力度,而非固定的思考预算,因此深度是各自请求中的一个参数
在 DeepSeek 这边有一个调度细节,是费率卡对比会掩盖掉的。我们的产品目录条目带有一个分时定价窗口:在世界标准时间 01:00 到 04:00 之间,以及再次在 06:00 到 10:00 之间,所列费率会乘以二。在这些时段,V4 Pro 的输入成本为 1.32 美元,输出成本为 3.96 美元——仍然比 Claude Sonnet 5.5 便宜,分别便宜 34% 和 60%,但已经不再拥有标题数字所暗示的那种价差优势。能够安排调度的批处理工作负载就值得安排调度,而不能安排调度的,则应按峰值费率而非平均费率来计价。这也是那种只有阅读产品目录、而不是营销页面时才会发现的事情,而这正是主张把所有候选模型放在同一个端点之后、而不是分散在三个供应商账户后面的理由。
两个能力数值,其中一个并非独立
在第三方评测方面,排名毫无争议。Artificial Analysis 在 Intelligence Index v4.3 上给 Claude Sonnet 5.5 打出 56 分,给 DeepSeek V4 Pro 打出 36 分,两者均采用最大推理投入配置。同一评估方给 Claude Opus 5 打出 51 分,给 Gemini 3.1 Pro Preview 打出 30 分,因此 V4 Pro 的 36 分使其低于 Anthropic 上一代旗舰,但高于 Google 的 Pro 档——对于一款价格仅为其五分之一的模型来说,这一位置已相当体面,但距离榜首仍相去甚远。
单任务成本的反转在这里也出现了,而在这场对比中,它的方向与上一场相反。DeepSeek V4 Pro 在索引套件上评估的成本为 0.67 美元。Claude Sonnet 5.5 的成本为 7.60 美元。这不是笔误,也不是四舍五入造成的假象:较新的 Anthropic 模型在整个套件中输出了 4.1 亿个 token,而中位数为 8800 万,并且 DeepSeek 模型的冗长程度远不足以弥合如此巨大的价格差距。在不受约束的开放式任务上,较便宜的模型在实践中便宜一个数量级,而不仅仅是在费率表上。
厂商数字需要更谨慎地处理。DeepSeek 为 V4 Pro 公布了 τ²-Bench 的 96.2 分,这是一个很强的分数,但它是厂商自报的,而 τ²-Bench 在 Artificial Analysis 指数的 v4.3 修订版中已被移除——因此这个数字无法被独立地放到与 Anthropic 所公布任何数据相同的标尺上。Anthropic 自己为 Claude Sonnet 5.5 发布的发布表也带有其自身的限定条件,其中包括一条脚注:在 FrontierCode 上,Max effort 设置的得分低于 Xhigh;以及一条说明:其中两项基准测试是在带有结构化输出 bug 的预发布部署上运行的。把两家厂商的表格并排放到一起,你得到的是两份营销文件,而不是一份排名。本文中唯一可以放在同一坐标轴上的数字,是两项指数得分和两项每任务成本,因为同一个评估方产出了全部四项。
为什么输出上限比价格更重要
在这场对比中,最不受关注的那个数字,恰恰是改变架构的那一个:384,000 个输出 token,对 128,000 个。
输出上限并不是一项舒适性功能。它决定了一个任务是一次调用,还是一串调用链。生成一个大型源文件、产出一份完整文档、撰写一份冗长的结构化报告、翻译一个书籍章节——凡是产物大于 128,000 个 token 的事情——都无法通过一次调用 Claude Sonnet 5.5 完成,必须拆解为一个序列,并在各次调用之间携带状态。拆解意味着每一步都要重新发送更多输入 token、更多的缓存读取、更多的编排代码,还会引入一类新的故障:错误恰恰藏身于各分块之间的接缝处。一个价格是五倍、但能省掉整个编排层的模型,在工程工时上可能更便宜——甚至早于它在 token 上变得更便宜;而反过来说,对于能塞进一次调用的任务,上限根本不会进入这道算术。
所以上限问题先于价格问题。如果你最长的产物能放进 128,000 个 token 以内,就忽略本节,按每个已完成任务的成本来比较。如果放不下,就要为你不得不搭建的流水线定价,而不只是算 token。
切换成本与回退问题
无论往哪个方向迁移,主要涉及的都是提示词而非代码,但有一个例外值得预留预算。
两个模型都通过 effort 参数来配置推理,但它们是不同厂商的参数,层级不同,默认值也不同。为 Anthropic 高 effort 设置调优好的提示词,迁移到 DeepSeek 的 effort 设置时并非对等替换,而是一次重新测量。在迁移的两端,每项工作负载都要预出一天时间来重新确立质量,之后才能相信成本预测。
例外是视觉。Claude Sonnet 5.5 可以读取图像和文件;DeepSeek V4 Pro 只能读取文本。在你的流水线中,任何把截图、扫描页或渲染图表交给模型的环节,都没有 DeepSeek 的对应能力,因此全面迁移只适用于你流量中文本形态的那部分。这是一条需要尽早划定的分界线,因为它通常意味着答案不是一个模型,而是一种拆分。
如今在 OrcaRouter 上,两者都可路由——deepseek/deepseek-v4和anthropic/claude-sonnet-5都已上线,按提供商标价、零加价计费,且共用同一份凭证。这一点恰恰在诸如此类的对比中最为关键:决定因素并非抽象意义上哪个模型更好,而是某个具体请求应当交给哪个模型。把纯文本的批量任务交给便宜的模型、把视觉任务交给昂贵的模型,这样的分工本身就是一条路由规则,而它在两个端点都归同一个密钥和同一套故障转移策略管辖时要容易表达得多。Claude Sonnet 5.5 本身尚未成为我们平台上的一条路由,因此这一搭配在今天的版本里是让Anthropic 的模型与 DeepSeek V4 Pro 组合,而非取而代之。
该决定,以规则形式陈述
当任务需要“看”——图像、PDF、截图、渲染输出——当产物的长度超过一页文字、而你希望由前沿模型来撰写时,或者当二十分的指数差距决定了一份草稿是需要人类重写还是可以直接交付时,就把它交给 Claude Sonnet 5.5。
当工作负载是文本输入、文本输出、高吞吐量,且能容忍较低的推理质量上限时,就把它发给 DeepSeek V4 Pro:分类、抽取、摘要、批量改写、有明确规范的代码转换,以及任何你本来会为每百万输出 token 花十美元来搬词的任务。89% 的缓存读取折扣让这个模型上的长上下文智能体循环在结构上变得廉价,这是对比中的其他任何东西都做不到的。
诚实的结论是:这并不是一场 DeepSeek 正在输掉的能力竞赛,而是一个资源分配决策,大多数团队都搞错了方向——去买他们根本用不上的能力。如果你的流量是文本,而你的质量门槛是“足够好,可以人工审阅”而不是“足够好,可以不经阅读直接发布”,那么以输出价格 20% 和 $0.022 缓存读取的 V4 Pro 就是正确的默认选择,而那二十个指数点就是你目前自愿支付的税。



本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
