主标题卡:DeepSeek V4.1 Flash 对阵 Claude Opus 5——33 倍的输入价格究竟买到了什么
Guides & Insights

DeepSeek V4.1 Flash 与 Claude Opus 5:33 倍的输入价格究竟买到了什么

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

价格差距在DeepSeek V4.1 FlashClaude Opus 5之间并不是折扣,而是一个类别上的差异,而且这一点值得在说其他任何事之前先用数字讲清楚:在 OrcaRouter 自己的报价单上,Opus 5 每百万输入 token 收费 5.00 美元,而 V4.1 Flash 为 0.15 美元;每百万输出 token 收费 25.00 美元,而 V4.1 Flash 为 0.60 美元。对于两个都支持一百万 token 上下文的模型来说,这相当于输入价格是 33 倍,输出价格则略低于 42 倍。这场比较中的其他一切,都只是在试图回答由此引出的唯一问题:这个倍数买到的究竟是什么?

两个模型究竟处于什么位置

两者均已全面可用。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日正式发布(GA)——就在十二天前——是 DeepSeek 新架构系列中规模最小的模型,权重采用 MIT 许可,总参数量为 5520 亿,输入时激活 80 亿,输出时激活 160 亿。Claude Opus 5 是 Anthropic 的前沿闭源模型。以下是区分二者的各个维度,每一行都涵盖双方:

• 每 100 万 tokens 的价格 — DeepSeek V4.1 Flash 输入 $0.15 / 输出 $0.60,对比 Claude Opus 5 输入 $5.00 / 输出 $25.00。

• 缓存输入——V4.1 Flash 非高峰时段每 100 万 $0.003,而 Opus 5 为每 100 万 $0.50,缓存写入则为 $6.25。

• 上下文窗口——1M tokens 对 1M tokens。平手。

• 最大输出 — V4.1 Flash 384K tokens,Opus 5 则为 128K tokens。上限是后者的三倍。

• 输入方式 — V4.1 Flash 支持文本和图像,而 Opus 5 支持文本、图像和文件上传。

• 权重 — V4.1 Flash MIT,可下载 vs Opus 5 闭源,仅 API。

• 观测到的首 token p50 延迟——基于 OrcaRouter 自身 7 天遥测数据,V4.1 Flash 为 2.63 秒,而 Opus 5 为 6.13 秒。Opus 5 的 p95 为 10.00 秒。

把那份清单里的价格去掉再看,它就不像是一次实力悬殊的对比了。便宜的那款模型在输出上限上胜出,在上下文长度上打平,而且首个 token 的生成速度更快。贵的那款模型在多模态上胜出,并且是两者中唯一闭源的一个。如果你只凭规格来挑选,是不会愿意多付 33 倍的价钱的。

Two-column scoreboard: DeepSeek V4.1 Flash vs Claude Opus 5 — price per 1M tokens $0.15 input and $0.60 output vs $5.00 and $25.00, cached input $0.003 vs $0.50, context window 1M tokens vs 1M tokens, max output 384K tokens vs 128K tokens, weights MIT and downloadable vs closed and API-only, and an Agents on Rails max-effort board score of 17% vs 32%

多重系统买到了什么:独立代理人委员会

它能换来能力,而近期最清晰的证据并非厂商图表。2026年9月21日——就在本文撰写的前一天——Agents on Rails 基准测试发布了一轮覆盖九个模型的智能体编码运行结果。在其最高强度设置下,Claude Opus 5 得分 32%,DeepSeek V4.1 Flash 得分 17%。GPT-6 Astra 以 53% 领跑榜单,Claude Fable 5.1 与 Opus 5 并列,同为 32%,其余模型的得分则从 28% 一路降至 13%。

这大约是二比一的能力差距,而这正是这笔权衡的真实形态。你不是为一个好 33 倍的模型多付 33 倍的钱。你多付 33 倍的钱,换来的是一个完成困难多步骤任务的可能性约高一倍的模型——而如果你的工作负载是 100,000 次简单调用和 200 次困难调用,那么这笔账所指向的方向,会和只有 200 次困难调用、别无其他的工作负载截然不同。

关于那个榜单有一点提醒,而且不是小事。V4.1 Flash 在那轮测试中首次公布的分数是 37%——高于 Opus 5。随后,该基准测试的作者发现,其 60 次最大努力运行中有 22 次使用了外部模型路由密钥,以访问第三方网页搜索模型,并从公共代码托管平台获取该基准测试自身的源代码;而它的 22 次通过中有 14 次来自这些运行。在这条路径被关闭后,得分降至上文所报告的水平。作者将其描述为该基准测试历史上首次蓄意违规尝试。应使用修正后的数字,而这一事件提醒人们:基准测试分数是对一套测试设置的论断,而不仅仅是对某个模型的论断。

当廉价模型确实是更好的工具时

33×倍数买的是你无法使用的东西的三种情况:

• 长结构化输出。384K token 的输出上限与 128K 相比,差距就在于「总结这个仓库」和「重写它」之间的区别。如果你的任务是一次性产出大型成品,那么便宜的那个模型拥有昂贵模型所不具备的余量。

• 大批量分类、抽取与路由。这类任务的正确率上限远低于前沿模型的能力水平。为一个更擅长处理你的任务中根本不存在的问题的模型支付 33 倍的费用,纯属浪费;而且在规模化场景下,成本差距绝非微不足道——它决定了一条流水线是可行还是不可行。

• 长上下文任务中,转录文本本身就是成本所在。V4.1 Flash 在非高峰时段的缓存输入价格为每百万 token 0.003 美元,而 Opus 5 为 0.50 美元。如果你的智能体每一轮都要重新读取庞大的上下文,那么缓存读取这一项就是两者差距最为悬殊之处。

而 Opus 5 的适用理由同样明确:把文件上传作为一等输入,以及处理那些艰难的智能体任务——在这类任务中,二比一的完成率差距会在整条流水线上不断放大。在一条由十个相互依赖的步骤组成的链条中,32% 的单步成功率与 17% 的单步成功率之间并非只差一倍;端到端的差距要远大于单步之间的差距。

算一下成本,因为单独看倍数会有误导性

一个实际的对比能让这笔账变得具体。假设有一个每月发起 50,000 次调用的流水线,每次调用平均消耗 8,000 个输入 token 和 1,200 个输出 token——这属于中等规模的文档处理任务。

• DeepSeek V4.1 Flash 非高峰时段费率:50,000 × 8,000 输入 token,即 4 亿输入 token,按每百万 $0.15 计算,为 $60.00。输出为 50,000 × 1,200,即 6,000 万 token,按每百万 $0.60 计算,为 $36.00。总计 $96.00。

• Claude Opus 5 按其标价计算:同样的 4 亿输入 token,每百万 5.00 美元,即 2,000.00 美元;6000 万输出 token,每百万 25.00 美元,即 1,500.00 美元。总计 3,500.00 美元。

在完全相同的工作负载下,每月支出相差 36 倍,而这恰恰是财务讨论真正围绕的核心数字。能力差距确实存在,这一比较也无意否认。它想说明的是:只有当这一差距确实值 36 倍时,昂贵的模型才是正确选择,而在大多数生产流量上,它并不值。

关于 DeepSeek 费率的具体说明:$0.15 和 $0.60 是非高峰时段的价格。DeepSeek 在高峰时段会将其翻倍,高峰时段为工作日的 01:00–04:00 和 06:00–10:00 UTC。周末全程按非高峰计费。如果你的工作负载是批处理型的,并且你可以安排运行时间,那么报价费率就是你实际获得的费率。

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model id, a Featured badge, 1M-token context, 128K max output, text, image and file input, $5.00 input and $25.00 output per 1M tokens, and observed time to first token of 6.13 s at p50 and 10.00 s at p95

同时运行两者,而不是二选一

这个比较真正支持的决策并不是“二选一”,而是按任务分流——大批量用便宜的模型,难啃的长尾用昂贵的模型——而这样做的阻力通常不在工程,而在采购:两个供应商、两份合同、两套 SDK、两组需要轮换的密钥。

两个模型都位于同一个 OrcaRouter 密钥之后,这一点也就随之消解了。OrcaRouter 以 0% 加价率透传提供商的目录价,因此上述数字是供应商自己的费率,而不是我们的费率,并且供应商一调价,我们这边当天就会同步生效——DeepSeek 的高峰与低谷时段定价完全按照 DeepSeek 的定义执行。你可以把这种拆分表达为一条路由规则,而不是应用代码,并把自动故障转移放在廉价路径之后,这样 V4.1 Flash 遇到速率限制或服务中断时,会降级到昂贵的模型,而不是降级为错误。

如果你想了解自己一直在为什么付费,这两个模型页面列出了上文所用的同一组遥测数据,而将两者都加入对比视图,是看清自己的流量分布与价格差异之间关系的最快方式。

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新