Claude Opus 5:Anthropic 的准前沿模型,价格仅为 Fable 5 的一半
Guides & Insights

Claude Opus 5:Anthropic 的准前沿模型,价格仅为 Fable 5 的一半

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年7月24日,Anthropic发布了Claude Opus 5——不到一天,它就实现了一件对于“更便宜”模型来说罕见的事:登上了独立排行榜榜首。Anthropic宣称Opus 5达到了接近前沿智能的Claude Fable 5,以一半的价格,并于同一天在Claude.ai、Claude API、Claude Code和Claude Cowork上上线。此后,Artificial Analysis将其评为智能指数第一名。本指南将介绍Opus 5究竟是什么、哪些是独立验证的而哪些是供应商报告的、其新的努力调节旋钮和安全姿态、实际使用成本,以及哪些用户应该切换。

下面的每个数字都标注了来源,因为在这个速度下,故事每天都在变化:发布日上写着“尚无独立评分”的内容,现在已变成“独立第一”。基准测试和价格都在变动——在承诺预算之前请先核实。

简而言之。Claude Opus 5 的定价为每百万输入 tokens 5 美元、每百万输出 tokens 25 美元——与 Opus 4.8完全相同,且恰好是 Fable 5 的 10 美元/50 美元的一半。在 Artificial Analysis Intelligence 指数中,它现在以 61 分(最大努力模式)领先于 170 个评估模型中的最高分,略超 Fable 5(60 分),并以一半的成本达到了同级别水平。Anthropic 自家的发布基准也印证了这一点:Frontier-Bench v0.1 得分 43.3%(对比 Fable 5 的 33.7%),并在 Zapier 的 AutomationBench 和 OSWorld 2.0 电脑使用基准测试中领先。它不只是一次降价,还有两个亮点:一个努力程度旋钮(低/中/高/最大),可按请求在成本与能力之间权衡;以及迄今为止所有 Opus 中最强的安全防护。如果你已经在使用 Claude 进行开发,升级风险低且不会增加账单;如果你正在各大旗舰模型之间做选择,Opus 5 现在是价值与质量的领先者——请用你自己的工作负载来验证。

关键要点

• 现在独立排名第一。Artificial Analysis 将 Claude Opus 5(最大努力模式)在其智能指数上列为 61 分——排名最高的模型,领先于 Fable 5(60 分)。

• 价格仅为Fable 5的一半。每100万Token收费5美元/25美元,与Opus 4.8相同,仅为Fable 5的10美元/50美元的一半——以中端价格提供前沿领先质量。

• 新的努力刻度盘。低/中/高/最大设置用代币(成本)换取能力;"最大"是排行榜榜首,更便宜的设置仍能击败大多数竞争对手。

• 专为代理和计算机使用而设计。Anthropic强调的是完成多步骤任务(AutomationBench)和操控真实用户界面(OSWorld 2.0),而不仅仅是给出单一答案。

• 迄今最安全的 Opus。Anthropic 称其为“最对齐的 Opus 模型”,预计其网络分类器的干预次数将比 Fable 5 减少约 85%——对合法工作的错误拒绝更少。

• 广泛、即时可用。Claude Max 上的默认模型,Claude Pro 上最强的模型,并且从第一天起就已在 API、Claude Code 和 Claude Cowork 上上线。

关于阅读本简报的说明:所有归属于Anthropic的内容均为发布材料中的供应商声明;独立数据(Intelligence Index)则归因于Artificial Analysis。对于尚未公布的数字(如单独的SWE-bench Verified得分),我们如实说明而非猜测。

Claude Opus 5 到底是什么

Opus 5 是 Anthropic Opus 系列的最新成员——位于 Sonnet 和 Haiku 之上的“重型”层级。它排在 Opus 4.8 之上,在独立智能指数中,现已略微领先于 Anthropic 2026 年 6 月的旗舰前沿模型 Fable 5。其引人注目之处并非能力的微小提升,而是以下组合:以实用级价格提供接近顶尖水平的智能。Anthropic 将其描述为一种“深思熟虑且积极主动”的模型,专为编码、智能体工作流程以及日常企业办公室工作而设计。

具体来说,Opus 5 的定价为每 100 万个输入代币 5 美元,每 100 万个输出代币 25 美元。这与 Opus 4.8 相同,是 Fable 5 定价(10 美元 / 50 美元)的一半。它是 Claude Max 的默认模型,也是 Claude Pro 上最强大的选项,并且从发布之日起可通过 Claude API、Claude Code(用于编码)和 Claude Cowork(用于协作代理工作)使用。其上下文窗口为 Opus 系列百万级。

实际上有什么新内容

最清晰的发布日信号是Anthropic的Frontier-Bench v0.1,这是一个高难度的推理与任务套件:Opus 5得分为43.3%,而Fable 5为33.7%,Opus 4.8为18.7%。在该基准测试中,Anthropic更便宜的新模型超过了自家更昂贵的旗舰产品——这一说法随后也得到了独立评分的印证。

又有两项第三方基准测试充实了“为实际工作而生”的故事。在Zapier的AutomationBench上——该基准测试衡量模型是否将商业任务执行到底,而非仅仅启动任务——Anthropic表示,Opus 5的通过率按匹配成本计算约为次优模型的1.5倍,并且即便使用其最便宜的推理设置,也超越了所有竞争对手的最佳结果。在计算机使用基准测试OSWorld 2.0上,Anthropic报告称Opus 5在每个价格点均超越对手,并仅用约三分之一的预算就达到了Fable 5的最高分。在Anthropic跟踪的所有生命科学评估中,Opus 5相比Opus 4.8也有提升,其中最大的跃升——超过10个百分点——出现在有机化学任务上,例如从光谱数据读取分子结构。

努力调节盘:只为所需的能力付费

最引人注目的特性——也是大多数评测者关注的焦点——是努力程度设置。Opus 5 让你选择模型在回应请求时投入多少努力:低、中、高或最高。更高的努力意味着更多的内部推理令牌(因此成本和延迟更高)和更高的质量;较低的努力则节省令牌,以获得更快、更便宜的答案。实际上,它就像是你的AI账单上的一个调节旋钮。

这就是为什么Artificial Analysis列出了多个Opus 5条目(medium、high、xhigh、max):每种投入水平对应成本-质量曲线上的不同点。目前,"max"设置以61分位居智能指数榜首;较低设置则牺牲少量质量,以显著降低每任务成本,而即便这些较低设置,据Anthropic称,也超越了大多数竞争对手的最佳结果。实际上,这意味着一个模型既能服务于你对延迟敏感、高并发的调用(low/medium),也能处理你最困难的推理任务(high/max)——你可以按请求调整参数,而无需切换模型。

基准测试深度剖析:这些测试实际衡量什么

在信任每个数字之前,了解其含义是有帮助的。该Artificial Analysis Intelligence Index是由第三方运行的许多独立评估(推理、数学、编码、知识)组成的综合指数;Opus 5在170个模型中以61分排名第一,这是这里最可信的单一信号,正是因为Anthropic没有运行它。Frontier-Bench v0.1(Opus 5为43.3%)是Anthropic自己的难题集——这是一个相对信号,表明Opus 5比Fable 5(33.7%)或Opus 4.8(18.7%)解决了更多难题,而不是学校意义上的'43%正确'。

AutomationBenchOSWorld 2.0如果你的用例是智能体,那么它们比单一的推理分数更重要。AutomationBench奖励任务完成——区别在于一个只起草邮件的智能体和一个实际提交费用报告的智能体——而OSWorld 2.0奖励操控真实的计算机用户界面。Anthropic声称Opus 5以三分之一的成本达到Fable 5的OSWorld峰值,现在由于Intelligence Index证实了其总体地位,这是一个将智能体工作负载迁移到Opus 5的有力论据。唯一不足:目前还没有独立的经过审计的Opus 5的SWE-bench Verified数据(Fable 5为95.0%,Opus 4.8为88.6%),所以如果纯粹引用编码准确性,请等待这个数字。

实际成本是多少

每次token的价格是抽象的;每次任务才是账单上实际反映的。以一个代表性的代理步骤为例,输入2万token,输出3千token。Opus 5(以及Opus 4.8):输入2万×$5/1M=$0.10,输出3千×$25/1M=$0.075,所以每次调用约$0.175。而Fable 5按$10/$50计算:输入$0.20 + 输出$0.15 = 约$0.35——价格几乎翻倍。若每月有10万次这样的调用,Opus 5的费用约为$17,500,而Fable 5则约为$35,000。由于Intelligence Index目前将Opus 5排在Fable 5之前,这不再是“近似Fable 5但更便宜”,而是以大约一半的月费获得领先等级的质量。

努力程度调节器再次改变了计算结果。一个高容量的支持渠道可以用低或中等努力程度来处理大多数来电——比上述数字更便宜——并将最大努力保留给少数真正棘手的工单。Anthropic的框架是,即使廉价的设置也胜过竞争对手的最佳配置,因此你很少为自己不用的功能付费。建立你自己的努力程度混合模型,而不是假设每个来电都以最大努力运行。

如何访问和使用Claude Opus 5

Opus 5 现已即刻在五个地方可用:Claude.ai(在 Max 计划中它是默认选项,在 Pro 计划中是最强选项)、Claude API(模型 ID 见 Anthropic 文档)、Claude Code(用于终端和 IDE 编码)以及 Claude Cowork(用于协作、多步骤智能体工作)。API 用户将努力级别设置为一个参数,因此每次请求的成本-能力权衡是可编程的。如果你已经在调用 Opus 4.8,切换到 Opus 5 只需更改模型 ID,价格不变——这是 Anthropic 一段时间以来推出的摩擦最小的升级。

适用对象:三种场景

1. 代理和计算机使用流水线

如果您的产品运行多步骤代理或驱动浏览器或桌面,Opus 5 的 AutomationBench 和 OSWorld 2.0 结果直接针对您——现在由独立的 #1 智能指数支持。以中等投入运行大多数步骤,对困难的步骤升级到高/最大投入;在承诺之前先在自己的代理轨迹上进行试点。

2. 关注预算的编码团队

Opus 5从第一天起就以Opus 4.8的价格在Claude Code中提供。凭借其Intelligence Index领先优势,它是一款强大的默认编程模型;唯一缺失的引用是独立的SWE-bench Verified分数(Fable 5仍以95.0%的分数保持该记录)。对于已在用Claude的团队而言,此次升级风险低且没有涨价。

3. 企业标准化于单一模型

广泛的可用性、百万级上下文、最安全的Opus对齐配置,以及覆盖廉价批量任务与高难度推理的用力调节旋钮,让Opus 5成为混合办公+工程工作中合理的单一默认选择——其成本远比前沿旗舰机型更容易被接受。

安全和对齐

Anthropic 将 Opus 5 定位为其最安全的 Opus 版本:"最对齐的 Opus 模型",以及"最不容易被诱骗滥用的模型"。一个实际后果对真实部署至关重要:Anthropic 预计 Opus 5 的网络分类器干预频率将比 Fable 5 低约 85%。通俗地说,这意味着在合法安全、编码或研究工作上的错误拒绝将更少——这是对设有严格防护的尖端模型常见的痛点——同时仍能阻止真正的滥用行为。一如既往,请根据您自身的内容和合规要求进行验证,而非盲目信任这一姿态。

Fable 5 出口管制故事现在已包含在系统提示中。

Fable 5 的发布绝非一帆风顺,任何将Claude Opus 5与之进行比较的人都需要了解这一背景。在Claude Fable 5和 Claude Mythos 5 于2026年6月9日发布三天后,Anthropic 为遵守美国商务部的出口管制令,暂停了这两款模型;6月30日管制解除,7月1日恢复访问。这一经过有据可查——Simon Willison 实时看到 Anthropic API 开始返回错误,Anthropic 也发表了自己的声明说明暂停和恢复的情况。

新颖之处在于 Opus 5 如何处理关于该事件的问题。该模型的训练截止日期为 2026 年 5 月,因此暂停及其撤销均超出其所学知识的范围。红队测试者 Pliny the Liberator 于 7 月 25 日发布的约 20 万字符的 Claude Opus 5 系统提示词——Anthropic 尚未确认该文档与生产环境一致——记录了完整的时间线,并指示模型坦率回答关于暂停的问题而非予以否认,同时在无法确认当前状态时引导用户查阅 Anthropic 的官方声明。这是一个具体例证,说明供应商如何将训练截止日期之后的历史写入提示词,以避免模型对其自身所属系列进行即兴编造。

何时不应使用

当你今天需要引用一个经过独立审计的SWE-bench Verified编码数据时,不要直接使用Opus 5——该数据尚未公布,Fable 5(95.0%)仍保持该记录。不要假设每个努力设置都是#1;排行榜领先的61是最高设置,较低设置会在质量与成本之间权衡,因此请对你实际运行的努力水平进行基准测试。对于纯高吞吐量、延迟敏感且无需推理的文本,更便宜的效率层模型(例如Gemini 3.6 Flash价格为1.50美元/7.50美元)每token仍更便宜——Opus 5是一个推理和智能体模型,而非批量文本模型。

常见问题

Claude Opus 5 多少钱?

每100万输入代币5美元,每100万输出代币25美元——与Opus 4.8相同,是Fable 5的10美元/50美元的一半。[Anthropic]

Opus 5真的是#1模型吗?

在人工智能分析智体指数(Artificial Analysis Intelligence Index)上,截至本文撰写时:Claude Opus 5(最大努力模式)以61/170的成绩领先于Fable 5(60)。这是一个独立评分,而非供应商声称。其他排行榜和您自己的工作负载可能给出不同排名,并且随着模型的增加,排名会变化。

什么是努力拨盘?

一个按请求设置的选项(低/中/高/最大),通过交换令牌(从而交换成本和延迟)来换取能力。“最大”在排行榜上名列前茅;根据Anthropic的说法,更便宜的设置仍然击败大多数竞争对手。API用户将其设置为一个参数。

Opus 5 比 Fable 5 更好吗?

在独立的智力指数(61比60)和Anthropic的Frontier-Bench v0.1(43.3%比33.7%)上,是的——以一半的价格。Fable 5在独立测量的SWE-bench Verified(95.0%)上仍然领先,所以对于纯粹的编码准确性引用,Fable 5保住了那个特定的王冠。

Opus 5 与 Opus 4.8 相比如何?

相同的$5/$25价格,实质更高的供应商基准(Frontier-Bench v0.1 43.3% vs 18.7%),以及每个追踪的生命科学评估均有提升,再加上新的努力拨盘和更安全的对齐。对于现有4.8用户,这是一次不加价的升级。

它有多安全?

Anthropic称其为最对齐的Opus模型,也是最不易被滥用的,并预计其网络分类器的干预频率将比Fable 5低约85%——通常对合法工作的错误拒绝更少。

我可以在哪里使用 Claude Opus 5?

Claude.ai(在Max上默认,在Pro上最强)、Claude API、Claude Code以及Claude Cowork——自2026年7月24日起上线。

什么是上下文窗口?

Opus系列100万token级别(Opus 4.8是100万token,无长上下文附加费)。Anthropic尚未单独公布Opus 5的数据,因此在确认之前将其视为100万token级别。

它支持图片或视频吗?

Opus 5 主要是一个文本与工具推理模型。对于重度多模态(图像/视频)理解,像 Gemini 3.1 Pro 这样的模型是专门构建的;使用 Opus 5 处理文本、代码和智能体。

底线

Claude Opus 5 的发布远不止是一次定价调整。它的定价像一台可靠的生产力工具——5美元/25美元,价格是Fable 5的一半,与Opus 4.8相同——但它目前在独立的人工智能分析智能指数(Artificial Analysis Intelligence Index)中以61分(最大努力)领先,背后有强劲的供应商基准(Frontier-Bench v0.1 43.3%、AutomationBench、OSWorld 2.0)、一个真正实用的努力拨盘,以及所有Opus模型中最安全的对齐配置。唯一的缺憾是仍然缺少独立的SWE-bench Verified数据,而Fable 5(95.0%)在此保持编程准确性的引用。对于现有Claude用户来说,升级风险低且不会增加账单;对其他用户而言,Opus 5现在是性价比之王——在你自己的工作负载上验证它,并通过OrcaRouter的一个OpenAI兼容端点与所有竞品一起路由。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube