
Claude Opus 5.5:Anthropic 的旗舰模型,完整规格详解
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 140 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 78 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 294 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Opus 5.5是厂商当前的旗舰模型,于 2026 年 9 月 22 日发布;按照厂商如今的文档说明,它位于 Claude 产品线中段:比其上方的 Claude Fable 5.1更便宜、更快速,比其下方的 Claude Sonnet 5.5更贵、更慢,并且是 Opus 产品线顶端的 Claude Opus 5的直接继任者。厂商自家的模型选择器对它的定位给出了最简明的概括:“大多数工作负载”直接从 Claude Opus 5.5 起步;而“要求严苛的推理与长周期智能体任务,或者在 Claude Opus 5.5 上以更高 effort 运行后评估结果仍不达标时”,则改用 Claude Fable 5.1。本页正是这一指引所指向的模型的参考页——涵盖其能力边界、完整费率表、每一项已公布成绩背后的 effort 设置、独立解读,以及它实际运行的位置。若读者希望深入了解其中某一项,本页只做引导而不重复:费率表的计算、含跨模型对比列的完整基准表,以及迁移细节,各自都有专门的页面。
Claude Opus 5.5 是什么,以及它在产品线中的位置
Anthropic 将 Claude Opus 5.5 描述为“为长时间运行的智能体编程和知识工作”而构建,并介绍它是“我们全新的 Claude 5.5 家族中的首个模型”。它取代 Claude Opus 5,成为该公司正式可用的旗舰模型;Claude Opus 5 仍作为遗留模型列出,并继续提供服务。正如 Anthropic 自己的模型概览所给出的,这四款模型组成的产品线短到可以一次说完:
• Claude Fable 5.1 — 每百万 token 输入 10 美元、输出 50 美元,相对延迟标注为更慢,自适应思考始终开启,默认努力程度为高,100 万 token 上下文,最大输出 128K,可靠知识截止日期为 2026 年 6 月。Anthropic 将其定位在旗舰型号之上,并据此定价。
• Claude Opus 5.5——每百万 token 输入 $4、输出 $20,对比延迟中等,自适应思考始终开启,默认 effort 为 medium,1M token 上下文,最大输出 128K,知识截止日期为 2026 年 6 月。它是整个产品线中唯一支持 effort 参数且默认值并非 high 的模型,而这个细节的重要性远超表面——参见下文关于 effort 的部分。
• Claude Sonnet 5.5 — 每百万 token 输入 $2、输出 $10,相对延迟快,自适应思考,默认强度 high,1M token 上下文,最大输出 128K,可靠知识截止日期为 2026 年 6 月,退役时间不早于 2027 年 9 月 28 日。
• Claude Haiku 4.5 — 每百万 token 输入 $1、输出 $5,相对延迟最快,支持扩展思考,无 effort 参数,200K token 上下文,最大输出 64K,不早于 2026 年 10 月 15 日退役。
对那张表的两种解读经常出错,值得专门点明。第一种是对价格变动方向的误读:Claude Opus 5.5 比它所取代的模型更便宜,而非更贵——$4/$20,对比 Claude Opus 5 的 $5/$25——并且在输入价格上仅为 Claude Fable 5.1 的五分之二。第二种是对与 Claude Fable 5.1 之间差距的含义的误读。Anthropic 报告称,Claude Opus 5.5 在若干已发布任务上达到或超过 Fable 5.1,而每任务成本仅为后者的五分之一到三分之一,同时仍将真正严苛的推理工作向上层引导;这是针对具体图表提出的每任务成本主张,而非关于更便宜的模型就是更强的模型的普遍主张,基准测试页面也让这一区别保持可见。Anthropic 还预告了接下来的动作:“Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周内跟进”,并带来“性能、效率和安全方面许多相同的改进”。这句话后来已部分得到印证:Claude Sonnet 5.5 已于 2026 年 9 月 28 日发布,而 Claude Haiku 5.5 尚未出现——截至 2026 年 10 月 7 日查看时,Anthropic 的模型概览仍将 Claude Haiku 4.5 列为当前的小型模型。
发布于2026年9月22日——以及为何日期本身并非这里的重点
发布日期在 Anthropic 自己的页面上被记录了两次:公告页注明的日期是 2026 年 9 月 22 日,而模型页面则写有“最新。发布于 2026 年 9 月 22 日。”。本文中的规格数据是在 2026 年 9 月 28 日从 Anthropic 自己的文档、Artificial Analysis 或我们自己的模型 API 中读取的,并且每一项都标注了它来自其中哪一个来源;可用性部分中关于当前最新情况的陈述,已于 2026 年 10 月 7 日对照这些相同的页面重新核查,并在那里注明了日期。
Anthropic 承诺,在其自主运营的平台上为 Claude Opus 5.5 提供支持,“不早于 2027 年 9 月 22 日”;Amazon Bedrock 和 Google Cloud 则各自设定自己的生命周期日期。每个 Claude 模型 ID 都是固定的快照,包括从 4.6 代起使用的无日期 ID,因此 claude-opus-5-5 并不是一个会在你脚下漂移的指针。
为什么这个页面是参考,而不是第二个发布故事
这一点值得直白说明,因为对于一篇关于2026年9月22日发布的模型的页面,最显而易见的解读是它属于发布报道,而事实并非如此。这是一款如今已在我们目录中上线的模型的规范参考页面——读者是通过搜索该模型自身的名称,而不是通过阅读新闻资讯流之后才抵达的页面。它的依据是我们以第一方数据测得的持续性搜索需求,而不是一次发布的新鲜度;此处出现的9月22日发布日期,是一个为该模型标注日期的既成事实,而不是本文正在报道的事件。
这个区分具有关键支撑作用。本博客的存档中已经存在关于 Claude Opus 5.5 的发布文章、泄露报道、对比页面和若干应用类文章,再多一篇公告也只会是已有工作的重复。此前不存在的是位于所有这些内容之下的那个页面:读者在任何专门页面变得有用之前所需要的导引。因此,那些确实各自负责一个主题的内容——定价、基准测试和 API 接口面——都从这里链接过去,而不是重新展开论述,而本页则专注于自己的职责。
信封
摘自 Anthropic 的 Claude Opus 5.5 模型页面及其模型总览,两者均于 2026 年 9 月 28 日读取:
• 上下文窗口 — 1,000,000 个 token。Anthropic 并未公布该窗口的字数,只给出了针对英文文本的粗略换算:"1 个 token 约等于 4 个字符或 0.75 个单词",而确切数量会因语言和内容类型而异。在这个数字旁边,还有一点关于分词器的提醒:Claude 4.7 及之后的模型(包括 Claude Opus 5.5)使用了更新的分词器,相同的输入大约会多出 30% 的 token,因此按较早的 Claude 模型来估算长度的提示词,并不能填满同一个窗口。
• 最大输出 — 在 Messages API 上同步为 128,000 个令牌。在 Message Batches API 上,借助 output-300k-2026-03-24 beta 标头,该上限可提升至 300,000 个令牌。
• 模态 — Anthropic 的文档将输入记录为文本和图像,输出为文本,并列出了当前全系产品的视觉、工具使用和多语言能力。我们自己的该模型目录条目还额外接受一种文件输入类型,而供应商页面并未列举这一点。
• 知识截止时间——可靠知识截止至2026年6月;训练数据截止时间同样为2026年6月。
• 模型 ID — claude-opus-5-5适用于 Claude API、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform;anthropic.claude-opus-5-5适用于 Amazon Bedrock。
• 状态 — 活跃(最新),在 Anthropic 运营的平台上承诺的退役时间不早于 2027 年 9 月 22 日。

费率卡,完整版
以下所有内容均为 Anthropic 公布的价格,读取于 2026 年 9 月 28 日。价格按每 token 计。
• 输入 — $4.00
• 输出 — $20.00。思考令牌按输出令牌计费,而 Claude Opus 5.5 的自适应思考无法关闭,因此思考并非一个你可以单独屏蔽的独立计费项。
• 缓存读取 — $0.20,Anthropic 将其列为基准输入价格的 0.05 倍。该倍率是针对此模型的特殊豁免:价目表上的标准费率为 0.1 倍,只有 Claude Fable 5.1 和 Claude Mythos 5.1 更低,为 0.025 倍。
• 5 分钟缓存写入 — 5.00 美元,标准的 1.25 倍基础输入倍率。
• 1 小时缓存写入 — $8.00,即标准的 2 倍乘数。可缓存提示词的最小长度为 512 个 token。
• Batch API — 双向均享 50% 折扣:输入 $2.00,输出 $10.00。
• 快速模式 — 输入 $8.00、输出 $40.00,恰好是标准价格的两倍,Anthropic 将其描述为研究预览版。它仅在官方 Claude API 上运行,Claude Platform on AWS 或合作伙伴云平台上均不提供,也不支持 Batch API。
• 仅限美国境内推理——将 inference_geo设为 "us"会对输入、输出、缓存写入和缓存读取应用 1.1 倍乘数。全局路由(默认设置)则使用标准定价。
• 无长上下文附加费——Anthropic 表示,Claude 4.6 及更高版本的模型在标准定价下即包含完整的 100 万 token 上下文窗口,因此 900,000 token 的请求与 9,000 token 的请求按相同的每 token 费率计费。
• 工具使用系统提示 — Anthropic 自己的 token 计数表将 Claude Opus 5.5 的工具使用系统提示计为 286 个 token,当工具选择为 auto 或 none 时。
读者真正关心的成本问题不是价目表,而是账单,而这属于另一个页面的主题:定价页面会详细梳理每完成一项任务的成本、缓存行在漫长的智能体运行中起什么作用,以及供应商“运行成本大约低40%”的说法能在多大程度上从表格中得到验证。
努力、思考,以及每一个已发布分数背后的背景
这是大多数发布报道会略过的规格部分,而正是这部分改变了基准测试数字的含义。Claude Opus 5.5 的自适应思考始终开启且无法禁用——Anthropic 表示,设置thinking: {"type": "disabled"}的请求会在每个 effort 级别返回 400 错误,而不仅仅是高等级。扩展思考,即手动的 budget_tokens 模式,是更早的机制:Anthropic 将其记录为在 Claude Opus 4.6 和 Claude Sonnet 4.6 上已弃用,并且在后续模型上不被接受。因此在 Claude Opus 5.5 上,控制方式是 output_config.effort,别无其他。
共有五个等级:low、medium、high、xhigh和max。Claude Opus 5.5 支持全部五个等级。它的默认值是medium——它是唯一既支持该参数、又不默认使用high的模型——这意味着从 Claude Opus 5 迁移过来、未显式设置effort值的配置,运行时等级会比以往低一级;而 Anthropic 的建议是:不要直接沿用原有设置,而应在自己的评测集上重新做一轮 effort 扫描。将 effort 设为该模型的默认值,其行为与省略该参数完全一致。Effort 会引导响应中的所有 token,包括思考 token,而 Anthropic 明确表示它“是一种行为信号,而非严格的 token 预算”。会话中途的更改可通过按消息生效的 effort beta 标头 mid-conversation-output-config-2026-07-01 来支持,该标头会保持提示缓存完好——而请求之间的顶层更改则不会。
effort 之所以应放在参考页上,是因为 Anthropic 公布的结果并非都在同一个设置下运行。公告中有一条长期说明——“除非另有说明,所有 Claude Opus 5.5 结果都在 max effort 下使用自适应思考”——随后又按基准分别注明例外情况。这样读来,这张表看起来就是这样:
• Terminal-Bench 4.0 — 66.4%,是在 xhigh 努力级别下报告的。 这是其中一项覆盖说明,而且是双向的:Anthropic 在同一张图表上报告 GPT-6 Astra 处于 high 努力级别,并称这两个数字“代表各模型的最高分”。一个模型处于 xhigh、另一个处于 high 的比较,并非同等努力下的比较,而正是 Anthropic 自己的脚注告诉了你这一点。
• FrontierCode v1.1(Main)— 54.6%,在默认强度(中等)下。 Anthropic 指出,它超过了 GPT-6 Astra 53.3% 的最高分,而每项任务的成本仅约为其五分之一。
• CursorBench 4.0 — 52.5%,在默认努力程度(中等)下。相比之下,Claude Fable 5.1 在最大努力下为 51.8%,Claude Opus 5 在最大努力下为 46.6%。再次注意这种不对称:Claude Opus 5.5 的数字是在比另外两个模型的最佳水平低一档的设置下产生的。
• GDPval-AA v2.1 — 1846 Elo,最高努力程度下。在同一图表中,Claude Fable 5.1 得分为 1735,Claude Opus 5 得分为 1708。
• 其余所有已发布内容——均按最高努力级别,依据既定说明。这涵盖 OSWorld 2.0 和 Chartography 的图表,其标签("partial" 和 "with tools")描述的是任务如何计分,而非由哪个努力级别产生;两个图表均未附带覆盖标记,因此都归入全局说明之下,而非例外。
还有两点注意事项应当与那些数字并列,而不是放在脚注里。Anthropic 公布了标准误差——Claude Opus 5.5 在 Terminal-Bench 4.0 上为 ±2.6 点,其他 Claude 模型为 ±1.6 到 2 点,而在 Terminal-Bench-Science 0.1 上每个模型为 ±3.5 到 5 点——并且它对照公开排行榜核验了两项结果,将 Claude Opus 5 已公布的 51.8% 复现为 52.3%,并将其已公布的 30.0% 复现为 29.0%。另外,其 AutomationBench 数据是在没有回退模型的情况下生成的,这与配有回退模型的部署属于不同的评测框架条件。任何跨模型横向阅读的人都需要掌握这三个事实。Claude Fable 5.1 的独立排名同样是在与 Claude Opus 5.5 不同的指数修订版上测得的,因此两者不能直接比较,而基准测试页面正是公开处理这一点的地方。

独立阅读
Anthropic 的数字来自厂商自报,上表也是照此标注的。对 Claude Opus 5.5 的独立测量确实存在,而且只有一个来源:Artificial Analysis——我们于 2026 年 9 月 28 日读取了其实时模型页面。
Artificial Analysis 给 Claude Opus 5.5 打出的分数是Artificial Analysis 智能指数(修订版 v4.3.2)58 分,在该修订版上于 211 个模型中位列第 1。页面中注明了它是在何种配置下被测量的——"Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)"——而这个标签才是关键所在:这一独立数值是最高努力(max effort)设置下的数字,并会回退到默认配置,因此无法与厂商资料表中任何在中等努力下得出的数字直接比较。除该指数之外,同一页面还报告了每秒 95.5 个 token 的输出速度、每个模型运行该智能指数需花费 5.98 美元、输出冗长度达 2.6 亿输出 token、95% 的缓存折扣、100 万 token 的上下文窗口,以及在 7:2:1 的缓存命中/输入/输出比例下每百万 token 2.94 美元的混合价格。Artificial Analysis 并未在该页面同时发布 Fable 5.1 的任何变体,也没有发布 Claude Opus 5.5 的第二种配置,因此这两个模型并未在那里以相匹配的努力设置和相匹配的测试框架进行过正面对比。这是证据上的空白,而不是一项结果,也正是本页不自行给出 Opus 5.5 与 Fable 5.1 对比的原因。
有一处差异值得记录,因为它会自行解决,而读者可能会看到两个版本。我们自己的模型 API 所缓存的 Artificial Analysis 数值日期为 2026 年 9 月 22 日,给出 57.6,对应同一指数。Artificial Analysis 的实时页面读数为 58,这是当前修订版上的数值。实时页面是记录在案的数值;57.6 是发布当天、依据当时生效修订版取得的快照。本页若给出单一数字,则为 58。
我们自己的遥测是第三种、不同的测量方式,它并不是基准测试。在截至 2026 年 9 月 28 日的七天里,通过我们的 playground 路由到 anthropic/claude-opus-5.5 的请求显示,首 token 时间 p50 为 4.69 秒,p95 为 10.00 秒,输出速度为每秒 97.8 个 token,错误率为 5.59%,该时间窗口内共路由了 6270 万个 token。这些数据描述的是我们的服务行为,而非模型的能力,之所以在此引用,是为了避免有人将其解读为基准测试结果。
可用性,以及版本测试
Anthropic 表示,Claude Opus 5.5“现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure”,模型页面列出了 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform。Claude Opus 5.5 也已在 OrcaRouter 上线,为 anthropic/claude-opus-5.5,按 Anthropic 的标价销售,不额外加价——输入 $4.00、输出 $20.00、缓存读取 $0.20、缓存写入 $5.00;这四个数字于 2026 年 9 月 28 日读取自我们自己的模型端点,与供应商表格逐行一致。我们为其设立的页面同样载有 1M token 窗口和 128K 最大输出,将文本、图像和文件列为可接受的输入类型,输出仅限文本,并标注该模型于 2026-09-22 发布、为精选模型,且未被弃用。
同一目录中的其他所有内容都可以通过同一个密钥访问:一个 API 即可对接200 多个模型,按 0% 加价率原样传递的供应商标价,自动故障转移(当某个端点性能下降时),以及针对需要固定某个模型或将多个模型融合成一个答案这类场景的路由 DSL。对于版本测试来说,这才是有用的特性。由于加价率为零,你用来比较的价格就是 Anthropic 公布的价格;而且由于同时提供 OpenAI 兼容的 chat-completions 端点和 Anthropic 自家的 messages 端点,现有的 Claude 客户端只需改动两个值就能指向新的 ID——模型字符串,以及(如果你想调整推理深度)effort level。用同一套评测分别在 medium和 xhigh 下运行,比较每完成一项任务的成本而非每次请求的成本,让你自己的数字来决定:旗舰模型还是它之上那一档,才是眼前这项工作合适的默认选择。API 指南涵盖了在你替换字符串时不会明显报错的那些部分;有四项破坏性变更会影响已经在 Claude Opus 5 上运行的代码,还有一项变更会在完全不报错的情况下改变响应结构。

Claude Opus 5.5 仍然是 Claude 系列中的最高型号,而这一说法所对应的日期是 2026 年 10 月 7 日。该系列中高于它的型号一个也没有发布:Anthropic 的模型总览恰好列出四款当前模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Haiku 4.5——没有第五个条目;Claude Opus 5.5 的文档页面名称旁仍标着 Latest 一词;在厂商的站点地图、弃用表、本目录以及 Artificial Analysis 上,都不存在任何后继型号的标识。反过来说也一样:同一天查阅 Artificial Analysis 上的模型排名列表,Claude Opus 5.5 依旧排在第一位。倘若读者来到这里是为了寻找下一代 Claude 旗舰,那么他寻找的仍是一个尚无名字之物;而实际的答案正是本节已经给出的:Claude Opus 5.5 就是今天可以调用的型号,厂商定价为每百万 token 输入 4 美元、输出 20 美元;而在 Anthropic 推荐适用的那些工作负载上,Claude Fable 5.1 依然是高它一级的选择。
还有一点也应当放在这里,因为当读者搜索一个尚不存在的 Claude 模型时,会先遇到版本号,再遇到名称。5.5 这个后缀并不代表产品线中的最高端,而是代表代际。Claude Sonnet 5.5 才是真正已发布的 5.5:它于 2026 年 9 月 28 日发布,厂商定价为每百万 token 输入 2 美元、输出 10 美元,并由 Artificial Analysis 在同一版 Intelligence Index 修订版 v4.3.2 上测得 56.00——而正是这一版将 Claude Opus 5.5 排在首位——因此,较小层级上听起来更高的数字仍然属于较小的层级。相比之下,“Claude Fable 5.5”这个字符串是传闻标签,而不是版本号。它背后的说法来自 2026 年 10 月 2 日的两条社交帖子,而线索到此为止:截至今天,厂商文档、本目录以及 Artificial Analysis 上都没有它的模型 ID、价目表、上下文窗口、发布日期或基准测试。Fable 产品线已发布的最高端是 Claude Fable 5.1,而本博客上题为《Claude Fable 5.5 尚未存在便击败了 GPT-6.1 Astra——而这正是有趣之处》的文章,正是审视该标签来源链的地方;本页所需的区分更窄——一个标记代际的后缀,与一个标记声明的名称相对。
简短版本
Claude Opus 5.5 是 Anthropic 当前产品线中默认应该选用的模型,而决定它是否适合某项具体工作的,是以下三个事实。它默认使用 medium effort,而它周围的模型默认使用 high,因此迁移过来的设置会在不知不觉间改变行为。它公布的基准测试成绩是在不同 effort 档位下产生的,而其中被引用最多的两项——Terminal-Bench 4.0 和 CursorBench 4.0——若不阅读注释,就无法与旁边的数字相提并论。而它的独立评分——在 Artificial Analysis 的 v4.3.2 指数上得分 58,在 211 个模型中排名第一——是最高 effort 档位下的测量结果,这使它成为该模型的能力上限,而非你实际运行时的表现。
在这三点之下,实际情况一目了然:百万级 token 窗口且不收取长上下文附加费,128K 同步输出,费率表低于它所取代的模型,无法关闭的自适应思考,以及两年后退役的承诺。所有具体内容——某项工作负载成本的计算方式、包含跨模型对比列和每个模型各自独立排名的完整基准测试表,以及已在 Claude Opus 5 上运行的代码的迁移细节——分别位于定价、基准测试和 API 页面,而这些正是从这里往后的下三个点击目标。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
