
Claude Opus 5.5 负责执行,Claude Fable 5.1 负责建议:为 Claude Code 的顾问循环定价
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Claude Fable 5.1负责撰写设计方案。 Claude Opus 5.5则循环执行它。Fable 5.1 再回来担任顾问,接受或否决结果。这正是 X/@dotey 在 2026 年 9 月 22 日——也就是该厂商发布 Claude Opus 5.5 的当天——所发布的模式,并将其描述为一种在成本压力下形成的省 token 方案:把顾问设为 Fable,运行 Opus,让昂贵的模型只在决策点开口。他们所用的已不再是提示词技巧或子代理配置,而是 Claude Code 内置的顾问工具——一项按顾问模型费率计费的服务器端功能,且费用叠加在主模型的所有开销之上。而建议本身只是便宜的那部分。为生成它而重读对话则不然——执行方的上下文如今重读起来很便宜,而顾问的上下文从来都不便宜。正是这一处不对称,决定了这个循环是否值得跑,也正是本文余下部分要算清的账。
循环实际上是什么
顾问工具会将你的主模型与第二个通常更强大的模型配对,Claude 会在关键时刻向后者咨询——在确定采用某种方案之前、错误反复出现时,或是在宣布任务完成之前。顾问会接收完整的对话内容,包括每一次工具调用及其结果,并返回指导建议,再由主模型加以应用。它从不调用工具,也从不产生面向用户的输出。由你选择哪个模型担任顾问;而 Claude 决定何时调用它。
最后这一点,正是它区别于 Claude Code 社区在八月流传的编排器-子代理模式的地方。子代理是委派:规划器将工作分解并分派给工作者,而你会显式配置每条通道的模型。顾问则是升级机制:一个模型驱动整个任务,昂贵的模型在过程中被引入,以做出驱动者无法独自做出的决定。没有工作池,没有任务图,也没有需要维护的编排提示。@dotey 描述的那个实用循环——规划、执行、验证、重复——就是当您把顾问指向 Fable 5.1 并让它监管循环的退出条件时,该机制所呈现的样子。
Anthropic 自己对这一战略的表述直白地道出了这种胜利形态:顾问“只能交付执行者所欠缺的能力”。下文的一切都取决于能力实际缺失的程度,以及执行者承认这一点的频率。
为什么 Claude Opus 5.5 改变了算术

Anthropic 公布的费率表,按每百万 token 计。这些是厂商提供的数据,而非估算:
• Claude Opus 5.5 — 输入 $4,输出 $20,缓存读取 $0.20,5 分钟缓存写入 $5
• Claude Opus 5 — 输入 $5,输出 $25,缓存读取 $0.50,5 分钟缓存写入 $6.25
• Claude Fable 5.1 — 输入 $10,输出 $50,缓存读取 $0.25,5 分钟缓存写入 $12.50
列表里有两个细节比标价本身更重要。首先,根据 Anthropic 自己的脚注,Opus 5.5 的缓存读取价格是基础输入的 5%,而大多数 Claude 模型为 10%,Fable 5.1 则为 2.5%。Fable 5.1 的倍率更优,但按绝对美元金额算仍然落败——0.20 美元对 0.25 美元——因为它的基础输入费率高出两倍半。
第二点,而这正是整个循环所依赖的机制:在 Claude Code 中切换 advisor 并不会使主模型的提示缓存失效,因此执行器那冗长、被反复重发的上下文依然很便宜,每百万 $0.20。advisor 自己对对话的读取则不会被缓存。每次咨询都会重新处理完整的对话记录,按 Fable 5.1 每百万输入 $10 的费率计费。一个会把 500K token 的上下文重读十次的执行器,只需支付缓存读取费用;而一个被咨询十次的 advisor,则会为一份始终在增长的对话记录支付十次全新输入费用。执行器的上下文越便宜,advisor 那未缓存的读取就越显突出——而 Opus 5.5 刚刚让执行器的上下文比 Opus 5 便宜了 60%。
在 Claude Code 中进行设置
该顾问功能是实验性的,Anthropic 在会话横幅中也说明了这一点——“Advisor Tool(实验性)已开启,并可能使用更多 token。”行为、定价和可用性都可能发生变化。在说明了该注意事项后,其工作机制已有文档记录:

• 使用 /advisor fable,或者运行 /advisor(不带参数)以打开选择器。所选内容会保存到 advisorModel 设置项(在用户设置中),并跨会话保留。/advisor off 会将其关闭。
• 若要在不更改已保存默认值的情况下仅用于单次会话,请使用 claude --advisor fable启动。该标志未列在 claude --help 中,且如果配对无效,Claude Code 会在启动时直接退出,而不会带着被静默忽略的 advisor 启动。
• 在设置文件中设置持久默认值,使用 {"advisorModel": "fable"}。
• 要彻底禁用它,请设置CLAUDE_CODE_DISABLE_ADVISOR_TOOL=1 —— /advisor 命令会消失,任何已配置的 advisorModel 都将被忽略。
• 配对的能力必须至少与主模型相当。Claude Opus 5.5 接受 Fable 和 Opus 5 或更高版本作为顾问。Opus 4.6 或 Sonnet 顾问会被 Claude Code 拒绝;Opus 4.7 或 Opus 4.8 顾问会被挂接,随后被 API 拒绝。Fable 5.1 作为主模型时只接受 Fable 5.1。
• 版本下限:advisor 工具需要 Claude Code v2.1.98 或更高版本;Fable 无论作为主模型还是 advisor,都需要 v2.1.170 或更高版本;Fable 5.1 需要 v2.1.257 或更高版本。/advisor 的 token 形式——也就是可在 -p、Agent SDK、桌面应用和 Remote Control 中使用的那个——需要 v2.1.260 或更高版本。
• 该顾问仅适用于 Anthropic API。它无法在 Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 的 Agent Platform 或 Microsoft Foundry 上使用,且它依赖于功能标志的获取,因此设置了 DISABLE_TELEMETRY 这类变量的会话会使其保持关闭。
• 在 Fable 用量计入用量额度的方案中,Fable 作为顾问也按同样方式计费,并需要一次性同意。在你接受之前,/advisor fable 不会保存,且 claude --advisor fable 会在启动时退出,并引导你改用 /model fable。
子代理会继承你所配置的任何顾问,并针对它们自己的模型重新运行相同的配对检查。这就是该模式与子代理模式之间唯一的交互:运行较小模型的子代理可能被允许使用其父级不允许使用的顾问。
成本形态,完整推演
下文没有任何内容是实测数据。token 形态是虚构的,目的是让算术过程可见;价格是 Anthropic 公布的费率。假设有一个执行器会话,读取 1M 个全新输入 token,并输出 500K 个输出 token,另有三次顾问咨询,每次重新读取一份 200K token 的对话记录,并返回约 600 个 token 的指导——大致相当于 Anthropic 自己的系统提示词所要求的每项任务两到三次咨询。
• 在 Claude Opus 5.5 上运行的执行器 — 100 万输入按 $4.00,加上 50 万输出按 $10.00 = $14.00
• 在 Claude Fable 5.1 上使用 Advisor — 60万输入 token 为 $6.00,加上约 1,800 个输出 token 约 $0.09 = $6.09
• 环线,总计 — 约 $20.09
• 同样的形态在 Fable 5.1 上端到端运行——$10.00 输入加上 $25.00 输出 = $35.00
• 仅在 Opus 5.5 上呈现的相同形态 —— $14.00
这个循环落在两者之间,而这正是 Anthropic 对它的定位:比全程运行 Fable 5.1 便宜约 43%,比仅使用执行器贵约 44%。请把第二个数字当作更诚实的那个来读。顾问并不是一种节省;它是在三项决策上购买 Fable 级判断力,而只有当这三项决策改变了结果时,它才划算。把记录推到 1M 上下文窗口,每次咨询本身就要花 10 美元。如果让执行器在大多数任务上而不是少数任务上开始询问,你就要在整个工作负载上按顾问费率付费——到那时,正如 Anthropic 所说,运行顾问自己的模型才是以更低成本获得相同分数的途径。
Anthropic 自己的测量结果说明了什么
Anthropic 已经公布了这个模式的实测结果,而这些结果属于厂商自报:由同时销售这两款模型的公司、在其自家的基准测试工具上运行得出。它们仍然是同类中仅有的数字,而且其中还包含了反对该模式的论据,这正是它们值得仔细阅读的原因。
• 以 Opus 5 作为执行器、Fable 5.1 作为顾问,在 Anthropic 内部智能体编码基准测试中每次尝试得分 $7.69——这是 Anthropic 测得的最准确配置。这比单独使用默认设置的 Opus 5 高出 3.5 分,而花费略少;比单独使用 Fable 5.1 高出约 2.5 分,而花费大约多一半。这 3.5 分的差距通过每项任务五次尝试与运行间噪声区分开来。
在同一项图表读取任务上,该组合的表现与单独使用、中等投入的 Fable 5.1 在噪声范围内不相上下——65.0 对 67.5——但每项任务的成本约为后者的 2.6 倍,因为几乎每项任务都咨询了顾问。
• 在 GPQA Diamond 上,增益与能力差距几乎完全吻合:Haiku 4.5 执行器的提升幅度很大,Sonnet 5 执行器提升了几个百分点,而前沿执行器则几乎没有提升。
• 咨询率才是那个脆弱的变量。一个低投入的 Sonnet 5 执行者在配有顾问的情况下于 DeepSWE 上提升了 23 分,随后在 SWE-bench Pro 上却完全不再求助,结果毫无提升。
• 延迟:每个任务大约增加两次前沿模型调用,每次均处于关键路径上。
关于那项证据,有两点直接关系到本周这个循环目前的状况。测量时以 Opus 5 作为执行者,因为运行这些测量时 Opus 5.5 尚不存在。而 Anthropic 报告称,Opus 5.5 在大多数工作上达到 Fable 5.1 的水平,运行成本却低 40%——这两点都是厂商的说法,均未获独立复现。如果执行者与顾问之间的差距正是顾问收取报酬去弥合的东西,那么差距收窄就意味着这是一笔更小的采购。Opus 5.5 发布后,这一模式并没有恶化;只是它所出售的东西变得没那么稀缺了。
你实际会遇到的故障模式
这些是已记录在案的行为,并非猜测,而第一条正是你要在调试任何内容之前先阅读本节的原因:
• 顾问静默缺席。如果 API 拒绝该顾问配对,Claude Code 会挂载它,API 拒绝它,Claude Code 便在不带顾问的情况下重新发送请求。此后的对话便在没有顾问、也没有任何错误提示的情况下继续运行。它会一直保持关闭,直到/clear 或 /compact,即使你切换到兼容的主模型之后也依然如此。
• 一种是被静默拒绝的情况。对于 Claude Code 自身拒绝的配对,顾问根本不会被附加到主模型的请求上。/advisor 的输出和一条通知会告诉你这一点——但不会有任何失败报错,因此你本以为正在提供建议的会话,可能自始至终都未曾生效。
• 你尚未授予的同意。当 Fable 被选定为需要用量额度同意的计划中的顾问时,在你接受之前,请求会在没有顾问的情况下发出。以 --advisor fable 启动的后台会话会在没有顾问的情况下启动,而不是直接退出。
• 一个你无法控制的允许列表。如果贵组织的 availableModels允许列表排除了顾问模型,Claude Code 便不会调用它,你需要通过 /advisor 选择一个允许的模型。
• 在所有它并不存在的地方。仅限 Anthropic API:没有 Bedrock,没有 AWS 上的 Claude Platform,没有 Google Cloud Agent Platform,没有 Microsoft Foundry。经由网关时,可用性取决于该网关是否将请求原封不动地转发到 Anthropic 的 API——这是网关自身的属性,而不是你可以想当然假设的事情。
OrcaRouter 的定位
这个循环中的两个模型今天都已上线 OrcaRouter,采用 Anthropic 自己的标价,0% 加价——供应商标价原样传递,因此你看到的价格就是 Anthropic 公布的价格。Claude Fable 5.1 的模型标识为 anthropic/claude-fable-5.1,Claude Opus 5 则为anthropic/claude-opus-5,共用一个 API 密钥。Claude Opus 5.5 目前还不在我们的路由之中;它可通过 Anthropic 自己的 API 以及各大云平台获取,我们会如实说明这一点,而不会作任何暗示。

在这里,一把密钥为你买到的是能够低成本地改变主意的能力。这个循环的经济性取决于执行者与顾问之间的价格比,而这一比值在七周内变动了两次——9 月 22 日 Opus 5 变为 Opus 5.5,以及 9 月 1 日 Fable 5 变为 Fable 5.1,后者将该模型的缓存读取价格从每百万 $1.00 降至 $0.25。其中每一次变动都会改变"这个顾问是否值得"的答案,而验证这个答案不应该需要再签一份合同。自动故障转移则是另一半:它让你可以把一部分流量指向一个你尚未摸清其特性的模型,并在必要时回退到你已有了解的那个模型,而不是把一条生产路径押在一张发布数据表上。如果你要自己搭建这套模式,而不是使用 Claude Code 的内置工具,路由 DSL 可以把多个模型组合进单次调用——在一个模型上执行规划步骤,接着在另一个模型上执行执行步骤,全部通过同一个端点对外呈现。
关于范围,有一点需要如实说明:顾问工具本身是运行在 Anthropic API 上的服务端工具,因此路由层并不能替代它。我们能做的是让这些模型仅需一个密钥即可使用,并按标价计费,这样保留还是舍弃顾问,就由你根据自己的数据来做决定。
如何根据自己的工作负载做出决定
Anthropic 自己的指导意见是恰当的起点,而且它坦率得令人耳目一新:用三种配置运行你的评测套件——执行器单独运行、执行器搭配顾问、以及仅用顾问的模型以低投入运行——并在每次模型发布时重新检查,因为每次发布都会同时改变能力差距和价格比。这三者中的最后一个是需要超越的基线。如果仅用顾问的模型以低投入运行,得分与这套循环相同但花费更少,那你就有了答案。
值得关注的两个变量正是 Anthropic 所命名的这两个。能力差距:执行器与顾问之间的差距越大,顾问才越能挣得自己的那份价值,而 Opus 5.5 从下方收窄了这一差距。咨询率:收益几乎与之呈一对一的关系,而它对提示词的敏感程度足以使其骤降——处于低投入水平的执行器可能不再察觉自己已经卡住,而在默认投入下对大多数任务都会发起咨询的配对,也可能跌到几乎为零。Anthropic 提供的系统提示词要求在实质性工作开始前调用一次顾问、在收尾前再调用一次,这样每个任务大概会落在两到三次咨询;产生 3.5 个百分点提升的那个代码配对正是以这一节奏运行的。照此为它做预算、给它设上限,并把每一次超出上限的咨询都当作一个信号——说明是你的执行器配置有误,而不是任务太难。
对于本文中的这个特定循环,三项具体设置承担了大部分工作。让 Claude Opus 5.5 保持默认的中等 effort,而不是去追求高 effort,因为 effort 直接决定成本,而 Anthropic 自家的 Opus 5.5 数据表明中等所放弃的非常少。设置 advisor 时用 /advisor fable,并确认横幅确实出现——横幅缺失意味着 advisor 静默缺席。而在扩大这一模式之前,要衡量每个已完成任务的 token 数,而不是每 token 的价格,因为这才是这个循环本应推动的数字。
常见问题
顾问是否会消耗与 Fable 会话相同的 Fable 额度?
在 API 计费中,顾问 token 按 Fable 5.1 自身的输入和输出费率计费,而顾问的速率限制与直接调用该模型的请求共用同一个按模型划分的配额桶——因此,被限流的顾问调用会以工具结果中的错误形式出现,而不会让你的请求失败。在订阅套餐中,顾问用量计入你套餐的用量限额,不过在 Fable 用量计入用量额度的套餐上,Fable 顾问也计入用量额度。实际影响是:顾问并不是一笔你可以随意花销的独立预算;它会与你在该模型上所做的其他一切争夺同样的资源。
顾问实际能看到什么?
完整对话,包括每一次工具调用和每一个工具结果——文件内容、命令输出、错误消息,统统算上。它运行在自己的、由 Anthropic 提供的系统提示下,并返回一个计划、一项纠正或一个停止信号。由此得出两个细节。第一,每次咨询都会重新读取整个记录,这就是为什么成本会随循环增长,而不是保持不变。第二,如果你的会话涉及你不愿以顾问这一价位层级发送给第二个模型的材料,那么顾问就是正在阅读所有这些材料的第二个模型。
什么会改变答案
两件事,而这两件事都比表面看起来更迫近。如果独立基准测试方发布一次同等投入的 Opus 5.5 对 Fable 5.1 的运行结果,并证实 Anthropic 所声称的差距收窄,那么顾问在大多数任务上剩下的优势就很微薄——而这个循环就会变成应对困难长尾的工具,而不再是默认选项。反之,如果咨询率保持不变,且在长时间的智能体工作上能力差距依然很大,那么上面那笔算术就是你正在两者之间做出的选择,而在一次 $14 的运行上花 $6 买建议,是一份便宜的期权,押注的是不交付错误的东西。
不会改变的是本文开篇所述的机制。执行器上下文可缓存且廉价;顾问上下文则既不可缓存也不廉价。任何在任务中途咨询更昂贵模型的循环,都会继承这种不对称性,无论下个月的价目表怎么说。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
