
Claude Fable 5 作为你的编排器:降低Token成本的子代理操作手册
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
8月7日,Anthropic 对 Claude Fable 5 自6月9日发布以来做出了最大的一次调整:将与生物相关的“回退”减少了约85%,因此日常健康和教育的提问现在会直接得到回答,而不再静默切换到较弱的模型。不过,本周真正在 Claude Code 社区中流行的做法与生物无关。从业者不断分享一种工作流:Claude Fable 5 运行编排循环——需求澄清、计划分解、任务分发、结果验收——而执行则交给 Claude Opus 5 子代理。其宣称的效果是:Fable 5 High 成为可负担的会话默认选项,而 Claude Opus 5 的冗长输出也不再耗尽会话额度。
最近的例子是 @dotey 于 8 月 14 日发布的:在 ~/.claude/CLAUDE.md 中增加一小段内容,指示代理打开 Opus 子代理来执行任务,同时保留 Claude Fable 5 作为会话默认,并以高推理强度运行。作者报告称,Token 消耗保持在合理水平——至于为什么不把 Claude Opus 5 设为默认,理由很直接:在作者手中,它在主循环中太慢,且烧掉了大量 Token。这是社区发现,而非 Anthropic 的官方指导——在照搬之前,值得先理解其中的道理,因为从纸面上看,这似乎是反的。
一个段落中的模式。在 Claude Code 中,子代理默认继承你的会话模型,因此要保持快速、低成本的循环,就是将会话模型设为规划者,并明确让执行者使用另一个模型。Claude Fable 5 —— Anthropic 的 Mythos-class 模型,已为常规使用做了安全化处理,于2026年6月9日发布,价格为每百万 token 10/50 美元 —— 负责持有需求、拆解工作、分发任务并接收结果。Claude Opus 5 —— 于2026年7月24日发布,价格为每百万 token 5/25 美元 —— 在子代理中运行实际实现。你把 Fable 级别的判断用在少数编排回合,把 Opus 级别的执行用在多数执行回合——而大部分 token 本来就消耗在这些执行回合上。
为什么主循环模型才是真正的成本问题
在基准测试中,这看起来像是一个已解决的问题——而答案似乎是“默认选择 Opus 5。”Anthropic 自己的数据(供应商报告、未经复现)显示,Claude Opus 5 在智能体编码基准 Frontier-Bench v0.1(43.3% 对 33.7%)、SWE-bench Verified(96.0% 对 95.5%)和 ARC-AGI-3(30.2%,约为次优公开模型的 4 倍)上都领先于 Claude Fable 5。Anthropic 将 Opus 5 定位为以一半的价格接近 Fable 5 的前沿智能。如果你纯粹根据供应商基准和每 token 价格来选择会话默认模型,Opus 5 显然是首选。
实际运行长会话的从业者正在得出相反的默认结论,原因在于每项任务的令牌消耗,而非每令牌价格。Opus 5 的思考默认开启且具备自适应性,Anthropic 表示它会未经提示便自行验证自己的工作——这意味着在实践中,每一轮循环产生的令牌数量都远超 Fable 5。禁用思考功能被限制在高努力档位,因此你无法将其一路压到精简状态。在长达数小时的会话中,循环才是不断累积的因素:每令牌最便宜的模型最终可能成为每次会话最昂贵的模型,而输出最少的模型才能让循环保持快速。
这与@dotey的报告相符。这种倒置设置让token消耗保持在“不算糟”的水平,恰恰是因为Opus 5——那个话多的模型——被隔离在子代理中,在那里它的输出是交付物,而不是开销。
反向架构:Fable 5 规划,Opus 执行
这种架构说起来很简单,但运行起来却有点反直觉:
• 会话模型 — 高推理强度下的 Claude Fable 5(即社区简写 “Fable 5 High” 中的 “High”)。它掌控对话、计划以及完成标准。
• 编排轮次 — 需求澄清、计划分解、任务分派和结果接收都发生在 Fable 5 上。这些轮次很少,占总 token 的比例也很小。
• 执行轮次——每个任务都会分派给运行 Claude Opus 5 的子代理。这些是大量轮次,也是 token 消耗的主要部分——而 Opus 5 正是供应商报告的智能体评分最高的所在。
这种经济性之所以成立,是因为两条成本曲线的走向不同。Fable 5 的强项是判断,应当有节制地使用;Opus 5 的强项是执行,可以大量并行使用,但要与主循环隔离。这样主循环保持快速且廉价,而昂贵的能力恰好花在了本来就在消耗 token 的地方。
这是流传中的两种社区模式之一,二者互为镜像。更常被推荐的“架构师模式”(例如 fable-advisor 插件采用此模式)让 Opus 担任全职架构师,将 Fable 5 保留给最高复杂度的实现通道,并在交付物结束时强制进行审查。区别在于优化目标:架构师模式把 Opus 级别的 token 花在协调上,把 Fable 5 用作手术刀;反向模式则用 Fable 5 做协调,用 Opus 5 处理大批量。两者都是社区指导——Anthropic 并未对任何一种进行文档记录——都是为了将前沿 token 花在能够改变结果之处。
在 Claude Code 中进行设置
Claude Code 没有内置的“编排器模式”,因此该模式通过两种方式强制执行:会话提示中的指令,以及执行端的显式模型固定。
指令层位于 ~/.claude/CLAUDE.md —— 也就是 @dotey 编辑过的同一个文件。作为一种形态,该提示要求主代理在将任何任务视为完成之前先做四件事:
• 在编写代码之前,重述需求并确认范围。
• 将工作分解为可以并行运行的任务。
• 将每个执行任务分派给固定使用 Claude Opus 5 的子代理。
• 在接受每个结果之前,根据计划进行核实。
那种形态值得作为指导原则来表述,而不是作为可粘贴的代码片段——你的需求和技术栈会改变其中应包含的内容。
模型层的重要性超出大多数配置的设想。在 Claude Code 中,子代理模型的解析顺序为:CLAUDE_CODE_SUBAGENT_MODEL 环境变量,然后是单次调用的模型参数,接着是代理定义中的 frontmatter,最后是会话模型。未设置模型的代理会继承会话模型。因此,如果你的会话运行在 Fable 5 上,并且依赖 Agent 工具的 model 参数,那么存在一个已记录的风险:该参数会被忽略(GitHub issue #83920)。子代理无论如何都会继承会话模型,而你会为原本打算在 Opus 5 上执行的操作按 Fable 5 的价格付费。
两个可靠的修复方法:为会话设置 CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5,或者在子代理的 frontmatter 中固定模型。这一个变量决定了该模式是如设计般正常运行,还是让整个会话悄悄运行在昂贵的模型上。
拆分背后的代币数学
以下是这两款型号今日的定价(厂商已公布,并按照OrcaRouter上的标价转售):
• Claude Fable 5 — 每 100 万输入 token 10 美元,每 100 万输出 token 50 美元;100 万 token 上下文,128K 输出。
• Claude Opus 5 — 每100万输入token收费5美元,每100万输出token收费25美元;支持100万token上下文,输出可达128K。

反直觉之处在于,Opus 5 的每 token 价格减半,却仍可能在单次会话的成本较量中落败。用粗略的数字很容易看清这种形态:如果 Opus 5 上的循环产生的 token 是 Fable 5 上循环的两到三倍——这是一个与从业者报告的 Opus 5 自我验证行为相符的示例性数字,而非实测数字——那么即使每 token 费率减半,循环成本也大致相同;如果差距更大,循环中的 Opus 成本反而更高。与此同时,执行 token 作为会话的大头,无论哪种情况都以更低的费率由子代理中的 Opus 5 承担。
这就是反向模式的全部论据:把每 token 价格更高但其循环更精简的模型放在循环上,把每 token 更便宜的模型放在批量部分。这是一个伪装成模型决策的路由决策。
由于OrcaRouter以0%加价转传提供商定价,以上数字就是您实际支付的金额——没有额外平台费用——如果Anthropic降低任一价格,更改会当天显示在模型页面上。
当倒挂形态奏效时——以及它失效时
不考虑自身工作负载的形态就照搬@dotey的设置,这在两个方向上都是错误。
反相模式在以下情况下胜出:
• 需求不明确,或计划变数众多——编排判断力才是稀缺资源。
• 执行可以并行化为子代理——数据量离开主循环。
• 会话很长 — 循环的冗长会累积成实际成本。
标准建议在以下情况下胜出:
• 你的大部分会话都是边界明确、机械性的工作——Fable 级别的规划器有点大材小用,而 Opus 5 更低的价格和更高的基准测试分数使其成为显而易见的默认选择。这就是为什么 Claude Code 自己的文档将 Opus 设为会话默认,而将 Fable 5 保留供显式选择。
• 你无法可靠地固定子代理模型——#83920 继承缺陷会把反转模式变成“一切都按 Fable 5 定价”。
还有一种调优的中间路线。Opus 5 提供了一个 effort 参数(从 low 到 max,默认 high),因此你可以让它表现得更精简——但无法完全做到,因为禁用思考时 effort 被限制在 high。如果 Opus 5 的冗长让你感到困扰,调低 effort 可能就足够了,你根本无需反转整个架构。
8月7日的生物学改动对这个配置意味着什么
Anthropic 8月7日的更新重写并重新训练了Claude Fable 5的生物分类器——该系统负责判断某个查询是否触发对能力较弱模型的“回退”。根据Anthropic自身的数据(供应商报告),生物相关回退在所有产品面上下降了约85%,整体回退在Claude.ai上下降约67%,在Cowork上约55%,在Claude Code上约17%,在Claude平台上约7%。

在一个 Fable 5 编排设置中,Claude Code 编号才是关键的。回退是指系统静默地将你的查询切换到另一个模型——在此情况下是 Opus 5。在普通聊天中,这是无形的摩擦;在代理式会话中,这意味着你的流水线部分运行在一个不是你选择的模型上,成本状况也不是你规划的。这次更新并未消除这一点:病毒学、毒理学和分子设计仍然会回退。但日常健康和教育的生物学——读取化验结果、理解症状、学习生物学——现在保留在 Fable 5 上。
一则前瞻性说明,特此明确标注:7 月下旬的未证实报道(36kr、WinCentral)指出,本月可能推出 Claude Fable 5.1 的更新版本,定价不变。Anthropic 尚未确认名称、日期或 API 模型 ID——在正式发布之前,请将其视为猜测。
尝试它,无需拿工作流冒险
反转模式之所以值得尝试,是因为它是可逆的,而且让两个模型通过同一个端点进行路由,使得反转成本很低。
在 OrcaRouter 上,Claude Fable 5(anthropic/claude-fable-5)和 Claude Opus 5(anthropic/claude-opus-5)共用一个 API 密钥。您可以在任一模型上运行会话的执行通道,无需签第二份合同,也无需改代码——这正是像“Fable 5 as orchestrator”这样的实验所需要的,因为其全部意义就在于,在正式投入之前先衡量您自己的单次会话成本。

OrcaRouter 的两个功能直接映射到这种设置上。自动故障转移允许您定义回退链——如果 Fable 5 报错或超时,请求就会路由到 Opus 5 或更便宜的模型,而不是直接失败。而路由 DSL 可以将这两者组合成一次调用:在同一个端点后面,先是 Fable 5 规划步骤,然后是 Opus 5 执行步骤。这就是以基础设施而非提示词纪律来体现的编排模式。
归根结底
这种倒置架构——Claude Fable 5负责规划,Claude Opus 5负责执行——是对一个现实问题的真实且可行的解答:每token成本最低的模型,并不一定是每个会话成本最低的模型。这不是一个基准测试层面的决策;Opus 5在大多数供应商报告的智能体对比中胜出。这是一个token路由层面的决策,只有在编排判断稀缺且执行可以并行化的情况下,它才真正有回报。
Claude Fable 5(2026年6月9日)和 Claude Opus 5(2026年7月24日)都是 Anthropic 当前的模型,而8月7日的安全措施变更使 Fable 5 成为一款更少被打断的日常主力。需留意三件事:Fable 5.1 的相关报道是否实至名归,Anthropic 是否会修复可能悄然打破这一模式的子代理继承漏洞,以及——最重要的是——在为期一周的真实会话中,你每完成一项任务的实际成本表现如何。
常见问题解答
Fable 5 是 Claude Code 中的默认模型吗?
不。Claude Code 自己的文档指出,Fable 5 并非任何账户类型的默认模型——会话默认使用标准 Opus 模型,你需要通过 /model、模型设置或“best”别名来选择 Fable 5。本文中的模式刻意违背这一默认设置。
为什么不直接用 Opus 5 作为默认,因为它每 token 成本更低且评分更高?
因为单次会话的成本是每个任务的令牌数乘以每个令牌的价格。从业者报告称,Opus 5 的适应性思维和自我验证会在每轮生成多得多的令牌,因此即便每令牌价格减半,在长循环中仍可能更慢、更贵。这就是本策略手册所依据的社区发现——在选边之前,先在你自己的工作负载上实测一下。
我可以强制我的子代理运行与当前会话不同的模型吗?
是的,但不要依赖每次调用的模型参数:GitHub issue #83920 记录了它被忽略的情况,子代理会改为继承会话模型。请设置 CLAUDE_CODE_SUBAGENT_MODEL,或在子代理的 frontmatter 中固定模型——这就是执行按 Opus 5 定价运行,与静默按 Fable 5 定价运行之间的区别。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
