
以 Claude Fable 5 作為你的編排者:降低 Token 成本的子代理實戰手冊
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
8月7日,Anthropic 對 Claude Fable 5 做出了自該模型於6月9日發布以來最大的一次單一變更:將與生物學相關的「後備」機制削減了約85%,因此日常健康和教育的問題現在能獲得直接回答,而不是默默切換到較弱的模型。然而,本週實際上在 Claude Code 社群中流傳的模式,與生物學無關。從業者不斷發布一種工作流程:由 Claude Fable 5 執行編排迴圈——需求釐清、計畫分解、任務分派、結果驗收——而執行則交給 Claude Opus 5 子代理。所述的好處是:Fable 5 High 成為負擔得起的會話預設,而 Claude Opus 5 的冗長不再耗盡會話。
最近的例子是 @dotey 於 8 月 14 日發布的內容:在 ~/.claude/CLAUDE.md 中新增一小段,指示 agent 開啟 Opus 子代理來執行任務,同時讓 Claude Fable 5 以高推理強度作為工作階段的預設,作者回報 token 消耗維持在合理範圍——而他之所以不把 Claude Opus 5 設為預設,原因也很直白:在他實際使用中,它太慢,而且在主迴圈中消耗了大量 token。這是社群的發現,不是 Anthropic 的官方指引——在照著複製之前,值得先理解背後的理由,因為表面上看起來這像是在開倒車。
一個段落中的模式。 在 Claude Code 中,子代理預設會繼承你的工作階段模型,因此要保持快速且低成本的迴圈,方法是讓工作階段模型擔任規劃者,並將執行者明確地指向不同的模型。Claude Fable 5 — Anthropic 的 Mythos 級模型,已針對一般用途進行安全化處理,於 2026 年 6 月 9 日發布,每百萬 tokens 定價 $10/$50 — 負責掌握需求、拆解工作、分派任務並接收結果。Claude Opus 5 — 於 2026 年 7 月 24 日發布,每百萬 tokens 定價 $5/$25 — 在子代理中執行實際的實作。你在少數的編排回合中運用 Fable 等級的判斷力,在大量的執行回合中運用 Opus 等級的執行力,而執行回合正是大部分 tokens 的流向所在。
為什麼主迴圈模型才是真正的成本問題
在基準測試上,這看起來是個已解決的問題——而答案看起來是「預設用 Opus 5」。Anthropic 自己的數據(供應商報告、未經複現)顯示 Claude Opus 5 在代理式編碼基準 Frontier-Bench v0.1(43.3% 對 33.7%)、SWE-bench Verified(96.0% 對 95.5%)以及 ARC-AGI-3(30.2%,大約是次佳公開模型的 4 倍)上都領先 Claude Fable 5。Anthropic 將 Opus 5 定位為以一半價格逼近 Fable 5 的前沿智慧。如果你純粹根據供應商基準和每 token 價格來挑選工作階段預設,Opus 5 是明顯的選擇。
實際執行長時間 session 的從業者,正得出相反的預設結論,原因在於每個任務的 token 數,而不是每個 token 的價格。Opus 5 的思考功能預設開啟且具有適應性,而 Anthropic 表示它會不經提示自行驗證自己的工作——這意味著在實務上,每次迴圈迭代所產生的 token 數量都遠多於 Fable 5。停用該思考功能被限制在高強度模式下,所以你無法將其一路調到精簡。在執行數小時的 session 中,迴圈效應才是真正累積的關鍵:每個 token 最便宜的模型,最終可能是每個 session 最昂貴的;而話最少的模型,才能讓迴圈保持快速。
這與 @dotey 的回報一致。這種反向設置之所以能讓 token 消耗維持在「還不錯」,正是因為 Opus 5 —— 那個較冗長的模型 —— 被隔離在子代理中,其輸出是交付物而非開銷。
倒置的架構:Fable 5 負責規劃,Opus 負責執行
這個架構說起來簡單,但執行起來有點反直覺:
• 會話模型 — Claude Fable 5,以高推理強度運行(社群簡稱「Fable 5 High」中的「High」)。它掌管對話、計畫,以及「完成」的定義。
• 編排輪次——需求釐清、計畫分解、任務分派與結果驗收都發生在 Fable 5 上。這些輪次數量很少,在總 token 數中占比也小。
• 執行回合 — 每個任務都會分派給執行 Claude Opus 5 的子代理。這些回合數量眾多,也是 token 花費的大宗 — 而 Opus 5 正是供應商回報中代理能力分數最高的模型。
這種經濟效益之所以成立,是因為兩條成本曲線指向不同的方向。Fable 5 的強項在於判斷,使用時宜節制;Opus 5 的強項在於執行,可以大量使用,但須以平行方式進行,並與主迴圈隔離。如此一來,主迴圈保持快速且低廉,而昂貴的能力恰好花費在原本就會耗用 token 的地方。
這是流通中的兩種社群模式之一,而兩者互為鏡像。較常被推薦的「architect pattern」(例如 fable-advisor 外掛即採用此模式)將 Opus 作為全職架構師,並把 Fable 5 保留給最高複雜度的實作軌道,以及交付物完成後的強制審查。差異在於最佳化目標:architect pattern 將 Opus 等級的 token 花在協調上,並把 Fable 5 當作手術刀;反向模式則用 Fable 5 做協調,用 Opus 5 處理大量工作。兩者都是社群指引——Anthropic 並未對任何一種提供文件——且兩者都是試圖將前沿 token 花在最能改變結果的地方。
在 Claude Code 中設定
Claude Code 沒有內建的「編排器模式」,因此這種模式是透過兩種方式來強制執行:工作階段提示詞中的指令,以及執行端的明確模型釘選。
指令層位於 ~/.claude/CLAUDE.md —— 也就是 @dotey 編輯過的同一檔案。簡言之,這個提示要求主代理在認定任何任務完成之前,先做四件事:
• 在撰寫程式碼之前,重述需求並確認範圍。
• 將工作分解為可平行執行的任務。
• 將每個執行任務分派給固定使用 Claude Opus 5 的子代理。
• 在接受每個結果之前,請根據計劃進行核對。
那種形狀值得作為指導方針來陳述,而非作為可貼上的程式碼片段——你的需求與你的技術棧會改變其中應包含的內容。
模型層的重要性比多數設定所假設的更高。在 Claude Code 中,子代理(subagent)模型的解析順序為:CLAUDE_CODE_SUBAGENT_MODEL 環境變數、每次呼叫的模型參數、代理定義的 frontmatter,最後是工作階段模型。未設定模型的代理會繼承工作階段模型。因此,如果你的工作階段執行於 Fable 5,並依賴 Agent 工具的 model 參數,則存在一項有文件記載的風險(GitHub issue #83920):該參數可能被忽略——子代理無論如何都會繼承工作階段模型,而你原本打算在 Opus 5 上執行的任務,卻要支付 Fable 5 的費用。
兩個可靠的修正方式:在該工作階段中設定 CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5,或在子代理的 frontmatter 中鎖定模型。這一個變數決定了該模式是如設計般正常運作,還是默默讓整個工作階段跑在昂貴的模型上。
拆分背後的代幣數學
以下是目前這兩款型號的定價(供應商發布,並在 OrcaRouter 上按標價提供):
• Claude Fable 5 — 每100萬個輸入代幣10美元,每100萬個輸出代幣50美元;100萬代幣上下文,128K輸出。
• Claude Opus 5 — 每100萬輸入代幣5美元,每100萬輸出代幣25美元;100萬代幣上下文,128K輸出。

反直覺的部分是,Opus 5 每個 token 的價格只有一半,但在每次會話的成本上仍可能落敗。用粗略的數字很容易看出輪廓:如果 Opus 5 上的迴圈所產生的 token 是 Fable 5 迴圈的兩到三倍——這個說明性數字與實務者關於 Opus 5 自我驗證行為的報告一致,並非實測值——那麼即使每個 token 費率只有一半,迴圈成本也大致相同;如果差距更大,Opus 在迴圈中的成本就更高。同時,佔整個會話大部分的執行 token,無論如何都以較低的費率落在 Opus 5 的子代理中。
這就是反向模式的整個論點:將每個 token 價格較高但迴圈更精簡的模型放在迴圈中,而將每個 token 價格較低的模型放在大量處理上。這是一個偽裝成模型決策的路由決策。
因為 OrcaRouter 以 0% 加成轉傳供應商定價,以上數字就是您實際支付的費用 — 沒有額外平台費 — 如果 Anthropic 調降任一定價,變更會在同一天顯示在模型頁面上。
反轉形態何時有效——以及何時無效
沒有先檢視自己工作負載的樣貌就複製 @dotey 的設定,無論往哪個方向看都是錯誤。
反向模式在以下情況中勝出:
• 需求模糊不清,或計畫有許多變動部分——編排判斷是稀缺資源。
• 執行可平行化拆分至子代理——工作量即脫離主迴圈。
• 會話很長 — 迴圈的冗長敘述會累積成實際成本。
標準建議在以下情況下勝出:
• 你大部分的工作階段都是範圍有限且機械性的工作——使用 Fable 等級的規劃器屬於大材小用,而 Opus 5 價格更低、基準測試分數更高,自然是顯而易見的預設選擇。這正是 Claude Code 官方文件將 Opus 設為工作階段預設、並將 Fable 5 保留給明確選擇的原因。
• 你無法可靠地固定子代理模型——#83920 繼承錯誤會將反向模式變成「一切都取決於 Fable 5 定價。」
也有調校的折衷路徑。Opus 5 提供一個 effort 參數(從 low 到 max,預設為 high),因此你可以將其推向更精簡的行為——但無法完全如此,因為停用思考被限制在 high effort。如果你的痛點是 Opus 5 的冗長,調低 effort 可能就足夠,而且你根本不需要反轉架構。
8月7日的生物學變更對這個設置意味著什麼
Anthropic 的 8 月 7 日更新重寫並重新訓練了 Claude Fable 5 的生物學分類器 — 該系統用於決定查詢是否觸發「回退」到能力較弱的模型。根據 Anthropic 自己的數據(供應商報告),生物學相關的回退在各產品介面下降了約 85%,整體回退在 Claude.ai 上下降約 67%,在 Cowork 上下降約 55%,在 Claude Code 上下降約 17%,在 Claude Platform 上下降約 7%。

在 Fable 5 編排配置中,真正重要的是 Claude Code 編號。Fallback(回退)是系統默默將你的查詢切換到另一個模型——這裡是切換到 Opus 5。在一般聊天中,那只是看不見的摩擦;在代理式(agentic)工作階段中,則代表你的一部分流程跑在你未選擇的模型上,成本結構也非你原先規劃。此次更新並未移除這點:病毒學、毒理學與分子設計仍會回退。但日常健康與教育生物學——閱讀檢驗結果、理解症狀、學習生物學——現在會停留在 Fable 5。
一則前瞻性說明,明確標示:7月底的未經證實報導(36kr、WinCentral)指出,本月可能會推出 Claude Fable 5.1 的更新版本,價格維持不變。Anthropic 尚未確認名稱、日期或 API 模型的 ID——在正式推出前,請將其視為推測。
無需賭上你的工作流程,即可試用
反向模式之所以值得嘗試,是因為它具有可逆性,而且將兩個模型都通過同一個端點進行路由,讓反轉變得成本低廉。
在 OrcaRouter 上,Claude Fable 5 (anthropic/claude-fable-5) 和 Claude Opus 5 (anthropic/claude-opus-5) 共用同一組 API 金鑰。你可以在任一模型上執行工作階段的執行通道,無需第二份合約或程式碼變更——這正是像「Fable 5 作為編排器」這類實驗所需要的,因為重點就在於在做出承諾之前,先衡量你自己每個工作階段的成本。

OrcaRouter 的兩項功能直接對應到此設定。自動故障轉移可讓您定義後備鏈——若 Fable 5 出錯或逾時,請求會路由至 Opus 5 或較便宜的模型,而不會失敗。路由 DSL 則可將兩者組合成單一呼叫:在單一端點背後,先以 Fable 5 進行規劃步驟,再以 Opus 5 執行步驟。這就是以基礎設施而非提示詞紀律所表達的編排模式。
重點
這種反向架構——由 Claude Fable 5 負責規劃、Claude Opus 5 負責執行——是針對真實問題提出的實際可行解答:每個 token 成本最低的模型,並不一定代表每個 session 的總成本最低。這不是一個基準測試的決策;Opus 5 在大多數供應商回報的代理式比較中勝出。這是一個 token 路由的決策,而且只有當編排判斷稀缺、執行可以平行化時,才能發揮效益。
Claude Fable 5(2026年6月9日)和 Claude Opus 5(2026年7月24日)都是目前 Anthropic 的模型,而 8 月 7 日的安全防護變更使 Fable 5 成為一款較少被打斷的日常主力工具。請留意三件事:Fable 5.1 的相關報導是否真有實質內容、Anthropic 是否修復了可能默默推翻此模式的子代理繼承 bug,以及——最重要的是——在為期一週的真實工作階段中,你每完成一項任務的實際成本會是什麼樣子。
常見問題
Fable 5 是 Claude Code 的預設模型嗎?
不。Claude Code 自己的文件指出,Fable 5 並非任何帳戶類型的預設 — 工作階段預設為標準 Opus 模型,你必須透過 /model、模型設定或 "best" 別名來選取 Fable 5。本文中的模式是刻意與該預設相悖而行的。
為什麼不直接將 Opus 5 設為預設,因為它的每個 token 成本更低且分數更高?
因為每次會話成本等於每個任務的 token 數乘以每個 token 的單價。從業人員回報,Opus 5 的自適應思考與自我驗證會在每一輪輸出遠更多的 token,因此即使每 token 費率只有一半,在長時間循環中仍可能更慢且更昂貴。這就是本操作手冊所依據的社群發現——在選邊站之前,請先在自己的工作負載上加以衡量。
我可以強制我的子代理運行與當前會話不同的模型嗎?
是的,但不要依賴每次呼叫的模型參數:GitHub issue #83920 記錄了該參數會被忽略,子代理反而會繼承工作階段的模型。請設定 CLAUDE_CODE_SUBAGENT_MODEL,或在子代理的 frontmatter 中固定模型——這就是執行跑在 Opus 5 定價上,還是默默跑在 Fable 5 定價上的差別。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
