
Claude Fable 5をオーケストレーターとして活用:トークンコストを抑えるサブエージェント・プレイブック
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
8月7日、Anthropicは、Claude Fable 5が6月9日にリリースされて以来最大の単一変更を行いました。生物学関連の「フォールバック」を約85%削減し、日常的な健康や教育の質問が、静かにより弱いモデルに切り替わる代わりに、直接回答を得られるようになりました。しかし、今週実際にClaude Codeコミュニティに広がっているパターンは、生物学とは無関係です。実践者たちは、Claude Fable 5がオーケストレーションループ(要件の明確化、計画の分解、タスクのディスパッチ、結果の受け入れ)を実行し、実行はClaude Opus 5のサブエージェントに委ねられるというワークフローを投稿し続けています。述べられている利点は、Fable 5 Highが手頃なセッションのデフォルトになり、Claude Opus 5の冗長さがセッションを消耗しなくなることです。
最新の例は、8月14日に投稿された@dotey氏のものです。~/.claude/CLAUDE.mdへの短い追記で、エージェントに実行用のOpusサブエージェントを開くよう指示し、セッションのデフォルトとしてはClaude Fable 5を高推論努力(high reasoning effort)のまま残すという内容です。著者によれば、トークン消費は妥当な範囲に保たれるとのことです。また、Claude Opus 5をデフォルトにしなかった理由は率直で、彼の手では遅すぎて、メインループで膨大な数のトークンを消費したからだそうです。これはコミュニティの知見であり、Anthropicの公式ガイダンスではありません。そして、それをコピーする前に理解しておく価値があります。なぜなら、理屈の上では逆に見えるからです。
1つの段落にまとめたパターン。 Claude Codeでは、サブエージェントはデフォルトでセッションモデルを継承するため、高速で低コストなループを維持する方法は、セッションモデルをプランナーにし、実行側を明示的に別のモデルに向けることです。Claude Fable 5——2026年6月9日リリース、100万トークンあたり$10/$50、一般利用向けに安全化されたAnthropicのMythosクラスのモデル——は、要件を保持し、作業を分解し、タスクを振り分け、結果を受け取ります。Claude Opus 5——2026年7月24日リリース、100万トークンあたり$5/$25——は、サブエージェント内で実際の実装を実行します。少数のオーケストレーションターンにはFable級の判断力を、トークンの大部分がすでに消費される多数の実行ターンにはOpus級の実行力を費やします。
メインループモデルが本当のコスト問題である理由
{{1}}ベンチマーク上では、これは解決済みの問題のように見える——そしてその答えは「Opus 5をデフォルトにすること」のように見える。{{/1}} {{2}}Anthropic自身の数値(ベンダー報告によるもので、再現はされていない)では、Claude Opus 5は、エージェント型コーディングベンチマークのFrontier-Bench v0.1(43.3%対33.7%)、SWE-bench Verified(96.0%対95.5%)、ARC-AGI-3(30.2%、次に性能の高い公開モデルの約4倍)のすべてにおいて、Claude Fable 5を上回っている。{{/2}} {{3}}AnthropicはOpus 5を、Fable 5のフロンティア水準の知能に半額で迫るものと位置づけている。セッションのデフォルトを純粋にベンダーのベンチマークとトークン単価だけで選ぶなら、Opus 5が明らかな選択肢だ。{{/3}}
実際に長時間のセッションを運用している実践者たちは、逆のデフォルトに到達しつつある。その理由は、トークンあたりの価格ではなく、タスクあたりのトークン数である。Opus 5の思考はデフォルトでオンになっており適応的で、Anthropicは、それがプロンプトなしで自身の作業を検証すると述べている。つまり実際には、すべてのループのターンでFable 5よりかなり多くのトークンが生成される。その思考の無効化は高負荷時に制限されているため、完全にリーンにすることはできない。何時間も続くセッションでは、複利的に効いてくるのはループである。トークンあたりのコストが最も安いモデルが、セッションあたりのコストでは最も高くなり得る。そして最も発言が少ないモデルが、ループを高速に保つ。
それは @dotey が報告している内容と一致します。逆の構成は、まさにOpus 5(冗長な方)がサブエージェントに隔離され、その出力がオーバーヘッドではなく成果物となるからこそ、トークン消費を「悪くない」状態に保てるのです。
逆転したアーキテクチャ:Fableが計画し、Opusが実行する
このアーキテクチャは説明するのは簡単ですが、実行するのは少し直感に反します:
• セッションモデル — 高推論努力設定のClaude Fable 5(コミュニティの略称「Fable 5 High」における「High」)。会話、計画、完了の定義を所有します。
• オーケストレーションターン — 要件明確化、プラン分解、タスクディスパッチ、結果受け入れはすべてFable 5上で行われます。これらは少数のターンであり、総トークンに占める割合も小さいです。
• 実行ターン — 各タスクはClaude Opus 5を実行するサブエージェントにディスパッチされます。これらが多数のターンであり、トークン消費の大部分を占めます — そしてOpus 5は、ベンダーが報告するエージェントスコアが最も高いところです。
経済性が成り立つ理由は、2つのコスト曲線が異なる方向を向いているからです。Fable 5の強みは判断力であり、控えめに使用します。Opus 5の強みは実行力であり、大量に使用しますが、並列処理でループから隔離されています。ループは高速かつ低コストを維持し、高価な機能は、そもそもトークンが消費されている場所に正確に投入されます。
これは流通している2つのコミュニティパターンのうちの1つであり、両者は互いに鏡像の関係にある。より一般的に推奨される「アーキテクトパターン」(例えばfable-advisorプラグインで使用される)は、Opusをフルタイムのアーキテクトとして稼働させ、Fable 5を最高複雑度の実装レーンと納品物末尾の必須レビューのために確保する。違いは最適化目標にある。アーキテクトパターンはOpusグレードのトークンを調整に費やし、Fable 5をメスとして使う。逆転パターンはFable 5を調整に使い、Opus 5を量に使う。どちらもコミュニティのガイダンスであり、Anthropicはどちらも文書化していない。そしてどちらも、フロンティアトークンを結果が変わる場所に費やそうとする試みである。
Claude Code でのセットアップ
Claude Codeには組み込みの「オーケストレーターモード」がないため、このパターンはセッションプロンプト内の指示と実行側の明示的なモデルピンという2つの方法で強制されます。
命令レイヤーは ~/.claude/CLAUDE.md にあります — @dotey が編集したのと同じファイルです。形としては、プロンプトはメインエージェントに対し、タスクを完了とみなす前に4つのことを行うよう指示します:
• コードを書く前に、要件を言い換えてスコープを確認する。
• 作業を並列に実行できるタスクに分解します。
• 各実行タスクをClaude Opus 5に固定されたサブエージェントにディスパッチします。
• 各結果を計画と照合してから受け入れてください。
その形は、貼り付けるスニペットというよりも指針として示す価値がある。あなたの要件やスタックによって、それに含まれるべきものは変わるからだ。
モデル層は、ほとんどのセットアップが想定する以上に重要です。Claude Codeでは、サブエージェントのモデル解決順序は次のとおりです:CLAUDE_CODE_SUBAGENT_MODEL環境変数、次に呼び出しごとのモデルパラメータ、その次にエージェント定義のfrontmatter、そしてセッションモデルです。モデルが設定されていないエージェントはセッションモデルを継承します。したがって、セッションがFable 5で実行されていて、Agentツールのmodel引数に依存している場合、それが無視されるという文書化されたリスクがあります(GitHub issue #83920):サブエージェントは結局セッションモデルを継承するため、Opus 5で実行するつもりだった処理に対してFable 5の料金を支払うことになります。
確実な修正方法は2つあります。セッションでCLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5を設定するか、サブエージェントのfrontmatterでモデルを固定することです。その1つの変数が、パターンが設計どおりに動作するか、セッション全体が気づかないうちに高価なモデルで実行されるかの違いを生みます。
分割の背後にあるトークン計算
本日時点での価格に基づく2つのモデルは以下のとおりです(ベンダー公表価格であり、OrcaRouterでは定価でそのまま適用されます):
Claude Fable 5 — 入力トークン100万件あたり10ドル、出力トークン100万件あたり50ドル。コンテキストは100万トークン、出力は128Kトークン。
• Claude Opus 5 — 入力トークン100万あたり$5、出力トークン100万あたり$25。コンテキストは100万トークン、出力は128K。

直感に反するのは、{{1}}Opus 5 はトークンあたりの価格が半分{{/1}}なのに、それでもセッション単位のコスト勝負では負け得るということです。その構造は概算ではっきり見えます: {{2}}Opus 5 のループが Fable 5 のループの 2〜3 倍のトークンを生成する場合{{/2}}——これは Opus 5 の自己検証的な挙動に関する実務者の報告と整合する例示的な数字であり、実測値ではありません——トークン単価が半分でもループのコストはほぼ同じになり、差がさらに広がれば、ループ内の Opus のコストは高くなります。一方、セッションの大半を占める実行トークンは、どちらにせよサブエージェント内の Opus 5 で安いレートのままです。
それが反転パターンに対する議論のすべてです。つまり、トークンあたりの価格は高いがループがより効率的なモデルをループ側に置き、トークンあたりのコストが低いモデルをボリューム側に置くというものです。これはモデルの決定のように見えて、実際にはルーティングの決定なのです。
OrcaRouterはプロバイダー価格をマークアップ0%でそのまま渡すため、上記の数字が実際にここでの支払額です。プラットフォーム手数料は上乗せされません。また、Anthropicがどちらかの価格を値下げした場合、その変更はモデルページに同日中に反映されます。
反転パターンが勝つとき — そして勝たないとき
@doteyのセットアップを、自分のワークロードの形を確認せずにコピーするのは、両方向において間違いだ。
逆パターンが勝つ場合:
「要件が曖昧であるか、計画に多くの変動要素がある場合、オーケストレーションの判断が希少なリソースとなる。」
• 実行はサブエージェントに並列化できる — ボリュームはループから外れる。
• セッションは長い — ループの冗長さが実際のコストに累積する。
定番のアドバイスが勝つのは、次の場合です:
• セッションの大部分は、範囲が定められた機械的な作業です。Fableグレードのプランナーは過剰であり、Opus 5は価格が低くベンチマークスコアが高いため、明白なデフォルトとなります。これが、Claude Code自身のドキュメントがOpusをセッションのデフォルトにし、明示的な選択のためにFable 5を予約している理由です。
• サブエージェントモデルを確実に固定することはできません — #83920 の継承バグにより、反転パターンが「Fable 5 の価格設定に関するすべて」になってしまいます。
調整における中間の道もあります。Opus 5はeffortパラメータ(low〜max、デフォルトはhigh)を公開しており、より簡潔な動作へ寄せられます。ただし、thinkingを無効にする場合はhigh effortに制限されるため、完全には寄せられません。Opus 5の冗長さが問題なら、effortを下げるだけで十分かもしれず、アーキテクチャを逆転させる必要はまったくありません。
8月7日の生物学の変更がこのセットアップに与える影響
Anthropicの8月7日のアップデートは、Claude Fable 5の生物学分類器を書き直し、再トレーニングしました。これは、クエリが能力の低いモデルへの「フォールバック」を引き起こすかどうかを判断するシステムです。Anthropic自身の数値(ベンダー報告)によると、生物学関連のフォールバックは製品全体で約85%減少し、全体のフォールバックはClaude.aiで約67%、Coworkで約55%、Claude Codeで約17%、Claudeプラットフォームで約7%減少しました。

Fable 5のオーケストレーション設定では、Claude Codeの番号が重要です。フォールバックとは、システムがあなたのクエリを静かに別のモデルに切り替えることです — この場合はOpus 5に。プレーンなチャットでは見えない摩擦ですが、エージェント型セッションでは、パイプラインの一部があなたが選んでいないモデルで実行され、計画していないコストプロファイルが発生することを意味します。このアップデートではそれが解消されません。ウイルス学、毒物学、分子デザインは依然としてフォールバックします。しかし、日常的な健康・教育系の生物学 — 検査結果を読む、症状を理解する、生物学を学ぶ — は、今やFable 5に留まります。
明確な注記:7月下旬の未確認報道(36kr、WinCentral)は、今月、価格を据え置いたままClaude Fable 5.1のリフレッシュが行われる可能性を示唆しています。Anthropicは名前、日付、APIモデルIDのいずれも確認していません—提供開始までは憶測としてお考えください。
ワークフローを危険にさらすことなく試す
逆転パターンを試す価値があるのは、それが可逆的であり、両方のモデルを1つのエンドポイント経由でルーティングすることで、逆転を低コストで実現できるからです。
OrcaRouterでは、Claude Fable 5(anthropic/claude-fable-5)とClaude Opus 5(anthropic/claude-opus-5)が1つのAPIキーの背後に配置されています。セッションの実行レーンは、2つ目の契約やコード変更なしでどちらのモデルでも実行できます。これは、「Fable 5をオーケストレーターとして使う」といった実験にまさに必要なことです。その本質は、コミットする前にセッションごとのコストを測定することだからです。

OrcaRouter の2つの機能は、この構成に直接対応します。{{1}}自動フェイルオーバーにより、フォールバックチェーンを定義できます。Fable 5 がエラーになるかタイムアウトした場合、リクエストは失敗する代わりに Opus 5 またはより低コストのモデルにルーティングされます。{{/1}} {{2}}また、ルーティング DSL は、この2つを1つの呼び出しに統合できます。つまり、1つのエンドポイントの背後で、Fable 5 のプラン ステップに続いて Opus 5 の実行ステップが実行されます。{{/2}} これは、プロンプトの規律ではなく、インフラストラクチャとして表現されたオーケストレーションパターンです。
結論
逆転アーキテクチャ — {{1}}Claude Fable 5が計画し{{/1}}、{{2}}Claude Opus 5が実行する{{/2}} — は、現実の問題に対する現実的で機能する答えです。トークンあたりのコストが最も安いモデルが、必ずしもセッションあたりのコストが最も安いとは限らないのです。これはベンチマーク上の判断ではありません。Opus 5は、ベンダーが報告するエージェント比較の大半で勝利しています。これはトークンルーティングの判断であり、オーケストレーションの判断が希少で、実行を並列化できる場合にのみ効果を発揮します。
Claude Fable 5(2026年6月9日)とClaude Opus 5(2026年7月24日)はどちらも現在のAnthropicモデルであり、8月7日のセーフガード変更により、Fable 5は中断されにくい日常使用モデルになります。注意すべき3つの点は、Fable 5.1に関する報告が何かを成し遂げるかどうか、Anthropicがこのパターンを静かに覆す可能性のあるサブエージェント継承バグを修正するかどうか、そして——最も重要なのは——1週間の実際のセッションにおける、完了したタスクあたりのコストがどのように見えるかです。
よくある質問
Fable 5はClaude Codeのデフォルトモデルですか?
いいえ。Claude Code自身のドキュメントには、Fable 5がどのアカウントタイプでもデフォルトではないと明記されています。セッションは標準のOpusモデルをデフォルトとし、Fable 5は/model、モデル設定、または"best"エイリアスで選択します。この記事のパターンは、そのデフォルトに意図的に反して動作します。
トークンあたりのコストが安くて、スコアも高いんだから、デフォルトはOpus 5にすればいいんじゃない?
セッションあたりのコストは、タスクあたりのトークン数にトークンあたりの価格を掛けたものになるからです。実務者によると、Opus 5の適応的思考と自己検証はターンごとにはるかに多くのトークンを生成するため、トークン単価が半分でも、長いループでは遅くなり費用も高くなる可能性があります。このプレイブックの根拠となっているのはそうしたコミュニティの知見です。どちらかを選ぶ前に、ご自身のワークロードで測定してください。
サブエージェントにセッションとは異なるモデルを強制的に使用させることはできますか?
はい、ただし、呼び出しごとのモデルパラメータには依存しないでください。GitHub issue #83920 には、そのパラメータが無視され、サブエージェントが代わりにセッションモデルを継承することが記載されています。CLAUDE_CODE_SUBAGENT_MODEL を設定するか、サブエージェントの frontmatter でモデルを固定してください。それが、実行が Opus 5 の料金で行われるのか、それとも暗黙のうちに Fable 5 の料金で実行されるのかの違いです。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
