
Claude Fable 5를 당신의 오케스트레이터로: 토큰 비용을 낮추는 서브에이전트 플레이북
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
8월 7일, Anthropic은 모델이 6월 9일에 출시된 이후 Claude Fable 5에 대한 가장 큰 단일 변경을 단행했습니다. 생물학 관련 '폴백'을 약 85% 줄여서, 이제 일상적인 건강 및 교육 질문은 조용히 더 약한 모델로 전환되는 대신 직접적인 답변을 얻습니다. 하지만 이번 주 실제로 Claude Code 커뮤니티에 퍼지고 있는 패턴은 생물학과는 아무 관련이 없습니다. 실무자들은 Claude Fable 5가 오케스트레이션 루프(요구 사항 명확화, 계획 분해, 작업 디스패치, 결과 수락)를 실행하고, 실행은 Claude Opus 5 서브에이전트에게 넘겨지는 워크플로를 계속 게시하고 있습니다. 명시된 이점: Fable 5 High가 저렴한 세션 기본값이 되고, Claude Opus 5의 장황함이 세션을 소모하지 않게 됩니다.
가장 최근 사례는 @dotey가 8월 14일에 게시한 것입니다. ~/.claude/CLAUDE.md에 짧은 내용을 추가해 에이전트가 실행을 위해 Opus 하위 에이전트를 열도록 지시하고, 세션 기본값으로 높은 추론 수준의 Claude Fable 5를 유지하는 방식입니다. 작성자는 토큰 소비가 합리적인 수준으로 유지된다고 보고했습니다. 또한 Claude Opus 5를 기본값으로 실행하지 않는 이유를 단호히 밝혔는데, 그가 사용해 보니 메인 루프에서 너무 느리고 엄청난 수의 토큰을 소모했다고 합니다. 이는 커뮤니티의 발견이지 Anthropic의 지침이 아닙니다. 그리고 복사하기 전에 이해할 가치가 있는 이유는, 이론상으로는 거꾸로 보이기 때문입니다.
한 단락에 담긴 패턴. Claude Code에서 서브에이전트는 기본적으로 세션 모델을 상속합니다. 따라서 빠르고 저렴한 루프를 유지하려면 세션 모델을 플래너로 만들고 실행 에이전트를 명시적으로 다른 모델로 지정하는 것이 방법입니다. Claude Fable 5 — 일반적인 사용에 안전하도록 만들어진 Anthropic의 Mythos급 모델, 2026년 6월 9일 출시, 토큰 100만 개당 $10/$50 — 요구 사항을 보유하고, 작업을 분해하고, 태스크를 분배하며, 결과를 수락합니다. Claude Opus 5 — 2026년 7월 24일 출시, 토큰 100만 개당 $5/$25 — 서브에이전트 내에서 실제 구현을 실행합니다. 소수의 오케스트레이션 턴에는 Fable급 판단을 사용하고, 다수의 실행 턴에는 Opus급 실행을 사용합니다. 토큰의 대부분은 이미 그 실행 턴에서 소비됩니다.
메인 루프 모델이 실제 비용 문제인 이유
벤치마크에서 보면 이는 이미 해결된 문제처럼 보인다 — 그리고 그 답은 "Opus 5를 기본값으로 설정"인 것처럼 보인다. Anthropic의 자체 수치(벤더 제공, 미검증)에 따르면 Claude Opus 5가 에이전트 코딩 벤치마크 Frontier-Bench v0.1(43.3% 대 33.7%), SWE-bench Verified(96.0% 대 95.5%), ARC-AGI-3(30.2%, 차선 공개 모델의 약 4배)에서 Claude Fable 5보다 앞선다. Anthropic는 Opus 5가 절반 가격으로 Fable 5의 최전선 지능에 근접한다고 평가한다. 세션 기본값을 순수하게 벤더 벤치마크와 토큰당 가격만으로 고른다면 Opus 5가 분명한 선택이다.
실제로 긴 세션을 운영하는 실무자들은 반대의 기본값에 도달하고 있다. 그 이유는 토큰당 가격이 아니라 작업당 토큰 수다. Opus 5의 추론은 기본적으로 켜져 있고 적응형이며, Anthropic은 그것이 지시 없이도 자체 작업을 검증한다고 말한다. 즉, 실제로 모든 루프 턴은 Fable 5의 그것보다 훨씬 더 많은 토큰을 생성한다. 그 추론을 비활성화하는 것은 높은 노력 수준에서 상한이 설정되어 있어 완전히 최소한으로 만들 수 없다. 몇 시간 동안 실행되는 세션에서는 루프가 복리 효과를 낸다. 토큰당 가장 저렴한 모델이 세션당 가장 비쌀 수 있으며, 가장 적게 말하는 모델이 루프를 빠르게 유지한다.
그것은 @dotey가 보고한 내용과 일치합니다. 역전된 구성이 토큰 소비를 "나쁘지 않은" 수준으로 유지하는 것은 정확히 Opus 5 — 장황한 모델 — 가 하위 에이전트에 격리되어, 그 출력이 오버헤드가 아니라 산출물이 되기 때문입니다.
역전된 구조: Fable 5는 계획하고, Opus는 실행한다
아키텍처는 설명하기는 간단하지만, 실행하기에는 약간 직관에 반한다:
• 세션 모델 — 높은 추론 강도로 실행되는 Claude Fable 5(커뮤니티 약칭 "Fable 5 High"의 "High"). 대화, 계획, 완료 정의를 총괄합니다.
• 오케스트레이션 턴 — 요구 사항 명확화, 계획 분해, 작업 할당, 결과 수락이 모두 Fable 5에서 이루어집니다. 이는 몇 번의 턴에 불과하며 전체 토큰에서 차지하는 비중이 작습니다.
• 실행 턴 — 각 태스크는 Claude Opus 5를 실행하는 서브에이전트에 디스패치됩니다. 이들은 많은 턴과 토큰 지출의 대부분을 차지하며, Opus 5는 벤더가 보고한 에이전트 점수가 가장 높은 곳입니다.
경제적 구조가 성립하는 이유는 두 비용 곡선이 서로 다른 방향을 가리키기 때문입니다. Fable 5의 강점은 판단입니다. 아껴서 사용합니다. Opus 5의 강점은 실행입니다. 많이 사용하되 병렬로, 루프에서 격리된 채로 사용합니다. 루프는 빠르고 저렴하게 유지되고, 값비싼 역량은 어차피 토큰이 소비되는 바로 그 지점에만 투입됩니다.
{{1}}이것은 통용되는 두 가지 커뮤니티 패턴 중 하나이며, 서로 거울상입니다.{{/1}} 더 일반적으로 권장되는 "아키텍트 패턴"(예: fable-advisor 플러그인에서 사용)은 Opus를 전담 아키텍트로 운영하고, Fable 5를 최고 복잡도 구현 영역과 필수 산출물 최종 검토용으로 예약합니다. {{2}}차이는 최적화 대상에 있습니다. 아키텍트 패턴은 조정에 Opus급 토큰을 소비하고 Fable 5를 메스처럼 사용하는 반면, 반전된 패턴은 Fable 5를 조정에 사용하고 Opus 5를 대량 처리에 사용합니다.{{/2}} 둘 다 커뮤니티 지침입니다. Anthropic은 둘 중 어느 것도 문서화하지 않으며, {{3}}둘 다 결과를 바꾸는 곳에 프런티어 토큰을 사용하려는 시도입니다.{{/3}}
Claude Code에서 설정하기
Claude Code에는 내장된 "오케스트레이터 모드"가 없으므로, 이 패턴은 두 가지 방식으로 적용됩니다: 세션 프롬프트의 지침과 실행 측의 명시적 모델 고정입니다.
명령 계층은 ~/.claude/CLAUDE.md에 있습니다 — @dotey가 편집한 바로 그 파일입니다. 형태로서, 프롬프트는 주 에이전트에게 어떤 작업을 완료된 것으로 간주하기 전에 네 가지 작업을 수행하도록 지시합니다:
• 코드를 작성하기 전에 요구사항을 재진술하고 범위를 확인하십시오.
• 작업을 병렬로 실행할 수 있는 작업들로 분해하십시오.
• 각 실행 작업을 Claude Opus 5에 고정된 하위 에이전트에게 전달하십시오.
• 각 결과를 수용하기 전에 계획과 대조하여 검증하십시오.
그 형태는 붙여 넣을 스니펫이 아니라 지침으로 명시할 가치가 있습니다 — 요구 사항과 스택에 따라 그 안에 포함될 내용이 달라지기 때문입니다.
모델 레이어는 대부분의 설정이 가정하는 것보다 더 중요하다. Claude Code에서 서브에이전트 모델 해석 순서는 다음과 같다. CLAUDE_CODE_SUBAGENT_MODEL 환경 변수, 그다음 호출별 모델 파라미터, 그다음 에이전트 정의의 frontmatter, 그다음 세션 모델이다. 모델이 설정되지 않은 에이전트는 세션 모델을 상속한다. 따라서 세션이 Fable 5에서 실행되고 Agent 도구의 모델 인자에 의존한다면, 그 인자가 무시될 수 있는 문서화된 위험이 있다(GitHub issue #83920). 즉 서브에이전트는 어차피 세션 모델을 상속하므로, Opus 5에서 실행하려던 작업에 Fable 5 요금을 지불하게 되는 것이다.
두 가지 확실한 해결 방법이 있습니다: 세션에 대해 CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5를 설정하거나, 서브에이전트의 frontmatter에서 모델을 고정하세요. 그 하나의 변수가 패턴이 설계대로 작동하는 것과 전체 세션을 비싼 모델로 조용히 실행하는 것 사이의 차이를 결정합니다.
분할 뒤의 토큰 계산
오늘 현재 가격이 책정된 두 모델은 다음과 같습니다(공급업체가 게시한 가격이며, OrcaRouter에서 정가로 전달됨):
• Claude Fable 5 — 1M 입력 토큰당 $10, 1M 출력당 $50; 1M 토큰 컨텍스트, 128K 출력.
• Claude Opus 5 — 입력 토큰 1M당 $5, 출력 토큰 1M당 $25; 1M 토큰 컨텍스트, 128K 출력.

직관에 반하는 점은 Opus 5가 토큰당 가격이 절반인데도 세션당 비용 대결에서 질 수 있다는 것입니다. 대략적인 수치로 그 윤곽을 쉽게 알 수 있습니다. Opus 5의 루프가 Fable 5의 루프보다 2~3배 많은 토큰을 생성한다면(이는 측정된 수치가 아니라 Opus 5의 자기 검증 동작에 대한 실무자들의 보고와 일치하는 예시적 수치입니다), 토큰당 요율이 절반이더라도 루프 비용은 거의 같아지고, 격차가 더 벌어지면 루프에서 Opus가 더 많은 비용을 초래합니다. 한편 세션의 대부분을 차지하는 실행 토큰은 어느 쪽이든 더 저렴한 요율로 서브에이전트의 Opus 5에 있게 됩니다.
그것이 역전된 패턴에 대한 전체 논거입니다. 즉, 토큰당 가격은 더 높지만 루프가 더 간결한 모델을 루프에 배치하고, 토큰당 가격이 더 저렴한 모델을 볼륨에 배치하는 것입니다. 이는 모델 결정으로 위장한 라우팅 결정입니다.
OrcaRouter가 공급업체 가격을 0% 마크업으로 그대로 전달하므로, 위 숫자는 여기서 실제로 지불하는 금액입니다. 플랫폼 수수료가 추가로 붙지 않으며, Anthropic이 두 가격 중 어느 하나라도 인하하면 변경 사항은 같은 날 모델 페이지에 반영됩니다.
역전 패턴이 승리할 때 — 그리고 그렇지 않을 때
@dotey의 설정을 복사하면서 자신의 워크로드 형태를 확인하지 않는 것은 양방향 모두에서 실수입니다.
반전된 패턴이 승리하는 경우:
• 요구 사항이 모호하거나 계획에 변수가 많다 — 오케스트레이션 판단이 희소한 자원이다.
실행은 서브에이전트로 병렬화할 수 있다 — 볼륨이 루프를 벗어난다.
• 세션은 길다 — 루프의 장황함은 실제 비용으로 누적된다.
표준 조언이 효과적인 경우는 다음과 같습니다.
세션의 대부분은 한정적이고 기계적인 작업이므로, Fable급 플래너는 과합니다. Opus 5는 가격이 더 낮고 벤치마크 점수가 더 높아 명백한 기본값입니다. 이것이 Claude Code의 문서가 Opus를 세션 기본값으로 삼고 Fable 5를 명시적 선택으로 남겨 두는 이유입니다.
• 하위 에이전트 모델을 안정적으로 고정할 수 없습니다 — #83920 상속 버그는 반전된 패턴을 "Fable 5 가격 책정의 모든 것"으로 바꿉니다.
또한 조정 가능한 중간 경로가 있습니다. Opus 5는 effort 파라미터(낮음~최대, 기본값 높음)를 노출하므로, 더 간결한 동작 쪽으로 밀어붙일 수 있습니다. 그러나 완전히는 아닙니다. thinking 비활성화가 높은 effort로 제한되기 때문입니다. Opus 5의 장황함이 문제라면 effort를 낮추는 것만으로 충분할 수 있으며, 아키텍처를 전혀 뒤집을 필요가 없습니다.
8월 7일 생물학 변경이 이 설정에 의미하는 바
Anthropic의 8월 7일 업데이트는 Claude Fable 5의 생물학 분류기를 재작성하고 재훈련했습니다. 이 분류기는 쿼리가 덜 유능한 모델로의 "폴백"을 유발하는지 여부를 결정하는 시스템입니다. Anthropic 자체 수치(벤더 보고 기준)에 따르면, 생물학 관련 폴백은 제품 전반에서 약 85% 감소했으며, 전체 폴백은 Claude.ai에서 약 67%, Cowork에서 약 55%, Claude Code에서 약 17%, Claude Platform에서 약 7% 감소했습니다.

Fable 5 오케스트레이션 설정에서 중요한 것은 Claude Code 번호입니다. 폴백(fallback)은 시스템이 사용자의 쿼리를 조용히 다른 모델로 전환하는 것을 의미하며, 이 경우에는 Opus 5로 전환됩니다. 일반 채팅에서는 보이지 않는 마찰일 뿐이지만, 에이전트 세션에서는 파이프라인의 일부가 선택하지 않은 모델에서 실행되고, 계획하지 않은 비용 프로필이 적용된다는 뜻입니다. 이 업데이트는 그것을 제거하지 않습니다. 바이러스학, 독성학, 분자 설계는 여전히 폴백됩니다. 하지만 일상적인 건강 및 교육 생물학 — 검사 결과 읽기, 증상 이해하기, 생물학 공부하기 — 는 이제 Fable 5에 유지됩니다.
분명히 표시된 사전 참고 사항: 7월 말의 확인되지 않은 보도(36kr, WinCentral)에 따르면 이번 달에 Claude Fable 5.1이 가격 변동 없이 리프레시될 가능성이 있습니다. Anthropic은 이름, 날짜 또는 API 모델 ID를 확인하지 않았습니다. 출시될 때까지는 추측으로 간주하세요.
워크플로우를 걸지 않고 시도하기
역전 패턴이 시도해볼 가치가 있는 이유는 그것이 되돌릴 수 있고, 두 모델을 하나의 엔드포인트를 통해 라우팅하면 되돌리는 것이 저렴하기 때문이다.
OrcaRouter에서는 Claude Fable 5(anthropic/claude-fable-5)와 Claude Opus 5(anthropic/claude-opus-5)가 하나의 API 키 뒤에 있습니다. 세션의 실행 레인을 별도의 계약이나 코드 변경 없이 두 모델 중 하나에서 실행할 수 있습니다. 이는 'Fable 5를 오케스트레이터로' 같은 실험에 꼭 필요한 기능입니다. 실험의 핵심이 커밋하기 전에 자신의 세션별 비용을 측정하는 것이기 때문입니다.

두 가지 OrcaRouter 기능이 이 구성에 직접 매핑됩니다. 자동 장애 조치(failover)를 사용하면 폴백 체인을 정의할 수 있습니다. 즉, Fable 5가 오류를 일으키거나 시간 초과되면 요청이 실패하는 대신 Opus 5나 더 저렴한 모델로 라우팅됩니다. 또한 라우팅 DSL은 두 모델을 하나의 호출로 구성할 수 있습니다. 하나의 엔드포인트 뒤에서 Fable 5 계획 단계에 이어 Opus 5 실행 단계가 이어지는 방식입니다. 이것은 프롬프트 규율이 아니라 인프라로 표현된 오케스트레이션 패턴입니다.
결론
역전된 아키텍처 — Claude Fable 5가 계획하고 Claude Opus 5가 실행한다 — 는 실제 문제에 대한 실질적이고 작동하는 해답입니다: 토큰당 가장 저렴한 모델이 반드시 세션당 가장 저렴한 것은 아닙니다. 이는 벤치마크 결정이 아닙니다. Opus 5는 대부분의 벤더 보고 에이전트 비교에서 승리합니다. 이는 토큰 라우팅 결정이며, 오케스트레이션 판단이 부족하고 실행을 병렬화할 수 있을 때에만 효과가 있습니다.
Claude Fable 5(2026년 6월 9일)와 Claude Opus 5(2026년 7월 24일)는 모두 현재 Anthropic 모델이며, 8월 7일 안전장치 변경으로 Fable 5는 중단이 덜한 일상 드라이버가 되었습니다. 다음 세 가지를 주목하세요. Fable 5.1 보고서가 실제로 성과를 내는지, Anthropic이 이 패턴을 조용히 되돌릴 수 있는 하위 에이전트 상속 버그를 수정하는지, 그리고 가장 중요하게는 일주일간의 실제 세션에서 완료된 작업당 비용이 어떤 모습인지입니다.
자주 묻는 질문
Fable 5가 Claude Code의 기본 모델인가요?
아니요. Claude Code의 자체 문서에 따르면 Fable 5는 어떤 계정 유형의 기본값도 아닙니다. 세션은 기본적으로 표준 Opus 모델을 사용하며, Fable 5는 /model, 모델 설정, 또는 "best" 별칭을 통해 선택합니다. 이 글의 패턴은 의도적으로 그 기본값에 반하는 방식으로 동작합니다.
토큰당 비용이 더 저렴하고 점수가 더 높은데, 기본값으로 그냥 Opus 5를 사용하지 않을까요?
세션당 비용은 작업당 토큰 수에 토큰당 가격을 곱한 값이기 때문입니다. 실무자들은 Opus 5의 적응형 사고와 자체 검증이 턴당 훨씬 더 많은 토큰을 생성한다고 보고하므로, 토큰당 요금이 절반이라도 긴 루프에서는 여전히 더 느리고 더 비쌀 수 있습니다. 이것이 이 플레이북이 기반으로 하는 커뮤니티의 발견입니다 — 어느 쪽을 선택하기 전에 자신의 워크로드에서 직접 측정해 보십시오.
내 하위 에이전트가 세션과 다른 모델을 실행하도록 강제할 수 있나요?
네, 맞습니다. 하지만 매 호출 시 모델 매개변수에 의존하지 마세요: GitHub 이슈 #83920에는 해당 매개변수가 무시되고 서브에이전트가 대신 세션 모델을 상속한다고 문서화되어 있습니다. CLAUDE_CODE_SUBAGENT_MODEL을 설정하거나 서브에이전트의 frontmatter에서 모델을 고정하세요 — 이것이 실행이 Opus 5 요금으로 진행되는지, 조용히 Fable 5 요금으로 진행되는지를 결정하는 차이입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
