Cartão de título hero para o artigo 'Claude Fable 5 como seu orquestrador' mostrando um nó central Claude Fable 5 que se ramifica em quatro nós menores de subagentes trabalhadores Opus 5, com o subtítulo 'Um playbook de subagentes Claude Code para manter os custos de token baixos' e o logotipo da OrcaRouter sobreposto no canto.
Guides & Insights

Claude Fable 5 como seu Orquestrador: O Guia dos Subagentes que Mantém os Custos de Tokens Baixos

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 7 de agosto, a Anthropic fez a maior mudança individual no Claude Fable 5 desde que o modelo foi lançado em 9 de junho: reduziu os "fallbacks" relacionados à biologia em cerca de 85%, então perguntas cotidianas de saúde e educação agora recebem uma resposta direta em vez de mudar silenciosamente para um modelo mais fraco. O padrão que está realmente se espalhando pela comunidade Claude Code esta semana, no entanto, não tem nada a ver com biologia. Os profissionais continuam publicando um fluxo de trabalho em que o Claude Fable 5 executa o loop de orquestração — esclarecimento de requisitos, decomposição do plano, despacho de tarefas, aceitação de resultados — enquanto a execução é transferida para subagentes do Claude Opus 5. O benefício declarado: o Fable 5 High se torna um padrão de sessão acessível, e a verbosidade do Claude Opus 5 deixa de consumir a sessão.

O exemplo mais recente é o de @dotey, postado em 14 de agosto: uma pequena adição ao ~/.claude/CLAUDE.md que instrui o agente a abrir subagentes Opus para execução, deixando o Claude Fable 5 com alto esforço de raciocínio como padrão da sessão, com o autor relatando que o consumo de tokens continua razoável — e um motivo direto para não executar o Claude Opus 5 como padrão: em suas mãos, era lento demais e queimava um enorme número de tokens no loop principal. Essa é uma descoberta da comunidade, não uma orientação da Anthrop​ic — e vale a pena entender antes de copiá-la, porque no papel parece invertida.

O padrão em um parágrafo. No Claude Code, os subagentes herdam o modelo da sua sessão por padrão; portanto, a maneira de manter um ciclo rápido e barato é fazer do modelo da sessão o planejador e apontar os executores para um modelo diferente explicitamente. O Claude Fable 5 — o modelo de classe Mythos da Anthrop​ic, tornado seguro para uso geral, lançado em 9 de junho de 2026, a $10/$50 por milhão de tokens — mantém os requisitos, decompõe o trabalho, despacha tarefas e aceita resultados. O Claude Opus 5 — lançado em 24 de julho de 2026, a $5/$25 por milhão de tokens — executa as implementações reais dentro dos subagentes. Você gasta julgamento de nível Fable nas poucas etapas de orquestração e execução de nível Opus nas muitas etapas de execução, onde já vai a maior parte dos tokens.

Por que o modelo de loop principal é o verdadeiro problema de custo

Em benchmarks, isso parece um problema resolvido — e a resposta parece ser "padrão para o Opus 5." Os próprios números da Anthrop​ic (relatados pela empresa, não reproduzidos) colocam o Claude Opus 5 à frente do Claude Fable 5 no benchmark de codificação agêntica Frontier-Bench v0.1 (43.3% contra 33.7%), no SWE-bench Verified (96.0% contra 95.5%) e no ARC-AGI-3 (30.2%, cerca de 4x o próximo melhor modelo público). A Anthrop​ic posiciona o Opus 5 como se aproximando da inteligência de fronteira do Fable 5 pela metade do preço. Se você escolhe um padrão de sessão puramente com base em benchmarks de fornecedores e preço por token, o Opus 5 é a escolha óbvia.

Profissionais que realmente executam sessões longas estão chegando ao padrão oposto, e a razão é tokens por tarefa, não preço por token. O pensamento do Opus 5 está ativado por padrão e é adaptativo, e a Anthrop​ic diz que ele verifica o próprio trabalho sem ser solicitado — o que significa, na prática, que cada turno do loop emite substancialmente mais tokens do que o do Fable 5. Desativar esse pensamento é limitado a alto esforço, então você não pode forçá-lo a ficar totalmente enxuto. Em uma sessão que dura horas, o loop é o que se acumula: o modelo mais barato por token pode acabar sendo o mais caro por sessão, e o modelo que menos fala mantém o loop rápido.

Isso corresponde ao que @dotey relata. A configuração invertida mantém o consumo de tokens "não ruim" precisamente porque o Opus 5 — o verboso — fica isolado nos subagentes, onde sua saída é o entregável em vez da sobrecarga.

A arquitetura invertida: Fable 5 planeja, Opus executa

A arquitetura é simples de enunciar e um pouco contraintuitiva de executar:

• Modelo de sessão — Claude Fable 5 com alto esforço de raciocínio (o "High" na abreviação da comunidade "Fable 5 High"). Ele é o dono da conversa, do plano e da definição de pronto.

• Turnos de orquestração — esclarecimento de requisitos, decomposição de plano, despacho de tarefas e aceitação de resultados acontecem todos no Fable 5. São poucos turnos e uma pequena parcela do total de tokens.

• Turnos de execução — cada tarefa é despachada para um subagente executando Claude Opus 5. Esses são os muitos turnos e a maior parte do gasto de tokens — e é no Opus 5 que as pontuações agênticas relatadas pelo fornecedor são mais altas.

The economics work because the two cost curves point in different directions. A força do Fable 5 é o julgamento; você o usa com moderação. A força do Opus 5 é a execução; você a usa intensamente, mas em paralelo, isolada do loop. O loop permanece rápido e barato, e a capacidade cara é gasta exatamente onde os tokens já estão sendo gastos de qualquer forma.

Este é um dos dois padrões comunitários em circulação, e eles são espelhos um do outro. O "padrão arquiteto", mais comumente recomendado (usado, por exemplo, pelo plugin fable-advisor), executa o Opus como arquiteto em tempo integral e reserva o Fable 5 para a faixa de implementação de maior complexidade e uma revisão obrigatória ao final da entrega. A diferença é um alvo de otimização: o padrão arquiteto gasta tokens de nível Opus em coordenação e usa o Fable 5 como bisturi; o padrão invertido usa o Fable 5 para coordenação e o Opus 5 para volume. Ambos são orientações da comunidade — a Anthrop​ic não documenta nenhum dos dois — e ambos são tentativas de gastar tokens de fronteira onde eles mudam o resultado.

Configurando no Claude Code

O Claude Code não tem um "modo orquestrador" integrado, então o padrão é aplicado de duas maneiras: instruções no prompt da sessão e modelos explicitamente fixados no lado da execução.

A camada de instrução vive em ~/.claude/CLAUDE.md — o mesmo arquivo que @dotey editou. Como uma forma, o prompt diz ao agente principal para fazer quatro coisas antes de considerar qualquer tarefa como concluída:

• Reafirme o requisito e confirme o escopo antes de escrever o código.

• Decomponha o trabalho em tarefas que podem ser executadas em paralelo.

• Despache cada tarefa de execução para um subagente fixado ao Claude Opus 5.

• Verifique cada resultado contra o plano antes de aceitá-lo.

Essa forma vale mais como orientação do que como um trecho para colar — seus requisitos e sua stack mudam o que pertence a ela.

A camada de modelo importa mais do que a maioria das configurações assume. No Claude Code, a ordem de resolução do modelo do subagente é: a variável de ambiente CLAUDE_CODE_SUBAGENT_MODEL, depois um parâmetro de modelo por invocação, depois o frontmatter da definição do agente, depois o modelo da sessão. Agentes sem um modelo definido herdam o modelo da sessão. Então, se sua sessão roda no Fable 5 e você depende do argumento de modelo da ferramenta Agent, há um risco documentado de ele ser ignorado (issue #83920 do GitHub): os subagentes herdam o modelo da sessão de qualquer forma, e você paga o preço do Fable 5 por uma execução que pretendia rodar no Opus 5.

Duas correções confiáveis: defina CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5 para a sessão, ou fixe o modelo no frontmatter do subagente. Essa única variável é a diferença entre o padrão funcionar como projetado e executar silenciosamente toda a sessão no modelo caro.

A matemática dos tokens por trás da divisão

Aqui estão os dois modelos conforme precificados hoje (publicados pelo fornecedor e repassados pelo preço de tabela no OrcaRouter):

• Claude Fable 5 — $10 por 1M de tokens de entrada, $50 por 1M de saída; contexto de 1M de tokens, saída de 128K.

• Claude Opus 5 — $5 por 1M de tokens de entrada, $25 por 1M de tokens de saída; contexto de 1M tokens, saída de 128K.

A comparison scoreboard for Claude Fable 5 and Claude Opus 5 contrasting price ($10/$50 vs $5/$25 per 1M tokens), context (both 1M in / 128K out), Frontier-Bench v0.1 (33.7% vs 43.3%), SWE-bench Verified (95.5% vs 96.0%), loop behaviour, and the role each plays in the orchestrator pattern, with a footer noting prices are vendor-published and benchmarks vendor-reported.

O ponto contraintuitivo é que o Opus 5 custa metade do preço por token e ainda assim pode perder o jogo de custo por sessão. O formato é fácil de ver com números aproximados: se o loop no Opus 5 emite de duas a três vezes mais tokens do que o loop no Fable 5 — um valor ilustrativo consistente com relatos de profissionais sobre o comportamento de autoverificação do Opus 5, não um valor medido — então mesmo com metade da taxa por token, o loop custa aproximadamente o mesmo, e se a diferença for maior, o Opus no loop custa mais. Enquanto isso, os tokens de execução, o grosso da sessão, ficam no Opus 5 em subagentes à taxa mais barata, de qualquer forma.

Esse é todo o argumento para o padrão invertido: colocar o modelo cujo preço por token é mais alto, mas cujo loop é mais enxuto no loop, e colocar o modelo mais barato por token no volume. É uma decisão de roteamento disfarçada de decisão de modelo.

Como o OrcaRouter repassa os preços dos provedores com margem de 0%, os números acima são o que você realmente paga aqui — sem taxa adicional de plataforma — e se a Anthrop​ic reduzir qualquer um dos preços, a mudança aparece na página do modelo no mesmo dia.

Quando o padrão invertido vence — e quando não vence

Copiar a configuração do @dotey sem verificar o formato da sua própria carga de trabalho é um erro em ambas as direções.

O padrão invertido vence quando:

• Os requisitos são ambíguos ou o plano tem muitas partes móveis — o julgamento de orquestração é o recurso escasso.

• A execução pode ser paralelizada em subagentes — o volume sai do loop.

• As sessões são longas — a verbosidade em loops se acumula em custo real.

O conselho padrão vence quando:

• A maior parte da sua sessão é trabalho limitado e mecânico — um planejador de nível Fable é exagero, e o preço mais baixo do Opus 5 e suas pontuações mais altas em benchmarks fazem dele a opção óbvia por padrão. É por isso que a própria documentação do Claude Code define Opus como padrão de sessão e reserva Fable 5 para seleção explícita.

• Você não pode fixar modelos de subagente de forma confiável — o bug de herança #83920 transforma o padrão invertido em "tudo sobre preços do Fable 5."

Há também um caminho intermediário de ajuste. O Opus 5 expõe um parâmetro de esforço (de baixo a máximo, com alto como padrão), então você pode empurrá-lo para um comportamento mais enxuto — mas não completamente, porque desativar o raciocínio é limitado ao esforço alto. Se o seu problema é a verbosidade do Opus 5, diminuir o esforço pode ser suficiente, e você nunca precisará inverter a arquitetura.

O que a mudança de biologia de 7 de agosto significa para esta configuração

A atualização de 7 de agosto da Anthropic reescreveu e retreinou o classificador de biologia do Claude Fable 5 — o sistema que decide se uma consulta aciona um "fallback" para um modelo menos capaz. Segundo os números da própria Anthropic (relatados pelo fornecedor), os fallbacks relacionados a biologia caíram cerca de 85% em todas as superfícies de produtos, com os fallbacks gerais reduzidos em ~67% no Claude.ai, ~55% no Cowork, ~17% no Claude Code e ~7% na Claude Platform.

Screenshot of Anthropic's 'Improving Fable 5's biology safeguards' announcement dated August 7, 2026, describing the roughly 85% reduction in biology-related fallbacks across product surfaces.

Para uma configuração de orquestração do Fable 5, o número do Claude Code é o que importa. Uma alternativa é o sistema trocar silenciosamente sua consulta para um modelo diferente — neste caso, para o Opus 5. Em um chat simples, isso é um atrito invisível; em uma sessão agêntica, significa que parte do seu pipeline roda em um modelo que você não escolheu, com um perfil de custo que você não planejou. A atualização não remove isso: virologia, toxicologia e design molecular ainda sofrem fallback. Mas biologia cotidiana de saúde e educação — ler um resultado de exame, entender um sintoma, estudar biologia — agora permanece no Fable 5.

Uma nota inicial, claramente rotulada: relatos não confirmados do final de julho (36kr, WinCentral) apontam para uma possível atualização do Claude Fable 5.1 neste mês, com preços inalterados. A Anthrop​ic não confirmou um nome, uma data ou um ID de modelo de API — trate isso como especulação até que seja lançado.

Experimentar sem arriscar seu fluxo de trabalho

O que torna o padrão invertido digno de tentativa é que ele é reversível, e rotear ambos os modelos por meio de um único endpoint torna a reversão barata.

No OrcaRouter, Claude Fable 5 (anthropic/claude-fable-5) e Claude Opus 5 (anthropic/claude-opus-5) ficam atrás de uma única chave de API. Você pode rodar a pista de execução da sessão em qualquer um dos modelos sem um segundo contrato ou alteração de código — o que é exatamente o que um experimento como "Fable 5 como orquestrador" precisa, porque o objetivo principal é medir seu próprio custo por sessão antes de se comprometer.

Screenshot of the OrcaRouter model page for Claude Fable 5 showing the slug anthropic/claude-fable-5, $10 per 1 million input tokens and $50 per 1 million output tokens, a 1M-token context, and the /v1/messages and /v1/chat/completions endpoints.

Duas funcionalidades do OrcaRouter mapeiam diretamente para esta configuração. O failover automático permite definir uma cadeia de fallback — se o Fable 5 apresentar erro ou atingir o tempo limite, a solicitação é roteada para o Opus 5 ou para um modelo mais barato, em vez de falhar. E o DSL de roteamento pode compor o par em uma única chamada: uma etapa de planejamento do Fable 5 seguida por etapas de execução do Opus 5 por trás de um único endpoint. Esse é o padrão de orquestração expresso como infraestrutura, em vez de disciplina de prompt.

Conclusão

A arquitetura invertida — Claude Fable 5 planeja, Claude Opus 5 executa — é uma resposta real e funcional para um problema real: o modelo que é mais barato por token não é necessariamente o mais barato por sessão. Não é uma decisão de benchmark; o Opus 5 vence a maioria das comparações de agentes relatadas pelos fornecedores. É uma decisão de roteamento de tokens, e só compensa quando o julgamento de orquestração é escasso e a execução pode ser paralelizada.

Claude Fable 5 (9 de junho de 2026) e Claude Opus 5 (24 de julho de 2026) são ambos modelos atuais da Anthrop​ic, e a mudança de salvaguarda de 7 de agosto torna o Fable 5 um driver diário com menos interrupções. Fique atento a três coisas: se os relatórios do Fable 5.1 realmente resultam em algo, se a Anthrop​ic corrige o bug de herança de subagente que pode silenciosamente desfazer esse padrão e — o mais importante — como fica seu próprio custo por tarefa concluída ao longo de uma semana de sessões reais.

Perguntas Frequentes

O Fable 5 é o modelo padrão no Claude Code?

Não. A documentação do próprio Claude Code afirma que o Fable 5 não é o padrão para nenhum tipo de conta — as sessões usam o modelo Opus padrão, e você seleciona o Fable 5 via /model, uma configuração de modelo ou o alias "best". A prática descrita neste artigo vai deliberadamente contra esse padrão.

Por que não usar simplesmente o Opus 5 como padrão, já que é mais barato por token e obtém pontuações mais altas?

Porque o custo por sessão é tokens por tarefa vezes preço por token. Profissionais relatam que o pensamento adaptativo e a autoverificação do Opus 5 emitem muito mais tokens por turno, então, mesmo com metade da taxa por token, ainda pode ser mais lento e mais caro em um loop longo. Essa é a descoberta da comunidade na qual este guia se baseia — meça em sua própria carga de trabalho antes de escolher um lado.

Posso forçar meus subagentes a executar um modelo diferente do da sessão?

Sim, mas não confie no parâmetro de modelo por invocação: o issue #83920 do GitHub documenta que ele é ignorado, com os subagentes herdando, em vez disso, o modelo da sessão. Defina CLAUDE_CODE_SUBAGENT_MODEL ou fixe o modelo no frontmatter do subagente — essa é a diferença entre a execução rodando no preço do Opus 5 e rodando silenciosamente no preço do Fable 5.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente