Cartão de título principal com o cabeçalho "Claude Opus 5.5 Executa, Claude Fable 5.1 Aconselha", com o subtítulo "Precificando o loop de aconselhamento do Claude Code", um diagrama da esquerda para a direita mostrando Fable 5.1 escrevendo o plano, Opus 5.5 executando o loop, e uma seta curva de feedback rotulada "aconselha e verifica", e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Claude Opus 5.5 Executa, Claude Fable 5.1 Aconselha: Precificando o Loop de Consultor do Claude Code

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Fable 5.1 escreve o plano de design. Claude Opus 5.5 o executa em loop. O Fable 5.1 volta como consultor e aceita ou rejeita o resultado. Esse é o padrão que X/@dotey publicou em 22 de setembro de 2026 — o dia em que o fornecedor lançou o Claude Opus 5.5 —, enquadrando-o como um arranjo de economia de tokens surgido sob pressão de custos: defina o consultor como Fable, rode o Opus e deixe o modelo caro falar apenas nos pontos de decisão. O que eles estão usando já não é um truque de prompt nem uma configuração de subagente. É a ferramenta de consultor integrada do Claude Code, um recurso do lado do servidor cobrado pelas tarifas do modelo consultor, por cima de tudo o que o modelo principal gasta. E o conselho é a parte barata. Reler a conversa para produzi-lo não é — o contexto do executor ficou barato de reler, e o do consultor nunca foi. Essa única assimetria decide se vale a pena rodar o loop, e é isso que o restante deste artigo precifica.

O que o loop realmente é

A ferramenta advisor combina seu modelo principal com um segundo modelo, geralmente mais forte, que o Claude consulta em momentos-chave — antes de se comprometer com uma abordagem, quando um erro continua se repetindo ou antes de declarar uma tarefa concluída. O advisor recebe a conversa completa, incluindo cada chamada de ferramenta e seu resultado, e retorna orientações que o modelo principal então aplica. Ele nunca chama ferramentas e nunca produz saída voltada ao usuário. Você escolhe qual modelo aconselha; o Claude decide quando chamá-lo.

Essa última parte é o que separa isto do padrão de orquestrador e subagente que a comunidade do Claude Code fazia circular em agosto. Subagentes são delegação: um planejador decompõe o trabalho e o despacha para workers, e você configura explicitamente o modelo de cada lane. O advisor é escalonamento: um modelo conduz a tarefa inteira, e o modelo caro é acionado em pleno andamento para tomar uma decisão que o condutor não consegue tomar sozinho. Não há pool de workers, nem grafo de tarefas, nem prompt de orquestração para manter. O loop prático que @dotey descreve — planejar, executar, verificar, repetir — é a aparência desse mecanismo quando você aponta o advisor para o Fable 5.1 e deixa que ele fiscalize a condição de saída do loop.

A própria formulação da Anthropic sobre a estratégia é direta quanto ao formato da vitória: o conselheiro "só pode transferir a capacidade que falta ao executor". Tudo o que vem a seguir decorre de quanta capacidade está de fato faltando e de com que frequência o executor admite isso.

Por que o Claude Opus 5.5 mudou a aritmética

A two-column scoreboard. Left column, Claude Opus 5.5 as executor: input $4.00 per million, output $20.00 per million, cache read $0.20 per million, role 'runs the loop', effort default medium, benchmarks vendor-reported. Right column, Claude Fable 5.1 as advisor: input $10.00 per million, output $50.00 per million, cache read $0.25 per million, role 'advises at decision points', each consult a full transcript and uncached, benchmarks vendor-reported. A footer notes the prices are from Anthropic's published rate card, September 2026, with no independent scores.

A tabela de preços publicada pela Anthropic, por milhão de tokens. São valores do fornecedor, não estimativas:

• Claude Opus 5.5 — US$ 4 de entrada, US$ 20 de saída, US$ 0,20 de leitura de cache, US$ 5 por gravação de cache de 5 minutos

Claude Opus 5 — $5 de entrada, $25 de saída, $0,50 de leitura de cache, $6,25 para uma gravação de cache de 5 minutos

• Claude Fable 5.1 — US$ 10 de entrada, US$ 50 de saída, US$ 0,25 de leitura de cache, US$ 12,50 por uma gravação de cache de 5 minutos

Dois detalhes nessa lista importam mais do que os preços de manchete. Primeiro, as leituras de cache no Opus 5.5 são 5% da entrada base, segundo a própria nota de rodapé da Anthropic, ao passo que a maioria dos modelos Claude fica em 10% e o Fable 5.1 fica em 2,5%. O Fable 5.1 tem o melhor multiplicador e ainda assim perde em dólares absolutos — US$ 0,20 contra US$ 0,25 — porque sua taxa de entrada base é duas vezes e meia maior.

Segundo, e esta é a mecânica da qual o loop depende: ativar e desativar o assessor no Claude Code não invalida o cache de prompt do modelo principal, então o contexto longo e repetidamente reenviado do executor continua barato a US$ 0,20 por milhão de tokens. A própria leitura do assessor sobre a conversa não é armazenada em cache. Cada consulta processa o transcrito completo do zero, à taxa de US$ 10 por milhão de tokens de entrada do Fable 5.1. Um executor que relê um contexto de 500 mil tokens dez vezes paga por leituras de cache; um assessor consultado dez vezes paga dez novas cobranças de entrada sobre um transcrito que está crescendo o tempo todo. Quanto mais barato fica o contexto do seu executor, mais a leitura sem cache do assessor se destaca — e o Opus 5.5 acabou de deixar o contexto do executor 60% mais barato do que o do Opus 5.

Configurando no Claude Code

O Advisor é experimental e a Anthropic deixa isso claro no banner da sessão — "Advisor Tool (experimental) está ativado e pode usar mais tokens". O comportamento, os preços e a disponibilidade podem mudar. Feita essa ressalva, a mecânica está documentada:

Screenshot of Anthropic's Claude Code documentation page for the advisor tool, showing the table of contents (Advisor, Availability, How it works, Supported pairings, How the advisor sees your conversation, Using the advisor, Model selection, Advisor response, Consuming the advisor result, Usage, Pricing, Rate limits, Troubleshooting, Tool use errors, Silent fallback) and body text confirming the tool is experimental and server-side, is available on the Anthropic API only, pairs the main model with a second model that advises at key moments, and that the advisor sees the full conversation including tool calls and results.

• Ative-o com /advisor fable, ou execute /advisor sem argumento para um seletor. A escolha é salva na configuração advisorModel nas suas configurações de usuário e persiste entre sessões. /advisor off o desativa.

• Para uma única sessão sem alterar o padrão salvo, inicie com claude --advisor fable. A flag não está listada em claude --help, e o Claude Code encerra na inicialização se o pareamento for inválido, em vez de iniciar com um advisor silenciosamente ignorado.

• Defina um padrão persistente no seu arquivo de configurações com {"advisorModel": "fable"}.

• Para desativá-lo completamente, defina CLAUDE_CODE_DISABLE_ADVISOR_TOOL=1 — o comando /advisor desaparece e qualquer advisorModel configurado é ignorado.

• O emparelhamento deve ser pelo menos tão capaz quanto o modelo principal. Claude Opus 5.5 aceita Fable e Opus 5 ou posterior como consultores. Um consultor Opus 4.6 ou Sonnet é rejeitado pelo Claude Code; um consultor Opus 4.7 ou Opus 4.8 é anexado e depois recusado pela API. Fable 5.1 como modelo principal aceita apenas Fable 5.1.

• Versões mínimas: a ferramenta advisor requer o Claude Code v2.1.98 ou posterior; o Fable, seja como modelo principal ou como advisor, requer a v2.1.170 ou posterior; o Fable 5.1 requer a v2.1.257 ou posterior. A forma de token do /advisor — aquela que funciona em -p, no Agent SDK, no aplicativo de desktop e no Remote Control — requer a v2.1.260 ou posterior.

• O assessor é exclusivo da API da Anthropic. Ele não está disponível no Amazon Bedrock, na Claude Platform on AWS, no Agent Platform do Google Cloud ou no Microsoft Foundry, e depende da busca de feature flags, então uma sessão com uma variável como DISABLE_TELEMETRY definida o mantém desativado.

• Em planos nos quais o uso do Fable é cobrado em créditos de uso, o Fable como advisor é cobrado da mesma forma e requer um consentimento único. Até você aceitá-lo, /advisor fable não é salvo e claude --advisor fable sai na inicialização apontando para /model fable em vez disso.

Subagentes herdam qualquer advisor que você tenha configurado e executam novamente a mesma verificação de pareamento em relação ao próprio modelo. Essa é a única interação entre este padrão e o padrão de subagentes: um subagente executando um modelo menor pode ter permissão para um advisor que seu pai não tem.

A estrutura dos custos, explicada em detalhe

Nada abaixo é uma medição. O formato dos tokens é inventado para tornar a aritmética visível; os preços são as tarifas publicadas da Anthropic. Suponha uma sessão de executor que lê 1M de tokens de entrada novos e emite 500K de tokens de saída, e três consultas a conselheiros, cada uma relendo uma transcrição de 200K tokens e retornando cerca de 600 tokens de orientação — aproximadamente as duas a três consultas por tarefa que o próprio prompt de sistema da Anthropic solicita.

• Executor no Claude Opus 5.5 — 1M de entrada a $4,00 mais 500K de saída a $10,00 = $14,00

• Consultor no Claude Fable 5.1 — 600K de entrada a $6,00 mais cerca de 1.800 tokens de saída a aproximadamente $0,09 = $6,09

• O loop, total — cerca de $20,09

• O mesmo formato executado de ponta a ponta no Fable 5.1 — $10.00 de entrada mais $25.00 de saída = $35.00

• O mesmo formato apenas no Opus 5.5 — $14.00

O loop fica entre os dois, que é exatamente onde a Anthropic o posiciona: cerca de 43% mais barato do que executar o Fable 5.1 o tempo todo e cerca de 44% mais caro do que apenas o executor. Leia o segundo número como o honesto. O consultor não é uma economia; é uma compra de julgamento de nível Fable em três decisões, e só compensa se essas três decisões mudarem o resultado. Leve a transcrição até a janela de contexto de 1M e cada consulta custa $10 por si só. Deixe o executor começar a perguntar na maioria das tarefas, em vez de em apenas algumas, e você estará pagando tarifas de consultor em toda a carga de trabalho — e, nesse ponto, como a Anthropic diz, executar o próprio modelo do consultor é o caminho mais barato para a mesma pontuação.

O que dizem as próprias medições da Anthropic

A Anthropic publicou resultados medidos para este padrão, e eles são relatados pelo fornecedor: executados pela empresa que vende ambos os modelos, em seu próprio harness de benchmark. Eles ainda são os únicos números desse tipo e incluem o argumento contra o padrão, e é por isso que vale a pena lê-los com atenção.

• Opus 5 como executor com Fable 5.1 como consultor alcançou US$ 7,69 por tentativa no benchmark interno de codificação agêntica da Anthropic — a configuração mais precisa que a Anthropic mediu. Isso é 3,5 pontos acima do Opus 5 sozinho em sua configuração padrão, por um custo ligeiramente menor, e cerca de 2,5 pontos acima do Fable 5.1 sozinho por aproximadamente uma vez e meia o valor. A diferença de 3,5 pontos foi separada do ruído entre execuções com cinco tentativas por tarefa.

• O mesmo pareamento em leitura de gráficos igualou o Fable 5.1 sozinho em esforço médio dentro da margem de erro — 65,0 contra 67,5 — a aproximadamente 2,6 vezes o custo por tarefa, porque o conselheiro foi consultado em quase todas as tarefas.

• No GPQA Diamond, o ganho acompanha a lacuna de capacidade quase perfeitamente: um executor Haiku 4.5 ganhou muito, um executor Sonnet 5 alguns pontos, e um executor de fronteira quase nada.

• A taxa de consulta é a variável frágil. Um executor Sonnet 5 de baixo esforço ganhou 23 pontos no DeepSWE com um consultor, depois parou completamente de perguntar no SWE-bench Pro e não ganhou nada.

• Latência: cerca de duas chamadas extras a modelos de fronteira por tarefa, cada uma no caminho crítico.

Duas coisas sobre essa evidência têm relação direta com o loop como ele está nesta semana. As medições usaram Opus 5 como executor, porque Opus 5.5 não existia quando foram realizadas. E a Anthropic relata que Opus 5.5 tem desempenho no nível do Fable 5.1 na maioria dos trabalhos, embora custe 40% menos para executar — ambas são alegações do fornecedor, nenhuma reproduzida de forma independente. Se a lacuna entre executor e consultor é o que o consultor é pago para fechar, então uma lacuna menor é uma compra menor. O padrão não piorou quando Opus 5.5 foi lançado; aquilo que ele vende ficou menos escasso.

Os modos de falha que você realmente vai encontrar

Estes são comportamentos documentados, não especulação, e o primeiro deles é o motivo para ler esta seção antes de depurar qualquer coisa:

• Um conselheiro ausente sem aviso. Se a API recusar o emparelhamento do conselheiro, o Claude Code anexa-o, a API recusa-o e o Claude Code reenvia o pedido sem o conselheiro. O resto da conversa decorre então sem conselheiro e sem mensagem de erro. Permanece desativado até /clear ou /compact, mesmo depois de mudar para um modelo principal compatível.

• Um rejeitado silenciosamente. Para emparelhamentos que o próprio Claude Code rejeita, o advisor simplesmente nunca é anexado às solicitações do modelo principal. A saída do /advisor e uma notificação avisam você — mas nada falha, então uma sessão que você presumia estar recebendo aconselhamento pode nunca ter recebido.

• Consentimento que você não deu. Com o Fable selecionado como consultor em um plano que exige consentimento para uso de créditos, as solicitações são enviadas sem o consultor até que você aceite. Uma sessão em segundo plano iniciada com --advisor fable começa sem um consultor em vez de encerrar.

• Uma lista de permissões que você não controla. Se a availableModels da sua organização excluir o modelo advisor, o Claude Code não o invocará, e você precisará escolher um modelo permitido com /advisor.

• Em todos os lugares em que não existe. Somente API da Anthropic: sem Bedrock, sem Claude Platform on AWS, sem Google Cloud Agent Platform, sem Microsoft Foundry. Por meio de um gateway, a disponibilidade depende de o gateway encaminhar a solicitação intacta à API da Anthropic — o que é uma propriedade do gateway, não algo que se possa presumir.

Onde o OrcaRouter se encaixa

Ambos os modelos neste loop já estão no OrcaRouter pelo preço de tabela da própria Anthropic, com 0% de margem — o preço de tabela do fornecedor é repassado, então a tarifa que você vê é a tarifa que a Anthropic publica. O Claude Fable 5.1 está em anthropic/claude-fable-5.1 e o Claude Opus 5 em anthropic/claude-opus-5, por trás de uma única chave de API. O Claude Opus 5.5 ainda não é uma das nossas rotas; ele está disponível por meio da própria API da Anthropic e das principais nuvens, e nós diremos isso em vez de dar a entender o contrário.

Screenshot of the OrcaRouter model page for Claude Fable 5.1 (anthropic/claude-fable-5.1), showing the model header, capability tags and the model description.

O que uma única chave compra aqui é a capacidade de mudar de ideia a baixo custo. A economia do loop depende da proporção de preço entre executor e consultor, e essa proporção mudou duas vezes em sete semanas — Opus 5 para Opus 5.5 em 22 de setembro, e Fable 5 para Fable 5.1 em 1º de setembro, o que reduziu a leitura de cache desse modelo de US$ 1,00 para US$ 0,25 por milhão. Cada uma dessas mudanças altera a resposta a "o consultor vale a pena?", e testar essa resposta não deveria exigir um segundo contrato. Failover automático é a outra metade: permite direcionar uma fatia do tráfego para um modelo que você ainda não caracterizou, com fallback para aquele que você já conhece, em vez de apostar um caminho de produção numa tabela de lançamento. E se você estiver construindo o padrão por conta própria em vez de usar a ferramenta integrada do Claude Code, o DSL de roteamento compõe vários modelos em uma única chamada — uma etapa de planejamento em um modelo seguida de etapas de execução em outro, por trás de um único endpoint.

Uma nota honesta sobre o escopo: a própria ferramenta advisor é uma ferramenta do lado do servidor que roda na API da Anthropic, então uma camada de roteamento não é um substituto para ela. O que podemos fazer é deixar os modelos a uma chave de distância, pelo preço de tabela, para que a decisão de manter ou descartar o advisor seja sua, com base nos seus próprios números.

Como decidir para a sua própria carga de trabalho

A própria orientação da Anthropic é o ponto de partida certo e é refrescantemente desprovida de sentimentalismo: execute sua suíte de avaliação com três configurações — o executor sozinho, o executor com um conselheiro e o modelo do conselheiro sozinho em esforço baixo — e verifique novamente a cada lançamento de modelo, porque os lançamentos alteram tanto a lacuna de capacidade quanto a proporção de preços. A última dessas três é a linha de base a ser superada. Se o modelo do seu conselheiro sozinho em esforço baixo obtiver a mesma pontuação que o loop por menos dinheiro, você tem sua resposta.

As duas variáveis a observar são as que a Anthropic nomeia. O hiato de capacidade: um hiato amplo entre executor e conselheiro é onde o conselheiro justifica o seu custo, e o Opus 5.5 estreitou esse hiato por baixo. A taxa de consulta: os ganhos acompanham-na quase um para um, e é suficientemente sensível ao prompt para colapsar — um executor em esforço baixo pode deixar de notar que está travado, e um pareamento que consulta na maioria das tarefas com esforço padrão pode cair para quase nenhuma. O prompt de sistema fornecido pela Anthropic pede uma chamada ao conselheiro antes do trabalho substancial e uma antes de terminar, o que resulta em duas a três consultas por tarefa; o pareamento de programação que produziu o ganho de 3,5 pontos operava nessa cadência. Reserve orçamento para isso, limite-o, e trate cada consulta acima desse limite como um sinal de que o seu executor está mal configurado, e não de que a tarefa era difícil.

Para o loop específico deste artigo, três configurações concretas fazem a maior parte do trabalho. Mantenha o Claude Opus 5.5 em seu esforço médio padrão em vez de buscar o alto, porque o esforço determina o custo diretamente e os próprios números do Opus 5.5 da Anthropic mostram que o médio abre mão de muito pouco. Configure o advisor com /advisor fable e confirme se o banner realmente aparece — um banner ausente significa um advisor silenciosamente ausente. E antes de escalar o padrão, meça tokens por tarefa concluída em vez de preço por token, porque esse é o número que o loop deve mover.

Perguntas Frequentes

O advisor consome a mesma cota do Fable que uma sessão do Fable?

No faturamento da API, os tokens do advisor são cobrados pelas próprias taxas de entrada e saída do Fable 5.1, e os limites de taxa do advisor saem do mesmo bucket por modelo que as chamadas diretas a esse modelo — portanto, uma chamada de advisor limitada por taxa aparece como um erro dentro do resultado da ferramenta, em vez de fazer sua solicitação falhar. Nos planos de assinatura, o uso do advisor conta para os limites de uso do seu plano, exceto que um advisor Fable é cobrado em créditos de uso nos planos em que o uso do Fable também é. A consequência prática é que o advisor não é um orçamento separado que você pode gastar livremente; ele compete com tudo o mais que você faz nesse modelo.

O que o consultor realmente consegue ver?

A conversa completa, incluindo cada chamada de ferramenta e cada resultado de ferramenta — conteúdo de arquivos, saída de comando, mensagens de erro, tudo isso. Ele é executado sob seu próprio prompt de sistema fornecido pela Anthropic e retorna um plano, uma correção ou um sinal de parada. Dois detalhes decorrem disso. Primeiro, cada consulta relê toda a transcrição, e é por isso que o custo cresce com o loop, em vez de permanecer constante. Segundo, se a sua sessão toca em material que você não enviaria a um segundo modelo na faixa de preço do advisor, o advisor é um segundo modelo lendo tudo isso.

O que mudaria a resposta

Duas coisas, e ambas estão mais próximas do que parecem. Se avaliadores independentes publicarem uma execução de esforço equivalente do Opus 5.5 contra o Fable 5.1 e confirmarem o estreitamento que a Anthropic alega, a vantagem restante do consultor na maioria das tarefas é pequena — e o loop se torna uma ferramenta para a cauda difícil, em vez de um padrão. Se, em vez disso, a taxa de consulta se mantiver e a lacuna de capacidade continuar grande em trabalhos agênticos longos, a aritmética acima é o que você está escolhendo, e $6 de consultoria em uma execução de $14 é uma opção barata para não entregar a coisa errada.

O que não vai mudar é o mecanismo no topo deste texto. O contexto do executor é armazenado em cache e é barato; o do consultor não é nem uma coisa nem outra. Qualquer loop que consulte um modelo mais caro no meio da tarefa herda essa assimetria, independentemente do que a tabela de preços diga no mês que vem.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente