Hero card del titolo per l'articolo 'Claude Fable 5 come tuo orchestratore' che mostra un nodo centrale Claude Fable 5 che si dirama verso quattro nodi worker subagent Opus 5 più piccoli, con il sottotitolo 'Un playbook per subagent di Claude Code per contenere i costi dei token' e il logo OrcaRouter composto nell'angolo.
Guides & Insights

Claude Fable 5 come orchestratore: il playbook dei subagent per tenere bassi i costi dei token

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 7 agosto, Anthrop​ic ha apportato la più grande modifica singola a Claude Fable 5 da quando il modello è stato rilasciato il 9 giugno: ha ridotto i "fallback" legati alla biologia di circa l'85%, così le domande quotidiane su salute e istruzione ora ricevono una risposta diretta invece di passare silenziosamente a un modello più debole. Tuttavia, il pattern che si sta effettivamente diffondendo nella community di Claude Code questa settimana non ha nulla a che fare con la biologia. Gli addetti ai lavori continuano a pubblicare un flusso di lavoro in cui Claude Fable 5 esegue il ciclo di orchestrazione — chiarimento dei requisiti, scomposizione del piano, assegnazione delle attività, accettazione dei risultati — mentre l'esecuzione viene affidata a sottoagenti di Claude Opus 5. Il vantaggio dichiarato: Fable 5 High diventa un default di sessione conveniente, e la verbosità di Claude Opus 5 smette di esaurire la sessione.

L'esempio più recente è quello di @dotey, pubblicato il 14 agosto: una breve aggiunta a ~/.claude/CLAUDE.md che dice all'agente di aprire subagent Opus per l'esecuzione, lasciando Claude Fable 5 con sforzo di ragionamento elevato come impostazione predefinita della sessione, con l'autore che riferisce che il consumo di token rimane ragionevole — e una ragione schietta per non usare Claude Opus 5 come predefinito: nelle sue mani era troppo lento e bruciava un'enorme quantità di token nel loop principale. Questa è una scoperta della community, non un'indicazione di Anthropic — e vale la pena capirla prima di copiarla, perché sulla carta sembra controintuitiva.

Lo schema in un paragrafo. In Claude Code, i subagenti ereditano il tuo modello di sessione per impostazione predefinita, quindi il modo per mantenere un ciclo veloce ed economico è fare del modello di sessione il pianificatore e indirizzare gli esecutori esplicitamente verso un modello diverso. Claude Fable 5 — il modello di classe Mythos di Anthropic reso sicuro per l'uso generale, rilasciato il 9 giugno 2026, a $10/$50 per milione di token — conserva i requisiti, scompone il lavoro, distribuisce i compiti e accetta i risultati. Claude Opus 5 — rilasciato il 24 luglio 2026, a $5/$25 per milione di token — esegue le implementazioni effettive all'interno dei subagenti. Dedichi il giudizio di livello Fable ai pochi turni di orchestrazione e l'esecuzione di livello Opus ai molti turni di esecuzione, dove va già la maggior parte dei token.

Perché il modello main-loop è il vero problema di costo.

Nei benchmark, questo sembra un problema risolto — e la risposta sembra essere «imposta Opus 5 come predefinito». I numeri di Anthropic (riportati dal fornitore, non riprodotti) vedono Claude Opus 5 davanti a Claude Fable 5 sul benchmark di coding agentico Frontier-Bench v0.1 (43,3% contro 33,7%), su SWE-bench Verified (96,0% contro 95,5%) e su ARC-AGI-3 (30,2%, circa 4 volte il miglior modello pubblico successivo). Anthropic posiziona Opus 5 come se si avvicinasse all'intelligenza di frontiera di Fable 5 a metà prezzo. Se scegli un predefinito di sessione puramente basato sui benchmark del fornitore e sul prezzo per token, Opus 5 è la scelta ovvia.

I professionisti che eseguono davvero sessioni lunghe stanno giungendo alla preimpostazione opposta, e la ragione è token per attività, non prezzo per token. La modalità di pensiero di Opus 5 è attiva per impostazione predefinita ed è adattiva, e Anthropic afferma che verifica il proprio lavoro senza che glielo si chieda — il che significa che, in pratica, ogni iterazione del ciclo emette sostanzialmente più token rispetto a quella di Fable 5. Disattivare quella modalità di pensiero è limitato a un alto sforzo, quindi non puoi spingerla fino a renderla completamente snella. In una sessione che dura ore, è il ciclo ciò che si accumula: il modello più economico per token può finire per essere il più costoso per sessione, e il modello che parla meno mantiene il ciclo veloce.

Ciò corrisponde a quanto riporta @dotey. La configurazione invertita mantiene il consumo di token "non male" proprio perché Opus 5 — quello verboso — è confinato ai subagent, dove il suo output è il risultato da consegnare piuttosto che un sovraccarico.

L'architettura invertita: Fable 5 pianifica, Opus esegue

L'architettura è semplice da descrivere e un po' controintuitiva da eseguire:

• Modello di sessione — Claude Fable 5 con elevato sforzo di ragionamento (l'"High" nell'abbreviazione della community "Fable 5 High"). Possiede la conversazione, il piano e la definizione di completamento.

• I turni di orchestrazione — chiarimento dei requisiti, scomposizione del piano, assegnazione delle attività e accettazione dei risultati avvengono tutti su Fable 5. Questi sono pochi turni e una piccola parte del totale dei token.

• Turni di esecuzione — ogni task viene assegnato a un subagent che esegue Claude Opus 5. Questi sono i turni più numerosi e la maggior parte della spesa in token — ed è su Opus 5 che i punteggi agentici riportati dal fornitore raggiungono i valori più alti.

L'economia funziona perché le due curve di costo puntano in direzioni diverse. Il punto di forza di Fable 5 è il giudizio; lo usi con parsimonia. Il punto di forza di Opus 5 è l'esecuzione; lo usi pesantemente ma in parallelo, isolato dal loop. Il loop rimane veloce ed economico, e la capacità costosa viene spesa esattamente dove i token vengono comunque spesi.

Questo è uno dei due pattern comunitari in circolazione, e sono l'uno lo specchio dell'altro. Il "pattern architetto" più comunemente raccomandato (usato, ad esempio, dal plugin fable-advisor) impiega Opus come architetto a tempo pieno e riserva Fable 5 per la corsia di implementazione a più alta complessità e per una revisione obbligatoria al termine del deliverable. La differenza è un obiettivo di ottimizzazione: il pattern architetto spende token di livello Opus per il coordinamento e usa Fable 5 come un bisturi; il pattern invertito usa Fable 5 per il coordinamento e Opus 5 per il volume. Entrambi sono indicazioni della community — Anthrop​ic non documenta nessuno dei due — ed entrambi sono tentativi di spendere token di frontiera dove cambiano il risultato.

Configurarlo in Claude Code

Claude Code non ha una "modalità orchestratore" integrata, quindi il pattern viene applicato in due modi: istruzioni nel prompt di sessione e pin espliciti del modello sul lato esecuzione.

Il livello di istruzioni vive in ~/.claude/CLAUDE.md — lo stesso file modificato da @dotey. In sostanza, il prompt dice all'agente principale di fare quattro cose prima di considerare completata qualsiasi attività:

• Ribadire il requisito e confermare l'ambito prima di scrivere il codice.

• Suddividi il lavoro in attività che possono essere eseguite in parallelo.

• Affida ogni attività di esecuzione a un subagent collegato a Claude Opus 5.

Verifica ogni risultato rispetto al piano prima di accettarlo.

Quella forma è degna di essere enunciata come linea guida piuttosto che come frammento da incollare — le tue esigenze e il tuo stack cambiano ciò che ne fa parte.

Il livello del modello conta più di quanto la maggior parte delle configurazioni presupponga. In Claude Code, l'ordine di risoluzione del modello per i subagent è: la variabile d'ambiente CLAUDE_CODE_SUBAGENT_MODEL, poi un parametro del modello specifico per invocazione, poi il frontmatter della definizione dell'agente, infine il modello della sessione. Gli agenti senza un modello impostato ereditano il modello della sessione. Quindi, se la tua sessione gira su Fable 5 e fai affidamento sull'argomento del modello dello strumento Agent, esiste un rischio documentato che venga ignorato (issue GitHub #83920): i subagent ereditano comunque il modello della sessione, e paghi la tariffa di Fable 5 per un'esecuzione che intendevi far girare su Opus 5.

Due soluzioni affidabili: imposta CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5 per la sessione, oppure fissa il modello nel frontmatter del subagente. Quella singola variabile fa la differenza tra il pattern che funziona come progettato e l'esecuzione silenziosa dell'intera sessione sul modello costoso.

La matematica dei token dietro lo split

Ecco i due modelli come sono prezzati oggi (pubblicati dal fornitore e trasmessi al prezzo di listino su OrcaRouter):

Claude Fable 5 — $10 per 1M token in input, $50 per 1M in output; contesto di 1M token, output di 128K.

• Claude Opus 5 — $5 per 1M token di input, $25 per 1M di output; contesto da 1M token, output da 128K.

A comparison scoreboard for Claude Fable 5 and Claude Opus 5 contrasting price ($10/$50 vs $5/$25 per 1M tokens), context (both 1M in / 128K out), Frontier-Bench v0.1 (33.7% vs 43.3%), SWE-bench Verified (95.5% vs 96.0%), loop behaviour, and the role each plays in the orchestrator pattern, with a footer noting prices are vendor-published and benchmarks vendor-reported.

La parte controintuitiva è che Opus 5 costa la metà per token e può comunque perdere la partita dei costi per sessione. Il quadro è facile da vedere con numeri approssimativi: se il loop su Opus 5 emette da due a tre volte i token del loop su Fable 5 — una cifra illustrativa coerente con le segnalazioni dei professionisti sul comportamento di auto-verifica di Opus 5, non una cifra misurata — allora anche a metà della tariffa per token il loop costa più o meno lo stesso, e se il divario è più ampio, Opus nel loop costa di più. Nel frattempo i token di esecuzione, il grosso della sessione, restano su Opus 5 nei subagent alla tariffa più bassa in ogni caso.

Questo è l'intero argomento per il pattern invertito: metti il modello il cui prezzo per token è più alto ma il cui loop è più snello sul loop, e metti il modello più economico per token sul volume. È una decisione di routing travestita da decisione di modello.

Poiché OrcaRouter applica i prezzi del provider senza alcun ricarico (margine 0%), i numeri sopra riportati sono esattamente ciò che paghi qui — nessuna commissione di piattaforma aggiuntiva — e se Anthropic riduce uno dei prezzi, la modifica compare nella pagina del modello lo stesso giorno.

Quando il pattern invertito vince — e quando non vince

Copiare il setup di @dotey senza verificare la forma del proprio carico di lavoro è un errore in entrambe le direzioni.

Il pattern invertito vince quando:

• I requisiti sono ambigui o il piano ha molte parti mobili — il giudizio di orchestrazione è la risorsa scarsa.

• L'esecuzione può essere parallelizzata in sottoagenti — il volume esce dal ciclo.

• Le sessioni sono lunghe — la verbosità del loop si accumula in un costo reale.

Il consiglio standard vince quando:

La maggior parte della tua sessione è lavoro limitato e meccanico — un planner di livello Fable è eccessivo, e il prezzo più basso di Opus 5 e i punteggi benchmark più alti lo rendono il default ovvio. Questo è il motivo per cui la documentazione di Claude Code rende Opus il default di sessione e riserva Fable 5 per la selezione esplicita.

• Non puoi fissare in modo affidabile i modelli subagent — il bug di ereditarietà #83920 trasforma il pattern invertito in "tutto sui prezzi di Fable 5."

Esiste anche una via di mezzo di ottimizzazione. Opus 5 espone un parametro di effort (da basso a massimo, predefinito alto), quindi puoi spingerlo verso un comportamento più snello — ma non fino in fondo, perché la disattivazione del pensiero è limitata a effort alto. Se il tuo problema è la verbosità di Opus 5, abbassare l'effort potrebbe essere sufficiente, e non devi affatto invertire l'architettura.

Cosa significa il cambiamento alla biologia del 7 agosto per questa configurazione

L'aggiornamento del 7 agosto di Anthrop​ic ha riscritto e riaddestrato il classificatore di biologia di Claude Fable 5 — il sistema che decide se una query attiva un "fallback" verso un modello meno capace. Secondo i numeri dichiarati da Anthrop​ic (riportati dal fornitore), i fallback legati alla biologia sono diminuiti di circa l'85% su tutte le superfici di prodotto, con i fallback complessivi in calo di ~67% su Claude.ai, ~55% su Cowork, ~17% su Claude Code e ~7% sulla Claude Platform.

Screenshot of Anthropic's 'Improving Fable 5's biology safeguards' announcement dated August 7, 2026, describing the roughly 85% reduction in biology-related fallbacks across product surfaces.

Per una configurazione di orchestrazione Fable 5, il numero di Claude Code è quello che conta. Un fallback è il sistema che reindirizza silenziosamente la tua query a un modello diverso — in questo caso a Opus 5. In una chat semplice si tratta di un attrito invisibile; in una sessione agentica significa che parte della tua pipeline gira su un modello che non hai scelto, con un profilo di costi che non avevi pianificato. L'aggiornamento non lo rimuove: virologia, tossicologia e design molecolare fanno ancora fallback. Ma la biologia quotidiana per la salute e l'istruzione — leggere un referto di laboratorio, capire un sintomo, studiare biologia — ora rimane su Fable 5.

Una nota preliminare, chiaramente etichettata: rapporti non confermati di fine luglio (36kr, WinCentral) indicano un possibile refresh di Claude Fable 5.1 questo mese a prezzi invariati. Anthropic non ha confermato né un nome, né una data, né un ID del modello API — trattalo come speculazione finché non verrà rilasciato.

Provarlo senza rischiare il tuo flusso di lavoro

Ciò che rende il pattern invertito degno di essere provato è che è reversibile, e instradare entrambi i modelli attraverso un unico endpoint rende l'inversione economica.

Su OrcaRouter, Claude Fable 5 (anthropic/claude-fable-5) e Claude Opus 5 (anthropic/claude-opus-5) condividono un'unica chiave API. Puoi eseguire la corsia di esecuzione della sessione su entrambi i modelli senza un secondo contratto o una modifica al codice — che è esattamente ciò di cui ha bisogno un esperimento come "Fable 5 come orchestratore", perché il punto fondamentale è misurare il proprio costo per sessione prima di impegnarsi.

Screenshot of the OrcaRouter model page for Claude Fable 5 showing the slug anthropic/claude-fable-5, $10 per 1 million input tokens and $50 per 1 million output tokens, a 1M-token context, and the /v1/messages and /v1/chat/completions endpoints.

Due funzionalità di OrcaRouter si mappano direttamente su questa configurazione. Il failover automatico consente di definire una catena di fallback: se Fable 5 genera un errore o va in timeout, la richiesta viene instradata verso Opus 5 o un modello più economico, invece di fallire. Inoltre, il DSL di routing può comporre la coppia in un'unica chiamata: un passo di pianificazione con Fable 5 seguito da passi di esecuzione con Opus 5 dietro un unico endpoint. Questo è il pattern di orchestrazione espresso come infrastruttura, piuttosto che come disciplina di prompt.

Il risultato finale

L'architettura invertita — Claude Fable 5 pianifica, Claude Opus 5 esegue — è una risposta reale e funzionante a un problema reale: il modello più economico per token non è necessariamente il più economico per sessione. Non è una decisione basata su benchmark; Opus 5 vince la maggior parte dei confronti agentici riportati dai fornitori. È una decisione di routing dei token, e ripaga solo quando il giudizio di orchestrazione è scarso e l'esecuzione può essere parallelizzata.

Claude Fable 5 (9 giugno 2026) e Claude Opus 5 (24 luglio 2026) sono entrambi attuali modelli Anthrop​ic, e il cambiamento delle salvaguardie del 7 agosto rende Fable 5 meno soggetto a interruzioni come strumento di uso quotidiano. Tieni d'occhio tre cose: se i report su Fable 5.1 si riveleranno fondati, se Anthrop​ic correggerà il bug di ereditarietà dei subagent che può silenziosamente annullare questo schema, e — cosa più importante — come appare il tuo costo per attività completata nell'arco di una settimana di sessioni reali.

Domande frequenti

Fable 5 è il modello predefinito in Claude Code?

No. La stessa documentazione di Claude Code afferma che Fable 5 non è il default per nessun tipo di account: le sessioni usano di default il modello Opus standard, e si seleziona Fable 5 tramite /model, un'impostazione del modello o l'alias "best". Il pattern descritto in questo articolo va deliberatamente contro questo default.

Perché non usare semplicemente Opus 5 come impostazione predefinita, visto che costa meno per token e ottiene punteggi più alti?

Perché il costo per sessione è pari ai token per attività moltiplicati per il prezzo per token. I professionisti riportano che il pensiero adattivo e l'auto-verifica di Opus 5 emettono molti più token per turno, quindi anche a metà della tariffa per token può risultare più lento e più costoso in un ciclo lungo. Questa è la conclusione della community su cui si basa questo playbook: misuralo sul tuo carico di lavoro prima di scegliere da che parte stare.

Posso forzare i miei subagent a eseguire un modello diverso da quello della sessione?

Sì, ma non fare affidamento sul parametro del modello per invocazione: la issue GitHub #83920 documenta che viene ignorato, con i subagent che ereditano invece il modello della sessione. Imposta CLAUDE_CODE_SUBAGENT_MODEL o fissa il modello nel frontmatter del subagent — è questa la differenza tra un'esecuzione alla tariffa di Opus 5 e una che gira silenziosamente alla tariffa di Fable 5.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno