Hero-titelkaart voor het artikel 'Claude Fable 5 als jouw orchestrator' met een centraal Claude Fable 5-knooppunt dat uitwaaiert naar vier kleinere Opus 5-subagent-werkernodes, met de ondertitel 'Een Claude Code-subagentplaybook om tokenkosten laag te houden' en het OrcaRouter-logo geplaatst in de hoek.
Guides & Insights

Claude Fable 5 als jouw orkestrator: Het subagent-draaiboek dat de tokenkosten laag houdt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 7 augustus bracht Anthrop​ic de grootste verandering aan in Claude Fable 5 sinds het model op 9 juni werd gelanceerd: het aantal biologisch gerelateerde 'fallbacks' is met ongeveer 85% verminderd, waardoor alledaagse gezondheids- en onderwijsgerelateerde vragen nu een direct antwoord krijgen in plaats van stilletjes over te schakelen naar een zwakker model. Het patroon dat zich deze week echter daadwerkelijk door de Claude Code-community verspreidt, heeft niets met biologie te maken. Beoefenaars blijven een workflow posten waarin Claude Fable 5 de orchestratielus draait — het verduidelijken van vereisten, het opsplitsen van plannen, het toewijzen van taken, het accepteren van resultaten — terwijl de uitvoering wordt overgedragen aan Claude Opus 5-subagenten. Het genoemde resultaat: Fable 5 High wordt een betaalbare standaard voor sessies, en de breedsprakigheid van Claude Opus 5 zorgt er niet langer voor dat de sessie uitgeput raakt.

Het meest recente voorbeeld is dat van @dotey, geplaatst op 14 augustus: een korte toevoeging aan ~/.claude/CLAUDE.md die de agent vertelt om Opus-subagenten te openen voor uitvoering, terwijl Claude Fable 5 op hoge redeneerinspanning de standaard voor de sessie blijft, waarbij de auteur meldt dat het tokenverbruik redelijk blijft — en een duidelijke reden om Claude Opus 5 niet als standaard te draaien: in zijn handen was het te traag en verbrandde het een enorm aantal tokens in de hoofdloop. Dat is een bevinding van de community, geen richtlijn van Anthrop​ic — en het is de moeite waard om te begrijpen voordat je het kopieert, want op papier lijkt het achterstevoren.

Het patroon in één alinea. In Claude Code erven subagents standaard je sessiemodel, dus de manier om een snelle, goedkope loop te behouden is om het sessiemodel de planner te laten zijn en de uitvoerders expliciet naar een ander model te laten wijzen. Claude Fable 5 — het Mythos-klasse model van Anthrop​ic, veilig gemaakt voor algemeen gebruik, uitgebracht op 9 juni 2026 voor $10/$50 per miljoen tokens — bevat de vereisten, deelt het werk op, stuurt taken aan en accepteert resultaten. Claude Opus 5 — uitgebracht op 24 juli 2026 voor $5/$25 per miljoen tokens — voert de daadwerkelijke implementaties uit in subagents. Je besteedt oordeelsvermogen van Fable-niveau aan de weinige orkestratiebeurten en uitvoering van Opus-niveau aan de vele uitvoeringsbeurten, waar het grootste deel van de tokens al naartoe gaat.

Waarom het main-loop-model het echte kostenprobleem is

Op benchmarks ziet dit eruit als een opgelost probleem — en het antwoord lijkt te zijn: "standaard voor Opus 5 kiezen." De eigen cijfers van Anthrop​ic (door de leverancier gerapporteerd, niet onafhankelijk gereproduceerd) tonen Claude Opus 5 voor op Claude Fable 5 op de agentische codeerbenchmark Frontier-Bench v0.1 (43,3% tegen 33,7%), op SWE-bench Verified (96,0% tegen 95,5%), en op ARC-AGI-3 (30,2%, ruwweg 4x het op één na beste openbare model). Anthrop​ic positioneert Opus 5 als bijna de frontier-intelligentie van Fable 5 tegen de helft van de prijs. Als je een standaard voor de sessie kiest puur op basis van leveranciersbenchmarks en prijs per token, is Opus 5 de voor de hand liggende keuze.

Praktijkmensen die daadwerkelijk lange sessies draaien, komen tot de tegenovergestelde standaard, en de reden is tokens per taak, niet de prijs per token. Het denken van Opus 5 is standaard ingeschakeld en adaptief, en Anthrop​ic zegt dat het zonder aansporing zijn eigen werk controleert — wat in de praktijk betekent dat elke lusbeurt aanzienlijk meer tokens produceert dan die van Fable 5. Het uitschakelen van dat denken is beperkt tot een hoge inspanning, dus je kunt het niet helemaal lean maken. In een sessie die uren duurt, is de lus wat zich opstapelt: het model dat het goedkoopst is per token kan uiteindelijk het duurst zijn per sessie, en het model dat het minst praat houdt de lus snel.

Dat komt overeen met wat @dotey meldt. De omgekeerde opzet houdt het tokenverbruik "niet slecht", juist omdat Opus 5 — de breedsprakige — is geïsoleerd in subagents, waar zijn output het eindresultaat is in plaats van de overhead.

De omgekeerde architectuur: Fable 5 plant, Opus voert uit

De architectuur is eenvoudig te beschrijven en een beetje contra-intuïtief om te draaien:

• Sessiemodel — Claude Fable 5 met hoge redeneerinspanning (de "High" in de community-afkorting "Fable 5 High"). Het beheert het gesprek, het plan en de definitie van gereed.

• Orkestratiebeurten — vereistenverduidelijking, plandecompositie, taakverzending en resultaatacceptatie vinden allemaal plaats op Fable 5. Dit zijn weinig beurten en een klein deel van het totale aantal tokens.

• Uitvoeringsronden — elke taak wordt toegewezen aan een subagent die Claude Opus 5 draait. Dit zijn de vele ronden en het grootste deel van de tokenuitgaven — en Opus 5 is waar de door de leverancier gerapporteerde agentische scores het hoogst zijn.

De economische logica klopt omdat de twee kostencurves in tegengestelde richting wijzen. {{1}}Fable 5's kracht is oordeelsvermogen; je gebruikt het spaarzaam.{{/1}} {{2}}Opus 5's kracht is uitvoering; je gebruikt het intensief maar parallel, geïsoleerd van de loop.{{/2}} De loop blijft snel en goedkoop, en de dure capaciteit wordt precies ingezet waar de tokens toch al worden verbruikt.

Dit is een van de twee community-patronen die in omloop zijn, en ze zijn elkaars spiegelbeeld. Het vaker aanbevolen "architectpatroon" (dat bijvoorbeeld door de fable-advisor-plugin wordt gebruikt) laat Opus fulltime als architect draaien en reserveert Fable 5 voor het meest complexe implementatietraject en voor een verplichte eindreview per oplevering. Het verschil is een optimalisatiedoel: het architectpatroon besteedt Opus-grade tokens aan coördinatie en gebruikt Fable 5 als scalpel; het omgekeerde patroon gebruikt Fable 5 voor coördinatie en Opus 5 voor volume. Beide zijn community-richtlijnen — Anthrop​ic documenteert geen van beide — en beide zijn pogingen om frontier-tokens in te zetten waar ze de uitkomst veranderen.

Instellen in Claude Code

Claude Code heeft geen ingebouwde "orkestratormodus", dus het patroon wordt op twee manieren afgedwongen: instructies in de sessieprompt en expliciete modelpins aan de uitvoeringszijde.

De instructielaag bevindt zich in ~/.claude/CLAUDE.md — hetzelfde bestand dat @dotey heeft bewerkt. Als vorm vertelt de prompt de hoofdagent om vier dingen te doen voordat hij welke taak dan ook als voltooid beschouwt:

• Herformuleer de vereiste en bevestig de reikwijdte voordat u code schrijft.

Splits het werk op in taken die parallel kunnen worden uitgevoerd.

• Stuur elke uitvoeringstaak naar een subagent die is vastgepind op Claude Opus 5.

• Controleer elk resultaat aan de hand van het plan voordat u het accepteert.

Die vorm is de moeite waard om als richtlijn te vermelden in plaats van als een snippet om te plakken — jouw vereisten en jouw stack bepalen wat erin hoort.

De modellaag is belangrijker dan de meeste configuraties aannemen. In Claude Code is de resolutievolgorde voor het subagentmodel: de omgevingsvariabele CLAUDE_CODE_SUBAGENT_MODEL, vervolgens een modelparameter per aanroep, daarna de frontmatter van de agentdefinitie, en dan het sessiemodel. Agents zonder ingesteld model erven het sessiemodel. Dus als je sessie op Fable 5 draait en je vertrouwt op het modelargument van de Agent-tool, is er een gedocumenteerd risico dat het wordt genegeerd (GitHub-issue #83920): subagents erven hoe dan ook het sessiemodel, en je betaalt Fable 5-prijzen voor uitvoering die je op Opus 5 wilde laten draaien.

Twee betrouwbare oplossingen: stel CLAUDE_CODE_SUBAGENT_MODEL=claude-opus-5 in voor de sessie, of pin het model vast in de frontmatter van de subagent. Die ene variabele bepaalt of het patroon werkt zoals bedoeld, of dat de hele sessie stilletjes op het dure model draait.

De token-wiskunde achter de splitsing

Hier zijn de twee modellen zoals ze vandaag geprijsd zijn (door de leverancier gepubliceerd, en tegen catalogusprijs doorberekend op OrcaRouter):

• Claude Fable 5 — $10 per 1M invoertokens, $50 per 1M uitvoertokens; 1M-token context, 128K uitvoer.

• Claude Opus 5 — $5 per 1M invoertokens, $25 per 1M uitvoer; 1M-token context, 128K uitvoer.

A comparison scoreboard for Claude Fable 5 and Claude Opus 5 contrasting price ($10/$50 vs $5/$25 per 1M tokens), context (both 1M in / 128K out), Frontier-Bench v0.1 (33.7% vs 43.3%), SWE-bench Verified (95.5% vs 96.0%), loop behaviour, and the role each plays in the orchestrator pattern, with a footer noting prices are vendor-published and benchmarks vendor-reported.

Het contra-intuïtieve is dat Opus 5 half zoveel per token kost en toch de kostenstrijd per sessie kan verliezen. De vorm is eenvoudig te zien met ruwe getallen: als de loop op Opus 5 twee tot drie keer zoveel tokens produceert als de loop op Fable 5 — een illustratief cijfer dat in lijn is met de rapportages van professionals over het zelfverificatiegedrag van Opus 5, geen gemeten cijfer — dan kost de loop zelfs tegen het halve tarief per token ongeveer hetzelfde, en als de kloof groter is, kost Opus in de loop meer. Ondertussen zitten de uitvoeringstokens, het grootste deel van de sessie, in subagenten op Opus 5, in beide gevallen tegen het goedkopere tarief.

Dat is het hele argument voor het omgekeerde patroon: zet het model met de hogere prijs per token maar de slankere lus op de lus, en zet het model dat per token goedkoper is op het volume. Het is een routeringsbeslissing vermomd als een modelbeslissing.

Omdat OrcaRouter de prijzen van providers doorgeeft met 0% opslag, zijn de bovenstaande bedragen wat je hier daadwerkelijk betaalt — geen platformkosten bovenop — en als Anthrop​ic een van de prijzen verlaagt, verschijnt de wijziging dezelfde dag op de modelpagina.

Wanneer het omgekeerde patroon wint — en wanneer het dat niet doet

Het kopiëren van @dotey's setup zonder de vorm van je eigen workload te controleren is in beide richtingen een vergissing.

Het omgekeerde patroon wint wanneer:

• Vereisten zijn ambigu of het plan heeft veel bewegende onderdelen — orchestratie-oordeel is de schaarse resource.

• Uitvoering kan worden geparalleliseerd in subagents — het volume verlaat de lus.

• Sessies duren lang — de uitvoerigheid van loops stapelt zich op tot echte kosten.

Het standaardadvies wint wanneer:

• Het grootste deel van je sessie is begrensd, mechanisch werk — een planner van Fable-niveau is overkill, en de lagere prijs en hogere benchmarkscores van Opus 5 maken het de voor de hand liggende standaard. Daarom stelt de eigen documentatie van Claude Code Opus in als sessiestandaard en reserveert Fable 5 voor expliciete selectie.

• Je kunt subagent-modellen niet betrouwbaar vastpinnen — de #83920 overervingsbug verandert het omgekeerde patroon in "alles over de prijzen van Fable 5."

Er is ook een middenweg bij het afstemmen. Opus 5 heeft een inspanningsparameter (laag tot maximaal, standaard hoog), dus je kunt het richting zuiniger gedrag duwen — maar niet helemaal, want het uitschakelen van denken is begrensd op hoge inspanning. Als de breedsprakigheid van Opus 5 je probleem is, kan het terugdraaien van de inspanning voldoende zijn, en je hoeft de architectuur helemaal niet om te keren.

Wat de biologieverandering van 7 augustus betekent voor deze opstelling

Anthrop​ic's update van 7 augustus herschreef en trainde de biologieclassifier van Claude Fable 5 opnieuw — het systeem dat bepaalt of een query een 'fallback' naar een minder capabel model activeert. Volgens Anthrop​ic's eigen cijfers (door de leverancier gerapporteerd) daalden biologiegerelateerde fallbacks met ongeveer 85% over alle productoppervlakken, terwijl de totale fallbacks met ~67% daalden op Claude.ai, ~55% op Cowork, ~17% op Claude Code en ~7% op het Claude Platform.

Screenshot of Anthropic's 'Improving Fable 5's biology safeguards' announcement dated August 7, 2026, describing the roughly 85% reduction in biology-related fallbacks across product surfaces.

Voor een Fable 5-orchestratieopstelling is het Claude Code-nummer het enige dat ertoe doet. Een fallback is dat het systeem je query stilletjes omschakelt naar een ander model—in dit geval naar Opus 5. In een gewone chat is dat onzichtbare wrijving; in een agentische sessie betekent het dat een deel van je pipeline draait op een model dat jij niet hebt gekozen, met een kostenprofiel waar je niet op had gerekend. De update verwijdert dat niet: virologie, toxicologie en moleculair ontwerp vallen nog steeds terug. Maar alledaagse gezondheids- en onderwijsbiologie—een labuitslag lezen, een symptoom begrijpen, biologie studeren—blijft nu op Fable 5.

Eén opmerking vooraf, duidelijk gelabeld: onbevestigde berichten van eind juli (36kr, WinCentral) wijzen op een mogelijke vernieuwing van Claude Fable 5.1 deze maand tegen ongewijzigde prijzen. Anthrop​ic heeft geen naam, datum of API-model-ID bevestigd — behandel dat als speculatie totdat het uitkomt.

Probeer het zonder je workflow op het spel te zetten.

Wat het omgekeerde patroon de moeite waard maakt om te proberen, is dat het omkeerbaar is, en het routeren van beide modellen via één endpoint maakt de omkering goedkoop.

Op OrcaRouter zitten Claude Fable 5 (anthropic/claude-fable-5) en Claude Opus 5 (anthropic/claude-opus-5) achter één API-sleutel. Je kunt de uitvoeringsbaan van de sessie op beide modellen draaien zonder tweede contract of code-wijziging — dat is precies wat een experiment als 'Fable 5 als orkestrator' nodig heeft, want het hele doel is om je eigen kosten per sessie te meten voordat je je vastlegt.

Screenshot of the OrcaRouter model page for Claude Fable 5 showing the slug anthropic/claude-fable-5, $10 per 1 million input tokens and $50 per 1 million output tokens, a 1M-token context, and the /v1/messages and /v1/chat/completions endpoints.

Twee OrcaRouter-functies sluiten direct aan op deze opzet. Met automatische failover kun je een fallback-keten definiëren — als Fable 5 een fout geeft of een time-out optreedt, wordt het verzoek gerouteerd naar Opus 5 of een goedkoper model in plaats van te mislukken. En de routing-DSL kan het paar samenstellen tot één enkele aanroep: een Fable 5-planstap gevolgd door Opus 5-uitvoeringsstappen achter één endpoint. Dat is het orkestratiepatroon, uitgedrukt als infrastructuur in plaats van als promptdiscipline.

Kortom

De omgekeerde architectuur — Claude Fable 5 plant, Claude Opus 5 voert uit — is een echt, werkend antwoord op een echt probleem: het model dat het goedkoopst is per token is niet noodzakelijkerwijs het goedkoopst per sessie. Het is geen benchmarkbeslissing; Opus 5 wint de meeste door leveranciers gerapporteerde agentische vergelijkingen. Het is een token-routeringsbeslissing, en het betaalt zich alleen uit wanneer orkestratie-oordeel schaars is en uitvoering kan worden geparallelliseerd.

Claude Fable 5 (9 juni 2026) en Claude Opus 5 (24 juli 2026) zijn beide huidige Anthrop​ic-modellen, en de beveiligingswijziging van 7 augustus maakt Fable 5 een minder onderbroken dagelijkse driver. Let op drie dingen: of de berichten over Fable 5.1 iets voorstellen, of Anthrop​ic de subagent-overervingsbug verhelpt die dit patroon stilletjes kan ongedaan maken, en — het allerbelangrijkst — wat je eigen kosten per voltooide taak zijn gedurende een week van echte sessies.

Veelgestelde vragen

Is Fable 5 het standaardmodel in Claude Code?

Nee. De eigen documentatie van Claude Code stelt dat Fable 5 niet de standaard is voor welk accounttype dan ook — sessies gebruiken standaard het standaard Opus-model, en je selecteert Fable 5 via /model, een modelinstelling, of het alias 'best'. Het patroon in dit artikel draait bewust tegen die standaard in.

Waarom niet gewoon Opus 5 als standaard gebruiken, aangezien het goedkoper is per token en hoger scoort?

Omdat de kosten per sessie het aantal tokens per taak maal de prijs per token zijn. Praktijkmensen melden dat Opus 5's adaptieve denken en zelfverificatie veel meer tokens per beurt produceren, dus tegen de helft van het tarief per token kan het in een lange lus nog steeds langzamer en duurder zijn. Dat is de community-bevinding waar deze playbook op is gebaseerd — meet het op je eigen workload voordat je een kant kiest.

Kan ik mijn subagenten dwingen om een ander model te draaien dan de sessie?

Ja, maar vertrouw niet op de modelparameter per aanroep: GitHub-issue #83920 documenteert dat deze wordt genegeerd, waarbij subagents in plaats daarvan het sessiemodel overnemen. Stel CLAUDE_CODE_SUBAGENT_MODEL in of pin het model in de frontmatter van de subagent — dat is het verschil tussen uitvoering die op Opus 5-prijzen draait en uitvoering die stilletjes op Fable 5-prijzen draait.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt