
Sakana Fugu Max: de $2/$6-orchestrator die het goedkoopste model kiest dat werkt
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
De meeste modellen concurreren op hoeveel ze kunnen doen. Sakana Fugu Max concurreert op hoe weinig het ermee weg kan komen. Sakana AI bracht Sakana Fugu Max op 11 september 2026 uit, samen met Sakana Fugu Ultra v2 — twee afstemmingen van één enkele orkestratiearchitectuur, gericht op tegenovergestelde uiteinden van de kosten-prestatiecurve. Fugu Max beantwoordt je verzoek niet zelf. Het leest de taak, kiest het goedkoopste model in zijn pool dat het aannemelijk aankan, routeert het daarnaartoe en retourneert één antwoord. Sakana rekent er $2 per miljoen invoertokens en $6 per miljoen uitvoertokens voor.
Het interessante deel is waartegen die prijs wordt afgezet. Sakana beweert dat het outputtarief van Fugu Max Claude Sonnet 5, GPT-5.6 Terra en Kimi K3 met 40–60% onderbiedt. Die bewering is controleerbaar, en, ongewoon voor een benchmark op de lanceerdag, klopt de rekensom: afgezet tegen de huidige lijstprijzen van de drie modellen die Sakana noemt, komt $6 per miljoen output bijna precies in het midden van de opgegeven bandbreedte uit. Wat veel moeilijker te controleren is, is de prestatiekant, omdat Sakana de resultaten van Fugu Max als spreidingsdiagrammen heeft gepubliceerd in plaats van als getallen.
Wat Fugu Max eigenlijk is
Fugu Max is geen checkpoint. Er is geen gewichtsbestand, geen parameteraantal en niets om te downloaden. Sakana beschrijft het als "een architectuur, niet één enkel model" — dezelfde kern-orchestratie-engine als Fugu Ultra v2, afgestemd op een andere vraag. Ultra v2 vraagt wat de hoogst beschikbare capaciteit is. Fugu Max vraagt wat de beste output is tegen de laagste kosten.
Dat onderscheid is operationeel van belang. Je kunt Fugu Max niet fine-tunen, niet zelf hosten en niet nagaan waarom het het ene model boven het andere koos. Je kunt ook niet de volledige lijst van modellen zien waarover het routeert — Sakana zegt dat de pool uitbreidt tot "onze grootste pool van open en gespecialiseerde modellen tot nu toe" en noemt expliciet NVIDIA's Nemotron-familie, toegevoegd via het NVIDIA-partnerschap dat Sakana in augustus aankondigde. De rest van de pool is naamloos, en Sakana publiceert geen routeringstrace per verzoek.
Wat je kunt zien, is de vorm van het geheel. Het eigen diagram van de leverancier toont Fugu Max bovenaan een fan-out: één orchestrator, een rij verwisselbare modelslots daarachter, en Sakana Namazu en Fugu Max zelf behoren tot de doelen. De pool wordt omschreven als ontworpen om uitwisselbaar te zijn, en de genoemde motivatie is evenzeer politiek als economisch — Sakana presenteert orchestratie als bescherming tegen vendor lock-in, API-intrekkingen en exportcontroles, met als argument dat een systeem dat zijn leveranciers kan verwisselen door geen enkele daarvan kan worden afgesneden.
Sakana Fugu zelf is niet nieuw. Het bereikte algemene beschikbaarheid op 22 juni 2026, en de eigen tijdlijn van de leverancier loopt van april (bèta), juni (GA plus Fugu Ultra v1), juli (Fugu-Cyber en een Claude Code-interface), augustus (Sakana Chat plus het NVIDIA-partnerschap) tot nu september. Fugu Max is de vijfde maandelijkse stap, geen debuut — en iedereen die Fugu al draait, upgradet ernaartoe met een parameterwijziging van één regel tegen hetzelfde OpenAI-compatibele endpoint, zonder migratie.
De prijsbelofte houdt stand bij confrontatie met de lijstprijzen.
Het cijfer van Sakana van $2 voor invoer en $6 voor uitvoer staat duidelijk vermeld op de lanceringspagina. Secundaire berichtgeving voegt een tarief voor gecachte invoer van $0,25 per miljoen tokens toe, dat de lanceringspagina zelf niet vermeldt — beschouw dat cijfer als gerapporteerd, niet als bevestigd. Ter vergelijking: Fugu Ultra v2 kost $5 voor invoer en $30 voor uitvoer, met $0,50 voor gecachte invoer.
Nu de 40–60%-bewering. De drie genoemde vergelijkers staan momenteel op:
• GPT-5.6 Terra — $2 input / $12 output, nadat de verlaging van OpenAI op 30 juli de output van $15 omlaag bracht.
• Claude Sonnet 5 — $10 output tegen het promotietarief bij de lancering, $15 tegen het standaardtarief. Bronnen zijn het er niet over eens of de geplande verhoging van september werd geschrapt of alleen uitgesteld, wat verklaart waarom de bandbreedte zo groot is.
• Kimi K3 — $3 invoer / $15 uitvoer, met gecachte invoer tegen $0,30.
Daartegenover staat dat de $6-output 50% lager geprijsd is dan Terra, 40% lager dan het promotietarief van Sonnet 5, 60% lager dan het standaardtarief van Sonnet 5, en 60% lager dan Kimi K3. De claim klopt, en hij klopt met gepubliceerde lijstprijzen in plaats van met een intern kostenmodel — wat je niet van elk percentage op de dag van de lancering kunt zeggen.
Eén getal in dezelfde sectie overleeft dezelfde behandeling niet. Sakana zegt ook dat Fugu Max "prestaties levert die dicht bij die van elite modellen komen, tegen twee tot zes keer lagere kosten". Tegenover de drie modellen die het voor het cijfer van 40–60% noemt, ligt het ruwe verschil in outputprijs dichter bij 1,7× tot 2,5×. De ruimere vermenigvuldigingsfactor is vermoedelijk gemeten over de volledige frontier — inclusief modellen die veel meer dan $12 kosten — in plaats van tegen de drie in de zin. Het is een verdedigbare bewering over de Pareto-curve en een onverdedigbare over de genoemde rivalen, en de lanceringspagina maakt geen onderscheid tussen de twee.
Dit is waar een routeringslaag aan de prijskant zijn nut bewijst. OrcaRouter geeft de lijstprijzen van providers ongewijzigd door, zonder opslag, dus wanneer een leverancier de lijstprijs wijzigt, wijzigt het getal dat je ziet diezelfde dag — relevant hier omdat het hele uitgangspunt van Fugu Max is dat er ergens in de pool een goedkoper model bestaat en dat je het moet kunnen bereiken zonder erbij na te denken. Wij hosten Fugu Max niet; het draait op Sakana's eigen API. Maar het pass-throughprincipe is hetzelfde principe dat een outputtarief van $6 het controleren waard maakt tegenover een gevestigde aanbieder van $12, in plaats van een van beide getallen blind te vertrouwen.
Wat Sakana zegt te verslaan, en wat het je niet laat zien

De benchmarksectie van de leverancier maakt drie specifieke claims voor Fugu Max: de beste totaalscore op zes benchmarks — Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench en SWEFish — een uitbreiding van de kosten-prestatie-Pareto-grens op zeven van de tien benchmarks, en prestaties 'binnen handbereik van elite modellen' tegen een fractie van de tokenuitgaven.
Drie dingen aan dat bewijs zijn het waard om te onthouden voordat je er ook maar iets van citeert.
Het eerste is dat Sakana geen cijfers publiceerde. De Fugu Max-resultaten verschijnen als tien spreidingsdiagrammen — score op de verticale as, outputprijs in dollars per miljoen tokens op de horizontale — waarbij Fugu Max als een rood punt ten noordwesten van het grijze veld is getekend. Je kunt zien dat het linksboven staat. Je kunt er geen score uit aflezen. Terminal Bench 2.1, GPQA-D en AA-LCR hebben allemaal openbare leaderboards waarop een cijfer direct vergelijkbaar zou zijn, en er is er geen gegeven.
Het tweede is dat een van de zes benchmarks van Sakana zelf is. SWEFish wordt op de lanceringspagina beschreven als "onze interne benchmark die Sakana AI's eigen codeeruitdagingen en use-cases weerspiegelt." Dat is een legitieme manier om geschiktheid voor je eigen product te meten, en het is geen manier om met een concurrent te vergelijken — een score op een benchmark die de leverancier heeft ontworpen, op taken die de leverancier heeft gekozen, is geen bewijs over het model van iemand anders.
Het derde is dat de sterkste cijfers op de pagina toebehoren aan het andere model. Fugu Ultra v2 krijgt cijfers waar Fugu Max grafieken krijgt: Chartography 48,3 tegen Opus 5 met 27,3 en Fable 5 met 29,5, DeepSWE 74,3, beste of gedeeld beste op vijf van de acht benchmarks en in de top twee op zeven van de acht. Ultra v2 heeft ook een opgegeven trainingsafsluitdatum van 2026-08-28 — iets meer dan twee weken voor de lancering — en, veelzeggend, een expliciete vermelding dat Fable 5, Fable 5.1 en GPT-6 Astra niet in zijn pool zitten. Sakana beweert dat het daar komt zonder die specifieke modellen te huren, wat het hele soevereiniteitsargument in één voetnoot is.
Niets hiervan maakt de Fugu Max-claims onwaar. Het maakt ze ongeverifieerd, en het maakt de kop over zes benchmarks alleen veilig om te herhalen met het label erbij. Onafhankelijke evaluatie van een gloednieuw orkestratie-endpoint is zeldzaam, en er is nog niets gepubliceerd.
Fugu Max vs Fugu Ultra v2: welke je echt wilt

Dit zijn geen concurrerende producten, en de keuze tussen beide is niet moeilijk zodra je de cijfers naast elkaar ziet. Fugu Max is de goedkope: $2 invoer, $6 uitvoer, gebouwd om weg te routeren van dure modellen wanneer een goedkoper model het werk kan doen. Fugu Ultra v2 is de sterke: $5 invoer, $30 uitvoer, $0,50 gecachet, gebouwd om bij complexe meerstaps-taken naar capaciteit te routeren, zelfs als dat meer kost.
De praktische tweedeling is op basis van taakvorm, niet op basis van budget. Als je verkeer voornamelijk bestaat uit lookups, extractie, classificatie, korte generaties en eenvoudige tool calls, dan is het hele ontwerp van Fugu Max erop gericht dat op te merken en zo weinig mogelijk uit te geven — en de bewering van Sakana dat het de grens verlegt op zeven van de tien benchmarks wijst op zijn minst in die richting. Als je verkeer lange agentische runs, refactors over meerdere bestanden of onderzoekstaken omvat die kostbaar falen wanneer een stap misgaat, dan koopt het $30-outputtarief op Ultra v2 iets echts: de top-twee-plaatsing op zeven van de acht benchmarks is het deel van de lanceringspagina dat het meest lijkt op een capaciteitsclaim in plaats van een kostenclaim.
Beide zijn beschikbaar op dezelfde OpenAI-compatibele API via de console van Sakana, en het upgradetraject vanaf bestaande Fugu is een parameterwijziging. Er gelden twee kanttekeningen bij de beschikbaarheid. Fugu is naar verluidt niet beschikbaar in de EU en de EER in afwachting van GDPR-werkzaamheden, wat, als dat nog steeds geldt, beperkt waar beide modellen kunnen worden ingezet. En beide zijn gesloten systemen: je koopt een endpoint, en de leverancier bepaalt welke modellen erachter zitten — waaronder, voor Fugu Max, een lijst die hij niet volledig bekendmaakt.
Het addertje onder het gras: een orchestrator die zijn frontier nog steeds huurt
De scherpste kritiek op Fugu is de kritiek die Sakana zelf uitlokt door het als soevereiniteitsinfrastructuur te presenteren. Een orchestratielaag die verkeer routeert over API's van derden, voorkomt niet dat die API's worden ingetrokken. Het verandert een enkelvoudig storingspunt in een gediversifieerd storingspunt, wat een echte verbetering is, maar de onderliggende modellen zijn nog steeds van iemand anders, nog steeds bereikbaar via dezelfde exportcontroles en nog steeds onderhevig aan dezelfde plotselinge dienststopzettingen. De NVIDIA-samenwerking van augustus en de Nemotron-toevoegingen zijn tot nu toe het meest concrete antwoord hierop — open-weightmodellen in de pool zijn modellen die niemand kan uitschakelen — maar Sakana zegt niet welk deel van het verkeer van Fugu Max daadwerkelijk bij hen terechtkomt.
Er is een tweede, stilere afweging. Routeringsbeslissingen voegen latentie toe en halen determinisme weg. Een verzoek dat vandaag op een klein model terechtkomt, kan morgen op een ander model terechtkomen als de pool of de kostenwegingen verschuiven, waardoor gedrag moeilijker te regressietesten is en moeilijker uit te leggen aan iedereen die het systeem auditeert. Sakana's antwoord is dat de orkestratie intern is en dat de API zich als één enkel model gedraagt. Dat klopt op het niveau van de interface, maar niet onder de motorkap, en teams met harde eisen op het gebied van reproduceerbaarheid moeten dat zorgvuldig testen voordat het een kritieke afhankelijkheid wordt.
Als je het kostenvoordeel wilt behalen zonder van de pool je enige afhankelijkheid te maken, is hetzelfde patroon beschikbaar om zelf samen te stellen. Onze routerings-DSL laat je een panel van modellen achter één endpoint definiëren en bepalen welk model welke klasse van verzoeken afhandelt, en modelfusie laat meerdere modellen op dezelfde prompt draaien en brengt de antwoorden met elkaar in overeenstemming waar overeenstemming belangrijker is dan prijs. Failover tussen providers betekent dat wanneer een leverancier verslechtert — of verdwijnt — het verkeer naar een model gaat dat je al vertrouwt, zonder codewijziging. Dat is de conservatievere versie van de gok die Sakana je vraagt integraal aan te gaan.

Het is de moeite waard om precies te zijn over wat we hier wel en niet bieden. Sakana Fugu Max staat niet in onze catalogus — het is aan onze kant geen routeerbaar model, en het draait op Sakana's eigen API en console. Onze catalogus bestaat uit 196 modellen van 15 providers op één sleutel en één factuur, met de tarieven per token op elke kaart vermeld en geen opslag bovenop die tarieven. De relevante overlap met Fugu Max is het idee, niet het aanbod: beide zijn argumenten dat het juiste antwoord op "welk model moet dit aanpakken" meestal niet het grootste model is.
Wie moet zich verplaatsen, en wie moet wachten
Fugu Max is een van de interessantere releases van deze maand, juist omdat het geen model is. Als je al op Sakana Fugu zit, is de upgrade een wijziging van één regel tegen een lagere prijs en is er geen enkele reden om te beraadslagen. Als je grootschalig, laagcomplex verkeer op een model uit het middensegment draait en daarvoor $10–$15 per miljoen outputtokens betaalt, is de rekensom die Sakana aanbiedt een eigen benchmark waard — neem een week aan echte verzoeken, haal ze door Fugu Max en vergelijk de kwaliteit met die van je huidige model in plaats van met de spreidingsdiagrammen.
Als je gepubliceerde benchmarkcijfers nodig hebt voordat je je vastlegt, wacht dan. Er is nog niets onafhankelijks over Fugu Max, het bewijs van de leverancier zelf is een grafiek in plaats van een tabel, en een van de zes belangrijkste benchmarks is van Sakana. Dat is geen reden om het af te wijzen — het is een reden om het op je eigen verkeer te testen, en dat is de enige benchmark die ooit je resultaten zou voorspellen. En als je workload agentisch is, een lange horizon heeft en fouten duur zijn, is het model om naar te kijken in dit tweetal Fugu Ultra v2, niet Fugu Max: dat is degene met cijfers eraan vast.
Onze routing-DSL laat je een panel van modellen achter één endpoint definiëren en bepalen welk model welke klasse van verzoeken afhandelt, en model fusion draait meerdere modellen op dezelfde prompt en brengt de antwoorden met elkaar in overeenstemming waar overeenstemming belangrijker is dan prijs.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
