
Sakana Fugu Ultra v2, uitgelegd: de pool werd kleiner en de score ging omhoog
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Fugu Ultra v2 is een vreemd soort upgrade: Sakana AI bracht het op 11 september 2026 uit met een modellenpool die Claude Fable 5, Claude Fable 5.1 noch GPT-6 Astra meer bevat — drie van de sterkste systemen die nu worden geleverd — en beweert nog steeds alle drie te verslaan. Het nieuwe vlaggenschip in de kwaliteitsklasse van het Tokio-lab, op dezelfde dag uitgebracht als een goedkopere broer genaamd Fugu Max, is het beste of gedeeld het beste op vijf van de acht benchmarks in Sakana's eigen evaluatie, waaronder 48,3 op Chartography tegenover Claude Opus 5 met 27,3 en Claude Fable 5 met 29,5, en 74,3 op DeepSWE. Geen van die cijfers is onafhankelijk gereproduceerd, en er is nog steeds geen Artificial Analysis-pagina voor welk Fugu-model dan ook. Dat gat is het verhaal: wat je wordt gevraagd te kopen, is een coördinatielaag waarvan de hele propositie is dat hij niet de beste modellen nodig heeft om de beste antwoorden te produceren.
Sakana AI werd in 2023 opgericht door Llion Jones, een medeauteur van de Transformer-paper, en David Ha. De Fugu-lijn werd in juni 2026 gelanceerd als een multi-agentsysteem dat als één model wordt geleverd: je roept één OpenAI-compatibel endpoint aan, en daarachter decomposeert een getrainde coördinator het verzoek, start agents op en synthetiseert het resultaat. Het onderzoek is echt en gepubliceerd — TRINITY (arXiv 2512.04695) evolueerde een lichtgewicht coördinator die de rollen Thinker, Worker en Verifier toewijst; Conductor (arXiv 2512.04388) leerde natuurlijke-taalcoördinatie tussen agents; het technische rapport van Fugu staat op arXiv 2606.21228. Wat Sakana nooit heeft gepubliceerd, is precies wat iedereen eigenlijk wil: de identiteit van de modellen in de pool, en de routingbeslissingen per taak.
Wat is er eigenlijk veranderd ten opzichte van de Fugu Ultra van juni?
Versie 2.0 is een puntupdate, ongeveer elf weken na het origineel, geen nieuwe architectuur. De eigen framing van de leverancier is dat Fugu Ultra v2 en Fugu Max "dezelfde kernarchitectuur voor orkestratie" zijn, afgestemd op twee verschillende missies: Max duwt de kosten-prestatiegrens omlaag, Ultra duwt de piekcapaciteit omhoog. Het model-ID is fugu-ultra-v2.0, en Sakana zegt dat migreren van een eerdere Fugu een parameterwijziging van één regel is zonder SDK-migratie — wat het meest consumentvriendelijke aspect van de release is.
De inhoudelijke wijzigingen zijn de twee uitersten. Ten eerste is de trainingsafsluitdatum verschoven naar 20260828, zodat de coördinator opnieuw is afgestemd op de huidige generatie frontiermodellen. Ten tweede, en veel interessanter, is de samenstelling van de pool veranderd op een manier die Sakana bewust naar buiten bracht: Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra zijn expliciet uitgesloten. Sakana's argument is dat dit bewijst dat de scores niet afhangen van één enkel bedrijfseigen frontiermodel, wat van belang is als je je zorgen maakt over vendor lock-in, ingetrokken API's of een model dat achter exportcontroles verdwijnt.
Er is een consequentie van de tweede orde waar Sakana niet bij stilstaat. Als de pool de drie sterkste beschikbare modellen uitsluit, dan worden de benchmarkvergelijkingen met Fable 5 en Fable 5.1 gemaakt tegen systemen die de orchestrator niet zou kunnen aanroepen, zelfs als hij dat zou willen. De vergelijking is legitiem — het is een bewering over de architectuur, niet over toegang — maar het is geen gelijkwaardige test van wie het betere model heeft. Het is een test van of coördinatie het wint van ruwe capaciteit. Dat is een oprecht interessante vraag. Het is alleen niet de vraag die het scorebord in één oogopslag suggereert.

De cijfers, en wie ze heeft geproduceerd
Elk cijfer in deze sectie is door de leverancier gerapporteerd. Sakana heeft geen evaluatieraamwerk, geen scorematrix per taak en geen reproductierecept vrijgegeven, en het orchestratieontwerp maakt onafhankelijke replicatie moeilijker in plaats van gemakkelijker: om een score te reproduceren is toegang vereist tot elk model in de pool, in dezelfde versies en met dezelfde topologie, en door het ontwerp varieert de topologie per verzoek.
• Chartografie (visueel redeneren over grafieken en gestructureerde documenten) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — volgens opgave van de leverancier
• DeepSWE (software-engineering in de praktijk) — Fugu Ultra v2 74,3 — door de leverancier opgegeven, naar verluidt beter dan modellen die drie tot vijf keer meer per token kosten
• Beste of gedeelde beste positie — vijf van de acht benchmarks: GDP.pdf, Chartography, SWEFish, DeepSWE en Toolathon — door de leverancier gerapporteerd
• Positie in de top twee — zeven van de acht benchmarks — door de leverancier gerapporteerd
• Eerdere Fugu Ultra (juni 2026, ter vergelijking) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — door leverancier gerapporteerd
De Chartography-rij verdient de nadruk die hij krijgt, want het is de enige categorie waarin het verschil met een genoemd, actueel vlaggenschip niet marginaal is. Een verschil van 21 punten met Claude Opus 5 op een benchmark voor visueel redeneren is het soort cijfer dat meestal binnen enkele dagen op een onafhankelijk leaderboard opduikt. Op het moment van schrijven is er nog geen enkele verschenen. Behandel de rij als een hypothese met een dollarbedrag eraan verbonden, niet als een vaststaand resultaat.
Prijzen: onveranderd sinds juni, en ronduit duur voor output
Fugu Ultra v2 kost $5 per miljoen invoertokens, $30 per miljoen uitvoertokens en $0,50 per miljoen gecachte invoer. Boven 272.000 tokens context worden die respectievelijk $10, $45 en $1,00. Fugu Max heeft een heel andere vorm: $2 invoer, $6 uitvoer, $0,25 gecacht, vast ongeacht de contextlengte, plus $0,007 per webzoekopdracht of fetch-aanroep.
Twee dingen aan die prijstabel zijn het zorgvuldig lezen waard. Het eerste is dat output zes keer input is — een agressieve verhouding die de breedsprakigheid van het model beprijst, en orkestratie is een breedsprakige aangelegenheid. Een coördinator die agents spawnt en hun antwoorden synthetiseert, stoot veel tokens uit, en je betaalt voor ze allemaal tegen $30 per miljoen. De efficiëntieclaim van Sakana gaat over de onderliggende pool, niet over hoeveel tekst het systeem namens jou produceert, en dat zijn verschillende getallen. Begroot op basis van waargenomen tokenaantallen, niet op basis van het genoemde tarief.
De tweede is de 272K-kloof. Het tarief per token boven een drempel verdubbelen is een legitieme manier om werk met een lange context te prijzen, maar het betekent dat de effectieve kosten van een agentrun met lange context niet het getal op de prijzenpagina zijn. Als je workload zich dicht bij de grens bevindt, verandert de rekensom aanzienlijk aan weerszijden ervan.
Fugu's abonnementsniveaus — $20 Standard, $100 Pro, $200 Max per maand, met 10x- en 20x-tegoeden — bieden allemaal toegang tot Fugu, Fugu Ultra en Fugu Max. Sakana berekent ook de prijs van het basismodel Fugu aan de hand van het hoogste niveau dat voor een bepaald verzoek in de pool aanwezig is, en stelt duidelijk dat het toevoegen van meer agents de factuur niet vermenigvuldigt. Dat is een wezenlijk verschil met het fan-out-kostenmodel dat je zou krijgen als je zelf meerdere frontier-modellen aanroept.
Wat Sakana je niet zal vertellen
Vraag welke modellen je vraag hebben beantwoord, en de FAQ is duidelijk: "deze routeringsinformatie wordt bewust niet vrijgegeven." Ultra- en Max-pools zijn vast, dus je kunt een leverancier niet uitsluiten; alleen het basismodel Fugu ondersteunt opt-outs per model in de console-instellingen. Enterprise-klanten kunnen onderhandelen over aangepaste configuraties.
Die ondoorzichtigheid is de kern van de kritiek die de Fugu-lijn sinds juni heeft gekregen, en het is eerder een terechte dan een vijandige kritiek. Wanneer een orchestrator goed scoort door de modellen van andere labs te combineren, hoort de score bij het systeem — wat een echt en verdedigbaar iets is om te verkopen — maar die is niet overdraagbaar naar één enkel model, en kan niet worden gecontroleerd. Recensenten hebben het bot gezegd: Fugu versloeg het vlaggenschip niet, het huurde het vlaggenschip in. Bij verifieerbare taken met een goedkope controle, zoals een codingbenchmark met een testsuite, kan een commissie echt beter presteren dan haar beste lid. Bij taken zonder zo'n controle rapporteert een panel dat meerdere frontiermodellen samplet en het beste resultaat rapporteert, deels geluk. Sakana's eigen categoriekeuzes — Chartography, DeepSWE, Toolathon — neigen naar de verifieerbare kant, wat de juiste plek is om de bewering te doen en ook de reden dat de bewering niet kosteloos kan worden gegeneraliseerd.
Onafhankelijke testers hebben ook latentievariantie aangemerkt als de praktische kosten van orkestratie: bij moeilijke taken beraadslaagt de coördinator, en bij gemakkelijke taken is die beraadslaging pure overhead. Naar verluidt kostte de shadertaak van een onderzoeker ongeveer dertig minuten, waarbij de kwaliteit slechts als acceptabel werd beoordeeld.

Waar je het echt kunt krijgen
Fugu Ultra v2 is nu live via de eigen OpenAI-compatibele API van Sakana — richt een bestaande client op het endpoint met een API-sleutel en wijzig één regel — en via verschillende platforms van derden. OrcaRouter biedt de Fugu-modellen niet aan; als je Fugu Ultra v2 wilt aanroepen, is de eigen API van de leverancier de directe route.
Wat het vermelden waard is, is het alternatief waarmee Sakana impliciet concurreert. De pool die Fugu Ultra v2 laat werken, is samengesteld uit modellen die vandaag afzonderlijk aanroepbaar zijn, en de tegenstanders waartegen het wordt afgemeten, zijn de modellen die teams al draaien. Claude Opus 5, DeepSeek V4 Pro en Gemini 3.1 Pro staan allemaal op OrcaRouter tegen de lijstprijzen van hun aanbieders met 0% opslag, wat betekent dat een prijsverlaging van een van die leveranciers aan onze kant live is op dezelfde dag dat die wordt aangekondigd. Als de reden dat je een orchestrator overweegt veerkracht is — niet willen dat een productiepad afhankelijk is van de uptime of het beleid van één leverancier — dan lost een routeringslaag met automatische failover tussen aanbieders een deel van dat probleem op op modelniveau, en Fugu Ultra v2 lost een ander deel op op redeneerniveau. Eén API voor 200+ modellen met failover is geen vervanging voor een getrainde coördinator, en een getrainde coördinator is geen vervanging voor het niet afhankelijk zijn van één leverancier. Sommige teams zullen beide willen.
De compliance-valkuil
Fugu is niet beschikbaar in de Europese Unie of de Europese Economische Ruimte. De bewoording van de leverancier is expliciet: nog niet beschikbaar in de EU/EER terwijl er wordt toegewerkt naar naleving van de AVG en EU-specifieke regelgeving, en elders kan de toegang beperkt zijn door netwerkomstandigheden of lokale regels. Als uw organisatie EU-entiteiten binnen scope heeft, haalt dit de Fugu-lijn uit de overwegingen, ongeacht de benchmarkprestaties, wat het waard is om te weten vóór de evaluatie in plaats van erna.

Wat te kijken
Drie dingen zouden Fugu Ultra v2 van een interessante bewering tot een dragende keuze maken. Een onafhankelijke evaluatie — een vermelding in Artificial Analysis, een plaatsing in LMArena, iets met een testharnas erachter — zou de Chartography-kwestie in een week beslechten. Gereproduceerde cijfers van een derde partij op de verifieerbare coding-benchmarks zouden de winst op systeemniveau bevestigen die de architectuur voorspelt. En een openbaar gemaakte pool, of zelfs een gedeeltelijke, zou kopers in staat stellen te beredeneren precies welke single points of failure zij accepteren wanneer zij productieverkeer door een coördinator routeren die zij niet kunnen inspecteren.
Tot dan is de eerlijke positie deze. Fugu Ultra v2 is de meest serieuze poging tot nu toe om orkestratie als product te verkopen in plaats van als onderzoeksdemo, van een lab met gepubliceerd werk achter zich, tegen een prijs die de orkestratiepremie expliciet maakt in plaats van verborgen. Als je workload langdurig, verifieerbaar en beperkt is tot een regio waar Sakana je kan bedienen, is het een afgebakende pilot waard met token-accounting aan. Zo niet, dan zijn de modellen waarmee Fugu Ultra v2 wordt vergeleken één API-aanroep verwijderd, tegen lijstprijs, met de bewijsstukken om aan te tonen wat ze kunnen.
Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
