
Fugu Ultra v2 vs GLM 5.2: Je betaalt voor coördinatie, niet voor parameters
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Zet de twee tariefkaarten naast elkaar en de vergelijking lijkt op een vergissing. Fugu Ultra v2, dat Sakana AI op 11 september 2026 aankondigde, rekent $5 per miljoen invoertokens en $30 per miljoen uitvoertokens. GLM 5.2, het vlaggenschip van Z.ai van 16 juni 2026, rekent $1,40 en $4,40. Beide claimen een contextvenster in de orde van een miljoen tokens. Beide zijn gericht op precies dezelfde koper — het team dat langdurig, meerstaps agentisch werk op repositoryschaal uitvoert. De een is ongeveer 3,6× de invoerprijs en 6,8× de uitvoerprijs van de ander, en de goedkopere is degene die je kunt downloaden en houden. Dus de hele vergelijking komt neer op één vraag: wat krijg je eigenlijk voor dat extra geld, en krijg je iets wat één enkel model niet kan zijn?
Het zijn niet hetzelfde soort object.
De reden dat het prijsverschil bestaat, is dat deze twee dingen taken met een lange horizon oplossen met volledig verschillende machinerie, en dat verschil wordt al zichtbaar voordat je ook maar een benchmark draait.
• Fugu Ultra v2 — een orkestratiesysteem, geen fundatiemodel. Het is de capaciteitenmaximaliserende tier van Sakana AI's Fugu-lijn: één OpenAI-compatibel endpoint dat een binnenkomende taak opsplitst en de onderdelen verdeelt over een pool van andere modellen, sommige met open gewichten en sommige gespecialiseerd. Sakana's eigen framing is dat het "piekprestaties hoger stuwt dan ooit tevoren, zonder de onmisbare afhankelijkheid van de frontiermodellen die het orkestreert." Je koopt een scheduler, en je betaalt voor elk token dat die scheduler aan nadenken besteedt, inclusief de interne orkestratietokens.
• GLM 5.2 — één enkel Mixture-of-Experts-model. Z.ai publiceert het als een tekst-in/tekst-uit-model met een "werkelijk bruikbaar" contextvenster van 1M tokens en tot 128K uitvoertokens, hybride redenering aangestuurd door reasoning_effort, en native tool calling. De gerapporteerde architectuur telt ruwweg 753B totale parameters met ongeveer 40B actief per token, hoewel Z.ai het aantal actieve parameters voor 5.2 specifiek niet heeft bevestigd — beschouw dat cijfer als overgenomen van GLM-5.1.
Dat is de tweesprong. Een van deze is een ding dat je aanroept; het andere is een ding dat dingen aanroept.
Wat Fugu Ultra v2 ons niet zou vertellen
Sakana's aankondigingspagina is opvallend openhartig over het ene en opvallend stil over het andere, en beide zijn van belang voor een aankoopbeslissing.
Het openhartige deel: het bedrijf verklaart ronduit dat Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra niet in de modellenpool van Fugu Ultra v2 zitten, terwijl het beweert ze te verslaan op benchmarks. De opgegeven reden is veerkracht — een verwisselbare pool van open en gespecialiseerde modellen die niet kan worden ingetrokken, herprijsd of afgesneden door een leverancier of een geopolitieke verschuiving. De trainingsafsluitdatum staat vermeld als 20260828. Wat je ook van het argument vindt, het is een echte architectuurkeuze, en het is de duidelijkste reden om Fugu Ultra v2 te kiezen boven een stack die je zelf hebt samengesteld.
Het onuitgesproken deel: de aankondiging vermeldt geen contextvenster, en op de pagina zelf worden de tokenprijzen van Fugu Ultra v2 niet vermeld. Vermeldingen van modellen van derden stellen het venster op 1M tokens en de tarieven op $5 / $0,50 gecachet / $30, met een tariefwijzigingsniveau boven ongeveer 272K invoertokens dat naar ongeveer $10 / $1,00 / $45 gaat. Dat zijn de cijfers die de rest van dit artikel gebruikt, maar het zijn vermeldingen, geen documentatie van de leverancier — controleer ze aan de hand van Sakana's actuele tariefkaart voordat je je budget erop baseert.
De kostenvraag die niemand per token beantwoordt
Prijs per token is de verkeerde eenheid voor deze vergelijking, en elke pagina die er momenteel op rankt maakt dezelfde fout. De rekening van een orchestrator is niet de grootte van je prompt vermenigvuldigd met een tarief; het is de grootte van je prompt, plus elke subaanroep die hij besluit te doen, plus de redeneertokens van de modellen die hij huurt, allemaal met een opslag tegen het eigen tarief van de orchestrator.
Sakana geeft dit ronduit toe: orkestratietokens die intern worden verbruikt, worden gefactureerd als gewone input- en outputtokens. Dat betekent dat de eerlijke manier om Fugu Ultra v2 met GLM 5.2 te vergelijken de kosten per voltooide taak zijn, en geen van beide leveranciers publiceert dat cijfer.
Enkele structurele punten die hoe dan ook standhouden:
• Invoerprijs — Fugu Ultra v2 $5,00 / 1M versus GLM 5.2 $1,40 / 1M op OrcaRouter tegen het providertarief van Z.ai. Fugu kost 3,6× zoveel voordat het ook maar één subaanroep doet.
• Prijs van output — Fugu Ultra v2 $30,00 / 1M vs GLM 5.2 $4,40 / 1M. Dit is het getal dat pijn doet, want agents produceren veel output, en een orchestrator produceert output die je niet hebt gevraagd.
• Gecachte invoer — Fugu Ultra v2 rekent $0,50 / 1 mln; GLM 5.2 cachet tegen $0,26 / 1 mln, een korting van 81% op zijn eigen invoertarief. Het is bij herhaalde agent-loops op een stabiele systeemprompt dat de voorsprong van GLM 5.2 zich het sterkst opstapelt.
• Herprijzing voor lange context — De gerapporteerde tier van Fugu Ultra v2 boven ~272K input verplaatst het hele verzoek naar ongeveer het dubbele invoertarief en 1,5× het uitvoertarief. GLM 5.2 heeft helemaal geen context-tiering: $1,40 / $4,40 vast, helemaal tot 1M.
Die laatste rij is de rij die je moet omcirkelen. Een agent-run met een lange horizon brengt het grootste deel van zijn leven door voorbij 272K tokens. Het vaste tarief van GLM 5.2 is echt geld waard precies daar waar dat van Fugu Ultra v2 verdubbelt.

De benchmarks raken het nauwelijks aan.
Dit is het werkelijk vreemde aan deze confrontatie, en het punt dat geen enkele huidige ranglijstpagina ronduit vermeldt: deze twee modellen worden bijna nooit op dezelfde test gemeten.
Sakana meldt Fugu Ultra v2 als beste of gedeeld beste op vijf van de acht benchmarks — GDP.pdf, Chartography, SWEFish, DeepSWE en Toolathon — en in de top twee op zeven van de acht. De twee belangrijkste cijfers die het geeft, zijn Chartography op 48,3, tegenover Opus 5 op 27,3 en Fable 5 op 29,5, en DeepSWE op 74,3. SWEFish en Toolathon zijn Sakanas eigen interne benchmarks. Alles is door de leverancier gerapporteerd en niets ervan is op het moment van publicatie onafhankelijk gereproduceerd.
De cijfers van Z.ai voor GLM 5.2 komen uit een heel andere categorie: Terminal-Bench 2.1 op 81,0, SWE-bench Pro op 62,1, GPQA-Diamond op 91,2, AIME 2026 op 99,2, HLE op 40,5 — ook door de leverancier gerapporteerd. Aan de onafhankelijke kant heeft GLM 5.2 een AA Coding Index van 68,8 en een Intelligence Index van 39 op de pagina van Artificial Analysis met herberekende scores, waar het als een voorlopige schatting wordt gemarkeerd en op #7 van 113 staat. Oudere verwijzingen naar 51 of 53 voor GLM 5.2 komen uit een achterhaalde indexschaal en mogen niet worden aangehaald.
Dus als je een zuiver cijfer voor een rechtstreekse vergelijking wilt, is dat er niet. Het dichtst bij een gemeenschappelijke as komt nog dat beide sterk zijn in agentic coding, en de eerlijke interpretatie is dat elk bedrijf heeft gepubliceerd over de tests waarin het goed scoort. Dat is een reden om je eigen evaluatie uit te voeren, niet om het hoogste cijfer te kiezen.
Iets dat het vermelden waard is voor iedereen die vandaag GLM 5.2 overweegt: het is niet langer Z.ai's nieuwste model. GLM-5.3 verscheen rond 14 augustus 2026 voor dezelfde adviesprijs, maar onder een aangepaste licentie die grote cloudproviders beperkt — waardoor GLM 5.2 het laatste volledig MIT-gelicenseerde Z.ai-vlaggenschip is, en de reden waarom het nog steeds een onderscheidend koopargument heeft.

De licentie is de scherpste scheidslijn
Laat de benchmarks buiten beschouwing, en het structurele verschil is scherper dan welke score dan ook.
GLM 5.2 wordt geleverd als open weights onder MIT op Hugging Face, zonder regionale beperkingen. Je kunt het downloaden, op je eigen hardware draaien, fine-tunen en in een product verwerken zonder iemand om toestemming te vragen of überhaupt een tarief per token te betalen. Z.ai heeft het getraind — opmerkelijk genoeg, volgens de eigen bewering van het bedrijf, volledig op Huawei Ascend-accelerators in plaats van op Nvidia.
Fugu Ultra v2 biedt je niets van dat alles. Het is een gehoste dienst: een orchestratiebeleid bovenop een pool van modellen waarvan Sakana het lidmaatschap alleen aan de randen heeft beschreven. Je kunt het niet downloaden, inspecteren, vastpinnen of air-gapped draaien. Wat je in plaats daarvan krijgt, is de abstractie — één enkel endpoint waarvan het gedrag in principe bestand is tegen het verdwijnen van eender welk upstream-model. Dat is een oprecht voordeel voor een productiesysteem dat zich niet kan permitteren dat een afhankelijkheid verdwijnt. Het is ook een oprechte kostprijs, want je hebt er de controle voor ingeruild.
Als je beperking is "het model mag niet onder me vandaan veranderen", dan geldt slechts één van deze antwoorden. Als je beperking is "het model mag niet door iemand anders verwijderd kunnen worden", dan geldt alleen de andere.
Snelheid, en wat testers over de laatste zeiden
GLM 5.2 is meetbaar niet snel: Artificial Analysis registreerde ongeveer 66,3 tokens per seconde met een time-to-first-token van rond 4,03 seconden, wat bescheiden is voor een model uit de frontier-klasse, en de eigen gebruikers van Z.ai hebben geklaagd over servercongestie tijdens piekuren.
Sakana publiceert geen latentie- of doorvoercijfers voor Fugu Ultra v2, wat op zichzelf veelzeggend is — een systeem dat naar meerdere modellen dispatcht, heeft een latentieprofiel dat volledig afhangt van wat het besluit aan te roepen, dus één enkel doorvoercijfer zou nagenoeg betekenisloos zijn. Voor de vorige Fugu Ultra meldden testers openbaar dat runs uitliepen tot ongeveer 30 minuten en dat de kosten ver boven het tarief van één model voor dezelfde taak lagen. Dat is het model van juni 2026 en geen bewijs over v2 — maar het is het faalpatroon waarop je moet testen, en de reden waarom een vergelijking per token orchestrators gunstiger doet lijken.

Hoe je elk van deze eigenlijk zou noemen
GLM 5.2 staat vanaf vandaag op OrcaRouter tegen Z.ai's eigen providertarieven — $1,40 per miljoen input en $4,40 per miljoen output, doorgegeven zonder enige markup, dus elke verlaging die Z.ai doorvoert, komt hier dezelfde dag nog aan. Het is OpenAI-compatibel, dus overstappen erop is een kwestie van de base-URL en model-ID aanpassen in de SDK die je al gebruikt, en je kunt het achter een failoverketen of een routeringsregel plaatsen in plaats van een productiepad op één provider te wedden.
Fugu Ultra v2 is niet iets wat wij routeren. Het is beschikbaar via Sakana AI's eigen OpenAI-compatibele API, en met één parameterwijziging verhuist een bestaande Fugu-integratie ernaartoe. Als je het tegen GLM 5.2 evalueert, is de praktische aanpak om GLM 5.2 op je bestaande gateway te houden en Fugu Ultra v2 rechtstreeks bij Sakana aan te roepen terwijl je beslist — beide zijn OpenAI-compatibel, dus ze kunnen in hetzelfde codepad achter een flag zitten.
Welke moet je kiezen?
Kies GLM 5.2 als je een bekend gegeven tegen een bekende prijs wilt: MIT-gelicentieerde gewichten die je morgen zelf kunt hosten, een vast tarief van $1,40 / $4,40 zonder penalty voor lange context, een echt bruikbaar venster van 1M, en een korting die zich opstapelt bij gecachte agent-loops. Accepteer dat het alleen tekst is, dat het een generatie achterloopt op GLM-5.3, en dat de onafhankelijke indexscore voorlopig is.
Kies Fugu Ultra v2 als het ding dat je koopt veerkracht plus piekcapaciteit bij moeilijk werk met meerdere stappen is, en je bereid bent om per token te betalen voor coördinatie en om het vermogen op te geven om te inspecteren of zelf te hosten wat je aanroept. De eigen claim van de leverancier is dat het frontier-niveau output bereikt zonder afhankelijk te zijn van frontier-modellen — een echte en ongebruikelijke propositie, en een die tot op de dag van vandaag door precies niemand buiten Sakana geverifieerd heeft kunnen worden.
Wat we niet zouden doen, is op basis van de benchmarktabel tussen hen kiezen. De tests overlappen nauwelijks, beide leveranciers publiceerden op hun eigen sterkste terrein, en het doorslaggevende getal — kosten per voltooide taak met een lange horizon — is juist het getal dat geen van beide bedrijven op een pagina heeft gezet.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
