Een hero-titelkaart voor "Fugu Max vs GLM-5.3" met de ondertitel "Het waardemodel wordt onderboden door het volumemodel", drie pilvormige badges met de tekst "$6,00 vs $3,96 uitvoer", "7.962,7 mln tokens per 7 dagen", "$2,00 vs $1,26 invoer", een voetregel met de tekst "Sakana AI vs Z.ai - september 2026", en het OrcaRouter-logo in de rechteronderhoek.
Engineering & Research

Fugu Max vs GLM-5.3: het waardemodel wordt ondergraven door het volumemodel

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Fugu Max was geprijsd om te winnen op kosten, en GLM-5.3 is goedkoper op beide assen. De coördinator van Sakana AI werd gelanceerd op 11 september 2026 voor $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, gebouwd om elke taak te routeren naar het goedkoopste model dat deze aankan. Z.ai's GLM-5.3, vermeld sinds 18 augustus 2026, staat op $1,26 input en $3,96 output per miljoen op OrcaRouter — tussen een derde en twee vijfde onder Fugu Max op beide, afkomstig van één enkel tekst-only model met een gepubliceerd contextvenster van 1M en een outputplafond van 128K. GLM-5.3 is toevallig ook met grote afstand het drukste model in onze catalogus. Die combinatie — goedkoper per token, en aantoonbaar productieverkeer op schaal verwerkend — maakt dit de confrontatie waarin de orchestratiepremie het moeilijkst te rechtvaardigen is.

Goedkoper op beide assen, met de specificatie gepubliceerd

De vergelijking is ongemakkelijk voor Fugu Max nog voordat er ook maar een benchmark in beeld komt, want het is geen kwestie van capaciteit inruilen voor prijs. GLM-5.3 is op zichzelf een frontier-adjacent flagship — Z.ai beschrijft het als een model dat ruwweg 50% codeerverbetering levert ten opzichte van GLM-5.2 en op geselecteerde cybersecurity-capaciteiten Mythos 5 evenaart. Het is geen budgetmodel dat als goedkoop alternatief wordt aangeboden. Het is een flagship dat toevallig geprijsd is onder een kosten-geoptimaliseerde orchestrator.

• Invoerprijs — Fugu Max $ 2,00 per 1 mln tokens vs. GLM-5.3 $ 1,26 per 1 mln tokens

• Prijs van de output — Fugu Max $6,00 per 1 miljoen tokens vs GLM-5.3 $3,96 per 1 miljoen tokens

• Gecachte invoer — Fugu Max $0,25 per 1 miljoen tokens vs. GLM-5.3 caching geprijsd als een korting op het basistarief voor invoer

• Context — Fugu Max niet gepubliceerd vs. GLM-5.3 1M tokens

• Maximale output — Fugu Max niet gepubliceerd vs. GLM-5.3 128K tokens

• Modaliteit — Fugu Max niet gepubliceerd vs GLM-5.3 alleen tekst, als zodanig gedocumenteerd

• Capaciteitslabels — Fugu Max: niets gepubliceerd vs GLM-5.3 toolgebruik, JSON-modus, redeneren

• Benchmarkcijfers — Fugu Max claimt zes overwinningen zonder scores tegenover de door de leverancier gerapporteerde DeepSWE van GLM-5.3 van 46,2 tot 66,9 ten opzichte van de vorige generatie, plus een gepubliceerde Artificial Analysis-intelligentiescore

• Gewichten — Fugu Max gesloten, pool niet bekendgemaakt vs. GLM-5.3 van een lab met een open-weights-verleden

• Waargenomen verkeer op OrcaRouter — Fugu Max geen, niet meegenomen vs. GLM-5.3 7.962,7M tokens in de afgelopen zeven dagen

Let op wat de laatste twee rijen samen doen. GLM-5.3 komt voort uit een lijn met open gewichten, wat de sterkste beschikbare vorm is van het argument voor leveranciersonafhankelijkheid dat Sakana als de volledige premisse van Fugu Max verkoopt. En het heeft een waarneembaar verkeerscijfer dat een orde van grootte hoger ligt dan dat van de meeste modellen die wij bedienen. Als de vraag is "wat draai ik voor tekstintensief productiewerk tegen een laag tarief", wijst het bewijs naar iets anders dan de orchestrator.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

Het volume-argument, en waarom het niet alleen een populariteitswedstrijd is

Een verkeersaantal is geen kwaliteitscijfer, en het moet ook niet als zodanig worden gelezen. Wat 7,96 miljard tokens in zeven dagen wél aantoont, is dat GLM-5.3 op productieschaal is gedraaid door veel onafhankelijke teams, op echte workloads, en geen massale migratie weg ervan heeft veroorzaakt. Dat is een zwak signaal over kwaliteit en een sterk signaal over operationele geschiktheid: de latentie is stabiel, de doorvoer houdt stand, de API gedraagt zich onder belasting, en de faalmodi zijn bekend bij een voldoende grote groep om publiekelijk zichtbaar te worden. Een model dat in dezelfde week als Fugu Max is uitgebracht, heeft niets van dat alles achter zich.

De latentie-regel maakt het punt scherper. GLM-5.3 laat een p50 time-to-first-token zien van 4,33 seconden over het verkeer dat wij bedienen. Voor agentisch werk — de workload waarop beide producten zijn gericht — telt time-to-first-token zich op bij elke beurt van elke subagent die de coördinator aanmaakt. Een goedkopere orchestrator die vier agents aanmaakt, is niet goedkoper als elk ervan meerdere seconden wacht voordat er iets wordt geproduceerd, en die kosten verschijnen nooit op een tariefkaart.

Het tegenargument van Fugu Max is dat de coördinator per verzoek naar het slankste capabele model routeert, wat in principe betekent dat veel taken helemaal nooit een duur backend aanraken. De uitbreiding van Sakana's pool in deze release voegde open-weights- en gespecialiseerde modellen toe, waaronder de NVIDIA Nemotron-familie via een samenwerking met NVIDIA, dus de goedkope sporten van die ladder zijn reëel. De vraag is of die sporten goedkoper zijn dan $3,96 per miljoen outputtokens. Voor de meeste teksttaken zijn ze dat niet — dat is een lage lat, en open-weights-modellen die tegen hostingtarieven draaien, halen die over het algemeen slechts met een kleine marge.

Vragen die het waard zijn om te stellen voordat je kiest

Is een orchestrator goedkoper dan één enkel open-weightsmodel? Niet standaard, en de intuïtie wijst de verkeerde kant op. Orchestratie voegt de synthesetokens van een coördinator toe en, bij multi-agentruns, de output van elke agent in het team. De prijsstelling van Sakana's Fugu elimineert het slechtste geval door één gemengd tarief te factureren op basis van het deelnemende model uit de topklasse in plaats van agents op te stapelen, wat een echte concessie is. Maar het basistarief dat je mengt is $6,00 output, en het enkele model dat je anders zou aanroepen is $3,96. Orchestratie bespaart geld wanneer het herpogingen voorkomt, niet wanneer het parallelisme toevoegt omwille van het parallelisme.

Maakt een beperking tot alleen tekst voor een van beide iets uit? Voor GLM-5.3 is het gedocumenteerd, dus het is een beperking waarop je kunt plannen — geen beeld, geen audio, geen video, en de catalogus zegt dat ook. Voor Fugu Max wordt de modaliteit simpelweg niet gepubliceerd. Dat is erger dan een beperking, want je kunt pas weten of een pipeline die een pdf verstuurt zal werken als je het probeert. Een niet-vermelde beperking is niet hetzelfde als geen beperking.

Wat gebeurt er met elk van hen wanneer de onderliggende modellen veranderen? GLM-5.3 is één model in één versie, getraind en geserveerd door Z.ai. Als Z.ai zijn prijzen wijzigt, landt die wijziging dezelfde dag op jouw key via OrcaRouter met 0% opslag, en kun je het zien en erop reageren. Het gedrag van Fugu Max is een functie van een pool waarvan Sakana de leden niet bekendmaakt, dus een deprecatie of prijswijziging bij een frontier-lab verandert stilletjes wat je koopt, zonder dat de productnaam verandert. Sakana presenteert dit als veerkracht. Het is veerkracht voor de leverancier en ondoorzichtigheid voor de koper.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Waar routeringsbeslissingen daadwerkelijk worden genomen

Beide zijn in feite routeringsbeslissingen — Fugu Max neemt ze binnen een ondoorzichtige coördinator, en jij neemt ze op de API-laag. OrcaRouter is het tweede type: één API voor meer dan 200 modellen met een routerings-DSL waarmee je het beleid expliciet kunt uitdrukken, automatische failover wanneer een providerpad verslechtert, en modelfusie wanneer je uitvoer bewust wilt combineren in plaats van erop te vertrouwen dat een black box het doet. GLM-5.3 staat in die catalogus tegen de lijstprijs van Z.ai met 0% opslag, wat meer waard is dan gebruikelijk voor een model met zoveel verkeer erachter: het tarief dat je ziet is het tarief dat Z.ai publiceert, ongewijzigd doorgegeven.

Het praktische verschil is auditeerbaarheid. Wanneer Fugu Max een model voor je verzoek kiest, kom je er niets over te weten: niet welk model het was en niet waarom. Wanneer je het routeringsbeleid zelf schrijft, staat de beslissing in je repository, is die te beoordelen door iedereen die je code reviewt, en is die te wijzigen zonder op een leverancier te wachten. Voor teams met enige vorm van compliance- of kostenverantwoordingsverplichting is dat geen filosofisch verschil.

Het vonnis

GLM-5.3 wint deze vergelijking op de punten die er voor een productieteam het meest toe doen: het is goedkoper bij input en output, het contextevenster en outputplafond zijn gepubliceerd, de modaliteitslimieten worden vermeld, het ondersteunt toolgebruik, JSON-modus en redeneren als gedocumenteerde mogelijkheden, het komt uit een open-weights-lijn, en het heeft een zevendaags verkeerscijfer dat de acht miljard tokens nadert. Er is geen enkele lezing van het openbare bewijsmateriaal waarop Fugu Max op dit prijspunt de beter onderbouwde aankoop is.

Fugu Max houdt één argument overeind, en het is een geldig argument: voor taken waarbij een tweede controle door een coördinator een fout opvangt die de eerste ronde zou hebben verzonden, kunnen de kosten per voltooide taak beter zijn dan de kosten per token. Dat is een afgebakende pilot waard als je werk controleerbaar is, een hoog volume heeft en je buiten de EU/EER zit — met vooraf een plafond voor outputtokens en een meting van tokens per afgeronde taak. Anders is het enkelvoudige model dat een derde minder kost en al een maand onder productiebelasting draait het antwoord, en het staat op OrcaRouter tegen de lijstprijs van Z.ai, waarbij het tarief van de provider wordt doorgegeven.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt