Ett hero-titelkort för "Fugu Max vs GLM-5.3" med underrubriken "Värdemodellen undergrävs av volymmodellen", tre pill-badges med texten "$6,00 vs $3,96 output", "7 962,7M tokens per 7d", "$2,00 vs $1,26 input", en sidfotsrad med texten "Sakana AI vs Z.ai – september 2026", och OrcaRouter-logotypen i nedre högra hörnet.
Engineering & Research

Fugu Max vs GLM-5.3: värdemodellen undergrävs av volymmodellen

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Fugu Max prissattes för att vinna på kostnad, och GLM-5.3 är billigare på båda axlarna. Sakana AI:s koordinator lanserades den 11 september 2026 till $2.00 per miljon indatatokens och $6.00 per miljon utdatatokens, byggd för att dirigera varje uppgift till den billigaste modell som klarar av den. Z.ai:s GLM-5.3, listad sedan den 18 augusti 2026, ligger på $1.26 för indata och $3.96 för utdata per miljon hos OrcaRouter – mellan en tredjedel och två femtedelar under Fugu Max på båda, från en enda textbaserad modell med ett publicerat kontextfönster på 1M och ett utdatatak på 128K. GLM-5.3 råkar dessutom vara den mest använda modellen i vår katalog, med bred marginal. Den kombinationen – billigare per token och bevisligen bärande produktionstrafik i stor skala – gör detta till den matchning där orkestreringspremien är svårast att motivera.

Billigare på båda axlarna, med specifikationen publicerad

Jämförelsen är obehaglig för Fugu Max redan innan någon benchmark kommer in i bilden, eftersom det inte handlar om att byta förmåga mot pris. GLM-5.3 är i sin egen rätt ett flaggskepp nära forskningsfronten – Z.ai beskriver det som att det levererar ungefär 50 % förbättring inom kodning jämfört med GLM-5.2 och matchar Mythos 5 inom utvalda cybersäkerhetsförmågor. Det är inte en budgetmodell som erbjuds som ett billigt alternativ. Det är ett flaggskepp som råkar vara prissatt under en kostnadsoptimerad orkestrerare.

• Ingångspris — Fugu Max 2,00 $ per 1 miljon tokens vs GLM-5.3 1,26 $ per 1 miljon tokens

• Pris för utdata — Fugu Max $6.00 per 1 miljon tokens jämfört med GLM-5.3 $3.96 per 1 miljon tokens

• Cachad indata – Fugu Max $0.25 per 1M tokens jämfört med GLM-5.3, där cachning prissätts som en rabatt på baspriset för indata

• Kontext — Fugu Max inte publicerad vs GLM-5.3 1M tokens

• Tak för utdata — Fugu Max ej publicerat vs GLM-5.3 128K tokens

• Modalitet — Fugu Max inte publicerad vs GLM-5.3 endast text, dokumenterad som sådan

• Förmågetaggar — Fugu Max: inga publicerade kontra GLM-5.3: verktygsanvändning, JSON-läge, resonemang

• Benchmark-siffror — Fugu Max sex segrar påstås utan poäng mot GLM-5.3:s leverantörsrapporterade DeepSWE 46,2 till 66,9 jämfört med föregående generation, plus en publicerad intelligenspoäng från Artificial Analysis

• Vikter — Fugu Max sluten, pool ej offentliggjord vs GLM-5.3 från ett labb med rötter i öppna vikter

Observerad trafik på OrcaRouter – Fugu Max: ingen, inte överförd, jämfört med GLM-5.3: 7 962,7 M tokens under de senaste sju dagarna.

Lägg märke till vad de två sista raderna gör tillsammans. GLM-5.3 kommer från en linje med öppna vikter, vilket är den starkaste tillgängliga formen av argumentet för leverantörsoberoende som Sakana säljer som hela premissen för Fugu Max. Och den har en observerbar trafiksiffra en storleksordning högre än de flesta modeller vi betjänar. Om frågan är "vad ska jag köra för texttungt produktionsarbete till ett lågt pris", pekar bevisen någon annanstans än på orkestreraren.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

Volymargumentet, och varför det inte bara är en popularitetstävling

Ett trafikmått är inte ett kvalitetsmått, och det bör inte läsas som ett sådant. Vad 7,96 miljarder tokens under sju dagar faktiskt visar är att GLM-5.3 har körts i produktionsskala av många oberoende team, på verkliga arbetsbelastningar, och inte har gett upphov till någon massflykt från den. Det är en svag signal om kvalitet och en stark signal om driftduglighet: latensen är stabil, genomströmningen håller, API:et beter sig under belastning, och felmoderna är kända av en tillräckligt stor grupp för att de ska bli offentligt synliga. En modell som släpptes samma vecka som Fugu Max har inget av detta bakom sig.

Latensraden skärper poängen. GLM-5.3 visar en p50-tid till första token på 4,33 sekunder över den trafik vi betjänar. För agentiskt arbete – den arbetsbelastning som båda dessa produkter riktar sig mot – ackumuleras tiden till första token över varje tur för varje subagent som koordinatorn startar. En billigare orkestrerare som startar fyra agenter är inte billigare om var och en väntar flera sekunder innan den ger ifrån sig något, och den kostnaden dyker aldrig upp på ett priskort.

Fugu Maxs motargument är att dess koordinator dirigerar till den mest resurssnåla kapabla modellen per begäran, vilket i princip innebär att många uppgifter aldrig ens når en dyr backend. Sakanas utökning av modellpoolen i den här versionen lade till modeller med öppna vikter och specialiserade modeller, inklusive NVIDIA Nemotron-familjen genom ett samarbete med NVIDIA, så de billiga stegpinnarna i den stegen är verkliga. Frågan är om stegpinnarna är billigare än 3,96 dollar per miljon utdatatoken. För de flesta textuppgifter är de inte det – det är en låg ribba, och modeller med öppna vikter som körs till hostingpriser klarar den i allmänhet bara med en liten marginal.

Frågor värda att ställa innan du väljer

Är en orkestrator billigare än en enda modell med öppna vikter? Inte som standard, och intuitionen pekar i fel riktning. Orkestrering tillför en koordinators syntestokens och, vid körningar med flera agenter, utdata från varje agent i teamet. Sakanas Fugu-prissättning tar bort värsta scenariot genom att debitera en enda blandad avgift baserad på den högsta deltagande modellen i stället för att stapla agenter, vilket är en genuin eftergift. Men basavgiften du blandar är $6.00 utdata, och den enskilda modell du annars skulle anropa är $3.96. Orkestrering sparar pengar när den förhindrar återförsök, inte när den lägger till parallellism för dess egen skull.

Spelar en begränsning till endast text någon roll för någon av dem? För GLM-5.3 är den dokumenterad, så det är en begränsning du kan planera kring – ingen vision, inget ljud, ingen video, och katalogen säger det. För Fugu Max är modalitet helt enkelt inte publicerad. Det är värre än en begränsning, eftersom du inte kan veta om en pipeline som skickar en PDF kommer att fungera förrän du provar. En outtalad begränsning är inte samma sak som en frånvarande.

Vad händer med var och en när de underliggande modellerna ändras? GLM-5.3 är en modell i en version, tränad och driftad av Z.ai. Om Z.ai ändrar sin prissättning slår ändringen igenom på din nyckel samma dag via OrcaRouter med 0 % påslag, och du kan se den och reagera. Fugu Maxs beteende är en funktion av en pool vars medlemmar Sakana inte avslöjar, så en utfasning eller prisändring från ett frontlinjelabb förändrar tyst vad du köper utan att produktnamnet ändras. Sakana presenterar detta som motståndskraft. Det är motståndskraft för leverantören och ogenomskinlighet för köparen.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Var routingbeslut faktiskt fattas

Båda dessa är i praktiken routingbeslut – Fugu Max fattar dem inuti en ogenomtränglig koordinator, och du fattar dem på API-nivån. OrcaRouter är den andra sorten: ett API för över 200 modeller med en routing-DSL som låter dig uttrycka policyn explicit, automatisk failover när en leverantörsväg försämras, och modellfusion när du vill kombinera utdata medvetet i stället för att lita på en svart låda att göra det. GLM-5.3 finns i den katalogen till Z.ai:s listpris med 0 % påslag, vilket är värt mer än vanligt för en modell med så här mycket trafik bakom sig: priset du ser är priset som Z.ai publicerar, vidarebefordrat oförändrat.

Den praktiska skillnaden är granskningsbarhet. När Fugu Max väljer en modell för din begäran får du inte veta något om vilken det var eller varför. När du själv skriver routningspolicyn finns beslutet i ditt kodförråd, granskningsbart av den som granskar din kod, och kan ändras utan att vänta på en leverantör. För team som omfattas av någon form av krav på regelefterlevnad eller kostnadsredovisning är det inte en filosofisk skillnad.

Domen

GLM-5.3 vinner den här jämförelsen på de punkter som betyder mest för ett produktionsteam: det är billigare på input och output, dess kontextfönster och utdatatak är offentliggjorda, dess modalitetsgränser är angivna, det har verktygsanvändning, JSON-läge och resonemang som dokumenterade kapaciteter, det kommer från en härstamning med öppna vikter, och det har en sjudagars trafikvolym som närmar sig åtta miljarder tokens. Det finns ingen tolkning av den offentliga bevisningen enligt vilken Fugu Max är det bättre underbyggda köpet vid den här prisnivån.

Fugu Max håller fast vid ett argument, och det är ett riktigt sådant: för uppgifter där en koordinators andra pass fångar ett misstag som det första passet skulle ha skickat iväg, kan kostnaden per slutförd uppgift slå kostnaden per token. Det är värt en avgränsad pilot om ditt arbete är kontrollerbart, högvolymigt och du befinner dig utanför EU/EES – med ett i förväg satt tak för utdata-token och en mätning av antalet token per slutförd uppgift. Annars är svaret den enskilda modellen som kostar en tredjedel mindre och har kört under produktionslast i en månad, och den finns på OrcaRouter till Z.ai:s listpris med leverantörens avgift vidarefakturerad.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen