
Fugu Max vs GLM-5.3: värdemodellen undergrävs av volymmodellen
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Max prissattes för att vinna på kostnad, och GLM-5.3 är billigare på båda axlarna. Sakana AI:s koordinator lanserades den 11 september 2026 till $2.00 per miljon indatatokens och $6.00 per miljon utdatatokens, byggd för att dirigera varje uppgift till den billigaste modell som klarar av den. Z.ai:s GLM-5.3, listad sedan den 18 augusti 2026, ligger på $1.26 för indata och $3.96 för utdata per miljon hos OrcaRouter – mellan en tredjedel och två femtedelar under Fugu Max på båda, från en enda textbaserad modell med ett publicerat kontextfönster på 1M och ett utdatatak på 128K. GLM-5.3 råkar dessutom vara den mest använda modellen i vår katalog, med bred marginal. Den kombinationen – billigare per token och bevisligen bärande produktionstrafik i stor skala – gör detta till den matchning där orkestreringspremien är svårast att motivera.
Billigare på båda axlarna, med specifikationen publicerad
Jämförelsen är obehaglig för Fugu Max redan innan någon benchmark kommer in i bilden, eftersom det inte handlar om att byta förmåga mot pris. GLM-5.3 är i sin egen rätt ett flaggskepp nära forskningsfronten – Z.ai beskriver det som att det levererar ungefär 50 % förbättring inom kodning jämfört med GLM-5.2 och matchar Mythos 5 inom utvalda cybersäkerhetsförmågor. Det är inte en budgetmodell som erbjuds som ett billigt alternativ. Det är ett flaggskepp som råkar vara prissatt under en kostnadsoptimerad orkestrerare.
• Ingångspris — Fugu Max 2,00 $ per 1 miljon tokens vs GLM-5.3 1,26 $ per 1 miljon tokens
• Pris för utdata — Fugu Max $6.00 per 1 miljon tokens jämfört med GLM-5.3 $3.96 per 1 miljon tokens
• Cachad indata – Fugu Max $0.25 per 1M tokens jämfört med GLM-5.3, där cachning prissätts som en rabatt på baspriset för indata
• Kontext — Fugu Max inte publicerad vs GLM-5.3 1M tokens
• Tak för utdata — Fugu Max ej publicerat vs GLM-5.3 128K tokens
• Modalitet — Fugu Max inte publicerad vs GLM-5.3 endast text, dokumenterad som sådan
• Förmågetaggar — Fugu Max: inga publicerade kontra GLM-5.3: verktygsanvändning, JSON-läge, resonemang
• Benchmark-siffror — Fugu Max sex segrar påstås utan poäng mot GLM-5.3:s leverantörsrapporterade DeepSWE 46,2 till 66,9 jämfört med föregående generation, plus en publicerad intelligenspoäng från Artificial Analysis
• Vikter — Fugu Max sluten, pool ej offentliggjord vs GLM-5.3 från ett labb med rötter i öppna vikter
Observerad trafik på OrcaRouter – Fugu Max: ingen, inte överförd, jämfört med GLM-5.3: 7 962,7 M tokens under de senaste sju dagarna.
Lägg märke till vad de två sista raderna gör tillsammans. GLM-5.3 kommer från en linje med öppna vikter, vilket är den starkaste tillgängliga formen av argumentet för leverantörsoberoende som Sakana säljer som hela premissen för Fugu Max. Och den har en observerbar trafiksiffra en storleksordning högre än de flesta modeller vi betjänar. Om frågan är "vad ska jag köra för texttungt produktionsarbete till ett lågt pris", pekar bevisen någon annanstans än på orkestreraren.

Volymargumentet, och varför det inte bara är en popularitetstävling
Ett trafikmått är inte ett kvalitetsmått, och det bör inte läsas som ett sådant. Vad 7,96 miljarder tokens under sju dagar faktiskt visar är att GLM-5.3 har körts i produktionsskala av många oberoende team, på verkliga arbetsbelastningar, och inte har gett upphov till någon massflykt från den. Det är en svag signal om kvalitet och en stark signal om driftduglighet: latensen är stabil, genomströmningen håller, API:et beter sig under belastning, och felmoderna är kända av en tillräckligt stor grupp för att de ska bli offentligt synliga. En modell som släpptes samma vecka som Fugu Max har inget av detta bakom sig.
Latensraden skärper poängen. GLM-5.3 visar en p50-tid till första token på 4,33 sekunder över den trafik vi betjänar. För agentiskt arbete – den arbetsbelastning som båda dessa produkter riktar sig mot – ackumuleras tiden till första token över varje tur för varje subagent som koordinatorn startar. En billigare orkestrerare som startar fyra agenter är inte billigare om var och en väntar flera sekunder innan den ger ifrån sig något, och den kostnaden dyker aldrig upp på ett priskort.
Fugu Maxs motargument är att dess koordinator dirigerar till den mest resurssnåla kapabla modellen per begäran, vilket i princip innebär att många uppgifter aldrig ens når en dyr backend. Sakanas utökning av modellpoolen i den här versionen lade till modeller med öppna vikter och specialiserade modeller, inklusive NVIDIA Nemotron-familjen genom ett samarbete med NVIDIA, så de billiga stegpinnarna i den stegen är verkliga. Frågan är om stegpinnarna är billigare än 3,96 dollar per miljon utdatatoken. För de flesta textuppgifter är de inte det – det är en låg ribba, och modeller med öppna vikter som körs till hostingpriser klarar den i allmänhet bara med en liten marginal.
Frågor värda att ställa innan du väljer
Är en orkestrator billigare än en enda modell med öppna vikter? Inte som standard, och intuitionen pekar i fel riktning. Orkestrering tillför en koordinators syntestokens och, vid körningar med flera agenter, utdata från varje agent i teamet. Sakanas Fugu-prissättning tar bort värsta scenariot genom att debitera en enda blandad avgift baserad på den högsta deltagande modellen i stället för att stapla agenter, vilket är en genuin eftergift. Men basavgiften du blandar är $6.00 utdata, och den enskilda modell du annars skulle anropa är $3.96. Orkestrering sparar pengar när den förhindrar återförsök, inte när den lägger till parallellism för dess egen skull.
Spelar en begränsning till endast text någon roll för någon av dem? För GLM-5.3 är den dokumenterad, så det är en begränsning du kan planera kring – ingen vision, inget ljud, ingen video, och katalogen säger det. För Fugu Max är modalitet helt enkelt inte publicerad. Det är värre än en begränsning, eftersom du inte kan veta om en pipeline som skickar en PDF kommer att fungera förrän du provar. En outtalad begränsning är inte samma sak som en frånvarande.
Vad händer med var och en när de underliggande modellerna ändras? GLM-5.3 är en modell i en version, tränad och driftad av Z.ai. Om Z.ai ändrar sin prissättning slår ändringen igenom på din nyckel samma dag via OrcaRouter med 0 % påslag, och du kan se den och reagera. Fugu Maxs beteende är en funktion av en pool vars medlemmar Sakana inte avslöjar, så en utfasning eller prisändring från ett frontlinjelabb förändrar tyst vad du köper utan att produktnamnet ändras. Sakana presenterar detta som motståndskraft. Det är motståndskraft för leverantören och ogenomskinlighet för köparen.

Var routingbeslut faktiskt fattas
Båda dessa är i praktiken routingbeslut – Fugu Max fattar dem inuti en ogenomtränglig koordinator, och du fattar dem på API-nivån. OrcaRouter är den andra sorten: ett API för över 200 modeller med en routing-DSL som låter dig uttrycka policyn explicit, automatisk failover när en leverantörsväg försämras, och modellfusion när du vill kombinera utdata medvetet i stället för att lita på en svart låda att göra det. GLM-5.3 finns i den katalogen till Z.ai:s listpris med 0 % påslag, vilket är värt mer än vanligt för en modell med så här mycket trafik bakom sig: priset du ser är priset som Z.ai publicerar, vidarebefordrat oförändrat.
Den praktiska skillnaden är granskningsbarhet. När Fugu Max väljer en modell för din begäran får du inte veta något om vilken det var eller varför. När du själv skriver routningspolicyn finns beslutet i ditt kodförråd, granskningsbart av den som granskar din kod, och kan ändras utan att vänta på en leverantör. För team som omfattas av någon form av krav på regelefterlevnad eller kostnadsredovisning är det inte en filosofisk skillnad.
Domen
GLM-5.3 vinner den här jämförelsen på de punkter som betyder mest för ett produktionsteam: det är billigare på input och output, dess kontextfönster och utdatatak är offentliggjorda, dess modalitetsgränser är angivna, det har verktygsanvändning, JSON-läge och resonemang som dokumenterade kapaciteter, det kommer från en härstamning med öppna vikter, och det har en sjudagars trafikvolym som närmar sig åtta miljarder tokens. Det finns ingen tolkning av den offentliga bevisningen enligt vilken Fugu Max är det bättre underbyggda köpet vid den här prisnivån.
Fugu Max håller fast vid ett argument, och det är ett riktigt sådant: för uppgifter där en koordinators andra pass fångar ett misstag som det första passet skulle ha skickat iväg, kan kostnaden per slutförd uppgift slå kostnaden per token. Det är värt en avgränsad pilot om ditt arbete är kontrollerbart, högvolymigt och du befinner dig utanför EU/EES – med ett i förväg satt tak för utdata-token och en mätning av antalet token per slutförd uppgift. Annars är svaret den enskilda modellen som kostar en tredjedel mindre och har kört under produktionslast i en månad, och den finns på OrcaRouter till Z.ai:s listpris med leverantörens avgift vidarefakturerad.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
