
Fugu Ultra v2 vs GLM 5.2: Du betalar för samordning, inte parametrar
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Lägg de två prislistorna sida vid sida och jämförelsen ser ut som ett misstag. Fugu Ultra v2, som Sakana AI tillkännagav den 11 september 2026, tar 5 dollar per miljon indatatokener och 30 dollar per miljon utdatatokener. GLM 5.2, Z.ai:s flaggskepp från den 16 juni 2026, tar 1,40 dollar och 4,40 dollar. Båda uppger ett kontextfönster i miljontokensklassen. Båda riktar sig till exakt samma köpare – teamet som kör långa, flerstegs, agentiska arbeten i repositoriskala. Den ena är ungefär 3,6× indatapriset och 6,8× utdatapriset för den andra, och den billigare är den du kan ladda ner och behålla. Så hela jämförelsen kokar ner till en enda fråga: vad köper de extra pengarna egentligen, och köper de något som en enda modell inte kan vara?
De är inte samma typ av objekt
Anledningen till att prisskillnaden finns är att dessa två saker löser uppgifter med lång tidshorisont med helt olika maskineri, och skillnaden visar sig innan du ens kör ett benchmark.
• Fugu Ultra v2 — ett orkestreringssystem, inte en basmodell. Det är den kapacitetsmaximerande nivån i Sakana AI:s Fugu-serie: en enda OpenAI-kompatibel slutpunkt som delar upp en inkommande uppgift och skickar ut delarna till en pool av andra modeller, vissa med öppna vikter och vissa specialiserade. Sakanas egen formulering är att den "pressar topprestandan högre än någonsin tidigare, utan det oumbärliga beroendet av de frontier-modeller som den orkestrerar." Du köper en schemaläggare, och du betalar för varje token som schemaläggaren spenderar på att tänka, inklusive de interna orkestreringstokens.
• GLM 5.2 – en enda Mixture-of-Experts-modell. Z.ai publicerar den som en text-in/text-ut-modell med ett "verkligen användbart" kontextfönster på 1 miljon token och upp till 128 000 utdatatoken, hybridresonemang som styrs av reasoning_effort, och inbyggt verktygsanrop. Den rapporterade arkitekturen har ungefär 753 miljarder parametrar totalt med omkring 40 miljarder aktiva per token, även om Z.ai inte har bekräftat antalet aktiva för just 5.2 – betrakta den siffran som övertagen från GLM-5.1.
Det är vägskälet. En av dessa är en sak som du anropar; den andra är en sak som anropar saker.
Vad Fugu Ultra v2 inte skulle berätta för oss
Sakanas tillkännagivandesida är ovanligt öppenhjärtig om en sak och ovanligt tystlåten om en annan, och båda spelar roll för ett köpbeslut.
Det uppriktiga: företaget säger rakt ut att Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra inte ingår i Fugu Ultra v2:s modellpool, samtidigt som man hävdar att man slår dem i benchmarks. Den angivna motiveringen är motståndskraft – en utbytbar pool av öppna och specialiserade modeller som varken en leverantör eller en geopolitisk förändring kan återkalla, prissätta om eller stänga av. Träningscutoffen anges vara 20260828. Vad du än tycker om argumentet är det en reell arkitektonisk hållning, och det är det tydligaste skälet att välja Fugu Ultra v2 framför en stack som du själv har satt ihop.
Det outtalade: tillkännagivandet anger inte något kontextfönster, och det anger inte Fugu Ultra v2:s tokenprissättning på själva sidan. Listningar av modeller från tredje part anger fönstret till 1 M tokens och priserna till $5 / $0,50 cachade / $30, med en omprissättningsnivå för över ungefär 272K indatatokens som går över till omkring $10 / $1,00 / $45. Det är siffrorna som resten av den här artikeln använder, men de är listningar, inte leverantörsdokumentation – bekräfta dem mot Sakanas aktuella prislista innan du budgeterar utifrån dem.
Kostnadsfrågan som ingen svarar på per token
Prissättning per token är fel enhet för den här jämförelsen, och varje sida som för närvarande rankar för det gör samma fel. En orkestrators nota är inte storleken på din prompt multiplicerad med en taxa; den är storleken på din prompt, plus varje underanrop den beslutar sig för att göra, plus resonemangstoken från modellerna den hyr, allt med påslag enligt orkestratorns egen taxa.
Sakana erkänner detta direkt: orkestreringstokens som förbrukas internt debiteras som vanliga input- och output-tokens. Det innebär att det ärliga sättet att jämföra Fugu Ultra v2 med GLM 5.2 är kostnad per slutförd uppgift, och ingen av leverantörerna publicerar den siffran.
Några strukturella punkter som faktiskt gäller oavsett:
• Indatapris — Fugu Ultra v2 $5.00 / 1M mot GLM 5.2 $1.40 / 1M på OrcaRouter till Z.ai:s leverantörspris. Fugu kostar 3,6× så mycket innan den gör ett enda subanrop.
• Pris för utdata — Fugu Ultra v2 $30.00 / 1M mot GLM 5.2 $4.40 / 1M. Det här är siffran som svider, eftersom agenter avger en massa utdata, och en orkestrerare avger utdata som du inte bad om.
• Cachad inmatning — Fugu Ultra v2 listar $0.50 / 1M; GLM 5.2 cachar vid $0.26 / 1M, en rabatt på 81 % jämfört med dess egen inmatningstaxa. Upprepade agent-loopar över en stabil systemprompt är där GLM 5.2:s fördel växer sig starkast.
• Omprissättning för lång kontext — Fugu Ultra v2:s rapporterade nivå över ~272K input flyttar hela begäran till ungefär den dubbla input-taxan och 1,5× output-taxan. GLM 5.2 har ingen kontextnivåindelning alls: $1,40 / $4,40 platt, hela vägen upp till 1M.
Den där sista raden är den som ska ringas in. En agentkörning med lång horisont tillbringar större delen av sin livstid bortom 272K tokens. GLM 5.2:s fasta taxa är värd riktiga pengar precis där Fugu Ultra v2:s fördubblas.

Benchmarkarna berör knappt
Här är det verkligt märkliga med den här jämförelsen, och det som ingen aktuell rangordningssida säger rakt ut: dessa två modeller mäts nästan aldrig i samma test.
Sakana rapporterar att Fugu Ultra v2 är bäst eller delat bäst i fem av åtta benchmarks – GDP.pdf, Chartography, SWEFish, DeepSWE och Toolathon – och bland de två bästa i sju av åtta. De två huvudresultat som anges är Chartography på 48,3, mot Opus 5 på 27,3 och Fable 5 på 29,5, samt DeepSWE på 74,3. SWEFish och Toolathon är Sakanas egna interna benchmarks. Allt är rapporterat av leverantören och inget av det har oberoende reproducerats vid tidpunkten för publiceringen.
Z.ai:s siffror för GLM 5.2 kommer från en helt annan hylla: Terminal-Bench 2.1 på 81,0, SWE-bench Pro på 62,1, GPQA-Diamond på 91,2, AIME 2026 på 99,2, HLE på 40,5 – också rapporterade av leverantören. På oberoende håll har GLM 5.2 ett AA Coding Index på 68,8 och ett Intelligence Index på 39 på Artificial Analysis sida med omräknade poäng, där den flaggas som en preliminär uppskattning, rankad som #7 av 113. Äldre citeringar av 51 eller 53 för GLM 5.2 kommer från en ersatt indexskala och bör inte citeras.
Så om du vill ha en ren siffra för en direkt jämförelse finns det ingen. Det som ligger närmast en gemensam axel är att båda är starka inom agentisk kodning, och den ärliga tolkningen är att varje företag har publicerat resultat för de tester där man är bra. Det är ett skäl att göra en egen utvärdering, inte att välja den högre siffran.
En sak värd att lyfta för alla som ska köpa GLM 5.2 idag: det är inte längre Z.ai:s nyaste modell. GLM-5.3 kom runt den 14 augusti 2026 till samma listpris, men under en anpassad licens som begränsar stora molnleverantörer – vilket gör GLM 5.2 till det sista helt MIT-licensierade Z.ai-flaggskeppet, och anledningen till att det fortfarande har ett tydligt köpargument.

Licensen är den skarpaste skiljelinjen.
Bortser man från riktmärkena är den strukturella skillnaden skarpare än någon poäng.
GLM 5.2 släpps som öppna vikter under MIT på Hugging Face, utan regionala begränsningar. Du kan ladda ner den, köra den på din egen hårdvara, finjustera den och leverera den i en produkt utan att be någon om tillstånd eller betala någon kostnad per token alls. Z.ai tränade den – anmärkningsvärt nog, enligt företagets eget påstående, helt och hållet på Huawei Ascend-acceleratorer i stället för Nvidia.
Fugu Ultra v2 ger dig inget av det. Det är en hostad tjänst: en orkestreringspolicy över en pool av modeller vars sammansättning Sakana bara har beskrivit i utkanterna. Du kan inte ladda ner den, inspektera den, låsa den till en version eller köra den i ett luftslutet nätverk. Det du får i stället är abstraktionen — en enda slutpunkt vars beteende i princip är motståndskraftigt mot att vilken enskild uppströmsmodell som helst försvinner. Det är en genuin fördel för ett produktionssystem som inte har råd med att ett beroende försvinner. Det är också en genuin kostnad, eftersom du har bytt bort kontrollen för att få den.
Om ditt villkor är ”modellen får inte förändras under mig”, är det bara ett av dessa svar som uppfyller det. Om ditt villkor är ”modellen får inte kunna tas bort av någon annan”, är det bara det andra som gör det.
Snabbhet, och vad testarna sa om den senaste
GLM 5.2 är mätbart inte snabb: Artificial Analysis uppmätte ungefär 66,3 tokens per sekund med en tid-till-första-token på omkring 4,03 sekunder, vilket är blygsamt för en modell i frontier-klass, och Z.ai:s egna användare har klagat på stockning i betjäningen under högtrafik.
Sakana publicerar inga siffror på latens eller genomströmning för Fugu Ultra v2, vilket i sig är informativt – ett system som dirigerar anrop till flera modeller har en latensprofil som helt beror på vad det väljer att anropa, så en enda genomströmningssiffra skulle vara närmast meningslös. För den tidigare Fugu Ultra rapporterade testare offentligt om körningar som sträckte sig till omkring 30 minuter och kostnader långt över en enskild modells taxa för samma jobb. Det är modellen från juni 2026 och inte bevis om v2 – men det är felmoden att testa för, och anledningen till att en jämförelse per token smickrar orkestratorer.

Hur du faktiskt skulle kalla var och en av dessa
GLM 5.2 finns på OrcaRouter idag till Z.ai:s egna leverantörspriser – 1,40 USD per miljon input och 4,40 USD per miljon output, vidarebefordrat utan påslag, så varje sänkning Z.ai gör landar här samma dag. Det är OpenAI-kompatibelt, så att byta till det är en ändring av bas-URL och modell-ID i SDK:t du redan har, och du kan sätta det bakom en failover-kedja eller en routingregel i stället för att satsa en produktionsväg på en enda leverantör.
Fugu Ultra v2 är inte något vi routar. Det är tillgängligt från Sakana AI:s eget OpenAI-kompatibla API, och en enda parameterändring flyttar en befintlig Fugu-integration till det. Om du utvärderar det mot GLM 5.2 är det praktiska upplägget att behålla GLM 5.2 på din befintliga gateway och anropa Fugu Ultra v2 direkt från Sakana medan du bestämmer dig — de två är båda OpenAI-kompatibla, så de kan ligga i samma kodväg bakom en flagga.
Vilken ska man välja?
Välj GLM 5.2 om du vill ha en känd kvantitet till ett känt pris: MIT-licensierade vikter som du skulle kunna hosta själv imorgon, ett fast pris på $1,40 / $4,40 utan straffavgift för lång kontext, ett genuint användbart 1M-fönster och en rabatt som ackumuleras på cachade agent-loopar. Acceptera att det är enbart text, att det är en generation bakom GLM-5.3, och att dess oberoende indexpoäng är preliminär.
Välj Fugu Ultra v2 om det du köper är motståndskraft plus högsta kapacitet vid svårt arbete i flera steg, och du är villig att betala för koordinering per token och att avstå från möjligheten att inspektera eller självhosta det du anropar. Leverantörens eget påstående är att den når frontier-nivå på utdata utan att bero på frontier-modeller — ett verkligt och ovanligt påstående, och ett som i dag precis ingen utanför Sakana har kunnat verifiera.
Vad vi inte skulle göra är att välja mellan dem utifrån benchmarktabellen. Testerna överlappar knappt, båda leverantörerna publicerade på sitt eget starkaste område, och den avgörande siffran – kostnad per slutförd uppgift med lång tidshorisont – är den som inget av företagen har satt på en sida.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
