
Fugu Ultra v2 vs Qwen3.8-Max: varför prislappen är fel siffra
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 kostar 30,00 USD per miljon utdatatokens. Qwen3.8-Max kostar 6,00 USD. Det är en skillnad på fem mot ett, och om du väljer mellan dessa två agentiska system utifrån den kvoten kommer du att välja fel – eftersom ingen av dem faktiskt debiteras på det sätt som deras prislista antyder. Enligt Artificial Analysiss egen mätning genererade Qwen3.8-Max 180 miljoner utdatatokens för att slutföra Intelligence Index, mer än dubbelt så många som medianmodellens 89 miljoner, till en kostnad av 2,67 USD per uppgift. Det är en sparsam modell räknat i tokens och en slösaktig sådan räknat i svar. Sakana AIs Fugu Ultra v2, som lanserades den 11 september 2026, har motsatt form: en ej avslöjad pool av modeller från andra labb som den startar och koordinerar per begäran, debiterad till en enda blandad taxa som Sakana säger inte multipliceras när agenter läggs till. Den ena är en enda modell med 2,4 biljoner parametrar som tänker högt under lång tid. Den andra är en liten koordinator som hyr in hjälp. Att jämföra deras tokenpriser säger dig nästan ingenting om vilken som är billigare att köra.
Två motsatta sätt att vara dyr
Börja med mekanismen, eftersom den förklarar alla andra skillnader i den här jämförelsen.
Qwen3.8-Max är en gles mixture-of-experts-modell – 2,4 biljoner parametrar totalt, ungefär 95 miljarder aktiva per token – som når resultat i gränslandet till frontlinjen genom att arbeta längre snarare än genom att vara större. Artificial Analysis mätte den till 37,8 utdata-tokens per sekund, vilket placerar den på #154 av 200 modeller i hastighet, med 180 miljoner utdata-tokens genererade över Intelligence Index (#70 av 200 i verbositet). Dess kostnad per uppgift i Intelligence Index uppgår till $2,67, och dess cacherabatt är ovanligt djup på 88%, vilket är hävstången som faktiskt styr räkningen här: en lång agentkörning som fortsätter att läsa om samma kontext är billig, och en som fortsätter att generera ny text är det inte.
Fugu Ultra v2 närmar sig samma problem från andra hållet. Det är en orkestrerare – en liten tränad koordinator, rapporterad kring 7 miljarder parametrar, som läser en begäran, sätter samman ett agentteam utifrån rollerna Thinker, Worker och Verifier från Sakanas TRINITY-arbete och sedan syntetiserar ett svar. Dess tokennota är summan av vad dess underagenter producerar plus koordinatorns egen syntestext. Sakana förbinder sig i sin prissättnings-FAQ att du debiteras en blandad taxa knuten till den högsta modellnivån som är inblandad och att att lägga till agenter inte multiplicerar notan, vilket tar bort den klassiska multi-agent-explosionen där utskalning multiplicerar kostnaden. Det som inte tas bort är volymen. Vid $30.00 per miljon utdatatokens är talet som spelar roll hur många agenter som körde och hur mycket de skrev, och det är ett tal som varken du eller Sakana kan förutsäga från prissättningssidan.
Det är den ärliga beskrivningen av prisgapet: det är en sats, inte en totalsumma. En fem gånger högre sats som tillämpas på en arbetsbelastning vars utdatavolym du inte kan förutse är inte fem gånger kostnaden — det är en obegränsad multipel med ett förutsägbart golv.

Specifikationsbladet, och den enda raden som avgör saken
• Pris — Fugu Ultra v2 $5.00 in / $30.00 ut per 1 miljon tokens jämfört med Qwen3.8-Max $2.00 in / $6.00 ut
• Cachad indata — Fugu Ultra v2 0,50 USD per 1 miljon jämfört med Qwen3.8-Max 0,25 USD per 1 miljon läsningar, och en cacherabatt på 88 % uppmätt av Artificial Analysis
• Tillägg för lång kontext — Fugu Ultra v2:s indata fördubblas till $10.00 och utdata till $45.00 över 272K tokens, jämfört med Qwen3.8-Max som inte har något tillägg för långa prompter och är platt ända till fönstret
• Kontextfönster — Fugu Ultra v2 1M tokens vs Qwen3.8-Max 1M tokens
• Utdatatak — Fugu Ultra v2 publiceras inte som en enskild siffra, jämfört med Qwen3.8-Max på cirka 128K tokens
• Indatatyp — Fugu Ultra v2 text, med poolens egna förmågor bakom sig, mot Qwen3.8-Max text, bild, video och PDF
• Vikter — Fugu Ultra v2 stängda, poolmedlemskap ej avslöjat avsiktligt, kontra Qwen3.8-Max öppna vikter publicerade för Max-klassens checkpoint under en anpassad licens
• Regional tillgänglighet — Fugu Ultra v2 säljs inte i EU/EES, medan Qwen3.8-Max är tillgänglig utan regional begränsning
• Oberoende utvärdering — Fugu Ultra v2 inga publicerade, och ingen Artificial Analysis-sida finns för någon Fugu-modell jämfört med Qwen3.8-Max en aktuell Artificial Analysis-post med publicerade siffror för hastighet, ordrikedom och kostnad per uppgift
Läs de två sista raderna tillsammans och jämförelsen skärps. Qwen3.8-Max är en modell som du kan versionslåsa, läsa licensen för, ladda ned en checkpoint av och stämma av mot en tredje parts resultattavla. Fugu Ultra v2 är ett system som du inte kan granska, inte kan självhosta, inte kan köpa i Europa och inte kan verifiera mot någon utanför Sakana. 272K-tilläggsavgiften förvärrar det: över den tröskeln fördubblas Fugu Ultra v2:s inputtaxa och dess outputtaxa ökar med hälften, medan taxan för Qwen3.8-Max inte rör sig. För det långsiktiga dokument- och repositoryarbetet som båda systemen är byggda för är det lägre rubrikpriset också det plattare.
Siffran för Qwen3.8-Max som alla citerar är föråldrad
Om du har läst om den här modellen någonstans under de senaste två veckorna har du förmodligen sett ett Artificial Analysis Intelligence Index på 58, eller 58,1, eller 58,4. De siffrorna var verkliga och de är inte längre aktuella. Artificial Analysis omkalibrerade sitt index till v4.3 den 7 september 2026, vilket komprimerade poängen överlag, och live-sidan för Qwen3.8-Max visar nu 40, vilket placerar den på #30 av 200 modeller – med märket "Updated" som markerar en omräknad poäng. De äldre texterna innehöll också ansträngningsskatten mätt på den tidigare skalan: 64 turer per uppgift mot 14 för den tidigare Qwen-generationen, och ungefär 1,14 USD per uppgift i Intelligence Index. Den aktuella sidan visar 2,67 USD per uppgift, 37,8 utdatatokens per sekund och 180 miljoner utdatatokens i indexet.
Två saker följer. För det första ligger Qwen3.8-Max på den omkalibrerade skalan i samma band som resten av frontierns andra skikt snarare än i nivå med det, och varje jämförelse du läser som rankar den mot Claude Opus 5 eller Kimi K3 på 58 jämför ögonblicksbilder från olika skalor. För det andra, och mer användbart för den här matchningen, är korrigeringen enkelriktad: Qwen3.8-Max har en siffra som kan vara fel och sedan rättas. Fugu Ultra v2 har ingen siffra. Varje Fugu-siffra i den här artikeln kommer från Sakanas egen utvärdering, och per den 11 september finns det ingen Artificial Analysis-sida för Fugu Ultra v2 eller någon annan Fugu-modell – URL:en ger 404. När en leverantör publicerar en resultattavla och ingen oberoende part har kört modellen, utgör resultattavlan hela dokumentationen.
Där de faktiskt överlappar, och där de inte gör det
Sakana rapporterar Fugu Ultra v2 som bäst eller delat bäst på fem av åtta benchmarks – GDP.pdf, Chartography, SWEFish, DeepSWE och Toolathon – och bland de två bästa på sju av åtta. De två konkreta siffrorna i releasen är Chartography på 48,3, mot 27,3 för Claude Opus 5 och 29,5 för Claude Fable 5 i samma tabell, och DeepSWE på 74,3. Alibabas egna publicerade rader för Qwen3.8-Max inkluderar Terminal-Bench 2.1 på 86,6, OSWorld-Verified på 86,1, GPQA Diamond på 92,6 och SWE-bench Pro på 67,7.
Lägg märke till vad de två listorna har gemensamt: ingenting. Inte en enda benchmark förekommer i båda leverantörstabellerna. Det finns ingen rad där du kan ställa en Sakana-siffra och en Alibaba-siffra sida vid sida och utläsa en vinnare, vilket innebär att det ärliga svaret på "vilken som är bättre på kodningsagenter" är att ingen publicerad evidens besvarar det. Det som finns är ett system med åtta leverantörsvalda rader och ingen extern verifiering, och ett system med leverantörsrader plus en oberoende post som mäter kostnad och hastighet snarare än förmåga i direkt jämförelse. Det är en lucka i evidensen, inte en lucka i modellerna, och det bör förändra hur du köper: du kan inte välja mellan dessa utifrån benchmarks, så välj utifrån de egenskaper du faktiskt kan verifiera.

Öppna vikter kontra en icke offentliggjord pool
Det är här det vanliga inlåsningsargumentet inverteras, och det är det mest intressanta med kombinationen.
Sakanas pitch för Fugu Ultra v2 är suveränitet. En utbytbar pool av öppna och specialiserade modeller innebär att ingen enskild leverantörs prissättningsbeslut, utfasningsschema eller policyändring kan slå ut din produkt, och lanseringen gör poängen explicit genom att notera att poolens sammansättning ändrades i v2. Företaget säger också rakt ut att Fugu Ultra v2:s poäng uppnåddes utan Claude Fable 5, Claude Fable 5.1 eller GPT-6 Astra i agentpoolen – och hävdar segrar över de tre starkaste tillgängliga modellerna samtidigt som det bekräftar att det inte anropar någon av dem. Vad poolen än innehåller är den inte marknadens topp enligt Sakanas egen redovisning.
Men hedgen har en kostnad som inte finns på prislistan. Du kan inte se poolen, du kan inte välja in eller ut en medlem i Ultra-nivån, du kan inte hosta någon del av den själv, och du kan inte köra den i EU/EES överhuvudtaget — Singapore-baserad orkestrering över andra labbs vikter är en annan riskprofil än att äga vikterna. Qwen3.8-Max vänder på det exakt. Det är en leverantörs modell och därmed utsatt för en leverantörs beslut, men Alibaba publicerade öppna vikter för Max-class Qwen3.8-2.4T-A95B-checkpointen under en anpassad licens, vilket innebär att utvägen är verklig snarare än retorisk: om prissättning eller villkor ändras kan modellen serveras från din egen infrastruktur. För ett team vars faktiska rädsla är att en leverantör drar undan mattan, är en nedladdningsbar checkpoint en starkare garanti än ett löfte om en pool du inte får inspektera.
Det finns en poäng av andra ordningen för alla som kör agenter över båda. Qwen3.8-Max finns i vår katalog till $2.00 in och $6.00 ut, vilket är Alibabas listpris med 0 % påslag som förs vidare — en leverantörsprisändring landar på samma nyckel samma dag, och automatisk failover täcker en hastighetsbegränsad eller försämrad leverantörsväg. Fugu Ultra v2 finns inte på OrcaRouter. Den nås via Sakanas eget OpenAI-kompatibla API och flera tredjepartsplattformar, och att byta från en tidigare Fugu är en parameterändring på en rad. En router är inte en ersättning för en koordinator, och en koordinator är inte en ersättning för förmågan att växla över; om du vill ha båda egenskaperna kör du två leverantörers system och bör budgetera för två räkningar.
Vilken du bör välja
Välj Qwen3.8-Max om du behöver en modell som du kan förutse, verifiera och undkomma. Dess utdatahastighet är en tredjedel av Fugu Ultra v2:s till listpris, den har ingen long-context-klippa, den tar emot bilder, video och PDF:er, medan Fugu-poolens modalitet är vad de underliggande agenterna råkar stödja, den publicerar en checkpoint som du kan falla tillbaka till, den säljs överallt, och den har en levande oberoende post som mäter det som faktiskt driver din räkning – 37,8 tokens per sekund och en siffra för kostnad per uppgift som du kan modellera innan du binder dig. Dess svagheter är lika specifika och värda att nämna: den är långsam, rankad #154 av 200 i hastighet, den är enormt mångordig med 180 miljoner tokens i indexet, och Artificial Analysis mätte separat att dess hallucinationsfrekvens ökade från 23 % till 40 % jämfört med föregående generation, vilket är en allvarlig oro för exakt det autonoma flerstegsarbete som den marknadsförs för. Budgetera för en verifierare och använd den djupa cacherabatten aggressivt.
Välj Fugu Ultra v2 om ditt arbete har lång horisont och är kontrollerbart, om din budget är utforskande snarare än produktionsinriktad och om du befinner dig utanför EU/EES. Det strukturella argumentet för en koordinator är verkligt, och leverantörens egna exempel pekar konsekvent på det – en automatiserad forskningskörning med 123 experiment över fjorton timmar på en enda H100, en Rubiks-kublösare i ren Python som slutförde alla 300 blandade kuber där två anonymiserade frontier-baslinjer kraschade totalt. Det är leverantörsvalda exempel med anonymiserade baslinjer, och de bevisar mindre än de verkar, men mönstret är sammanhängande: på uppgifter där korrektheten är kontrollerbar och det svåra är uthålligheten slår det att starta en verifierare att pressa en enda modell hårdare. Det du köper är den uthålligheten, till en kostnad som är fem gånger den för Qwen3.8-Max, i ett system vars kvalitet du inte kan granska och vars pool du inte kan låsa. Pilota det avgränsat, mät utdatatoken per slutförd uppgift i stället för per token, och sätt ett tak före första körningen.

Anledningen till att prislappen visar fel siffra är att båda dessa produkter har flyttat kostnaden för ett svar bort från kostnaden för en token. Fugu Ultra v2 gör det genom att sprida ut sig till modeller som den inte namnger. Qwen3.8-Max gör det genom att tänka i 180 miljoner tokens. Om du redan vet din tokenvolym per uppgift är räkningen trivial och du bör göra den. De flesta team känner inte till den siffran, och för dem kokar beslutet ner till något enklare: Qwen3.8-Max är valet du kan granska, prissätta och överge, och Fugu Ultra v2 är valet som satsar på att samordning slår förmåga. Båda går att försvara. Bara ett av dem kommer med bevisen.
