
Fugu Max vs Qwen3.8-Max: Samma pris, samma benchmark, ett publicerat nummer
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Max och Qwen3.8-Max ligger på samma pris: 2,00 USD per miljon indatatokens och 6,00 USD per miljon utdatatokens. Sakana AI släppte Fugu Max den 11 september 2026, och Alibaba har erbjudit Qwen3.8-Max sedan början av augusti, och de två leverantörerna hamnade på en identisk prislista från motsatta håll — den ena prissätter en routingpolicy, den andra prissätter en modell med 2,4 biljoner parametrar. Prislikheten tar bort priset från beslutet helt och hållet, vilket är ovanligt rent. Det som återstår är bevis, och där skiljer sig de två sidorna mer än någon annanstans. Båda leverantörernas tabeller namnger Terminal Bench 2.1. Alibaba anger 86,6 för Qwen3.8-Max. Sakana säger att Fugu Max tar hem bästa totalpoäng på Terminal Bench 2.1 och anger ingen siffra alls — varken för det testet eller de övriga fem som den uppges vinna.
Det enda riktmärket som båda sidor nämner
Det här är hela matchningen komprimerad till en enda rad, så det är värt att vara noggrann med den.
Sakanas release listar sex benchmarkar där Fugu Max tar bästa totala poäng: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench och SWEFish. Fem är erkända offentliga utvärderingar och den sjätte, SWEFish, är Sakanas egen kodningsbenchmark. För ingen av de sex anger releasen ett värde, en marginal eller en konkurrents siffra att ställa bredvid. Det parallella påståendet – att Fugu Max utvidgar Paretofronten för kostnad-prestanda på sju av tio benchmarkar – är likaså ett uttalande om position i ett diagram snarare än en punkt på en axel.
Alibabas publicerade resultatrader för Qwen3.8-Max inkluderar Terminal-Bench 2.1 på 86,6, OSWorld-Verified på 86,1, GPQA Diamond på 92,6 och SWE-bench Pro på 67,7. Allt leverantörsrapporterat, allt siffror. Så på det enda test som båda företagen valde att namnge har det ena publicerat en siffra och det andra publicerat en placering. Av det kan du inte sluta dig till vilket system som är bättre — Sakanas "bäst totalt" skulle kunna betyda 91 eller 87. Vad du kan sluta dig till är att det vid publiceringen inte finns några offentliga bevis som besvarar frågan, och att leverantören som gör det större påståendet är den som avstår från att kvantifiera det.
Identiska priser, motsatt konstruktion
• Indata – Fugu Max $2,00 per 1 miljon tokens vs Qwen3.8-Max $2,00 per 1 miljon tokens
• Utdata — Fugu Max $6,00 per 1 miljon tokens mot Qwen3.8-Max $6,00 per 1 miljon tokens
• Cachad indata — Fugu Max 0,25 USD per 1 miljon tokens jämfört med Qwen3.8-Max 0,25 USD per 1 miljon tokens, och Artificial Analysis mäter oberoende en cacherabatt på 88 procent på Qwen-sidan
• Tilläggsavgift för långa prompter – Fugu Max: ingen nivå anges i utgåvan, mot Qwen3.8-Max som är platt upp till fönstret utan tilläggsavgift
• Kontext och utdata — Fugu Max har inte publicerat någon av siffrorna, jämfört med Qwen3.8-Max: ett 1M-token-fönster med ett utdatatak på ungefär 128K
• Indatamodalitet — Fugu Max text, med poolens egna förmågor bakom sig, kontra Qwen3.8-Max text, bild, video och PDF
• Arkitektur — Fugu Max, en tränad koordinator över en icke offentliggjord pool, utökad för Max med öppna vikter och specialiserade modeller, inklusive NVIDIA Nemotron-familjen genom ett samarbete med NVIDIA, jämfört med Qwen3.8-Max, en gles mixture-of-experts-modell med cirka 2,4 biljoner parametrar totalt och omkring 95 miljarder aktiva per token
• Vikter — Fugu Max stängda, poolmedlemskap avsiktligt inte offentliggjort, mot Qwen3.8-Max öppna vikter publicerade för Max-klassens checkpoint under en anpassad licens
• Oberoende utvärdering — Fugu Max: ingen publicerad, och ingen Artificial Analysis-sida finns för någon Fugu-modell, jämfört med Qwen3.8-Max: en aktiv Artificial Analysis-post med publicerade siffror för hastighet, ordrikedom och kostnad per uppgift
Fyra av dessa rader lyder "inte publicerad" på Fugu-sidan och har en siffra på Qwen-sidan. När priserna är identiska är det hela jämförelsen: för samma pengar får du ett system du kan beskriva och ett du inte kan.

En kolumn har en tredje part bakom sig.
Artificial Analysis ger Qwen3.8-Max 40 poäng på det omräknade v4.3 Intelligence Index, rankad #30 av 200, med en kostnad på $2.67 per Intelligence Index-uppgift och 37,8 utdatatoken per sekund — tillräckligt långsamt för att rankas #154 av 200 i hastighet. Samma post registrerar 180 miljoner genererade utdatatoken över indexet, mer än dubbelt så många som medianmodellens 89 miljoner, och en cacherabatt på 88 procent.
Två rättelser gäller innan något av detta citeras. Den första är att den vitt spridda siffran 58 – eller 58,1, eller 58,4 – för Qwen3.8-Max är från innan Artificial Analysis omkalibrerade indexet i september 2026, och livesidan bär märket "Updated" som markerar en omräknad poäng. De äldre texterna hade också en annan ansträngningskostnad än den tidigare skalan, 64 turer per uppgift mot 14 för den föregående Qwen-generationen vid ungefär 1,14 USD per Intelligence Index-uppgift; den nuvarande sidan visar 2,67 USD. Den andra är en verklig varning snarare än en skalartefakt: Artificial Analysis mätte separat Qwen3.8-Maxs hallucineringsfrekvens stiga från 23 procent till 40 procent jämfört med den tidigare generationen. För en modell som marknadsförs för autonomt flerstegsarbete är det en kostnad man budgeterar för i verifierare, inte en fotnot.
Fugu Max har ingen oberoende post av något slag. Varje siffra som anges för den kommer från Sakana, och i skrivande stund finns ingen Artificial Analysis-sida för Fugu Max eller något av dess syskon. Det är inte en anklagelse – en modell som släpptes för några timmar sedan kommer inte att ha tredjepartstäckning – men det innebär att de två kolumnerna inte är lika kontrollerbara, och det kommer att förbli så tills någon utanför Sakana kör den.
Två sätt att överspendera
Båda dessa system har flyttat kostnaden för ett svar bort från kostnaden för en token, och de gör det i motsatta riktningar. Qwen3.8-Max är sparsam per token och frikostig per svar: 180 miljoner utdatatokens på Intelligence Index, dubbelt så många som medianen, till $2,67 per uppgift. Den arbetar länge i stället för att vara stor, och cacherabatten på 88 procent är spaken som styr räkningen — en lång agentkörning som ständigt läser om samma kontext förblir billig, en som ständigt genererar ny text gör det inte.
Fugu Max är dyrt per token och oförutsägbart i sina svar. Dess koordinator skapar subagenter, var och en skriver resonemang och utdatatext som faktureras med 6,00 USD per miljon, plus koordinatorns egen syntes. Sakana garanterar att multiagentkörningar debiteras en sammanvägd taxa knuten till den deltagande toppmodellen och att fler agenter inte multiplicerar fakturan, vilket undanröjer den värsta tänkbara fan-out-uppblåsningen som gör naiva multiagentsystem oöverkomliga. Det tar inte bort volymen. Och i volymfrågan är releasen tyst på ett sätt som spelar roll: Sakanas egen rapportering uppger att byte av modell mitt i en uppgift kan minska återanvändningen av kontextcache och generera extra orkestreringstokens, och bekräftar att företaget inte avslöjade Max cacheträfffrekvens eller den totala tokenkostnaden per uppgift för Max.
Så samma taxa på 2,00 $ / 6,00 $ är ett förutsägbart tal på ena sidan och en obegränsad multipel med en nedre gräns på den andra. Qwen3.8-Max mångordighet går att mäta innan du binder dig; Fugu Max mångordighet går inte.
Nödlucketestet
Det är här som det vanliga inlåsningsargumentet inverteras, och det är det mest användbara i parningen.
Sakanas argument för Fugu Max handlar om motståndskraft. En pool som spänner över öppna vikter och specialiserade modeller, utökad för Max med NVIDIA Nemotron-familjen, innebär att ingen enskild frontier-leverantörs utfasning, omprissättning eller regionala tillbakadragande kan slå ut din produkt — en verklig hedge, och en som företaget är tydligt med att sälja. Men hedgen går inte att verifiera utifrån. Du kan inte se poolen, inte välja in eller ut en medlem, inte självhosta någon del av den och inte köra den i EU/EEA överhuvudtaget. Ett löfte om en pool du inte får granska är en svagare garanti än det låter.
Qwen3.8-Max driver argumentet i motsatt riktning. Det är en leverantörs modell och därför utsatt för en leverantörs beslut – men Alibaba publicerade öppna vikter för Max-klassens Qwen3.8-2.4T-A95B-checkpoint under en anpassad licens, vilket innebär att nödutgången är verklig snarare än retorisk: om prissättning eller villkor ändras kan modellen köras från din egen infrastruktur. För ett team vars faktiska rädsla är att en leverantör drar undan mattan slår en nedladdningsbar checkpoint en beskrivning av en pool.
Att ringa någon av dem
Qwen3.8-Max finns i vår katalog för 2,00 USD in och 6,00 USD ut per miljon tokens, vilket är Alibabas listpris med 0 % påslag som förs vidare, så en leverantörsprisändring landar på samma nyckel samma dag i stället för enligt ett migreringsschema. Den är OpenAI-kompatibel på samma bas-URL som resten av katalogen, vilket innebär att du kan sätta den bakom en villkorlig routningsregel, en failover-kedja eller en modellfusionspanel utan ett andra avtal eller en kodändring – och automatisk failover täcker en hastighetsbegränsad eller försämrad leverantörsväg. Den flyttade 127,7 miljoner tokens genom gatewayen under de senaste sju dagarna.
Fugu Max finns inte på OrcaRouter. Det når dig via Sakanas egen OpenAI-kompatibla API och flera tredjepartsplattformar, och företaget säger att en befintlig Fugu-integration uppgraderas med en enradig parameterändring. Eftersom båda använder samma förfrågningsformat är det billigaste sättet att avgöra benchmark-gapet att sluta vänta på att Sakana publicerar det: kör båda bakom en enda flagga på din egen arbetsbelastning och räkna utdatatokens per slutförd uppgift. Det är mätningen som ingen av leverantörerna har tillhandahållit.

Vilken, och när?
Qwen3.8-Max är valet du kan granska, prissätta och överge. Med samma prislista ger den dig ett 1M-tokenfönster utan tilläggsavgift för långa prompter, bild-, video- och PDF-indata, en nedladdningsbar Max-klass-checkpoint, en aktuell oberoende post som mäter det som driver din kostnad, och 88 procents rabatt på cachad indata. Dess kostnader är lika specifika: den är långsam med 37,8 tokens per sekund, rankas nära botten av fältet när det gäller hastighet, den är enormt mångordig med 180 miljoner tokens i indexet, och dess uppmätta hallucinationsfrekvens var ungefär dubbelt så hög som den föregående generationens — vilket är ett allvarligt bekymmer för just det autonoma arbete den säljs för. Utnyttja cacharrabatten till fullo och budgetera för en verifierare.
Fugu Max är vadet om att samordning slår förmåga. Om ditt arbete är långsiktigt och kontrollerbart, och en koordinator som startar en verifierare slutför uppgifter som en enskild modell misslyckas med två gånger, då är orkestreringstokens billigare än återförsöken och den identiska prislistan är inte alls ett dött lopp. Det du köper är uthållighet, i ett system vars pool du inte kan låsa, vars kontextfönster inte är publicerat, och vars sex benchmarksegrar inte har några värden kopplade till sig — från en leverantör som valde att namnge testet och undanhålla siffran.
Båda produkterna kostar lika mycket per token. Bara en av dem berättar vad du får för det.

