
Fugu Max vs Gemini 3.1 Pro: samma indatapris, halva utdatapriset och en pool som ingen kan se
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Max och Gemini 3.1 Pro tar lika mycket för att bli ställda en fråga. Båda har ett listpris på $2.00 per miljon indatatoken. De går skilda vägar på vägen ut: Sakana AI:s Fugu Max skriver för $6.00 per miljon utdatatoken, och Google's Gemini 3.1 Pro skriver för $12.00. Sakana lanserade Fugu Max den 11 september 2026 som en koordinator som dirigerar varje uppgift till den billigaste tillräckliga modellen i en pool som den inte avslöjar. Gemini 3.1 Pro är en namngiven modell – anropbar via ID, versionshanterad, multimodal – vilket är precis det som en orkestrator är utformad för att inte vara. Så den intressanta frågan här är inte vilken av dem som är bättre på $2.00 input. Det är huruvida en jämförelse mellan en koordinator och en modell ens har rätt form, med tanke på att Sakanas tidigare Fugu-generation enligt uppgift räknade Gemini 3.1 Pro bland de modeller som den routade till.
Poolfrågan, precist formulerad
När den första Fugu Ultra lanserades i juni 2026 beskrev rapporteringen om dess arkitektur en pool som inkluderade Gemini 3.1 Pro tillsammans med modeller från andra frontier-laboratorier. Sakana har inte offentliggjort vilka modeller som ingår i Fugu Max-poolen. I releaseinformationen sägs att poolen utökades till att omfatta ett aldrig tidigare skådat antal modeller med öppna vikter och specialiserade modeller, och nämner NVIDIA Nemotron-familjen genom ett samarbete med NVIDIA – och där slutar den. Det står inte heller att Gemini 3.1 Pro togs bort.
Det lämnar två möjligheter och inget offentligt sätt att välja mellan dem. Om Gemini 3.1 Pro ingår i Fugu Max-poolen, är den här matchen delvis en "versus" och delvis en "through" — ett Fugu Max-svar på en svår resonemangsuppgift kan vara ett Gemini-svar som en koordinator valde ut, kontrollerade och skrev om, och i så fall köper outputpriset på $6.00 Geminis resonemang plus orkestreringsoverhead till rabatt jämfört med att anropa Gemini direkt. Om det inte ingår i poolen är de två produkterna genuint olika instrument och prisskillnaden återspeglar olika underliggande förmåga.
Ingenting i utgåvan avgör detta. Den som säger till dig vilken det är har slutit sig till det snarare än läst det. Vad som med säkerhet kan sägas är snävare och ändå användbart: en orkestrators publicerade poäng tillhör poolen, inte koordinatorn, och en pool vars medlemmar inte är offentliggjorda gör dessa poäng omöjliga att tillskriva.
• Indatapris — Fugu Max $2.00 per 1 miljon tokens jämfört med Gemini 3.1 Pro $2.00 per 1 miljon tokens
• Pris för utdata — Fugu Max $6.00 per 1 miljon tokens jämfört med Gemini 3.1 Pro $12.00 per 1 miljon tokens
• Cachad indata — Fugu Max $0,25 per 1 miljon tokens vs Gemini 3.1 Pro-cachning som erbjuds med rabatt på baspriset för indata
• Kontext — Fugu Max inte publicerad vs Gemini 3.1 Pro 1M tokens
• Utdatatak — Fugu Max inte publicerad vs Gemini 3.1 Pro 65K tokens
• Indatamodalitet — Fugu Max inte publicerad vs Gemini 3.1 Pro ljud, fil, bild, text och video
• Utdatamodalitet — Fugu Max inte publicerad vs Gemini 3.1 Pro text, med en separat bildgenereringslinje i 3.1-familjen
• Benchmark-siffror — Fugu Max sex segrar hävdas utan poängsiffror mot Gemini 3.1 Pro:s Google-rapporterade ARC-AGI-2 77,1 %, GPQA Diamond 94,3 %, SWE-bench Verified 80,6 %, BrowseComp 85,9 %
Vad en modell kan lova som en koordinator inte kan
Den enskilt största praktiska skillnaden i den listan är inte priset för utdata. Det är modalitetsraden. Gemini 3.1 Pro tar emot ljud, video och bilder som indata och dokumenteras som sådant, vilket gör den användbar för arbete som inte har något med text att göra – att läsa en skärminspelning, transkribera och resonera kring ett samtal, tolka ett skannat formulär. Fugu Max publicerar ingen modalitetsspecifikation alls. Den kan mycket väl hantera några av dessa indata, beroende på vad dess pool innehåller och huruvida koordinatorn vidarebefordrar multimodalt innehåll eller först plattar ut det till text. Ingen utanför Sakana vet, och det är en annan sorts osäkerhet än "vi har inte benchmarkat det ännu". Det innebär att du inte kan avgöra lämpligheten för en multimodal arbetsbelastning utifrån dokumentationen; du måste testa den.
Det finns en andra asymmetri i utdatataket. Gemini 3.1 Pro dokumenterar maximalt 65K utdatatoken. Fugu Max dokumenterar ingenting. För en koordinator är det effektiva taket minimivärdet bland de modeller den dirigerar till, så siffran är verkligen svårare att ange – men ett system med ett oangivet tak är besvärligt att planera kring om din applikation genererar långa artefakter.

Att läsa benchmark-raderna ärligt
Sakana nämner sex benchmarks där Fugu Max uppnår "bästa övergripande resultat": Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench och SWEFish. Inga siffror åtföljer påståendet, och SWEFish är Sakanas eget interna kodningsbenchmark. Google publicerar samtidigt verkliga siffror för Gemini 3.1 Pro, inklusive 77,1 % på ARC-AGI-2, 94,3 % på GPQA Diamond, 80,6 % på SWE-bench Verified och 85,9 % på BrowseComp.
Se upp för en nära-miss. Google rapporterar 68,5 % för Terminal-Bench 2.0. Sakana hävdar att de har det bästa totalresultatet på Terminal Bench 2.1. De är angränsande versionsnummer på ett benchmark som förändras mellan dem, vilket innebär att de två resultaten inte kan ställas sida vid sida ens i princip. En läsare som skummar rubriker skulle se ”båda gör anspråk på tätpositionen i Terminal Bench” och dra slutsatsen att de är jämförbara. Det är de inte.
GPQA är det jämnare fallet — Sakana listar GPQAD som en av sina sex segrar; Google rapporterar GPQA Diamond 94,3 %. Samma underliggande utvärderingsfamilj, båda rapporterade av leverantören, och bara en ger dig en siffra. Om Sakanas GPQAD-resultat hade publicerats skulle detta vara den enda raden där en genuin jämförelse var möjlig. Det är inte publicerat, så raden läses som ett påstående mot en siffra.
Ingen oberoende part har utvärderat Fugu Max, och det finns ingen Artificial Analysis-post för den eller någon Fugu-modell. Gemini 3.1 Pro har däremot varit i offentlig cirkulation tillräckligt länge för att förekomma i tredjepartsrankningar och utvärderingsrapporter – vilket är vad "månader av oberoende granskning" ger dig jämfört med en lansering samma vecka.
Anledningen till att detta spelar större roll än vanligt för just den här specifika jämförelsen är att Fugu Max:s egen arkitektur gör dess poäng svårare att tolka. Gemini 3.1 Pro:s 94,3 % på GPQA Diamond är ett faktum om en modell i en version. En Fugu Max-poäng på samma test skulle vara ett faktum om en routingpolicy, en pool vars medlemskap inte är avslöjat, och en koordinator som tränats att välja bland dem. Ändra vilken som helst av dessa, och siffran förändras utan att produktnamnet ändras. Gemini 3.1 Pro:s poäng har en fast referent. Fugu Max:s skulle inte ha det.
Att ringa dem, och vilka routingändringar
Gemini 3.1 Pro finns på OrcaRouter under modell-ID:t google/gemini-3.1-pro-preview, till Googles listpris med 0 % påslag – leverantörens pris förs vidare oförändrat, så en prisändring från Google slår igenom på din befintliga nyckel samma dag i stället för vid förnyelsen. Den finns sida vid sida med över 200 andra modeller bakom en enda API-nyckel, vilket spelar roll här av en specifik anledning: om du vill ta reda på om Fugu Max utpris på $6.00 faktiskt är bättre för din arbetsbelastning, är det renodlade experimentet att köra båda mot samma uppsättning uppgifter, och Fugu Max finns inte i vår katalog. Den nås via Sakanas egen OpenAI-kompatibla API och flera tredjepartsplattformar. Att köra sitt eget A/B-test innebär två integrationer, två fakturor och två uppsättningar autentiseringsuppgifter.
Automatisk failover är den andra pusselbiten som är värd att nämna. Gemini 3.1 Pro körs via flera leverantörsvägar genom routern, och om en av dem är hastighetsbegränsad eller försämrad flyttas trafiken utan kodändring. Det är en partiell, praktisk version av den resiliens Sakana säljer som hela premissen för orkestrering – du får den på transportlagret snarare än på resonemangslagret, och du får den för en modell vars beteende du kan låsa fast.

Hur man väljer mellan dem
Välj Gemini 3.1 Pro om ditt arbete involverar indata som inte är text, om du behöver ett dokumenterat utdatatak, om du vill ha en modell vars benchmark-siffror kan kontrolleras mot andras resultat, eller om du helt enkelt behöver en komponent som du kan låsa till en version och resonera kring. Med ett indatapris på $2.00 kostar det inget att prova, och 65K utdata räcker för de flesta genereringsuppgifter. Dess publicerade siffror placerar den bland de starkare allmänna modellerna som finns, och dess multimodala indatauppsättning är inte något som ett orkestreringslager kan ersätta.
Välj Fugu Max om ditt arbete är texttungt, verifierbart och högvolymigt, och om du bryr dig om mediankostnaden för en slutförd uppgift snarare än taket för ett enskilt anrop. Utmatningspriset på 6,00 $ är hälften av Gemini 3.1 Pros, och cachepriset på 0,25 $ är den mest aggressiva siffran i någon av prislistorna. Kör det på problem där ett felaktigt svar kan upptäckas, sätt en budget för utmatningstoken innan du börjar och mät token per slutförd uppgift. Välj det inte för en multimodal pipeline med hänvisning till utgivningssidan, eftersom utgivningssidan inte talar om huruvida den accepterar bilder.
Beslutet
Gemini 3.1 Pro är det säkrare och bättre dokumenterade valet: identiskt indatapris, ett publicerat kontextfönster, ett angivet utdatatak på 65K, dokumenterad multimodal indata och leverantörsbenchmarks som tredje parter har haft möjlighet att granska. Dess utdatahastighet är dubbelt så hög som Fugu Max, och det är hela argumentet för den andra sidan.
Fugu Max är det billigare sättet att generera text och det mer ogenomskinliga sättet att göra allt annat. Dess sex benchmarkvinster åtföljs inte av några siffror, dess kontextfönster och modalitetsstöd är opublicerade, och sammansättningen av den pool som producerar dess resultat är inte offentliggjord – vilket innebär att du inte kan utesluta att du betalar 6,00 dollar för en rabatterad version av det resonemang du skulle kunna köpa från Gemini 3.1 Pro direkt för 2,00 dollar i input hos OrcaRouter med leverantörens listpris vidarebefordrat och 0 % påslag ovanpå.

