Ett hero-titelkort för Fugu Ultra v2 vs Gemini 3.1 Pro med underrubriken 'Motståndaren som kanske redan finns inuti maskinen', pillerformade etiketter med texten '$30,00 vs $12,00 utdata', 'CharXiv 86,6 vs 80,2 riktad' och 'Ej offentliggjord pool', en sidfotsrad 'Sakana AI vs Google DeepMind - september 2026', och OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

Fugu Ultra v2 vs Gemini 3.1 Pro: motståndaren som kanske redan finns inuti maskinen

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns en version av jämförelsen mellan Fugu Ultra v2 och Gemini 3.1 Pro där Gemini vinner oavsett hur benchmarken går – eftersom den kan göra en del av arbetet. Sakana AI:s orkestreringssystem, som släpptes den 11 september 2026, avslöjar inte vilka modeller det koordinerar; den rapporterade poolen för juniversionen av Fugu Ultra inkluderade Gemini 3.1 Pro bland andra, och version 2.0 berättar bara vad den tog bort, och namnger Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra som uteslutna. Googles Gemini 3.1 Pro är en enda multimodal frontier-modell med en kontext på 1 M tokens som hanterar text, bilder, PDF:er, ljud och video, allmänt tillgänglig sedan maj 2026 för 2,00 USD per miljon input-tokens och 12,00 USD per miljon output-tokens. En av dessa är en modell du kan inspektera. Den andra är ett system vars benchmarksegrar kan gå via den första, och ingen av leverantörerna kommer att berätta för dig om så är fallet.

Vad varje system faktiskt är

Gemini 3.1 Pro är begriplig på ett sätt som har blivit sällsynt bland lanseringar i framkanten. Det är en sparse mixture-of-experts-transformer från Google DeepMind, som först släpptes i förhandsversion den 19 februari 2026, med en källa som daterar den allmänna tillgängligheten till maj 2026 — i vår egen förteckning finns den under förhandsversionens modell-ID. Den har ett indatafönster på 1M tokens och ett utdatatak på 65K tokens, tar emot text, bilder, PDF:er, ljud, video och kod, och erbjuder en trestegs resonemangsinställning — låg, medel eller hög — där hög är API-standard. Google rapporterar 77,1 % på ARC-AGI-2, mer än dubbelt så högt som föregående generations 31,1 %; 94,3 % på GPQA Diamond; 80,6 % på SWE-bench Verified; 68,5 % på Terminal-Bench 2.0; 85,9 % på BrowseComp; och 44,4 % på Humanity's Last Exam utan verktyg, vilket stiger till 51,4 % med sökning och kodexekvering. Det är siffror från leverantören. Dess kunskapsgräns är januari 2025, vilket är värt att notera om ditt arbete är beroende av aktuella händelser.

Fugu Ultra v2 är en koordinator. Det är en tränad modell som enligt uppgift har omkring 7B parametrar och som läser en begäran, sätter samman ett agentteam med rollerna Thinker, Worker och Verifier hämtade från Sakanas TRINITY-forskning, och syntetiserar ett svar bakom en OpenAI-kompatibel endpoint. Den har ingen egen publicerad modalitetslista – allt den kan se, ser den eftersom en modell i dess pool kan se det. Dess kontext är 1M tokens med en brant prisklippa vid 272K, där priserna fördubblas till $10 för indata och $45 för utdata. Dess utdatatak är inte publicerat. Dess pool är inte offentliggjord, dess routningsbeslut "exponeras inte avsiktligt", och för Ultra-nivån är poolen fast, så du kan inte utesluta en leverantör.

Den asymmetrin är hela matchningen. Gem​ini 3.1 Pro är en komponent som du kan köpa direkt och resonera kring. Fugu Ultra v2 är en sammansättning vars delar du inte kan se och vars starkaste benchmark-påståenden till viss del kan vara Gem​inis egna resultat kombinerade med någon annans.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Jämförelsen där de två överlappar

Väldigt lite av den publicerade bevisningen ställer upp de två systemen på samma rad. Siffrorna nedan för Gem​ini 3.1 Pro är Goo​gles egna; Fugu Ultra v2:s är Sakanas egna; där en tredjepartsaggregator har publicerat en gemensam rad är den markerad och åtföljs av ett förbehåll om att den är vägledande snarare än avgörande.

• Multimodalt resonemang (CharXiv, delad rad) — Fugu Ultra v2 86,6 % vs Gemini 3.1 Pro 80,2 %, enligt BenchLM, som betecknar kategorin som riktningsgivande och avstår från att utse en vinnare

• TerminalBench 2.1 — ingen siffra för Fugu Ultra v2 v2.0 mot Gem​ini 3.1 Pro, ingen jämförbar publicerad siffra; Fugu Ultra från juni rapporterade 82,1 % mot Gem​ini 3.1 Pro:s 70,3 % i tredjepartsaggregering

• SWE-Bench Pro — ingen siffra för Fugu Ultra v2 v2.0 kontra Gemini 3.1 Pro, ingen jämförbar publicerad siffra; Fugu Ultra från juni rapporterade 73,7 % mot Gemini 3.1 Pro:s 54,2 %.

• ARC-AGI-2 — ingen siffra för Fugu Ultra v2 jämfört med Gem​ini 3.1 Pro 77,1 %, enligt leverantören

• Humanity's Last Exam — inget resultat för Fugu Ultra v2 v2.0 jämfört med Gemini 3.1 Pro: 44,4 % utan verktyg, 51,4 % med, enligt leverantören

• Modalitetstäckning — Fugu Ultra v2 ärver vad dess pool stöder, ej offentliggjort jämfört med Gem​ini 3.1 Pro:s text, bild, PDF, ljud, video och kod, dokumenterade

• Pris för in-/utdata — Fugu Ultra v2 $5.00 / $30.00 per 1M, fördubblas över 272K jämfört med Gem​ini 3.1 Pro $2.00 / $12.00 per 1M upp till 200K, $4.00 / $18.00 därutöver, cachad indata $0.20 / $0.40

• Kontext och utdata — Fugu Ultra v2 1M kontext, utdatatak ej publicerat vs Gem​ini 3.1 Pro 1M indata, 65K utdata

• Vikter och åtkomst — Fugu Ultra v2 stängd, EU/EES exkluderat mot Gem​ini 3.1 Pro som är proprietär men brett tillgänglig via Goo​gles ytor

Den multimodala raden är den som ska hanteras försiktigt, eftersom den är den mest citerade och den minst solida. BenchLM:s CharXiv-aggregering placerar Fugu Ultra v2 före med 6,4 normaliserade poäng — och samma sida säger uttryckligen att riktningsrader aldrig får en vinnare, att Gem​ini inte hade några uppmätta resultat i de agentiska, kodnings-, kunskaps- eller flerspråkighetskategorierna, och att Fugu inte hade några i matematik eller flerspråkighet. En kategori där bara en sida har mätts i de flesta rader kan inte ge ett avgörande. Om du inte tar med dig något annat från den här jämförelsen, ta med dig detta: specifikt för multimodalt arbete ger den publicerade evidensen inte stöd för någon slutsats åt något håll, och den enda rad som finns är uttryckligen inte ett fastställt resultat.

Möjligheten som förändrar ramen

Sakana vill inte säga vad som finns i poolen. Det är ett dokumenterat designval, inte ett förbiseende – FAQ säger att routinginformation inte exponeras av design, och det finns ingen mekanism för att inspektera den. Vad vi vet från junigenerationen är att de rapporterade poolmedlemmarna inkluderade Gem​ini 3.1 Pro tillsammans med andra frontier-modeller. Version 2.0 ändrade poolen, och Sakana beskrev ändringen endast genom subtraktion: Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra är ute. Ingenting i släppet säger att Gem​ini är kvar.

Om Gem​ini 3.1 Pro finns i poolen följer tre konsekvenser, och alla tre är praktiska snarare än filosofiska. För det första är en del av Fugu Ultra v2:s multimodala prestanda Gem​inis prestanda, kombinerad med andra modellers — vilket innebär att du betalar en samordningspremie ovanpå ett tokenpris som du skulle kunna betala direkt. För det andra är Fugu Ultra v2 med $30 per miljon utdata mot Gem​ini 3.1 Pro med $12 en premie för sammansättning, inte för rå kapacitet; om din uppgift är en enda multimodal fråga besvarar Gem​ini den billigare och du kan se exakt vilken modell som svarade. För det tredje, och mest användbart, är det ärliga benchmarktestet för en orkestrator inte "slår den sina komponenter" utan "slår den sin bästa komponent när du använder den ensam". Sakanas arkitektur bygger på påståendet att den gör det, på verifierbara uppgifter. Det påståendet är värt att testa på din egen arbetsbelastning innan du accepterar det på ett benchmark för diagramläsning.

Det finns en version där svaret är nej och orkestratorn ändå förtjänar sin plats. Om Gem​ini finns i poolen och Fugu Ultra v2:s Chartography-poäng på 48,3 mot Claude Opus 5:s 27,3 håller, då är det Sakana har byggt ett koordinationslager som tillförlitligt får ut mer av samma modell än vad man får genom att anropa den en gång. Det är en riktig produkt, och den öppna frågan är bara om marginalen täcker priset. Ingen har publicerat experimentet.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

Där de ärliga kanterna är

Gemini 3.1 Pro:s fördelar är konkreta. Priset är ungefär två femtedelar av Fugu Ultra v2:s pris för indata och utdata, och till skillnad från Fugu fördubblas inte dess priser efter en kontexttröskel — steget vid 200K är mjukare än stupet vid 272K. Det dokumenterar sina modaliteter i stället för att ärva dem, vilket innebär att ljud- och videobearbetning är en funktion som stöds snarare än en förhoppning. Det har ett publicerat utdatatak. Det är tillgängligt via Googles egna plattformar och, precis som de andra modellerna som Fugu Ultra v2 jämförs med, är det anropbart på OrcaRouter — som google/gemini-3.1-pro-preview, till Googles listpris med 0 % påslag, så en prisändring från Google slår igenom på samma nyckel samma dag som den tillkännages.

Fugu Ultra v2:s fördelar är snävare och verkliga. Den angriper ett svårt problem mer än en gång, med en Verifier-roll som granskar arbetet, vilket är anledningen till att dess starkaste påståenden ligger på benchmarks där korrektheten kan kontrolleras — Chartography, DeepSWE, Toolathon — snarare än på kunskapsåtergivning. Sakanas publicerade fallstudier lutar åt samma håll: en mekanisk CAD-iris som öppnas och stängs korrekt där andra modeller lämnade luckor och svaga kopplingar; en Rubiks kub-lösare i ren Python som klarade alla 300 blandade kuber där två anonymiserade frontlinje-baslinjer kraschade fullständigt. Dessa baslinjer är anonymiserade och valda av leverantören, så betrakta dem som illustration snarare än bevis. Men mönstret är konsekvent genom hela utgåvan, och det beskriver en genuin förmåga som ett enskilt modellanrop inte har: uthållighet med ett problem tills svaret klarar en kontroll.

Väg även in begränsningarna. Fugu Ultra v2 säljs inte i EU eller EES, och Sakana är tydliga med att de arbetar för att uppnå GDPR-efterlevnad. Gemini 3.1 Pro har ingen sådan begränsning och en mycket längre historik av oberoende utvärdering bakom sig.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Domen

För de flesta multimodala uppgifter är Gemini 3.1 Pro det rätta valet, och det är inte ens nära. Den är billigare per token, billigare per dokument, har dokumenterat stöd för ljud och video, har ett kontexttak som inte fördubblar din räkning mitt i körningen, och – det som spelar störst roll här – du kan se vad som svarade dig. Om du behöver en modell som läser en PDF, tittar på ett klipp och svarar på en fråga, finns det inget argument för att skicka det genom en oangiven pool till två och en halv gånger priset för utdata.

Fugu Ultra v2 är rätt val för en specifik och mycket snävare typ av arbete: uppgifter med lång tidshorisont och ett kontrollerbart svar, där att prova ett problem på tre sätt och verifiera resultatet slår att prova det en gång, och där den marginella kvalitetsvinsten är värd den flerdubbla kostnaden. Det är helt uteslutet om du har EU- eller EES-användare inom omfattningen.

Den obehagliga frågan som matchningen lämnar öppen är den som ingen har mätt. Om Gem​ini 3.1 Pro finns i poolen – och det enda ärliga svaret i dag är att Sakana inte har sagt att den inte är det – så är en del av det du köper med Fugu Ultra v2 Gem​ini 3.1 Pro med ett koordinationslager ovanpå, till ett pris som antyder att lagret är värt ungefär två och en halv gånger modellen. Det kan mycket väl vara sant. Sakanas arkitektur byggdes för att göra det sant. Men det är en hypotes med en resultattavla från leverantören bakom sig och inget oberoende test, och tills någon genomför det är modellen du kan se den du kan försvara.