
Fugu Ultra v2 vs Gemini 3.1 Pro: motståndaren som kanske redan finns inuti maskinen
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Det finns en version av jämförelsen mellan Fugu Ultra v2 och Gemini 3.1 Pro där Gemini vinner oavsett hur benchmarken går – eftersom den kan göra en del av arbetet. Sakana AI:s orkestreringssystem, som släpptes den 11 september 2026, avslöjar inte vilka modeller det koordinerar; den rapporterade poolen för juniversionen av Fugu Ultra inkluderade Gemini 3.1 Pro bland andra, och version 2.0 berättar bara vad den tog bort, och namnger Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra som uteslutna. Googles Gemini 3.1 Pro är en enda multimodal frontier-modell med en kontext på 1 M tokens som hanterar text, bilder, PDF:er, ljud och video, allmänt tillgänglig sedan maj 2026 för 2,00 USD per miljon input-tokens och 12,00 USD per miljon output-tokens. En av dessa är en modell du kan inspektera. Den andra är ett system vars benchmarksegrar kan gå via den första, och ingen av leverantörerna kommer att berätta för dig om så är fallet.
Vad varje system faktiskt är
Gemini 3.1 Pro är begriplig på ett sätt som har blivit sällsynt bland lanseringar i framkanten. Det är en sparse mixture-of-experts-transformer från Google DeepMind, som först släpptes i förhandsversion den 19 februari 2026, med en källa som daterar den allmänna tillgängligheten till maj 2026 — i vår egen förteckning finns den under förhandsversionens modell-ID. Den har ett indatafönster på 1M tokens och ett utdatatak på 65K tokens, tar emot text, bilder, PDF:er, ljud, video och kod, och erbjuder en trestegs resonemangsinställning — låg, medel eller hög — där hög är API-standard. Google rapporterar 77,1 % på ARC-AGI-2, mer än dubbelt så högt som föregående generations 31,1 %; 94,3 % på GPQA Diamond; 80,6 % på SWE-bench Verified; 68,5 % på Terminal-Bench 2.0; 85,9 % på BrowseComp; och 44,4 % på Humanity's Last Exam utan verktyg, vilket stiger till 51,4 % med sökning och kodexekvering. Det är siffror från leverantören. Dess kunskapsgräns är januari 2025, vilket är värt att notera om ditt arbete är beroende av aktuella händelser.
Fugu Ultra v2 är en koordinator. Det är en tränad modell som enligt uppgift har omkring 7B parametrar och som läser en begäran, sätter samman ett agentteam med rollerna Thinker, Worker och Verifier hämtade från Sakanas TRINITY-forskning, och syntetiserar ett svar bakom en OpenAI-kompatibel endpoint. Den har ingen egen publicerad modalitetslista – allt den kan se, ser den eftersom en modell i dess pool kan se det. Dess kontext är 1M tokens med en brant prisklippa vid 272K, där priserna fördubblas till $10 för indata och $45 för utdata. Dess utdatatak är inte publicerat. Dess pool är inte offentliggjord, dess routningsbeslut "exponeras inte avsiktligt", och för Ultra-nivån är poolen fast, så du kan inte utesluta en leverantör.
Den asymmetrin är hela matchningen. Gemini 3.1 Pro är en komponent som du kan köpa direkt och resonera kring. Fugu Ultra v2 är en sammansättning vars delar du inte kan se och vars starkaste benchmark-påståenden till viss del kan vara Geminis egna resultat kombinerade med någon annans.

Jämförelsen där de två överlappar
Väldigt lite av den publicerade bevisningen ställer upp de två systemen på samma rad. Siffrorna nedan för Gemini 3.1 Pro är Googles egna; Fugu Ultra v2:s är Sakanas egna; där en tredjepartsaggregator har publicerat en gemensam rad är den markerad och åtföljs av ett förbehåll om att den är vägledande snarare än avgörande.
• Multimodalt resonemang (CharXiv, delad rad) — Fugu Ultra v2 86,6 % vs Gemini 3.1 Pro 80,2 %, enligt BenchLM, som betecknar kategorin som riktningsgivande och avstår från att utse en vinnare
• TerminalBench 2.1 — ingen siffra för Fugu Ultra v2 v2.0 mot Gemini 3.1 Pro, ingen jämförbar publicerad siffra; Fugu Ultra från juni rapporterade 82,1 % mot Gemini 3.1 Pro:s 70,3 % i tredjepartsaggregering
• SWE-Bench Pro — ingen siffra för Fugu Ultra v2 v2.0 kontra Gemini 3.1 Pro, ingen jämförbar publicerad siffra; Fugu Ultra från juni rapporterade 73,7 % mot Gemini 3.1 Pro:s 54,2 %.
• ARC-AGI-2 — ingen siffra för Fugu Ultra v2 jämfört med Gemini 3.1 Pro 77,1 %, enligt leverantören
• Humanity's Last Exam — inget resultat för Fugu Ultra v2 v2.0 jämfört med Gemini 3.1 Pro: 44,4 % utan verktyg, 51,4 % med, enligt leverantören
• Modalitetstäckning — Fugu Ultra v2 ärver vad dess pool stöder, ej offentliggjort jämfört med Gemini 3.1 Pro:s text, bild, PDF, ljud, video och kod, dokumenterade
• Pris för in-/utdata — Fugu Ultra v2 $5.00 / $30.00 per 1M, fördubblas över 272K jämfört med Gemini 3.1 Pro $2.00 / $12.00 per 1M upp till 200K, $4.00 / $18.00 därutöver, cachad indata $0.20 / $0.40
• Kontext och utdata — Fugu Ultra v2 1M kontext, utdatatak ej publicerat vs Gemini 3.1 Pro 1M indata, 65K utdata
• Vikter och åtkomst — Fugu Ultra v2 stängd, EU/EES exkluderat mot Gemini 3.1 Pro som är proprietär men brett tillgänglig via Googles ytor
Den multimodala raden är den som ska hanteras försiktigt, eftersom den är den mest citerade och den minst solida. BenchLM:s CharXiv-aggregering placerar Fugu Ultra v2 före med 6,4 normaliserade poäng — och samma sida säger uttryckligen att riktningsrader aldrig får en vinnare, att Gemini inte hade några uppmätta resultat i de agentiska, kodnings-, kunskaps- eller flerspråkighetskategorierna, och att Fugu inte hade några i matematik eller flerspråkighet. En kategori där bara en sida har mätts i de flesta rader kan inte ge ett avgörande. Om du inte tar med dig något annat från den här jämförelsen, ta med dig detta: specifikt för multimodalt arbete ger den publicerade evidensen inte stöd för någon slutsats åt något håll, och den enda rad som finns är uttryckligen inte ett fastställt resultat.
Möjligheten som förändrar ramen
Sakana vill inte säga vad som finns i poolen. Det är ett dokumenterat designval, inte ett förbiseende – FAQ säger att routinginformation inte exponeras av design, och det finns ingen mekanism för att inspektera den. Vad vi vet från junigenerationen är att de rapporterade poolmedlemmarna inkluderade Gemini 3.1 Pro tillsammans med andra frontier-modeller. Version 2.0 ändrade poolen, och Sakana beskrev ändringen endast genom subtraktion: Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra är ute. Ingenting i släppet säger att Gemini är kvar.
Om Gemini 3.1 Pro finns i poolen följer tre konsekvenser, och alla tre är praktiska snarare än filosofiska. För det första är en del av Fugu Ultra v2:s multimodala prestanda Geminis prestanda, kombinerad med andra modellers — vilket innebär att du betalar en samordningspremie ovanpå ett tokenpris som du skulle kunna betala direkt. För det andra är Fugu Ultra v2 med $30 per miljon utdata mot Gemini 3.1 Pro med $12 en premie för sammansättning, inte för rå kapacitet; om din uppgift är en enda multimodal fråga besvarar Gemini den billigare och du kan se exakt vilken modell som svarade. För det tredje, och mest användbart, är det ärliga benchmarktestet för en orkestrator inte "slår den sina komponenter" utan "slår den sin bästa komponent när du använder den ensam". Sakanas arkitektur bygger på påståendet att den gör det, på verifierbara uppgifter. Det påståendet är värt att testa på din egen arbetsbelastning innan du accepterar det på ett benchmark för diagramläsning.
Det finns en version där svaret är nej och orkestratorn ändå förtjänar sin plats. Om Gemini finns i poolen och Fugu Ultra v2:s Chartography-poäng på 48,3 mot Claude Opus 5:s 27,3 håller, då är det Sakana har byggt ett koordinationslager som tillförlitligt får ut mer av samma modell än vad man får genom att anropa den en gång. Det är en riktig produkt, och den öppna frågan är bara om marginalen täcker priset. Ingen har publicerat experimentet.

Där de ärliga kanterna är
Gemini 3.1 Pro:s fördelar är konkreta. Priset är ungefär två femtedelar av Fugu Ultra v2:s pris för indata och utdata, och till skillnad från Fugu fördubblas inte dess priser efter en kontexttröskel — steget vid 200K är mjukare än stupet vid 272K. Det dokumenterar sina modaliteter i stället för att ärva dem, vilket innebär att ljud- och videobearbetning är en funktion som stöds snarare än en förhoppning. Det har ett publicerat utdatatak. Det är tillgängligt via Googles egna plattformar och, precis som de andra modellerna som Fugu Ultra v2 jämförs med, är det anropbart på OrcaRouter — som google/gemini-3.1-pro-preview, till Googles listpris med 0 % påslag, så en prisändring från Google slår igenom på samma nyckel samma dag som den tillkännages.
Fugu Ultra v2:s fördelar är snävare och verkliga. Den angriper ett svårt problem mer än en gång, med en Verifier-roll som granskar arbetet, vilket är anledningen till att dess starkaste påståenden ligger på benchmarks där korrektheten kan kontrolleras — Chartography, DeepSWE, Toolathon — snarare än på kunskapsåtergivning. Sakanas publicerade fallstudier lutar åt samma håll: en mekanisk CAD-iris som öppnas och stängs korrekt där andra modeller lämnade luckor och svaga kopplingar; en Rubiks kub-lösare i ren Python som klarade alla 300 blandade kuber där två anonymiserade frontlinje-baslinjer kraschade fullständigt. Dessa baslinjer är anonymiserade och valda av leverantören, så betrakta dem som illustration snarare än bevis. Men mönstret är konsekvent genom hela utgåvan, och det beskriver en genuin förmåga som ett enskilt modellanrop inte har: uthållighet med ett problem tills svaret klarar en kontroll.
Väg även in begränsningarna. Fugu Ultra v2 säljs inte i EU eller EES, och Sakana är tydliga med att de arbetar för att uppnå GDPR-efterlevnad. Gemini 3.1 Pro har ingen sådan begränsning och en mycket längre historik av oberoende utvärdering bakom sig.

Domen
För de flesta multimodala uppgifter är Gemini 3.1 Pro det rätta valet, och det är inte ens nära. Den är billigare per token, billigare per dokument, har dokumenterat stöd för ljud och video, har ett kontexttak som inte fördubblar din räkning mitt i körningen, och – det som spelar störst roll här – du kan se vad som svarade dig. Om du behöver en modell som läser en PDF, tittar på ett klipp och svarar på en fråga, finns det inget argument för att skicka det genom en oangiven pool till två och en halv gånger priset för utdata.
Fugu Ultra v2 är rätt val för en specifik och mycket snävare typ av arbete: uppgifter med lång tidshorisont och ett kontrollerbart svar, där att prova ett problem på tre sätt och verifiera resultatet slår att prova det en gång, och där den marginella kvalitetsvinsten är värd den flerdubbla kostnaden. Det är helt uteslutet om du har EU- eller EES-användare inom omfattningen.
Den obehagliga frågan som matchningen lämnar öppen är den som ingen har mätt. Om Gemini 3.1 Pro finns i poolen – och det enda ärliga svaret i dag är att Sakana inte har sagt att den inte är det – så är en del av det du köper med Fugu Ultra v2 Gemini 3.1 Pro med ett koordinationslager ovanpå, till ett pris som antyder att lagret är värt ungefär två och en halv gånger modellen. Det kan mycket väl vara sant. Sakanas arkitektur byggdes för att göra det sant. Men det är en hypotes med en resultattavla från leverantören bakom sig och inget oberoende test, och tills någon genomför det är modellen du kan se den du kan försvara.
