Een hero-titelkaart voor Fugu Ultra v2 vs Gemini 3.1 Pro met de ondertitel 'De tegenstander die misschien al in de machine zit', pill-badges met de tekst '$30,00 vs $12,00 output', 'CharXiv 86,6 vs 80,2 richtinggevend' en 'Niet-bekendgemaakte pool', een voettekstregel 'Sakana AI vs Google DeepMind - september 2026', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Fugu Ultra v2 vs Gemini 3.1 Pro: de tegenstander die zich mogelijk al in de machine bevindt

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er is een versie van de vergelijking Fugu Ultra v2 vs Gem​ini 3.1 Pro waarin Gem​ini wint, hoe de benchmark ook uitvalt — omdat het misschien een deel van het werk doet. Het orkestratiesysteem van Sakana AI, uitgebracht op 11 september 2026, maakt niet bekend welke modellen het coördineert; de gerapporteerde pool van de Fugu Ultra van juni omvatte onder andere Gem​ini 3.1 Pro, en versie 2.0 vertelt ons alleen wat er is verwijderd, waarbij Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra als uitgesloten worden genoemd. De Gem​ini 3.1 Pro van Goo​gle is één multimodaal frontiermodel met een 1M-tokencontext dat tekst, afbeeldingen, pdf's, audio en video verwerkt, algemeen beschikbaar sinds mei 2026 voor $2,00 per miljoen input en $12,00 per miljoen output. Een van deze is een model dat je kunt inspecteren. De andere is een systeem waarvan de benchmarkoverwinningen via het eerste kunnen verlopen, en geen van beide leveranciers zal je vertellen of dat gebeurt.

Wat elk systeem eigenlijk is

Gem​ini 3.1 Pro is op een manier leesbaar die zeldzaam is geworden onder frontier-releases. Het is een sparse mixture-of-experts-transformer van Goo​gle DeepMind, voor het eerst uitgebracht in preview op 19 februari 2026, waarbij één bron de algemene beschikbaarheid op mei 2026 dateert — onze eigen vermelding voert het onder de preview-model-ID. Het heeft een invoervenster van 1M tokens en een uitvoerplafond van 65K tokens, accepteert tekst, afbeeldingen, pdf's, audio, video en code, en biedt een redeneerinstelling met drie niveaus — laag, gemiddeld of hoog — waarbij hoog de standaardwaarde voor de API is. Goo​gle rapporteert 77,1% op ARC-AGI-2, meer dan het dubbele van de 31,1% van de vorige generatie; 94,3% op GPQA Diamond; 80,6% op SWE-bench Verified; 68,5% op Terminal-Bench 2.0; 85,9% op BrowseComp; en 44,4% op Humanity's Last Exam zonder tools, oplopend tot 51,4% met zoeken en code-uitvoering. Dat zijn cijfers van de leverancier. De kennisafsluitdatum is januari 2025, wat het vermelden waard is als je werk afhankelijk is van recente gebeurtenissen.

Fugu Ultra v2 is een coördinator. Het is een getraind model, naar verluidt rond de 7B parameters, dat een verzoek leest, een agentteam samenstelt met de rollen Thinker, Worker en Verifier uit Sakana's TRINITY-onderzoek, en een antwoord synthetiseert achter een OpenAI-compatibel endpoint. Het heeft zelf geen gepubliceerde modaliteitenlijst — alles wat het kan zien, ziet het omdat een model in zijn pool het kan zien. De context bedraagt 1M tokens met een scherpe prijssprong bij 272K, waar de tarieven verdubbelen naar $10 voor input en $45 voor output. Het outputplafond is niet gepubliceerd. De pool is niet bekendgemaakt, de routeringsbeslissingen zijn 'niet beschikbaar gesteld door ontwerp', en voor de Ultra-tier staat de pool vast, dus je kunt geen provider uitsluiten.

Die asymmetrie is de hele confrontatie. Gem​ini 3.1 Pro is een component die je direct kunt kopen en waarover je kunt redeneren. Fugu Ultra v2 is een assemblage waarvan je de onderdelen niet kunt zien en waarvan de sterkste benchmarkclaims deels Gem​ini's eigen resultaten kunnen zijn, gecombineerd met die van iemand anders.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

De vergelijking waarin de twee overlappen

Er is maar heel weinig van het gepubliceerde bewijs dat de twee systemen in dezelfde rij naast elkaar zet. De cijfers hieronder van Gem​ini 3.1 Pro zijn die van Goo​gle zelf; die van Fugu Ultra v2 zijn die van Sakana zelf; waar een externe aggregator een gedeelde rij heeft gepubliceerd, is die gemarkeerd en gaat die gepaard met de kanttekening dat ze eerder richtinggevend dan beslissend zijn.

• Multimodale redenering (CharXiv, gedeelde rij) — Fugu Ultra v2 86,6% vs. Gem​ini 3.1 Pro 80,2%, volgens BenchLM, dat de categorie als indicatief bestempelt en weigert een winnaar aan te wijzen

• TerminalBench 2.1 — geen Fugu Ultra v2 v2.0-cijfer vs Gemini 3.1 Pro, geen vergelijkbaar gepubliceerd cijfer; de Fugu Ultra van juni rapporteerde 82,1% tegenover 70,3% voor Gemini 3.1 Pro in aggregatie door derden

• SWE-Bench Pro — geen cijfer voor Fugu Ultra v2 v2.0 versus Gem​ini 3.1 Pro; geen vergelijkbaar gepubliceerd cijfer; de Fugu Ultra van juni rapporteerde 73,7% tegenover de 54,2% van Gem​ini 3.1 Pro

• ARC-AGI-2 — geen cijfer voor Fugu Ultra v2 tegenover Gem​ini 3.1 Pro 77,1%, volgens opgave van de leverancier

• Humanity's Last Exam — geen Fugu Ultra v2 v2.0-cijfer vs Gem​ini 3.1 Pro: 44,4% zonder tools, 51,4% met, volgens de leverancier

• Modaliteitsdekking — Fugu Ultra v2 erft wat zijn pool ondersteunt, niet bekendgemaakt versus Gem​ini 3.1 Pro tekst, afbeelding, PDF, audio, video en code, gedocumenteerd

• Invoer-/uitvoerprijs — Fugu Ultra v2 $5,00 / $30,00 per 1M, verdubbelt boven 272K tegenover Gemini 3.1 Pro $2,00 / $12,00 per 1M tot 200K, $4,00 / $18,00 daarboven, gecachte invoer $0,20 / $0,40

• Context en uitvoer — Fugu Ultra v2 1M context, uitvoerplafond niet gepubliceerd vs Gem​ini 3.1 Pro 1M invoer, 65K uitvoer

• Gewichten en toegang — Fugu Ultra v2 gesloten, EU/EER uitgesloten vs Gem​ini 3.1 Pro propriëtair maar breed beschikbaar via Goo​gle-oppervlakken

De multimodale rij is degene die zorgvuldig moet worden behandeld, want die wordt het meest geciteerd en is het minst solide. De CharXiv-aggregatie van BenchLM zet Fugu Ultra v2 met 6,4 genormaliseerde punten op voorsprong — en dezelfde pagina stelt ronduit dat directionele rijen nooit een winnaar krijgen, dat Gemini geen gemeten resultaten had in de agentische, coderings-, kennis- of meertalige categorieën, en dat Fugu er geen had in wiskunde of meertaligheid. Een categorie waarin in de meeste rijen slechts één kant is gemeten, kan geen oordeel opleveren. Als je niets anders uit deze vergelijking meeneemt, neem dan dit mee: specifiek voor multimodaal werk ondersteunt het gepubliceerde bewijs geen conclusie in welke richting dan ook, en de enige rij die bestaat, is expliciet geen definitief resultaat.

De mogelijkheid die het kader verandert

Sakana zal niet zeggen wat er in de pool zit. Dat is een gedocumenteerde ontwerpkeuze, geen vergissing — de FAQ zegt dat routeringsinformatie bewust niet wordt vrijgegeven, en er is geen mechanisme om die te inspecteren. Wat we weten uit de juni-generatie is dat de gerapporteerde pool-leden onder meer Gemini 3.1 Pro omvatten, naast andere frontier-modellen. Versie 2.0 veranderde de pool, en Sakana beschreef de wijziging alleen in termen van wat eraf ging: Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra zijn eruit. Niets in de release zegt dat Gemini er nog in zit.

Als Gemini 3.1 Pro in de pool zit, volgen er drie consequenties, en alle drie zijn ze praktisch in plaats van filosofisch. Ten eerste is een deel van de multimodale prestaties van Fugu Ultra v2 de prestatie van Gemini, gecombineerd met die van andere modellen — wat betekent dat je een coördinatiepremie betaalt bovenop een tarief per token dat je rechtstreeks zou kunnen betalen. Ten tweede is Fugu Ultra v2 tegen $30 output per miljoen tegenover Gemini 3.1 Pro tegen $12 een premie voor assemblage, niet voor ruwe capaciteit; als je taak één enkele multimodale vraag is, antwoordt Gemini goedkoper en kun je precies zien welk model heeft geantwoord. Ten derde, en dat is het nuttigst, is de eerlijke maatstaf voor een orchestrator niet "verslaat hij zijn componenten", maar "verslaat hij zijn beste component wanneer je die alleen gebruikt." De architectuur van Sakana is gebouwd op de bewering dat dat lukt, op verifieerbare taken. Die bewering is het waard om op je eigen workload te testen voordat je die aanneemt op basis van een benchmark voor het lezen van grafieken.

Er is een versie waarin het antwoord nee is en de orchestrator nog steeds zijn plek verdient. Als Gem​ini in de pool zit en de Chartography-score van Fugu Ultra v2 van 48,3 tegenover 27,3 van Claude Opus 5 standhoudt, dan is wat Sakana heeft gebouwd een coördinatielaag die betrouwbaar meer uit hetzelfde model haalt dan wanneer je het één keer aanroept. Dat is een echt product, en de enige open vraag is of de marge de prijs dekt. Niemand heeft het experiment gepubliceerd.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

Waar de eerlijke randen zijn

De voordelen van Gem​ini 3.1 Pro zijn concreet. Het kost ongeveer twee vijfde van de prijs van Fugu Ultra v2 voor input en output, en anders dan bij Fugu verdubbelen de tarieven niet voorbij een contextdrempel — de stap bij 200K is geleidelijker dan de klif bij 272K. Het documenteert zijn modaliteiten in plaats van ze te erven, wat betekent dat audio- en videowerk een ondersteunde functie is in plaats van iets waarop je moet hopen. Het heeft een gepubliceerd outputplafond. Het is beschikbaar via Goo​gles eigen kanalen en, net als de andere modellen waarmee Fugu Ultra v2 wordt vergeleken, is het aanroepbaar op OrcaRouter — als google/gemini-3.1-pro-preview, tegen de lijstprijs van Goo​gle met 0% opslag, zodat een prijswijziging van Goo​gle dezelfde dag dat die wordt aangekondigd op dezelfde sleutel terechtkomt.

De voordelen van Fugu Ultra v2 zijn beperkter en reëel. Het pakt een moeilijk probleem meerdere keren aan, met een Verifier-rol die het werk controleert, waardoor zijn sterkste claims op benchmarks liggen waar correctheid controleerbaar is — Chartography, DeepSWE, Toolathon — en niet op kennisrecall. Sakana's gepubliceerde casestudy's wijzen dezelfde kant op: een mechanische CAD-iris die correct opent en sluit waar andere modellen gaten en zwakke verbindingen achterlieten; een pure-Python Rubik's cube-oplosser die alle 300 door elkaar geschudde kubussen voltooit, waar twee geanonimiseerde frontier-baselines volledig crashten. Die baselines zijn geanonimiseerd en door de leverancier gekozen, dus beschouw ze als illustratie en niet als bewijs. Maar het patroon is consistent in de hele release, en het beschrijft een echt vermogen dat een enkele modelaanroep niet heeft: volharding op een probleem totdat het antwoord een controle doorstaat.

Weeg ook de beperkingen mee. Fugu Ultra v2 wordt niet verkocht in de EU of de EER, en Sakana zegt expliciet dat het werkt aan GDPR-naleving. Gem​ini 3.1 Pro heeft geen dergelijke beperking en een veel langere staat van dienst op het gebied van onafhankelijke evaluatie.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Het vonnis

Voor de meeste multimodale taken is Gem​ini 3.1 Pro de juiste keuze, en dat is niet eens een moeilijke beslissing. Het is goedkoper per token, goedkoper per document, gedocumenteerd voor audio en video, begrensd op een contextdrempel die je rekening niet halverwege een run verdubbelt, en — het deel dat hier het belangrijkst is — je kunt zien welk model je heeft geantwoord. Als je één model nodig hebt om een PDF te lezen, een clip te bekijken en een vraag te beantwoorden, is er geen enkel argument om dat via een niet-bekendgemaakte pool te routeren tegen tweeënhalf keer de outputprijs.

Fugu Ultra v2 is de juiste keuze voor een specifieke en veel nauwere vorm van werk: langetermijntaken met een controleerbaar antwoord, waarbij een probleem op drie manieren aanpakken en het resultaat verifiëren beter is dan het één keer proberen, en waarbij de marginale kwaliteitswinst de meervoudige inzet waard is. Het valt volledig buiten beschouwing als je EU- of EER-gebruikers binnen je scope hebt.

De ongemakkelijke vraag die de match-up openlaat, is degene die niemand heeft gemeten. Als Gemini 3.1 Pro in de pool zit — en het enige eerlijke antwoord vandaag is dat Sakana niet heeft gezegd dat het niet zo is — dan is een deel van wat je met Fugu Ultra v2 koopt, Gemini 3.1 Pro met een coördinatielaag erbovenop, tegen een prijs die suggereert dat de laag ongeveer tweeënhalf keer het model waard is. Dat kan heel goed waar zijn. Sakana's architectuur is gebouwd om dat waar te maken. Maar het is een hypothese met een scorebord van de leverancier erachter en geen onafhankelijke test, en totdat iemand die uitvoert, is het model dat je kunt zien het model dat je kunt verdedigen.