
Fugu Ultra v2 vs Gemini 3.1 Pro: de tegenstander die zich mogelijk al in de machine bevindt
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Er is een versie van de vergelijking Fugu Ultra v2 vs Gemini 3.1 Pro waarin Gemini wint, hoe de benchmark ook uitvalt — omdat het misschien een deel van het werk doet. Het orkestratiesysteem van Sakana AI, uitgebracht op 11 september 2026, maakt niet bekend welke modellen het coördineert; de gerapporteerde pool van de Fugu Ultra van juni omvatte onder andere Gemini 3.1 Pro, en versie 2.0 vertelt ons alleen wat er is verwijderd, waarbij Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra als uitgesloten worden genoemd. De Gemini 3.1 Pro van Google is één multimodaal frontiermodel met een 1M-tokencontext dat tekst, afbeeldingen, pdf's, audio en video verwerkt, algemeen beschikbaar sinds mei 2026 voor $2,00 per miljoen input en $12,00 per miljoen output. Een van deze is een model dat je kunt inspecteren. De andere is een systeem waarvan de benchmarkoverwinningen via het eerste kunnen verlopen, en geen van beide leveranciers zal je vertellen of dat gebeurt.
Wat elk systeem eigenlijk is
Gemini 3.1 Pro is op een manier leesbaar die zeldzaam is geworden onder frontier-releases. Het is een sparse mixture-of-experts-transformer van Google DeepMind, voor het eerst uitgebracht in preview op 19 februari 2026, waarbij één bron de algemene beschikbaarheid op mei 2026 dateert — onze eigen vermelding voert het onder de preview-model-ID. Het heeft een invoervenster van 1M tokens en een uitvoerplafond van 65K tokens, accepteert tekst, afbeeldingen, pdf's, audio, video en code, en biedt een redeneerinstelling met drie niveaus — laag, gemiddeld of hoog — waarbij hoog de standaardwaarde voor de API is. Google rapporteert 77,1% op ARC-AGI-2, meer dan het dubbele van de 31,1% van de vorige generatie; 94,3% op GPQA Diamond; 80,6% op SWE-bench Verified; 68,5% op Terminal-Bench 2.0; 85,9% op BrowseComp; en 44,4% op Humanity's Last Exam zonder tools, oplopend tot 51,4% met zoeken en code-uitvoering. Dat zijn cijfers van de leverancier. De kennisafsluitdatum is januari 2025, wat het vermelden waard is als je werk afhankelijk is van recente gebeurtenissen.
Fugu Ultra v2 is een coördinator. Het is een getraind model, naar verluidt rond de 7B parameters, dat een verzoek leest, een agentteam samenstelt met de rollen Thinker, Worker en Verifier uit Sakana's TRINITY-onderzoek, en een antwoord synthetiseert achter een OpenAI-compatibel endpoint. Het heeft zelf geen gepubliceerde modaliteitenlijst — alles wat het kan zien, ziet het omdat een model in zijn pool het kan zien. De context bedraagt 1M tokens met een scherpe prijssprong bij 272K, waar de tarieven verdubbelen naar $10 voor input en $45 voor output. Het outputplafond is niet gepubliceerd. De pool is niet bekendgemaakt, de routeringsbeslissingen zijn 'niet beschikbaar gesteld door ontwerp', en voor de Ultra-tier staat de pool vast, dus je kunt geen provider uitsluiten.
Die asymmetrie is de hele confrontatie. Gemini 3.1 Pro is een component die je direct kunt kopen en waarover je kunt redeneren. Fugu Ultra v2 is een assemblage waarvan je de onderdelen niet kunt zien en waarvan de sterkste benchmarkclaims deels Gemini's eigen resultaten kunnen zijn, gecombineerd met die van iemand anders.

De vergelijking waarin de twee overlappen
Er is maar heel weinig van het gepubliceerde bewijs dat de twee systemen in dezelfde rij naast elkaar zet. De cijfers hieronder van Gemini 3.1 Pro zijn die van Google zelf; die van Fugu Ultra v2 zijn die van Sakana zelf; waar een externe aggregator een gedeelde rij heeft gepubliceerd, is die gemarkeerd en gaat die gepaard met de kanttekening dat ze eerder richtinggevend dan beslissend zijn.
• Multimodale redenering (CharXiv, gedeelde rij) — Fugu Ultra v2 86,6% vs. Gemini 3.1 Pro 80,2%, volgens BenchLM, dat de categorie als indicatief bestempelt en weigert een winnaar aan te wijzen
• TerminalBench 2.1 — geen Fugu Ultra v2 v2.0-cijfer vs Gemini 3.1 Pro, geen vergelijkbaar gepubliceerd cijfer; de Fugu Ultra van juni rapporteerde 82,1% tegenover 70,3% voor Gemini 3.1 Pro in aggregatie door derden
• SWE-Bench Pro — geen cijfer voor Fugu Ultra v2 v2.0 versus Gemini 3.1 Pro; geen vergelijkbaar gepubliceerd cijfer; de Fugu Ultra van juni rapporteerde 73,7% tegenover de 54,2% van Gemini 3.1 Pro
• ARC-AGI-2 — geen cijfer voor Fugu Ultra v2 tegenover Gemini 3.1 Pro 77,1%, volgens opgave van de leverancier
• Humanity's Last Exam — geen Fugu Ultra v2 v2.0-cijfer vs Gemini 3.1 Pro: 44,4% zonder tools, 51,4% met, volgens de leverancier
• Modaliteitsdekking — Fugu Ultra v2 erft wat zijn pool ondersteunt, niet bekendgemaakt versus Gemini 3.1 Pro tekst, afbeelding, PDF, audio, video en code, gedocumenteerd
• Invoer-/uitvoerprijs — Fugu Ultra v2 $5,00 / $30,00 per 1M, verdubbelt boven 272K tegenover Gemini 3.1 Pro $2,00 / $12,00 per 1M tot 200K, $4,00 / $18,00 daarboven, gecachte invoer $0,20 / $0,40
• Context en uitvoer — Fugu Ultra v2 1M context, uitvoerplafond niet gepubliceerd vs Gemini 3.1 Pro 1M invoer, 65K uitvoer
• Gewichten en toegang — Fugu Ultra v2 gesloten, EU/EER uitgesloten vs Gemini 3.1 Pro propriëtair maar breed beschikbaar via Google-oppervlakken
De multimodale rij is degene die zorgvuldig moet worden behandeld, want die wordt het meest geciteerd en is het minst solide. De CharXiv-aggregatie van BenchLM zet Fugu Ultra v2 met 6,4 genormaliseerde punten op voorsprong — en dezelfde pagina stelt ronduit dat directionele rijen nooit een winnaar krijgen, dat Gemini geen gemeten resultaten had in de agentische, coderings-, kennis- of meertalige categorieën, en dat Fugu er geen had in wiskunde of meertaligheid. Een categorie waarin in de meeste rijen slechts één kant is gemeten, kan geen oordeel opleveren. Als je niets anders uit deze vergelijking meeneemt, neem dan dit mee: specifiek voor multimodaal werk ondersteunt het gepubliceerde bewijs geen conclusie in welke richting dan ook, en de enige rij die bestaat, is expliciet geen definitief resultaat.
De mogelijkheid die het kader verandert
Sakana zal niet zeggen wat er in de pool zit. Dat is een gedocumenteerde ontwerpkeuze, geen vergissing — de FAQ zegt dat routeringsinformatie bewust niet wordt vrijgegeven, en er is geen mechanisme om die te inspecteren. Wat we weten uit de juni-generatie is dat de gerapporteerde pool-leden onder meer Gemini 3.1 Pro omvatten, naast andere frontier-modellen. Versie 2.0 veranderde de pool, en Sakana beschreef de wijziging alleen in termen van wat eraf ging: Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra zijn eruit. Niets in de release zegt dat Gemini er nog in zit.
Als Gemini 3.1 Pro in de pool zit, volgen er drie consequenties, en alle drie zijn ze praktisch in plaats van filosofisch. Ten eerste is een deel van de multimodale prestaties van Fugu Ultra v2 de prestatie van Gemini, gecombineerd met die van andere modellen — wat betekent dat je een coördinatiepremie betaalt bovenop een tarief per token dat je rechtstreeks zou kunnen betalen. Ten tweede is Fugu Ultra v2 tegen $30 output per miljoen tegenover Gemini 3.1 Pro tegen $12 een premie voor assemblage, niet voor ruwe capaciteit; als je taak één enkele multimodale vraag is, antwoordt Gemini goedkoper en kun je precies zien welk model heeft geantwoord. Ten derde, en dat is het nuttigst, is de eerlijke maatstaf voor een orchestrator niet "verslaat hij zijn componenten", maar "verslaat hij zijn beste component wanneer je die alleen gebruikt." De architectuur van Sakana is gebouwd op de bewering dat dat lukt, op verifieerbare taken. Die bewering is het waard om op je eigen workload te testen voordat je die aanneemt op basis van een benchmark voor het lezen van grafieken.
Er is een versie waarin het antwoord nee is en de orchestrator nog steeds zijn plek verdient. Als Gemini in de pool zit en de Chartography-score van Fugu Ultra v2 van 48,3 tegenover 27,3 van Claude Opus 5 standhoudt, dan is wat Sakana heeft gebouwd een coördinatielaag die betrouwbaar meer uit hetzelfde model haalt dan wanneer je het één keer aanroept. Dat is een echt product, en de enige open vraag is of de marge de prijs dekt. Niemand heeft het experiment gepubliceerd.

Waar de eerlijke randen zijn
De voordelen van Gemini 3.1 Pro zijn concreet. Het kost ongeveer twee vijfde van de prijs van Fugu Ultra v2 voor input en output, en anders dan bij Fugu verdubbelen de tarieven niet voorbij een contextdrempel — de stap bij 200K is geleidelijker dan de klif bij 272K. Het documenteert zijn modaliteiten in plaats van ze te erven, wat betekent dat audio- en videowerk een ondersteunde functie is in plaats van iets waarop je moet hopen. Het heeft een gepubliceerd outputplafond. Het is beschikbaar via Googles eigen kanalen en, net als de andere modellen waarmee Fugu Ultra v2 wordt vergeleken, is het aanroepbaar op OrcaRouter — als google/gemini-3.1-pro-preview, tegen de lijstprijs van Google met 0% opslag, zodat een prijswijziging van Google dezelfde dag dat die wordt aangekondigd op dezelfde sleutel terechtkomt.
De voordelen van Fugu Ultra v2 zijn beperkter en reëel. Het pakt een moeilijk probleem meerdere keren aan, met een Verifier-rol die het werk controleert, waardoor zijn sterkste claims op benchmarks liggen waar correctheid controleerbaar is — Chartography, DeepSWE, Toolathon — en niet op kennisrecall. Sakana's gepubliceerde casestudy's wijzen dezelfde kant op: een mechanische CAD-iris die correct opent en sluit waar andere modellen gaten en zwakke verbindingen achterlieten; een pure-Python Rubik's cube-oplosser die alle 300 door elkaar geschudde kubussen voltooit, waar twee geanonimiseerde frontier-baselines volledig crashten. Die baselines zijn geanonimiseerd en door de leverancier gekozen, dus beschouw ze als illustratie en niet als bewijs. Maar het patroon is consistent in de hele release, en het beschrijft een echt vermogen dat een enkele modelaanroep niet heeft: volharding op een probleem totdat het antwoord een controle doorstaat.
Weeg ook de beperkingen mee. Fugu Ultra v2 wordt niet verkocht in de EU of de EER, en Sakana zegt expliciet dat het werkt aan GDPR-naleving. Gemini 3.1 Pro heeft geen dergelijke beperking en een veel langere staat van dienst op het gebied van onafhankelijke evaluatie.

Het vonnis
Voor de meeste multimodale taken is Gemini 3.1 Pro de juiste keuze, en dat is niet eens een moeilijke beslissing. Het is goedkoper per token, goedkoper per document, gedocumenteerd voor audio en video, begrensd op een contextdrempel die je rekening niet halverwege een run verdubbelt, en — het deel dat hier het belangrijkst is — je kunt zien welk model je heeft geantwoord. Als je één model nodig hebt om een PDF te lezen, een clip te bekijken en een vraag te beantwoorden, is er geen enkel argument om dat via een niet-bekendgemaakte pool te routeren tegen tweeënhalf keer de outputprijs.
Fugu Ultra v2 is de juiste keuze voor een specifieke en veel nauwere vorm van werk: langetermijntaken met een controleerbaar antwoord, waarbij een probleem op drie manieren aanpakken en het resultaat verifiëren beter is dan het één keer proberen, en waarbij de marginale kwaliteitswinst de meervoudige inzet waard is. Het valt volledig buiten beschouwing als je EU- of EER-gebruikers binnen je scope hebt.
De ongemakkelijke vraag die de match-up openlaat, is degene die niemand heeft gemeten. Als Gemini 3.1 Pro in de pool zit — en het enige eerlijke antwoord vandaag is dat Sakana niet heeft gezegd dat het niet zo is — dan is een deel van wat je met Fugu Ultra v2 koopt, Gemini 3.1 Pro met een coördinatielaag erbovenop, tegen een prijs die suggereert dat de laag ongeveer tweeënhalf keer het model waard is. Dat kan heel goed waar zijn. Sakana's architectuur is gebouwd om dat waar te maken. Maar het is een hypothese met een scorebord van de leverancier erachter en geen onafhankelijke test, en totdat iemand die uitvoert, is het model dat je kunt zien het model dat je kunt verdedigen.
