Una card del titolo hero per Fugu Ultra v2 vs Gemini 3.1 Pro con il sottotitolo 'L'avversario che potrebbe già essere dentro la macchina', badge a pillola con scritto '$30.00 vs $12.00 output', 'CharXiv 86.6 vs 80.2 direzionale' e 'Pool non divulgato', una riga a piè di pagina 'Sakana AI vs Google DeepMind - Settembre 2026', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Fugu Ultra v2 vs Gemini 3.1 Pro: l'avversario che potrebbe già essere dentro la macchina

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Esiste una versione del confronto tra Fugu Ultra v2 e Gemini 3.1 Pro in cui Gemini vince in qualunque modo vada il benchmark — perché potrebbe svolgere parte del lavoro. Il sistema di orchestrazione di Sakana AI, rilasciato l'11 settembre 2026, non divulga quali modelli coordini; il pool riportato del Fugu Ultra di giugno includeva, tra gli altri, Gemini 3.1 Pro, e la versione 2.0 ci dice solo ciò che ha rimosso, indicando Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra come esclusi. Gemini 3.1 Pro di Google è un singolo modello multimodale di frontiera con una finestra di contesto da 1M di token che gestisce testo, immagini, PDF, audio e video, disponibile in generale da maggio 2026 a 2,00 $ per milione di input e 12,00 $ per milione di output. Uno di questi è un modello che puoi ispezionare. L'altro è un sistema le cui vittorie nei benchmark potrebbero passare attraverso il primo, e nessuno dei due fornitori ti dirà se ciò accade.

Che cos'è in realtà ciascun sistema

Gem​ini 3.1 Pro è leggibile in un modo che è diventato raro tra i rilasci di frontiera. È un transformer sparse mixture-of-experts di Goo​gle DeepMind, rilasciato per la prima volta in anteprima il 19 febbraio 2026, con una fonte che data la disponibilità generale a maggio 2026 — la nostra scheda lo riporta sotto l'ID del modello di anteprima. Ha una finestra di input da 1M token e un tetto di output da 65K token, accetta testo, immagini, PDF, audio, video e codice, ed espone un controllo di ragionamento a tre livelli — basso, medio o alto — con alto come default dell'API. Goo​gle riporta 77,1% su ARC-AGI-2, più del doppio del 31,1% della generazione precedente; 94,3% su GPQA Diamond; 80,6% su SWE-bench Verified; 68,5% su Terminal-Bench 2.0; 85,9% su BrowseComp; e 44,4% su Humanity's Last Exam senza strumenti, salendo al 51,4% con ricerca ed esecuzione di codice. Queste sono cifre del fornitore. Il suo cutoff di conoscenza è gennaio 2025, il che vale la pena segnalare se il tuo lavoro dipende da eventi recenti.

Fugu Ultra v2 è un coordinatore. È un modello addestrato, riportato intorno ai 7B parametri, che legge una richiesta, assembla un team di agenti con i ruoli di Thinker, Worker e Verifier tratti dalla ricerca TRINITY di Sakana, e sintetizza una risposta dietro un endpoint compatibile con OpenAI. Non ha un elenco di modalità pubblicato proprio — tutto ciò che riesce a vedere, lo vede perché un modello nel suo pool può vederlo. Il suo contesto è di 1M token con un brusco salto di prezzo a 272K, dove le tariffe raddoppiano a 10 $ in input e 45 $ in output. Il suo tetto di output non è pubblicato. Il suo pool non è divulgato, le sue decisioni di routing "non sono esposte per scelta progettuale", e per il livello Ultra il pool è fisso, quindi non puoi escludere un provider.

Quell'asimmetria è l'intero confronto. Gem​ini 3.1 Pro è un componente che puoi acquistare direttamente e su cui puoi ragionare. Fugu Ultra v2 è un assemblaggio di cui non puoi vedere le parti e le cui più forti affermazioni sui benchmark possono essere, in parte, i risultati di Gem​ini stesso combinati con quelli di qualcun altro.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Il confronto in cui i due si sovrappongono

Ben poco delle prove pubblicate allinea i due sistemi sulla stessa riga. I dati di Gem​ini 3.1 Pro riportati di seguito sono quelli di Goo​gle; quelli di Fugu Ultra v2 sono di Sakana; laddove un aggregatore di terze parti ha pubblicato una riga condivisa, questa è contrassegnata e accompagnata da un'avvertenza sul fatto che è indicativa più che decisiva.

• Ragionamento multimodale (CharXiv, riga condivisa) — Fugu Ultra v2 86,6% vs Gemini 3.1 Pro 80,2%, secondo BenchLM, che etichetta la categoria come indicativa e si astiene dal dichiarare un vincitore

• TerminalBench 2.1 — nessun dato per Fugu Ultra v2 v2.0 vs Gem​ini 3.1 Pro, nessuna cifra pubblicata comparabile; il Fugu Ultra di giugno ha riportato 82,1% contro il 70,3% di Gem​ini 3.1 Pro in un'aggregazione di terze parti

• SWE-Bench Pro — nessun valore per Fugu Ultra v2 v2.0 rispetto a Gem​ini 3.1 Pro; nessun dato pubblicato comparabile; il Fugu Ultra di giugno ha riportato il 73,7% contro il 54,2% di Gem​ini 3.1 Pro

• ARC-AGI-2 — nessun dato per Fugu Ultra v2 vs Gem​ini 3.1 Pro 77,1%, riportato dal fornitore

• Humanity's Last Exam — nessun dato per Fugu Ultra v2 v2.0 rispetto a Gem​ini 3.1 Pro: 44,4% senza strumenti, 51,4% con, riportato dal fornitore

• Copertura delle modalità — Fugu Ultra v2 eredita qualunque cosa supporti il suo pool, non divulgata rispetto a Gem​ini 3.1 Pro: testo, immagine, PDF, audio, video e codice, documentati

• Prezzo input / output — Fugu Ultra v2 5,00 $ / 30,00 $ per 1M, raddoppia oltre 272K rispetto a Gem​ini 3.1 Pro 2,00 $ / 12,00 $ per 1M fino a 200K, 4,00 $ / 18,00 $ oltre, input in cache 0,20 $ / 0,40 $

• Contesto e output — Fugu Ultra v2: contesto da 1M, limite massimo di output non pubblicato vs Gem​ini 3.1 Pro: input da 1M, output da 65K

• Pesi e accesso — Fugu Ultra v2 chiuso, UE/SEE esclusi vs Gemini 3.1 Pro proprietario ma ampiamente disponibile su tutte le superfici Google

La riga multimodale è quella da gestire con attenzione, perché è la più citata e la meno solida. L'aggregazione CharXiv di BenchLM pone Fugu Ultra v2 in vantaggio di 6,4 punti normalizzati — e la stessa pagina afferma chiaramente che le righe direzionali non ricevono mai un vincitore, che Gem​ini non aveva risultati misurati nelle categorie agentiche, di programmazione, di conoscenza o multilingue, e che Fugu non ne aveva in matematica o multilingua. Una categoria in cui, nella maggior parte delle righe, è stato misurato solo un lato non può produrre un verdetto. Se non trai nient'altro da questo confronto, trai questo: specificamente sul lavoro multimodale, le evidenze pubblicate non supportano una conclusione in un senso o nell'altro, e l'unica riga che esiste è esplicitamente non un risultato consolidato.

La possibilità che cambia la cornice

Sakana non dirà cosa c'è nel pool. Si tratta di una scelta progettuale documentata, non di una svista: le FAQ affermano che le informazioni di routing non vengono esposte per scelta progettuale, e non esiste alcun meccanismo per ispezionarle. Quello che sappiamo dalla generazione di giugno è che tra i membri del pool segnalati figuravano Gemini 3.1 Pro insieme ad altri modelli di frontiera. La versione 2.0 ha cambiato il pool, e Sakana ha descritto il cambiamento solo per sottrazione: Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra sono fuori. Nulla nel comunicato dice che Gemini sia ancora dentro.

Se Gemini 3.1 Pro è nel pool, seguono tre conseguenze, e tutte e tre sono pratiche anziché filosofiche. Primo, una quota delle prestazioni multimodali di Fugu Ultra v2 è costituita dalle prestazioni di Gemini, combinate con quelle di altri modelli — il che significa che stai pagando un sovrapprezzo di coordinamento in aggiunta a una tariffa per token che potresti pagare direttamente. Secondo, Fugu Ultra v2 a 30 $ di output per milione contro Gemini 3.1 Pro a 12 $ è un sovrapprezzo per l'assemblaggio, non per la capacità grezza; se il tuo compito è una singola domanda multimodale, Gemini risponde a un costo inferiore e puoi vedere esattamente quale modello ha risposto. Terzo, e cosa più utile, il benchmark onesto di un orchestratore non è "batte i suoi componenti" ma "batte il suo componente migliore quando lo usi da solo". L'architettura di Sakana si basa sull'affermazione che lo fa, su compiti verificabili. Vale la pena testare tale affermazione sul tuo carico di lavoro prima di accettarla su un benchmark di lettura di grafici.

Esiste una versione in cui la risposta è no e l'orchestratore si guadagna comunque il suo posto. Se Gemini è nel pool e il punteggio Chartography di Fugu Ultra v2, 48,3 contro il 27,3 di Claude Opus 5, regge, allora quello che Sakana ha costruito è uno strato di coordinamento che riesce in modo affidabile a ottenere di più dallo stesso modello di quanto si ottenga chiamandolo una volta sola. È un prodotto vero, e la questione aperta è solo se il margine copra il prezzo. Nessuno ha pubblicato l'esperimento.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

Dove sono i margini onesti

I vantaggi di Gem​ini 3.1 Pro sono concreti. Costa circa due quinti del prezzo di Fugu Ultra v2 in input e output e, a differenza di Fugu, le sue tariffe non raddoppiano oltre una soglia di contesto — il salto a 200K è più graduale del precipizio a 272K. Documenta le sue modalità invece di ereditarle, il che significa che il lavoro su audio e video è una funzionalità supportata anziché una speranza. Ha un limite di output pubblicato. È disponibile tramite le superfici di Goo​gle e, come gli altri modelli con cui Fugu Ultra v2 viene confrontato, è invocabile su OrcaRouter — come google/gemini-3.1-pro-preview, al prezzo di listino di Goo​gle con 0% di ricarico, così una variazione di prezzo di Goo​gle arriva sulla stessa chiave lo stesso giorno in cui viene annunciata.

I vantaggi di Fugu Ultra v2 sono più limitati e reali. Attacca un problema difficile più di una volta, con un ruolo di Verifier che controlla il lavoro, ed è per questo che le sue affermazioni più forti si basano su benchmark in cui la correttezza è verificabile — Chartography, DeepSWE, Toolathon — piuttosto che sul richiamo di conoscenze. Anche gli studi di caso pubblicati da Sakana vanno nella stessa direzione: un'iride CAD meccanica che si apre e si chiude correttamente dove altri modelli lasciavano lacune e collegamenti deboli; un risolutore di cubi di Rubik in puro Python che completa tutti e 300 i cubi mescolati dove due baseline frontier anonimizzate si sono bloccate del tutto. Quelle baseline sono anonimizzate e scelte dal fornitore, quindi vanno considerate come illustrazione e non come prova. Ma il pattern è coerente lungo tutta la release, e descrive una capacità autentica che una singola chiamata a un modello non possiede: la persistenza su un problema finché la risposta non supera un controllo.

Soppesa anche i vincoli. Fugu Ultra v2 non è venduto nell'UE né nello SEE, e Sakana dichiara esplicitamente di lavorare per la conformità al GDPR. Gem​ini 3.1 Pro non ha questa restrizione e ha alle spalle una storia molto più lunga di valutazioni indipendenti.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Il verdetto

Per la maggior parte del lavoro multimodale, Gemini 3.1 Pro è la scelta giusta, e non c'è partita. È più economico per token, più economico per documento, documentato per audio e video, limitato a una soglia di contesto che non raddoppia la fattura a metà esecuzione e — la parte che conta di più qui — puoi vedere cosa ti ha risposto. Se ti serve un solo modello per leggere un PDF, guardare una clip e rispondere a una domanda, non c'è alcun motivo per instradare tutto ciò attraverso un pool non dichiarato a due volte e mezzo il prezzo di output.

Fugu Ultra v2 è la scelta giusta per una forma di lavoro specifica e molto più ristretta: attività a lungo orizzonte con una risposta verificabile, in cui provare a risolvere un problema in tre modi e verificare il risultato batte provarlo una volta sola, e in cui il punto di qualità marginale vale il costo multiplo. È del tutto fuori considerazione se hai utenti UE o SEE nel tuo ambito.

La scomoda domanda che il confronto lascia aperta è quella che nessuno ha misurato. Se Gem​ini 3.1 Pro è dentro il pool — e l'unica risposta onesta oggi è che Sakana non ha detto che non lo è — allora parte di ciò che acquisti con Fugu Ultra v2 è Gem​ini 3.1 Pro con sopra un livello di coordinamento, a un prezzo che implica che il livello valga circa due volte e mezzo il modello. Può benissimo essere vero. L'architettura di Sakana è stata costruita per renderlo vero. Ma è un'ipotesi con dietro il tabellone di un fornitore e nessun test indipendente, e finché qualcuno non lo esegue, il modello che puoi vedere è quello che puoi difendere.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno