
Fugu Ultra v2 vs Gemini 3.1 Pro: l'avversario che potrebbe già essere dentro la macchina
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Esiste una versione del confronto tra Fugu Ultra v2 e Gemini 3.1 Pro in cui Gemini vince in qualunque modo vada il benchmark — perché potrebbe svolgere parte del lavoro. Il sistema di orchestrazione di Sakana AI, rilasciato l'11 settembre 2026, non divulga quali modelli coordini; il pool riportato del Fugu Ultra di giugno includeva, tra gli altri, Gemini 3.1 Pro, e la versione 2.0 ci dice solo ciò che ha rimosso, indicando Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra come esclusi. Gemini 3.1 Pro di Google è un singolo modello multimodale di frontiera con una finestra di contesto da 1M di token che gestisce testo, immagini, PDF, audio e video, disponibile in generale da maggio 2026 a 2,00 $ per milione di input e 12,00 $ per milione di output. Uno di questi è un modello che puoi ispezionare. L'altro è un sistema le cui vittorie nei benchmark potrebbero passare attraverso il primo, e nessuno dei due fornitori ti dirà se ciò accade.
Che cos'è in realtà ciascun sistema
Gemini 3.1 Pro è leggibile in un modo che è diventato raro tra i rilasci di frontiera. È un transformer sparse mixture-of-experts di Google DeepMind, rilasciato per la prima volta in anteprima il 19 febbraio 2026, con una fonte che data la disponibilità generale a maggio 2026 — la nostra scheda lo riporta sotto l'ID del modello di anteprima. Ha una finestra di input da 1M token e un tetto di output da 65K token, accetta testo, immagini, PDF, audio, video e codice, ed espone un controllo di ragionamento a tre livelli — basso, medio o alto — con alto come default dell'API. Google riporta 77,1% su ARC-AGI-2, più del doppio del 31,1% della generazione precedente; 94,3% su GPQA Diamond; 80,6% su SWE-bench Verified; 68,5% su Terminal-Bench 2.0; 85,9% su BrowseComp; e 44,4% su Humanity's Last Exam senza strumenti, salendo al 51,4% con ricerca ed esecuzione di codice. Queste sono cifre del fornitore. Il suo cutoff di conoscenza è gennaio 2025, il che vale la pena segnalare se il tuo lavoro dipende da eventi recenti.
Fugu Ultra v2 è un coordinatore. È un modello addestrato, riportato intorno ai 7B parametri, che legge una richiesta, assembla un team di agenti con i ruoli di Thinker, Worker e Verifier tratti dalla ricerca TRINITY di Sakana, e sintetizza una risposta dietro un endpoint compatibile con OpenAI. Non ha un elenco di modalità pubblicato proprio — tutto ciò che riesce a vedere, lo vede perché un modello nel suo pool può vederlo. Il suo contesto è di 1M token con un brusco salto di prezzo a 272K, dove le tariffe raddoppiano a 10 $ in input e 45 $ in output. Il suo tetto di output non è pubblicato. Il suo pool non è divulgato, le sue decisioni di routing "non sono esposte per scelta progettuale", e per il livello Ultra il pool è fisso, quindi non puoi escludere un provider.
Quell'asimmetria è l'intero confronto. Gemini 3.1 Pro è un componente che puoi acquistare direttamente e su cui puoi ragionare. Fugu Ultra v2 è un assemblaggio di cui non puoi vedere le parti e le cui più forti affermazioni sui benchmark possono essere, in parte, i risultati di Gemini stesso combinati con quelli di qualcun altro.

Il confronto in cui i due si sovrappongono
Ben poco delle prove pubblicate allinea i due sistemi sulla stessa riga. I dati di Gemini 3.1 Pro riportati di seguito sono quelli di Google; quelli di Fugu Ultra v2 sono di Sakana; laddove un aggregatore di terze parti ha pubblicato una riga condivisa, questa è contrassegnata e accompagnata da un'avvertenza sul fatto che è indicativa più che decisiva.
• Ragionamento multimodale (CharXiv, riga condivisa) — Fugu Ultra v2 86,6% vs Gemini 3.1 Pro 80,2%, secondo BenchLM, che etichetta la categoria come indicativa e si astiene dal dichiarare un vincitore
• TerminalBench 2.1 — nessun dato per Fugu Ultra v2 v2.0 vs Gemini 3.1 Pro, nessuna cifra pubblicata comparabile; il Fugu Ultra di giugno ha riportato 82,1% contro il 70,3% di Gemini 3.1 Pro in un'aggregazione di terze parti
• SWE-Bench Pro — nessun valore per Fugu Ultra v2 v2.0 rispetto a Gemini 3.1 Pro; nessun dato pubblicato comparabile; il Fugu Ultra di giugno ha riportato il 73,7% contro il 54,2% di Gemini 3.1 Pro
• ARC-AGI-2 — nessun dato per Fugu Ultra v2 vs Gemini 3.1 Pro 77,1%, riportato dal fornitore
• Humanity's Last Exam — nessun dato per Fugu Ultra v2 v2.0 rispetto a Gemini 3.1 Pro: 44,4% senza strumenti, 51,4% con, riportato dal fornitore
• Copertura delle modalità — Fugu Ultra v2 eredita qualunque cosa supporti il suo pool, non divulgata rispetto a Gemini 3.1 Pro: testo, immagine, PDF, audio, video e codice, documentati
• Prezzo input / output — Fugu Ultra v2 5,00 $ / 30,00 $ per 1M, raddoppia oltre 272K rispetto a Gemini 3.1 Pro 2,00 $ / 12,00 $ per 1M fino a 200K, 4,00 $ / 18,00 $ oltre, input in cache 0,20 $ / 0,40 $
• Contesto e output — Fugu Ultra v2: contesto da 1M, limite massimo di output non pubblicato vs Gemini 3.1 Pro: input da 1M, output da 65K
• Pesi e accesso — Fugu Ultra v2 chiuso, UE/SEE esclusi vs Gemini 3.1 Pro proprietario ma ampiamente disponibile su tutte le superfici Google
La riga multimodale è quella da gestire con attenzione, perché è la più citata e la meno solida. L'aggregazione CharXiv di BenchLM pone Fugu Ultra v2 in vantaggio di 6,4 punti normalizzati — e la stessa pagina afferma chiaramente che le righe direzionali non ricevono mai un vincitore, che Gemini non aveva risultati misurati nelle categorie agentiche, di programmazione, di conoscenza o multilingue, e che Fugu non ne aveva in matematica o multilingua. Una categoria in cui, nella maggior parte delle righe, è stato misurato solo un lato non può produrre un verdetto. Se non trai nient'altro da questo confronto, trai questo: specificamente sul lavoro multimodale, le evidenze pubblicate non supportano una conclusione in un senso o nell'altro, e l'unica riga che esiste è esplicitamente non un risultato consolidato.
La possibilità che cambia la cornice
Sakana non dirà cosa c'è nel pool. Si tratta di una scelta progettuale documentata, non di una svista: le FAQ affermano che le informazioni di routing non vengono esposte per scelta progettuale, e non esiste alcun meccanismo per ispezionarle. Quello che sappiamo dalla generazione di giugno è che tra i membri del pool segnalati figuravano Gemini 3.1 Pro insieme ad altri modelli di frontiera. La versione 2.0 ha cambiato il pool, e Sakana ha descritto il cambiamento solo per sottrazione: Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra sono fuori. Nulla nel comunicato dice che Gemini sia ancora dentro.
Se Gemini 3.1 Pro è nel pool, seguono tre conseguenze, e tutte e tre sono pratiche anziché filosofiche. Primo, una quota delle prestazioni multimodali di Fugu Ultra v2 è costituita dalle prestazioni di Gemini, combinate con quelle di altri modelli — il che significa che stai pagando un sovrapprezzo di coordinamento in aggiunta a una tariffa per token che potresti pagare direttamente. Secondo, Fugu Ultra v2 a 30 $ di output per milione contro Gemini 3.1 Pro a 12 $ è un sovrapprezzo per l'assemblaggio, non per la capacità grezza; se il tuo compito è una singola domanda multimodale, Gemini risponde a un costo inferiore e puoi vedere esattamente quale modello ha risposto. Terzo, e cosa più utile, il benchmark onesto di un orchestratore non è "batte i suoi componenti" ma "batte il suo componente migliore quando lo usi da solo". L'architettura di Sakana si basa sull'affermazione che lo fa, su compiti verificabili. Vale la pena testare tale affermazione sul tuo carico di lavoro prima di accettarla su un benchmark di lettura di grafici.
Esiste una versione in cui la risposta è no e l'orchestratore si guadagna comunque il suo posto. Se Gemini è nel pool e il punteggio Chartography di Fugu Ultra v2, 48,3 contro il 27,3 di Claude Opus 5, regge, allora quello che Sakana ha costruito è uno strato di coordinamento che riesce in modo affidabile a ottenere di più dallo stesso modello di quanto si ottenga chiamandolo una volta sola. È un prodotto vero, e la questione aperta è solo se il margine copra il prezzo. Nessuno ha pubblicato l'esperimento.

Dove sono i margini onesti
I vantaggi di Gemini 3.1 Pro sono concreti. Costa circa due quinti del prezzo di Fugu Ultra v2 in input e output e, a differenza di Fugu, le sue tariffe non raddoppiano oltre una soglia di contesto — il salto a 200K è più graduale del precipizio a 272K. Documenta le sue modalità invece di ereditarle, il che significa che il lavoro su audio e video è una funzionalità supportata anziché una speranza. Ha un limite di output pubblicato. È disponibile tramite le superfici di Google e, come gli altri modelli con cui Fugu Ultra v2 viene confrontato, è invocabile su OrcaRouter — come google/gemini-3.1-pro-preview, al prezzo di listino di Google con 0% di ricarico, così una variazione di prezzo di Google arriva sulla stessa chiave lo stesso giorno in cui viene annunciata.
I vantaggi di Fugu Ultra v2 sono più limitati e reali. Attacca un problema difficile più di una volta, con un ruolo di Verifier che controlla il lavoro, ed è per questo che le sue affermazioni più forti si basano su benchmark in cui la correttezza è verificabile — Chartography, DeepSWE, Toolathon — piuttosto che sul richiamo di conoscenze. Anche gli studi di caso pubblicati da Sakana vanno nella stessa direzione: un'iride CAD meccanica che si apre e si chiude correttamente dove altri modelli lasciavano lacune e collegamenti deboli; un risolutore di cubi di Rubik in puro Python che completa tutti e 300 i cubi mescolati dove due baseline frontier anonimizzate si sono bloccate del tutto. Quelle baseline sono anonimizzate e scelte dal fornitore, quindi vanno considerate come illustrazione e non come prova. Ma il pattern è coerente lungo tutta la release, e descrive una capacità autentica che una singola chiamata a un modello non possiede: la persistenza su un problema finché la risposta non supera un controllo.
Soppesa anche i vincoli. Fugu Ultra v2 non è venduto nell'UE né nello SEE, e Sakana dichiara esplicitamente di lavorare per la conformità al GDPR. Gemini 3.1 Pro non ha questa restrizione e ha alle spalle una storia molto più lunga di valutazioni indipendenti.

Il verdetto
Per la maggior parte del lavoro multimodale, Gemini 3.1 Pro è la scelta giusta, e non c'è partita. È più economico per token, più economico per documento, documentato per audio e video, limitato a una soglia di contesto che non raddoppia la fattura a metà esecuzione e — la parte che conta di più qui — puoi vedere cosa ti ha risposto. Se ti serve un solo modello per leggere un PDF, guardare una clip e rispondere a una domanda, non c'è alcun motivo per instradare tutto ciò attraverso un pool non dichiarato a due volte e mezzo il prezzo di output.
Fugu Ultra v2 è la scelta giusta per una forma di lavoro specifica e molto più ristretta: attività a lungo orizzonte con una risposta verificabile, in cui provare a risolvere un problema in tre modi e verificare il risultato batte provarlo una volta sola, e in cui il punto di qualità marginale vale il costo multiplo. È del tutto fuori considerazione se hai utenti UE o SEE nel tuo ambito.
La scomoda domanda che il confronto lascia aperta è quella che nessuno ha misurato. Se Gemini 3.1 Pro è dentro il pool — e l'unica risposta onesta oggi è che Sakana non ha detto che non lo è — allora parte di ciò che acquisti con Fugu Ultra v2 è Gemini 3.1 Pro con sopra un livello di coordinamento, a un prezzo che implica che il livello valga circa due volte e mezzo il modello. Può benissimo essere vero. L'architettura di Sakana è stata costruita per renderlo vero. Ma è un'ipotesi con dietro il tabellone di un fornitore e nessun test indipendente, e finché qualcuno non lo esegue, il modello che puoi vedere è quello che puoi difendere.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
