Una card del titolo hero per Fugu Ultra v2 intitolata 'Fugu Ultra v2' con il sottotitolo 'Il pool si è ristretto e il punteggio è salito', badge a pillola con la scritta 'Chartography 48.3', 'DeepSWE 74.3' e '$5 / $30 per 1M', una riga di footer 'Sakana AI - rilasciato l'11 settembre 2026', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Sakana Fugu Ultra v2, spiegato: il pool si è ridotto e il punteggio è salito

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Fugu Ultra v2 è una strana forma di aggiornamento: Sakana AI l'ha rilasciato l'11 settembre 2026 con un pool di modelli che non contiene più Claude Fable 5, Claude Fable 5.1 o GPT-6 Astra — tre dei sistemi più forti attualmente in distribuzione — e continua a dichiarare di batterli tutti e tre. Il nuovo modello di punta della fascia di qualità del laboratorio di Tokyo, pubblicato lo stesso giorno di un fratello più economico chiamato Fugu Max, è il migliore o a pari merito su cinque degli otto benchmark nella valutazione di Sakana stessa, inclusi 48,3 su Chartography contro Claude Opus 5 a 27,3 e Claude Fable 5 a 29,5, e 74,3 su DeepSWE. Nessuno di questi numeri è stato riprodotto in modo indipendente, e non esiste ancora una pagina di Artificial Analysis per alcun modello Fugu. È proprio questo divario il punto: quello che ti viene chiesto di comprare è un livello di coordinamento la cui intera proposta è che non ha bisogno dei modelli migliori per produrre le risposte migliori.

Sakana AI è stata fondata nel 2023 da Llion Jones, coautore del paper Transformer, e David Ha. La linea Fugu è stata lanciata a giugno 2026 come sistema multi-agente distribuito come modello unico: si chiama un singolo endpoint compatibile con OpenAI e, dietro di esso, un coordinatore addestrato scompone la richiesta, genera agenti e sintetizza il risultato. La ricerca è reale e pubblicata — TRINITY (arXiv 2512.04695) ha fatto evolvere un coordinatore leggero che assegna i ruoli di Thinker, Worker e Verifier; Conductor (arXiv 2512.04388) ha appreso il coordinamento in linguaggio naturale tra agenti; il rapporto tecnico di Fugu si trova su arXiv 2606.21228. Ciò che Sakana non ha mai pubblicato è proprio la cosa che tutti vogliono davvero: l'identità dei modelli nel pool e le decisioni di routing per singolo task.

Cosa è effettivamente cambiato rispetto al Fugu Ultra di giugno

La versione 2.0 è un aggiornamento incrementale circa undici settimane dopo l'originale, non una nuova architettura. La presentazione dello stesso fornitore è che Fugu Ultra v2 e Fugu Max siano "la stessa architettura di orchestrazione di base" ottimizzata per due missioni diverse: Max spinge più in basso la frontiera del rapporto costo-prestazioni, Ultra spinge più in alto la capacità di picco. L'ID del modello è fugu-ultra-v2.0, e Sakana afferma che migrare da un Fugu precedente è una modifica di un solo parametro, senza migrazione dell'SDK — che è l'aspetto più favorevole per il consumatore di questo rilascio.

Le modifiche sostanziali sono i due elementi che fanno da cornice. In primo luogo, il cutoff di addestramento è stato spostato al 20260828, quindi il coordinatore è stato ricalibrato rispetto alla generazione attuale di modelli di frontiera. In secondo luogo, e cosa molto più interessante, la composizione del pool è cambiata in un modo che Sakana ha scelto di pubblicizzare: Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra sono esplicitamente esclusi. L'argomento di Sakana è che ciò dimostra che i punteggi non dipendono da un singolo modello di frontiera proprietario, il che conta se la tua preoccupazione è il vendor lock-in, le revoche delle API o la scomparsa di un modello dietro controlli sulle esportazioni.

C'è una conseguenza di secondo ordine su cui Sakana non si sofferma. Se il pool esclude i tre modelli più forti disponibili, allora i confronti benchmark con Fable 5 e Fable 5.1 vengono effettuati rispetto a sistemi che l'orchestratore non potrebbe chiamare nemmeno se volesse. Il confronto è legittimo — è un'affermazione sull'architettura, non sull'accesso — ma non è un test omogeneo su chi abbia il modello migliore. È un test per stabilire se il coordinamento batte la capacità grezza. È una domanda davvero interessante. Semplicemente non è la domanda che il tabellone lascia intendere a colpo d'occhio.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

I numeri, e chi li ha prodotti

Ogni cifra in questa sezione è riportata dal fornitore. Sakana non ha rilasciato alcun sistema di valutazione, alcuna griglia di punteggi per attività e alcuna ricetta di riproduzione, e la progettazione dell'orchestrazione rende la replicazione indipendente più difficile anziché più facile: riprodurre un punteggio richiede l'accesso a ogni modello del pool alle stesse versioni e con la stessa topologia, e per concezione la topologia varia da richiesta a richiesta.

• Chartography (ragionamento visivo su grafici e documenti strutturati) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — dato dichiarato dal fornitore

• DeepSWE (ingegneria del software del mondo reale) — Fugu Ultra v2 74.3 — dichiarato dal fornitore, si dice che superi modelli che costano da tre a cinque volte di più per token

• Posizionamento migliore o a pari merito — cinque degli otto benchmark: GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon — dato dichiarato dal fornitore

• Posizionamento tra i primi due — sette benchmark su otto — dati dichiarati dal fornitore

• Precedente Fugu Ultra (giugno 2026, per confronto) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — riportato dal fornitore

La riga Chartography merita l'enfasi che sta ricevendo, perché è l'unica categoria in cui il divario rispetto a un flagship attuale e identificato non è marginale. Un divario di 21 punti su Claude Opus 5 in un benchmark di ragionamento visivo è il tipo di numero che di solito compare su una classifica indipendente nel giro di pochi giorni. Al momento in cui scrivo, non ne è apparsa nessuna. Tratta la riga come un'ipotesi con una cifra in dollari attaccata, non come un risultato definitivo.

Prezzi: invariati rispetto a giugno e decisamente cari sull'output

Fugu Ultra v2 costa $5 per milione di token di input, $30 per milione di token di output e $0,50 per milione di input in cache. Oltre 272.000 token di contesto, questi diventano rispettivamente $10, $45 e $1,00. Fugu Max ha una forma del tutto diversa: $2 di input, $6 di output, $0,25 in cache, tariffa fissa indipendentemente dalla lunghezza del contesto, più $0,007 per ogni ricerca web o chiamata di fetch.

Due cose in quella tabella dei prezzi meritano una lettura attenta. La prima è che l'output è sei volte l'input — un rapporto aggressivo che fa pagare la verbosità del modello, e l'orchestrazione è un business verboso. Un coordinatore che genera agenti e sintetizza le loro risposte emette molti token, e li paghi tutti a 30 $ per milione. L'affermazione di efficienza di Sakana riguarda il pool sottostante, non quanto testo il sistema produce per tuo conto, e sono numeri diversi. Fai il budget in base ai conteggi osservati dei token, non in base alla tariffa pubblicizzata.

Il secondo è il cliff dei 272K. Raddoppiare la tariffa per token al di sopra di una soglia è un modo legittimo di prezzare il lavoro a contesto lungo, ma significa che il costo effettivo di un'esecuzione di un agente a contesto lungo non è il numero riportato nella pagina dei prezzi. Se il tuo carico di lavoro si trova vicino al limite, l'aritmetica cambia in modo sostanziale da entrambe le parti.

I livelli di abbonamento di Fugu — Standard a 20 $, Pro a 100 $, Max a 200 $ al mese, con quote di utilizzo di 10x e 20x — includono tutti l'accesso a Fugu, Fugu Ultra e Fugu Max. Sakana determina inoltre il prezzo del modello Fugu base in base al livello più alto presente nel pool per una determinata richiesta, e afferma chiaramente che aggiungere più agenti non moltiplica la fattura. Questa è una vera differenza rispetto al modello di costo fan-out che otterresti chiamando tu stesso diversi modelli di frontiera.

Quello che Sakana non ti dirà

Chiedi quali modelli hanno risposto alla tua domanda e le FAQ sono dirette: "queste informazioni di routing non sono esposte per scelta progettuale." I pool Ultra e Max sono fissi, quindi non puoi escludere un fornitore; solo il modello base Fugu supporta opt-out per modello nelle impostazioni della console. I clienti Enterprise possono negoziare configurazioni personalizzate.

Quell'opacità è il fulcro delle critiche che la linea Fugu ha attirato da giugno, ed è una critica equa più che ostile. Quando un orchestratore ottiene un buon punteggio combinando i modelli di altri laboratori, il punteggio appartiene al sistema — che è una cosa reale e difendibile da vendere — ma non si trasferisce a nessun singolo modello e non può essere sottoposto ad audit. I recensori hanno fatto notare il punto senza mezzi termini: Fugu non ha battuto il modello di punta, l'ha ingaggiato. Nelle attività verificabili con un verificatore a basso costo, come un benchmark di programmazione con una suite di test, un comitato può davvero superare il suo membro migliore. Nelle attività senza uno, un panel che campiona diversi modelli di frontiera e riporta il risultato migliore sta in parte riportando la fortuna. Le scelte di categoria di Sakana stessa — Chartography, DeepSWE, Toolathon — pendono verso l'estremo verificabile, che è il posto giusto per formulare l'affermazione e anche la ragione per cui l'affermazione non può essere generalizzata a costo zero.

Anche i tester indipendenti hanno segnalato la variabilità della latenza come costo pratico dell’orchestrazione: sui compiti difficili il coordinatore delibera, mentre sui compiti facili tale deliberazione è puro sovraccarico. Secondo quanto riferito, il compito di shader di un ricercatore ha richiesto circa trenta minuti, con una qualità giudicata solo accettabile.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Dove puoi effettivamente trovarlo

Fugu Ultra v2 è ora disponibile tramite l'API compatibile con OpenAI di Sakana stessa — basta puntare un client esistente all'endpoint con una chiave API e modificare una riga — e tramite diverse piattaforme di terze parti. OrcaRouter non offre i modelli Fugu; se vuoi chiamare Fugu Ultra v2, l'API dello stesso fornitore è la via diretta.

Vale la pena notare l'alternativa con cui Sakana sta implicitamente competendo. Il pool che fa funzionare Fugu Ultra v2 è composto da modelli che oggi sono richiamabili individualmente, e gli avversari con cui viene misurato sono quelli che i team già utilizzano. Claude Opus 5, DeepSeek V4 Pro e Gem​ini 3.1 Pro sono tutti su OrcaRouter ai prezzi di listino dei rispettivi fornitori con 0% di ricarico, il che significa che un taglio di prezzo da parte di uno di quei fornitori è attivo dalla nostra parte lo stesso giorno in cui viene annunciato. Se il motivo per cui stai considerando un orchestratore è la resilienza — non voler che un percorso di produzione dipenda dall'uptime di un fornitore o dalla politica di un fornitore — allora un livello di routing con failover automatico tra fornitori risolve parte di quel problema a livello di modello, e Fugu Ultra v2 risolve una parte diversa a livello di ragionamento. Un'unica API per oltre 200 modelli con failover non è un sostituto di un coordinatore addestrato, e un coordinatore addestrato non è un sostituto del non dipendere da un unico fornitore. Alcuni team vorranno entrambe le cose.

L'inghippo della conformità

Fugu non è disponibile nell'Unione europea né nello Spazio economico europeo. La formulazione del fornitore è esplicita: non ancora disponibile nell'UE/SEE mentre lavora per conformarsi al GDPR e alle normative specifiche dell'UE, e altrove l'accesso può essere limitato da condizioni di rete o da regole locali. Se la tua organizzazione ha entità UE nell'ambito di applicazione, questo esclude la linea Fugu da ogni considerazione a prescindere dalle prestazioni nei benchmark, cosa che è utile sapere prima della valutazione anziché dopo.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

Cosa guardare

Tre cose farebbero passare Fugu Ultra v2 da un'affermazione interessante a una scelta portante. Una valutazione indipendente — una voce in Artificial Analysis, un posizionamento in LMArena, qualsiasi cosa con un harness alle spalle — risolverebbe la questione Chartography in una settimana. Numeri riprodotti da una terza parte sui benchmark di coding verificabili confermerebbero il guadagno a livello di sistema che l'architettura prevede. E un pool divulgato, o anche solo parziale, permetterebbe agli acquirenti di ragionare esattamente su quali singoli punti di guasto stanno accettando quando instradano il traffico di produzione attraverso un coordinatore che non possono ispezionare.

Fino ad allora, la posizione onesta è questa. Fugu Ultra v2 è il tentativo più serio finora di vendere l'orchestrazione come prodotto anziché come demo di ricerca, da un laboratorio con pubblicazioni alle spalle, a un prezzo che rende esplicito, anziché nascosto, il sovrapprezzo per l'orchestrazione. Se il vostro carico di lavoro è a lungo orizzonte, verificabile e limitato a una regione in cui Sakana può fornirvi il servizio, vale la pena avviare un pilot circoscritto con la contabilizzazione dei token attivata. In caso contrario, i modelli con cui Fugu Ultra v2 viene misurato sono a una chiamata API di distanza, al prezzo di listino, con le prove per dimostrare ciò che possono fare.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno