Una card con titolo hero per "Fugu Max vs Claude Opus 5" con il sottotitolo "Quattro volte più economico, e un numero che nessuno ha pubblicato", tre badge a pillola che recitano $6.00 vs $25.00 output", "Sei vittorie, zero punteggi", "$2.00 vs $5.00 input, una riga di footer che recita "Sakana AI vs Anthropic - Settembre 2026", e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Fugu Max vs Claude Opus 5: quattro volte più economico, e un numero che nessuno ha pubblicato

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Produrre un milione di token di output con Fugu Max costa 6,00 $. Claude Opus 5 costa 25,00 $. Sakana AI ha lanciato Fugu Max l'11 settembre 2026 come coordinatore che indirizza ogni attività al modello più snello del suo pool, e lo ha prezzato in modo così aggressivo che un divario di output di quattro volte rispetto al flagship di Anth​ropic è il fatto principale del lancio. Ciò che il lancio non contiene è un singolo numero che descriva quanto Fugu Max performi davvero. Sakana afferma che ottiene il "miglior punteggio complessivo" su sei benchmark e amplia la frontiera costo-prestazioni su sette su dieci: affermazioni sulla posizione in un grafico, non su valori lungo un asse. Claude Opus 5, al contrario, arriva con un punteggio pubblicato per quasi tutto ciò che fa. Quindi la versione onesta di questo confronto non è economico contro costoso. È misurato contro asserito, ed è il divario di prezzo a rendere quella contrapposizione meritevole di discussione.

Il divario, e il confronto che Sakana ha scelto di non fare

La pagina di rilascio di Sakana giustifica la tariffa di output di Fugu Max confrontandola con altri modelli. I tre che nomina sono Claude Sonnet 5, GPT-5.6 Terra e Kimi K3, e l'affermazione è che il prezzo di output di Fugu Max è inferiore a questi ultimi dal 40 al 60 percento. Nota chi è assente. Claude Opus 5 non è in quell'elenco, e la ragione è aritmetica: a $6.00 contro $25.00, Fugu Max non costa il 40 percento in meno di Opus 5, ma il 76 percento in meno. Citare Opus 5 avrebbe fatto sembrare l'affermazione implausibile piuttosto che competitiva, quindi il confronto viene effettuato con il livello inferiore all'ammiraglia.

Non è una critica al prezzo, che è davvero basso. È un'osservazione su ciò che sta facendo la frase circostante. L'inquadramento di Sakana stesso — prestazioni «a un passo dai modelli d'élite, a un costo da due a sei volte inferiore» — è tarato sui modelli che ha scelto di nominare. Rispetto a Claude Opus 5 il multiplo non è da due a sei, è oltre quattro sull'output; se Opus 5 sia ancora un «modello d'élite» secondo i criteri di quella frase non viene dichiarato, il che è un'omissione curiosa in un comunicato il cui intero messaggio è l'efficienza costo-prestazioni alla frontiera.

• Prezzo di input — Fugu Max $2,00 per 1M token vs Claude Opus 5 $5,00 per 1M token

• Prezzo dell'output — Fugu Max 6,00 $ per 1 milione di token vs Claude Opus 5 25,00 $ per 1 milione di token

• Input in cache — Fugu Max 0,25 $ per 1M token contro il caching di Claude Opus 5, prezzato come uno sconto fino al 90% sull'input in cache

• Punteggi benchmark — Fugu Max: nessuno pubblicato, sei vittorie in benchmark dichiarate senza cifre contro Claude Opus 5, per cui Anthropic riporta 96,0% SWE-bench Verified, 79,2% SWE-bench Pro, circa 30,2% su ARC-AGI 3

• Architettura — Fugu Max, un coordinatore addestrato su un pool non divulgato, vs Claude Opus 5, un singolo modello fissabile per versione

• Contesto — Fugu Max non pubblicato vs Claude Opus 5 1M token, con un tetto di output di 128K

• Valutazione indipendente — Fugu Max: non ne esiste alcuna per nessun modello Fugu, a differenza dei 5 mesi di posizionamenti di Claude Opus in classifiche di terze parti

Sei vittorie senza punteggi associati

I sei benchmark sono Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Cinque di questi sono valutazioni pubbliche riconoscibili. Il sesto, SWEFish, è il benchmark di programmazione di Sakana, il che significa che una delle sei vittorie viene assegnata in base a un test scritto dall'azienda e non pubblicato.

Per gli altri cinque, il comunicato dichiara che Fugu Max ottiene il punteggio complessivo migliore senza specificare quale sia tale punteggio, né quanto abbia ottenuto qualsiasi concorrente. È una forma insolita per l'annuncio di un modello. I fornitori tendono abitualmente a esagerare, ma di solito esagerano con i numeri, perché i numeri sono la cosa che circola. Un comunicato che rivendica sei vittorie e non ne riporta nemmeno una chiede di essere preso sulla fiducia, solo in base all'affermazione.

Esiste una lettura caritatevole, e vale la pena enunciarla chiaramente. Fugu Max è un coordinatore ottimizzato per i costi, non una spinta sulle capacità — Sakana lo ha rilasciato lo stesso giorno di Fugu Ultra v2, la versione pensata per la massima capacità a $5,00 in input e $30,00 in output. Il compito di Max è raggiungere una qualità accettabile a $6,00 in output, e il punteggio principale di un orchestratore è meno significativo del suo punteggio per dollaro, che è esattamente ciò che mostra un grafico di Pareto. La comunicazione visiva di Sakana per questo rilascio sono i grafici di Pareto. Se l'argomento è "guardate la curva, non il picco", allora un numero grezzo di benchmark è fuori discussione.

L'interpretazione meno caritatevole è che un numero inviterebbe a un confronto che il fornitore preferirebbe evitare. Entrambe le letture sono coerenti con le prove, e attualmente nulla nella documentazione pubblica permette di distinguerle. Ciò che si può dire è che nessuna parte indipendente ha valutato alcun modello Fugu, e non esiste alcuna voce di Artificial Analysis per Fugu Max o per alcuno dei suoi fratelli. Ogni dato nel comunicato, comprese le sei vittorie, proviene da Sakana.

A two-column scoreboard titled "Fugu Max vs Claude Opus 5 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Benchmarks six wins with no figures, Context not published, Evidence vendor-reported only. Right column Claude Opus 5: Output price $25.00 / 1M, Input price $5.00 / 1M, Cached input up to 90% discount, Benchmarks 96.0% SWE-bench Verified, Context 1M with a 128K output ceiling, Evidence independent evals. Footer reading "Fugu Max figures vendor-reported by Sakana AI; Opus 5 rows Anthropic-reported. No independent Fugu Max evaluation exists.", with the OrcaRouter logo bottom-right.

L'acquisto che stai effettivamente facendo

Quando un fornitore di modelli singoli pubblica un benchmark, stai acquistando un'affermazione su un modello. Quando lo pubblica un orchestratore, stai acquistando un'affermazione su un pool — modelli che il fornitore non ha addestrato, eseguiti sotto un coordinatore le cui decisioni di instradamento sono deliberatamente non esposte. Il pool in questione è descritto come il più grande che Fugu abbia mai usato, ampliato con modelli open-weights e specializzati, inclusa la famiglia NVIDIA Nemotron, grazie a una collaborazione con NVIDIA. Per il resto, i membri non sono divulgati.

La conseguenza pratica è che il comportamento di Fugu Max può cambiare senza che cambi la sua versione. La dismissione da parte di un laboratorio di frontiera, un cambiamento di prezzo o il ritiro di un modello da una regione alterano ciò che il coordinatore può chiamare, e Sakana dichiara esplicitamente che questa resilienza è il punto — vende protezione contro il vendor lock-in e le revoche delle API. È un beneficio reale e non è gratuito. È anche il motivo per cui un benchmark di Fugu Max, se ne fosse pubblicato uno, avrebbe una data di scadenza che un benchmark di Claude Opus 5 non ha.

La proposta di valore di Claude Opus 5 è l'inversa ed è più facile da prezzare. È un unico modello in un'unica versione, che esegue il pensiero adattivo per impostazione predefinita con un selettore esplicito dello sforzo da basso a massimo, con una finestra di contesto da 1M di token e un tetto di output di 128K, oltre a visione, uso degli strumenti e modalità JSON. Anth​ropic riporta il 96,0% su SWE-bench Verified e il 79,2% su SWE-bench Pro, e quei numeri sono stati misurati su ciò che ottieni quando chiami l'endpoint — non su un insieme la cui composizione può cambiare sotto di te. Per un carico di lavoro che gira in produzione e viene revisionato, quella stabilità è una funzionalità che stai pagando 19,00 $ per milione di token di output per avere.

Costo per attività completata, non per token

Il costo di output di 6,00 $ di Fugu Max è davvero allettante, e il modo per metterlo alla prova è smettere di confrontare i prezzi dei token. Un orchestratore genera agenti; ognuno scrive token di ragionamento e di output; il coordinatore scrive una sintesi. Le FAQ sui prezzi di Sakana per la linea Fugu si impegnano su una singola tariffa mista basata sul modello partecipante di fascia più alta, con le esecuzioni multi-agente che non accumulano il conto — il che elimina la moltiplicazione del fan-out nel caso peggiore che rende insostenibili i sistemi multi-agente ingenui. Non elimina però il volume. Il numero di token di output per cui vieni fatturato dipende da quanti agenti sono stati eseguiti, e a 6,00 $ per milione quel volume è la variabile che una pagina dei prezzi non può dirti.

La struttura dei costi di Claude Opus 5 è una chiamata, un modello, una manopola dell'effort che controlli e l'elaborazione in batch a metà tariffa per il lavoro che può attendere. Puoi prevederla prima di eseguirla. Su oltre diecimila esecuzioni, la prevedibilità vale molto più di un margine di benchmark che nessuno ha pubblicato.

Qui è dove la questione del routing si separa dalla questione del modello. Claude Opus 5 è su OrcaRouter al prezzo di listino di Anth​ropic con 0% di ricarico — la tariffa del provider passata direttamente, quindi una modifica ai prezzi di Anth​ropic è attiva sulla stessa chiave lo stesso giorno, con failover automatico tra i percorsi dei provider quando uno è soggetto a limiti di velocità o non è disponibile. Fugu Max non è nel nostro catalogo; ti arriva tramite l'API OpenAI-compatibile di Sakana e diverse piattaforme di terze parti, e passare a esso da un Fugu precedente è un cambio di un solo parametro. Se vuoi la base di prove di Opus 5 e una bolletta prevedibile, il router è la via più breve. Se vuoi un sistema che assembla da sé il proprio fan-out sui problemi difficili, Fugu Max è ciò che fa questo — e dovresti avviarne il pilot con la contabilità dei token attivata fin dalla prima richiesta.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Dove Fugu Max è probabilmente la risposta giusta

Rendi giustizia al design. Se il tuo lavoro è ad alto volume, verificabile, e ti interessa il costo mediano di un'attività completata anziché la capacità di picco di una singola chiamata, un orchestratore che sceglie il modello sufficiente più economico per ogni richiesta fa qualcosa che un modello di punta fisso non può fare. Fugu Max è pensato esattamente per quel carico di lavoro, e la tariffa di input di $2,00 con input in cache a $0,25 è calibrata per i contesti lunghi e ripetitivi che quei carichi di lavoro generano. Anche la collaborazione con NVIDIA conta più di quanto sembri: i modelli Nemotron sono a pesi aperti, il che significa che il gradino più economico del pool non è esposto alle decisioni di prezzo di un altro laboratorio.

Ciò che non ti dà è una ragione per credere che Fugu Max sarà all'altezza di Claude Opus 5 nei compiti in cui i numeri pubblicati di Opus 5 sono i più forti — ingegneria del software su scala repository e ragionamento difficile. Quelle sono precisamente le righe in cui la tabella a sei benchmark di Sakana non offre alcuna cifra. Se il tuo problema è uno in cui essere il migliore conta più dell'essere economico, la tariffa di output di $25.00 acquista la cosa di cui hai effettivamente bisogno.

Il risultato finale

Claude Opus 5 è l'acquisto meglio supportato dalle prove e il default di produzione più sicuro: benchmark pubblicati dal fornitore, una versione che puoi fissare, una finestra di contesto che non si sposta, un tetto di output di 128K, una manopola dello sforzo che ti consente di acquistare capacità di ragionamento solo quando conviene, e mesi di risultati di terze parti alle spalle. Fugu Max è la scommessa più interessante e davvero più economica — circa il 60 percento in meno sull'input e il 76 percento in meno sull'output, con una tariffa di cache di un ordine di grandezza inferiore al prezzo base di input di Opus 5.

Se esegui un lavoro verificabile, ripetitivo e ad alto volume e ti trovi al di fuori dell'UE/SEE, Fugu Max merita un pilot con ambito definito, con un tetto di token di output fissato prima di iniziare e una misurazione dei token per attività completata anziché dei token per chiamata. Se ti serve una decisione di produzione che puoi difendere davanti a qualcun altro entro questo trimestre, Claude Opus 5 resta la risposta — ed è disponibile su OrcaRouter al prezzo di listino di Anth​ropic, con la tariffa del fornitore trasferita senza alcuna modifica.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the anthropic/claude-opus-5 model ID, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24, the /v1/chat/completions and /v1/messages endpoints, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the 1M token context with 128K max output and text + image + file input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.