Una card hero per il titolo di Fugu Ultra v2 vs Claude Opus 5 con il sottotitolo 'Stesso prezzo di input, due scommesse diverse', badge a pillola che recitano '$5.00 input entrambi', 'Chartography 48.3 vs 27.3' e 'contesto 1M', una riga a piè di pagina 'Sakana AI vs Anthropic - settembre 2026', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: stesso prezzo di input, due scommesse diverse

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

La coincidenza che plasma tutto

Inizia da ciò su cui i due prodotti concordano, perché è più del prezzo di listino.

• Prezzo di input — Fugu Ultra v2 5,00 $ per 1 milione di token vs Claude Opus 5 5,00 $ per 1 milione di token

• Prezzo di output — Fugu Ultra v2 $30.00 per 1 milione di token rispetto a Claude Opus 5 $25.00 per 1 milione di token

• Input in cache — Fugu Ultra v2 0,50 $ per 1 milione al di sopra della tariffa base, contro Claude Opus 5, che applica alla cache uno sconto fino al 90% sull'input in cache

• Contesto — Fugu Ultra v2 1M token, con tariffe che raddoppiano oltre 272K rispetto a Claude Opus 5 1M token, fisse

• Limite di output — Fugu Ultra v2 non pubblicato come singolo valore rispetto a Claude Opus 5 128K token

• Disponibilità — Fugu Ultra v2 non in vendita nell'UE/SEE, mentre Claude Opus 5 è generalmente disponibile secondo i termini standard dell'API

• Prove — benchmark dichiarati dal fornitore per Fugu Ultra v2, nessuna valutazione indipendente finora, rispetto ai benchmark dichiarati dal fornitore per Claude Opus 5 più mesi di posizionamenti nelle classifiche di terze parti

È nell'ultima riga che il confronto si ribalta davvero. Allo stesso prezzo di input, stai scegliendo tra un sistema i cui punteggi devi accettare sulla fiducia e un modello i cui punteggi sono stati riprodotti da altri. Il salto dei 272K aggrava la cosa: oltre quella soglia, la tariffa di input di Fugu Ultra v2 raddoppia a $10 e quella di output a $45, mentre la tariffa di Claude Opus 5 non cambia. Per le esecuzioni di agenti a contesto lungo — il carico di lavoro esatto per cui Fugu Ultra v2 è progettato — il vantaggio di prezzo del listino più basso svanisce proprio dove il sistema dovrebbe eccellere.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Cosa sia in realtà ognuno

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2 non è questo, e la differenza non è cosmetica. È un coordinatore — un piccolo modello addestrato, riportato intorno ai 7B parametri, che legge la tua richiesta, assembla una squadra di agenti, assegna i ruoli di Thinker, Worker e Verifier dal lavoro TRINITY di Sakana, e sintetizza una risposta finale. I modelli sottostanti non sono divulgati, le decisioni di instradamento non sono esposte per design, e per il tier Ultra il pool è fisso: non puoi escludere un fornitore. La stessa impostazione di Sakana della versione 2 è che il cutoff di addestramento è stato spostato al 28 agosto 2026 e la composizione del pool è cambiata — in particolare per escludere Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra.

Quell'esclusione è il dettaglio più rivelatore del comunicato. Fugu Ultra v2 dichiara vittorie nei benchmark sui tre modelli più forti disponibili, pur confermando di non chiamarne nessuno. Qualunque cosa contenga il pool, non è il vertice del mercato secondo i calcoli della stessa Sakana. La proposta è che il coordinamento batte la capacità. Questa è una tesi reale e, su compiti verificabili con un verificatore economico, è una tesi supportata da prove. Non è la stessa affermazione di "questo sistema è più intelligente di Claude Opus 5", e il tabellone è organizzato in modo che sia facile confondere le due cose.

Il tabellone che Sakana ha scelto

Ogni numero riportato di seguito proviene dalla valutazione di Sakana stessa di Fugu Ultra v2. Le cifre di Claude Opus 5 sono quelle misurate da Sakana nella stessa comparazione, salvo dove diversamente indicato. Nessuna parte indipendente ha riprodotto la colonna Fugu e, al momento in cui scriviamo, non esiste alcuna voce di Artificial Analysis per alcun modello Fugu.

• Chartography — Fugu Ultra v2 48,3 vs Claude Opus 5 27,3 — dichiarato dal fornitore, un divario di 21 punti

• DeepSWE — Fugu Ultra v2 74,3 vs nessun dato pubblicato di Claude Opus 5 nella stessa tabella — riportato dal fornitore

• Posizionamento nei benchmark — Fugu Ultra v2 migliore o a pari merito in cinque casi su otto, tra i primi due in sette casi su otto — dichiarato dal fornitore

• SWE-bench Verified — nessun dato per Fugu Ultra v2 rispetto al 96,0% di Claude Opus 5 — riportato da Anthropic

• SWE-bench Pro — nessun dato per Fugu Ultra v2 contro il 79,2% di Claude Opus 5 — riportato da Anthropic

• ARC-AGI 3 — nessun dato per Fugu Ultra v2 rispetto a Claude Opus 5 ~30,2% — riportato da Anthropic

Leggilo come una forma, non come una classifica. Sakana ha pubblicato una tabella di otto benchmark in cui vince su cinque, e i risultati più forti documentati pubblicamente di Claude Opus 5 — le righe SWE-bench, ARC-AGI 3 — semplicemente non vi compaiono. Non è un'accusa di malafede; è l'aspetto che ha il tabellone di un fornitore, compreso quello di qualsiasi fornitore. Ma significa che non puoi concludere dal rilascio che Fugu Ultra v2 superi Claude Opus 5 nell'ingegneria del software, perché i due sistemi non sono stati misurati sulle stesse righe abbastanza spesso da poterlo affermare. Sull'unica riga in cui compaiono entrambi e in cui entrambi i numeri sono pubblici — Chartography — Fugu Ultra v2 rivendica una netta vittoria. Sulle righe più ampie di ragionamento e programmazione, solo una delle due parti ha pubblicato.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Costo per attività, non costo per token

Il conto dei token di un orchestratore non è la sua tariffa per token. Fugu Ultra v2 genera agenti, ognuno dei quali contribuisce con token di ragionamento e di output, e il coordinatore stesso produce testo di sintesi. Le FAQ sui prezzi di Sakana assumono qui un impegno davvero utile — ti viene applicata una tariffa unica ponderata basata sul modello di fascia più alta coinvolto, e aggiungere agenti non moltiplica il conto — il che elimina la moltiplicazione fan-out nel caso peggiore che rende costose le configurazioni multi-agente ingenue. Ma non elimina il volume. La quantità di token di output fatturati è comunque funzione di quanti agenti sono stati eseguiti e di quanto hanno scritto, e a 30 $ per milione quel volume è la variabile che non puoi prevedere dalla pagina dei prezzi.

La struttura di costo di Claude Opus 5 è l'inversa. Una chiamata, un modello, un selettore dello sforzo che controlli tu e una tariffa di output di 25 $ con elaborazione batch disponibile al 50% di sconto per il lavoro non in tempo reale. Puoi prevederla. Per un carico di lavoro che esegui diecimila volte al giorno, la prevedibilità vale molto più di un margine di benchmark su un compito di lettura di grafici.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Dove Fugu Ultra v2 vince davvero

Rendiamo al sistema ciò che gli spetta. Il risultato di Chartography, se regge, è il genere di successo che i modelli singoli difficilmente riescono a falsificare: il ragionamento visivo su documenti strutturati premia il tentare una lettura, verificarla rispetto al documento e riprovare — che è esattamente ciò a cui serve un ruolo di Verifier. La stessa logica vale per Toolathon e DeepSWE, dove la risposta può essere testata invece che discussa. I casi di studio pubblicati da Sakana vanno nella stessa direzione: un'esecuzione di AutoResearch da 123 esperimenti nell'arco di quattordici ore su una H100, un risolutore di Rubik's cube in puro Python che ha completato tutti i 300 cubi mescolati, mentre due baseline di frontiera anonimizzate sono andate completamente in crash, un'iride CAD meccanica che effettivamente si apre e si chiude. Questi sono esempi selezionati dal fornitore con baseline anonimizzate, quindi dimostrano meno di quanto sembrino. Ma il pattern è coerente, e indica una categoria reale: compiti in cui la correttezza è verificabile e la parte difficile è la persistenza.

C'è anche un'argomentazione strutturale che non ha nulla a che fare con i benchmark. Claude Opus 5 è il modello di un unico fornitore, soggetto alle decisioni di prezzo, al calendario di dismissione e alle policy di un unico fornitore. Fugu Ultra v2 è progettato per sopravvivere al cambiamento di uno qualsiasi di questi elementi, e Sakana dice esplicitamente che è proprio questo il punto: lock-in del fornitore, revoca delle API, controlli sulle esportazioni. In un mercato in cui i modelli sono stati ritirati da alcune regioni con poco preavviso, non è un'ipotesi. È una copertura, e le coperture costano: 5 $ in più per milione di token di output è all'incirca il prezzo di questa copertura.

Il verdetto

Claude Opus 5 vince la decisione che la maggior parte dei team sta effettivamente prendendo. Ha alle spalle mesi di valutazione indipendente, una finestra da 1M token il cui prezzo non raddoppia a metà del documento, un tetto di output di 128K, un prezzo pubblicato che puoi prevedere, una manopola dell'effort che ti consente di acquistare ragionamento solo quando il compito lo merita, e risultati di terze parti esattamente sui benchmark — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — che i team agentici e di coding considerano più importanti. Fugu Ultra v2 vince su una questione più ristretta e più interessante: se un coordinatore con un pool più piccolo possa superare un flagship su compiti in cui la risposta può essere verificata. Il tabellone di Sakana stesso dice di sì su cinque righe su otto, e l'esclusione dal pool dice che la vittoria è arrivata senza i tre migliori modelli al mondo.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno