Una card con titolo hero per "Fugu Max vs DeepSeek V4 Pro" con il sottotitolo "Quello ottimizzato per i costi è quello costoso", tre badge a pillola con la scritta "$6.00 vs $2.18 output", "1.6T MoE, 49B attivi", "tetto di output di 384K", una riga a piè di pagina con la scritta "Sakana AI vs DeepSeek - settembre 2026", e il logo OrcaRouter nell'angolo in basso a destra.
Engineering & Research

Fugu Max vs DeepSeek V4 Pro: quello ottimizzato per i costi è quello costoso

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Fugu Max è progettato per essere l'opzione economica, e DeepSeek V4 Pro lo batte comunque sul prezzo. Sakana AI ha rilasciato Fugu Max l'11 settembre 2026 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output, posizionandolo come un coordinatore che espande la frontiera del rapporto costo-prestazioni instradando ogni attività verso il modello più snello del suo pool. DeepSeek V4 Pro, in listino da aprile 2026, si attesta a 0,73 $ in input e 2,18 $ in output per milione alla tariffa a consumo di OrcaRouter — circa un terzo di quanto fa pagare Fugu Max su entrambi gli assi, da un singolo modello mixture-of-experts a pesi aperti con 384K di limite di output e nessun livello di orchestrazione. Questa inversione è l'intero confronto. Tutto il resto su questa coppia è una domanda su cosa ti compra l'orchestrazione quando la baseline che stai cercando di sottocotare è già più economica di te.

Due modi per abbassare una bolletta, e uno dei due è già più basso

L'argomento di Sakana a favore di Fugu Max è che un coordinatore può ridurre la spesa non pagando prezzi di frontiera per attività che non richiedono capacità di frontiera. È un argomento solido. Il problema è il modello rispetto al quale viene formulato. DeepSeek V4 Pro è un mixture-of-experts da 1,6 trilioni di parametri con 49 miliardi di parametri attivi per token, ovvero la stessa idea di riduzione dei costi eseguita un livello più in basso: paghi per i parametri che un token attiva effettivamente, non per la dimensione della rete. Entrambi i prodotti sono risposte alla domanda «come smettiamo di pagare per capacità che non utilizziamo». Uno dei due fa pagare 2,18 dollari per milione di token di output per il privilegio.

• Prezzo di input — Fugu Max 2,00 $ per 1 milione di token rispetto a DeepSeek V4 Pro 0,73 $ per 1 milione di token a consumo

• Prezzo di output — Fugu Max $6,00 per 1M token vs DeepSeek V4 Pro $2,18 per 1M token a consumo

• Input in cache — Fugu Max $0.25 per 1M token vs input con cache hit di DeepSeek V4 Pro, prezzato molto al di sotto della sua tariffa base, con la tariffa di listino pubblicata dal fornitore che resta sotto $1.00 per 1M

• Contesto — Fugu Max non pubblicato vs DeepSeek V4 Pro 1M token

• Limite di output — Fugu Max non pubblicato vs DeepSeek V4 Pro 384K token

• Modalità — Fugu Max non pubblicato vs DeepSeek V4 Pro solo testo, con uso di strumenti, modalità JSON e ragionamento

• Architettura — Fugu Max, un coordinatore addestrato su un pool non divulgato, vs DeepSeek V4 Pro, un singolo modello MoE, lignaggio open-weights

• Cifre dei benchmark — Fugu Max: sei vittorie dichiarate senza punteggi, contro i valori dichiarati dal fornitore di DeepSeek V4 Pro: 87,9 su Terminal Bench 2.1, 92,8 su GPQA Diamond, 96,4 su SWE-bench Vals

Un numero in quell'elenco merita di essere tirato fuori. DeepSeek riporta 87,9 su Terminal Bench 2.1. Fugu Max rivendica il "miglior punteggio complessivo" su Terminal Bench 2.1. Stesso benchmark, stessa finestra di rilascio, una parte pubblica una cifra e l'altra pubblica la parola "migliore". Questa è l'illustrazione più limpida in assoluto dell'asimmetria delle prove in questa coppia, e non è un dettaglio: è proprio la ragione per cui il divario di prezzo non chiude la discussione.

A two-column scoreboard titled "Fugu Max vs DeepSeek V4 Pro - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Context not published, Terminal Bench 2.1 best overall with no figure, Weights closed and pool undisclosed. Right column DeepSeek V4 Pro: Output price $2.18 / 1M, Input price $0.73 / 1M, Cached input below base rate, Context 1M tokens, Terminal Bench 2.1 87.9, Weights open-weights lineage. Footer reading "Fugu Max rows vendor-reported by Sakana AI with no scores published; DeepSeek rows vendor-reported, metered rate on OrcaRouter.", with the OrcaRouter logo bottom-right.

Cosa offre l'orchestrazione quando la baseline è già economica

La giustificazione per pagare di più per Fugu Max deve basarsi su lavori che un singolo modello gestisce male, e ne esiste una categoria reale. I compiti a lungo termine in cui una svolta sbagliata si amplifica — refactoring multi-file, modifiche su scala di repository, qualsiasi cosa in cui un verificatore che controlla l'output del worker valga più di un worker più forte — sono esattamente ciò a cui serve un assetto Thinker/Worker/Verifier. La stessa impostazione di Sakana per la linea Fugu è che individuare un errore in un secondo passaggio costa meno che azzeccarlo al primo tentativo. Su quei compiti, una tariffa di output di $6,00 che termina in un solo tentativo può battere una tariffa di $2,18 che ne richiede tre.

Quell'argomento ha una forma verificabile e Sakana non l'ha eseguito in pubblico. Il confronto che si vorrebbe è il costo per attività completata su un benchmark che entrambi i sistemi affrontano — Terminal Bench 2.1 è proprio lì, è agentico e basato sul terminale per costruzione, e solo uno dei due fornitori ha pubblicato un numero al riguardo. Finché quel divario non si colma, la posizione onesta è che il vantaggio di costo di Fugu Max è affermato a livello di token e non dimostrato a livello di attività, mentre quello di DeepSeek V4 Pro è diretto: i token stessi costano un terzo.

C'è un punto di secondo ordine sulla composizione del pool che in questo confronto conta più che nella maggior parte degli altri. Il pool di Fugu Max si è ampliato in questa versione per includere modelli open-weights e specializzati, con la famiglia NVIDIA Nemotron citata attraverso una collaborazione con NVIDIA. La presenza di pesi aperti nel pool significa che il gradino più economico della scala di Sakana non è esposto alle decisioni di prezzo di un altro laboratorio. DeepSeek V4 Pro, essendo esso stesso a pesi aperti, non è esposto alle decisioni di prezzo di nessuno se non a quelle di DeepSeek — ed è il gradino. L'argomento di resilienza che Sakana avanza per l'orchestrazione si applica direttamente a DeepSeek e solo indirettamente alla fornitura sottostante di Fugu Max.

Il caching è il punto in cui i carichi di lavoro degli agenti diventano davvero costosi.

La tariffa base di nessuno dei due fornitori è quella che paga un ciclo agente. Le esecuzioni prolungate di agenti reinviano a ogni turno un prefisso ampio e per lo più invariato, ed è il tasso di cache hit a determinare la bolletta reale. Fugu Max indica l'input in cache a 0,25 $ per milione, una cifra autentica e aggressiva: un ottavo della sua stessa tariffa base per l'input. DeepSeek V4 Pro prezza l'input con cache hit molto al di sotto della base pubblicata, e la sua tariffa di output è fissata a circa tre volte quella di input anziché al rapporto di quattro-cinque volte usato dalla maggior parte dei fornitori, il che comprime specificamente il costo dei cicli a forte generazione.

Oggi non puoi calcolare in modo affidabile il confronto basandoti sul listino prezzi di nessuno dei due fornitori, perché la tariffa in cache di Fugu Max si applica a un numero di token che non puoi prevedere. Un orchestratore decide quanti agenti vengono eseguiti; il contesto di ciascun agente contribuisce; il coordinatore aggiunge il proprio. L'impegno tariffario di Sakana per la linea Fugu — una tariffa unica basata sul modello partecipante di fascia più alta, con gli agenti che non fanno lievitare il conto — elimina lo scenario peggiore, il che è una vera concessione e va riconosciuta. Non rende però il volume conoscibile in anticipo. Il conto di DeepSeek V4 Pro è funzione dei token che invii e dei token che ricevi, e di nient'altro.

Quella prevedibilità è una proprietà del routing tanto quanto una proprietà del modello. DeepSeek V4 Pro è su OrcaRouter al prezzo di listino del fornitore, con 0% di ricarico, così una revisione delle tariffe da parte di DeepSeek raggiunge la tua chiave esistente lo stesso giorno, anziché al tuo prossimo rinnovo contrattuale, e il failover automatico ti copre quando uno dei percorsi del fornitore è soggetto a limiti di frequenza. Quest'ultima parte ha un peso insolito proprio per questo modello: DeepSeek ha già revisionato i suoi prezzi una volta in questo ciclo, con fasce di picco e fuori picco le cui cifre finali variano tra le fonti. Quando il listino di un fornitore si muove, il router è la differenza tra assorbire il cambiamento e scoprirlo in fattura.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Ciò che non abbiamo potuto verificare

Tre cose nel rilascio di Fugu Max non hanno potuto essere verificate rispetto a nulla al di fuori dei materiali di Sakana stesso, e sono elencate qui invece di essere passate sotto silenzio. In primo luogo, le sei vittorie nei benchmark non riportano cifre — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish sono indicate come vittorie senza punteggi associati, e SWEFish è un benchmark interno di Sakana. In secondo luogo, la finestra di contesto, il tetto di output e le modalità supportate di Fugu Max non sono pubblicati, quindi le righe relative a modalità e tetto qui sopra confrontano una specifica rilasciata con il silenzio. In terzo luogo, non esiste alcuna valutazione indipendente di nessun modello Fugu, e non esiste alcuna voce di Artificial Analysis per Fugu Max.

Per DeepSeek V4 Pro la situazione è invertita. Il fornitore riporta un lungo elenco di numeri — Terminal Bench 2.1 87.9, GPQA Diamond 92.8, SWE-bench Vals 96.4, HLE 42.7 e 60.0 in due configurazioni, MCP Atlas 73.6, Toolathlon-Verified 74.1, CyberGym 83.3 — e anche tutti questi sono riportati dal fornitore. La differenza non sta nel fatto che un fornitore sia più affidabile. Sta nel fatto che, quando entrambe le parti pubblicano numeri, il disaccordo è possibile, e un disaccordo può essere esaminato. Un'affermazione senza numeri non può essere verificata, solo accettata o ignorata.

Un'ulteriore avvertenza sui prezzi Deep​Seek di cui sopra: la nostra pagina del modello riporta due cifre, una tariffa a consumo di $0,73 per l'input e $2,18 per l'output per milione nei riquadri dei prezzi e una descrizione più vecchia di $0,44 per l'input e $0,87 per l'output per milione. Deep​Seek ha inoltre annunciato fasce peak e off-peak sulle cui tariffe finali le fonti non concordano. Considera $0,73 e $2,18 come le tariffe che ti verranno effettivamente addebitate tramite noi oggi e verifica sul tariffario pubblicato prima di basare un budget su di esse.

Il risultato finale

DeepSeek V4 Pro vince questo confronto secondo i termini scelti da Fugu Max. È più economico in input e output, ha una finestra di contesto pubblicata e un tetto di output di 384K, riporta un numero reale sul benchmark in cui Fugu Max afferma di essere leader, e la sua discendenza è open-weights, che è la forma più forte disponibile dell'argomento di indipendenza dal fornitore che Sakana sta vendendo. Se il tuo carico di lavoro è ad alto consumo di token e la tua priorità è il costo per token più basso difendibile da un modello che puoi fissare, non c'è partita.

Fugu Max vince su una questione più ristretta a cui DeepSeek V4 Pro non risponde affatto: se un coordinatore che assembla il proprio team di agenti possa completare lavoro difficile e a lungo orizzonte in meno tentativi rispetto a un singolo modello. Vale la pena sperimentarlo se hai lavoro verificabile e tollerante agli errori e ti trovi al di fuori dell'UE/SEE. Calcolane il costo in token per attività completata, stabilisci prima un limite massimo e confrontalo con l'endpoint DeepSeek V4 Pro su OrcaRouter al prezzo di listino del fornitore — una chiave, 0% di ricarico, e una tariffa che segue quella del fornitore stesso.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the FLAGSHIP and Featured badges, the deepseek/deepseek-v4-pro model ID, the Tools, JSON and Reasoning tags, the listing date 2026-04-24, the /v1/chat/completions and /v1/responses endpoints, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms and 6,313.7M tokens of 7-day traffic, the 1M token context with 384K max output and text-only input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno