
Fugu Ultra v2 vs Qwen3.8-Max: perché il prezzo è il numero sbagliato
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 costa $30,00 per milione di token di output. Qwen3.8-Max costa $6,00. È un divario di cinque a uno, e se scegli tra questi due sistemi agentici in base a quel rapporto sceglierai male — perché nessuno dei due viene in realtà fatturato come suggerisce il suo listino prezzi. Secondo la misurazione di Artificial Analysis, Qwen3.8-Max ha generato 180 milioni di token di output per completare l'Intelligence Index, più del doppio della mediana dei modelli, 89 milioni, a un costo di $2,67 per attività. È un modello parsimonioso in termini di token e prodigo in termini di risposta. Fugu Ultra v2 di Sakana AI, rilasciato l'11 settembre 2026, ha la forma opposta: un pool non divulgato di modelli di altri laboratori che genera e coordina a ogni richiesta, fatturato a una tariffa unica consolidata che, secondo Sakana, non si moltiplica man mano che si aggiungono agenti. Uno è un singolo modello da 2,4 trilioni di parametri che pensa ad alta voce a lungo. L'altro è un piccolo coordinatore che recluta aiuto. Confrontare i loro prezzi per token non ti dice quasi nulla su quale sia più economico da eseguire.
Due modi opposti di essere costosi
Inizia dal meccanismo, perché spiega ogni altra differenza di questo confronto.
Qwen3.8-Max è un modello sparse mixture-of-experts — 2,4 trilioni di parametri totali, circa 95 miliardi attivi per token — che raggiunge risultati prossimi alla frontiera lavorando più a lungo anziché essendo più grande. Artificial Analysis lo ha misurato a 37,8 token di output al secondo, classificandolo #154 su 200 modelli per velocità, con 180 milioni di token di output emessi attraverso l'Intelligence Index (#70 su 200 per verbosità). Il suo costo per attività dell'Intelligence Index risulta di $2,67, e il suo sconto sulla cache è insolitamente profondo, all'88%, ed è la leva che di fatto controlla il conto in questo caso: una lunga esecuzione di un agente che continua a rileggere lo stesso contesto costa poco, mentre una che continua a generare testo nuovo no.
Fugu Ultra v2 affronta lo stesso problema dall'altro capo. È un orchestratore — un piccolo coordinatore addestrato, riportato intorno ai 7 miliardi di parametri, che legge una richiesta, assembla una squadra di agenti secondo i ruoli Thinker, Worker e Verifier del lavoro TRINITY di Sakana, e poi sintetizza una risposta. Il suo conto in token è la somma di ciò che producono i suoi sub-agenti più il testo di sintesi del coordinatore stesso. Sakana garantisce nella sua FAQ sui prezzi che ti viene addebitata una tariffa unica mista ancorata al modello di fascia più alta coinvolto e che aggiungere agenti non moltiplica il conto, il che elimina il classico effetto esplosivo multi-agente in cui il fan-out moltiplica i costi. Ciò che non elimina è il volume. A $30,00 per milione di token di output, il numero che conta è quanti agenti sono stati eseguiti e quanto hanno scritto, e questo è un numero che né tu né Sakana potete prevedere dalla pagina dei prezzi.
Questa è la rappresentazione onesta del divario di prezzo: è una tariffa, non un totale. Una tariffa cinque volte più alta applicata a un carico di lavoro di cui non si può prevedere il volume di output non equivale a un costo cinque volte maggiore — è un multiplo illimitato con una soglia minima prevedibile.

La scheda tecnica, e l'unica riga che decide tutto
• Prezzo — Fugu Ultra v2 5,00 $ in input / 30,00 $ in output per 1M di token vs Qwen3.8-Max 2,00 $ in input / 6,00 $ in output
Input in cache — Fugu Ultra v2 0,50 $ per 1M vs Qwen3.8-Max 0,25 $ per 1M di lettura, e uno sconto sulla cache dell'88% misurato da Artificial Analysis
• Supplemento per contesto lungo — con Fugu Ultra v2 l'input raddoppia a $10,00 e l'output a $45,00 oltre 272K token, mentre Qwen3.8-Max non applica alcun supplemento per i prompt lunghi, con tariffa fissa fino alla finestra
• Finestra di contesto — Fugu Ultra v2 1M token vs Qwen3.8-Max 1M token
• Limite di output — Fugu Ultra v2 non pubblicato come cifra singola rispetto a Qwen3.8-Max, che è di circa 128K token
• Modalità di input — testo di Fugu Ultra v2, con le capacità proprie del pool a supporto, rispetto a testo, immagine, video e PDF di Qwen3.8-Max
• Pesi — Fugu Ultra v2 chiuso, appartenenza al pool non divulgata per scelta progettuale vs Qwen3.8-Max pesi aperti pubblicati per il checkpoint della classe Max con licenza personalizzata
• Disponibilità regionale — Fugu Ultra v2 non commercializzato nell'UE/SEE, mentre Qwen3.8-Max è disponibile senza restrizioni regionali
• Valutazione indipendente — per Fugu Ultra v2 non ne è stata pubblicata alcuna, e non esiste alcuna pagina di Artificial Analysis per nessun modello Fugu, contro Qwen3.8-Max, una voce attiva di Artificial Analysis con dati pubblicati su velocità, verbosità e costo per attività
Leggi le ultime due righe insieme e il confronto si fa più netto. Qwen3.8-Max è un modello che puoi bloccare a una versione, di cui puoi leggere la licenza, di cui puoi scaricare un checkpoint e che puoi verificare confrontandolo con il tabellone di un terzo. Fugu Ultra v2 è un sistema che non puoi ispezionare, non puoi ospitare in autonomia, non puoi acquistare in Europa e non puoi verificare confrontandolo con nessuno al di fuori di Sakana. Il sovrapprezzo di 272K aggrava la cosa: oltre quella soglia la tariffa di input di Fugu Ultra v2 raddoppia e la sua tariffa di output aumenta della metà, mentre la tariffa di Qwen3.8-Max non si muove. Per il lavoro a lungo termine su documenti e repository per cui entrambi i sistemi sono progettati, il prezzo di listino più basso è anche il più piatto.
Il numero di Qwen3.8-Max che tutti citano è obsoleto
Se hai letto di questo modello da qualche parte nelle ultime due settimane, probabilmente hai visto un Artificial Analysis Intelligence Index di 58, o 58,1, o 58,4. Quelle cifre erano reali e non sono più attuali. Il 7 settembre 2026 Artificial Analysis ha ricalibrato il suo indice alla v4.3, comprimendo i punteggi su tutta la linea, e la pagina live di Qwen3.8-Max ora riporta 40, collocandolo al #30 di 200 modelli — con il badge "Updated" che segnala un punteggio rideterminato. Le analisi precedenti riportavano anche il costo in termini di sforzo misurato sulla scala precedente: 64 turni per attività contro 14 per la generazione Qwen precedente, e circa $1,14 per attività dell'Intelligence Index. La pagina attuale mostra $2,67 per attività, 37,8 token di output al secondo e 180 milioni di token di output sull'indice.
Ne conseguono due cose. Primo: sulla scala ricalibrata, Qwen3.8-Max si colloca nella stessa fascia del resto del secondo livello della frontiera, anziché allo stesso livello di quest'ultima, e qualsiasi confronto tu legga che lo mette a confronto con Claude Opus 5 o Kimi K3 su un 58 sta confrontando istantanee provenienti da scale diverse. Secondo, e cosa più utile per questo confronto: la correzione è unidirezionale: Qwen3.8-Max ha un numero che può essere sbagliato e poi corretto. Fugu Ultra v2 non ha alcun numero. Ogni cifra di Fugu in questo articolo proviene dalla valutazione di Sakana stessa e, alla data dell'11 settembre, non esiste alcuna pagina di Artificial Analysis per Fugu Ultra v2 o per qualsiasi altro modello Fugu: l'URL restituisce 404. Quando un fornitore pubblica un tabellone dei punteggi e nessuna parte indipendente ha eseguito il modello, il tabellone dei punteggi costituisce l'intera documentazione.
Dove in realtà si sovrappongono, e dove no
Sakana riporta Fugu Ultra v2 come migliore o a pari merito su cinque di otto benchmark — GDP.pdf, Chartography, SWEFish, DeepSWE e Toolathon — e tra i primi due su sette di otto. Le due cifre concrete nel comunicato sono Chartography a 48,3, contro 27,3 di Claude Opus 5 e 29,5 di Claude Fable 5 nella stessa tabella, e DeepSWE a 74,3. Le righe pubblicate da Alibaba per Qwen3.8-Max includono Terminal-Bench 2.1 a 86,6, OSWorld-Verified a 86,1, GPQA Diamond a 92,6 e SWE-bench Pro a 67,7.
Nota cosa hanno in comune quelle due liste: nulla. Nemmeno un benchmark compare in entrambe le tabelle dei fornitori. Non c'è alcuna riga in cui puoi tenere un dato Sakana e un dato Alibaba fianco a fianco e leggere chi vince, il che significa che la risposta onesta a «quale sia migliore negli agenti di codifica» è che nessuna prova pubblicata lo dice. Ciò che esiste è un sistema con otto righe scelte dal fornitore e nessuna verifica esterna, e un sistema con righe del fornitore più una voce indipendente che misura costo e velocità anziché la capacità in un confronto diretto. Questa è una lacuna nelle prove, non una lacuna nei modelli, e dovrebbe cambiare il modo in cui acquisti: non puoi scegliere tra questi in base ai benchmark, quindi scegli in base alle proprietà che puoi effettivamente verificare.

Pesi aperti contro un pool non divulgato
È qui che il solito argomento del lock-in si inverte, ed è la cosa più interessante dell'abbinamento.
Il messaggio di Sakana per Fugu Ultra v2 è la sovranità. Un pool intercambiabile di modelli aperti e specializzati significa che nessuna decisione sui prezzi, calendario di deprecazione o cambio di policy di un singolo fornitore può mettere fuori gioco il tuo prodotto, e il rilascio lo rende esplicito notando che la composizione del pool è cambiata nella v2. L'azienda dichiara anche apertamente che i punteggi di Fugu Ultra v2 sono stati ottenuti senza Claude Fable 5, Claude Fable 5.1 o GPT-6 Astra nel pool di agenti — rivendicando vittorie sui tre modelli più forti disponibili e confermando al contempo di non chiamarne nessuno. Qualunque cosa contenga il pool, non è il vertice del mercato secondo i calcoli della stessa Sakana.
Ma la copertura ha un costo che non figura nel listino prezzi. Non puoi vedere il pool, non puoi includere o escludere un membro dal livello Ultra, non puoi auto-ospitare nulla di tutto ciò e non puoi eseguirlo affatto nell'UE/SEE — un'orchestrazione con sede a Singapore su pesi di altri laboratori ha un profilo di rischio diverso dal possedere i pesi. Qwen3.8-Max ribalta esattamente questo. È il modello di un singolo fornitore e quindi esposto alle decisioni di un singolo fornitore, ma Alibaba ha pubblicato pesi aperti per il checkpoint Qwen3.8-2.4T-A95B di classe Max con una licenza personalizzata, il che significa che la via di fuga è reale e non solo retorica: se i prezzi o i termini cambiano, il modello può essere servito dalla tua infrastruttura. Per un team la cui paura reale è che un fornitore tiri il tappeto sotto i piedi, un checkpoint scaricabile è una garanzia più forte di una promessa su un pool che non ti è consentito ispezionare.
C'è un punto di secondo ordine per chiunque esegua agenti su entrambe le piattaforme. Qwen3.8-Max è nel nostro catalogo a 2,00 $ in entrata e 6,00 $ in uscita, che è il prezzo di listino di Alibaba con 0% di ricarico ribaltato sul cliente — una variazione di prezzo del fornitore arriva sulla stessa chiave lo stesso giorno, e il failover automatico copre un percorso del fornitore con limiti di frequenza o degradato. Fugu Ultra v2 non è su OrcaRouter. Ti arriva tramite l'API compatibile con OpenAI di Sakana e diverse piattaforme di terze parti, e passare da un Fugu precedente è un cambio di parametro su una sola riga. Un router non sostituisce un coordinatore, e un coordinatore non sostituisce la capacità di eseguire il failover; se vuoi entrambe le proprietà stai gestendo i sistemi di due fornitori e dovresti mettere in budget due fatture.
Quale dovresti scegliere
Scegli Qwen3.8-Max se ti serve un modello che puoi prevedere, verificare e da cui puoi fuggire. È un terzo del tasso di output di Fugu Ultra v2 a listino, non ha il crollo del contesto lungo, accetta immagini, video e PDF laddove la modalità del pool Fugu è qualunque cosa gli agenti sottostanti si trovino a supportare, pubblica un checkpoint su cui puoi ripiegare, è in vendita ovunque e ha una voce indipendente live che misura le cose che determinano davvero la tua bolletta — 37,8 token al secondo e un costo per attività che puoi modellare prima di impegnarti. I suoi punti deboli sono altrettanto specifici e vale la pena nominarli: è lento, classificato #154 su 200 per velocità, è enormemente prolisso con 180 milioni di token sull'indice, e Artificial Analysis ha misurato separatamente il suo tasso di allucinazione salire dal 23% al 40% rispetto alla generazione precedente, il che è una seria preoccupazione proprio per il lavoro autonomo a più passaggi per cui viene pubblicizzato. Metti in budget un verificatore e sfrutta in modo aggressivo lo sconto sulla deep cache.
Scegli Fugu Ultra v2 se il tuo lavoro è a lungo orizzonte e verificabile, il tuo budget è esplorativo anziché di produzione, e ti trovi al di fuori dell'UE/SEE. L'argomentazione strutturale a favore di un coordinatore è reale e gli esempi dello stesso fornitore la indicano in modo coerente — un'esecuzione di ricerca automatizzata di 123 esperimenti nell'arco di quattordici ore su una singola H100, un risolutore di cubi di Rubik in puro Python che ha completato tutti i 300 cubi mescolati, dove due baseline di frontiera anonimizzate si sono bloccate del tutto. Sono esempi selezionati dal fornitore con baseline anonimizzate e dimostrano meno di quanto sembri, ma lo schema è coerente: su attività in cui la correttezza è verificabile e la parte difficile è la persistenza, generare un verificatore batte il chiedere di più a un singolo modello. Ciò che stai acquistando è quella persistenza, a una tariffa cinque volte quella di Qwen3.8-Max, in un sistema di cui non puoi verificare la qualità e il cui pool non puoi fissare. Pilotalo in modo circoscritto, strumenta i token di output per attività completata anziché per token, e stabilisci un tetto prima della prima esecuzione.

Il motivo per cui il prezzo indicato è il numero sbagliato è che entrambi questi prodotti hanno spostato il costo di una risposta lontano dal costo di un token. Fugu Ultra v2 lo fa aprendosi a ventaglio verso modelli che non intende nominare. Qwen3.8-Max lo fa pensando per 180 milioni di token. Se conosci già il tuo volume di token per attività, l'aritmetica è banale e dovresti farla. La maggior parte dei team non conosce quel numero, e per loro la decisione si riduce a qualcosa di più semplice: Qwen3.8-Max è la scelta che puoi verificare, prezzare e abbandonare, e Fugu Ultra v2 è la scelta che scommette che il coordinamento batta la capacità. Entrambe sono difendibili. Solo una delle due arriva con le prove.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
