Una card del titolo hero che recita 'Fugu Max vs Qwen3.8-Max' con il sottotitolo 'Stesso prezzo, stesso benchmark, un solo numero', tre badge a pillola che recitano '$2.00 / $6.00 su entrambi', 'Terminal Bench 2.1: 86.6 vs non dichiarato' e 'Punteggio indipendente: nessuno vs 40', una riga a piè di pagina che recita 'Sakana AI, settembre 2026 vs Alibaba, agosto 2026', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Fugu Max vs Qwen3.8-Max: stesso prezzo, stesso benchmark, un solo numero pubblicato

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Fugu Max e Qwen3.8-Max sono listati allo stesso prezzo: 2,00 $ per milione di token di input e 6,00 $ per milione di token di output. Sakana AI ha rilasciato Fugu Max l'11 settembre 2026 e Alibaba serve Qwen3.8-Max dall'inizio di agosto, e i due fornitori sono arrivati a un listino identico partendo da direzioni opposte: uno prezza una politica di routing, l'altro prezza un modello da 2,4 trilioni di parametri. Il pareggio elimina del tutto il prezzo dalla decisione, il che è insolitamente lineare. Quello che resta sono le prove, ed è lì che le due parti divergono più che in qualsiasi altro punto. Entrambe le tabelle dei fornitori citano Terminal Bench 2.1. Alibaba riporta 86,6 per Qwen3.8-Max. Sakana afferma che Fugu Max ottiene il miglior punteggio complessivo su Terminal Bench 2.1 e non riporta alcuna cifra — né per quel test né per gli altri cinque che sostiene di vincere.

L'unico benchmark che entrambe le parti citano

Questo è l'intero confronto compresso in un'unica riga, quindi vale la pena essere precisi al riguardo.

Il comunicato di Sakana elenca sei benchmark in cui Fugu Max ottiene il miglior punteggio complessivo: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Cinque sono valutazioni pubbliche riconosciute e il sesto, SWEFish, è il benchmark di coding di Sakana stesso. Per nessuno dei sei il comunicato indica un valore, un margine o il numero di un concorrente da affiancare. L'affermazione parallela — che Fugu Max espande la frontiera di Pareto costo-prestazioni su sette benchmark su dieci — è parimenti un'affermazione sulla posizione su un grafico anziché su un punto su un asse.

Le righe pubblicate da Alibaba per Qwen3.8-Max includono Terminal-Bench 2.1 a 86,6, OSWorld-Verified a 86,1, GPQA Diamond a 92,6 e SWE-bench Pro a 67,7. Tutti dichiarati dal fornitore, tutti numeri. Quindi sull'unico test che entrambe le aziende hanno scelto di citare, una ha pubblicato una cifra e l'altra ha pubblicato una posizione in classifica. Da questo non si può concludere quale sistema sia migliore — il "migliore nel complesso" di Sakana potrebbe significare 91 o 87. Ciò che si può concludere è che, al momento della pubblicazione, nessuna prova pubblica risponde alla domanda, e il fornitore che avanza l'affermazione più grande è quello che si astiene dal quantificarla.

Prezzi identici, costruzione opposta

• Input — Fugu Max $2,00 per 1M token vs Qwen3.8-Max $2,00 per 1M token

• Output — Fugu Max 6,00 $ per 1M token vs Qwen3.8-Max 6,00 $ per 1M token

• Input in cache — Fugu Max 0,25 $ per 1 milione di token rispetto a Qwen3.8-Max 0,25 $ per 1 milione di token, e Artificial Analysis misura in modo indipendente uno sconto sulla cache dell'88 percento sul fronte Qw​en

• Supplemento per prompt lunghi — Fugu Max: nessun livello indicato nella release, contro Qwen3.8-Max con tariffa unica fino alla finestra e nessun sovrapprezzo

• Contesto e output — Fugu Max non ha pubblicato alcun dato, rispetto a Qwen3.8-Max: una finestra di 1M token con un tetto di output di circa 128K

• Modalità di input — Fugu Max testo, con dietro le capacità proprie del pool, rispetto a Qwen3.8-Max testo, immagine, video e PDF

• Architettura — Fugu Max, un coordinatore addestrato su un pool non divulgato, ampliato per Max con modelli a pesi aperti e specializzati, inclusa la famiglia NVIDIA Nemotron grazie a una collaborazione con NVIDIA, contro Qwen3.8-Max, un modello sparse mixture-of-experts con circa 2,4 trilioni di parametri totali e circa 95 miliardi attivi per token

• Pesi — Fugu Max chiuso, appartenenza al pool non divulgata per scelta progettuale vs pesi aperti Qwen3.8-Max pubblicati per il checkpoint di classe Max con licenza personalizzata

• Valutazione indipendente — Fugu Max: nessuna pubblicata, e non esiste alcuna pagina Artificial Analysis per alcun modello Fugu, mentre Qwen3.8-Max è una voce Artificial Analysis attiva con cifre pubblicate su velocità, verbosità e costo per attività

Quattro di quelle righe riportano «non pubblicato» sul lato Fugu e presentano una cifra sul lato Qw​en. Quando le tariffe sono identiche, questo è l'intero confronto: lo stesso denaro compra un sistema che puoi descrivere e uno che non puoi.

A two-column scoreboard titled 'Fugu Max vs Qwen3.8-Max - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, Terminal Bench 2.1 best with no figure, evidence vendor-reported only. Qwen3.8-Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context 1M with a 128K output ceiling, Terminal Bench 2.1 at 86.6, evidence Artificial Analysis Index 40 and $2.67 per task. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Qwen3.8-Max rows Alibaba-reported and per Artificial Analysis.' OrcaRouter logo bottom-right.

Una colonna ha una terza parte alle spalle.

Artificial Analysis assegna a Qwen3.8-Max un punteggio di 40 nell'Intelligence Index v4.3 riformulato, posizionandolo al #30 su 200, con un costo di $2,67 per attività dell'Intelligence Index e 37,8 token di output al secondo — una velocità abbastanza bassa da collocarlo al #154 su 200 per velocità. La stessa voce registra 180 milioni di token di output generati nell'ambito dell'indice, più del doppio rispetto agli 89 milioni del modello mediano, e uno sconto dell'88 percento sulla cache.

Due correzioni vanno apportate prima che tutto ciò venga citato. La prima è che la cifra ampiamente diffusa di 58 — o 58,1, o 58,4 — per Qwen3.8-Max risale a prima che Artificial Analysis ricalibrasse l'indice a settembre 2026, e la pagina live riporta il badge "Updated" che segnala un punteggio riformulato. I vecchi articoli riportavano anche un diverso costo di impegno rispetto alla scala precedente, 64 turni per attività contro 14 per la generazione precedente di Qwen a circa $1,14 per attività dell'Intelligence Index; la pagina attuale mostra $2,67. La seconda è un avvertimento autentico piuttosto che un artefatto di scala: Artificial Analysis ha misurato separatamente il tasso di allucinazione di Qwen3.8-Max, che è salito dal 23 per cento al 40 per cento rispetto alla generazione precedente. Per un modello pubblicizzato per il lavoro autonomo multi-step, questo è un costo che si mette in budget per i verificatori, non una nota a piè di pagina.

Fugu Max non ha alcun tipo di voce indipendente. Ogni cifra a esso associata proviene da Sakana e, al momento in cui scriviamo, non esiste alcuna pagina di Artificial Analysis per Fugu Max né per nessuno dei suoi modelli fratelli. Non è un'accusa — un modello rilasciato poche ore fa non avrà copertura di terze parti — ma significa che le due colonne non sono ugualmente verificabili, e resterà così finché qualcuno esterno a Sakana non lo eseguirà.

Due modi per spendere troppo

Entrambi questi sistemi hanno spostato il costo di una risposta dal costo di un token, e lo fanno in direzioni opposte. Qwen3.8-Max è parsimonioso sul token e prodigo sulla risposta: 180 milioni di token di output sull'Intelligence Index, il doppio della mediana, a 2,67 $ per attività. Lavora a lungo anziché essere grande, e lo sconto dell'88 percento sulla cache è la leva che controlla il conto — una lunga esecuzione di un agente che continua a rileggere lo stesso contesto rimane economica, una che continua a generare testo nuovo no.

Fugu Max è costoso per token e imprevedibile per risposta. Il suo coordinatore genera sotto-agenti, ciascuno dei quali scrive testo di ragionamento e di output fatturato a 6,00 $ per milione, più la sintesi del coordinatore stesso. Sakana si impegna a che le esecuzioni multi-agente siano fatturate a una tariffa unica mista ancorata al modello partecipante di fascia più alta e che l'aggiunta di agenti non moltiplichi la fattura, il che elimina l'esplosione worst-case del fan-out che rende insostenibili i sistemi multi-agente ingenui. Non elimina il volume. E sulla questione del volume il comunicato tace in un modo che conta: la stessa trattazione di Sakana afferma che cambiare modello a metà attività può ridurre il riutilizzo della cache di contesto e generare token di orchestrazione extra, e conferma che l'azienda non ha divulgato il tasso di successo della cache di Max né il suo costo totale in token per attività.

Quindi la stessa tariffa di $2,00 / $6,00 è un numero prevedibile da una parte e un multiplo illimitato con una soglia minima dall'altra. La verbosità di Qwen3.8-Max è misurabile prima di impegnarsi; quella di Fugu Max no.

Il test della via di fuga

È qui che il consueto argomento del lock-in si inverte, ed è la cosa più utile nell'abbinamento.

Il punto di forza di Sakana per Fugu Max è la resilienza. Un pool che spazia da modelli open-weights a modelli specializzati, ampliato per Max con la famiglia NVIDIA Nemotron, significa che la deprecazione, la rimodulazione dei prezzi o il ritiro regionale di un singolo fornitore di frontiera non può abbattere il tuo prodotto: una vera copertura, e una che l'azienda dichiara esplicitamente di vendere. Ma la copertura non è verificabile dall'esterno. Non puoi vedere il pool, non puoi includere o escludere un membro, non puoi auto-ospitare nessuna sua parte e non puoi eseguirlo affatto nell'UE/SEE. Una promessa riguardo a un pool che non ti è consentito ispezionare è una garanzia più debole di quanto sembri.

Qwen3.8-Max porta l'argomentazione nella direzione opposta. È il modello di un unico fornitore e quindi esposto alle decisioni di un unico fornitore — ma Alibaba ha pubblicato i pesi aperti per il checkpoint di classe Max Qwen3.8-2.4T-A95B con una licenza personalizzata, il che significa che la via di fuga è reale anziché retorica: se i prezzi o i termini cambiano, il modello può essere erogato dalla propria infrastruttura. Per un team la cui paura concreta è che un fornitore tiri il tappeto da sotto i piedi, un checkpoint scaricabile batte la descrizione di un pool.

Chiamare uno dei due

Qwen3.8-Max è nel nostro catalogo a $2,00 in ingresso e $6,00 in uscita per milione di token, ovvero il prezzo di listino di Alibaba con lo 0% di markup trasferito, così una variazione di prezzo del fornitore arriva sulla stessa chiave lo stesso giorno invece che secondo un calendario di migrazione. È compatibile con OpenAI sullo stesso base URL del resto del catalogo, il che significa che puoi metterlo dietro una regola di routing condizionale, una catena di failover o un pannello di model fusion senza un secondo contratto o una modifica al codice — e il failover automatico copre un percorso del fornitore limitato per frequenza o degradato. Ha movimentato 127,7 milioni di token attraverso il gateway negli ultimi sette giorni.

Fugu Max non è su OrcaRouter. Ti raggiunge tramite l'API OpenAI-compatibile di Sakana stessa e diverse piattaforme di terze parti, e l'azienda afferma che un'integrazione Fugu esistente si aggiorna con il cambio di un singolo parametro. Poiché entrambi parlano lo stesso formato di richiesta, il modo più economico per risolvere il divario nel benchmark è smettere di aspettare che Sakana lo pubblichi: esegui entrambi dietro un unico flag sul tuo carico di lavoro e conta i token di output per ogni attività completata. Questa è la misurazione che nessuno dei due fornitori ha fornito.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the argument that the industry has raced along a single axis of bigger and more expensive foundation models while the frontier that matters is two-dimensional, capability on one axis and cost on the other.

Quale, e quando

Qwen3.8-Max è la scelta che puoi verificare, valutare in termini di prezzo e abbandonare. Allo stesso listino ti offre una finestra da 1M token senza sovrapprezzo per i prompt lunghi, input di immagini, video e PDF, un checkpoint di classe Max scaricabile, una voce indipendente in tempo reale che misura le cose che determinano la tua bolletta e uno sconto dell'88 percento sull'input in cache. Anche i suoi costi sono altrettanto specifici: è lento, a 37,8 token al secondo, è in fondo alla classifica per velocità, è enormemente prolisso con 180 milioni di token sull'indice, e il suo tasso di allucinazione misurato è quasi raddoppiato rispetto alla generazione precedente — il che è una seria preoccupazione proprio per il lavoro autonomo per cui viene venduto. Sfrutta a fondo lo sconto sulla cache e metti in budget un verificatore.

Fugu Max è la scommessa che il coordinamento batte la capacità. Se il tuo lavoro è a lungo termine e verificabile, e un coordinatore che avvia un verificatore completa attività in cui un singolo modello fallisce due volte, allora i token di orchestrazione costano meno dei tentativi ripetuti e la scheda tariffaria identica non è affatto un pareggio. Ciò che stai comprando è la persistenza, in un sistema di cui non puoi fissare il pool, di cui la finestra di contesto non è pubblicata e le cui sei vittorie nei benchmark non hanno valori associati — da un fornitore che ha scelto di nominare il test e di omettere il numero.

Entrambi i prodotti costano lo stesso per token. Solo uno dei due ti dice cosa ottieni in cambio.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the Featured badge, the identifier qwen/qwen3.8-max, by Qwen dated 2026-08-03, vision, tools, JSON and reasoning capability tags, a 1M-token context window with text, image and video input, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 TTFT of 10.00 seconds, traffic of 127.7 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno