
Fugu Max vs GLM-5.3: il modello value è minato dal modello volume
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Fugu Max era prezzato per vincere sul costo e GLM-5.3 è più economico su entrambi i fronti. Il coordinatore di Sakana AI è stato lanciato l'11 settembre 2026 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output, progettato per instradare ogni attività verso il modello meno costoso in grado di gestirla. GLM-5.3 di Z.ai, in listino dal 18 agosto 2026, si attesta a 1,26 $ in input e 3,96 $ in output per milione su OrcaRouter — tra un terzo e due quinti in meno rispetto a Fugu Max su entrambi, da un singolo modello solo testuale con una finestra di contesto dichiarata di 1M e un tetto di output di 128K. GLM-5.3 è anche, con un ampio margine, il modello più trafficato del nostro catalogo. Questa combinazione — più economico per token e dimostratamente in grado di sostenere traffico di produzione su larga scala — rende questo il confronto in cui il sovrapprezzo per l'orchestrazione è più difficile da giustificare.
Più economico su entrambi gli assi, con la specifica pubblicata
Il confronto è scomodo per Fugu Max ancor prima che qualsiasi benchmark entri in gioco, perché non si tratta di barattare capacità con il prezzo. GLM-5.3 è a pieno titolo un modello di punta prossimo alla frontiera — Z.ai lo descrive come in grado di offrire un miglioramento della codifica di circa il 50% rispetto a GLM-5.2 e di eguagliare Mythos 5 su capacità selezionate di cybersicurezza. Non è un modello economico offerto come alternativa a basso costo. È un modello di punta che si trova ad avere un prezzo inferiore a quello di un orchestratore ottimizzato per i costi.
• Prezzo di input — Fugu Max $2.00 per 1M token vs GLM-5.3 $1.26 per 1M token
• Prezzo di output — Fugu Max 6,00 $ per 1 milione di token rispetto a GLM-5.3 3,96 $ per 1 milione di token
• Input in cache — Fugu Max $0,25 per 1M token vs caching di GLM-5.3 prezzato come sconto sulla tariffa base di input
• Contesto — Fugu Max non pubblicato vs GLM-5.3 1M token
• Limite di output — Fugu Max non pubblicato vs GLM-5.3 128K token
• Modalità — Fugu Max non pubblicato vs GLM-5.3 solo testo, documentato come tale
• Tag di capacità — Fugu Max nessuno pubblicato vs GLM-5.3 uso degli strumenti, modalità JSON, ragionamento
• Cifre di benchmark — Fugu Max: sei vittorie dichiarate senza punteggi rispetto a GLM-5.3, il cui DeepSWE riportato dal fornitore va da 46,2 a 66,9 rispetto alla generazione precedente, più un punteggio di intelligenza Artificial Analysis pubblicato
• Pesi — Fugu Max chiuso, pool non divulgato vs GLM-5.3, di un laboratorio con una tradizione di pesi aperti
• Traffico osservato su OrcaRouter — Fugu Max nessuno, non veicolato rispetto a GLM-5.3 7.962,7M token negli ultimi sette giorni
Nota cosa fanno insieme le ultime due righe. GLM-5.3 proviene da una discendenza con pesi aperti, che è la forma più forte disponibile dell'argomento di indipendenza dal fornitore che Sakana vende come premessa assoluta di Fugu Max. E ha una cifra di traffico osservabile di un ordine di grandezza superiore alla maggior parte dei modelli che serviamo. Se la domanda è "cosa eseguo per un lavoro di produzione ad alto contenuto testuale a una tariffa bassa", le prove indicano altrove rispetto all'orchestratore.

L'argomento del volume, e perché non è solo una gara di popolarità
Un numero di traffico non è un numero di qualità, e non dovrebbe essere letto come tale. Ciò che 7,96 miliardi di token in sette giorni dimostra è che GLM-5.3 è stato eseguito su scala di produzione da molti team indipendenti, su carichi di lavoro reali, e non ha generato una migrazione di massa lontano da esso. Questo è un segnale debole sulla qualità e un segnale forte sull'idoneità operativa: la latenza è stabile, il throughput regge, l'API si comporta bene sotto carico e le modalità di guasto sono note a una popolazione sufficientemente ampia da emergere pubblicamente. Un modello rilasciato la stessa settimana di Fugu Max non ha nulla di tutto ciò alle spalle.
La riga della latenza rende il punto ancora più chiaro. GLM-5.3 mostra un tempo al primo token p50 di 4,33 secondi sul traffico che serviamo. Per il lavoro agentico — il carico di lavoro a cui sono destinati entrambi questi prodotti — il tempo al primo token si accumula a ogni turno di ogni subagente che il coordinatore genera. Un orchestratore più economico che genera quattro agenti non è più economico se ognuno di essi attende diversi secondi prima di emettere qualsiasi cosa, e quel costo non compare mai su un listino prezzi.
La controargomentazione di Fugu Max è che il suo coordinatore indirizza verso il modello capace più snello per ogni richiesta, il che in linea di principio significa che molte attività non toccano mai un backend costoso. L'espansione del pool di Sakana in questa release ha aggiunto modelli open-weights e specializzati, tra cui la famiglia NVIDIA Nemotron, grazie a una collaborazione con NVIDIA, quindi i gradini economici di quella scala sono reali. La domanda è se questi gradini costino meno di 3,96 $ per milione di token di output. Per la maggior parte delle attività testuali, non è così: l'asticella è bassa, e i modelli open-weights eseguiti a tariffe di hosting generalmente la superano solo di un margine ristretto.
Domande che vale la pena porsi prima di scegliere
Un orchestratore è più economico di un singolo modello open-weights? Non per impostazione predefinita, e l'intuizione va nella direzione sbagliata. L'orchestrazione aggiunge i token di sintesi di un coordinatore e, nelle esecuzioni multi-agente, l'output di ogni agente del team. Il prezzo di Fugu di Sakana elimina il caso peggiore fatturando una tariffa unica combinata basata sul modello partecipante di fascia più alta anziché impilare agenti, il che è una concessione autentica. Ma la tariffa base che stai combinando è di $6,00 di output, e il singolo modello che altrimenti chiameresti è $3,96. L'orchestrazione fa risparmiare denaro quando previene i ritentativi, non quando aggiunge parallelismo fine a se stesso.
Una limitazione al solo testo ha importanza per uno dei due? Per GLM-5.3 è documentata, quindi è un vincolo che puoi pianificare — niente visione, niente audio, niente video, e il catalogo lo dice. Per Fugu Max, le modalità supportate semplicemente non sono pubblicate. È peggio di una limitazione, perché non puoi sapere se una pipeline che invia un PDF funzionerà finché non la provi. Un vincolo non dichiarato non è la stessa cosa di un vincolo assente.
Cosa succede a ciascuno quando i modelli sottostanti cambiano? GLM-5.3 è un modello in una versione, addestrato e servito da Z.ai. Se Z.ai cambia i suoi prezzi, la modifica arriva sulla tua chiave lo stesso giorno tramite OrcaRouter con markup dello 0%, e puoi vederla e reagire. Il comportamento di Fugu Max dipende da un pool i cui membri Sakana non divulga, quindi la deprecazione o la variazione di prezzo di un laboratorio di frontiera altera silenziosamente ciò che stai acquistando senza che il nome del prodotto cambi. Sakana lo presenta come resilienza. È resilienza per il venditore e opacità per l'acquirente.

Dove vengono effettivamente prese le decisioni di routing
Entrambe sono, di fatto, decisioni di routing — Fugu Max le prende all'interno di un coordinatore opaco, e tu le prendi al livello API. OrcaRouter è del secondo tipo: una sola API per oltre 200 modelli con un DSL di routing che ti consente di esprimere la policy in modo esplicito, failover automatico quando un percorso di un provider si degrada, e fusione di modelli quando vuoi combinare gli output deliberatamente anziché affidarti a una scatola nera per farlo. GLM-5.3 è presente in quel catalogo al prezzo di listino di Z.ai con markup 0%, il che vale più del solito per un modello con tutto questo traffico alle spalle: la tariffa che vedi è quella pubblicata da Z.ai, trasferita invariata.
La differenza pratica è l’auditabilità. Quando Fugu Max sceglie un modello per la tua richiesta, non ti viene detto quale sia né perché. Quando scrivi tu stesso la policy di routing, la decisione è nel tuo repository, verificabile da chiunque revisioni il tuo codice, e modificabile senza aspettare un fornitore. Per i team soggetti a qualsiasi tipo di obbligo di compliance o di contabilità dei costi, questa non è una differenza filosofica.
Il verdetto
GLM-5.3 vince questo confronto sui termini che contano di più per un team di produzione: è più economico in input e output, la sua finestra di contesto e il tetto di output sono pubblicati, i suoi limiti di modalità sono dichiarati, include uso di strumenti, modalità JSON e ragionamento come capacità documentate, proviene da una linea open-weights e ha un dato di traffico su sette giorni vicino a otto miliardi di token. Non esiste alcuna lettura delle prove pubbliche secondo cui Fugu Max sia l'acquisto meglio supportato dalle prove a questo livello di prezzo.
Fugu Max sostiene una sola tesi, ed è una tesi valida: per le attività in cui il secondo passaggio di un coordinatore intercetta un errore che il primo passaggio avrebbe lasciato passare, il costo per attività completata può battere il costo per token. Vale la pena un pilot circoscritto se il tuo lavoro è verificabile, ad alto volume e ti trovi fuori dall'UE/SEE — con un tetto di token di output fissato in anticipo e una misurazione dei token per attività completata. Altrimenti, la risposta è il singolo modello che costa un terzo in meno e che gira sotto carico di produzione da un mese, ed è su OrcaRouter al prezzo di listino di Z.ai con la tariffa del fornitore riportata tal quale.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
