Una card del titolo principale con la scritta 'Fugu Max vs Grok 4.6' e il sottotitolo 'Listini identici, un solo punteggio pubblicato', tre badge a pillola con la scritta '$2.00 vs $2.00 input', '$6.00 vs $6.00 output' e 'Sei vittorie, zero cifre', una riga a piè di pagina con la scritta 'Sakana AI, settembre 2026 vs SpaceXAI, agosto 2026', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Fugu Max vs Grok 4.6: schede tariffarie identiche, un solo punteggio pubblicato

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Fugu Max e Grok 4.6 costano esattamente lo stesso. Sakana AI ha rilasciato Fugu Max l'11 settembre 2026, al prezzo di 2,00 $ per milione di token in input e 6,00 $ per milione di token in output — e quella è, riga per riga, la tariffa che SpaceXAI applica per Grok 4.6 dal suo lancio del 12 agosto. La coincidenza è il fatto più utile di questo confronto, perché elimina il prezzo dalla discussione. Quando due prodotti fatturano in modo identico, l'unica domanda che resta è cosa si ottiene per quei soldi, e lì i due si separano completamente. Grok 4.6 è un singolo modello che puoi fissare per versione, di cui puoi leggere una tabella di benchmark e verificare rispetto a un indice indipendente. Fugu Max è un coordinatore addestrato che smista ogni attività al modello più economico del suo pool, e l'annuncio di Sakana sostiene che ottiene il miglior punteggio complessivo su sei benchmark senza pubblicare una cifra da nessuno di essi. Uno di questi acquisti è misurabile prima di farlo. L'altro no.

Due prodotti, un unico listino

• Input — Fugu Max $2,00 per 1 milione di token vs Grok 4.6 $2,00 per 1 milione di token

• Output — Fugu Max $6.00 per 1M token vs Grok 4.6 $6.00 per 1M token

• Input in cache — Fugu Max $0,25 per 1 milione di token rispetto a Grok 4.6 $0,50 per 1 milione di token, l'unica voce in cui i due prezzi differiscono in qualche misura

• Finestra di contesto — Fugu Max non pubblicata dal fornitore vs Grok 4.6 500.000 token, invariata rispetto a Grok 4.5

• Ricalcolo del prezzo per prompt lunghi — Fugu Max non specifica alcun livello nel comunicato, mentre Grok 4.6 raddoppia a 4,00 $ / 12,00 $ non appena una singola richiesta supera i 200.000 token, applicato all'intera richiesta anziché all'eccedenza

• Controllo del ragionamento — Fugu Max non esposto vs Grok 4.6 quattro livelli di sforzo, da low a xhigh, predefinito su high e non disattivabile

• Architettura — Fugu Max, un coordinatore addestrato su un pool non divulgato che include modelli open-weight e specializzati, ampliato per Max con la famiglia NVIDIA Nemotron tramite una collaborazione con NVIDIA, rispetto a Grok 4.6, un modello a una sola versione

• Valutazione indipendente — Fugu Max: nessuna pubblicata, e non esiste alcuna pagina di Artificial Analysis per alcun modello Fugu, rispetto a Grok 4.6 che ha un Artificial Analysis Intelligence Index live di 44, classificato #20 su 200

La colonna economica è quella imprevedibile.

Guarda dove Fugu Max vince davvero sul prezzo: la lettura della cache, a metà di quella di Grok 4.6. È un vero vantaggio ed è esattamente il posto sbagliato per costruire un modello di costo, perché il prezzo della cache ripaga solo in proporzione al tuo tasso di successo della cache — e Sakana non ne pubblica uno per Fugu Max. Il comunicato non indica nemmeno una finestra di contesto, né un livello per contesti lunghi, né un limite di output. Quindi l'unica colonna in cui Fugu Max batte Grok 4.6 è uno sconto di entità sconosciuta applicato a una quota sconosciuta dei tuoi token.

I punti deboli di Grok 4.6 sono almeno visibili. La sua soglia di 200.000 token è aggressiva — ricalcola il prezzo dell'intera richiesta, quindi un prompt di 250.000 token viene fatturato a tariffa doppia fin dal primo token, non dal 200.001º. Ma puoi vedere il dirupo, misurare i tuoi prompt rispetto ad esso e decidere se suddividerli in blocchi. Questa è la differenza sostanziale qui: un sistema pubblica un listino prezzi con una struttura attorno alla quale puoi pianificare, e l'altro pubblica una tariffa di richiamo senza alcun listino allegato.

Sei vittorie e non un solo punto

I benchmark citati da Sakana sono Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Cinque di questi sono valutazioni pubbliche riconosciute. Il sesto, SWEFish, è il benchmark di programmazione di Sakana stessa, il che significa che una delle sei vittorie dichiarate è misurata su un test scritto dal fornitore e non reso pubblico. Per gli altri cinque, il comunicato afferma che Fugu Max ottiene il miglior punteggio complessivo e si ferma lì — nessun punteggio, nessun margine, nessun numero di un concorrente da affiancare.

Confrontate questo con la tabella pubblicata da SpaceXAI per Grok 4.6, che è interamente riportata dal fornitore ma è almeno una tabella: GDPVal-AA v2 a 1.753, AA-Briefcase a 1.577, DeepSWE v1.1 al 65,9%, CursorBench v3.2 al 69,9% e GPQA Diamond al 94,9%. Il materiale di lancio riporta inoltre circa 53 turni e circa mezzo miliardo di token di input per risolvere compiti a lungo orizzonte su AA-Briefcase, contro circa 103 turni e due miliardi di token per un modello frontier concorrente — un argomento, ancora una volta riportato dal fornitore, secondo cui Grok è economico per lavoro completato anche a una modesta tariffa per token.

Due dei numeri di Grok richiedono una precisazione prima che tu li citi. Il primo è che il suo punteggio principale di 94,9% su GPQA Diamond proviene da un benchmark che Artificial Analysis ha nel frattempo ritirato in quanto saturo, quindi non distingue più i modelli di frontiera come faceva un tempo. Il secondo è il numero che vedrai nelle coperture più vecchie: un Intelligence Index di 61 di Artificial Analysis per Grok 4.6. Quella era la scala precedente alla revisione. Artificial Analysis ha ricalibrato l'indice a settembre 2026, e il valore attuale è 44, al 20° posto su 200, con un costo di 1,86 $ per attività dell'Intelligence Index. Chiunque collochi Grok 4.6 rispetto a Claude Fable 5 o GPT-5.6 Sol su un 61 sta confrontando letture provenienti da due strumenti diversi.

A two-column scoreboard titled 'Fugu Max vs Grok 4.6 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Grok 4.6: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.50 per 1M, context 500K with a 200K repricing cliff, benchmarks GDPVal 1,753 and DeepSWE 65.9%, evidence Artificial Analysis Index 44 ranked #20 of 200. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Grok 4.6 rows SpaceXAI-reported and per Artificial Analysis. No independent Fugu Max evaluation exists.' OrcaRouter logo bottom-right.

Cosa non include il prezzo del token di un orchestratore

La copertura del rilascio da parte di Sakana stessa ammette il problema strutturale. Poiché Fugu Max passa da un modello all'altro all'interno di un singolo compito, può "ridurre il riutilizzo della cache del contesto e anche generare token di orchestrazione extra" — e l'azienda non ha divulgato il tasso di hit della cache risultante o un costo totale in token per compito. Ogni agente che il coordinatore genera scrive testo di ragionamento e di output, e tutto ciò viene fatturato a $6,00 per milione. La tariffa è identica a quella di Grok 4.6. Il volume no, e il volume è la variabile che una pagina dei prezzi non può mostrarti.

Entrambi i fornitori ti stanno spingendo verso la stessa correzione — smetti di confrontare le tariffe, inizia a confrontare il costo per lavoro finito — ma solo uno dei due ti fornisce un numero da cui partire. Grok 4.6 arriva con un profilo pubblicato di turni e token. Fugu Max arriva con l'istruzione di misurarlo da solo.

C'è una lettura equa del silenzio di Fugu Max e merita di essere esplicitata. Max è il tier ottimizzato per i costi della linea Fugu, distribuito lo stesso giorno di Fugu Ultra v2, che è la spinta sulle capacità a $5,00 di input e $30,00 di output. L'argomento visivo di Sakana per Max è un grafico di Pareto — capacità contro costo — e su un grafico di Pareto un punteggio benchmark grezzo è irrilevante; il punteggio per dollaro è l'intera tesi. Se questo è l'argomento, stampare sei punteggi vincenti senza i loro costi sarebbe il grafico fuorviante, non quello mancante. Ciò che il rilascio deve ancora a un acquirente è un denominatore, e non ne fornisce uno.

Dove Grok 4.6 è davvero esposto

Il lavoro da terminale è la superficie pubblicata più debole di Grok 4.6. Il suo punteggio su Terminal-Bench v3.0 si attesta al 26%, ben dietro la vetta del settore. Fai attenzione alla cifra vicina: lo stesso modello totalizza l'88,4% su Terminal-Bench v2.1, e quelli sono test diversi. Nei resoconti vedrai le due cose mescolate, e la mescolanza favorisce notevolmente Grok.

La seconda esposizione è che il ragionamento non può essere disattivato. I token di pensiero vengono fatturati a ogni richiesta, quindi il costo effettivo di output di Grok 4.6 dipende da quanto a fondo il modello decide di riflettere sul tuo prompt. La manopola dello sforzo ti dà il controllo al livello minimo, ma non esiste un'impostazione zero.

In confronto, Grok 4.6 ha qualcosa che Fugu Max al momento non può offrire a nessun prezzo: un numero. Ogni riga qui sopra può essere verificata da una terza parte, e la voce di Artificial Analysis significa che una lo è già stata. Le sei vittorie di Fugu Max sono state pubblicate lo stesso giorno del modello, dall'azienda che l'ha costruito, e al momento in cui scriviamo nessuno al di fuori di Sakana l'ha provato.

Chiamando uno, pilotando l'altro

Grok 4.6 è su OrcaRouter al prezzo di listino di SpaceXAI — 2,00 $ per milione di input, 0,50 $ in caso di cache hit, 6,00 $ per milione di output — passato con markup dello 0%, quindi una variazione del prezzo del fornitore raggiunge il nostro gateway lo stesso giorno invece che secondo un calendario di migrazione. È compatibile con OpenAI sullo stesso URL di base del resto del catalogo, il che significa che puoi inserirlo in una catena di failover o dietro una regola di routing condizionale invece di codificare in modo fisso un provider in un percorso di produzione, e puoi testarlo in A/B rispetto a un altro modello senza un secondo contratto. Ha movimentato 46,6 milioni di token attraverso il gateway negli ultimi sette giorni.

Fugu Max non è nel nostro catalogo. Ti raggiunge tramite l'API compatibile con OpenAI di Sakana stessa e diverse piattaforme di terze parti, e l'azienda afferma che un'integrazione Fugu esistente si aggiorna a essa con un solo cambio di parametro. Poiché entrambi usano lo stesso formato di richiesta, una valutazione che li mette dietro un unico flag è una sostituzione del base-URL anziché una riscrittura — il che è il modo giusto per dirimere questa particolare questione, dal momento che la questione riguarda i token per attività completata e solo il tuo carico di lavoro può produrre quel numero.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the introductory argument that a system deploying a multi-trillion-parameter model for a simple lookup is wasteful, and a cost-versus-performance chart placing Fugu Max on a frontier formed by Fugu models above the frontier formed by single models.

Quale comprare

Grok 4.6 è il default difendibile. Con un listino prezzi identico a quello di Fugu Max, ti offre una finestra di contesto da 500K su cui pianificare, una versione che puoi bloccare, quattro livelli di controllo del ragionamento, un posizionamento in un indice indipendente a 44 con accanto una cifra di costo per attività, e mesi di misurazioni di terze parti. I suoi costi sono specifici e noti: il salto di riprezzamento a 200K, il ragionamento che fattura sempre e un profilo di lavoro in terminale che è in ritardo rispetto al campo.

Fugu Max è la scommessa più interessante e, stando alle prove disponibili, quella meno ispezionabile. La logica progettuale è solida: se un coordinatore sceglie in modo affidabile il modello più economico in grado di completare il tuo compito, il costo mediano per lavoro completato diminuisce anche quando il tuo listino prezzi non lo fa. Ma a $2,00 / $6,00 la tariffa per token non è dove risiede il vantaggio di Fugu Max; quella tariffa è esattamente quella di Grok 4.6. Il vantaggio deve derivare dal consumo di meno token, e Sakana non ha pubblicato la misurazione che dimostrerebbe che è così.

Quindi esegui il confronto nel modo in cui entrambi i fornitori ti chiedono di farlo. Metti Grok 4.6 sul tuo gateway, invoca Fugu Max dietro un flag di funzionalità e conta i token di output per attività completata su un lavoro simile al tuo. Se Fugu Max termina con meno token rispetto a un singolo modello alla stessa tariffa, lo sconto della cache e il coordinamento sono soldi veri e il passaggio è giustificato. Se non è così, stai pagando tariffe identiche per un sistema la cui composizione può cambiare sotto di te senza che il suo numero di versione cambi.

Per tutto ciò che puoi decidere questo trimestre senza quella misurazione, inizia con il modello che ha un tabellone.

A screenshot of the OrcaRouter model page for Grok 4.6 (English UI, captured September 11, 2026), showing the NEW and Featured badges, the identifier grok/grok-4.6, by SpaceXAI dated 2026-08-12, vision, tools, JSON and reasoning capability tags, a 500K-token context window with text, image and file input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, traffic of 46.6 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno