
Fugu Ultra v2 vs Grok 4.6: Cinque volte il prezzo di output, un unico benchmark condiviso
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Esiste esattamente un benchmark sul quale Fugu Ultra v2 e Grok 4.6 pubblicano entrambi un numero, ed è DeepSWE: Sakana AI riporta 74,3 per Fugu Ultra v2 nel suo annuncio dell'11 settembre 2026, mentre il materiale di lancio di xAI per Grok 4.6 indica il suo punteggio DeepSWE v1.1 al 65,9%. Si tratta di un divario di 8,4 punti, ed è l'unico confronto pulito che le due aziende offrono. Tutto il resto che potresti mettere a confronto — Chartography e SWEFish di Sakana contro GPQA Diamond e CursorBench di Grok — è misurato su strumenti diversi da laboratori diversi. Quindi la domanda onesta non è "quale sia più intelligente". È se il vantaggio dichiarato di Fugu Ultra v2 valga la pena di pagare 30 $ per milione di token di output, quando Grok 4.6 ne fa pagare 6 $.
Due risposte diverse allo stesso problema
Grok 4.6 è un unico modello, ed è l'attuale modello di punta della linea Grok — elencato come "Latest" nella documentazione per sviluppatori dello stesso fornitore, successore di Grok 4.5 con la stessa finestra di contesto da 500.000 token, la stessa superficie di input per testo/immagini/file e lo stesso prezzo di base. Ha una data di aggiornamento delle conoscenze al 1º febbraio 2026 ed espone il livello di sforzo di ragionamento su low, medium, high e xhigh, con high come impostazione predefinita. Un dettaglio che sorprende molti: il ragionamento non può essere disattivato. I token di pensiero vengono fatturati a ogni richiesta, il che fa dipendere il costo reale di output di Grok 4.6 da quanto intensamente decida di pensare.
Fugu Ultra v2non è affatto un modello nel senso consueto. È il livello di capacità di punta della linea di orchestrazione di Sakana AI — un singolo endpoint compatibile con OpenAI che scompone un compito e lo distribuisce su un pool di altri modelli, alcuni open-weights, altri specializzati. La posizione di Sakana è che raggiunge un output di livello frontier "senza la dipendenza indispensabile dai modelli frontier che orchestra", e dichiara apertamente che Claude Fable 5, Claude Fable 5.1 e GPT-6 Astra sono esclusi da quel pool. Stai pagando per il livello di scheduling e per ogni token che i sotto-agenti consumano.
Questa distinzione non è puramente estetica. È l'intera ragione per cui esiste il divario di prezzo, ed è l'unica cosa che rende quel divario difendibile.
Le schede tariffarie, inclusa la parte che si ripete
• Input — Fugu Ultra v2 $5,00 per 1M vs Grok 4.6 $2,00 per 1M. Fugu è 2,5× prima che avvenga qualsiasi sottochiamata.
• Output — Fugu Ultra v2 $30.00 per 1 mln vs Grok 4.6 $6.00 per 1 mln. Un divario di 5×, e quello che decide la maggior parte delle bollette.
• Input in cache — 0,50 $ per 1M su entrambi. Identici. Due fornitori che non hanno nient'altro in comune sono arrivati allo stesso prezzo di lettura della cache, il che rende i cicli degli agenti a forte uso di cache l'unico carico di lavoro in cui i due sono davvero confrontabili riga per riga.
• Nuova tariffazione per contesto lungo — Grok 4.6 raddoppia a $4,00 / $12,00 una volta che un prompt supera i 200.000 token, e la nuova tariffazione si applica all'intera richiesta, non solo all'eccedenza. Il livello segnalato di Fugu Ultra v2 al di sopra di circa 272.000 token di input passa a circa $10,00 / $45,00, anch'esso sull'intera richiesta. Entrambi penalizzano i prompt lunghi; Grok inizia a penalizzare 72.000 token prima.
• Finestra di contesto — Grok 4.6 500K token contro Fugu Ultra v2 1M, come riportato da elenchi di terze parti. La pagina di annuncio di Sakana non indica affatto una cifra di contesto, quindi considera il suo 1M come non confermato dal fornitore.
La riga del contesto lungo taglia in entrambe le direzioni e vale la pena fare i calcoli. Un prompt da 300K token ti costa 4,00 $ per milione di input su Grok 4.6 e circa 10,00 $ su Fugu Ultra v2. Un prompt da 150K token costa 2,00 $ su Grok e 5,00 $ su Fugu. Il modello di Sakana è più costoso a ogni lunghezza di prompt — l'unica domanda è quanto spesso debba essere chiamato.

L'argomento a favore di pagare 5× sull'output
La tesi a favore di un orchestratore non è che costi meno per token. È che richiede meno tentativi, e che i token che spende per il coordinamento costano meno dei token che spenderesti fallendo.
Questo è un argomento valido, e Sakana lo sta dichiarando esplicitamente: Fugu Ultra v2 è pensato per lavori complessi a più passaggi — ricerca autonoma, sviluppo full-stack — dove la modalità di fallimento di un singolo modello è deragliare a metà di una lunga esecuzione. Se una tariffa di output di $30 ti fa ottenere un compito completato al primo tentativo invece che al terzo, il sovrapprezzo per token è irrilevante.
Ci sono prove a sostegno provenienti dalla stessa parte della barricata del fornitore, anche se sono favorevoli al fornitore e vanno lette come tali. Il materiale di lancio di xAI per Grok 4.6 cita all'incirca 53 turni e circa 0,5 miliardi di token di input per risolvere compiti a lungo orizzonte, contro circa 103 turni e 2,0 miliardi di token di input per un modello di frontiera concorrente — un argomento secondo cui Grok stesso è economico per compito anche a un basso prezzo per token. Entrambe le aziende stanno facendo la stessa mossa: spingerti ad allontanarti dal listino prezzi e ad andare verso il costo per lavoro completato.
Il che significa che il numero decisivo è uno che nessuno dei due fornitori pubblica, e che devi misurare da solo: token consumati, dall'inizio alla fine, su un compito simile al tuo.
Dove ciascuno è davvero debole
Il punto debole dichiarato di Grok 4.6 è il lavoro da terminale. Il suo punteggio su Terminal-Bench v3.0 si attesta al 26%, ben dietro la vetta del settore, anche se lo stesso modello registra un ben più solido 88,4% sul più vecchio Terminal-Bench v2.1 — si tratta di test diversi e mescolarli è un errore che vedrai in molte analisi. Detiene inoltre il punteggio più alto della sua coorte su GPQA Diamond, con il 94,9%, ma GPQA Diamond è ormai stato rimosso dall'indice di Artificial Analysis in quanto saturo, quindi un punteggio elevato in quel test non discrimina più tra i modelli di frontiera come faceva un anno fa.
Sul fronte indipendente, Artificial Analysis assegna a Grok 4.6 un punteggio di 44 nel suo Intelligence Index v4.3, posizionandolo al #20 posto su 200, con un costo per attività di $1,86. Il valore di 61, spesso diffuso, proviene da una scala di indice superata e non andrebbe citato senza specificare quale versione lo abbia prodotto.
Il punto debole di Fugu Ultra v2 è la verifica. Al momento della pubblicazione, nulla di ciò che Sakana ha dichiarato al riguardo — i cinque risultati migliori o a pari merito, il punteggio Chartography di 48,3 contro il 27,3 di Opus 5 e il 29,5 di Fable 5, il 74,3 di DeepSWE — è stato riprodotto in modo indipendente. Inoltre non esiste alcun dato pubblicato su latenza o throughput, che conta più per un orchestratore che per un singolo modello, perché il suo tempo di risposta dipende interamente da ciò che decide di chiamare. Per il precedente Fugu Ultra, i tester hanno segnalato pubblicamente esecuzioni che si protraevano fino a circa 30 minuti; quello è il modello di giugno 2026, non la v2, ma è la modalità di errore da testare prima di dedicare un percorso alla produzione.

Una nota sul nome del fornitore
Una complicazione che vale la pena conoscere prima di cercare Grok 4.6 in una console per sviluppatori: il modello viene costantemente chiamato Grok 4.6, ma il branding del fornitore che lo circonda è in evoluzione. La documentazione di xAI ora porta il nome SpaceXAI, un cambiamento che la maggior parte della copertura del lancio non ha ancora recepito. Gli identificatori del modello e la superficie API sono invariati — Grok 4.6 è un modello OpenAI Responses di prima classe e si inserisce nei loop di tool-calling esistenti senza un livello di traduzione — ma se stai cercando una scheda del modello e il branding sembra sbagliato, non è un tuo errore.
Chiamare uno dei due in pratica
Grok 4.6 è su OrcaRouter alla tariffa del provider stesso — 2,00 $ per milione di input e 6,00 $ per milione di output, trasferiti senza alcun ricarico, così una variazione di prezzo del fornitore arriva qui lo stesso giorno anziché secondo un calendario di migrazione. È compatibile con OpenAI sulla stessa base URL di tutto il resto del catalogo, il che significa che puoi metterlo dietro una catena di fallback o una regola di routing invece di codificarlo in modo fisso, e puoi confrontarlo in A/B con un altro modello senza un secondo contratto né modifiche al codice.
Fugu Ultra v2 non viene instradato da noi. È disponibile tramite l'API compatibile con OpenAI di Sakana AI stessa, e l'azienda afferma che un'integrazione Fugu esistente passa ad esso con la modifica di un solo parametro. Se vuoi confrontare i due sul tuo carico di lavoro, la soluzione più economica è lasciare Grok 4.6 sul tuo gateway e chiamare Fugu Ultra v2 direttamente da Sakana dietro un feature flag — entrambi parlano lo stesso formato di richiesta, quindi lo stesso test harness funziona su entrambi.

Il verdetto
Grok 4.6 è la scelta predefinita razionale per la maggior parte dei team, e sul prezzo non c'è confronto. A 2,00 $ / 6,00 $ con una lettura della cache da 0,50 $ e una finestra da 500K, gestisce il ragionamento su documenti lunghi, gli agenti di coding e il lavoro su file multimodali a un quinto della tariffa di output di Fugu Ultra v2, ed è valutato e sottoposto a benchmark in modo indipendente. La sua esposizione è la lunghezza del prompt — il salto dei 200K raddoppia l'intera richiesta — e i cicli di agenti con forte uso del terminale, dove i suoi punteggi pubblicati non sono competitivi.
Fugu Ultra v2 vale il suo sovrapprezzo solo se hai un tipo specifico di carico di lavoro: attività lunghe, multi-step, ad alta autonomia, dove un singolo modello tende a deragliare, e dove vuoi anche la proprietà architetturale che Sakana sta vendendo — un livello di capacità che non dipende dal fatto che un qualsiasi fornitore di frontiera resti disponibile o resti economico. È una cosa reale da desiderare. Ma è un'affermazione, non ancora una misurazione, e il divario DeepSWE che lo fa sembrare credibile è un singolo benchmark di un singolo fornitore il giorno del rilascio.
Se non sai dire quale dei tuoi compiti fallisce attualmente al secondo o al terzo tentativo, non hai ancora il numero che giustificherebbe la differenza di prezzo. Misura prima quello. I listini tariffari ti dicono già tutto il resto.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
