
Fugu Max vs Kimi K3: Sakana ha scelto questo metro di paragone, quindi leggiamolo
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Il rilascio di Fugu Max da parte di Sakana AI nomina esattamente tre modelli per giustificarne il prezzo, e Kimi K3 di Moonshot AI è uno di questi. L'affermazione è che il prezzo di output di Fugu Max è dal 40 al 60 percento inferiore a quello di quei tre, il che rende Kimi K3 — non Grok 4.6, non Qwen3.8-Max — il benchmark che Sakana stessa ha scelto per il valore. È una cosa insolitamente generosa da parte di un fornitore: ti porge un metro e ti dice dove tenerlo. Quindi questa pagina fa la cosa ovvia e lo tiene. Fugu Max è stato rilasciato l'11 settembre 2026 a $2,00 per milione di token di input e $6,00 per milione di token di output. Kimi K3 ha un listino di $3,00 e $15,00. L'affermazione del 60 percento sull'output è aritmeticamente corretta. Ciò che la frase non menziona è che il modello che sta battendo sul prezzo pubblica un resoconto completo di risultati misurati in modo indipendente, e il modello che attua la riduzione di prezzo non ne pubblica alcuno.
La frase del 40-60 percento, esaminata
• Input — Fugu Max 2,00 $ per 1 milione di token rispetto a Kimi K3 3,00 $ per 1 milione di token, un risparmio del 33% anziché del 40-60% che il comunicato mette in primo piano
• Output — Fugu Max 6,00 $ per 1 milione di token contro Kimi K3 15,00 $ per 1 milione di token, che è inferiore del 60 percento, il limite superiore dell'intervallo dichiarato da Sakana
• Input in cache — Fugu Max 0,25 $ per 1M di token contro Kimi K3 0,30 $ per 1M di token, un divario abbastanza piccolo da non farsi notare nei cicli a uso intensivo della cache
• Finestra di contesto — Fugu Max nessun dato pubblicato nella release vs Kimi K3 1.048.576 token
• Ricalcolo del prezzo per i prompt lunghi — Fugu Max non indica alcuna fascia vs Kimi K3 con tariffa fissa per l'intera finestra e nessun sovrapprezzo a qualsiasi lunghezza
• Distribuzione — solo API del fornitore Fugu Max, appartenenza al pool non divulgata vs pesi scaricabili di Kimi K3 secondo la licenza Kimi K3
• Valutazione indipendente — Fugu Max: nessuna, e non esiste alcuna pagina di Artificial Analysis per nessun modello Fugu, rispetto a Kimi K3 con un Artificial Analysis Intelligence Index di 44 e un 93,40% standardizzato su SWE-bench Verified da Vals AI
Nota la forma di quella prima riga. L'intervallo di riferimento, dal 40 al 60 per cento, è l'intervallo tra tre concorrenti nominati, e Kimi K3 è quello che produce il 60. Considerando solo l'input, il confronto è del 33 per cento, che è comunque un risparmio reale ma una frase diversa. Non è una critica al prezzo — $2.00 e $6.00 sono numeri davvero bassi per un sistema che rivendica risultati vicini alla frontiera. È un'osservazione su quale numero nel comunicato sta svolgendo il ruolo persuasivo, e su come il paragrafo è costruito attorno ad esso.
Kimi K3 è nel nostro catalogo alla tariffa di Moonshot stessa — 3,00 $ per milione di token in input, 0,30 $ in caso di cache hit, 15,00 $ per milione in output — trasferita senza alcun ricarico, quindi se Moonshot modifica i suoi prezzi la nuova tariffa è attiva sulla stessa chiave lo stesso giorno anziché su un ciclo di migrazione. Qui conta più del solito, perché un taglio di prezzo a monte è esattamente ciò che erode o amplia il divario del 60 percento su cui si fonda l'intero confronto.
Ciò che pubblica il parametro di riferimento
Il palmarès di Kimi K3 è tutto fuorché scarno. La model card di Moonshot stessa riporta Terminal-Bench 2.1 a 88,3, GPQA Diamond a 93,5, HLE-Full a 43,5 che sale a 56,0 con gli strumenti, SWE-Marathon a 42,0, OSWorld-Verified a 84,8, MCPMark-Verified a 94,5 e DeepSWE a 67,5. Tutti dichiarati dal fornitore, e ce ne sono parecchi.
Esiste anche il livello indipendente, che è la parte che conta per questo confronto. Artificial Analysis assegna a Kimi K3 un punteggio di 44 sull'Intelligence Index v4.3 — secondo tra i modelli open-weight, dietro GLM-5.3 a 45 — con un throughput registrato di 37,9 token di output al secondo e un tempo al primo token di 3,80 secondi. L'harness agentico standardizzato di Vals AI lo colloca al 93,40% su SWE-bench Verified, dietro Claude Opus 5 e DeepSeek V4 Pro ma vicino. Guida anche la Frontend Code Arena con 1679 Elo, davanti a Claude Fable 5 a 1631 e GPT-5.6 Sol a 1618. Una precisazione: se avete visto Kimi K3 citato a 57 o 60 sull'Intelligence Index, quelli sono dati precedenti alla riformulazione, risalenti a prima che Artificial Analysis ricalibrasse la scala a settembre 2026, e non dovrebbero essere ripetuti insieme ai numeri attuali.
C'è anche un segnale di utilizzo, e proviene dal nostro gateway, non dal marketing di qualcun altro: Kimi K3 ha fatto passare circa 3,27 miliardi di token attraverso OrcaRouter negli ultimi sette giorni, il traffico più intenso di qualsiasi modello in questo confronto. Non è una misura della qualità. È un ampio campione di ciò a cui gli sviluppatori ricorrono quando l'unico costo della scelta è il prezzo per token, e dice che la finestra piatta da 1M e i pesi aperti hanno già conquistato una quota sostanziale di vero lavoro a lungo orizzonte.

Il tabellone sul quale non ci sono numeri
Sakana riporta che Fugu Max ottiene il miglior punteggio complessivo su sei benchmark: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench e SWEFish. Afferma inoltre che Max espande la frontiera di Pareto costo-prestazioni su sette dei dieci benchmark. Entrambe sono affermazioni sulla posizione in un grafico. Nessuna delle due è accompagnata da un valore, un margine o una cifra di un concorrente accanto.
Le due liste si toccano appena, ed è questo il problema pratico. Kimi K3 riporta 88,3 su Terminal-Bench 2.1; Sakana afferma che Fugu Max ottiene il miglior risultato complessivo su Terminal Bench 2.1 e non pubblica nulla con cui confrontarlo. Quella singola riga è l'illustrazione più chiara dell'intero confronto: entrambi i fornitori citano lo stesso test, uno pubblica un numero e l'altro pubblica la parola "best". Finché Sakana non pubblica il dato, nessuna prova pubblicata risponde alla domanda se Fugu Max batta Kimi K3 sul benchmark che Sakana ha scelto di mettere in primo piano.
Esiste una lettura equa del comunicato che vale la pena esporre. Fugu Max è il tier di costo — rilasciato lo stesso giorno di Fugu Ultra v2, che è la spinta sulle capacità a 5,00 $ in input e 30,00 $ in output — e la sua argomentazione si fonda su un grafico di Pareto in cui l'affermazione riguarda il punteggio per dollaro, non il punteggio. In questa impostazione, un semplice numero di benchmark sarebbe la statistica meno onesta. Il problema è che il comunicato omette anche il denominatore: la stessa documentazione di Sakana ammette che cambiare modello a metà attività può ridurre il riutilizzo della cache di contesto e generare token di orchestrazione aggiuntivi, e conferma che l'azienda non ha divulgato il tasso di successo in cache di Max né il suo costo totale in token per attività. Quindi l'unica misura che risolverebbe un'argomentazione sul tier di costo è quella che non viene fornita.
Pesi che puoi tenere, o una piscina che non puoi vedere
È qui che i due prodotti smettono del tutto di essere paragonabili.
Kimi K3 viene distribuito con pesi scaricabili, il che è una vera via di fuga: se i prezzi o i termini cambiano, il modello può essere servito dalla propria infrastruttura. La licenza è più restrittiva di quanto "pesi aperti" di solito implichi. È la Kimi K3 License anziché una concessione approvata dall'OSI, e la descrizione, ripetuta spesso, che la definisce una MIT modificata è contestata. I termini richiedono un accordo separato con Moonshot per le attività di model-as-a-service con ricavi superiori a 20 milioni di dollari in qualsiasi periodo di dodici mesi consecutivi, oltre all'attribuzione per prodotti con più di 100 milioni di utenti mensili o 20 milioni di dollari di ricavi mensili, con esenzione per l'uso interno. E la scala pratica è reale: il checkpoint è di circa 1,5 terabyte e Moonshot consiglia 64 o più acceleratori, quindi l'auto-hosting è una decisione da cluster di inferenza, non da laptop.
Fugu Max non offre nulla di tutto ciò — nessun peso, nessun pool ispezionabile, nessuna opzione di self-hosting — e in cambio non impone alcuna condizione di licenza, perché non c'è nulla da concedere in licenza. Il beneficio dichiarato da Sakana è l'inverso del controllo: un pool che copre modelli open-weight e modelli specializzati, ampliato per Max con la famiglia NVIDIA Nemotron, significa che la dismissione o la variazione dei prezzi di un singolo fornitore a monte non può far cadere il tuo prodotto. È una vera copertura. Inoltre, non è verificabile dall'esterno, perché la composizione non viene deliberatamente pubblicata, e significa che un risultato di Fugu Max porta con sé una data di scadenza che un risultato di Kimi K3 non ha.
Pesi aperti e un pool non divulgato sono due risposte diverse alla stessa paura. Una dice che puoi andartene. L'altra dice che non c'è nulla da lasciare.
Dove la finestra piatta decide
Il contesto da 1.048.576 token di Kimi K3 è piatto — nessun livello per il contesto lungo, nessun sovrapprezzo a qualsiasi lunghezza. La release di Fugu Max non indica alcuna finestra, quindi non c'è nulla con cui confrontarla e nulla su cui pianificare. Per il coding agentico a lungo orizzonte a cui entrambi i prodotti sono destinati, dove le sessioni trascorrono gran parte della loro vita in profondità nel contesto, quell'asimmetria conta più del listino prezzi.
La velocità è l'immagine speculare dello stesso problema. I 37,9 token al secondo di Kimi K3 con un tempo al primo token di 3,80 secondi sono misurati, ed è lento — davvero un vincolo per un modello costruito attorno a lunghi loop, e Artificial Analysis lo segnala come notevolmente verboso. Sakana non pubblica alcun dato di latenza o throughput per Fugu Max, il che per un orchestratore è discutibilmente onesto più che evasivo: il tempo di risposta dipende da quali modelli sceglie e da quante passate esegue. Ma significa che non puoi modellare il costo in tempo reale del passaggio senza misurarlo tu stesso. Per il precedente Fugu Ultra, gli utenti hanno segnalato pubblicamente esecuzioni che si protraevano fino a 30 minuti. Quello è il modello di giugno 2026 e non è una prova riguardo a Max, ma è il numero da battere quando esegui benchmark.

Il verdetto, nei termini di Sakana
Sakana ha scelto Kimi K3 come uno dei tre modelli che Fugu Max batte sul prezzo, e sul prezzo di output l'affermazione regge: 6,00 $ contro 15,00 $ è il 60 per cento in meno, esattamente il limite superiore dell'intervallo dichiarato. Prendendo il comunicato alla lettera, Fugu Max è il prodotto più economico.
Ora applica il metro di misura che il rilascio ha evitato. Kimi K3 costa il 33 per cento in più in input e il 150 per cento in più in output — e per quella cifra ti offre una finestra da 1M token senza scogliera di riprezzamento, un checkpoint scaricabile con licenza vincolata al fatturato, un posizionamento indipendente di 44 nell'Intelligence Index, un punteggio standardizzato di 93,40% su SWE-bench Verified, il primo posto nella Frontend Code Arena e il traffico reale più consistente di qualsiasi modello in questo confronto. Fugu Max ti offre una tariffa più bassa su entrambi i lati del token, sei vittorie non quantificate nei benchmark, una tariffa di cache pari alla metà di quella di K3 senza un hit rate pubblicato e un pool che non puoi ispezionare.
La conclusione onesta è che Sakana ha scelto un metro che la favorisce sul prezzo e non ti ha dato nulla per verificare le capacità. Se il tuo carico di lavoro è ad alto volume e i tuoi compiti sono del tipo che un coordinatore può scomporre in modo affidabile, la differenza di tariffa è denaro reale e Fugu Max merita un pilot con ambito definito e la rendicontazione dei token attivata fin dalla prima richiesta. Se ti serve una decisione di produzione che puoi difendere questo trimestre — una finestra su cui puoi pianificare, un punteggio che puoi indicare e un modello che potresti ancora eseguire se il fornitore sparisse — Kimi K3 è la risposta, ed è su OrcaRouter al prezzo di listino di Moonshot con la tariffa del fornitore trasferita invariata.

