
Claude Haiku 5.5 vs Sakana Namazu: entrambi economici, entrambi veloci, quasi nient'altro in comune
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token · 72 tok/s
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 382 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
In apparenza, questi due sembrano equivalenti. Claude Haiku 5.5 è il livello piccolo e veloce del fornitore, rilasciato il 7 ottobre 2026 a $0,10 per milione di token in input e $0,50 per milione in output, con una finestra di un milione di token, pensato per classificazione, estrazione, instradamento e attività di subagenti. Sakana Namazu è il modello API specializzato in giapponese di Sakana AI, lanciato il 3 agosto 2026, fatturato a $0,95 per milione di token in input e $4,00 per milione in output con una tariffa di $0,15 per input in cache, perfezionato sulla base aperta Kimi K2.6 con il post-training di Sakana, e disponibile tramite un endpoint compatibile con OpenAI.
Entrambi sono posizionati come l'opzione economica nelle rispettive gamme, ed è qui che finisce la somiglianza. Claude Haiku 5.5 è un modello occidentale di uso generale a cui ricorreresti per instradare il traffico; Sakana Namazu è un modello specializzato per un paese a cui ricorreresti quando il compito è in giapponese e l'alternativa è un modello generale che lo svolge male. La domanda interessante non è quale sia migliore. È che cosa ti offre uno specialista, dove si colloca effettivamente il confine di quella specializzazione e quanto costa uscirne.
Cosa ha effettivamente costruito Sakana AI
Vale la pena capire Sakana Namazu prima di paragonarlo a qualunque altra cosa, perché la sua costruzione è insolita. Non è addestrato da zero. È un affinamento di un modello esistente a pesi aperti — Kimi K2.6 — che Sakana ha ulteriormente addestrato e che eroga come API chiusa. La discendenza conta: la capacità generale di ragionamento e di programmazione del modello di base è ereditata, e ciò che Sakana ha aggiunto è il livello specifico per il Giappone.
Quello strato è documentato, cosa che non si può certo dire della maggior parte delle dichiarazioni sulla localizzazione. Sakana riferisce che Namazu mantiene le prestazioni del modello di base nelle valutazioni generali — AIME26, MMLU-Pro, LiveCodeBench v6 — superandolo al contempo nell'insieme giapponese e specifico per il Giappone, con FairPoliticsQA che sale dal 34,10% al 56,30%. Utilizza un proprio benchmark interno di traduzione dal giapponese, JFBench, e riferisce miglioramenti su tutta la linea anche lì. Un caso di studio separato, uno strumento di ricerca di evidenze per i medici, riporta il 96,8% al 119º esame medico nazionale e il 96,4% al 120º.
Quelli sono i numeri di Sakana sui benchmark di Sakana, e JFBench non è uno standard pubblico che chiunque altro possa riprodurre. L'affermazione che sopravvive a quella riserva è limitata ma reale: il modello è un modello base con nome più un passaggio di post-training documentato, e i delta riportati sono rispetto alla sua stessa base anziché al resto del settore.
L'API e i termini commerciali sono gli elementi che decideranno la maggior parte dei casi d'uso aziendali. Namazu è compatibile con OpenAI — un cambio di endpoint e un sakana-namazu come nome del modello è l'unica modifica al codice, secondo la documentazione di Sakana stessa. La fatturazione avviene in dollari statunitensi e offre il pagamento in yen con il piano Enterprise. Comporta inoltre costi degli strumenti che un confronto per token non farà mai emergere: 7,00 $ per mille chiamate di ricerca web e 0,12 $ per ora di esecuzione del codice, che Sakana include nel prodotto.
Ci sono due vincoli che contano più di qualsiasi numero sul listino prezzi. Namazu non è disponibile in UE, SEE, Regno Unito o Svizzera in attesa di attività di conformità legate al GDPR, secondo la pagina di Sakana stessa. E la politica predefinita di gestione dei dati afferma che gli input possono essere usati per addestrare e migliorare i modelli di Sakana, con possibilità di opt-out disponibile nelle impostazioni della Console; l'azienda dichiara di non poter attualmente garantire che il trattamento rimanga interamente in Giappone. Per un team europeo o britannico, il primo è squalificante e il secondo è una domanda a cui rispondere prima della prima chiamata.
Il confine, detto onestamente
Questa è la sezione in cui un confronto basato sulle schede tecniche ti mentirebbe, quindi ecco cosa è effettivamente confrontabile:
• Prezzo — Claude Haiku 5.5: $0,10 di input e $0,50 di output per milione di token fino a 100.000 token di prompt, poi $0,50 e $2,50. Sakana Namazu: $0,95 e $4,00, con una tariffa di $0,15 per l'input in cache. Namazu è circa nove volte e mezzo più costoso sull'input e otto volte sull'output nella prima fascia.
• Caching — le letture dalla cache di Claude Haiku 5.5 costano $0.01 e $0.05 per milione a seconda del tier; quella di Sakana Namazu è $0.15 flat. I valori assoluti sono vicini nel tier più alto e distano ventinove volte l'uno dall'altro in quello più basso.
• Strumenti — nessuno dei due è un semplice modello testuale e nessuno dei due applica lo stesso tipo di tariffazione. Claude Haiku 5.5 include il pensiero adattivo con una manopola dello sforzo da Low a Max e il supporto agli strumenti lato server; Sakana Namazu comprende la ricerca web a 7,00 $ per mille chiamate e l'esecuzione di codice a 0,12 $ l'ora.
• Contesto — un milione di token per Claude Haiku 5.5. Sakana non pubblica una finestra di contesto per Namazu, e qualunque cifra venga citata al riguardo è un'assunzione sulla base Kimi K2.6 anziché una specifica.
• Valutazione indipendente — Claude Haiku 5.5 ha un punteggio di 43 nell'Artificial Analysis Intelligence Index, secondo su 182 nella sua classe in quella classifica, con un costo di 0,21 $ per attività dell'Intelligence Index. Sakana Namazu non ha alcuna voce in Artificial Analysis e nessuna valutazione di terze parti di alcun tipo che io sia riuscito a trovare. Le cifre che pubblica sono le sue.
• Disponibilità — Claude Haiku 5.5 è disponibile su Claude API, Amazon Bedrock, Vertex AI, Microsoft Foundry e Claude Platform on AWS, con un impegno di ritiro pubblicato non prima del 7 ottobre 2027. Sakana Namazu è disponibile sull'API proprietaria di Sakana, su Sakana Chat e sul prodotto Sakana Translate, e non è disponibile in UE, SEE, Regno Unito e Svizzera.
• Gestione dei dati — I termini del fornitore sono di livello enterprise, e i blocchi di pensiero del modello sono circoscritti all'account che li ha prodotti. L'impostazione predefinita di Sakana Namazu prevede che gli input possano essere utilizzati per l'addestramento, con possibilità di opt-out.
• Modalità — Claude Haiku 5.5 accetta testo e immagini; la copertura delle modalità di Sakana Namazu non è pubblicata al di là del suo posizionamento incentrato sul testo.
• Licenza e discendenza — Claude Haiku 5.5 è proprietario e disponibile solo via API. Sakana Namazu è proprietario ma costruito su pesi aperti di Kimi K2.6, il che significa che la base è ispezionabile mentre il modello messo a punto no.
Il problema della valutazione onesta
Leggi quell'elenco e nota cosa manca: qualsiasi riga che dica quale modello produce un output giapponese migliore. Non è una svista. Non esiste tra loro un benchmark condiviso che possa dirimere la questione. Le forti prestazioni in giapponese di Claude Haiku 5.5 non sono qualcosa che il fornitore pubblicizza come rivendicazione di punta, e i numeri di JFBench di Sakana sono un suo strumento di misura. Un modello piccolo generalista di fascia frontier, di un fornitore con una forte capacità multilingue, valutato contro un modello basato su Kimi sottoposto a post-addestramento specificamente per il giapponese, è un confronto che nessuno ha davvero eseguito e pubblicato.
Ciò che si può dire è strutturale, non empirico. L'intera identità commerciale di Namazu è l'affermazione che un modello generale non è abbastanza buono per il lavoro in giapponese — che lingua specifica del paese, inferenza culturale e contesto nazionale sono una capacità distinta che giustifica un modello specializzato a un prezzo nove volte superiore. Se credi a quell'affermazione, Namazu è la risposta e il prezzo è quanto costa la risposta. Se non ci credi, un modello generale a $0.10 per milione di token è quello che usi e la domanda è se riesci a misurare la differenza sul tuo traffico.
La versione misurabile dell'affermazione è quella fornita da Sakana: FairPoliticsQA passa dal 34,10% al 56,30% rispetto al modello base da cui è stato messo a punto. Questo è un miglioramento reale su un benchmark reale, ma è un confronto con Kimi K2.6, non con Claude Haiku 5.5 — e ti dice che il post-addestramento per un contesto politico specifico per il Giappone sposta l'ago della bilancia su quel compito, il che è un'affermazione più ristretta e più difendibile di "migliore in giapponese".

Come si presenta il divario di costi su larga scala
Esegui una pipeline modesta con 10 milioni di token di input e 2 milioni di token di output al giorno attraverso entrambi.
• Costo di input, al giorno — $1,00 su Claude Haiku 5.5, $9,50 su Sakana Namazu.
• Costo dell'output, al giorno — 1,00 $ su Claude Haiku 5.5, 8,00 $ su Sakana Namazu.
Totale giornaliero — $2,00 contro $17,50, circa $60 al mese contro $525.
Quei $525 sono prima ancora di una singola chiamata di ricerca web o di un'ora di esecuzione di codice. Aggiungi 500 chiamate di ricerca al giorno e Namazu costa altri $3,50 al giorno, portandolo a $21,00 contro $2,00 — un rapporto superiore a dieci a uno che nessuna quantità di efficienza dei token può colmare.
Se sia una cifra elevata dipende interamente da qual è l’alternativa. Se la tua scelta è Namazu o un modello generico che produce un output in giapponese mediocre che i tuoi revisori devono correggere a mano, i 525 $ servono a recuperare ore di lavoro dei revisori e il confronto non è token contro token, ma token contro stipendio. Se il tuo traffico in giapponese è di routine ed è già sufficientemente buono su un modello generico, il sovrapprezzo non compra nulla di misurabile e gli stessi dollari comprano dieci volte il volume altrove.
La terza opzione è quella interessante per un prodotto in lingua giapponese: usare lo specialista dove regge la pretesa di specializzazione — traduzione, contesto nazionale, testi normativi e politici — e un modello generale per il lavoro di volume che vi ruota attorno. Non è un compromesso. È l'architettura che il prezzo implica effettivamente, perché il premium di Namazu si paga per token e non c'è motivo di pagarlo sulla classificazione.

Nessuno dei due modelli è nel nostro catalogo.
Dobbiamo essere chiari su questo, perché è il tipo di confronto in cui è facile introdurre di nascosto un paragrafo sulla disponibilità: OrcaRouter non serve né Claude Haiku 5.5 né Sakana Namazu. Namazu è disponibile tramite l'API di Sakana stessa, e Claude Haiku 5.5 tramite quella del fornitore e dei principali cloud. Nessuno dei due fatti cambia il confronto, che si basa su tariffe pubblicate, capacità pubblicate e restrizioni pubblicate.
Il ruolo che un singolo endpoint svolge in un caso come questo è più ristretto e più onesto di quello di un plug. È la gamba generalista di un ibrido — il punto in cui instraderesti il traffico di classificazione ed estrazione non giapponese che non ha bisogno dello specialista, senza dover attivare un secondo rapporto con un fornitore. Una sola API per oltre 200 modelli, tariffe di listino dei provider passate attraverso con 0% di markup, failover automatico tra provider, e il DSL di routing quando è la lingua della richiesta a dover decidere il percorso anziché l'applicazione. Se gestisci un prodotto giapponese accanto a uno inglese, quella è la cucitura che altrimenti costruiresti a mano.
Quale, per chi
Scegli Sakana Namazu quando il giapponese è il prodotto e non una localizzazione — quando i tuoi revisori stanno correggendo l'output, quando il dominio è diritto nazionale, medicina, politica o servizio clienti, quando un sovrapprezzo di nove volte sui token è inferiore al costo delle correzioni che elimina, e quando i tuoi utenti sono fuori da UE, SEE, Regno Unito e Svizzera oppure disponi di consulenti legali che hanno risolto la questione del trattamento dei dati.
Scegli Claude Haiku 5.5 quando il lavoro è generico, il volume è elevato e vuoi un punteggio misurato in modo indipendente anziché un benchmark di un fornitore — quando sono $0,10 e $0,50 per milione di token a fare i calcoli per te, quando ti serve la finestra da un milione di token su un documento lungo, o quando la risposta a «quale è migliore in giapponese» deve venire dalla tua valutazione anziché da quella di uno dei due fornitori.
I due non sono davvero rivali. Uno è un modello generalista con un prezzo pensato per essere usato di continuo; l'altro è uno specialista con un prezzo pensato per essere usato in modo ponderato. L'errore è comprare lo specialista per un lavoro che il generalista già fa bene, e l'errore opposto — presumere che un modello generale gestisca la lingua e il contesto di un paese specifico bene quanto qualcosa addestrato per farlo — è quello su cui è costruito l'intero business di Sakana: il fatto che la gente lo commetta.

