Carte principale générée intitulée « Claude Haiku 5.5 vs Sakana Namazu », avec deux panneaux côte à côte. Le panneau de gauche, Claude Haiku 5.5, indique « Usage général », « 0,10 $ / 0,50 $ par 1 M » et « Indice 43 ». Le panneau de droite, Sakana Namazu, indique « Spécialiste du japonais », « 0,95 $ / 4,00 $ par 1 M » et « Benchmarks du fournisseur uniquement ». Une bande pleine largeur en dessous indique « Même profil rapide et économique, spécialisations opposées. » Un pied de page indique « Indice selon Artificial Analysis ; chiffres de Namazu selon Sakana AI, non audités. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Claude Haiku 5.5 vs Sakana Namazu : tous deux bon marché, tous deux rapides, presque rien d'autre en commun.

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

En apparence, ces deux modèles semblent équivalents. Claude Haiku 5.5 est la petite gamme rapide du fournisseur, publiée le 7 octobre 2026 à 0,10 $ par million de jetons en entrée et 0,50 $ par million de jetons en sortie, avec une fenêtre d'un million de jetons, conçue pour la classification, l'extraction, le routage et le travail de sous-agents. Sakana Namazu est le modèle d'API spécialisé dans le japonais de Sakana AI, lancé le 3 août 2026, facturé à 0,95 $ par million de jetons en entrée et 4,00 $ par million de jetons en sortie, avec un tarif de 0,15 $ pour les entrées mises en cache, affiné à partir de la base ouverte Kimi K2.6 avec le post-entraînement propre à Sakana, et accessible via un point de terminaison compatible avec OpenAI.

Ils sont tous deux positionnés comme l’option abordable dans leurs gammes respectives, et c’est là que la ressemblance s’arrête. Claude Haiku 5.5 est un modèle occidental polyvalent vers lequel vous vous tourneriez pour router du trafic ; Sakana Namazu est un modèle spécialisé pour un pays vers lequel vous vous tourneriez lorsque la tâche est en japonais et que l’alternative est un modèle généraliste qui s’en acquitte mal. La question intéressante n’est pas de savoir lequel est le meilleur. C’est ce qu’un spécialiste vous apporte, où se situe réellement la frontière de cette spécialité, et ce qu’il en coûte d’en sortir.

Ce que Sakana AI a réellement construit

Sakana Namazu mérite d’être compris avant d’être comparé à quoi que ce soit, car sa construction est inhabituelle. Il n’est pas entraîné à partir de zéro. C’est un affinement d’un modèle à poids ouverts existant — Kimi K2.6 — que Sakana a post-entraîné davantage, et qu’il sert sous forme d’API fermée. La lignée compte : la capacité générale de raisonnement et de codage du modèle de base est héritée, et ce que Sakana a ajouté est la couche spécifique au Japon.

Cette couche est documentée, ce qui est plus qu’on ne peut en dire pour la plupart des affirmations en matière de localisation. Sakana rapporte que Namazu conserve les performances du modèle de base sur les évaluations générales — AIME26, MMLU-Pro, LiveCodeBench v6 — tout en les surpassant sur l’ensemble des évaluations japonaises et spécifiques au Japon, FairPoliticsQA passant de 34,10 % à 56,30 %. Sakana exploite son propre benchmark interne de traduction japonaise, JFBench, et rapporte là aussi des améliorations sur tous les fronts. Une étude de cas distincte, un outil de recherche de preuves pour les médecins, rapporte 96,8 % au 119e examen national de médecine et 96,4 % au 120e.

Ce sont les chiffres de Sakana sur les benchmarks de Sakana, et JFBench n’est pas une norme publique que quiconque d’autre peut reproduire. L’affirmation qui subsiste malgré cette réserve est limitée mais réelle : le modèle est un modèle de base nommé auquel s’ajoute une étape de post-entraînement documentée, et les écarts rapportés le sont par rapport à son propre modèle de base plutôt que par rapport au reste du domaine.

L'API et les conditions commerciales sont les éléments qui décideront de la plupart des cas d'usage métier. Namazu est compatible avec OpenAI — un changement de point de terminaison et un nom de modèle sakana-namazuconstituent la seule modification de code, d'après la documentation de Sakana elle-même. La facturation se fait en dollars américains et le paiement en yens est proposé avec le forfait Enterprise. Elle comporte aussi des coûts d'outillage qu'une comparaison par jeton ne fera jamais apparaître : 7,00 $ par millier d'appels de recherche web et 0,12 $ par heure d'exécution de code, que Sakana intègre au produit.

Deux contraintes comptent plus que n'importe quel chiffre sur la grille tarifaire. Namazu n'est pas disponible dans l'UE, l'EEE, au Royaume-Uni ni en Suisse, en attendant des travaux de conformité liés au RGPD, d'après la propre page de Sakana. Et la politique de traitement des données par défaut stipule que les entrées peuvent servir à entraîner et améliorer les modèles de Sakana, avec une option de refus disponible dans les paramètres de Console ; l'entreprise indique qu'elle ne peut pas garantir actuellement que le traitement reste entièrement au Japon. Pour une équipe européenne ou britannique, la première est éliminatoire et la seconde est une question à trancher avant le premier appel.

La limite, dite honnêtement

C’est la section où une comparaison de fiches techniques vous mentirait, alors voici ce qui est réellement comparable :

• Prix — Claude Haiku 5.5 : 0,10 $ en entrée et 0,50 $ en sortie par million de tokens jusqu'à 100 000 tokens de prompt, puis 0,50 $ et 2,50 $. Sakana Namazu : 0,95 $ et 4,00 $, avec un tarif de 0,15 $ pour l'entrée mise en cache. Namazu est environ neuf fois et demie plus cher en entrée et huit fois plus cher en sortie au premier palier.

• Mise en cache — les lectures de cache de Claude Haiku 5.5 coûtent 0,01 $ et 0,05 $ par million selon le palier ; celle de Sakana Namazu est à 0,15 $ forfaitaire. Les chiffres absolus sont proches au palier supérieur et séparés d’un facteur vingt-neuf au palier inférieur.

• Outils — aucun des deux n’est un simple modèle textuel et ils ne facturent pas de la même manière. Claude Haiku 5.5 propose une réflexion adaptative avec un curseur d’effort allant de Faible à Max et une prise en charge des outils côté serveur ; Sakana Namazu inclut la recherche web à 7,00 $ les mille appels et l’exécution de code à 0,12 $ de l’heure.

Contexte — un million de tokens pour Claude Haiku 5.5. Sakana ne publie pas de fenêtre de contexte pour Namazu, et tout chiffre que vous voyez cité pour celui-ci est une supposition sur la base Kimi K2.6 plutôt qu'une spécification.

• Notation indépendante — Claude Haiku 5.5 a un indice d’intelligence Artificial Analysis de 43, deuxième sur 182 dans sa catégorie sur ce classement, avec un coût de 0,21 $ par tâche de l’indice d’intelligence. Sakana Namazu n’a aucune entrée dans Artificial Analysis et aucune évaluation tierce, de quelque nature que ce soit, que j’aie pu trouver. Ses chiffres publiés sont les siens.

• Disponibilité — Claude Haiku 5.5 est disponible sur l'API Claude, Amazon Bedrock, Vertex AI, Microsoft Foundry et Claude Platform sur AWS, avec un engagement de retrait publié prévoyant une date pas avant le 7 octobre 2027. Sakana Namazu est disponible sur l'API propre à Sakana, Sakana Chat et le produit Sakana Translate, et n'est pas disponible dans l'UE, l'EEE, au Royaume-Uni et en Suisse.

• Traitement des données — Les conditions du fournisseur sont conformes aux standards de l’entreprise, et les blocs de réflexion du modèle sont limités au compte qui les a produits. Par défaut, Sakana Namazu considère que les entrées peuvent être utilisées pour l’entraînement, avec possibilité de refus.

• Modalité — Claude Haiku 5.5 prend en charge le texte et les images ; la couverture des modalités de Sakana Namazu n'est pas publiée au-delà de son positionnement centré sur le texte.

• Licence et lignée — Claude Haiku 5.5 est propriétaire et uniquement accessible via API. Sakana Namazu est propriétaire mais construit sur les poids ouverts de Kimi K2.6, ce qui signifie que la base est inspectable et que le modèle affiné ne l'est pas.

Le problème de la notation honnête

Lisez cette liste et remarquez ce qui manque : toute ligne qui indique quel modèle produit de meilleures sorties en japonais. Ce n’est pas un oubli. Il n’existe entre eux aucun benchmark commun qui permettrait de trancher. Les solides performances de Claude Haiku 5 en japonais ne sont pas un argument phare que le fournisseur met en avant, et les chiffres JFBench de Sakana proviennent de son propre instrument. Un petit modèle généraliste de niveau frontière, proposé par un fournisseur aux solides capacités multilingues, évalué face à un modèle basé sur Kimi post-entraîné spécifiquement pour le japonais, est une comparaison que personne n’a réellement menée et publiée.

Ce qui peut être dit est d’ordre structurel plutôt qu’empirique. Toute l’identité commerciale de Namazu repose sur l’affirmation qu’un modèle généraliste ne suffit pas pour le travail en japonais — que la langue propre au pays, l’inférence culturelle et le contexte national constituent une capacité distincte qui justifie un modèle spécialisé à un prix neuf fois supérieur. Si vous croyez à cette affirmation, Namazu est la réponse et le prix est ce que coûte la réponse. Si vous n’y croyez pas, vous utilisez un modèle généraliste à 0,10 $ par million de tokens, et la question est de savoir si vous pouvez mesurer la différence sur votre propre trafic.

La version mesurable de l’affirmation est celle que Sakana fournit : FairPoliticsQA passant de 34,10 % à 56,30 % par rapport au modèle de base à partir duquel il a été affiné. C’est une amélioration réelle sur un benchmark réel, mais il s’agit d’une comparaison avec Kimi K2.6, et non avec Claude Haiku 5.5 — et cela indique que le post-entraînement pour un contexte politique propre au Japon fait bouger les lignes sur cette tâche, ce qui est une affirmation plus étroite et plus défendable que « meilleur en japonais ».

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Sakana Namazu - the scoreboard', with six rows carrying both sides. Input price: $0.10 / 1M against $0.95 / 1M. Output price: $0.50 / 1M against $4.00 / 1M. Cached input: $0.01 to $0.05 / 1M against $0.15 / 1M. Focus: general purpose against Japanese language and context. Lineage: proprietary against Kimi K2.6 post-trained. Independent index: 43 against no entry. The footer reads 'Claude Haiku 5.5 index per Artificial Analysis; Namazu figures per vendor.' The OrcaRouter logo is composited in the bottom-right corner.

À quoi ressemble l’écart de coûts en volume

Faites passer un pipeline modeste de 10 millions de tokens d'entrée et 2 millions de tokens de sortie par jour dans les deux.

• Coût des entrées, par jour — 1,00 $ sur Claude Haiku 5.5, 9,50 $ sur Sakana Namazu.

• Coût de sortie, par jour — 1,00 $ sur Claude Haiku 5.5, 8,00 $ sur Sakana Namazu.

• Total quotidien — 2,00 $ contre 17,50 $, soit environ 60 $ par mois contre 525 $.

Ces 525 $ s’entendent avant même un seul appel de recherche web ou une heure d’exécution de code. Ajoutez 500 appels de recherche par jour et Namazu coûte 3,50 $ de plus par jour, ce qui porte le total à 21,00 $ contre 2,00 $ — un rapport supérieur à dix pour un qu’aucun niveau d’efficacité des tokens ne peut combler.

Savoir si c’est beaucoup dépend entièrement de ce qui constitue l’alternative. Si votre choix se porte sur Namazu ou sur un modèle généraliste qui produit des sorties en japonais médiocres que vos relecteurs doivent corriger à la main, les 525 $ servent à récupérer des heures de relecture, et la comparaison n’est pas jeton contre jeton, mais jeton contre salaire. Si votre trafic est routinier et qu’un modèle généraliste suffit déjà, le supplément n’apporte rien de mesurable, et les mêmes dollars permettent d’obtenir dix fois plus de volume ailleurs.

La troisième option est la plus intéressante pour un produit en japonais : recourir au spécialiste là où la promesse du spécialiste tient — traduction, contexte national, textes réglementaires et politiques — et à un modèle généraliste pour le travail de volume autour. Ce n’est pas un compromis. C’est l’architecture que la tarification implique réellement, car le supplément de Namazu se paie au token et il n’y a aucune raison de le payer pour de la classification.

A headless capture of Anthropic's Claude Platform model documentation showing the Models overview comparison table with the Claude Haiku 5.5 column alongside Claude Fable 5.1, Claude Opus 5.5 and Claude Sonnet 5.5, including the 'From $0.10 / input MTok' and 'From $0.50 / output MTok' pricing rows, the 1M-token context window entry and the 'Fastest' comparative latency listing for Claude Haiku 5.5.

Aucun des deux modèles n'est sur notre catalogue

Nous devrions être clairs là-dessus, car c’est le genre de comparaison où un paragraphe sur la disponibilité est facile à faire passer en douce : OrcaRouter ne sert ni Claude Haiku 5.5 ni Sakana Namazu. Namazu est disponible via l’API propre à Sakana, et Claude Haiku 5.5 via celle du fournisseur et les principaux clouds. Aucun de ces faits ne change la comparaison, qui repose sur des tarifs publiés, des capacités publiées et des restrictions publiées.

Le rôle qu'un seul point d'accès joue dans un cas comme celui-ci est plus restreint — et plus honnête — que celui d'un plug-in. C'est la branche « modèle généraliste » d'un dispositif hybride : l'endroit où vous routeriez le trafic de classification et d'extraction non japonais qui n'a pas besoin du spécialiste, sans avoir à mettre en place une seconde relation fournisseur pour cela. Une seule API pour plus de 200 modèlesles tarifs des fournisseurs répercutés à 0 % de marge, le basculement automatique entre fournisseurs, et le DSL de routage lorsque c'est la langue de la requête — et non l'application — qui doit décider de la route. Si vous exploitez un produit japonais en parallèle d'un produit anglais, c'est là la couture que vous devriez sinon construire à la main.

Lequel, pour qui

Choisissez Sakana Namazu lorsque le japonais est le produit plutôt qu'une simple locale — lorsque vos relecteurs corrigent les sorties, lorsque le domaine est le droit national, la médecine, la politique ou le service client, lorsqu'un surcoût de jetons multiplié par neuf est inférieur au coût des corrections qu'il permet d'éviter, et lorsque vos utilisateurs se trouvent en dehors de l'UE, de l'EEE, du Royaume-Uni et de la Suisse, ou que vous disposez de conseillers juridiques qui ont validé la question du traitement des données.

Choisissez Claude Haiku 5.5 quand le travail est général, que le volume est élevé et que vous voulez un score mesuré indépendamment plutôt qu’un benchmark de fournisseur — quand 0,10 $ et 0,50 $ par million de tokens font le calcul pour vous, quand vous avez besoin de la fenêtre d’un million de tokens sur un document long, ou quand la réponse à « lequel est meilleur en japonais » doit venir de votre propre évaluation plutôt que de celle de l’un ou l’autre fournisseur.

Les deux ne sont pas vraiment des rivaux. L’un est un modèle polyvalent dont le tarif est conçu pour être utilisé en permanence ; l’autre est un spécialiste dont le tarif est conçu pour être utilisé de manière délibérée. L’erreur consiste à acheter le spécialiste pour un travail que le généraliste fait déjà bien, et l’erreur inverse — supposer qu’un modèle généraliste gère aussi bien la langue et le contexte d’un pays donné qu’un modèle entraîné pour cela — est celle sur laquelle repose toute l’activité de Sakana : que les gens la commettent.

A headless capture of the OrcaRouter models catalogue page reading '207 models, 16 providers, one API key, one bill', with the filter sidebar showing input-modality counts, a pricing filter and a populated model list, and the panel that reads 'How to call any model' with an OpenAI-compatible curl sample pointing at https://api.orcarouter.ai/v1/chat/completions.