「Claude Haiku 5.5 vs Sakana Namazu」というタイトルの生成ヒーローカードで、左右に並んだ2つのパネルを備えている。左パネルのClaude Haiku 5.5には、「汎用」、「100万あたり$0.10 / $0.50」、「Index 43」が記載されている。右パネルのSakana Namazuには、「日本語特化」、「100万あたり$0.95 / $4.00」、「ベンダーベンチマークのみ」が記載されている。下の全幅ストリップには、「高速かつ低価格という同じ形、正反対の専門性。」と書かれている。フッターには、「IndexはArtificial Analysisによる。Namazuの数値はSakana AI提供、未監査。」と書かれている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Claude Haiku 5.5 対 Sakana Namazu:どちらも安く、どちらも速い、それ以外に共通点はほとんどない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

表面上、この2つは同格に見える。Claude Haiku 5.5はベンダーの小型高速ティアで、2026年10月7日にリリースされ、入力トークン100万あたり$0.10、出力100万あたり$0.50、100万トークンのウィンドウを備え、分類、抽出、ルーティング、サブエージェント作業向けに構築されている。Sakana NamazuはSakana AIの日本語特化APIモデルで、2026年8月3日にローンチされ、入力トークン100万あたり$0.95、出力100万あたり$4.00、キャッシュ入力レート$0.15で課金され、オープンなKimi K2.6ベースにSakana独自のポストトレーニングを施して改良され、OpenAI互換エンドポイントを通じて利用可能。

どちらもそれぞれのラインナップで手頃な選択肢として位置づけられており、似ているのはそこまでだ。Claude Haiku 5.5 は、トラフィックのルーティングに手を伸ばすような西側の汎用モデルだ。Sakana Namazu は、課題が日本語で、代替が汎用モデルによる下手な処理になる場合に手を伸ばす国特化モデルだ。興味深い問いは、どちらが優れているかではない。専門特化が何をもたらすのか、その専門性の境界が実際どこにあるのか、そしてそこから離れるのに何のコストがかかるのか、だ。

Sakana AIが実際に作ったもの

Sakana Namazuは、何かと比較される前に理解する価値がある。その構築が異例だからだ。ゼロから訓練されたものではない。既存のオープンウェイトモデル、Kimi K2.6を改良したもので、Sakanaがさらに事後学習し、クローズドAPIとして提供している。その系統が重要だ。基盤モデルの一般的な推論能力とコーディング能力は受け継がれており、Sakanaが加えたのは日本固有の層である。

そのレイヤーは文書化されている。大半のローカリゼーションに関する主張には、そこまで言えないのだが。Sakanaは、Namazuが一般評価——AIME26、MMLU-Pro、LiveCodeBench v6——でベースモデルの性能を維持しつつ、日本語向けおよび日本固有のセット全体ではそれを上回っており、FairPoliticsQAは34.10%から56.30%に上昇したと報告している。また、自社内製の日本語翻訳ベンチマークJFBenchを運用しており、そこでも全般的な改善を報告している。別のケーススタディでは、医師向けのエビデンス探索ツールが、第119回医師国家試験で96.8%、第120回で96.4%を報告している。

それらはSakanaのベンチマークにおけるSakanaの数値であり、JFBenchは他の誰もが再現できる公開標準ではない。その注意点を踏まえても残る主張は、限定的だが確かなものだ。すなわち、そのモデルは名前が示されたベースモデルに、文書化された事後学習ステップを加えたものであり、報告されている差分は分野全体との比較ではなく、自身のベースモデルに対するものである。

APIと商用条件は、ほとんどのビジネスケースを左右する部分です。NamazuはOpenAI互換であり、Sakana自身のドキュメントによれば、コード変更はエンドポイントの変更とsakana-namazuモデル名だけです。請求は米ドル建てで、Enterpriseプランでは円での支払いにも対応しています。また、トークン単位の比較では決して表面化しないツール利用コストも伴います。ウェブ検索1,000回あたり$7.00、コード実行1時間あたり$0.12で、Sakanaはこれらを製品にバンドルしています。

料金表のどんな数字よりも重要な制約が2つある。Sakana自身のページによると、NamazuはGDPR関連のコンプライアンス対応が完了するまで、EU、EEA、英国、スイスでは利用できない。そして、デフォルトのデータ取り扱いポリシーでは、入力がSakanaのモデルのトレーニングと改善に使用される可能性があるとされており、Console設定でオプトアウトが可能だ。同社は、処理が完全に日本国内にとどまることを現時点で保証できないと述べている。欧州または英国のチームにとって、1つ目は失格要因であり、2つ目は初回の通話の前に答えを出すべき問題だ。

正直に述べられた境界

ここは、スペックシートの比較に騙されかねないセクションです。そこで、実際に比較できるものは次のとおりです。

• 価格 — Claude Haiku 5.5 は、プロンプトが 100,000 トークンまでの場合、100 万トークンあたり入力 $0.10、出力 $0.50、それを超えると入力 $0.50、出力 $2.50。Sakana Namazu は $0.95 と $4.00 で、キャッシュ済み入力の料金は $0.15。Namazu は最初のティアでは、入力で約 9.5 倍、出力で 8 倍高価です。

• キャッシュ — Claude Haiku 5.5 のキャッシュ読み取りは、ティアに応じて100万単位あたり$0.01と$0.05です。Sakana Namazu の場合は一律$0.15です。絶対額は最上位ティアでは近く、最下位ティアでは29倍の差があります。

• ツール — どちらも単なるテキストモデルではなく、課金方法も同じではありません。Claude Haiku 5.5 は、Low から Max までのエフォートダイヤルを備えた適応型思考とサーバーサイドツールのサポートを搭載しています。Sakana Namazu は、ウェブ検索を1,000回あたり$7.00、コード実行を1時間あたり$0.12でバンドルしています。

• コンテキスト — Claude Haiku 5.5の100万トークン。SakanaはNamazuのコンテキストウィンドウを公開しておらず、それについて引用されているいかなる数値も、仕様ではなくKimi K2.6ベースに関する推測です。

• 独立したスコアリング — Claude Haiku 5.5 の Artificial Analysis Intelligence Index は 43 で、そのボード上では同クラス 182 件中 2 位、Intelligence Index タスクあたりのコストは $0.21 です。Sakana Namazu には Artificial Analysis への登録がなく、私が探せた限りではいかなる種類の第三者評価もありません。公表されている数値は自社によるものです。

• 提供状況 — Claude Haiku 5.5 は Claude API、Amazon Bedrock、Vertex AI、Microsoft Foundry、および AWS 上の Claude Platform で提供されており、廃止時期は2027年10月7日より早くならないと公表されています。Sakana Namazu は Sakana 自社の API、Sakana Chat、および Sakana Translate 製品で提供されており、EU、EEA、英国、スイスでは利用できません。

• データの取り扱い — ベンダーの条件はエンタープライズ標準であり、モデルの思考ブロックは、それらを生成したアカウントに限定されます。Sakana Namazu のデフォルトでは、入力がトレーニングに使用される可能性があり、オプトアウトできます。

• モダリティ — Claude Haiku 5.5はテキストと画像を扱う。Sakana Namazuのモダリティ対応範囲は、テキスト優先という位置づけ以外には公開されていない。

• ライセンスと系譜 — Claude Haiku 5.5 はプロプライエタリで、API専用です。Sakana Namazu はプロプライエタリですが、オープンな Kimi K2.6 の重みに基づいて構築されているため、ベースは検査可能で、調整済みモデルはそうではありません。

正直な採点の問題

あのリストを読んで、何が欠けているかに気づいてください。どのモデルがより良い日本語出力を生み出すかを示す行が一つもありません。それは見落としではありません。それに決着をつけるような共有ベンチマークは、両者の間には存在しません。Claude Haiku 5.5 の強い日本語性能は、ベンダーが看板となる主張として宣伝しているものではなく、Sakana の JFBench の数値は同社独自の計測ツールによるものです。多言語能力に優れたベンダーによる汎用のフロンティア級小型モデルを、日本語向けに特化して事後学習された Kimi ベースのモデルと評価する――そんな比較は、実際には誰も実施して公表していません。

言えるのは、経験的というより構造的なことだ。Namazuの商業的アイデンティティのすべては、汎用モデルでは日本語の仕事には十分ではないという主張にある——国固有の言語、文化的推論、国内の文脈は、9倍の価格プレミアムを払って専用モデルを正当化する別個の能力だという主張である。その主張を信じるなら、Namazuが答えであり、価格はその答えにかかる費用だ。信じないなら、100万トークンあたり$0.10の汎用モデルを使うことになり、問題は自分のトラフィックでその違いを測定できるかどうかだ。

主張の測定可能なバージョンは、Sakanaが示しているものだ。FairPoliticsQAが、チューニング元のベースモデルと比べて34.10%から56.30%へ上昇したというものだ。それは実際のベンチマークにおける実際の改善だが、比較対象はKimi K2.6であり、Claude Haiku 5.5ではない — そしてそれは、日本固有の政治的文脈向けのポストトレーニングがそのタスクで効果を上げることを示しており、「日本語がより得意」というより狭く、より擁護しやすい主張だ。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Sakana Namazu - the scoreboard', with six rows carrying both sides. Input price: $0.10 / 1M against $0.95 / 1M. Output price: $0.50 / 1M against $4.00 / 1M. Cached input: $0.01 to $0.05 / 1M against $0.15 / 1M. Focus: general purpose against Japanese language and context. Lineage: proprietary against Kimi K2.6 post-trained. Independent index: 43 against no entry. The footer reads 'Claude Haiku 5.5 index per Artificial Analysis; Namazu figures per vendor.' The OrcaRouter logo is composited in the bottom-right corner.

大量利用時におけるコスト格差の実態

控えめなパイプラインを、1日あたり入力1,000万トークン・出力200万トークンで、両方を通して実行してみてください。

入力コスト、1日あたり — Claude Haiku 5.5 では $1.00、Sakana Namazu では $9.50。

• 1日あたりの出力コスト — Claude Haiku 5.5では$1.00、Sakana Namazuでは$8.00

• 1日の合計 — $2.00 対 $17.50、月額換算でおよそ $60 対 $525。

その525ドルは、ウェブ検索を1回呼び出す前、あるいはコードを1時間実行する前の金額だ。1日500回の検索呼び出しを加えると、Namazuにはさらに1日3.50ドルかかり、合計は21.00ドル対2.00ドルになる——10対1を上回る比率であり、どれだけトークン効率を高めても埋められない。

それが高いかどうかは、完全に代替案が何かによって決まる。あなたの選択がNamazuか、レビュアーが手作業で修正しなければならない平凡な日本語出力を生成する汎用モデルなら、$525はレビュアーの時間を取り戻すことになり、比較はトークン対トークンではなく、トークン対人件費である。あなたの日本語トラフィックが定型的で、汎用モデルですでに十分な品質なら、その割増料金は測定可能なものを何ももたらさず、同じ金額で他なら10倍の量が買える。

第3の選択肢は、日本語向け製品にとって興味深いものです。専門特化モデルの主張が成り立つ領域——翻訳、国内文脈、規制・政治テキスト——では専門特化モデルを使い、その周辺の大量処理には汎用モデルを使う。これは妥協ではありません。料金体系が実際に示唆しているアーキテクチャなのです。なぜなら、Namazuのプレミアムはトークン単位で支払われるのであり、分類にそれを支払う理由はないからです。

A headless capture of Anthropic's Claude Platform model documentation showing the Models overview comparison table with the Claude Haiku 5.5 column alongside Claude Fable 5.1, Claude Opus 5.5 and Claude Sonnet 5.5, including the 'From $0.10 / input MTok' and 'From $0.50 / output MTok' pricing rows, the 1M-token context window entry and the 'Fastest' comparative latency listing for Claude Haiku 5.5.

どちらのモデルも当社のカタログには掲載されていません。

これは率直に言っておくべきだ。というのも、この種の比較では、可用性に関する段落を紛れ込ませるのはたやすいからだ。OrcaRouterはClaude Haiku 5.5もSakana Namazuも提供していない。NamazuはSakana自身のAPIを通じて利用でき、Claude Haiku 5.5はベンダーおよび主要クラウドを通じて利用できる。どちらの事実もこの比較を変えるものではない。この比較は、公開された料金、公開された能力、公開された制限に基づいているのだから。

このようなケースで1つのエンドポイントが果たす役割は、プラグよりも狭く、より正直である。それはハイブリッドの汎用モデル側の脚であり、専門特化モデルを必要としない非日本語の分類・抽出トラフィックを、そのために2つ目のベンダー関係を立ち上げることなくルーティングする場所である。200以上のモデルに対応する1つの API、プロバイダーのリスト料金を0%のマークアップでそのまま提供、プロバイダー間の自動フェイルオーバー、そしてリクエストの言語がアプリケーションではなくルートを決めるべき場合に使えるルーティング DSL。日本語の製品と英語の製品を並行して運用しているなら、それは本来手作業で構築することになる継ぎ目だ。

どれを、誰のために

日本語がロケールではなく製品そのものであるとき、つまりレビュアーが出力を修正しているとき、分野が国内法、医療、政治、カスタマーサービスであるとき、9倍のトークン割増がそれがなくす修正コストよりも小さいとき、そしてユーザーがEU、EEA、英国、スイス以外にいるか、データ取り扱い上の問題をクリアした顧問弁護士がいる場合は、Sakana Namazuを選んでください。

一般的な作業で量が多く、ベンダーのベンチマークではなく独立して測定されたスコアが欲しいときは、Claude Haiku 5.5 を選びましょう — 100万トークンあたり $0.10 と $0.50 が計算を代わりにやってくれるとき、長い文書で 100万トークンのウィンドウが必要なとき、あるいは「日本語ではどちらが優れているか」という答えを、どちらのベンダーのものでもなく自分の評価から得る必要があるときです。

その2つは実際にはライバルではない。一方は常に使われることを想定した価格の汎用モデルで、もう一方は意図的に使われることを想定した価格の専門特化モデルだ。間違いは、汎用モデルがすでに得意としている仕事に専門特化モデルを買うことだが、逆の間違い——汎用モデルが特定の国の言語と文脈を、それに特化して訓練されたものと同程度にうまく扱えると想定すること——こそ、Sakanaの事業全体が、人々がそれを犯すことを前提に成り立っているものである。

A headless capture of the OrcaRouter models catalogue page reading '207 models, 16 providers, one API key, one bill', with the filter sidebar showing input-modality counts, a pricing filter and a populated model list, and the panel that reads 'How to call any model' with an OpenAI-compatible curl sample pointing at https://api.orcarouter.ai/v1/chat/completions.