「Claude Haiku 5.5 vs Claude Sonnet 5.5」というタイトルのヒーローカードがあり、サブ見出しは「わずか6日、そして1ティアの差」。角丸のカード2枚が横並びに配置されている。左側は「Claude Haiku 5.5」という見出しで、行には Index 43、タスクあたり $0.21、リリース日 2026年10月7日 と表示されている。右側は「Claude Sonnet 5.5」という見出しで、行には Index 56、タスクあたり $7.60、リリース日 2026年9月28日 と表示されている。両者の間には中央揃えのバッジがあり、「実測コスト差 36倍」と表示されている。フッター行には「タスクあたりのコストおよび Intelligence Index は Artificial Analysis による。両モデルとも 1M コンテキスト。」とある。
Guides & Insights

Claude Haiku 5.5 対 Claude Sonnet 5.5:20倍の料金表、36倍の実測請求額

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Haiku 5.5とClaude Sonnet 5.5は、同じファミリー内でリリースが6日違い、ティアが1つ違いで、100万トークンのコンテキストウィンドウを共有し、同じAPI形状で応答する。公開されている料金表では、ほとんどのリクエストが収まる帯域において、安いほうのコストは高いほうの5分の1だ。独立系の Artificial Analysis のボードでは、その差はさらに大きい。Claude Haiku 5.5 で Intelligence Index のタスクを1つ完了するのに $0.21 かかるのに対し、Claude Sonnet 5.5 では $7.60、Intelligence Index は 43 対 56 である。この記事のきっかけとなったシグナルは、Claude Haiku 5.5 が「GPT-6 Luna よりはるかに優れている」、「Sonnet 5.5 に(より)近い」というものだった。その前半は、おおむねベンダー自身の比較セットが示すとおりだ。後半は、測定値がマーケティングと一致しなくなる部分であり、どちらがどうなのかを正確に見極める価値がある。

2つのモデル、6日と1段階の違い

Claude Haiku 5.5は2026年10月7日、モデルID claude-haiku-5-5で出荷された。Claude Haiku 4.5の直接の後継であり、テキストと画像を入力として受け取りテキストを返す。また、Anthropicが調整可能なエフォート設定——Low、Medium、High、Xhigh、Max——を用意した初のHaikuクラスのモデルであり、mediumがAPIのデフォルトとなっている。Anthropicはこれを「これまでにリリースした中で最も安価で、最速で、最も高性能な小型モデル」と称しており、その脚注では、最速というのは各モデルの標準速度における話であり、OpusモデルがFast Modeで動作する場合には依然としてそれらに及ばないと補足している。

Claude Sonnet 5.5は6日前の2026年9月28日にclaude-sonnet-5-5として登場した——Anthropicがスピードと知能の最良の組み合わせとして位置づけるティアであり、複雑なエージェント型コーディングに推奨するものでもある。100万トークンのコンテキストウィンドウは同じ。Claude Haiku 5.5とは異なり、プロンプト長に応じた価格帯が存在せず、これは6日前に登場したという先行優位よりも重要な差であることがわかる。

両方とも現在、Amazon Web Services、Google Cloud、Microsoft Azure を含むすべてのプラットフォームで利用でき、いずれも提供開始から1年より早くには廃止しないという廃止コミットメントを伴っています。Claude Haiku 5.5 は2027年10月7日、Claude Sonnet 5.5 は2027年9月28日です。Anthropic によると、Claude Sonnet 5.5 は Claude Opus 5.5 および Claude Sonnet 5 と同様に、ゼロデータ保持で利用可能です。

料金表の両面を、ひとつの場所に

100万トークンあたり、米ドル建て、Anthropicの公表レートに基づく:

• 入力 — Claude Haiku 5.5 は100,000トークンまでのプロンプトで$0.10、それを超える場合は$0.50。Claude Sonnet 5.5 は$2.00の一律で、段階なし。

• 出力 — Claude Haiku 5.5 は 100,000 トークンまで $0.50、それを超える場合は $2.50。Claude Sonnet 5.5 は一律 $10.00。

• キャッシュ読み取り — 下限帯では Claude Haiku 5.5 が $0.01、それを超えると $0.05、Claude Sonnet 5.5 は $0.10。Anthropic は Haiku のリリースと同時に Claude Sonnet 5.5 のキャッシュ読み取りを $0.20 から半減させ、キャッシュ読み取りはエージェント型のトークン使用量の中で大きな割合を占めるため、Claude Sonnet 5.5 はほとんどのエージェント型作業でコストが約 20% 下がると述べている。

• キャッシュ書き込み — Claude Haiku 5.5 は、5分間の書き込みで $0.125、1時間の書き込みで $0.20(下位帯の場合)、それを上回る場合は $0.625 と $1.00。Claude Sonnet 5.5 は、5分間の書き込みで $2.50、1時間で $4.00。

• Batch — Batch API は入力と出力の両方で 50% オフです。これにより Claude Haiku 5.5 は、100,000 トークンのライン未満では $0.05 と $0.25、それを超えると $0.25 と $1.25 になり、Claude Sonnet 5.5 の $1.00 と $5.00 と対比されます。

これらの線を横断して読むと、形は一貫している。下側の帯域では、入力ギャップは20倍、出力ギャップも20倍だ。線より上では、4倍と4倍になる。Anthropicの大見出しは、Claude Haiku 4.5と比べて平均で「実行コストが約75%少ない」というもので、脚注で、100,000トークン未満では90%安く、それを上回ると50%安いと精密化され、トークナイザーの変更もその平均に織り込まれている。

10万トークンの段階で、算術が転じる

2つのことが相反する方向に作用しており、そのうち料金表に載っているのは片方だけだ。価格はClaude Haiku 4.5に対して大きく下がる。同時に、Claude Haiku 5.5は更新されたトークナイザーを搭載しており、これはClaude Sonnet 5.5やClaude Opus 5.5のものと同様で、Anthropic曰く「タスクあたりわずかに多くのトークンを使用する」ため、同一のプロンプトでも前世代より多くの課金対象トークンとして到着する。75%という平均はその両者の純効果であり、ベンダーが出した数字だ。

10万トークンという線が、多くの人が引っかかる部分だ。AnthropicはClaude Haiku 5.5をプロンプト長で価格設定している。プロンプトが10万トークンを超えるリクエストは、閾値を超えた分だけでなく、リクエスト全体に高い方の価格を支払う。プロンプト長は、キャッシュ読み取りとキャッシュ書き込みを含むすべての入力トークンを数え、各リクエストはそれぞれ個別に価格設定される。長いリクエストは、プロンプトの一部がキャッシュヒットであっても高い方の帯域の価格を支払い、それ以前のリクエストは請求されたときの価格のままとなる。90,000トークンで余裕を持って収まっている検索パイプラインは$0.10と$0.50を支払う。ウィンドウを1段ずらすだけで、リクエスト全体が$0.50と$2.50に再価格設定される。Claude Sonnet 5.5はこうならない。100万トークンのウィンドウ全体が標準価格で請求されるからだ。

2つの帰結が続くが、それらは逆方向を指している。第一に、人が期待する逆転——長いコンテキストによって高価なモデルのほうが安くなる——は起こらない。ラインより上の Claude Haiku 5.5 は、料金表上では依然として Claude Sonnet 5.5 の4分の1だ。第二に、当てにしていた差は、ワークロードが重くなるまさにそのときに20倍から4倍へと縮まる。そしてそれは、絶対値が重要になり始めるまさにそのときだ。この段差こそが、コストに敏感なパイプラインがトークン単価ではなく独自の予算項目を持つ必要がある理由だ。

各ベンダーが報告するスコア

このセクションの内容はすべてベンダーによる報告であり、第三者による再現はされていません。Anthropicは、Claude Haiku 5.5とClaude Sonnet 5.5のページで同じ比較セットを公開しており、2つのページが重なる箇所では一致しています:

• GDPval-AA v2.1、ナレッジワーク — Claude Haiku 5.5 は 1,620、Claude Sonnet 5.5 は 1,840、Claude Haiku 4.5 は 735、GPT-6 Luna は 1,437。

• AA-Briefcase v1.1 — Claude Haiku 5.5では1,578、Claude Sonnet 5.5では1,824、Claude Haiku 4.5では614、GPT-6 Lunaでは1,336。

• OSWorld 2.1、コンピュータ操作、オフラインサブセット — Claude Haiku 5.5 は 72.4%、Claude Sonnet 5.5 は 83.9%、Claude Haiku 4.5 は 15.7%、GPT-6 Luna は 48.9%。

• Terminal-Bench 4.0、エージェント型コーディング — Claude Haiku 5.5 は 39.2%、Claude Sonnet 5.5 の 70.6% に対して、Claude Haiku 4.5 は 0.0%、GPT-6 Luna は 16.4%。

• FrontierCode 1.1、Main — Claude Haiku 5.5 は46.4%、Xhigh effort の Claude Sonnet 5.5 は52.1%、GPT-6 Luna は42.4%。Anthropic はまた、このベンチマークで Claude Sonnet 5.5 が Max effort では Xhigh より低いスコアになると指摘しており、これは code-review スキルの使用頻度が高まり、タイムアウトや範囲外の編集が発生することに起因するとしている。

• チャートグラフィー、ツールを使わない視覚的推論 — Claude Haiku 5.5 は 46.4%、それに対して Claude Sonnet 5.5 は 61.6%、Claude Haiku 4.5 は 6.4%、GPT-6 Luna は 29.1%。

• Humanity's Last Exam — Claude Haiku 5.5ではツールなしで45.9%、ツールありで57.4%。同じページで、Claude Sonnet 5.5はツールありで64.5%、Claude Haiku 4.5は18.7%、Claude Sonnet 5.5はツールなしで56.9%。Anthropicは、OpenAIが画像理解のバグを修正し、サードパーティのスコアがすべて更新されていたわけではなかったため、GPT-6ファミリーの数値は古い可能性があると指摘している。

それらの行のうち2行は二度読む価値がある。FrontierCodeでは、両モデルはどちらかといえば接近している——46.4%対52.1%——。そして、隠れるためのツールが存在しないChartographyでは、差は15ポイントだ。Terminal-Bench 4.0はまったく接近していない。39.2%対70.6%は別の能力クラスであり、だからこそAnthropicのClaude Sonnet 5.5のページは、複雑なエージェント型コーディング向けにはClaude Sonnet 5.5とClaude Opus 5.5を依然として挙げ、Claude Haiku 5.5を狭い範囲の大量作業向けモデルとして位置づけている。

独立した取締役会がもたらすもの

Anthropicの数値は、自社のモデル同士を、そして1社の競合他社を比較している。独立系の評価機関は、その両方を業界全体と比較し、ベンダーが報告していない指標として、完了したタスクあたりのコストを報告している。

Artificial Analysisは、Max effortにおけるClaude Haiku 5.5をIntelligence Index 43と評価している。これは同等モデルの中央値13を大きく上回る。Index上で4億4000万出力トークンを生成し、中央値の1億に対して非常に冗長である。入力100万あたり$0.10、出力100万あたり$0.50、毎秒242出力トークンである。その実測コストはIntelligence Indexタスクあたり$0.21である。

同じボードでは、Claude Sonnet 5.5 が56点(中央値26)で、410Mの出力トークンを生成(中央値88M)。入力 $2.00、出力 $10.00、90%のキャッシュ割引。Intelligence Index タスクあたりの測定コストは $7.60 です。

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

その2行を並べてみれば、比率がすべてを物語る。$0.21 対 $7.60 は36倍強で、両モデルは冗長性ではほぼ互角——出力トークンは440M 対 410M——なので、この倍率はほぼすべて、料金表が料金表のうたうとおりに作用している結果だ。ベンダー自身の料金表では、同じ比較は20倍になる。上乗せ分は、トークン単価では示せないものから生じる。このエフォート設定では、安価なモデルの方がタスクあたりの課金対象トークン数が少なく答えに到達し、キャッシュ読み取りは Claude Sonnet 5.5 の10分の1の料金で課金される。同じハーネス、同じタスク、独立した測定。

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

安いティアが実際に尽きるのはどこか

Anthropicが公表する顧客の数値は、ベンチマークよりも頻繁に選択を左右し、それらはすべて同じ方向を指している。Asanaは、タスク完了時のレイテンシが30%以上低下し、エージェントのターンあたりの推論が最大2.5倍高速化したと報告している。Boxは、約半分のレイテンシで、Claude Haiku 4.5より11ポイント高いスコアを報告している。HubSpotは、自社スイートでこれまでに見た中で最高のスコア、3回の実行で平均92.8%を報告しており、最高のヒット率と最低の偽陽性率を記録している。AlphaSenseは、「Ask in Document」を通じて週に約800万回の呼び出しを実行しており、Claude Haiku 4.5に対する統計的に有意な改善、0.84対0.76を報告している。Cognitionは、Claude Haiku 5.5をサイドキックとして、そのFusionエージェントがFrontierCodeスコア66.2を保持していると報告している。

そのどれも、長期的な時間軸で動くエージェントではない。それらはポイントソリューションであり、明確に定義された1つのステップを、より速く、より安くするものだ。Claude Haiku 5.5 が作られているのはその形であり、36倍のコスト優位が丸め誤差ではなく実際の金額になるのも、その形だ。この優位性は呼び出し量が増えるほど複利的に効き、呼び出しの深さが増すほど消え去る。1日10万件の分類呼び出しを入力$0.10、出力$0.50で行うのは、消えていくのが目に見える費目だが、一方で1セッションあたり100回のエージェントターンがそれぞれ蓄積されたコンテキストを再読込するのは、しきい値を超えた各ターンがより高い価格帯を支払うため、超線形的に増大する費目だ。

Claude Sonnet 5.5の反論は、トークン単位のコストではなく試行単位のコストだ。Anthropicは、Claude Sonnet 5より30%以上速く、ほとんどの作業で最大30%安価だと述べている。その節約は料金が低いことではなく、必要なトークン数が少なくて済むことによる。第三者のテスターがそれを数値化している。Slackは出力トークンがおよそ14%少ないと報告し、Balyasnyは回答あたり約121kトークンで497kと対比、Boxは2.4倍高速でトークン数は12%少なく、Lovableはツール呼び出しがおよそ3分の1少なくシェル実行が約半分、AtlassianはRovo Agentsが最大30%高速、Base44はビルドあたり3.6回の反復でClaude Opus 5の7.7回と対比している。うまく決まる1ターンは、決まらない4ターンに勝る。

逆方向に働く第三の要因がある。Anthropicはこの世代で、エフォートをモデルレベルのダイヤルに移した——Claude Haiku 5.5のエフォート設定は、リクエストごとの思考予算として調整されるのではなく、リクエストごとに一度設定される。そして旧来のbudget_tokensモードは4.6モデルでは非推奨であり、それ以降のモデルでは受け付けられない。多くのサービスから単一のモデルIDを呼び出すフリートにとって、これは簡素化だ。呼び出しごとに自前で推論量を調整していたものにとっては、書き換えになる。

両方を1つのエンドポイントの背後で実行する

この判断を正しく下す価値があるのは、判断を誤った側を元に戻すのに多大なコストがかかるからだ。あるモデルIDから別のモデルIDへ本番パスを配線し直すとなれば、旧モデルの挙動を前提としていたすべての呼び出し箇所に手を入れることになる。あるワークロードがどのティアに属するかを見極める、より安上がりな方法は、両方を1つのエンドポイントの背後で動かし、リファクタリングではなく設定によってトラフィックを移すことだ。

そのためにあるのがOrcaRouterです。 Claude Sonnet 5.5はカタログに anthropic/claude-sonnet-5.5として、Claude Sonnet 5、Claude Opus 5.5、Claude Haiku 4.5と並んで掲載されています。旧世代のHaikuティアも、そこから移行する間の参照点として引き続き利用できます。このプラットフォームはプロバイダーの定価をマークアップなしでそのまま通しますので、上記の$2.00と$10.00がそのままお支払いいただく料金です。逆も同じで、ベンダーが価格を改定すれば、新しい価格は当日中にここで有効になります。Claude Sonnet 5.5のキャッシュ読み取りの値下げが当社に届いたのも、この仕組みによるものです。この判断に必要な役割を担う機能が2つあります。 自動フェイルオーバーは、まだ評価中のモデルをクリティカルパスから外し、それ自体で機能します。さらにルーティングDSLを使えば、10万トークン未満の呼び出しは安価なティアへ、長いコンテキストや長期的なタスクの呼び出しはより高価なティアへと、同じリクエストフローの中で振り分けられます。2つ目の契約も2つ目のSDKも不要です。

何がホストされていて、何がホストされていないのかを正確に言うと、Claude Sonnet 5.5 は現在、当社経由でルーティング可能です。Claude Haiku 5.5 はまだカタログには載っていません。それまでは、Anthropic 自身の API と上記の3つのクラウドプラットフォーム上でホストされています。

どうやって決めるか

タスクが狭く、大量処理で、検証可能なときは Claude Haiku 5.5 を選ぼう — 分類、抽出、ルーティング、要約、すでに構築したエージェント内のターンごとの作業などだ。そこでは20倍の料金差がまさに要点であり、100,000トークンのステップは設計上避けられる。また、独立に測定されたタスクあたり$0.21は、その優位性がベンダー自身のラボの外でも持続することを示している。エフォートダイヤルはデフォルトのままにせず、タスククラスごとに設定しよう。Haikuクラスのモデルでは、LowとMaxの違いは品質上の好みではなく、コストの倍率だ。

タスクが長期的な視野を要するもの、エージェント的、または検証不能なものである場合——コンパイルしなければならないコード、画面を既知の状態に残さなければならないコンピュータ操作、誤った答えのコストが呼び出しよりも高くつくあらゆるもの——には、Claude Sonnet 5.5 を選んでください。Terminal-Bench 4.0 の 70.6% 対 39.2% は些細な違いではなく、別の能力クラスであり、定額の料金表は、長いコンテキストがリクエスト全体を黙って再価格設定しないことを意味します。ワークロードが本当に中間にあるなら、正直な答えは、どちらのモデルにもそれを裏付ける広範な第三者による再現がまだ存在せず、インデックススコアは単一のハーネスから得られたものであり、上記で引用したベンダーの数値はベンダー自身のものである、ということです。

何がこの回答を変えるでしょうか

注目すべき点は3つあり、いずれもベンチマークのリリースではない。1つ目は、Claude Haiku 5.5をLow、High、Xhigh effort(Maxだけでなく)で独立評価したときに、同じタスクあたりコスト比を示すかどうかだ。なぜなら、effortダイヤルはこの比較で最も安価なレバーであり、最も測定されていないからだ。2つ目は、100,000トークンの刻みが存続するかどうか。第3の価格帯、あるいは次世代で価格帯がまったくないとなれば、どの単一のベンチマークスコアよりも、実運用中のあらゆる検索パイプラインの計算を変えるだろう。3つ目はトークナイザーだ。後続のチェックポイントが同じテキストを古いレートでトークン化するなら、Anthropicの75%という平均は目標ではなく下限となり、どちらの価格も動かずにClaude Sonnet 5.5との差が広がる。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新