生成されたタイトルカードには「Claude Haiku 5.5: 10万トークンの価格ステップ」と表示され、2つの価格カード——「10万トークン未満: 入力 $0.10 / 出力 $0.50」と「10万トークン超: 入力 $0.50 / 出力 $2.50」——が並び、その間に上向きのステップ図、さらにフッター行に「Anthropic 定価、2026年10月」と記されている。実際の OrcaRouter ロゴが右下に合成されている。
Guides & Insights

Claude Haiku 5.5の真実は「100Kの崖」:新しいHaikuは100,000トークン超でいくら課金するのか

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Haiku 5.5は2026年10月7日に登場し、目玉の価格は100万入力トークンあたり0.10ドル、100万出力トークンあたり0.50ドルでした。そしてどこでも繰り返された数字は、Anthropic自身が発表に記したものでした。同じ2つの料金項目について、Haiku 4.5の料金に対する90パーセント削減です。その90パーセントは事実です。ただしそれは、請求の一つの側面の半分に範囲が限られた話でもあります。そしてリクエストが100,000トークンを超えた瞬間、その中のあらゆる料金に、ローンチ時の報道がほとんど飛ばしてしまったことが起きます。本稿が扱うのは、その境界線です——それがいくらかかるのか、どのワークロードが実際にそこへ達するのか、そして、なぜ「90パーセント安い」があなたの請求書についての主張ではなく、請求書の一部分についての主張なのか。

2つの価格と、それらが切り替わる場所

Anthropic はモデル向けに 2 つの列を公開しており、それらの間の切り替えは、あなたが選ぶモデル設定ではなく、リクエストのサイズに関する単一のしきい値によって決まります:

• ショート階層、100,000トークン以下 — 入力100万トークンあたり$0.10、出力100万トークンあたり$0.50(A​nthropic list) • ロング階層、100,000トークン超 — 入力100万トークンあたり$0.50、出力100万トークンあたり$2.50(A​nthropic list) • キャッシュ読み取り — 100万トークンあたり$0.01(ショート階層)および$0.05(ロング階層) • バッチAPI — どちらの列でも50%オフ、最大出力長は300,000トークン • 標準最大出力 — 128,000トークン、両階層とも100万トークンのコンテキストウィンドウ

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing Input price (under 100K): $0.10 per million, Output price (under 100K): $0.50 per million, Input price (over 100K): $0.50 per million, Output price (over 100K): $2.50 per million, Context window: 1,000,000 tokens, AA Index: 43.4, with the footer 'Anthropic list prices; AA Index per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.

それらはAnthropic自身が公表した料金であり、実測されたものではありません。そして、それが現在の価格表です。これほど新しいモデルの価格は、まだ動く時間がありませんでしたが、Anthropicはそれを据え置く義務を負っているわけではありません。

その4つの数字を順に読めば、この事柄の形は明らかだ。ロングコンテキスト階層のすべての料率は、ショートコンテキスト料率のちょうど5倍で、しきい値はそのすべてで同時に同じ10万トークンだ。緩やかな曲線も、補間も、中間の帯もない――99,000トークンのリクエストと101,000トークンのリクエストは、境界を越えた2,000トークンだけでなく、請求内のすべてのトークンで5倍違う。まさにそれが、これを斜面ではなく崖にしている部分であり、「90パーセント安い」という枠組みには見えない部分だ。

A screenshot of Anthropic's Claude Platform Docs pricing page, showing the model pricing table and the per-model rate columns for the Claude line, captured in English.

なぜ切り傷は実際よりも大きく見えるのか

Haiku 4.5との比較——Anthropicが行った比較——では、ショートティアは入力と出力の両方で真に90パーセント削減だ。Haiku 4.5は、同じ2つの列で100万トークンあたり$1.00と$5.00だった。ロングティアは話が別だ。同じ$1.00と$5.00に対して$0.50と$2.50は、90パーセント削減ではなく50パーセント削減だ。したがって、ローンチ時の主張を正直に言えば、Claude Haiku 5.5は100,000トークン未満ではHaiku 4.5より90パーセント安く、それを超えると50パーセント安い、ということになる。これはまさに、片方ではなく両方の列を読めばAnthropic自身のドキュメントが示す区分そのものだ。単一のパーセンテージは間違いではない。それはショートティアのパーセンテージを、その条件なしで提示したものだ。

逆方向に引っ張る第二の要素があり、こちらは見落としやすく対処が難しいため、より興味深い。Claude Haiku 5.5 は新しいトークナイザーを搭載しており、Anthropic 自身のガイダンスでは、あるテキストのトークン数が Haiku 4.5 が同じ内容で生成したものより約30パーセント多いとされている。トークンあたりに支払っていた額は下がり、*あなたの*テキストのトークンあたりに支払う額は、旧モデルの計算と比べて約3分の1上昇した。Anthropic が公表している正味の数字、つまりこのモデルは平均で約75パーセント安く実行できるという数字は、すでにこれを織り込んでいる——90パーセントの定価引き下げから約30パーセントのトークン膨張を差し引くと、短いコンテキストのトラフィックではそのあたりに落ち着く——が、二つの効果は分離可能であり、分離する価値がある。価格の動きは、ページから読み取れる定価の変更である。トークナイザーの動きは、その価格の単位を既存のプロンプトがどれだけ消費するかを変え、他のどこに現れるよりも先に、あなた自身のトークン数に現れる。

1回の呼び出しあたり100,000トークンを余裕をもって下回っていたワークロードにとって、実用的な効果は呼び出しあたりのコストの単純な削減であり、トークナイザーによって部分的に相殺される。そうでなかったワークロードにとっては、算術は長い半分で二度、逆方向に働く。

実際に100,000トークンを超える領域には何があるのか

反射的に、長文コンテキストの料金設定を「エージェント型コーディングとRAG、自分たちではない」に分類してしまいがちだ。だがそれは早計すぎる。なぜなら、10万トークンのラインは1リクエストあたりのラインであり、1リクエストのサイズはタスクのサイズと同じものではないからだ。日常的にそれを超えるいくつかのパターンがある:

• ステップごとに再取得するのではなく、セッション全体を通じて大きなワーキングセットをコンテキストに保持するコードベース読解エージェント

• 長いPDFとそれ自体の指示および少数ショット例が入力になる文書・契約分析 — 誰かが例を追加する前には60,000トークンだった種類のプロンプト

• 多数の小さな項目を1回の呼び出しにまとめて呼び出しごとのオーバーヘッドを償却し、そうすることでバッチ全体をしきい値超えに押し上げてしまうインジェストパイプライン

• 会話履歴全体を要約せずにそのままインラインで保持し続け、何かによって切り詰められるまでリクエストが単調に増大していくチャット製品

• 音声および長時間動画の文字起こし形式の入力——これはまさに、100万トークンのウィンドウが可能にすると謳われているトラフィックそのものである

100万トークンのコンテキストウィンドウは、この崖が話題に値するものになる、スペック表の部分だ。Anthropicは、モデルに非常に大きなリクエストを渡せる能力を売りにしており、価格設定は、そのリクエストの最後の90万トークンが最初の10万トークンの5倍の費用になるように組まれている。どちらの事実も意図的であり、ただ発表されている場所が違うだけだ。長いコンテキストウィンドウこそが、あなたがそもそもこのモデルに目を向けている理由なら、長コンテキストの列はあなたの列であり、ローンチ時のパーセンテージは他の誰かのものだ。

価格がFlashティアに与える圧力

Anthropicがこのモデルについて示した意図は、スタックの低コスト・高スループット側を押さえることにあり、価格表はその意図を率直に反映している。ブルームバーグの発表に関する報道は、Anthropicがより安価なオープンウェイトの競合他社に対して自社の低コストの立場を守る動きだと位置づけたが、ベンダー側の説明はさらに踏み込み、新しいHaikuは直接の競合を大きく下回る価格に設定されているとした。

比較がすっきり成立するのはショートティアだけであり、そこでは $0.10 と $0.50 が極めて低く設定されている。100,000 トークンを超えると、$0.50 と $2.50 の料金はもはや誰のショートティアも下回っておらず、ごく普通の中位ティアの数字だ。そのベンダーの「広いマージン」という主張は料金表の最初の列についての言明であり、Anthropic はそこではそう主張する資格がある——それは Anthropic が公表している数字を正確に読み取ったものだ。それは長いコンテキストのワークロードが支払う額についての主張ではなく、そのように引用されるべきではない。

モデルの残りを手短に

Claude Haiku 5.5 は、サイズクラスに合わせて機能を削ぎ落とすのではなく、Sonnet と Opus のラインで提供された機能をそのまま引き継いでいます。デフォルトのエフォート設定が medium の適応型思考を備えており、Haiku クラスで初めて Low から Max まで調整可能なエフォートダイヤルを搭載したモデルです。知識カットオフは 2026 年 6 月、モデル ID はclaude-haiku-5-5です。Anthropic は、廃止日を早くとも 2027 年 10 月 7 日——リリースと同じ日付の 1 年後——と述べており、このモデルは Anthropic 自身の API と並んで Amazon Bedrock、Google Cloud、Microsoft Azure でも提供されています。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', with an Intelligence Index of 43.395, speed #10 of 182, and a cost comparison block showing $0.10 input.

ベンチマークに関して言えば、ローンチ投稿に載っているものはすべて同じ出所ラベルを帯びており、それは妥当だ。これらはベンダー報告の数値であり、モデルを販売している企業によって測定されたもので、執筆時点で独立した再現は公表されていない。

• GDPval-AA v2.1 — ベンダー報告では、Claude Haiku 5.5が1,620、同じハーネスにおけるHaiku 4.5の735に対して

• AA-Briefcase v1.1 — ベンダー報告値は1,578、前世代は614

• OSWorld 2.1 — ベンダー報告では72.4パーセント、それに対して15.7パーセント

• Terminal-Bench 4.0 — ベンダー報告値39.2、対する0.0

• Humanity's Last Exam — ベンダー報告で45.9パーセント、ツール使用時は57.4

これらの差分の大きさこそ、それらを引用するのではなく、注意フラグを付けるべき理由である。モデルのベンダー自身が測定したOS-agentベンチマークで15.7から72.4への跳躍は、第三者が同じハーネスを実行するまでは、確定値として軽々に扱うべきではない数字だ。Artificial Analysisは、2026年10月初旬時点でこのモデルについて独自の指標を公表している——独立した数値は43.395で、Terminal-Bench Hardでは0.329、HLEでは0.444——そして、その主張が異議に耐える必要があるときは、この数値群を引用すべきだ。ベンダーの数値と独立した数値は矛盾しているわけではない。単に異なるハーネスにすぎず、それらを一つの文に混ぜることが、ブログ記事がベンダー評価を事実だと断言してしまう所以である。

インフラの注記は、私たちが1つ運用しているため

AnthropicはClaude Haiku 5.5を自社APIのほか、Bedrock、Google Cloud、Azureを通じても販売しています。これらのどれを呼び出すか検討している場合、あるいはすでにスタックにある他のモデルの隣にこれを追加しようとしている場合は、次の点にご留意ください。ベンダーの定価はどこで販売されていても同じであり、OrcaRouterはその定価をマークアップゼロでそのまま通すように作られています — つまり、このモデルに関するAnthropicの価格改定は、遅延ではなく当日に当社側でも反映されます。当社のカタログにはqwen/qwen3.8-flashも100万トークンあたり$0.15と$0.47で、z-ai/glm-5.3-flashも100万トークンあたり$0.15と$0.50で掲載されています。この2つは、Haikuクラスのモデルの隣の枠に入ることが最も多い組み合わせで、同じキー、同じ請求書で利用できます — これにより、混在したスタックのコストが3契約ではなく1契約で済みます。当社はClaude Haiku 5.5自体は提供していません。それについては、Anthropicを直接呼び出してください。

複数のモデルをルーティングするなら、この崖の実用的な帰結の1つはこうだ。100,000トークンの境界は、以前は安かったリクエストが、リクエストの中身が実質的に何も変わらないのに高くなる地点だ。ルーティング層がフェイルオーバーできるなら、賢明な構成は、長いコンテキストのトラフィックはしきい値を超えると実際に安い方のモデルに向けておき、短いコンテキストのトラフィックはしきい値を下回ると安い方のモデルに流すことだ。1つのモデルの公表料金が両方に当てはまると想定するのではなく。

ローンチから学ぶべきこと

値下げは本物で、しかも大きい——100,000トークン未満では。このモデルは、出荷済みの機能セットとエフォートダイヤルを備えた最初のHaikuであり、エージェント用途では価格よりもそれが重要だ。ベンチマークの差分はベンダー報告であり、繰り返し言及するたびにその旨を明記すべきだ。そして価格表には100,000トークンのところに段差があり、すべての料金を一挙に5倍にする——これこそ、次のスプリントのトークン予算が決まる前に、プレスリリースの読者ではなくあなたのスタックの読者が最も知っておく必要がある、今回の発表に関する一点だ。

自分のトラフィックに照らして計算を確認したいなら、引き出すべき数字は、リクエストサイズの95パーセンタイルと、100,000トークンを超えるリクエストへの支出割合の2つです。1つ目が基準を下回っていれば、90パーセントがあなたに適用され、ローンチ時の報道はあなたの状況について正しかったことになります。2つ目が請求額のかなりの部分を占めるなら、重要な数字は50であり、スタック内で90を前提に選んだモデルについて、コスト見積もりを再実行する価値があります。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新