
デイリーAIブリーフ、10月8日:Claude Haiku 5.5が0.10ドルで登場、Sonnet 5.5のキャッシュ読み取りが半減
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Claude Haiku 5.5は2026年10月7日にリリースされ、同社がこれまでAPIで提供してきた中で最も安価なものです。最大100,000トークンのプロンプトで、入力トークン100万あたり$0.10、出力トークン100万あたり$0.50、100万トークンのコンテキストウィンドウと、LowからMaxまで動作するエフォートダイヤルを備えています。同じ日、独自の発表記事もないまま、Claude Sonnet 5.5のプロンプトキャッシュ読み取りが100万トークンあたり$0.20から$0.10に引き下げられました。そのうちの一方は製品であり、もう一方は明細項目です。そして、今四半期により多くの資金を動かすのは明細項目のほうです。
まず価格です。今日あなたが実際に手を打てるのはそこだからです。次にエフォート——価格を静かに決めているのはこれです。そしてキャッシュの値下げ。Sonnet 5.5 に支払っている人の半分は、次の請求書が届くまでそれに気づくことはありません。
Claude Haiku 5.5とは何か、重要な順に
ベンダー自身による位置づけは「これまでにリリースした中で最も安価で、最速かつ最も高性能な小型モデル」であり、リリース日は2026年10月7日 — このブリーフの1日前です。モデルIDはclaude-haiku-5-5。入力はテキストと画像、出力はテキストです。コンテキストウィンドウは1,000,000トークンで、Claude Haiku 4.5の200,000から増加しており、最大出力は128,000トークン、Batch APIのベータヘッダーを使用すると300,000に引き上げられます。トレーニングのカットオフは2026年6月で、Anthropicは2027年10月7日より前にこれを廃止しないことを確約しています。
トラフィックをルーティングする人にとって最も重要な点は、コンテキストウィンドウではない。それは、これが調整可能なエフォートを備えた初のHaikuクラスモデルであるということだ。エフォートはLow、Medium、High、Xhigh、Maxで、デフォルトはMedium、適応型思考はデフォルトでオンになっている。SonnetとOpusの機能が1段下のティアに降りてきた形だ。ローンチ投稿には、構築ではなく購入に関する2つのことも書かれている。Claude MaxおよびTeamプラン向けの月次APIクレジット(Max 5xで100ドル、Max 20xで200ドル、Teamでは最大500ドルまでプール可能)と、SDKにおけるベータ版のコンピュータ使用およびブラウザ使用のサポートだ。安全性もティアに見合って追随している。サイバーセーフガードはClaude Haiku 4.5よりも厳格で、ペネトレーションテストのリクエストは依然としてブロックされ、生物学セーフガードはClaude Sonnet 5、Claude Sonnet 5.5、Claude Opus 5と同等だ。

価格、そしてその真ん中にある100,000トークンの崖
見出しの料金は、入力トークン100万あたり$0.10、出力トークン100万あたり$0.50です。アスタリスクの注記を読んでください。これは10万トークン以下のプロンプトに適用される料金です。10万トークンを超えると、どちらの数字も5倍になり、入力$0.50、出力$2.50になります。キャッシュの書き込みは、低価格帯では5分ティアが100万あたり$0.125、1時間ティアが$0.20かかり、キャッシュの読み取りは100万あたり$0.01です。これは入力料金の10分の1で、Anthropicがあらゆるモデルの中でこれまでに公表した中で最も深いキャッシュ割引です。バッチを使えばすべてがさらに半額になります。低価格帯では$0.05と$0.25、それを超えると$0.25と$1.25です。
それを Claude Haiku 4.5 と比較してください。Claude Haiku 4.5 は依然として価格表に載っており、入力 $1.00、出力 $5.00 の一律料金で、コンテキストに基づく段階制はなく、キャッシュ読み取りは $0.10、ウィンドウは 200,000 トークンです。新しいモデルは同じプロンプト形状で価格が10分の1、コンテキストは5倍です。ここで移行の計算をする必要はありません。算術的には比べ物になりません。
崖は設計の前提となる部分だ。99,000トークンのプロンプトは、入力レートで1,000回あたり99セントかかる。101,000トークンのプロンプトは1,000回あたり5.05ドルかかる。2,000トークンの差が5倍の請求額になるので、安い料金帯で構築するものは、余裕をもって100,000トークン未満に収めるか、意図的に一貫してそれを超えるかのどちらかにすべきだ。最悪の結果は、境界線をまたぐパイプラインで、トラフィックの半分で高い料金を支払うことになる。
エフォートは今や価格設定のパラメータであり、デフォルトが最も安いわけではない
エフォートはデフォルトでMediumに設定され、思考はデフォルトで有効になっているため、表示価格と実際の価格は同じ数字ではない。推論トークンは出力トークンとして課金される。Anthropicが公表したArtificial Analysis Intelligence Indexの自社実行(ベンダー報告であり、当社による再現はなし)では、Claude Haiku 5.5はタスクあたりおよそ162,000トークンを出力し、そのうち約129,000が推論である。このインデックスの中央値モデルはスイート全体で1億トークン程度を出力するが、Haiku 5.5は4億4,000万を費やす。出力トークン100万あたり$0.50なら、その冗長さは手頃であり、まさにそこが要点だ。Haiku 5.5の料金では、出力に$5.00を請求するモデルで少し考えるよりも、たくさん考えるほうが依然として安い。
分類、抽出、ルーティングの判断では、熟考された回答よりも速い回答が必要な場合にエフォートをLowに設定し、ユーザーが読むものについてはMediumのままにしてください。Lowに下げることは、冗長なエージェントを100,000トークンの範囲内に確実に収める方法でもあります。それは、回答の品質を落とす前に推論トークンを削減するからです。
静かなる系譜:Sonnet 5.5、キャッシュ読み取りが半減
Claude Sonnet 5.5は10月7日時点で、キャッシュされたプロンプトを100万トークンあたり$0.10で読み取る。これは$0.20からの引き下げだ。Sonnet 5.5の入力価格は$2.00、出力は$10.00なので、0.05倍のキャッシュ読み取り倍率は現在、Haiku 5.5が持つのと同じ倍率を、20倍大きい入力単価に適用したものになる。Anthropic自身の試算では、これによりほとんどのエージェント作業のコストが約20%削減される。これはベンチマークではなく、ワークロードの形状に関する主張だ。つまり、入力の大部分が、毎ターン再送信している安定したプレフィックスである場合にのみ成り立つ。呼び出しごとにプロンプトが一意であれば、この変更はコストを何もかけず、何も節約しない。
この値下げが何を意味するかは注目に値する。Anthropic は、非常に安価な小型モデルを投入するまさにそのタイミングで、ミッドティアモデルにおける長寿命プレフィックスの価格を積極的に設定している。これは2モデルアーキテクチャを支持する論拠として読める。つまり、判断を必要とする作業にはホットキャッシュを備えた Sonnet 5.5 のレッグを、そうではない処理量には Haiku 5.5 のレッグを、という構成だ。
独立した数値が示すもの、1日目に
Artificial AnalysisはClaude Haiku 5.5をリリース翌日に評価した。そのIntelligence Indexは総合43で、Max-effort構成は43.40と報告され、ボード上の182モデル中2位となっている。インデックスタスクあたりのコストは$0.21で、46番目に安い。入力・キャッシュ済み入力・出力の7:2:1混合におけるブレンド価格は100万トークンあたり$0.08であり、これが先ほどのティア比較を他のすべてに対して不公平に感じさせる数値だ。出力速度は毎秒243.4トークンで、ボード上9番目に速く、報告されている初回トークン遅延は約0.3秒、キャッシュ割引は90%である。
その4億4000万トークンという出力数値は、43に付された注意点だ。スコアは本物で、独立に実施されている。冗長性も同様だ。これほど考えるモデルはトークンあたりでは安いが、タスクあたりでは必ずしも安くない。そしてその2つの数値の差こそ、ルーティング判断が実際に存在する場所なのだ。
規模感を示すと、Anthropic自身が公開した比較では、Claude Haiku 5.5はGDPval-AA v2.1で1620、Claude Haiku 4.5は735、OSWorld 2.1では72.4%対15.7%、Humanity's Last Examのツールなしでは45.9%対10.2%、Terminal-Bench 4.0では39.2%対0.0%となっている。これらはベンダーが報告した数値であり、ベンダーが選んだ評価によるものなので、方向性を示すものとして読むべきだが、その方向性は決して微妙ではない——これは小型モデルの小さなアップグレードではない。

2つ目の契約なしでこれらのモデルにたどり着く
Claude Haiku 5.5はAnthropic自身のAPIを通じて利用でき、そこからAnthropicのモデルが再販されているあらゆる場所で利用できます。OrcaRouterのカタログにおいて、Anthropicのラインナップは現在anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5、anthropic/claude-fable-5.1です。当社はClaude Haiku 5.5をホストしておらず、この記事はそうでないふりをするつもりはありません。当社が扱っているのはその一つ上のティアであり、OrcaRouterはプロバイダーの定価をマークアップ0%でそのまま通しており、だからこそSonnet 5.5のキャッシュ読み取り価格の引き下げが当社の価格に当日反映されたのは、Anthropicがそれを実施したその日であり、定期的な価格改定サイクルによるものではありませんでした。
実務的な言い方をすれば、分類用のレッグで Haiku 5.5 を試しつつ、判断用のレッグは Claude Sonnet 5.5 のままにしたいなら、鍵を1つではなく2つ持つことになり、その A/B を決めるのはルーティング層だ。これが、直接統合ではなくゲートウェイを選ぶ理由のすべてである——単一のエンドポイント、モデル文字列、そしてプロバイダーが不安定になったときのフェイルオーバー経路だ。

ここから何に注目すべきか
3つのこと。サードパーティプロバイダーが Haiku 5.5 を、ブレンドレートが$0.10を下回る形で再販し始めるかどうか——これは、ルーティング層が単に調達を簡素化するだけでなく、そのコストに見合う価値を発揮し始める分岐点だ。Anthropicが100,000トークンの階層境界を拡張するかどうか——ちょうど100,000の位置に崖があるのは、100万トークンのウィンドウを持つモデルにとって奇妙なことだからだ。そして、4億4,000万トークンという冗長性の数値がポイントリリースで下がるかどうか——なぜなら、その一つの数値が、Haiku 5.5 がプロダクションスタックの下半分全体にとって明白なデフォルトになることを妨げているからだ。
