Claude Sonnet 5.5 のタイトルカード。見出しは「同じ価格で、より少ない作業」、サブタイトルは「100万トークンあたり $2 / $10、Sonnet 5 から変更なし」、3枚の統計カードには 56(AA Intelligence Index)、#3 / 216(そのインデックスでの順位)、$7.60(最大エフォート時のタスクあたりコスト)と表示。
Guides & Insights

Claude Sonnet 5.5:30%のコスト主張と、Sonnet 5のコードを壊す6つの変更

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Sonnet 5.5は2026年9月28日、Claude Sonnet 5とまったく同じ料金で提供開始された——入力100万トークンあたり2ドル、出力100万トークンあたり10ドル、キャッシュ読み取り100万トークンあたり0.20ドル。一方、Anthropicの発表は「ほとんどの作業で30%以上高速に動作し、コストは最大30%削減」を前面に打ち出している。どちらの記述も真実であり、その二つの隔たりこそがすべてを物語っている。節約分は料金表の中にはない。料金表は動いていないからだ。それは、前世代が必要としていたよりも低いeffort設定でモデルを動かすことから生まれる。つまり30%という数字は、引き継げる価格ではなく、自分で選ばなければならない動作点についての主張なのだ。独立した測定は、その分岐を鋭く浮かび上がらせる。Artificial Analysisでは、Claude Sonnet 5.5を最大effortで動かすとIntelligence Index上でタスクあたり7.60ドルかかるのに対し、5.09ドルなのがClaude Sonnet 5の最大effort時——およそ49%多いのであって、30%安いのではない。これはAnthropicの数字と矛盾しているわけではない。同じ曲線のもう一方の端であり、誰もeffort設定のスイープをやり直さなければ、ほとんどの移行がデフォルトでたどり着く地点なのだ。

二つの主張が一つの番号をまとっている

Anthropicの投稿は、タスクあたりの主張を3か所で行っており、そのいずれもエフォートに依拠している。最も強いバージョンは次のとおりだ。Terminal-Bench 4.0では、Medium effort(Claudeアプリのデフォルト)で、Sonnet 5.5は「タスクあたりのコスト10分の1未満で、Sonnet 5の最高スコアをはるかに上回る」。AA-Briefcase v1.1では、Medium effortで、約9分の1のコストでSonnet 5の最高スコアを上回る。CursorBench 4.0では、Low effortで、10分の1未満のコストでSonnet 5の最高スコアを超える。

これらを一組として読めば、仕組みは明白だ。Sonnet 5.5の下限は、複数の評価でSonnet 5の上限を上回っている。30%はトークンあたりのコストを下げることで得られるのではない。高価な設定が不要になることで得られるのだ。Anthropicはマーケティング資料の1ページ隣にある移行ドキュメントで、まさにそう述べている。「エフォートレベルは再調整されています。あるエフォートレベルが生み出す思考量は、Claude Sonnet 5のときと同じではありません。設定をそのまま引き継ぐのではなく、エフォートスイープを再実行してください。」

その一文は、Anthropicが今週公開した中で運用上最も重要な一行であり、ほとんどのローンチ報道には盛り込まれなかったものだ。

Anthropicが公開したもの — ベンダーによる報告で、未再現

このセクションの内容はすべてAnthropic自身による測定であり、Sonnet 5.5の発表とシステムカードに基づくものです。これはベンダーによる主張であって独立した結果ではなく、脚注の連なりは見出しの数字と同じくらい重要です。

• Terminal-Bench 4.0(エージェント型コーディング)— Sonnet 5.5 70.6% 対 Sonnet 5 10.3%。これは、最も引用されるたった1つの行における7倍の急上昇であり、ほとんどの報道が冒頭で取り上げた数字だ。

• FrontierCode 1.1(メイン) — Sonnet 5.5 は Xhigh で 52.1%、Max で 46.2%。Sonnet 5 は 42.4%、Claude Opus 5.5 は 54.4%、GPT-6 Sol は 49.3%。注目すべきは逆転で、Sonnet 5.5 は Max の方が Xhigh より 低いスコアを記録する。

• CursorBench 4.0 — Sonnet 5.5 は 55.5%、Sonnet 5 は 34.1%、Opus 5.5 は 57.8%。CursorBench 4.0 は GPT-6 Sol を公に報告していません。

• GDPval-AA v2.1(ナレッジワーク)— Sonnet 5.5 1844 Elo、Sonnet 5 1449、Opus 5.5 1846、GPT-6 Sol 1487。

• AA-Briefcase v1.1 — 同じ4モデルで 1811 / 1359 / 1822 / 1483。

• Humanity's Last Exam(ツール使用時) — 64.5% / 54.9% / 67.7%。

• OSWorld 2.1(コンピュータ操作、部分点)— 80.1% / 57.0% / 81.8%。

• Chartography(視覚的なグラフ認識、ツール不使用)— 61.6% / 15.6% / 64.4% / 53.6%。

それらの行には、下に置くのではなく、その行とともに運ばれるべき脚注が3つある。第一に、Terminal-Bench 4.0におけるOpus 5.5の66.4%という数値は、Opus 5.5で最もスコアの高い構成であるXhigh effortで報告されたものだ。第二に、FrontierCode Maxでの逆転はこう説明される。Maxでは、Sonnet 5.5がClaude Codeのコードレビュースキルをより頻繁に実行し、このスキルはレビューを多数のサブエージェントに分割する。そして2件のケースで、タイムアウトまたはタスクの範囲を超えた編集が生じた。FrontierCodeは、たとえ良い変更であっても範囲外の変更にはペナルティを課す。第三に、そしてベンダーにとって最も居心地が悪いのは、Artificial AnalysisがGDPval-AAとAA-Briefcaseをプレリリース版のSonnet 5.5デプロイメントで実行したことだ。Anthropicによれば、これは構造化出力リクエストへの応答を劣化させるバグがあったという。Anthropicは、影響は小さく、Sonnet 5.5を過小評価するものになると予想しており、バグは修正済みだと述べている。また同社は、OpenAIが最近GPT-6 Solの画像理解のバグを修正したことにも言及しており、そのためこれらの行のGPT-6 Solの数値は、まだ現在のモデルを反映していない可能性がある。

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

独立した実行が同じモデルについて述べていること

Artificial Analysis は Sonnet 5.5 を測定済みで、そのページには正確な構成が「Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)」と記載されています。同じインデックスのリビジョンでは、クラス内の216モデル:

• Claude Sonnet 5.5 — インテリジェンス指数 56、順位は216件中3位。指数タスクあたりのコストは7.60ドル。指数実行中に4億1000万の出力トークンを生成し、中央値は8800万だった。

• Claude Sonnet 5 — インデックス 38、216件中58位、専用ページでは「(Adaptive Reasoning, Max Effort)」と表示されています。タスクあたり$5.09のコスト。出力トークン370M。

• Claude Opus 5.5 — インデックス58、216件中第1位。タスクあたり5.98ドル。毎秒95.3出力トークン。

• GPT-6 Sol — Index 48、216 件中 20 位、リスト価格は $2/$10。タスクあたり $1.06、出力毎秒 89.8 トークン。

Intelligence Indexの差 — 56対38、18ポイント — は、この記事における最も強力な独立した裏付けであり、読者が実際に持ち帰るべき数字だ。コストの数値のほうはただし書きが必要で、正確に述べておく価値がある。両方のデータ点は最大エフォート構成であり、より長く推論するモデルにおける最大エフォートは、意図的に高コストな立ち位置なのだ。Sonnet 5.5はインデックス実行で410Mトークンを消費し、Sonnet 5は370Mだった。そしてどちらも中央値88Mをはるかに上回っている。この数字が反証するのは「タスクあたりでより安い」ということではなく、それをモデルの性質として読むことのほうだ。

Artificial AnalysisはまだSonnet 5.5の出力速度の数値を公開していない。同社のページでは「Output tokens per second」がN/Aとなっており、Sonnet 5の78.7、Opus 5.5の95.3と対比されている。つまり、Anthropicの主張のうち「30%以上高速」という部分は、現時点ではベンダーによる報告にすぎない。第三者が測定するまでは方向性を示すものとして扱うべきだ。

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

節約が実際どこから生まれるのか、そしてそれをどう手に入れるか

もしその仕組みを受け入れるなら、移行手順は自ずと出来上がり、Anthropicはそれを公開している:

• 既定では high から始めてください。Sonnet 5 の設定がどうなっていたかに引きずられる必要はありません。 Anthropic のガイダンスでは、ワークロードがエージェント型であるかレイテンシーに敏感でない限り high が推奨されます。

• エージェント型コーディングと多段階ツール使用 — 明確に定義されたタスクでは中程度から始め、より難しいまたは長いタスクでは高に上げてください。

• チャットやその他のレイテンシーに敏感な作業 — 中または低から始めましょう。 「コスト10分の1」という主張が当てはまるのは、この帯域です。

低い設定が機能する理由には筋の通った説明があり、それはマーケティングではない。Anthropicの初期テスターは、Sonnet 5.5がSonnet 5よりもツール呼び出しをまとめて行い、タスクあたりのステップ数が少なくなると報告した。発表におけるCodeRabbitの注記は、ローンチ時の引用としては異例なほど具体的だ。Sonnet 5の「ウェブ検索に頼りすぎる傾向と、高いトークン使用量は、どちらもこの新しいモデルでは解消されている」。Sonnet 5.5はSonnet 5と同じトークナイザーを維持しているため、同一のテキストは同一のトークン数になる——削減されているのはターン数と冗長な呼び出しであり、より安価な語彙ではない。つまり、ログ内のトークン数はアップグレード後も比較可能なままで、アップグレード前後の測定が簡単になる。

Sonnet 5のコードを壊す、あるいは改変する6つの変更点

これはリリースの中でもエンジニアリング工数を食う部分であり、移行ガイドがベンチマークチャートよりも価値を持つ箇所でもある。6つのうち5つはハードエラーを返し、残る6つ目はサイレントに失敗する。

• thinking: {"type": "disabled"} は 400 を返すようになりました。 代替となるのは thinking: {"type": "between_tools"} で、これは事前の思考をオフにし、このモデルで最も低い思考設定です。low、medium、high effort で動作し、beta ヘッダーは不要で、Sonnet 5.5 を提供するすべてのプラットフォームで利用できます。xhigh または max effort では、between_tools 自体が 400 を返します — これらのレベルが必要な場合は、adaptive thinking を使用してください(フィールドを省略するか、{"type": "adaptive"} を送信します)。between_tools では、会話の途中で effort を変更することもできません。

• 強制ツール使用はサポートされていません。 tool_choice を {"type": "any"} または {"type": "tool", "name": "..."} に設定すると、400 が返され、メッセージは「tool_choice: type 'tool' and 'any' are not supported for this model.」となります。同じチェックはトークン数カウントエンドポイントにも適用されます。スキーマに有効な入力に対する文書化された代替手段は、tool_choice: {"type": "auto"} とツールの strict: true を併用するか、スキーマを構造化出力に移行することです。

• 思考ブロックはモデルと会話に紐付けられています。Sonnet 5.5はSonnet 5、Opus 4.8、Haiku 4.5およびそれ以前から思考ブロックを読み取ります — Opus 5、Opus 5.5、またはFableやMythosモデルからは読み取りません。他のモデルはSonnet 5.5のブロックを読み取りません。会話をSonnet 5から5.5に移動すると推論は保持されます。Sonnet 5.5から他の何かに移動すると、以降のターンはそれなしで実行されます。別途、APIは現在、思考ブロックが生成されてからシステムプロンプト、ツールリスト、または以前のメッセージが変更されたかどうかをチェックし、2026年8月31日以降に作成されたアカウントでは、変更があった場合に400を返します。会話を追記専用に保つか、thinking-binding-controls-2026-08-01ベータヘッダーをprefix_mismatch_behavior: "drop_block"と共に送信してください。

• computer_20251124 は Claude API と Google Cloud では拒否されます。そちらでコンピュータ使用を利用するには computer_toolset_20260801 ツールセットが必要です。Amazon Bedrock は依然として古いツールを受け付けます。同じエージェントを両方で実行する場合は、指摘する価値のあるプラットフォーム間の差異です。

• 一部のアドバイザーの組み合わせは利用できなくなりました。 Sonnet 5.5 のエグゼキューターは、アドバイザーとして Mythos 5.1、Fable 5.1、Mythos 5、Fable 5、Opus 5.5、Opus 5、または Sonnet 5.5 自体を受け付けます。Sonnet 5 のエグゼキューターで動作する Opus 4.8、Opus 4.7、Sonnet 5 のアドバイザーは、Sonnet 5.5 のエグゼキューターでは 400 を返します。Sonnet 5.5 が受け付けるすべてのアドバイザーはアドバイスを暗号化して返すため、クライアントはアドバイスのテキストを読み取れません。

• ツール呼び出し間のテキストが、今では thinking ブロック内に届くようになりました — そしてデフォルトの表示「omitted」では、それは空です。 これがサイレントなケースです。ツール呼び出し間の 1、2 文より長いメモは、テキストとしてではなく、進捗更新の thinking ブロックとして返されます。そのナレーションをユーザーにストリーミングするアプリケーションは、ツール呼び出し間で沈黙し、エラーもなく、ログにも何もありません。修正方法は、テキストが返されるように thinking.display を設定するか、between_tools に切り替えるかのいずれかです。後者の場合、テキストは通常のテキストとして返されます。

移行で触れるさらに2つの点、どちらもエラーではありません。拒否の監視:Sonnet 5.5 は stop_reason: "refusal" を返し、stop_details オブジェクトで5つのポリシー領域——cyber、bio、frontier_llm、reasoning_extraction、general_harms——のいずれかを示します。そして Anthropic のサーバー側フォールバックは、cyber と frontier_llm の拒否を Sonnet 5 で再試行しますが、残りの3つは再試行しません。また、セキュリティ態勢は本当に変わりました。Sonnet 5.5 は、Opus クラスと同様のサイバーセーフガードとフォールバックを搭載して出荷される最初の Sonnet モデルであり、つまりリスクの高いサイバーセキュリティリクエストは目に見えて Sonnet 5 にフォールバックします。さらに、推論抽出に対する分類器を備えた最初の Sonnet でもあります。あなたの製品の価値提案がセキュリティツールであるなら、モデルの差し替えを出荷する前にその境界をテストしてください。

料金設定、そして今日私たちのルートに本当にあるもの

料金表はSonnet 5から変更されておらず、公表されているその全容は端的に述べられるほど短い:

• 入力 — 100万トークンあたり$2.00。出力 — 100万トークンあたり$10.00。どちらもSonnet 5と同一で、AnthropicのSonnet 5.5のモデルページで確認済みです。

• キャッシュ読み取り — 100万あたり$0.20、入力の90%割引。5分間のキャッシュ書き込み 100万あたり$2.50。1時間のキャッシュ書き込み 100万あたり$4.00。キャッシュ可能な最小プロンプトはSonnet 5.5で512トークンとなり、Sonnet 5の1,024トークンから減少しました。

• Batch — 双方向とも50%オフ、つまり100万トークンあたり$1.00 / $5.00。Message Batches APIでは、output-300k-2026-03-24ベータヘッダーを使用すると、出力は最大300Kトークンまで可能です。

• Opus 5.5 との比較 — Sonnet 5.5 はちょうど半額で、$2/$10 対 $4/$20、キャッシュ書き込みは半分、キャッシュ読み取りは $0.20 で同一です。これこそが元の取れる移行であり、Anthropic もそれを明言しています。Sonnet をより低いエフォートで動かすとき、この 2 つのモデルは最もよく補い合い、Opus は「継続的な判断を要する複雑で自由闊達な作業において明らかに依然として強力」だというのです。

• コンテキストと出力 — 100万トークンのコンテキスト、最大出力128K、適応的思考はデフォルトで有効、デフォルトのエフォートは高、信頼できる知識カットオフは2026年6月、ゼロデータ保持が利用可能、廃止は早くとも2027年9月28日。

可用性について、暗に示すのではなく明言しておきたい注記が 1 つあります: Claude Sonnet 5.5 は、2026年9月29日時点で当社のモデルカタログにありません。その前身である anthropic/claude-sonnet-5 と、より大きな兄弟モデルである anthropic/claude-opus-5.5 はいずれも掲載されており、当社側の料金はプロバイダー自身の設定です — Sonnet 5 では入力 $2.00、出力 $10.00、キャッシュ読み取り $0.20、キャッシュ書き込み $2.50 で、マークアップは一切加算されていないため、ベンダーの価格変更は次の請求サイクルではなく、それが反映された当日にここでも有効になります。この最後の特性こそが、料金表を読むことを飾りではなく有用なものにしています。

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

今日これでできること

本番環境ですでにClaude Sonnet 5を運用しているチームにとっての正直な進め方は3つのステップであり、そのどれも「モデル文字列を差し替えてグラフを眺める」ことではない。

まず、エフォートスイープを再実行してください。Sonnet 5からハイまたはマックスの設定を引き継いでいるなら、それが品質基準に必要なことだったからでしょうが、今はもう買う必要のない推論に対してコストを払っています。独立したタスクあたりのコスト数値によれば、はしごの最上位はより高価になったのであって、安くなったのではなく、ベンダー自身のコスト主張はいずれもその中間について述べたものです。次に、デプロイ前に2つのエラーパスを修正してください — 思考の無効化とツール使用の強制です — どちらも大きく、即座に失敗するのが良い知らせです。3つ目に、ナレーションパスに注意してください。これは静かに失敗するからです。

そのモデルがまだあなたの使っているルートにないなら、低リスクで評価する方法は、置き換えるのではなく併走させることです。Sonnet 5 を同じキーのフォールバックとして固定しておけば、拒否やタイムアウト、評価の失敗が起きたときにリクエストはすでに信頼しているモデルへ送られ、自動フェイルオーバーが2つ目の統合なしにループを閉じます。実績のないモデルを、ユーザーの前に置くのではなく1つのエンドポイントの背後で評価する根拠は、これで尽きています。そしてここではそれが二重に当てはまります。Sonnet 5.5 の拒否カテゴリは新しく、そのエフォートのキャリブレーションは前世代と明示的に同じではないからです。デフォルトを移す準備ができたら、1つのキー上のラインナップは200以上のモデルに及び、比較は2つ目の契約ではなく設定変更になります。

何を見るべきか

この記事に残る未解決の疑問を決着させるのは3つのことであり、そのどれもまだ起こっていない。

独立した出力速度測定が第一だ。AnthropicはSonnet 5より30%以上高速だと主張している。Artificial AnalysisはSonnet 5.5の数値を公表しておらず、その主張はコスト論で実際に効いている。高速なモデルは同じタスクをより短い実時間で、しばしばより少ないトークンで終えるからだ。第二はClaude Haiku 5.5だ — Anthropicは「今後数週間で」登場すると述べており、Sonnet 5.5の下位に位置することになる。これは、中程度と低いエフォートですでにSonnet 5.5が競争力を持つ大量チャット帯の計算を変える。第三は補正パスだ。Artificial Analysisは構造化出力のバグがあるリリース前ビルドでGDPval-AAとAA-Briefcaseを実行した。Anthropicはこれらのスコアがモデルを過小評価していると予想しており、どちらの数値も再実行されていない。もしそれらが上方修正されれば、Opus 5.5とのナレッジワークの差はさらに縮まり、「半額」という主張はさらに強くなる。

それまでは、擁護可能な要約は発表よりも範囲が狭く、ベンチマークチャートよりも有用だ。Claude Sonnet 5.5 は独立系インデックス上で Sonnet 5 に対する18ポイントの知能向上であり、公表料金は同じで、エフォートの階段を下る人なら誰でも利用できる現実的かつ測定可能な節約があり、そうしない人には現実的かつ測定可能なペナルティがある。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新