
Claude Sonnet 5.5 vs Claude Sonnet 5:同じ価格、異なる請求
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
同じベンダーから出た2つのモデル。同じティア、同じ名前、そして公開されている料金表のどの行でも同じ価格です。Claude Sonnet 5は2026年6月30日に、100万入力トークンあたり2.00ドル、100万出力トークンあたり10.00ドルで提供開始されました。Claude Sonnet 5.5は2026年9月28日に一般提供開始となり、価格は2.00ドルと10.00ドル、キャッシュ読み取りは0.20ドル、5分キャッシュ書き込みは2.50ドルで、どちらも同じです。価格については何も変わっていません。変わったのは、価格表が測らないすべてであり、その結果、この2つのモデルのうち一方は、トークンあたりのコストがまったく同じであるにもかかわらず、他方よりも運用コストが大幅に安くなっています。Anthropic自身のリリース見出しも、明言こそしないものの、そのことを示しています。料金表は変更なしのまま、ほとんどの作業で最大30%のコスト削減。両方の文が真であるためには、新しい方のモデルが同じ仕事をより少ないトークンで完了する場合だけであり、それをベンチマークが示し、独立したタスク別の数値が裏付けています。
Claude Sonnet 5.5はClaude Sonnet 5より高価ですか?
いいえ——それに、この問いには真剣に受け止める価値がある。なぜなら、非常に多くの移行が、定額料金表を定額請求書とみなすことで失敗してきたからだ。
トークンあたりでは、2つのモデルは同一です。入力$2.00、出力$10.00、キャッシュされたトークンの読み取りが$0.20、書き込みが$2.50です。段階的な料金帯も、長いコンテキストに対する追加料金もありません。新しいモデルが何であれ、それは世代を装った値上げではありません。
完了したタスク1件あたりで見ると、どちらのワークロードを説明しているかによって全体像は逆転する。Artificial Analysisは、同じIntelligence Index v4.3スイート上で、Claude Sonnet 5はタスク1件あたり5.09ドル、Claude Sonnet 5.5はタスク1件あたり7.60ドルかかると報告している。新しいモデルのほうが、同一料金でありながら、タスクを完了するのに49%高くつく。同じレポートは、Sonnet 5.5がスイート全体で4億1000万トークンを出力したのに対し、Sonnet 5は3億7000万トークンだったと指摘している。いずれも追跡対象分野の中央値8800万トークンと比べたものだ。評価者のオープンエンドなプロンプトでは、新しいモデルは単純により多く書き、同一料金ならトークンが多いほど請求額は大きくなる。
Anthropicの「30%安い」という主張は、自社が選んだワークロードについてのベンダー主張だ。第三者による7.60ドル対5.09ドルは、別のセットでの測定値である。どちらも間違いではない。この不一致こそがすべてであり、決め手は、あなたのタスクが自らの出力を制約するかどうかにある。
2世代間で実際に変わったこと
料金表は静的だが、モデルはそうではない。単一のリストとして並べると、差分は大きく、そのほとんどが一方向的だ。
• Terminal-Bench 4.0 — Claude Sonnet 5.5 が 70.6%、Claude Sonnet 5 が 10.3% で、Anthropic がこのテストで公表した中で最大の単一世代の飛躍
• CursorBench 4.0 — 55.5% 対 34.1%
• チャートグラフィー、ツールなし — 61.6% 対 15.6%
• GDPval-AA v2.1 — 1844 対 1449
• AA-Briefcase v1.1 — 1811 対 1359
• Humanity's Last Exam、ツール使用時 — 64.5% 対 54.9%
• OSWorld 2.1、部分完了 — 80.1% 対 57.0%
• Artificial Analysis Intelligence Index v4.3 — 56 対 38、同じ「Adaptive Reasoning, Max Effort」構成で測定された第三者尺度における18ポイントの差
そのリストの形は一様な進歩ではない。Chartographyが15.6%から61.6%へ、Terminal-Benchが10.3%から70.6%へと動いたのは、改善した能力ではなく、欠けていた能力が今は存在するように見える。Humanity's Last Examが10ポイント、OSWorldが23ポイント、価格が変わらないまま動いたのは、全般的に賢くなった世代ではなく、特定のギャップを埋めた世代のパターンだ。18ポイントの指数の差はその算術平均であり、実在し、大きく、ツール使用、コード実行、視覚作業に集中している。
ベンダー表を注意深く読む人にとって重要な脚注が1つある。Anthropicは、FrontierCodeにおいてMax effort構成のスコアがXhighよりも低くなると述べており、さらにGDPval-AAとAA-Briefcaseの実行は、構造化出力のバグを抱えたリリース前のデプロイメント上で実行されたと指摘している。上記の数値は依然として入手可能な最良のものだが、モデルの恒久的な特性ではなく、単一のデプロイメント時点のスナップショットとして扱うべきである。
なぜ価格は同じなのに請求額は違うのか
実際の請求書をどれだけ動かすかの降順による、3つのメカニズム。
第一は、出力長の規律である。Sonnet 5.5 はより有能なエージェントであり、つまり回答する前に多くのことを行うため、長さ制約のないスイートでは、トークンあたりのコストは同じでありながら、Sonnet 5 より約 11% 多く書く。出力を上限付きにするワークロード——固定スキーマへの抽出、分類、範囲を限定した要約——では、その 11% は決して現実にならず、30% という主張は信憑性を帯びる。なぜなら、勝ちはターンあたりのトークン数を減らすことではなく、より少ないターンで答えに到達することにあるからだ。
2点目はキャッシュの挙動であり、キャッシュ読み取り価格が変わらないからといってキャッシュコストが変わらないとは限らないのは、まさにこのためです。キャッシュの読み取りと書き込みは両モデルで同一価格なので、キャッシュされたトークン量の変化はそのまま請求額に反映されます。エージェントタスクを完了するまでのターン数が少ないモデルは、プレフィックスを読む回数も少なくなります。それは価格変動を一切伴わない節約であり、料金表の明細だけを並べたあらゆる比較表では見えてきません。
三つ目は、移行日に多くのチームがつまずくポイント、すなわち effort のデフォルト値です。Claude Sonnet 5.5 は reasoning を effort パラメータで構成し、low、medium、high、xhigh、max の設定があります。デフォルトは Claude Platform では high、Claude アプリ内では medium です。reasoning バジェットを固定していた Sonnet 5 のデプロイから移行した場合、新しいデフォルトは、あなたが支払っていたのとは異なる深さになっているかもしれません。コスト削減になるか増加になるかを決めつける前に、必ず測定してください。
また、ロールアウト後にではなく前に指摘しておく価値のある、行動面の影響もあります。Anthropic は、Claude Sonnet 5.5 がサイバーセーフガードとフォールバックを最上位モデルと同等の立場で搭載して登場する最初の Sonnet であると述べています。そのため、よりリスクの高いサイバーセキュリティ関連のリクエストは、以前の Sonnet に目に見える形でフォールバックします。ログには、リクエストしていないモデルが表示されます。関連して、thinking を無効にして Sonnet を実行する場合は、between-tools behaviour に切り替える必要があります。これはフラグではなく、コード変更です。
OrcaRouterでは、anthropic/claude-sonnet-5 が本日時点で1つのクレデンシャルでプロバイダーの定価、マークアップ0%でルーティング可能であり、Claude Opus 5.5、Claude Opus 5、DeepSeek V4 Pro、Gemini 3.1 Pro Previewも同様です。Claude Sonnet 5.5自体はまだ当プラットフォームのルートではないため、現時点でこの比較が実用的に意味するのは、すでにSonnet 5を運用しているチームが、APIキーに触れることなく、掲載されたその日に差分を測定でき、その間は文字列を変更するだけでティア間のフェイルオーバーができるということです。
切り替える前にみんなが聞く質問
両方同時に実行して、自分のトラフィックで比較できますか?まだ1つのOrcaRouter認証情報ではできません。Claude Sonnet 5.5が登録されたルートに含まれていないためです。回避策としては、新しいモデルをAnthropic自身のAPIで、古いモデルを当社経由で実行し、トークンあたりのコストではなく完了したタスクあたりのトークン数を比較することです。なぜなら、そこが2つのモデルが実際に異なる数値だからです。
価格が据え置かれているということは、Anthropicが新しい能力に対して課金していないということですか?それは、モデルが改善される間も定価が据え置かれているという意味で、過去2世代のSonnetと同じパターンです。それが続くかどうかは技術上の問題ではなく商業上の問題であり、公表されている提供終了期間——早くても2027年9月——が、付随する唯一の確約です。
どちらの数字を信じるべきですか、Anthropicの30%と第三者による49%のどちらを?一般的な主張としては、どちらも信じるべきではありません。Anthropicの数値は、モデルがより少ないターンで答えに到達するワークロードを説明しており、Artificial Analysisの数値は、冗長さが自由に増大できる制約のないインデックススイートを説明しています。あなたのプロンプトセットに似ている方を選び、それがどちらなのか判別できないなら、その曖昧さ自体が答えです——それを測定してください。
結論
Claude Sonnet 5.5 は値上げではないが、自動的に節約になるわけでもない。Anthropic は料金表の各行を据え置いたまま、その下でモデルを入れ替えた。つまり経済性の根拠はすべて、完了したタスクあたりのトークン数にかかっている。その数値は、ベンダーが選んだワークロードでは 30% 優れ、独立した評価者が選んだスイートでは 49% 悪い。あなたのタスクが自らの出力を制限しているなら、切り替えてその利得を取ればよい。そうでないなら、料金が据え置きであることは測定を省く理由にはならない。なぜなら、その作業において明らかに優れているモデルに対して、タスクあたり 1.5 倍多く支払うことになり得るからだ。



