
Claude Sonnet 5.5 vs Claude Opus 5:あらゆる項目で安価、かつインデックスで先行
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
Claude Opus 5は2026年7月24日にリリースされ、入力100万トークンあたり5.00ドル、出力100万トークンあたり25.00ドルでした。Claude Sonnet 5.5は2026年9月28日に一般提供開始となり、2.00ドルと10.00ドルでした。これは2世代新しいモデルで、入力60%削減、出力60%削減です。さらに、Artificial Analysisが両モデルに対して実行するハーネス上では、Intelligence Index v4.3で56を記録し、Claude Opus 5の51を上回ります。新しいほうが安いモデルが、サードパーティ指数でも高スコアになるまれな比較であり、現行モデルを選ぶ残された理由がベンチマーク順位ではなく、特定の種類の作業にあるという比較です。両モデルとも100万トークンのコンテキストを扱い、最大128Kトークンを出力し、テキスト、画像、ファイルを読み取り、推論の設定はthinking-token予算ではなくeffortパラメータで行います。利用できる機能面が同じであるため、両者の選択は、完了したタスクにいくらかかるかと、どのタスクが失敗するかという純粋な問題になります。
2つのリリース、1つのインターフェース
まずは変化の少なさから見ていこう。それでも大半の世代の飛躍よりはずっと大きいのだから。
• コンテキストウィンドウ — 両方で1,000,000トークン
• 最大出力 — 両方とも128,000トークン
• 入力モダリティ — 両方ともテキスト、画像、ファイルに対応。どちらも音声・動画には非対応
• 推論 — 両方で設定可能なエフォートによる適応型思考。深さは別個のモデル文字列ではなく、リクエストパラメータとなる
• 機能 — ビジョン、ツール、JSON、および両方における推論、OrcaRouter のカタログエントリによると、anthropic/claude-opus-5 と Sonnet ライン
実用上の帰結はこうだ。Claude Opus 5 向けに書かれたプロンプトは、Claude Sonnet 5.5 で動かすために書き直す必要がなく、128K の出力上限を前提に調整されたエージェントループにも新しいティアは不要である。移行とは、モデル文字列を差し替え、固定していた effort 設定を再確認することだけだ — それ以上ではない。過去2年間のマルチモーダルかつマルチパラメータの移行を経験してきたチームにとって、それがベンチマークではなく最大のニュースなのだ。
変わる唯一のものは価格で、しかもそれはマーケティング用スライドにある2つだけでなく、どの行でも変わる。
• 入力 — 100万あたり$2.00、$5.00に対して60%削減
• 出力 — 100万あたり$10.00、$25.00に対して60%削減
• キャッシュ読み取り — 100万あたり$0.20、$0.50から60%削減
• キャッシュ書き込み — 100万あたり$2.50、5分間のウィンドウでは$10.00に対して、75%削減
毎ターン長いプレフィックスを再読み込みするエージェントを実行している場合、キャッシュ読み取りの行が移行のコストを回収する項目です。$0.20 対 $0.50 では、長いセッションのすべてのキャッシュされたトークンが旧コストの 40% になり、キャッシュ読み取りはほとんどのエージェントループにおけるトークン数の大部分を占めます。その節約は、トークン単価の見出しでは捉えられない形で複利効果を発揮します。
5つのポイントはどこから来るのか
Artificial AnalysisはIntelligence Index v4.3において、Claude Sonnet 5.5を56、Claude Opus 5を51と評価しており、いずれも「Adaptive Reasoning, Max Effort」構成で測定されている。5点はそのスケールでは丸め誤差ではない——参考までに、同じ評価者ではSonnet 5が38、Gemini 3.1 Pro Previewが30であるため、Claude Opus 5とClaude Sonnet 5.5の差は、Claude Opus 5と前世代のSonnetとの差の3分の1に相当する。
Anthropic自身が公表したClaude Sonnet 5.5のリリース時数値も、別の物差しで同じ方向を指している。同社はTerminal-Bench 4.0で70.6%を報告している。これは、以前のAnthropicの表でClaude Opus 5が89.1%と記録されているのと同じテストだが、その数値は別のハーネス改訂版を用いたものであり、新しい方から差し引くべきではない。これが本記事で最も重要な出典上の注意点だ。Terminal-Benchは2026年の途中で4.0に移行し、それを掲載するインデックスは合わせてv4.3に改訂され、このベンチマークのバージョン間比較は算術ではできない。数値にバージョンが付く場合は、そのバージョンを必ず示すこと。
クリーンに比較できるのは、ベンダー自身によるSonnet側の進歩 — Sonnet 5のTerminal-Bench 4.0で10.3%からSonnet 5.5の70.6%へ — と、第三者インデックスの読みであり、そこでは両方の数値が同じ日に同じハーネスから出ている。その証拠に基づけば、後継モデルは汎用推論において7月のフラッグシップを本当に追い抜いており、これはどのベンダーのスライドが示す主張よりも強い主張である。
出力長の罠
ここで、算術は新しいモデルに優しくなくなる。
Artificial Analysisは、Claude Sonnet 5.5をそのインデックススイートで評価すると、タスクあたり7.60ドルかかると報告している。Claude Opus 5は同じスイートでタスクあたり5.86ドルだ。新しいモデルは、料金表のすべての項目で60%オフであるにもかかわらず、タスクを完了するのに約30%高くつく。その理由は同じレポートにある。Sonnet 5.5はスイート全体で4億1000万トークンを出力したのに対し、追跡対象モデルの中央値は8800万トークンであり、評価者はこれを「非常に冗長」と評している。Claude Opus 5は同じスイートで1億4000万トークンを出力した。
割り算してしまえば、仕組みは単純だ。Sonnet 5.5 は同一の作業で Claude Opus 5 のおよそ3倍の出力トークンを生成し、出力価格は40%だ。3かける0.4は1.2 — キャッシュ効果を考慮する前の20%のペナルティであり、これが7.60ドル対5.86ドルという結果の近辺である。トークンあたりの価格は間違っていない。ただ、請求額を左右する数字ではないというだけだ。
これは、新しいモデルの方が購入価値が低いということを意味するものではない。これは、ほとんどの比較が省いている何か——つまり、あなたのワークロードが出力を制限できるかどうか——に判断を依存させる。長さ指示付きの要約ジョブ、JSONを生成する構造化抽出パイプライン、ラベルを返す分類器——これらすべてにおいて、冗長性が表面化することはなく、60%のレートカード削減は実際のコスト削減になる。出力規律なしに「リポジトリを修正して」と依頼されたオープンエンドのエージェントは、Sonnet 5.5に3倍の余地を与える。
エフォート設定と、誰も予算を取っていない移行
どちらのモデルも、複数のレベルを持つ effort パラメータを通じて推論の深さを公開しており、どちらも固定値ではなくデフォルトを提供している——Claude Platform では high、Claude アプリ内では medium。移行時にありがちな誘惑は、設定を旧モデルでのままにしておいて、作業は完了だと呼ぶことだ。
それは測定可能な理由による間違いです。Anthropic自身のClaude Sonnet 5.5向け脚注には、Max effort構成がFrontierCodeでXhighより低いスコアになることが記載されています。つまり、effortは単調なダイヤルではなく、最上位設定が無料のアップグレードになるわけではありません。effortは、利用可能な中で最も高価なオプションを選ぶのではなく、タスクを測定して設定してください。
Sonnet側には、展開前に知っておく価値のある重大な挙動の違いもあります。Anthropicは、Claude Sonnet 5.5が、自社の最上位モデルに匹敵するサイバーセーフガードとフォールバックを搭載して出荷される最初のSonnetであると述べています。そのため、よりリスクの高いセキュリティ関連のリクエストは、あなたが指定したモデルによって処理されるのではなく、目に見える形で以前のSonnetにフォールバックします。ワークロードがその領域に該当する場合、ログにはリクエストしていないモデルが表示されます。Claude Opus 5は、Sonnetラインにおけるその取り決めより前に登場していますが、フラッグシップ層での生物学およびサイバーセキュリティ業務向けに、Anthropicの製品全体で同種のルーティングが存在します。
OrcaRouterでは現在、両方のエンドポイントが稼働しています — anthropic/claude-opus-5とanthropic/claude-sonnet-5は他のすべてと同じカタログに並び、プロバイダーの定価で、マークアップ0%で価格設定されています — そしてClaude Sonnet 5.5は、リストされ次第、同じ認証情報で利用できるようになります。それまでの間に関連する機能は自動フェイルオーバーです。Anthropicの一方のティアがレート制限されているかエラーを返している場合、コード変更なしでリクエストを他方に向け直すことができますこれは、この比較について誤っていた場合に備える最も安価なヘッジです。
規則として述べられた決定
あなたの仕事に範囲が定まっているなら——出力の形を自分で制御でき、プロンプトが構造化されており、タスクごとのトークン数が予測可能なら——Claude Sonnet 5.5 に移行して、60%の削減を受け入れよう。指標も一致しており、料金表も一致しており、もう一方の側に能力面での反論は残っていない。
作業が自由裁量型でエージェント的なら、どちらの料金表を信じる前に実験を走らせよう。各モデルで1週間、自分のトラフィックにおける「完了タスクあたりのトークン数」を測るのだ。$7.60 対 $5.86 という第三者による結果は、安い料金表がかえって大きな請求を生み得るという具体的な警告だ。長期ホライズンの自律作業では、その数値が出るまで Claude Opus 5 が引き続きより安全な既定の選択肢である。
正直な結論:これは、フラッグシップの存在理由が純粋な能力ではなくタスクの形に依拠する最初のSonnet世代であり、モデル名だけで判断している人は今や、どちらに賭けるかを推測するかだけで、60%を逃しているか、完了したタスクあたり30%多く支払っているかのどちらかだ。



この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
