Claude Opus 5.5 対 Claude Opus 5 のヒーロータイトルカード。見出しは「エフォートレベルは同じ意味ではない」で、バッジには medium 対 high(デフォルト)、$4.00 対 $5.00、$0.20 対 $0.50(キャッシュ)と記され、右下隅に OrcaRouter のロゴがある。
Engineering & Research

Claude Opus 5.5 対 Claude Opus 5:エフォートレベルは同じ意味ではない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

比較する前にまず知っておくべきことは、Claude Opus 5.5Claude Opus 5では、両モデルが同じエフォート尺度を共有していないということだ。そして今週あなたが目にするほぼすべての一騎打ちは、その事実を無視している。Opus 5 のデフォルトはhighエフォート。Opus 5.5 のデフォルトはmediumで、同じ名前のレベルでも、前世代より1ターンあたりに多くのことを考える。つまり「Opus 5.5 のデフォルト対 Opus 5 のデフォルト」は統制された実験ではなく、異なる2つの思考量の比較でしかない。ベンダー自身が移行ガイドでそう述べている——複数のエフォートレベルをテストし、Opus 5 の設定を再利用してはならない。同じ名前のレベルが同じ思考バジェットに対応するわけではないからだ。それを統制してしまえば、両モデルの差はあるところでは縮まり、別のところでは広がり、アップグレードの判断は生の能力以外の何か、つまり完了したタスクあたりのコストと、今日 Opus 5 で動いているコードを壊す4つの API 変更にかかってくる。

スペック単位で比べると、実際に何が違うのか

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

2つのモデルは、バージョン番号が示すよりも、スペック上は近い:

• 価格 — Claude Opus 5.5 は100万トークンあたり入力 $4.00 / 出力 $20.00、Claude Opus 5 は $5.00 / $25.00

• キャッシュ読み取り — 100万あたり$0.20 対 100万あたり$0.50、エージェント実行を支配する費用項目で60%削減

• キャッシュ書き込み — 5.5では5分間のウィンドウで100万トークンあたり5ドル、1時間のウィンドウで8ドル、Opus 5では6.25ドル

• コンテキストと出力 — どちらもコンテキスト100万トークン、出力128K。どちらも、{{2}}output-300k-2026-03-24{{/2}} {{3}}ベータヘッダー{{/3}}を指定することで、Batch API で300Kの出力に到達しますoutput-300k-2026-03-24ベータヘッダー

• デフォルトのエフォート — Opus 5.5 ではOpus 5 では

• Thinking — どちらも適応型で常時オンだが、Opus 5.5 ではまったく無効化できなくなった

• 知識カットオフ — 2026年6月 対 2026年5月

• レイテンシー — AnthropicはOpus 5.5を現行ラインナップと比較して「中程度」と評価しており、Opus 5よりも30%以上高速に出力を生成すると述べている

• 廃止 — Opus 5.5 は 2027年9月22日より早くに廃止されることはなく、Opus 5 は 2027年7月24日より早くに廃止されることはありません

注意していただきたいのは、以下が変わらないという点です。コンテキストウィンドウ、出力上限、バッチ割引、そして常時有効な適応型思考モデル。Opus 5.5 は、コンテキストがより大きいモデルでも、出力がより長いモデルでもありません。同じ枠組みの中で、より安価で、より高速で、トークン効率の高いモデルです。

ベンチマーク、そしてそのすべてに付く努力のアスタリスク

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

これらの数値はAnthropicの発表資料に基づくもので、ベンダーによる自己申告であり、同社自身のモデルに対して実行されたものだ。そしてここでは、モデル名よりもエフォート設定のほうが重要となる:

• Terminal-Bench 4.0 — 66.4% 対 52.3%、Opus 5.5 の実行はデフォルトではなく xhigh effort で

• FrontierCode v1.1(Main) — 54.4% 対 48.0%、そしてデフォルトの medium エフォートでの Opus 5.5 は 54.6%

• CursorBench 4.0 — 57.8% 対 46.6%、medium では 52.5%

• GDPval-AA v2.1 — 1846 Elo 対 1708

• AutomationBench — 40.0% 対 26.9%

• Humanity's Last Exam、ツール使用時 — 67.7% 対 63.6%

• Terminal-Bench-Science 0.1 — 58.7% 対 29.0%、セット内で最大の差

• OSWorld 2.0 — 部分達成 81.8% 対 74.0%

• ツールを使用したチャート作成 — 89.0% 対 83.4%

FrontierCodeの結果こそ検討すべきものだ。Opus 5.5はxhighで54.4%、mediumで54.6%を記録する——統計的には同じ数字であり、しかも思考予算のほんの一部で済む。Anthropicがどのような改善を行ったとしても、そのベンチマーク上では、それはより深く考えることから生じているわけではない。CursorBenchは逆方向に動く。xhighで57.8%に対しmediumで52.5%と、5ポイントの開きがあり、これは一部のタスクでは努力が依然として実際の精度を買うことを示している。教訓は「mediumを使え」や「xhighを使え」ではない。適切な努力レベルは今やワークロードごとに測るべきものになり、Opus 5をhighのデフォルトのままにしておくという古い習慣は、新しいモデルについてもはや何も教えてくれない。

Anthropicは繰り返す価値のある注意書きを添えている。この能力レベルでは、ベンチマークの差は「実世界での違いを知る上ではあまり信頼できない指標」であり、同社によれば、Claude Fable 5.1との内部的な差は公開スコアが示唆するよりも小さいという。これはベンダーが、自社の表を過大に読み取らないよう促しているのだ。

完了したタスクあたりのコストこそが、それを決める比較だ

エージェントにとってトークン単位の価格は誤った単位であり、この対決はそれが明らかになる場面だ。Anthropic自身の実例:Opus 5.5での合併分析は63分かかり、Opus 5での同じタスク(93分)よりコストが50%少なかった。料金表はその一部を説明する——入力と出力で20%削減、キャッシュ読み取りで60%削減——が、すべてではない。残りは、同じ地点に到達するためにより少ないトークンとより少ないターン数でモデルが処理していることにある。ローンチ時に公表された顧客の声も同じ方向を指す:Boxはトークン数が3分の1で、回答の冗長性が約40%少ないと報告し、Kiroはトークン数がほぼ半分で呼び出し回数が40%少ない、Factoryは出力トークンが20~25%少ない、GitHubは、同社が測定した中で最も少ないトークン数とステップ数の一つである。

それらはベンダーが公開した顧客の発言であり、監査済みの結果ではありません。また、「一般的なワークロードで約40%安い」という集計値は、Anthropicが自社で選んだワークロード全体の平均をどう表現したかにすぎません。あなた自身の計画にとって正直な言い方をすれば、20%の表示価格引き下げは実際にあり、当てにできるものと想定し、追加の20%は仮説として扱い、同じタスクを両方のモデルで実行してトークンを数えれば、午後ひとつで検証できます。

キャッシュ削減が実力以上に効く理由についての構造的な補足を1つ。毎ターン長いシステムプロンプトとファイルツリーを再送するエージェントは、入力の大部分に対して新規入力レートではなくキャッシュ読み取りレートを支払う。これを100万あたり$0.50から$0.20に下げると、ヘッドラインのレートが変える以上に長時間セッションの経済性が大きく変わる — そしてこれが、Opus 5ではぎりぎり成立していたワークロードが、プロンプトを一切変えずにOpus 5.5では明らかに成立し得るようになる理由だ。

移行チェックリストとしての4つの破壊的変更

Opus 5.5は新しいモデルであり、名前が変更されたOpus 5ではありません。Anthropicの移行ノートには、本番環境で既に稼働しているコードを壊す4つの変更点が挙げられています:

• Thinking は無効にできません。Thinking をオフにしていたあらゆるコードパスはエラーになるか動作が変わり、深さは現在 effort パラメータを通じてのみ制御されます。

• 強制的なツール使用はエラーを返します。tool_choiceで特定のツールを強制することはサポートされていません。

• Thinkingブロックは、それを生成したモデルと会話に紐づいているため、一部のパイプラインが想定しているようには、モデル間で再生できません。

• 以前のcomputer_20251124 computer-use ツールは、Claude API または Google Cloud では受け入れられません。

5つ目の変更があります。これは何も失敗させないため、それだけにより危険です。ツール呼び出しの間のテキストは、デフォルトの表示設定ではテキストが空になる thinking ブロックの内部で返されるようになりました。アプリケーションがそのテキストを進捗更新としてユーザーにストリーミングしている場合、テキストを返す表示値を設定するまで、ツール呼び出しの間は沈黙します。すべてのテストは通ります。インターフェースがナレーションを停止するだけです。

最初の3つはClaude Fable 5.1にも当てはまるため、すでにそのモデルへ移行済みのチームは、この作業の一部をすでに終えています。まだOpus 5を使っているチームは、まだ終えていません。

Opus 5が依然として正しい選択となるのはどのような場合か

アップグレードは自動ではなく、現状にとどまるべき本当の理由が4つあります:

• コストの予測可能性。Opus 5 はすでに特性を把握済みのモデルです。もし予算をそのトークン消費量に基づいてモデル化しているなら、同じ名前のエフォートレベルで思考量が異なるモデルへ移行すると、再測定するまでそのモデルは無効になります。

• 互換性。スタックのいずれかの部分が、思考の無効化、ツールの強制、または旧式のコンピュータ使用ツールに依存している場合、その移行は文字列の置き換えではなくコード作業になります。

• セーフガードのルーティング。Opus 5.5 には Fable 5.1 級のセーフガードが搭載されているため、ほとんどのサイバーセキュリティ関連のリクエストは Claude Opus 4.8 に再ルーティングされ、生物学関連の作業は、アカウントが検証済みでない限り Claude Opus 5 にフォールバックします。あなたの製品がどちらかの領域にある場合、「アップグレード」によってユーザーがより小規模なモデルから回答を得ることになる可能性があります。Opus 5 にはそのルーティングはありません。

• 寿命。Opus 5 はすぐにどうなるものでもない — Anthropic は廃止を早くとも2027年7月24日と記載しており、それは10か月先です。

他の皆にとっては計算は単純明快だ。より高い能力、より低い価格、より少ないトークン、そしてエンジニア1人が1日でこなせる移行チェックリストである。

切り替え中は両方を実行する

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

旗艦モデルの移行で厄介なのは、常にその中間段階だ。新しいトラフィックにはOpus 5.5を使いたいが、自社のエフォート設定で特性を把握していないモデルに本番経路を賭けるわけにはいかない。そして、検証している間はOpus 5を動かし続けたい。これはリプラットフォーム化ではなくルーティングの問題であり、何がどこにあるのかを正確に見極める価値がある。Claude Opus 5は現在OrcaRouterで利用可能、Anthropicの定価そのまま、マークアップ0% — プロバイダーの定価をそのまま通しているので、ベンダーの料金改定は同期を待たず当日に当社側へ反映される。Claude Opus 5.5はまだ当社のルートの一つではない。Anthropic自身のAPIと主要クラウドを通じて利用できる。登場すれば2つ目の契約と2つ目のSDKではなく、同じキー上のもう一つのルートになり、これによってトラフィックの一部を新モデルに振り向けつつ自動フェイルオーバーで残りをすでに特性を把握済みのモデルに維持できる。両方をまたいで呼び出しを構成する — 一方でドラフト、もう一方で検証パス — のはルーティングDSLの1行だ。

それが何をもたらすかについては正確に述べておこう。それはOpus 5.5の独立したベンチマークを与えるものではない。まだ何も与えていない。なぜなら、公表されている直接比較はAnthropic自身のものだけで、独立系のトラッカーは依然としてエフォート設定の確定に至っていないからだ。それによって得られるのは、あなたの請求額を実際に予測できる唯一の測定値であり、あなたのプロンプト上で、あなたが本番投入するエフォートレベルにおいて得られるものだ。

決定規則

何か新しいことを始めるなら、Claude Opus 5.5を使い、エフォートで始めて、その後、設定があなたのタスクで通用するかどうかを測定しましょう — Anthropicによれば、低はいくつかのコーディング評価において、はるかに低いコストで上位の設定に迫るそうで、上記のFrontierCodeの数値は、デフォルト設定がほとんど取りこぼしていないことを示唆しています。

本番環境で Claude Opus 5 を動かしているなら、移行の引き金になるのはベンチマーク表ではない。4つの API 変更を吸収できるかどうか、そしてあなたのワークロードがサイバーセキュリティや生物学に属するかどうか——そこではセーフガードのルーティングが、あなたのトラフィックの一部を静かに小さなモデルへと流すことになる——だ。このアップグレードのそれ以外の点はすべて、モデルリリースの衣をまとった値下げであり、それらは受け入れる価値がある。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新