Claude Opus 5.5のタイトルカードの表記:2026年9月22日リリース、コンテキスト1M・最大出力128K、入力100万トークンあたり$4、出力100万トークンあたり$20。
Guides & Insights

Claude Opus 5.5:Anthropicのフラッグシップモデル、完全解説

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Opus 5.5は、ベンダーの現行フラッグシップモデルであり、2026年9月22日にリリースされ、ベンダーが現在文書化しているClaudeラインの中間に位置する。次のモデルより安価で高速である:Claude Fable 5.1は上位に位置し、Claude Opus 5.5は次のモデルより高価で低速である:Claude Sonnet 5.5Claude Opus 5.5は下位に位置し、次のモデルの直接の後継である:Claude Opus 5はOpusラインの頂点にある。ベンダー自身のモデルピッカーは、それがどこに属するかを最も短く有用にまとめている:まずClaude Opus 5.5を「ほとんどのワークロード」向けに使い、Claude Fable 5.1は「要求の厳しい推論や長期的なエージェント作業、またはより高いeffortでClaude Opus 5.5に関する評価がまだ不足する場合」に求める。このページは、そのガイダンスが指し示すモデルのリファレンスである — エンベロープ、完全な料金表、公表されたすべてのスコアの背後にあるeffort設定、独立した評価、そして実際にどこで動作するか。読者がそれらのいずれかについて深く知りたい場合、このページは繰り返すのではなくルーティングする:料金表の計算、クロスモデル列を含む完全なベンチマークシート、および移行の詳細は、それぞれ独自のページにある。

Claude Opus 5.5とは何か、そして製品ラインの中でどこに位置づけられるのか

Anthro​picはClaude Opus 5.5について、「長時間実行されるエージェント型コーディングとナレッジワーク向け」に構築されたと説明し、「私たちの新しいClaude 5.5ファミリーの最初のモデル」として紹介している。これは、同社が一般提供するフラッグシップとしてClaude Opus 5を置き換える。Claude Opus 5はレガシーモデルとして掲載され続け、引き続き提供される。Anthro​pic自身のモデル概要が示すとおり、この4モデルのラインアップは一度に把握できるほど短い:

• Claude Fable 5.1 — 100万トークンあたり入力$10、出力$50、比較レイテンシは遅いと記載、適応的思考は常時オン、デフォルトのエフォートは高、1Mトークンコンテキスト、最大出力128K、信頼できる知識カットオフは2026年6月。Anthropicはこれをフラッグシップより上位に位置づけ、それに見合う価格を設定している。

• Claude Opus 5.5 — 100万トークンあたり入力$4、出力$20、相対レイテンシは中程度、適応的思考は常時オン、デフォルトのエフォートは中、100万トークンのコンテキスト、最大出力128K、知識カットオフは2026年6月。ラインナップで唯一、エフォートパラメータをサポートし、デフォルトが高ではないモデルであり、その詳細は見た目以上に重要です — 以下のエフォートセクションを参照してください。

• Claude Sonnet 5.5 — 100万トークンあたり入力$2、出力$10、比較レイテンシは高速、適応的思考、デフォルトのエフォートは高、100万トークンのコンテキスト、最大出力128K、信頼できる知識カットオフは2026年6月、退役は早くとも2027年9月28日。

• Claude Haiku 4.5 — 100万トークンあたり入力$1、出力$5、相対レイテンシは最速、拡張思考、effortパラメータなし、200Kトークンのコンテキスト、最大出力64K、廃止は2026年10月15日以降。

その表には、名指しするに値するほど頻繁に誤読される読み方が2つある。1つ目は価格の動きの方向だ。Claude Opus 5.5 は、置き換えたモデルより高いのではなく安い — $4/$20 対 Claude Opus 5 の $5/$25 — そして入力では Claude Fable 5.1 の2.5分の1だ。2つ目は、Claude Fable 5.1 との差が何を意味するかだ。Anthropic は、Claude Opus 5.5 が公開された複数のタスクで Fable 5.1 と同等かそれを上回り、タスクあたりコストは5分の1から3分の1である一方、真に要求の厳しい推論作業は依然として上位に回していると報告している。これは特定のチャートについてのタスクあたりコストの主張であり、安いモデルのほうが強いという一般的な主張ではない。ベンチマークページはその区別が見えるように保っている。Anthropic は次の展開についても述べている。「Claude Sonnet 5.5 と Claude Haiku 5.5 が今後数週間で続く」、そして「性能、効率、安全性における同じ改善の多く」を伴う。この文はその後、一部が明らかになった。Claude Sonnet 5.5 は2026年9月28日にリリースされたが、Claude Haiku 5.5 はまだ登場していない — Anthropic のモデル概要では、2026年10月7日確認時点で Claude Haiku 4.5 が現行の小型モデルとして依然として掲載されている。

2026年9月22日リリース — そして、ここでは日付が本題ではない理由

リリース日は、Anthropic自身の公式ページ上で2回記載されています。告知ページの日付は2026年9月22日で、モデルページには「最新。2026年9月22日リリース。」という一文があります。本記事の仕様数値は、2026年9月28日に、Anthropic自身のドキュメント、Artificial Analysis、または当社独自のモデルAPIから読み取ったもので、それぞれがどれに由来するかがラベル付けされています。可用性セクションにある、今日時点で何が最新かについての記述は、2026年10月7日にそれと同じ公式ページに対して再確認され、そこに日付が記載されています。

Anthropicは、自社で運営するプラットフォーム上でClaude Opus 5.5を「2027年9月22日より早くには終了しない」とサポートすることを約束しています。Amazon BedrockとGoogle Cloudは、それぞれ独自のライフサイクル日を設定しています。すべてのClaudeモデルIDは固定されたスナップショットであり、4.6世代以降で使用される日付なしのIDも含まれます。そのため、claude-opus-5-5は、あなたの足元で勝手に変わるポインターではありません。

なぜこのページは参照資料であって、二度目のローンチ記事ではないのか

これは率直に言っておく価値がある。2026年9月22日にリリースされたモデルに関するページは、一見するとローンチ報道のように読めるが、そうではないからだ。これは、今日私たちのカタログに掲載されているモデルの正規の参照ページである——読者がニュースフィードを読んだ後ではなく、モデル名そのものを検索した後にたどり着くページだ。その根拠は、私たちが自社で計測した継続的な検索需要であり、ローンチの新しさではない。そして、9月22日というリリース日は、この記事が報じている出来事としてではなく、モデルの日付を示す事実としてここに記載されている。

その区別は肝心要だ。このブログのアーカイブには、Claude Opus 5.5 に関するローンチ記事、リーク記事、比較ページ、そしていくつかの応用記事がすでにある。もう一つ告知を加えても、既存の成果の重複になるだけだ。これまで存在しなかったのは、それらすべての土台となるページ、つまり専門的な各ページが役立つ前に読者が必要とする導入だ。だから、価格、ベンチマーク、API サーフェスという主題をそれぞれ担う記事は、ここで再構成するのではなく、このページからリンクする。このページは自分の役割に徹する。

封筒

AnthropicのClaude Opus 5.5モデルページおよび同社のモデル概要から(いずれも2026年9月28日に閲覧):

• コンテキストウィンドウ — 1,000,000トークン。Anthropicはこのウィンドウの語数を公表しておらず、英語テキストについてのおおよその換算値のみを示している。「1トークンは約4文字、または0.75語」というもので、正確な数は言語やコンテンツの種類によって異なる。この数字のそばには、トークナイザーに関する注意点を一つ添えておくべきだろう。Claude 4.7以降のモデルには、Claude Opus 5.5も含まれるが、より新しいトークナイザーが採用されており、同じ入力に対して生成されるトークン数はおよそ30パーセント多くなる。そのため、以前のClaudeモデルを基準にサイズを調整したプロンプトでは、同じウィンドウを埋め尽くすことはない。

• 最大出力 — Messages API では同期的に 128,000 トークン。Message Batches API では 300,000 トークンに増加します。これはoutput-300k-2026-03-24ベータヘッダーによるものです。

• モダリティ — Anthropicのドキュメントでは、入力はテキストと画像、出力はテキストとして記載され、現行ラインナップ全体にわたる視覚・ツール使用・多言語対応能力が挙げられています。当社のカタログにおける本モデルの項目では、さらにファイル入力タイプも受け付けますが、ベンダーのページには記載されていません。

• 知識のカットオフ — 信頼できる知識のカットオフは2026年6月、トレーニングデータのカットオフも同様に2026年6月です。

• モデル ID — claude-opus-5-5は Claude API、Goo​gle Cloud、Microsoft Foundry、および AWS 上の Claude Platform で利用できます。anthropic.claude-opus-5-5は Amazon Bedrock で利用できます。

• ステータス — アクティブ(最新)。Anthropic運営プラットフォームにおける廃止は2027年9月22日より早くならないことを確約。

Anthropic's Claude Opus 5.5 model page, showing the Latest line and Released September 22, 2026, the model ID claude-opus-5-5, a 1M-token context window with 128K max output, input pricing $4 per MTok and output pricing $20 per MTok, the four-model How it compares table across Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5 and Claude Haiku 4.5, and a note that adaptive thinking is always on and cannot be turned off.

料金表、その全容

以下はすべて、2026年9月28日に閲覧したAnthropicの公開価格です。価格は100万トークンあたりです。

• 入力 — $4.00

• 出力 — $20.00。思考トークンは出力トークンとして課金され、Claude Opus 5.5 の適応型思考はオフにできないため、思考を抑制できる別項目にはなっていません。

• キャッシュ読み取り — $0.20。Anthropicの文書では、これは基本入力価格の0.05倍とされています。この倍率はこのモデル向けの例外措置です。料金表上の標準レートは0.1倍で、さらに低い0.025倍なのはClaude Fable 5.1とClaude Mythos 5.1だけです。

• 5分間のキャッシュ書き込み — $5.00、標準の1.25倍のベース入力乗数です。

• 1時間キャッシュ書き込み — $8.00、標準の2倍の乗数です。キャッシュ可能な最小プロンプト長は512トークンです。

• Batch API — 双方向とも50%オフ:入力$2.00、出力$10.00。

• 高速モード — 入力 $8.00、出力 $40.00 で、標準のちょうど2倍。Anthropic はこれをリサーチプレビューと説明しています。ファーストパーティの Claude API でのみ動作し、AWS 上の Claude Platform やパートナークラウドでは提供されておらず、Batch API でも利用できません。

• 米国限定の推論 — inference_geoを"us"に設定すると、入力、出力、キャッシュ書き込み、キャッシュ読み取りに1.1倍の乗数が適用されます。デフォルトであるグローバルルーティングでは標準価格が適用されます。

• 長文コンテキスト割増なし — Anthro​pic によると、Claude 4.6 以降のモデルでは 100万トークンのフルウィンドウが標準価格に含まれるため、90万トークンのリクエストも 9,000トークンのリクエストと同じトークン単価で課金されます。

• ツール使用システムプロンプト — Anthropic 自身のトークン数表によると、ツール選択が autoまたはnoneの場合、Claude Opus 5.5 のツール使用システムプロンプトは 286 トークンです。

読者が実際に抱くコストの疑問は、料金表ではなく請求額であり、それは別のページの主題だ。料金ページでは、完了したタスクあたりのコスト、長いエージェント実行を通じてキャッシュ行が何をするのか、そしてベンダーの「実行コストが約40%少ない」という表現がどこまで料金表から検証できるかを掘り下げている。

あらゆる公開スコアの背後にある努力、思考、そして設定

これは、ほとんどのローンチ時の報道が飛ばしてしまう仕様の部分であり、ベンチマークの数値が何を意味するかを変える部分でもある。Claude Opus 5.5 の適応的思考は常に有効で、無効にできない——Anthro​pic によると、thinking: {"type": "disabled"} を設定したリクエストは、高いエフォートレベルだけでなく、すべてのエフォートレベルで 400 エラーを返す。拡張思考、すなわち手動の budget_tokens モードは、以前の仕組みである。Anthro​pic は、Claude Opus 4.6 と Claude Sonnet 4.6 では非推奨であり、それ以降のモデルでは受け付けられないと記している。したがって Claude Opus 5.5 では、制御は output_config.effort のみであり、それ以外にない。

5つのレベルがあります:low、medium、high、xhigh、そしてmaxです。Claude Opus 5.5 は5つすべてをサポートしています。そのデフォルトはmedium — このパラメータをサポートしつつhighをデフォルトとしない唯一のモデルです — つまり、Claude Opus 5 から移行したリクエストで明示的なeffort値が指定されていない場合、以前より1レベル低く実行されることになります。Anthropic の指針では、設定をそのまま引き継ぐのではなく、独自の評価で新たに effort スイープを実行することが推奨されています。effort をモデルのデフォルトに設定すると、パラメータを省略した場合とまったく同じ動作になります。effort は思考を含む応答内のすべてのトークンを制御しますが、Anthropic はそれが「厳密なトークン予算ではなく、行動上のシグナル」であると明言しています。会話途中での変更は、メッセージ単位の effort ベータヘッダー mid-conversation-output-config-2026-07-01 を通じてサポートされており、これによりプロンプトキャッシュが維持されます — リクエスト間でのトップレベルの変更では維持されません。

エフォートがリファレンスページに載っているのは、Anthropic が公開している結果がすべて同じ設定で実行されているわけではないからです。発表には常設の注記 —「特に断りのない限り、Claude Opus 5.5 のすべての結果は最大エフォートでの適応的思考を使用する」— があり、その後、ベンチマークごとに別段の注記が付いています。そのように読むと、このシートは次のようになります:

• Terminal-Bench 4.0 — 66.4%、xhigh effortでの報告値。これはオーバーライドの一つであり、しかも双方に関わるものだ。Anthropicは同じチャート上でGPT-6 Astraをhigh effortだと報告し、両方の数値が「各モデルの最高スコアを表す」と述べている。一方がxhigh、他方がhighという比較はエフォートを揃えた比較ではない——そして、そう教えてくれるのはAnthropic自身の脚注である。

• FrontierCode v1.1(Main)— デフォルト設定(medium)で54.6%。Anthropicは、タスクあたり約5分の1のコストで、GPT-6 Astraの最高スコア53.3%を上回ると指摘している。

• CursorBench 4.0 — 52.5%、デフォルトのエフォート(medium)時。最大エフォート時のClaude Fable 5.1が51.8%、Claude Opus 5が46.6%であるのに対し。ここでも非対称性に注目:Claude Opus 5.5の数値は、他の2モデルのベストより1段階低い設定で出されている。

• GDPval-AA v2.1 — 最大エフォートで1846 Elo。同じチャートで、Claude Fable 5.1は1735、Claude Opus 5は1708を記録しています。

• その他すべての公開分は——常設の注記により——最大エフォートで。これにはOSWorld 2.0とChartographyが含まれる。これらのラベル(「partial」および「with tools」)は、どのエフォートレベルで生成されたかではなく、そのタスクがどのように採点されたかを表している。どちらのチャートにも上書き指定はないため、どちらもこの全体的な文の対象となり、そこから外れることはない。

さらなる2つの注意点は、脚注ではなく、それらの数値のすぐそばに置かれるべきです。Anthropicは標準誤差を公表しており——Terminal-Bench 4.0でのClaude Opus 5.5は±2.6ポイント、他のClaudeモデルは±1.6~2ポイント、Terminal-Bench-Science 0.1ではモデルごとに±3.5~5ポイント——また、2つの結果を公開リーダーボードと照合し、Claude Opus 5の公表値51.8%を52.3%で、同モデルの公表値30.0%を29.0%で再現しています。これとは別に、同社のAutomationBenchの数値はフォールバックモデルなしで作成されたもので、これはフォールバックモデルがあるデプロイ環境とは異なるハーネス条件です。複数のモデルを横断して読む人には、それら3つの事実を把握しておく必要があります。Claude Fable 5.1の独立した位置づけも同様に、Claude Opus 5.5とは異なるインデックス改訂版で測定されているため、両者は直接比較できず、その点が公開の場で検討されるのはベンチマークページです。

A six-row scoreboard titled Claude Opus 5.5, the effort behind each score. Rows read: Terminal-Bench 4.0, 66.4 percent at xhigh effort; FrontierCode v1.1 Main, 54.6 percent at default effort, medium; CursorBench 4.0, 52.5 percent at default effort, medium; GDPval-AA v2.1, 1846 Elo at max effort; all other published results at max effort; default effort on the Claude API, medium. Footer reads: Anthropic's published results, read 2026-09-28, vendor-reported.

独立した読み

Anthropicの数値はベンダーによる報告であり、上の表もそのように引用されています。Claude Opus 5.5については独立した測定値が存在し、それは一つの情報源、Artificial Analysisによるものです。そのライブモデルページを私たちは2026年9月28日に閲覧しました。

Artificial Analysis は Claude Opus 5.5 をArtificial Analysis Intelligence Index(リビジョン v4.3.2)において 58 と評価しており、そのリビジョンで 211 モデル中第 1 位に位置づけています。測定が行われた構成はページに明記されています —「Claude Opus 5.5(Adaptive Reasoning、Max Effort、Default Fallback)」— そしてこのラベルこそが重要な点です。この独立系の数値は max-effort の数値であり、デフォルト構成へのフォールバックを伴うため、medium で作成されたベンダー資料のいかなる数値とも直接比較できるものではありません。インデックスに加えて、同じページには出力速度 95.5 トークン/秒、モデルごとに Intelligence Index を実行するコスト $5.98、冗長性 2 億 6,000 万出力トークン、95% のキャッシュ割引、100 万トークンのコンテキストウィンドウ、そしてキャッシュヒット/入力/出力が 7:2:1 の混合における 100 万トークンあたり $2.94 のブレンド価格が報告されています。Artificial Analysis は、これと並ぶ Fable 5.1 のバリアントも、2 つ目の Claude Opus 5.5 構成も公開していないため、この 2 つのモデルはそこで、揃った effort と揃ったハーネスのもとで直接比較のベンチマークを受けたことはありません。これは結果ではなく証拠の欠落であり、だからこそこのページは Opus 5.5 対 Fable 5.1 の独自の比較を掲載していないのです。

一つの不一致は記録に値します。それはやがて解消されるものであり、読者が両方のバージョンを見る可能性があるからです。私たち自身のモデルAPIは、キャッシュされたArtificial Analysisの数値が2026年9月22日付となっていますが、57.6という値を同じ指数について示しています。Artificial Analysisのライブページは58を現在のリビジョンで表示しています。ライブページが記録上の数値です。57.6はリリース当日に取得されたスナップショットで、その時点で有効だったリビジョンに基づくものです。このページが単一の数値を示す場合、それは58です。

当社独自のテレメトリは第三の、そして異なる種類の測定であり、ベンチマークではありません。2026年9月28日までの7日間、anthropic/claude-opus-5.5に当社のプレイグラウンド経由でルーティングされたリクエストは、初回トークンまでの時間のp50が4.69秒、p95が10.00秒、出力トークン毎秒97.8、エラー率5.59%を示し、その期間に6,270万トークンがルーティングされました。これらは当社のサービング動作を表すものであってモデルの能力を表すものではなく、ベンチマーク結果として受け取られないよう、ここに引用しています。

可用性、およびバージョンテスト

Anthropicは、Claude Opus 5.5が「Amazon Web Services、Google Cloud、Microsoft Azureを含むすべてのプラットフォームで利用可能になった」と述べており、モデルページにはClaude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、およびAWS上のClaude Platformが記載されています。Claude Opus 5.5はOrcaRouterでもanthropic/claude-opus-5.5として公開されており、Anthropicの定価のままで上乗せは一切ありません — 入力$4.00、出力$20.00、キャッシュ読み取り$0.20、キャッシュ書き込み$5.00。この4つの数値は2026年9月28日に当社自身のモデルエンドポイントから読み取ったもので、ベンダーの資料と行単位で一致しています。当社の同モデルのページには同じ100万トークンのコンテキストウィンドウと最大128Kの出力が記載され、入力タイプとしてテキスト、画像、ファイルを受け付け、出力はテキストのみであること、モデルは2026-09-22にリリース済み、注目、非推奨ではないと表示されています。

同じカタログ内のその他のすべては同じキーから到達できます。単一のAPIで200以上のモデル、 プロバイダーの定価を0%のマークアップでそのまま透過し、 自動フェイルオーバーはエンドポイントが劣化したときに発動し、特定のモデルを固定したい場合や複数のモデルを1つの回答にブレンドしたい場合のためのルーティングDSLもあります。バージョンテストにとっては、これが役に立つ性質です。マークアップがゼロなので、比較する価格はAnthro​picが公表している価格と同じであり、OpenAI互換のchat-completionsエンドポイントとAnthro​pic自身のmessagesエンドポイントの両方が提供されるため、既存のClaudeクライアントは2つの値——モデル文字列と、推論の深さを変えたい場合はeffortレベル——を変更するだけで新しいIDに向けられます。同じevalをmediumで、そしてxhighでも実行し、リクエストあたりのコストではなく完了したタスクあたりのコストを比較し、ご自身の数値で、目の前の作業にとってフラッグシップとその上のモデルのどちらが適切なデフォルトなのかを判断してください。APIガイドでは、文字列を差し替えても大きなエラーを出してくれない部分について説明しています。すでにClaude Opus 5に対して実行されているコードに適用される破壊的変更が4つあり、さらに1つの変更はエラーを一切発生させないままレスポンスの形を変えます。

The OrcaRouter model page for anthropic/claude-opus-5.5, showing a 1M-token context window, 128K maximum output, text plus image plus file input and text output, a release date of 2026-09-22, capability chips reading Vision, Tools, JSON and Reasoning, and a stat strip listing $4.00 input and $20.00 output per million tokens with p50 time to first token 4.68 seconds.

Claude Opus 5.5 は依然として Claude ラインナップの最上位にあり、その記述の日付は2026年10月7日です。このファミリーの中でそれより上位のものは何も公開されていません。Anthro​pic のモデル概要には、現行モデルがちょうど4つ — Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5、Claude Haiku 4.5 — だけが掲載されており、5つ目の項目はありません。Claude Opus 5.5 のドキュメントページでは、その名前の横に依然として「Latest」という語が添えられており、ベンダーのサイトマップにも、非推奨テーブルにも、このカタログにも、Artificial Analysis にも後継の識別子はありません。逆方向からも同じことが言えます。同日に読んだ Artificial Analysis のモデルランキングでも、Claude Opus 5.5 が依然として1位です。次の Claude フラッグシップを求めてここにたどり着いた読者が探しているのは、まだ名前のないものです。そして実用的な答えは、このセクションがすでに示しているとおりです。Claude Opus 5.5 が、ベンダーの100万トークンあたり入力$4、出力$20で今日呼び出せるものであり、Anthro​pic が推奨するワークロードでは、Claude Fable 5.1 が依然としてその一段上の選択肢です。

ここにもう一つ付け加えておくべきことがある。なぜなら、まだ存在しないClaudeモデルを検索する読者は、名前より先にバージョン番号に出会うからだ。5.5という接尾辞は最上位を意味するのではなく、世代を意味する。Claude Sonnet 5.5は実際に出荷された本物の5.5であり、2026年9月28日にリリースされ、ベンダー価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドル、そしてArtificial Analysisによる測定値は56.00——Claude Opus 5.5を首位に置くのと同じIntelligence Indexリビジョンv4.3.2における値だ。つまり、より下位の階層に付いたより大きく聞こえる数字も、やはりより下位の階層にすぎない。対照的に、「Claude Fable 5.5」という文字列はバージョン番号ではなく噂のラベルである。その背後にある主張は2026年10月2日の2件のソーシャル投稿でなされ、連鎖はそこで途切れている。今日時点で、ベンダーのドキュメントにも、このカタログにも、Artificial Analysisにも、そのモデルID、料金表、コンテキストウィンドウ、リリース日、ベンチマークは存在しない。Fableラインでリリース済みの最上位はClaude Fable 5.1であり、「Claude Fable 5.5 Beat GPT-6.1 Astra Before It Exists — and That Is the Interesting Part」というタイトルでこのブログに掲載された記事が、そのラベルの出典の連鎖を検証している。このページに必要な区別はもっと狭い——世代を示す接尾辞と、主張を示す名前との対比である。

短いバージョン

Claude Opus 5.5は、Anthro​picの現行ラインナップにおいてデフォルトで選ぶべきモデルであり、ある用途にそれが適しているかどうかを決める3つの事実は次のとおりだ。そのデフォルトのエフォートは、mediumであり、周囲のモデルはhighをデフォルトとしている。そのため、設定を移行すると知らぬ間に挙動が変わってしまう。公表されているベンチマーク数値はそれぞれ異なるエフォートレベルで生成されており、最もよく引用される2つ — Terminal-Bench 4.0とCursorBench 4.0 — は、注記を読まない限り、その隣に並ぶ数値と比較できない。また、Artificial Analysisのv4.3.2インデックスで211モデル中1位となる58という独立系スコアは、最大エフォートでの測定値であり、これは実際に動かすものというよりモデルの上限値を示している。

それら3つの下には、実用的な全体像が明快に示されています。長期コンテキスト割増なしの100万トークンウィンドウ、128Kの同期出力、置き換えたモデルを下回る料金表、オフにできない適応型思考、そして2年後の廃止コミットメントです。具体的な事柄——ワークロードのコスト計算、モデル横断列と各モデルの独立した位置づけを備えた完全なベンチマークシート、すでにClaude Opus 5で稼働しているコードの移行詳細——はすべて、それぞれ料金、ベンチマーク、APIの各ページにあり、ここから3クリック先です。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新