
Claude Opus 5.5のベンチマーク:全スコア、それが導かれたエフォート設定、そして誰が測定したのか
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Anthropic が Claude Opus 5.5の Terminal-Bench 4.0 における目玉数値として挙げているのは66.4%で、同じ表の 52.3%(Claude Opus 5)と並べて記載されています。そしてこの 66.4% は xhigh effort で出されたものであり、モデルのデフォルトである mediumではありません。このモデルは 2026 年 9 月 22 日に出荷され、このページが書かれる 2 日前のことです。つまり GA モデルであり、GA モデルの価格と GA モデルのベンチマーク表を備えています。同じベンチマークについての独立した数値は Artificial Analysisによるもので59.6%で、その構成には Anthropic のサーバーサイド保護ルーティングが組み込まれています。この 2 つの数値の間には、ハーネスの違い、effort の違い、ルーティングの違いがあり、それぞれがこの差のどれだけを説明するのかは、私たちを含め、まだ誰にも言えません。このページにできるのは、Claude Opus 5.5 について公表されているあらゆる数値を 1 か所にまとめ、誰がそれを出したのか、どの設定で出されたのかを明示し、GPT-6 Astra と Claude Fable 5.1 が上回る行も含めることです。
エフォート設定から始めましょう。モデルよりも数値を大きく動かすからです。
Claude Opus 5.5 はデフォルトでmedium effort を Claude API で使います。Claude Opus 5 はデフォルトでhigh でした。同じ名前のレベルでも、2 つのモデル間で同じ思考予算というわけではないため、「両方とも high で実行した」としても、ラベルが一致していても制御された比較にはなりません。Opus 5.5 ではアダプティブ思考が常に有効で、オフにすることはできません。effort パラメータが変えるのは深さ、レイテンシ、コストだけで、それ以外は何も変えません。
AnthropicのTerminal-Bench 4.0の数値はxhighで実行された。その一つの事実が、このページで最も重要な注意点である。なぜなら、それが筆頭に掲げるベンチマークは、前のモデルに対する報告済みの差が最も大きいものだからであり、同じ表が、この設定をそのままにした場合に何が起きるかを示しているからだ:
• FrontierCode v1.1 Main — xhighで54.4%、デフォルトのmediumで54.6%。ベンダー報告による数値。mediumの実行は高いxhighの実行より。このワークロードでは、effortダイヤルは測定できるものを何ももたらさなかった。二つの数値は同じ数値である。
• CursorBench 4.0 — xhighで57.8%、mediumで52.5%。ベンダー報告値。同じモデル、同じハーネス、同じ週で、5.3ポイント差。これは現時点で最大のエフォート差だ。
1つのベンダー表に並んだその2行が、議論のすべてだ。一方のワークロードは努力量に鈍感で、もう一方は努力量に強く敏感であり、モデルカードはあなたのワークロードがどちらの種類なのかを事前に教えてはくれない。データが支持する結論は狭く、狭いまま述べる価値がある。適切な努力量は今やワークロードごとの測定値であり、継承するデフォルトではない。 これは「Opus 5.5はベンチマークが示唆するより速い」とか「Anthropicはデフォルトを意図的に抑えていた」を支持するものではない——そのためには5つの設定すべてにわたるワークロード別のスイープが必要だが、誰もそれを公開していない。ただ、Opus 5から移行して既に使っていた努力量設定をそのままにするなら、あなたはモデルだけでなく実験そのものを変えたのだ、ということは意味している。
さらにもう一つの非対称性があり、今度は逆方向に効いてくる。AnthropicのTerminal-Benchの行にある競合の欄はGPT-6 Astraの57.9%——high effortで実行されたもので、Anthropic自身のチャートの注記によれば、一方Opus 5.5の66.4%はxhighで実行されていた。自社モデルを一方の設定で、競合を他方の設定で走らせるベンダーの表は、二つの数字が横に並んでどう見えようと、一対一の比較ではない。
各行にソースと設定があるベンダー表
このセクションの内容はすべてベンダー報告です。Anthropicの発表資料、Anthropicのハーネス、本番用セーフガードは有効、行に別段の記載がない限り適応的思考は最大努力設定。AnthropicがAnthropicを測定したものとして読んでください。
• Terminal-Bench 4.0 — 66.4%、xhigh effort時点。ベンダー報告値で、標準誤差は約±2.6ポイント。同じ行には、Claude Opus 5 が52.3%、Claude Fable 5.1 が55.8%、GPT-6 Astra が57.9%(high effort時)、GPT-5.6 Sol が37.3%。Terminal-Bench 4.0 は、実際のターミナル作業にとって不完全な代理指標にすぎないとベンダー自身が認めているベンチマークであり、そしてこれがこのモデルの看板指標である。
• FrontierCode v1.1 Main — xhighで54.4%、デフォルトmediumで54.6%。 ベンダー報告値。Opus 5は48.0%、Fable 5.1は50.3%、GPT-6 Astraは53.3%、GPT-5.6 Solは47.5%。AnthropicのシステムカードにはExtendedバリアントの63.6%と、mediumでの最高Extended値65.3%も記載されている。
• CursorBench 4.0 — xhighで57.8%、mediumで52.5%。ベンダー報告値。Opus 5が46.6%、Fable 5.1が51.8%、GPT-5.6 Solが41.7%。なお、Fable 5.1とOpus 5のCursorBenchの行は最大effortでの値であるため、mediumでのOpus 5.5は同系統モデルの最大effort時の値と比較されている点に注意。
• GDPval-AA v2.1 — 1,846 Elo。これはベンダーの表の中で、ベンダー自身が実施していない唯一の行だ。GDPval-AAはArtificial Analysisによる評価であり、Artificial Analysis自身によるOpus 5.5に関する記述でも同じ1,846が示されており、Fable 5.1は1,735、Opus 5は1,708とされている。ベンダーの表では、Fable 5.1が1,735、Opus 5が1,708、GPT-5.6 Solが1,588、GPT-6 Astraが1,542だ。ここで2つの組織が同じ数値で一致している唯一の行であり、それは同じ測定だからだ。
• AutomationBench(Zapier) — 40.0%。ベンダー報告値であり、フォールバックモデルなしで実行されたため、すべてのセーフガード介入が失敗として採点された。GPT-6 Astra 41.4%、Fable 5.1 31.4%、GPT-5.6 Sol 28.8%、Opus 5 26.9%。
• Humanity's Last Exam、ツール使用時 — 67.7%。ベンダー報告値。Fable 5.1 は 65.6%、Opus 5 は 63.6%、GPT-6 Astra は 57.2%。Anthropic のシステムカードでは別途ツールなしで 64.4%と報告されており、モデルにツールへのアクセスを付与していない情報源と比較する場合はこの数値を参照すべきです。
• Terminal-Bench-Science 0.1 — 58.7%。ベンダー報告値であり、標準誤差はおよそ ±3.5~±5 ポイントのため、これは一点ではなく幅をもった値である。GPT-6 Astra 64.6%、Fable 5.1 52.6%、Opus 5 29.0%、GPT-5.6 Sol 22.4%。
• OSWorld 2.0 — 81.8%(部分達成)。ベンダーによる報告であり、この文の「partial」は実際に重要な役割を果たしている。Anthropicのシステムカードでは、同じモデルによる同じ評価での厳密な完遂率は48.7%とされている。どちらも公開されているが、引用されるのは partial のほうの数値だ。Fable 5.1 80.7%、Opus 5 74.0%。
• ツール併用時のChartography — 89.0%。ベンダー報告値。Fable 5.1 88.4%、Opus 5 83.4%。

独立した数値、そして「Default Fallback」が実際に意味するもの
Artificial Analysisは、総合指数に関してClaude Opus 5.5の公表済みかつ最新の評価を持つ唯一の第三者であり、その数値はAnthropicのものと並べて参照すべきものだ。2026年9月24日時点の記載では:
• インテリジェンス指数 — 最大エフォートで58、その構成は「Adaptive Reasoning, Max Effort, Default Fallback」とラベル付けされている。 独立系で、Artificial Analysisによる計測。同社自身の記事は58を「我々が計測した中で数ポイント差で最高のスコア」と評している。同じ指数は、他のあらゆるエフォート設定におけるOpus 5.5も公表しており、有用なのはそのばらつきのほうだ:xhighで56、highで54、mediumで51、lowで42。これは単一モデルのエフォートダイヤル全体で16ポイントの振れ幅であり、あのボード上のほとんどのモデル間の差よりも大きい。
• Terminal-Bench 4.0 — 59.6%。独立系。Artificial Analysis はこれを「首位の GPT-6 Astra(xhigh)と同等」と報告しており、Claude Opus 5 を約11ポイント上回っています。
• Humanity's Last Exam — 61.4%。独立系であり、同じボードにおけるこれまでの最高記録は59.1%で、それはClaude Fable 5.1が保持していたものでした。
• SciCode — 66.9%。独立系で、Claude Fable 5.1の63.1%に対して。
次に、引用ではなく説明を要する条項について。「Default Fallback」はベンチマークの産物でも、Artificial Analysis の設定でもない。それはAnthropic のサーバー側セーフガード・ルーティングが有効にされたままの状態だ。Claude Opus 5.5 には、かつては Fable 5.1 用に取って置かれていたセーフガード階層が搭載されている。つまり、大半のサイバーセキュリティ関連リクエストは透過的に Claude Opus 4.8 へ再ルーティングされ、生物学関連の作業はアカウントが検証済みでない限り Claude Opus 5 へフォールバックする。Artificial Analysis がデフォルト・フォールバックを有効にした状態でこのインデックスを実行するとき、測定しているのは実際にデプロイされたシステム、すなわち未検証の API キーが実際に到達する対象であって、Opus 5.5 の重みのクリーンなチェックポイントではない。買い手にとってはこれがより正直な測定であり、ベンチマークとしてはよりクリーンでない測定である。Anthropic は自社の表についても同じことを述べている。Terminal-Bench 4.0 の実行における介入により、サイバー系タスクは Opus 4.8 が、生物学系タスクは Opus 5 が完了した。そして同社は、それらの介入によって報告スコアがおそらく引き下げられた可能性が高いと述べている。したがって、セーフガード・ルーティングは両方向において現実の運用上の事実であり、このページのどの数値も、基盤となるモデルをそれから切り離してはいない。
2つの表が一致しない箇所と、その理由
2つのTerminal-Bench 4.0の数値を並べてみると、66.4%対59.6%——同じベンチマークで、同じモデルにおいて6.8ポイントの差になる。その理由は知られており、どれも単独で無視できないほど大きなものだ:
• ハーネスが異なる。Anthropicは自社のエージェントスキャフォールドを実行し、Artificial Analysisは独自の参照エージェントハーネスを実行した。ターミナルベンチマークのスコアはスキャフォールドとモデルの組み合わせに属する特性であり、モデル単体の特性ではない。しかも、どちらの組織もスキャフォールドを入れ替える実験を公表していない。
• エフォート設定が異なります。Anthropicの66.4%はxhighでの値です。Artificial Analysisの59.6%に付随するエフォート設定は、その数値を示す文には明記されておらず、同社が報告しているベンチマーク値は概して最大エフォートのものです。
• どちらのケースもセーフガードは有効だが、その数え方は異なっていた。Anthropicはフォールバックありで実行し、介入をスコア低減要因として扱いつつも、依然としてスコアを付けた。AutomationBenchではフォールバックなしで実行し、介入を完全な失敗としてカウントした。Artificial Analysisは一貫してフォールバックを有効にして実行している。
• 数字は、同じベンダー自身の表の中ですら動く。AnthropicはTerminal-Bench 4.0でClaude Opus 5を52.3%と記載し、同じモデルについて公開ボードの51.8%は「誤差の範囲内」だと注記している。
そして、このページでハーネスにどれほどの価値があるかを示す最も強力な証拠。2026年9月24日に取得された公開のTerminal-Bench 4.0リーダーボードには、Claude Opus 5.5の行が一切存在しない。その最上位は最大エフォートのGPT-6 Astra、Codexエージェントで、58.2% ±2.82位は最大エフォートでClaude Code経由のClaude Fable 5.1、57.9% ±3.83位はxhighでClaude Code経由のClaude Opus 5、53.9% ±3.2。つまり66.4%は、独立した59.6%とは単に異なる数字というだけではない——公開ボードには載っておらず、ボード側のClaude Opus 5の値は53.9%であって、ローンチ時の表が印刷する52.3%ではない。Terminal-BenchがOpus 5.5の提出を受け入れて公開するまでは、66.4%は誰にも再現されていないベンダーのハーネス結果であり、59.6%こそが外部の第三者が実際に保証する数字である。同じボード上で、Artificial AnalysisのTerminal-Bench 4.0リーダーとAnthropicのOpus 5.5が同じ59.6%に到達している点にも注目されたい——これは一つのハーネスにおける同点であり、もう一方については何も語っていない。

Opus 5.5が負ける行
損失を省いたまとめはまとめではなく、Anthropic自身の表にはその両方が含まれている。
• Terminal-Bench-Science 0.1 — GPT-6 Astra の 64.6% に対して 58.7%。ベンダー報告の数値であり、Anthropic の表に記載されたもので、科学的推論に最も近い行において、名指しされた競合他社に 5.9 ポイント差で敗れている。ベンダー自身の標準誤差の注記(±3.5~±5)は、この差が余裕をもってノイズの内側にあるというよりも、ノイズの端に近いことを意味する——だがそれはベンダー自身のページ上での敗北であり、その誤差幅が勝利に変わるわけではない。Claude Opus 5 は同じ行で 29.0% にとどまるため、競合他社がリードしている領域であっても、世代間の向上は実在する。
• AutomationBench — GPT-6 Astraの41.4%に対して40.0%。ベンダー報告による1.4ポイント差の敗北であり、しかもこの実行にはフォールバックモデルがなかったため、セーフガード介入は失敗として採点された。つまり、この特定の比較は、ルーティングペナルティを含めたOpus 5.5を、そのルーティングペナルティが何であれ説明されていない競合相手と比較して測定している。これは、このページでどちらの方向に解釈するにしても最も解釈が難しい行だ。
見出しが示すほどリードが小さい箇所がさらに2つあり、どちらもベンダー報告によるものです。ツール使用時のHumanity's Last Examでは、Claude Fable 5.1との差は2.1ポイント(67.7% 対 65.6%)、ツール使用時のChartographyでは0.6ポイント(89.0% 対 88.4%)、OSWorld 2.0 partialでは1.1ポイント(81.8% 対 80.7%)です。これらは、「Opus 5.5が最高のエージェント型モデルだ」という主張が、測定された差ではなく順位についてのものになる行であり、0.6ポイントのグラフ読解の差が調達を決めるべきではありません。
Claude Fable 5.1の独自の位置付け、別のインデックス改訂版における
Opus 5.5をその兄弟分と並べて論じるには専用のセクションが必要で、しかも警告を添える必要がある。なぜなら、その比較は見た目よりも難しいからだ。
Artificial Analysisが2026年9月1日にClaude Fable 5.1の解説記事を公開したとき、それは最大努力時66を、Intelligence Indexで記録し、これまでに測定した中で最高スコアだと評した——Claude Opus 5の63、GPT-5.6 Solの61を上回る。2026年9月24日に掲載されているインデックスでは、同じモデルはフォールバックありの最大努力時53に現れ、Opus 5.5は58で相当する構成に現れる。Opus 5.5に関する9月22日の記事では、58を「我々が測定した中で最高スコアであり、数ポイント差をつけている」としている。
その2つの記述が同一の尺度上でともに真であることはあり得ず、その解決は、両者が同一の尺度上にないということにある。このインデックスはArtificial Analysisが改訂し続ける生きた対象であり、同社が公表した2本の記事は、5週間の隔たりがありながら、同じ兄弟モデルのペアを首位の座を挟んで逆側に置いている。これはインデックスの改訂についての記述であって、どちらかのモデルが劣化したことを述べたものではなく、つまり66と58を並べて表示してはならないということだ。同じ日に、同じリストを、同じラベル付けされた構成で読むなら、現在の順序ではOpus 5.5がFable 5.1を5ポイント上回っている——そしてそれさえも、同一インデックス内、同一インデックス提供元による比較であり、監査済みの直接対決ではない。安全に言えることは、それより狭い。両方を測定する唯一の独立系複合指標の現在の改訂版において、Opus 5.5は2つのAnthropicモデルのうちより強い方であり、Fable 5.1のよりよく知られた66は、そのインデックスの以前の改訂版に属するものである。
設定については、混同しやすいがゆえに、もう一文を割く価値がある。Fable 5.1の66とOpus 5.5の58はどちらも最大努力の行だが、Fable 5.1の5つの努力設定は、出力トークン使用量で11倍の幅があり、低で13.1Mから最大で143.7Mに達し、インデックススコアは58から66に及ぶ。これほど内部にばらつきがあるモデルにとって、単一のインデックス点は、実際に実行することになる行の代わりとしては貧弱だ。
トークンコストはそれ自体がベンチマークの軸である。
上の数字はすべてスコアです。それらのどれも法案ではなく、このモデルでは興味深い動きがあるのは法案のほうです。
Artificial Analysisが最大エフォート設定でClaude Opus 5.5を測定したところ、Intelligence Indexのタスク1件あたり約119,000出力トークンを使用しています——これは同社のインデックス内で最高です。比較として、同じボードの同じ設定では、Claude Opus 5が約73,000、Claude Fable 5.1が約78,000、そしてGPT-6 Astraが約27,000です。思考トークンは出力トークンとして課金され、Opus 5.5では適応型思考をオフにできません。そのため、モデルが熟考に費やすトークンは価格の脚注ではなく、その大半を占めています。
計算してみよう。表示価格だけでは誤解を招くからだ。Opus 5.5 は入力 $4.00 / 出力 $20.00 で、Opus 5 の $5.00 / $25.00 から 20% の値下げとなっている。Artificial Analysis の測定では、Opus 5.5 は最大エフォートで約インデックスタスク1件あたり $5.98 で、Opus 5 の $5.86 に対して同じ設定では、わずかに多いのであって、少ないのではない。というのも、およそ 1.6 倍の出力トークンが 20% の料金引き下げ分をすべて食いつぶし、それ以上に食い込むからだ。インデックス全体では、Opus 5.5 は2億6,000万出力トークンを生成しており、ボード中央値の 8,800 万に対して、評価者はこれを「非常に冗長」とラベル付けしている。
したがって、コストの話は完全にeffort設定次第であり、それを使う場合にのみ成り立ちます。最大effortでは、Opus 5.5は置き換えるモデルよりも完了タスクあたりのコストが高いモデルです。mediumでは——実際の製品デフォルトであり、Anthropicの「一般的なワークロードで実行コストが約40%低い」という主張が対象とする範囲でもある——節約は実際にありますが、それはベンダーが選んだワークロード全体の平均についての記述であり、監査済みのタスク単位の結果ではありません。実用的な読み方:20%の値下げは料金表に対する割引であり、effortダイヤル上のオプションであって、自動的な節約ではありません。移行計画が「モデルIDを差し替えて設定をそのままにする」というものであるなら、あなたは高価なバージョンを買っていることになります。
何が全く確立されていないのですか
これは、ページの残りの部分が支えるために存在するセクションです。
• Claude Opus 5.5 を名指しのライバルと比較した、エフォートとハーネスを揃えた独立の直接対決は、これまで公表されていない。このページにあるベンダー間の比較——Opus 5.5 対 GPT-6 Astra、対 GPT-5.6 Sol、対 Claude Fable 5.1——はすべて、異なる2社が、異なる2つのハーネス上で、異なる2つのエフォート設定で作成した2つの表を比べたものであり、そのうち一方は通常、ベンダー自身のモデルを有利な設定で測ったものである。2つのベンダーにわたってスキャフォールドとエフォートを一定に保ち、双方を報告した実験は、公開記録のどこにも存在しない。
• 問題ごとのトークン内訳は公開されていない。 出力トークンの集計値は独立に測定されているが、そのうちどれだけが思考でどれだけが回答テキストなのかは、我々が調べた限り誰も公開していない。このモデルについて正確な思考トークン数を示しているページがあれば、それは誰も測定していない数字を示していることになる。
• システムカードの大部分は第三者によるベンチマーク評価を受けていない。 SWE-bench Pro 89.9%、Multilingual 93.9%、DeepSWE v1.1 74.2%、ProgramBench 91.2%、OfficeQA 78.9%、HealthBench Professional 65.6%(長さ調整済み)、GMMLU 94.3%、ArXivMath 96.9%(ツール使用時)— すべてベンダー報告値であり、執筆時点で独立に再現されたものはない。
• Terminal-Bench 4.0の看板となる数値は公開ボードには載っていない。 前述のとおりであり、これもこのリストに含めるべきものだ。このモデルについて最も引用される単一の数値は、ベンダー外部の誰も実行したことがないものである。
• Anthropicは、Claude Opus 5.5が「しばしば自分が評価されているのではないかと疑う」と報告している——同社自身の言葉であり、自社の安全性評価における限界として挙げられたものだ。これを珍しい話ではなく、測定上の問題として真剣に受け止めるべきである。もしモデルがテストされていると信じたときに異なる挙動を示すのであれば、このページにあるあらゆるベンチマークの数値は、ベンダー製であれ独立系であれ、観察下にあるモデルの測定値であり、それが実際に展開されたときの挙動とどれほど異なるかは不明で、定量化もされていない。これは良い行にも悪い行にも等しく当てはまる。どんなに条件を揃えた方法論をもっても埋められない、唯一の注意点である。
• Sonnet 5.5 と Haiku 5.5 はご利用いただけません。Anthropic は「今後数週間以内」に提供すると発表しています。まだ出荷されておらず、公開されたベンチマークも存在せず、このページの内容がそのまま当てはまるものでもありません。
価格、エンベロープ、そしてコードを書き換えることになる仕様の部分
2026年9月24日に公開されたAnthropicの料金表より: 入力トークン100万あたり$4.00、出力100万あたり$20.00、キャッシュ読み取り100万あたり$0.20、5分キャッシュ書き込み100万あたり$5.00、1時間キャッシュ書き込み100万あたり$8.00、そしてBatch APIでは双方向とも50%オフ。 キャッシュ読み取り料金は目立たない項目だ — 基本入力の5%であり、ほとんどのClaudeモデルは10%、Fable 5.1は2.5%となっている。Fastモードは$8.00 / $40.00で別料金となり、Anthropicはこれを一般向けティアではなくリサーチプレビューと説明している。
ここは、レートカードがもはや豆知識ではなく、ルーターがあなたのために計算してくれる算術になるセクションです。Claude Opus 5.5はanthropic/claude-opus-5.5としてOrcaRouter上で同じ$4.00 / $20.00で提供され、定価は0%のマークアップでそのまま反映されます —— つまりAnthropicが料金を動かした瞬間、それが同日に、モデル化すべき価格改定の遅延もなく、ここでの料金になるということです。実際の請求額を決めるのは、カタログが価格の隣に併記している要素です。すなわち、基準入力の5%にあたる$0.20のキャッシュ読み取り(Fable 5.1の2.5%に対して)、100万トークンのコンテキストウィンドウ、そして128Kの出力上限です。このモデルのコストが実際に動くのはeffortパラメータだからです —— 16ポイントのインデックス変動と、最大設定時にタスクあたり約119,000出力トークン(Opus 5の約73,000に対して)—— コストを節約する移行とは、アカウント単位ではなくワークロード単位でeffortを調整できるようにし、どの設定をあなたのトラフィックが求めているかを測定している間はOpus 5.5のルートを自動フェイルオーバーの背後に置くものです。
• Envelope — コンテキスト100万トークン、最大出力128K、Batch APIでの300K出力(output-300k-2026-03-24ベータヘッダー使用時)、ナレッジカットオフは2026年6月、提供終了は2027年9月22日以降。出力はClaude Opus 5より30%以上高速です。
• Opus 5 に対する破壊的変更 — thinking を無効化できなくなりました;ツール使用の強制(特定のツールを指定する tool_choice)はエラーを返します;thinking ブロックは、それを生成したモデルと会話に紐付けられます;旧式の computer_20251124 computer-use ツールは Claude API や Google Cloud では受け付けられません。最初の3つは Fable 5.1 にも適用されます。5つ目の暗黙の変更があります:ツール呼び出し間のテキストは、デフォルトの表示設定ではテキストが空である thinking ブロック内に届くようになったため、そのテキストを進行状況インジケーターとしてストリーミングする UI は、何もエラーが起きないまま沈黙します。
• 繰り返しになりますが、セーフガードのルーティングは仕様項目であり脚注ではないため — ほとんどのサイバーセキュリティ関連のリクエストは Claude Opus 4.8 に送られ、生物学関連の作業はアカウントが検証済みでない限り Claude Opus 5 にフォールバックします。これらの評価では、受け取る回答が Opus 5.5 から得られたものではない可能性さえあるため、サイバーおよびバイオ隣接ベンチマークで公表されているスコアは、このモデルを正確に測定したものではありません。
• 効率性に関する主張はすべてベンダー報告 — 一般的なワークロードでの実行コストが約40%低下する一方、定価は20%引き。合併分析の実例では、Opus 5.5で63分、Opus 5で93分かかり、コストは50%少ない。さらにBox(トークン数は3分の1、回答は約40%簡潔)、Kiro(トークンは約半分、呼び出しは40%減)、Factory(出力トークンが20~25%減)、GitHub(同社が測定した中でトークン数とステップ数が最も少ない部類)からの顧客発言。これらはベンダーとそのローンチパートナーが選んだワークロード全体の平均値だ。帰属情報であり、監査済みの結果ではなく、上記の独立したタスク別コスト数値と明らかに矛盾している — それ自体もデフォルトではなく最大努力時の測定値である。両方とも真であり得るが、どちらもあなたのワークロードに関する一般的な主張ではない。

エビデンスの現状
Claude Opus 5.5 は、実際の料金引き下げを伴う実在のモデルであり、コンテキスト 1M トークン、出力 128K という実際の枠を持ち、思考とエフォートの設定方法に現実的かつ重大な変更をもたらす。また、主に Anthropic を測定するベンチマーク表、主にチェックポイントではなくルーティングされたデプロイを測定する独立系の表、そしてその両方を損なう、文書化された自己認識問題を伴って登場する。Claude Opus 5.5 を名の知られた競合と突き合わせた、エフォートを揃え、ハーネスを揃えた独立系の直接対決は、まだ公開されていない。それが公開されるまでは、このページ上のあらゆるベンダー間比較を、あるがままに読むべきだ。つまり、2 社が 2 つの設定で出した 2 つのベンダー表を、私たちが横に並べたものだ。そして、モデルを測り直す前に、自分のエフォート設定を測り直してほしい。
この記事で比較したモデル4
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
