「Claude Opus 5.5、コーディングエージェント指数で66を獲得し首位」と記されたタイトルカード。サブタイトルは「トークンはより安く、タスク請求はより大きく」。その下に角の丸いカードが3枚並ぶ:コーディングエージェント指数 66、タスクあたりのコスト $13.04(21%増)、そして Claude Opus 5:60($10.79)。
Guides & Insights

Claude Opus 5.5がコーディングエージェント指数で66を記録して首位に — そしてタスク費用は21%上昇

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ベンダーはClaude Opus 5.5のトークン価格を2026年9月22日に20%引き下げた。2日後、Artificial Analysisは、この値下げがエージェントの請求額に何をもたらしたかを示すコーディングエージェントの測定結果を公表した。タスクあたりのコストは上昇し、21%増の$13.04となった。以前は$10.79を同じ指数がClaude Opus 5。スコアも上がった — 66はCoding Agent Indexのスコアで、Artificial Analysisはこれを自社が測定した中で最高だと説明している。Claude Opus 5を6ポイント、同じ構成のClaude Fable 5.1を4ポイント上回る。この二つの事実は同時に成り立ち、同時に成り立つ理由こそがこのランキングの物語そのものである。モデルがより多く消費する安いトークンは、安いタスクではない。そして長時間のエージェント実行で最大の推論エフォートをかける場合、Claude Opus 5.5はそれをはるかに多く消費する。

Coding Agent Index が実際に評価しているもの

これはモデルのリーダーボードではない。ここに並ぶ各行はハーネスとモデルのペア — 特定のコーディングエージェント内で、特定のエフォート設定で動くチェックポイントだ。誰もが引用している行は、maxエフォートでClaude Code内で動くClaude Opus 5.5であり、これはAnthropicが開発・調整の対象としているハーネスだ。Claude Opus 5の60とClaude Fable 5.1の62は同じハーネスと同じエフォート設定から得られたもので、それこそが誠実な比較を可能にしている。どちらかのモデルを別のコーディングエージェントで測った行は別の測定値であり、同じものであるかのようにはここには載せていない。

この指標にはバージョンがあり、それに付けられたブランド名よりもバージョンのほうが重要です。現在v1.5として公開されているリーダーボードは、3つの評価を平均しており、それぞれが等しく重み付けされ、各タスクにつき3回の試行で平均した pass@1 として報告されています。

Terminal-Bench 4.0 — エージェントによるシェルとコマンドラインの作業:ファイルシステムの操作、ツールの正しい使用、途中の障害からの復旧、複数ステップのワークフローの完遂。

DeepSWE v1.1 — ソフトウェアエンジニアリングのタスク、リポジトリ編集作業。

SWE-Atlas-QnA — リポジトリ理解に関する質問で、答えはコードベースを変更するのではなく読み取ることで見つかります。

3つの評価と1つの数値、そしてその横に印刷されたタスクあたりのコスト列。そのコスト列があるからこそ、この指標はスコアだけよりも役立ち、また、見出しの数値が一見するより読み取りにくい理由でもある。

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

3つの構成要素と、6つのポイントがどこから来たのか

Artificial Analysisはコンポーネント行をコンポジットと並べて公開しており、それらは均等には動かない:

Terminal-Bench 4.063.1%Claude Opus 5.5 の54.5% 対 Claude Opus 5 の8.6ポイントの増加。これはこのセットの中で最大の単一の改善です。

DeepSWE v1.168.4%62.5%5.9ポイント上昇

SWE-Atlas-QnA66.4%62.1%4.3ポイント上昇。

その3つを平均すると66.0になり、これが合成スコアです。興味深いのは伸びの形です。モデルはコードベースを読むことでは最も改善が小さく、シェルを操作することでは最も改善しました。Terminal-Benchは、人々が「コーディングエージェント」と言うときに実際に意味するものに最も近い評価です。つまり、モデルがコマンドを選び、出力を読み、次に何をするかを決める長時間のループであり、ステップ間に人間は介在しません。そこでの8.6ポイントの跳ね上がりは、コード生成ではなく、持続的なツール使用を示しています。

改善をどこに期待すべきかについて、それが何を意味するかに注目してください。ワークロードが「このリポジトリを説明して」なら、Claude Opus 5.5 は Claude Opus 5 からの控えめなアップグレードです — 4ポイント。ワークロードが「テストスイートが通るまで実行し、壊れた箇所を修正する」なら、表の中で最大の飛躍です。

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

ランキングの横に印刷されている数字:1タスクあたり$13.04

値下げが発表されたときとは別の見え方になる、その計算はこうだ。Anthropic の Claude Opus 5.5 のリスト価格は、100万入力トークンあたり$4.00、および100万出力トークンあたり$20.00で、Claude Opus 5 の$5.00と$25.00から下がり、キャッシュ読み取りは60%減の$0.20(100万あたり)。これらの項目はどれも安くなっている。それでも、最大エフォート時にタスクにかかるコストについての Artificial Analysis の推定は、どのみちもっと高い:

タスクあたりのコスト — Claude Opus 5.5 は $13.04、Claude Opus 5 は $10.79 で、21%増加しています(同一インデックス、同一ハーネス、同一エフォート設定)。

タスクあたりの総トークン数 — 約 15.6M11.4M、約 37%

タスクあたりの出力トークン — およそ 333,000137,000で、2倍以上。出力はコストがかさむ方向であり、最も大きく動いた線です。

タスクあたりのキャッシュ入力 — およそ14.6Mに対して10.9M、約34%増。60%のキャッシュ読み取り削減はここで確かに効いているが、コンテキストを3分の1多く読むタスクを相殺するには十分ではない。

公表されている料金で計算すれば、構図はおのずと見えてくる。出力トークンだけを見ると、333,000トークン×100万トークンあたり$20.00で約$6.66——推定総額$13.04のおよそ半分が、倍になったたった1つの項目から出ている。キャッシュ読み取りの項目は量が膨大で、価格はほぼ無料同然だ。14.6Mトークン×100万トークンあたり$0.20で$3未満。20%の削減は本物で、キャッシュの削減も本物だ。だが最大エフォートのエージェントループでは、より長く考え、より多く書くモデルの前では、それらは単純に圧倒されてしまう。

これは予算の組み方に直接影響します。チームが最大エフォートで1日500件のコーディングエージェントのタスクを実行する場合、$10.79と$13.04の差は約1日あたり$1,125 — 月額およそ$34,000 — 同じタスク数で、ということです。これが、モデル変更を承認する担当者に見せるべき数字であり、値下げが示唆する数字ではありません。

なぜ$5.98と$13.04がどちらも正しいのか

Artificial Analysisは、異なるタスクあたりコストの数値を同じモデルについて数日前に公表していた。ラベルなしでこの二つを並べて読むと、矛盾しているように見える。だがそうではない——両者は異なる評価であり、その違いは示唆に富んでいる。

では、Intelligence Index9月22日の記事でClaude Opus 5.5のタスクあたりコストが$5.98とされており、Claude Opus 5の$5.86とほぼ同水準でした。タスクあたりの出力トークン数が約119,000で、Opus 5の73,000に対して大幅に多いにもかかわらずです。ここでは、値下げとトークン増加分がほぼ正確に相殺し合っています。Coding Agent Indexでは、最大エフォート時、Claude Codeにおいて、同じモデルのコストは$13.04で、$10.79との対比となっています。

どちらも異なるワークロードを正直に測定したものです。質問応答の評価は短いやり取りですが、エージェントタスクはツール呼び出しの長いループで、コンテキストが増え続け、その増加は最も価格の高い出力方向で複利的に効いてきます。実践的な教訓は、「値下げは余分なトークンを相殺するのか?」に単一の答えはないということです — それはタスクの長さに依存し、タスクが長く、よりエージェント的であるほど、相殺の効果は悪くなります。短答ベンチマークから予算を立てていると、エージェントの請求額を過小評価することになります。

その行に記載すべき3つの注意事項

66という数字はClaude Codeのスコアであり、素のモデルのスコアではない。 このインデックスは、ツールのルーティング、リトライ処理、コンテキスト管理はエージェントの測定性能と切り離せないという論拠に基づき、モデルとハーネスを意図的に対にして評価している。ここではそれがAnthropicに有利に働く。なぜなら、採点に用いられるハーネスは同社自身のものだからだ。Artificial Analysisはハーネス比較ビューを近日公開としているが、それが実現するまでは、6ポイントのリードのうちどれだけがチェックポイントによるもので、どれだけがそれを取り巻く足場によるものかは誰にも言えない。

Anthropic自身によるTerminal-Bench 4.0の数値はこのコンポーネントより高く、それはAnthropicが実行したものである。 発表資料では66.4%xhighエフォート時)が報告されており、Coding Agent Indexのコンポーネントは63.1%(max時)で、さらにArtificial Analysisが別途独自に実施した計測では、同じベンチマークバージョン上で自社ハーネスにより59.6%が測定された。3つの数値、3つの構成、3つの計測主体。上の行にある63.1%はインデックス自身のコンポーネントであり、そのインデックス上の他の数値とのみ比較すべきものである。ベンダーによる66.4%はベンダー申告の値であり、第三者による再現はなされておらず、異なるエフォート設定に属するものである。

インデックスの改訂で動きます。本ブログは9月上旬に、同じボードの旧バージョン上で、異なるCoding Agent Indexの行を報じました。それらの古い数値はv1.5とは比較できません — Terminal-Bench 4.0が以前のバージョンに取って代わった時点で、評価セット自体が変わったからです。サードパーティのミラーは、古いバージョンラベルが付いた古いスナップショットを依然として保持しています。このインデックスにおけるClaude Opus 5.5の数値が現在のv1.5の行のものでない場合、それをv1.5の数値の隣に置かず、両者をまたいで差分を計算しないでください。

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

実際に何をデプロイするか

このランキングはmaxエフォートでの数値であり、maxエフォートはほとんど誰もデフォルトで出荷すべきではない設定です。Claude Opus 5.5には5つのエフォート設定 — low、medium、high、xhigh、max — があり、モデルのデフォルトはmediumです。Artificial Analysisはより低い設定でのCoding Agent Indexの行を公開していないため、そこでのコスト削減はこのインデックス上では数値化されていません。Intelligence Indexでは、同じモデルのmediumが51を記録し、Claude Opus 5のmaxと一致しています$1.34(タスクあたり)でした。削減分が存在するのはまさにこの方向であり、それは別のモデルではなく、ひとつの設定です。

現実的なパターンは分割だ。長時間の自律ループ——そこで8.6ポイントのTerminal-Benchの向上分こそがあなたの買っているものだ——には最大エフォートを維持し、定型作業は、モデルがClaude Opus 5が終えた地点よりなお大きく先行している低めのエフォートで回す。エフォートはデプロイではなくリクエストパラメータなので、この分割はルーティングルールであり、両モデルは同じカタログに載っている——Anthropicの定価を0%のマークアップでそのまま適用しているため、ベンダーの値下げは発表当日にanthropic/claude-opus-5.5で反映され、この2つをあなた自身のタスクでA/B比較するのに二つ目の契約もコード変更も関与しない。とりわけ最大エフォートの経路では、1つのタスクが長時間の無人実行になり得るのだから、停滞したプロバイダによってループ全体を失わないようにしてくれるのが自動フェイルオーバーだ。

まだ測定されていないものは何ですか?

この状況を変えるはずの3つの要素があるが、そのいずれもまだ存在しない。同等のエフォートと同等のハーネスでClaude Opus 5.5を競合チェックポイントと比較したものは存在しない——利用可能なベンダー間比較はいずれも、2つのベンダー表を横に並べただけだ。中または高エフォートで実施されたCoding Agent Indexの公開実行結果も存在しないが、そこにこそ本番トラフィックの大半が位置することになる。そして、ハーネス帰属の問題——66のうちどれだけがモデルで、どれだけがClaude Codeなのか——は、インデックス側で認識されているものの先送りにされている。

今日あなたが実際に行動に移せることは、ランキングよりも狭く、そしてより有用だ。Claude Opus 5.5 は、持続的なシェル駆動型エージェント作業において Claude Opus 5 よりも本当に優れている——大規模で一貫性があり、独立に生成された改善を示す唯一の要素がこれだ。また、その改善が測定された設定では、1タスクあたり約$2.25多くコストがかかり、トークン単価の値下げはその数字には届かない。ループが長く失敗コストが高いところでは最大エフォートで展開し、それ以外のすべてではより安い設定を維持し、低エフォートの行が現れたらインデックスを再確認せよ。ほとんどのチームが実際に支払うのはその構成だからだ。値下げだけを理由に乗り換えるなら、あなたは間違ったものを買っている——モデルはトークンあたりでは安く、タスクあたりでは高く、その2つの数字のうち請求書に現れるのは片方だけだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新