Epoch Capabilities Index に関する記事のタイトルカードを生成しました。見出しは「Claude Opus 5.5 Tops the Epoch Capabilities Index」、その下に水色の等幅フォントで「167.35 vs 166.51」という行、さらに灰色のサブラインで「Top two on a composite of 50+ benchmarks」、右下隅に OrcaRouter のロゴが配置されています。
Guides & Insights

Claude Opus 5.5、Epoch Capabilities Indexで0.84ポイント差の首位に

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

その数字は0.84だ。Claude Opus 5.5は、私たちが2026年10月2日に読んだファイル時点で、Epoch Capabilities Index において167.35に位置し、GPT-6 Astraは166.51 —— 公開されている95%区間が両モデルでほぼ完全に重なる尺度における、1ポイント未満の差である。Opus 5.5が164.0から172.0、Astraが163.14から171.05だ。その下では、Claude Sonnet 5.5が165.2、Claude Fable 5.1が164.82を記録した。つまり、50を超えるベンチマークからなる独立した合成指標の上位4件は2.53ポイント差で並んでおり、そのうち3つが同じベンダーの名前を冠している。この順序は、点推定値が順序づけられているという意味では実在する。しかし0.84ポイントのリードが自身の誤差範囲を生き延びるという意味では実在しない。そしてこのリーダーボードについて語る価値のあることはすべて、この2つの事実を同時に抱えることから導かれる。

指数とは何か、そして0.84ポイントが何でないか

Epoch Capabilities Indexはベンダーのスコアボードではない。これは独立研究機関であるEpoch AIによって、50を超える異なるベンチマークのスコアを一つの汎用能力尺度へと縫い合わせた複合指標として構築されており、各ベンチマークの相対的な難易度を、偶然同時に複数のベンチマークに登場するモデルから推測している。その方法論は、Google DeepMindのAGI Safety & Alignmentチームの研究者らと共同で執筆され、DeepMindから資金提供を受けた論文に記されているが、Epochは、この指数が自社の製品であり、自社がそのすべての権利を保有していると明確に述べている——資金提供元とスコアの公表者が同じ当事者でない場合に保持する価値のある区別である。コードは公開されている。

このスケールには、見出しの数字よりも重要な二つの性質がある。一つ目は、ECIが絶対値ではなく意図的に基準点に固定されているという点だ。生のスコアは再スケーリングされ、Claude 3.5 Sonnetが130、GPT-5が150に収まるようになっている。つまり、この指数上の数字は、同じファイル内の別の数字と並べて初めて意味を持ち、単独では意味をなさない。二つ目は、この指数には上限がないことだ。近づくべき100という値は存在しない。したがって「指数のトップ」とは、ある時点についての記述であり、誰かが到達した限界についての記述ではない。

だからこそ、167.35 対 166.51 を正直に読んでも、「Claude Opus 5.5 が世界で最も高性能なモデルだ」ということにはならない。それはより限定的で、引用しにくい話だ。2026年10月2日に利用可能だった証拠に対する Epoch のモデル化では、両モデルはトップでは区別がつかず、両者の順序は測定ではなくタイブレークにすぎない。公表された区間が直接そう語っている——164.0 から 172.0 と 163.14 から 171.05 は、その範囲の大部分が重なっている。0.84 を判定として引用する人は、丸め処理の産物を引用しているにすぎない。

Anthropicのブロック、そしてリリースのサイズ

この表でより多くのことを教えてくれるのは、誰が1位かではない。3行目と4行目だ。9月28日にリリースされ165.2を記録したClaude Sonnet 5.5は、9月1日にリリースされ164.82のClaude Fable 5.1を0.38ポイント上回る——実質的に両者が同じ位置にあると言えるほど近く、またこのペアが首位からわずか2.15ポイント下に位置するほど近い。SonnetはAnthropicのラインナップにおけるミッドティア製品であり、Fableは同社が歴史的に汎用的な推論作業に充ててきたモデルだ。両者が今やフロンティアをすぐ下から挟み込んでいることこそ、今回のリフレッシュにおける実質的な変化であり、リーダーが誰かということ以上に重要である。

Anthropic自身の世代的な歩みも見て取れる。Claude Opus 5.5はClaude Opus 5の後継であり、Epochのスコアは162.94、区間は160.2~166.7だ。これは約2か月で4.41ポイントの改善であり、7月24日のリリースから9月22日のリリースにかけての動きで、今日の1位と2位を隔てる0.84ポイントより大きい。そう読むなら、この表で興味深い量は、首位の2社間の差ではなく、単一ベンダーの系列内の傾きである。

オープンウェイト路線はどこまで続くのか

Epochはモデルをアクセシビリティによって分類しており、それによりオープンウェイトの境界を推測することなく明確に読み取れる。最高のオープンウェイト項目は157.61のKimi K3で、日付は7月16日、非商用と表示されている。その背後には、155.38のDeepSeek V4 Pro 0813と155.0のDeepSeek V4.1 Flashが続き、どちらも無制限である。次いでGLM-5.3-Flashが151.94、GLM-5.2が151.78となっている。したがって、首位に最も近いオープンモデルは9.74ポイント後方にあり、その差は1位と2位の間の差の18倍の広さで、区間が互いに近づくことすらないほど広い。

その非対称性は、この表で唯一長く効力を持つ発見だ。クローズドなフロンティアは3ポイント以内での密集戦であり、クローズドなフロンティアからダウンロード可能な最良の重みまでの距離は、それより一桁大きい。ベンチマーク世代をまたいで比較できる複合指数は、まさにそれに気づくためのツールだ。なぜなら、飽和しつつあるベンチマークが沈黙したと報告する代わりに、7月にも9月にも同じことを言えるからである。

近くの行のいくつかは、文脈のためにピン留めしておく価値があります。それらは読者が実際にOpus 5.5と比較検討するモデルだからです:

• Claude Sonnet 5 — 156.34、6月30日リリース、区間 153.61~158.81

• Grok 4.6 — 156.61、8月12日リリース、区間154.66~158.93

• Gemini 3.8 Flash 156.93、9月2日リリース、区間154.64~160.42

• Muse Spark 1.3 — 156.86、9月2日リリース、区間154.73~159.56

• GPT-5.6 Sol — 161.8、7月9日リリース、区間159.26〜165.26

インデックスポジションはビルではありません

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

ここでは、上位2つのモデルのコストがまったく同じではないため、リーダーボードはもはや全体像を語るものではありません。当社自身のカタログには、両モデルともプロバイダーの定価(マークアップなし)で掲載されています。$4.00/$20.00、キャッシュ読み取り$0.20のClaude Opus 5.5と、$10.00/$50.00、キャッシュ読み取り$1.00のGPT-6 Astraは、料金表の入力・出力の両方向で2.5倍の差があります。さらにAstraは272,000プロンプトトークンを超えると段階が上がり、入力が$20.00、出力が$75.00になります。一方、Opus 5.5はフル1Mトークンのウィンドウ全体を通じて$4.00/$20.00を据え置きます。両モデルとも128,000出力トークンを提供します。

長文コンテキストのワークロードで実際にかかる計算をしてみよう——キャッシュから供給される180,000トークンのプレフィックス、生成される5,000トークン。Opus 5.5では、180,000トークンが100万トークンあたり$0.20で約3.6セント、それに5,000トークンが100万トークンあたり$20で10セント:およそ13.6セント。GPT-6 Astraでは、180,000トークンが$1.00で18セント、それに5,000トークンが$50で25セント:およそ43セント。0.84ポイントの優位と3.2倍のコスト差は同じ種類の事実ではなく、前者だけを重んじる調達判断は、より小さい数字を重んじたことになる。

Fable 5.1は、同じベンダーの料金表のもう一方の側からその点を際立たせている。$10.00/$50.00で、価格はAstraとまったく同じであり、スコアは164.82——同じ金額でOpus 5.5より2.53ポイント低い。この指数は、Anthropicの3つのフロンティアモデルを互いに2.53ポイント以内に収め、その料金表はそれらを2.5倍の差で引き離している。これは、購入者が目の前にしている選択を、どの単一のランキングよりもはるかによく言い表している。

数字について議論するつもりなら、自分のトラフィックで議論しろ

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

この指標がそもそも読む価値を持つのは、ベンダー以外の誰かによって測定されているからだ——しかしその合成指標の構造自体が、議論の前提条件を設定してしまう。Epochのキャリブレーション、その難易度推定、そしてベンチマークをスキップするモデルの扱いは、いずれも表に載る数値の上流に位置しており、どれも読者がスクリーンショットから再導出できるものではない。同じことはあらゆるベンダーの看板ベンチマークにも当てはまる。だからこそ有用なのは、それらの間でどちらかの肩を持つことではなく、自分が管理するトラフィック上で比較することなのだ。

これらのモデルはどちらもOrcaRouter上の1つのAPIキーから利用でき、プロバイダの定価を0%のマークアップでそのまま提供しています。Claude Opus 5.5は$4.00/$20.00、キャッシュ読み取りは$0.20、そしてGPT-6 Astraは$10.00/$50.00で、272K超のティアはプロバイダが設定したとおりに正確に適用されます。同じプロンプトセットを両方に送るのは、2つ目の契約ではなく設定変更であり、両方がルーティングされる場合、自動フェイルオーバーがその下で機能しており、このことはノイズフロアにこれほど近い判断にとって重要です。リーダーボードは、2つのモデルが区別できないと教えてくれます。どちらがあなたの仕事において区別できないかを教えてくれるのは、あなた自身の評価だけです。

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

来月、この数字を動かす要因は何でしょうか

Epochのファイルは生きたものであり、3つのことが読み取りを素早く変えるだろう。第一は、トップ4に入るフロンティアモデルの新たな評価である。クラスターがこれほど密集している場合、ベンチマークの観測が1つ追加されるだけで、明確なリーダーがいる場合よりも複合指標が大きく動くからだ。第二は信頼区間の変動である。最新のエントリは最も広い区間を持っている。重複するベンチマークで最も少なく評価されているため、9月のリリースが最も動きやすく、7月のものは最も動きにくい。第三はベンチマークが飽和に達することであり、これはこのインデックスが生き残るために作られた特定の失敗である。コンポーネントが識別できなくなると、Epochはモデルの優位性をテストとともに消えさせるのではなく、構成を再重み付けする。

今のところ、擁護できる要約は狭い方のものだ。Claude Opus 5.5は、自身の信頼区間が裏付けない0.84ポイントの差によって、Epoch Capabilities Indexで167.35で首位に立っている。Claude Sonnet 5.5は、同じ系列の中位から首位の2.15ポイント以内まで上昇した。そして、オープンウェイトの分野は、それらすべてから9ポイント以上遅れている。首位の座は2社間のコイントスだ。両者間の価格差4ポイントはそうではない。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新