「level at 165」という見出しの生成済みタイトルカード。サブタイトルは「Epoch Capabilities Index、2026年10月1日付のファイル」、165(Claude Sonnet 5.5)、165(Claude Fable 5.1)、11 vs 20(各数値の背後にあるベンチマーク評価)と表示された3枚の統計カード、そして右下隅にOrcaRouterのロゴ。
Guides & Insights

Claude Sonnet 5.5、Epoch Capabilities IndexでClaude Fable 5.1と同率

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

リーダーボードの首位が同点というのは、たいていその表で最も面白くない事柄だ。今回ばかりは例外である。首位に並ぶ2つのモデルは、同じ金額ではないからだ。2026年10月1日更新のEpoch Capabilities Indexファイルでは、Claude Sonnet 5.5とClaude Fable 5.1がいずれも165——追跡対象253モデル中3番目と4番目の行——で、Claude Opus 5.5とGPT-6 Astraの2ポイント下に位置する。この2モデルは167で並んでおり、Claude Opus 5の163を2ポイント上回る。Claude Sonnet 5.5は2026年9月28日に、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで登場した。Claude Fable 5.1は9月1日に10ドルと50ドルで登場した。1つの数字は、両者が一般的な能力において交換可能だと言う。出力価格が5倍ということは、そうではないと言う。どちらも成り立つ。そして両者が同時に成り立つ理由は、表の中で誰も引用しない部分にある。

指標とは実際に何なのか、そして誰が測定しているのか

The ECI is not a vendor scoreboard. It is built by Epoch AI, an independent research organisation, as a composite that stitches scores from more than fifty distinct benchmarks into one general-capability scale, inferring each benchmark's relative difficulty from the models that happen to appear on several of them at once. The methodology is set out in a paper, “A Rosetta Stone for AI Benchmarks”, funded by Go​ogle DeepMind and written with researchers from its AGI Safety & Alignment team — but Epoch states plainly that the index is its own product and that it holds full rights over it, and the fitting code is public. That distinction matters when the funder of the research and the publisher of the score are not the same party.

この尺度には2つの特性があり、それによって尺度上の数値がどのように読めるかが決まる。第一に、ECIは絶対値ではなく基準点に固定されている。生の値は再スケーリングされ、Claude 3.5 Sonnet が 130、GPT-5 が 150 に位置するようになる。つまり、ある数値は同じファイル内の別の数値と並べて初めて意味を持つ。第二に、上限が存在しない。近づくべき 100 は存在しないので、「指数のトップ」は、誰かが到達した限界についての記述ではなく、日付についての記述である。

3番目の特性は、同点を物語に変えるものだ。各スコアの横に公表されている区間——各モデル自身の観測されたベンチマーク結果を500回リサンプリングして構築された90%ブートストラップ区間——は、165において両モデルで同一である。Claude Sonnet 5.5は162~169、Claude Fable 5.1も162~169。しかし、それらを生み出した件数は同じではない。Claude Sonnet 5.5の165は11件のベンチマーク評価からフィットされている。Claude Fable 5.1のそれは20件からフィットされている。

なぜ同じ区間が同じ証拠を意味しないのか

ECIでは、モデルにそもそもスコアが付けられる前に最低4件のベンチマーク評価が必要なので、どちらの数値も下限を余裕で上回っている。しかし、この区間が述べているのは、モデル自身の結果がどれだけばらつくかであって、結果がいくつあるかではない——だからこそ、2つのモデルが同じ点推定の周りに同じ幅を示していても、一方はおよそ半分の証拠しか根拠にしていないことがある。2つの165を等しく堅固なものとして扱うなら、その区間を、実際にはそうではないサンプルサイズ補正として読んでしまっていることになる。

非対称性はタイミングに関して実用的な帰結を持つ。Epochは新しい評価が届くたびに、すべてのデータにわたってモデル全体を同時に再フィットするため、そのモデル自体に何の変化もなくても、モデルの数値が動くことがある。11件の観測を担うモデルのほうが、20件を担うモデルよりも動く余地が大きく、それにより次の改訂でこのペアのうち動く可能性が高いのはClaude Sonnet 5.5である——どちらの方向にも。

Epoch自身による今回の測定結果の枠組みは、それが生み出した見出しよりも狭い。同組織による更新の要約は、Claude Opus 5.5が167で首位に立ち、GPT-6 Astraを僅差で上回ったことを先頭に置き、2文目を、Claude Sonnet 5.5が165でClaude Fable 5.1に「ほぼ並んだ」という事実に充てている。「ほぼ並んだ」が鍵となる表現であり、公表された区間こそ、それが適切な表現である理由だ。

2つのプロファイルが実際に分岐する点

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

総合スコアでの水準は、個々の構成要素での水準を意味するものではない。Epoch は各モデルページにベンチマークごとのパネルを掲載しており、Claude Sonnet 5.5 のページと Claude Fable 5.1 のページの両方に6つのベンチマークが登場する——つまり、インデックス自体から同条件の比較を行えるのは、それら6つだけということになる。

• ミステリーゲームパズル — Claude Sonnet 5.5 65% 対 Claude Fable 5.1 58%

• FrontierMath ティア1~3(v2) — Claude Sonnet 5.5 89% vs Claude Fable 5.1 90%

• FrontierMath ティア4(v2) — Claude Sonnet 5.5 80% 対 Claude Fable 5.1 88%

• OTIS模擬AIME 2024–2025 — Claude Sonnet 5.5 100% 対 Claude Fable 5.1 100%

• 家具組み立てベンチマーク — Claude Sonnet 5.5 75% 対 Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% 対 Claude Fable 5.1 71%

これほど混み合った総合指標でどちらに転んでも4ポイントの変動があり、その根底にある差は対称にはほど遠い。Claude Sonnet 5.5 は、ゲーム的でマルチモーダルな作業——パズル解決、物理的な組み立て——で優位に立ち、競技数学では互角だ。Claude Fable 5.1 は FrontierMath の最難関層で8ポイント、SimpleQA Verified で24ポイント上回っている。この世界知識セットでは、47% 対 71% という差が共通パネル内で最大の単一ギャップだ。この2つのモデルのどちらかを選ぶ購入者は、同じ能力についての2つの解釈を選んでいるのではない。ある作業ではより強い安価なモデルと、別の作業ではより強い高価なモデルのどちらかを選んでいるのであり、汎用能力指数は両者を区別しようとしない。

Epochのインデックスは、ベンチマークごとの首位が総合指標に現れなければならないわけではないとも明言している。ベンチマークは精度によって重み付けされているわけではなく、特定分野に特化したモデルは、個々のテストで首位に立ちながらも、異なる形のライバルを下回るスコアになることがある——そのドキュメントはそう直接述べている。それは言い訳されている欠陥ではない。50あまりのテストをまとめた総合指標とは、まさにそのためのものだ。

二つの独立した計器は反対方向を指し示している

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

世に出回っている2つ目の独立した測定値があり、この2つのモデルのどちらが先行しているかについて、最初の測定値とは一致していない。Artificial Analysis Intelligence Indexでは、当社のカタログがこの2つのモデルについて掲載している数値は、Claude Sonnet 5.5が56、Claude Fable 5.1が53.4で、同じ版の同インデックスから取られており、したがって評価対象モデルの同じサンプルに基づいている。3ポイント差で、より安価なモデルに有利——そこではEpochは両者を同一と読んでいる。

どちらの読み方も間違っておらず、それらを使う方法は、両者が何について食い違っているかに気づくことです。2つの指数は異なるベンチマークセットを対象とし、それらに異なる重み付けをしています。Epoch composite はベンチマークが飽和しても耐えられるように作られている一方、Artificial Analysis index は異なるバスケットをそのまま集計したものです。2つのモデルがこれほど接近しているとき、測ろうとしている差よりも、どの測定器を選ぶかのほうが重要です。隣り合う2つの数値のうち強いほうを知りたい読者は、どちらの見出しを見るのではなく、上にある共通の個別ベンチマークのパネルを見るべきです。なぜなら、同じテストで2つのモデルが互いに比較されているのは、そこだけだからです。

総合指標が含まない文脈がもう一つあり、Epoch はそれを含んでいる。公開日である。Claude Fable 5.1 は現在追跡されている253モデル中4位につけている。2026年9月1日に自身が公開された時点では、当時追跡されていた247モデル中1位だった。その重みは変わっていない。単にフロンティアが1か月のうちに6位分それを追い越しただけであり——これが表全体の形であり、月次指数の読み取りが評決ではなくスナップショットである理由だ。

その違いがいくらになるのか、そして安い側はどこなのか

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

汎用能力では同水準、入力で2.5倍、出力で5倍の差——これが今回の読解の実用的な中身のすべてです。両モデルは当社独自のカタログに掲載されており、anthropic/claude-sonnet-5.5は100万入力あたり$2.00、100万出力あたり$10.00、キャッシュ読み取りは$0.20、anthropic/claude-fable-5.1は$10.00と$50.00、キャッシュ読み取りは$0.25です。そしてどちらもプロバイダー自身の定価で、マークアップを一切加えずにそのまま通しているため、ベンダーの料金改定は、相手側に反映されるのと同じ日に当社側にも反映されます。

見出しよりも、繰り返し発生するコストのほうが重要だ。キャッシュから12万トークンのプレフィックスを送信し、8,000トークンの出力を生成するワークロードを、1日1回、1か月間実行するとしよう。Claude Sonnet 5.5では、そのプレフィックスは12万トークンで、100万トークンあたり$0.20、つまり約2.4セント、さらに8,000トークンが100万トークンあたり$10で8セント — 1回あたりおよそ10.4セント、30日間で約$3.12になる。Claude Fable 5.1では、同じプレフィックスが12万トークンで$0.25、3セント、さらに8,000トークンが$50で40セント — 1回あたり約43セント、1か月で$12.90だ。どちらのモデルも同じ100万トークンのウィンドウを最大128Kの出力で提供するので、違いは上限ではなく料金表にある。

それに対して、6つの共通ベンチマークは、上乗せしたコストがどちらの方向に何を買うのかを教えてくれる。FrontierMath Tier 4やオープンエンドな事実の想起に近い仕事をするチームは、4倍の費用を払うことで、それらのテストで実に8~24ポイントの差を買っている。一方、パズル解決やマルチモーダルな組み立てに近い仕事をするチームは、より少ない金額を払いながら、逆方向に5~7ポイントを買っている。単一のプラットフォーム上では、これらは2つの調達判断ではない。どちらのモデルも200以上あるモデルのうちの1つのAPIキーの背後にあるので、自分のトラフィックで両者を比較するのは、2つ目の契約ではなく設定の変更で済む。そして両方がルーティングされている場合、その下には自動フェイルオーバーが控えている——2つの独立した計測器がどちらが優れているかで見解を異にするとき、これは重要になる。

この数値を動かすものは何ですか?

それを変えるのは3つで、そのうち1つだけがどちらかのモデルに関係する。

第一の要因は、ベンチマーク評価の増加です。Claude Sonnet 5.5 は4日前、背後に11件の評価を伴ってインデックスに加わりました。評価が追加されるたびにその区間は狭まり、点推定値も動き得ます。そして、合同での再フィッティングにより、その動きは新しい行だけにとどまりません。

第二の点は、新たなフロンティアモデルの登場である。上位4行は4ポイントにわたり、その範囲内に2つの同点が含まれる。したがって、適切に評価された新規参入者が1つ現れれば、集団の下ではなく、その集団の中に入ることになる——そして公開されている信頼区間は4つすべてで重なっているため、それらの間の順序は測定結果ではなく、タイブレークにすぎない。

第三はモデル自体の価格であり、これはどの指数も追跡していない。この記事が焦点を当てる格差は料金表の格差だ。2ドルと10ドル対、今日の10ドルと50ドルである。どちらかの料金表が変われば、能力スコアを1つも動かすことなく判断が変わる。

擁護可能な要約は、より限定的なものだ。Epoch AIの総合指標では、2026年10月1日更新のファイルにおいて、Claude Sonnet 5.5とClaude Fable 5.1は同じ数値——165で同率3位であり、公表された区間は同一だが、根拠となる証拠の量は異なる。Artificial Analysisの別の測定ツールでは、同じ2つのモデルに3ポイントの差がある。指数が両者を直接比較している6つのベンチマークでは、両者は同水準に並んでいるのではなく、領域ごとに優位を入れ替えている。そして料金表では、両者はまったくかけ離れている。この解釈で支持できない唯一の文は、最も引用されそうなあの文、すなわち「両モデルは同等だ」という文である。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新