為一篇關於 Epoch Capabilities Index 的文章生成的標題卡,標題「Claude Opus 5.5 高居 Epoch Capabilities Index 榜首」位於一行寫著「167.35 vs 166.51」的淺藍色等寬字體文字上方,灰色副標寫著「在 50 多項基準的綜合評比中名列前兩名」,右下角則有 OrcaRouter 標誌。
Guides & Insights

Claude Opus 5.5 以 0.84 分登上 Epoch Capabilities Index 榜首

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個數字是 0.84。Claude Opus 5.5在我們於 2026 年 10 月 2 日讀取的檔案中,以 167.35 分位居 Epoch Capabilities Index,而GPT-6 Astra則為 166.51 分——在這個尺度上,兩款模型已公布的 95% 區間幾乎完全重疊,Opus 5.5 是 164.0 到 172.0,Astra 則是 163.14 到 171.05,差距還不到一分。在她們之下,Claude Sonnet 5.5拿下 165.2 分,Claude Fable 5.1則是 164.82 分,因此在一個由五十多項基準測試構成的獨立綜合指標上,前四名之間只相差 2.53 分,其中三個還掛著同一家廠商的名字。就點估計確實有高低次序這層意義而言,這個排名是真實的。但就 0.84 分的領先能撐過自身誤差範圍這層意義而言,它並不真實;而關於這份排行榜,一切值得一說的事都源自同時掌握這兩項事實。

指數是什麼,以及0.84點不是什麼

Epoch Capabilities Index 並非廠商排行榜。它由獨立研究機構 Epoch AI 建構,是一項複合指標,把超過五十個不同基準測試的分數拼合成單一通用能力量表,並從恰好同時出現在數個基準測試上的模型,推斷各基準測試的相對難度。其方法論載於一篇與 Google DeepMind AGI Safety & Alignment 團隊研究人員合寫、由 DeepMind 資助的論文,但 Epoch 明白表示,該指數是自家產品,且擁有其完整權利——當資助來源與某項分數的發布者並非同一方時,這項區別值得保留。程式碼是公開的。

這個量表的兩項特性,比表面上的頭條更為重要。第一,ECI 是刻意採用錨定而非絕對尺度:原始分數會經過重新縮放,使 Claude 3.5 Sonnet 落在 130、GPT-5 落在 150,這意味著這個指數上的某個數字,只有和同一份檔案中的另一個數字並列時才有意義,單獨來看則毫無意義。第二,這個指數沒有上限。沒有所謂的 100 可以逼近,因此「指數最高點」只是在陳述某個日期,而不是在說任何人已達到的極限。

這就是為什麼,對 167.35 對上 166.51 的誠實解讀並不是「Claude Opus 5.5 是世界上能力最強的模型」。它更狹隘,也更難以引用:根據 Epoch 對 2026 年 10 月 2 日可得證據所做的建模,這兩款模型在頂端難以區分,而它們之間的排序只是平手時的裁決,而不是一項量測。所公布的區間直接說明了這一點——164.0 到 172.0 與 163.14 到 171.05 的絕大部分範圍彼此重疊。任何把 0.84 當作定論來引用的人,引用到的都只是四捨五入的產物。

Anthropic 區塊,以及發布的規模

表格中更具資訊價值的不是誰排在第一位。而是第三列與第四列。九月二十八日發佈、得分 165.2 的 Claude Sonnet 5.5,比九月一日發佈、得分 164.82 的 Claude Fable 5.1 高出 0.38 分——差距小到兩者在實際上可視為同一名次,也小到這對組合僅以 2.15 分之差落於榜首之下。Sonnet 是 Anthropic 產品線中的中階產品,而 Fable 則是該公司歷來指向通用推理工作的模型;如今這兩者雙雙從緊貼前沿之下的位置包夾前沿,這才是本次更新中實質性的變化,其意義勝過誰是領先者。

Anthropic 自身的世代躍進也可見一斑。Claude Opus 5.5 是 Claude Opus 5 的後繼者,Epoch 給 Claude Opus 5 的評分為 162.94,區間為 160.2 至 166.7。這是在大約兩個月內、從 7 月 24 日發布到 9 月 22 日發布所帶來的 4.41 分進步——比今日第一名與第二名之間相隔的 0.84 分還要大。這樣看來,這張表中有趣的量是單一廠商線內部的斜率,而不是頂端兩家廠商之間的差距。

開源權重的界線在哪裡

Epoch 依可及性區分模型,讓開放權重界線清楚可辨,無須猜測。最佳的開放權重入選者是 Kimi K3,得分 157.61,日期為 7 月 16 日,標示為非商業性。其後是 DeepSeek V4 Pro 0813(155.38)與 DeepSeek V4.1 Flash(155.0),兩者皆無限制,接著是 GLM-5.3-Flash(151.94)與 GLM-5.2(151.78)。因此,最接近榜首的開放模型落後 9.74 分——這個差距比第一名與第二名之間的差距寬十八倍,而且寬到這些區間根本遠遠碰不到彼此。

那種不對稱是這張表裡唯一持久的發現。閉源前沿是在三分之內的一場混戰;而從閉源前沿到最佳可下載權重的距離,卻大了一個數量級。一個能讓你跨評測世代進行比較的綜合指數,正是察覺這件事的工具,因為它能在七月和九月說出同一件事,而不是回報某個正在飽和的評測基準已經沉寂無聲。

有幾個鄰近的列值得固定下來作為脈絡,因為它們才是讀者實際上會拿來與 Opus 5.5 權衡比較的模型:

• Claude Sonnet 5 — 156.34,於6月30日發布,區間為 153.61 至 158.81

• Grok 4.6 — 156.61,於8月12日發布,區間為154.66至158.93

• Gemini 3.8 Flash — 156.93,發布於 9 月 2 日,區間 154.64 至 160.42

• Muse Spark 1.3 — 156.86,於9月2日發布,區間為154.73至159.56

• GPT-5.6 Sol — 161.8,於7月9日發布,區間 159.26 至 165.26

索引位置不是帳單

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

在這裡,排行榜不再是全貌,因為位居頂端的兩個模型成本完全不在同一個檔次。從我們自己的目錄來看,兩者都以供應商的定價列出,沒有任何加價,Claude Opus 5.5 為 $4.00/$20.00,快取讀取為 $0.20,以及 GPT-6 Astra 為 $10.00/$50.00,快取讀取為 $1.00,兩者在費率表的兩個方向都相差 2.5 倍。Astra 在提示詞超過 272,000 個 token 後還會跳升,輸入變成 $20.00,輸出變成 $75.00;Opus 5.5 則在其完整的 100 萬 token 視窗內維持 $4.00/$20.00 不變。兩者都提供 128,000 個輸出 token。

算一下長脈絡工作負載實際會產生的費用:一個 180,000 符元的前綴由快取供應,生成 5,000 個符元。在 Opus 5.5 上,這是 180,000 個符元、每百萬 $0.20,約 3.6 美分,加上 5,000 個、每百萬 $20,也就是 10 美分:大約 13.6 美分。在 GPT-6 Astra 上,則是 180,000 個、每百萬 $1.00,也就是 18 美分,加上 5,000 個、每百萬 $50,也就是 25 美分:大約 43 美分。0.84 分的優勢與 3.2 倍的成本差距並非同一類事實,而只權衡前者的採購決策,所權衡的其實是較小的那個數字。

Fable 5.1 從同一家廠商價目表的另一端點出了這件事:在 $10.00/$50.00 的價位上,它的定價與 Astra 完全相同,而它得分 164.82——同樣的價格,比 Opus 5.5 低了 2.53 分。這個指數把 Anthropic 的三個前沿項目放在彼此相差 2.53 分以內,而它的價目表卻把它們的價格拉開到 2.5 倍,這比任何單一排名都更能描述買家眼前實際面對的選擇。

如果你打算為某個數字爭論,就在你自己的流量上爭論。

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

這個指數之所以還值得一讀,在於它是由廠商以外的人所測量的——但這個綜合指數本身的結構,卻決定了爭論的條件。Epoch 的校準、它對難度的估計,以及它如何處理跳過基準測試的模型,全都存在於表格中那個數字的更上游,而這些都不是讀者能從一張截圖重新推導出來的東西。每個廠商的重點宣傳基準測試也是如此,這就是為什麼有用的做法不是在它們之間選邊站,而是在你能掌控的流量上比較它們。

這兩個模型都能透過 OrcaRouter 上的同一組 API 金鑰存取,並以 0% 加成直接傳遞供應商定價:Claude Opus 5.5 為 $4.00/$20.00,快取讀取為 $0.20,而GPT-6 Astra 為 $10.00/$50.00,其超過 272K 的分層費率完全依照供應商設定套用。將同一組提示詞送到兩者只是變更設定,而非再簽一份合約;而在兩者皆有路由的情況下,自動容錯移轉就位於底層,這對於如此貼近雜訊底限的決策至關重要。排行榜可以告訴你這兩個模型無法區分。只有你自己的評估能告訴你,哪一個在你的工作上是無法區分的。

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

什麼會在下個月推動這個數字?

Epoch 的檔案是一份活的文件,有三件事會很快改變判讀。第一是任何新出現、落進前四名的前沿模型評估,因為在分數叢集如此緊密時,單一額外的基準測試觀測值對綜合分數的推動,會比有明顯領先者時更大。第二是信賴區間的漂移——最新的條目擁有最寬的區間,因為它們被評估的重疊基準測試最少,因此九月發布的項目最可能變動,七月的最不可能。第三是某項基準測試達到飽和,而這正是這個指數設計來承受的特定失效情況:當某個組成部分不再具有區分力時,Epoch 會重新加權整體組成,而不是讓模型的優勢隨著測試一起消失。

就目前而言,站得住腳的總結是狹義的那一個。Claude Opus 5.5 以 167.35 分登上 Epoch Capabilities Index 榜首,靠的是 0.84 分的領先差距,而這個差距連它自己的信賴區間都不支持;Claude Sonnet 5.5 已從同一產品線的中階位置爬升到距離領先者 2.15 分以內;而開放權重陣營則落後它們全部超過九分。領先地位在兩家廠商之間是五五波。但它們之間四分的價格差距可不是。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新