
Claude Opus 5.5 以 0.84 分登上 Epoch Capabilities Index 榜首
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
這個數字是 0.84。Claude Opus 5.5在我們於 2026 年 10 月 2 日讀取的檔案中,以 167.35 分位居 Epoch Capabilities Index,而GPT-6 Astra則為 166.51 分——在這個尺度上,兩款模型已公布的 95% 區間幾乎完全重疊,Opus 5.5 是 164.0 到 172.0,Astra 則是 163.14 到 171.05,差距還不到一分。在她們之下,Claude Sonnet 5.5拿下 165.2 分,Claude Fable 5.1則是 164.82 分,因此在一個由五十多項基準測試構成的獨立綜合指標上,前四名之間只相差 2.53 分,其中三個還掛著同一家廠商的名字。就點估計確實有高低次序這層意義而言,這個排名是真實的。但就 0.84 分的領先能撐過自身誤差範圍這層意義而言,它並不真實;而關於這份排行榜,一切值得一說的事都源自同時掌握這兩項事實。
指數是什麼,以及0.84點不是什麼
Epoch Capabilities Index 並非廠商排行榜。它由獨立研究機構 Epoch AI 建構,是一項複合指標,把超過五十個不同基準測試的分數拼合成單一通用能力量表,並從恰好同時出現在數個基準測試上的模型,推斷各基準測試的相對難度。其方法論載於一篇與 Google DeepMind AGI Safety & Alignment 團隊研究人員合寫、由 DeepMind 資助的論文,但 Epoch 明白表示,該指數是自家產品,且擁有其完整權利——當資助來源與某項分數的發布者並非同一方時,這項區別值得保留。程式碼是公開的。
這個量表的兩項特性,比表面上的頭條更為重要。第一,ECI 是刻意採用錨定而非絕對尺度:原始分數會經過重新縮放,使 Claude 3.5 Sonnet 落在 130、GPT-5 落在 150,這意味著這個指數上的某個數字,只有和同一份檔案中的另一個數字並列時才有意義,單獨來看則毫無意義。第二,這個指數沒有上限。沒有所謂的 100 可以逼近,因此「指數最高點」只是在陳述某個日期,而不是在說任何人已達到的極限。
這就是為什麼,對 167.35 對上 166.51 的誠實解讀並不是「Claude Opus 5.5 是世界上能力最強的模型」。它更狹隘,也更難以引用:根據 Epoch 對 2026 年 10 月 2 日可得證據所做的建模,這兩款模型在頂端難以區分,而它們之間的排序只是平手時的裁決,而不是一項量測。所公布的區間直接說明了這一點——164.0 到 172.0 與 163.14 到 171.05 的絕大部分範圍彼此重疊。任何把 0.84 當作定論來引用的人,引用到的都只是四捨五入的產物。
Anthropic 區塊,以及發布的規模
表格中更具資訊價值的不是誰排在第一位。而是第三列與第四列。九月二十八日發佈、得分 165.2 的 Claude Sonnet 5.5,比九月一日發佈、得分 164.82 的 Claude Fable 5.1 高出 0.38 分——差距小到兩者在實際上可視為同一名次,也小到這對組合僅以 2.15 分之差落於榜首之下。Sonnet 是 Anthropic 產品線中的中階產品,而 Fable 則是該公司歷來指向通用推理工作的模型;如今這兩者雙雙從緊貼前沿之下的位置包夾前沿,這才是本次更新中實質性的變化,其意義勝過誰是領先者。
Anthropic 自身的世代躍進也可見一斑。Claude Opus 5.5 是 Claude Opus 5 的後繼者,Epoch 給 Claude Opus 5 的評分為 162.94,區間為 160.2 至 166.7。這是在大約兩個月內、從 7 月 24 日發布到 9 月 22 日發布所帶來的 4.41 分進步——比今日第一名與第二名之間相隔的 0.84 分還要大。這樣看來,這張表中有趣的量是單一廠商線內部的斜率,而不是頂端兩家廠商之間的差距。
開源權重的界線在哪裡
Epoch 依可及性區分模型,讓開放權重界線清楚可辨,無須猜測。最佳的開放權重入選者是 Kimi K3,得分 157.61,日期為 7 月 16 日,標示為非商業性。其後是 DeepSeek V4 Pro 0813(155.38)與 DeepSeek V4.1 Flash(155.0),兩者皆無限制,接著是 GLM-5.3-Flash(151.94)與 GLM-5.2(151.78)。因此,最接近榜首的開放模型落後 9.74 分——這個差距比第一名與第二名之間的差距寬十八倍,而且寬到這些區間根本遠遠碰不到彼此。
那種不對稱是這張表裡唯一持久的發現。閉源前沿是在三分之內的一場混戰;而從閉源前沿到最佳可下載權重的距離,卻大了一個數量級。一個能讓你跨評測世代進行比較的綜合指數,正是察覺這件事的工具,因為它能在七月和九月說出同一件事,而不是回報某個正在飽和的評測基準已經沉寂無聲。
有幾個鄰近的列值得固定下來作為脈絡,因為它們才是讀者實際上會拿來與 Opus 5.5 權衡比較的模型:
• Claude Sonnet 5 — 156.34,於6月30日發布,區間為 153.61 至 158.81
• Grok 4.6 — 156.61,於8月12日發布,區間為154.66至158.93
• Gemini 3.8 Flash — 156.93,發布於 9 月 2 日,區間 154.64 至 160.42
• Muse Spark 1.3 — 156.86,於9月2日發布,區間為154.73至159.56
• GPT-5.6 Sol — 161.8,於7月9日發布,區間 159.26 至 165.26
索引位置不是帳單

在這裡,排行榜不再是全貌,因為位居頂端的兩個模型成本完全不在同一個檔次。從我們自己的目錄來看,兩者都以供應商的定價列出,沒有任何加價,Claude Opus 5.5 為 $4.00/$20.00,快取讀取為 $0.20,以及 GPT-6 Astra 為 $10.00/$50.00,快取讀取為 $1.00,兩者在費率表的兩個方向都相差 2.5 倍。Astra 在提示詞超過 272,000 個 token 後還會跳升,輸入變成 $20.00,輸出變成 $75.00;Opus 5.5 則在其完整的 100 萬 token 視窗內維持 $4.00/$20.00 不變。兩者都提供 128,000 個輸出 token。
算一下長脈絡工作負載實際會產生的費用:一個 180,000 符元的前綴由快取供應,生成 5,000 個符元。在 Opus 5.5 上,這是 180,000 個符元、每百萬 $0.20,約 3.6 美分,加上 5,000 個、每百萬 $20,也就是 10 美分:大約 13.6 美分。在 GPT-6 Astra 上,則是 180,000 個、每百萬 $1.00,也就是 18 美分,加上 5,000 個、每百萬 $50,也就是 25 美分:大約 43 美分。0.84 分的優勢與 3.2 倍的成本差距並非同一類事實,而只權衡前者的採購決策,所權衡的其實是較小的那個數字。
Fable 5.1 從同一家廠商價目表的另一端點出了這件事:在 $10.00/$50.00 的價位上,它的定價與 Astra 完全相同,而它得分 164.82——同樣的價格,比 Opus 5.5 低了 2.53 分。這個指數把 Anthropic 的三個前沿項目放在彼此相差 2.53 分以內,而它的價目表卻把它們的價格拉開到 2.5 倍,這比任何單一排名都更能描述買家眼前實際面對的選擇。
如果你打算為某個數字爭論,就在你自己的流量上爭論。

這個指數之所以還值得一讀,在於它是由廠商以外的人所測量的——但這個綜合指數本身的結構,卻決定了爭論的條件。Epoch 的校準、它對難度的估計,以及它如何處理跳過基準測試的模型,全都存在於表格中那個數字的更上游,而這些都不是讀者能從一張截圖重新推導出來的東西。每個廠商的重點宣傳基準測試也是如此,這就是為什麼有用的做法不是在它們之間選邊站,而是在你能掌控的流量上比較它們。
這兩個模型都能透過 OrcaRouter 上的同一組 API 金鑰存取,並以 0% 加成直接傳遞供應商定價:Claude Opus 5.5 為 $4.00/$20.00,快取讀取為 $0.20,而GPT-6 Astra 為 $10.00/$50.00,其超過 272K 的分層費率完全依照供應商設定套用。將同一組提示詞送到兩者只是變更設定,而非再簽一份合約;而在兩者皆有路由的情況下,自動容錯移轉就位於底層,這對於如此貼近雜訊底限的決策至關重要。排行榜可以告訴你這兩個模型無法區分。只有你自己的評估能告訴你,哪一個在你的工作上是無法區分的。

什麼會在下個月推動這個數字?
Epoch 的檔案是一份活的文件,有三件事會很快改變判讀。第一是任何新出現、落進前四名的前沿模型評估,因為在分數叢集如此緊密時,單一額外的基準測試觀測值對綜合分數的推動,會比有明顯領先者時更大。第二是信賴區間的漂移——最新的條目擁有最寬的區間,因為它們被評估的重疊基準測試最少,因此九月發布的項目最可能變動,七月的最不可能。第三是某項基準測試達到飽和,而這正是這個指數設計來承受的特定失效情況:當某個組成部分不再具有區分力時,Epoch 會重新加權整體組成,而不是讓模型的優勢隨著測試一起消失。
就目前而言,站得住腳的總結是狹義的那一個。Claude Opus 5.5 以 167.35 分登上 Epoch Capabilities Index 榜首,靠的是 0.84 分的領先差距,而這個差距連它自己的信賴區間都不支持;Claude Sonnet 5.5 已從同一產品線的中階位置爬升到距離領先者 2.15 分以內;而開放權重陣營則落後它們全部超過九分。領先地位在兩家廠商之間是五五波。但它們之間四分的價格差距可不是。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
