
Claude Sonnet 5.5 在 Epoch Capabilities Index 上追平 Claude Fable 5.1
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
排行榜榜首出現並列,通常是榜上最無趣的事。這次是例外,因為並列榜首的兩個模型,成本並不相同。在 2026 年 10 月 1 日更新的 Epoch Capabilities Index 檔案中,Claude Sonnet 5.5 與 Claude Fable 5.1 的分數都是 165——在 253 個追蹤模型中排名第三與第四——落後 Claude Opus 5.5 與 GPT-6 Astra 兩分,而這兩者本身以 167 分並列,並領先 Claude Opus 5(163 分)兩分。Claude Sonnet 5.5 於 2026 年 9 月 28 日推出,價格為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。Claude Fable 5.1 於 9 月 1 日推出,價格為 10 美元與 50 美元。單一數字顯示,兩者在一般能力上可互換。五倍的輸出價格則說明它們並非如此。這兩種說法都成立,而它們能同時成立的原因,正是這張表上沒有人引用的那一部分。
這個指數實際上是什麼,以及是由誰在衡量
ECI 並不是供應商的計分板。它由獨立研究機構 Epoch AI 打造,是一項複合指標,把五十多個不同基準測試的分數拼接成單一的通用能力量表,並從那些恰好同時出現在好幾個基準測試上的模型,推斷各基準測試的相對難度。其方法論載於一篇論文《A Rosetta Stone for AI Benchmarks》,該研究由 Google DeepMind 資助,並與其 AGI Safety & Alignment 團隊的研究人員共同撰寫——但 Epoch 明白表示,這項指數是它自家的產品,它對其擁有完整權利,而擬合程式碼是公開的。當研究的資助方與分數的發布方並非同一方時,這項區別就顯得重要。
一個數字在其上可以如何被解讀,取決於兩項特性。第一,ECI 採用錨定而非絕對值:原始數值會被重新縮放,使 Claude 3.5 Sonnet 落在 170,而 GPT-5 落在 150,這意味著一個數字唯有與同一份檔案中的另一個數字並列,才有意義。第二,它沒有上限。沒有 170 可以逼近,所以「名單頂端」說的是時間,而不是任何人已達成的成就。
第三個特性,正是把平手變成一段故事的那個特性。每個分數旁公布的區間——90% bootstrap 區間,透過對每個模型自身觀測到的基準測試結果重新抽樣五百次所建構——在 165 這個分數上,兩個模型完全相同:Claude Sonnet 5.5 是 162 到 169,Claude Fable 5.1 也是 162 到 169。但產生這些區間的計數卻不是。Claude Sonnet 5.5 的 165 是從 11 次基準測試評估擬合出來的。Claude Fable 5.1 的則是從 20 次擬合出來的。
為什麼相同的區間並不代表相同的證據
ECI 至少需要四次基準評測,模型才會被評分,因此這兩個數字都輕鬆通過門檻。但區間所陳述的是模型自身結果的分散程度,而不是結果的數量——這就是為什麼兩個模型可以在相同的點估計周圍得出相同的區間,即使其中一個所依據的證據大約只有一半。若把兩個 165 視為同樣穩固,你就是把該區間解讀成一種它實際上並非的樣本數校正。
不對稱性對時機有實際影響。每當有新的評估結果出現時,Epoch 都會在所有資料上聯合重新擬合整個模型,因此某個模型的數字可能變動,即使該模型本身毫無改變。擁有 11 筆觀測值的模型,比起擁有 20 筆的模型有更大的變動空間,這使得 Claude Sonnet 5.5 在下一版修訂中,是兩者中較可能出現變化的一方——無論往哪個方向。
Epoch 本身對當前讀數的詮釋,比它所衍生出的新聞標題來得狹窄。該組織對這次更新的摘要,開頭先講 Claude Opus 5.5 以 167 分拿下榜首,微幅領先 GPT-6 Astra,第二句則用來交代 Claude Sonnet 5.5 在 165 分「大致追平」Claude Fable 5.1 這件事。「大致追平」是關鍵措辭,而公布的信賴區間正是這個說法恰當的原因。
這兩個設定檔實際上分歧的地方

在綜合分數上持平,並不代表在各個部分上也持平。Epoch 會在各個模型頁面上發布每項基準的個別面板,而有六項基準同時出現在 Claude Sonnet 5.5 頁面和 Claude Fable 5.1 頁面上——這使得它們成為唯一六項能直接從該索引本身取得同類比較的基準。
• 懸疑遊戲謎題 — Claude Sonnet 5.5 65% Claude Fable 5.1 58%
• FrontierMath 第 1–3 級(v2)— Claude Sonnet 5.5 89% 對比 Claude Fable 5.1 90%
• FrontierMath 第 4 級(v2)— Claude Sonnet 5.5 80% 對比 Claude Fable 5.1 88%
• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% 對 Claude Fable 5.1 100%
• 家具組裝基準測試 — Claude Sonnet 5.5 75% 對比 Claude Fable 5.1 70%
• SimpleQA Verified — Claude Sonnet 5.5 47% 對比 Claude Fable 5.1 71%
在如此擁擠的一項綜合指標上,四個百分點的上下擺動,而底層的分歧根本算不上對稱。Claude Sonnet 5.5 在偏遊戲性質與多模態的工作上領先——解謎、實體組裝——並在競賽數學上打成平手。Claude Fable 5.1 在 FrontierMath 最難層級上領先 8 個百分點,並在 SimpleQA Verified 上領先 24 個百分點;後者是世界知識題組,其中 47% 對上 71% 的差距,是共同評測組合中最大的單一落差。在這兩款模型之間做選擇的買家,並不是在選擇同一種能力的兩種讀數;他們是在選擇一款較便宜、在某些工作上更強的模型,與一款較昂貴、在其他工作上更強的模型,而一般能力指數卻無意將兩者區分開來。
Epoch 的指數也明確表示,在單一基準上的領先不一定會反映在綜合結果中。基準並非依準確度加權,而一個專精化的模型即使在個別測試中領先,也可能得分低於型態不同的對手——其文件直接這麼說。這不是被開脫的缺陷;這正是涵蓋五十多項測試的綜合評比存在的目的。
這兩具獨立儀器指向相反的方向

市面上還流傳著第二項獨立測量,而在這兩個模型之中哪一個領先的問題上,它與第一項並不一致。在 Artificial Analysis Intelligence Index 上,我們自家目錄為這兩個模型所載的數字顯示:Claude Sonnet 5.5 為 56,Claude Fable 5.1 為 53.4;兩者取自該指數的同一修訂版本,因此也涵蓋同一批受評估模型的樣本。兩者相差三分,且有利於較便宜的那個模型——而 Epoch 卻把它們讀成完全相同。
這兩種解讀都沒有錯,而使用它們的方式,就是留意它們在哪些地方不一致。這兩個指數涵蓋不同的基準測試集,並以不同方式加權;Epoch composite 的設計是為了在基準測試飽和時仍能成立,而 Artificial Analysis 指數則是對另一個不同組合的直接匯總。當一對模型如此接近時,選擇哪個工具比所測量的差距更有價值。想從兩個相鄰數字中找出較強者的讀者,應該看上方共同個別基準測試的面板,而不是任何一個頭條數字,因為那是唯一讓兩個模型在同一項測試中相互比較的地方。
還有一項脈絡是這個綜合指標並未承載、而 Epoch 有承載的:發布日期。Claude Fable 5.1 在今日追蹤的 253 個模型中排名第四。在它自己於 9 月 1 日發布之時,它在當時追蹤的 247 個模型中排名第一。它的權重未曾改變。前沿只是在一個月內就超越它六個名次——這正是整張表的樣貌,也是為什麼每月一次的指數讀數是快照,而非定論。
差異的代價是什麼,以及便宜的一方在哪裡

在一般能力上處於同一水準,而輸入相差 2.5 倍、輸出相差 5 倍,就是這份解讀的全部實際內容。這兩個模型都收錄在我們自家的目錄中—— anthropic/claude-sonnet-5.5 每百萬輸入 2.00 美元、每百萬輸出 10.00 美元,快取讀取 0.20 美元;而 anthropic/claude-fable-5.1 則是 10.00 美元與 50.00 美元,快取讀取 0.25 美元——兩者都按供應商本身的定價原樣傳遞,不額外加價,因此供應商的價格變動在他們那邊生效的同一天,也會反映到我們這邊。
真正關鍵的是重複發生的頻率,而非帳面上的標題數字。假設有個工作負載每天從快取送出 120,000 個 token 的前綴,並產生 8,000 個 token 的輸出,持續執行一個月。在 Claude Sonnet 5.5 上,該前綴的 120,000 個 token 以每百萬 $0.20 計價,約 2.4 美分,加上 8,000 個 token 以每百萬 $10 計價,為 8 美分——每次執行約 10.4 美分,三十天下來約 $3.12。在 Claude Fable 5.1 上,同樣的前綴是 120,000 個 token 以 $0.25 計價,為 3 美分,加上 8,000 個以 $50 計價,為 40 美分——每次執行約 43 美分,整個月為 $12.90。兩個模型都提供相同的 1M token 上下文視窗,輸出上限皆為 128K,因此差異在於價目表,而非上限。
相對於此,這六項共同基準測試則說明了多花的錢究竟往哪個方向買到東西。若團隊的工作性質接近 FrontierMath Tier 4 或開放式事實回憶,他們多付四倍價錢,買到的是那些測試上貨真價實的 8 到 24 分差距;若團隊的工作性質接近解謎或多模態組裝,則是花較小的數字、往另一個方向買到 5 到 7 分。在單一平台上,這並不是兩個各自獨立的採購決策。兩個模型都位於超過 200 個模型中的同一把 API 金鑰之後,因此要拿自家流量來比較兩者,只是改個設定,而不是多簽一份合約;而在兩者都有路由的地方,底下還有自動容錯移轉——當兩套獨立工具對誰領先看法不一時,這點就格外重要。
什麼會讓這個讀數變動?
有三件事會改變它,而其中只有一件牽涉到這兩個模型中的任一個。
首先是更多基準評估。Claude Sonnet 5.5 於四天前進入該指數,背後已有 11 項評估;每一項額外評估都會縮小其區間,也可能使其點估計值移動,而聯合重新擬合意味著這種移動不會只侷限於新增的那一列。
第二點是另一個前沿模型的到來。前四列橫跨四個點,而該範圍內有兩組並列,因此一個經過充分評估的新進者會落在這個群集內,而不是落在其下方——而且這四者所公布的區間彼此重疊,意味著它們之間的排序只是平手時的決勝依據,而非一項測量。
第三個是模型本身的價格,而這是沒有任何指數會追蹤的。這篇文章所緊扣的落差,是一道價目表落差:2 美元與 10 美元,對比今日的 10 美元與 50 美元。任一張價目表的變動都會左右決策,卻不會動到任何一項能力分數。
站得住腳的結論是那個範圍較窄的說法。在 Epoch AI 的綜合指標中——一份於 2026 年 10 月 1 日更新的檔案——Claude Sonnet 5.5 與 Claude Fable 5.1 是同一個數字:165,並列第三,公布的區間完全相同,但各自所依據的證據量不同。在 Artificial Analysis 另一套獨立工具上,同樣這兩個模型相差三分。在該指數直接比較兩者的六項基準測試中,它們是依領域互有領先,而非平分秋色。而在價目表上,兩者根本相去甚遠。這個解讀唯一無法支撐的,正是它最可能被引述成的那句話:這兩個模型是相等的。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
