
Claude Opus 5.5 對決 Claude Fable 5.1:價格較低的模型贏得獨立指數評比
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Anthropic 現在在其產品陣容頂端販售兩款模型,而價格貴上兩倍半的那一款,並不是排行榜上的第一名。Claude Opus 5.5於 2026 年 9 月 22 日發布,每百萬輸入 token 收費 4 美元、每百萬輸出 token 收費 20 美元,在 Artificial Analysis Intelligence Index 上得分 58。Claude Fable 5.1自 9 月 1 日起便穩居旗艦地位,輸入 10 美元、輸出 50 美元,得分 53。這兩個數字出自同一個評測機構,也都是在同一配置系列下測得,而差距的方向卻與價格標籤相反。這是這篇比較必須從此出發的事實,因為過去一週幾乎每一篇發表報導都把 Opus 5.5 描繪成 Fable 5.1 的折扣版——一款在多數工作上「比得上」昂貴模型的更便宜模型。這項獨立數據卻顯示,折扣款才是領先的那一方。
那是否應該改變你部署的內容,是另一個問題;而答案與其說取決於那五個百分點的差距,不如說取決於兩項沒人會放上標題的設定:每個模型預設採用哪個努力等級,以及哪一個能被調得很快。
獨立的數字,以及它們唯一的共同點

Artificial Analysis 為每個模型只發布一組組態,而這兩者都被標示為「自適應推理、最大努力、預設回退」。相同的標籤、相同的評估器、相同的執行——這讓這場對決成為這兩個模型歷來最純粹的一次正面交鋒:
• 智慧指數 — Claude Opus 5.5 58,在 210 個中排名第 1,相較於 Claude Fable 5.1 53,排名第 4
• 輸出速度 — Claude Fable 5.1 每秒 65.8 個 token,低於排行榜中位數 71.0;相較之下 Claude Opus 5.5 尚未登上排行榜
• 首個詞元產生時間 — Claude Fable 5.1 為 274.43 秒,對比排行榜中位數 3.83 秒;Claude Opus 5.5 尚未公布
• 索引上的冗長程度 — Claude Opus 5.5 產生了 2.6 億個輸出 token,而全體的中位數為 8,800 萬
• 價格 — Claude Opus 5.5 每百萬 $4.00 / $20.00,對比 Claude Fable 5.1 $10.00 / $50.00
那些列中有兩列需要細讀,而非直接引用。第一個是「最大努力」標籤:兩個模型的分數都不反映其出貨預設值,而且這兩個預設值並不相同——詳情見下文。第二個是冗長度那一列,這與 Opus 5.5 的宣傳方式相牴觸。Anthropic 的效率說法是,該模型能用更少的 token 達到相同答案,而發布資料引用合作夥伴指出輸出 token 少了三分之一到一半。在該 Index 上,以實測而非引述來看,Opus 5.5 產生了 2.6 億個 token,而排行榜中位數為 8,800 萬——大約是它所比較的典型模型的三倍多話。這兩件事可能同時成立:它使用的 token 可能比 Claude Opus 5 少,但以絕對值而言仍是個冗長的模型。但如果你是根據「更少 token」那句話來編列預算,而不是根據你自己的帳單,那麼該檢查的是獨立測量的數據。
每百萬多付的6美元能換來什麼

把基準測試拿掉,差別就在於一份價目表。這裡的一切都出自 Anthropic 公開的定價頁面,今天即可查證:
• 輸入 — Opus 5.5 每百萬 $4.00,對比 Fable 5.1 的 $10.00
• 輸出 — 每百萬 $20.00 對比 $50.00
• 快取讀取 — Opus 5.5 每百萬 $0.20,相較之下 Fable 5.1 為 $0.25
• 快取乘數 — Opus 5.5 將快取命中以基礎輸入的 0.05x 計費;Fable 5.1 則以 0.025x 計費,在更高的基礎上提供更優的乘數
• 快取寫入 — 在 Opus 5.5 上,5 分鐘視窗每百萬 $5、1 小時為 $8,而 Fable 5.1 則分別為 $12.50 與 $20
• 批次 API — Opus 5.5 減半至 $2.00 / $10.00;Fable 5.1 減半至 $5.00 / $25.00
• 快速模式 —— Opus 5.5 支援此模式,價格為 $8.00 / $40.00,輸出速度最高可達約 2.5 倍;Fable 5.1 則完全不支援快速模式
快取那一行值得多看兩遍,因為這兩個模型顛倒了慣常的模式。Fable 5.1 的乘數較積極——基本輸入的 2.5%,對比 Opus 5.5 的 5%——但由於它的基準是 $10 而非 $4,以絕對美元計算,它的快取讀取仍是兩者中較貴的。沒有任何配置能讓高階模型在快取內容的每個 token 上勝出。而且乘數並不是你能移植的東西:一個針對 Fable 5.1 快取行為調校過的代理迴圈,在 Opus 5.5 上每次快取命中的比例付費會更高,即使它每個全新 token 的付費更低。
Fast mode 是更銳利的那種不對稱。Anthropic 的文件列出 Claude Opus 5.5、Claude Opus 5 和 Claude Opus 4.8 支援 Fast mode——Fable 5.1 不在該清單上。所以較便宜的模型擁有昂貴模型根本沒有的延遲槓桿,價格為 $8/$40,仍低於 Fable 5.1 標準的 $10/$50 輸出費率。如果你的工作負載互動性夠高,慢速的首個 token 就構成產品問題,那麼請注意,Fable 5.1 實測的首個 token 時間為 274 秒。這個數字是最大努力推理下的產物,而非缺陷,但這就是評估者所記錄下來的數字。
預設值並不一樣,而這正是陷阱所在。
Anthropic 自家的模型文件將這兩個模型並列比較,而決定大多數實際比較結果的那一列並不是價格,而是預設的 effort 等級:medium 用於 Claude Opus 5.5,high 用於 Claude Fable 5.1。兩者都執行無法關閉的自適應思考;深度只能透過 effort 參數控制,其尺度為 low、medium、high、xhigh、max。
這就是為什麼發布標語「Opus 5.5 在大多數工作上與 Fable 5.1 旗鼓相當」和它下方的基準測試表格,看起來彼此矛盾。Anthropic 針對 Opus 5.5 的一對一比較列,經常標註著比預設更高的 effort 設定——Terminal-Bench 4.0 中 66.4% 對上 Fable 5.1 的 55.8% 那項數據,是在 xhigh effort 下跑出來的,而不是 medium。與此同時,Fable 5.1 自己的數字則是在其較高的預設值下產生的。兩個模型在不同 effort 設定下比較,根本算不上是在比較;而 Anthropic 在自家發布資料中也表明了這點,它提醒:在這個能力水準下,基準測試的差距作為現實世界差異的指引,並不如分數本身所暗示的那麼可靠。
實際上,這讓這個決定變成了一項調校工作,而不是單純的選擇。如果你從 Fable 5.1 換到 Opus 5.5,卻原封不動地沿用你的 effort 設定,就等於在不知不覺中改變了模型思考的份量,之後產出的每一個品質與成本數字都會受到混淆。Anthropic 的建議是測試多個 effort 層級,而不是直接沿用舊模型的設定。這件事做起來成本很低,卻幾乎沒有人這麼做,因為那意味著你得把自己的評估跑兩次。
這對組合唯一真正發揮價值的地方
讓兩者都值得保留的模式,就是顧問迴路:由 Opus 5.5 動手做事,遇到困難決策時再諮詢 Fable 5.1。Anthropic 實測過,這確實能提升準確度——代價是更高的成本與延遲,而這正是把較慢的模型放進迴路時預期會有的取捨。改變的是這套做法背後的算盤。當能力差距更大時,花 $10/$50 去監督一個 $5/$25 的執行者,顯然是值得的。如今在獨立指數上,執行者的分數已經高於顧問,顧問的貢獻就收窄到那些它自家評估能勝過 Opus 5.5 的特定任務,而那些任務得由你自己辨識出來。對困難的子集來說,這個迴路仍然合理;但作為一體適用的通用設定,它就不再有道理了。
兩者都只差一個按鍵
這裡真正讓團隊栽跟頭的遷移細節,不是 API 介面——而是這些都是同一家廠商的模型,卻有不同的 effort 等級、不同的快取倍率和不同的預設設定,而要誠實比較,就得在相同配置下用你自己的提示詞把兩者都跑一遍。Claude Opus 5.5 已上架 OrcaRouter,採用 Anthropic 自家的 $4.00 / $20.00,而Claude Fable 5.1 也在 OrcaRouter 上,價格為 $10.00 / $50.00——供應商定價原樣傳遞、0% 加成,所以只要 Anthropic 調價,這兩個數字當天就會跟著變動,而且兩者都不需要第二份合約或第二套 SDK。

這正是讓這種分工切實可行、而非流於理論的原因。把大部分流量送往 Opus 5.5,並釘選一條將真正棘手的案例升級至 Fable 5.1 的路由規則,只是在單一端點上的一項設定,而不是兩套整合;而組合一次呼叫、讓一個模型負責起草、另一個負責驗證,也只是 routing-DSL 的一行程式碼,而不是你得自行建置與維護的管線。如果升級路徑最後證明不適合你的工作負載,自動容錯移轉會讓請求落在你已經充分掌握其特性的模型上,而不是直接失敗。
什麼能讓它塵埃落定
這個比較最誠實的現況是:Anthropic 公布了其中一份表格,顯示較便宜的模型在大多數項目中勝出;Artificial Analysis 公布了另一份表格,顯示它全面勝出;而兩者都是在你不會實際部署的 effort 設定下跑出來的。這兩者都不是在預設值一致情況下的受控正面對決,也沒有任何第三方做過這樣的測試。在這些前提下依然成立的差距——Claude Opus 5.5 在價目表的每一行都實質上更便宜、支援 Fable 5.1 所沒有的快速模式,而且在兩者唯一共同擁有的獨立評分上也並未落後——已經大到讓舉證責任轉移了。如果你預設使用 Fable 5.1,問題已不再是 Opus 5.5 是否夠好;而是你的工作負載中,哪些特定任務會在 medium effort 下失敗,因為那些才是你唯一在為其支付溢價的任務。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
