
Claude Sonnet 5.5 對決 Claude Fable 5.1:較便宜的模型領先三分
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 983 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
Claude Sonnet 5.5 於 2026 年 9 月 28 日問世,每百萬輸入 token 收費 2.00 美元,每百萬輸出 token 收費 10.00 美元。而廠商於 9 月 1 日推出的 Mythos 級模型 Claude Fable 5.1,在同樣這兩項計價上分別是 10.00 美元與 50.00 美元。一個很誘人的總結是:Fable 5.1 是比較貴的那個,因此也是比較好的那個;但在 Artificial Analysis Intelligence Index 上,排名卻恰恰相反:Claude Sonnet 5.5 得分 56,Claude Fable 5.1 得分 53。這不是四捨五入造成的假象,但這也並非全貌,因為同一個評測機構在同一套測試中,把兩者每項任務的成本差距壓在三分錢以內——7.60 美元對 7.63 美元。價目表上五倍的差距,等到一項任務完成時,幾乎已消失無蹤。剩下的,是一組形狀上的差異,而非分數上的差異;而要在這兩者之間做選擇,主要取決於你的工作負載是哪一種形狀。
兩張費率表,以及唯一一行差距不是五倍之處
逐 token 的比較極為鮮明,無需任何解讀。
• 輸入 — Claude Sonnet 5.5 每百萬個詞元 $2.00,相較於 Claude Fable 5.1 的 $10.00,相差五倍
• 輸出 — 每百萬 $10.00 對比 $50.00,再次恰好是五倍
• 快取讀取 — 每百萬 $0.20 對比 $0.25。這是支撐長時間代理執行的項目,而折扣從 5× 驟降至 20%
• 快取寫入 — 標準五分鐘視窗下,每百萬 $2.50 對比 $12.50,是兩張卡上最大的單一差距
• 批次 — Anthropic 的批次模式套用於這兩張卡的方式,與套用於 Fable 5.1 的方式並不相同:Fable 5.1 推出時,批次定價即減半,輸入為 $5.00、輸出為 $25.00。在你假設這能沿用到整個系列之前,請先到 Anthropic 自家的定價頁面上讀一讀批次那一行
• 上下文與上限 — 兩者皆具備 1,000,000 個詞元的上下文,以及 128,000 個詞元的最大輸出量。在 Message Batches API 上,Claude Sonnet 5.5 在 output-300k-2026-03-24 beta 標頭下支援最高 300,000 個輸出詞元,這對大量生成而言是實實在在的上限差異,而非行銷話術。
有一項對 Claude Sonnet 5.5 有利的微小優點,是價目表所低估的。Anthropic 報告指出,這個模型完成相同工作通常所需的 token 遠比前代少,並稱這相當於每項任務成本最多降低 30%。那是關於另一組比較——Sonnet 5.5 對 Sonnet 5——的廠商說法,並非關於這次對決的證據。然而,這正是解釋獨立測量所發現結果的機制。
五倍價差的去向
Artificial Analysis 於 2026-09-29 在同一套測試框架、同一個設定標籤「自適應推理、最大努力、預設回退」下,以 Intelligence Index v4.3 對這兩個模型進行評測。兩項主要數字分別是 Claude Sonnet 5.5 的 56 與 Claude Fable 5.1 的 53——較便宜的那個模型領先約 3 分,而在這把量尺上,同一評測者將中位數模型置於 26。兩者在同一頁面上都以廠商名稱標示,因此這是同一套工具、同一份快照,而不是兩份。
接著是成本欄,以及這個配對之所以有趣、而非顯而易見的原因。在同一次索引執行中,Claude Sonnet 5.5 每項任務花費 $7.602633,而 Claude Fable 5.1 花費 $7.629706。兩者相差二十七千分之一美元。拆解之後才是奇怪的地方:光是 Claude Fable 5.1 的輸入部分,每項任務就要 $3.73,相較於 Sonnet 5.5 小得多的輸入元件,而它的推理權杖光是本身,每項任務就花費 $2.36。那個每權杖便宜五倍的模型,換算成每項完成的任務,根本一點也沒有比較便宜。
原因在於量,而這兩個模型失效的方向恰好相反。
• 在索引套件中的輸出 token 數——Claude Sonnet 5.5 產生了 410,577,501,而 Claude Fable 5.1 為 188,465,663,在該套件中,追蹤的中位數為 8,800 萬。兩者都遠高於中位數;Sonnet 5.5 是 Fable 5.1 的兩倍以上,且幾乎是中位數的五倍
• 每項任務的輸出 token 數——Sonnet 5.5 為 192,838,Fable 5.1 為 78,111;其中推理部分分別佔 142,386 與 47,240。Sonnet 5.5 每項任務的思考時間大約是 Fable 5.1 的三倍
• 整個索引套件的輸入 token 用量——Sonnet 5.5 為 185 億,對比 Fable 5.1 的 56 億。Sonnet 5.5 的讀取量是對方的三倍,這是兩者中較不起眼的數字,卻也是實際吃掉較便宜輸入費率的那一個
• 在輸入:快取讀取:輸出為 7:2:1 的混合比例下,混合價格為——Sonnet 5.5 是 $1.54,而 Fable 5.1 則是 $7.17。這一行符合費率卡,也正是描述輸出簡短且範圍明確之工作負載的那一行。
把這些放在一起看,誠實的說法是這樣:混合價格差距是真的,而每項任務的差距則不是。這兩個數字中哪一個能描述你的帳單,完全取決於你的任務是會終止,還是會漫無邊際地拖延下去,而這套索引套件正是為了讓它們漫無邊際地拖延下去而打造的。
努力階梯才是真正的決策
兩個模型都提供一個投入程度參數——低、中、高、極高、最大——且兩者都在 2026 年 9 月 29 日於每一個檔位進行了測量。這是比較中任何價目表都無法表達的部分,因為便宜模型在較低檔位時,以大幅差距勝過處於較低檔位的昂貴模型,而昂貴模型只有在接近頂端時才拉開差距。
• 低強度 — Claude Sonnet 5.5 每項任務得分 35.84,費用 $0.41;Claude Fable 5.1 得分 46.82,費用 $2.37。在最低階層級,昂貴的模型領先十一分,代價卻是將近六倍的費用
• 中等投入——花費 $0.59 得 40.74,對比花費 $2.98 得 48.92。Fable 5.1 以五倍成本保持八點領先
• 高投入 — 以 $1.08 達到 46.74,對比以 $3.91 達到 51.15。差距縮小至四點五分;成本比維持在約 3.6×
• Xhigh 努力 — 以 $2.74 換得 51.85,對比以 $5.98 換得 53.20。相差一又三分之一分,價格卻只要 46%
• 最大努力 — 在 $7.60 下為 55.98,相較於在 $7.63 下的 53.35。排序反轉,成本收斂至半個百分點以內
將第四列與第五列放在一起看,這場對決的輪廓就浮現了。Claude Sonnet 5.5 在 xhigh 下交出 51.85 的成績——只差 Claude Fable 5.1 在任何推理投入程度下的最佳分數 1.5 個指數點——每項任務要價 $2.74,對比之下則是 $7.63。如果你的工作需要的是接近前沿,而非身處前沿,那一列就是全部的答案,而且每完成一項任務能省下 64%。把 Sonnet 5.5 推到 max,你會用 2.8 倍的費用換來多 3 分,讓你落在與 Fable 5.1 的 max 相同的帳單上,分數略好一些,但推理特性卻截然不同。
最後一句話值得好好確定下來,因為它反直覺到值得再三確認。在相同的 max effort 設定下,費率表便宜五倍的模型,每項任務的成本竟與費率表昂貴的模型相同。它是靠輸出 2.5 倍的 token 來達成,而其中推理所佔的比例又是三倍大。Anthropic 自家的文件解釋了部分機制:tokenizer 已改變,同樣的文字在 Claude Sonnet 5.5 上會比在較早的模型上多產生約 30% 的 token。這是幾項促成因素之一,也提醒我們:若不加以說明,輸出 token 數在不同 tokenizer 修訂版本之間並不具可比性。
延遲就是這兩者不再彼此相似的地方
分數收斂並不延伸到時間層面。在同一份 2026-09-29 快照中,Artificial Analysis 報告指出,在長提示切片上,Claude Fable 5.1 的首個 token 時間為 254.41 秒,Claude Sonnet 5.5 則為 2.80 秒;兩者的中位輸出速度分別為每秒 67.9 與 49.4 個 token。這代表呼叫方在收到任何內容之前所需等待的時間相差兩個數量級,而這是這項比較中在營運上最具關鍵影響的單一數字。
這兩個數字都需要清楚說明其限定條件。Fable 5.1 的 TTFT 是在長提示類型上測得的;同一模型在同一天的中等提示切片為 117.60 秒,因此 254 秒這個數字是尾端值,並非固定不變的常數。Sonnet 5.5 的 2.80 秒是其整體中位數,而評估器自身的變異範圍則從第五百分位的 1.91 秒到第九十五百分位的 4.23 秒。Anthropic 的平台文件將 Fable 5.1 的相對延遲描述為較慢,並將 Sonnet 5.5 的描述為快速,這在方向性上一致,但並非一項測量值。
我們自己的基礎設施提供了第三種讀數,因為我們路由 Claude Fable 5.1,並量測我們實際提供的內容。在截至 9 月 28 日的七天內,就 OrcaRouter 自身的流量而言,Claude Fable 5.1 的首個 token 中位數為 6,973 毫秒,第 95 百分位數為 10.0 秒,輸出速度為每秒 65.8 個 token,錯誤率為 0.349%。那個 p50 比評估器的長提示數字快超過一百倍,這與其說是矛盾,不如說是名詞定義問題:面向開發者、短提示下的首個 token,與基準測試、長提示下的首個 token,是不同事物的量測。任何依據排行榜數字做規劃的人都應該知道自己買到的是哪一個。

採購誠信、留存,以及無人提及的移轉
廠商基準測試表與獨立評估是不同的量尺,絕不應互相相減。Anthropic 針對 Claude Sonnet 5.5 的自家發布表格回報 Terminal-Bench 4.0 為 70.6%。Artificial Analysis 使用自家的測試框架,對同名評估中的同一模型回報 63.6%。就 Claude Fable 5.1 而言,差距方向相反:Anthropic 在發布時回報 55.8%,而獨立測試框架的讀數為 52.0%。這兩組數字都不是對彼此的修正。應各自依其自身標準來評判;當你決定要將正式環境流量導向何處時,請優先採用獨立的那一項。
資料保留的立場也有所不同,而這種差異只有在前採購審查中才會顯現。Anthropic 表示,Claude Sonnet 5.5 以零資料保留的形式提供,與其對 Opus 5.5 和 Sonnet 5 採取的立場相同。Claude Fable 5.1 的發布資料描述了與其並行的漸進式資料使用政策,以及 Project Glasswing 下的一項獨立部署,該部署帶有預設 30 天的保留窗口以進行安全監控,而零保留安排則被描述為過渡狀態。如果你的團隊需要接受資料處理審查,這項區別就是一個實實在在的項目,而非註腳,值得閱讀 Anthropic 目前的政策頁面,而不是任何對它的摘要,包括這一份。
遷移成本的不對稱性,鮮少會出現在上線報導中。移轉到 Claude Sonnet 5.5 並不是改個模型字串而已。Anthropic 的遷移指南指出,非預設的 temperature、top_p 與 top_k 值現在會回傳 400 錯誤,tool_choice 設為 any 或指定具名工具會被直接拒絕,而若你原本是在關閉前置思考的情況下執行,thinking: {"type": "disabled"} 必須改成 between_tools。between_tools 類型在 low、medium 與 high effort 下會被接受,但在 xhigh 或 max 時會回傳 400。在 Claude API 與 Google Cloud 上,computer use 僅能透過 computer_toolset_20260801 工具集支援;較舊的 computer_20251124 會被拒絕。這些都不適用於移轉到 Claude Fable 5.1,那是從 Fable 5 進行的同系列升級,本身帶有三項破壞性變更。如果你正把這兩者當作平行的遷移目標來權衡,那麼較便宜的模型反而是採用成本較高的那一個。

哪一個要放在哪裡
從這些數字得出的決定,是一項關於你的流量中有多少是範圍界定明確的決定。
• 有界、高頻、工具驅動的工作 —— Claude Sonnet 5.5,若你需要貼近前沿,就以 xhigh 投入度運行。它落後 Fable 5.1 的最佳表現一個半指數點,但每個完成任務的成本低了 64%,約三秒即回傳首個 token,而其更便宜的快取寫入費用讓重建的上下文前綴變得可負擔
• 長時程、開放式的工作,一旦答錯代價高昂 —— Claude Fable 5.1。它以相同的每項任務成本,達到 Sonnet 5.5 的最高分,卻僅需三分之一的推理 token 與四分之一的輸入,當任務確實是開放式、且評測套件的形態與你的問題相似時,這一點格外重要。
• 受延遲制約的互動介面 — Claude Sonnet 5.5,而且差距相當懸殊。在評估者自家的快照上,長提示詞類型的首個 token 差距達兩個數量級,而中提示詞的讀值也只把差距縮小到約 118 秒。若不透過批次處理或串流來繞開,就無法以 Fable 5.1 的那個數字建構聊天介面
• 大量生成與長輸出 — Claude Sonnet 5.5,因為在 output-300k-2026-03-24 標頭後方的 Message Batches API 上,可使用 300,000 個 token 的輸出上限,而其他所有地方的上限為 128,000 個 token。在確定採用前,請先確認您的批次定價;批次費率在兩張定價卡上並不完全相同
• 必須跨帳戶進行,或在系統之間移交推理的工作——在兩者之前,請先閱讀 Anthropic 的 preserved-thinking 文件。Thinking blocks 會綁定到產生它們的模型與帳戶,而 Sonnet 5.5 是第一款內建分類器的 Sonnet,可防止推理被擷取。這同時是合規功能,也是一項限制。
• 受監管或對資料留存敏感的作業負載——請查閱現行政策,而非發布時的報導。Claude Sonnet 5.5 推出時提供零資料留存;Fable 5.1 的資料所描述的是一項漸進式政策,在某個部署上預設為 30 天視窗,並以零留存作為過渡狀態

在 OrcaRouter 上,Claude Fable 5.1 與 Claude Sonnet 5 都共用同一組憑證,以供應商的定價、0% 加價取得,因此當你在兩者之間切換時,只有快取讀取那一行與 tokenizer 的變動會影響你的帳單。Claude Sonnet 5.5 目前還不是我們平台上的路由——這個模型才剛推出一天——所以誠實的說法是,今天你只能透過 Anthropic 自家的 API 使用它。任何透過我們執行 Fable 5.1 的人,都能在它上線當天估算切換成本,而不需更動整合的其他任何部分;在此同時,跨供應商的自動容錯移轉正是讓你能在一條必須保持運作的路徑上,安心試用這麼新的模型的原因。
結論比價格差距所暗示的還要狹窄。Claude Sonnet 5.5 對幾乎所有有界的工作來說都是更好的預設選擇——它在獨立指數上高出三分,能在幾秒內回答,而在 xhigh 下,它以每項任務遠低於一半的成本,逼近 Fable 5.1 上限的一分半以內。Claude Fable 5.1 仍保有一個真正的論點,而這正是 Anthropic 自家比較表所提出的:當工作屬於開放式,且犯錯的代價超過多思考一段時間的代價時,五倍的輸入價格換來的模型能達到相同分數,卻不必為此花費三倍的推理 token。要根據任務的形態來選擇,而不是價目表的大小,因為在努力階梯的頂端,這兩個模型向你收取的費用是一樣的。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
