為 Claude Sonnet 5.5 對比 Claude Fable 5.1 生成的主視覺標題卡,副標題為「便宜的模型領先三分」,左側顯示每百萬個 token 輸入 $2.00、輸出 $10.00,右側則是 $10.00 與 $50.00,下方標有 Artificial Analysis Intelligence Index v4.3 的分數 56 與 53,右下角則合成上 OrcaRouter 標誌。
Guides & Insights

Claude Sonnet 5.5 對決 Claude Fable 5.1:較便宜的模型領先三分

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.5 於 2026 年 9 月 28 日問世,每百萬輸入 token 收費 2.00 美元,每百萬輸出 token 收費 10.00 美元。而廠商於 9 月 1 日推出的 Mythos 級模型 Claude Fable 5.1,在同樣這兩項計價上分別是 10.00 美元與 50.00 美元。一個很誘人的總結是:Fable 5.1 是比較貴的那個,因此也是比較好的那個;但在 Artificial Analysis Intelligence Index 上,排名卻恰恰相反:Claude Sonnet 5.5 得分 56,Claude Fable 5.1 得分 53。這不是四捨五入造成的假象,但這也並非全貌,因為同一個評測機構在同一套測試中,把兩者每項任務的成本差距壓在三分錢以內——7.60 美元對 7.63 美元。價目表上五倍的差距,等到一項任務完成時,幾乎已消失無蹤。剩下的,是一組形狀上的差異,而非分數上的差異;而要在這兩者之間做選擇,主要取決於你的工作負載是哪一種形狀。

兩張費率表,以及唯一一行差距不是五倍之處

逐 token 的比較極為鮮明,無需任何解讀。

• 輸入 — Claude Sonnet 5.5 每百萬個詞元 $2.00,相較於 Claude Fable 5.1 的 $10.00,相差五倍

• 輸出 — 每百萬 $10.00 對比 $50.00,再次恰好是五倍

• 快取讀取 — 每百萬 $0.20 對比 $0.25。這是支撐長時間代理執行的項目,而折扣從 5× 驟降至 20%

• 快取寫入 — 標準五分鐘視窗下,每百萬 $2.50 對比 $12.50,是兩張卡上最大的單一差距

• 批次 — Anthropic 的批次模式套用於這兩張卡的方式,與套用於 Fable 5.1 的方式並不相同:Fable 5.1 推出時,批次定價即減半,輸入為 $5.00、輸出為 $25.00。在你假設這能沿用到整個系列之前,請先到 Anthropic 自家的定價頁面上讀一讀批次那一行

• 上下文與上限 — 兩者皆具備 1,000,000 個詞元的上下文,以及 128,000 個詞元的最大輸出量。在 Message Batches API 上,Claude Sonnet 5.5 在 output-300k-2026-03-24 beta 標頭下支援最高 300,000 個輸出詞元,這對大量生成而言是實實在在的上限差異,而非行銷話術。

有一項對 Claude Sonnet 5.5 有利的微小優點,是價目表所低估的。Anthropic 報告指出,這個模型完成相同工作通常所需的 token 遠比前代少,並稱這相當於每項任務成本最多降低 30%。那是關於另一組比較——Sonnet 5.5 對 Sonnet 5——的廠商說法,並非關於這次對決的證據。然而,這正是解釋獨立測量所發現結果的機制。

五倍價差的去向

Artificial Analysis 於 2026-09-29 在同一套測試框架、同一個設定標籤「自適應推理、最大努力、預設回退」下,以 Intelligence Index v4.3 對這兩個模型進行評測。兩項主要數字分別是 Claude Sonnet 5.5 的 56 與 Claude Fable 5.1 的 53——較便宜的那個模型領先約 3 分,而在這把量尺上,同一評測者將中位數模型置於 26。兩者在同一頁面上都以廠商名稱標示,因此這是同一套工具、同一份快照,而不是兩份。

接著是成本欄,以及這個配對之所以有趣、而非顯而易見的原因。在同一次索引執行中,Claude Sonnet 5.5 每項任務花費 $7.602633,而 Claude Fable 5.1 花費 $7.629706。兩者相差二十七千分之一美元。拆解之後才是奇怪的地方:光是 Claude Fable 5.1 的輸入部分,每項任務就要 $3.73,相較於 Sonnet 5.5 小得多的輸入元件,而它的推理權杖光是本身,每項任務就花費 $2.36。那個每權杖便宜五倍的模型,換算成每項完成的任務,根本一點也沒有比較便宜。

原因在於量,而這兩個模型失效的方向恰好相反。

• 在索引套件中的輸出 token 數——Claude Sonnet 5.5 產生了 410,577,501,而 Claude Fable 5.1 為 188,465,663,在該套件中,追蹤的中位數為 8,800 萬。兩者都遠高於中位數;Sonnet 5.5 是 Fable 5.1 的兩倍以上,且幾乎是中位數的五倍

• 每項任務的輸出 token 數——Sonnet 5.5 為 192,838,Fable 5.1 為 78,111;其中推理部分分別佔 142,386 與 47,240。Sonnet 5.5 每項任務的思考時間大約是 Fable 5.1 的三倍

• 整個索引套件的輸入 token 用量——Sonnet 5.5 為 185 億,對比 Fable 5.1 的 56 億。Sonnet 5.5 的讀取量是對方的三倍,這是兩者中較不起眼的數字,卻也是實際吃掉較便宜輸入費率的那一個

• 在輸入:快取讀取:輸出為 7:2:1 的混合比例下,混合價格為——Sonnet 5.5 是 $1.54,而 Fable 5.1 則是 $7.17。這一行符合費率卡,也正是描述輸出簡短且範圍明確之工作負載的那一行。

把這些放在一起看,誠實的說法是這樣:混合價格差距是真的,而每項任務的差距則不是。這兩個數字中哪一個能描述你的帳單,完全取決於你的任務是會終止,還是會漫無邊際地拖延下去,而這套索引套件正是為了讓它們漫無邊際地拖延下去而打造的。

努力階梯才是真正的決策

兩個模型都提供一個投入程度參數——低、中、高、極高、最大——且兩者都在 2026 年 9 月 29 日於每一個檔位進行了測量。這是比較中任何價目表都無法表達的部分,因為便宜模型在較低檔位時,以大幅差距勝過處於較低檔位的昂貴模型,而昂貴模型只有在接近頂端時才拉開差距。

• 低強度 — Claude Sonnet 5.5 每項任務得分 35.84,費用 $0.41;Claude Fable 5.1 得分 46.82,費用 $2.37。在最低階層級,昂貴的模型領先十一分,代價卻是將近六倍的費用

• 中等投入——花費 $0.59 得 40.74,對比花費 $2.98 得 48.92。Fable 5.1 以五倍成本保持八點領先

• 高投入 — 以 $1.08 達到 46.74,對比以 $3.91 達到 51.15。差距縮小至四點五分;成本比維持在約 3.6×

• Xhigh 努力 — 以 $2.74 換得 51.85,對比以 $5.98 換得 53.20。相差一又三分之一分,價格卻只要 46%

• 最大努力 — 在 $7.60 下為 55.98,相較於在 $7.63 下的 53.35。排序反轉,成本收斂至半個百分點以內

將第四列與第五列放在一起看,這場對決的輪廓就浮現了。Claude Sonnet 5.5 在 xhigh 下交出 51.85 的成績——只差 Claude Fable 5.1 在任何推理投入程度下的最佳分數 1.5 個指數點——每項任務要價 $2.74,對比之下則是 $7.63。如果你的工作需要的是接近前沿,而非身處前沿,那一列就是全部的答案,而且每完成一項任務能省下 64%。把 Sonnet 5.5 推到 max,你會用 2.8 倍的費用換來多 3 分,讓你落在與 Fable 5.1 的 max 相同的帳單上,分數略好一些,但推理特性卻截然不同。

最後一句話值得好好確定下來,因為它反直覺到值得再三確認。在相同的 max effort 設定下,費率表便宜五倍的模型,每項任務的成本竟與費率表昂貴的模型相同。它是靠輸出 2.5 倍的 token 來達成,而其中推理所佔的比例又是三倍大。Anthropic 自家的文件解釋了部分機制:tokenizer 已改變,同樣的文字在 Claude Sonnet 5.5 上會比在較早的模型上多產生約 30% 的 token。這是幾項促成因素之一,也提醒我們:若不加以說明,輸出 token 數在不同 tokenizer 修訂版本之間並不具可比性。

延遲就是這兩者不再彼此相似的地方

分數收斂並不延伸到時間層面。在同一份 2026-09-29 快照中,Artificial Analysis 報告指出,在長提示切片上,Claude Fable 5.1 的首個 token 時間為 254.41 秒,Claude Sonnet 5.5 則為 2.80 秒;兩者的中位輸出速度分別為每秒 67.9 與 49.4 個 token。這代表呼叫方在收到任何內容之前所需等待的時間相差兩個數量級,而這是這項比較中在營運上最具關鍵影響的單一數字。

這兩個數字都需要清楚說明其限定條件。Fable 5.1 的 TTFT 是在長提示類型上測得的;同一模型在同一天的中等提示切片為 117.60 秒,因此 254 秒這個數字是尾端值,並非固定不變的常數。Sonnet 5.5 的 2.80 秒是其整體中位數,而評估器自身的變異範圍則從第五百分位的 1.91 秒到第九十五百分位的 4.23 秒。Anthropic 的平台文件將 Fable 5.1 的相對延遲描述為較慢,並將 Sonnet 5.5 的描述為快速,這在方向性上一致,但並非一項測量值。

我們自己的基礎設施提供了第三種讀數,因為我們路由 Claude Fable 5.1,並量測我們實際提供的內容。在截至 9 月 28 日的七天內,就 OrcaRouter 自身的流量而言,Claude Fable 5.1 的首個 token 中位數為 6,973 毫秒,第 95 百分位數為 10.0 秒,輸出速度為每秒 65.8 個 token,錯誤率為 0.349%。那個 p50 比評估器的長提示數字快超過一百倍,這與其說是矛盾,不如說是名詞定義問題:面向開發者、短提示下的首個 token,與基準測試、長提示下的首個 token,是不同事物的量測。任何依據排行榜數字做規劃的人都應該知道自己買到的是哪一個。

Screenshot of Anthropic's product page for Claude Sonnet 5.5 via the Claude Platform overview, showing the model comparison table across context window, maximum output, input price, output price, comparative latency, thinking mode and knowledge cutoff, with Claude Sonnet 5.5 marked as the model being viewed at $2.00 input and $10.00 output per million tokens alongside Claude Fable 5.1 and Claude Opus 5.5.

採購誠信、留存,以及無人提及的移轉

廠商基準測試表與獨立評估是不同的量尺,絕不應互相相減。Anthropic 針對 Claude Sonnet 5.5 的自家發布表格回報 Terminal-Bench 4.0 為 70.6%。Artificial Analysis 使用自家的測試框架,對同名評估中的同一模型回報 63.6%。就 Claude Fable 5.1 而言,差距方向相反:Anthropic 在發布時回報 55.8%,而獨立測試框架的讀數為 52.0%。這兩組數字都不是對彼此的修正。應各自依其自身標準來評判;當你決定要將正式環境流量導向何處時,請優先採用獨立的那一項。

資料保留的立場也有所不同,而這種差異只有在前採購審查中才會顯現。Anthropic 表示,Claude Sonnet 5.5 以零資料保留的形式提供,與其對 Opus 5.5 和 Sonnet 5 採取的立場相同。Claude Fable 5.1 的發布資料描述了與其並行的漸進式資料使用政策,以及 Project Glasswing 下的一項獨立部署,該部署帶有預設 30 天的保留窗口以進行安全監控,而零保留安排則被描述為過渡狀態。如果你的團隊需要接受資料處理審查,這項區別就是一個實實在在的項目,而非註腳,值得閱讀 Anthropic 目前的政策頁面,而不是任何對它的摘要,包括這一份。

遷移成本的不對稱性,鮮少會出現在上線報導中。移轉到 Claude Sonnet 5.5 並不是改個模型字串而已。Anthropic 的遷移指南指出,非預設的 temperature、top_p 與 top_k 值現在會回傳 400 錯誤,tool_choice 設為 any 或指定具名工具會被直接拒絕,而若你原本是在關閉前置思考的情況下執行,thinking: {"type": "disabled"} 必須改成 between_tools。between_tools 類型在 low、medium 與 high effort 下會被接受,但在 xhigh 或 max 時會回傳 400。在 Claude API 與 Google Cloud 上,computer use 僅能透過 computer_toolset_20260801 工具集支援;較舊的 computer_20251124 會被拒絕。這些都不適用於移轉到 Claude Fable 5.1,那是從 Fable 5 進行的同系列升級,本身帶有三項破壞性變更。如果你正把這兩者當作平行的遷移目標來權衡,那麼較便宜的模型反而是採用成本較高的那一個。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Fable 5.1. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56, best value rung xhigh at 51.85 and $2.74 per task, first token 2.80 seconds, 410M output tokens on the index suite. Right column Claude Fable 5.1: input $10.00, output $50.00, cache read $0.25, cache write $12.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 53, best score max at 53.35 and $7.63 per task, first token 254.41 seconds on the long prompt slice, 188M output tokens on the index suite. The card heading reads 'Claude Sonnet 5.5 against Claude Fable 5.1: five-fold on the rate card, level on the finished task', and a footer line reads 'Per-token prices per the OrcaRouter catalogue; index, per-task, effort and latency figures per Artificial Analysis, Intelligence Index v4.3, 2026-09-29 snapshot.'

哪一個要放在哪裡

從這些數字得出的決定,是一項關於你的流量中有多少是範圍界定明確的決定。

• 有界、高頻、工具驅動的工作 —— Claude Sonnet 5.5,若你需要貼近前沿,就以 xhigh 投入度運行。它落後 Fable 5.1 的最佳表現一個半指數點,但每個完成任務的成本低了 64%,約三秒即回傳首個 token,而其更便宜的快取寫入費用讓重建的上下文前綴變得可負擔

• 長時程、開放式的工作,一旦答錯代價高昂 —— Claude Fable 5.1。它以相同的每項任務成本,達到 Sonnet 5.5 的最高分,卻僅需三分之一的推理 token 與四分之一的輸入,當任務確實是開放式、且評測套件的形態與你的問題相似時,這一點格外重要。

• 受延遲制約的互動介面 — Claude Sonnet 5.5,而且差距相當懸殊。在評估者自家的快照上,長提示詞類型的首個 token 差距達兩個數量級,而中提示詞的讀值也只把差距縮小到約 118 秒。若不透過批次處理或串流來繞開,就無法以 Fable 5.1 的那個數字建構聊天介面

• 大量生成與長輸出 — Claude Sonnet 5.5,因為在 output-300k-2026-03-24 標頭後方的 Message Batches API 上,可使用 300,000 個 token 的輸出上限,而其他所有地方的上限為 128,000 個 token。在確定採用前,請先確認您的批次定價;批次費率在兩張定價卡上並不完全相同

• 必須跨帳戶進行,或在系統之間移交推理的工作——在兩者之前,請先閱讀 Anthropic 的 preserved-thinking 文件。Thinking blocks 會綁定到產生它們的模型與帳戶,而 Sonnet 5.5 是第一款內建分類器的 Sonnet,可防止推理被擷取。這同時是合規功能,也是一項限制。

• 受監管或對資料留存敏感的作業負載——請查閱現行政策,而非發布時的報導。Claude Sonnet 5.5 推出時提供零資料留存;Fable 5.1 的資料所描述的是一項漸進式政策,在某個部署上預設為 30 天視窗,並以零留存作為過渡狀態

Screenshot of the OrcaRouter model page for Anthropic Claude Fable 5.1 (anthropic/claude-fable-5.1), showing the model header, a 1M-token context window with 128K maximum output, the capability tags, the $10.00 input and $50.00 output prices per million tokens with a $0.25 cache read and $12.50 cache write, and the seven-day performance panel with a 65.836 token-per-second output speed and a 0.349% error rate.

在 OrcaRouter 上,Claude Fable 5.1 與 Claude Sonnet 5 都共用同一組憑證,以供應商的定價、0% 加價取得,因此當你在兩者之間切換時,只有快取讀取那一行與 tokenizer 的變動會影響你的帳單。Claude Sonnet 5.5 目前還不是我們平台上的路由——這個模型才剛推出一天——所以誠實的說法是,今天你只能透過 Anthropic 自家的 API 使用它。任何透過我們執行 Fable 5.1 的人,都能在它上線當天估算切換成本,而不需更動整合的其他任何部分;在此同時,跨供應商的自動容錯移轉正是讓你能在一條必須保持運作的路徑上,安心試用這麼新的模型的原因。

結論比價格差距所暗示的還要狹窄。Claude Sonnet 5.5 對幾乎所有有界的工作來說都是更好的預設選擇——它在獨立指數上高出三分,能在幾秒內回答,而在 xhigh 下,它以每項任務遠低於一半的成本,逼近 Fable 5.1 上限的一分半以內。Claude Fable 5.1 仍保有一個真正的論點,而這正是 Anthropic 自家比較表所提出的:當工作屬於開放式,且犯錯的代價超過多思考一段時間的代價時,五倍的輸入價格換來的模型能達到相同分數,卻不必為此花費三倍的推理 token。要根據任務的形態來選擇,而不是價目表的大小,因為在努力階梯的頂端,這兩個模型向你收取的費用是一樣的。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新