
Claude Sonnet 5.5:中階預設之選,規格完整揭露
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 64 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Sonnet 5.5是 Claude 系列的中階模型,於 2026 年 9 月 28 日發布,而它的定價正是它值得單獨擁有一頁的完整理由:每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,相較之下,Claude Opus 5.5——六天前推出的旗艦款——則是 4 美元與 20 美元。這等於是用一半的輸出價格,換取 1.62 點的人工分析智慧指數(Artificial Analysis Intelligence Index)差距——中階款為 56.00,旗艦款為 57.62,兩項數據皆由 Artificial Analysis 在指數修訂版 v4.3.2 上測得,既非我們所測,也非廠商所測。而在這兩者之上的是 Claude Fable 5.1,定價 10 美元 / 50 美元,在同一修訂版上為 53.35:比旗艦款更貴,卻又落後於它。與 Claude Sonnet 5.5 同為 2 美元 / 10 美元牌價的,是 OpenAI 的 GPT-6.1 Sol,分數為 51.83——落在界線另一側,相差 417 個指數百分點,而這正是權衡中階款的讀者實際上必須做出的比較。
本頁是參考資料,而其中的日期說明的是原因,而不是時效。Claude Sonnet 5.5 在 2026-10-08 時已推出十天,這使它落在這個部落格報導新聞的七天窗口之外。落在該窗口內的,是一則已發生六天的事件:兩篇發布於 X、日期為 2026-10-02 的貼文,聲稱此家族中的一款後繼模型擊敗了自家廠商已完成卻未發布的競爭對手。該說法在從這裡所能觸及的任何登錄庫中,都沒有模型 ID、沒有費率表、沒有上下文視窗,也沒有基準測試作為依據,而且它並非本頁的主題——資料來源鏈、廠商公開介面缺漏查核,以及五模型索引分布,全都由這個部落格已發表的一篇報導完整負責,該報導標題為《Claude Fable 5.5 在 GPT-6.1 Astra 存在之前就將其擊敗——而這正是有趣之處》,日期為 2026-10-03。那個說法確實帶來的,是一批讀者紛紛詢問:在等待期間,該以哪一款已推出的 Claude 模型作為標準。而這個問題需要一頁專門談論確實存在的那款模型。就是這一頁。
2026年9月28日發布了什麼
廠商自家的文件直接給出了規格,而且它是這一層級的延續,而非新的形態。以下所有內容均於 2026-10-08 摘自 Anthropic 的 Claude Platform 文件,因此這是 Anthropic 的規格,而非對其進行的獨立測試。
• 已發布 — 2026年9月28日。該模型自身的說明文件頁面開頭寫著「最新版本。發布於 2026年9月28日。」
• 定位——「速度與智能的最佳組合」,並列出延遲比較:Claude Opus 5.5 為「快」對比「中等」,Claude Fable 5.1 為「較慢」,而小型等級則為「最快」。
• 模型 ID — claude-sonnet-5-5 適用於 Claude API、Google Cloud、Microsoft Foundry 及 AWS 上的 Claude Platform;anthropic.claude-sonnet-5-5 適用於 Amazon Bedrock。每個 Claude 模型 ID 都是固定的快照,因此該字串並非會在你腳下漂移的指標。
• 上下文與輸出 — 在 Messages API 上提供 1,000,000 個詞元的上下文,以及 128,000 個詞元的同步輸出,而在 output-300k-2026-03-24 測試版標頭之後,於 Message Batches API 上可提升至 300,000 個詞元。
• Thinking——自適應、預設一律開啟,預設強度為high。最低的設定是between_tools,它會關閉事前思考,並在high強度或以下時被接受。將temperature、top_p 或 top_k設為預設值以外的任何值都會回傳 400 錯誤,因此從較舊的 Claude 模型移轉、帶有調校過溫度的請求會大聲失敗,而不是悄悄失敗。
• 知識截止點 — 2026 年 6 月,可靠截止點與訓練資料截止點皆然。
• 生命週期 — 使用中(最新),在 Anthropic 營運的平台上,承諾退役時間不早於 2027 年 9 月 28 日。Amazon Bedrock 與 Google Cloud 則各自訂定其日期。
供應商的發布定調值得引用,因為那是一項宣稱,而非實測數據:Anthropic 的公告將 Claude Sonnet 5.5 描述為「相較於 Sonnet 5 是明顯升級,執行速度快 30%,且對大多數工作而言成本最多低 30%」。那句話出自供應商,並非由我們重現,而這種宣稱完全取決於你拿哪種工作來測試它。此外,這次發布還附帶一項遷移成本,而本頁不是適合討論這個的地方:五項破壞性變更會影響已在 Claude Sonnet 5 上執行的程式碼,第六項則會改變回應形態,卻不會讓任何請求失敗。那筆帳屬於本部落格在發布當週所刊出的推出說明;如果你目前已在正式環境使用 Sonnet 5,那是最該先讀的東西。

這 1.62 點,以及半價
這個模型的獨立評分來自單一來源,而且它們帶有一個決定這場爭論的數字。Artificial Analysis 測得 Claude Sonnet 5.5在其 Intelligence Index 上為 56.00,修訂版 v4.3.2,在該頁面稱作「Claude Sonnet 5.5 (Max, Default Fallback)」的配置中。我們在 2026-10-08 讀取了該頁面。在同一修訂版、同一天:
• Claude Opus 5.5 — 57.62,於 2026-09-22 發布,$4 / $20
• Claude Sonnet 5.5 — 2026-09-28 發布,$2 / $10
• Claude Fable 5.1 — 53.35,於 2026-09-01 發布,$10 / $50
• GPT-6 Astra — 52.67,於 2026-09-03 發布,$10 / $50,並具備長上下文級別,提示詞超過 272,000 個 token 時為 $20 / $75
• GPT-6.1 Sol — 51.83,2026-09-29 發布,$2 / $10
說明是哪一個修訂版本很重要,因為某個版本指數所得到的分數,無法與另一個版本的分數互相比較:v4.3.2 納入了十項評估——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 以及 AA-LCR v1.1——而這組評估的組成已隨各修訂版本而改變。上述五個數字全都來自同一個修訂版本,這正是它們能夠互相對照解讀的原因,也是它們全都無法與引用自較早版本的任何數字相互對照解讀的原因。
價格比較是決定行為的那一環。Claude Sonnet 5.5 的輸出費率是 Claude Opus 5.5 的一半,輸入費率也再減半;在供應商自家的價目表上,中階款收費 $2 / $10,而旗艦款收費 $4 / $20。把這兩個已公布的數字放在一起算,比例差距一目了然:以每美元輸出定價計,Claude Sonnet 5.5 帶來 5.60 個指數點,Claude Opus 5.5 則帶來 2.88——根據 Anthropic 自家的費率表與 Artificial Analysis 自家的測量,每美元輸出所得的指數幾乎是兩倍。那是對兩個已公布數字所做的算術,而不是對任何東西的測量,而這正是中階款論點的誠實形式。這也不是一項裁決:指數點不是正確性的單位,而本頁其餘部分的重點,在於 1.62 是由什麼構成、又不是由什麼構成。

價目表,以及變動最頻繁的兩條產品線
Anthropic 的完整價格表,讀取於 2026-10-08。本節中的每一項數字均為供應商所提供。
• 輸入 — 每百萬個權杖 $2.00。輸出 — 每百萬個 $10.00,且思考權杖會以輸出計費,由於此處預設開啟自適應思考,因此無法抑制。
• 快取讀取 — 每百萬 $0.10,Anthropic 將其記載為基礎輸入價格的 5%。這與 Claude Opus 5.5 所適用的比例折扣相同,因此快取並不會改變兩者之間的排名,而這也確實意味著,長時間執行且維持穩定前綴的代理程式,對其重新讀取的所有內容只需支付輸入費率的十分之一。
• 快取寫入 — 五分鐘快取每百萬個 $2.50,一小時快取為 $4.00。可快取的最短提示長度為 512 個 token,因此短提示完全無法享有這項折扣。
• Batch API — 雙向皆享 50% 折扣,因此可等待處理的工作,輸入為 $1.00、輸出為 $5.00。
• 無長上下文附加費——Anthropic 在此模型上,對完整的 1M token 視窗一律按標準的每 token 費率計費,因此一筆 900,000 個 token 的請求,每 token 的費用與 9,000 個 token 的請求相同。這與 GPT-6 Astra 有實質差異:其提示超過 272,000 個 token 後的長上下文級距會跳升至 $20 / $75——值得特別點名,因為一旦提示變長,這是兩家廠商主打數字明顯分歧的唯一之處。
真正決定多數帳單的,是這兩行,而不是主打的表面費率:長時間 agent 執行過程中的快取讀取折扣,以及任何非同步作業的批次折扣。$2 / $10 這個主打價格是排行榜上被拿來比較的數字;而快取與批次這兩行,才是每月帳單實際據以計算的基礎。
這個差距意味著什麼、不意味著什麼
Intelligence Index 是在一組固定任務組合上得出的單一數字,而正是這個特性解釋了圍繞它的大多數混淆。v4.3.2 背後的十項評估包括代理式編碼與終端機作業、研究所程度的科學推理、一組軟體工程題組、一組代理式自動化題組,以及一組長脈絡檢索題組,並加權組成一個綜合分數。一個模型若落後另一個模型 1.62 分,是落後在那個綜合分數上——而不是落後在你的工作負載上;你的工作負載可能以完全不同的比例來權重那十項,也可能包含這十項都無法代表的任務。
這在實務上意味著,劃分方式是依工作的形態,而不是依層級的聲望。Anthropic 自家的模型選擇器把這種劃分講得明明白白,而且值得一讀,因為它並不吹捧中階層級:文件告訴讀者「大多數工作負載請從 Claude Opus 5.5 開始」,而要動用 Claude Fable 5.1,則是「為了要求嚴苛的推理與長時程的代理式工作,或是當你在更高努力程度下對 Claude Opus 5.5 的評估仍然未達標準時」。Claude Sonnet 5.5 並不是那句話開頭提到的模型。同一份文件把它描述為速度與智慧的最佳組合,在小模型層級之外擁有最快的相對延遲——這是另一種論點,而且範圍更窄。
誠實的解讀是這樣的。對於範圍明確、需要大量處理的工作,中階模型通常才是正確答案:針對已知程式庫開發功能與修正錯誤、具有明確輸出格式的擷取與分類、困難點在於框架而非推理的工具呼叫迴圈,以及任何首個 token 要快、每次呼叫成本要低,比最後那 2% 能力更重要的事。當工作確實是長時程任務時,旗艦模型才對得起它的價格——長達數小時的代理執行、橫跨提示詞一次容納不下的多個檔案的重構,以及在中階模型上提高投入程度後仍明顯達不到標準的評估。最後那個條件是供應商自己提出的,而且可以檢驗:提高中階模型的投入等級,跑你自己的評估,看看它是否能縮小差距。如果能,那 1.62 對你而言就不是關鍵支撐。如果不能,你就是用自己的數字買到了答案,而不是用別人的綜合評分。
這個差距並不代表 1.62 分不算什麼。它是兩個模型之間的全部差距,而在固定測試框架、相同條件下評估時,這是一個真實的排序。它只是某一特定任務組合的排序,而且是在最大努力搭配預設回退的情況下得出的;對於兩者都未曾做過基準測試的工作負載,它完全無法說明哪一個更值得買。
名稱陷阱:這是哪個 Claude Sonnet 5.5 頁面
搜尋這個模型名稱的讀者,會在本部落格上遇到幾篇看起來像這一篇、實際上卻不是的頁面。日期標為 2026-09-24 的那一篇是預告頁:它是在模型推出前寫成的,主題是一則聲稱進行隱匿測試的 X 貼文,並對照它將取代的模型數據來重構。發布週刊登的那一篇則是推出說明:其主題是五項會影響已在 Claude Sonnet 5 上執行的程式碼的破壞性變更,外加第六項會改變回應結構卻不會引發錯誤的變更。此外,還有一系列對戰頁面,將這個模型的名稱與其他廠商的模型捉對比較,以及一篇應用頁面,說明這次發布的推廣涵蓋哪些內容。
它們都不是模型頁面,而這正是本文要填補的缺口。這個頁面是讀者在搜尋模型本身的名稱之後會找到的參考依據:它是什麼、要花多少錢、它衡量什麼,以及哪些工作屬於它。推出頁面的遷移細節與前瞻頁面的來源考據仍留在原處;如果你有 Sonnet 5 的程式碼正在生產環境中運行,推出頁面是你第一個該點開的,而這個頁面則告訴你,你正在遷移過去的模型是不是你想要的那一個。
既然我們談到這裡,有一個命名習慣值得修正,因為它本身就會造成誤導。5.5 這個後綴標示的是世代,不是等級。Claude Sonnet 5.5 和 Claude Opus 5.5 是同一家族、同一世代,而小數點前面的數字才是層級。後綴本身完全無法告訴你哪一個會在基準測試中勝出。
可用性,已註明日期
Claude Sonnet 5.5 自推出以來就一直在 OrcaRouter 上,以 anthropic/claude-sonnet-5.5 的形式提供,價格採用 Anthropic 自家的定價,完全沒有額外加價:每百萬個 token 輸入 $2.00、輸出 $10.00,這兩個數字是我們在 2026-10-08 從自家的模型端點讀取到的,與供應商的價目表一字不差。我們為它設立的頁面同樣載明 1M token 的上下文視窗與 128K 的最大輸出,列出文字、圖像與檔案為可接受的輸入類型,並以文字為唯一輸出,標示其發布日期為 2026-09-28 且尚未淘汰,同時顯示它可透過 OpenAI 相容的 chat-completions 端點以及 Anthropic 自家的 messages 端點存取——這正是它能成為既有整合直接替換選項的原因,無論該整合原本採用的是哪一種端點。
同一份目錄中的其他一切都能透過同一把金鑰取用:以一組 API 涵蓋 200 多個模型,並具備供應商定價以 0% 加成原樣傳遞,因此供應商一旦降價,客戶在公布當天就能享受到,自動容錯移轉可在端點效能退化時接手,還有一套路由 DSL,供你想固定某個模型、或把多個模型組合成單一回答時使用。正是這樣的組合,讓本頁這個問題回答起來便宜而非昂貴。上方比較中的兩個模型都位於同一組憑證之後,所以你拿來比價的是供應商自己公布的價格,而不是經銷商的價格;而版本測試的代價是一趟評估執行,而不是一個遷移專案:把一部分流量導向anthropic/claude-sonnet-5.5,其餘流量留在旗艦模型上,再讓你自己的「每完成一項任務成本」數字決定哪一個該成為預設。

簡短版本
Claude Sonnet 5.5 是一款中階模型,其數據表現已逼近旗艦級,輸出價格卻只要旗艦級的一半;而決定它是否該成為你預設選擇的,就是以下三個關鍵事實。在 Artificial Analysis 的 v4.3.2 指數上,它落後 Claude Opus 5.5 達 1.62 分,分別為 56.00 對上 57.62,兩項數字都是在相同修訂版本、相同 max-effort 設定並採用預設回退的情況下測得。它的價格為 $2 / $10,旗艦級則是 $4 / $20,而快取與批次折扣是按比例調整而非有所不同,因此兩款模型提供的任何折扣都無法消除這道價差。此外,它預設採用 high effort,旗艦級則預設為 medium,這意味著從旗艦級沿用的設定在這裡會高出一級而非降低一級,而這麼做的代價得由你親自測量,不能憑假設。
Anthropic 自家的模型選擇器在多數工作負載上仍以 Claude Opus 5.5 為起點,這一點在你標準化採用任何方案之前值得先了解。但對大多數因為搜尋這個模型名稱而來到本頁的讀者而言,中階款才是合理的預設選擇,旗艦款則是例外——當你自己的評估要求時才購入:大量且範圍明確的工作、快速延遲、百萬 token 視窗且無長上下文附加費,以及輸出費用減半的費率。兩者在 OrcaRouter 上都只差一組金鑰,而決定選哪一個的評估只需花一個下午,而不是一次遷移。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
