
Claude Sonnet 5.5:以四個早已存在的數字拼湊而成的隱蔽測試洩漏
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
9 月 24 日,四個數字被發布在 X 上,作為 Claude Sonnet 5.5「已在進行隱密測試」的證據:1M token 的上下文視窗、128K token 的最大輸出、每百萬輸入 token 2 美元,以及每百萬輸出 token 10 美元。這四項目前全都列在 Anthropic 自家的價目表上,掛在 Claude Sonnet 5 之下——也就是 5.5 會取代的模型,該模型自 2026 年 6 月 30 日起已全面開放使用。同樣的 2 美元/10 美元標價也屬於 GPT-6 Sol,OpenAI 已於 9 月 22 日推出該模型;而這種重疊,正是讓這則貼文讀起來像是在回應 OpenAI、而非例行性層級更新的原因:「這在我看來是對 GPT-6-Sol 的直接回應。相同的定價,而且推測也有類似的效能。」
那些都不會讓這個說法變成錯的。它讓這個說法變得不可否證,而這是一個不同、且更值得寫下來的問題。隱蔽測試的目擊,其價值不會高於它背後的產物;而這起目擊背後的產物,是一份規格表,與 Anthropic 這十二週來一直在供應的模型毫無二致。
實際上發布了什麼
來源是一則來自帳號 @kimmonismus 的單一 X 貼文,日期為 2026 年 9 月 24 日。文中陳述了上下文視窗、輸出上限與兩個價格,並將定價與 GPT-6 Sol 相比,結論是 Sonnet 5.5 正在測試中。整則貼文沒有附上任何截圖、模型字串、API 回應、主控台列表、測試者對行為的描述,也沒有第二位觀察者。這則貼文是一項帶有數字的宣稱,而那些數字就是該層級的公開上限。
這值得與另一種 Anthropic 預發布傳聞區分開來,因為 2026 年產生了兩種,而它們看起來毫不相似。八月的早期存取識別碼 claude-marshmallow-eap 和 claude-melon-eap 是存在於請求中的字串——醜陋、不起眼,而且可查證。貫穿九月的 Opus 5.2 傳聞則是一份路由報告:開發者注意到「Opus 5」標籤背後的後端回應方式不同,並描述該行為。兩者都是具體產物。「已經在進行隱蔽測試」而沒有附上任何具體產物,只是對 Sonnet 層級已經在販售內容的總結。
來源本身也有一個值得注意的模式。同一個帳號在9月20日發布了一篇綜合整理,開頭列出四個它聲稱「已經看到測試正在進行」的模型——Claude Sonnet 5.2、Claude Opus 5.2、Claude Fable 5.2 和 Gemini 4 Pro。在這四個名稱中,Opus 和 Fable 這兩項背後有各自獨立、可相互印證的報導,而 Gemini 這一項也有自己的目擊消息。Sonnet 這一項當時只是清單上的一個位置。四天後,Sonnet 的說法長出了一份規格表,而那份規格表描述的正是已經存在的模型。
這四個數字是 Claude Sonnet 5 的數字
這就是那個花三十秒就能查證、卻幾乎沒有人查過的部分。Anthropic 的模型總覽頁面,今天查閱時,列出 Claude Sonnet 5 具備 1M token 上下文視窗、128K 最大輸出,以及每百萬 token 2 美元/10 美元。把外洩內容拿來和它對照:
• 上下文視窗 — Claude Sonnet 5.5 聲稱支援 100 萬個 token;Claude Sonnet 5 公布支援 100 萬個 token
• 最大輸出 — 宣稱 128K tokens;已發佈 128K tokens
• 輸入價格 — 每百萬已認領 $2;每百萬已發布 $2
• 輸出價格 — 每百萬次宣稱 $10;每百萬次發佈 $10
• 模型 ID — Claude Sonnet 5.5 尚未公布任何資訊;Claude Sonnet 5 則為 claude-sonnet-5
• 獨立評分——所聲稱的模型沒有任何獨立評分;Artificial Analysis 在其測量的 210 個模型中,於自適應推理、最大努力組態下,將 Claude Sonnet 5 列於 Intelligence Index 38、第 54 名

這個洩漏內容搞反的定價重點,其實還有第二層。Claude Sonnet 5 推出時,$2 / $10 是作為促銷價公布的,實施至 2026 年 8 月 31 日,並預定於 9 月 1 日調漲至 $3 / $15。但這次調漲並未發生。Anthropic 的定價頁面如今附有一則註腳,指出 $2 / $10「現已成為標準價格」,且「原定於 2026 年 9 月 1 日調漲至每百萬輸入/輸出符元 $3 / $15 的方案將不會實施」。因此,洩漏內容當作新模型競爭利器的那個價格,其實是現任者的永久費率——這意味著 Sonnet 5.5 若以 $2 / $10 推出,等於完全沒有折扣,而且是投入一個早已對照 GPT-6 Sol 定價的價格帶。
Anthropic 唯一真正說過的一件事
把來自未具名爆料者的所有內容剔除後,只剩下一句第一方說法。當 Anthropic 於 2026 年 9 月 22 日推出 Claude Opus 5.5 時,它表示 Claude Sonnet 5.5 和 Claude Haiku 5.5 將「在未來幾週內」跟進,帶來在效能、效率與安全性方面相當的提升。那句話就是全部已確認的紀錄。它沒有模型 ID、沒有上下文視窗、沒有價格、沒有基準測試,也沒有日期——尤其沒有提及任何關於隱蔽測試、灰色路徑或任何形式測試的內容。
Anthropic 其餘公開資訊也印證了這種解讀。模型總覽仍列出四個模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5 和 Claude Haiku 4.5——沒有第五列,沒有價格項目,也沒有為 Sonnet 後繼者標示「即將推出」。如果某個 Sonnet 層級的檢查點正在開發者能觸及的地方提供服務,該識別碼會是最先浮現的東西,因為已提供服務的模型在請求中必須有名稱。但目前什麼都沒有。
九月公告至少確認了一件事:它推翻了先前聲稱 Haiku 產品線將被淘汰、5.5 世代將重組產品陣容的爆料。根據 Anthropic,Haiku 5.5 即將推出,這表示重組的說法錯了,而且錯在爆料者很少會錯的方向——平價層級仍會保留。
八月的爆料說有 200 萬個 token。這次則說有 100 萬個。
在 9 月 24 日那則貼文的六週前,也就是 8 月 9 日,另一個 X 帳號發布了一份「SONNET 5.5 外洩」規格表,裡頭的主張大膽得多:200 萬個字符的上下文視窗,是 Sonnet 5 的兩倍;更快的推論速度;更出色的瀏覽器與終端機工具操作能力;效能直逼 Claude Fable 5;以及「下個月」就會推出。那份外洩資料還附上一張刻意做成 Anthropic 預覽卡片風格的圖。但它同時也帶著一個致命細節,批評者立刻緊咬不放:它給出的代號「Fennec」,正是 6 月 30 日就已隨 Claude Sonnet 5 一同發布的那個代號。一個代號不可能成為採用它的那個模型之後繼者的新證據。
所以,這兩波爆料在最常被引用的那個數字上說法不一。八月說是 2M 上下文。九月則說是 1M。兩者不可能是在描述同一個版本。最可能的解讀是最平淡無奇的那個:九月那篇貼文描述的是 Sonnet 等級已公布的限制,因為從外部來看,Sonnet 等級的模型就是這個樣子;而八月那篇則是在猜測一次改版可能會合理地翻倍到什麼程度。注意這個數字往哪個方向移動——往下,朝已經存在的東西靠攏。
所以 GPT-6 Sol 的比較是對的嗎?
大致上沒錯,而它出錯的地方才是有趣的部分。GPT-6 Sol 於 2026 年 9 月 22 日推出,與 Claude Opus 5.5 同一天,而其定價從每百萬輸入 $2、每百萬輸出 $10 起——正好是 Sonnet 5 的費率,也正好是外洩消息所稱 Sonnet 5.5 的價格。它提供 1,050,000 token 的上下文視窗,輸出上限為 128K,兩者都與 Claude Sonnet 5 的數字僅有些微差距。較便宜的兄弟型號 GPT-6 Luna 則落在 $0.10 / $0.50。
真正的分界在於長上下文。GPT-6 Sol 採兩段式定價:輸入 token 在 272,000 以內為 $2 / $10,超過之後則是 $4 / $15。Anthropic 在 Sonnet 系列上並不這麼做——Claude Sonnet 5 對完整的 1M 視窗一律按標準費率計費,因此 900K token 的請求,每 token 成本與 9K 的請求相同。所以,真正的 Sonnet 5.5 對上真正的 GPT-6 Sol,在一般提示下是價格打平,但在兩者主打的長文件與大型程式庫工作負載上卻出現兩倍差距。「同價」在標題上說得通,但在真正決定選用哪個級距的工作負載上卻是錯的。
在整個比較底下,還藏著第二個但書。Claude Sonnet 5 採用 Anthropic 較新的分詞器,同樣一段文字會比前一代多產生約 30% 的詞元。公告費率不等於帳單;帳單是每項任務的詞元數,而那個數字從來沒有任何外洩消息披露過。
什麼會讓 Sonnet 5.5 顯得重要?
先擱置它是否存在,改問對一個付費買 token 的人來說,會有什麼改變。四件事,而且沒有一件是規格表。
第一點是低於 $2 / $10 的價格。隨著 9 月 1 日的漲價取消,現任者的費率如今已成永久費率——因此,繼任者若維持相同費率,只是平移之舉,而唯一能牽動資金的 Sonnet 層級消息,就是降價。
第二項是超過 1M 的上下文。那正是八月外洩消息真正的主張,而這也是該外洩消息唯一能指名、而現任領導者尚未涵蓋的能力缺口。
第三項是每項任務的 token 用量。Claude Sonnet 5 的自適應思考預設為開啟,而獨立分析測得它每項任務產生的輸出 token 數明顯多於前代。若能推出一個維持 $2 / $10 費率並終止這種膨脹的版本,將比表面上的降價更能進一步削減實際帳單。
第四項是識別碼。一個 API 模型字串、一列文件、一筆定價條目、一張模型卡——其中任何一項都能終結這場爭論;而在如此明確的洩漏之後,這四項全都付之闕如,本身就是這個故事裡最能說明問題的事實。
今天你可以稱之為什麼
Claude Sonnet 5 並不是在分層定位塵埃落定前的臨時替代品。它早已是大多數 Claude API 流量所實際運行的模型,擁有 100 萬 token 的上下文視窗、128K 輸出,以及如今屬於標準而非促銷的每百萬 token 2 美元/10 美元價格。

它自六月起就以 Anthropic 自家的 $2 / $10 價格在 OrcaRouter 上架,按供應商定價原樣傳遞、不加任何加成,因此 Sonnet 系列若有廠商調價,這裡當天便會生效,而不必等到下一個計費週期。同一把金鑰已經能連上定價 $2 / $10 的 GPT-6 Sol,這在像本文這樣的一篇文章裡比平時更為要緊:這份外洩所倚賴的比較,是你用單一憑證就能自行跑出的比較,而不必動用兩份合約。

這也是回答外洩消息所引發問題最省成本的方式。如果 Sonnet 5.5 真的問世,它會像其他任何項目一樣出現在目錄中,而你只要把一小部分流量導向它並以自動容錯移轉至 Claude Sonnet 5 作為後盾——不需要第二次整合、不需要重新協商,也不會有任何正式環境路徑仰賴一個沒有人獨立做過基準測試的模型。嘗試未經證實的層級是個路由決策,不是遷移專案。
與其看下一則爆料貼文,不如看什麼?
三種訊號,依它們能告訴你多少資訊的遞減順序排列。{{1}}識別碼具決定性,因為一個已提供服務的模型必須在請求中有一個名稱,而這就是 2026 年每一個可查證的 Anthropic 預發布消息之所以可查證的方式。{{/1}} {{2}}廠商確認——模型卡、文件中的一列、定價中的一行,或模型單純出現在 Anthropic 自家的清單上——會直接終結此事;「未來幾週」這句話意味著其中某一項確實是理當出現的。{{/2}}一份描述行為而非規格的測試者報告,是三者中最弱的一項,但仍然比今日所存在的更多。
在其中一項問世之前,誠實的總結是:Anthropic 已承諾在未來幾週推出 Sonnet 更新,而有一位觀察者用它將取代的模型數字來描述它。如果你的技術堆疊已經運行 claude-sonnet-5,那就沒有什麼好等待,也沒有什麼好據以規劃。如果你正在權衡 Claude Sonnet 5 與 GPT-6 Sol,你能據以行動的數字就是已經公布的那些——而它們正是這則外洩消息試圖當成新聞賣給你的同一組數字。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
