Claude Sonnet 5.2 外洩主打卡片:一個「目前已知資訊」面板,將狀態列為未發布,僅有一筆清單項目且沒有識別碼、一個未經確認的觀察者標籤,證據僅限於一篇彙整貼文和一則標題,沒有已公布的識別碼,也沒有基準測試,並以 Claude Sonnet 5 作為實際出貨的模型,自 6 月 30 日起全面開放使用
Guides & Insights

Claude Sonnet 5.2:一筆清單項目,零個識別碼——實際已知的是什麼

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.2 以某份清單中第一項的身分在網路上登場。9 月 20 日,X 帳號 @kimmonismus 發布了一則彙整貼文,開頭是它聲稱「已經看到正在測試」的模型——Claude Sonnet 5.2、Claude Opus 5.2、Claude Fable 5.2 和 Gemini 4 Pro——接著才談到它預期接下來會推出的版本。那個首個名稱之後的每一個,背後都有些東西。Claude Opus 5.2 有為期一週的報導,關於 Claude Code 內部一條靜默路由通道。Claude Fable 5.2 有它自己的外洩討論串。Gemini 4 Pro 有各自獨立的目擊蹤跡。Claude Sonnet 5.2 則只在清單中佔了一個位置。這就是截至今天早上的全部公開紀錄:一則推文、一個低查證度聚合網站上的一則標題,以及在任何地方都找不到的識別碼、價格、上下文視窗或基準測試。Claude Sonnet 5——5.2 將會取代的模型——自 6 月 30 日起全面開放使用,每百萬輸入 token 為 2 美元、每百萬輸出 token 為 10 美元,並且是每一個 Claude 訂閱層級的預設模型。

那種不對稱才是值得寫下來的故事,因為當一則彙整推文被當成新聞事件來讀時,被丟掉的正是這一點。一個模型名稱出現在清單裡,和一個模型名稱出現在模型 ID 旁邊,並不是同一種主張;而這個差別,就是「Sonnet 即將推出更新」和「有人把 Sonnet 這個詞跟數字 5.2 放在一起」之間的整體差別。

9月20日那篇貼文到底說了什麼

仔細讀那篇貼文,Sonnet 的說法比標題所暗示的還要薄弱。這份清單分成兩半,而 Sonnet 5.2 落在第一半——也就是「已經看到測試」的那一半——這是兩個說法中較強的一個。第二半則明確加上了保留:「即將發布的確認或暗示」,涵蓋 Grok 4.7、GPT-6-Sol 和 Kimi K3.1,而 GPT-6-Sol 那一項甚至帶有自身的但書,說週二預告的大型發布「可能就是它」。

所以,作者在這篇文章的一半裡措辭謹慎,在另一半裡卻毫無保留,而 Sonnet 5.2 就位於毫無保留的那一半。沒有截圖、沒有 API 回應、沒有模型字串、沒有測試人員報告、沒有計時資料。想查核這項說法的讀者,沒有任何可供對照的東西。

這個名稱唯一另外一次公開出現的地方,是 9 月 19 日的一篇聚合器貼文,其標題寫著「Fable 5.2、Opus 5.2、Sonnet 5.2 外洩」。點開後,Sonnet 5.2 出現在標題中,之後在內文裡就不再出現;內文把三個 Claude 名稱全混進一句關於整個平台「顯著進展」的話裡。那篇貼文對這三者中的任何一個都沒有提供證據,並明確警告偽造基準測試應謹慎看待。兩次出現,形態相同:名字藏在一組名字之中,個別來看卻沒有任何資訊附屬於它。

真正缺少的,是那個具體、可查證的產物——2026 年每一次真正的 Anthropic 外洩事件都曾產生過這種東西。八月時,Marshmallow 和 Melon 的故事有可觀察到的 API 流量,落在一個名為claude-marshmallow-ht-eap的字串上,之後還有更乾淨的變體。本月 Opus 5.2 的故事,則有開發者回報「Opus 5」標籤背後的後端代稱指向了某個新地方。Sonnet 5.2 兩者皆無。如果某個 Sonnet 層級的檢查點曾在開發者搆得到的地方提供服務,那個識別碼會是第一個外洩的東西,因為它是最難藏住的——它必須存在於請求之中。

九月故事中獲得證實的部分並不是 Sonnet

這就是閱讀那篇綜合報導時的陷阱。貫穿整個九月、經多方佐證的 Anthropic 灰度測試事件,是一則 Opus 等級的消息。多家中文與英文媒體報導,Anthropic 正悄悄把一小部分請求導向一個未發布的檢查點,並藏在 Opus 5 的標籤背後——這是一場無聲的灰度測試,開發者是透過行為改變、而非名稱改變而察覺到。9 月 17 日晚間的報導描述,該管道在未事先通知的情況下遭到切斷,約一天後恢復;據稱在那之後,它從 Claude Code 擴大到聊天與 cowork 介面。報導中掛在該檢查點上的名稱,是 Claude Opus 5.2。

Sonnet 5.2 承襲了那份報導的可信度,卻未承襲其任何證據。這是外洩報導中一種特定且常見的失誤模式:一個層級有文件佐證,另一個層級在同一句話裡被點名,接著第二個名稱便開始流傳,彷彿它也曾被報導過。但事實並非如此。如果你去找一份 Sonnet 層級的路由報告,你會找到 Opus 的那份,以及一份清單。

在所有這一切底下,還有一條獨立、消息來源更可靠的脈絡——也就是商業報導指出,Anthropic 已將其上市時程推遲至十一月,而根據路透社引述三名消息人士的說法,該公司正在權衡是否要在上市前先行推出新模型,以回應 GPT-6 Astra。這則報導是真實的,也確實切題。但值得注意的是,它對於這款模型會落在哪個層級隻字未提。在 IPO 之前,一次主力產品的更新與一次旗艦機種的發表,是截然不同的舉措,而迄今公布的資訊都沒有說明正在考慮的是哪一種。

上個月,社群命名了一款從未推出的 Sonnet。

質疑「Sonnet 5.2」最有力的理由,並不是這個說法本身站不住腳,而是這套一模一樣的命名模式一個月前才在公開場合栽過一次,而且那次失敗是有紀錄可查的。

八月底,兩個早期存取識別碼開始流傳:claude-marshmallow-eap以及claude-melon-eap。這兩個字串都不含 Opus、Sonnet 等字眼,也沒有任何版本編號。8 月 24 日,社群貼文與謠言部落格從外部為它們冠上產品名稱——Marshmallow 變成「Opus 5.1」,Melon 變成「Sonnet 5.1」——依據是測試者的印象,認為 Marshmallow 比 Melon 更強,也比當時的 Opus 5 更強。據報導,一位進行調查的開發者發現,這些純字串並未產生任何可驗證的第一方輸出,使得先前的流量成為唯一可觀察的證據。

兩個名稱都沒有正式推出。在那個期間內,Anthropic 的下一款發布是 9 月 1 日的 Claude Fable 5.1——完全是另一個層級,而且所用的名稱,沒人曾指派給前述任何一個識別名稱。「Sonnet 5.1」這個標籤原本是社群的推測,後來固化成謠言,接著就煙消雲散了。

那段歷史在這裡之所以重要,原因不只是出於一般的謹慎。這意味著 Sonnet 層級如今已在兩個月內於洩漏中被點名兩次,而兩次都沒有任何一項該層級專屬的具體產物。這也意味著最強的先驗——Anthropic 實際的 2026 年節奏——指向另一種形態:七月底的 Opus 5、九月初的 Fable 5.1,以及九月中旬的 Opus 5.2 灰度測試。Sonnet 層級自 6 月 30 日以來就沒有動靜,這正是 Sonnet 傳聞之所以可信的原因,也正是它之所以未經證實的原因。長時間的空檔是預期會有某事發生的理由,而不是某個特定事物存在的證據。

你今天實際能運行什麼

Claude Sonnet 5 不是讓你等待時的佔位符。它已是大多數 Claude 流量實際運行的模型,而且它的數據具體,絕非 5.2 傳聞中的任何內容可比。

Artificial Analysis model page for Claude Sonnet 5 showing an Intelligence Index of 32 at rank 8, 165 tokens per second output speed, 31.20 second time to first token, $2.00 input and $10.00 output per million tokens, a 1M token context window, 128k maximum output, a Coding Index of 51 and an Agentic Index of 36

• 模型 ID — claude-sonnet-5,目前可直接呼叫;Claude Sonnet 5.2 沒有任何已公開的識別碼

• 價格 — 每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,已於 8 月 10 日成為永久價格;原定的 $3 / $15 標準費率不再適用。關於 5.2 的定價一無所知,因為根本沒有什麼可知道

• 背景——具備 128K 最大輸出量的 1M 詞元脈絡窗口。Anthropic 自家的文章並未在發布頁面上說明該窗口;它明確指出的細節是經過修訂的分詞器,而這件事的重要性超乎聽起來的程度:相同的輸入,可能依內容類型對應到約 1.0–1.35 倍的詞元數。

• 廠商回報的基準測試結果 — SWE-bench Pro 63.2%、Terminal-Bench 2.1 為 80.4–80.5%、Humanity's Last Exam 在無工具情況下為 43.2%,使用工具時為 57.4%、OSWorld-Verified 81.2%、GDPval-AA v2 為 1,618。這些是 Anthropic 的數據,此處未經重現

• 獨立——Artificial Analysis 在其自適應推理、最高努力配置中,將 Claude Sonnet 5 的智慧指數評為 32,遠高於同價位層級的中位數 24,而在非推理的高努力配置中則為 29

• 比任何版本編號都更長壽的成本警語——Anthropic 的權杖價格並未變動,但對 Intelligence Index 的獨立分析發現,Sonnet 5 每項任務消耗的輸出權杖比前代多出約 30–40%,因為自適應思考預設為開啟。標價不等於帳單

最後那一點,是任何 5.2 討論都該帶上的。如果 Sonnet 更新版登場,真正有意思的數字不是每百萬費率,而是每項任務的 token 用量,以及新的預設投入等級是否會悄悄再次把它推高。

Sonnet 5.2 必須改變什麼才能夠有意義

先別管它是否存在。更有用的問題是,什麼會讓它值得切換過去,因為那決定了該留意什麼——而這些都不是「Sonnet 推出更新版」。

Comparison scoreboard for Claude Sonnet 5.2 and Claude Sonnet 5: the rumoured model's unconfirmed status, missing model ID, unknown price, absent benchmarks and single list entry against the live model's GA date of June 30, claude-sonnet-5 model ID, $2 / $10 per million tokens, and Artificial Analysis Intelligence Index of 32

一個有意義的 Sonnet 5.2 至少必須推動四件事中的其中一件。第一是每項任務的 token 用量:一個維持 $2 / $10 費率、但止住 30–40% 輸出 token 膨脹的版本,會比檯面上的降價更能削減實際帳單。第二是與上一層級之間的代理能力落差——Sonnet 5 被定位為在代理工作方面大約達到前一代旗艦模型的九成,而成本僅其一小部分,正是這個比例讓它成為預設選擇。第三是修訂後的 tokenizer 讓長上下文行為變得更難推斷。第四,也是最不可能被公布的一點,是 5.2 究竟是否會以 Sonnet 之姿登場——上一次社群篤定點名 Sonnet 接班人時,最終出貨的模型是 Fable。

算不上新聞的事:某個檢查點出現在評測框架裡、某個代號出現在框架的程式碼庫中,或又是一則彙整推文。這些都不會改變你能呼叫什麼、要花多少錢,或跑出什麼分數。

如何在不下注的情況下取得定位

未經驗證的等級更新,其實務問題不在於你可能會錯過它。而在於,為它做準備通常意味著你得做那些你會不甘願做兩次的工作——第二份供應商合約、第二次 SDK 整合、第二套金鑰、限制與帳單。

那正是現在就該移除、而不是拖到以後的部分。Claude Sonnet 5 自六月起就已進駐 OrcaRouter,採用 Anthropic 自家的 $2 / $10,並以供應商定價原價轉供、不加收任何費用,因此 Sonnet 系列若出現廠商價格變動,這裡當天就會生效,而不必等到下一個計費週期。

OrcaRouter model page for anthropic/claude-sonnet-5, showing Claude Sonnet 5 listed at Anthropic's prices of $2.00 input and $10.00 output per million tokens with a 1M token context window, 128K maximum output, and an Artificial Analysis Intelligence Index of 32 at rank 8

同一組金鑰已經能觸及目前 Claude 系列的其他成員,以及平台上其他兩百多款模型,這意味著 5.2 問世時並不會啟動一項整合專案——它會直接出現在目錄中,而你只要把一小部分流量導向它,並在其後設置一個退回 Claude Sonnet 5 的備援機制,同時釐清每項任務的 token 計算在你的工作負載中是否真的行得通。自動容錯移轉正是讓這件事在面對一個尚未有人獨立評測過的模型時仍能安全進行的關鍵

對於技術堆疊已經採用 claude-sonnet-5的人來說,對「我該等 Claude Sonnet 5.2 嗎」這個問題,誠實的答案是否定的——沒有什麼好等的,沒有日期,也沒有理由相信目前的模型即將不再是正確的預設選擇。該做的是讓轉換成本低廉,而不是提早切換。

「什麼能解決這件事?」

三件事,依其能告訴你多少資訊由高到低排列。一個 API 識別碼會是決定性的,因為一個正在被提供服務的模型,在請求裡必然得有個名稱,而 Marshmallow 與 Melon 的故事之所以變得可查證,以及 Opus 5.2 的路由報告之所以變得可查證,正是靠這個。供應商的確認——一張模型卡、一個文件頁面、更新日誌裡的一行——就能直接終結爭論。一份針對特定層級的測試者報告,描述的是行為而非名稱,會是三者中最弱的,但仍比現今存在的任何東西都多。

在那些之一出現之前,Claude Sonnet 5.2 就只是清單上的一個名字。把它當成一個提示,去檢查你的技術堆疊能否以低成本吸收一次 Sonnet 更新,而不是當成一個理由,圍繞著它來做規劃。