
Claude Opus 5.5 與西瓜測試:Anthropic 修好了文筆,但重點仍被埋沒
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在發表週之後流傳得最遠的樣本之一,是一篇關於西瓜的短篇故事。幾百字,沒有附上任何基準測試,沒有圖表——就只是要模型寫點小東西,而它大致上寫對了。這樣一件產物竟坐落在旗艦發表的中心附近,著實古怪,但它指向了廠商Claude Opus 5.5在 2026 年 9 月 22 日推出時選擇拿來打頭陣的那個東西:不是 Terminal-Bench 上的另一個分數,而是散文。該公司的說法是,這個模型寫得比較不那麼「Claude 腔」——那是他們用來指稱公式化、過度模稜兩可、清喉嚨式語體的詞,Claude Opus 5曾因此招致抱怨,而Claude Fable 5.1、GPT-6 Astra與GPT-5.6 Sol自那之後都各自被拿來與它衡量。所以,值得回答的問題不是那個示範是否討喜,而是這些散文是否可量測地進步了、進步了多少,以及它在哪裡仍然失手。
Anthropic 表示已修復的內容

Anthropic 的說法足夠具體,可以接受檢驗。它表示,Opus 5.5 會把最重要的資訊放在最前面、較少使用行話,並且比先前的 Opus 模型更嚴格遵循使用者指定的寫作規則。支持這項說法的資料由廠商自行報告,且未經重現:Anthropic 表示,內部事實查核測試在 18 次中通過了 16 次,而 Claude Fable 5.1與Claude Opus 5則都是 18 次中 0 次。發布資料中的客戶引述也指向同一方向——Ramp 的 John Ruelas 形容其輸出「寫起來像個好同事」,Box 則回報自家工作負載的冗長程度大約減少了 40%。
這裡有兩件事值得分開來看。第一,「較不 Claude 腔」是真實且可指名的失效模式,不是行銷捏造。自 4.6 之後的 Opus 世代以來,實務工作者一直抱怨 Claude 的文字濃縮、結構糟糕,而且抱怨內容很具體:前言太多、太常重述提示詞,還習慣在讀者需要重點的兩段之後才切入重點。第二,Anthropic 自己提出已修復此問題的數字,正就是那樣——Anthropic 自己的數字。18 次中有 16 次這個數字沒有獨立重現,而「冗長程度降低 40%」是某位客戶的內部量測,不是已發表的方法論。
這次發布還帶來一項與寫作無關、但值得留意的變動:Opus 5.5 是首個隨附網路安全、生物學及前沿 LLM 開發防護措施的 Opus 模型,這些防護與 Claude Fable 5.1 上的相同。當某項請求觸發其中一項防護時,Anthropic 表示會透明地將該請求轉送至另一個模型,而非直接拒絕。
那些不屬於 Anthropic 的數字

關於這項寫作能力宣稱,最有用的獨立評析來自 Every 的 Vibe Check,它讓相同的提示詞跑過五個前沿模型,並以兩項標準可讀性工具為輸出評分。在那一組提示詞上,Claude Opus 5.5是這群模型中最易讀的——而它與所取代的模型之間的差距才是重點:
• Flesch-Kincaid 年級程度 — Claude Opus 5.5 為 6.95,相較於 Claude Opus 5 的 7.97
• Flesch 閱讀易讀性 — Opus 5.5 為 68.4,相較之下 Opus 5 為 61.35
• Claude Fable 5.1 — 7.43 年級程度,66.09 閱讀容易度
• GPT-6 Astra — 7.52 年級程度,64.55 閱讀易讀性
• GPT-5.6 Sol — 8.74 年級程度,56.62 閱讀易讀性
請把這兩項指標一起看,因為它們的方向相反,而這正是重點:年級程度越低、易讀性分數越高,都代表文句越簡單。Opus 5.5 大約比 Opus 5 低了整整一個年級,比 Claude Fable 5.1 和 GPT-6 Astra 都低了約半個年級,並比 GPT-5.6 Sol 低了將近兩個年級。用白話來說,就是七年級的閱讀程度,而非八年級。
那是一項真正的進步,也是一項狹隘的進步。這只是某一家媒體的提示集,不是有固定任務清單、背後還有排行榜的基準測試。它會告訴你行進方向,以及這一步大概有多大。它不會告訴你 Opus 5.5 在你的工作上寫得好,而 Every 自家的質性註記也清楚顯示,該評論者同樣不這麼認為。
在它仍然埋沒重點的地方
產生可讀性數字的那份評論,對修正後依然存在的缺失直言不諱。被要求為一篇文章開頭時,Opus 5.5 用了 37 到 39 句才涵蓋評論者用 21 句就講完的內容,還花了一整段來談評論者用八個字就點出的一點。評論者的總結是,這個模型「仍把重點埋沒掉」——而更尖銳的批評版本是:它能正確診斷一個段落需要什麼,接著卻產出一份無視自身診斷的修訂版。
作為編輯,它的表現比作為寫作者更差。在編輯任務上與其他模型一較高下時,Opus 5.5 排名落後於Claude Opus 5、GPT-5.6 Sol與GPT-6 Astra——這個模型更擅長寫出通順易讀的句子,卻不太擅長辨認哪一句才該放在最前面。評論者的結論落在一句值得引用的話上,因為那是整篇評論中最有用的內容:「比起它產出的文句,我更樂於與它合作。」
實際的解讀直接由此而來。用它來起草,並以高強度或以上的設定來起草——較低的強度設定正是灌水最嚴重的地方。自己提供範例,而不是要它自己編造。接著自己把重點移到最前面,或把草稿交給會這麼做的工具。Opus 5.5 帶給你的是更快產出乾淨初稿的途徑,以及在後續各輪修改中真正更好的協作者。它不會給你一位編輯。
多餘字詞的代價是什麼

冗長問題有一個成本面向,是那些寫作評論大多略過的,而這點與發布敘事相牴觸。Artificial Analysis 自行進行評估,而非依賴廠商數據,它將Claude Opus 5.5在其 Intelligence Index 上排在 212 個模型中的第一名,分數為 58——但在冗長程度方面卻是 212 個模型中的第 95 名,在該次 Intelligence Index 評測中產生了 2.6 億個輸出 token,而中位數為 8,800 萬個。每個 Intelligence Index 任務的評估成本為 5.98 美元,總計為 8,708.20 美元。
把這點與 Anthropic 自家的效率宣稱並列來看,兩者顯然並不一致。廠商所報告的立場是,Opus 5.5 使用的 token 較少,且產出速度比 Opus 5 快 30% 以上。Artificial Analysis 的獨立測試則發現,這款模型相較於同類模型非常囉嗦。兩者可能同時成立——任務組合不同、effort 設定不同、對「token 較少」的定義不同——但沒有人應該把發表時的說法當成關於 token 經濟性的既定事實。價格方面就清楚多了:每百萬輸入 4 美元、每百萬輸出 20 美元,低於先前的 5/25 美元,而在 Artificial Analysis 的數據中,快取折扣為 95%。
如果你是按輸出 token 付費,長篇大論就不是風格偏好。它就是一筆帳。
將它與你已有的內容進行比對
在進入實用部分之前,先誠實說明一件事:Claude Opus 5.5 不是我們提供的路由之一。我們並未代管它,以下任何內容都不應被解讀為我們有這麼做。你可以透過 Anthropic 自家的 API 及幾個第三方平台取得它。
今天在 OrcaRouter 上的是它所取代的模型,以及比它更高一階的版本。Claude Opus 5 今天已在 OrcaRouter 上,Claude Fable 5.1 也是,兩者都按供應商的定價提供,0% 加成原樣轉嫁——這表示供應商一旦調價,我們這邊當天就會反映,而不是等經銷商哪天想到才跟進。如果你正在衡量 Opus 5.5 的行文是否值得轉換,這是一組很實用的搭配:你可以只用一組金鑰就完成比較,無須再簽一份合約或改動程式碼,因為這兩個模型只需一個 API 就能取用 200+ 個模型,而且就在同一個端點上。
在流程中保留第二個模型的另一個理由,正是本文所探討的失敗模式。一個會把重點埋沒掉的模型,就是你在任務進行到一半時會希望能繞道而過的模型,而自動容錯移轉之所以存在,正是為了避免一次糟糕的生成變成停滯的流水線。如果你根本不想只挑一個模型,路由 DSL 能把多個模型組合成單一呼叫,而模型融合則會讓一組模型共同作答——這對編輯類工作而言是合理的形態,因為這類工作的失敗點在於判斷,而非能力不足。
誰應該行動,誰應該等待
如果你對 Claude Opus 5 的抱怨是必須重寫它的開頭,那麼 Opus 5.5 針對那個問題大約一個年級的程度,確實是真正的修正,而且可讀性資料顯示這項改進是可測量的,而不是憑感覺。如果你的抱怨是它要花三段才講到重點,獨立證據中沒有任何內容顯示這點有所改變。這些是不同的抱怨,而發表報導一直把它們當成同一件事。
就創意工作而言,西瓜故事除了說明人們想試探一個新模型時,會伸手去拿小而溫暖、無關緊要的提示詞之外,並不能證明任何事。這是合情合理的做法。而這也正是一種傾向最不容易被看見的情境:把重點埋起來,因為沒有人讀西瓜故事是為了找論點。把模型放到一份讀者需要在前兩句就讀到結論的文件前面,你就會發現你實際上遇到的是這兩個問題中的哪一個。
接下來值得觀察的是,這個系列的下一個模型——Sonnet 5.5 和 Haiku 5.5 都預計在未來幾週內推出——是否會繼承這項可讀性提升,以及是否有人會公布針對編輯而非起草的可讀性數值。起草的數值是最容易的那個。而編輯的數值,正是 Opus 5.5 仍落後於三個競爭對手的地方。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
