
Claude Opus 5.5 与西瓜测试:Anthropic 修好了文笔,但重点仍被埋没
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在发布周之后传播得最远的样本之一,是一篇关于西瓜的短篇小说。几百字,没附任何基准测试,没有图表——只是让模型写点小东西,而它大体上写对了。作为一件产物,它出现在一场旗舰级发布的中心位置显得有些奇怪,但它指向了厂商在Claude Opus 5.5于 2026 年 9 月 22 日发布时选择主打的要点:不是 Terminal-Bench 上又多一个分数,而是散文。公司的说法是,这个模型写出的东西更少“Claudish”——这是他们用来形容那种程式化、过度对冲、绕圈子铺垫的文风的词,而Claude Opus 5曾因此招致抱怨,此后Claude Fable 5.1、GPT-6 Astra和GPT-5.6 Sol也都一直被拿来与之对照衡量。所以,值得回答的问题并不是这个演示是否讨人喜欢,而是文笔是否可衡量地变好了、好了多少,以及它仍然在哪些地方失手。
Anthropic 表示已修复的内容

Anthropic 的说法足够具体,可以被检验。它称 Opus 5.5 会把最重要的信息放在最前面,少用专业术语,并且比此前的 Opus 模型更严格地遵循用户明确提出的写作规则。支撑材料来自厂商自述,且未经复现:Anthropic 称内部事实核查测试在 18 次尝试中通过了 16 次,而 Claude Fable 5.1 和 Claude Opus 5发布材料中的客户引语也指向同一方向——Ramp 的 John Ruelas 形容其输出“写得像一位好同事”,Box 则报告在自身工作负载上冗长度减少了约 40%。
有两点值得分开来看。第一,“less Claudish”是一种真实存在、可以命名的失效模式,而不是营销上的生造概念。自 Opus 4.6 之后的各代模型以来,实践者一直在抱怨 Claude 的行文压缩生硬、结构糟糕,而且这种抱怨相当具体:开场白太多,对提示词的重述太多,习惯于等读者早就需要看到要点了,才在整整两段之后才讲到。第二点是,Anthropic 为“已修复该问题”给出的自家数据,恰恰就是如此——只是 Anthropic 自家的数据。18 项中 16 项这个数字没有独立复现,而“冗长度降低 40%”是某位客户的内部测量结果,并非已公开发布的方法论。
此次发布还包含一项值得了解的非写作类变更:Opus 5.5 是首个配备网络安全、生物学以及前沿 LLM 开发相关防护措施的 Opus 模型,这些防护措施与 Claude Fable 5.1 上的防护措施一致。当某一请求触发其中一项防护时,Anthropic 表示会将请求透明地路由至另一个模型,而不是直接拒绝。
那些不属于Anthropic的数字

关于这一写作能力说法,最有用的独立解读来自 Every's Vibe Check:它用相同的提示词在五款前沿模型上运行,并用两个标准的可读性工具对输出进行评分。在该提示词集上,Claude Opus 5.5是该组中可读性最高的——而它与所取代模型之间的差距才是关键:
• Flesch-Kincaid 可读性等级 — Claude Opus 5.5 为 6.95,相比之下 Claude Opus 5 为 7.97
• Flesch阅读易读度——Opus 5.5为68.4,而Opus 5为61.35
• Claude Fable 5.1 — 7.43 年级水平,66.09 阅读轻松度
• GPT-6 Astra — 7.52 年级水平,64.55 阅读易读度
• GPT-5.6 Sol — 8.74 年级水平,56.62 易读性
要结合这两个指标来看,因为它们的变动方向正好相反,而这正是关键所在:年级水平越低、易读性得分越高,都意味着行文越简单。Opus 5.5 比 Opus 5 低了大约整整一个年级,比 Claude Fable 5.1 和 GPT-6 Astra 都低约半个年级,比 GPT-5.6 Sol 则低了近两个年级。说白了,就是七年级而非八年级的阅读水平。
这是真正的进步,但也是很有限的进步。这是某一家媒体的一组提示词,而不是一个带有固定任务列表和背后排行榜的基准测试。它告诉你的是前进方向,以及这一步大致有多大。它并没有告诉你 Opus 5.5 能在你的工作内容上写得好,而 Every 自己的定性笔记也清楚表明,评审者同样不这么认为。
仍然掩盖重点之处
产生可读性数据的同一次评审,对那个在修复后依然存在的缺陷毫不留情。当被要求展开一篇随笔时,Opus 5.5 用了37到39个句子才覆盖评审者用21句就说清的内容,还花了一整段来阐述评审者用八个字就点明的观点。评审者的总结是,该模型"仍然把重点埋起来"——而更尖锐的说法是,它能正确诊断一个段落需要什么,随后却给出一个无视自身诊断的修改稿。
作为编辑,它的表现不如作为写作者。在编辑任务的模型排名中,Opus 5.5 落在Claude Opus 5、GPT-5.6 Sol和GPT-6 Astra之后——这个模型更擅长写出可读的句子,而更不擅长判断哪一句本应排在最前面。评审的结论中有一句话值得引用,因为它是整篇评测中最有用的内容:“比起它产出的文字,我更满意它作为协作者的表现。”
实际的解读直接由此而来。用它来起草,并且以高强度或更高档位来起草——低强度档位正是废话填充最严重的地方。自己提供示例,而不是让它去凭空编造。然后自己把要点移到开头,或者把草稿交给一个会这么做的工具。Opus 5.5 带给你的,是一条更快获得干净初稿的路径,以及一个在后续修改轮次中真正更好的协作者。它不会给你一个编辑。
多余的字词代价几何

关于冗长问题,还有一个成本维度是那些写作评估大多忽略的,而且它与发布叙事相悖。Artificial Analysis不依赖厂商提供的数据,而是自行开展评估,它在其智能指数上将Claude Opus 5.5列为212个模型中的第一名,得分为58——但在冗长度上却排在212个模型中的第95位,在该指数评测过程中生成了2.6亿个输出token,而中位数为8800万个。评估每个智能指数任务的成本为5.98美元,总计8708.20美元。
把这一点与 Anthropic 自己宣称的效率放在一起看,两者显然并不一致。厂商给出的说法是,Opus 5.5 使用的 token 更少,输出生成速度比 Opus 5 快 30% 以上。Artificial Analysis 的独立测试则发现,该模型相比同类模型非常冗长。两者可以同时成立——任务组合不同、effort 设置不同、"token 更少"的定义也不同——但任何人都不应把发布时的表述当作关于 token 经济性的既定事实。在价格方面,情况更为清晰:每百万输入 4 美元、每百万输出 20 美元,低于此前的 5/25 美元,而在 Artificial Analysis 的数据中还带有 95% 的缓存折扣。
If you are paying per output token, verbose prose is not a style preference. It is the line item.
对照你已有的内容运行它
在进入实操部分之前,先坦诚说明一点:Claude Opus 5.5 不是我们的路由之一。我们不托管它,下文任何内容都不应被解读为我们在声称托管它。你可以通过 Anthropic 自己的 API 以及多个第三方平台来使用它。
如今 OrcaRouter 上架的是它所取代的模型,以及比它高一档的型号。Claude Opus 5 如今已在 OrcaRouter 上线,Claude Fable 5.1 同样如此,两者都按供应商的标价、以 0% 加价直通——这意味着供应商一调价,当天就会落到我们这边,而不用等某个经销商什么时候腾出手来。如果你正在纠结 Opus 5.5 的文笔是否值得为此迁移,这样的搭配很有用:你可以在同一个密钥上完成对比,无需再签一份合同,也无需改动代码,因为这两个模型就位于同一端点,只差一个 API 覆盖 200+ 模型这一步之遥。
在循环中保留第二个模型的另一个原因,正是本文所讨论的失效模式。一个把重点埋没掉的模型,是你在任务进行到一半时希望能绕开的模型,而自动故障转移的存在恰恰是为了避免一次糟糕的生成变成停滞的流水线。如果你根本不想只选一个模型,路由 DSL 可以把多个模型组合成一次调用,而模型融合则会让一组模型共同作答——对于编辑类工作来说,这是一种合理的形态,因为这类工作的失败源于判断力而非能力不足。
谁该行动,谁该等待
如果你对 Claude Opus 5 的抱怨是不得不重写它的开头,那么 Opus 5.5 确实能把这个问题改善大约一个等级,而且可读性数据表明这一提升是可测量的,而非凭感觉。如果你的抱怨是它要花三段才切入正题,那么没有任何独立证据表明这一点有所改变。这是两种不同的抱怨,而发布报道一直把它们当成一回事。
具体到创意工作,西瓜故事除了说明人们在想试探一个新模型时会去选用那些小而温暖、低风险的提示词之外,证明不了任何东西。这么做很合理。而且这也恰恰是“把重点埋起来”的倾向最不显眼的情境,因为没人读西瓜故事是为了看中心论点。把模型放到一份读者需要在前两句话里就得到结论的文件面前,你就能弄清自己实际有的到底是这两个问题中的哪一个。
接下来值得关注的是,该系列中的下一代模型——Sonnet 5.5 和 Haiku 5.5 都预计将在未来几周内推出——是否会继承这一可读性提升,以及是否有人会公布用于编辑而非起草的可读性数值。起草的可读性数值是容易的那个。编辑的可读性数值才是 Opus 5.5 仍落后于三个竞争对手的地方。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
