
Claude Opus 5.5 vs GPT-6.1 Sol:实测 5 倍订阅价值差距
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
每月 200 美元可以购买一个 Claude Max 20x 席位,或一个 ChatGPT Pro 200 席位。在相同的智能体工作负载下,其中一方带来 每月 11,726 美元的第一方 API 等效 token,而另一方带来 2,084 美元——差距达 5.6 倍,介于Claude Opus 5.5和GPT-6.1 Sol之间。真正让这件事成为新闻的并不是这两款模型,而且两者也都不新:Claude Opus 5.5 于 2026 年 9 月 22 日发布,GPT-6.1 Sol 于 2026 年 9 月 29 日发布,因此这两款模型本身分别已有两周和一周之久。新的地方在于,运行它们的订阅经济账如今有了一个实测数字,该数字由 SemiAnalysis 于 2026 年 10 月 5 日发布——也就是本文发布前一天——此前该公司建立了一套方法,用于给厂商未公布的限额定价。
这个头条数字自10月5日晚上以来一直在 X 上流传,通常都被剥去了限定条件。所以先把这些限定条件放在前面,因为没有它们,这个数字毫无价值。下表中的每个值都是某份研究出版物对他人私有计量数据的建模结果,是在明确的工作负载形态下测量的,并以区间形式报告,而非经过审计的基准测试。套餐价格是供应商自己公布的目录价格。后文引用的能力得分是 Artificial Analysis 在具名配置下的得分。而整个比较是关于 订阅——一种有其自身规则的计费模式——而不是关于任一模型每词元的成本,那是另一个问题,有不同的答案。
你如何为一个无法看透内部的方案定价
Anthropic 和 OpenAI 都将订阅用量以百分比计量的形式呈现,而不是价格。存在一个五小时窗口和每周限额,也没有按请求开具的发票。供应商通过相对于其他套餐的倍数来区分层级——Claude 的 Max 5x 和 Max 20x 字面上就是根据它们相对于 Pro 的定位来命名的,ChatGPT 的层级也曾如此,直到 OpenAI 从其定价页面上移除了相对用量。
因此,同一份套餐的价值取决于你把它花在哪个模型上,因为被缓存输入 token 消耗的一个额度,和被输出 token 消耗的一个额度,二者之间的定价比例与厂商在 API 上收取的比例并不相同。这正是整项推演的核心论点:你不能孤立地说一份套餐值 X 美元。你需要把套餐、模型和工作负载放在一起看。
SemiAnalysis 的方法值得详细描述,因为它决定了这些数字能承载多少分量。该公司反复进行调用,每次只隔离出一种 token 类型——《战争与和平》的一部分,每次调用配一个随机标签,用于未缓存输入;同一个提示词标记为缓存,用于缓存写入;缓存读取则使用固定标签;再用一篇长篇技术文章来强制产生输出。每次调用都会记录供应商计费的 token 量以及用量计量器的位置。由于单次请求几乎根本不会让计量器移动,他们便以“步”为单位来测量:计量器两次移动之间的 token 总量即为一个计量单位的成本,两端不完整的步会被舍弃,步不断累积,直到范围落在 ±5% 以内。在 5 亿个 token 之后仍不能让计量器移动的缓存读取,被视为免费。负载组合则来自该公司自己 9 月的使用比例,而价值等于由此得出的 token 容量乘以供应商针对每种 token 类型公布的 API 价格。
方法部分中最有趣的发现,与两家实验室中任何一家的慷慨无关。在验证过程中,SemiAnalysis 发现,它在同一套餐下测试的三个账户中,有一个账户的限额比其他两个低约 20%——这是一个较旧的账户。该提供商证实,这是针对限额的一次“极其微小”的 A/B 测试,并强调它并未全面削减限额。这两方面都很重要:它证明订阅限额可以在任何时候被悄然调整,也证明该方法足够敏感,能够在 20% 的变动发生时将其检测出来。
各档位在 200 美元、100 美元和 20 美元时的回报
三档、两家实验室、智能体工作负载、按第一方目录价计算的每月 API 等效价值:
• 每月 $200 — Max 20x 上的 Claude Opus 5.5 可返还 $11,726 — 按 API 等效 token 计,为费用的 58.6 倍;ChatGPT Pro 200 上的 GPT-6.1 Sol 返还 $2,084 — 为费用的 10.4 倍。比值:5.6 倍。
• 每月 100 美元 — Claude Opus 5.5 在 Max 5x 上带来 5,725 美元(费用的 57.3 倍);GPT-6.1 Sol 在 ChatGPT Pro 100 上带来 1,055 美元(费用的 10.6 倍)。比率:5.4 倍。
• 每月 $20 — Claude Pro 上的 Claude Opus 5.5 可带来 $1,178(是费用的 58.9 倍);ChatGPT Plus 上的 GPT-6.1 Sol 可带来 $211(是费用的 10.6 倍)。比值:5.6 倍。
三个层级落在5.4倍到5.6倍之间,这才是发现,而不是具体的美元数额。比较是在每个实验室产品目录的中端层级上进行的——两家供应商都将其定位为日常主力而非旗舰的那款模型——并且是在整个价格阶梯上进行的,因此使用20美元套餐的读者和使用200美元套餐的读者会得到相同的答案。SemiAnalysis自己的总结很直白:在这个层级上,Anthropic是“一个压倒性更划算的选择,全面提供约5倍的API等效价值。”
三行数据背后的工作负载形态是有标注的,而且值得读两遍:智能体式,0.4% 未缓存输入,96.6% 缓存输入,2.6% 缓存写入,0.3% 输出。这就是智能体循环的样子——少量新鲜指令、大量重复读取的上下文,以及一小条生成的文本。而且,正如下一节所示,这也是最能衬托 Anthropic 的组合。

Opus 5.5 每个 token 的成本翻倍,却仍以 5.6 倍的优势胜出
这是流传版本的那张图表所遗漏的一点。Claude Opus 5.5 并不是更便宜的那个模型。它是更贵的那个,价格要高出整整一倍。
两份价目表都是公开的。Claude Opus 5.5 的标价为每百万输入词元 4.00 美元、每百万缓存读取 0.20 美元、每百万缓存写入 5.00 美元、每百万输出词元 20.00 美元。GPT-6.1 Sol 在同样这四个项目上的标价分别为 2.00 美元、0.10 美元、2.50 美元和 10.00 美元。按上文的智能体组合对它们进行加权后,混合费率大致为Claude Opus 5.5 每百万词元 0.399 美元,而 GPT-6.1 Sol 为 0.200 美元——比值达 2.00 倍。这一算术结果出自我们之手,依据是两家供应商公布的价目表,但它并无争议:它直接源自公布的价格和所标注的组合。
把 5.6 倍的价值差距除以 2.0 倍的价格差距,你大致会得到:在 Claude 这边,每美元套餐可获得的 token 数多出约 2.8 倍。在 20 美元档位做同样的除法,得到 2.79 倍——这个差距源于一种计量口径要慷慨得多,而且几乎在整个阶梯上完全一致,并不是因为某个模型运行成本更低。这意味着,5 倍这个标题数字是关于 Anthropic 额度定价的陈述,而且它只适用于与所测量的那种工作负载相似的工作负载。
改变构成比例,数字就会变化。该构成中96.6%是缓存读取,在这一项上Opus 5.5收费$0.20,而Sol为$0.10。缓存较少的负载——新鲜长文档、复用很少——主要落在输入这一项上,同样的2倍差距也出现在那里。输出密集型工作,比如长文本生成而非长时间智能体运行,则触及Opus为$20.00、Sol为$10.00的那一行。而SemiAnalysis明确表示,它自己偏好的指标存在一种失效模式:如果某个模型按API价格算特别划算或特别不划算,API等效价值“当然会产生误导”,而这正是此处的情形——每token更贵的那个模型,反而是订阅更划算的那个。该公司也不愿依赖token效率图表,称它不认为典型的智能体基准任务能代表真实工作,而且业界缺乏可靠的效率数据。应把5倍视为来自单一出版物、针对某一种负载形态的审慎陈述,而不是任一模型的永久属性。
使这一差距成为真正的问题、而非一个中性取舍的,是订阅制且更便宜的那一方在独立榜单上同时也是更强的一方。Artificial Analysis 在其 Intelligence Index 上将 Claude Opus 5.5 评为 58 分,所用配置在其模型页面上被标为“max with fallback”,在变体选择器中则列为“Claude Opus 5.5 (Max, Default Fallback)”——这比它此前测得的最高分还高出好几个点。在同一指数(版本 v4.3.2)上,GPT‑6.1 Sol 在最高努力档位下为 51.8,GPT‑6 Astra 则为 52.7。因此,一位在两种 200 美元套餐之间权衡的买家,被要求为得分更低的模型,在每美元可用容量上多付 5.6 倍。这些分数来自第三方且独立;价值数据则出自 SemiAnalysis 的模型。两者都有明确标注,且都不是厂商给出的数字。

OpenAI 在9月29日改变了什么
这一切都不是静止不变的。之所以人们在本周而不是上周讨论这个差距,是因为 OpenAI 在测量结果落地前的八天挪动了自己的标尺。
2026年9月29日,OpenAI 重新向新订阅者开放了 200 美元的 Pro 订阅,并在此次重新开放的同时改变了用量计算方式。用其当天自己的话说,这一变化“与旧的 Pro 200 美元方案相比,按美元计的 API 支出将净减半”,同日发布的第二篇帖子也称该档位的 API 等价价值被减半。这是供应商就其自身方案作出的、带有日期的陈述,而正是这一事件让订阅价值度量变得值得发布。
SemiAnalysis测量出的三个后果:
• 各档位的 Token 数量减半,而 Sol 级模型的价值跌幅更大。OpenAI 同时下调了 GPT-6.1 Sol 的缓存输入价格——降至每百万 $0.10,OpenAI 的开发者账号于 9 月 29 日称,该价格比标准输入价格低 95%,比 GPT-6 Sol 的缓存价格低 50%——因此,该套餐中 Sol 级模型的实测 API 等效价值跌幅超过 50%,而非仅凭 Token 削减所推断的 50%。
• 500 美元档位来了,但它并未恢复原有价值。新的 Pro 500 方案提供的 GPT-6 Astra 比旧的 200 美元方案多出 21%;但由于 Sol 降价,500 美元档位上 Sol 级 API 等效价值实际上反而下降了。超快模式——即每秒 300 token 的服务档位——才是那里真正的新增内容,SemiAnalysis 表示其限制仍在测试中。
• 现有订阅者可保留原有待遇,直至 2026 年 10 月 29 日。 在降价前持有的 200 美元套餐,在该日期之前仍可保留原有更大的额度,之后将在价格不变的情况下转为较低额度。对于在 9 月 29 日之前购买的用户,本文中的对比将从本月底开始适用于其账户,而不是今天。
再平衡才是微妙之处。此次削减之前,OpenAI 的每美元价值在顶端严重偏向自己:Pro 200 在 Astra 上提供的每美元价值大约是 Pro 100 的两倍,而 Pro 100 本身提供的每美元价值又大约是 Plus 的两倍。削减之后,对于所有模型,Pro 100、Pro 200 和 Pro 500 每美元给出的 token 都相同,而 Plus 在 Sol 上与之相当,但在 Astra 上仍然相对较差。OpenAI 通过把所有档位都减半至最低一档,使其阶梯在内部变得公平。相比之下,Anthropic 在每个档位早已提供相同的每美元价值——这就是为什么无论你看的是 20 美元套餐还是 200 美元套餐,都会出现同样的 5.6 倍。如果你用的是 Plus,并且原本指望获得 Astra 访问权限,那么这次削减移除的正是过去让 OpenAI 最高档位值得够一够的那部分价值。
OpenAI 确实保有一项真正的结构性优势,SemiAnalysis 也承认这一点:Pro 各档套餐均不设五小时窗口,这使得在单次长时间会话中消耗掉月度限额的较大比例更为容易。该机构的判断是,这无法抵消其在 API 等效价值上约 4 到 5 倍的差距。
两个经济体,同一个型号名
把这些内容解读为关于模型本身的论断,其中暗藏一个陷阱。如果你按 token 付费——无论是 API key、自托管技术栈,还是你自己搭建的智能体平台——5.6x 都不是你的数字,也从来不是。你的数字是混合后的 2.00x,而基于这一点,在相同的智能体循环下,GPT-6.1 Sol 才是更便宜的模型。订阅制对比回答的是“我该买哪个席位”。API 对比回答的是“我该调用哪个模型”。对于这两个模型,两者指向相反的方向,而把它们混为一谈,是围绕这张图表的评论中最常见的单一错误。
为订阅测算提供依据的这一轮降价,已经体现在 API 价目表中。Anthropic 在 9 月 25 日 Opus 5.5 发布时,将其输入和输出定价较 Opus 5 下调了 20%,缓存读取下调了 60%。OpenAI 在 9 月 29 日 GPT-6.1 Sol 发布时,将其缓存输入价格减半。这就是本文通篇使用的两张标价卡,无论你是按席位购买还是按 token 购买,它们都同样适用。这两款模型都以供应商标价收录在 OrcaRouter 目录中——Claude Opus 5.5 按供应商标价,0% 加价,以及GPT-6.1 Sol 使用同一密钥、置于单一端点之后——因此供应商的降价在公布的同时即已生效,而无需等待路由表刷新。
有一件事值得说清楚:OrcaRouter 不销售订阅,因此这项测量不会改变 OrcaRouter 用户支付的费用。它改变的是他们应该为哪个模型付费,同时也为替代方案标出了价格。对比中的套餐侧是一堵你无法控制的墙——两家实验室都已表明,它们会在降价的同一周,悄无声息地、仅提前很短时间通知就调整限额。这种风险在 API 层面的对应能力,是无需新合同即可把同一个请求发往别处,这正是跨提供商的自动故障转移的用途。如果你正以 96.6% 的缓存读取率运行智能体循环,你真正想要的是能接受该请求的最便宜路由,以及在供应商改变主意时改变自己想法的能力。
谁应该移动,谁不应该移动
如果你正在为 Claude 订阅付费,并运行智能体式编码或长时间工具循环,那么继续订阅的理由如今已是可量化的,而非仅凭个例:在 200 美元档位,你支付的费用会以 API 等价容量形式返还 58.6 倍,而在相应档位上则为 10.4 倍——这一点在每个价位上都成立。如果你使用的是在 9 月 29 日之前购买的 ChatGPT Pro 200 套餐,那么在 2026 年 10 月 29 日之前,你享有的是较旧的额度;之后则是较低的额度——在做任何决定之前先核对日期,因为在接下来的三周里,你拿来对比的是一个对新买家来说已不复存在的套餐。
如果你是 API 构建者,就忽略 5.6x。按 2.00x 的混合费率来路由,按任务而非按 token 定价,并在每次供应商调价后重新核对,因为本季度就出现了四次调价——GPT-6 Sol、Fable 5.1、Opus 5.5 和 GPT-6.1 Sol,全都发生在一个多月内。对订阅而言,真正重要的衡量指标是实验室外没人能看到的计量表。对 API 而言,真正重要的衡量指标是费率卡,而那张卡是公开的。
接下来值得关注的是:Anthropic 的 Opus 限额能否在整个季度内维持,考虑到其竞争对手上周一直在削减,而且两家实验室都保留着悄悄改动计量标准的能力;OpenAI 是否会通过提高限额、而非再次降价,在 500 美元档位恢复 Sol 级别的价值;以及 200 美元档位的祖父条款是否真的会像已公布的那样在 10 月 29 日结束。SemiAnalysis 将底层数字维护为实时仪表盘,而不是固定研究,因此这里引用的数字是 2026 年 10 月 5 日的数据集状态,而该数据集本就是会变动的。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
